运用本体及HTML信息块的Web信息提取方法研究

来源 :北京大学 | 被引量 : 0次 | 上传用户:weiqiangting
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
信息提取(Information Extraction)技术在对互联网(Web)进行信息挖掘和从Web向语义网进行数据迁移的过程中,具有重要的作用.而作为语义网核心技术的本体论方法具有改进信息组织、信息管理和信息理解的巨大潜力.在从Web向语义网迁移的过程中,它在基于内容的获取、互操作、通信和提供高质量、高层次的服务等方面扮演着极为关键的角色.如何将本体论方法与信息提取技术进行有效的结合,也是当前信息提取研究领域的热点之一.该文根据数据密集型网站页面固有的结构化特点以及内容上的统计特性,在信息提取过程中引入本体知识,针对Web信息提取领域面临的三个主要问题,提出了一个基于本体的跨领域的自适应Web信息提取框架模型H-Model,并在此基础上实现了基于本体的跨领域的自适应Web信息提取系统Odaies,并对其性能进行了分析.
其他文献
随着多媒体技术的发展,对各种媒体之间交互作用的研究越来越受到人们的关注。可视语音研究是这个领域的一个重要研究方向,在智能化人机交互界面等研究中占有重要地位。本文结合
目前,集成电路工业作为信息产业的基础,对国民经济和和社会发展产生着日益重要的影响。随着超大规模集成(VLSI)技术和深亚微米工艺的发展,集成电路中广泛存在宽度仅为深亚微米量
在大数据时代,海量数据使得压缩技术变得越来越重要。同样地,对于搜索引擎来讲,高效的压缩算法将会提升倒排索引的查询性能和空间利用率。近十年来,计算机处理器得到了快速发展,提
该文研究内容包括硬件防火墙技术、网络处理器技术以及如何将二者有效结合起来这三个方面的问题.该文在IBM网络处理器平台上开发了一个硬件防火墙的原型系统,同时对系统瓶颈
随着计算机网络技术、多媒体技术以及数字传输技术的不断发展,在网络、广电、出版等领域使用数字技术产生、传输和保存了大量的图像、视频、音频、文本等不同类型的跨媒体数据
该文用16个金属氧化物半导体气敏传感器和神经网络分类方法建立了一种新的嗅觉模拟装置,开发了一套功能较完善的系统控制软件,并对该装置的实验条件和参数进行了研究.该文重
本文对高性能集群计算机系统和PC机群两种体系结构上的并行体绘制算法和基于图像的并行绘制技术进行了研究和探讨。首先对三维数据场并行绘制的研究现状进行了综述。介绍了体
随着自动语音识别从孤立词发展到大词汇量连续语音,发音词典已成为这类系统的重要组成部分之一,它一方面对语言模型有着影响,又在词层次上约束声学模型。当前,如何确定发音词典,即
该文提出了一种基于范例的程序理解方法.其中着重在程序抽象表示方法和相似度衡量上进行了研究.第1章主要介绍程序理解的概念和什么是基于范例推理.第2章探讨了应用基于范例
基于惯性和磁的微型姿态传感器可以为游戏、虚拟现实、交互学习、卡通及电影特效提供重要的三维姿态信息。尤其是最近几年,随着微机电系统(micro-electro-mechanicalsystems,ME