Web页面链接信息抽取与分类的研究

来源 :哈尔滨工业大学 | 被引量 : 0次 | 上传用户:flash021
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
该文则从另一个角度来分析和利用超链接信息,即利用对链接文本和链接所指向页面(必要时)的内容分析来对该链接(亦即对链接所指向的网页)进行分类.页面中的链接主要分为两类,即与本页主题相关的链接(该文称之为相关链接)和无关的链接(如导航条和广告链接等).所以首要的工作是提取出页面中的相关链接.该文提出了基于页面链接分块思想的相关链接提取算法,能够高效准确地抽取出页面中的相关链接.对相关链接的分类,需要涉及到的问题有特征词表提取、未登录词的识别、特征句提取和分类体系的建立与表示等等.我们采用改进后带有网页信息的TF-IDF算法,可以更准确地提取网络文本中常用的特征词.对于未登录词的识别,虽然采用传统的方法已取得较好的效果,但是它们需要大量的源信息且时间复杂性较高,不适合该课题的需求.因此,通过对一些常见未登录词的观察和统计,该文提出可以从词的结构特点和特征词之间的二元关系两个方面来辅助识别未登录词,并取得了较好的实验效果.为了避免对文本的全文分析,降低时间复杂性,该文还提出了页面特征句提取算法.特征句信息载量大,对信息抽取和分类都有非常重要的作用.对于信息抽取和建立分类体系,需要考虑到特征信息之间的关系.该文总结了三种常见的关系,即等价关系、从属关系和同属关系,并引入了三个简洁的标识符将各类信息都表达成统一的格式,维护方便,通用性好.由于Web信息量巨大,信息内容涉及范围非常广泛,所以该文这里以IT中文新闻网页作为实验对象,并开发了一个超链接分类的原型系统,对上面的算法进行了测试.结果表明该文提出的方法所需的源信息较少且时空开销小,所以可应用性很强.最终分类的精确率在74﹪左右,虽然与传统的文本分类方法相比还有一定的差距,但其中很大一部分原因是与实验系统在IT类页面下进一步细分为多个小类有关.由于小类之间的差别不够明显,导致分类相对困难一些.随着课题的后续深入研究,相信能取得更好的成果.
其他文献
  本课题的主要研究内容和目的是为了适应无纸化考试的需要,研究与实现具备网络化、自动化、通用化的题库管理、试卷生成、网络考试、考试监控、自动阅卷、成绩管理等功能的
聚类分析是数据挖掘中的一个重要研究领域,是一种数据划分或分组处理的重要手段和方法.聚类的应用是非常广泛的,无论是在商务上,还是在市场分析、生物学、Web文档分类等领域
京信交换系统公司是一家从事程控交换机产品生产的企业.它的主导产品是HJD04程控交换机.随着公司的发展,HJD04程控交换机产品市场迅速扩大,客户对交换机产品的质量和服务质量
Internet计算环境,其资源总是有限的,而每个任务/服务都有其特定QoS特征的资源需求。因此无法同时为任意多个用户提供其满意的QoS服务。独占资源虽然服务质量最高,但是资源的利
  J2ME增强了手机作为数据信息终端的功能,使其具有了动态下载、自动安装、用户触发执行等特点。论文提出了以KJava手机为信息系统客户端的一种新的移动信息系统,系统具有成
随着信息技术的迅速发展 ,特别是Internet/Intranet技术的普及,使得越来越多的组织和个人的计算机系统设施和信息资源的安全受到威胁,因此,信息安全成为信息技术研究领域最重要
Markov网是类似于Bayesian网的另一种进行不确定性推理的有力工具。它是用一个无向图来表示变量之间的依赖关系。图中的每一个结点表示问题域中的一个变量,两个结点不相邻表示
随着信息技术的飞速发展,软件得到了大规模的应用,从学习、工作到生活,无处不在。同时,人们对信息化的要求越来越高,导致软件设计的需求越来越庞大,软件功能越来越复杂。因此,软件设
随着Internet的快速发展与广泛应用,构件运行支撑平台作为一类新型的系统软件,提供的功能种类越来越多,甚至为同一功能提供具有不同质量的实现.因此,构件运行支撑平台必须能
基于内容的图像检索(Content-BasedImageRetrieval,简称CBIR),是目前多媒体、信息检索、人工智能、数据库等领域共同关注的一个重要研究方向。由于传统数据模式难以描述图像等