论文部分内容阅读
该文则从另一个角度来分析和利用超链接信息,即利用对链接文本和链接所指向页面(必要时)的内容分析来对该链接(亦即对链接所指向的网页)进行分类.页面中的链接主要分为两类,即与本页主题相关的链接(该文称之为相关链接)和无关的链接(如导航条和广告链接等).所以首要的工作是提取出页面中的相关链接.该文提出了基于页面链接分块思想的相关链接提取算法,能够高效准确地抽取出页面中的相关链接.对相关链接的分类,需要涉及到的问题有特征词表提取、未登录词的识别、特征句提取和分类体系的建立与表示等等.我们采用改进后带有网页信息的TF-IDF算法,可以更准确地提取网络文本中常用的特征词.对于未登录词的识别,虽然采用传统的方法已取得较好的效果,但是它们需要大量的源信息且时间复杂性较高,不适合该课题的需求.因此,通过对一些常见未登录词的观察和统计,该文提出可以从词的结构特点和特征词之间的二元关系两个方面来辅助识别未登录词,并取得了较好的实验效果.为了避免对文本的全文分析,降低时间复杂性,该文还提出了页面特征句提取算法.特征句信息载量大,对信息抽取和分类都有非常重要的作用.对于信息抽取和建立分类体系,需要考虑到特征信息之间的关系.该文总结了三种常见的关系,即等价关系、从属关系和同属关系,并引入了三个简洁的标识符将各类信息都表达成统一的格式,维护方便,通用性好.由于Web信息量巨大,信息内容涉及范围非常广泛,所以该文这里以IT中文新闻网页作为实验对象,并开发了一个超链接分类的原型系统,对上面的算法进行了测试.结果表明该文提出的方法所需的源信息较少且时空开销小,所以可应用性很强.最终分类的精确率在74﹪左右,虽然与传统的文本分类方法相比还有一定的差距,但其中很大一部分原因是与实验系统在IT类页面下进一步细分为多个小类有关.由于小类之间的差别不够明显,导致分类相对困难一些.随着课题的后续深入研究,相信能取得更好的成果.