面向Web论坛的信息抽取技术研究

来源 :南京大学 | 被引量 : 0次 | 上传用户:lizhongfeng3218
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
随着Internet技术的不断发展,基于Web方式的论坛得到了越来越广泛的应用,随着时间的推移,这些论坛站点中积累了丰富的信息资源。然而,由于论坛站点本身的特点,至今缺乏行之有效的方法处理这些信息资源。在这种情况下,面向Web论坛智能信息处理技术的研究也就成为一项重要而迫切的课题。本文详细研究了目前Web论坛的信息组织模式和页面内容格式,分析了处理论坛站点信息资源的技术难点。在回顾近几年来Web信息收集和抽取技术发展的基础上,提出了一套完整的针对Web论坛站点的信息抽取框架,并就其中涉及的关键技术,如话题线索的收集、抽取规则的表示方法、消息及其属性域的提取等,进行了深入的探讨和研究。本文旨在为进一步发掘论坛站点中信息资源与知识提供前期处理和技术支持。 本文的主要工作和所获得的研究成果可以概括为以下几个方面:(1)Web论坛中信息资源组织模式分析本文通过详细分析论坛中各种不同功能类型的页面,确定了Web论坛信息抽取系统处理的两种页面类型:标题索引页面和消息内容页面。根据对上述两种类型页面展现格式的深入分析,本文总结出论坛中最为重要的信息单位——话题线索的组织模型。在此基础上,本文还对两种具有代表性的线索组织模型进行了详细的分析。这部分工作为面向Web论坛的话题线索重建和消息对象抽取奠定了基础。 (2)基于超链特征的页面过滤技术研究在面向Web论坛系统的页面收集方面,本文提出了基于超链特征的页面过滤算法,来自动识别论坛站点中的标题索引类型和消息内容类型页面。该算法将页面中的超级链接根据其中包含的URL结构特征进行聚类,并结合启发式规则来判断聚类效果,进而识别超链所指向页面的类型。该算法较好地解决了面向Web论坛页面收集过程中页面类型的自动判别问题,提高了信息收集的效率和质量。 (3)Web论坛中话题线索重建研究在对Web论坛中话题线索组织模式进行详细分析的基础上,本文提出了话题线索重建算法。该算法模仿用户对话题线索的浏览过程,采取深度优先策略来遍历整个消息内容页面集,并使用链接消重技术来过滤重复的候选话题线索。该算法实现了Web论坛中话题线索的自动提取,在系统处理过程中取得了良好的效果。 (4)面向Web论坛的信息收集规则表示方案本文在分析相关工作的基础上,提出了一套完整的信息抽取规则表示方案,旨在描述Web论坛中具有重复模式的多消息记录条页面。该表示方案综合考虑了提取对象的结构路径和模式特征信息,克服了单独使用一种提取方式的不足,确保了信息抽取框架的可行性和可靠性,也符合本系统轻量级、可扩展的特性。本文还设计了新颖的规则管理和展示方案,使用户能方便地浏览、修改、导出和导入多个Web论坛的抽取规则。 (5)Web论坛中信息记录条的识别与抽取在详细分析论坛消息内容页面中多消息记录条内部结构的基础上,本文提出了消息记录条抽取规则的自动生成算法。该算法基于HTML标签序列的重复模式发现,并综合了根据Web论坛特点所提出的主信息区域预抽取和修饰标签修剪两个改进措施。本文提出的算法充分利用了多消息记录条页面中包含的重复标签序列模式,并解决了多信息区域和修饰性标签所带来的信息条误识别问题,在记录条抽取规则生成过程中收到了良好的处理效果。 基于上述工作成果,本文为面向Web论坛的信息抽取制定了通用的处理流程和框架结构,设计并实现了一个论坛信息资源抽取系WebWrapper。实验证明,该系统能够正确地处理目前大多数Web论坛中的消息与线索资源。该系统的抽取结果使得使用数据库技术自动处理论坛资源更加方便可行,为进一步面向论坛的信息检索和知识发现提供了技术支持。
其他文献
将人工免疫系统运用到入侵检测系统中,近年来已经有了一定的发展.在这个领域中,如何利用人工免疫学的基本原理,培育山符合需求的免疫细胞,使能够较多的识别非我并较少的识别
重复数据清理是当今数据质量研究的一个重要问题,清理重复数据关系着数据库服务的质量.因此,论文查重子系统是科研服务平台中的一个部分,它提供了对整个科研服务平台中的英文
在中国目前的集中阅卷工作中,大多延用的是传统的模式.也有一些替代模式,但是由于成本过高或使用复杂而无法得到广泛的应用.该文提出了一种成本低廉、使用方便的解决方案--无
云计算是计算机时代的一个进步,其有效地整合了计算机的计算能力,并将计算能力商品化,按需付费使用。Hadoop“移动计算而非移动数据”的设计思想,很大程度上符合大规模数据处
对工作流的研究起源于二十世纪七十年代,受网络的局限性,最初的工作流系统主要以企业内部的文档处理为主。到了二十世纪九十年代,随着Internet技术的发展及应用,促进了电子商务应
随着社会的发展 ,各个方面对快速有效的自动身份验证的要求日益迫切。由于生物特征是人的内在属性,具有很强的自身稳定性和个体差异性,是身份验证的最理想依据。从而,“生物特
并行遗传算法中的迁移包括两个子过程:一、从源子群体中选择一定数目的个体迁出,迁出是通过对被迁出个体的复制来实现,不改变原来群体的组成;二、在接收子群体中迁入个体替换
随着互联网技术的不断的向前发展,信息量爆炸问题已经存在已久并且在相当长一段时间内还会持续扩大化。互联网用户时刻面临着信息碎片化的问题,如何有效的筛选信息,获取更感兴趣
计算机排课问题是一个具有代表性的信息处理问题.90年代后期以来,人们开始使用面向对象的数据库技术和人工智能领域的专家系统技术作为技术支持解决这一问题,但是到目前为止
本文以武汉中地公司开发的数字测图系统MapSuv的输出文件.suv作为数据源,研究了基于二维矢量地图的三维可视化方法,并在此基础上,开发了数字测图成果的三维可视化系统.论文的