论文部分内容阅读
随着Internet技术的不断发展,基于Web方式的论坛得到了越来越广泛的应用,随着时间的推移,这些论坛站点中积累了丰富的信息资源。然而,由于论坛站点本身的特点,至今缺乏行之有效的方法处理这些信息资源。在这种情况下,面向Web论坛智能信息处理技术的研究也就成为一项重要而迫切的课题。本文详细研究了目前Web论坛的信息组织模式和页面内容格式,分析了处理论坛站点信息资源的技术难点。在回顾近几年来Web信息收集和抽取技术发展的基础上,提出了一套完整的针对Web论坛站点的信息抽取框架,并就其中涉及的关键技术,如话题线索的收集、抽取规则的表示方法、消息及其属性域的提取等,进行了深入的探讨和研究。本文旨在为进一步发掘论坛站点中信息资源与知识提供前期处理和技术支持。
本文的主要工作和所获得的研究成果可以概括为以下几个方面:(1)Web论坛中信息资源组织模式分析本文通过详细分析论坛中各种不同功能类型的页面,确定了Web论坛信息抽取系统处理的两种页面类型:标题索引页面和消息内容页面。根据对上述两种类型页面展现格式的深入分析,本文总结出论坛中最为重要的信息单位——话题线索的组织模型。在此基础上,本文还对两种具有代表性的线索组织模型进行了详细的分析。这部分工作为面向Web论坛的话题线索重建和消息对象抽取奠定了基础。
(2)基于超链特征的页面过滤技术研究在面向Web论坛系统的页面收集方面,本文提出了基于超链特征的页面过滤算法,来自动识别论坛站点中的标题索引类型和消息内容类型页面。该算法将页面中的超级链接根据其中包含的URL结构特征进行聚类,并结合启发式规则来判断聚类效果,进而识别超链所指向页面的类型。该算法较好地解决了面向Web论坛页面收集过程中页面类型的自动判别问题,提高了信息收集的效率和质量。
(3)Web论坛中话题线索重建研究在对Web论坛中话题线索组织模式进行详细分析的基础上,本文提出了话题线索重建算法。该算法模仿用户对话题线索的浏览过程,采取深度优先策略来遍历整个消息内容页面集,并使用链接消重技术来过滤重复的候选话题线索。该算法实现了Web论坛中话题线索的自动提取,在系统处理过程中取得了良好的效果。
(4)面向Web论坛的信息收集规则表示方案本文在分析相关工作的基础上,提出了一套完整的信息抽取规则表示方案,旨在描述Web论坛中具有重复模式的多消息记录条页面。该表示方案综合考虑了提取对象的结构路径和模式特征信息,克服了单独使用一种提取方式的不足,确保了信息抽取框架的可行性和可靠性,也符合本系统轻量级、可扩展的特性。本文还设计了新颖的规则管理和展示方案,使用户能方便地浏览、修改、导出和导入多个Web论坛的抽取规则。
(5)Web论坛中信息记录条的识别与抽取在详细分析论坛消息内容页面中多消息记录条内部结构的基础上,本文提出了消息记录条抽取规则的自动生成算法。该算法基于HTML标签序列的重复模式发现,并综合了根据Web论坛特点所提出的主信息区域预抽取和修饰标签修剪两个改进措施。本文提出的算法充分利用了多消息记录条页面中包含的重复标签序列模式,并解决了多信息区域和修饰性标签所带来的信息条误识别问题,在记录条抽取规则生成过程中收到了良好的处理效果。
基于上述工作成果,本文为面向Web论坛的信息抽取制定了通用的处理流程和框架结构,设计并实现了一个论坛信息资源抽取系WebWrapper。实验证明,该系统能够正确地处理目前大多数Web论坛中的消息与线索资源。该系统的抽取结果使得使用数据库技术自动处理论坛资源更加方便可行,为进一步面向论坛的信息检索和知识发现提供了技术支持。