论文部分内容阅读
近些年来论坛、贴吧、博客、微博等网络社区己成为信息发布、共享和传播的重要媒介。特别是论坛,已成为信息发布、共享和传播的重要平台。论坛内容由普通用户创建和发布,主要反映的是大众的观点,通过对其观点进行分析,可以发现公众对政府政策的态度,或对其不良信息进行识别与过滤等。因此分析研究网络论坛的信息对舆情分析与监测、不良信息的监测与管理等应用具有重要价值和意义。在舆情分析与监测、不良信息的监测与管理中,急需获取论坛中帖子内容,为进一步舆情分析,不良信息的分析与监督管理等工作,提供原始数据。由此可见,数据爬取(Data Crawler)是数据分析和应用的前提,是系统的所有工作的基础。然而以页面为单位的传统的爬取技术爬取网页的方式不适合论坛数据的爬取。原因有三:传统的以网页为单位的爬虫技术,忽略了论坛页面的内在结构和页面间的关联;传统爬虫不具有帖子过滤功能,并且不对页面内容进行分析,而仅仅只分析页面中的链接;传统的爬虫保存页面的完整信息,不对页面进行数据处理。而这些论坛页面的内在结构和页面间的关联、避免重复抓取与存储的帖子过滤功能以及对帖子页面信息的处理对于论坛数据的抓取和获取都是必须考虑的问题。因此为了解决传统爬虫对论坛爬取的各种不足,本文在研究普通的通用爬虫、网页更新和调度的基础上,分析网络社区论坛的特征,针对网络论坛的信息抓取与获取进行了研究并取得了一定的成果。本文的主要研究成果及贡献如下:1)研究分析网络论坛的特征,并结合论坛的网页三层逻辑架构,针对论坛定制爬取策略。通过研究通用爬虫的原理制定针对论坛的抓取策略,针对论坛的特性,提出并使用了一种过滤机制,这个过滤机制是基于URL链接地址格式过滤与基于内容检测的过滤校验机制。在基于内容检测的过滤校验中,提出并使用了一种基于BG的多模式匹配算法的改进算法-BG_q-Grams_u-Unrolling_s-Shift系列算法。并对设计的论坛爬虫策略与基于链接过滤机制结合的论坛爬虫,进行了实验,召回率和准确率都很高,获得了良好的抓取效果。2)网站一般都有更新,而论坛更新速度更快,帖子内容增量式增加。通过对论坛的增量更新信息的研究统计分析论坛更新数据,使用基于链接池的增量更新方案,提出对不同的增量信息采用不同的抓取小策略,并形成了论坛的增量抓取算法;增量抓取算法,获得了很高的准确率和召回率。在抓取调度中并使用了基于版块的抓取调度算法,将系统总延迟大幅减小。