论文部分内容阅读
随着Web2.0的迅速发展,互联网日益成为人们获取信息的主渠道,而网络信息呈爆炸式增长,如何快速获得网络核心信息、快速获得准确有意义的信息成为每一个互联网人的难题。本课题关注在web信息传播过程中传播模型的构建,以及推动信息向全网扩散,最终成为热点话题的关键因素。首先,本文利用传统的增量式聚类算法single-pass的基本思想,结合传统的基于划分的代表方法K-MEANS,提出了一种基于划分的增量式聚类算法。算法不仅有效地对动态更新的网络文本信息进行聚类,而且消除了K-MEANS的缺陷,将K-MEANS算法中对K的设定和对初始聚类中心的选择,转换为对文档与类之间的相似度和预定相似度阈值的判断,而相似度阈值的设定可以通过在实验过程中不断调整来获取,使结果更加准确,开销也大大缩减。这样,算法具有更强的适应性,增强了解决实际问题的能力。同时,算法还考虑到了网络信息的话题偏移和无限性等问题。在获得聚类信息的基础上,本文综合考虑两方面内容:一是媒体的关注度,包括报道数目、报道时长、传播速度、传播范围等;二是用户行为,包括点击次数、阅读速度、评论条数、评论人数、转发次数等,定义了网络话题的“关注度”,从而得到了网络热点话题,并且随时间更新。话题传播模型的构建是针对网络热点话题的。本课题中,提出了一个考虑节点活跃度的基于离散时间话题传播模型。基于页面内容的相似度分析,识别文档间存在的传播关系,以推断信息源,并得出话题在网页问的传播路径,最终绘制话题传播图。一方面,基于日前热议的“网络水军”概念,引入“水话题”的概念,结合话题传播图,对纯粹追求商业利益的营销和炒作性话题传播现象进行识别。另一方面,通过分析不同背景和传播模式的网络热点话题的传播情况,探究站点活跃度、站点贡献度、时间、地域、话题源媒体类型等外界环境对话题传播路径的影响。结果表明,所提出的模型可以体现话题动态传播过程的特性,解释话题的实际传播过程,指出影响话题传播路径的关键因素,并作为话题传播状态估计和话题发展趋势的预判的依据。本课题通过构建网络热点话题传播模型和绘制网络热点话题传播图,在帮助大众把握当前热点话题,了解流行观点的出现、传播方式和传播过程等方面做出贡献。从而,一方面使网络舆情能够理性地蔓延,另一方面,为互联网建设与管理提供一些数据和技术上的支持。