论文部分内容阅读
互联网中的信息聚类与整合是研究人员一直关注和研究的热点问题,由于信息量大,算法需要综合考虑准确率、运行效率和存储开销等问题,存在较大研究难度。本文针对互联网中新闻信息的聚类和整合,以网页为主、微博为辅,研究了新闻信息溯源过程中的两方面关键技术:信息抽取和信息聚类。 在信息抽取方面,针对网页正文提取算法缺乏通用性,以及对新闻网页的提取缺乏针对性覆盖标题、时间、来源信息的问题,提出了一种新闻关键信息的提取算法(newsExtractor)。该算法首先将网页转换成行号和文本的集合,然后根据字数最长的语句出现在新闻正文的概率极高的统计特征,确定算法扫描起点,并向两端探寻正文的起点和终点,从而提取新闻正文;针对新闻网页,进一步根据最长公共子串算法提取标题,构造正则表达式并以行号辅助判断提取时间,根据来源的格式特点并辅以行号提取来源,最后收集真实新闻网页构造了数据集,并在其上进行对比实验。实验结果表明,通过与知名开源软件(newsPaper)进行提取准确率的对比,newsExtractor的正文平均提取准确率指标高出newsPaper1.3%,对标题、时间和来源等方面的提取准确率方面,newsExtractor也都明显优于newsPaper,具备良好的通用性和鲁棒性。 在信息聚类方面,针对传统的Kmeans算法在执行效率上的不足以及事先无法确定聚类簇数K的问题,借鉴SimHash算法快速查找的特点,提出了一种基于SimHash改进的Kmeans算法;在使用轮廓系数作为评价指标的情况下,在所构造数据集上的进行实验,结果表明,改进后的Kmeans比传统Kmeans的聚类结果更接近于最佳值,同时算法的执行时间比传统Kmeans提高了27倍。该算法在大规模数据聚类上的优越性显著。 最后,通过对“CNNIC发布第37次报告”事件进行案例研究的方式,运用上述关键技术,计算得出了新闻溯源的结果,确定在该新闻传播过程中的重要节点,并通过将此次事件中所邀请的新闻媒体列表与算法得出的结果进行对比,给出了后续类似事件的新闻投放建议。