互联网新闻溯源及跨媒体影响分析关键技术研究

来源 :中国科学院大学 | 被引量 : 0次 | 上传用户:jsdfyxl
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
互联网中的信息聚类与整合是研究人员一直关注和研究的热点问题,由于信息量大,算法需要综合考虑准确率、运行效率和存储开销等问题,存在较大研究难度。本文针对互联网中新闻信息的聚类和整合,以网页为主、微博为辅,研究了新闻信息溯源过程中的两方面关键技术:信息抽取和信息聚类。  在信息抽取方面,针对网页正文提取算法缺乏通用性,以及对新闻网页的提取缺乏针对性覆盖标题、时间、来源信息的问题,提出了一种新闻关键信息的提取算法(newsExtractor)。该算法首先将网页转换成行号和文本的集合,然后根据字数最长的语句出现在新闻正文的概率极高的统计特征,确定算法扫描起点,并向两端探寻正文的起点和终点,从而提取新闻正文;针对新闻网页,进一步根据最长公共子串算法提取标题,构造正则表达式并以行号辅助判断提取时间,根据来源的格式特点并辅以行号提取来源,最后收集真实新闻网页构造了数据集,并在其上进行对比实验。实验结果表明,通过与知名开源软件(newsPaper)进行提取准确率的对比,newsExtractor的正文平均提取准确率指标高出newsPaper1.3%,对标题、时间和来源等方面的提取准确率方面,newsExtractor也都明显优于newsPaper,具备良好的通用性和鲁棒性。  在信息聚类方面,针对传统的Kmeans算法在执行效率上的不足以及事先无法确定聚类簇数K的问题,借鉴SimHash算法快速查找的特点,提出了一种基于SimHash改进的Kmeans算法;在使用轮廓系数作为评价指标的情况下,在所构造数据集上的进行实验,结果表明,改进后的Kmeans比传统Kmeans的聚类结果更接近于最佳值,同时算法的执行时间比传统Kmeans提高了27倍。该算法在大规模数据聚类上的优越性显著。  最后,通过对“CNNIC发布第37次报告”事件进行案例研究的方式,运用上述关键技术,计算得出了新闻溯源的结果,确定在该新闻传播过程中的重要节点,并通过将此次事件中所邀请的新闻媒体列表与算法得出的结果进行对比,给出了后续类似事件的新闻投放建议。
其他文献
当前人们享受信息化带来的便利的同时也深受海量数据难以管理的困扰,个人文件同步系统的产生和发展为这个问题带来一个比较好的解决办法。这种文件同步系统通过将个人文件夹内
当今社会互联网技术的飞速发展以及与电信网络不断融合的背景下,VOIP技术在互联网中变得也来越重要,网络中对传输语音视频数据的需求在不断增强。互联网的飞速发展加速了互联
近年来新型社交媒体微博客平台高速发展,已经逐渐成为人们分享、获取信息的主要方式。由于微博客平台用户量急剧增多,用户产生的数据总量呈现爆炸式增长,基于这些信息的突发话题
随着以DropBox、EverNote等为代表的云存储服务的兴起与不断发展,云存储平台在存储数据方面的可靠性、易用性使得个人信息正在不断从传统的存储介质向云存储转移,云存储平台正
随着计算机和互联网技术的飞速发展,网络上的多媒体信息呈现爆炸式的增长态势。如何分类和检索这海量的多媒体数据,是人们的迫切需求,也成为亟待解决的问题。基于内容的互联网图
随着社会的不断发展进步,人们已经步入了信息化时代,集成电路设计与工艺制造作为信息产业的基础,对信息化的高速发展发挥着关键性作用。本论文以高性能处理器中的关键模块寄存器
软件缺陷检测是计算机科学特别是软件工程相关领域的重要研究工作之一。对于静态检测方法而言,如何在保障准确性的同时改善可扩展性一直以来都是研究的热点问题。本文设计并实
相场模型起源于计算材料科学,被广泛应用于模拟材料物理、计算化学等领域的多个过程。近年来,相场法已成为该领域模拟中尺度水平微结构演化的一项通用性很强的数值方法。指数时
车联网系统旨在通过车车之间(V2V)、车路之间(V2I)的信息交互,有效地降低道路事故率,提高交通效率,并为用户提供高质量的流媒体服务。在行车安全方面,基于短距离通信协议(DSRC)的
随着互联网和办公自动化的日益普及,PDF(Portable Document Format)文档以其丰富的功能、高度的集成与封装以及平台无关的特性迅速成为全球电子文档分发的开放式标准。PDF文档