论文部分内容阅读
随着互联网及移动通信技术的快速发展,各大社交平台的兴起,微博已经成为当今社会传播信息的重要媒介之一,由于微博的低门槛等特性,使得用户在微博上的参与度非常高,这直接导致一些在现实社会中易引起大众关注的事件很容易并且在短时间内在微博平台上形成讨论,引起的舆论效果在某种程度上会影响到现实中的这一事件。同时,针对当前的大数据环境下数据本身的属性及传播特性,做好微博这一新媒体的网络舆情监控是我国舆情工作者面临的一个巨大挑战。因此,对海量微博数据进行采集、挖掘、监控分析,达到舆情监控的目的,为决策者应对舆情危机提供科学化的信息支持,具有很大的现实意义。本文针对这一问题,结合软件工程中项目的总体设计流程,通过分析微博舆情监控系统的整体架构,结合当前流行的大数据技术,构建了一种基于Hadoop的微博舆情监控系统模型。对系统各功能模块的工作流程和实现方式作出了详细设计。主要工作及研究成果如下:(1)研究了大数据与微博舆情的国内外发展现状,从多个维度进行了分析。同时研究了大数据与微博舆情的特点,并对Hadoop及相关核心组件作出了详细阐述,为模型的技术实现奠定坚实的理论基础;(2)通过分析模型各个功能模块的关键技术和解决方法,利用大数据环境下Hadoop集群的优势,完成了整个模型的构建,同时详细分析了信息采集模块、信息预处理模块、数据聚类模块与舆情分析模块在大数据环境下的具体功能和实现流程;(3)分析了信息采集、信息预处理、文本聚类三个阶段的可并行性,将上述过程进行优化,并对相关算法进行了改进处理。利用MapReduce分布式并行计算模型和TFIDF权重计算方法以及结合Canopy算法的K-Means聚类方法将处理过程分成map和reduce两个阶段进行分布式并行计算,提高了处理大批量数据的效率;(4)在以上理论研究及相关技术分析的基础上,利用普通PC机搭建Hadoop集群环境,对相关算法的改进利用MapReduce进行并行化。主要对数据采集、文本预处理、数据聚类、舆情分析等过程进行实验验证,同时与传统的处理方式对比,证明基于Hadoop的微博舆情监控系统模型的可用性、可扩展性以及高效性。