论文部分内容阅读
博客作为一种社交网络,是比较年轻的社会学习及沟通工具,它正日益成为一个重要的信息来源。社区挖掘是一个比较新的研究方向,对社区结构和内容分析具有重要的实际价值。随着网络的发展,其中承载着的信息越来越丰富,如何才能从这些信息中挖掘出有价值、有意义的内容显得尤为重要,社区的发现为其提供了一个很好的途径。在研究社区发现时候,把网络划分为多个群组,且采用社区的方式进行划分,加快博客用户自发聚集的速度,最终形成社区。研究节点与节点间存在的链接关系以及研究节点中的文本内容时候采用的比较传统的方法是社区法,且社区间的结构关系是呈现树形关系,所以一般对社区进行分类时候采用分层法。当今社会,网络发展速度非常快,而传统的算法有着明显的弱点,那就是单一性,这就会使得传统算法无法很好的适应新的社交网站。然而,由于数据掘技术以及图论挖的高速发展,博客社区的发现开始使用分类法。本文对单个的博客进行考察,分析了这些博客个体的结构及其特征。然后分析了博客个体的行为特征及连接特征,并研究了社交网络。在社区发现的技术方面,对国内外的研究状况进行总结,并比较其各自的优缺点,在此基础上考虑社会网络分析方法,并对博客用户的文本内容及链接关系进行研究,从而发现社区。在文本技术提取方面,分析了基于机械主题提取法和基于语义语法分法各自的优缺点,对文章的内容相关度分析采用基于LDA模型,来计算文本内容之间的相关性,而在社区主题提取方面采用了比较简单的机械式提取方法来提取关键词。本文针对分析结果及挖掘出的数据设计了相关的实验,结果发现潜在的社区是可以通过本文所用的方法来发现,社区的文档性及相关性比较高,对社区进行进一步挖掘能够获得社区的相关主题,本文的研究考虑了文本的语义。文章最后给出工作成果,分析了未来可能存在的一些问题并给出了比较合理的改进建议。本文做了大量理论研究和实验后,得出未来博客社区发现的研究需要努力的方向,比如找出结合模型对Blog社区中的文本内容进行分析的更好的方法,对社区发现算法进行进一步的优化等。