论文部分内容阅读
现今,社会化媒体的普及,积累了规模庞大且具有价值的用户数据资源。海量的异构数据给学术界在大数据挖掘领域带来了新的突破点,社会化媒体用户隐含属性识别任务也应运而生。社会化媒体用户隐含属性识别是指运用现有的规模数据自动推断出社会化媒体用户群体的未知属性与潜在特质。基于微博、知乎不同的用户数据,本文有针对性地提出了以下两种方法:1.基于Labeled LDA模型的社会化媒体用户隐含属性识别方法本文运用Labeled LDA模型识别知乎社区这一社会化媒体的用户的隐含属性——职业倾向。与微博用户文本数据相比较,知乎社区用户文本多为成千上万的长文本数据且规模庞大,需进行复杂的数据清洗才能投入实验。本文尝试利用用户的行为特征——粉丝用户对“意见领袖”用户的关注行为进行隐含属性——职业倾向的识别。因用户的各个行业存在规范文本,本文可直接利用现有的规范文本作为标签,运用Labeled LDA模型进行识别任务。利用用户的行为特征进行隐含属性职业倾向识别。该识别系统的准确度比利用文本统计特征的方法高5个百分点。2.基于递归神经网络的社会化媒体用户隐含属性识别方法该方法基于递归神经网络,融合多种特征进行社会化媒体用户隐含属性——性别属性的识别。传统SVM模型的识别性能好坏取决于所选择的特征。当特征选取不当时,SVM模型的分类性能不佳。此外,传统特征数据量过大时易造成数据稀疏从而降低识别系统的准确度。本文分析社会化媒体新浪微博的用户数据,选定用户标签和用户关注内容作为融合特征基于递归神经网络识别用户隐含属性,本文还利用了传统SVM模型和词典方法进行实验作为对照组。实验结果表明,递归神经网络基于传统特征、标签特征和关注内容特征的组合特征数据进行隐含属性识别任务的实验时,系统的识别结果最好。在进行上述两项实验的过程中,本文发现识别系统的性能与用户规模有一定的关联性,用户规模越高,识别系统的性能越好。