论文部分内容阅读
近年来,主题情感联合模型成为了无监督学习领域的一项重要研究内容,在文本主题挖掘和情感分析等方面均有实际应用。然而在现实场景中,微博本身存在文字短小,结构不完整等特征,当处理小型微博数据集时,主题情感模型的情感极性分类效果不佳。因此,本课题围绕微博主题情感模型展开研究与改进,提出基于词嵌入主题情感模型的微博情感极性分析方法,主要研究成果如下:
首先,针对基于多特征融合的微博主题情感挖掘模型——TSMMF(Topic Sentiment Modelbased on Multi-feature Fusion)面对小型微博语料库时,仅通过单词共现来推断出各项分布,不能挖掘低频词语的语义关系,而无法达到预期的情感分类效果的问题,提出了TSMMF模型与词向量技术相结合的方法。通过使用情感-主题-词语Dirichlet多项式分布和词向量空间的混合组件来代替原Dirichlet多项式分布重新生成词语,进而提出了WE-TSMMF模型(Topic Sentiment Model based on Multi-feature Fusion with Word Embedding)。通过实验获取了WE-TSMMF模型中参数的最优值,并验证了该模型在小型微博语料库上的可行性及有效性。
然后,针对词向量技术与TSMMF模型结合时,面对大型微博语料库会出现运行速度缓慢的问题,提出基于高斯分布的改进词嵌入主题情感模型。通过多元高斯分布从词向量空间中快速采样邻近词语,并替换掉由Dirichlet多项式分布生成的词语,从而将共现频率低、信息量少的单词转变成突出主题、信息明确的单词,同时使用最近邻搜索算法来提升词向量空间中邻近词的搜索速率,进而提出了GWE-TSMMF模型(TopicSentiment Model based on Multi-feature Fusion with Gaussian Word Embedding)。通过实验获取了GWE-TSMMF模型中参数的最优值,并验证了该模型在大型微博语料库上的可行性及有效性。
最后,为了进一步验证WE-TSMMF模型和GWE-TSMMF模型的有效性和适用性,通过在自然语言处理与信息检索共享平台搜集公开微博语料库以扩充实验数据集,并在该数据集上进行综合实验以充分评估本文所提的模型。实验结果表明,WE-TSMMF模型和GWE-TSMMF模型相较于原模型在主题质量、情感分类效果上均有明显提升。其次,通过与当前主流词嵌入主题情感模型的对比实验,进一步验证了本文提出的模型具有更优的微博情感极性分析性能。
首先,针对基于多特征融合的微博主题情感挖掘模型——TSMMF(Topic Sentiment Modelbased on Multi-feature Fusion)面对小型微博语料库时,仅通过单词共现来推断出各项分布,不能挖掘低频词语的语义关系,而无法达到预期的情感分类效果的问题,提出了TSMMF模型与词向量技术相结合的方法。通过使用情感-主题-词语Dirichlet多项式分布和词向量空间的混合组件来代替原Dirichlet多项式分布重新生成词语,进而提出了WE-TSMMF模型(Topic Sentiment Model based on Multi-feature Fusion with Word Embedding)。通过实验获取了WE-TSMMF模型中参数的最优值,并验证了该模型在小型微博语料库上的可行性及有效性。
然后,针对词向量技术与TSMMF模型结合时,面对大型微博语料库会出现运行速度缓慢的问题,提出基于高斯分布的改进词嵌入主题情感模型。通过多元高斯分布从词向量空间中快速采样邻近词语,并替换掉由Dirichlet多项式分布生成的词语,从而将共现频率低、信息量少的单词转变成突出主题、信息明确的单词,同时使用最近邻搜索算法来提升词向量空间中邻近词的搜索速率,进而提出了GWE-TSMMF模型(TopicSentiment Model based on Multi-feature Fusion with Gaussian Word Embedding)。通过实验获取了GWE-TSMMF模型中参数的最优值,并验证了该模型在大型微博语料库上的可行性及有效性。
最后,为了进一步验证WE-TSMMF模型和GWE-TSMMF模型的有效性和适用性,通过在自然语言处理与信息检索共享平台搜集公开微博语料库以扩充实验数据集,并在该数据集上进行综合实验以充分评估本文所提的模型。实验结果表明,WE-TSMMF模型和GWE-TSMMF模型相较于原模型在主题质量、情感分类效果上均有明显提升。其次,通过与当前主流词嵌入主题情感模型的对比实验,进一步验证了本文提出的模型具有更优的微博情感极性分析性能。