论文部分内容阅读
话题模型是近年来在文本分析和挖掘领域比较流行的机器学习方法,不像传统的向量空间模型在高维稀疏的单词空间中刻画文档,它在表示文档时,通过使用隐话题将文档和单词联系起来。这样,在赋予文档的低维表示的同时,也可以挖掘出文档中单词的语义,即话题。话题模型扩展了人们对数据的认识,已被广泛应用到文本挖掘和信息处理的各个领域。然而,在研究和应用话题模型的过程中,人们发现尽管网络包含了海量的数据,但数据本身却具有稀疏的特性。数据的稀疏性不仅表现在数据特征上的不足,而且会降低数据间的关联性。因此如何将话题模型拓展到具有稀疏性的文本建模场景中,挖掘出有效的文本语义,成为学术界和工业界关注的热点。 本文主要针对文本数据稀疏特性影响下的话题模型进行研究,我们研究主要围绕稀疏性的三个方面展开:1)文本内容的稀疏性;2)文本语义的稀疏性;3)文本间相互关系的稀疏性。具体的研究内容包括: 针对内容稀疏数据,我们以搜索查询为例,提出了一种建模词项查询图的概率混合模型。该模型通过查询日志中的查询会话信息将查询联系起来,不仅增强了查询内部单词共现的统计特性,而且使得学习出的话题能够反映用户在使用搜索引擎的查询意图。另外,我们还提出了一种能有效融合查询意图的查询推荐方法,该方法可以将查询中单词的推荐结果按查询意图自然的融合,避免了噪声单词对推荐结果的影响。实验结果表明,通过引入查询意图,可以显著提高查询推荐结果的相关性。 针对语义稀疏的话题模型,我们着眼于解决文档话题的有效稀疏性和话题的清晰可解释性之间的矛盾。我们提出了Group Sparse Topical Coding(GSTC),一种新型的非概率化的建模文本稀疏隐语义的话题模型。该模型综合了概率话题模型和非概率话题模型的各自优点,通过放松概率话题模型对文本话题的一致的概率性约束,GSTC能够直接控制文档的稀疏语义表示,并且能够通过高效的算法求解。同时,GSTC可以通过学得的文档单词编码和文档话题字典推导出文档的稀疏语义话题表示。在标准数据集合上的试验表明,我们的方法可以有效的发现文档的稀疏话题,并且相对于传统的话题模型,GSTC能够改进文档分类精度和学习速度。 此外,文档之间还存在着稀疏的关系。原有的话题模型在发掘文档中的有效语义特征的时候,并不考虑文档之间的分布关系,很多研究表明文档更有可能是分布在高维空间中的一个低维流形上。在流形上,由于文档仅在局部范围内可以保持欧式空间的特征,这种局部性导致了文档之间关系的稀疏。基于此认识,我们提出了一种双空间矩阵分解模型:在话题空间上的分解,我们可以获取文档的语义表达;而在文档空间上的分解,通过使用稀疏性约束,我们可以一步的获得在局部空间上文档之间的相互关系。将文档在两个空间上的表示加以匹配,不仅可获得具有局部文档关系信息的文档隐语义表示,而且能够克服传统带流形约束的话题模型启发式的计算文档相似度和数据分布不平衡造成的损失。试验结果,验证了我们所提方法的有效性。 我们的研究表明,文本数据的稀疏属性影响了话题的学习,考虑稀疏性质的文档语义模型可以提升话题学习的有效性,并取得较好的应用效果。