论文部分内容阅读
在大数据背景下,我们可以轻易获得海量、多源化、无结构的短文本数据,包括网页检索片段、地理位置、微信息、产品评论以及新闻标题等。但是,如何根据用户的个性化需求,快速、准确地从大规模数据中挖掘出其最需要的信息,仍然面临着很大的挑战。短文本分类技术的研究能帮助系统更加高效地“理解”和“管理”各种各样的文本数据,对于网络智能的发展有重要影响。 目前,对短文本进行建模的方法主要有词袋模型、序列模型和基于树结构的模型等。由于短文本包含的上下文内容比较少,表达的语义信息不够显著,传统的特征表示方法容易遭遇数据稀疏性和歧义性问题。为了解决这些问题,本文主要研究基于大规模语料库对短文本进行建模的方法,并应用于分类任务。研究的主要思路是试图从语料库中挖掘潜在的主题、关键词和语义等不同层次的信息对短文本进行扩展,以获得增强的特征表示。本文的主要贡献包括: 1.提出一种基于多粒度主题扩展和模型融合的短文本分类方法 为了克服传统词袋模型的数据稀疏性问题,并对短文本的特征进行主题增强,本文提出分别抽取不同主题粒度的特征,用于训练融合模型以实现短文本的分类。该方法基于外部大规模语料库学习主题模型,挖掘多粒度的主题信息对短文本的内容进行扩展,在缓解数据稀疏性的同时,还可以有效引入外部知识。为构建融合模型,利用包含不同主题数目和不同层次的特征分别训练最大熵和SVM分类器,并提出一种决策规则,将最大熵和SVM融合在一起,实现对短文本的综合预测。实验结果表明,该方法能够发挥多模型的优势,确保分类性能的鲁棒性。 2.提出一种基于关键词扩展的短文本分类方法 虽然通过挖掘多粒度主题对短文本进行扩展,能够丰富词袋特征的主题信息。但是,由于词袋特征的维数往往很高,而每一条短文本所包含的主题个数很少。因此,扩展的主题信息难以获得足够大的权重,使得这部分信息在分类模型训练过程中所应发挥的作用被弱化。为了解决这个问题,本文提出对短文本进行关键词扩展,以改善其词袋特征的相似度计算。所提方法采用一种改进算法对每一个主题下的关键词分布进行重排序,可以得到更加显著的主题表示。基于重排序后的关键词分布,构建主题-关键词图谱,该图谱能够直观的体现语料库的整体语义结构,因此可以用来挖掘关键词之间的语义相关性。为了综合计算关键词之间的相似度,本文提出基于链接分析和K-L散度相结合的方法。实验证明通过对短文本中的种子关键词进行扩展,可以缓解数据稀疏性和多义词问题。 3.提出一种基于语义信息扩展和卷积神经网络的短文本分类方法无论是对短文本进行主题扩展,还是关键词扩展,都没有考虑词序信息和关键词之间的依赖关系,这使得短文本的语义信息损失严重。为了解决这个问题,本文提出挖掘语义词向量以构建扩展矩阵,并训练卷积神经网络对短文本进行分类。该方法利用基于密度峰的快速聚类方法对预训练的词向量在空间中进行聚类,使得相关的词语形成语义团簇。在对短文本进行特征扩展时,为了降低噪声的引入,将语义团用作监督信息以检测短文本中可能存在的语义单元,并把与该语义单元最近邻的词向量抽出以构建扩展语义矩阵。在卷积神经网络中,以短文本的映射矩阵和扩展矩阵作为输入,在全连接层可以获得定长的特征表示,并学习Softmax决策函数对短文本的类别进行预测。该方法将短文本映射到低维、稠密的实数向量空间中,能够抽取语义丰富的特征表示,分类性能稳定。