论文部分内容阅读
短文本分类问题是基于短文本应用领域的必须解决的具有挑战性的基础性关键问题之一。由于短文本具有长度短、所描述概念信号弱的固有缺陷,短文本分类的可行途径是利用外部资源中的可用信息来扩展短文本所描述的概念。
通过词聚类方法可以建立词语对之间的语义关系,进而用来扩展短文本所描述的概念,因此它是用于改善文本分类、特别是短文本分类的有效手段之一。词聚类用于短文本分类时存在两个必须解决的问题:
(1)在语料类别不平衡时,如何有效地在分类过程中利用词聚类技术?这需要开发一种考虑语料类别不平衡条件下的特征选择方法,从而使词聚类技术能够较好的用于文本分类。
(2)在短文本中,低频词语所占比例较大,在词聚类技术中所采用的常规相似度计算方法无效。这需要研究一种适合于短文本分类的低频词语相似度计算方法。
对第一个问题,本文提出一种中文文本分类的两步特征选择方法,首先根据词语的类间分布进行区分词的定义,选出区分度较大的词作为某一类别的核心特征,然后用传统的特征选择方法从每个类别的核心特征中选出最佳特征子集,最后将各个特征子集合并起来作为结果。该方法不仅重点选出类别区分能力较强的特征,还尽可能保留传统特征选择方法选出的优秀特征,从而更好地捕获了分类信息。实验结果证明该方法明显优于传统的特征选择方法。
对第二个问题,本文提出了一种低频词语相似度计算的方法。该方法利用语义资源《知网》和基于Internet的构造语料进行相似度计算:对那些能够在《知网》中查到的词对,直接利用《知网》进行相似度计算;否则,利用构造语料进行相似度计算。实验结果表明,该方法在一定程度上解决了中文低频词语相似度计算问题。
最后,论文对词聚类技术如何有效用于短文本分类这一问题进行了初步探讨,并进行了相关实验。