词聚类用于文本分类的方法研究

来源 :重庆邮电大学 | 被引量 : 0次 | 上传用户:wzxisno2
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
短文本分类问题是基于短文本应用领域的必须解决的具有挑战性的基础性关键问题之一。由于短文本具有长度短、所描述概念信号弱的固有缺陷,短文本分类的可行途径是利用外部资源中的可用信息来扩展短文本所描述的概念。   通过词聚类方法可以建立词语对之间的语义关系,进而用来扩展短文本所描述的概念,因此它是用于改善文本分类、特别是短文本分类的有效手段之一。词聚类用于短文本分类时存在两个必须解决的问题:   (1)在语料类别不平衡时,如何有效地在分类过程中利用词聚类技术?这需要开发一种考虑语料类别不平衡条件下的特征选择方法,从而使词聚类技术能够较好的用于文本分类。   (2)在短文本中,低频词语所占比例较大,在词聚类技术中所采用的常规相似度计算方法无效。这需要研究一种适合于短文本分类的低频词语相似度计算方法。   对第一个问题,本文提出一种中文文本分类的两步特征选择方法,首先根据词语的类间分布进行区分词的定义,选出区分度较大的词作为某一类别的核心特征,然后用传统的特征选择方法从每个类别的核心特征中选出最佳特征子集,最后将各个特征子集合并起来作为结果。该方法不仅重点选出类别区分能力较强的特征,还尽可能保留传统特征选择方法选出的优秀特征,从而更好地捕获了分类信息。实验结果证明该方法明显优于传统的特征选择方法。   对第二个问题,本文提出了一种低频词语相似度计算的方法。该方法利用语义资源《知网》和基于Internet的构造语料进行相似度计算:对那些能够在《知网》中查到的词对,直接利用《知网》进行相似度计算;否则,利用构造语料进行相似度计算。实验结果表明,该方法在一定程度上解决了中文低频词语相似度计算问题。   最后,论文对词聚类技术如何有效用于短文本分类这一问题进行了初步探讨,并进行了相关实验。
其他文献
大米是最重要的粮食品种之一,目前我国对大米的质量检测仍然停留在人工观察阶段,这种检测方式缺乏客观性与准确性,而且难以适应实际生活中的大批量的检测。针对这些问题本文
学位
随着信息与通信技术的发展、数字家庭理念的普及,家庭网关产品将走向一个更高、更先进、涉及面更广的层次,以满足数字家庭的不同功能和业务需求。智能化、集成化产品将成为家
学位
媒体服务器是国际软交换联盟(ISC)和国际互联网工程专家组(IETF)使用的术语,在第三代通信伙伴计划(3GPP)中,称为媒体资源功能(MRF)。媒体服务器位于NGN中的IP核心网上,可为软
如何将已有的面向对象系统转化为面向Aspeet系统,进而提高原有系统的可复用性、可维护性以及可扩展性已成为AOP(Aspect-OrientedProgramming,面向Aspect编程)领域的热点问题。
学位
Ad Hoc网络是国内外无线移动通信领域的研究热点,网络无需设置中心控制点,所有节点地位平等,各个节点不仅具有普通移动终端的功能,而且具有报文转发能力,通过分层的网络协议
学位
短文本分类问题是对长度短的文本(通常文本长度小于160字符)进行自动分类,它是基于短文本应用领域必须解决的具有挑战性的基础性关键问题之一,具有重要的应用前景。   在
学位
人脸检测是当前人工智能和模式识别研究中的一个热点,它可以将人脸信息有效地应用于视频监控、身份验证、档案管理、可视化通讯、多媒体数据库检索以及网络传输中的基于内容的
学位
随着信息技术的迅猛发展和人类社会生活对Internet需求的日益增长,计算机与互联网科技得以不断的创新与升级,网络入侵的风险性也越来越大,网络安全已经成为全球性的问题。入
学位
学位
随着Web应用的快速发展,Web数据挖掘成为数据挖掘的热点之一,根据Web挖掘的目的和数据对象的不同,web数据挖掘可以分为Web内容挖掘、Web结构挖掘、Web日志挖掘。Web日志挖掘是对
学位