论文部分内容阅读
随着Web2.0的兴起,论坛、微博、贴吧等社会媒体信息不仅使人们成为了一个信息享有者,也让人们成为了一个信息提供者。在海量评论文本中,比较句是一种常用的句型,常常用来对两个事物或多个事物对比,以表达人们对不同事物的情感倾向。比较要素的抽取可为商家对投放市场的同类产品进行比较分析提供数据资源,同时为普通消费者购买商品提供决策支撑。人们在撰写评论时,常常追求简洁明了,采用省略方式,导致比较要素抽取性能不高,针对这一问题,本文主要对比较句中的比较要素缺省识别与抽取开展深入研究。主要研究内容如下:(1)基于规则和序列模式的比较要素缺省识别根据比较句型的特点,总结了比较特征词集,在此基础上,构建了五元组识别规则和序列模式挖掘算法。为了充分利用两种方法的优点,设计了五元组方法和序列模式方法混合策略。在COAE2013语料上进行对比实验,结果表明,基于规则的五元组和序列模式混合策略优于单一方法的比较要素缺省识别。(2)基于比较要素缺省的要素抽取通过对比较句要素缺省情况的考察,归纳了两种形式的缺省,一种是仅仅为表达简洁而产生的显式缺省,另一种是比较句中属性的隐式缺省。对于显式缺省,本文利用不同大小窗口情况下的句子中已标记的对象和属性分别作为相应的比较要素。属性的隐式缺省,需要通过上下文进行推测,本文主要利用同义词词林扩展后的隐式属性库进行恢复,然后抽取恢复后的属性得到比较要素。(3)基于受限领域知识的比较要素抽取系统利用基于序列模式的汉语比较句识别方法以及本文对比较句缺省识别与抽取方法,开发了一个集比较句识别、比较句要素缺省项识别、比较句要素抽取为一体的比较要素抽取系统,该系统可为产品分析提供技术支撑。