论文部分内容阅读
近年来分布式表示方法被广泛应用于词性标注、机器翻译、词义消歧等自然语言处理任务中,并且已显示出其效果的优越性。然而这种在大规模文本语料上通过无监督学习训练得到的词嵌入式表示,难以涵盖知识库和语义词典中完善的人工标注信息,知识库中的实体关系及其特有的层次结构等特点毫无疑问在NLP中有着重要的作用。如何有效结合分布式表示和知识库来得到更完善的词嵌入式表示,解决一词多义、词位(一个词的某一种词义)扩展等问题,已成为当前的研究热点。本文研究的课题也是基于该任务。本文基于自编码器思想的AutoExtend[18]模型,实现并提出了新的半监督、层次结构化的词向量模型,来融合知识库和无监督的词向量,进而优化一词多义、词位扩展等任务的效果。虽然AutoExtend模型以及相关研究已取得一定的成效,但是它们所利用的知识库实体关系有限,并且仅对登录词有效。针对以上缺陷,本文充分利用知识库的特征实现和提出了两种模型,在保证效率和并行化的前提下对词、词位向量进行改进,通过词语相似性、词扩展、命名实体识别等任务进行实验,并且比已有模型取得了更好的改进效果。本文的主要研究内容和阶段成果如下:(1)设计实现了一种基于词典半监督学习的RetroExtend模型,用于改进登录词词位向量。该模型利用AutoExtend模型中的自编码器框架,在编码-解码过程中基于图学习全面分析词典中词、词位之间的实体关系,从而训练得到更高质量的登录词词位向量;(2)提出了一种基于层次结构半监督学习的OOVExtend模型,用于解决未登录词的一词多义问题,扩展出未登录词词位向量。该模型首先充分利用知识库的层次结构特征,为未登录词匹配知识库中最契合的同义词集合,然后利用RetroExtend模型学习到的同义词集合向量,在由被匹配的同义词集合向量至词向量的解码过程中,以最小化重建损失为目标函数来学习权重矩阵,从而计算得到未登录词的词位向量,实现对未登录词的一词多义识别。(3)基于本文模型,通过结合WordNet、PPDB等知识库和Wikipedia和GoogleNews等语料,在WS353、SCWS等标准数据集上,利用AvgSim、AvgSimC等评估方法,解决词语相似性、词扩展、命名实体识别等问题。实验结果表明,本文提出的模型在已有相关算法的基础上有一定的提升效果,例如,对于词语相似性实验,Spearman系数有2%~3%的提高。由此可见本文设计的算法能够较好的解决一词多义、词位扩展等问题,具有可行性。