论文部分内容阅读
自然语言处理是人工智能研究的核心领域之一。在自然语言处理中,阅读理解技术的发展进步对于处于信息时代的人们准确获取所需信息带来便利。阅读理解任务是对给定的自然语言文章以及给定与文章相关的问题,计算机能够从该文中自动获得问题的答案句。近年来,国内外关于阅读理解的研究有很多,大都是基于句子中词语之间的匹配进行研究。而基于汉语中词语或者字的分布式实值表示的向量在欧氏空间中来刻画词语之间相似关系的阅读理解研究还很少。本文首先尝试使用神经网络语言模型训练得到汉语中词和字的向量表示矩阵,而后基于山西大学自主研究开发的中文阅读理解语料库CRCC,对于由问句和答案句构成的两类分类问题,使用最大熵模型对每个句子进行建模,在原始的十个词层面特征的基础上加入我们构建的词的分布式实值向量表示这个特征,其中分布式词向量特征分别是以下几类:1)MAXOUT特征,刻画问题句和答案句的词对应的分布式实值向量的最大值的欧式距离;2)算法平均特征,刻画问句和答案句中的词所对应的实值向量的平均值的欧式距离;3)词的平均相似度匹配特征,对问句和答案句对应的实值向量先求距离再求平均值;4)余弦夹角特征,分别对以上三个特征求余弦夹角。这些特征主要是用来度量问题句和候选答案句的相似程度。针对语料库规模有限等情况,在语料上使用holdout验证方法,随机切分了五次得到训练集和测试集。采用HumSent准确率来评价模型的预测性能。本文首先使用训练好的原始词向量矩阵得到初步结果,而后对词向量矩阵进行尺度优化,最后,在模型中加入基于分布式表示的字向量矩阵和经过尺度优化的字向量矩阵。通过多次实验对比,我们选择性能好的字向量矩阵和特征来训练得到本文的结果。实验表明,在阅读理解问题回答任务中,把通过尺度优化的词向量矩阵得到的特征加入到最大熵模型中,使用总共十一个特征进行训练,在测试集上的HumSent准确率达到63.37%。进而加入基于字的分布式表示的向量矩阵和特征,最终的HumSent准确率达到63.81%,比原始十个特征61.74%的HumSent准确率提高2.07%。证明把基于词或者字的分布式实值表示向量作为特征加入到最大熵模型中对于测试集上阅读理解问题回答任务HumSent准确率的提升是有作用的。