基于词的分布式表示的中文阅读理解研究

来源 :山西大学 | 被引量 : 1次 | 上传用户:zzmaazhu
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
自然语言处理是人工智能研究的核心领域之一。在自然语言处理中,阅读理解技术的发展进步对于处于信息时代的人们准确获取所需信息带来便利。阅读理解任务是对给定的自然语言文章以及给定与文章相关的问题,计算机能够从该文中自动获得问题的答案句。近年来,国内外关于阅读理解的研究有很多,大都是基于句子中词语之间的匹配进行研究。而基于汉语中词语或者字的分布式实值表示的向量在欧氏空间中来刻画词语之间相似关系的阅读理解研究还很少。本文首先尝试使用神经网络语言模型训练得到汉语中词和字的向量表示矩阵,而后基于山西大学自主研究开发的中文阅读理解语料库CRCC,对于由问句和答案句构成的两类分类问题,使用最大熵模型对每个句子进行建模,在原始的十个词层面特征的基础上加入我们构建的词的分布式实值向量表示这个特征,其中分布式词向量特征分别是以下几类:1)MAXOUT特征,刻画问题句和答案句的词对应的分布式实值向量的最大值的欧式距离;2)算法平均特征,刻画问句和答案句中的词所对应的实值向量的平均值的欧式距离;3)词的平均相似度匹配特征,对问句和答案句对应的实值向量先求距离再求平均值;4)余弦夹角特征,分别对以上三个特征求余弦夹角。这些特征主要是用来度量问题句和候选答案句的相似程度。针对语料库规模有限等情况,在语料上使用holdout验证方法,随机切分了五次得到训练集和测试集。采用HumSent准确率来评价模型的预测性能。本文首先使用训练好的原始词向量矩阵得到初步结果,而后对词向量矩阵进行尺度优化,最后,在模型中加入基于分布式表示的字向量矩阵和经过尺度优化的字向量矩阵。通过多次实验对比,我们选择性能好的字向量矩阵和特征来训练得到本文的结果。实验表明,在阅读理解问题回答任务中,把通过尺度优化的词向量矩阵得到的特征加入到最大熵模型中,使用总共十一个特征进行训练,在测试集上的HumSent准确率达到63.37%。进而加入基于字的分布式表示的向量矩阵和特征,最终的HumSent准确率达到63.81%,比原始十个特征61.74%的HumSent准确率提高2.07%。证明把基于词或者字的分布式实值表示向量作为特征加入到最大熵模型中对于测试集上阅读理解问题回答任务HumSent准确率的提升是有作用的。
其他文献
该文主要研究Banach空间的含经典序列空间的渐近等距副本.我们将该文分为六章.在第一章中,我们研究了James扭曲定理,证明了:如果一个共轭空间含有C[0,1]的同构副本,则其必几
该文第一章在Cn中单位球上讨论了空间F(p,q,s)到Bloch型空间β上的点乘子,根据p、q、s、α的不同情况对乘子空间M(F(p,q,s),β)进行了较完整的刻划.设U是n维复空间C中的单位
该文主要研究了模糊数值模糊测度的结构特性和模糊可测函数的性质以及Choquet积分定义的单调集函数对原单调集函数结构特性的遗传性.具体工作如下:(1)引入了模糊值模糊测度的
对于处于恶劣工作环境中的传感器,制造商和工业企业现在可以借助罗克韦尔自动化IP67防护等级的Allen-Bradley Armor Block IO-Link主站,获得更为详细的诊断信息。该主站设备
1976年1月8日,周恩来,这位伟大的无产阶级革命家、20世纪的伟人,在同病魔作了顽强的斗争后,留下期望,留下瞩托,带着对党和国家前途与命运的担忧,离开了他为之奋斗一生,功勋卓
本文从数字化技术应用的角度,阐述从电子政务、电子图书、数字化实验室、数字化校园、数字化学习直到数字化教育的概念发展及发展趋势,并结合新环境、新技术冲击下管理信息系统
本文研究了半线性波动方程和Klein-Gordon-Schrodinger耦合组的Cauchy问题的适定性,同时我们考察了Davey-Stewartson系统在初值的正则性低于能量范数意义下的整体适定性.对半
在市十二届人大一次会议上,苏兴华以市民身份首次旁听了市人代会。他既高兴又激动:“看现场与看电视的感觉就是不一样,身临其境,多了一种亲切感。”通过旁听,苏兴华更好地领
党的十六大提出的坚持以人为本,全面、协调、可持续的科学发展观,是我们党以邓小平理论和“三个代表”重要思想为指导,从新世纪、新阶段党和国家事业发展全局出发提出的重大
该文讨论互连网络拓扑结构分析中的几个问题.全文共分二部分.第一部分讨论变更图的直径问题.变更图的直径问题是图论中的一个经典问题.对于给定的正整数t和d(≥2),用F(t,d)和