论文部分内容阅读
摘要生成是指模型对输入文本进行凝练压缩,得出简短的原文摘要。互联网技术日新月异,获取信息的来源越来越多,需要处理的信息量呈现指数增长。从长篇章的文本中生成高质量的摘要,不仅可以加快人们处理信息的速度,也可以节约有限的时间。另外摘要生成技术不同于自然语言处理的其它任务,它需要根据输入文章生成符合语法要求以及事实的简练句子,相比其它自然语言任务更加复杂和困难,因此研究摘要生成技术具有重要的实用意义和技术价值。随着深度学习技术的发展,摘要生成模型也取得了很大的进步。与传统的抽取式摘要方法相比,深度学习技术可以避免人工构建复杂的语法特征,并且可以生成丰富多样的摘要,而不仅仅局限于原文。深度学习框架和计算芯片已日趋成熟,快速训练和部署深度学习模型更加方便简单,这更加有助于摘要生成的学术研究。本文基于深度学习技术的发展轨迹,在哈工大提出的中文摘要数据集LCSTS(Large Scale Chinese Short Text Summarization Dataset)上进行摘要生成研究。研究共分为三个阶段,分别研究了不同阶段的模型可以解决的问题。第一阶段是以循环神经网络GRU(Gate Recurrent Unit)、LSTM(Long-Short Term Memory)为基础的Seq2Seq模型,但是这种循环结构模型是根据序列的顺序生成信息,存在误差累积、长序列依赖差等问题。第二阶段是以self-attention为基础的Transformer模型,这种模型完全不同于循环结构模型,self-attention将每个token之间的距离都变为1,降低了编码阶段的信息误差累积。虽然这种模型结构相对第一阶段的模型有进步,但是想要训练一个好的模型,需要大量的训练语料和高性能GPU,普通的研究者不易实现通用语义信息的获取。第三阶段是以大规模预训练模型BERT(Bidirectional Encoder Representation from Transformers)为基础的UNILM(Unified Language Model Pre-training for Natural Language Understanding and Generation)模型,这种预训练模型一般都是大的研究机构或者公司提供机器的支持,在超大语料上进行预训练使模型获取语言的本质信息,并供其它研究人员在预训练模型的基础上进一步研究,加快了研究进度也将研究成果进一步提升。本文提出一种更加全面的摘要评价方法。传统的自动化摘要评价指标是Rouge方法,但是该种评价方法没有考虑摘要语言质量以及摘要和原文章的语义相似度。如果通过人工评价摘要语言质量和生成摘要是否符合文章中心意思,虽然可以保证准确无误,但是耗时长,成本高。本文设计了语言质量网络与语义相似网络,并提出了将语言质量得分与语义相似得分融合的评价方法。主要创新如下:一是设计了语言质量网络与语义相似网络;二是构建语言质量和语义相似度数据集,利用无监督方式快速生成数据集负样本;三是引入大规模预训练模型BERT,利用迁移学习技术,达到模型快速收敛的效果;四是提出一种摘要质量打分方法,将语言质量得分与语义相似得分进行融合,得出摘要质量得分。研究结果表明,本文设计的语言质量网络与语义相似网络可以有效给出相关评分,提出的评价方式可以对模型进行有效的区分,并使评价结果更加直观。