论文部分内容阅读
随着互联网以及信息技术的飞速发展,网络中的信息资源呈指数级增长,人们很难做到不知疲倦地学习,开始期待计算机能够自动从海量信息中学习知识并像人一样进行表达和创作。自动生成具有对比关系的段落文本,不仅可以帮助人们自动获取文本之间对比的重要内容,而且能够节约人们写作的时间与精力,为面向特定写作关系的文本自动生成研究提供了一些思路,也为面向特定写作意图的机器自动写作的研究和应用提供了参考。
本研究着眼于文本自动生成问题,旨在生成待对比文本和其多个相关文本之间具有对比关系的段落文本内容,通过设计对比关系段落文本生成模型,将段落文本生成分为对比关系句子生成和句子组织两个部分,参考当前文本自动生成的相关技术构建Seq2seq序列结构的对比关系句子生成模型,在基于Bert改进的动态文本表示语言模型基础上融入对比特征向量对输入文本进行表示,并利用半监督自学习训练的方式进行增量训练,最后通过设计规则模板的方式对句子进行组织,从而获取对比关系段落文本。具体而言,主要进行了以下工作:
(1)结合具体的生成段落文本示例,总结分析了对比关系文本具有的不同粒度特征,包含词性特征、关键词特征以及数值特征,并对各个特征的获取方式进行了描述。
(2)针对传统文本表示存在的问题,引入了常用的动态文本表示语言模型以及其中涉及到的特征提取器,并进行了对比分析。针对本研究的实际任务,对原生Bert模型进行改进,使之更加轻量化,并使用科技文献数据重新训练以适应本文研究任务,以困惑度作为评价标准,最终实验结果为7.439,并通过与Elmo的对比证明了改进后动态文本表示语言模型的有效性。
(3)构建了以Seq2seq为基础结构的对比关系句子生成模型,编码器和解码器都采用BiLSTM,同时加入Attention机制。优化生成模型的输入层,在融合了词级别和字符级别特征的动态词向量表示基础上,融入词性特征向量、关键词特征向量以及数值特征向量对输入文本进行表示,并针对标注训练数据少的情况,利用半监督自学习的方式进行增量训练,从而生成对比关系句子。在人工标注的查新单及科技论文数据集上对句子生成模型展开实验,采用BLEU作为生成效果评价指标,最后评价得分为15.3,相较于基准模型Transformer和BiLSTM+A ttention,得分分别提高了7.4和8.7。
(4)设计了规则模板对句子进行组织,生成对比关系段落文本,并以科技查新中真实查新结论为例对本文段落文本生成方法进行案例分析,由生成实例的效果证明了本研究所提出段落文本生成方法的有效性。
本研究着眼于文本自动生成问题,旨在生成待对比文本和其多个相关文本之间具有对比关系的段落文本内容,通过设计对比关系段落文本生成模型,将段落文本生成分为对比关系句子生成和句子组织两个部分,参考当前文本自动生成的相关技术构建Seq2seq序列结构的对比关系句子生成模型,在基于Bert改进的动态文本表示语言模型基础上融入对比特征向量对输入文本进行表示,并利用半监督自学习训练的方式进行增量训练,最后通过设计规则模板的方式对句子进行组织,从而获取对比关系段落文本。具体而言,主要进行了以下工作:
(1)结合具体的生成段落文本示例,总结分析了对比关系文本具有的不同粒度特征,包含词性特征、关键词特征以及数值特征,并对各个特征的获取方式进行了描述。
(2)针对传统文本表示存在的问题,引入了常用的动态文本表示语言模型以及其中涉及到的特征提取器,并进行了对比分析。针对本研究的实际任务,对原生Bert模型进行改进,使之更加轻量化,并使用科技文献数据重新训练以适应本文研究任务,以困惑度作为评价标准,最终实验结果为7.439,并通过与Elmo的对比证明了改进后动态文本表示语言模型的有效性。
(3)构建了以Seq2seq为基础结构的对比关系句子生成模型,编码器和解码器都采用BiLSTM,同时加入Attention机制。优化生成模型的输入层,在融合了词级别和字符级别特征的动态词向量表示基础上,融入词性特征向量、关键词特征向量以及数值特征向量对输入文本进行表示,并针对标注训练数据少的情况,利用半监督自学习的方式进行增量训练,从而生成对比关系句子。在人工标注的查新单及科技论文数据集上对句子生成模型展开实验,采用BLEU作为生成效果评价指标,最后评价得分为15.3,相较于基准模型Transformer和BiLSTM+A ttention,得分分别提高了7.4和8.7。
(4)设计了规则模板对句子进行组织,生成对比关系段落文本,并以科技查新中真实查新结论为例对本文段落文本生成方法进行案例分析,由生成实例的效果证明了本研究所提出段落文本生成方法的有效性。