论文部分内容阅读
随着计算机技术的飞速发展,如今我们生活在一个信息大爆炸的时代,怎样快速、准确、高效地从大量的互联网信息中搜索出我们所需要的文本成为了我们所要解决的难题。命名实体识别作为自然语言处理的一个重要研究领域,在学术界受到重视和关注,最近几年也涌现了大量有关命名实体识别的算法。因此,无论是从理论或是实用的角度看,命名实体识别研究都有重要的意义和价值。但目前的研究主要集中在英文语料和中文现代文语料上,由于古文自身的特点,基于古籍语料进行命名实体识别的研究尚未全面展开。随着古籍数字化进程的不断加快,如果能从中抽取出我们所需要的实体信息,将对古文学研究和自然语言处理领域产生巨大的作用。
本文语料选自经典古籍《汉书》,通过挖掘《汉书》具有的特点,利用当前在序列任务中表现最为优异的Transformer结构以及RoBERTa预训练模型技术,对《汉书》中的人名、地名、书名、时间表达以及朝代进行自动识别。性能相比于已有的命名实体识别模型有了极大的提升。最后,本文将模型在《汉书》语料中识别出的人名、地名、书名、时间表达这四类实体分别整理完毕,方便学界查阅。全文包括五章:
第1章为引言,从计算机技术发展、古籍命名实体识别的必要性及其价值意义三方面说明选题原因,对相关理论背景和国内外相关研究现状做了评述,并阐述了本文研究的目的和意义,介绍了主要研究方法。第2章着重说明对古籍语料《汉书》进行的处理,主要包括《汉书》语料获取、加工和处理的过程和方法,并对实体类别选择的原因和标注情况做了说明。第3章为本文研究重点,在对基于规则和词典的方法、基于统计的方法和基于深度学习的方法这三种已有的经典命名实体识别模型进行全面评析的基础上,评估了词向量与字向量在古籍《汉书》上的性能表现;结合当前在机器翻译、文本分类等任务中表现优良的Transformer结构和开源的RoBERTa预训练模型,对目前处理命名实体识别任务最为流行的BiLSTM+CRF结构进行了优化处理。第4章为模型的展示和测试,对经典的命名实体识别模型以及改进后的模型进行代码实现,同时在标注的《汉书》数据集上进行了性能测试。通过对比CRF、BiLSTM+CRF、Transformer和预训练的RoBERTa模型,经测试发现表现最好的是在预训练的RoBERTa上进行精调的模型,其识别准确率达到了93.40%,比基于词向量的BiLSTM-CRF模型精确度提高了12.75%,F1值提高了12.41%。第5章对本文的研究工作进行了总结,并对后续的工作进行了展望。
对古籍《汉书》进行命名实体识别,可以较大地发挥出其自身的价值,识别出的各类实体为更好地进行本体研究提供了便利,并且在一定意义上填补了目前基于古籍语料进行命名实体识别的缺失。此外,本文搭建的算法模型对基于古籍语料进行的命名实体识别研究有较大的应用价值和借鉴意义,也将对计算语言学和自然语言处理产生一定的作用。
本文语料选自经典古籍《汉书》,通过挖掘《汉书》具有的特点,利用当前在序列任务中表现最为优异的Transformer结构以及RoBERTa预训练模型技术,对《汉书》中的人名、地名、书名、时间表达以及朝代进行自动识别。性能相比于已有的命名实体识别模型有了极大的提升。最后,本文将模型在《汉书》语料中识别出的人名、地名、书名、时间表达这四类实体分别整理完毕,方便学界查阅。全文包括五章:
第1章为引言,从计算机技术发展、古籍命名实体识别的必要性及其价值意义三方面说明选题原因,对相关理论背景和国内外相关研究现状做了评述,并阐述了本文研究的目的和意义,介绍了主要研究方法。第2章着重说明对古籍语料《汉书》进行的处理,主要包括《汉书》语料获取、加工和处理的过程和方法,并对实体类别选择的原因和标注情况做了说明。第3章为本文研究重点,在对基于规则和词典的方法、基于统计的方法和基于深度学习的方法这三种已有的经典命名实体识别模型进行全面评析的基础上,评估了词向量与字向量在古籍《汉书》上的性能表现;结合当前在机器翻译、文本分类等任务中表现优良的Transformer结构和开源的RoBERTa预训练模型,对目前处理命名实体识别任务最为流行的BiLSTM+CRF结构进行了优化处理。第4章为模型的展示和测试,对经典的命名实体识别模型以及改进后的模型进行代码实现,同时在标注的《汉书》数据集上进行了性能测试。通过对比CRF、BiLSTM+CRF、Transformer和预训练的RoBERTa模型,经测试发现表现最好的是在预训练的RoBERTa上进行精调的模型,其识别准确率达到了93.40%,比基于词向量的BiLSTM-CRF模型精确度提高了12.75%,F1值提高了12.41%。第5章对本文的研究工作进行了总结,并对后续的工作进行了展望。
对古籍《汉书》进行命名实体识别,可以较大地发挥出其自身的价值,识别出的各类实体为更好地进行本体研究提供了便利,并且在一定意义上填补了目前基于古籍语料进行命名实体识别的缺失。此外,本文搭建的算法模型对基于古籍语料进行的命名实体识别研究有较大的应用价值和借鉴意义,也将对计算语言学和自然语言处理产生一定的作用。