论文部分内容阅读
自然语言是人类空间认知结果的最重要表现形式。实现自然语言中地理空间信息的挖掘,不仅能够丰富地理信息系统(GIS)的信息来源,而且能够提升GIS的表达能力和可理解性。作为一种最常用的自然语言载体,文本中蕴含着丰富的地理空间信息。从文本中获取未分析的、非显式的空间知识已成为当前地理信息科学迫切需要解决的问题。地理命名实体识别是从文本智能化获取地理空间信息的基础。本文在综述国内外相关研究进展的基础上,重点探讨了基于机器学习的地理命名实体识别方法。主要内容包括以下几个方面:
(1)地理命名实体标注语料库的构建方法。针对目前国内外相关实验数据匮乏的情况,借鉴自然语言处理技术中命名实体标注方法,制定了中文文本中地理命名实体的标注规范,开发了相应的标注系统,并以“《中国大百科全书》(地理分册)”(约150 万字)为例进行了标注实验。统计分析表明,该语料库中地理命名实体的分布较为均匀,适宜于地理命名实体识别技术的研究。
(2)基于条件随机场的地理命名实体识别方法(简称“CRF-GNER”)。条件随机场(CRF)是一种用于在给定了指定的输入结点值时计算指定输出结点值的概率的无向图模型,具有表达长距离依赖性和交叠性特征的能力,成功应用于生物医学、计算机语言学和语音识别等领域。地理命名实体具有上下文依赖性、嵌套性等特点,而CRF模型在解决这些问题方面具有较好的性能。本文在分析中文文本中地理命名实体语言特点的基础上,通过制定标注粒度策略,建立了基本特征函数集,设计了相应的特征模板,讨论了模型训练和测试的具体过程。
(3)原型系统开发和实验验证分析。在上述研究基础上,开发了面向中文文本的地理命名实体识别原型系统,主要功能包括语料管理、语言模型、地理命名实体识别和模型评测。此外,为了验证相关模型和算法的应用效果,开发了网页地理命名实体识别系统。最后,以“《中国大百科全书》(地理分册)”为实验数据,对本文提出的“CRF-GNER”模型和算法进行了实验。实验结果表明,合适的复合特征能够提高识别性能,但手工设计复合特征过于繁琐,有必要采用特征归纳方法自动生成优化的组合特征。使用ICTCLAS 标注的词性特征有助于改善识别效果。是否有必要加入词典特征以及如何选取更有效的原子特征加入模型是需要进一步探索的问题。