论文部分内容阅读
随着医疗行业信息化水平的不断提高,传统的、功能相对独立的各类信息系统应用已经无法满足以病人为中心的医疗服务模式发展的需要,以电子病历为核心的医院信息化建设正在逐步推进。然而,由传统信息系统运行产生的病历文本大量存在,如何有效地共享和利用这些病历文本,使其为临床医疗决策、更大规模的数据共享服务成为当前亟待解决的问题。作为一门研究人与计算机之间如何用自然语言进行有效通信的科学,自然语言处理在文本信息和结构化信息间架起了一座桥梁,而信息抽取技术作为自然语言处理领域的一个重要分支,它提供了更为有力的信息获取工具。以此为依托,本文提出了用于实现中文病历文本结构化的架构,本架构应用了一系列基于自然语言处理和信息抽取的方法和技术,面向中文病历文本领域展开了对于文本信息结构化的研究。 本文着眼于对已成文的病历文本的结构化转储,该过程主要分为三个步骤:首先,初步构建了病历术语库,并完成了对病历文本基于该术语库的词性标注及术语提取。这部分主要使用逆向最大匹配(BMM)方法抽取病历术语,同时通过分词工具对病历文本分词处理,最后将两者的结果进行合并,得到术语和词性均被标注的病历文本;然后,创建了面向病历各个侧面的产生式规则库,基于此规则库,对完成了术语和词性标注后的病历文本进行句法分析,并通过正则表达式的模式匹配进一步筛选信息抽取的结果;最后,将抽取到的关键信息点以XML文件的格式进行转储。 文中通过对病历中既往史部分的结构化实践,检验了本文所提出的中文病历文本结构化架构的实用性和有效性。本文提出的结构化架构具有针对性强、自动化程度高等特点,是对中文病历文本结构化研究方面做出的有益探索,这将对基于病历文本的临床医疗决策、大规模数据的共享和标准化工作产生积极的意义。