论文部分内容阅读
信息的急剧增长及电子化,促进了知识传播的共享性及便利性,却也增加了人们获取知识的困难度,致力于从信息中识别获取特定目标信息的信息抽取技术由此得到广泛发展。面向中文的信息抽取却因中文特有的构成特征及多义现象,遭遇了更多的障碍。生物多样性是生物学、生态学等研究的基础,物种是最接近生物的自然单元,可视为生物多样性的基础,其中又因植物物种的海量性而视其为生物物种领域的重要内容。然而海量的植物物种描述信息往往以文本形式存在,无法便利地被识别与应用,更无法以此促进未来植物物种领域的发展。出于信息抽取方案可最大化应用的角度,本研究设计了一套基于领域本体的信息抽取方案,以本体为支撑,采取逐层分析的形式,在对文本结构解析的条件下针对语句依据规则抽取描述文本中的信息,以形成一个完整的信息抽取框架。其中,还针对领域本体的构建,总结了基于顶层本体框架以复用已有本体的构建方式,实现了领域知识的充分利用。在框架实现上,选取了植物物种领域作为实践领域,以促进领域知识发展。在具体操作中将整个过程分解为以下四项任务。(1) 构建领域本体——在顶层本体架构下,通过复用已有本体构建中文植物物种多样性本体,并设计实践了基于顶层本体框架复用已有本体以构建新本体的整体流程;(2) 生成文本集数据——基于DOM树对网页进行结构解析,进行结构性筛选,参照目标样本集计算文本相似度值,实现内容筛选,批量获得待抽取文本集;(3) 形成领域字典及标注集——通过Jena调用相关函数对所构建领域本体进行解析,生成领域词典,在其基础上结合文本特征及抽取需求进一步形成标注集;(4) 标注和抽取——借由分词进行内容标注,依照文本结构逐层进行内容解析,判断语义结构,并最终形成形式化知识再现。研究中以中文植物物种领域为框架实践领域,通过复用本体成功构建了中文植物物种多样性本体,并实现了植物物种描述文本的信息抽取。在四组实验数据中,平均达到了0.89的准确率、0.88的召回率以及0.88的F值,并通过实验比对验证了该方案对于不同物种具备相对稳定的适用性。最终完成并达到了以下几项成果:(1)实现了信息抽取方法的创新;(2)构建了中文植物物种多样性本体;(3)方法综合实践效果高于国内类似研究。