论文部分内容阅读
随着计算机应用的广泛普及以及互联网技术的飞速发展,人们可共享和利用的信息资源越来越丰富,目前面临的关键问题是如何帮助用户从这些丰富的信息资源中获取所需要的有用信息。自动问答是一种使得人们能够更加快速、准确地获取信息的新的手段。目前的问答系统大多是基于开放领域进行研究,效率和效果都不尽如人意,它只是单纯的对字符序列进行检索匹配,经常不能返回准确的答案,其根本原因在于它的技术仅仅停留在文字表面,没有对信息资源进行一定程度的语义理解。从特定领域的语义检索入手,是一条解决基于语义信息检索问题的有效途径,由于领域的特殊性和限定性,使自然语言本文中的歧义现象大大减少,简化了自然语言处理的难度,此外,丰富、确定的领域知识也为信息抽取带来了许多便利,因而本文选择基于特定领域进行自由文本语义检索的研究工作。
本文结合特定领域内用户提问的特点和自动问答的现状进行考察,通过对特定领域知识的分析,提出了采用实例匹配的检索新思路。采用这种检索方式不仅能够对用户的描述进行深一步的理解,同时还可以根据不同用户关心的主题来调整匹配的侧重点。整个研究工作的基础是领域本体,领域本体不但可以为实例抽取的工作提供领域概念间的关系和取值约束,而且可以为实例的匹配工作提供概念相关度的衡量。
本文的主要工作概括为以下三个方面:
(1)自由文本、完全结构化文本以及半结构化文本是目前信息表达的三种主要方式,实例抽取和匹配的共同基础是要确定一个统一的实例表示模型。针对领域中广泛存在的层次式的信息结构以及实例抽取过程中的灵活性,本文提出了一个层次化的基于XML的实例表示模型。
(2)实例抽取工作是两个实例进行匹配的前提。本文提出了一个基于领域本体的实例抽取算法。针对领域自由文本的实例抽取分为预处理和实例抽取两个阶段。预处理的任务是对自由文本进行分词标注,并按照一定的主题进行筛选,分门别类地将句子分到不同的主题句子集合中:在实例抽取阶段,本文采用本体结合特定句式的匹配规则,提出了“接力式”的实例抽取方式。抽取得到的实例按照实例表示模型的形式保存到实例库中。
(3)在经过了实例抽取以后,两段自由文本的匹配就可以转变成两个实例树的相似度计算。本文首先确定实例树中概念的权值体系,提出了自顶向下递归计算两个实例树相似度的策略。通过对实例树的形状比较以及比较两棵实例树上相对应节点的属性值这两方面,分别从树间距离、本体的概念相关度和属性相似度的角度,提出了对两棵实例树进行相似度计算的方法。此外,本文给出了一个基于统计的实例相似度预测算法,在一定程度上解决了基于本体推理无法推出的缺失属性值的相似度计算问题,这样就能够对属性值缺失的情况进行属性值相似度计算。