论文部分内容阅读
数据库领域所提到的传统的数据融合(data fusion)是数据集成领域的一个重要问题。它是将来自不同数据源、表示同一实体、具有重复性和互补性的记录进行检测并整合为一条完整的、包含所有可信信息的完整记录。随着社会信息化进程逐步加快,人类社会产生的大量数据,80%以上具有非结构化数据的特征,而文本数据可以认为是非结构化数据中最重要的部分。因此,如何提高文本数据融合结果质量是这里的挑战。将跨数据源、跨资料库的文本数据引入数据融合系统,以完成数据集成的任务,可以理解为两个层次的数据融合。第一是面向查询检索的数据融合,即为用户提供跨格式的整合内容的查询结果,将所有与查询词相关的内容展示给目标用户;第二是面向内容挖掘的数据融合,即利用多源数据信息全面的优势,从文本中抽取相关实体更完整的信息,根据多个来源的数据补充当前信息,预测未来主题趋势等等方面的文本数据挖掘应用。当前关于文本数据融合的研究,例如DATA TAMER等,多集中在第一个方面,而且都是基于关键字直接匹配的方法进行内容检索。还有一部分与跨文本内容集成挖掘相关的研究,如TextFlow等,是针对文档集合主题的趋势分析,对于更细粒度的文本级的分析还有待加强。针对面向查询的数据融合问题,本文提出了实体关联算法SimNet和文本语义匹配的方法textSim,能够在进行查询时针对实体与文本的语义相似度进行计算,并发现内容语义相关的部分,以进行实体关联和文本匹配。本文的主要研究内容如下:(1)系统的介绍了实体关联和文本匹配的国内外研究现状,简述了具有代表性的相关工作,并分析了各种算法的优势和不足。(2)针对实体关联的已有问题,本文提出了基于Skip-Gram模型的三阶段语义相似实体关联及近似网络构建方法。该方法将语义相似单词的发现分为三个阶段。第一步,基于Skip-Gram模型,将构成文本的单词嵌入一个50维的向量空间,得到单词语义的向量表示;第二步,将与目标实体在向量空间中距离较近的点作为候选点集,计算点集中的每个点与目标实体相似的置信概率;第三步,将置信度较高的点作为相似点,以相似点集合为初始条件,迭代地计算所有与目标词相似的点。(3)针对文本匹配的相关工作中的问题,本文提出了基于单词对齐的文本局部相似匹配方法。本方法采用文本图作为文本建模的基本数据结构,通过单词的语义对齐和以对齐词为中心的文本特征扩展,发现可能描述相同内容的文本片段。这部分内容相似的文本片段即是要计算得到的局部相似文本。(4)本文在生物医学领域的文本数据上构建了一个文本融合系统,并实现了语义相似度计算工具。该系统可以帮助使用者在跨资料库的文本数据集中检索出与查询实体具有相同语义的词或描述实体相似的文本,而不是简单的基于关键字的查询结果,以便用户根据多源数据整合的结果,进行更加有效的分析。文本数据融合作为一个新兴的研究领域,为大规模的结构化数据与文本数据整合利用提供了新的研究视角与方法。本文研究了文本数据融合过程中的基础性问题:实体关联与实体描述文本的语义匹配。并通过实验证明了语义相似实体发现与描述文本语义匹配算法的可行性与有效性。与其它的实体关联算法和文本匹配算法进行比较,本文提出的方法可以取得较好的准确度和区分度。