论文部分内容阅读
随着互联网技术的飞速发展,在INTERNET上传输和交换的数据格式越来越多样化,HTML语言本身所具有的弱点,使得其已不能满足WEB越来越广泛的应用,以统一标准,灵活格式的数据标准XML技术就此应运而生。XML的出现是INTERNET发展史上一个重要的里程碑。针对XML文档的检索技术研究也越来越火热。目前的研究主要分为两种,一种使用XQuery语言对XML文档做查询,但是这种查询语言要求用户必须熟悉XML文档的结构,不适合进行大规模的异构的XML检索;另一种研究基于关键词的XML全文检索,并在此基础上加了一定的结构检索,这种检索目前主要研究方向为查询匹配的算法、相关排序的算法和索引文件算法,没有一个通用的XML文档检索的系统,而且,目前的研究都是关键词+基础的结构索引的查询方式,不能支持用户进行复杂的结构限制,除此之外,目前的研究主要针对同一个XML文档进行查询,没有针对异构的XML文档进行查询的系统。在考虑到目前相关研究的不足,针对用户对异构的XML文档进行内容和结构查询的需求,本文在对XML文档的特点、XML的基本理论、XML查询语言以及传统信息检索模型在XML文档检索中的应用等问题进行仔细分析的基础上,提出了一种通用的XML文档检索的总体系统框架、具体算法及其实现。首先,考虑到普通用户对:XML文档的结构检索和内容检索的需求,针对XQuery无法满足普通用户的检索需求以及目前没有一种简单有效的XML文档查询语言,本文提出了一种新的XML文档查询语言,该查询语言语法简单,能同时表达路径和结点内容查询,并且能支持复杂的结构限制和返回节点限制。对于这种查询语言,本文设计了一套底层XML文档索引的机制,以及相应的查询匹配的算法。最终,实现了一个通用的XML文档检索原型系统。该系统具有可用性和一定的可扩展性,相信随着XML文档检索研究的深入进行,针对异构的XML文档的结构和内容检索的技术会越来越先进!