论文部分内容阅读
XML(eXtensible Markup Language)已逐渐成为互联网信息的主要表示和交换标准。为了有效地分析和处理XML数据,研究者们已经提出了各种XML数据处理技术,其中XML的存储、索引、查询等受到了广泛的关注。在XML的存储技术方面,原生XML数据库由于可按原结构不经任何转换就可存储XML数据,从而实现高效存储和无数据损失,并且可以通过精心设计,实现比在关系数据库或文件系统存储的文档更快的查询处理等,因此原生XML数掘库在管理XML数据方面有其独特的优势。
路径表达式查询(如XPath)是XML上查询语言的重要组成部分,除此之外,XML上关键词查询技术由于查询方式简单,用户无需了解数掘内在格式,是近来研究的热点。另外,XML数据上基于结构相似度的查询由于有其实际的应用场景,也是一个重要的研究课题。因此,在原生XML数据库中实现上述多种查询方式,具有较大的实际意义。
本文对XML数据的存储和检索技术进行了研究,主要贡献和创新之处在于:
1)XML数据存储技术的研究,设计实现了一个XML数据存储的原型系统Sheepdog,提供了有效的数据存储,支持多种索引技术,能够有效地处理XPath查询。
2)提出了一种更为快速的XML数据上关键词检索的技术,该技术在求解树结点的共同祖先问题时采用范围最小值查询算法。此技术应用在上述XML数据存储系统 Sheepdog中,并和现有的关健词查询技术XKScarch 做了比较,证明了其优越性。
3)研究了XML 上的结构相似度检索,提出了一种快速的算法进行相似XML文档的查找,也实现在上述XML存储系统Sheepdog 中。
本文研究XML数据的存储、检索技术,更详细的说,是对XML数据的原生存储方式和对XML数据上的关键词检索技术和结构相似度检索进行了深入的探讨和研究,提出了有效的算法和新的技术,并且实现了原型系统,通过实验证明了本文所提出方法的有效性。研究成果将可直接用于XML数据库的项目开发和产品研制中,具有重要的理论和现实意义。