论文部分内容阅读
随着计算机技术的发展,卫星及航拍技术的成熟,地理信息系统(Geographic Information System)被广泛应用于各领域,空间数据类型在计算机数据管理中比重越来越大,如何有效地利用和组织管理这些空间数据以支持空间分析和决策是一项迫切的研究任务。目前数据仓库技术得到广泛应用,其与GIS结合发展成空间数据仓库。空间数据仓库正是解决这一问题的有力工具。空间数据仓库是数据仓库的特殊形式,其在数据结构上具有综合性,可以根据一定的主题内容集成来自不同数据源、不同类型的数据,能利用多维空间分析方法,从不同角度对隐藏在空间和属性数据中的信息进行综合分析比较以达到数据挖掘的目的。对空间数据仓库的研究是当前的热点课题。本文主要对空间数据仓库构建中的如下基础工作进行了初步研究:首先是基于地址编码的空间数据聚合。构建空间数据仓库的第一步是规范数据格式,因为数据质量直接影响系统的有效性。采用地址编码是聚合异构空间数据源的一种方法。由于我国汉字地址具有悠久地历史人文内涵,复杂度远超其他国家,因此,国外的编码标准并不适合中国使用。本文在分析各种地址特征的基础上,综合MIS的语义地址分类和GIS几何空间数据分类概念的长处,提出了新的地址分类、编码方法,采用该方法构建的数据模型能够更有效地实现空间数据的聚合。其次是空间数据泛化。异构、多源空间数据的泛化很大程度上可以转化为数据相似度的距离问题,基于标准地址数据的语义地址泛化相似度计算方法是关键技术,为此本文分析了常用的Levenshtein算法,结合实际应用项目,针对地址数据经常出现的详址匹配而辖区地址不匹配的问题提出了改进的逆向Levenshtein算法;针对同语义地址的同音不同字的Levenshtein编辑距离问题,提出了拼音码改进替换算法,提高了地址匹配准确率。在对上述两个问题进行研究和实验验证的基础上,本文将此成果应用于《上海市实有人口信息系统》空间数据仓库建设中,取得了一定的成效。本文提出的基于地址编码的空间数据聚合方法及泛化的相似度算法对同类问题有一定的指导意义和实用价值。