论文部分内容阅读
数据挖掘是近些年来发展起来的新技术,通过数据挖掘,人们可以发现数据背后隐藏的有价值的、潜在的知识,为科学地进行各种商业决策提供强有力的支持。随着数据挖掘技术的迅速发展,作为其重要的组成部分,网格聚类技术已经被广泛的应用于数据分析、图象处理、市场研究等许多领域。基于网格的聚类算法研究已经成为数据挖掘研究领域中非常活跃的一个研究课题。本文首先介绍了数据挖掘研究的相关背景及其理论知识,对数据挖掘中的聚类分析的相关工作做了一个简要的概述。在研究了传统聚类算法的基础上,提出了基于网格的共享近邻聚类算法(GNN),即将空间数据映射到网格中,在区域查询时只考虑相关网格单元内的数据,提高了处理速度。该算法主要利用网格技术去除数据集中的部分孤立点或噪声,使用密度阈值处理技术来定义网格的密度阈值,使用中心点技术提高聚类效率;针对对象间的相似性度量方法,提出了基于相似度的网格聚类算法(SGCA),将其应用于网格聚类,根据定义的边界点阈值函数提取类的边界点,显著地提高了网格聚类的精度,另外还引进了网格核技术,使得SGCA算法的时间复杂度也有了明显地改善。本文使用Visual C++6.0实现了基于网格的共享近邻聚类算法、基于相似度的网格聚类算法、SNN算法、CLIQUE算法,并做了大量的对比实验,其中包括GNN算法和SGCA算法的正确性和有效性。GNN算法和SGCA算法都具有较好的可扩展性,可以发现任意形状的聚类,受噪声的影响不明显,它们不仅适用于综合数据集,而且对高维数据集也具有较好的聚类结果。实验结果表明,基于网格的共享近邻聚类算法采用网格密度阈值处理可以很好的解决传统网格聚类算法对参数敏感的问题,使用网格中心点技术提高了聚类的效率;基于相似度的网格聚类算法利用网格技术去除了数据集中的部分孤立点或噪声,边界点阈值函数能有效的提取类的边界点,提高了聚类的精度;网格核技术应用于SGCA算法进一步改善了它的时间复杂度。总之,基于网格的共享近邻聚类算法不仅能有效的识别出任意形状的聚类,而且也能有效的识别出孤立点或噪声,对噪声数据和数据输入顺序不敏感,在与传统的共享近邻聚类算法对比中显示出了一定的优越性;基于相似度的网格聚类算法不仅适用于综合数据集,而且对高维数据集也具有较好的聚类结果。