论文部分内容阅读
随着数据收集工具和互联网的迅速发展,传统聚类算法存在着单位时间内处理大数据时间长难以达到预期效果的缺陷,同时传统的聚类方法已经不能满足需求;云计算平台应运而生,它是由并行计算发展而来;基于云计算的大型应用具有分布性、异构性、大数据等特征,适合大数据的分析与处理。目前对于传统聚类算法改进的研究主要用包括数据场、网格、增量、并行和MapReduce等方法;其中研究最多的是基于MapReduce模型来提高聚类算法的效率。由于随着数据量的增长,利用云计算处理大数据进行聚类已成为热点。就目前关于云平台的聚类方法研究方向来看,主要包括:如何把传统的聚类方法实现并行化,或者基于云平台实现聚类算法的分布式架构;其中,基于云平台的研究主要考虑到的因素有算法复杂性、加速比和可扩展性等。本文在基于划分、层次与密度聚类算法的基础上,基于Hadoop开源云计算平台分别设计与实现了三种改进的聚类算法;(1)针对于大数据的海量与高维特性,提出了一种在云计算平台上基于MapReduce框架的距离三角不等式Canopy-K-Means并行聚类算法;该算法利用三角不等式的原理减少了计算冗余,提高了原算法的执行速度;实验结果表明:该算法减少了I/O以及网络传输的消耗,克服了算法陷入局部最优解的缺点,并使之能够充分的利用集群的计算和存储能力对大数据进行聚类分析。(2)针对于海量数据分布不均匀的聚类问题,本文基于MapReduce框架,提出了一种基于云计算平台的均值偏移CURE(MS-CURE)聚类算法。该算法利用代表点聚类算法的实现原理,并在海量数据进行预处理时,融合了均值偏移(Mean shift)思想,实现了层次聚类算的健壮性;实验结果表明:该算法实现了层次聚类的有效性与时效性的平衡,并且聚类效果较好。(3)针对于传统密度聚类算法对参数敏感,处理大数据的算法时间复杂度高,多处理静态数据等问题,提出了一种利用参考点和MapReduce模型进行并行计算的动态增量密度算法。其创新点在于,实现了一种基于云计算的动态聚类;实验结果表明:该算法降低了参数敏感性,提高密度算法的聚类效率和资源利用率,适合大数据进行聚类分析。