论文部分内容阅读
科学技术的发展,尤其是智能移动互联和物联网相关技术的普及,影响了数据的维度、大小、种类以及产生方式,增加了数据的复杂度,从而使数据的标注愈加困难。所以,如何在类标未知的样本中解决模式识别的相关问题成了无监督学习应用的背景。在无监督学习中,聚类和异常检测是两类广泛使用的方法。
早在《战国策.齐策三》中,我们的先人就提出了“物以类聚,人以群分”的思想。近年来,密度代表点这一概念被广泛应用于聚类分析领域。其中,密度代表点和聚类算法相结合的方法在图像处理和模式识别领域取得了很好的结果。但是在处理任意形状、高维、多密度层次或含有噪声的复杂数据时,单一代表点的方式不能有效刻画和反应簇的各种信息,从而对聚类的结果产生负面的影响。由于密度核心能够有效地代表和描述其所在簇的属性,本文在聚类分析中引入了密度核心的概念,从而解决了基于单个代表点的现有聚类方法不能应用于包含复杂形状和多密度层次数据集的问题。
聚类分通常用于寻找一般模式,而异常检测通常用于识别数据中有效和有潜在价值的特殊模式。由于简单、快速和有效, 基于距离和密度的异常检测方法近年来被广泛应用。然而,对参数敏感的缺陷常常导致这类方法的检测性能不稳定。因此,受万有引力的启发,本文提出了局部合力变化率模型,并将其引入到离群点和边界点的检测中。基于局部合力变化率的检测方法能够有效地检测到离群点和边界点,同时对输入参数不敏感。
本文对密度核心和局部合力在聚类分析和异常检测的应用进行了研究,主要贡献和创新如下所示:
(1)本文提出了一种基于密度核心和动态扫描半径的聚类方法DCNaN(Density Core-based Clustering Algorithm with Dynamic Scanning Radius)。DCNaN结合自然邻居概念,在不需要手动输入参数的情况下,通过使用动态扫描半径r对传统密度核心的获取方法进行了改进。使用基于动态扫描半径 r 和均值漂移(Mean-Shift)方法获取密度核心的过程能够自动适应多密度层次的数据集,解决了现有聚类方法无法应对含有复杂形状簇和多密度层次数据集的问题。
(2)本文提出了一种基于密度核心和相对密度的聚类方法RDcore(A Relative Density-core-based Clustering Algorithm with Natural Neighbor)。RDcore通过引入自然邻居的方式自动获取k值,提出了基于自然邻居的相对密度获取方法NaNRNKD (Relative K-nearest Neighbor Kernel Density Measure Based on the Natural Neighbor)。NaNRNKD 可以快速准确地获取属于密度核心的数据点,解决了使用均值漂移获取密度核心时间复杂度过高的问题。
(3)本文提出了一种基于密度核心的聚类内部评价指标DCVI(A New Internal Index Based on the Density Core for Clustering Validation)。DCVI通过引入密度核心,将所有数据的内部评价指标转换为密度核心的内部评价指标。根据簇内的紧致度和簇间的分离度,本文提出了聚类的内部评价指标,从而有效地避免噪声,复杂形状和重叠对评价指标的影响。结合最小生成树(MST)聚类方法,本文提出了DCVI-MST 聚类方法,可以准确快速地评估出聚类簇的个数以及给出有效的聚类结果。同时 DCVI 可以有效地应用于基 K-means ,密度或层次划分的聚类中,寻找最优的聚类个数。
(4)本文提出了一种基于局部合力变化率的异常点检测方法LGOD(a Novel Local-gravitation-based Outlier Detection Method)。LGOD利用局部合力变化率获取离群点、边界点和内部点变化率的排序,通过使用层次划分方法寻找到离群点,用于消除传统异常检测方法对参数敏感,且需要人为选择的缺陷。
(5)本论文提出了一种基于局合力变化率的边界点检测方法LGBD(a Novel Local-gravitation-based Boundary Point Detection Method)。LGBD利用局部合力变化率,通过选择比例参数,可以较准确地获取处于数据集中的边界点。相比于其它方法,LGBD能够更好地反应数据的分布特点。
通过人工数据集和真实数据集的实验对比,本文提出的相关理论和方法要明显优于现有的相关方法和理论。通过对聚类和异常检测领域的基础理论和相关算法进行分析研究,希望在丰富现有无监督学习方法的同时,能够对聚类分析和异常检测领域存在的难题和应用瓶颈提供解决思路。
早在《战国策.齐策三》中,我们的先人就提出了“物以类聚,人以群分”的思想。近年来,密度代表点这一概念被广泛应用于聚类分析领域。其中,密度代表点和聚类算法相结合的方法在图像处理和模式识别领域取得了很好的结果。但是在处理任意形状、高维、多密度层次或含有噪声的复杂数据时,单一代表点的方式不能有效刻画和反应簇的各种信息,从而对聚类的结果产生负面的影响。由于密度核心能够有效地代表和描述其所在簇的属性,本文在聚类分析中引入了密度核心的概念,从而解决了基于单个代表点的现有聚类方法不能应用于包含复杂形状和多密度层次数据集的问题。
聚类分通常用于寻找一般模式,而异常检测通常用于识别数据中有效和有潜在价值的特殊模式。由于简单、快速和有效, 基于距离和密度的异常检测方法近年来被广泛应用。然而,对参数敏感的缺陷常常导致这类方法的检测性能不稳定。因此,受万有引力的启发,本文提出了局部合力变化率模型,并将其引入到离群点和边界点的检测中。基于局部合力变化率的检测方法能够有效地检测到离群点和边界点,同时对输入参数不敏感。
本文对密度核心和局部合力在聚类分析和异常检测的应用进行了研究,主要贡献和创新如下所示:
(1)本文提出了一种基于密度核心和动态扫描半径的聚类方法DCNaN(Density Core-based Clustering Algorithm with Dynamic Scanning Radius)。DCNaN结合自然邻居概念,在不需要手动输入参数的情况下,通过使用动态扫描半径r对传统密度核心的获取方法进行了改进。使用基于动态扫描半径 r 和均值漂移(Mean-Shift)方法获取密度核心的过程能够自动适应多密度层次的数据集,解决了现有聚类方法无法应对含有复杂形状簇和多密度层次数据集的问题。
(2)本文提出了一种基于密度核心和相对密度的聚类方法RDcore(A Relative Density-core-based Clustering Algorithm with Natural Neighbor)。RDcore通过引入自然邻居的方式自动获取k值,提出了基于自然邻居的相对密度获取方法NaNRNKD (Relative K-nearest Neighbor Kernel Density Measure Based on the Natural Neighbor)。NaNRNKD 可以快速准确地获取属于密度核心的数据点,解决了使用均值漂移获取密度核心时间复杂度过高的问题。
(3)本文提出了一种基于密度核心的聚类内部评价指标DCVI(A New Internal Index Based on the Density Core for Clustering Validation)。DCVI通过引入密度核心,将所有数据的内部评价指标转换为密度核心的内部评价指标。根据簇内的紧致度和簇间的分离度,本文提出了聚类的内部评价指标,从而有效地避免噪声,复杂形状和重叠对评价指标的影响。结合最小生成树(MST)聚类方法,本文提出了DCVI-MST 聚类方法,可以准确快速地评估出聚类簇的个数以及给出有效的聚类结果。同时 DCVI 可以有效地应用于基 K-means ,密度或层次划分的聚类中,寻找最优的聚类个数。
(4)本文提出了一种基于局部合力变化率的异常点检测方法LGOD(a Novel Local-gravitation-based Outlier Detection Method)。LGOD利用局部合力变化率获取离群点、边界点和内部点变化率的排序,通过使用层次划分方法寻找到离群点,用于消除传统异常检测方法对参数敏感,且需要人为选择的缺陷。
(5)本论文提出了一种基于局合力变化率的边界点检测方法LGBD(a Novel Local-gravitation-based Boundary Point Detection Method)。LGBD利用局部合力变化率,通过选择比例参数,可以较准确地获取处于数据集中的边界点。相比于其它方法,LGBD能够更好地反应数据的分布特点。
通过人工数据集和真实数据集的实验对比,本文提出的相关理论和方法要明显优于现有的相关方法和理论。通过对聚类和异常检测领域的基础理论和相关算法进行分析研究,希望在丰富现有无监督学习方法的同时,能够对聚类分析和异常检测领域存在的难题和应用瓶颈提供解决思路。