论文部分内容阅读
支持向量机(Support Vector Machine,SVM)是一种建立在结构风险最小化原理基础之上的机器学习算法,能够很好的解决小样本、非线性、高维数和局部极小点等实际问题。支持向量机发展至今在图像处理、生物特征识别、数据挖掘和文本分类等诸多领域取得了广泛的应用。而随着当今信息化社会的迅速发展,非平衡数据的分类问题已经成为了国内外相关研究领域的一个热点,也是模式识别领域的难点之一。与传统的数据分类问题相比,非平衡数据具有明显的数据偏斜性,因此很多常用的机器学习方法在非平衡数据上并不能取得良好的效果。本文的主要内容是研究基于SVM的非平衡数据分类方法。 首先,本文介绍了机器学习和支持向量机的发展概况,非平衡数据的基本定义,以及当前研究中,针对非平衡数据的预处理和特征选取等相关技术。 其次,针对非平衡数据的特点,通过分析标准的软间隔支持向量机(C-SVM)在处理非平衡数据时存在的若干问题,对传统支持向量机模型进行扩展,引入了非平衡支持向量机模型。其基本思想是增加一个惩罚因子,即对数据集中偏斜的两类数据采取不同的惩罚阈值(Different Error Costs,DEC)。通过更多的参数调节使训练后的分类器更加拟合数据自身的特性,从而取得更好的分类效果。 再次,本文对非平衡支持向量机模型的求解方法进行了详细的介绍,同时讨论了如何根据数据集本身的特性选取相关的参数。目前,支持向量机的参数优选并没有一个通用的理论原则,大多依靠交叉验证等实验反复进行选取。本文给出了一种基于数据的平均密度(Average Density,AD)直接设定惩罚参数的实现途径,能够在短时间内获得效果较好的参数。 最后,本文在非平衡支持向量机模型的基础上,结合样例惩罚(Example Dependent Costs,EDC)思想,设计并且实现了一个基于数据分布的样例惩罚支持向量机,可以针对每一个单独的样例,根据其相应的空间分布特性选取惩罚以获得高度敏感的分类面。该系统的分类算法能够有效提高非平衡数据的分类效果,在医疗诊断、基因检测等研究领域具有广泛的应用前景。