基于支持向量机的非平衡数据分类方法研究与实现

来源 :北京工业大学 | 被引量 : 0次 | 上传用户:tanner007
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
支持向量机(Support Vector Machine,SVM)是一种建立在结构风险最小化原理基础之上的机器学习算法,能够很好的解决小样本、非线性、高维数和局部极小点等实际问题。支持向量机发展至今在图像处理、生物特征识别、数据挖掘和文本分类等诸多领域取得了广泛的应用。而随着当今信息化社会的迅速发展,非平衡数据的分类问题已经成为了国内外相关研究领域的一个热点,也是模式识别领域的难点之一。与传统的数据分类问题相比,非平衡数据具有明显的数据偏斜性,因此很多常用的机器学习方法在非平衡数据上并不能取得良好的效果。本文的主要内容是研究基于SVM的非平衡数据分类方法。  首先,本文介绍了机器学习和支持向量机的发展概况,非平衡数据的基本定义,以及当前研究中,针对非平衡数据的预处理和特征选取等相关技术。  其次,针对非平衡数据的特点,通过分析标准的软间隔支持向量机(C-SVM)在处理非平衡数据时存在的若干问题,对传统支持向量机模型进行扩展,引入了非平衡支持向量机模型。其基本思想是增加一个惩罚因子,即对数据集中偏斜的两类数据采取不同的惩罚阈值(Different Error Costs,DEC)。通过更多的参数调节使训练后的分类器更加拟合数据自身的特性,从而取得更好的分类效果。  再次,本文对非平衡支持向量机模型的求解方法进行了详细的介绍,同时讨论了如何根据数据集本身的特性选取相关的参数。目前,支持向量机的参数优选并没有一个通用的理论原则,大多依靠交叉验证等实验反复进行选取。本文给出了一种基于数据的平均密度(Average Density,AD)直接设定惩罚参数的实现途径,能够在短时间内获得效果较好的参数。  最后,本文在非平衡支持向量机模型的基础上,结合样例惩罚(Example Dependent Costs,EDC)思想,设计并且实现了一个基于数据分布的样例惩罚支持向量机,可以针对每一个单独的样例,根据其相应的空间分布特性选取惩罚以获得高度敏感的分类面。该系统的分类算法能够有效提高非平衡数据的分类效果,在医疗诊断、基因检测等研究领域具有广泛的应用前景。
其他文献
近年来,随着互联网的飞速发展,互联网广告作为互联网公司的主要盈利模式也得到了工业界和学术界的广泛关注。与传统广告不同的是,互联网广告可以利用数据挖掘,信息检索和机器学习
“脑-机接口”系统(Brain-Computer Interface,BCI)是一种全新的人机接口方式,它直接从大脑获取与外界通讯的信息,并将人类的思维状态与计算机处理系统建立关联。能够反应大脑思
可信计算技术通过从体系架构上建立攻击免疫机制,实现计算平台安全、可信赖运行。可信计算技术目前已经得到了普遍应用。随着可信计算技术的发展,其应用已经扩展到了新的平台与
虚拟现实是由计算机图形学、人机交互技术、传感器技术、计算机仿真、人工智能、计算机网络等多个学科交叉综合产生的学科。目前,在虚拟现实与人机交互领域亟需解决的问题之一
随着计算机技术的不断推广和深入,计算机中涉密数据的安全越来越得到人们的关注。如何有效的保存、读取和传输这些数据已成为科研单位、企业、军事单位等面临的关键问题。传统
随着信息技术和计算机网络的飞速发展,现实世界越来越依赖于计算机系统。防止病毒对计算机系统的破坏、黑客对机密信息的窃取,加强计算机系统的安全性,更好的保护计算机内部的数
随着多媒体技术的快速发展,视频运动对象分割技术的应用越来越广泛。它在MPEG-4基于内容的视频编码、视频临控、场景分析、对象跟踪、基于内容的检索以及交互式操作等领域中都
随着Web2.0的发展及个人电子设备的普及,网络上的信息量非常的巨大,并且时时刻刻都在以惊人的速度增加着。互联网的每个用户是信息的消费者的同时也有可能成为信息的产生者。无
随着半导体工艺的迅速发展,晶体管的数量及处理器芯片的制程工艺不断提高,使处理器的集成度越来越高。然而,片上集成元件数量的增加使得处理器芯片的功耗密度急剧增长。目前,多核
视觉注意机制使人类能够高效的处理外界环境信息,进行目标检测。计算机视觉系统也面临同样的问题:如何实时有效的处理大量的视觉数据,如何智能化的根据场景的需求来有效的处理其