【摘 要】
:
随着大数据时代的来临,人们面临着怎样从大量的数据中得到他们想要的有价值的知识的问题。在这一需求之下数据挖掘随之诞生,并迅速成为了一个热门的研究课题。数据分类作为数据挖掘中重要的一节,通过采用高效的分类算法分析数据找出其中存在的联系,从而尽可能准确的预测待测样本的类别。其中支持向量机SVM算法因其在实际应用中能够有效解决数据分类过程中遇到的非线性、高维度、过学习等问题而具有较明显的优势,成为目前比较
论文部分内容阅读
随着大数据时代的来临,人们面临着怎样从大量的数据中得到他们想要的有价值的知识的问题。在这一需求之下数据挖掘随之诞生,并迅速成为了一个热门的研究课题。数据分类作为数据挖掘中重要的一节,通过采用高效的分类算法分析数据找出其中存在的联系,从而尽可能准确的预测待测样本的类别。其中支持向量机SVM算法因其在实际应用中能够有效解决数据分类过程中遇到的非线性、高维度、过学习等问题而具有较明显的优势,成为目前比较流行的数据分类算法。但是传统SVM算法在学习阶段计算量与样本数量成正比,因此在处理海量数据时,计算量巨大,在学习阶段耗费过多的时间;学习样本中存在的噪声数据影响分类超平面的正确划分,从而降低该算法的分类精度。而且在测试阶段,分类超平面附近易发生错分。本文针对SVM分类方法中存在的不足给出了改进的方案。首先对原始学习数据集根据密度做裁剪预处理,把处理后的数据集作为新的学习数据集,在新的学习数据集上进行SVM参数寻优操作,通过学习获得最佳分类决策函数。然后在测试阶段,将待测样本带入决策函数中,若函数值大于设定的阈值,则以SVM预测的类别作为待测样本的类别,反之使用AdaBoost.M1-KNN算法重新预测。由于在预处理阶段有效地裁剪掉大量的多余的学习样本,包括大部分的噪声样本也被裁剪掉,因此有效地降低了学习阶段的计算量,使分类超平面的划分更准确,从而提高了SVM的分类准确率。对于出现在SVM分类超平面附近的待测样本不能被正确分类的情况,引入AdaBoost.M1-KNN分类算法,使得分类准确率进一步提高。将该算法应用到10组UCI数据集上,实验结果表明:本文提出的基于密度裁剪的SVM与AdaBoost.M1-KNN结合的分类算法同传统SVM分类算法相比有效地提高了分类准确率,且降低了SVM的学习时间,因此该方案是可行有效的。
其他文献
1 对象和方法1.1 对象①组Ⅰ: 2002年5月到2004年7月本院血液科初诊38例或在初诊38例中住院治疗后完全缓解的25例急性髓系白血病(AML)患者.
粒子群算法具有计算简单,收敛速度快和良好的全局与局部收敛能力等特点.通过对珩磨加工工艺参数的分析,构建了基于粒子群算法的珩磨加工参数智能选择模型,在理论模型的基础上
从中等地震震源机制解,地震活动的空间分布和时间分布等方面研究了甘肃九甸峡水库库区及邻近地区的地壳应力场和地震活动特征.其结果为估计九甸峡水库蓄水后发生诱发地震的可能
通过对南通地区地面沉降发展历史的总结, 分析了南通地区区域地面沉降的特征和形成机理, 指出地面沉降的发生主要与不合理过量开采地下水引起的水位下降有关, 南通地区地下水
2018年是“一带一路”倡议提出五周年。五年来的进展與经验表明,“一带一路”不可能是一帆风顺的,也不可能一朝一夕就能建成。未来“一带一路”建设面临的困难与挑战,将极大考验中国对外战略的定力与耐力。这就像是一场新时代下中国与世界互动合作的马拉松,怎么把握跑的节奏感,如何应对沿路的各种内外困扰,首先取决于我们对这场超长距离跑的预期。由此,笔者尝试分析“一带一路”五年来中央决策设计与中外合作演化进程,结
坦桑尼亚是丝绸之路经济带上的重要沿线国家。根据皮尤研究中心发布的中国在多国的影响力报告,坦桑尼亚以77%的正面积极态度与孟加拉国并列第二,仅次于巴基斯坦的78%。①在此
一、当前城市房屋拆迁存在的主要问题1.补偿标准不统一补偿标准的不统一主要包括两种情况:一是相邻基地不同区县之间补偿标准不统一。各个区县在拆迁补偿政策上各自为政,而由于
运用动物模型DFREML,估测美系杜洛克猪的生长和繁殖性状的遗传力和育种值,结果表明,生长肥育性状日增重、饲料转化率、体重达100 kg时日龄和体重100 kg时背膘厚的遗传力估计
自工业革命以来,人类活动逐渐影响了自然环境。特别是从上个世纪的五千年开始,由于人们对环境资源使用的不节制,加上没有注重保护自然环境,这样的处理方式会使我们人类的生存环境受到很大的危害。现在,为了能够长期健康的发展,世界各国纷纷在采取行动,尽力实现经济持续发展和人类生存能够共存的目标。在中国,政府也在关注环境问题,并提出了很多有效的政策,希望通过这些政策来提高人们生活的质量,能够保证人们的身体健康。