论文部分内容阅读
多核学习算法能够有效地解决单核学习不能很好处理的数据固有特征异构、属性分布不规则,样本分布不平坦等问题;另外由于其灵活性好,能够较好地诠释数据固有特性而受到越来越多的关注。然而,多核学习算法存在时间和空间复杂度较高等缺陷,同时由于目前存在的多核学习算法并没有对每个候选核矩阵在构造最优融合矩阵中的贡献进行评估和衡量,而是选用所有的候选核矩阵参与最优融合矩阵的构造过程,这种构造方法会在一定程度上增大算法的冗余度和计算成本,也会在一定程度上影响所设计分类器的合理性。针对这些问题,本文从多核学习效率问题出发,提出了几个基于计算约简与代价敏感的多核分类器设计算法,并且通过实验验证这些算法的有效性。本文的主要工作如下:(1)根据多核学习算法的框架模型,采用不同的核方法将原始空间中的样本信息映射到各异的高维空间内,在每个高维空间中采用Nystrom近似矩阵算法优化原始核矩阵,根据每个近似候选核矩阵与原始矩阵之间的近似误差确定每个近似候选核矩阵在多核学习框架模型中的组合系数;然后将这些近似候选核矩阵按照凸组合的方式进行融合,得到最优的融合矩阵;最后,将得到的融合矩阵引入KMHKS算法中构造时间复杂度和空间复杂度都较低的且分类性能较好的新的多核学习分类器,继而提出了NMKMHKS算法。为了验证该算法的有效性和可行性,设计了在人工数据集合和UCI数据集合上的实验验证了该方法的效率。(2)对所提出的多核学习算法中的每个近似候选核矩阵在构造最优融合矩阵中的贡献进行评估和衡量,在算法NMKMHKS中引入代价敏感的思想,通过设定不同的阈值,在不影响分类器性能的前提下剔除那些在构造融合矩阵时贡献不大的近似候选核矩阵,从而在降低了多核学习算法的复杂程度,并由此提出了CMVLM算法。通过在UCI数据集合、图像数据集和生物数据集合上的大量对比实验,验证了该想法的有效性和合理性。(3)对原始的单源模式在向高维空间映射过程中没有采用传统的隐性核映射方法,而是直接采用经验核映射的方法进行处理,从而在基于代价敏感思想在隐性核学习中的实验验证,实现将代价敏感的思想引入经验核学习过程中,提出了代价敏感的经验核学习算法CRMEK-MHKS,并且根据实验结果验证了该方法的有效性。本文提出的这些算法提高了多核学习算法的效率,降低了时间和空间的开销。同时,通过引入代价的思想来衡量不同的候选核矩阵在构造分类器中的贡献,也在保证和提高分类性能的前提下进一步优化了所设计的分类器算法。