论文部分内容阅读
多示例学习由于非常适合高性噪比和数据缺失严重环境下的概念学习,近来受到了广泛地应用,日益成为研究热点之一,在理论和应用方面都有了很多进展。本文主要研究了基于非平行支持向量机的多示例分类方法。针对多示例学习的特征,文中提出了两种新的有效求解多示例问题的最优化分类算法,根据各算法的特点分别作了探讨,并给出了相应的求解方法和数值实验结果。同时,针对多示例分类问题中普遍存在的大规模数据求解速度慢的问题,做了深入研究,提出了快速求解大规模数据的非平行支持向量机模型,并给出了相应的求解算法和在多个数据集上的分类性能和时间性能的具体数值实验结果。本文的主要研究工作和成果为: (1)提出了基于非平行支持向量机的多示例分类模型MI-NPSVM。 非平行支持向量机相对于标准支持向量机已在很多方面证实了其优越性,因此我们将非平行支持向量机应用到多示例分类中。线性MI-NPSVM模型通过求解两个标准SVM形态的最优化问题来创建两个非平行的超平面实现分类的目的;非线性MI-NPSVM模型通过带入核函数到线性模型中,自然而便捷地将线性模型扩展为非线性模型。与已存在的基于非平行支持向量机的多示例分类模型,例如MI-TWSVM,相比,MI-NPSVM模型首先确保了结构风险最小化原则;同时,MI-NPSVM不用求解双层规划问题,而是通过求解一系列的标准二次规划问题得解。 (2)提出了基于v-NPSVM的多示例分类模型v-MINPSVM。 论文首先提出了一个高性能且具有稀疏性的非平行支持向量机模型v-NPSVM,然后将其拓展到多示例分类问题中,提出了新的高效求解多示例分类问题的v-MINPSVM模型。v-NPSVM模型是NPSVM模型的等价形式,继承了NPSVM模型的所有优点,同时具有一些额外的性能,最重要的是其对稀疏性的定量控制。将已存在的各种支持向量机(包括TWSVM,TBSVM,NPSVM等)中的参数C替换为v-NPSVM模型中的参数v,首先参数v继承了参数C的主要功能——调节支持向量机的两个基本目标——间隔最大化和训练误差最小化;同时,相比于NPSVM模型中的参数C,参数v具有数值上的意义——v的值是模型中支持向量比率的下界,也是模型中支持向量比率一个比较近的估计。我们可以通过选择适当的参数v的值来控制模型中支持向量的比率,从而控制模型的稀疏性。对不同类别的数据点,还可以通过设定其对应的参数v的数值,来获得不同类别相应的不同的稀疏性,这给更好的求解非平衡数据集的分类问题提供了另一种思路。 (3)针对多示例学习普遍面临的大规模数据问题,提出了基于对偶坐标下降(Dual Coordinate Descent,DCD)算法的线性L2-NPSVM模型,实现了大规模数据的快速求解。 线性L2-NPSVM模型是在TWSVM模型的基础上,对其进行完善,采用二次损失函数,最终建立其数学模型。首先,此模型所构造的两个优化问题的对偶问题都是标准的二次规划模型,且只有下限约束,因此可以通过对偶坐标下降算法高效求解,而且在训练之前,不需计算和储存逆矩阵;同时,可以从理论上证明,线性TWSVM模型和线性L2-SVM模型都是线性L2-NPSVM模型的特殊情况,这从理论上保证了线性L2-NPSVM具有更优秀的性能。在小规模数据和大规模数据上的实验结果都表明了L2-NPSVM方法不仅能够高效地用于大规模数据的求解,而且相比于线性TWSVM和线性L2-SVM,也具有更高的一般性和推广性。