论文部分内容阅读
特征选择是一种数据降维方式。在分类算法中,数据降维的目的主要是降低时空复杂度同时尽量提高分类准确率。因此一般通过比较分类准确率有没有提高,训练分类模型的时间有没有降低来反映特征选择算法的优劣,很少考虑选择的特征子集是否稳定。事实上,特征选择的稳定性是一种比较重要的性质。
分类算法有过拟合训练数据集,分类准确率可信度低的问题。在高维数据集上,如果特征选择算法结果不稳定,则特征选择进行降维后再训练分类模型得到的分类准确率就更不可信。此外有些领域中特征选择是为了找出关键特征解释类别差异而不是训练分类模型。例如在生物信息学的微阵列数据分析中,特征选择是为了寻找生物标记基因。如果算法稳定性很差,结果过拟合训练数据,就不能判断哪些基因是关键基因。所以需要研究特征选择算法的稳定性。
本文分析了特征选择算法及其稳定性的研究现状。DRAGS算法从稳定性的角度考虑提出了密集特征组的概念,是比较稳定的特征选择算法。但DRAGS算法中存在两个问题:(1)一个特征被允许分到多个组中。这和直观理解是相违背的,一般一个特征最多只归到一个组。(2)在聚类分组前,没有删除不相关特征。不相关特征可能成为噪声特征影响聚类结果,进而影响算法的稳定性。
本文基于这些观察,提出一种改进的特征选择算法流程。按照这个流程提出算法Fisher—DBC,用Fisher—score算法去除不相关特征。经实验比较,Fisher—DBC算法比DRAGS算法稳定,有了一定的改进。