论文部分内容阅读
大规模稀疏学习是机器学习中的重要方法之一,在很多实际应用问题上有着广泛应用,比如,文本信息挖掘、生物信息学、图像处理、新闻推荐等等。然而,在具有海量样本和超高特征维度的大规模问题中,大规模稀疏学习模型的高效训练依然是一个非常具有挑战性的问题。因此,多年来,大规模稀疏学习一直是学术界和工业界的重要研究热点。现有的大规模稀疏学习模型训练方法,大多是基于随机复合优化算法设计的。因为其迭代过程中的在线批量转换步骤存在缺陷,所以,现有的算法不能获得真正稀疏的模型。为此,通过将新的稀疏在线批量转换步骤引入到随机优化中,我们提出了一个简单有效的随机复合优化框架以及在此框架下的三个具体算法。理论分析和实验结果显示,我们的算法不仅在稀疏学习能力方面完全优于现有算法,而且能将大概率误差界降低一个数量级。筛选是一类能够有效加速大规模稀疏学习模型训练的新兴技术,能够快速检测出与模型无关的特征或者样本并将其从模型中剔除,从而降低模型规模、提高训练效率。但是,现有的筛选算法都只单一研究特征筛选或者样本筛选,无法应用于数据量和特征数量都非常大的应用中。为此,我们提出了一个基于原问题和对偶问题解的准确估计的稀疏支持向量机静态加速训练算法,该算法能够同时筛选与模型无关的特征和样本。实验结果显示,我们的算法能够带来速度上几个数量级的提升。另外,我们注意到,随机矩阵算法在大规模数据分析中具有很高的时间效率,但尚未被引入到大规模稀疏学习模型的训练中。据此,我们创造性地将随机矩阵引入到稀疏学习中,提出了基于随机投影的加速稀疏线性回归算法。我们的算法能在取得指数收敛速度的同时,大大降低单次迭代的计算复杂度,而且我们算法的中间解的稀疏性具有理论保证。最后,在具体应用方面,由于生物数据(如人类基因数据)常常具有非常高的维度,而且其所用的稀疏学习模型比较复杂,因此,模型训练效率一直是大规模稀疏学习模型在生物信息学中应用时面临的瓶颈问题。对此,我们以阿尔茨海默病为例,提出了一种基于共享树结构的多任务特征学习的基因风险因子检测算法。这是一项能够通过同时利用特征结构信息和多任务间共享信息来提高检测性能的独特技术。我们还为该模型设计了一种基于筛选的加速训练算法。相比于现有最佳方法,我们的方法在检测基因风险因子方面具有明显优势。我们的筛选方法能在不损失任何精度的前提下将模型训练效率提高数个数量级。