论文部分内容阅读
本文主要研究了两个问题:高维生存数据的模型平均和高维海量数据的分布式算法.
首先,高维生存数据的Cox比例风险模型的正则化方法已经有广泛的研究.但是此方法严重依赖于模型的正确性.如果模型被错误指定,这将带来错误的统计推断和预测.为了提高相对风险和生存概率的预测精度,我们提出了针对高维Cox比例风险回归的模型平均方法.基于鞅残差过程,我们定义了删一的交叉验证过程.进一步,基于上述过程,我们提出了三种新的准则,包括末端时间交叉验证(ECV),积分交叉验证(ICV)和最小上界交叉验证(SCV).在不需要假设权重的和等于一的情况下,分别对这些泛函准则进行最小化,从而求解子模型的最优权.为了简化计算方法,我们基于贪婪算法的思想提出一种新的算法,并通过实证分析对我们提出的方法进行了评估.实证分析结果表明,我们的方法相对传统的基于模型的正则化方法具有更高的预测精度和稳健性.最后,将我们的方法引用于套细胞淋巴瘤的研究.
其次,我们研究了分布式存储的海量高维数据的预测和分类问题。对于连续型的响应变量,我们提出了一种分布式网格模型平均(DGMA)方法来预测响应变量的条件均值.在每台存储了相对中等样本量的局部数据的机器上,我们提出将变量分割成维数较低的部分,利用模型平均的方法降低计算的复杂度和提高方法的稳健性.通过构建一个替代函数解决大量数据在机器中传输的困难.计算上,利用贪婪算法的思想,设计分布式贪婪算法,降低数据交换的难度.此算法每一次迭代只需要在主机器上解决一个移位的惩罚二次损失函数,同时计算每个本地机器上的损失函数的梯度,然后将它返回给主机器.此流程有效地分配了工作量,大大降低了交换的成本.理论上,我们建立了DGMA方法预测误差界,并用局部样本量和交换次数明确表示.进一步证明,如果局部样本量或交换次数足够多时,我们提出的方法可以充分接近基于完整数据的全局方法的预测误差界。此外,在模拟数据集和真实数据集上进行了大量的数值实验,以证明DGMA方法的可行性和有效性.
对于响应变量是分类变量的海量高维数据,我们提出了一种基于交替方向乘子的分布式稀疏最优评分分类方法.首先,通过最优得分的方法,分类问题可转化为回归问题.基于数据分布式存储在多台机器中,引入每台机器中的估计相等的强制性约束,利用分布式交替方向乘子算法,每台机器可以并行优化,而机器间只需要交换估计,如此传输损失保持在可承受的水平.进一步我们证明了所得到的估计以线性迭代次数的速度收敛到通过访问完整数据得到的全局解.通过数值模拟和实际数据研究,验证了算法的全局最优性和收敛性.
首先,高维生存数据的Cox比例风险模型的正则化方法已经有广泛的研究.但是此方法严重依赖于模型的正确性.如果模型被错误指定,这将带来错误的统计推断和预测.为了提高相对风险和生存概率的预测精度,我们提出了针对高维Cox比例风险回归的模型平均方法.基于鞅残差过程,我们定义了删一的交叉验证过程.进一步,基于上述过程,我们提出了三种新的准则,包括末端时间交叉验证(ECV),积分交叉验证(ICV)和最小上界交叉验证(SCV).在不需要假设权重的和等于一的情况下,分别对这些泛函准则进行最小化,从而求解子模型的最优权.为了简化计算方法,我们基于贪婪算法的思想提出一种新的算法,并通过实证分析对我们提出的方法进行了评估.实证分析结果表明,我们的方法相对传统的基于模型的正则化方法具有更高的预测精度和稳健性.最后,将我们的方法引用于套细胞淋巴瘤的研究.
其次,我们研究了分布式存储的海量高维数据的预测和分类问题。对于连续型的响应变量,我们提出了一种分布式网格模型平均(DGMA)方法来预测响应变量的条件均值.在每台存储了相对中等样本量的局部数据的机器上,我们提出将变量分割成维数较低的部分,利用模型平均的方法降低计算的复杂度和提高方法的稳健性.通过构建一个替代函数解决大量数据在机器中传输的困难.计算上,利用贪婪算法的思想,设计分布式贪婪算法,降低数据交换的难度.此算法每一次迭代只需要在主机器上解决一个移位的惩罚二次损失函数,同时计算每个本地机器上的损失函数的梯度,然后将它返回给主机器.此流程有效地分配了工作量,大大降低了交换的成本.理论上,我们建立了DGMA方法预测误差界,并用局部样本量和交换次数明确表示.进一步证明,如果局部样本量或交换次数足够多时,我们提出的方法可以充分接近基于完整数据的全局方法的预测误差界。此外,在模拟数据集和真实数据集上进行了大量的数值实验,以证明DGMA方法的可行性和有效性.
对于响应变量是分类变量的海量高维数据,我们提出了一种基于交替方向乘子的分布式稀疏最优评分分类方法.首先,通过最优得分的方法,分类问题可转化为回归问题.基于数据分布式存储在多台机器中,引入每台机器中的估计相等的强制性约束,利用分布式交替方向乘子算法,每台机器可以并行优化,而机器间只需要交换估计,如此传输损失保持在可承受的水平.进一步我们证明了所得到的估计以线性迭代次数的速度收敛到通过访问完整数据得到的全局解.通过数值模拟和实际数据研究,验证了算法的全局最优性和收敛性.