论文部分内容阅读
了解蛋白质如何相互作用对于研究蛋白质的功能机制至关重要。随着高通量基因组技术的飞速发展,蛋白质相互作用的数据规模变得越来越庞大,从而对蛋白质相互作用关系预测方法研究提出了新的挑战。因此,为了满足大规模蛋白质相互作用预测的需求,本文在前人研究工作的基础上,提出了一种适用于大规模蛋白质相互作用预测的分布式算法pCoFex。与前人的研究成果CoFex算法相比,pCoFex从两个方面解决了其无法应用于大规模蛋白质相互作用预测的缺陷:(1)pCoFex采用了一种新的树形数据结构CF-Tree,只需要遍历一次数据集就能保存候选共进化模式出现的次数信息,避免了CoFex算法需要多次遍历的情况;(2)在算法实现过程中,与主流分布式计算框架MapReduce的整合使得pCoFex能够以并行计算的方式完成预测任务。与此同时,本文还对不同的分布式计算资源分配方案进行了测试,分析了这些方案对pCoFex算法运算效率的影响。本文具体研究内容如下:
(1)对前期的研究成果CoFex算法进行性能瓶颈分析,归纳其无法胜任大规模蛋白质相互作用预测的原因,分别是提取共进化模式的效率问题以及大规模蛋白质数据预测的计算力问题,并通过实验进行验证,为下一步提出改进算法提供理论依据。
(2)在共进化模式提取过程中,CoFex算法需要多次遍历蛋白质序列数据集以完成候选共进化模式出现次数信息的统计任务。为了解决这个问题,本文提出了新的树形结构CF-Tree。实验结果表明,CF-Tree在提高共进化模式提取速度上有着非常显著的效果。
(3)基于树形结构CF-Tree,本文结合主流分布式计算框架提出了一种改进的分布式算法pCoFex,用于实现对大规模蛋白质相互作用进行预测的目标。实验结果表明,pCoFex算法能够在保证预测准确性的前提下,大幅度提高运算效率,从而实现大规模蛋白质预测的目标。
(4)在Hadoop分布式环境中,本文通过调整计算节点的规模,测试了不同的分布式计算资源分配方案对pCoFex算法运算效率的影响。实验结果表明,随着计算节点数量的增加,pCoFex算法的运算效率也会得到提高,但这种趋势会慢慢趋于稳定。同时,在对不同阶段的计算节点进行分配时,本文发现相比较Reduce阶段,pCoFex算法对Map阶段计算节点数目变化更为敏感。
(1)对前期的研究成果CoFex算法进行性能瓶颈分析,归纳其无法胜任大规模蛋白质相互作用预测的原因,分别是提取共进化模式的效率问题以及大规模蛋白质数据预测的计算力问题,并通过实验进行验证,为下一步提出改进算法提供理论依据。
(2)在共进化模式提取过程中,CoFex算法需要多次遍历蛋白质序列数据集以完成候选共进化模式出现次数信息的统计任务。为了解决这个问题,本文提出了新的树形结构CF-Tree。实验结果表明,CF-Tree在提高共进化模式提取速度上有着非常显著的效果。
(3)基于树形结构CF-Tree,本文结合主流分布式计算框架提出了一种改进的分布式算法pCoFex,用于实现对大规模蛋白质相互作用进行预测的目标。实验结果表明,pCoFex算法能够在保证预测准确性的前提下,大幅度提高运算效率,从而实现大规模蛋白质预测的目标。
(4)在Hadoop分布式环境中,本文通过调整计算节点的规模,测试了不同的分布式计算资源分配方案对pCoFex算法运算效率的影响。实验结果表明,随着计算节点数量的增加,pCoFex算法的运算效率也会得到提高,但这种趋势会慢慢趋于稳定。同时,在对不同阶段的计算节点进行分配时,本文发现相比较Reduce阶段,pCoFex算法对Map阶段计算节点数目变化更为敏感。