大规模蛋白质相互作用预测算法研究

来源 :武汉理工大学 | 被引量 : 0次 | 上传用户:wyxxzh
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
了解蛋白质如何相互作用对于研究蛋白质的功能机制至关重要。随着高通量基因组技术的飞速发展,蛋白质相互作用的数据规模变得越来越庞大,从而对蛋白质相互作用关系预测方法研究提出了新的挑战。因此,为了满足大规模蛋白质相互作用预测的需求,本文在前人研究工作的基础上,提出了一种适用于大规模蛋白质相互作用预测的分布式算法pCoFex。与前人的研究成果CoFex算法相比,pCoFex从两个方面解决了其无法应用于大规模蛋白质相互作用预测的缺陷:(1)pCoFex采用了一种新的树形数据结构CF-Tree,只需要遍历一次数据集就能保存候选共进化模式出现的次数信息,避免了CoFex算法需要多次遍历的情况;(2)在算法实现过程中,与主流分布式计算框架MapReduce的整合使得pCoFex能够以并行计算的方式完成预测任务。与此同时,本文还对不同的分布式计算资源分配方案进行了测试,分析了这些方案对pCoFex算法运算效率的影响。本文具体研究内容如下:
  (1)对前期的研究成果CoFex算法进行性能瓶颈分析,归纳其无法胜任大规模蛋白质相互作用预测的原因,分别是提取共进化模式的效率问题以及大规模蛋白质数据预测的计算力问题,并通过实验进行验证,为下一步提出改进算法提供理论依据。
  (2)在共进化模式提取过程中,CoFex算法需要多次遍历蛋白质序列数据集以完成候选共进化模式出现次数信息的统计任务。为了解决这个问题,本文提出了新的树形结构CF-Tree。实验结果表明,CF-Tree在提高共进化模式提取速度上有着非常显著的效果。
  (3)基于树形结构CF-Tree,本文结合主流分布式计算框架提出了一种改进的分布式算法pCoFex,用于实现对大规模蛋白质相互作用进行预测的目标。实验结果表明,pCoFex算法能够在保证预测准确性的前提下,大幅度提高运算效率,从而实现大规模蛋白质预测的目标。
  (4)在Hadoop分布式环境中,本文通过调整计算节点的规模,测试了不同的分布式计算资源分配方案对pCoFex算法运算效率的影响。实验结果表明,随着计算节点数量的增加,pCoFex算法的运算效率也会得到提高,但这种趋势会慢慢趋于稳定。同时,在对不同阶段的计算节点进行分配时,本文发现相比较Reduce阶段,pCoFex算法对Map阶段计算节点数目变化更为敏感。
  
其他文献
当今,数据处理的应用飞速增长,数据管理技术尤其是关系型数据库管理系统(DataBase Management Systems)被广泛应用在各个行业,例如大到航天飞行器的数据系统,小到百姓日常的购物消费系统等都和数据库息息相关。随着日益快速发展的互联网技术,尤其是伴随着未来5G市场的爆发以及万物互联的设备持续增多,数据库管理系统必将持续成为当前以及未来的研究热点。最近十多年计算机硬件的性能发生了质的
学位
数据中心网络作为现代分布式计算的基础架构,决定了分布式应用的通信性能。随着大数据技术的快速发展和云计算基础设施的不断成熟,数据中心承载了越来越多的分布式计算任务,其底层网络的设计也面临着严峻的挑战。为了保证性能和可靠性,现代数据中心网络通常采用专用的结构化多径拓扑。具体地,以Fat-tree为代表的多径网络已成为大规模数据中心网络设计的首选方案。但是多路径网络由于其路由方式的不同,使得传统路由算法
在现实世界中,实体连同关联关系构成了一种网络关系结构即信息网络。这里的实体可以是商品、文章、会议、人、图片、电影或者导演等个体,关联关系可以是购买、发表、观看、出演或者指导等关联。链路预测是指通过已知的网络节点以及网络结构等信息来预测网络中尚未产生连边的两个节点之间产生链路或产生某种符号链路的可能性。这些被预测出的链路可以是实际存在但未被观察到的链路,也可以是未来可能会出现的链路。链路预测已经成为
学位
软件定义网络(software defined networks,SDNs)是一种由多种网络技术组成的新型网络结构,由底层的数据平面、中间层的控制平面以及最上层的应用平面组成,具有灵活敏捷的特点,能够自动优化网络资源的利用,尤其适用于网络中流量需求不断变化的应用。软件定义网络与传统网络不同之处在于SDN将网络设备的控制平面与数据平面相分离,因此根据实时动态的网络需求,用户可以通过简单的编程操作对整
网络上的图像数据规模愈发庞大,伴随而来的有关图像的需求如存储、传输、识别等,也面临着更大的挑战,对图像识别和图像表示的研究已经成为应对新挑战的亟需攻克的关键点。目前,图像识别中利用结构特征、纹理特征、子空间、机器学习等方法与图像表示中线性类方法如矩阵分解、稀疏编码、线性判别分析和非线性类方法如核学习、流形学习、机器学习等,都存在需要经过复杂的运算分析、过程抽象、优化困难、对训练数据要求较高的问题。
学位
云计算作为一种高效的计算模式受到了人们广泛的关注,使得云计算市场飞速发展。广阔的市场前景吸引了各大互联网巨头纷纷布局其云计算业务,希望在激烈的竞争环境中脱颖而出,从而形成了一个具有多方博弈的云计算市场。在这样一个云市场中,当不同云服务提供商提供相似的云服务时,云服务的价格则会对云用户选择不同云服务提供商的结果产生重要影响。现有云市场交易模式大致归为两类,分别是商品市场模式和拍卖市场模式,本文将分别
人脸识别系统容易受到恶意的欺骗攻击,例如打印的照片攻击或视频重播攻击。因此,为了保障人脸识别系统的安全性,研究能够抵抗欺骗攻击的人脸活体检测技术显得尤为重要。本文主要的研究对象是基于纹理的人脸活体检测方法。现有基于纹理的方法对光照变化和噪声等因素敏感,且使用的特征表达能力不足,导致泛化性能较低。除此之外,当源域和目标域数据分布差异较大时,学习的模型不能很好地泛化到目标域中,导致性能急剧下降。为了解
学位
近年来,随着我国经济发展进入新常态,经济发展的总量规模和复杂程度均空前增大,政府管理调控经济的要求越来越高,传统的管理理念、方法和工具难以适应新形势需要。因此,利用计算机科学技术充分考虑各行业之间的关联性,探求新常态下经济运行新规律,可以为推动政府治理精准化提供新的技术支撑。在以往的研究中,大多是通过统计学和计量经济学的方法作为宏观经济决策研究的理论基础,本研究立足于分析各宏观经济指标间的关联性,
学位
近年来,大数据催生的很多以数据为中心的技术和应用对计算机内存的容量、速度、能耗提出了更高的要求。传统的DRAM内存技术因其存储密度小,易失性和静态功耗大等问题难以满足新的技术对于大容量内存的需求。为解决传统计算机主存面临的瓶颈,由非易失存储器(Non-Volatile Memory,NVM)和DRAM共同组成计算机内存的混合内存技术的提出受到了学术界的广泛关注。这种新的内存结构的出现对整个系统结构
科技的发展使得人类的生活变得更加的舒适便捷,自然场景下的文本检测与识别技术就是一项改变人类生活的技术。比如码头上通过图像识别货柜上的货柜号码、票据上的圆形公章的识别等都是自然场景下的文本识别。但是自然场景下的文本检测与识别会受到拍摄的图片的质量、图片中的遮挡物、背景、文本排列方式等因素的影响。由于曲线文本字符特殊的排列方式,曲线文本的检测与识别比水平文本更难。因此如何从自然场景图片中定位出文本区域
学位