基因组序列物种聚类问题研究及DNA聚类的云计算实现

来源 :中国科学技术大学 | 被引量 : 0次 | 上传用户:wnn379
下载到本地 , 更方便阅读
声明 : 本文档内容版权归属内容提供方 , 如果您对本文有版权争议 , 可与客服联系进行内容授权或下架
论文部分内容阅读
基因组学是研究生物基因组奥秘的新技术,随着测序技术在过去十几年间的高速发展,目前我们已经进入了千元人类基因组阶段,这极大推动了研究微生物信息和群落的功能的宏基因组学发展。同时基于下一代测序技术的宏基因组项目的发展,也产生了海量的生物序列,在对这些数据进行处理和分析中涌现出了大量的分析问题,亟需通过有效的计算手段进行解决。本文围绕着宏基因组序列物种聚类问题和DNA聚类问题进行了深入的研究,主要研究内容和贡献如下:   1.宏基因组序列的物种聚类算法研究   由于宏基因组测序序列中包含多个物种的DNA片段,对宏基因组序列分析需要首先对不同物种的DNA序列进行分离。目前基于无监督的宏基因组序列物种聚类算法主要有MetaCluster和TOSS。基于结构信息的MetaCluster3.0无法有效处理短序列,并且由于k-means算法随机生成中心点,多次运行面临产生的结果不一致的问题。而基于相似度信息进行物种聚类的算法TOSS,却面临着聚类速度较慢,无法处理大规模数据的问题。本文结合了相似度信息和结构信息,并引入了仿射聚类来对宏基因组测序序列物种聚类问题进行分析。实验数据表明我们的算法克服了MetaCluster3.0无法处理短序列的问题,并且运行时间比TOSS快10倍以上。   2.DNA序列聚类算法的云计算实现   下一代测序技术的迅速发展和宏基因组项目的进行均产生了大量的DNA序列,这加剧了当前序列聚类算法的处理能力与测序得到的大量的DNA序列之间的矛盾。目前已有针对DNA序列聚类的算法都是基于单机分析处理的,已经无法应对下一代测序技术产生的迅速增长的序列数据,因此我们基于开源Hadoop的MapReduce云计算框架,开发了基于云计算平台的DNA序列聚类工具。实验数据表明我们的聚类算法具有很强的可扩展性,并且运行效率较高。
其他文献
集成学习,是先将样本提供给多个学习模型,再采取投票或是级联等方法把这些学习模型的输出集成起来的学习模型。集成学习采用合成多个学习模型的输出,能够显著的提高学习模型的泛
随着Web2.0的出现和高速发展,互联网中用户所产生的信息容量和用户数量都呈现爆炸性增长的趋势,网络平台已经成为人们日常生活中不可缺少的信息获取、交流和传播的重要媒体。
癌症不是单一类型的疾病,而是存在分子亚型的。其分子的复杂性体现在mRNA、DNA、蛋白质等多层次遗传物质中。仅分析其中一种数据并不能够完整揭示分子亚型的独有特点。  
随着信息化技术不断发展,人类社会进入了信息化时代,各种各样的应用软件也随之应运而生,如ERP、OA、SCM、PLM等。这些软件对企业的快速发展起到了重要作用,越来越多的企业也
随着互联网的持续高速发展和广泛应用,分布式计算取得了巨大的进步,分布式计算技术的新进展和XML技术的出现,最终导致了Web服务技术的诞生。Web服务是一种基于服务提供者和服
在基于目标函数的模糊聚类算法中,模糊C-均值聚类算法得到了丰富的理论研究和广泛应用。它通过迭代和爬山技术来寻找问题的最优解,是一种局部搜索算法。然而,该算法对初始中心很
数据挖掘技术随着当前互联网中与日俱增的海量数据不断地热门起来,已成为当前信息科学领域中的热门研究课题。关联规则挖掘逐渐受到研究者的追捧,成为数据挖掘的热门研究方向
无线网络因带宽受限、信号衰减等问题,使得原本为有线网络设计的TCP协议往往错误触发拥塞控制机制,导致网络性能恶化。因此,无线网络中对TCP的改进是近年来网络研究的热点之一。
随着计算机网络技术与数字通信技术的飞速发展,多媒体数据的交互得到迅速的普及,但是由此而来的多媒体数据的侵权和篡改现象日益严重。传统的数字签名技术对多媒体数据的保护有
基因组学(genomics)是当今生物学家探究生命奥秘的新兴研究领域,其中单体型是基因组学中的一类重要信息,它在复杂疾病关联研究、药物设计中起着至关重要的作用。由于人类基因型数