论文部分内容阅读
基因组学是研究生物基因组奥秘的新技术,随着测序技术在过去十几年间的高速发展,目前我们已经进入了千元人类基因组阶段,这极大推动了研究微生物信息和群落的功能的宏基因组学发展。同时基于下一代测序技术的宏基因组项目的发展,也产生了海量的生物序列,在对这些数据进行处理和分析中涌现出了大量的分析问题,亟需通过有效的计算手段进行解决。本文围绕着宏基因组序列物种聚类问题和DNA聚类问题进行了深入的研究,主要研究内容和贡献如下:
1.宏基因组序列的物种聚类算法研究
由于宏基因组测序序列中包含多个物种的DNA片段,对宏基因组序列分析需要首先对不同物种的DNA序列进行分离。目前基于无监督的宏基因组序列物种聚类算法主要有MetaCluster和TOSS。基于结构信息的MetaCluster3.0无法有效处理短序列,并且由于k-means算法随机生成中心点,多次运行面临产生的结果不一致的问题。而基于相似度信息进行物种聚类的算法TOSS,却面临着聚类速度较慢,无法处理大规模数据的问题。本文结合了相似度信息和结构信息,并引入了仿射聚类来对宏基因组测序序列物种聚类问题进行分析。实验数据表明我们的算法克服了MetaCluster3.0无法处理短序列的问题,并且运行时间比TOSS快10倍以上。
2.DNA序列聚类算法的云计算实现
下一代测序技术的迅速发展和宏基因组项目的进行均产生了大量的DNA序列,这加剧了当前序列聚类算法的处理能力与测序得到的大量的DNA序列之间的矛盾。目前已有针对DNA序列聚类的算法都是基于单机分析处理的,已经无法应对下一代测序技术产生的迅速增长的序列数据,因此我们基于开源Hadoop的MapReduce云计算框架,开发了基于云计算平台的DNA序列聚类工具。实验数据表明我们的聚类算法具有很强的可扩展性,并且运行效率较高。