论文部分内容阅读
高通量测序技术产生了海量的基因组学数据和抗癌药物组学数据。建立有效的计算模型是快速挖掘这些大数据蕴含的信息的重要手段。本文首先基于DNA序列的碱基转移概率、碱基含量和碱基位置比三类特征构造了 24维特征向量,成功应用于11物种β-珠蛋白基因完整编码序列和18物种哺乳动物线粒体基因组序列的相似性比较,构建的系统发生树与进化事实相符。然后基于该特征向量,结合支持向量机分类识别了 28株细菌中的必需基因,平均AUC值高达0.808,高于部分识别方法。最后的实验结果表明:生物序列基本构成元素的转移概率、含量