【摘 要】
:
DNA序列分类是生物信息学的一项基础任务,目的是根据结构或功能的相似性预测DNA序列所属的类别。为进行有效分类,如何将序列映射到特征向量空间并最大程度地保留序列中蕴含的碱
【基金项目】
:
国家自然科学基金(61175123)
论文部分内容阅读
DNA序列分类是生物信息学的一项基础任务,目的是根据结构或功能的相似性预测DNA序列所属的类别。为进行有效分类,如何将序列映射到特征向量空间并最大程度地保留序列中蕴含的碱基间顺序关系是一项困难的任务。为克服现有方法容易导致因DNA序列碱基残缺而影响分类精度等问题,提出一种新的DNA序列特征表示方法。新方法首先为每条序列训练一个隐马尔科夫模型(HMM),然后将DNA序列投影到由HMM状态转移概率矩阵的特征向量构成的向量空间中。基于这种新的特征表示法,构造了一种 K-NN分类器对DNA序列进行分类。实验结果表
其他文献
为解决海量GIS地图信息显示分辨率高、处理难度大等问题,研究了集群并行显示、WMS服务、GIS渲染显示等技术,提出了以计算机集群并行计算为基础构建集群并行GIS拼接显示系统,采用WMS并行获取GIS数据信息、地图投影变换处理数据、Open GL并行纹理渲染,进而实现GIS数据的超高分辨显示.实验结果表明,提出的集群并行GIS拼接显示系统可极大地提高地图显示分辨率、为海量GIS地图的超高分辨显示提供
由于强大的自主学习能力, 强化学习方法逐渐成为机器人导航问题的研究热点, 但是复杂的未知环境对算法的运行效率和收敛速度提出了考验。提出一种新的机器人导航Q学习算法,
二氧化碳排放量的急剧升高引发了一系列的环境问题,碳排放权交易系统作为一种以较低成本达到碳减排目标的经济手段,对中国的减排之路具有重要意义. 本研究基于Agent建立了钢铁
针对复杂行车环境下智能车辆行车安全问题,提出了一种基于改进Susan边缘检测算法提取车辆边界特征.首先介绍了SUSAN边缘检测算子的原理,然后提出改进的SUSAN算法,即对待检测像素粗略提取,采用一种自适应选取阈值的方法对候选边缘点检测提取边缘.实验表明,算法能在复杂图像中识别前方车辆,有较高的准确度.
针对一类多输入多输出系统进行辨识,以“A simulation of the western basin of Lake Erie”为例,通过分析河流湖泊的水质特征,针对伊利湖湖泊水质建立数学模型,由于该环境系
为解决高校传统长跑具有管理、监督困难,学生参与积极性低等问题,设计和实现了一种嵌入式阳光长跑终端系统.系统硬件平台选用TI的基于ARM架构的DM3730处理器,以Linux操作系统作为软件平台.提出一种基于身份证和指纹的二次身份识别技术,基于Qt设计人机交互界面,使用SQLite数据库记录学生长跑信息,采用TCP协议实现长跑信息与远程服务器交互.系统测试表明:学生身份识别速度快、准确率高,人机交互
提出和实现了一种图像配准方法,利用OpenCV库开发了一个低空遥感图像拼接系统.将SIFT作为图像拼接特征向量,实现了图像局部尺度空间中极值点的计算和SIFT特征点的提取.使用特征向量的欧氏距离实现特征点的粗匹配,结合随机抽样一致RANSAC算法对匹配点进行优化,并精确估算出投影变换矩阵,实现两幅图像的拼接.最后实现对重合区域的图像融合.实验结果表明本文方法较好的解决了遥感图像中常出现的图像的平移
针对传统K—means算法中对初始化聚类中心敏感,容易陷入局部极小值等缺点,提出了一种基于粒子群算法和多类合并方法的新型K-means聚类算法.该算法首先利用改进粒子群算法选取初
为了获得更加理想的网络入侵检测结果,针对网络入侵特征选取和样本选择问题,提出一种基于特征选取和样本选择的网络入侵检测模型.首先提取网络入侵特征,并进行归一化处理,然
针对当前信息系统(Information System,IS)中文档批量生成与报表技术繁琐复杂的问题,提出了一种基于Aspose技术的自定义模板文档生成方法.首先建立模板文档,划分常量域与变量域