论文部分内容阅读
蛋白质结构预测是生物信息学众多研究方向中的一个发展已久但仍富有挑战性的问题。蛋白质二级结构预测是蛋白质空间结构预测的一种简化和过渡,其成功预测对于确定和理解蛋白质的空间结构及功能,指导分子设计、生物制药等应用领域均具有极为重要的意义。
本文以提高蛋白质二级结构的预测精度为目的,研究了基于神经网络的蛋白质二级结构预测模型、基因表达式编程对神经网络模型的优化以及氨基酸的编码方法等问题。主要研究内容和取得的结论如下:
(1)针对基因表达式编程进化过程中存在的“早熟”收敛问题,通过分析算法原理,提出了基于进化效果的动态突变率和局部搜索算子两种提高基因表达式编程算法性能的改进方法。典型实例验证表明,提出的改进方法能较好地解决多样性和收敛速度的矛盾,增加算法的局部搜索能力,提高了算法的性能。
(2)为了提高基因表达式编程算法的进化效率,提出了一种线性求解适应度的LFC方法。该方法不需要构造表达式树,仅用一种线性结构对染色体进行两次扫描便可完成适应度的计算。对比实验结果表明,LFC方法具有较快的进化速度,且构造简单,有效地提高了算法的效率,在处理复杂问题时效果更加明显。
(3)针对BP网络的结构和初始权重难以确定、易陷入局部最优的不足,利用改进基因表达式编程全局搜索、进化速度快的优点,提出用改进基因表达式编程对BP网络进行优化设计的方法。通过优化网络的结构和初始权重,使网络在最优结构下从最优初始权重开始训练学习,以加快网络的收敛速度,提高网络的稳定性和泛化能力。对比实验可知,改进基因表达式编程优化BP网络方法,克服了网络初始连接权值获取的随机性以及网络结构确定过程所带来的网络振荡,既可以发现更简单有效的神经网络,又具有更快的收敛速度,其平均进化代数仅是遗传算法优化BP网络的14%。
(4)针对蛋白质二级结构形成的特性,在分析氨基酸残基理化性质的基础上,提出了一种基于氨基酸的排列顺序和氨基酸生化指标的编码方法。该方法考虑了周围理化环境对氨基酸残基构象的影响,将序列中每个残基所处的疏水环境融合到氨基酸编码中去。对比实验结果表明,提出的Bin5+12编码方法是有效的,在相同实验条件下,预测精度较正交编码和5位编码分别提高了1.47和5.06个百分点。
(5)针对基于单序列蛋白质二级结构预测精度偏低问题,将基因表达式编程优化设计神经网络与提出的编码方法相结合,建立了GEP-ANN蛋白质二级结构预测模型。该模型充分利用蛋白质一级结构信息,提高了网络的映射精度。用PDBSelect25中的36条蛋白质共6122个残基进行测试,实验表明基于提出网络模型的蛋白质二级结构预测精度达到了69.6%,与基于BP网络模型的预测相比,预测精度提高了4.86个百分点。
(6)针对基于单个神经网络预测精度偏低的问题,结合进化神经网络和神经网络集成技术,提出一种新的预测模型—复合级联神经网络模型。该模型充分利用了进化神经网络中最后一代种群中个体所包含的信息,采用一种组合方法将最后一代种群中的部分个体集成,构成模型的第一层网络结构,并对第二层网络的编码进行了改进,充分利用了第一层网络的预测结果。用PDBSelect25中的36条蛋白质共6122个残基进行测试表明,提出的网络模型和编码方法是有效的,将蛋白质二级结构的预测精度提高到73.02%。
本文以提高蛋白质二级结构的预测精度为目的,研究了基于神经网络的蛋白质二级结构预测模型、基因表达式编程对神经网络模型的优化以及氨基酸的编码方法等问题。主要研究内容和取得的结论如下:
(1)针对基因表达式编程进化过程中存在的“早熟”收敛问题,通过分析算法原理,提出了基于进化效果的动态突变率和局部搜索算子两种提高基因表达式编程算法性能的改进方法。典型实例验证表明,提出的改进方法能较好地解决多样性和收敛速度的矛盾,增加算法的局部搜索能力,提高了算法的性能。
(2)为了提高基因表达式编程算法的进化效率,提出了一种线性求解适应度的LFC方法。该方法不需要构造表达式树,仅用一种线性结构对染色体进行两次扫描便可完成适应度的计算。对比实验结果表明,LFC方法具有较快的进化速度,且构造简单,有效地提高了算法的效率,在处理复杂问题时效果更加明显。
(3)针对BP网络的结构和初始权重难以确定、易陷入局部最优的不足,利用改进基因表达式编程全局搜索、进化速度快的优点,提出用改进基因表达式编程对BP网络进行优化设计的方法。通过优化网络的结构和初始权重,使网络在最优结构下从最优初始权重开始训练学习,以加快网络的收敛速度,提高网络的稳定性和泛化能力。对比实验可知,改进基因表达式编程优化BP网络方法,克服了网络初始连接权值获取的随机性以及网络结构确定过程所带来的网络振荡,既可以发现更简单有效的神经网络,又具有更快的收敛速度,其平均进化代数仅是遗传算法优化BP网络的14%。
(4)针对蛋白质二级结构形成的特性,在分析氨基酸残基理化性质的基础上,提出了一种基于氨基酸的排列顺序和氨基酸生化指标的编码方法。该方法考虑了周围理化环境对氨基酸残基构象的影响,将序列中每个残基所处的疏水环境融合到氨基酸编码中去。对比实验结果表明,提出的Bin5+12编码方法是有效的,在相同实验条件下,预测精度较正交编码和5位编码分别提高了1.47和5.06个百分点。
(5)针对基于单序列蛋白质二级结构预测精度偏低问题,将基因表达式编程优化设计神经网络与提出的编码方法相结合,建立了GEP-ANN蛋白质二级结构预测模型。该模型充分利用蛋白质一级结构信息,提高了网络的映射精度。用PDBSelect25中的36条蛋白质共6122个残基进行测试,实验表明基于提出网络模型的蛋白质二级结构预测精度达到了69.6%,与基于BP网络模型的预测相比,预测精度提高了4.86个百分点。
(6)针对基于单个神经网络预测精度偏低的问题,结合进化神经网络和神经网络集成技术,提出一种新的预测模型—复合级联神经网络模型。该模型充分利用了进化神经网络中最后一代种群中个体所包含的信息,采用一种组合方法将最后一代种群中的部分个体集成,构成模型的第一层网络结构,并对第二层网络的编码进行了改进,充分利用了第一层网络的预测结果。用PDBSelect25中的36条蛋白质共6122个残基进行测试表明,提出的网络模型和编码方法是有效的,将蛋白质二级结构的预测精度提高到73.02%。