论文部分内容阅读
蛋白质翻译后修饰(Post-Translational Modifications,PTMs)位点预测是生物信息学领域的重要研究课题之一。已知的PTM反应有400多种,例如糖化、瓜氨酸化等。PTMs在基因表达调控、信号传输、蛋白质-蛋白质相互作用等细胞过程中发挥关键作用。判断蛋白质中某个氨基酸是否会发生PTMs反应并深入研究反应发生机制对理解相关疾病的发病机理,拓宽治疗思路有着决定性作用。通过实验方法识别PTM位点,成本昂贵、耗时耗力且无法大规模开展。因此,亟需开发快速准确的计算方法。基于机器学习,本学位论文针对赖氨酸上的糖化修饰和精氨酸上的瓜氨酸化修饰,建立了相应的计算预测器,主要研究内容如下:(1)基于支持向量机(Support Vector Machines,SVM),提出了新的蛋白质糖化位点预测器Gly-predict。Gly-predict利用k-近邻算法去除冗余负样本;通过二进制编码(Binary Encoding,BE)、可及表面积、二级结构概率和灰色关联度提取蛋白质序列特征;并利用最大相关最小冗余算法(max Relevancy Min Redundancy,mRMR)获取最优特征集。在独立测试集上,该方法的预测性能优于现有方法。受数据集中正负样本数目不平衡的影响,Gly-predict的预测灵敏度不理想,存在提升空间。(2)针对训练数据集中的类不平衡问题,提出了带有长短期记忆(Long Short-Term Memory,LSTM)单元的循环神经网络(Recurrent Neural Network,RNN)LSTM RNNs,通过确定采样温度以人工生成含糖化位点肽链。以二进制编码后的正样本肽链为输入,利用网格搜索法获取该网络的最优超参数。从全局电荷、疏水性和氨基酸组成角度验证了该方法的有效性。统计显著性检验结果表明生成肽链与原始正样本具有相似性。(3)鉴于生物语言与自然语言的相似性,将数据集中的肽链切割成生物学词,并采用连续分布表示对其编码;以编码后的肽链向量为输入,构建基于卷积神经网络(Convolutional Neural Network,CNN)的蛋白质糖化位点预测器DeepGly。通过与现有方法进行比较,证实了 DeepGly具有强大的预测能力。(4)提出了一种用于预测蛋白质瓜氨酸化位点的预测器PCSPred_SC。该预测器首先选用BE、位置特异性氨基酸倾向(Position Specific Amino Acid Propensity,PSAAP)、伪氨基酸组成(Pseudo-Amino Acid Composition,PseAAC)和物理化学性质(Physicochemical Properties,PP)等方法对序列进行特征提取。随后,在完整特征空间下,分别探讨了不同预测算法,过采样方法和特征选择方法的预测能力。实验结果表明,添加过采样算法的预测器具有更高的灵敏度;添加特征选择方法可以缩减特征维度,减少计算开销;在相同数据集上与其它方法相比,由SVM,自适应合成(Adaptive synthesis,Adasyn)和基于T分布的随机近邻嵌入(t-Stochastic Neighbor Embedding,t-SNE)组合而成的PCSPred_SC具有更出色的性能。