论文部分内容阅读
目的:在法庭科学实践中,年龄是刻画嫌疑人生物特征的一个关键指标。若犯罪现场遗留生物物证中提取的DNA与数据库无比对结果时,年龄信息将为侦查提供有利的线索。并且,对于高度腐败甚至白骨化无名尸的年龄推断,可为查找尸源提供有价值的信息。此外,个体年龄鉴定还常用于灾难事故中未知受害者鉴定及刑事责任能力认定等方面。目前,个体年龄推断主要依赖于人类学方法,对骨骼、牙齿进行数据测量以推断骨龄或牙龄,但这些基于形态学的方法误差较大,且无法应用于血液、唾液、毛发等常见的法医生物检材。对于这些生物检材,近年来有研究筛选了一系列年龄相关性分子标记物,如端粒长度、线粒体DNA损伤、m RNA等,进行体液斑迹样本的年龄推断研究。虽然这些生物标志物表现出了较好的年龄相关性,但以它们为基础构建的年龄推断模型普遍存在精准度低、可重复性差、适用性差等问题。目前,基于DNA甲基化构建的年龄推断模型被认为最具年龄推断潜力,其年龄预测的精准度较其他生物标志物相比有较大提高,但该方法对于检材和DNA的质量要求较高,从而限制了其在法医实践中的应用。21世纪以来,随着人类基因组计划的完成,非编码RNA生物学功能的探索已然成为当前生命科学研究领域的热点新兴。研究表明,非编码RNA家族几乎影响了细胞生理和机体发育过程的各个方面,在细胞衰老和机体衰老过程中发挥了巨大的调控作用。因此,基于非编码RNA分子的分布广泛性和时相变化性等特性,我们推测年龄相关性非编码RNA在法医学年龄推断研究中具有巨大的潜力和广阔的应用前景。综上,本研究通过二代测序技术筛选年龄相关性高的circ RNAs分子,结合生物信息学分析筛选年龄相关性mi RNAs分子,基于机器学习算法联合构建检测体系和年龄推断模型,并对检测体系进行法医学应用评估研究。方法:1.基于公共数据库挖掘年龄相关性mi RNA分子。用生物信息分析方法,从Array Express和GEO公共数据库进行筛选,筛选条件为:(1)采用mi RNA芯片或转录组芯片方法进行检测的研究;(2)研究对象为人类外周血液样本的研究;(3)研究中包含的健康对照样本中年轻个体和老年个体样本量至少为15例。对符合研究目的的数据集进行原始数据预处理。对mi RNA表达谱数据集进行差异表达分析或相关性分析筛选年龄相关性mi RNAs分子:(1)对年龄分组明确的数据集,采用“limma”包筛选候选年龄相关性mi RNAs,筛选标准为log2(foldchange)绝对值大于1,错误发现率(False Discovery Rate,FDR)校正后P值≤0.05;(2)对年龄分组未明确的数据集,根据Spearman相关性分析结果筛选候选年龄相关性mi RNAs,筛选条件为相关性系数rho绝对值大于0.2且FDR校正后P值≤0.05。候选年龄相关性mi RNAs通过RT-q PCR实验进行验证。同时,利用Target Scan、mir Tar Base和mir Walk公共数据库预测年龄相关性mi RNAs的靶基因,并对靶基因集合进行GO富集分析和KEGG通路分析。2.年龄相关性circ RNAs候选生物标记分子的筛选。利用circ RNA二代测序技术(circ RNA-seq)检测不同年龄的健康无关个体外周血circ RNA表达谱,包括年轻组样本4名(20-29岁)和老年组样本4名(50-62岁)。“limma”包筛选候选年龄相关性circ RNAs,筛选标准为log2(foldchange)的绝对值大于2且P值≤0.001。年龄相关性circ RNAs分子根据表达特点分成三组:(1)仅在年轻组个体中表达的circ RNAs;(2)仅在老年组个体中表达的circ RNAs;(3)在不同年龄组中差异表达显著的circ RNAs。选择三组中排名靠前的前5个circ RNAs(Top5)作为候选年龄相关性circ RNAs分子,并通过RT-q PCR实验进行验证。3.年龄相关性mi RNAs和circ RNAs分子大样本靶向检测,以及机器学习法构建年龄推断模型。采集200名不同年龄的健康无关个体外周血样本(20-80岁)进行RT-q PCR实验靶向检测,ΔCt值代表nc RNAs分子的相对表达量。将样本数据集以训练集:测试集(8:2)的比例随机分成两组,采用Tree回归树、Bagging回归、随机森林回归、支持向量回归和XGBoost五种机器学习算法进行年龄推断模型的构建。以平均绝对误差值(MAE)、均方根误差值(RMSE)和R~2值作为评估各模型推断精确度的指标。4.年龄推断模型的法医学应用评估。基于前述构建的年龄推断模型,进行以下几个方面的评估:(1)灵敏度:取1份血液样本,对RNA起始模板量进行梯度稀释,以测试RT-q PCR实验方法的灵敏度;(2)重复性:取3份样本,分别重复进行三次定量检测,并验证年龄推断模型结果的一致重复性;(3)降解检材:随机取3份样本制成血斑,实验室环境下分别放置0天、1天、7天、14天、28天和90天,对比目标非编码RNA表达是否稳定及模型对同一份检材在新鲜状态下和降解检材中预测结果是否有差异;(4)跨体液适用性:取唾液、精液、月经血、阴道分泌物样本各3份,评估非编码RNA在常见人体体液中是否存在体液特异性,若不存在表达特异性,则进一步评估年龄推断模型的跨体液适用性如何。结果:1.(1)我们通过GEO和Array Express公共数据库筛选找到3个符合研究目的的mi RNAs表达谱公共数据集,分别是E-MTAB-3303、E-MTAB-1231和GSE89042。包括17-104岁的171例人外周血样本mi RNA表达谱。(2)根据筛选标准,三个数据集中,E-MTAB-3303数据集筛选出的年龄相关性mi RNAs共55个(40个上调,15个下调);E-MTAB-1231数据集共筛选出117个年龄相关性mi RNAs;GSE89042数据集共筛选出40个年龄相关性mi RNAs(30个上调,10个下调)。选择至少在两个数据集中随年龄变化显著且变化趋势一致的18个mi RNAs作为候选年龄相关性mi RNAs用于RT-q PCR实验验证。(3)RT-q PCR实验验证最终筛选出11个年龄相关性mi RNAs用于后续大样本靶向检测和年龄推断模型的构建。(4)年龄相关性mi RNAs靶基因GO富集分析和KEGG通路分析显示,mi RNA靶基因参与多种重要的细胞生理过程,且数量最多的靶基因富集在细胞衰老通路。2.(1)根据筛选标准,将年龄相关性circ RNAs分为三组:仅在年轻组中表达的circ RNAs(10个circ RNAs,0.7%);仅在老年组中表达的circ RNAs(141个circ RNAs,10%);在不同年龄组中差异表达显著的circ RNAs(1403个circ RNAs,921个上调,482个下调)。选择三组中排名前5的circ RNAs作为候选年龄相关性circ RNAs用于RT-q PCR实验验证。(2)RT-q PCR实验验证最终筛选出4个年龄相关性circ RNAs用于后续大样本靶向检测和年龄推断模型的构建。3.(1)采用5种不同机器学习算法构建年龄推断模型,结果显示,在训练集上,年龄推断的平均绝对误差值在3.68岁至6.536岁之间,测试集的平均绝对误差为6.84岁至7.985岁之间。从测试集上的表现来看,随机森林回归模型和支持向量回归模型优于其他模型。(2)仅用mi RNAs和仅用circ RNAs分别进行模型构建,结果表明,仅用circ RNAs建模,平均绝对误差为8.1岁至10.9岁;仅用mi RNA建模,平均绝对误差为9.1岁至12.6岁。(3)对年龄进行分组分析,结果表明,年轻个体与老年个体的预测误差较大,且年轻个体的年龄被高估而老年个体的年龄被低估。(4)将男性样本和女性样本分开构建模型,结果显示,在训练集上,男性样本预测误差明显低于女性样本,且不同性别样本分开建模的误差略小于合并建模时的误差。4.(1)灵敏度检验:15个非编码RNA中,9个非编码RNA的最低可检测RNA加入量为0.1ng,其余6个非编码RNA的最低模板量为0.01ng;(2)重复性检验:随机取一份血液样本,真实年龄为45岁,提取RNA重复检测了3次,以随机森林回归为例,3次年龄推断值分别为40.5岁,43.8岁和39.7岁;(3)降解检材:取3份血液样本制成血斑(实际年龄均为30岁),放置不同天数并检测目标非编码RNA的表达量情况,结果表明,15个非编码RNA在90天内血斑中虽能检测到,但均有不同程度的降解,mi RNA的稳定性较circ RNA稳定性更好,内参基因U6的稳定性优于18S r RNA的稳定性。SVR模型中,与新鲜血斑相比,陈旧血斑的年龄预测误差增大,尤其第7天之后,预测误差大于10岁;(4)跨体液适用性:本研究中构建的年龄推断体系能较好的应用于精液样本和阴道分泌物样本的年龄推断,五种模型的MAE值范围分别为5.858-8.074岁和3.854-7.733岁之间。总体来看,本研究中构建的年龄推断模型在精液、月经血和阴道分泌物样本中具有较好的应用性,而在唾液样本中表现较差。结论:1.本研究利用生物信息学技术,挖掘公共数据库中年龄相关性mi RNAs,利用circ RNA二代测序技术,分析不同年龄组circ RNA差异表达谱,筛选出年龄相关性非编码RNA标志物,并通过RT-q PCR实验验证。2.本研究利用多种机器学习算法,基于15个年龄相关性非编码RNA生物标志物,构建了5种年龄推断模型,表明联合应用mi RNA和circ RNA标志物具有年龄推断潜力。3.本研究对基于非编码RNA构建的年龄推断模型进行了系统的法医学应用评估,表明非编码RNA具有较高的检测灵敏度和抗降解能力,且在常见人体体液中有较好的适用性。