论文部分内容阅读
复杂疾病,也称为多因子病,是指受多个基因控制,虽然表现出一定的家族聚集倾向性,但并不完全符合孟德尔遗传规律的一类疾病。心血管疾病、非胰岛素依赖型糖尿病、原发性高血压、肥胖及多数恶性肿瘤等众多疾病皆属复杂疾病。随着人类全基因组高精密度序列图谱的完成,越来越多的生物医学研究人员已经将注意力从单基因病的研究转移到对人类健康和社会发展影响最大的复杂疾病的研究。复杂疾病的发生、发展是受多个基因控制的,通常单个致病基因的作用微小,而多个基因之间以及基因与环境之间存在着复杂的交互作用。基于群体的病例对照研究设计的基因定位关联分析的分析策略主要是借助连锁不平衡的原理利用标记SNP检测致病基因所在的区域。另一种分析策略是利用基因与基因之间的交互作用研究复杂疾病的致病机制。目前,用于分析基因与基因之间交互作用的统计检验方法主要有:一是通过分析两基因区域内的两个代表性标记SNP之间的交互作用间接地反应基因与基因之间的交互作用,二是根据单倍域理论推断出各基因区域内的多个标记SNPs组成的单体型,然后通过检验两个基因区域内单体型之间的交互作用,来检验两个基因之间的交互作用。然而,单个SNP位点无法反映整个致病基因的作用(除非所选择的标记SNP恰好是致病位点,此种情况极为罕见)。因此,这两类分析策略存在多重校正、单体型推断不稳定、检验效能不高等问题,使得检验结果可信度不高。为了解决这些问题,本研究提出了“整体基因”的概念。所谓“整体基因(whole gene)”是指一个完整的功能基因,而不是基因上的某个标记SNP。“整体基因”关联性分析是评价基因与疾病表型关联性的重要手段,也是进一步构建遗传交互网络的基础。本研究在“整体基因”的基础上构建了基于主成分分析的booststrap可信区间检验方法(PCA-BCIT)用以检验“整体基因”与疾病表型的关联性,以及基于典型相关理论的U统计量(CCA-U统计量)用以检验“整体基因”之间交互作用的致病效应。在内容安排上,本文分为相对独立的两章。其主要研究内容如下:第一章整体基因与疾病表型关联性检验的PCA-bootstrap可信区间检验方法(PCA-BCIT):本研究将PCA和可信区间检验方法的基本原理有机结合,利用bootstrap统计模拟技术巧妙地构建了PCA-BCIT检验方法。对于基于群体的病例对照研究设计的基因分型数据,即使从同一种矩阵(例如相关系数矩阵)提取主成分,也存在四种不同的提取方法:①从病例组的基因分型相关系数矩阵与对照组的基因分型相关系数矩阵独立的提取主成分(SES);②基于病例组的基因分型相关系数矩阵提取主成分(CAES),并将主成分回归方程分别应用于病例组和对照组计算相应的主成分得分;③基于对照组的基因分型相关系数矩阵提取主成分(COES),并将主成分回归方程分别应用于病例组和对照组计算相应的主成分得分;④将病例组与对照组基因分型数据合并计算相关系数矩阵,从该矩阵提取主成分(CES),然后将主成分回归方程分别应用于病例组和对照组计算相应的主成分得分。本章同时采用了以上四种不同的主成分提取策略,并通过统计模拟和实例分析比较了它们的合理性和有效性。主要研究结论如下:(1)PCA-BCIT检验方法的结果与PCA-LRT检验方法及Armitage趋势检验等方法相比,更加可信、检验效能更高。(2)对于SES,CAES,COES和CES四种不同的主成分提取策略:①SES主成分提取方法的检验效能十分低下,实际中不宜采用。②CES,CAES和COES三种主成分提取方法均较SES主成分提取方法有效。③相比之下,COES主成分提取方法较CES和CAES两种主成分提取方法更为合理,更符合病例对照研究的基本原理。(3)PCA-BCIT检验方法较其他常规方法及PCA-LRT检验方法具有更高的实际应用价值,值得在关联分析中推广应用。特别是在研究者着眼于分析“整体基因”与疾病表型的关联性,进而构建遗传交互网络时,该方法具有明显的优势。第二章基于典型相关理论的整体基因之间交互作用的统计推断方法研究:本章在“整体基因”的概念基础上,论证了“生物学意义的交互作用”与“统计学意义的交互作用”的辩证统一性,并基于典型相关理论构建了检验整体基因之间的交互作用的CCA-U统计量。经过统计模拟和实例分析,主要结论如下:(1)CCA-U统计量近似服从正态分布,是一种有效的检验整体基因之间的交互作用的统计推断方法。(2)CCA-U统计量的优越性体现在:①与传统的Fisher方法相比,CCA-U统计量基于典型相关理论,着眼于分析两个整体基因之间的交互作用,而不是将基因与基因之间的交互作用笼统地作为两个基因主效应的剩余部分,因此具有更清晰的生物学解析。②与MDR方法、logistic回归分析、基于LD的统计量以及基于熵的统计量相比,CCA-U统计量不是检验单个SNP-SNP之间的交互作用,而是以整体基因为单位检验两整体基因之间的交互作用,有利于在此基础上构建遗传交互网络。③与logistic回归分析、基于LD的统计量以及基于熵的统计量相比,CCA-U统计量采用典型相关分析提取整体基因内的综合信息,有效地降低了自由度,避免了多重校正问题,提高了检验效能。④与基于LD的统计量等方法相比,CCA-U统计量以具有完整功能的整体基因作为单位检验基因之间的交互作用,因而无需考虑标记SNP之间的连锁不平衡现象对基因交互作用的混杂。(3)CCA-U统计量的适用条件:①一般情况下,交互作用量(r_D-r_C)大于0.1时,样本含量在1000之内便可达到可接受的检验效能。②当病例组和对照组中两整体基因之间的相关性r_D和r_C均较大(min(r_D,r_C)>0.3)时,即使样本含量较小,CCA-U统计量的检验效能也较高。③CCA-U统计量对不同的遗传交互作用模型不敏感,适用于各种遗传交互作用模型。(4)与传统方法相比,CCA-U统计量的分析结果更加有效。对于两个基因之间的交互作用:①当基于LD的统计量或logistic回归分析不能检测出两基因内的任何两两标记SNP之间存在交互作用时,CCA-U统计量仍可以检测到两基因之间存在整体交互作用。②当基于LD的统计量或logistic回归分析检测到两个基因内的标记SNP之间存在交互作用时,CCA-U统计量也可以检测到两基因之间存在整体交互作用。③仅个别情况下,特别是当样本含量小时,CCA-U统计量的检验效能降低。