论文部分内容阅读
大量SNP标记的出现,使以单个标记为中心的关联分析方法逐渐转变成以单倍型为主的关联分析方法。以单倍型为主的分析方法的首要问题是如何获取单倍型。通过实验手段获取单倍型成本较高,利用基因型数据通过单倍型推断获取单倍型是当前首选方法。
针对一般系谱和紧密连锁的SNP标记,本研究提出了一种快速和准确的单倍型推断方法。该方法通过三步六条规则,利用亲子关系确定有序基因型,逐步剔除多余的单倍型,最后通过最大似然法确定单倍型组合。利用SIMPED程序模拟数据验证在不同系谱大小,不同标记数目和不同标记基因型缺失率等参数组合条件下,单倍型推断方法的效率和准确性,并与PEDPHASE程序作比较。结果表明我们的方法的运行速度和准确性都优于PEDPHASE。我们的方法的运行速度比PEDPHASE快10~15倍;准确性比PEDPHASE高4~10%。同时结果还说明了我们的方法的准确性几乎不受系谱大小、标记数目和标记基因型缺失率的影响。
在零重组单倍型推断方法的基础上,本研究又提出了有重组的单倍型推断方法。同样,该方法也是三步六规则,利用亲子关系确定有序基因型,逐步剔除多余的单倍型,最后通过最大似然法确定单倍型组合。与零重组单倍型推断方法不同的地方在于本方法的六条规则要按标记顺序正向和反向运行两次,同时本方法第五条规则中的阈值与零重组单倍型推断方法不同,由零重组数阈值变成最小重组数阈值。同样该方法也通过SIMPED模拟不同系谱大小、标记数目、标记间重组率和标记基因型缺失率等共81种参数组合情况下的标记基因型数据,从而对算法的效率和准确性进行验证,并与PEDPHASE进行比较。结果说明我们的方法具有较高的效率和准确性,在绝大多数的情况下要优于PEDPHASE。
在对上述单倍型推断算法进行验证的同时,我们还分析系谱大小和结构、标记数目、标记基因型缺失率和标记间重组率对单倍型推断的影响。
随着系谱变大,单倍型推断算法运行时间也增长。一般情况下,单倍型推断的准确性会随着系谱增大而降低;但是在零重组的条件下,单倍型推断的准确性有随着系谱增大而提高的趋势;系谱中基础群个体比例的增加会降低单倍型推断的准确性。
标记数目的增加会加长单倍型推断算法的运行时间。在标记间重组率较大的情况下,单倍型推断的准确性会随着标记数目的增加而明显降低;当标记间重组率较小时,这种降低的趋势就变得不明显了。
标记间重组率对单倍型推断的影响非常大。在零重组的条件下,单倍型推断的准确率相当高,可以接近和达到1;在有重组的情况下,单倍型推断的准确率会随着重组率的增加而降低,且变化明显。同时标记问重组率较高时单倍型推断算法运行时间也会加长。
标记基因型缺失率对算法运行时间有较大影响。一般的,算法的运行的时间会随着标记基因型缺失率的增加而增长。标记基因型缺失率增加也会导致单倍型推断的准确性降低,但是这种趋势受到重组率的限制和影响。当标记间重组率较大时,随着标记基因型缺失率增加,单倍型推断的准确性会明显降低;当标记间的重组率较小时,单倍型推断的准确性降低的趋势不明显。