💡
concept
四、变异检测的统计基础
变异检测的核心是判断某个位置的碱基差异是真实的遗传变异还是测序/比对错误。这本质上是一个统计假设检验问题。 **零假设(H₀)**:该位置没有变异,所有观察到的差异都是测序错误 **备择假设(H₁)**:该位置存在变异 测序错误通常被建模为**二项分布**或**贝叶斯模型**: - 设测序错误率为ε(通常ε≈0.001,对应Q30) - 在覆盖度为D的位置,观察到k个非参考碱基 - 如果H₀成立,...
📖 定义
变异检测的核心是判断某个位置的碱基差异是真实的遗传变异还是测序/比对错误。这本质上是一个统计假设检验问题。
零假设(H₀):该位置没有变异,所有观察到的差异都是测序错误
备择假设(H₁):该位置存在变异
测序错误通常被建模为二项分布或贝叶斯模型:
- 设测序错误率为ε(通常ε≈0.001,对应Q30)
- 在覆盖度为D的位置,观察到k个非参考碱基
- 如果H₀成立,k ~ Binomial(D, ε)
- 计算P(k | H₀),如果该P值小于阈值(如0.05),则拒绝H₀,判定为变异
基因型似然模型:
更精确的方法是对三种可能的基因型(参考纯合RR、杂合RA、变异纯合AA)分别计算似然值:
- L(RR) = ∏ P(read_i | RR)
- L(RA) = ∏ P(read_i | RA)
- L(AA) = ∏ P(read_i | AA)
选择似然值最大的基因型作为该位点的基因型。
GATK HaplotypeCaller使用更先进的单倍型模型,在局部区域(通常数百bp)同时考虑所有可能的变异,通过局部de novo组装生成候选单倍型,然后计算每个单倍型的似然值。