基因组选择(GS)的原理
**1. 基本概念** 基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。 假设个体的表型值P可以分解为: P = μ + g + e 其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。 GS的目标是利用标记基因型X来预测遗传效应...
📖 定义
1. 基本概念
基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。
假设个体的表型值P可以分解为:
P = μ + g + e
其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。
GS的目标是利用标记基因型X来预测遗传效应g:
g = Xβ + ε
其中,β为标记效应向量。
2. 统计模型
基因组选择的核心是估计每个标记的效应。由于标记数(p,通常为数千至数百万)远大于个体数(n,数百至数千),传统的最小二乘法无法直接使用,需要借助特殊统计方法:
- 岭回归最佳线性无偏预测(RR-BLUP):假设所有标记效应服从正态分布,通过L2正则化(岭回归)解决过拟合问题。计算速度快,是GS的基准方法。
- 贝叶斯方法(BayesA、BayesB、Bayesian LASSO等):假设标记效应服从不同的先验分布。BayesB假设只有少数标记具有大效应(大部分标记效应为0),更符合真实遗传架构。
- GBLUP(Genomic BLUP):利用标记信息构建基因组关系矩阵G,替代传统的系谱关系矩阵A,进行最佳线性无偏预测。
- 机器学习算法:随机森林(RF)、支持向量机(SVM)、神经网络等也被用于GS,在处理非加性遗传效应时可能优于线性模型。
3. 实施流程
(1) 训练群体构建:选择具有代表性的群体,测定高密度SNP基因型和目标性状表型。
(2) 统计模型训练:利用训练数据估计标记效应。
(3) 育种值预测:对候选个体(仅有基因型)计算GEBV。
(4) 选择决策:根据GEBV排名,选择最优个体进入下一代。
(5) 模型更新:定期用新收集的表型数据更新预测模型,保持预测准确性。
4. 影响预测准确性的因素
- 训练群体大小:一般而言,训练群体越大,预测准确性越高。
- 训练群体与候选群体的亲缘关系:关系越近,预测越准确。
- 性状遗传力:遗传力越高,GS效果越好。
- 标记密度:需要足够密度的标记覆盖全基因组,捕获LD信息。
- 性状遗传架构:由大量微效基因控制的性状更适合GS。