一、 什么是育种值估计?
在育种工作中,我们无法直接观测到个体的遗传组成,只能通过其表现型(Phenotype, P)来推断。育种值(Breeding Value, BV)被定义为个体携带基因对后代平均贡献的加性效应总和。育种值估计的核心目标,就是从混杂了环境效应、非加性遗传效应(如显性、上位性)的表现型数据中,剥离出纯粹的加性遗传信息。
⚡ 核心定义
育种值(A)是个体所有基因加性效应的总和。它是可遗传给后代的部分,也是选择反应(R)的决定因素。
⚙️ 基本模型
表现型(P)= 固定效应(B)+ 随机遗传效应(A)+ 随机环境误差(E)。即 P = B + A + E。
〓 估计目标
在已知所有其他参数的前提下,求解随机效应 A 的最佳线性无偏预测值(BLUP),即 EBV(Estimated Breeding Value)。
二、 育种值估计的核心公式解析
理解育种值估计公式,关键在于掌握混合模型方程组(MME)的构建。这是现代育种计算的基石。
1. 一般线性混合模型
最基础的数学表达式为:
其中:
- y:观测值向量(如产奶量、体重)。
- b:固定效应向量(如场、年、季、性别)。
- a:随机加性遗传效应向量(即我们要估计的育种值)。
- e:随机残差效应向量(包含非加性遗传效应及未测量环境效应)。
- X, Z:设计矩阵,用于连接观测值与效应。
2. 方差-协方差结构
为了进行最佳预测,必须假设随机效应服从正态分布,且其协方差结构已知:
在单性状动物模型中,通常假设:
- Var(a) = Aσ²a:其中 A 是加性关系矩阵(Numerator Relationship Matrix),σ²a 是加性遗传方差。
- Var(e) = Iσ²e:I 是单位矩阵,σ²e 是残差方差。
3. 混合模型方程组(MME)
通过最小二乘法推导,得到求解 b 和 a 的方程组:
[ Z'R⁻¹X Z'R⁻¹Z + A⁻¹(L) ] [ a ] = [ Z'R⁻¹y ]
其中 L = σ²e / σ²a = 1/h² - 1。这个方程组的解给出了固定效应的 BLUE 和随机效应的 BLUP。
三、 参数估计与计算方法
在实际应用中,方差组分(σ²a, σ²e)通常是未知的,需要预先估计。以下是主要的计算流程与方法对比。
限制性最大似然法(REML)
REML(Restricted Maximum Likelihood)是目前估计方差组分的主流方法。与传统的 ML 法不同,REML 考虑了固定效应所损失的自由度,从而得到无偏的方差估计。
核心步骤:
- 迭代启动: 给定初始方差组分值。
- 求解 MME: 计算当前参数下的育种值预测值。
- 更新方差: 利用预测残差和育种值,通过期望最大化(EM)算法或 Fisher Scoring 算法更新方差组分。
- 收敛判断: 当方差组分的变化小于设定阈值时停止迭代。
优势: 能够处理不平衡数据(如不同场、不同年份的记录数不同),是现代育种软件(如 ASReml, DMU, VCE)的标准配置。
混合模型求解算法
当群体规模庞大(数万至数百万个体)时,直接求解 MME 的计算量巨大。Henderson 提出了三种主要方法:
- 直接法: 直接求逆 MME 矩阵。适用于小规模群体(N < 1000)。
- 平均-迭代法(AI-REML): 用于高效估计方差组分。
- 共轭梯度法(CG): 利用矩阵的稀疏性,无需显式求逆,适用于大规模基因组数据。
| 算法 | 计算复杂度 | 适用场景 | 内存需求 |
|---|---|---|---|
| 直接求逆 | O(N³) | 小群体、单性状 | 高 |
| 共轭梯度 (CG) | O(N²) 或更低 | 大群体、多性状 | 中 |
| 期望最大化 (EM) | O(N²) | 方差组分估计 | 中 |
基因组选择(GBLUP)
随着 SNP 芯片技术的发展,育种值估计进入了基因组时代。GBLUP 的基本思想是用基因组关系矩阵(G)替代系谱关系矩阵(A)。
公式变化:
Var(g) = Gσ²g
G 矩阵的计算:
通常使用 VanRaden 方法计算:
其中 M 是中心化后的基因型矩阵,pᵢ 是第 i 个位点的等位基因频率。基因组选择能够捕捉到 Mendel 抽样误差,显著提高年轻个体的选择准确性。
四、 育种值估计技术的发展历程
从简单的家系平均到复杂的基因组模型,育种值估计技术经历了多次范式转移。
传统选择指数(Selection Index)
Hazel 和 Lush 建立了基于表型和亲属信息的选择指数理论。主要依赖家系平均或同胞测定,假设方差组分已知且恒定。这是育种值估计的萌芽期。
BLUP 时代的到来
C.R. Henderson 提出了最佳线性无偏预测(BLUP)理论,并证明了如何利用系谱关系矩阵 A 同时校正固定效应和利用亲属信息。这标志着现代动物育种的诞生。
REML 与计算机化
限制性最大似然法(REML)成为方差组分估计的标准。随着计算机性能提升,混合模型方程组的求解成为可能,大规模育种计划(如奶牛育种)开始实施。
基因组选择(Genomic Selection)
Meuwissen, Hayes 和 Goddard 提出基因组选择概念。利用高密度 SNP 标记直接估计育种值(GEBV),打破了选择间隔的限制,使育种进展速度提升了数倍。五、 实际应用与案例解析
育种值估计不仅存在于理论中,更广泛应用于奶牛、生猪、家禽及林木育种。
案例 1:奶牛产奶量育种
奶牛育种是全球最成功的育种计划之一。通过 BLUP 模型,结合全球数百万头奶牛及其后裔的产奶记录,计算每头公牛的“女儿产奶量差值”(DGV)或直接估计育种值。
- 挑战: 公牛只有在成年后才能通过女儿测定评估,选择间隔长。
- 解决方案: 引入基因组信息,对犊牛进行 SNP 分型,提前 1-2 年进行选种,显著加速遗传进展。
案例 2:生猪背膘厚与日增重
生猪育种中,背膘厚(脂肪沉积)与日增重(瘦肉生长)往往存在负相关。育种值估计通过构建多性状模型(Multivariate Model),在提高日增重的同时,控制背膘厚的不合理增加。
| 性状 | 遗传力 (h²) | 主要信息来源 | 估计精度 |
|---|---|---|---|
| 日增重 | 0.30 - 0.40 | 个体记录 + 同胞 | 中 |
| 背膘厚 | 0.40 - 0.50 | 活体超声 + 屠宰 | 中高 |
| 产仔数 | 0.10 - 0.15 | 母系亲属 + 基因组 | 低 (依赖基因组) |
七、 常见问题解答(FAQ)
遗传力(h²)决定了表型值中有多少比例是由加性遗传效应决定的。它是构建混合模型方程组中随机效应权重(L = 1/h² - 1)的关键参数。如果遗传力估计不准,会导致育种值预测的偏差和精度下降。
BLUP 是基于系谱关系的最佳线性无偏预测,而 GBLUP 是基于基因组标记关系矩阵的最佳线性无偏预测。GBLUP 能更精确地反映个体间的真实亲缘关系,特别是在近交严重的群体中,且能用于无系谱信息的个体。
小样本会导致方差组分估计不准确,进而影响育种值精度。通常建议训练群规模至少为独立染色体片段数(Me)的 10-20 倍。对于小样本,可采用贝叶斯方法(如 BayesR)或引入先验信息来提高稳定性。
常用方法包括:1) 交叉验证(Cross-Validation),将数据分为训练集和验证集;2) 比较预测育种值与实际后代测定结果的相关性;3) 检查残差的分布是否符合正态假设。