逆概率加权(IPW)
**倾向得分(Propensity Score)**: $$e(Z) = P(X=1|Z)$$ 即给定协变量 $Z$ 下接受干预的概率。通常通过Logistic回归估计。 **IPW估计量**: 给每个样本赋予权重: - 干预组:$w_i = 1 / e(Z_i)$ - 对照组:$w_i = 1 / (1 - e(Z_i))$ 然后计算加权平均: $$\hat{\tau}_{IPW} = \fra...
📖 定义
倾向得分(Propensity Score):
$$e(Z) = P(X=1|Z)$$
即给定协变量 $Z$ 下接受干预的概率。通常通过Logistic回归估计。
IPW估计量:
给每个样本赋予权重:
- 干预组:$w_i = 1 / e(Z_i)$
- 对照组:$w_i = 1 / (1 - e(Z_i))$
然后计算加权平均:
$$\hat{\tau}{IPW} = \frac{1}{n}\sum{i=1}^{n} \left[\frac{X_i Y_i}{e(Z_i)} - \frac{(1-X_i)Y_i}{1-e(Z_i)}\right]$$
IPW的思想是:对干预组中那些"不太可能被分配到干预"(倾向得分小)的样本赋予更大权重,使得加权后的样本分布近似于随机化试验。
IPW的局限性:
- 当倾向得分接近0或1时,权重变得极大,导致方差爆炸
- 需要正确指定倾向得分模型
修剪(Trimming):
当倾向得分极端时,可以剔除倾向得分 < 0.1 或 > 0.9 的样本,减少方差但引入偏差。
重叠权重(Overlap Weights):
$$w_i = X_i(1-e(Z_i)) + (1-X_i)e(Z_i)$$
重叠权重给倾向得分接近0.5的样本更大权重,自动排除极端倾向得分的样本,具有更好的有限样本性质。