💡
concept
随机森林
**随机森林(Random Forest)**在Bagging的基础上进一步减少树之间的相关性: 1. 对每棵树,bootstrap采样生成训练集 2. 在每个节点分裂时,随机选择 $m$ 个变量(通常 $m = \sqrt{p}$ 或 $p/3$),从中选择最优分裂变量 3. 不剪枝,让树完全生长 4. 预测时,所有树的预测平均(回归)或投票(分类) **随机森林的优势**: - 预测精度高,不...
📖 定义
随机森林(Random Forest)在Bagging的基础上进一步减少树之间的相关性:
1. 对每棵树,bootstrap采样生成训练集
2. 在每个节点分裂时,随机选择 $m$ 个变量(通常 $m = \sqrt{p}$ 或 $p/3$),从中选择最优分裂变量
3. 不剪枝,让树完全生长
4. 预测时,所有树的预测平均(回归)或投票(分类)
随机森林的优势:
- 预测精度高,不易过拟合
- 不需要交叉验证来估计泛化误差(OOB误差)
- 可以评估变量重要性(通过permutation importance或Gini importance)
- 并行计算友好
变量重要性:
- Gini Importance:某变量在所有树中带来的不纯度减少的平均值
- Permutation Importance:随机打乱某变量的值,观察模型性能下降的程度
OOB(Out-of-Bag)误差:
每个样本在bootstrap抽样中没有被选中的概率约为 $e^{-1} \approx 0.368$。对于这些样本,可以用没有使用它们的树来预测,得到OOB预测。OOB误差是OOB预测与真实标签的差异,是无偏的泛化误差估计。