回归树和决策树
**决策树(Decision Tree)**是一种递归分割的模型,将特征空间划分为多个区域,每个区域赋予一个预测值。 **回归树**: - 对于每个节点,选择最优的分裂变量和分裂点,使左右子节点的响应变量方差之和最小 - 叶子节点的预测值是该节点内所有样本响应变量的均值 **决策树(分类)**: - 选择使不纯度(如基尼指数、信息熵)减少最多的分裂 - 叶子节点的预测值是类别多数表决 **基尼指数...
📖 定义
决策树(Decision Tree)是一种递归分割的模型,将特征空间划分为多个区域,每个区域赋予一个预测值。
回归树:
- 对于每个节点,选择最优的分裂变量和分裂点,使左右子节点的响应变量方差之和最小
- 叶子节点的预测值是该节点内所有样本响应变量的均值
决策树(分类):
- 选择使不纯度(如基尼指数、信息熵)减少最多的分裂
- 叶子节点的预测值是类别多数表决
基尼指数(Gini Index):
$$Gini = 1 - \sum_{k=1}^{K} p_k^2$$
其中 $p_k$ 是节点中第 $k$ 类的比例。Gini越小,节点纯度越高。
信息熵(Entropy):
$$Entropy = -\sum_{k=1}^{K} p_k \log p_k$$
信息增益(Information Gain):
$$IG = Entropy_{parent} - \frac{n_{left}}{n} Entropy_{left} - \frac{n_{right}}{n} Entropy_{right}$$
选择使信息增益最大的分裂。
决策树的优缺点:
- 优点:可解释性强,不需要特征缩放,能处理非线性关系
- 缺点:容易过拟合,不稳定(小的数据变化可能导致完全不同的树),预测精度通常不如集成方法