数据特征
**统计量与参数**: - **统计量(Statistic)**:基于样本数据计算的数值,用来描述样本特征。如样本均值 $\bar{X}$、样本标准差 $s$。 - **参数(Parameter)**:描述总体特征的数值,通常是未知的。如总体均值 $\mu$、总体标准差 $\sigma$。 **常用统计量**: **(1) 均值(Mean)** 样本均值是所有观测值的总和除以观测值个数: $$\b...
📖 定义
统计量与参数:
- 统计量(Statistic):基于样本数据计算的数值,用来描述样本特征。如样本均值 $\bar{X}$、样本标准差 $s$。
- 参数(Parameter):描述总体特征的数值,通常是未知的。如总体均值 $\mu$、总体标准差 $\sigma$。
常用统计量:
(1) 均值(Mean)
样本均值是所有观测值的总和除以观测值个数:
$$\bar{X} = \frac{1}{n}\sum_{i=1}^{n} X_i \tag{2-1}$$
均值反映了数据的"重心",是最常用的集中趋势度量。但对极端值(离群值)敏感。
(2) 中位数(Median)
将数据从小到大排列后处于中间位置的值:
$$\widetilde{X} = \begin{cases} X_{\frac{n+1}{2}} & \text{(n为奇数)} \ \frac{1}{2}\left(X_{\frac{n}{2}} + X_{\frac{n}{2}+1}\right) & \text{(n为偶数)} \end{cases} \tag{2-2}$$
中位数不受极端值影响,是稳健的集中趋势度量。当数据分布偏斜时,中位数比均值更能代表"典型"值。
(3) 众数(Mode)
数据中出现频率最高的值。一个数据集可以有多个众数,也可以没有众数。
(4) 极差(Range)
$R = X_{\max} - X_{\min}$
极差是最简单的离散程度度量,但只利用了两个极端值,对数据分布的中间部分不敏感。
(5) 方差(Variance)与标准差(Standard Deviation)
方差衡量数据偏离均值的平均程度。样本方差定义为:
$$s^2 = \frac{1}{n-1}\sum_{i=1}^{n}(X_i - \bar{X})^2 \tag{2-3}$$
注意分母是 $n-1$ 而不是 $n$,这是为了得到总体方差的无偏估计(称为贝塞尔校正)。标准差是方差的平方根:$s = \sqrt{s^2}$。
为什么分母是 $n-1$ 而不是 $n$?
这是一个初学者最常困惑的问题。证明如下:
设总体方差为 $\sigma^2 = E[(X - \mu)^2]$,考虑样本方差 $s^2 = \frac{1}{n-1}\sum(X_i - \bar{X})^2$。
$$\sum(X_i - \bar{X})^2 = \sum[(X_i - \mu) - (\bar{X} - \mu)]^2 = \sum(X_i - \mu)^2 - n(\bar{X} - \mu)^2$$
取期望:
$$E\left[\sum(X_i - \bar{X})^2\right] = \sum E[(X_i - \mu)^2] - nE[(\bar{X} - \mu)^2] = n\sigma^2 - n\cdot\frac{\sigma^2}{n} = (n-1)\sigma^2$$
因此 $E[s^2] = \sigma^2$,即 $s^2$ 是 $\sigma^2$ 的无偏估计。如果使用分母 $n$,则会系统性地低估总体方差。
(6) 四分位距(IQR)
将数据从小到大排列后四等分,三个分位点分别称为第一四分位数 $Q_1$(第25百分位数)、第二四分位数 $Q_2$(中位数,第50百分位数)、第三四分位数 $Q_3$(第75百分位数)。
$$IQR = Q_3 - Q_1$$
IQR包含了中间50%的数据,是稳健的离散程度度量。
(7) 变异系数(CV)
$$CV = \frac{s}{\bar{X}} \times 100\%$$
变异系数消除了量纲影响,用于比较不同单位或不同量级数据的离散程度。
(8) 偏度(Skewness)
衡量数据分布的不对称程度:
$$g_1 = \frac{\frac{1}{n}\sum_{i=1}^{n}(X_i - \bar{X})^3}{\left[\frac{1}{n}\sum_{i=1}^{n}(X_i - \bar{X})^2\right]^{3/2}} \tag{2-4}$$
- $g_1 > 0$:右偏(正偏),长尾在右侧,均值 > 中位数
- $g_1 < 0$:左偏(负偏),长尾在左侧,均值 < 中位数
- $g_1 = 0$:对称分布
(9) 峰度(Kurtosis)
衡量数据分布的尖峭程度(相对于正态分布):
$$g_2 = \frac{\frac{1}{n}\sum_{i=1}^{n}(X_i - \bar{X})^4}{\left[\frac{1}{n}\sum_{i=1}^{n}(X_i - \bar{X})^2\right]^2} - 3 \tag{2-5}$$
- $g_2 > 0$:比正态分布更尖峭(重尾,离群值更多)
- $g_2 < 0$:比正态分布更扁平(轻尾,数据更集中)
- $g_2 = 0$:正态分布的峰度(注意:有些软件不减3,此时正态分布峰度为3)