💡 concept

降维

**主成分分析(PCA)**: PCA通过线性变换将数据投影到新的正交坐标系中,使得第一主成分方向上的数据方差最大,第二主成分方向上的方差次大,且与第一主成分正交,以此类推。 **数学原理**: 设数据矩阵 $X \in \mathbb{R}^{n \times p}$(已中心化)。寻找投影方向 $\beta$($\|\beta\| = 1$)使 $Var(X\beta) = \beta^T \S...

📖 定义

主成分分析(PCA)
PCA通过线性变换将数据投影到新的正交坐标系中,使得第一主成分方向上的数据方差最大,第二主成分方向上的方差次大,且与第一主成分正交,以此类推。
数学原理
设数据矩阵 $X \in \mathbb{R}^{n \times p}$(已中心化)。寻找投影方向 $\beta$($|\beta| = 1$)使 $Var(X\beta) = \beta^T \Sigma \beta$ 最大,其中 $\Sigma$ 是协方差矩阵。
通过拉格朗日乘子法:
$$\max_{\beta} \beta^T \Sigma \beta \quad \text{s.t.} \quad \beta^T \beta = 1$$
解为 $\Sigma$ 的最大特征值对应的特征向量。第 $k$ 主成分对应第 $k$ 大特征值 $\lambda_k$ 的特征向量。
方差贡献率
$$PC_k \text{ 的贡献率} = \frac{\lambda_k}{\sum_{j=1}^{p} \lambda_j}$$
通常选择前几个主成分,使其累计贡献率达到80%-90%。
t-SNE(t-Distributed Stochastic Neighbor Embedding)
PCA是线性降维,可能无法捕捉非线性结构。t-SNE通过保持高维空间中样本之间的局部相似性来进行非线性降维。
核心思想:
1. 在高维空间中,定义样本 $i$ 和 $j$ 之间的相似度为条件概率:
$$p_{j|i} = \frac{\exp(-|x_i - x_j|^2 / 2\sigma_i^2)}{\sum_{k \neq i} \exp(-|x_i - x_k|^2 / 2\sigma_i^2)}$$
2. 在低维空间中,用t分布定义相似度:
$$q_{ij} = \frac{(1 + |y_i - y_j|^2)^{-1}}{\sum_{k \neq l} (1 + |y_k - y_l|^2)^{-1}}$$
3. 最小化 $p_{ij}$ 和 $q_{ij}$ 之间的KL散度
t-SNE特别适合可视化高维数据的局部结构,但全局距离可能不准确。通常先用PCA降维到50维左右,再用t-SNE。
UMAP(Uniform Manifold Approximation and Projection)
UMAP是近年来流行的降维方法,相比t-SNE:
- 速度更快,适合大规模数据
- 保留更多的全局结构
- 更好的理论保证(基于黎曼几何和代数拓扑)