1.4.1 降维算法
**为什么需要降维?** 生物数据通常具有"高维"特征。例如: - 一个RNA-Seq实验可能测量2万多个基因的表达 - 一个基因组变异研究可能检测数百万个SNP位点 - 一个单细胞测序实验可能同时测量数万个基因在数千个细胞中的表达 维度如此之高,人类无法直观理解,计算也会遇到"维度灾难"。降维算法将数据投影到低维空间,保留最重要的信息。 **主成分分析(PCA)**: - **原理**:寻找数据...
📖 定义
为什么需要降维?
生物数据通常具有"高维"特征。例如:
- 一个RNA-Seq实验可能测量2万多个基因的表达
- 一个基因组变异研究可能检测数百万个SNP位点
- 一个单细胞测序实验可能同时测量数万个基因在数千个细胞中的表达
维度如此之高,人类无法直观理解,计算也会遇到"维度灾难"。降维算法将数据投影到低维空间,保留最重要的信息。
主成分分析(PCA):
- 原理:寻找数据中方差最大的方向,将数据投影到这些方向上
- 类比:想象一个三维的云朵,PCA找到云朵"最长"和"次长"的两个方向,将其投影到二维平面上
- 生物应用:基因表达数据可视化、群体遗传结构分析(如PCA用于推断人群祖先成分)、批次效应校正
- 优点:无监督、计算高效、结果可解释
- 局限:只能捕获线性关系
t-SNE(t-分布随机邻域嵌入):
- 原理:在高维空间中"相近"的样本,在低维空间中也应该"相近";优化低维表示使得这种"邻近关系"尽可能保持
- 类比:把一张揉皱的地图展平,尽量保持邻近城市的相对位置
- 生物应用:单细胞RNA-Seq数据可视化(如Seurat包中的标准流程)、细胞类型识别、发育轨迹推断
- 优点:擅长揭示非线性结构、可视化效果好
- 局限:计算成本高、结果随机性强、全局结构保持不佳
UMAP(统一流形近似与投影):
- 原理:基于流形学习(manifold learning)和拓扑数据分析,保持数据的局部和全局结构
- 生物应用:单细胞数据降维、空间转录组数据可视化
- 优点:比t-SNE更快、能更好地保持全局结构、更稳定
- 局限:参数调优较复杂
选择建议:PCA适合初步探索和线性结构;t-SNE适合精细可视化;UMAP是二者的折中,是目前单细胞分析的首选。