⚙️ algorithm

三、Seurat分析流程

Seurat是scRNA-seq分析最广泛使用的R包,由Satija Lab开发。 **标准分析流程**: ``` 原始数据 (Cell Ranger输出) ↓ 创建Seurat对象 ↓ 质控过滤 (nFeature, nCount, percent.mt) ↓ 标准化 (LogNormalize, SCTransform) ↓ 高变基因选择 (FindVariab...

📖 定义

Seurat是scRNA-seq分析最广泛使用的R包,由Satija Lab开发。
标准分析流程

原始数据 (Cell Ranger输出)
    ↓
创建Seurat对象
    ↓
质控过滤 (nFeature, nCount, percent.mt)
    ↓
标准化 (LogNormalize, SCTransform)
    ↓
高变基因选择 (FindVariableFeatures)
    ↓
缩放 (ScaleData)
    ↓
线性降维 (PCA)
    ↓
非线性降维 (UMAP/t-SNE)
    ↓
聚类 (FindNeighbors + FindClusters, Louvain算法)
    ↓
细胞类型注释 (marker基因/自动注释)
    ↓
差异表达分析 (FindAllMarkers)
    ↓
可视化 (DimPlot, FeaturePlot, VlnPlot)

(1)质控
- nFeature_RNA:每个细胞检测到的基因数。过低(<200)可能是死细胞/空液滴;过高(>5000-8000)可能是双细胞
- nCount_RNA:每个细胞的总UMI数。与nFeature相关
- percent.mt:线粒体基因比例。过高(>10-20%)提示细胞膜破损,细胞质RNA流失
(2)标准化
- LogNormalize:对每个细胞的总UMI数进行标准化,然后取log1p
$$norm_count = \log\left( \frac{count}{total_UMI} \times 10000 + 1 \right)$$
- SCTransform:使用正则化负二项回归进行标准化,同时去除技术变异(如测序深度影响),效果通常优于简单标准化
(3)降维与聚类
- PCA:线性降维,保留主要变异方向
- UMAP(Uniform Manifold Approximation and Projection):非线性降维,保留局部结构的同时拉开不同聚类
- Louvain聚类:基于共享最近邻(SNN)图的社区检测算法
(4)细胞类型注释
- 根据已知marker基因的表达进行手动注释
- 或使用自动注释工具(SingleR, scCATCH, celldex)
- 常用marker:
- T细胞:CD3D, CD3E
- B细胞:CD79A, MS4A1
- 单核/巨噬细胞:CD14, LYZ
- NK细胞:NKG7, GNLY