💡 concept

1.4.2 聚类算法

**为什么需要聚类?** 聚类是"无监督学习"——不需要预先知道类别标签,让数据"自己分组"。在生物信息学中,聚类用于发现数据中自然存在的群体结构。 **K-Means聚类**: - **原理**:预先指定K个类别,迭代地将每个样本分配到最近的中心点,然后更新中心点 - **类比**:老师让学生们按"身高相似"分组,先随机指定K个组长,然后每个人找身高最接近的组长,组长再更新为组内平均身高,反复直...

📖 定义

为什么需要聚类?
聚类是"无监督学习"——不需要预先知道类别标签,让数据"自己分组"。在生物信息学中,聚类用于发现数据中自然存在的群体结构。
K-Means聚类
- 原理:预先指定K个类别,迭代地将每个样本分配到最近的中心点,然后更新中心点
- 类比:老师让学生们按"身高相似"分组,先随机指定K个组长,然后每个人找身高最接近的组长,组长再更新为组内平均身高,反复直到稳定
- 生物应用:基因表达模式聚类、患者分型、微生物群落分类
- 优点:简单、高效
- 局限:需要预先指定K值、对初始值敏感、假设簇是球形
层次聚类(Hierarchical Clustering)
- 原理:自底向上(凝聚)或自顶向下(分裂)地构建树状结构
- 类比:从每片叶子(单个样本)开始,不断合并"最相似"的两组,直到形成一棵树
- 生物应用:基因表达热图(heatmap)的标准聚类方法、进化树构建、样本关系分析
- 优点:不需要预先指定类别数、输出树状图(dendrogram)直观展示关系
- 局限:计算复杂度高、对噪声敏感
DBSCAN(基于密度的聚类)
- 原理:将"高密度区域"识别为簇,可以自动发现任意形状的簇
- 生物应用:发现细胞亚群、识别异常样本
- 优点:能发现任意形状的簇、自动识别噪声
- 局限:对密度不均匀的数据效果不佳
聚类在生物信息学中的经典应用
- 基因共表达网络:聚类表达模式相似的基因,推断功能模块
- 癌症分子分型:基于基因表达谱将癌症患者分为不同亚型,指导治疗
- 细胞类型鉴定:聚类单细胞数据,发现新的细胞类型