💡 concept

聚类分析

**K-means算法**: 目标:最小化类内平方和(Within-cluster Sum of Squares, WCSS): $$WCSS = \sum_{k=1}^{K} \sum_{i \in C_k} \|x_i - \mu_k\|^2$$ 其中 $\mu_k$ 是第 $k$ 类的中心。 **算法步骤**: 1. 随机初始化 $K$ 个中心 2. 重复直到收敛: - **分配步**...

📖 定义

K-means算法
目标:最小化类内平方和(Within-cluster Sum of Squares, WCSS):
$$WCSS = \sum_{k=1}^{K} \sum_{i \in C_k} |x_i - \mu_k|^2$$
其中 $\mu_k$ 是第 $k$ 类的中心。
算法步骤
1. 随机初始化 $K$ 个中心
2. 重复直到收敛:
- 分配步:将每个样本分配到距离最近的中心所在的类
- 更新步:重新计算每个类的中心(该类所有样本的均值)
K-means的缺点
- 需要预先指定 $K$(可以用肘部法则或轮廓系数选择)
- 对初始值敏感(通常运行多次取最好结果)
- 对非球形簇效果差
- 对离群值敏感
层次聚类(Hierarchical Clustering)
不需要预先指定聚类数,生成一个树状结构(树状图,dendrogram)。
自底向上(Agglomerative)
1. 每个样本作为一个独立的类
2. 计算所有类之间的距离(如欧氏距离)
3. 合并距离最近的两个类
4. 更新距离矩阵,重复直到所有样本合并为一个类
类间距离的定义
- 单链接(Single linkage):两类中最近样本的距离
- 全链接(Complete linkage):两类中最远样本的距离
- 平均链接(Average linkage):两类中所有样本对距离的平均
- Ward法:合并后使类内平方和增加最小
层次聚类的优缺点
- 优点:不需要预设聚类数,树状图直观展示层次结构
- 缺点:计算复杂度高($O(n^3)$),对噪声和离群值敏感,一旦合并不能撤销
其他聚类方法
- DBSCAN:基于密度,可以发现任意形状的簇,自动识别离群值
- 高斯混合模型(GMM):基于概率模型,假设数据来自多个高斯分布的混合
- 谱聚类:利用图论和拉普拉斯矩阵进行聚类,适合非凸形状的数据