1.4.3 分类算法
**为什么需要分类?** 分类是"监督学习"——需要预先标注的训练数据,然后训练模型预测新样本的类别。在生物信息学中,分类用于预测疾病的诊断、药物的效果、蛋白质的功能等。 **决策树(Decision Tree)**: - **原理**:通过一系列"如果...那么..."的判断规则,将样本分配到不同类别 - **类比**:医生诊断流程图——"如果发烧且咳嗽,那么可能是流感;如果发烧且无咳嗽,那么可...
📖 定义
为什么需要分类?
分类是"监督学习"——需要预先标注的训练数据,然后训练模型预测新样本的类别。在生物信息学中,分类用于预测疾病的诊断、药物的效果、蛋白质的功能等。
决策树(Decision Tree):
- 原理:通过一系列"如果...那么..."的判断规则,将样本分配到不同类别
- 类比:医生诊断流程图——"如果发烧且咳嗽,那么可能是流感;如果发烧且无咳嗽,那么可能是..."
- 生物应用:疾病诊断决策、基因功能分类、突变有害性预测(如SIFT、PolyPhen)
- 优点:可解释性强、不需要数据标准化
- 局限:容易过拟合、对数据变化敏感
支持向量机(SVM):
- 原理:在高维空间中寻找一个超平面,使不同类别的样本间隔最大化
- 类比:想象两类水果(苹果和橙子),SVM找到一条"最宽"的分界线,把两类水果分开
- 生物应用:蛋白质分类、疾病亚型识别、基因选择
- 优点:在高维空间表现好、泛化能力强
- 局限:大数据集训练慢、核函数选择困难
随机森林(Random Forest):
- 原理:构建多棵决策树,每棵树用随机抽样的样本和特征训练,最后投票决定分类
- 类比:让一个"专家委员会"(多棵树)投票决定,每个专家看问题的角度不同(随机特征),综合结果更稳健
- 生物应用:特征选择(识别重要基因)、疾病风险预测、蛋白质-蛋白质相互作用预测
- 优点:准确率高、能评估特征重要性、不易过拟合
- 局限:模型复杂、训练时间长
深度学习(Deep Learning):
- 原理:多层神经网络自动学习特征表示
- 生物应用:蛋白质结构预测(AlphaFold)、基因表达调控预测、药物分子生成、病理图像诊断
- 优点:表示能力强、自动特征提取
- 局限:需要大量训练数据、计算成本高、可解释性差("黑箱"问题)
分类算法选择建议:
- 小样本、需要可解释性:决策树、SVM
- 大数据、追求准确率:随机森林、深度学习
- 生物信息学实际问题:往往需要尝试多种方法,交叉验证选择最优