1.4.5 统计分析
统计分析是生物信息学的基石,贯穿于所有分析流程。本节介绍最常用的统计方法。 **假设检验**: - **核心问题**:观察到的差异是"真实存在"还是"随机波动"? - **p值**:在零假设(无差异)成立的条件下,观察到当前或更极端结果的概率。p < 0.05通常被视为"统计显著" - **生物应用**:差异表达分析(比较两组样本中基因表达是否有差异)、突变频率比较 - **注意事项**:p值不是...
📖 定义
统计分析是生物信息学的基石,贯穿于所有分析流程。本节介绍最常用的统计方法。
假设检验:
- 核心问题:观察到的差异是"真实存在"还是"随机波动"?
- p值:在零假设(无差异)成立的条件下,观察到当前或更极端结果的概率。p < 0.05通常被视为"统计显著"
- 生物应用:差异表达分析(比较两组样本中基因表达是否有差异)、突变频率比较
- 注意事项:p值不是"差异有多大",而是"证据有多强";需要结合效应量(effect size)解释结果
多重检验校正:
- 问题:当同时进行数千次检验(如检测2万个基因的差异表达)时,即使零假设成立,也有约5%的检验会"偶然"显著(假阳性)
- Bonferroni校正:将阈值除以检验次数,非常严格但损失统计功效
- FDR(False Discovery Rate)校正:控制假阳性比例,如Benjamini-Hochberg方法
- 生物应用:全基因组关联研究(GWAS)、RNA-Seq差异表达分析
- 重要性:不进行多重检验校正,差异表达分析几乎总会"发现"大量假阳性基因
方差分析(ANOVA):
- 原理:比较三组或更多组之间的均值差异,分解变异来源
- 生物应用:多组实验比较(如三种药物处理下的基因表达差异)、批次效应评估
- 类型:单因素ANOVA(一个分组变量)、双因素ANOVA(两个分组变量,如处理+时间)
非参数检验:
- 何时使用:数据不满足正态分布、样本量小、存在异常值
- 常用方法:Mann-Whitney U检验(两组比较)、Kruskal-Wallis检验(多组比较)、Wilcoxon符号秩检验(配对样本)
- 生物应用:基因表达数据(通常不服从正态分布)、微生物组数据(计数数据,偏态分布)
- 优点:不假设数据分布、稳健
- 局限:统计功效通常低于参数检验
生存分析(Survival Analysis):
- 核心:分析"事件发生时间"(如死亡、复发、转移)
- Kaplan-Meier曲线:直观展示不同组别的生存概率
- Cox比例风险模型:评估协变量对风险率的影响
- 生物应用:临床预后分析(根据基因表达预测患者生存时间)、药物临床试验
统计学习在生物信息学中的趋势:
- 从"统计显著"到"生物学意义":不仅看p值,还关注效应量、临床意义
- 贝叶斯方法:结合先验知识(如通路信息、蛋白质相互作用)进行推断,在生物信息学中越来越重要
- 可重复性危机:生物信息学领域正加强统计方法的规范使用,提高结果可重复性