💡 concept

三、代谢组学数据处理

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

📖 定义

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能