蛋白质组学和代谢组学

6 个小节 · 36 个知识点

蛋白质组学概述

💡

第9章 蛋白质组学和代谢组学

chapter

> 章节导读:蛋白质是生命活动的主要承担者,代谢物则是基因表达和蛋白质功能的最终产物。蛋白质组学通过高通量质谱技术系统鉴定和定量生物样本中的蛋白质,揭示蛋白质表达、修饰和相互作用的全景图。代谢组学则通过检测小分子代谢物的组成和变化,反映生物体的生理和病理状态。近年来,以深度学习为代表的人工智能技术在蛋白质结构预测和功能分析中取得了革命性突破。本章将系统介绍蛋白质组学、蛋白质结构分析、分子动力学模拟、功能预测以及代谢组学的基本原理和生物信息学分析方法。

查看详情 →
💡

9.1 蛋白质组学概述

section
查看详情 →
💡

一、蛋白质组学的研究内容

concept

蛋白质组学根据研究目的可分为三大类: **1. 表达蛋白质组学(Expression Proteomics)** - 研究蛋白质在不同生理、病理条件下的表达变化 - 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free) - 应用:疾病生物标志物发现、药物靶点鉴定 **2. 结构蛋白质组学(Structural Proteomics)** - 研究蛋白质的三维结构...

蛋白质组学根据研究目的可分为三大类:
1. 表达蛋白质组学(Expression Proteomics)
- 研究蛋白质在不同生理、病理条件下的表达变化
- 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free)
- 应用:疾病生物标志物发现、药物靶点鉴定
2. 结构蛋白质组学(Structural Proteomics)
- 研究蛋白质的三维结构及其动态变化
- 方法:X射线晶体学、NMR、冷冻电镜、计算结构预测
- 应用:蛋白质功能机制、药物设计
3. 功能蛋白质组学(Functional Proteomics)
- 研究蛋白质的功能、相互作用和信号通路
- 方法:蛋白质芯片、酵母双杂交、Co-IP/质谱、Proximity labeling
- 应用:蛋白质网络构建、信号转导通路解析

查看详情 →
💡

二、质谱技术原理

concept

**质谱仪的基本组成**: 1. **离子源**:将分析物转化为气相离子 - ESI(电喷雾电离):适用于液相样品,可产生多电荷离子 - MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子 2. **质量分析器**:按质荷比(m/z)分离离子 - 四极杆(Quadrupole):结构简单,常用于一级筛选 - 飞行时间(TOF):质量范围宽,分辨率较高...

质谱仪的基本组成
1. 离子源:将分析物转化为气相离子
- ESI(电喷雾电离):适用于液相样品,可产生多电荷离子
- MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子
2. 质量分析器:按质荷比(m/z)分离离子
- 四极杆(Quadrupole):结构简单,常用于一级筛选
- 飞行时间(TOF):质量范围宽,分辨率较高
- 轨道阱(Orbitrap):超高分辨率(>100,000),质量精度高(<1 ppm)
- 离子阱(Ion Trap):可进行多级碎裂(MSn)
3. 检测器:检测并记录离子信号
4. 数据处理系统:将信号转化为质谱图
串联质谱(MS/MS或MS²)
- 第一级质谱(MS1):分离和选择特定质荷比的母离子(precursor ion)
- 碰撞室:母离子与惰性气体(如N₂、Ar)碰撞,发生裂解(CID/HCD/EThcD)
- 第二级质谱(MS2):分析碎片离子(fragment ions)的质荷比
- 碎片类型:b离子(N端碎片)、y离子(C端碎片)为主

查看详情 →
💡

三、鸟枪法蛋白质组学流程

concept

**实验部分**: 1. **蛋白质提取**:从细胞/组织中提取总蛋白质 2. **蛋白质定量**:BCA/Bradford法测定蛋白质浓度 3. **蛋白质还原和烷基化**:DTT还原二硫键,IAA烷基化保护游离巯基 4. **酶解**:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段 5. **肽段脱盐**:C18柱去除盐类和干扰物 6. **LC-MS/MS分析**: - 液...

实验部分
1. 蛋白质提取:从细胞/组织中提取总蛋白质
2. 蛋白质定量:BCA/Bradford法测定蛋白质浓度
3. 蛋白质还原和烷基化:DTT还原二硫键,IAA烷基化保护游离巯基
4. 酶解:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段
5. 肽段脱盐:C18柱去除盐类和干扰物
6. LC-MS/MS分析
- 液相色谱(nano-LC)分离肽段(通常60-120分钟梯度)
- 电喷雾离子化(ESI)进入质谱仪
- 数据依赖采集(DDA):MS1全扫描 → 选择前N个最强离子进行MS2碎裂
- 数据非依赖采集(DIA):MS1全扫描 → 对预设m/z窗口进行系统MS2碎裂
计算部分
1. 数据库搜索
- 输入:MS2谱图 + 蛋白质序列数据库
- 过程:根据母离子质量筛选候选肽段 → 预测理论碎片谱图 → 与实验谱图比对打分
- 输出:PSM列表(肽段-谱图匹配结果)
2. FDR控制
- 目标-诱饵库策略(Target-Decoy):构建随机或反序的诱饵数据库,与目标数据库同时搜索
- 混合搜库FDR = 2×R / (F + R),其中F为目标库匹配数,R为诱饵库匹配数
- 分开搜库FDR = R / F
- 通常FDR < 1%作为可信鉴定阈值
3. 蛋白质组装
- 从肽段推断蛋白质:Occam's Razor原则(用最少的蛋白质解释所有肽段)
- 处理共享肽段(不同蛋白质产生的相同肽段)
- 概率型组装(如ProteinProphet):基于肽段置信度计算蛋白质水平概率
4. 蛋白质定量
- 标记定量:TMT/iTRAQ的 reporter ion 强度比
- SILAC:轻/重同位素标记肽段的峰面积比
- Label-free:基于肽段色谱峰面积或谱图计数(spectral counting)
- 定量值归一化:消除系统偏差

查看详情 →
💡

四、翻译后修饰蛋白质组学

concept

**磷酸化蛋白质组学**: - 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化 - 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%) - 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr) - 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄) - 软件:MaxQuant、Proteome Discoverer、pFi...

磷酸化蛋白质组学
- 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化
- 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%)
- 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr)
- 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄)
- 软件:MaxQuant、Proteome Discoverer、pFind(支持磷酸化位点定位)
糖基化蛋白质组学
- N-糖基化:Asn-X-Ser/Thr序列模体(X≠Pro),发生在内质网/高尔基体
- O-糖基化:主要发生在Ser/Thr,无特定序列模体
- 富集策略:凝集素亲和色谱、亲水相互作用色谱(HILIC)
- 鉴定挑战:糖链异质性导致同一肽段产生多种糖型
- 软件:Byonic、pGlyco、NGlycan
泛素化蛋白质组学
- 泛素化通过蛋白酶体途径调控蛋白质降解
- 富集策略:K-GG抗体(识别泛素化留下的Lys-Gly-Gly足迹)
- 应用:泛素-蛋白酶体系统研究、药物靶点发现(如蛋白酶体抑制剂)

查看详情 →
💡

五、蛋白质组数据与资源

concept

**公共数据库**: - **PRIDE**(Proteomics Identification Database):EMBL-EBI维护,存储MS数据 - **PeptideAtlas**:基于多实验数据的蛋白质/肽段图谱 - **MassIVE**:UCSD维护,支持数据存储和重新分析 - **ProteomeXchange(PX)**:国际联盟,统一数据提交标准 **人类蛋白质组计划(HPP...

公共数据库
- PRIDE(Proteomics Identification Database):EMBL-EBI维护,存储MS数据
- PeptideAtlas:基于多实验数据的蛋白质/肽段图谱
- MassIVE:UCSD维护,支持数据存储和重新分析
- ProteomeXchange(PX):国际联盟,统一数据提交标准
人类蛋白质组计划(HPP)
- 目标:系统绘制人类蛋白质组图谱
- 2020年:发布了覆盖>90%人类蛋白质编码基因的草图
- 中国人类蛋白质组计划(CNHPP):聚焦中国人常见癌症的蛋白质组研究

查看详情 →
💡

9.2 蛋白质结构分析

section
查看详情 →
💡

一、蛋白质结构的层次组织

concept

**1. 一级结构** - 由20种常见氨基酸通过肽键连接形成线性多肽链 - 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向 - 关键特征:N端(氨基端)和C端(羧基端),肽链方向性 **2. 二级结构** **α螺旋**: - 每圈3.6个氨基酸残基,螺距5.4 Å - 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键 - 氢键大致平行于螺旋轴,稳定螺旋结构 - 氨基酸倾向性...

1. 一级结构
- 由20种常见氨基酸通过肽键连接形成线性多肽链
- 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向
- 关键特征:N端(氨基端)和C端(羧基端),肽链方向性
2. 二级结构
α螺旋
- 每圈3.6个氨基酸残基,螺距5.4 Å
- 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键
- 氢键大致平行于螺旋轴,稳定螺旋结构
- 氨基酸倾向性:Ala、Glu、Leu、Met偏好螺旋;Pro、Gly破坏螺旋
β折叠
- 由多条肽链片段或同一肽链的不同片段平行排列形成
- 链间氢键稳定:一条链的羰基氧与另一条链的酰胺氢形成氢键
- 平行式(N→C同向)和反平行式(N→C反向),反平行更稳定
- 氨基酸倾向性:Val、Ile、Phe偏好β折叠;Pro、Gly不利于β折叠
环区/转角(Loop/Turn)
- 连接二级结构元件的无规区域
- 通常位于蛋白质表面,暴露在溶剂中
- 高柔性和高多样性,常参与功能位点形成
3. 超二级结构(Supersecondary Structure)
- 两个或多个二级结构单元的组合模式
- 常见类型:α-α(螺旋-转角-螺旋)、β-α-β(Rossmann折叠)、β-发夹(β-hairpin)
4. 结构域(Domain)
- 独立折叠的球状单元,具有特定功能
- 结构域分类:全α(all-α)、全β(all-β)、α/β(交替)、α+β(分离)
- 多结构域蛋白质:不同结构域可以执行不同功能,通过柔性连接子连接
5. 三级结构
- 稳定三级结构的相互作用:
- 疏水作用:疏水残基埋藏在蛋白质内部(主要驱动力)
- 氢键:主链和侧链之间
- 离子键:带相反电荷的侧链之间
- 范德华力:所有原子之间的弱吸引力
- 二硫键:半胱氨酸残基之间的共价连接(稳定作用)
6. 四级结构
- 多个多肽链(亚基)通过非共价相互作用形成蛋白质复合物
- 亚基间相互作用:疏水界面、氢键、盐桥
- 别构效应:配体结合改变亚基间相互作用,调控蛋白质活性

查看详情 →
💡

二、蛋白质结构预测方法

concept

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测

查看详情 →
💡

三、蛋白质结构性质预测

concept

**1. 二级结构预测** **Q3准确率**:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。 **方法发展**: - 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60% - 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65% - 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多...

1. 二级结构预测
Q3准确率:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。
方法发展
- 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60%
- 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65%
- 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多序列比对,准确率>75-80%
- 深度学习:基于CNN/Transformer,准确率>85%
PSIPRED方法
1. PSI-BLAST搜索NR数据库,获得多序列比对(PSSM)
2. 将PSSM特征(20种氨基酸的频率)输入两层神经网络
3. 输出每个残基的三态概率(H/E/C)
2. 无序区预测(Intrinsically Disordered Region, IDR)
IDR特征
- 生理条件下不能形成稳定三维结构
- 人类蛋白质中约30-40%的残基处于无序区
- 功能:信号传导、转录调控、蛋白质相互作用枢纽
预测方法
- IUPred:基于能量估算(低相互作用能→无序)
- PONDR、DisEMBL:基于机器学习和神经网络
- SPOT-Disorder:基于深度学习,准确率>80%

查看详情 →
💡

四、功能蛋白质的从头设计

concept

**设计策略**: 1. **拓扑选择**:选择适合目标功能的蛋白质折叠类型 2. **骨架设计**:设计主链结构,满足目标约束(如配体结合口袋) 3. **序列优化**:使用能量函数和深度学习优化氨基酸序列 4. **实验验证**:表达纯化蛋白质,验证功能 **深度学习设计方法**: - **trRosetta**:基于Transformer的序列-结构联合生成 - **ProteinMPNN*...

设计策略
1. 拓扑选择:选择适合目标功能的蛋白质折叠类型
2. 骨架设计:设计主链结构,满足目标约束(如配体结合口袋)
3. 序列优化:使用能量函数和深度学习优化氨基酸序列
4. 实验验证:表达纯化蛋白质,验证功能
深度学习设计方法
- trRosetta:基于Transformer的序列-结构联合生成
- ProteinMPNN:基于图神经网络的序列设计
- RFdiffusion:基于扩散模型的蛋白质结构生成(2023, Baker Lab)
成功案例
- 2023年Baker Lab设计新型萤光素酶(LuxSit-i)
- 使用"family-wide hallucination"从NTF2超家族生成新结构
- 通过RIFGen/RIFDock设计与DTZ配体的结合口袋
- 设计的萤光素酶活性与天然酶相当,但结构完全不同

查看详情 →
💡

9.3 蛋白质分子动力学模拟

section
查看详情 →
💡

一、统计力学基础

concept

**1. 相空间和系综** 对于N个粒子组成的系统,经典动力学由6N个变量描述: - 位置:r₁(t), r₂(t), ..., rₙ(t) - 动量:p₁(t), p₂(t), ..., pₙ(t) 相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。 **系综类型**: - **NVT(正则系综)**:粒子数N、体积V、温度T恒定。通过热...

1. 相空间和系综
对于N个粒子组成的系统,经典动力学由6N个变量描述:
- 位置:r₁(t), r₂(t), ..., rₙ(t)
- 动量:p₁(t), p₂(t), ..., pₙ(t)
相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。
系综类型
- NVT(正则系综):粒子数N、体积V、温度T恒定。通过热浴(thermostat)维持温度,如Nosé-Hoover、Langevin动力学。
- NPT(等温等压系综):粒子数N、压强P、温度T恒定。通过恒压器(barostat)调节体积,如Parrinello-Rahman、Berendsen。
- NVE(微正则系综):粒子数N、体积V、总能量E恒定。无热浴和恒压器,系统为孤立体系。
2. 自由能
Helmholtz自由能(F):适用于恒容体系(NVT)
$$F = U - TS$$
Gibbs自由能(G):适用于恒压体系(NPT),生物体系常用
$$G = H - TS = U + PV - TS$$
其中U为内能,T为温度,S为熵,H为焓,P为压强,V为体积。
自由能是系统做非体积功的最大能力。在恒温恒压下,自发过程总是朝着Gibbs自由能降低的方向进行(ΔG < 0)。
自由能面(Free Energy Landscape)
- 描述系统自由能随构象坐标变化的"地形图"
- 低能量区域(山谷)对应稳定构象(亚稳态)
- 高能量区域(山脊)对应过渡态
- 能垒高度决定构象转换的速率(Arrhenius方程)
自由能计算
- 直接计数法:ΔF = -k_B T ln(P_A / P_B),其中P_A和P_B为状态A和B的观测概率
- 缺点:对于高能量垒,罕见事件的采样需要极长时间

查看详情 →
💡

二、分子力场

concept

力场将总势能分解为键合项和非键合项: $$E_{total} = E_{bonded} + E_{nonbonded}$$ **1. 键合项(Bonded Terms)** **键长伸缩能**: $$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$ - 谐振子近似,K_r为力常数,r_eq为平衡键长 **键角弯曲能**: $$E_{angl...

力场将总势能分解为键合项和非键合项:
$$E_{total} = E_{bonded} + E_{nonbonded}$$
1. 键合项(Bonded Terms)
键长伸缩能
$$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$
- 谐振子近似,K_r为力常数,r_eq为平衡键长
键角弯曲能
$$E_{angle} = \sum_{angles} \frac{K_\theta}{2}(\theta - \theta_{eq})^2$$
- 谐振子近似,K_θ为力常数,θ_eq为平衡键角
二面角扭转能
$$E_{dihedral} = \sum_{dihedrals} \sum_{n} \frac{V_n}{2}[1 + \cos(n\phi - \gamma)]$$
- 傅里叶级数展开,V_n为势垒高度,n为周期性(旋转对称性),γ为相位偏移
2. 非键合项(Nonbonded Terms)
静电相互作用(Coulomb)
$$E_{electrostatic} = \sum_{i<j} \frac{q_i q_j}{4\pi\varepsilon_0 r_{ij}}$$
- q_i, q_j为原子电荷,r_ij为原子间距离
- 长程相互作用,通常使用截断(cutoff)或PME(Particle Mesh Ewald)方法处理
范德华相互作用(Lennard-Jones)
$$E_{vdW} = \sum_{i<j} \varepsilon_{ij}\left[\left(\frac{\sigma_{ij}}{r_{ij}}\right)^{12} - \left(\frac{\sigma_{ij}}{r_{ij}}\right)^6\right]$$
- ε_ij为势阱深度(相互作用强度)
- σ_ij为势能为0时的距离(原子"半径")
- r⁻¹²项:短程排斥(电子云重叠)
- r⁻⁶项:长程吸引(London色散力)
3. 常见力场
AMBER
- 开发:UC San Francisco (Peter Kollman, David Case)
- 特点:广泛用于蛋白质和核酸,参数基于量子化学计算和实验数据
- 版本:AMBER94/99/03/14/19, ff99SB-ILDN, ff14SB
- 优势:蛋白质力场准确,参数优化充分
CHARMM
- 开发:Harvard University (Martin Karplus)
- 特点:全面覆盖生物大分子(蛋白质、脂质、核酸、糖类)
- 版本:CHARMM22/27/36/36m
- 优势:脂质膜和膜蛋白模拟表现出色
OPLS-AA
- 开发:Jorgensen Lab (Yale University)
- 特点:液态模拟和蛋白质模拟兼顾
- 版本:OPLS-AA/L, OPLS3/3e
- 优势:有机小分子参数丰富
GROMOS
- 开发:van Gunsteren Lab (ETH Zurich)
- 特点: united-atom 表示(减少计算量)
- 版本:GROMOS43A1/53A5/54A7
- 优势:计算效率高,适用于大规模体系
力场选择原则
- 蛋白质模拟:AMBER ff14SB/ff19SB, CHARMM36m
- 膜蛋白模拟:CHARMM36, Slipids
- 小分子/药物设计:OPLS3/3e, GAFF2
- 大规模体系:GROMOS, MARTINI(粗粒化)

查看详情 →
💡

三、牛顿运动方程与积分算法

concept

**1. 牛顿运动方程** 对于每个原子i: $$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$ 其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。 **2. 有限差分积分算法** **Verlet算法**: $$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delt...

1. 牛顿运动方程
对于每个原子i:
$$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$
其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。
2. 有限差分积分算法
Verlet算法
$$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delta t^2$$
- 优点:时间可逆,能量守恒好
- 缺点:速度计算精度低
Velocity Verlet算法
$$v(t + \frac{\Delta t}{2}) = v(t) + \frac{a(t)\Delta t}{2}$$
$$r(t + \Delta t) = r(t) + v(t + \frac{\Delta t}{2})\Delta t$$
$$v(t + \Delta t) = v(t + \frac{\Delta t}{2}) + \frac{a(t + \Delta t)\Delta t}{2}$$
- 优点:同时更新位置和速度,精度高,稳定性好
- 是目前最常用的MD积分算法
时间步长选择
- 典型值:2 fs(飞秒,10⁻¹⁵秒)
- 限制因素:体系中最快运动(键长振动,C-H键约10⁻¹⁴秒周期)
- 约束算法(SHAKE/SETTLE/LINCS):固定键长,允许更大时间步长(2-4 fs)
3. 周期性边界条件(PBC)
- 模拟盒子(如立方体、十二面体、截角八面体)被其镜像复制填满整个空间
- 原子离开盒子一侧时,从另一侧进入(保持原子数恒定)
- 最小镜像约定:每个原子只与最近的镜像相互作用
- 目的:消除边界效应,模拟无限大体系
4. 长程相互作用处理
截断法(Cutoff)
- 只计算截断距离(如10-12 Å)内的非键相互作用
- 简单高效,但对于带电体系可能引入显著误差
Particle Mesh Ewald(PME)
- 将长程静电相互作用分解为实空间短程和倒空间长程两部分
- 实空间:截断范围内直接计算
- 倒空间:使用快速傅里叶变换(FFT)在网格上计算
- 优点:精度高(~10⁻⁵),效率合理
- 缺点:需要周期性边界条件

查看详情 →
💡

四、MD模拟流程

concept

**1. 体系准备** - 获取蛋白质结构(PDB下载或预测) - 检查结构完整性:缺失原子、残基、二硫键 - 添加氢原子(根据pH确定质子化状态) - 选择力场和溶剂模型(如TIP3P、SPC/E) - 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度) - 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI **2. 能量最小化** - 目的:消除不...

1. 体系准备
- 获取蛋白质结构(PDB下载或预测)
- 检查结构完整性:缺失原子、残基、二硫键
- 添加氢原子(根据pH确定质子化状态)
- 选择力场和溶剂模型(如TIP3P、SPC/E)
- 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度)
- 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI
2. 能量最小化
- 目的:消除不合理的原子接触和键长/键角畸变
- 算法:最陡下降法(Steepest Descent)→ 共轭梯度法(Conjugate Gradient)
- 判断标准:体系势能达到最小值,最大受力<1000 kJ/mol/nm
3. 平衡阶段
- NVT平衡:在恒定体积下升温至目标温度(如300K),温度耦合(如V-rescale)
- NPT平衡:在恒定温度和压强下平衡密度,压强耦合(如Parrinello-Rahman)
- 判断标准:温度、密度、能量、RMSD均达到稳定波动
- 典型时长:100 ps - 1 ns
4. 生产模拟(Production Run)
- 在平衡后的构象上开始长时间采样
- 记录轨迹(坐标、速度、能量等)
- 典型时长:100 ns - 10 μs(取决于体系和计算资源)
- 现代GPU加速:RTX 4090可达~100 ns/天(~50,000原子体系)
5. 轨迹分析
- 结构分析:RMSD、RMSF、回旋半径(Rg)
- 动力学分析:主成分分析(PCA)、自由能面构建
- 相互作用分析:氢键、盐桥、疏水接触、π-π堆积
- 工具:VMD、MDAnalysis、MDTraj、CPPTRAJ

查看详情 →
💡

五、增强采样方法

concept

**1. 伞形采样(Umbrella Sampling)** - 沿反应坐标(Collective Variable, CV)划分多个窗口 - 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]² - 将系统限制在特定CV范围内采样 - 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面 - 适用:...

1. 伞形采样(Umbrella Sampling)
- 沿反应坐标(Collective Variable, CV)划分多个窗口
- 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]²
- 将系统限制在特定CV范围内采样
- 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面
- 适用:已知反应路径,计算自由能面
2. 副本交换分子动力学(REMD)
- 并行运行多个不同温度的副本(如300K, 310K, 320K, ...)
- 定期尝试交换相邻副本的构象(按Metropolis准则)
- 高温副本探索高能量构象,交换到低温副本中
- 适用:构象搜索、折叠/去折叠研究
- 缺点:副本数随体系自由度增加,计算成本高
3. 元动力学(Metadynamics)
- 在CV空间上不断添加高斯偏置势(负反馈机制)
- 高斯势累积"填平"势能阱,促进系统逃离局部最小值
- 适用:未知反应路径,自动探索自由能面
- 变种:Well-Tempered Metadynamics(WTMetaD)、Adaptive Bias Force(ABF)
4. 其他方法
- Steered MD(SMD):施加外力驱动系统沿特定方向运动
- Gaussian Accelerated MD(GaMD): boost 势能促进低能量区域的采样
- REST2(Replica Exchange with Solute Tempering):仅增强溶质温度,降低计算成本

查看详情 →
💡

六、粗粒化模拟

concept

**MARTINI力场**: - 将4个重原子映射为1个珠子(bead) - 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水) - 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍 - 应用:膜蛋白、脂质体、大分子复合物组装 - 局限:丧失原子细节,不适合研究化学键形成/断裂

MARTINI力场
- 将4个重原子映射为1个珠子(bead)
- 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水)
- 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍
- 应用:膜蛋白、脂质体、大分子复合物组装
- 局限:丧失原子细节,不适合研究化学键形成/断裂

查看详情 →
💡

9.4 蛋白质功能预测与分析

section
查看详情 →
💡

一、蛋白质功能概述

concept

**1. 蛋白质功能的层次性** 蛋白质功能具有复杂性和多层次性: - **分子功能**:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活) - **生物过程**:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路) - **细胞组分**:蛋白质所在的细胞位置(如细胞核、线粒体、膜) 同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行...

1. 蛋白质功能的层次性
蛋白质功能具有复杂性和多层次性:
- 分子功能:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活)
- 生物过程:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路)
- 细胞组分:蛋白质所在的细胞位置(如细胞核、线粒体、膜)
同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行(冗余性)。
2. GO注释系统
GO采用有向无环图(DAG)结构组织术语:
- 每个术语(GO term)有唯一ID(如GO:0004672,蛋白激酶活性)
- 术语之间存在"is_a"和"part_of"关系
- 从根节点到叶节点的路径表示功能的特异性递增
GO注释证据代码
- EXP:实验验证
- IDA:直接实验测定
- IPI:蛋白质相互作用
- ISS:序列相似性推断
- IEA:自动电子注释
- ...(共约15种证据代码)
3. CAFA竞赛
- 2010年首次举办,之后每2-3年一次
- 使用未公开蛋白质序列作为测试集
- 评估指标:Fmax(F-measure最大值)、Smin(语义距离最小值)、AUPR(精确率-召回率曲线下面积)
- 推动了功能预测方法的发展,特别是整合多源信息的方法

查看详情 →
💡

二、基于序列的功能分析

concept

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区

查看详情 →
💡

三、基于结构的功能分析

concept

**1. 基于结构相似性的功能预测** **原理**:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。 **结构比对工具**: - **DALI**:基于分子内距离矩阵的比较 - **TM-align**:基于TM-score的结构相似性度量 - **FATCAT**:允许柔性旋转的结构比对 **结构比对评估**: - **RMSD(Root Mean Square Deviation)*...

1. 基于结构相似性的功能预测
原理:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。
结构比对工具
- DALI:基于分子内距离矩阵的比较
- TM-align:基于TM-score的结构相似性度量
- FATCAT:允许柔性旋转的结构比对
结构比对评估
- RMSD(Root Mean Square Deviation):结构叠合后的原子坐标偏差,<2Å为高度相似
- TM-score(Template Modeling Score):0-1之间,>0.5表示相同折叠,>0.9表示高度相似
- GDT_TS:与CASP评估类似,用于结构相似性度量
2. 基于结构的功能预测工具
ProFunc
- 整合多种序列和结构分析方法
- 包括序列同源性搜索、结构相似性搜索、残基保守性分析、表面分析等
- 输出综合功能注释
COFACTOR
- 基于结构比对的功能注释系统
- 将待测蛋白结构比对到已知功能模板库
- 预测配体结合位点、酶学分类(EC号)、GO注释
3. 基于分子对接的功能分析
分子对接原理
- 搜索配体在受体结合口袋中的最佳位置和取向
- 评估结合模式的亲和力(打分函数)
- 预测配体-受体相互作用
对接类型
- 刚性对接:受体和配体构象均固定,适用于大分子对接(如蛋白质-蛋白质)
- 半柔性对接:配体构象可变化,受体固定,适用于小分子-蛋白质对接
- 柔性对接:受体和配体构象均可变化,精度高但计算成本高
对接流程
1. 受体准备:从PDB获取结构,添加氢原子,确定质子化状态,定义结合口袋
2. 配体准备:生成3D构象,添加电荷,确定可旋转键
3. 构象搜索:系统搜索、遗传算法、蒙特卡罗模拟等方法
4. 打分评估:基于力场、经验公式或知识的打分函数
5. 结果分析:聚类相似构象,选择最佳结合模式
常用对接软件
- AutoDock Vina:快速开源对接软件,基于经验打分函数
- GOLD:商业软件,基于遗传算法,高精度
- Glide:Schrödinger软件包,基于网格搜索
- rDOCK:基于力场的对接和打分
虚拟筛选(Virtual Screening)
- 将大型化合物库(如数百万分子)与靶蛋白对接
- 筛选结合打分最高的候选化合物
- 用于药物发现的早期阶段,大幅降低实验筛选成本
4. 结合自由能计算
MM-PBSA/MM-GBSA
- 基于分子力学和泊松-玻尔兹曼/广义Born溶剂化模型
- 计算结合自由能:ΔG_bind = ΔH - TΔS ≈ ΔE_MM + ΔG_solvation - TΔS
- 适用于快速估算相对结合亲和力
自由能微扰(FEP)
- 通过一系列"炼金术"变换(逐渐改变配体A为配体B)计算相对结合自由能
- 精度高(<1 kcal/mol),但计算成本高
- 适用于先导化合物优化
热力学积分(TI)
- 类似FEP,但使用积分而非微扰计算自由能差
- 适用于化学变化较大的体系

查看详情 →
💡

四、基于网络的蛋白质功能分析

concept

**1. 蛋白质相互作用网络(PPI Network)** PPI网络以蛋白质为节点,相互作用为边。 - 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘 - 数据库:STRING、BioGRID、IntAct、MINT **2. 基于邻域的方法(Neighborhood Method)** **邻居计数法**: - 将邻居节点中最频繁的功能分配给目标蛋白 - 简单直接,但忽略...

1. 蛋白质相互作用网络(PPI Network)
PPI网络以蛋白质为节点,相互作用为边。
- 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘
- 数据库:STRING、BioGRID、IntAct、MINT
2. 基于邻域的方法(Neighborhood Method)
邻居计数法
- 将邻居节点中最频繁的功能分配给目标蛋白
- 简单直接,但忽略了功能频率差异
χ²检验法
- 使用χ²检验或Fisher精确检验确定邻居中显著富集的功能
- 仅将显著富集的功能分配给目标蛋白
- 比简单计数法更可靠
邻居扩展法
- 将邻居扩展到一阶邻居的近邻
- 扩大功能信息来源,但可能引入噪声
3. 基于全局网络拓扑的方法
马尔可夫随机场(MRF)
- 建模网络中节点功能的依赖关系
- 利用Gibbs采样或变分推断进行概率推断
- 考虑全局网络结构,而不仅是局部邻居
4. 基于模块划分的方法
模块识别
- 识别网络中紧密连接的节点群(社区/模块)
- 同一模块内的蛋白质倾向于参与同一生物过程
常用算法
- MCL(Markov Cluster Algorithm):基于随机游走的扩展和膨胀操作
- Louvain算法:基于模块度优化的贪心算法
- RWR(Random Walk with Restart):从种子节点出发,通过重启随机游走量化节点关联性
- 谱聚类:基于图拉普拉斯矩阵的特征向量聚类
模块识别后的功能注释
- 将模块内已知功能直接分配给未知蛋白
- 使用χ²检验或Fisher精确检验对模块内功能进行富集分析
- 结合机器学习模型,利用网络拓扑特征预测功能
5. 基于网络整合的方法
GeneMANIA
- 整合多种网络(PPI、基因共表达、遗传相互作用、通路共享)
- 使用线性回归学习每个网络的权重
- 构建加权整合网络,使用标签传播算法预测功能
GAIN(Graphical Association Network)
- 基于贝叶斯网络的方法
- 将每个网络视为独立证据
- 使用条件概率和贝叶斯规则整合证据,推断功能概率
6. 基于深度学习的网络方法
DeepWalk
- 通过随机游走生成节点序列
- 使用Skip-gram模型学习节点嵌入(低维向量表示)
- 嵌入向量保留网络拓扑信息
DeepGO
- 整合DeepWalk网络特征和序列特征(3-mer编码+1D CNN)
- 分层神经网络预测GO功能,保持GO层次关系
图卷积网络(GCN)
- 直接对图结构进行卷积操作
- 每个节点的特征由邻居节点聚合得到
- DeepGraphGO:构建多物种PPI网络,使用GCN提取特征,整合序列特征预测功能

查看详情 →
💡

9.5 代谢组学

section
查看详情 →
💡

一、代谢组学技术平台

concept

**1. 核磁共振(NMR)** **原理**: - 利用原子核(主要是¹H)在磁场中的共振吸收特性 - 不同化学环境的氢原子具有不同的化学位移 - 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构 **优点**: - 非破坏性,样本可重复使用 - 无需色谱分离,样品制备简单 - 定量准确,重现性高 - 可检测所有含氢代谢物(无偏向性) **缺点**: - 灵敏度低...

1. 核磁共振(NMR)
原理
- 利用原子核(主要是¹H)在磁场中的共振吸收特性
- 不同化学环境的氢原子具有不同的化学位移
- 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构
优点
- 非破坏性,样本可重复使用
- 无需色谱分离,样品制备简单
- 定量准确,重现性高
- 可检测所有含氢代谢物(无偏向性)
缺点
- 灵敏度低(比MS低3-5个数量级)
- 分辨率有限,复杂样本谱图重叠严重
- 难以检测低丰度代谢物
应用
- 体液代谢组学(尿液、血液)
- 样本非常珍贵的情况(需要后续其他分析)
- 实时动态监测(如流动注射NMR)
2. 液相色谱-质谱联用(LC-MS)
原理
- 液相色谱(LC):根据代谢物在固定相和流动相之间的分配系数差异进行分离
- 反相色谱(RP-C18):分离非极性/中等极性代谢物(如脂质、脂肪酸)
- 亲水作用色谱(HILIC):分离极性代谢物(如氨基酸、糖类、核苷酸)
- 质谱(MS):LC洗脱的代谢物经ESI离子化,进入质谱仪检测
- 高分辨质谱(HRMS):Orbitrap、Q-TOF,精确分子量<5 ppm
- 串联质谱(MS/MS):提供碎片信息,用于结构鉴定
优点
- 灵敏度高(fmol-pmol级别)
- 覆盖范围广(可同时检测数千种代谢物)
- 分辨率高,可区分同分异构体
缺点
- 离子化效率差异导致定量偏差
- 基质效应(matrix effect):复杂样本中共同洗脱物质抑制或增强信号
- 样本制备要求高
3. 气相色谱-质谱联用(GC-MS)
原理
- 气相色谱(GC):样本气化后,在色谱柱中根据沸点和极性分离
- 质谱(MS):EI(电子轰击)电离,产生特征性碎片谱图
- 数据库:NIST/EPA/NIH Mass Spectral Library(超过250,000张标准谱图)
优点
- 重现性极高,保留时间稳定
- 有完善的EI谱图数据库,便于鉴定
- 定量准确(使用内标法)
缺点
- 需要样本衍生化(硅烷化、甲基化),增加样品制备复杂度
- 只能检测热稳定和挥发性代谢物(分子量<500 Da)
- 不适用于大分子、极性代谢物
应用
- 植物代谢组学(挥发性代谢物丰富)
- 脂肪酸分析
- 氨基酸和有机酸分析(衍生化后)
4. 其他技术
CE-MS(毛细管电泳-质谱)
- 分离原理:基于电荷/质量比的电泳迁移
- 优势:分离效率高,适合极性代谢物和离子型代谢物
- 应用:氨基酸、有机酸、核苷酸分析
MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 原理:在组织切片上直接进行质谱分析,获得代谢物的空间分布
- 应用:肿瘤代谢异质性、药物组织分布
5. 技术选择策略
| 样本类型 | 推荐技术 | 理由 |
|----------|----------|------|
| 血清/血浆 | LC-MS (RP + HILIC) | 覆盖极性和非极性代谢物 |
| 尿液 | NMR或LC-MS | NMR定量准确,LC-MS灵敏度高 |
| 组织 | LC-MS或GC-MS | 根据目标代谢物类型选择 |
| 植物提取物 | GC-MS + LC-MS | 挥发性用GC-MS,极性用LC-MS |
| 脂质组学 | LC-MS (RP-C18) | 反相色谱分离脂质效果好 |
| 单细胞 | LC-MS (高灵敏) | 需要极低样本量 |

查看详情 →
💡

二、代谢组学实验设计

concept

**1. 样本收集与制备** **样本类型**: - 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁 - 组织样本:肝脏、肌肉、肿瘤、脑组织 - 细胞样本:培养细胞、原代细胞 - 其他:粪便、肠道内容物、发酵液 **质控样本**: - **QC样本(Quality Control)**:混合等量的所有实验样本,用于监测系统稳定性和数据质量 - **空白样本**:溶剂空白,评估背景污染 - **标准...

1. 样本收集与制备
样本类型
- 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁
- 组织样本:肝脏、肌肉、肿瘤、脑组织
- 细胞样本:培养细胞、原代细胞
- 其他:粪便、肠道内容物、发酵液
质控样本
- QC样本(Quality Control):混合等量的所有实验样本,用于监测系统稳定性和数据质量
- 空白样本:溶剂空白,评估背景污染
- 标准品:已知浓度的代谢物混合物,用于方法验证
样本制备
- 蛋白质沉淀:甲醇/乙腈/氯仿提取,去除大分子
- 脂质去除:如需分析极性代谢物,使用正己烷或氯仿去除脂质
- 衍生化:GC-MS需要硅烷化(BSTFA+TMCS)或甲基化
- 注意:不同代谢物类别需要不同的提取方法,没有"一刀切"的最佳方案
2. 仪器分析
色谱条件优化
- 色谱柱选择:C18(反相)、HILIC(亲水)、T3(混合模式)
- 流动相:水/乙腈或水/甲醇,含0.1%甲酸或5mM乙酸铵
- 梯度洗脱:从低有机相到高有机相,洗脱不同极性的代谢物
- 流速:200-400 μL/min(nano-LC更低)
质谱参数
- 离子源:ESI+(正离子模式,检测碱性代谢物如氨基酸、胺类)和ESI-(负离子模式,检测酸性代谢物如脂肪酸、有机酸)
- 采集模式:Full scan(全扫描)+ DDA(数据依赖MS/MS)或DIA(全离子碎片)
- 分辨率:Orbitrap 60,000-120,000(Full scan),15,000-30,000(MS/MS)
- 扫描范围:m/z 50-1000(或更宽)
3. 数据质量监控
QC样本分析
- 每5-10个样本插入一个QC样本
- 监测保留时间漂移、信号强度变化、峰形变化
- 评估标准:QC中代谢物峰的RSD(相对标准偏差)<20%(或30%)
批次效应评估
- PCA分析:检查QC样本是否聚类,样本是否按批次聚集
- 如果样本按批次分离,说明存在显著批次效应,需要校正

查看详情 →
💡

三、代谢组学数据处理

concept

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能

查看详情 →
💡

四、代谢通路分析

concept

**1. 过表征分析(ORA, Over-Representation Analysis)** **原理**: - 输入:差异代谢物列表 - 背景:所有检测到的代谢物 - 方法:Fisher精确检验或超几何检验 - 输出:显著富集的代谢通路(p < 0.05) **局限性**: - 忽略代谢物变化方向(上调/下调) - 忽略代谢物丰度变化幅度 - 假设通路独立,忽略通路间交互 **2. 通路拓扑分...

1. 过表征分析(ORA, Over-Representation Analysis)
原理
- 输入:差异代谢物列表
- 背景:所有检测到的代谢物
- 方法:Fisher精确检验或超几何检验
- 输出:显著富集的代谢通路(p < 0.05)
局限性
- 忽略代谢物变化方向(上调/下调)
- 忽略代谢物丰度变化幅度
- 假设通路独立,忽略通路间交互
2. 通路拓扑分析(PT, Pathway Topology)
原理
- 考虑代谢通路中的拓扑结构(代谢物连接度、位置重要性)
- 中心代谢物(如ATP、NADH)在通路中的权重更高
- 方法:Impact Factor、Node Importance
软件
- MetaboAnalyst:综合代谢组学分析平台,支持ORA、PT、联合分析
- MetPA(Metabolic Pathway Analysis):基于通路拓扑的富集分析
- KEGG Mapper:基于KEGG通路的可视化分析
3. 整合通路分析
MSEA(Metabolite Set Enrichment Analysis)
- 类似GSEA,不需要预设差异代谢物阈值
- 输入:所有代谢物的排序列表(如按|logFC|排序)
- 评估预定义代谢物集合(如通路)是否集中在排序列表的顶端或底端
联合通路分析
- 整合ORA和拓扑分析的结果
- 结合代谢物变化方向和幅度
- 更全面地解释通路调控状态

查看详情 →
💡

五、代谢组学应用实例

concept

**1. 疾病生物标志物发现** **策略**: - 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照) - 验证阶段:靶向代谢组学,在独立队列中验证候选标志物 - 临床转化:开发检测试剂盒,进行临床试验 **成功案例**: - **前列腺癌**: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009) - **心血管疾病**: TMAO(氧化三甲胺)作为心血管风险标志...

1. 疾病生物标志物发现
策略
- 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照)
- 验证阶段:靶向代谢组学,在独立队列中验证候选标志物
- 临床转化:开发检测试剂盒,进行临床试验
成功案例
- 前列腺癌: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009)
- 心血管疾病: TMAO(氧化三甲胺)作为心血管风险标志物(NEJM, 2013)
- 糖尿病: 支链氨基酸(BCAA)与胰岛素抵抗相关
2. 药物代谢和药代动力学
研究内容
- 药物代谢产物鉴定(I相和II相代谢)
- 药物-药物相互作用(代谢酶竞争)
- 个体化给药(基于代谢酶基因型)
3. 营养代谢和精准营养
研究内容
- 食物代谢物分析(如多酚、维生素、脂肪酸)
- 个体代谢反应差异( responder vs. non-responder)
- 肠道菌群代谢物(短链脂肪酸、吲哚衍生物)
4. 环境代谢组学
研究内容
- 污染物暴露的代谢效应
- 生物标志物监测(如重金属、农药)
- 生态毒性评估

查看详情 →
💡

六、多组学整合

concept

**代谢组学与其他组学的整合**: **基因组+代谢组**: - 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL) - 识别代谢酶的遗传变异对代谢物水平的影响 **转录组+代谢组**: - 整合基因表达和代谢物水平,构建代谢调控网络 - 识别限速酶和调控节点 **蛋白质组+代谢组**: - 同时检测酶蛋白水平和代谢物水平 - 验证代谢通路的活性状态 **微生物组+代谢组*...

代谢组学与其他组学的整合
基因组+代谢组
- 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL)
- 识别代谢酶的遗传变异对代谢物水平的影响
转录组+代谢组
- 整合基因表达和代谢物水平,构建代谢调控网络
- 识别限速酶和调控节点
蛋白质组+代谢组
- 同时检测酶蛋白水平和代谢物水平
- 验证代谢通路的活性状态
微生物组+代谢组
- 肠道菌群16S/宏基因组 + 粪便/血清代谢组
- 揭示菌群-宿主代谢互作(如SCFA产生、胆汁酸代谢)
整合方法
- 相关性网络:计算代谢物与基因/蛋白质之间的Pearson/Spearman相关性
- 联合通路分析:如IMPaLA、iPEA
- 多组学因子分析(MOFA):识别跨组学的共享变异源
- 机器学习整合:使用多组学特征构建预测模型

查看详情 →
💡

9.6 蛋白质组学和代谢组学的总结与展望

section
查看详情 →
💡

一、蛋白质组学的最新进展

concept

**1. 单细胞蛋白质组学** **技术挑战**: - 单个哺乳动物细胞仅含约100-200 pg蛋白质 - 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级) - 需要极低体积的样本处理(微升级)和超灵敏的质谱检测 **技术突破**: - **SCoPE-MS(2018)**: - 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号 -...

1. 单细胞蛋白质组学
技术挑战
- 单个哺乳动物细胞仅含约100-200 pg蛋白质
- 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级)
- 需要极低体积的样本处理(微升级)和超灵敏的质谱检测
技术突破
- SCoPE-MS(2018)
- 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号
- 单个细胞通过独立的通道标记,与载体通道混合后进入质谱
- 实现单个细胞的蛋白质定量(~1,000-3,000个蛋白质)
- SCoPE2(2021)
- 改进样本处理和色谱分离
- 提高定量准确性(比率压缩校正)
- 检测深度提升至~5,000个蛋白质/单细胞
- DIA单细胞蛋白质组学
- 使用timsTOF Pro(离子淌度分离)和DIA模式
- 无需TMT标记,减少比率压缩
- 检测深度~2,000-4,000个蛋白质/单细胞
应用
- 肿瘤异质性:鉴定稀有耐药细胞亚群
- 免疫细胞图谱:揭示不同免疫细胞亚型的蛋白质特征
- 发育生物学:追踪细胞分化过程中的蛋白质动态变化
2. 空间蛋白质组学
技术方法
- LCM-MS(激光显微切割-质谱)
- 使用激光切取特定组织区域(20-100 μm,约5-10个细胞)
- 超微量蛋白质提取和酶解
- 高灵敏质谱分析
- 应用:肿瘤微环境区域分析、组织异质性研究
- 深度视觉蛋白质组学(DVP, 2022)
- 免疫荧光成像识别目标细胞类型
- LCM精确切割目标细胞
- 超灵敏质谱分析(>5,000个蛋白质)
- 在FFPE样本中实现单细胞分辨率的蛋白质组分析
- MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 在组织切片上直接进行质谱分析
- 空间分辨率:10-50 μm
- 可以同时获得数千个蛋白质和代谢物的空间分布
- 应用:肿瘤边界分析、药物分布研究
3. 人工智能驱动的蛋白质组学
蛋白质语言模型
- ESM-2(Meta AI, 2022)
- 基于15亿参数Transformer,在UniRef数据库上预训练
- 从单序列提取进化信息(无需MSA搜索)
- ESMFold结构预测速度比AlphaFold2快60倍
- 应用:宏基因组蛋白质结构预测、蛋白质表示学习
- ProtTrans(2021)
- 在3930亿氨基酸上训练的Transformer模型
- 学习蛋白质的语义表示
- 用于蛋白质分类、定位预测和功能注释
AI在质谱数据分析中的应用
- 肽段从头测序(De novo sequencing)
- 传统方法:基于图的动态规划(如PEAKS、Novor)
- AI方法:使用深度学习(CNN、LSTM、Transformer)直接预测序列
- 优势:可以鉴定数据库中不存在的肽段(如未知剪接变体、新抗原)
- DIA谱图解析
- 传统方法:依赖谱图库匹配
- AI方法:使用深度学习预测肽段的MS/MS谱图,构建"预测谱图库"
- 提高DIA数据分析的覆盖度和灵敏度
- 蛋白质定量优化
- 使用深度学习模型校正批次效应和技术噪声
- 提高低丰度蛋白质的定量准确性

查看详情 →
💡

二、代谢组学的最新进展

concept

**1. 单细胞代谢组学** **技术挑战**: - 代谢物比蛋白质更不稳定(半衰期从秒到分钟) - 单细胞代谢物总量极低(fg-pg级别) - 样本处理过程中的代谢物变化难以控制 **技术方法**: - **SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)**: - 使用代谢抑制剂处理细胞 - 通过抗...

1. 单细胞代谢组学
技术挑战
- 代谢物比蛋白质更不稳定(半衰期从秒到分钟)
- 单细胞代谢物总量极低(fg-pg级别)
- 样本处理过程中的代谢物变化难以控制
技术方法
- SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)
- 使用代谢抑制剂处理细胞
- 通过抗体检测代谢标志物(如ATP、NADH)
- 间接反映单细胞代谢状态
- Live-seq
- 使用微流控技术提取单细胞细胞质
- 结合质谱分析代谢物
- 实现活细胞代谢组分析
- 空间代谢组学(MALDI-MSI)
- 分辨率提升至5-10 μm(接近单细胞)
- 可以同时获得数百个代谢物的空间分布
- 应用:肿瘤代谢异质性、神经递质分布
2. 人工智能驱动的代谢组学
代谢物鉴定
- 基于深度学习的MS/MS谱图预测
- 使用生成模型(如变分自编码器、GAN)预测未知代谢物的MS/MS谱图
- 与实验谱图匹配,提高鉴定成功率
- MassGenie(2022)
- 基于Transformer框架,探索数百万种碎片模式
- 从质谱数据中识别小分子的能力前所未有
生物标志物发现
- 使用深度学习(CNN、LSTM、GNN)整合多组学数据
- 发现传统统计方法难以识别的复杂生物标志物模式
- 稳定识别算法:基于SVM和递归特征消除,提高代谢组学生物标志物的稳定性
通路分析
- 使用图神经网络(GNN)建模代谢网络
- 预测代谢通路的活性状态和扰动响应
- 整合基因表达和代谢物数据,构建动态代谢模型
3. 代谢组学数据库和标准化
数据库发展
- HMDB 5.0:超过220,000个代谢物条目,包含更多脂质和次级代谢物
- GNPS(Global Natural Products Social Molecular Networking)
- 代谢组学社区平台,支持MS/MS数据共享和协作注释
- 分子网络(molecular networking):基于MS/MS谱图相似性构建代谢物关系网络
- METLIN:超过250,000个代谢物,包含广泛的MS/MS数据
标准化进展
- 代谢组学数据标准(MSI):代谢物鉴定层次标准化
- 代谢组学报告标准(METABOLIGHTS):实验元数据记录
- 质谱数据格式标准化:mzML、mzXML通用格式

查看详情 →
💡

三、多组学整合与精准医学

concept

**1. 多组学整合策略** **数据层面整合**: - 使用MOFA+、iCluster、SNF等统计方法整合多组学数据 - 识别跨组学的共享因子(如疾病状态、批次效应) - 发现单一组学无法检测的调控关系 **知识层面整合**: - 构建多组学调控网络:基因→RNA→蛋白质→代谢物 - 使用贝叶斯网络、因果推断模型推断调控关系 - 整合通路数据库(KEGG、Reactome、Wikipathw...

1. 多组学整合策略
数据层面整合
- 使用MOFA+、iCluster、SNF等统计方法整合多组学数据
- 识别跨组学的共享因子(如疾病状态、批次效应)
- 发现单一组学无法检测的调控关系
知识层面整合
- 构建多组学调控网络:基因→RNA→蛋白质→代谢物
- 使用贝叶斯网络、因果推断模型推断调控关系
- 整合通路数据库(KEGG、Reactome、Wikipathways)进行系统解释
应用案例
- 癌症分子分型
- 整合基因组(突变、CNV)、转录组、蛋白质组和代谢组数据
- 识别新的癌症亚型,指导精准治疗
- 例如:CPTAC(Clinical Proteomic Tumor Analysis Consortium)对多种癌症进行多组学分析
- 疾病机制研究
- 整合GWAS、转录组、蛋白质组和代谢组,构建从基因变异到表型的因果链
- 识别关键调控节点和潜在药物靶点
- 药物反应预测
- 整合多组学数据预测患者对特定药物的反应
- 指导个体化用药(如化疗药物选择、免疫治疗响应预测)
2. 精准医学中的应用
疾病早期诊断
- 蛋白质/代谢标志物panel用于癌症早筛(如多癌种早期检测MCED)
- 液体活检:血液蛋白质组和代谢组分析
治疗靶点发现
- 多组学整合识别疾病驱动因素
- 蛋白质结构预测(AlphaFold)加速靶点结构解析和药物设计
患者分层
- 基于蛋白质组/代谢组特征对患者进行分层
- 预测治疗响应和预后
伴随诊断
- 蛋白质/代谢标志物指导靶向药物使用
- 监测治疗过程中的动态变化,评估疗效

查看详情 →
💡

四、未来展望

concept

**1. 技术发展趋势** **更高灵敏度**: - 单细胞蛋白质组学检测深度向10,000+蛋白质迈进 - 单细胞代谢组学实现真正的代谢物定量 **更高通量**: - 样本处理自动化(液体处理机器人) - 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral) - 每天可处理数百个样本 **更高维度**: - 空间组学:从组织水平到单细胞水平的空间分辨率 - 时间维度:动态监测...

1. 技术发展趋势
更高灵敏度
- 单细胞蛋白质组学检测深度向10,000+蛋白质迈进
- 单细胞代谢组学实现真正的代谢物定量
更高通量
- 样本处理自动化(液体处理机器人)
- 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral)
- 每天可处理数百个样本
更高维度
- 空间组学:从组织水平到单细胞水平的空间分辨率
- 时间维度:动态监测蛋白质/代谢物变化
- 多模态:同时测量蛋白质、代谢物、脂质和翻译后修饰
2. 计算方法发展趋势
AI驱动的全面革新
- 蛋白质语言模型:从结构预测到功能预测、蛋白质设计
- 深度学习质谱分析:从头测序、DIA解析、定量优化
- 生成式AI(如蛋白质扩散模型)用于从头设计蛋白质和代谢酶
多组学整合方法
- 从简单的相关性分析到因果推断
- 从静态网络到动态网络模型
- 从描述性分析到预测性模型
知识图谱
- 构建整合基因组、蛋白质组、代谢组、疾病和药物的全面知识图谱
- 使用图神经网络进行推理和预测
- 支持药物重定位和靶点发现
3. 挑战与机遇
挑战
- 数据标准化和共享:不同实验室、不同平台的数据难以直接比较
- 批次效应:大规模队列研究中的技术变异
- 缺失值和噪声:低丰度分子的检测困难
- 生物信息学瓶颈:数据量增长超过分析能力
- 临床转化:从研究发现到临床应用的鸿沟
机遇
- 技术进步:单细胞、空间、超灵敏质谱技术快速发展
- 计算能力:GPU、TPU、云计算使大规模分析成为可能
- AI革命:深度学习正在改变蛋白质组学和代谢组学的每个环节
- 精准医学:个体化诊断和治疗的需求驱动技术创新
- 国际合作:大型联盟(如HPP、CPTAC、CNHPP)推动标准化和资源共享

查看详情 →

蛋白质结构分析

💡

第9章 蛋白质组学和代谢组学

chapter

> 章节导读:蛋白质是生命活动的主要承担者,代谢物则是基因表达和蛋白质功能的最终产物。蛋白质组学通过高通量质谱技术系统鉴定和定量生物样本中的蛋白质,揭示蛋白质表达、修饰和相互作用的全景图。代谢组学则通过检测小分子代谢物的组成和变化,反映生物体的生理和病理状态。近年来,以深度学习为代表的人工智能技术在蛋白质结构预测和功能分析中取得了革命性突破。本章将系统介绍蛋白质组学、蛋白质结构分析、分子动力学模拟、功能预测以及代谢组学的基本原理和生物信息学分析方法。

查看详情 →
💡

9.1 蛋白质组学概述

section
查看详情 →
💡

一、蛋白质组学的研究内容

concept

蛋白质组学根据研究目的可分为三大类: **1. 表达蛋白质组学(Expression Proteomics)** - 研究蛋白质在不同生理、病理条件下的表达变化 - 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free) - 应用:疾病生物标志物发现、药物靶点鉴定 **2. 结构蛋白质组学(Structural Proteomics)** - 研究蛋白质的三维结构...

蛋白质组学根据研究目的可分为三大类:
1. 表达蛋白质组学(Expression Proteomics)
- 研究蛋白质在不同生理、病理条件下的表达变化
- 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free)
- 应用:疾病生物标志物发现、药物靶点鉴定
2. 结构蛋白质组学(Structural Proteomics)
- 研究蛋白质的三维结构及其动态变化
- 方法:X射线晶体学、NMR、冷冻电镜、计算结构预测
- 应用:蛋白质功能机制、药物设计
3. 功能蛋白质组学(Functional Proteomics)
- 研究蛋白质的功能、相互作用和信号通路
- 方法:蛋白质芯片、酵母双杂交、Co-IP/质谱、Proximity labeling
- 应用:蛋白质网络构建、信号转导通路解析

查看详情 →
💡

二、质谱技术原理

concept

**质谱仪的基本组成**: 1. **离子源**:将分析物转化为气相离子 - ESI(电喷雾电离):适用于液相样品,可产生多电荷离子 - MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子 2. **质量分析器**:按质荷比(m/z)分离离子 - 四极杆(Quadrupole):结构简单,常用于一级筛选 - 飞行时间(TOF):质量范围宽,分辨率较高...

质谱仪的基本组成
1. 离子源:将分析物转化为气相离子
- ESI(电喷雾电离):适用于液相样品,可产生多电荷离子
- MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子
2. 质量分析器:按质荷比(m/z)分离离子
- 四极杆(Quadrupole):结构简单,常用于一级筛选
- 飞行时间(TOF):质量范围宽,分辨率较高
- 轨道阱(Orbitrap):超高分辨率(>100,000),质量精度高(<1 ppm)
- 离子阱(Ion Trap):可进行多级碎裂(MSn)
3. 检测器:检测并记录离子信号
4. 数据处理系统:将信号转化为质谱图
串联质谱(MS/MS或MS²)
- 第一级质谱(MS1):分离和选择特定质荷比的母离子(precursor ion)
- 碰撞室:母离子与惰性气体(如N₂、Ar)碰撞,发生裂解(CID/HCD/EThcD)
- 第二级质谱(MS2):分析碎片离子(fragment ions)的质荷比
- 碎片类型:b离子(N端碎片)、y离子(C端碎片)为主

查看详情 →
💡

三、鸟枪法蛋白质组学流程

concept

**实验部分**: 1. **蛋白质提取**:从细胞/组织中提取总蛋白质 2. **蛋白质定量**:BCA/Bradford法测定蛋白质浓度 3. **蛋白质还原和烷基化**:DTT还原二硫键,IAA烷基化保护游离巯基 4. **酶解**:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段 5. **肽段脱盐**:C18柱去除盐类和干扰物 6. **LC-MS/MS分析**: - 液...

实验部分
1. 蛋白质提取:从细胞/组织中提取总蛋白质
2. 蛋白质定量:BCA/Bradford法测定蛋白质浓度
3. 蛋白质还原和烷基化:DTT还原二硫键,IAA烷基化保护游离巯基
4. 酶解:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段
5. 肽段脱盐:C18柱去除盐类和干扰物
6. LC-MS/MS分析
- 液相色谱(nano-LC)分离肽段(通常60-120分钟梯度)
- 电喷雾离子化(ESI)进入质谱仪
- 数据依赖采集(DDA):MS1全扫描 → 选择前N个最强离子进行MS2碎裂
- 数据非依赖采集(DIA):MS1全扫描 → 对预设m/z窗口进行系统MS2碎裂
计算部分
1. 数据库搜索
- 输入:MS2谱图 + 蛋白质序列数据库
- 过程:根据母离子质量筛选候选肽段 → 预测理论碎片谱图 → 与实验谱图比对打分
- 输出:PSM列表(肽段-谱图匹配结果)
2. FDR控制
- 目标-诱饵库策略(Target-Decoy):构建随机或反序的诱饵数据库,与目标数据库同时搜索
- 混合搜库FDR = 2×R / (F + R),其中F为目标库匹配数,R为诱饵库匹配数
- 分开搜库FDR = R / F
- 通常FDR < 1%作为可信鉴定阈值
3. 蛋白质组装
- 从肽段推断蛋白质:Occam's Razor原则(用最少的蛋白质解释所有肽段)
- 处理共享肽段(不同蛋白质产生的相同肽段)
- 概率型组装(如ProteinProphet):基于肽段置信度计算蛋白质水平概率
4. 蛋白质定量
- 标记定量:TMT/iTRAQ的 reporter ion 强度比
- SILAC:轻/重同位素标记肽段的峰面积比
- Label-free:基于肽段色谱峰面积或谱图计数(spectral counting)
- 定量值归一化:消除系统偏差

查看详情 →
💡

四、翻译后修饰蛋白质组学

concept

**磷酸化蛋白质组学**: - 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化 - 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%) - 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr) - 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄) - 软件:MaxQuant、Proteome Discoverer、pFi...

磷酸化蛋白质组学
- 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化
- 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%)
- 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr)
- 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄)
- 软件:MaxQuant、Proteome Discoverer、pFind(支持磷酸化位点定位)
糖基化蛋白质组学
- N-糖基化:Asn-X-Ser/Thr序列模体(X≠Pro),发生在内质网/高尔基体
- O-糖基化:主要发生在Ser/Thr,无特定序列模体
- 富集策略:凝集素亲和色谱、亲水相互作用色谱(HILIC)
- 鉴定挑战:糖链异质性导致同一肽段产生多种糖型
- 软件:Byonic、pGlyco、NGlycan
泛素化蛋白质组学
- 泛素化通过蛋白酶体途径调控蛋白质降解
- 富集策略:K-GG抗体(识别泛素化留下的Lys-Gly-Gly足迹)
- 应用:泛素-蛋白酶体系统研究、药物靶点发现(如蛋白酶体抑制剂)

查看详情 →
💡

五、蛋白质组数据与资源

concept

**公共数据库**: - **PRIDE**(Proteomics Identification Database):EMBL-EBI维护,存储MS数据 - **PeptideAtlas**:基于多实验数据的蛋白质/肽段图谱 - **MassIVE**:UCSD维护,支持数据存储和重新分析 - **ProteomeXchange(PX)**:国际联盟,统一数据提交标准 **人类蛋白质组计划(HPP...

公共数据库
- PRIDE(Proteomics Identification Database):EMBL-EBI维护,存储MS数据
- PeptideAtlas:基于多实验数据的蛋白质/肽段图谱
- MassIVE:UCSD维护,支持数据存储和重新分析
- ProteomeXchange(PX):国际联盟,统一数据提交标准
人类蛋白质组计划(HPP)
- 目标:系统绘制人类蛋白质组图谱
- 2020年:发布了覆盖>90%人类蛋白质编码基因的草图
- 中国人类蛋白质组计划(CNHPP):聚焦中国人常见癌症的蛋白质组研究

查看详情 →
💡

9.2 蛋白质结构分析

section
查看详情 →
💡

一、蛋白质结构的层次组织

concept

**1. 一级结构** - 由20种常见氨基酸通过肽键连接形成线性多肽链 - 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向 - 关键特征:N端(氨基端)和C端(羧基端),肽链方向性 **2. 二级结构** **α螺旋**: - 每圈3.6个氨基酸残基,螺距5.4 Å - 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键 - 氢键大致平行于螺旋轴,稳定螺旋结构 - 氨基酸倾向性...

1. 一级结构
- 由20种常见氨基酸通过肽键连接形成线性多肽链
- 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向
- 关键特征:N端(氨基端)和C端(羧基端),肽链方向性
2. 二级结构
α螺旋
- 每圈3.6个氨基酸残基,螺距5.4 Å
- 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键
- 氢键大致平行于螺旋轴,稳定螺旋结构
- 氨基酸倾向性:Ala、Glu、Leu、Met偏好螺旋;Pro、Gly破坏螺旋
β折叠
- 由多条肽链片段或同一肽链的不同片段平行排列形成
- 链间氢键稳定:一条链的羰基氧与另一条链的酰胺氢形成氢键
- 平行式(N→C同向)和反平行式(N→C反向),反平行更稳定
- 氨基酸倾向性:Val、Ile、Phe偏好β折叠;Pro、Gly不利于β折叠
环区/转角(Loop/Turn)
- 连接二级结构元件的无规区域
- 通常位于蛋白质表面,暴露在溶剂中
- 高柔性和高多样性,常参与功能位点形成
3. 超二级结构(Supersecondary Structure)
- 两个或多个二级结构单元的组合模式
- 常见类型:α-α(螺旋-转角-螺旋)、β-α-β(Rossmann折叠)、β-发夹(β-hairpin)
4. 结构域(Domain)
- 独立折叠的球状单元,具有特定功能
- 结构域分类:全α(all-α)、全β(all-β)、α/β(交替)、α+β(分离)
- 多结构域蛋白质:不同结构域可以执行不同功能,通过柔性连接子连接
5. 三级结构
- 稳定三级结构的相互作用:
- 疏水作用:疏水残基埋藏在蛋白质内部(主要驱动力)
- 氢键:主链和侧链之间
- 离子键:带相反电荷的侧链之间
- 范德华力:所有原子之间的弱吸引力
- 二硫键:半胱氨酸残基之间的共价连接(稳定作用)
6. 四级结构
- 多个多肽链(亚基)通过非共价相互作用形成蛋白质复合物
- 亚基间相互作用:疏水界面、氢键、盐桥
- 别构效应:配体结合改变亚基间相互作用,调控蛋白质活性

查看详情 →
💡

二、蛋白质结构预测方法

concept

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测

查看详情 →
💡

三、蛋白质结构性质预测

concept

**1. 二级结构预测** **Q3准确率**:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。 **方法发展**: - 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60% - 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65% - 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多...

1. 二级结构预测
Q3准确率:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。
方法发展
- 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60%
- 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65%
- 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多序列比对,准确率>75-80%
- 深度学习:基于CNN/Transformer,准确率>85%
PSIPRED方法
1. PSI-BLAST搜索NR数据库,获得多序列比对(PSSM)
2. 将PSSM特征(20种氨基酸的频率)输入两层神经网络
3. 输出每个残基的三态概率(H/E/C)
2. 无序区预测(Intrinsically Disordered Region, IDR)
IDR特征
- 生理条件下不能形成稳定三维结构
- 人类蛋白质中约30-40%的残基处于无序区
- 功能:信号传导、转录调控、蛋白质相互作用枢纽
预测方法
- IUPred:基于能量估算(低相互作用能→无序)
- PONDR、DisEMBL:基于机器学习和神经网络
- SPOT-Disorder:基于深度学习,准确率>80%

查看详情 →
💡

四、功能蛋白质的从头设计

concept

**设计策略**: 1. **拓扑选择**:选择适合目标功能的蛋白质折叠类型 2. **骨架设计**:设计主链结构,满足目标约束(如配体结合口袋) 3. **序列优化**:使用能量函数和深度学习优化氨基酸序列 4. **实验验证**:表达纯化蛋白质,验证功能 **深度学习设计方法**: - **trRosetta**:基于Transformer的序列-结构联合生成 - **ProteinMPNN*...

设计策略
1. 拓扑选择:选择适合目标功能的蛋白质折叠类型
2. 骨架设计:设计主链结构,满足目标约束(如配体结合口袋)
3. 序列优化:使用能量函数和深度学习优化氨基酸序列
4. 实验验证:表达纯化蛋白质,验证功能
深度学习设计方法
- trRosetta:基于Transformer的序列-结构联合生成
- ProteinMPNN:基于图神经网络的序列设计
- RFdiffusion:基于扩散模型的蛋白质结构生成(2023, Baker Lab)
成功案例
- 2023年Baker Lab设计新型萤光素酶(LuxSit-i)
- 使用"family-wide hallucination"从NTF2超家族生成新结构
- 通过RIFGen/RIFDock设计与DTZ配体的结合口袋
- 设计的萤光素酶活性与天然酶相当,但结构完全不同

查看详情 →
💡

9.3 蛋白质分子动力学模拟

section
查看详情 →
💡

一、统计力学基础

concept

**1. 相空间和系综** 对于N个粒子组成的系统,经典动力学由6N个变量描述: - 位置:r₁(t), r₂(t), ..., rₙ(t) - 动量:p₁(t), p₂(t), ..., pₙ(t) 相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。 **系综类型**: - **NVT(正则系综)**:粒子数N、体积V、温度T恒定。通过热...

1. 相空间和系综
对于N个粒子组成的系统,经典动力学由6N个变量描述:
- 位置:r₁(t), r₂(t), ..., rₙ(t)
- 动量:p₁(t), p₂(t), ..., pₙ(t)
相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。
系综类型
- NVT(正则系综):粒子数N、体积V、温度T恒定。通过热浴(thermostat)维持温度,如Nosé-Hoover、Langevin动力学。
- NPT(等温等压系综):粒子数N、压强P、温度T恒定。通过恒压器(barostat)调节体积,如Parrinello-Rahman、Berendsen。
- NVE(微正则系综):粒子数N、体积V、总能量E恒定。无热浴和恒压器,系统为孤立体系。
2. 自由能
Helmholtz自由能(F):适用于恒容体系(NVT)
$$F = U - TS$$
Gibbs自由能(G):适用于恒压体系(NPT),生物体系常用
$$G = H - TS = U + PV - TS$$
其中U为内能,T为温度,S为熵,H为焓,P为压强,V为体积。
自由能是系统做非体积功的最大能力。在恒温恒压下,自发过程总是朝着Gibbs自由能降低的方向进行(ΔG < 0)。
自由能面(Free Energy Landscape)
- 描述系统自由能随构象坐标变化的"地形图"
- 低能量区域(山谷)对应稳定构象(亚稳态)
- 高能量区域(山脊)对应过渡态
- 能垒高度决定构象转换的速率(Arrhenius方程)
自由能计算
- 直接计数法:ΔF = -k_B T ln(P_A / P_B),其中P_A和P_B为状态A和B的观测概率
- 缺点:对于高能量垒,罕见事件的采样需要极长时间

查看详情 →
💡

二、分子力场

concept

力场将总势能分解为键合项和非键合项: $$E_{total} = E_{bonded} + E_{nonbonded}$$ **1. 键合项(Bonded Terms)** **键长伸缩能**: $$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$ - 谐振子近似,K_r为力常数,r_eq为平衡键长 **键角弯曲能**: $$E_{angl...

力场将总势能分解为键合项和非键合项:
$$E_{total} = E_{bonded} + E_{nonbonded}$$
1. 键合项(Bonded Terms)
键长伸缩能
$$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$
- 谐振子近似,K_r为力常数,r_eq为平衡键长
键角弯曲能
$$E_{angle} = \sum_{angles} \frac{K_\theta}{2}(\theta - \theta_{eq})^2$$
- 谐振子近似,K_θ为力常数,θ_eq为平衡键角
二面角扭转能
$$E_{dihedral} = \sum_{dihedrals} \sum_{n} \frac{V_n}{2}[1 + \cos(n\phi - \gamma)]$$
- 傅里叶级数展开,V_n为势垒高度,n为周期性(旋转对称性),γ为相位偏移
2. 非键合项(Nonbonded Terms)
静电相互作用(Coulomb)
$$E_{electrostatic} = \sum_{i<j} \frac{q_i q_j}{4\pi\varepsilon_0 r_{ij}}$$
- q_i, q_j为原子电荷,r_ij为原子间距离
- 长程相互作用,通常使用截断(cutoff)或PME(Particle Mesh Ewald)方法处理
范德华相互作用(Lennard-Jones)
$$E_{vdW} = \sum_{i<j} \varepsilon_{ij}\left[\left(\frac{\sigma_{ij}}{r_{ij}}\right)^{12} - \left(\frac{\sigma_{ij}}{r_{ij}}\right)^6\right]$$
- ε_ij为势阱深度(相互作用强度)
- σ_ij为势能为0时的距离(原子"半径")
- r⁻¹²项:短程排斥(电子云重叠)
- r⁻⁶项:长程吸引(London色散力)
3. 常见力场
AMBER
- 开发:UC San Francisco (Peter Kollman, David Case)
- 特点:广泛用于蛋白质和核酸,参数基于量子化学计算和实验数据
- 版本:AMBER94/99/03/14/19, ff99SB-ILDN, ff14SB
- 优势:蛋白质力场准确,参数优化充分
CHARMM
- 开发:Harvard University (Martin Karplus)
- 特点:全面覆盖生物大分子(蛋白质、脂质、核酸、糖类)
- 版本:CHARMM22/27/36/36m
- 优势:脂质膜和膜蛋白模拟表现出色
OPLS-AA
- 开发:Jorgensen Lab (Yale University)
- 特点:液态模拟和蛋白质模拟兼顾
- 版本:OPLS-AA/L, OPLS3/3e
- 优势:有机小分子参数丰富
GROMOS
- 开发:van Gunsteren Lab (ETH Zurich)
- 特点: united-atom 表示(减少计算量)
- 版本:GROMOS43A1/53A5/54A7
- 优势:计算效率高,适用于大规模体系
力场选择原则
- 蛋白质模拟:AMBER ff14SB/ff19SB, CHARMM36m
- 膜蛋白模拟:CHARMM36, Slipids
- 小分子/药物设计:OPLS3/3e, GAFF2
- 大规模体系:GROMOS, MARTINI(粗粒化)

查看详情 →
💡

三、牛顿运动方程与积分算法

concept

**1. 牛顿运动方程** 对于每个原子i: $$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$ 其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。 **2. 有限差分积分算法** **Verlet算法**: $$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delt...

1. 牛顿运动方程
对于每个原子i:
$$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$
其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。
2. 有限差分积分算法
Verlet算法
$$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delta t^2$$
- 优点:时间可逆,能量守恒好
- 缺点:速度计算精度低
Velocity Verlet算法
$$v(t + \frac{\Delta t}{2}) = v(t) + \frac{a(t)\Delta t}{2}$$
$$r(t + \Delta t) = r(t) + v(t + \frac{\Delta t}{2})\Delta t$$
$$v(t + \Delta t) = v(t + \frac{\Delta t}{2}) + \frac{a(t + \Delta t)\Delta t}{2}$$
- 优点:同时更新位置和速度,精度高,稳定性好
- 是目前最常用的MD积分算法
时间步长选择
- 典型值:2 fs(飞秒,10⁻¹⁵秒)
- 限制因素:体系中最快运动(键长振动,C-H键约10⁻¹⁴秒周期)
- 约束算法(SHAKE/SETTLE/LINCS):固定键长,允许更大时间步长(2-4 fs)
3. 周期性边界条件(PBC)
- 模拟盒子(如立方体、十二面体、截角八面体)被其镜像复制填满整个空间
- 原子离开盒子一侧时,从另一侧进入(保持原子数恒定)
- 最小镜像约定:每个原子只与最近的镜像相互作用
- 目的:消除边界效应,模拟无限大体系
4. 长程相互作用处理
截断法(Cutoff)
- 只计算截断距离(如10-12 Å)内的非键相互作用
- 简单高效,但对于带电体系可能引入显著误差
Particle Mesh Ewald(PME)
- 将长程静电相互作用分解为实空间短程和倒空间长程两部分
- 实空间:截断范围内直接计算
- 倒空间:使用快速傅里叶变换(FFT)在网格上计算
- 优点:精度高(~10⁻⁵),效率合理
- 缺点:需要周期性边界条件

查看详情 →
💡

四、MD模拟流程

concept

**1. 体系准备** - 获取蛋白质结构(PDB下载或预测) - 检查结构完整性:缺失原子、残基、二硫键 - 添加氢原子(根据pH确定质子化状态) - 选择力场和溶剂模型(如TIP3P、SPC/E) - 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度) - 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI **2. 能量最小化** - 目的:消除不...

1. 体系准备
- 获取蛋白质结构(PDB下载或预测)
- 检查结构完整性:缺失原子、残基、二硫键
- 添加氢原子(根据pH确定质子化状态)
- 选择力场和溶剂模型(如TIP3P、SPC/E)
- 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度)
- 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI
2. 能量最小化
- 目的:消除不合理的原子接触和键长/键角畸变
- 算法:最陡下降法(Steepest Descent)→ 共轭梯度法(Conjugate Gradient)
- 判断标准:体系势能达到最小值,最大受力<1000 kJ/mol/nm
3. 平衡阶段
- NVT平衡:在恒定体积下升温至目标温度(如300K),温度耦合(如V-rescale)
- NPT平衡:在恒定温度和压强下平衡密度,压强耦合(如Parrinello-Rahman)
- 判断标准:温度、密度、能量、RMSD均达到稳定波动
- 典型时长:100 ps - 1 ns
4. 生产模拟(Production Run)
- 在平衡后的构象上开始长时间采样
- 记录轨迹(坐标、速度、能量等)
- 典型时长:100 ns - 10 μs(取决于体系和计算资源)
- 现代GPU加速:RTX 4090可达~100 ns/天(~50,000原子体系)
5. 轨迹分析
- 结构分析:RMSD、RMSF、回旋半径(Rg)
- 动力学分析:主成分分析(PCA)、自由能面构建
- 相互作用分析:氢键、盐桥、疏水接触、π-π堆积
- 工具:VMD、MDAnalysis、MDTraj、CPPTRAJ

查看详情 →
💡

五、增强采样方法

concept

**1. 伞形采样(Umbrella Sampling)** - 沿反应坐标(Collective Variable, CV)划分多个窗口 - 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]² - 将系统限制在特定CV范围内采样 - 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面 - 适用:...

1. 伞形采样(Umbrella Sampling)
- 沿反应坐标(Collective Variable, CV)划分多个窗口
- 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]²
- 将系统限制在特定CV范围内采样
- 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面
- 适用:已知反应路径,计算自由能面
2. 副本交换分子动力学(REMD)
- 并行运行多个不同温度的副本(如300K, 310K, 320K, ...)
- 定期尝试交换相邻副本的构象(按Metropolis准则)
- 高温副本探索高能量构象,交换到低温副本中
- 适用:构象搜索、折叠/去折叠研究
- 缺点:副本数随体系自由度增加,计算成本高
3. 元动力学(Metadynamics)
- 在CV空间上不断添加高斯偏置势(负反馈机制)
- 高斯势累积"填平"势能阱,促进系统逃离局部最小值
- 适用:未知反应路径,自动探索自由能面
- 变种:Well-Tempered Metadynamics(WTMetaD)、Adaptive Bias Force(ABF)
4. 其他方法
- Steered MD(SMD):施加外力驱动系统沿特定方向运动
- Gaussian Accelerated MD(GaMD): boost 势能促进低能量区域的采样
- REST2(Replica Exchange with Solute Tempering):仅增强溶质温度,降低计算成本

查看详情 →
💡

六、粗粒化模拟

concept

**MARTINI力场**: - 将4个重原子映射为1个珠子(bead) - 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水) - 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍 - 应用:膜蛋白、脂质体、大分子复合物组装 - 局限:丧失原子细节,不适合研究化学键形成/断裂

MARTINI力场
- 将4个重原子映射为1个珠子(bead)
- 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水)
- 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍
- 应用:膜蛋白、脂质体、大分子复合物组装
- 局限:丧失原子细节,不适合研究化学键形成/断裂

查看详情 →
💡

9.4 蛋白质功能预测与分析

section
查看详情 →
💡

一、蛋白质功能概述

concept

**1. 蛋白质功能的层次性** 蛋白质功能具有复杂性和多层次性: - **分子功能**:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活) - **生物过程**:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路) - **细胞组分**:蛋白质所在的细胞位置(如细胞核、线粒体、膜) 同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行...

1. 蛋白质功能的层次性
蛋白质功能具有复杂性和多层次性:
- 分子功能:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活)
- 生物过程:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路)
- 细胞组分:蛋白质所在的细胞位置(如细胞核、线粒体、膜)
同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行(冗余性)。
2. GO注释系统
GO采用有向无环图(DAG)结构组织术语:
- 每个术语(GO term)有唯一ID(如GO:0004672,蛋白激酶活性)
- 术语之间存在"is_a"和"part_of"关系
- 从根节点到叶节点的路径表示功能的特异性递增
GO注释证据代码
- EXP:实验验证
- IDA:直接实验测定
- IPI:蛋白质相互作用
- ISS:序列相似性推断
- IEA:自动电子注释
- ...(共约15种证据代码)
3. CAFA竞赛
- 2010年首次举办,之后每2-3年一次
- 使用未公开蛋白质序列作为测试集
- 评估指标:Fmax(F-measure最大值)、Smin(语义距离最小值)、AUPR(精确率-召回率曲线下面积)
- 推动了功能预测方法的发展,特别是整合多源信息的方法

查看详情 →
💡

二、基于序列的功能分析

concept

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区

查看详情 →
💡

三、基于结构的功能分析

concept

**1. 基于结构相似性的功能预测** **原理**:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。 **结构比对工具**: - **DALI**:基于分子内距离矩阵的比较 - **TM-align**:基于TM-score的结构相似性度量 - **FATCAT**:允许柔性旋转的结构比对 **结构比对评估**: - **RMSD(Root Mean Square Deviation)*...

1. 基于结构相似性的功能预测
原理:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。
结构比对工具
- DALI:基于分子内距离矩阵的比较
- TM-align:基于TM-score的结构相似性度量
- FATCAT:允许柔性旋转的结构比对
结构比对评估
- RMSD(Root Mean Square Deviation):结构叠合后的原子坐标偏差,<2Å为高度相似
- TM-score(Template Modeling Score):0-1之间,>0.5表示相同折叠,>0.9表示高度相似
- GDT_TS:与CASP评估类似,用于结构相似性度量
2. 基于结构的功能预测工具
ProFunc
- 整合多种序列和结构分析方法
- 包括序列同源性搜索、结构相似性搜索、残基保守性分析、表面分析等
- 输出综合功能注释
COFACTOR
- 基于结构比对的功能注释系统
- 将待测蛋白结构比对到已知功能模板库
- 预测配体结合位点、酶学分类(EC号)、GO注释
3. 基于分子对接的功能分析
分子对接原理
- 搜索配体在受体结合口袋中的最佳位置和取向
- 评估结合模式的亲和力(打分函数)
- 预测配体-受体相互作用
对接类型
- 刚性对接:受体和配体构象均固定,适用于大分子对接(如蛋白质-蛋白质)
- 半柔性对接:配体构象可变化,受体固定,适用于小分子-蛋白质对接
- 柔性对接:受体和配体构象均可变化,精度高但计算成本高
对接流程
1. 受体准备:从PDB获取结构,添加氢原子,确定质子化状态,定义结合口袋
2. 配体准备:生成3D构象,添加电荷,确定可旋转键
3. 构象搜索:系统搜索、遗传算法、蒙特卡罗模拟等方法
4. 打分评估:基于力场、经验公式或知识的打分函数
5. 结果分析:聚类相似构象,选择最佳结合模式
常用对接软件
- AutoDock Vina:快速开源对接软件,基于经验打分函数
- GOLD:商业软件,基于遗传算法,高精度
- Glide:Schrödinger软件包,基于网格搜索
- rDOCK:基于力场的对接和打分
虚拟筛选(Virtual Screening)
- 将大型化合物库(如数百万分子)与靶蛋白对接
- 筛选结合打分最高的候选化合物
- 用于药物发现的早期阶段,大幅降低实验筛选成本
4. 结合自由能计算
MM-PBSA/MM-GBSA
- 基于分子力学和泊松-玻尔兹曼/广义Born溶剂化模型
- 计算结合自由能:ΔG_bind = ΔH - TΔS ≈ ΔE_MM + ΔG_solvation - TΔS
- 适用于快速估算相对结合亲和力
自由能微扰(FEP)
- 通过一系列"炼金术"变换(逐渐改变配体A为配体B)计算相对结合自由能
- 精度高(<1 kcal/mol),但计算成本高
- 适用于先导化合物优化
热力学积分(TI)
- 类似FEP,但使用积分而非微扰计算自由能差
- 适用于化学变化较大的体系

查看详情 →
💡

四、基于网络的蛋白质功能分析

concept

**1. 蛋白质相互作用网络(PPI Network)** PPI网络以蛋白质为节点,相互作用为边。 - 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘 - 数据库:STRING、BioGRID、IntAct、MINT **2. 基于邻域的方法(Neighborhood Method)** **邻居计数法**: - 将邻居节点中最频繁的功能分配给目标蛋白 - 简单直接,但忽略...

1. 蛋白质相互作用网络(PPI Network)
PPI网络以蛋白质为节点,相互作用为边。
- 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘
- 数据库:STRING、BioGRID、IntAct、MINT
2. 基于邻域的方法(Neighborhood Method)
邻居计数法
- 将邻居节点中最频繁的功能分配给目标蛋白
- 简单直接,但忽略了功能频率差异
χ²检验法
- 使用χ²检验或Fisher精确检验确定邻居中显著富集的功能
- 仅将显著富集的功能分配给目标蛋白
- 比简单计数法更可靠
邻居扩展法
- 将邻居扩展到一阶邻居的近邻
- 扩大功能信息来源,但可能引入噪声
3. 基于全局网络拓扑的方法
马尔可夫随机场(MRF)
- 建模网络中节点功能的依赖关系
- 利用Gibbs采样或变分推断进行概率推断
- 考虑全局网络结构,而不仅是局部邻居
4. 基于模块划分的方法
模块识别
- 识别网络中紧密连接的节点群(社区/模块)
- 同一模块内的蛋白质倾向于参与同一生物过程
常用算法
- MCL(Markov Cluster Algorithm):基于随机游走的扩展和膨胀操作
- Louvain算法:基于模块度优化的贪心算法
- RWR(Random Walk with Restart):从种子节点出发,通过重启随机游走量化节点关联性
- 谱聚类:基于图拉普拉斯矩阵的特征向量聚类
模块识别后的功能注释
- 将模块内已知功能直接分配给未知蛋白
- 使用χ²检验或Fisher精确检验对模块内功能进行富集分析
- 结合机器学习模型,利用网络拓扑特征预测功能
5. 基于网络整合的方法
GeneMANIA
- 整合多种网络(PPI、基因共表达、遗传相互作用、通路共享)
- 使用线性回归学习每个网络的权重
- 构建加权整合网络,使用标签传播算法预测功能
GAIN(Graphical Association Network)
- 基于贝叶斯网络的方法
- 将每个网络视为独立证据
- 使用条件概率和贝叶斯规则整合证据,推断功能概率
6. 基于深度学习的网络方法
DeepWalk
- 通过随机游走生成节点序列
- 使用Skip-gram模型学习节点嵌入(低维向量表示)
- 嵌入向量保留网络拓扑信息
DeepGO
- 整合DeepWalk网络特征和序列特征(3-mer编码+1D CNN)
- 分层神经网络预测GO功能,保持GO层次关系
图卷积网络(GCN)
- 直接对图结构进行卷积操作
- 每个节点的特征由邻居节点聚合得到
- DeepGraphGO:构建多物种PPI网络,使用GCN提取特征,整合序列特征预测功能

查看详情 →
💡

9.5 代谢组学

section
查看详情 →
💡

一、代谢组学技术平台

concept

**1. 核磁共振(NMR)** **原理**: - 利用原子核(主要是¹H)在磁场中的共振吸收特性 - 不同化学环境的氢原子具有不同的化学位移 - 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构 **优点**: - 非破坏性,样本可重复使用 - 无需色谱分离,样品制备简单 - 定量准确,重现性高 - 可检测所有含氢代谢物(无偏向性) **缺点**: - 灵敏度低...

1. 核磁共振(NMR)
原理
- 利用原子核(主要是¹H)在磁场中的共振吸收特性
- 不同化学环境的氢原子具有不同的化学位移
- 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构
优点
- 非破坏性,样本可重复使用
- 无需色谱分离,样品制备简单
- 定量准确,重现性高
- 可检测所有含氢代谢物(无偏向性)
缺点
- 灵敏度低(比MS低3-5个数量级)
- 分辨率有限,复杂样本谱图重叠严重
- 难以检测低丰度代谢物
应用
- 体液代谢组学(尿液、血液)
- 样本非常珍贵的情况(需要后续其他分析)
- 实时动态监测(如流动注射NMR)
2. 液相色谱-质谱联用(LC-MS)
原理
- 液相色谱(LC):根据代谢物在固定相和流动相之间的分配系数差异进行分离
- 反相色谱(RP-C18):分离非极性/中等极性代谢物(如脂质、脂肪酸)
- 亲水作用色谱(HILIC):分离极性代谢物(如氨基酸、糖类、核苷酸)
- 质谱(MS):LC洗脱的代谢物经ESI离子化,进入质谱仪检测
- 高分辨质谱(HRMS):Orbitrap、Q-TOF,精确分子量<5 ppm
- 串联质谱(MS/MS):提供碎片信息,用于结构鉴定
优点
- 灵敏度高(fmol-pmol级别)
- 覆盖范围广(可同时检测数千种代谢物)
- 分辨率高,可区分同分异构体
缺点
- 离子化效率差异导致定量偏差
- 基质效应(matrix effect):复杂样本中共同洗脱物质抑制或增强信号
- 样本制备要求高
3. 气相色谱-质谱联用(GC-MS)
原理
- 气相色谱(GC):样本气化后,在色谱柱中根据沸点和极性分离
- 质谱(MS):EI(电子轰击)电离,产生特征性碎片谱图
- 数据库:NIST/EPA/NIH Mass Spectral Library(超过250,000张标准谱图)
优点
- 重现性极高,保留时间稳定
- 有完善的EI谱图数据库,便于鉴定
- 定量准确(使用内标法)
缺点
- 需要样本衍生化(硅烷化、甲基化),增加样品制备复杂度
- 只能检测热稳定和挥发性代谢物(分子量<500 Da)
- 不适用于大分子、极性代谢物
应用
- 植物代谢组学(挥发性代谢物丰富)
- 脂肪酸分析
- 氨基酸和有机酸分析(衍生化后)
4. 其他技术
CE-MS(毛细管电泳-质谱)
- 分离原理:基于电荷/质量比的电泳迁移
- 优势:分离效率高,适合极性代谢物和离子型代谢物
- 应用:氨基酸、有机酸、核苷酸分析
MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 原理:在组织切片上直接进行质谱分析,获得代谢物的空间分布
- 应用:肿瘤代谢异质性、药物组织分布
5. 技术选择策略
| 样本类型 | 推荐技术 | 理由 |
|----------|----------|------|
| 血清/血浆 | LC-MS (RP + HILIC) | 覆盖极性和非极性代谢物 |
| 尿液 | NMR或LC-MS | NMR定量准确,LC-MS灵敏度高 |
| 组织 | LC-MS或GC-MS | 根据目标代谢物类型选择 |
| 植物提取物 | GC-MS + LC-MS | 挥发性用GC-MS,极性用LC-MS |
| 脂质组学 | LC-MS (RP-C18) | 反相色谱分离脂质效果好 |
| 单细胞 | LC-MS (高灵敏) | 需要极低样本量 |

查看详情 →
💡

二、代谢组学实验设计

concept

**1. 样本收集与制备** **样本类型**: - 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁 - 组织样本:肝脏、肌肉、肿瘤、脑组织 - 细胞样本:培养细胞、原代细胞 - 其他:粪便、肠道内容物、发酵液 **质控样本**: - **QC样本(Quality Control)**:混合等量的所有实验样本,用于监测系统稳定性和数据质量 - **空白样本**:溶剂空白,评估背景污染 - **标准...

1. 样本收集与制备
样本类型
- 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁
- 组织样本:肝脏、肌肉、肿瘤、脑组织
- 细胞样本:培养细胞、原代细胞
- 其他:粪便、肠道内容物、发酵液
质控样本
- QC样本(Quality Control):混合等量的所有实验样本,用于监测系统稳定性和数据质量
- 空白样本:溶剂空白,评估背景污染
- 标准品:已知浓度的代谢物混合物,用于方法验证
样本制备
- 蛋白质沉淀:甲醇/乙腈/氯仿提取,去除大分子
- 脂质去除:如需分析极性代谢物,使用正己烷或氯仿去除脂质
- 衍生化:GC-MS需要硅烷化(BSTFA+TMCS)或甲基化
- 注意:不同代谢物类别需要不同的提取方法,没有"一刀切"的最佳方案
2. 仪器分析
色谱条件优化
- 色谱柱选择:C18(反相)、HILIC(亲水)、T3(混合模式)
- 流动相:水/乙腈或水/甲醇,含0.1%甲酸或5mM乙酸铵
- 梯度洗脱:从低有机相到高有机相,洗脱不同极性的代谢物
- 流速:200-400 μL/min(nano-LC更低)
质谱参数
- 离子源:ESI+(正离子模式,检测碱性代谢物如氨基酸、胺类)和ESI-(负离子模式,检测酸性代谢物如脂肪酸、有机酸)
- 采集模式:Full scan(全扫描)+ DDA(数据依赖MS/MS)或DIA(全离子碎片)
- 分辨率:Orbitrap 60,000-120,000(Full scan),15,000-30,000(MS/MS)
- 扫描范围:m/z 50-1000(或更宽)
3. 数据质量监控
QC样本分析
- 每5-10个样本插入一个QC样本
- 监测保留时间漂移、信号强度变化、峰形变化
- 评估标准:QC中代谢物峰的RSD(相对标准偏差)<20%(或30%)
批次效应评估
- PCA分析:检查QC样本是否聚类,样本是否按批次聚集
- 如果样本按批次分离,说明存在显著批次效应,需要校正

查看详情 →
💡

三、代谢组学数据处理

concept

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能

查看详情 →
💡

四、代谢通路分析

concept

**1. 过表征分析(ORA, Over-Representation Analysis)** **原理**: - 输入:差异代谢物列表 - 背景:所有检测到的代谢物 - 方法:Fisher精确检验或超几何检验 - 输出:显著富集的代谢通路(p < 0.05) **局限性**: - 忽略代谢物变化方向(上调/下调) - 忽略代谢物丰度变化幅度 - 假设通路独立,忽略通路间交互 **2. 通路拓扑分...

1. 过表征分析(ORA, Over-Representation Analysis)
原理
- 输入:差异代谢物列表
- 背景:所有检测到的代谢物
- 方法:Fisher精确检验或超几何检验
- 输出:显著富集的代谢通路(p < 0.05)
局限性
- 忽略代谢物变化方向(上调/下调)
- 忽略代谢物丰度变化幅度
- 假设通路独立,忽略通路间交互
2. 通路拓扑分析(PT, Pathway Topology)
原理
- 考虑代谢通路中的拓扑结构(代谢物连接度、位置重要性)
- 中心代谢物(如ATP、NADH)在通路中的权重更高
- 方法:Impact Factor、Node Importance
软件
- MetaboAnalyst:综合代谢组学分析平台,支持ORA、PT、联合分析
- MetPA(Metabolic Pathway Analysis):基于通路拓扑的富集分析
- KEGG Mapper:基于KEGG通路的可视化分析
3. 整合通路分析
MSEA(Metabolite Set Enrichment Analysis)
- 类似GSEA,不需要预设差异代谢物阈值
- 输入:所有代谢物的排序列表(如按|logFC|排序)
- 评估预定义代谢物集合(如通路)是否集中在排序列表的顶端或底端
联合通路分析
- 整合ORA和拓扑分析的结果
- 结合代谢物变化方向和幅度
- 更全面地解释通路调控状态

查看详情 →
💡

五、代谢组学应用实例

concept

**1. 疾病生物标志物发现** **策略**: - 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照) - 验证阶段:靶向代谢组学,在独立队列中验证候选标志物 - 临床转化:开发检测试剂盒,进行临床试验 **成功案例**: - **前列腺癌**: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009) - **心血管疾病**: TMAO(氧化三甲胺)作为心血管风险标志...

1. 疾病生物标志物发现
策略
- 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照)
- 验证阶段:靶向代谢组学,在独立队列中验证候选标志物
- 临床转化:开发检测试剂盒,进行临床试验
成功案例
- 前列腺癌: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009)
- 心血管疾病: TMAO(氧化三甲胺)作为心血管风险标志物(NEJM, 2013)
- 糖尿病: 支链氨基酸(BCAA)与胰岛素抵抗相关
2. 药物代谢和药代动力学
研究内容
- 药物代谢产物鉴定(I相和II相代谢)
- 药物-药物相互作用(代谢酶竞争)
- 个体化给药(基于代谢酶基因型)
3. 营养代谢和精准营养
研究内容
- 食物代谢物分析(如多酚、维生素、脂肪酸)
- 个体代谢反应差异( responder vs. non-responder)
- 肠道菌群代谢物(短链脂肪酸、吲哚衍生物)
4. 环境代谢组学
研究内容
- 污染物暴露的代谢效应
- 生物标志物监测(如重金属、农药)
- 生态毒性评估

查看详情 →
💡

六、多组学整合

concept

**代谢组学与其他组学的整合**: **基因组+代谢组**: - 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL) - 识别代谢酶的遗传变异对代谢物水平的影响 **转录组+代谢组**: - 整合基因表达和代谢物水平,构建代谢调控网络 - 识别限速酶和调控节点 **蛋白质组+代谢组**: - 同时检测酶蛋白水平和代谢物水平 - 验证代谢通路的活性状态 **微生物组+代谢组*...

代谢组学与其他组学的整合
基因组+代谢组
- 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL)
- 识别代谢酶的遗传变异对代谢物水平的影响
转录组+代谢组
- 整合基因表达和代谢物水平,构建代谢调控网络
- 识别限速酶和调控节点
蛋白质组+代谢组
- 同时检测酶蛋白水平和代谢物水平
- 验证代谢通路的活性状态
微生物组+代谢组
- 肠道菌群16S/宏基因组 + 粪便/血清代谢组
- 揭示菌群-宿主代谢互作(如SCFA产生、胆汁酸代谢)
整合方法
- 相关性网络:计算代谢物与基因/蛋白质之间的Pearson/Spearman相关性
- 联合通路分析:如IMPaLA、iPEA
- 多组学因子分析(MOFA):识别跨组学的共享变异源
- 机器学习整合:使用多组学特征构建预测模型

查看详情 →
💡

9.6 蛋白质组学和代谢组学的总结与展望

section
查看详情 →
💡

一、蛋白质组学的最新进展

concept

**1. 单细胞蛋白质组学** **技术挑战**: - 单个哺乳动物细胞仅含约100-200 pg蛋白质 - 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级) - 需要极低体积的样本处理(微升级)和超灵敏的质谱检测 **技术突破**: - **SCoPE-MS(2018)**: - 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号 -...

1. 单细胞蛋白质组学
技术挑战
- 单个哺乳动物细胞仅含约100-200 pg蛋白质
- 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级)
- 需要极低体积的样本处理(微升级)和超灵敏的质谱检测
技术突破
- SCoPE-MS(2018)
- 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号
- 单个细胞通过独立的通道标记,与载体通道混合后进入质谱
- 实现单个细胞的蛋白质定量(~1,000-3,000个蛋白质)
- SCoPE2(2021)
- 改进样本处理和色谱分离
- 提高定量准确性(比率压缩校正)
- 检测深度提升至~5,000个蛋白质/单细胞
- DIA单细胞蛋白质组学
- 使用timsTOF Pro(离子淌度分离)和DIA模式
- 无需TMT标记,减少比率压缩
- 检测深度~2,000-4,000个蛋白质/单细胞
应用
- 肿瘤异质性:鉴定稀有耐药细胞亚群
- 免疫细胞图谱:揭示不同免疫细胞亚型的蛋白质特征
- 发育生物学:追踪细胞分化过程中的蛋白质动态变化
2. 空间蛋白质组学
技术方法
- LCM-MS(激光显微切割-质谱)
- 使用激光切取特定组织区域(20-100 μm,约5-10个细胞)
- 超微量蛋白质提取和酶解
- 高灵敏质谱分析
- 应用:肿瘤微环境区域分析、组织异质性研究
- 深度视觉蛋白质组学(DVP, 2022)
- 免疫荧光成像识别目标细胞类型
- LCM精确切割目标细胞
- 超灵敏质谱分析(>5,000个蛋白质)
- 在FFPE样本中实现单细胞分辨率的蛋白质组分析
- MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 在组织切片上直接进行质谱分析
- 空间分辨率:10-50 μm
- 可以同时获得数千个蛋白质和代谢物的空间分布
- 应用:肿瘤边界分析、药物分布研究
3. 人工智能驱动的蛋白质组学
蛋白质语言模型
- ESM-2(Meta AI, 2022)
- 基于15亿参数Transformer,在UniRef数据库上预训练
- 从单序列提取进化信息(无需MSA搜索)
- ESMFold结构预测速度比AlphaFold2快60倍
- 应用:宏基因组蛋白质结构预测、蛋白质表示学习
- ProtTrans(2021)
- 在3930亿氨基酸上训练的Transformer模型
- 学习蛋白质的语义表示
- 用于蛋白质分类、定位预测和功能注释
AI在质谱数据分析中的应用
- 肽段从头测序(De novo sequencing)
- 传统方法:基于图的动态规划(如PEAKS、Novor)
- AI方法:使用深度学习(CNN、LSTM、Transformer)直接预测序列
- 优势:可以鉴定数据库中不存在的肽段(如未知剪接变体、新抗原)
- DIA谱图解析
- 传统方法:依赖谱图库匹配
- AI方法:使用深度学习预测肽段的MS/MS谱图,构建"预测谱图库"
- 提高DIA数据分析的覆盖度和灵敏度
- 蛋白质定量优化
- 使用深度学习模型校正批次效应和技术噪声
- 提高低丰度蛋白质的定量准确性

查看详情 →
💡

二、代谢组学的最新进展

concept

**1. 单细胞代谢组学** **技术挑战**: - 代谢物比蛋白质更不稳定(半衰期从秒到分钟) - 单细胞代谢物总量极低(fg-pg级别) - 样本处理过程中的代谢物变化难以控制 **技术方法**: - **SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)**: - 使用代谢抑制剂处理细胞 - 通过抗...

1. 单细胞代谢组学
技术挑战
- 代谢物比蛋白质更不稳定(半衰期从秒到分钟)
- 单细胞代谢物总量极低(fg-pg级别)
- 样本处理过程中的代谢物变化难以控制
技术方法
- SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)
- 使用代谢抑制剂处理细胞
- 通过抗体检测代谢标志物(如ATP、NADH)
- 间接反映单细胞代谢状态
- Live-seq
- 使用微流控技术提取单细胞细胞质
- 结合质谱分析代谢物
- 实现活细胞代谢组分析
- 空间代谢组学(MALDI-MSI)
- 分辨率提升至5-10 μm(接近单细胞)
- 可以同时获得数百个代谢物的空间分布
- 应用:肿瘤代谢异质性、神经递质分布
2. 人工智能驱动的代谢组学
代谢物鉴定
- 基于深度学习的MS/MS谱图预测
- 使用生成模型(如变分自编码器、GAN)预测未知代谢物的MS/MS谱图
- 与实验谱图匹配,提高鉴定成功率
- MassGenie(2022)
- 基于Transformer框架,探索数百万种碎片模式
- 从质谱数据中识别小分子的能力前所未有
生物标志物发现
- 使用深度学习(CNN、LSTM、GNN)整合多组学数据
- 发现传统统计方法难以识别的复杂生物标志物模式
- 稳定识别算法:基于SVM和递归特征消除,提高代谢组学生物标志物的稳定性
通路分析
- 使用图神经网络(GNN)建模代谢网络
- 预测代谢通路的活性状态和扰动响应
- 整合基因表达和代谢物数据,构建动态代谢模型
3. 代谢组学数据库和标准化
数据库发展
- HMDB 5.0:超过220,000个代谢物条目,包含更多脂质和次级代谢物
- GNPS(Global Natural Products Social Molecular Networking)
- 代谢组学社区平台,支持MS/MS数据共享和协作注释
- 分子网络(molecular networking):基于MS/MS谱图相似性构建代谢物关系网络
- METLIN:超过250,000个代谢物,包含广泛的MS/MS数据
标准化进展
- 代谢组学数据标准(MSI):代谢物鉴定层次标准化
- 代谢组学报告标准(METABOLIGHTS):实验元数据记录
- 质谱数据格式标准化:mzML、mzXML通用格式

查看详情 →
💡

三、多组学整合与精准医学

concept

**1. 多组学整合策略** **数据层面整合**: - 使用MOFA+、iCluster、SNF等统计方法整合多组学数据 - 识别跨组学的共享因子(如疾病状态、批次效应) - 发现单一组学无法检测的调控关系 **知识层面整合**: - 构建多组学调控网络:基因→RNA→蛋白质→代谢物 - 使用贝叶斯网络、因果推断模型推断调控关系 - 整合通路数据库(KEGG、Reactome、Wikipathw...

1. 多组学整合策略
数据层面整合
- 使用MOFA+、iCluster、SNF等统计方法整合多组学数据
- 识别跨组学的共享因子(如疾病状态、批次效应)
- 发现单一组学无法检测的调控关系
知识层面整合
- 构建多组学调控网络:基因→RNA→蛋白质→代谢物
- 使用贝叶斯网络、因果推断模型推断调控关系
- 整合通路数据库(KEGG、Reactome、Wikipathways)进行系统解释
应用案例
- 癌症分子分型
- 整合基因组(突变、CNV)、转录组、蛋白质组和代谢组数据
- 识别新的癌症亚型,指导精准治疗
- 例如:CPTAC(Clinical Proteomic Tumor Analysis Consortium)对多种癌症进行多组学分析
- 疾病机制研究
- 整合GWAS、转录组、蛋白质组和代谢组,构建从基因变异到表型的因果链
- 识别关键调控节点和潜在药物靶点
- 药物反应预测
- 整合多组学数据预测患者对特定药物的反应
- 指导个体化用药(如化疗药物选择、免疫治疗响应预测)
2. 精准医学中的应用
疾病早期诊断
- 蛋白质/代谢标志物panel用于癌症早筛(如多癌种早期检测MCED)
- 液体活检:血液蛋白质组和代谢组分析
治疗靶点发现
- 多组学整合识别疾病驱动因素
- 蛋白质结构预测(AlphaFold)加速靶点结构解析和药物设计
患者分层
- 基于蛋白质组/代谢组特征对患者进行分层
- 预测治疗响应和预后
伴随诊断
- 蛋白质/代谢标志物指导靶向药物使用
- 监测治疗过程中的动态变化,评估疗效

查看详情 →
💡

四、未来展望

concept

**1. 技术发展趋势** **更高灵敏度**: - 单细胞蛋白质组学检测深度向10,000+蛋白质迈进 - 单细胞代谢组学实现真正的代谢物定量 **更高通量**: - 样本处理自动化(液体处理机器人) - 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral) - 每天可处理数百个样本 **更高维度**: - 空间组学:从组织水平到单细胞水平的空间分辨率 - 时间维度:动态监测...

1. 技术发展趋势
更高灵敏度
- 单细胞蛋白质组学检测深度向10,000+蛋白质迈进
- 单细胞代谢组学实现真正的代谢物定量
更高通量
- 样本处理自动化(液体处理机器人)
- 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral)
- 每天可处理数百个样本
更高维度
- 空间组学:从组织水平到单细胞水平的空间分辨率
- 时间维度:动态监测蛋白质/代谢物变化
- 多模态:同时测量蛋白质、代谢物、脂质和翻译后修饰
2. 计算方法发展趋势
AI驱动的全面革新
- 蛋白质语言模型:从结构预测到功能预测、蛋白质设计
- 深度学习质谱分析:从头测序、DIA解析、定量优化
- 生成式AI(如蛋白质扩散模型)用于从头设计蛋白质和代谢酶
多组学整合方法
- 从简单的相关性分析到因果推断
- 从静态网络到动态网络模型
- 从描述性分析到预测性模型
知识图谱
- 构建整合基因组、蛋白质组、代谢组、疾病和药物的全面知识图谱
- 使用图神经网络进行推理和预测
- 支持药物重定位和靶点发现
3. 挑战与机遇
挑战
- 数据标准化和共享:不同实验室、不同平台的数据难以直接比较
- 批次效应:大规模队列研究中的技术变异
- 缺失值和噪声:低丰度分子的检测困难
- 生物信息学瓶颈:数据量增长超过分析能力
- 临床转化:从研究发现到临床应用的鸿沟
机遇
- 技术进步:单细胞、空间、超灵敏质谱技术快速发展
- 计算能力:GPU、TPU、云计算使大规模分析成为可能
- AI革命:深度学习正在改变蛋白质组学和代谢组学的每个环节
- 精准医学:个体化诊断和治疗的需求驱动技术创新
- 国际合作:大型联盟(如HPP、CPTAC、CNHPP)推动标准化和资源共享

查看详情 →

蛋白质分子动力学模拟

💡

第9章 蛋白质组学和代谢组学

chapter

> 章节导读:蛋白质是生命活动的主要承担者,代谢物则是基因表达和蛋白质功能的最终产物。蛋白质组学通过高通量质谱技术系统鉴定和定量生物样本中的蛋白质,揭示蛋白质表达、修饰和相互作用的全景图。代谢组学则通过检测小分子代谢物的组成和变化,反映生物体的生理和病理状态。近年来,以深度学习为代表的人工智能技术在蛋白质结构预测和功能分析中取得了革命性突破。本章将系统介绍蛋白质组学、蛋白质结构分析、分子动力学模拟、功能预测以及代谢组学的基本原理和生物信息学分析方法。

查看详情 →
💡

9.1 蛋白质组学概述

section
查看详情 →
💡

一、蛋白质组学的研究内容

concept

蛋白质组学根据研究目的可分为三大类: **1. 表达蛋白质组学(Expression Proteomics)** - 研究蛋白质在不同生理、病理条件下的表达变化 - 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free) - 应用:疾病生物标志物发现、药物靶点鉴定 **2. 结构蛋白质组学(Structural Proteomics)** - 研究蛋白质的三维结构...

蛋白质组学根据研究目的可分为三大类:
1. 表达蛋白质组学(Expression Proteomics)
- 研究蛋白质在不同生理、病理条件下的表达变化
- 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free)
- 应用:疾病生物标志物发现、药物靶点鉴定
2. 结构蛋白质组学(Structural Proteomics)
- 研究蛋白质的三维结构及其动态变化
- 方法:X射线晶体学、NMR、冷冻电镜、计算结构预测
- 应用:蛋白质功能机制、药物设计
3. 功能蛋白质组学(Functional Proteomics)
- 研究蛋白质的功能、相互作用和信号通路
- 方法:蛋白质芯片、酵母双杂交、Co-IP/质谱、Proximity labeling
- 应用:蛋白质网络构建、信号转导通路解析

查看详情 →
💡

二、质谱技术原理

concept

**质谱仪的基本组成**: 1. **离子源**:将分析物转化为气相离子 - ESI(电喷雾电离):适用于液相样品,可产生多电荷离子 - MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子 2. **质量分析器**:按质荷比(m/z)分离离子 - 四极杆(Quadrupole):结构简单,常用于一级筛选 - 飞行时间(TOF):质量范围宽,分辨率较高...

质谱仪的基本组成
1. 离子源:将分析物转化为气相离子
- ESI(电喷雾电离):适用于液相样品,可产生多电荷离子
- MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子
2. 质量分析器:按质荷比(m/z)分离离子
- 四极杆(Quadrupole):结构简单,常用于一级筛选
- 飞行时间(TOF):质量范围宽,分辨率较高
- 轨道阱(Orbitrap):超高分辨率(>100,000),质量精度高(<1 ppm)
- 离子阱(Ion Trap):可进行多级碎裂(MSn)
3. 检测器:检测并记录离子信号
4. 数据处理系统:将信号转化为质谱图
串联质谱(MS/MS或MS²)
- 第一级质谱(MS1):分离和选择特定质荷比的母离子(precursor ion)
- 碰撞室:母离子与惰性气体(如N₂、Ar)碰撞,发生裂解(CID/HCD/EThcD)
- 第二级质谱(MS2):分析碎片离子(fragment ions)的质荷比
- 碎片类型:b离子(N端碎片)、y离子(C端碎片)为主

查看详情 →
💡

三、鸟枪法蛋白质组学流程

concept

**实验部分**: 1. **蛋白质提取**:从细胞/组织中提取总蛋白质 2. **蛋白质定量**:BCA/Bradford法测定蛋白质浓度 3. **蛋白质还原和烷基化**:DTT还原二硫键,IAA烷基化保护游离巯基 4. **酶解**:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段 5. **肽段脱盐**:C18柱去除盐类和干扰物 6. **LC-MS/MS分析**: - 液...

实验部分
1. 蛋白质提取:从细胞/组织中提取总蛋白质
2. 蛋白质定量:BCA/Bradford法测定蛋白质浓度
3. 蛋白质还原和烷基化:DTT还原二硫键,IAA烷基化保护游离巯基
4. 酶解:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段
5. 肽段脱盐:C18柱去除盐类和干扰物
6. LC-MS/MS分析
- 液相色谱(nano-LC)分离肽段(通常60-120分钟梯度)
- 电喷雾离子化(ESI)进入质谱仪
- 数据依赖采集(DDA):MS1全扫描 → 选择前N个最强离子进行MS2碎裂
- 数据非依赖采集(DIA):MS1全扫描 → 对预设m/z窗口进行系统MS2碎裂
计算部分
1. 数据库搜索
- 输入:MS2谱图 + 蛋白质序列数据库
- 过程:根据母离子质量筛选候选肽段 → 预测理论碎片谱图 → 与实验谱图比对打分
- 输出:PSM列表(肽段-谱图匹配结果)
2. FDR控制
- 目标-诱饵库策略(Target-Decoy):构建随机或反序的诱饵数据库,与目标数据库同时搜索
- 混合搜库FDR = 2×R / (F + R),其中F为目标库匹配数,R为诱饵库匹配数
- 分开搜库FDR = R / F
- 通常FDR < 1%作为可信鉴定阈值
3. 蛋白质组装
- 从肽段推断蛋白质:Occam's Razor原则(用最少的蛋白质解释所有肽段)
- 处理共享肽段(不同蛋白质产生的相同肽段)
- 概率型组装(如ProteinProphet):基于肽段置信度计算蛋白质水平概率
4. 蛋白质定量
- 标记定量:TMT/iTRAQ的 reporter ion 强度比
- SILAC:轻/重同位素标记肽段的峰面积比
- Label-free:基于肽段色谱峰面积或谱图计数(spectral counting)
- 定量值归一化:消除系统偏差

查看详情 →
💡

四、翻译后修饰蛋白质组学

concept

**磷酸化蛋白质组学**: - 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化 - 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%) - 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr) - 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄) - 软件:MaxQuant、Proteome Discoverer、pFi...

磷酸化蛋白质组学
- 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化
- 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%)
- 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr)
- 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄)
- 软件:MaxQuant、Proteome Discoverer、pFind(支持磷酸化位点定位)
糖基化蛋白质组学
- N-糖基化:Asn-X-Ser/Thr序列模体(X≠Pro),发生在内质网/高尔基体
- O-糖基化:主要发生在Ser/Thr,无特定序列模体
- 富集策略:凝集素亲和色谱、亲水相互作用色谱(HILIC)
- 鉴定挑战:糖链异质性导致同一肽段产生多种糖型
- 软件:Byonic、pGlyco、NGlycan
泛素化蛋白质组学
- 泛素化通过蛋白酶体途径调控蛋白质降解
- 富集策略:K-GG抗体(识别泛素化留下的Lys-Gly-Gly足迹)
- 应用:泛素-蛋白酶体系统研究、药物靶点发现(如蛋白酶体抑制剂)

查看详情 →
💡

五、蛋白质组数据与资源

concept

**公共数据库**: - **PRIDE**(Proteomics Identification Database):EMBL-EBI维护,存储MS数据 - **PeptideAtlas**:基于多实验数据的蛋白质/肽段图谱 - **MassIVE**:UCSD维护,支持数据存储和重新分析 - **ProteomeXchange(PX)**:国际联盟,统一数据提交标准 **人类蛋白质组计划(HPP...

公共数据库
- PRIDE(Proteomics Identification Database):EMBL-EBI维护,存储MS数据
- PeptideAtlas:基于多实验数据的蛋白质/肽段图谱
- MassIVE:UCSD维护,支持数据存储和重新分析
- ProteomeXchange(PX):国际联盟,统一数据提交标准
人类蛋白质组计划(HPP)
- 目标:系统绘制人类蛋白质组图谱
- 2020年:发布了覆盖>90%人类蛋白质编码基因的草图
- 中国人类蛋白质组计划(CNHPP):聚焦中国人常见癌症的蛋白质组研究

查看详情 →
💡

9.2 蛋白质结构分析

section
查看详情 →
💡

一、蛋白质结构的层次组织

concept

**1. 一级结构** - 由20种常见氨基酸通过肽键连接形成线性多肽链 - 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向 - 关键特征:N端(氨基端)和C端(羧基端),肽链方向性 **2. 二级结构** **α螺旋**: - 每圈3.6个氨基酸残基,螺距5.4 Å - 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键 - 氢键大致平行于螺旋轴,稳定螺旋结构 - 氨基酸倾向性...

1. 一级结构
- 由20种常见氨基酸通过肽键连接形成线性多肽链
- 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向
- 关键特征:N端(氨基端)和C端(羧基端),肽链方向性
2. 二级结构
α螺旋
- 每圈3.6个氨基酸残基,螺距5.4 Å
- 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键
- 氢键大致平行于螺旋轴,稳定螺旋结构
- 氨基酸倾向性:Ala、Glu、Leu、Met偏好螺旋;Pro、Gly破坏螺旋
β折叠
- 由多条肽链片段或同一肽链的不同片段平行排列形成
- 链间氢键稳定:一条链的羰基氧与另一条链的酰胺氢形成氢键
- 平行式(N→C同向)和反平行式(N→C反向),反平行更稳定
- 氨基酸倾向性:Val、Ile、Phe偏好β折叠;Pro、Gly不利于β折叠
环区/转角(Loop/Turn)
- 连接二级结构元件的无规区域
- 通常位于蛋白质表面,暴露在溶剂中
- 高柔性和高多样性,常参与功能位点形成
3. 超二级结构(Supersecondary Structure)
- 两个或多个二级结构单元的组合模式
- 常见类型:α-α(螺旋-转角-螺旋)、β-α-β(Rossmann折叠)、β-发夹(β-hairpin)
4. 结构域(Domain)
- 独立折叠的球状单元,具有特定功能
- 结构域分类:全α(all-α)、全β(all-β)、α/β(交替)、α+β(分离)
- 多结构域蛋白质:不同结构域可以执行不同功能,通过柔性连接子连接
5. 三级结构
- 稳定三级结构的相互作用:
- 疏水作用:疏水残基埋藏在蛋白质内部(主要驱动力)
- 氢键:主链和侧链之间
- 离子键:带相反电荷的侧链之间
- 范德华力:所有原子之间的弱吸引力
- 二硫键:半胱氨酸残基之间的共价连接(稳定作用)
6. 四级结构
- 多个多肽链(亚基)通过非共价相互作用形成蛋白质复合物
- 亚基间相互作用:疏水界面、氢键、盐桥
- 别构效应:配体结合改变亚基间相互作用,调控蛋白质活性

查看详情 →
💡

二、蛋白质结构预测方法

concept

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测

查看详情 →
💡

三、蛋白质结构性质预测

concept

**1. 二级结构预测** **Q3准确率**:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。 **方法发展**: - 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60% - 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65% - 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多...

1. 二级结构预测
Q3准确率:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。
方法发展
- 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60%
- 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65%
- 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多序列比对,准确率>75-80%
- 深度学习:基于CNN/Transformer,准确率>85%
PSIPRED方法
1. PSI-BLAST搜索NR数据库,获得多序列比对(PSSM)
2. 将PSSM特征(20种氨基酸的频率)输入两层神经网络
3. 输出每个残基的三态概率(H/E/C)
2. 无序区预测(Intrinsically Disordered Region, IDR)
IDR特征
- 生理条件下不能形成稳定三维结构
- 人类蛋白质中约30-40%的残基处于无序区
- 功能:信号传导、转录调控、蛋白质相互作用枢纽
预测方法
- IUPred:基于能量估算(低相互作用能→无序)
- PONDR、DisEMBL:基于机器学习和神经网络
- SPOT-Disorder:基于深度学习,准确率>80%

查看详情 →
💡

四、功能蛋白质的从头设计

concept

**设计策略**: 1. **拓扑选择**:选择适合目标功能的蛋白质折叠类型 2. **骨架设计**:设计主链结构,满足目标约束(如配体结合口袋) 3. **序列优化**:使用能量函数和深度学习优化氨基酸序列 4. **实验验证**:表达纯化蛋白质,验证功能 **深度学习设计方法**: - **trRosetta**:基于Transformer的序列-结构联合生成 - **ProteinMPNN*...

设计策略
1. 拓扑选择:选择适合目标功能的蛋白质折叠类型
2. 骨架设计:设计主链结构,满足目标约束(如配体结合口袋)
3. 序列优化:使用能量函数和深度学习优化氨基酸序列
4. 实验验证:表达纯化蛋白质,验证功能
深度学习设计方法
- trRosetta:基于Transformer的序列-结构联合生成
- ProteinMPNN:基于图神经网络的序列设计
- RFdiffusion:基于扩散模型的蛋白质结构生成(2023, Baker Lab)
成功案例
- 2023年Baker Lab设计新型萤光素酶(LuxSit-i)
- 使用"family-wide hallucination"从NTF2超家族生成新结构
- 通过RIFGen/RIFDock设计与DTZ配体的结合口袋
- 设计的萤光素酶活性与天然酶相当,但结构完全不同

查看详情 →
💡

9.3 蛋白质分子动力学模拟

section
查看详情 →
💡

一、统计力学基础

concept

**1. 相空间和系综** 对于N个粒子组成的系统,经典动力学由6N个变量描述: - 位置:r₁(t), r₂(t), ..., rₙ(t) - 动量:p₁(t), p₂(t), ..., pₙ(t) 相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。 **系综类型**: - **NVT(正则系综)**:粒子数N、体积V、温度T恒定。通过热...

1. 相空间和系综
对于N个粒子组成的系统,经典动力学由6N个变量描述:
- 位置:r₁(t), r₂(t), ..., rₙ(t)
- 动量:p₁(t), p₂(t), ..., pₙ(t)
相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。
系综类型
- NVT(正则系综):粒子数N、体积V、温度T恒定。通过热浴(thermostat)维持温度,如Nosé-Hoover、Langevin动力学。
- NPT(等温等压系综):粒子数N、压强P、温度T恒定。通过恒压器(barostat)调节体积,如Parrinello-Rahman、Berendsen。
- NVE(微正则系综):粒子数N、体积V、总能量E恒定。无热浴和恒压器,系统为孤立体系。
2. 自由能
Helmholtz自由能(F):适用于恒容体系(NVT)
$$F = U - TS$$
Gibbs自由能(G):适用于恒压体系(NPT),生物体系常用
$$G = H - TS = U + PV - TS$$
其中U为内能,T为温度,S为熵,H为焓,P为压强,V为体积。
自由能是系统做非体积功的最大能力。在恒温恒压下,自发过程总是朝着Gibbs自由能降低的方向进行(ΔG < 0)。
自由能面(Free Energy Landscape)
- 描述系统自由能随构象坐标变化的"地形图"
- 低能量区域(山谷)对应稳定构象(亚稳态)
- 高能量区域(山脊)对应过渡态
- 能垒高度决定构象转换的速率(Arrhenius方程)
自由能计算
- 直接计数法:ΔF = -k_B T ln(P_A / P_B),其中P_A和P_B为状态A和B的观测概率
- 缺点:对于高能量垒,罕见事件的采样需要极长时间

查看详情 →
💡

二、分子力场

concept

力场将总势能分解为键合项和非键合项: $$E_{total} = E_{bonded} + E_{nonbonded}$$ **1. 键合项(Bonded Terms)** **键长伸缩能**: $$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$ - 谐振子近似,K_r为力常数,r_eq为平衡键长 **键角弯曲能**: $$E_{angl...

力场将总势能分解为键合项和非键合项:
$$E_{total} = E_{bonded} + E_{nonbonded}$$
1. 键合项(Bonded Terms)
键长伸缩能
$$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$
- 谐振子近似,K_r为力常数,r_eq为平衡键长
键角弯曲能
$$E_{angle} = \sum_{angles} \frac{K_\theta}{2}(\theta - \theta_{eq})^2$$
- 谐振子近似,K_θ为力常数,θ_eq为平衡键角
二面角扭转能
$$E_{dihedral} = \sum_{dihedrals} \sum_{n} \frac{V_n}{2}[1 + \cos(n\phi - \gamma)]$$
- 傅里叶级数展开,V_n为势垒高度,n为周期性(旋转对称性),γ为相位偏移
2. 非键合项(Nonbonded Terms)
静电相互作用(Coulomb)
$$E_{electrostatic} = \sum_{i<j} \frac{q_i q_j}{4\pi\varepsilon_0 r_{ij}}$$
- q_i, q_j为原子电荷,r_ij为原子间距离
- 长程相互作用,通常使用截断(cutoff)或PME(Particle Mesh Ewald)方法处理
范德华相互作用(Lennard-Jones)
$$E_{vdW} = \sum_{i<j} \varepsilon_{ij}\left[\left(\frac{\sigma_{ij}}{r_{ij}}\right)^{12} - \left(\frac{\sigma_{ij}}{r_{ij}}\right)^6\right]$$
- ε_ij为势阱深度(相互作用强度)
- σ_ij为势能为0时的距离(原子"半径")
- r⁻¹²项:短程排斥(电子云重叠)
- r⁻⁶项:长程吸引(London色散力)
3. 常见力场
AMBER
- 开发:UC San Francisco (Peter Kollman, David Case)
- 特点:广泛用于蛋白质和核酸,参数基于量子化学计算和实验数据
- 版本:AMBER94/99/03/14/19, ff99SB-ILDN, ff14SB
- 优势:蛋白质力场准确,参数优化充分
CHARMM
- 开发:Harvard University (Martin Karplus)
- 特点:全面覆盖生物大分子(蛋白质、脂质、核酸、糖类)
- 版本:CHARMM22/27/36/36m
- 优势:脂质膜和膜蛋白模拟表现出色
OPLS-AA
- 开发:Jorgensen Lab (Yale University)
- 特点:液态模拟和蛋白质模拟兼顾
- 版本:OPLS-AA/L, OPLS3/3e
- 优势:有机小分子参数丰富
GROMOS
- 开发:van Gunsteren Lab (ETH Zurich)
- 特点: united-atom 表示(减少计算量)
- 版本:GROMOS43A1/53A5/54A7
- 优势:计算效率高,适用于大规模体系
力场选择原则
- 蛋白质模拟:AMBER ff14SB/ff19SB, CHARMM36m
- 膜蛋白模拟:CHARMM36, Slipids
- 小分子/药物设计:OPLS3/3e, GAFF2
- 大规模体系:GROMOS, MARTINI(粗粒化)

查看详情 →
💡

三、牛顿运动方程与积分算法

concept

**1. 牛顿运动方程** 对于每个原子i: $$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$ 其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。 **2. 有限差分积分算法** **Verlet算法**: $$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delt...

1. 牛顿运动方程
对于每个原子i:
$$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$
其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。
2. 有限差分积分算法
Verlet算法
$$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delta t^2$$
- 优点:时间可逆,能量守恒好
- 缺点:速度计算精度低
Velocity Verlet算法
$$v(t + \frac{\Delta t}{2}) = v(t) + \frac{a(t)\Delta t}{2}$$
$$r(t + \Delta t) = r(t) + v(t + \frac{\Delta t}{2})\Delta t$$
$$v(t + \Delta t) = v(t + \frac{\Delta t}{2}) + \frac{a(t + \Delta t)\Delta t}{2}$$
- 优点:同时更新位置和速度,精度高,稳定性好
- 是目前最常用的MD积分算法
时间步长选择
- 典型值:2 fs(飞秒,10⁻¹⁵秒)
- 限制因素:体系中最快运动(键长振动,C-H键约10⁻¹⁴秒周期)
- 约束算法(SHAKE/SETTLE/LINCS):固定键长,允许更大时间步长(2-4 fs)
3. 周期性边界条件(PBC)
- 模拟盒子(如立方体、十二面体、截角八面体)被其镜像复制填满整个空间
- 原子离开盒子一侧时,从另一侧进入(保持原子数恒定)
- 最小镜像约定:每个原子只与最近的镜像相互作用
- 目的:消除边界效应,模拟无限大体系
4. 长程相互作用处理
截断法(Cutoff)
- 只计算截断距离(如10-12 Å)内的非键相互作用
- 简单高效,但对于带电体系可能引入显著误差
Particle Mesh Ewald(PME)
- 将长程静电相互作用分解为实空间短程和倒空间长程两部分
- 实空间:截断范围内直接计算
- 倒空间:使用快速傅里叶变换(FFT)在网格上计算
- 优点:精度高(~10⁻⁵),效率合理
- 缺点:需要周期性边界条件

查看详情 →
💡

四、MD模拟流程

concept

**1. 体系准备** - 获取蛋白质结构(PDB下载或预测) - 检查结构完整性:缺失原子、残基、二硫键 - 添加氢原子(根据pH确定质子化状态) - 选择力场和溶剂模型(如TIP3P、SPC/E) - 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度) - 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI **2. 能量最小化** - 目的:消除不...

1. 体系准备
- 获取蛋白质结构(PDB下载或预测)
- 检查结构完整性:缺失原子、残基、二硫键
- 添加氢原子(根据pH确定质子化状态)
- 选择力场和溶剂模型(如TIP3P、SPC/E)
- 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度)
- 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI
2. 能量最小化
- 目的:消除不合理的原子接触和键长/键角畸变
- 算法:最陡下降法(Steepest Descent)→ 共轭梯度法(Conjugate Gradient)
- 判断标准:体系势能达到最小值,最大受力<1000 kJ/mol/nm
3. 平衡阶段
- NVT平衡:在恒定体积下升温至目标温度(如300K),温度耦合(如V-rescale)
- NPT平衡:在恒定温度和压强下平衡密度,压强耦合(如Parrinello-Rahman)
- 判断标准:温度、密度、能量、RMSD均达到稳定波动
- 典型时长:100 ps - 1 ns
4. 生产模拟(Production Run)
- 在平衡后的构象上开始长时间采样
- 记录轨迹(坐标、速度、能量等)
- 典型时长:100 ns - 10 μs(取决于体系和计算资源)
- 现代GPU加速:RTX 4090可达~100 ns/天(~50,000原子体系)
5. 轨迹分析
- 结构分析:RMSD、RMSF、回旋半径(Rg)
- 动力学分析:主成分分析(PCA)、自由能面构建
- 相互作用分析:氢键、盐桥、疏水接触、π-π堆积
- 工具:VMD、MDAnalysis、MDTraj、CPPTRAJ

查看详情 →
💡

五、增强采样方法

concept

**1. 伞形采样(Umbrella Sampling)** - 沿反应坐标(Collective Variable, CV)划分多个窗口 - 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]² - 将系统限制在特定CV范围内采样 - 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面 - 适用:...

1. 伞形采样(Umbrella Sampling)
- 沿反应坐标(Collective Variable, CV)划分多个窗口
- 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]²
- 将系统限制在特定CV范围内采样
- 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面
- 适用:已知反应路径,计算自由能面
2. 副本交换分子动力学(REMD)
- 并行运行多个不同温度的副本(如300K, 310K, 320K, ...)
- 定期尝试交换相邻副本的构象(按Metropolis准则)
- 高温副本探索高能量构象,交换到低温副本中
- 适用:构象搜索、折叠/去折叠研究
- 缺点:副本数随体系自由度增加,计算成本高
3. 元动力学(Metadynamics)
- 在CV空间上不断添加高斯偏置势(负反馈机制)
- 高斯势累积"填平"势能阱,促进系统逃离局部最小值
- 适用:未知反应路径,自动探索自由能面
- 变种:Well-Tempered Metadynamics(WTMetaD)、Adaptive Bias Force(ABF)
4. 其他方法
- Steered MD(SMD):施加外力驱动系统沿特定方向运动
- Gaussian Accelerated MD(GaMD): boost 势能促进低能量区域的采样
- REST2(Replica Exchange with Solute Tempering):仅增强溶质温度,降低计算成本

查看详情 →
💡

六、粗粒化模拟

concept

**MARTINI力场**: - 将4个重原子映射为1个珠子(bead) - 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水) - 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍 - 应用:膜蛋白、脂质体、大分子复合物组装 - 局限:丧失原子细节,不适合研究化学键形成/断裂

MARTINI力场
- 将4个重原子映射为1个珠子(bead)
- 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水)
- 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍
- 应用:膜蛋白、脂质体、大分子复合物组装
- 局限:丧失原子细节,不适合研究化学键形成/断裂

查看详情 →
💡

9.4 蛋白质功能预测与分析

section
查看详情 →
💡

一、蛋白质功能概述

concept

**1. 蛋白质功能的层次性** 蛋白质功能具有复杂性和多层次性: - **分子功能**:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活) - **生物过程**:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路) - **细胞组分**:蛋白质所在的细胞位置(如细胞核、线粒体、膜) 同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行...

1. 蛋白质功能的层次性
蛋白质功能具有复杂性和多层次性:
- 分子功能:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活)
- 生物过程:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路)
- 细胞组分:蛋白质所在的细胞位置(如细胞核、线粒体、膜)
同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行(冗余性)。
2. GO注释系统
GO采用有向无环图(DAG)结构组织术语:
- 每个术语(GO term)有唯一ID(如GO:0004672,蛋白激酶活性)
- 术语之间存在"is_a"和"part_of"关系
- 从根节点到叶节点的路径表示功能的特异性递增
GO注释证据代码
- EXP:实验验证
- IDA:直接实验测定
- IPI:蛋白质相互作用
- ISS:序列相似性推断
- IEA:自动电子注释
- ...(共约15种证据代码)
3. CAFA竞赛
- 2010年首次举办,之后每2-3年一次
- 使用未公开蛋白质序列作为测试集
- 评估指标:Fmax(F-measure最大值)、Smin(语义距离最小值)、AUPR(精确率-召回率曲线下面积)
- 推动了功能预测方法的发展,特别是整合多源信息的方法

查看详情 →
💡

二、基于序列的功能分析

concept

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区

查看详情 →
💡

三、基于结构的功能分析

concept

**1. 基于结构相似性的功能预测** **原理**:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。 **结构比对工具**: - **DALI**:基于分子内距离矩阵的比较 - **TM-align**:基于TM-score的结构相似性度量 - **FATCAT**:允许柔性旋转的结构比对 **结构比对评估**: - **RMSD(Root Mean Square Deviation)*...

1. 基于结构相似性的功能预测
原理:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。
结构比对工具
- DALI:基于分子内距离矩阵的比较
- TM-align:基于TM-score的结构相似性度量
- FATCAT:允许柔性旋转的结构比对
结构比对评估
- RMSD(Root Mean Square Deviation):结构叠合后的原子坐标偏差,<2Å为高度相似
- TM-score(Template Modeling Score):0-1之间,>0.5表示相同折叠,>0.9表示高度相似
- GDT_TS:与CASP评估类似,用于结构相似性度量
2. 基于结构的功能预测工具
ProFunc
- 整合多种序列和结构分析方法
- 包括序列同源性搜索、结构相似性搜索、残基保守性分析、表面分析等
- 输出综合功能注释
COFACTOR
- 基于结构比对的功能注释系统
- 将待测蛋白结构比对到已知功能模板库
- 预测配体结合位点、酶学分类(EC号)、GO注释
3. 基于分子对接的功能分析
分子对接原理
- 搜索配体在受体结合口袋中的最佳位置和取向
- 评估结合模式的亲和力(打分函数)
- 预测配体-受体相互作用
对接类型
- 刚性对接:受体和配体构象均固定,适用于大分子对接(如蛋白质-蛋白质)
- 半柔性对接:配体构象可变化,受体固定,适用于小分子-蛋白质对接
- 柔性对接:受体和配体构象均可变化,精度高但计算成本高
对接流程
1. 受体准备:从PDB获取结构,添加氢原子,确定质子化状态,定义结合口袋
2. 配体准备:生成3D构象,添加电荷,确定可旋转键
3. 构象搜索:系统搜索、遗传算法、蒙特卡罗模拟等方法
4. 打分评估:基于力场、经验公式或知识的打分函数
5. 结果分析:聚类相似构象,选择最佳结合模式
常用对接软件
- AutoDock Vina:快速开源对接软件,基于经验打分函数
- GOLD:商业软件,基于遗传算法,高精度
- Glide:Schrödinger软件包,基于网格搜索
- rDOCK:基于力场的对接和打分
虚拟筛选(Virtual Screening)
- 将大型化合物库(如数百万分子)与靶蛋白对接
- 筛选结合打分最高的候选化合物
- 用于药物发现的早期阶段,大幅降低实验筛选成本
4. 结合自由能计算
MM-PBSA/MM-GBSA
- 基于分子力学和泊松-玻尔兹曼/广义Born溶剂化模型
- 计算结合自由能:ΔG_bind = ΔH - TΔS ≈ ΔE_MM + ΔG_solvation - TΔS
- 适用于快速估算相对结合亲和力
自由能微扰(FEP)
- 通过一系列"炼金术"变换(逐渐改变配体A为配体B)计算相对结合自由能
- 精度高(<1 kcal/mol),但计算成本高
- 适用于先导化合物优化
热力学积分(TI)
- 类似FEP,但使用积分而非微扰计算自由能差
- 适用于化学变化较大的体系

查看详情 →
💡

四、基于网络的蛋白质功能分析

concept

**1. 蛋白质相互作用网络(PPI Network)** PPI网络以蛋白质为节点,相互作用为边。 - 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘 - 数据库:STRING、BioGRID、IntAct、MINT **2. 基于邻域的方法(Neighborhood Method)** **邻居计数法**: - 将邻居节点中最频繁的功能分配给目标蛋白 - 简单直接,但忽略...

1. 蛋白质相互作用网络(PPI Network)
PPI网络以蛋白质为节点,相互作用为边。
- 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘
- 数据库:STRING、BioGRID、IntAct、MINT
2. 基于邻域的方法(Neighborhood Method)
邻居计数法
- 将邻居节点中最频繁的功能分配给目标蛋白
- 简单直接,但忽略了功能频率差异
χ²检验法
- 使用χ²检验或Fisher精确检验确定邻居中显著富集的功能
- 仅将显著富集的功能分配给目标蛋白
- 比简单计数法更可靠
邻居扩展法
- 将邻居扩展到一阶邻居的近邻
- 扩大功能信息来源,但可能引入噪声
3. 基于全局网络拓扑的方法
马尔可夫随机场(MRF)
- 建模网络中节点功能的依赖关系
- 利用Gibbs采样或变分推断进行概率推断
- 考虑全局网络结构,而不仅是局部邻居
4. 基于模块划分的方法
模块识别
- 识别网络中紧密连接的节点群(社区/模块)
- 同一模块内的蛋白质倾向于参与同一生物过程
常用算法
- MCL(Markov Cluster Algorithm):基于随机游走的扩展和膨胀操作
- Louvain算法:基于模块度优化的贪心算法
- RWR(Random Walk with Restart):从种子节点出发,通过重启随机游走量化节点关联性
- 谱聚类:基于图拉普拉斯矩阵的特征向量聚类
模块识别后的功能注释
- 将模块内已知功能直接分配给未知蛋白
- 使用χ²检验或Fisher精确检验对模块内功能进行富集分析
- 结合机器学习模型,利用网络拓扑特征预测功能
5. 基于网络整合的方法
GeneMANIA
- 整合多种网络(PPI、基因共表达、遗传相互作用、通路共享)
- 使用线性回归学习每个网络的权重
- 构建加权整合网络,使用标签传播算法预测功能
GAIN(Graphical Association Network)
- 基于贝叶斯网络的方法
- 将每个网络视为独立证据
- 使用条件概率和贝叶斯规则整合证据,推断功能概率
6. 基于深度学习的网络方法
DeepWalk
- 通过随机游走生成节点序列
- 使用Skip-gram模型学习节点嵌入(低维向量表示)
- 嵌入向量保留网络拓扑信息
DeepGO
- 整合DeepWalk网络特征和序列特征(3-mer编码+1D CNN)
- 分层神经网络预测GO功能,保持GO层次关系
图卷积网络(GCN)
- 直接对图结构进行卷积操作
- 每个节点的特征由邻居节点聚合得到
- DeepGraphGO:构建多物种PPI网络,使用GCN提取特征,整合序列特征预测功能

查看详情 →
💡

9.5 代谢组学

section
查看详情 →
💡

一、代谢组学技术平台

concept

**1. 核磁共振(NMR)** **原理**: - 利用原子核(主要是¹H)在磁场中的共振吸收特性 - 不同化学环境的氢原子具有不同的化学位移 - 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构 **优点**: - 非破坏性,样本可重复使用 - 无需色谱分离,样品制备简单 - 定量准确,重现性高 - 可检测所有含氢代谢物(无偏向性) **缺点**: - 灵敏度低...

1. 核磁共振(NMR)
原理
- 利用原子核(主要是¹H)在磁场中的共振吸收特性
- 不同化学环境的氢原子具有不同的化学位移
- 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构
优点
- 非破坏性,样本可重复使用
- 无需色谱分离,样品制备简单
- 定量准确,重现性高
- 可检测所有含氢代谢物(无偏向性)
缺点
- 灵敏度低(比MS低3-5个数量级)
- 分辨率有限,复杂样本谱图重叠严重
- 难以检测低丰度代谢物
应用
- 体液代谢组学(尿液、血液)
- 样本非常珍贵的情况(需要后续其他分析)
- 实时动态监测(如流动注射NMR)
2. 液相色谱-质谱联用(LC-MS)
原理
- 液相色谱(LC):根据代谢物在固定相和流动相之间的分配系数差异进行分离
- 反相色谱(RP-C18):分离非极性/中等极性代谢物(如脂质、脂肪酸)
- 亲水作用色谱(HILIC):分离极性代谢物(如氨基酸、糖类、核苷酸)
- 质谱(MS):LC洗脱的代谢物经ESI离子化,进入质谱仪检测
- 高分辨质谱(HRMS):Orbitrap、Q-TOF,精确分子量<5 ppm
- 串联质谱(MS/MS):提供碎片信息,用于结构鉴定
优点
- 灵敏度高(fmol-pmol级别)
- 覆盖范围广(可同时检测数千种代谢物)
- 分辨率高,可区分同分异构体
缺点
- 离子化效率差异导致定量偏差
- 基质效应(matrix effect):复杂样本中共同洗脱物质抑制或增强信号
- 样本制备要求高
3. 气相色谱-质谱联用(GC-MS)
原理
- 气相色谱(GC):样本气化后,在色谱柱中根据沸点和极性分离
- 质谱(MS):EI(电子轰击)电离,产生特征性碎片谱图
- 数据库:NIST/EPA/NIH Mass Spectral Library(超过250,000张标准谱图)
优点
- 重现性极高,保留时间稳定
- 有完善的EI谱图数据库,便于鉴定
- 定量准确(使用内标法)
缺点
- 需要样本衍生化(硅烷化、甲基化),增加样品制备复杂度
- 只能检测热稳定和挥发性代谢物(分子量<500 Da)
- 不适用于大分子、极性代谢物
应用
- 植物代谢组学(挥发性代谢物丰富)
- 脂肪酸分析
- 氨基酸和有机酸分析(衍生化后)
4. 其他技术
CE-MS(毛细管电泳-质谱)
- 分离原理:基于电荷/质量比的电泳迁移
- 优势:分离效率高,适合极性代谢物和离子型代谢物
- 应用:氨基酸、有机酸、核苷酸分析
MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 原理:在组织切片上直接进行质谱分析,获得代谢物的空间分布
- 应用:肿瘤代谢异质性、药物组织分布
5. 技术选择策略
| 样本类型 | 推荐技术 | 理由 |
|----------|----------|------|
| 血清/血浆 | LC-MS (RP + HILIC) | 覆盖极性和非极性代谢物 |
| 尿液 | NMR或LC-MS | NMR定量准确,LC-MS灵敏度高 |
| 组织 | LC-MS或GC-MS | 根据目标代谢物类型选择 |
| 植物提取物 | GC-MS + LC-MS | 挥发性用GC-MS,极性用LC-MS |
| 脂质组学 | LC-MS (RP-C18) | 反相色谱分离脂质效果好 |
| 单细胞 | LC-MS (高灵敏) | 需要极低样本量 |

查看详情 →
💡

二、代谢组学实验设计

concept

**1. 样本收集与制备** **样本类型**: - 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁 - 组织样本:肝脏、肌肉、肿瘤、脑组织 - 细胞样本:培养细胞、原代细胞 - 其他:粪便、肠道内容物、发酵液 **质控样本**: - **QC样本(Quality Control)**:混合等量的所有实验样本,用于监测系统稳定性和数据质量 - **空白样本**:溶剂空白,评估背景污染 - **标准...

1. 样本收集与制备
样本类型
- 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁
- 组织样本:肝脏、肌肉、肿瘤、脑组织
- 细胞样本:培养细胞、原代细胞
- 其他:粪便、肠道内容物、发酵液
质控样本
- QC样本(Quality Control):混合等量的所有实验样本,用于监测系统稳定性和数据质量
- 空白样本:溶剂空白,评估背景污染
- 标准品:已知浓度的代谢物混合物,用于方法验证
样本制备
- 蛋白质沉淀:甲醇/乙腈/氯仿提取,去除大分子
- 脂质去除:如需分析极性代谢物,使用正己烷或氯仿去除脂质
- 衍生化:GC-MS需要硅烷化(BSTFA+TMCS)或甲基化
- 注意:不同代谢物类别需要不同的提取方法,没有"一刀切"的最佳方案
2. 仪器分析
色谱条件优化
- 色谱柱选择:C18(反相)、HILIC(亲水)、T3(混合模式)
- 流动相:水/乙腈或水/甲醇,含0.1%甲酸或5mM乙酸铵
- 梯度洗脱:从低有机相到高有机相,洗脱不同极性的代谢物
- 流速:200-400 μL/min(nano-LC更低)
质谱参数
- 离子源:ESI+(正离子模式,检测碱性代谢物如氨基酸、胺类)和ESI-(负离子模式,检测酸性代谢物如脂肪酸、有机酸)
- 采集模式:Full scan(全扫描)+ DDA(数据依赖MS/MS)或DIA(全离子碎片)
- 分辨率:Orbitrap 60,000-120,000(Full scan),15,000-30,000(MS/MS)
- 扫描范围:m/z 50-1000(或更宽)
3. 数据质量监控
QC样本分析
- 每5-10个样本插入一个QC样本
- 监测保留时间漂移、信号强度变化、峰形变化
- 评估标准:QC中代谢物峰的RSD(相对标准偏差)<20%(或30%)
批次效应评估
- PCA分析:检查QC样本是否聚类,样本是否按批次聚集
- 如果样本按批次分离,说明存在显著批次效应,需要校正

查看详情 →
💡

三、代谢组学数据处理

concept

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能

查看详情 →
💡

四、代谢通路分析

concept

**1. 过表征分析(ORA, Over-Representation Analysis)** **原理**: - 输入:差异代谢物列表 - 背景:所有检测到的代谢物 - 方法:Fisher精确检验或超几何检验 - 输出:显著富集的代谢通路(p < 0.05) **局限性**: - 忽略代谢物变化方向(上调/下调) - 忽略代谢物丰度变化幅度 - 假设通路独立,忽略通路间交互 **2. 通路拓扑分...

1. 过表征分析(ORA, Over-Representation Analysis)
原理
- 输入:差异代谢物列表
- 背景:所有检测到的代谢物
- 方法:Fisher精确检验或超几何检验
- 输出:显著富集的代谢通路(p < 0.05)
局限性
- 忽略代谢物变化方向(上调/下调)
- 忽略代谢物丰度变化幅度
- 假设通路独立,忽略通路间交互
2. 通路拓扑分析(PT, Pathway Topology)
原理
- 考虑代谢通路中的拓扑结构(代谢物连接度、位置重要性)
- 中心代谢物(如ATP、NADH)在通路中的权重更高
- 方法:Impact Factor、Node Importance
软件
- MetaboAnalyst:综合代谢组学分析平台,支持ORA、PT、联合分析
- MetPA(Metabolic Pathway Analysis):基于通路拓扑的富集分析
- KEGG Mapper:基于KEGG通路的可视化分析
3. 整合通路分析
MSEA(Metabolite Set Enrichment Analysis)
- 类似GSEA,不需要预设差异代谢物阈值
- 输入:所有代谢物的排序列表(如按|logFC|排序)
- 评估预定义代谢物集合(如通路)是否集中在排序列表的顶端或底端
联合通路分析
- 整合ORA和拓扑分析的结果
- 结合代谢物变化方向和幅度
- 更全面地解释通路调控状态

查看详情 →
💡

五、代谢组学应用实例

concept

**1. 疾病生物标志物发现** **策略**: - 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照) - 验证阶段:靶向代谢组学,在独立队列中验证候选标志物 - 临床转化:开发检测试剂盒,进行临床试验 **成功案例**: - **前列腺癌**: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009) - **心血管疾病**: TMAO(氧化三甲胺)作为心血管风险标志...

1. 疾病生物标志物发现
策略
- 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照)
- 验证阶段:靶向代谢组学,在独立队列中验证候选标志物
- 临床转化:开发检测试剂盒,进行临床试验
成功案例
- 前列腺癌: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009)
- 心血管疾病: TMAO(氧化三甲胺)作为心血管风险标志物(NEJM, 2013)
- 糖尿病: 支链氨基酸(BCAA)与胰岛素抵抗相关
2. 药物代谢和药代动力学
研究内容
- 药物代谢产物鉴定(I相和II相代谢)
- 药物-药物相互作用(代谢酶竞争)
- 个体化给药(基于代谢酶基因型)
3. 营养代谢和精准营养
研究内容
- 食物代谢物分析(如多酚、维生素、脂肪酸)
- 个体代谢反应差异( responder vs. non-responder)
- 肠道菌群代谢物(短链脂肪酸、吲哚衍生物)
4. 环境代谢组学
研究内容
- 污染物暴露的代谢效应
- 生物标志物监测(如重金属、农药)
- 生态毒性评估

查看详情 →
💡

六、多组学整合

concept

**代谢组学与其他组学的整合**: **基因组+代谢组**: - 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL) - 识别代谢酶的遗传变异对代谢物水平的影响 **转录组+代谢组**: - 整合基因表达和代谢物水平,构建代谢调控网络 - 识别限速酶和调控节点 **蛋白质组+代谢组**: - 同时检测酶蛋白水平和代谢物水平 - 验证代谢通路的活性状态 **微生物组+代谢组*...

代谢组学与其他组学的整合
基因组+代谢组
- 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL)
- 识别代谢酶的遗传变异对代谢物水平的影响
转录组+代谢组
- 整合基因表达和代谢物水平,构建代谢调控网络
- 识别限速酶和调控节点
蛋白质组+代谢组
- 同时检测酶蛋白水平和代谢物水平
- 验证代谢通路的活性状态
微生物组+代谢组
- 肠道菌群16S/宏基因组 + 粪便/血清代谢组
- 揭示菌群-宿主代谢互作(如SCFA产生、胆汁酸代谢)
整合方法
- 相关性网络:计算代谢物与基因/蛋白质之间的Pearson/Spearman相关性
- 联合通路分析:如IMPaLA、iPEA
- 多组学因子分析(MOFA):识别跨组学的共享变异源
- 机器学习整合:使用多组学特征构建预测模型

查看详情 →
💡

9.6 蛋白质组学和代谢组学的总结与展望

section
查看详情 →
💡

一、蛋白质组学的最新进展

concept

**1. 单细胞蛋白质组学** **技术挑战**: - 单个哺乳动物细胞仅含约100-200 pg蛋白质 - 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级) - 需要极低体积的样本处理(微升级)和超灵敏的质谱检测 **技术突破**: - **SCoPE-MS(2018)**: - 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号 -...

1. 单细胞蛋白质组学
技术挑战
- 单个哺乳动物细胞仅含约100-200 pg蛋白质
- 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级)
- 需要极低体积的样本处理(微升级)和超灵敏的质谱检测
技术突破
- SCoPE-MS(2018)
- 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号
- 单个细胞通过独立的通道标记,与载体通道混合后进入质谱
- 实现单个细胞的蛋白质定量(~1,000-3,000个蛋白质)
- SCoPE2(2021)
- 改进样本处理和色谱分离
- 提高定量准确性(比率压缩校正)
- 检测深度提升至~5,000个蛋白质/单细胞
- DIA单细胞蛋白质组学
- 使用timsTOF Pro(离子淌度分离)和DIA模式
- 无需TMT标记,减少比率压缩
- 检测深度~2,000-4,000个蛋白质/单细胞
应用
- 肿瘤异质性:鉴定稀有耐药细胞亚群
- 免疫细胞图谱:揭示不同免疫细胞亚型的蛋白质特征
- 发育生物学:追踪细胞分化过程中的蛋白质动态变化
2. 空间蛋白质组学
技术方法
- LCM-MS(激光显微切割-质谱)
- 使用激光切取特定组织区域(20-100 μm,约5-10个细胞)
- 超微量蛋白质提取和酶解
- 高灵敏质谱分析
- 应用:肿瘤微环境区域分析、组织异质性研究
- 深度视觉蛋白质组学(DVP, 2022)
- 免疫荧光成像识别目标细胞类型
- LCM精确切割目标细胞
- 超灵敏质谱分析(>5,000个蛋白质)
- 在FFPE样本中实现单细胞分辨率的蛋白质组分析
- MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 在组织切片上直接进行质谱分析
- 空间分辨率:10-50 μm
- 可以同时获得数千个蛋白质和代谢物的空间分布
- 应用:肿瘤边界分析、药物分布研究
3. 人工智能驱动的蛋白质组学
蛋白质语言模型
- ESM-2(Meta AI, 2022)
- 基于15亿参数Transformer,在UniRef数据库上预训练
- 从单序列提取进化信息(无需MSA搜索)
- ESMFold结构预测速度比AlphaFold2快60倍
- 应用:宏基因组蛋白质结构预测、蛋白质表示学习
- ProtTrans(2021)
- 在3930亿氨基酸上训练的Transformer模型
- 学习蛋白质的语义表示
- 用于蛋白质分类、定位预测和功能注释
AI在质谱数据分析中的应用
- 肽段从头测序(De novo sequencing)
- 传统方法:基于图的动态规划(如PEAKS、Novor)
- AI方法:使用深度学习(CNN、LSTM、Transformer)直接预测序列
- 优势:可以鉴定数据库中不存在的肽段(如未知剪接变体、新抗原)
- DIA谱图解析
- 传统方法:依赖谱图库匹配
- AI方法:使用深度学习预测肽段的MS/MS谱图,构建"预测谱图库"
- 提高DIA数据分析的覆盖度和灵敏度
- 蛋白质定量优化
- 使用深度学习模型校正批次效应和技术噪声
- 提高低丰度蛋白质的定量准确性

查看详情 →
💡

二、代谢组学的最新进展

concept

**1. 单细胞代谢组学** **技术挑战**: - 代谢物比蛋白质更不稳定(半衰期从秒到分钟) - 单细胞代谢物总量极低(fg-pg级别) - 样本处理过程中的代谢物变化难以控制 **技术方法**: - **SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)**: - 使用代谢抑制剂处理细胞 - 通过抗...

1. 单细胞代谢组学
技术挑战
- 代谢物比蛋白质更不稳定(半衰期从秒到分钟)
- 单细胞代谢物总量极低(fg-pg级别)
- 样本处理过程中的代谢物变化难以控制
技术方法
- SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)
- 使用代谢抑制剂处理细胞
- 通过抗体检测代谢标志物(如ATP、NADH)
- 间接反映单细胞代谢状态
- Live-seq
- 使用微流控技术提取单细胞细胞质
- 结合质谱分析代谢物
- 实现活细胞代谢组分析
- 空间代谢组学(MALDI-MSI)
- 分辨率提升至5-10 μm(接近单细胞)
- 可以同时获得数百个代谢物的空间分布
- 应用:肿瘤代谢异质性、神经递质分布
2. 人工智能驱动的代谢组学
代谢物鉴定
- 基于深度学习的MS/MS谱图预测
- 使用生成模型(如变分自编码器、GAN)预测未知代谢物的MS/MS谱图
- 与实验谱图匹配,提高鉴定成功率
- MassGenie(2022)
- 基于Transformer框架,探索数百万种碎片模式
- 从质谱数据中识别小分子的能力前所未有
生物标志物发现
- 使用深度学习(CNN、LSTM、GNN)整合多组学数据
- 发现传统统计方法难以识别的复杂生物标志物模式
- 稳定识别算法:基于SVM和递归特征消除,提高代谢组学生物标志物的稳定性
通路分析
- 使用图神经网络(GNN)建模代谢网络
- 预测代谢通路的活性状态和扰动响应
- 整合基因表达和代谢物数据,构建动态代谢模型
3. 代谢组学数据库和标准化
数据库发展
- HMDB 5.0:超过220,000个代谢物条目,包含更多脂质和次级代谢物
- GNPS(Global Natural Products Social Molecular Networking)
- 代谢组学社区平台,支持MS/MS数据共享和协作注释
- 分子网络(molecular networking):基于MS/MS谱图相似性构建代谢物关系网络
- METLIN:超过250,000个代谢物,包含广泛的MS/MS数据
标准化进展
- 代谢组学数据标准(MSI):代谢物鉴定层次标准化
- 代谢组学报告标准(METABOLIGHTS):实验元数据记录
- 质谱数据格式标准化:mzML、mzXML通用格式

查看详情 →
💡

三、多组学整合与精准医学

concept

**1. 多组学整合策略** **数据层面整合**: - 使用MOFA+、iCluster、SNF等统计方法整合多组学数据 - 识别跨组学的共享因子(如疾病状态、批次效应) - 发现单一组学无法检测的调控关系 **知识层面整合**: - 构建多组学调控网络:基因→RNA→蛋白质→代谢物 - 使用贝叶斯网络、因果推断模型推断调控关系 - 整合通路数据库(KEGG、Reactome、Wikipathw...

1. 多组学整合策略
数据层面整合
- 使用MOFA+、iCluster、SNF等统计方法整合多组学数据
- 识别跨组学的共享因子(如疾病状态、批次效应)
- 发现单一组学无法检测的调控关系
知识层面整合
- 构建多组学调控网络:基因→RNA→蛋白质→代谢物
- 使用贝叶斯网络、因果推断模型推断调控关系
- 整合通路数据库(KEGG、Reactome、Wikipathways)进行系统解释
应用案例
- 癌症分子分型
- 整合基因组(突变、CNV)、转录组、蛋白质组和代谢组数据
- 识别新的癌症亚型,指导精准治疗
- 例如:CPTAC(Clinical Proteomic Tumor Analysis Consortium)对多种癌症进行多组学分析
- 疾病机制研究
- 整合GWAS、转录组、蛋白质组和代谢组,构建从基因变异到表型的因果链
- 识别关键调控节点和潜在药物靶点
- 药物反应预测
- 整合多组学数据预测患者对特定药物的反应
- 指导个体化用药(如化疗药物选择、免疫治疗响应预测)
2. 精准医学中的应用
疾病早期诊断
- 蛋白质/代谢标志物panel用于癌症早筛(如多癌种早期检测MCED)
- 液体活检:血液蛋白质组和代谢组分析
治疗靶点发现
- 多组学整合识别疾病驱动因素
- 蛋白质结构预测(AlphaFold)加速靶点结构解析和药物设计
患者分层
- 基于蛋白质组/代谢组特征对患者进行分层
- 预测治疗响应和预后
伴随诊断
- 蛋白质/代谢标志物指导靶向药物使用
- 监测治疗过程中的动态变化,评估疗效

查看详情 →
💡

四、未来展望

concept

**1. 技术发展趋势** **更高灵敏度**: - 单细胞蛋白质组学检测深度向10,000+蛋白质迈进 - 单细胞代谢组学实现真正的代谢物定量 **更高通量**: - 样本处理自动化(液体处理机器人) - 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral) - 每天可处理数百个样本 **更高维度**: - 空间组学:从组织水平到单细胞水平的空间分辨率 - 时间维度:动态监测...

1. 技术发展趋势
更高灵敏度
- 单细胞蛋白质组学检测深度向10,000+蛋白质迈进
- 单细胞代谢组学实现真正的代谢物定量
更高通量
- 样本处理自动化(液体处理机器人)
- 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral)
- 每天可处理数百个样本
更高维度
- 空间组学:从组织水平到单细胞水平的空间分辨率
- 时间维度:动态监测蛋白质/代谢物变化
- 多模态:同时测量蛋白质、代谢物、脂质和翻译后修饰
2. 计算方法发展趋势
AI驱动的全面革新
- 蛋白质语言模型:从结构预测到功能预测、蛋白质设计
- 深度学习质谱分析:从头测序、DIA解析、定量优化
- 生成式AI(如蛋白质扩散模型)用于从头设计蛋白质和代谢酶
多组学整合方法
- 从简单的相关性分析到因果推断
- 从静态网络到动态网络模型
- 从描述性分析到预测性模型
知识图谱
- 构建整合基因组、蛋白质组、代谢组、疾病和药物的全面知识图谱
- 使用图神经网络进行推理和预测
- 支持药物重定位和靶点发现
3. 挑战与机遇
挑战
- 数据标准化和共享:不同实验室、不同平台的数据难以直接比较
- 批次效应:大规模队列研究中的技术变异
- 缺失值和噪声:低丰度分子的检测困难
- 生物信息学瓶颈:数据量增长超过分析能力
- 临床转化:从研究发现到临床应用的鸿沟
机遇
- 技术进步:单细胞、空间、超灵敏质谱技术快速发展
- 计算能力:GPU、TPU、云计算使大规模分析成为可能
- AI革命:深度学习正在改变蛋白质组学和代谢组学的每个环节
- 精准医学:个体化诊断和治疗的需求驱动技术创新
- 国际合作:大型联盟(如HPP、CPTAC、CNHPP)推动标准化和资源共享

查看详情 →

蛋白质功能预测与分析

💡

第9章 蛋白质组学和代谢组学

chapter

> 章节导读:蛋白质是生命活动的主要承担者,代谢物则是基因表达和蛋白质功能的最终产物。蛋白质组学通过高通量质谱技术系统鉴定和定量生物样本中的蛋白质,揭示蛋白质表达、修饰和相互作用的全景图。代谢组学则通过检测小分子代谢物的组成和变化,反映生物体的生理和病理状态。近年来,以深度学习为代表的人工智能技术在蛋白质结构预测和功能分析中取得了革命性突破。本章将系统介绍蛋白质组学、蛋白质结构分析、分子动力学模拟、功能预测以及代谢组学的基本原理和生物信息学分析方法。

查看详情 →
💡

9.1 蛋白质组学概述

section
查看详情 →
💡

一、蛋白质组学的研究内容

concept

蛋白质组学根据研究目的可分为三大类: **1. 表达蛋白质组学(Expression Proteomics)** - 研究蛋白质在不同生理、病理条件下的表达变化 - 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free) - 应用:疾病生物标志物发现、药物靶点鉴定 **2. 结构蛋白质组学(Structural Proteomics)** - 研究蛋白质的三维结构...

蛋白质组学根据研究目的可分为三大类:
1. 表达蛋白质组学(Expression Proteomics)
- 研究蛋白质在不同生理、病理条件下的表达变化
- 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free)
- 应用:疾病生物标志物发现、药物靶点鉴定
2. 结构蛋白质组学(Structural Proteomics)
- 研究蛋白质的三维结构及其动态变化
- 方法:X射线晶体学、NMR、冷冻电镜、计算结构预测
- 应用:蛋白质功能机制、药物设计
3. 功能蛋白质组学(Functional Proteomics)
- 研究蛋白质的功能、相互作用和信号通路
- 方法:蛋白质芯片、酵母双杂交、Co-IP/质谱、Proximity labeling
- 应用:蛋白质网络构建、信号转导通路解析

查看详情 →
💡

二、质谱技术原理

concept

**质谱仪的基本组成**: 1. **离子源**:将分析物转化为气相离子 - ESI(电喷雾电离):适用于液相样品,可产生多电荷离子 - MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子 2. **质量分析器**:按质荷比(m/z)分离离子 - 四极杆(Quadrupole):结构简单,常用于一级筛选 - 飞行时间(TOF):质量范围宽,分辨率较高...

质谱仪的基本组成
1. 离子源:将分析物转化为气相离子
- ESI(电喷雾电离):适用于液相样品,可产生多电荷离子
- MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子
2. 质量分析器:按质荷比(m/z)分离离子
- 四极杆(Quadrupole):结构简单,常用于一级筛选
- 飞行时间(TOF):质量范围宽,分辨率较高
- 轨道阱(Orbitrap):超高分辨率(>100,000),质量精度高(<1 ppm)
- 离子阱(Ion Trap):可进行多级碎裂(MSn)
3. 检测器:检测并记录离子信号
4. 数据处理系统:将信号转化为质谱图
串联质谱(MS/MS或MS²)
- 第一级质谱(MS1):分离和选择特定质荷比的母离子(precursor ion)
- 碰撞室:母离子与惰性气体(如N₂、Ar)碰撞,发生裂解(CID/HCD/EThcD)
- 第二级质谱(MS2):分析碎片离子(fragment ions)的质荷比
- 碎片类型:b离子(N端碎片)、y离子(C端碎片)为主

查看详情 →
💡

三、鸟枪法蛋白质组学流程

concept

**实验部分**: 1. **蛋白质提取**:从细胞/组织中提取总蛋白质 2. **蛋白质定量**:BCA/Bradford法测定蛋白质浓度 3. **蛋白质还原和烷基化**:DTT还原二硫键,IAA烷基化保护游离巯基 4. **酶解**:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段 5. **肽段脱盐**:C18柱去除盐类和干扰物 6. **LC-MS/MS分析**: - 液...

实验部分
1. 蛋白质提取:从细胞/组织中提取总蛋白质
2. 蛋白质定量:BCA/Bradford法测定蛋白质浓度
3. 蛋白质还原和烷基化:DTT还原二硫键,IAA烷基化保护游离巯基
4. 酶解:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段
5. 肽段脱盐:C18柱去除盐类和干扰物
6. LC-MS/MS分析
- 液相色谱(nano-LC)分离肽段(通常60-120分钟梯度)
- 电喷雾离子化(ESI)进入质谱仪
- 数据依赖采集(DDA):MS1全扫描 → 选择前N个最强离子进行MS2碎裂
- 数据非依赖采集(DIA):MS1全扫描 → 对预设m/z窗口进行系统MS2碎裂
计算部分
1. 数据库搜索
- 输入:MS2谱图 + 蛋白质序列数据库
- 过程:根据母离子质量筛选候选肽段 → 预测理论碎片谱图 → 与实验谱图比对打分
- 输出:PSM列表(肽段-谱图匹配结果)
2. FDR控制
- 目标-诱饵库策略(Target-Decoy):构建随机或反序的诱饵数据库,与目标数据库同时搜索
- 混合搜库FDR = 2×R / (F + R),其中F为目标库匹配数,R为诱饵库匹配数
- 分开搜库FDR = R / F
- 通常FDR < 1%作为可信鉴定阈值
3. 蛋白质组装
- 从肽段推断蛋白质:Occam's Razor原则(用最少的蛋白质解释所有肽段)
- 处理共享肽段(不同蛋白质产生的相同肽段)
- 概率型组装(如ProteinProphet):基于肽段置信度计算蛋白质水平概率
4. 蛋白质定量
- 标记定量:TMT/iTRAQ的 reporter ion 强度比
- SILAC:轻/重同位素标记肽段的峰面积比
- Label-free:基于肽段色谱峰面积或谱图计数(spectral counting)
- 定量值归一化:消除系统偏差

查看详情 →
💡

四、翻译后修饰蛋白质组学

concept

**磷酸化蛋白质组学**: - 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化 - 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%) - 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr) - 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄) - 软件:MaxQuant、Proteome Discoverer、pFi...

磷酸化蛋白质组学
- 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化
- 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%)
- 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr)
- 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄)
- 软件:MaxQuant、Proteome Discoverer、pFind(支持磷酸化位点定位)
糖基化蛋白质组学
- N-糖基化:Asn-X-Ser/Thr序列模体(X≠Pro),发生在内质网/高尔基体
- O-糖基化:主要发生在Ser/Thr,无特定序列模体
- 富集策略:凝集素亲和色谱、亲水相互作用色谱(HILIC)
- 鉴定挑战:糖链异质性导致同一肽段产生多种糖型
- 软件:Byonic、pGlyco、NGlycan
泛素化蛋白质组学
- 泛素化通过蛋白酶体途径调控蛋白质降解
- 富集策略:K-GG抗体(识别泛素化留下的Lys-Gly-Gly足迹)
- 应用:泛素-蛋白酶体系统研究、药物靶点发现(如蛋白酶体抑制剂)

查看详情 →
💡

五、蛋白质组数据与资源

concept

**公共数据库**: - **PRIDE**(Proteomics Identification Database):EMBL-EBI维护,存储MS数据 - **PeptideAtlas**:基于多实验数据的蛋白质/肽段图谱 - **MassIVE**:UCSD维护,支持数据存储和重新分析 - **ProteomeXchange(PX)**:国际联盟,统一数据提交标准 **人类蛋白质组计划(HPP...

公共数据库
- PRIDE(Proteomics Identification Database):EMBL-EBI维护,存储MS数据
- PeptideAtlas:基于多实验数据的蛋白质/肽段图谱
- MassIVE:UCSD维护,支持数据存储和重新分析
- ProteomeXchange(PX):国际联盟,统一数据提交标准
人类蛋白质组计划(HPP)
- 目标:系统绘制人类蛋白质组图谱
- 2020年:发布了覆盖>90%人类蛋白质编码基因的草图
- 中国人类蛋白质组计划(CNHPP):聚焦中国人常见癌症的蛋白质组研究

查看详情 →
💡

9.2 蛋白质结构分析

section
查看详情 →
💡

一、蛋白质结构的层次组织

concept

**1. 一级结构** - 由20种常见氨基酸通过肽键连接形成线性多肽链 - 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向 - 关键特征:N端(氨基端)和C端(羧基端),肽链方向性 **2. 二级结构** **α螺旋**: - 每圈3.6个氨基酸残基,螺距5.4 Å - 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键 - 氢键大致平行于螺旋轴,稳定螺旋结构 - 氨基酸倾向性...

1. 一级结构
- 由20种常见氨基酸通过肽键连接形成线性多肽链
- 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向
- 关键特征:N端(氨基端)和C端(羧基端),肽链方向性
2. 二级结构
α螺旋
- 每圈3.6个氨基酸残基,螺距5.4 Å
- 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键
- 氢键大致平行于螺旋轴,稳定螺旋结构
- 氨基酸倾向性:Ala、Glu、Leu、Met偏好螺旋;Pro、Gly破坏螺旋
β折叠
- 由多条肽链片段或同一肽链的不同片段平行排列形成
- 链间氢键稳定:一条链的羰基氧与另一条链的酰胺氢形成氢键
- 平行式(N→C同向)和反平行式(N→C反向),反平行更稳定
- 氨基酸倾向性:Val、Ile、Phe偏好β折叠;Pro、Gly不利于β折叠
环区/转角(Loop/Turn)
- 连接二级结构元件的无规区域
- 通常位于蛋白质表面,暴露在溶剂中
- 高柔性和高多样性,常参与功能位点形成
3. 超二级结构(Supersecondary Structure)
- 两个或多个二级结构单元的组合模式
- 常见类型:α-α(螺旋-转角-螺旋)、β-α-β(Rossmann折叠)、β-发夹(β-hairpin)
4. 结构域(Domain)
- 独立折叠的球状单元,具有特定功能
- 结构域分类:全α(all-α)、全β(all-β)、α/β(交替)、α+β(分离)
- 多结构域蛋白质:不同结构域可以执行不同功能,通过柔性连接子连接
5. 三级结构
- 稳定三级结构的相互作用:
- 疏水作用:疏水残基埋藏在蛋白质内部(主要驱动力)
- 氢键:主链和侧链之间
- 离子键:带相反电荷的侧链之间
- 范德华力:所有原子之间的弱吸引力
- 二硫键:半胱氨酸残基之间的共价连接(稳定作用)
6. 四级结构
- 多个多肽链(亚基)通过非共价相互作用形成蛋白质复合物
- 亚基间相互作用:疏水界面、氢键、盐桥
- 别构效应:配体结合改变亚基间相互作用,调控蛋白质活性

查看详情 →
💡

二、蛋白质结构预测方法

concept

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测

查看详情 →
💡

三、蛋白质结构性质预测

concept

**1. 二级结构预测** **Q3准确率**:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。 **方法发展**: - 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60% - 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65% - 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多...

1. 二级结构预测
Q3准确率:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。
方法发展
- 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60%
- 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65%
- 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多序列比对,准确率>75-80%
- 深度学习:基于CNN/Transformer,准确率>85%
PSIPRED方法
1. PSI-BLAST搜索NR数据库,获得多序列比对(PSSM)
2. 将PSSM特征(20种氨基酸的频率)输入两层神经网络
3. 输出每个残基的三态概率(H/E/C)
2. 无序区预测(Intrinsically Disordered Region, IDR)
IDR特征
- 生理条件下不能形成稳定三维结构
- 人类蛋白质中约30-40%的残基处于无序区
- 功能:信号传导、转录调控、蛋白质相互作用枢纽
预测方法
- IUPred:基于能量估算(低相互作用能→无序)
- PONDR、DisEMBL:基于机器学习和神经网络
- SPOT-Disorder:基于深度学习,准确率>80%

查看详情 →
💡

四、功能蛋白质的从头设计

concept

**设计策略**: 1. **拓扑选择**:选择适合目标功能的蛋白质折叠类型 2. **骨架设计**:设计主链结构,满足目标约束(如配体结合口袋) 3. **序列优化**:使用能量函数和深度学习优化氨基酸序列 4. **实验验证**:表达纯化蛋白质,验证功能 **深度学习设计方法**: - **trRosetta**:基于Transformer的序列-结构联合生成 - **ProteinMPNN*...

设计策略
1. 拓扑选择:选择适合目标功能的蛋白质折叠类型
2. 骨架设计:设计主链结构,满足目标约束(如配体结合口袋)
3. 序列优化:使用能量函数和深度学习优化氨基酸序列
4. 实验验证:表达纯化蛋白质,验证功能
深度学习设计方法
- trRosetta:基于Transformer的序列-结构联合生成
- ProteinMPNN:基于图神经网络的序列设计
- RFdiffusion:基于扩散模型的蛋白质结构生成(2023, Baker Lab)
成功案例
- 2023年Baker Lab设计新型萤光素酶(LuxSit-i)
- 使用"family-wide hallucination"从NTF2超家族生成新结构
- 通过RIFGen/RIFDock设计与DTZ配体的结合口袋
- 设计的萤光素酶活性与天然酶相当,但结构完全不同

查看详情 →
💡

9.3 蛋白质分子动力学模拟

section
查看详情 →
💡

一、统计力学基础

concept

**1. 相空间和系综** 对于N个粒子组成的系统,经典动力学由6N个变量描述: - 位置:r₁(t), r₂(t), ..., rₙ(t) - 动量:p₁(t), p₂(t), ..., pₙ(t) 相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。 **系综类型**: - **NVT(正则系综)**:粒子数N、体积V、温度T恒定。通过热...

1. 相空间和系综
对于N个粒子组成的系统,经典动力学由6N个变量描述:
- 位置:r₁(t), r₂(t), ..., rₙ(t)
- 动量:p₁(t), p₂(t), ..., pₙ(t)
相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。
系综类型
- NVT(正则系综):粒子数N、体积V、温度T恒定。通过热浴(thermostat)维持温度,如Nosé-Hoover、Langevin动力学。
- NPT(等温等压系综):粒子数N、压强P、温度T恒定。通过恒压器(barostat)调节体积,如Parrinello-Rahman、Berendsen。
- NVE(微正则系综):粒子数N、体积V、总能量E恒定。无热浴和恒压器,系统为孤立体系。
2. 自由能
Helmholtz自由能(F):适用于恒容体系(NVT)
$$F = U - TS$$
Gibbs自由能(G):适用于恒压体系(NPT),生物体系常用
$$G = H - TS = U + PV - TS$$
其中U为内能,T为温度,S为熵,H为焓,P为压强,V为体积。
自由能是系统做非体积功的最大能力。在恒温恒压下,自发过程总是朝着Gibbs自由能降低的方向进行(ΔG < 0)。
自由能面(Free Energy Landscape)
- 描述系统自由能随构象坐标变化的"地形图"
- 低能量区域(山谷)对应稳定构象(亚稳态)
- 高能量区域(山脊)对应过渡态
- 能垒高度决定构象转换的速率(Arrhenius方程)
自由能计算
- 直接计数法:ΔF = -k_B T ln(P_A / P_B),其中P_A和P_B为状态A和B的观测概率
- 缺点:对于高能量垒,罕见事件的采样需要极长时间

查看详情 →
💡

二、分子力场

concept

力场将总势能分解为键合项和非键合项: $$E_{total} = E_{bonded} + E_{nonbonded}$$ **1. 键合项(Bonded Terms)** **键长伸缩能**: $$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$ - 谐振子近似,K_r为力常数,r_eq为平衡键长 **键角弯曲能**: $$E_{angl...

力场将总势能分解为键合项和非键合项:
$$E_{total} = E_{bonded} + E_{nonbonded}$$
1. 键合项(Bonded Terms)
键长伸缩能
$$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$
- 谐振子近似,K_r为力常数,r_eq为平衡键长
键角弯曲能
$$E_{angle} = \sum_{angles} \frac{K_\theta}{2}(\theta - \theta_{eq})^2$$
- 谐振子近似,K_θ为力常数,θ_eq为平衡键角
二面角扭转能
$$E_{dihedral} = \sum_{dihedrals} \sum_{n} \frac{V_n}{2}[1 + \cos(n\phi - \gamma)]$$
- 傅里叶级数展开,V_n为势垒高度,n为周期性(旋转对称性),γ为相位偏移
2. 非键合项(Nonbonded Terms)
静电相互作用(Coulomb)
$$E_{electrostatic} = \sum_{i<j} \frac{q_i q_j}{4\pi\varepsilon_0 r_{ij}}$$
- q_i, q_j为原子电荷,r_ij为原子间距离
- 长程相互作用,通常使用截断(cutoff)或PME(Particle Mesh Ewald)方法处理
范德华相互作用(Lennard-Jones)
$$E_{vdW} = \sum_{i<j} \varepsilon_{ij}\left[\left(\frac{\sigma_{ij}}{r_{ij}}\right)^{12} - \left(\frac{\sigma_{ij}}{r_{ij}}\right)^6\right]$$
- ε_ij为势阱深度(相互作用强度)
- σ_ij为势能为0时的距离(原子"半径")
- r⁻¹²项:短程排斥(电子云重叠)
- r⁻⁶项:长程吸引(London色散力)
3. 常见力场
AMBER
- 开发:UC San Francisco (Peter Kollman, David Case)
- 特点:广泛用于蛋白质和核酸,参数基于量子化学计算和实验数据
- 版本:AMBER94/99/03/14/19, ff99SB-ILDN, ff14SB
- 优势:蛋白质力场准确,参数优化充分
CHARMM
- 开发:Harvard University (Martin Karplus)
- 特点:全面覆盖生物大分子(蛋白质、脂质、核酸、糖类)
- 版本:CHARMM22/27/36/36m
- 优势:脂质膜和膜蛋白模拟表现出色
OPLS-AA
- 开发:Jorgensen Lab (Yale University)
- 特点:液态模拟和蛋白质模拟兼顾
- 版本:OPLS-AA/L, OPLS3/3e
- 优势:有机小分子参数丰富
GROMOS
- 开发:van Gunsteren Lab (ETH Zurich)
- 特点: united-atom 表示(减少计算量)
- 版本:GROMOS43A1/53A5/54A7
- 优势:计算效率高,适用于大规模体系
力场选择原则
- 蛋白质模拟:AMBER ff14SB/ff19SB, CHARMM36m
- 膜蛋白模拟:CHARMM36, Slipids
- 小分子/药物设计:OPLS3/3e, GAFF2
- 大规模体系:GROMOS, MARTINI(粗粒化)

查看详情 →
💡

三、牛顿运动方程与积分算法

concept

**1. 牛顿运动方程** 对于每个原子i: $$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$ 其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。 **2. 有限差分积分算法** **Verlet算法**: $$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delt...

1. 牛顿运动方程
对于每个原子i:
$$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$
其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。
2. 有限差分积分算法
Verlet算法
$$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delta t^2$$
- 优点:时间可逆,能量守恒好
- 缺点:速度计算精度低
Velocity Verlet算法
$$v(t + \frac{\Delta t}{2}) = v(t) + \frac{a(t)\Delta t}{2}$$
$$r(t + \Delta t) = r(t) + v(t + \frac{\Delta t}{2})\Delta t$$
$$v(t + \Delta t) = v(t + \frac{\Delta t}{2}) + \frac{a(t + \Delta t)\Delta t}{2}$$
- 优点:同时更新位置和速度,精度高,稳定性好
- 是目前最常用的MD积分算法
时间步长选择
- 典型值:2 fs(飞秒,10⁻¹⁵秒)
- 限制因素:体系中最快运动(键长振动,C-H键约10⁻¹⁴秒周期)
- 约束算法(SHAKE/SETTLE/LINCS):固定键长,允许更大时间步长(2-4 fs)
3. 周期性边界条件(PBC)
- 模拟盒子(如立方体、十二面体、截角八面体)被其镜像复制填满整个空间
- 原子离开盒子一侧时,从另一侧进入(保持原子数恒定)
- 最小镜像约定:每个原子只与最近的镜像相互作用
- 目的:消除边界效应,模拟无限大体系
4. 长程相互作用处理
截断法(Cutoff)
- 只计算截断距离(如10-12 Å)内的非键相互作用
- 简单高效,但对于带电体系可能引入显著误差
Particle Mesh Ewald(PME)
- 将长程静电相互作用分解为实空间短程和倒空间长程两部分
- 实空间:截断范围内直接计算
- 倒空间:使用快速傅里叶变换(FFT)在网格上计算
- 优点:精度高(~10⁻⁵),效率合理
- 缺点:需要周期性边界条件

查看详情 →
💡

四、MD模拟流程

concept

**1. 体系准备** - 获取蛋白质结构(PDB下载或预测) - 检查结构完整性:缺失原子、残基、二硫键 - 添加氢原子(根据pH确定质子化状态) - 选择力场和溶剂模型(如TIP3P、SPC/E) - 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度) - 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI **2. 能量最小化** - 目的:消除不...

1. 体系准备
- 获取蛋白质结构(PDB下载或预测)
- 检查结构完整性:缺失原子、残基、二硫键
- 添加氢原子(根据pH确定质子化状态)
- 选择力场和溶剂模型(如TIP3P、SPC/E)
- 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度)
- 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI
2. 能量最小化
- 目的:消除不合理的原子接触和键长/键角畸变
- 算法:最陡下降法(Steepest Descent)→ 共轭梯度法(Conjugate Gradient)
- 判断标准:体系势能达到最小值,最大受力<1000 kJ/mol/nm
3. 平衡阶段
- NVT平衡:在恒定体积下升温至目标温度(如300K),温度耦合(如V-rescale)
- NPT平衡:在恒定温度和压强下平衡密度,压强耦合(如Parrinello-Rahman)
- 判断标准:温度、密度、能量、RMSD均达到稳定波动
- 典型时长:100 ps - 1 ns
4. 生产模拟(Production Run)
- 在平衡后的构象上开始长时间采样
- 记录轨迹(坐标、速度、能量等)
- 典型时长:100 ns - 10 μs(取决于体系和计算资源)
- 现代GPU加速:RTX 4090可达~100 ns/天(~50,000原子体系)
5. 轨迹分析
- 结构分析:RMSD、RMSF、回旋半径(Rg)
- 动力学分析:主成分分析(PCA)、自由能面构建
- 相互作用分析:氢键、盐桥、疏水接触、π-π堆积
- 工具:VMD、MDAnalysis、MDTraj、CPPTRAJ

查看详情 →
💡

五、增强采样方法

concept

**1. 伞形采样(Umbrella Sampling)** - 沿反应坐标(Collective Variable, CV)划分多个窗口 - 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]² - 将系统限制在特定CV范围内采样 - 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面 - 适用:...

1. 伞形采样(Umbrella Sampling)
- 沿反应坐标(Collective Variable, CV)划分多个窗口
- 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]²
- 将系统限制在特定CV范围内采样
- 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面
- 适用:已知反应路径,计算自由能面
2. 副本交换分子动力学(REMD)
- 并行运行多个不同温度的副本(如300K, 310K, 320K, ...)
- 定期尝试交换相邻副本的构象(按Metropolis准则)
- 高温副本探索高能量构象,交换到低温副本中
- 适用:构象搜索、折叠/去折叠研究
- 缺点:副本数随体系自由度增加,计算成本高
3. 元动力学(Metadynamics)
- 在CV空间上不断添加高斯偏置势(负反馈机制)
- 高斯势累积"填平"势能阱,促进系统逃离局部最小值
- 适用:未知反应路径,自动探索自由能面
- 变种:Well-Tempered Metadynamics(WTMetaD)、Adaptive Bias Force(ABF)
4. 其他方法
- Steered MD(SMD):施加外力驱动系统沿特定方向运动
- Gaussian Accelerated MD(GaMD): boost 势能促进低能量区域的采样
- REST2(Replica Exchange with Solute Tempering):仅增强溶质温度,降低计算成本

查看详情 →
💡

六、粗粒化模拟

concept

**MARTINI力场**: - 将4个重原子映射为1个珠子(bead) - 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水) - 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍 - 应用:膜蛋白、脂质体、大分子复合物组装 - 局限:丧失原子细节,不适合研究化学键形成/断裂

MARTINI力场
- 将4个重原子映射为1个珠子(bead)
- 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水)
- 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍
- 应用:膜蛋白、脂质体、大分子复合物组装
- 局限:丧失原子细节,不适合研究化学键形成/断裂

查看详情 →
💡

9.4 蛋白质功能预测与分析

section
查看详情 →
💡

一、蛋白质功能概述

concept

**1. 蛋白质功能的层次性** 蛋白质功能具有复杂性和多层次性: - **分子功能**:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活) - **生物过程**:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路) - **细胞组分**:蛋白质所在的细胞位置(如细胞核、线粒体、膜) 同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行...

1. 蛋白质功能的层次性
蛋白质功能具有复杂性和多层次性:
- 分子功能:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活)
- 生物过程:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路)
- 细胞组分:蛋白质所在的细胞位置(如细胞核、线粒体、膜)
同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行(冗余性)。
2. GO注释系统
GO采用有向无环图(DAG)结构组织术语:
- 每个术语(GO term)有唯一ID(如GO:0004672,蛋白激酶活性)
- 术语之间存在"is_a"和"part_of"关系
- 从根节点到叶节点的路径表示功能的特异性递增
GO注释证据代码
- EXP:实验验证
- IDA:直接实验测定
- IPI:蛋白质相互作用
- ISS:序列相似性推断
- IEA:自动电子注释
- ...(共约15种证据代码)
3. CAFA竞赛
- 2010年首次举办,之后每2-3年一次
- 使用未公开蛋白质序列作为测试集
- 评估指标:Fmax(F-measure最大值)、Smin(语义距离最小值)、AUPR(精确率-召回率曲线下面积)
- 推动了功能预测方法的发展,特别是整合多源信息的方法

查看详情 →
💡

二、基于序列的功能分析

concept

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区

查看详情 →
💡

三、基于结构的功能分析

concept

**1. 基于结构相似性的功能预测** **原理**:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。 **结构比对工具**: - **DALI**:基于分子内距离矩阵的比较 - **TM-align**:基于TM-score的结构相似性度量 - **FATCAT**:允许柔性旋转的结构比对 **结构比对评估**: - **RMSD(Root Mean Square Deviation)*...

1. 基于结构相似性的功能预测
原理:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。
结构比对工具
- DALI:基于分子内距离矩阵的比较
- TM-align:基于TM-score的结构相似性度量
- FATCAT:允许柔性旋转的结构比对
结构比对评估
- RMSD(Root Mean Square Deviation):结构叠合后的原子坐标偏差,<2Å为高度相似
- TM-score(Template Modeling Score):0-1之间,>0.5表示相同折叠,>0.9表示高度相似
- GDT_TS:与CASP评估类似,用于结构相似性度量
2. 基于结构的功能预测工具
ProFunc
- 整合多种序列和结构分析方法
- 包括序列同源性搜索、结构相似性搜索、残基保守性分析、表面分析等
- 输出综合功能注释
COFACTOR
- 基于结构比对的功能注释系统
- 将待测蛋白结构比对到已知功能模板库
- 预测配体结合位点、酶学分类(EC号)、GO注释
3. 基于分子对接的功能分析
分子对接原理
- 搜索配体在受体结合口袋中的最佳位置和取向
- 评估结合模式的亲和力(打分函数)
- 预测配体-受体相互作用
对接类型
- 刚性对接:受体和配体构象均固定,适用于大分子对接(如蛋白质-蛋白质)
- 半柔性对接:配体构象可变化,受体固定,适用于小分子-蛋白质对接
- 柔性对接:受体和配体构象均可变化,精度高但计算成本高
对接流程
1. 受体准备:从PDB获取结构,添加氢原子,确定质子化状态,定义结合口袋
2. 配体准备:生成3D构象,添加电荷,确定可旋转键
3. 构象搜索:系统搜索、遗传算法、蒙特卡罗模拟等方法
4. 打分评估:基于力场、经验公式或知识的打分函数
5. 结果分析:聚类相似构象,选择最佳结合模式
常用对接软件
- AutoDock Vina:快速开源对接软件,基于经验打分函数
- GOLD:商业软件,基于遗传算法,高精度
- Glide:Schrödinger软件包,基于网格搜索
- rDOCK:基于力场的对接和打分
虚拟筛选(Virtual Screening)
- 将大型化合物库(如数百万分子)与靶蛋白对接
- 筛选结合打分最高的候选化合物
- 用于药物发现的早期阶段,大幅降低实验筛选成本
4. 结合自由能计算
MM-PBSA/MM-GBSA
- 基于分子力学和泊松-玻尔兹曼/广义Born溶剂化模型
- 计算结合自由能:ΔG_bind = ΔH - TΔS ≈ ΔE_MM + ΔG_solvation - TΔS
- 适用于快速估算相对结合亲和力
自由能微扰(FEP)
- 通过一系列"炼金术"变换(逐渐改变配体A为配体B)计算相对结合自由能
- 精度高(<1 kcal/mol),但计算成本高
- 适用于先导化合物优化
热力学积分(TI)
- 类似FEP,但使用积分而非微扰计算自由能差
- 适用于化学变化较大的体系

查看详情 →
💡

四、基于网络的蛋白质功能分析

concept

**1. 蛋白质相互作用网络(PPI Network)** PPI网络以蛋白质为节点,相互作用为边。 - 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘 - 数据库:STRING、BioGRID、IntAct、MINT **2. 基于邻域的方法(Neighborhood Method)** **邻居计数法**: - 将邻居节点中最频繁的功能分配给目标蛋白 - 简单直接,但忽略...

1. 蛋白质相互作用网络(PPI Network)
PPI网络以蛋白质为节点,相互作用为边。
- 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘
- 数据库:STRING、BioGRID、IntAct、MINT
2. 基于邻域的方法(Neighborhood Method)
邻居计数法
- 将邻居节点中最频繁的功能分配给目标蛋白
- 简单直接,但忽略了功能频率差异
χ²检验法
- 使用χ²检验或Fisher精确检验确定邻居中显著富集的功能
- 仅将显著富集的功能分配给目标蛋白
- 比简单计数法更可靠
邻居扩展法
- 将邻居扩展到一阶邻居的近邻
- 扩大功能信息来源,但可能引入噪声
3. 基于全局网络拓扑的方法
马尔可夫随机场(MRF)
- 建模网络中节点功能的依赖关系
- 利用Gibbs采样或变分推断进行概率推断
- 考虑全局网络结构,而不仅是局部邻居
4. 基于模块划分的方法
模块识别
- 识别网络中紧密连接的节点群(社区/模块)
- 同一模块内的蛋白质倾向于参与同一生物过程
常用算法
- MCL(Markov Cluster Algorithm):基于随机游走的扩展和膨胀操作
- Louvain算法:基于模块度优化的贪心算法
- RWR(Random Walk with Restart):从种子节点出发,通过重启随机游走量化节点关联性
- 谱聚类:基于图拉普拉斯矩阵的特征向量聚类
模块识别后的功能注释
- 将模块内已知功能直接分配给未知蛋白
- 使用χ²检验或Fisher精确检验对模块内功能进行富集分析
- 结合机器学习模型,利用网络拓扑特征预测功能
5. 基于网络整合的方法
GeneMANIA
- 整合多种网络(PPI、基因共表达、遗传相互作用、通路共享)
- 使用线性回归学习每个网络的权重
- 构建加权整合网络,使用标签传播算法预测功能
GAIN(Graphical Association Network)
- 基于贝叶斯网络的方法
- 将每个网络视为独立证据
- 使用条件概率和贝叶斯规则整合证据,推断功能概率
6. 基于深度学习的网络方法
DeepWalk
- 通过随机游走生成节点序列
- 使用Skip-gram模型学习节点嵌入(低维向量表示)
- 嵌入向量保留网络拓扑信息
DeepGO
- 整合DeepWalk网络特征和序列特征(3-mer编码+1D CNN)
- 分层神经网络预测GO功能,保持GO层次关系
图卷积网络(GCN)
- 直接对图结构进行卷积操作
- 每个节点的特征由邻居节点聚合得到
- DeepGraphGO:构建多物种PPI网络,使用GCN提取特征,整合序列特征预测功能

查看详情 →
💡

9.5 代谢组学

section
查看详情 →
💡

一、代谢组学技术平台

concept

**1. 核磁共振(NMR)** **原理**: - 利用原子核(主要是¹H)在磁场中的共振吸收特性 - 不同化学环境的氢原子具有不同的化学位移 - 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构 **优点**: - 非破坏性,样本可重复使用 - 无需色谱分离,样品制备简单 - 定量准确,重现性高 - 可检测所有含氢代谢物(无偏向性) **缺点**: - 灵敏度低...

1. 核磁共振(NMR)
原理
- 利用原子核(主要是¹H)在磁场中的共振吸收特性
- 不同化学环境的氢原子具有不同的化学位移
- 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构
优点
- 非破坏性,样本可重复使用
- 无需色谱分离,样品制备简单
- 定量准确,重现性高
- 可检测所有含氢代谢物(无偏向性)
缺点
- 灵敏度低(比MS低3-5个数量级)
- 分辨率有限,复杂样本谱图重叠严重
- 难以检测低丰度代谢物
应用
- 体液代谢组学(尿液、血液)
- 样本非常珍贵的情况(需要后续其他分析)
- 实时动态监测(如流动注射NMR)
2. 液相色谱-质谱联用(LC-MS)
原理
- 液相色谱(LC):根据代谢物在固定相和流动相之间的分配系数差异进行分离
- 反相色谱(RP-C18):分离非极性/中等极性代谢物(如脂质、脂肪酸)
- 亲水作用色谱(HILIC):分离极性代谢物(如氨基酸、糖类、核苷酸)
- 质谱(MS):LC洗脱的代谢物经ESI离子化,进入质谱仪检测
- 高分辨质谱(HRMS):Orbitrap、Q-TOF,精确分子量<5 ppm
- 串联质谱(MS/MS):提供碎片信息,用于结构鉴定
优点
- 灵敏度高(fmol-pmol级别)
- 覆盖范围广(可同时检测数千种代谢物)
- 分辨率高,可区分同分异构体
缺点
- 离子化效率差异导致定量偏差
- 基质效应(matrix effect):复杂样本中共同洗脱物质抑制或增强信号
- 样本制备要求高
3. 气相色谱-质谱联用(GC-MS)
原理
- 气相色谱(GC):样本气化后,在色谱柱中根据沸点和极性分离
- 质谱(MS):EI(电子轰击)电离,产生特征性碎片谱图
- 数据库:NIST/EPA/NIH Mass Spectral Library(超过250,000张标准谱图)
优点
- 重现性极高,保留时间稳定
- 有完善的EI谱图数据库,便于鉴定
- 定量准确(使用内标法)
缺点
- 需要样本衍生化(硅烷化、甲基化),增加样品制备复杂度
- 只能检测热稳定和挥发性代谢物(分子量<500 Da)
- 不适用于大分子、极性代谢物
应用
- 植物代谢组学(挥发性代谢物丰富)
- 脂肪酸分析
- 氨基酸和有机酸分析(衍生化后)
4. 其他技术
CE-MS(毛细管电泳-质谱)
- 分离原理:基于电荷/质量比的电泳迁移
- 优势:分离效率高,适合极性代谢物和离子型代谢物
- 应用:氨基酸、有机酸、核苷酸分析
MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 原理:在组织切片上直接进行质谱分析,获得代谢物的空间分布
- 应用:肿瘤代谢异质性、药物组织分布
5. 技术选择策略
| 样本类型 | 推荐技术 | 理由 |
|----------|----------|------|
| 血清/血浆 | LC-MS (RP + HILIC) | 覆盖极性和非极性代谢物 |
| 尿液 | NMR或LC-MS | NMR定量准确,LC-MS灵敏度高 |
| 组织 | LC-MS或GC-MS | 根据目标代谢物类型选择 |
| 植物提取物 | GC-MS + LC-MS | 挥发性用GC-MS,极性用LC-MS |
| 脂质组学 | LC-MS (RP-C18) | 反相色谱分离脂质效果好 |
| 单细胞 | LC-MS (高灵敏) | 需要极低样本量 |

查看详情 →
💡

二、代谢组学实验设计

concept

**1. 样本收集与制备** **样本类型**: - 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁 - 组织样本:肝脏、肌肉、肿瘤、脑组织 - 细胞样本:培养细胞、原代细胞 - 其他:粪便、肠道内容物、发酵液 **质控样本**: - **QC样本(Quality Control)**:混合等量的所有实验样本,用于监测系统稳定性和数据质量 - **空白样本**:溶剂空白,评估背景污染 - **标准...

1. 样本收集与制备
样本类型
- 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁
- 组织样本:肝脏、肌肉、肿瘤、脑组织
- 细胞样本:培养细胞、原代细胞
- 其他:粪便、肠道内容物、发酵液
质控样本
- QC样本(Quality Control):混合等量的所有实验样本,用于监测系统稳定性和数据质量
- 空白样本:溶剂空白,评估背景污染
- 标准品:已知浓度的代谢物混合物,用于方法验证
样本制备
- 蛋白质沉淀:甲醇/乙腈/氯仿提取,去除大分子
- 脂质去除:如需分析极性代谢物,使用正己烷或氯仿去除脂质
- 衍生化:GC-MS需要硅烷化(BSTFA+TMCS)或甲基化
- 注意:不同代谢物类别需要不同的提取方法,没有"一刀切"的最佳方案
2. 仪器分析
色谱条件优化
- 色谱柱选择:C18(反相)、HILIC(亲水)、T3(混合模式)
- 流动相:水/乙腈或水/甲醇,含0.1%甲酸或5mM乙酸铵
- 梯度洗脱:从低有机相到高有机相,洗脱不同极性的代谢物
- 流速:200-400 μL/min(nano-LC更低)
质谱参数
- 离子源:ESI+(正离子模式,检测碱性代谢物如氨基酸、胺类)和ESI-(负离子模式,检测酸性代谢物如脂肪酸、有机酸)
- 采集模式:Full scan(全扫描)+ DDA(数据依赖MS/MS)或DIA(全离子碎片)
- 分辨率:Orbitrap 60,000-120,000(Full scan),15,000-30,000(MS/MS)
- 扫描范围:m/z 50-1000(或更宽)
3. 数据质量监控
QC样本分析
- 每5-10个样本插入一个QC样本
- 监测保留时间漂移、信号强度变化、峰形变化
- 评估标准:QC中代谢物峰的RSD(相对标准偏差)<20%(或30%)
批次效应评估
- PCA分析:检查QC样本是否聚类,样本是否按批次聚集
- 如果样本按批次分离,说明存在显著批次效应,需要校正

查看详情 →
💡

三、代谢组学数据处理

concept

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能

查看详情 →
💡

四、代谢通路分析

concept

**1. 过表征分析(ORA, Over-Representation Analysis)** **原理**: - 输入:差异代谢物列表 - 背景:所有检测到的代谢物 - 方法:Fisher精确检验或超几何检验 - 输出:显著富集的代谢通路(p < 0.05) **局限性**: - 忽略代谢物变化方向(上调/下调) - 忽略代谢物丰度变化幅度 - 假设通路独立,忽略通路间交互 **2. 通路拓扑分...

1. 过表征分析(ORA, Over-Representation Analysis)
原理
- 输入:差异代谢物列表
- 背景:所有检测到的代谢物
- 方法:Fisher精确检验或超几何检验
- 输出:显著富集的代谢通路(p < 0.05)
局限性
- 忽略代谢物变化方向(上调/下调)
- 忽略代谢物丰度变化幅度
- 假设通路独立,忽略通路间交互
2. 通路拓扑分析(PT, Pathway Topology)
原理
- 考虑代谢通路中的拓扑结构(代谢物连接度、位置重要性)
- 中心代谢物(如ATP、NADH)在通路中的权重更高
- 方法:Impact Factor、Node Importance
软件
- MetaboAnalyst:综合代谢组学分析平台,支持ORA、PT、联合分析
- MetPA(Metabolic Pathway Analysis):基于通路拓扑的富集分析
- KEGG Mapper:基于KEGG通路的可视化分析
3. 整合通路分析
MSEA(Metabolite Set Enrichment Analysis)
- 类似GSEA,不需要预设差异代谢物阈值
- 输入:所有代谢物的排序列表(如按|logFC|排序)
- 评估预定义代谢物集合(如通路)是否集中在排序列表的顶端或底端
联合通路分析
- 整合ORA和拓扑分析的结果
- 结合代谢物变化方向和幅度
- 更全面地解释通路调控状态

查看详情 →
💡

五、代谢组学应用实例

concept

**1. 疾病生物标志物发现** **策略**: - 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照) - 验证阶段:靶向代谢组学,在独立队列中验证候选标志物 - 临床转化:开发检测试剂盒,进行临床试验 **成功案例**: - **前列腺癌**: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009) - **心血管疾病**: TMAO(氧化三甲胺)作为心血管风险标志...

1. 疾病生物标志物发现
策略
- 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照)
- 验证阶段:靶向代谢组学,在独立队列中验证候选标志物
- 临床转化:开发检测试剂盒,进行临床试验
成功案例
- 前列腺癌: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009)
- 心血管疾病: TMAO(氧化三甲胺)作为心血管风险标志物(NEJM, 2013)
- 糖尿病: 支链氨基酸(BCAA)与胰岛素抵抗相关
2. 药物代谢和药代动力学
研究内容
- 药物代谢产物鉴定(I相和II相代谢)
- 药物-药物相互作用(代谢酶竞争)
- 个体化给药(基于代谢酶基因型)
3. 营养代谢和精准营养
研究内容
- 食物代谢物分析(如多酚、维生素、脂肪酸)
- 个体代谢反应差异( responder vs. non-responder)
- 肠道菌群代谢物(短链脂肪酸、吲哚衍生物)
4. 环境代谢组学
研究内容
- 污染物暴露的代谢效应
- 生物标志物监测(如重金属、农药)
- 生态毒性评估

查看详情 →
💡

六、多组学整合

concept

**代谢组学与其他组学的整合**: **基因组+代谢组**: - 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL) - 识别代谢酶的遗传变异对代谢物水平的影响 **转录组+代谢组**: - 整合基因表达和代谢物水平,构建代谢调控网络 - 识别限速酶和调控节点 **蛋白质组+代谢组**: - 同时检测酶蛋白水平和代谢物水平 - 验证代谢通路的活性状态 **微生物组+代谢组*...

代谢组学与其他组学的整合
基因组+代谢组
- 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL)
- 识别代谢酶的遗传变异对代谢物水平的影响
转录组+代谢组
- 整合基因表达和代谢物水平,构建代谢调控网络
- 识别限速酶和调控节点
蛋白质组+代谢组
- 同时检测酶蛋白水平和代谢物水平
- 验证代谢通路的活性状态
微生物组+代谢组
- 肠道菌群16S/宏基因组 + 粪便/血清代谢组
- 揭示菌群-宿主代谢互作(如SCFA产生、胆汁酸代谢)
整合方法
- 相关性网络:计算代谢物与基因/蛋白质之间的Pearson/Spearman相关性
- 联合通路分析:如IMPaLA、iPEA
- 多组学因子分析(MOFA):识别跨组学的共享变异源
- 机器学习整合:使用多组学特征构建预测模型

查看详情 →
💡

9.6 蛋白质组学和代谢组学的总结与展望

section
查看详情 →
💡

一、蛋白质组学的最新进展

concept

**1. 单细胞蛋白质组学** **技术挑战**: - 单个哺乳动物细胞仅含约100-200 pg蛋白质 - 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级) - 需要极低体积的样本处理(微升级)和超灵敏的质谱检测 **技术突破**: - **SCoPE-MS(2018)**: - 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号 -...

1. 单细胞蛋白质组学
技术挑战
- 单个哺乳动物细胞仅含约100-200 pg蛋白质
- 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级)
- 需要极低体积的样本处理(微升级)和超灵敏的质谱检测
技术突破
- SCoPE-MS(2018)
- 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号
- 单个细胞通过独立的通道标记,与载体通道混合后进入质谱
- 实现单个细胞的蛋白质定量(~1,000-3,000个蛋白质)
- SCoPE2(2021)
- 改进样本处理和色谱分离
- 提高定量准确性(比率压缩校正)
- 检测深度提升至~5,000个蛋白质/单细胞
- DIA单细胞蛋白质组学
- 使用timsTOF Pro(离子淌度分离)和DIA模式
- 无需TMT标记,减少比率压缩
- 检测深度~2,000-4,000个蛋白质/单细胞
应用
- 肿瘤异质性:鉴定稀有耐药细胞亚群
- 免疫细胞图谱:揭示不同免疫细胞亚型的蛋白质特征
- 发育生物学:追踪细胞分化过程中的蛋白质动态变化
2. 空间蛋白质组学
技术方法
- LCM-MS(激光显微切割-质谱)
- 使用激光切取特定组织区域(20-100 μm,约5-10个细胞)
- 超微量蛋白质提取和酶解
- 高灵敏质谱分析
- 应用:肿瘤微环境区域分析、组织异质性研究
- 深度视觉蛋白质组学(DVP, 2022)
- 免疫荧光成像识别目标细胞类型
- LCM精确切割目标细胞
- 超灵敏质谱分析(>5,000个蛋白质)
- 在FFPE样本中实现单细胞分辨率的蛋白质组分析
- MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 在组织切片上直接进行质谱分析
- 空间分辨率:10-50 μm
- 可以同时获得数千个蛋白质和代谢物的空间分布
- 应用:肿瘤边界分析、药物分布研究
3. 人工智能驱动的蛋白质组学
蛋白质语言模型
- ESM-2(Meta AI, 2022)
- 基于15亿参数Transformer,在UniRef数据库上预训练
- 从单序列提取进化信息(无需MSA搜索)
- ESMFold结构预测速度比AlphaFold2快60倍
- 应用:宏基因组蛋白质结构预测、蛋白质表示学习
- ProtTrans(2021)
- 在3930亿氨基酸上训练的Transformer模型
- 学习蛋白质的语义表示
- 用于蛋白质分类、定位预测和功能注释
AI在质谱数据分析中的应用
- 肽段从头测序(De novo sequencing)
- 传统方法:基于图的动态规划(如PEAKS、Novor)
- AI方法:使用深度学习(CNN、LSTM、Transformer)直接预测序列
- 优势:可以鉴定数据库中不存在的肽段(如未知剪接变体、新抗原)
- DIA谱图解析
- 传统方法:依赖谱图库匹配
- AI方法:使用深度学习预测肽段的MS/MS谱图,构建"预测谱图库"
- 提高DIA数据分析的覆盖度和灵敏度
- 蛋白质定量优化
- 使用深度学习模型校正批次效应和技术噪声
- 提高低丰度蛋白质的定量准确性

查看详情 →
💡

二、代谢组学的最新进展

concept

**1. 单细胞代谢组学** **技术挑战**: - 代谢物比蛋白质更不稳定(半衰期从秒到分钟) - 单细胞代谢物总量极低(fg-pg级别) - 样本处理过程中的代谢物变化难以控制 **技术方法**: - **SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)**: - 使用代谢抑制剂处理细胞 - 通过抗...

1. 单细胞代谢组学
技术挑战
- 代谢物比蛋白质更不稳定(半衰期从秒到分钟)
- 单细胞代谢物总量极低(fg-pg级别)
- 样本处理过程中的代谢物变化难以控制
技术方法
- SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)
- 使用代谢抑制剂处理细胞
- 通过抗体检测代谢标志物(如ATP、NADH)
- 间接反映单细胞代谢状态
- Live-seq
- 使用微流控技术提取单细胞细胞质
- 结合质谱分析代谢物
- 实现活细胞代谢组分析
- 空间代谢组学(MALDI-MSI)
- 分辨率提升至5-10 μm(接近单细胞)
- 可以同时获得数百个代谢物的空间分布
- 应用:肿瘤代谢异质性、神经递质分布
2. 人工智能驱动的代谢组学
代谢物鉴定
- 基于深度学习的MS/MS谱图预测
- 使用生成模型(如变分自编码器、GAN)预测未知代谢物的MS/MS谱图
- 与实验谱图匹配,提高鉴定成功率
- MassGenie(2022)
- 基于Transformer框架,探索数百万种碎片模式
- 从质谱数据中识别小分子的能力前所未有
生物标志物发现
- 使用深度学习(CNN、LSTM、GNN)整合多组学数据
- 发现传统统计方法难以识别的复杂生物标志物模式
- 稳定识别算法:基于SVM和递归特征消除,提高代谢组学生物标志物的稳定性
通路分析
- 使用图神经网络(GNN)建模代谢网络
- 预测代谢通路的活性状态和扰动响应
- 整合基因表达和代谢物数据,构建动态代谢模型
3. 代谢组学数据库和标准化
数据库发展
- HMDB 5.0:超过220,000个代谢物条目,包含更多脂质和次级代谢物
- GNPS(Global Natural Products Social Molecular Networking)
- 代谢组学社区平台,支持MS/MS数据共享和协作注释
- 分子网络(molecular networking):基于MS/MS谱图相似性构建代谢物关系网络
- METLIN:超过250,000个代谢物,包含广泛的MS/MS数据
标准化进展
- 代谢组学数据标准(MSI):代谢物鉴定层次标准化
- 代谢组学报告标准(METABOLIGHTS):实验元数据记录
- 质谱数据格式标准化:mzML、mzXML通用格式

查看详情 →
💡

三、多组学整合与精准医学

concept

**1. 多组学整合策略** **数据层面整合**: - 使用MOFA+、iCluster、SNF等统计方法整合多组学数据 - 识别跨组学的共享因子(如疾病状态、批次效应) - 发现单一组学无法检测的调控关系 **知识层面整合**: - 构建多组学调控网络:基因→RNA→蛋白质→代谢物 - 使用贝叶斯网络、因果推断模型推断调控关系 - 整合通路数据库(KEGG、Reactome、Wikipathw...

1. 多组学整合策略
数据层面整合
- 使用MOFA+、iCluster、SNF等统计方法整合多组学数据
- 识别跨组学的共享因子(如疾病状态、批次效应)
- 发现单一组学无法检测的调控关系
知识层面整合
- 构建多组学调控网络:基因→RNA→蛋白质→代谢物
- 使用贝叶斯网络、因果推断模型推断调控关系
- 整合通路数据库(KEGG、Reactome、Wikipathways)进行系统解释
应用案例
- 癌症分子分型
- 整合基因组(突变、CNV)、转录组、蛋白质组和代谢组数据
- 识别新的癌症亚型,指导精准治疗
- 例如:CPTAC(Clinical Proteomic Tumor Analysis Consortium)对多种癌症进行多组学分析
- 疾病机制研究
- 整合GWAS、转录组、蛋白质组和代谢组,构建从基因变异到表型的因果链
- 识别关键调控节点和潜在药物靶点
- 药物反应预测
- 整合多组学数据预测患者对特定药物的反应
- 指导个体化用药(如化疗药物选择、免疫治疗响应预测)
2. 精准医学中的应用
疾病早期诊断
- 蛋白质/代谢标志物panel用于癌症早筛(如多癌种早期检测MCED)
- 液体活检:血液蛋白质组和代谢组分析
治疗靶点发现
- 多组学整合识别疾病驱动因素
- 蛋白质结构预测(AlphaFold)加速靶点结构解析和药物设计
患者分层
- 基于蛋白质组/代谢组特征对患者进行分层
- 预测治疗响应和预后
伴随诊断
- 蛋白质/代谢标志物指导靶向药物使用
- 监测治疗过程中的动态变化,评估疗效

查看详情 →
💡

四、未来展望

concept

**1. 技术发展趋势** **更高灵敏度**: - 单细胞蛋白质组学检测深度向10,000+蛋白质迈进 - 单细胞代谢组学实现真正的代谢物定量 **更高通量**: - 样本处理自动化(液体处理机器人) - 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral) - 每天可处理数百个样本 **更高维度**: - 空间组学:从组织水平到单细胞水平的空间分辨率 - 时间维度:动态监测...

1. 技术发展趋势
更高灵敏度
- 单细胞蛋白质组学检测深度向10,000+蛋白质迈进
- 单细胞代谢组学实现真正的代谢物定量
更高通量
- 样本处理自动化(液体处理机器人)
- 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral)
- 每天可处理数百个样本
更高维度
- 空间组学:从组织水平到单细胞水平的空间分辨率
- 时间维度:动态监测蛋白质/代谢物变化
- 多模态:同时测量蛋白质、代谢物、脂质和翻译后修饰
2. 计算方法发展趋势
AI驱动的全面革新
- 蛋白质语言模型:从结构预测到功能预测、蛋白质设计
- 深度学习质谱分析:从头测序、DIA解析、定量优化
- 生成式AI(如蛋白质扩散模型)用于从头设计蛋白质和代谢酶
多组学整合方法
- 从简单的相关性分析到因果推断
- 从静态网络到动态网络模型
- 从描述性分析到预测性模型
知识图谱
- 构建整合基因组、蛋白质组、代谢组、疾病和药物的全面知识图谱
- 使用图神经网络进行推理和预测
- 支持药物重定位和靶点发现
3. 挑战与机遇
挑战
- 数据标准化和共享:不同实验室、不同平台的数据难以直接比较
- 批次效应:大规模队列研究中的技术变异
- 缺失值和噪声:低丰度分子的检测困难
- 生物信息学瓶颈:数据量增长超过分析能力
- 临床转化:从研究发现到临床应用的鸿沟
机遇
- 技术进步:单细胞、空间、超灵敏质谱技术快速发展
- 计算能力:GPU、TPU、云计算使大规模分析成为可能
- AI革命:深度学习正在改变蛋白质组学和代谢组学的每个环节
- 精准医学:个体化诊断和治疗的需求驱动技术创新
- 国际合作:大型联盟(如HPP、CPTAC、CNHPP)推动标准化和资源共享

查看详情 →

代谢组学

💡

第9章 蛋白质组学和代谢组学

chapter

> 章节导读:蛋白质是生命活动的主要承担者,代谢物则是基因表达和蛋白质功能的最终产物。蛋白质组学通过高通量质谱技术系统鉴定和定量生物样本中的蛋白质,揭示蛋白质表达、修饰和相互作用的全景图。代谢组学则通过检测小分子代谢物的组成和变化,反映生物体的生理和病理状态。近年来,以深度学习为代表的人工智能技术在蛋白质结构预测和功能分析中取得了革命性突破。本章将系统介绍蛋白质组学、蛋白质结构分析、分子动力学模拟、功能预测以及代谢组学的基本原理和生物信息学分析方法。

查看详情 →
💡

9.1 蛋白质组学概述

section
查看详情 →
💡

一、蛋白质组学的研究内容

concept

蛋白质组学根据研究目的可分为三大类: **1. 表达蛋白质组学(Expression Proteomics)** - 研究蛋白质在不同生理、病理条件下的表达变化 - 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free) - 应用:疾病生物标志物发现、药物靶点鉴定 **2. 结构蛋白质组学(Structural Proteomics)** - 研究蛋白质的三维结构...

蛋白质组学根据研究目的可分为三大类:
1. 表达蛋白质组学(Expression Proteomics)
- 研究蛋白质在不同生理、病理条件下的表达变化
- 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free)
- 应用:疾病生物标志物发现、药物靶点鉴定
2. 结构蛋白质组学(Structural Proteomics)
- 研究蛋白质的三维结构及其动态变化
- 方法:X射线晶体学、NMR、冷冻电镜、计算结构预测
- 应用:蛋白质功能机制、药物设计
3. 功能蛋白质组学(Functional Proteomics)
- 研究蛋白质的功能、相互作用和信号通路
- 方法:蛋白质芯片、酵母双杂交、Co-IP/质谱、Proximity labeling
- 应用:蛋白质网络构建、信号转导通路解析

查看详情 →
💡

二、质谱技术原理

concept

**质谱仪的基本组成**: 1. **离子源**:将分析物转化为气相离子 - ESI(电喷雾电离):适用于液相样品,可产生多电荷离子 - MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子 2. **质量分析器**:按质荷比(m/z)分离离子 - 四极杆(Quadrupole):结构简单,常用于一级筛选 - 飞行时间(TOF):质量范围宽,分辨率较高...

质谱仪的基本组成
1. 离子源:将分析物转化为气相离子
- ESI(电喷雾电离):适用于液相样品,可产生多电荷离子
- MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子
2. 质量分析器:按质荷比(m/z)分离离子
- 四极杆(Quadrupole):结构简单,常用于一级筛选
- 飞行时间(TOF):质量范围宽,分辨率较高
- 轨道阱(Orbitrap):超高分辨率(>100,000),质量精度高(<1 ppm)
- 离子阱(Ion Trap):可进行多级碎裂(MSn)
3. 检测器:检测并记录离子信号
4. 数据处理系统:将信号转化为质谱图
串联质谱(MS/MS或MS²)
- 第一级质谱(MS1):分离和选择特定质荷比的母离子(precursor ion)
- 碰撞室:母离子与惰性气体(如N₂、Ar)碰撞,发生裂解(CID/HCD/EThcD)
- 第二级质谱(MS2):分析碎片离子(fragment ions)的质荷比
- 碎片类型:b离子(N端碎片)、y离子(C端碎片)为主

查看详情 →
💡

三、鸟枪法蛋白质组学流程

concept

**实验部分**: 1. **蛋白质提取**:从细胞/组织中提取总蛋白质 2. **蛋白质定量**:BCA/Bradford法测定蛋白质浓度 3. **蛋白质还原和烷基化**:DTT还原二硫键,IAA烷基化保护游离巯基 4. **酶解**:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段 5. **肽段脱盐**:C18柱去除盐类和干扰物 6. **LC-MS/MS分析**: - 液...

实验部分
1. 蛋白质提取:从细胞/组织中提取总蛋白质
2. 蛋白质定量:BCA/Bradford法测定蛋白质浓度
3. 蛋白质还原和烷基化:DTT还原二硫键,IAA烷基化保护游离巯基
4. 酶解:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段
5. 肽段脱盐:C18柱去除盐类和干扰物
6. LC-MS/MS分析
- 液相色谱(nano-LC)分离肽段(通常60-120分钟梯度)
- 电喷雾离子化(ESI)进入质谱仪
- 数据依赖采集(DDA):MS1全扫描 → 选择前N个最强离子进行MS2碎裂
- 数据非依赖采集(DIA):MS1全扫描 → 对预设m/z窗口进行系统MS2碎裂
计算部分
1. 数据库搜索
- 输入:MS2谱图 + 蛋白质序列数据库
- 过程:根据母离子质量筛选候选肽段 → 预测理论碎片谱图 → 与实验谱图比对打分
- 输出:PSM列表(肽段-谱图匹配结果)
2. FDR控制
- 目标-诱饵库策略(Target-Decoy):构建随机或反序的诱饵数据库,与目标数据库同时搜索
- 混合搜库FDR = 2×R / (F + R),其中F为目标库匹配数,R为诱饵库匹配数
- 分开搜库FDR = R / F
- 通常FDR < 1%作为可信鉴定阈值
3. 蛋白质组装
- 从肽段推断蛋白质:Occam's Razor原则(用最少的蛋白质解释所有肽段)
- 处理共享肽段(不同蛋白质产生的相同肽段)
- 概率型组装(如ProteinProphet):基于肽段置信度计算蛋白质水平概率
4. 蛋白质定量
- 标记定量:TMT/iTRAQ的 reporter ion 强度比
- SILAC:轻/重同位素标记肽段的峰面积比
- Label-free:基于肽段色谱峰面积或谱图计数(spectral counting)
- 定量值归一化:消除系统偏差

查看详情 →
💡

四、翻译后修饰蛋白质组学

concept

**磷酸化蛋白质组学**: - 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化 - 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%) - 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr) - 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄) - 软件:MaxQuant、Proteome Discoverer、pFi...

磷酸化蛋白质组学
- 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化
- 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%)
- 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr)
- 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄)
- 软件:MaxQuant、Proteome Discoverer、pFind(支持磷酸化位点定位)
糖基化蛋白质组学
- N-糖基化:Asn-X-Ser/Thr序列模体(X≠Pro),发生在内质网/高尔基体
- O-糖基化:主要发生在Ser/Thr,无特定序列模体
- 富集策略:凝集素亲和色谱、亲水相互作用色谱(HILIC)
- 鉴定挑战:糖链异质性导致同一肽段产生多种糖型
- 软件:Byonic、pGlyco、NGlycan
泛素化蛋白质组学
- 泛素化通过蛋白酶体途径调控蛋白质降解
- 富集策略:K-GG抗体(识别泛素化留下的Lys-Gly-Gly足迹)
- 应用:泛素-蛋白酶体系统研究、药物靶点发现(如蛋白酶体抑制剂)

查看详情 →
💡

五、蛋白质组数据与资源

concept

**公共数据库**: - **PRIDE**(Proteomics Identification Database):EMBL-EBI维护,存储MS数据 - **PeptideAtlas**:基于多实验数据的蛋白质/肽段图谱 - **MassIVE**:UCSD维护,支持数据存储和重新分析 - **ProteomeXchange(PX)**:国际联盟,统一数据提交标准 **人类蛋白质组计划(HPP...

公共数据库
- PRIDE(Proteomics Identification Database):EMBL-EBI维护,存储MS数据
- PeptideAtlas:基于多实验数据的蛋白质/肽段图谱
- MassIVE:UCSD维护,支持数据存储和重新分析
- ProteomeXchange(PX):国际联盟,统一数据提交标准
人类蛋白质组计划(HPP)
- 目标:系统绘制人类蛋白质组图谱
- 2020年:发布了覆盖>90%人类蛋白质编码基因的草图
- 中国人类蛋白质组计划(CNHPP):聚焦中国人常见癌症的蛋白质组研究

查看详情 →
💡

9.2 蛋白质结构分析

section
查看详情 →
💡

一、蛋白质结构的层次组织

concept

**1. 一级结构** - 由20种常见氨基酸通过肽键连接形成线性多肽链 - 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向 - 关键特征:N端(氨基端)和C端(羧基端),肽链方向性 **2. 二级结构** **α螺旋**: - 每圈3.6个氨基酸残基,螺距5.4 Å - 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键 - 氢键大致平行于螺旋轴,稳定螺旋结构 - 氨基酸倾向性...

1. 一级结构
- 由20种常见氨基酸通过肽键连接形成线性多肽链
- 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向
- 关键特征:N端(氨基端)和C端(羧基端),肽链方向性
2. 二级结构
α螺旋
- 每圈3.6个氨基酸残基,螺距5.4 Å
- 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键
- 氢键大致平行于螺旋轴,稳定螺旋结构
- 氨基酸倾向性:Ala、Glu、Leu、Met偏好螺旋;Pro、Gly破坏螺旋
β折叠
- 由多条肽链片段或同一肽链的不同片段平行排列形成
- 链间氢键稳定:一条链的羰基氧与另一条链的酰胺氢形成氢键
- 平行式(N→C同向)和反平行式(N→C反向),反平行更稳定
- 氨基酸倾向性:Val、Ile、Phe偏好β折叠;Pro、Gly不利于β折叠
环区/转角(Loop/Turn)
- 连接二级结构元件的无规区域
- 通常位于蛋白质表面,暴露在溶剂中
- 高柔性和高多样性,常参与功能位点形成
3. 超二级结构(Supersecondary Structure)
- 两个或多个二级结构单元的组合模式
- 常见类型:α-α(螺旋-转角-螺旋)、β-α-β(Rossmann折叠)、β-发夹(β-hairpin)
4. 结构域(Domain)
- 独立折叠的球状单元,具有特定功能
- 结构域分类:全α(all-α)、全β(all-β)、α/β(交替)、α+β(分离)
- 多结构域蛋白质:不同结构域可以执行不同功能,通过柔性连接子连接
5. 三级结构
- 稳定三级结构的相互作用:
- 疏水作用:疏水残基埋藏在蛋白质内部(主要驱动力)
- 氢键:主链和侧链之间
- 离子键:带相反电荷的侧链之间
- 范德华力:所有原子之间的弱吸引力
- 二硫键:半胱氨酸残基之间的共价连接(稳定作用)
6. 四级结构
- 多个多肽链(亚基)通过非共价相互作用形成蛋白质复合物
- 亚基间相互作用:疏水界面、氢键、盐桥
- 别构效应:配体结合改变亚基间相互作用,调控蛋白质活性

查看详情 →
💡

二、蛋白质结构预测方法

concept

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测

查看详情 →
💡

三、蛋白质结构性质预测

concept

**1. 二级结构预测** **Q3准确率**:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。 **方法发展**: - 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60% - 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65% - 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多...

1. 二级结构预测
Q3准确率:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。
方法发展
- 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60%
- 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65%
- 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多序列比对,准确率>75-80%
- 深度学习:基于CNN/Transformer,准确率>85%
PSIPRED方法
1. PSI-BLAST搜索NR数据库,获得多序列比对(PSSM)
2. 将PSSM特征(20种氨基酸的频率)输入两层神经网络
3. 输出每个残基的三态概率(H/E/C)
2. 无序区预测(Intrinsically Disordered Region, IDR)
IDR特征
- 生理条件下不能形成稳定三维结构
- 人类蛋白质中约30-40%的残基处于无序区
- 功能:信号传导、转录调控、蛋白质相互作用枢纽
预测方法
- IUPred:基于能量估算(低相互作用能→无序)
- PONDR、DisEMBL:基于机器学习和神经网络
- SPOT-Disorder:基于深度学习,准确率>80%

查看详情 →
💡

四、功能蛋白质的从头设计

concept

**设计策略**: 1. **拓扑选择**:选择适合目标功能的蛋白质折叠类型 2. **骨架设计**:设计主链结构,满足目标约束(如配体结合口袋) 3. **序列优化**:使用能量函数和深度学习优化氨基酸序列 4. **实验验证**:表达纯化蛋白质,验证功能 **深度学习设计方法**: - **trRosetta**:基于Transformer的序列-结构联合生成 - **ProteinMPNN*...

设计策略
1. 拓扑选择:选择适合目标功能的蛋白质折叠类型
2. 骨架设计:设计主链结构,满足目标约束(如配体结合口袋)
3. 序列优化:使用能量函数和深度学习优化氨基酸序列
4. 实验验证:表达纯化蛋白质,验证功能
深度学习设计方法
- trRosetta:基于Transformer的序列-结构联合生成
- ProteinMPNN:基于图神经网络的序列设计
- RFdiffusion:基于扩散模型的蛋白质结构生成(2023, Baker Lab)
成功案例
- 2023年Baker Lab设计新型萤光素酶(LuxSit-i)
- 使用"family-wide hallucination"从NTF2超家族生成新结构
- 通过RIFGen/RIFDock设计与DTZ配体的结合口袋
- 设计的萤光素酶活性与天然酶相当,但结构完全不同

查看详情 →
💡

9.3 蛋白质分子动力学模拟

section
查看详情 →
💡

一、统计力学基础

concept

**1. 相空间和系综** 对于N个粒子组成的系统,经典动力学由6N个变量描述: - 位置:r₁(t), r₂(t), ..., rₙ(t) - 动量:p₁(t), p₂(t), ..., pₙ(t) 相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。 **系综类型**: - **NVT(正则系综)**:粒子数N、体积V、温度T恒定。通过热...

1. 相空间和系综
对于N个粒子组成的系统,经典动力学由6N个变量描述:
- 位置:r₁(t), r₂(t), ..., rₙ(t)
- 动量:p₁(t), p₂(t), ..., pₙ(t)
相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。
系综类型
- NVT(正则系综):粒子数N、体积V、温度T恒定。通过热浴(thermostat)维持温度,如Nosé-Hoover、Langevin动力学。
- NPT(等温等压系综):粒子数N、压强P、温度T恒定。通过恒压器(barostat)调节体积,如Parrinello-Rahman、Berendsen。
- NVE(微正则系综):粒子数N、体积V、总能量E恒定。无热浴和恒压器,系统为孤立体系。
2. 自由能
Helmholtz自由能(F):适用于恒容体系(NVT)
$$F = U - TS$$
Gibbs自由能(G):适用于恒压体系(NPT),生物体系常用
$$G = H - TS = U + PV - TS$$
其中U为内能,T为温度,S为熵,H为焓,P为压强,V为体积。
自由能是系统做非体积功的最大能力。在恒温恒压下,自发过程总是朝着Gibbs自由能降低的方向进行(ΔG < 0)。
自由能面(Free Energy Landscape)
- 描述系统自由能随构象坐标变化的"地形图"
- 低能量区域(山谷)对应稳定构象(亚稳态)
- 高能量区域(山脊)对应过渡态
- 能垒高度决定构象转换的速率(Arrhenius方程)
自由能计算
- 直接计数法:ΔF = -k_B T ln(P_A / P_B),其中P_A和P_B为状态A和B的观测概率
- 缺点:对于高能量垒,罕见事件的采样需要极长时间

查看详情 →
💡

二、分子力场

concept

力场将总势能分解为键合项和非键合项: $$E_{total} = E_{bonded} + E_{nonbonded}$$ **1. 键合项(Bonded Terms)** **键长伸缩能**: $$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$ - 谐振子近似,K_r为力常数,r_eq为平衡键长 **键角弯曲能**: $$E_{angl...

力场将总势能分解为键合项和非键合项:
$$E_{total} = E_{bonded} + E_{nonbonded}$$
1. 键合项(Bonded Terms)
键长伸缩能
$$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$
- 谐振子近似,K_r为力常数,r_eq为平衡键长
键角弯曲能
$$E_{angle} = \sum_{angles} \frac{K_\theta}{2}(\theta - \theta_{eq})^2$$
- 谐振子近似,K_θ为力常数,θ_eq为平衡键角
二面角扭转能
$$E_{dihedral} = \sum_{dihedrals} \sum_{n} \frac{V_n}{2}[1 + \cos(n\phi - \gamma)]$$
- 傅里叶级数展开,V_n为势垒高度,n为周期性(旋转对称性),γ为相位偏移
2. 非键合项(Nonbonded Terms)
静电相互作用(Coulomb)
$$E_{electrostatic} = \sum_{i<j} \frac{q_i q_j}{4\pi\varepsilon_0 r_{ij}}$$
- q_i, q_j为原子电荷,r_ij为原子间距离
- 长程相互作用,通常使用截断(cutoff)或PME(Particle Mesh Ewald)方法处理
范德华相互作用(Lennard-Jones)
$$E_{vdW} = \sum_{i<j} \varepsilon_{ij}\left[\left(\frac{\sigma_{ij}}{r_{ij}}\right)^{12} - \left(\frac{\sigma_{ij}}{r_{ij}}\right)^6\right]$$
- ε_ij为势阱深度(相互作用强度)
- σ_ij为势能为0时的距离(原子"半径")
- r⁻¹²项:短程排斥(电子云重叠)
- r⁻⁶项:长程吸引(London色散力)
3. 常见力场
AMBER
- 开发:UC San Francisco (Peter Kollman, David Case)
- 特点:广泛用于蛋白质和核酸,参数基于量子化学计算和实验数据
- 版本:AMBER94/99/03/14/19, ff99SB-ILDN, ff14SB
- 优势:蛋白质力场准确,参数优化充分
CHARMM
- 开发:Harvard University (Martin Karplus)
- 特点:全面覆盖生物大分子(蛋白质、脂质、核酸、糖类)
- 版本:CHARMM22/27/36/36m
- 优势:脂质膜和膜蛋白模拟表现出色
OPLS-AA
- 开发:Jorgensen Lab (Yale University)
- 特点:液态模拟和蛋白质模拟兼顾
- 版本:OPLS-AA/L, OPLS3/3e
- 优势:有机小分子参数丰富
GROMOS
- 开发:van Gunsteren Lab (ETH Zurich)
- 特点: united-atom 表示(减少计算量)
- 版本:GROMOS43A1/53A5/54A7
- 优势:计算效率高,适用于大规模体系
力场选择原则
- 蛋白质模拟:AMBER ff14SB/ff19SB, CHARMM36m
- 膜蛋白模拟:CHARMM36, Slipids
- 小分子/药物设计:OPLS3/3e, GAFF2
- 大规模体系:GROMOS, MARTINI(粗粒化)

查看详情 →
💡

三、牛顿运动方程与积分算法

concept

**1. 牛顿运动方程** 对于每个原子i: $$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$ 其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。 **2. 有限差分积分算法** **Verlet算法**: $$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delt...

1. 牛顿运动方程
对于每个原子i:
$$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$
其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。
2. 有限差分积分算法
Verlet算法
$$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delta t^2$$
- 优点:时间可逆,能量守恒好
- 缺点:速度计算精度低
Velocity Verlet算法
$$v(t + \frac{\Delta t}{2}) = v(t) + \frac{a(t)\Delta t}{2}$$
$$r(t + \Delta t) = r(t) + v(t + \frac{\Delta t}{2})\Delta t$$
$$v(t + \Delta t) = v(t + \frac{\Delta t}{2}) + \frac{a(t + \Delta t)\Delta t}{2}$$
- 优点:同时更新位置和速度,精度高,稳定性好
- 是目前最常用的MD积分算法
时间步长选择
- 典型值:2 fs(飞秒,10⁻¹⁵秒)
- 限制因素:体系中最快运动(键长振动,C-H键约10⁻¹⁴秒周期)
- 约束算法(SHAKE/SETTLE/LINCS):固定键长,允许更大时间步长(2-4 fs)
3. 周期性边界条件(PBC)
- 模拟盒子(如立方体、十二面体、截角八面体)被其镜像复制填满整个空间
- 原子离开盒子一侧时,从另一侧进入(保持原子数恒定)
- 最小镜像约定:每个原子只与最近的镜像相互作用
- 目的:消除边界效应,模拟无限大体系
4. 长程相互作用处理
截断法(Cutoff)
- 只计算截断距离(如10-12 Å)内的非键相互作用
- 简单高效,但对于带电体系可能引入显著误差
Particle Mesh Ewald(PME)
- 将长程静电相互作用分解为实空间短程和倒空间长程两部分
- 实空间:截断范围内直接计算
- 倒空间:使用快速傅里叶变换(FFT)在网格上计算
- 优点:精度高(~10⁻⁵),效率合理
- 缺点:需要周期性边界条件

查看详情 →
💡

四、MD模拟流程

concept

**1. 体系准备** - 获取蛋白质结构(PDB下载或预测) - 检查结构完整性:缺失原子、残基、二硫键 - 添加氢原子(根据pH确定质子化状态) - 选择力场和溶剂模型(如TIP3P、SPC/E) - 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度) - 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI **2. 能量最小化** - 目的:消除不...

1. 体系准备
- 获取蛋白质结构(PDB下载或预测)
- 检查结构完整性:缺失原子、残基、二硫键
- 添加氢原子(根据pH确定质子化状态)
- 选择力场和溶剂模型(如TIP3P、SPC/E)
- 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度)
- 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI
2. 能量最小化
- 目的:消除不合理的原子接触和键长/键角畸变
- 算法:最陡下降法(Steepest Descent)→ 共轭梯度法(Conjugate Gradient)
- 判断标准:体系势能达到最小值,最大受力<1000 kJ/mol/nm
3. 平衡阶段
- NVT平衡:在恒定体积下升温至目标温度(如300K),温度耦合(如V-rescale)
- NPT平衡:在恒定温度和压强下平衡密度,压强耦合(如Parrinello-Rahman)
- 判断标准:温度、密度、能量、RMSD均达到稳定波动
- 典型时长:100 ps - 1 ns
4. 生产模拟(Production Run)
- 在平衡后的构象上开始长时间采样
- 记录轨迹(坐标、速度、能量等)
- 典型时长:100 ns - 10 μs(取决于体系和计算资源)
- 现代GPU加速:RTX 4090可达~100 ns/天(~50,000原子体系)
5. 轨迹分析
- 结构分析:RMSD、RMSF、回旋半径(Rg)
- 动力学分析:主成分分析(PCA)、自由能面构建
- 相互作用分析:氢键、盐桥、疏水接触、π-π堆积
- 工具:VMD、MDAnalysis、MDTraj、CPPTRAJ

查看详情 →
💡

五、增强采样方法

concept

**1. 伞形采样(Umbrella Sampling)** - 沿反应坐标(Collective Variable, CV)划分多个窗口 - 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]² - 将系统限制在特定CV范围内采样 - 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面 - 适用:...

1. 伞形采样(Umbrella Sampling)
- 沿反应坐标(Collective Variable, CV)划分多个窗口
- 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]²
- 将系统限制在特定CV范围内采样
- 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面
- 适用:已知反应路径,计算自由能面
2. 副本交换分子动力学(REMD)
- 并行运行多个不同温度的副本(如300K, 310K, 320K, ...)
- 定期尝试交换相邻副本的构象(按Metropolis准则)
- 高温副本探索高能量构象,交换到低温副本中
- 适用:构象搜索、折叠/去折叠研究
- 缺点:副本数随体系自由度增加,计算成本高
3. 元动力学(Metadynamics)
- 在CV空间上不断添加高斯偏置势(负反馈机制)
- 高斯势累积"填平"势能阱,促进系统逃离局部最小值
- 适用:未知反应路径,自动探索自由能面
- 变种:Well-Tempered Metadynamics(WTMetaD)、Adaptive Bias Force(ABF)
4. 其他方法
- Steered MD(SMD):施加外力驱动系统沿特定方向运动
- Gaussian Accelerated MD(GaMD): boost 势能促进低能量区域的采样
- REST2(Replica Exchange with Solute Tempering):仅增强溶质温度,降低计算成本

查看详情 →
💡

六、粗粒化模拟

concept

**MARTINI力场**: - 将4个重原子映射为1个珠子(bead) - 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水) - 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍 - 应用:膜蛋白、脂质体、大分子复合物组装 - 局限:丧失原子细节,不适合研究化学键形成/断裂

MARTINI力场
- 将4个重原子映射为1个珠子(bead)
- 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水)
- 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍
- 应用:膜蛋白、脂质体、大分子复合物组装
- 局限:丧失原子细节,不适合研究化学键形成/断裂

查看详情 →
💡

9.4 蛋白质功能预测与分析

section
查看详情 →
💡

一、蛋白质功能概述

concept

**1. 蛋白质功能的层次性** 蛋白质功能具有复杂性和多层次性: - **分子功能**:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活) - **生物过程**:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路) - **细胞组分**:蛋白质所在的细胞位置(如细胞核、线粒体、膜) 同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行...

1. 蛋白质功能的层次性
蛋白质功能具有复杂性和多层次性:
- 分子功能:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活)
- 生物过程:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路)
- 细胞组分:蛋白质所在的细胞位置(如细胞核、线粒体、膜)
同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行(冗余性)。
2. GO注释系统
GO采用有向无环图(DAG)结构组织术语:
- 每个术语(GO term)有唯一ID(如GO:0004672,蛋白激酶活性)
- 术语之间存在"is_a"和"part_of"关系
- 从根节点到叶节点的路径表示功能的特异性递增
GO注释证据代码
- EXP:实验验证
- IDA:直接实验测定
- IPI:蛋白质相互作用
- ISS:序列相似性推断
- IEA:自动电子注释
- ...(共约15种证据代码)
3. CAFA竞赛
- 2010年首次举办,之后每2-3年一次
- 使用未公开蛋白质序列作为测试集
- 评估指标:Fmax(F-measure最大值)、Smin(语义距离最小值)、AUPR(精确率-召回率曲线下面积)
- 推动了功能预测方法的发展,特别是整合多源信息的方法

查看详情 →
💡

二、基于序列的功能分析

concept

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区

查看详情 →
💡

三、基于结构的功能分析

concept

**1. 基于结构相似性的功能预测** **原理**:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。 **结构比对工具**: - **DALI**:基于分子内距离矩阵的比较 - **TM-align**:基于TM-score的结构相似性度量 - **FATCAT**:允许柔性旋转的结构比对 **结构比对评估**: - **RMSD(Root Mean Square Deviation)*...

1. 基于结构相似性的功能预测
原理:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。
结构比对工具
- DALI:基于分子内距离矩阵的比较
- TM-align:基于TM-score的结构相似性度量
- FATCAT:允许柔性旋转的结构比对
结构比对评估
- RMSD(Root Mean Square Deviation):结构叠合后的原子坐标偏差,<2Å为高度相似
- TM-score(Template Modeling Score):0-1之间,>0.5表示相同折叠,>0.9表示高度相似
- GDT_TS:与CASP评估类似,用于结构相似性度量
2. 基于结构的功能预测工具
ProFunc
- 整合多种序列和结构分析方法
- 包括序列同源性搜索、结构相似性搜索、残基保守性分析、表面分析等
- 输出综合功能注释
COFACTOR
- 基于结构比对的功能注释系统
- 将待测蛋白结构比对到已知功能模板库
- 预测配体结合位点、酶学分类(EC号)、GO注释
3. 基于分子对接的功能分析
分子对接原理
- 搜索配体在受体结合口袋中的最佳位置和取向
- 评估结合模式的亲和力(打分函数)
- 预测配体-受体相互作用
对接类型
- 刚性对接:受体和配体构象均固定,适用于大分子对接(如蛋白质-蛋白质)
- 半柔性对接:配体构象可变化,受体固定,适用于小分子-蛋白质对接
- 柔性对接:受体和配体构象均可变化,精度高但计算成本高
对接流程
1. 受体准备:从PDB获取结构,添加氢原子,确定质子化状态,定义结合口袋
2. 配体准备:生成3D构象,添加电荷,确定可旋转键
3. 构象搜索:系统搜索、遗传算法、蒙特卡罗模拟等方法
4. 打分评估:基于力场、经验公式或知识的打分函数
5. 结果分析:聚类相似构象,选择最佳结合模式
常用对接软件
- AutoDock Vina:快速开源对接软件,基于经验打分函数
- GOLD:商业软件,基于遗传算法,高精度
- Glide:Schrödinger软件包,基于网格搜索
- rDOCK:基于力场的对接和打分
虚拟筛选(Virtual Screening)
- 将大型化合物库(如数百万分子)与靶蛋白对接
- 筛选结合打分最高的候选化合物
- 用于药物发现的早期阶段,大幅降低实验筛选成本
4. 结合自由能计算
MM-PBSA/MM-GBSA
- 基于分子力学和泊松-玻尔兹曼/广义Born溶剂化模型
- 计算结合自由能:ΔG_bind = ΔH - TΔS ≈ ΔE_MM + ΔG_solvation - TΔS
- 适用于快速估算相对结合亲和力
自由能微扰(FEP)
- 通过一系列"炼金术"变换(逐渐改变配体A为配体B)计算相对结合自由能
- 精度高(<1 kcal/mol),但计算成本高
- 适用于先导化合物优化
热力学积分(TI)
- 类似FEP,但使用积分而非微扰计算自由能差
- 适用于化学变化较大的体系

查看详情 →
💡

四、基于网络的蛋白质功能分析

concept

**1. 蛋白质相互作用网络(PPI Network)** PPI网络以蛋白质为节点,相互作用为边。 - 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘 - 数据库:STRING、BioGRID、IntAct、MINT **2. 基于邻域的方法(Neighborhood Method)** **邻居计数法**: - 将邻居节点中最频繁的功能分配给目标蛋白 - 简单直接,但忽略...

1. 蛋白质相互作用网络(PPI Network)
PPI网络以蛋白质为节点,相互作用为边。
- 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘
- 数据库:STRING、BioGRID、IntAct、MINT
2. 基于邻域的方法(Neighborhood Method)
邻居计数法
- 将邻居节点中最频繁的功能分配给目标蛋白
- 简单直接,但忽略了功能频率差异
χ²检验法
- 使用χ²检验或Fisher精确检验确定邻居中显著富集的功能
- 仅将显著富集的功能分配给目标蛋白
- 比简单计数法更可靠
邻居扩展法
- 将邻居扩展到一阶邻居的近邻
- 扩大功能信息来源,但可能引入噪声
3. 基于全局网络拓扑的方法
马尔可夫随机场(MRF)
- 建模网络中节点功能的依赖关系
- 利用Gibbs采样或变分推断进行概率推断
- 考虑全局网络结构,而不仅是局部邻居
4. 基于模块划分的方法
模块识别
- 识别网络中紧密连接的节点群(社区/模块)
- 同一模块内的蛋白质倾向于参与同一生物过程
常用算法
- MCL(Markov Cluster Algorithm):基于随机游走的扩展和膨胀操作
- Louvain算法:基于模块度优化的贪心算法
- RWR(Random Walk with Restart):从种子节点出发,通过重启随机游走量化节点关联性
- 谱聚类:基于图拉普拉斯矩阵的特征向量聚类
模块识别后的功能注释
- 将模块内已知功能直接分配给未知蛋白
- 使用χ²检验或Fisher精确检验对模块内功能进行富集分析
- 结合机器学习模型,利用网络拓扑特征预测功能
5. 基于网络整合的方法
GeneMANIA
- 整合多种网络(PPI、基因共表达、遗传相互作用、通路共享)
- 使用线性回归学习每个网络的权重
- 构建加权整合网络,使用标签传播算法预测功能
GAIN(Graphical Association Network)
- 基于贝叶斯网络的方法
- 将每个网络视为独立证据
- 使用条件概率和贝叶斯规则整合证据,推断功能概率
6. 基于深度学习的网络方法
DeepWalk
- 通过随机游走生成节点序列
- 使用Skip-gram模型学习节点嵌入(低维向量表示)
- 嵌入向量保留网络拓扑信息
DeepGO
- 整合DeepWalk网络特征和序列特征(3-mer编码+1D CNN)
- 分层神经网络预测GO功能,保持GO层次关系
图卷积网络(GCN)
- 直接对图结构进行卷积操作
- 每个节点的特征由邻居节点聚合得到
- DeepGraphGO:构建多物种PPI网络,使用GCN提取特征,整合序列特征预测功能

查看详情 →
💡

9.5 代谢组学

section
查看详情 →
💡

一、代谢组学技术平台

concept

**1. 核磁共振(NMR)** **原理**: - 利用原子核(主要是¹H)在磁场中的共振吸收特性 - 不同化学环境的氢原子具有不同的化学位移 - 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构 **优点**: - 非破坏性,样本可重复使用 - 无需色谱分离,样品制备简单 - 定量准确,重现性高 - 可检测所有含氢代谢物(无偏向性) **缺点**: - 灵敏度低...

1. 核磁共振(NMR)
原理
- 利用原子核(主要是¹H)在磁场中的共振吸收特性
- 不同化学环境的氢原子具有不同的化学位移
- 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构
优点
- 非破坏性,样本可重复使用
- 无需色谱分离,样品制备简单
- 定量准确,重现性高
- 可检测所有含氢代谢物(无偏向性)
缺点
- 灵敏度低(比MS低3-5个数量级)
- 分辨率有限,复杂样本谱图重叠严重
- 难以检测低丰度代谢物
应用
- 体液代谢组学(尿液、血液)
- 样本非常珍贵的情况(需要后续其他分析)
- 实时动态监测(如流动注射NMR)
2. 液相色谱-质谱联用(LC-MS)
原理
- 液相色谱(LC):根据代谢物在固定相和流动相之间的分配系数差异进行分离
- 反相色谱(RP-C18):分离非极性/中等极性代谢物(如脂质、脂肪酸)
- 亲水作用色谱(HILIC):分离极性代谢物(如氨基酸、糖类、核苷酸)
- 质谱(MS):LC洗脱的代谢物经ESI离子化,进入质谱仪检测
- 高分辨质谱(HRMS):Orbitrap、Q-TOF,精确分子量<5 ppm
- 串联质谱(MS/MS):提供碎片信息,用于结构鉴定
优点
- 灵敏度高(fmol-pmol级别)
- 覆盖范围广(可同时检测数千种代谢物)
- 分辨率高,可区分同分异构体
缺点
- 离子化效率差异导致定量偏差
- 基质效应(matrix effect):复杂样本中共同洗脱物质抑制或增强信号
- 样本制备要求高
3. 气相色谱-质谱联用(GC-MS)
原理
- 气相色谱(GC):样本气化后,在色谱柱中根据沸点和极性分离
- 质谱(MS):EI(电子轰击)电离,产生特征性碎片谱图
- 数据库:NIST/EPA/NIH Mass Spectral Library(超过250,000张标准谱图)
优点
- 重现性极高,保留时间稳定
- 有完善的EI谱图数据库,便于鉴定
- 定量准确(使用内标法)
缺点
- 需要样本衍生化(硅烷化、甲基化),增加样品制备复杂度
- 只能检测热稳定和挥发性代谢物(分子量<500 Da)
- 不适用于大分子、极性代谢物
应用
- 植物代谢组学(挥发性代谢物丰富)
- 脂肪酸分析
- 氨基酸和有机酸分析(衍生化后)
4. 其他技术
CE-MS(毛细管电泳-质谱)
- 分离原理:基于电荷/质量比的电泳迁移
- 优势:分离效率高,适合极性代谢物和离子型代谢物
- 应用:氨基酸、有机酸、核苷酸分析
MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 原理:在组织切片上直接进行质谱分析,获得代谢物的空间分布
- 应用:肿瘤代谢异质性、药物组织分布
5. 技术选择策略
| 样本类型 | 推荐技术 | 理由 |
|----------|----------|------|
| 血清/血浆 | LC-MS (RP + HILIC) | 覆盖极性和非极性代谢物 |
| 尿液 | NMR或LC-MS | NMR定量准确,LC-MS灵敏度高 |
| 组织 | LC-MS或GC-MS | 根据目标代谢物类型选择 |
| 植物提取物 | GC-MS + LC-MS | 挥发性用GC-MS,极性用LC-MS |
| 脂质组学 | LC-MS (RP-C18) | 反相色谱分离脂质效果好 |
| 单细胞 | LC-MS (高灵敏) | 需要极低样本量 |

查看详情 →
💡

二、代谢组学实验设计

concept

**1. 样本收集与制备** **样本类型**: - 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁 - 组织样本:肝脏、肌肉、肿瘤、脑组织 - 细胞样本:培养细胞、原代细胞 - 其他:粪便、肠道内容物、发酵液 **质控样本**: - **QC样本(Quality Control)**:混合等量的所有实验样本,用于监测系统稳定性和数据质量 - **空白样本**:溶剂空白,评估背景污染 - **标准...

1. 样本收集与制备
样本类型
- 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁
- 组织样本:肝脏、肌肉、肿瘤、脑组织
- 细胞样本:培养细胞、原代细胞
- 其他:粪便、肠道内容物、发酵液
质控样本
- QC样本(Quality Control):混合等量的所有实验样本,用于监测系统稳定性和数据质量
- 空白样本:溶剂空白,评估背景污染
- 标准品:已知浓度的代谢物混合物,用于方法验证
样本制备
- 蛋白质沉淀:甲醇/乙腈/氯仿提取,去除大分子
- 脂质去除:如需分析极性代谢物,使用正己烷或氯仿去除脂质
- 衍生化:GC-MS需要硅烷化(BSTFA+TMCS)或甲基化
- 注意:不同代谢物类别需要不同的提取方法,没有"一刀切"的最佳方案
2. 仪器分析
色谱条件优化
- 色谱柱选择:C18(反相)、HILIC(亲水)、T3(混合模式)
- 流动相:水/乙腈或水/甲醇,含0.1%甲酸或5mM乙酸铵
- 梯度洗脱:从低有机相到高有机相,洗脱不同极性的代谢物
- 流速:200-400 μL/min(nano-LC更低)
质谱参数
- 离子源:ESI+(正离子模式,检测碱性代谢物如氨基酸、胺类)和ESI-(负离子模式,检测酸性代谢物如脂肪酸、有机酸)
- 采集模式:Full scan(全扫描)+ DDA(数据依赖MS/MS)或DIA(全离子碎片)
- 分辨率:Orbitrap 60,000-120,000(Full scan),15,000-30,000(MS/MS)
- 扫描范围:m/z 50-1000(或更宽)
3. 数据质量监控
QC样本分析
- 每5-10个样本插入一个QC样本
- 监测保留时间漂移、信号强度变化、峰形变化
- 评估标准:QC中代谢物峰的RSD(相对标准偏差)<20%(或30%)
批次效应评估
- PCA分析:检查QC样本是否聚类,样本是否按批次聚集
- 如果样本按批次分离,说明存在显著批次效应,需要校正

查看详情 →
💡

三、代谢组学数据处理

concept

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能

查看详情 →
💡

四、代谢通路分析

concept

**1. 过表征分析(ORA, Over-Representation Analysis)** **原理**: - 输入:差异代谢物列表 - 背景:所有检测到的代谢物 - 方法:Fisher精确检验或超几何检验 - 输出:显著富集的代谢通路(p < 0.05) **局限性**: - 忽略代谢物变化方向(上调/下调) - 忽略代谢物丰度变化幅度 - 假设通路独立,忽略通路间交互 **2. 通路拓扑分...

1. 过表征分析(ORA, Over-Representation Analysis)
原理
- 输入:差异代谢物列表
- 背景:所有检测到的代谢物
- 方法:Fisher精确检验或超几何检验
- 输出:显著富集的代谢通路(p < 0.05)
局限性
- 忽略代谢物变化方向(上调/下调)
- 忽略代谢物丰度变化幅度
- 假设通路独立,忽略通路间交互
2. 通路拓扑分析(PT, Pathway Topology)
原理
- 考虑代谢通路中的拓扑结构(代谢物连接度、位置重要性)
- 中心代谢物(如ATP、NADH)在通路中的权重更高
- 方法:Impact Factor、Node Importance
软件
- MetaboAnalyst:综合代谢组学分析平台,支持ORA、PT、联合分析
- MetPA(Metabolic Pathway Analysis):基于通路拓扑的富集分析
- KEGG Mapper:基于KEGG通路的可视化分析
3. 整合通路分析
MSEA(Metabolite Set Enrichment Analysis)
- 类似GSEA,不需要预设差异代谢物阈值
- 输入:所有代谢物的排序列表(如按|logFC|排序)
- 评估预定义代谢物集合(如通路)是否集中在排序列表的顶端或底端
联合通路分析
- 整合ORA和拓扑分析的结果
- 结合代谢物变化方向和幅度
- 更全面地解释通路调控状态

查看详情 →
💡

五、代谢组学应用实例

concept

**1. 疾病生物标志物发现** **策略**: - 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照) - 验证阶段:靶向代谢组学,在独立队列中验证候选标志物 - 临床转化:开发检测试剂盒,进行临床试验 **成功案例**: - **前列腺癌**: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009) - **心血管疾病**: TMAO(氧化三甲胺)作为心血管风险标志...

1. 疾病生物标志物发现
策略
- 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照)
- 验证阶段:靶向代谢组学,在独立队列中验证候选标志物
- 临床转化:开发检测试剂盒,进行临床试验
成功案例
- 前列腺癌: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009)
- 心血管疾病: TMAO(氧化三甲胺)作为心血管风险标志物(NEJM, 2013)
- 糖尿病: 支链氨基酸(BCAA)与胰岛素抵抗相关
2. 药物代谢和药代动力学
研究内容
- 药物代谢产物鉴定(I相和II相代谢)
- 药物-药物相互作用(代谢酶竞争)
- 个体化给药(基于代谢酶基因型)
3. 营养代谢和精准营养
研究内容
- 食物代谢物分析(如多酚、维生素、脂肪酸)
- 个体代谢反应差异( responder vs. non-responder)
- 肠道菌群代谢物(短链脂肪酸、吲哚衍生物)
4. 环境代谢组学
研究内容
- 污染物暴露的代谢效应
- 生物标志物监测(如重金属、农药)
- 生态毒性评估

查看详情 →
💡

六、多组学整合

concept

**代谢组学与其他组学的整合**: **基因组+代谢组**: - 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL) - 识别代谢酶的遗传变异对代谢物水平的影响 **转录组+代谢组**: - 整合基因表达和代谢物水平,构建代谢调控网络 - 识别限速酶和调控节点 **蛋白质组+代谢组**: - 同时检测酶蛋白水平和代谢物水平 - 验证代谢通路的活性状态 **微生物组+代谢组*...

代谢组学与其他组学的整合
基因组+代谢组
- 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL)
- 识别代谢酶的遗传变异对代谢物水平的影响
转录组+代谢组
- 整合基因表达和代谢物水平,构建代谢调控网络
- 识别限速酶和调控节点
蛋白质组+代谢组
- 同时检测酶蛋白水平和代谢物水平
- 验证代谢通路的活性状态
微生物组+代谢组
- 肠道菌群16S/宏基因组 + 粪便/血清代谢组
- 揭示菌群-宿主代谢互作(如SCFA产生、胆汁酸代谢)
整合方法
- 相关性网络:计算代谢物与基因/蛋白质之间的Pearson/Spearman相关性
- 联合通路分析:如IMPaLA、iPEA
- 多组学因子分析(MOFA):识别跨组学的共享变异源
- 机器学习整合:使用多组学特征构建预测模型

查看详情 →
💡

9.6 蛋白质组学和代谢组学的总结与展望

section
查看详情 →
💡

一、蛋白质组学的最新进展

concept

**1. 单细胞蛋白质组学** **技术挑战**: - 单个哺乳动物细胞仅含约100-200 pg蛋白质 - 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级) - 需要极低体积的样本处理(微升级)和超灵敏的质谱检测 **技术突破**: - **SCoPE-MS(2018)**: - 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号 -...

1. 单细胞蛋白质组学
技术挑战
- 单个哺乳动物细胞仅含约100-200 pg蛋白质
- 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级)
- 需要极低体积的样本处理(微升级)和超灵敏的质谱检测
技术突破
- SCoPE-MS(2018)
- 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号
- 单个细胞通过独立的通道标记,与载体通道混合后进入质谱
- 实现单个细胞的蛋白质定量(~1,000-3,000个蛋白质)
- SCoPE2(2021)
- 改进样本处理和色谱分离
- 提高定量准确性(比率压缩校正)
- 检测深度提升至~5,000个蛋白质/单细胞
- DIA单细胞蛋白质组学
- 使用timsTOF Pro(离子淌度分离)和DIA模式
- 无需TMT标记,减少比率压缩
- 检测深度~2,000-4,000个蛋白质/单细胞
应用
- 肿瘤异质性:鉴定稀有耐药细胞亚群
- 免疫细胞图谱:揭示不同免疫细胞亚型的蛋白质特征
- 发育生物学:追踪细胞分化过程中的蛋白质动态变化
2. 空间蛋白质组学
技术方法
- LCM-MS(激光显微切割-质谱)
- 使用激光切取特定组织区域(20-100 μm,约5-10个细胞)
- 超微量蛋白质提取和酶解
- 高灵敏质谱分析
- 应用:肿瘤微环境区域分析、组织异质性研究
- 深度视觉蛋白质组学(DVP, 2022)
- 免疫荧光成像识别目标细胞类型
- LCM精确切割目标细胞
- 超灵敏质谱分析(>5,000个蛋白质)
- 在FFPE样本中实现单细胞分辨率的蛋白质组分析
- MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 在组织切片上直接进行质谱分析
- 空间分辨率:10-50 μm
- 可以同时获得数千个蛋白质和代谢物的空间分布
- 应用:肿瘤边界分析、药物分布研究
3. 人工智能驱动的蛋白质组学
蛋白质语言模型
- ESM-2(Meta AI, 2022)
- 基于15亿参数Transformer,在UniRef数据库上预训练
- 从单序列提取进化信息(无需MSA搜索)
- ESMFold结构预测速度比AlphaFold2快60倍
- 应用:宏基因组蛋白质结构预测、蛋白质表示学习
- ProtTrans(2021)
- 在3930亿氨基酸上训练的Transformer模型
- 学习蛋白质的语义表示
- 用于蛋白质分类、定位预测和功能注释
AI在质谱数据分析中的应用
- 肽段从头测序(De novo sequencing)
- 传统方法:基于图的动态规划(如PEAKS、Novor)
- AI方法:使用深度学习(CNN、LSTM、Transformer)直接预测序列
- 优势:可以鉴定数据库中不存在的肽段(如未知剪接变体、新抗原)
- DIA谱图解析
- 传统方法:依赖谱图库匹配
- AI方法:使用深度学习预测肽段的MS/MS谱图,构建"预测谱图库"
- 提高DIA数据分析的覆盖度和灵敏度
- 蛋白质定量优化
- 使用深度学习模型校正批次效应和技术噪声
- 提高低丰度蛋白质的定量准确性

查看详情 →
💡

二、代谢组学的最新进展

concept

**1. 单细胞代谢组学** **技术挑战**: - 代谢物比蛋白质更不稳定(半衰期从秒到分钟) - 单细胞代谢物总量极低(fg-pg级别) - 样本处理过程中的代谢物变化难以控制 **技术方法**: - **SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)**: - 使用代谢抑制剂处理细胞 - 通过抗...

1. 单细胞代谢组学
技术挑战
- 代谢物比蛋白质更不稳定(半衰期从秒到分钟)
- 单细胞代谢物总量极低(fg-pg级别)
- 样本处理过程中的代谢物变化难以控制
技术方法
- SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)
- 使用代谢抑制剂处理细胞
- 通过抗体检测代谢标志物(如ATP、NADH)
- 间接反映单细胞代谢状态
- Live-seq
- 使用微流控技术提取单细胞细胞质
- 结合质谱分析代谢物
- 实现活细胞代谢组分析
- 空间代谢组学(MALDI-MSI)
- 分辨率提升至5-10 μm(接近单细胞)
- 可以同时获得数百个代谢物的空间分布
- 应用:肿瘤代谢异质性、神经递质分布
2. 人工智能驱动的代谢组学
代谢物鉴定
- 基于深度学习的MS/MS谱图预测
- 使用生成模型(如变分自编码器、GAN)预测未知代谢物的MS/MS谱图
- 与实验谱图匹配,提高鉴定成功率
- MassGenie(2022)
- 基于Transformer框架,探索数百万种碎片模式
- 从质谱数据中识别小分子的能力前所未有
生物标志物发现
- 使用深度学习(CNN、LSTM、GNN)整合多组学数据
- 发现传统统计方法难以识别的复杂生物标志物模式
- 稳定识别算法:基于SVM和递归特征消除,提高代谢组学生物标志物的稳定性
通路分析
- 使用图神经网络(GNN)建模代谢网络
- 预测代谢通路的活性状态和扰动响应
- 整合基因表达和代谢物数据,构建动态代谢模型
3. 代谢组学数据库和标准化
数据库发展
- HMDB 5.0:超过220,000个代谢物条目,包含更多脂质和次级代谢物
- GNPS(Global Natural Products Social Molecular Networking)
- 代谢组学社区平台,支持MS/MS数据共享和协作注释
- 分子网络(molecular networking):基于MS/MS谱图相似性构建代谢物关系网络
- METLIN:超过250,000个代谢物,包含广泛的MS/MS数据
标准化进展
- 代谢组学数据标准(MSI):代谢物鉴定层次标准化
- 代谢组学报告标准(METABOLIGHTS):实验元数据记录
- 质谱数据格式标准化:mzML、mzXML通用格式

查看详情 →
💡

三、多组学整合与精准医学

concept

**1. 多组学整合策略** **数据层面整合**: - 使用MOFA+、iCluster、SNF等统计方法整合多组学数据 - 识别跨组学的共享因子(如疾病状态、批次效应) - 发现单一组学无法检测的调控关系 **知识层面整合**: - 构建多组学调控网络:基因→RNA→蛋白质→代谢物 - 使用贝叶斯网络、因果推断模型推断调控关系 - 整合通路数据库(KEGG、Reactome、Wikipathw...

1. 多组学整合策略
数据层面整合
- 使用MOFA+、iCluster、SNF等统计方法整合多组学数据
- 识别跨组学的共享因子(如疾病状态、批次效应)
- 发现单一组学无法检测的调控关系
知识层面整合
- 构建多组学调控网络:基因→RNA→蛋白质→代谢物
- 使用贝叶斯网络、因果推断模型推断调控关系
- 整合通路数据库(KEGG、Reactome、Wikipathways)进行系统解释
应用案例
- 癌症分子分型
- 整合基因组(突变、CNV)、转录组、蛋白质组和代谢组数据
- 识别新的癌症亚型,指导精准治疗
- 例如:CPTAC(Clinical Proteomic Tumor Analysis Consortium)对多种癌症进行多组学分析
- 疾病机制研究
- 整合GWAS、转录组、蛋白质组和代谢组,构建从基因变异到表型的因果链
- 识别关键调控节点和潜在药物靶点
- 药物反应预测
- 整合多组学数据预测患者对特定药物的反应
- 指导个体化用药(如化疗药物选择、免疫治疗响应预测)
2. 精准医学中的应用
疾病早期诊断
- 蛋白质/代谢标志物panel用于癌症早筛(如多癌种早期检测MCED)
- 液体活检:血液蛋白质组和代谢组分析
治疗靶点发现
- 多组学整合识别疾病驱动因素
- 蛋白质结构预测(AlphaFold)加速靶点结构解析和药物设计
患者分层
- 基于蛋白质组/代谢组特征对患者进行分层
- 预测治疗响应和预后
伴随诊断
- 蛋白质/代谢标志物指导靶向药物使用
- 监测治疗过程中的动态变化,评估疗效

查看详情 →
💡

四、未来展望

concept

**1. 技术发展趋势** **更高灵敏度**: - 单细胞蛋白质组学检测深度向10,000+蛋白质迈进 - 单细胞代谢组学实现真正的代谢物定量 **更高通量**: - 样本处理自动化(液体处理机器人) - 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral) - 每天可处理数百个样本 **更高维度**: - 空间组学:从组织水平到单细胞水平的空间分辨率 - 时间维度:动态监测...

1. 技术发展趋势
更高灵敏度
- 单细胞蛋白质组学检测深度向10,000+蛋白质迈进
- 单细胞代谢组学实现真正的代谢物定量
更高通量
- 样本处理自动化(液体处理机器人)
- 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral)
- 每天可处理数百个样本
更高维度
- 空间组学:从组织水平到单细胞水平的空间分辨率
- 时间维度:动态监测蛋白质/代谢物变化
- 多模态:同时测量蛋白质、代谢物、脂质和翻译后修饰
2. 计算方法发展趋势
AI驱动的全面革新
- 蛋白质语言模型:从结构预测到功能预测、蛋白质设计
- 深度学习质谱分析:从头测序、DIA解析、定量优化
- 生成式AI(如蛋白质扩散模型)用于从头设计蛋白质和代谢酶
多组学整合方法
- 从简单的相关性分析到因果推断
- 从静态网络到动态网络模型
- 从描述性分析到预测性模型
知识图谱
- 构建整合基因组、蛋白质组、代谢组、疾病和药物的全面知识图谱
- 使用图神经网络进行推理和预测
- 支持药物重定位和靶点发现
3. 挑战与机遇
挑战
- 数据标准化和共享:不同实验室、不同平台的数据难以直接比较
- 批次效应:大规模队列研究中的技术变异
- 缺失值和噪声:低丰度分子的检测困难
- 生物信息学瓶颈:数据量增长超过分析能力
- 临床转化:从研究发现到临床应用的鸿沟
机遇
- 技术进步:单细胞、空间、超灵敏质谱技术快速发展
- 计算能力:GPU、TPU、云计算使大规模分析成为可能
- AI革命:深度学习正在改变蛋白质组学和代谢组学的每个环节
- 精准医学:个体化诊断和治疗的需求驱动技术创新
- 国际合作:大型联盟(如HPP、CPTAC、CNHPP)推动标准化和资源共享

查看详情 →

蛋白质组学和代谢组学的总结与展望

💡

第9章 蛋白质组学和代谢组学

chapter

> 章节导读:蛋白质是生命活动的主要承担者,代谢物则是基因表达和蛋白质功能的最终产物。蛋白质组学通过高通量质谱技术系统鉴定和定量生物样本中的蛋白质,揭示蛋白质表达、修饰和相互作用的全景图。代谢组学则通过检测小分子代谢物的组成和变化,反映生物体的生理和病理状态。近年来,以深度学习为代表的人工智能技术在蛋白质结构预测和功能分析中取得了革命性突破。本章将系统介绍蛋白质组学、蛋白质结构分析、分子动力学模拟、功能预测以及代谢组学的基本原理和生物信息学分析方法。

查看详情 →
💡

9.1 蛋白质组学概述

section
查看详情 →
💡

一、蛋白质组学的研究内容

concept

蛋白质组学根据研究目的可分为三大类: **1. 表达蛋白质组学(Expression Proteomics)** - 研究蛋白质在不同生理、病理条件下的表达变化 - 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free) - 应用:疾病生物标志物发现、药物靶点鉴定 **2. 结构蛋白质组学(Structural Proteomics)** - 研究蛋白质的三维结构...

蛋白质组学根据研究目的可分为三大类:
1. 表达蛋白质组学(Expression Proteomics)
- 研究蛋白质在不同生理、病理条件下的表达变化
- 定量策略:标记定量(TMT、iTRAQ、SILAC)和非标记定量(Label-free)
- 应用:疾病生物标志物发现、药物靶点鉴定
2. 结构蛋白质组学(Structural Proteomics)
- 研究蛋白质的三维结构及其动态变化
- 方法:X射线晶体学、NMR、冷冻电镜、计算结构预测
- 应用:蛋白质功能机制、药物设计
3. 功能蛋白质组学(Functional Proteomics)
- 研究蛋白质的功能、相互作用和信号通路
- 方法:蛋白质芯片、酵母双杂交、Co-IP/质谱、Proximity labeling
- 应用:蛋白质网络构建、信号转导通路解析

查看详情 →
💡

二、质谱技术原理

concept

**质谱仪的基本组成**: 1. **离子源**:将分析物转化为气相离子 - ESI(电喷雾电离):适用于液相样品,可产生多电荷离子 - MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子 2. **质量分析器**:按质荷比(m/z)分离离子 - 四极杆(Quadrupole):结构简单,常用于一级筛选 - 飞行时间(TOF):质量范围宽,分辨率较高...

质谱仪的基本组成
1. 离子源:将分析物转化为气相离子
- ESI(电喷雾电离):适用于液相样品,可产生多电荷离子
- MALDI(基质辅助激光解吸电离):适用于固态样品,通常产生单电荷离子
2. 质量分析器:按质荷比(m/z)分离离子
- 四极杆(Quadrupole):结构简单,常用于一级筛选
- 飞行时间(TOF):质量范围宽,分辨率较高
- 轨道阱(Orbitrap):超高分辨率(>100,000),质量精度高(<1 ppm)
- 离子阱(Ion Trap):可进行多级碎裂(MSn)
3. 检测器:检测并记录离子信号
4. 数据处理系统:将信号转化为质谱图
串联质谱(MS/MS或MS²)
- 第一级质谱(MS1):分离和选择特定质荷比的母离子(precursor ion)
- 碰撞室:母离子与惰性气体(如N₂、Ar)碰撞,发生裂解(CID/HCD/EThcD)
- 第二级质谱(MS2):分析碎片离子(fragment ions)的质荷比
- 碎片类型:b离子(N端碎片)、y离子(C端碎片)为主

查看详情 →
💡

三、鸟枪法蛋白质组学流程

concept

**实验部分**: 1. **蛋白质提取**:从细胞/组织中提取总蛋白质 2. **蛋白质定量**:BCA/Bradford法测定蛋白质浓度 3. **蛋白质还原和烷基化**:DTT还原二硫键,IAA烷基化保护游离巯基 4. **酶解**:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段 5. **肽段脱盐**:C18柱去除盐类和干扰物 6. **LC-MS/MS分析**: - 液...

实验部分
1. 蛋白质提取:从细胞/组织中提取总蛋白质
2. 蛋白质定量:BCA/Bradford法测定蛋白质浓度
3. 蛋白质还原和烷基化:DTT还原二硫键,IAA烷基化保护游离巯基
4. 酶解:胰蛋白酶(Trypsin)在Lys和Arg后切割,产生肽段
5. 肽段脱盐:C18柱去除盐类和干扰物
6. LC-MS/MS分析
- 液相色谱(nano-LC)分离肽段(通常60-120分钟梯度)
- 电喷雾离子化(ESI)进入质谱仪
- 数据依赖采集(DDA):MS1全扫描 → 选择前N个最强离子进行MS2碎裂
- 数据非依赖采集(DIA):MS1全扫描 → 对预设m/z窗口进行系统MS2碎裂
计算部分
1. 数据库搜索
- 输入:MS2谱图 + 蛋白质序列数据库
- 过程:根据母离子质量筛选候选肽段 → 预测理论碎片谱图 → 与实验谱图比对打分
- 输出:PSM列表(肽段-谱图匹配结果)
2. FDR控制
- 目标-诱饵库策略(Target-Decoy):构建随机或反序的诱饵数据库,与目标数据库同时搜索
- 混合搜库FDR = 2×R / (F + R),其中F为目标库匹配数,R为诱饵库匹配数
- 分开搜库FDR = R / F
- 通常FDR < 1%作为可信鉴定阈值
3. 蛋白质组装
- 从肽段推断蛋白质:Occam's Razor原则(用最少的蛋白质解释所有肽段)
- 处理共享肽段(不同蛋白质产生的相同肽段)
- 概率型组装(如ProteinProphet):基于肽段置信度计算蛋白质水平概率
4. 蛋白质定量
- 标记定量:TMT/iTRAQ的 reporter ion 强度比
- SILAC:轻/重同位素标记肽段的峰面积比
- Label-free:基于肽段色谱峰面积或谱图计数(spectral counting)
- 定量值归一化:消除系统偏差

查看详情 →
💡

四、翻译后修饰蛋白质组学

concept

**磷酸化蛋白质组学**: - 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化 - 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%) - 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr) - 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄) - 软件:MaxQuant、Proteome Discoverer、pFi...

磷酸化蛋白质组学
- 磷酸化是真核细胞中最常见的PTM,超过3/4的蛋白质经历磷酸化
- 主要发生在Ser(~90%)、Thr(~10%)和Tyr(~1%)
- 富集策略:IMAC(固定化金属离子亲和色谱)、TiO₂、抗体富集(pTyr)
- 鉴定挑战:磷酸化肽段在质谱中信号较弱,且可能产生中性丢失(H₃PO₄)
- 软件:MaxQuant、Proteome Discoverer、pFind(支持磷酸化位点定位)
糖基化蛋白质组学
- N-糖基化:Asn-X-Ser/Thr序列模体(X≠Pro),发生在内质网/高尔基体
- O-糖基化:主要发生在Ser/Thr,无特定序列模体
- 富集策略:凝集素亲和色谱、亲水相互作用色谱(HILIC)
- 鉴定挑战:糖链异质性导致同一肽段产生多种糖型
- 软件:Byonic、pGlyco、NGlycan
泛素化蛋白质组学
- 泛素化通过蛋白酶体途径调控蛋白质降解
- 富集策略:K-GG抗体(识别泛素化留下的Lys-Gly-Gly足迹)
- 应用:泛素-蛋白酶体系统研究、药物靶点发现(如蛋白酶体抑制剂)

查看详情 →
💡

五、蛋白质组数据与资源

concept

**公共数据库**: - **PRIDE**(Proteomics Identification Database):EMBL-EBI维护,存储MS数据 - **PeptideAtlas**:基于多实验数据的蛋白质/肽段图谱 - **MassIVE**:UCSD维护,支持数据存储和重新分析 - **ProteomeXchange(PX)**:国际联盟,统一数据提交标准 **人类蛋白质组计划(HPP...

公共数据库
- PRIDE(Proteomics Identification Database):EMBL-EBI维护,存储MS数据
- PeptideAtlas:基于多实验数据的蛋白质/肽段图谱
- MassIVE:UCSD维护,支持数据存储和重新分析
- ProteomeXchange(PX):国际联盟,统一数据提交标准
人类蛋白质组计划(HPP)
- 目标:系统绘制人类蛋白质组图谱
- 2020年:发布了覆盖>90%人类蛋白质编码基因的草图
- 中国人类蛋白质组计划(CNHPP):聚焦中国人常见癌症的蛋白质组研究

查看详情 →
💡

9.2 蛋白质结构分析

section
查看详情 →
💡

一、蛋白质结构的层次组织

concept

**1. 一级结构** - 由20种常见氨基酸通过肽键连接形成线性多肽链 - 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向 - 关键特征:N端(氨基端)和C端(羧基端),肽链方向性 **2. 二级结构** **α螺旋**: - 每圈3.6个氨基酸残基,螺距5.4 Å - 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键 - 氢键大致平行于螺旋轴,稳定螺旋结构 - 氨基酸倾向性...

1. 一级结构
- 由20种常见氨基酸通过肽键连接形成线性多肽链
- 氨基酸侧链的理化性质(电荷、疏水性、极性)决定了蛋白质的折叠倾向
- 关键特征:N端(氨基端)和C端(羧基端),肽链方向性
2. 二级结构
α螺旋
- 每圈3.6个氨基酸残基,螺距5.4 Å
- 第i个残基的酰胺氢与第i+4个残基的羰基氧形成氢键
- 氢键大致平行于螺旋轴,稳定螺旋结构
- 氨基酸倾向性:Ala、Glu、Leu、Met偏好螺旋;Pro、Gly破坏螺旋
β折叠
- 由多条肽链片段或同一肽链的不同片段平行排列形成
- 链间氢键稳定:一条链的羰基氧与另一条链的酰胺氢形成氢键
- 平行式(N→C同向)和反平行式(N→C反向),反平行更稳定
- 氨基酸倾向性:Val、Ile、Phe偏好β折叠;Pro、Gly不利于β折叠
环区/转角(Loop/Turn)
- 连接二级结构元件的无规区域
- 通常位于蛋白质表面,暴露在溶剂中
- 高柔性和高多样性,常参与功能位点形成
3. 超二级结构(Supersecondary Structure)
- 两个或多个二级结构单元的组合模式
- 常见类型:α-α(螺旋-转角-螺旋)、β-α-β(Rossmann折叠)、β-发夹(β-hairpin)
4. 结构域(Domain)
- 独立折叠的球状单元,具有特定功能
- 结构域分类:全α(all-α)、全β(all-β)、α/β(交替)、α+β(分离)
- 多结构域蛋白质:不同结构域可以执行不同功能,通过柔性连接子连接
5. 三级结构
- 稳定三级结构的相互作用:
- 疏水作用:疏水残基埋藏在蛋白质内部(主要驱动力)
- 氢键:主链和侧链之间
- 离子键:带相反电荷的侧链之间
- 范德华力:所有原子之间的弱吸引力
- 二硫键:半胱氨酸残基之间的共价连接(稳定作用)
6. 四级结构
- 多个多肽链(亚基)通过非共价相互作用形成蛋白质复合物
- 亚基间相互作用:疏水界面、氢键、盐桥
- 别构效应:配体结合改变亚基间相互作用,调控蛋白质活性

查看详情 →
💡

二、蛋白质结构预测方法

concept

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测

查看详情 →
💡

三、蛋白质结构性质预测

concept

**1. 二级结构预测** **Q3准确率**:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。 **方法发展**: - 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60% - 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65% - 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多...

1. 二级结构预测
Q3准确率:预测为螺旋(H)、折叠(E)、无规卷曲(C)的残基中正确分类的比例。
方法发展
- 第一代(1960-1980):Chou-Fasman,基于单残基统计倾向,准确率<60%
- 第二代(1980-1992):GOR,基于信息论,考虑局部序列上下文,准确率<65%
- 第三代(1992-至今):PSIPRED、SPIDER2,基于神经网络+多序列比对,准确率>75-80%
- 深度学习:基于CNN/Transformer,准确率>85%
PSIPRED方法
1. PSI-BLAST搜索NR数据库,获得多序列比对(PSSM)
2. 将PSSM特征(20种氨基酸的频率)输入两层神经网络
3. 输出每个残基的三态概率(H/E/C)
2. 无序区预测(Intrinsically Disordered Region, IDR)
IDR特征
- 生理条件下不能形成稳定三维结构
- 人类蛋白质中约30-40%的残基处于无序区
- 功能:信号传导、转录调控、蛋白质相互作用枢纽
预测方法
- IUPred:基于能量估算(低相互作用能→无序)
- PONDR、DisEMBL:基于机器学习和神经网络
- SPOT-Disorder:基于深度学习,准确率>80%

查看详情 →
💡

四、功能蛋白质的从头设计

concept

**设计策略**: 1. **拓扑选择**:选择适合目标功能的蛋白质折叠类型 2. **骨架设计**:设计主链结构,满足目标约束(如配体结合口袋) 3. **序列优化**:使用能量函数和深度学习优化氨基酸序列 4. **实验验证**:表达纯化蛋白质,验证功能 **深度学习设计方法**: - **trRosetta**:基于Transformer的序列-结构联合生成 - **ProteinMPNN*...

设计策略
1. 拓扑选择:选择适合目标功能的蛋白质折叠类型
2. 骨架设计:设计主链结构,满足目标约束(如配体结合口袋)
3. 序列优化:使用能量函数和深度学习优化氨基酸序列
4. 实验验证:表达纯化蛋白质,验证功能
深度学习设计方法
- trRosetta:基于Transformer的序列-结构联合生成
- ProteinMPNN:基于图神经网络的序列设计
- RFdiffusion:基于扩散模型的蛋白质结构生成(2023, Baker Lab)
成功案例
- 2023年Baker Lab设计新型萤光素酶(LuxSit-i)
- 使用"family-wide hallucination"从NTF2超家族生成新结构
- 通过RIFGen/RIFDock设计与DTZ配体的结合口袋
- 设计的萤光素酶活性与天然酶相当,但结构完全不同

查看详情 →
💡

9.3 蛋白质分子动力学模拟

section
查看详情 →
💡

一、统计力学基础

concept

**1. 相空间和系综** 对于N个粒子组成的系统,经典动力学由6N个变量描述: - 位置:r₁(t), r₂(t), ..., rₙ(t) - 动量:p₁(t), p₂(t), ..., pₙ(t) 相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。 **系综类型**: - **NVT(正则系综)**:粒子数N、体积V、温度T恒定。通过热...

1. 相空间和系综
对于N个粒子组成的系统,经典动力学由6N个变量描述:
- 位置:r₁(t), r₂(t), ..., rₙ(t)
- 动量:p₁(t), p₂(t), ..., pₙ(t)
相空间:由这6N个变量定义的6N维空间,系统的每个状态对应相空间中的一个点,系统演化对应相空间中的一条轨迹。
系综类型
- NVT(正则系综):粒子数N、体积V、温度T恒定。通过热浴(thermostat)维持温度,如Nosé-Hoover、Langevin动力学。
- NPT(等温等压系综):粒子数N、压强P、温度T恒定。通过恒压器(barostat)调节体积,如Parrinello-Rahman、Berendsen。
- NVE(微正则系综):粒子数N、体积V、总能量E恒定。无热浴和恒压器,系统为孤立体系。
2. 自由能
Helmholtz自由能(F):适用于恒容体系(NVT)
$$F = U - TS$$
Gibbs自由能(G):适用于恒压体系(NPT),生物体系常用
$$G = H - TS = U + PV - TS$$
其中U为内能,T为温度,S为熵,H为焓,P为压强,V为体积。
自由能是系统做非体积功的最大能力。在恒温恒压下,自发过程总是朝着Gibbs自由能降低的方向进行(ΔG < 0)。
自由能面(Free Energy Landscape)
- 描述系统自由能随构象坐标变化的"地形图"
- 低能量区域(山谷)对应稳定构象(亚稳态)
- 高能量区域(山脊)对应过渡态
- 能垒高度决定构象转换的速率(Arrhenius方程)
自由能计算
- 直接计数法:ΔF = -k_B T ln(P_A / P_B),其中P_A和P_B为状态A和B的观测概率
- 缺点:对于高能量垒,罕见事件的采样需要极长时间

查看详情 →
💡

二、分子力场

concept

力场将总势能分解为键合项和非键合项: $$E_{total} = E_{bonded} + E_{nonbonded}$$ **1. 键合项(Bonded Terms)** **键长伸缩能**: $$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$ - 谐振子近似,K_r为力常数,r_eq为平衡键长 **键角弯曲能**: $$E_{angl...

力场将总势能分解为键合项和非键合项:
$$E_{total} = E_{bonded} + E_{nonbonded}$$
1. 键合项(Bonded Terms)
键长伸缩能
$$E_{bond} = \sum_{bonds} \frac{K_r}{2}(r - r_{eq})^2$$
- 谐振子近似,K_r为力常数,r_eq为平衡键长
键角弯曲能
$$E_{angle} = \sum_{angles} \frac{K_\theta}{2}(\theta - \theta_{eq})^2$$
- 谐振子近似,K_θ为力常数,θ_eq为平衡键角
二面角扭转能
$$E_{dihedral} = \sum_{dihedrals} \sum_{n} \frac{V_n}{2}[1 + \cos(n\phi - \gamma)]$$
- 傅里叶级数展开,V_n为势垒高度,n为周期性(旋转对称性),γ为相位偏移
2. 非键合项(Nonbonded Terms)
静电相互作用(Coulomb)
$$E_{electrostatic} = \sum_{i<j} \frac{q_i q_j}{4\pi\varepsilon_0 r_{ij}}$$
- q_i, q_j为原子电荷,r_ij为原子间距离
- 长程相互作用,通常使用截断(cutoff)或PME(Particle Mesh Ewald)方法处理
范德华相互作用(Lennard-Jones)
$$E_{vdW} = \sum_{i<j} \varepsilon_{ij}\left[\left(\frac{\sigma_{ij}}{r_{ij}}\right)^{12} - \left(\frac{\sigma_{ij}}{r_{ij}}\right)^6\right]$$
- ε_ij为势阱深度(相互作用强度)
- σ_ij为势能为0时的距离(原子"半径")
- r⁻¹²项:短程排斥(电子云重叠)
- r⁻⁶项:长程吸引(London色散力)
3. 常见力场
AMBER
- 开发:UC San Francisco (Peter Kollman, David Case)
- 特点:广泛用于蛋白质和核酸,参数基于量子化学计算和实验数据
- 版本:AMBER94/99/03/14/19, ff99SB-ILDN, ff14SB
- 优势:蛋白质力场准确,参数优化充分
CHARMM
- 开发:Harvard University (Martin Karplus)
- 特点:全面覆盖生物大分子(蛋白质、脂质、核酸、糖类)
- 版本:CHARMM22/27/36/36m
- 优势:脂质膜和膜蛋白模拟表现出色
OPLS-AA
- 开发:Jorgensen Lab (Yale University)
- 特点:液态模拟和蛋白质模拟兼顾
- 版本:OPLS-AA/L, OPLS3/3e
- 优势:有机小分子参数丰富
GROMOS
- 开发:van Gunsteren Lab (ETH Zurich)
- 特点: united-atom 表示(减少计算量)
- 版本:GROMOS43A1/53A5/54A7
- 优势:计算效率高,适用于大规模体系
力场选择原则
- 蛋白质模拟:AMBER ff14SB/ff19SB, CHARMM36m
- 膜蛋白模拟:CHARMM36, Slipids
- 小分子/药物设计:OPLS3/3e, GAFF2
- 大规模体系:GROMOS, MARTINI(粗粒化)

查看详情 →
💡

三、牛顿运动方程与积分算法

concept

**1. 牛顿运动方程** 对于每个原子i: $$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$ 其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。 **2. 有限差分积分算法** **Verlet算法**: $$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delt...

1. 牛顿运动方程
对于每个原子i:
$$F_i = m_i a_i = -\frac{\partial U}{\partial r_i}$$
其中F_i为受力,m_i为质量,a_i为加速度,U为势能函数,r_i为位置。
2. 有限差分积分算法
Verlet算法
$$r(t + \Delta t) = 2r(t) - r(t - \Delta t) + a(t)\Delta t^2$$
- 优点:时间可逆,能量守恒好
- 缺点:速度计算精度低
Velocity Verlet算法
$$v(t + \frac{\Delta t}{2}) = v(t) + \frac{a(t)\Delta t}{2}$$
$$r(t + \Delta t) = r(t) + v(t + \frac{\Delta t}{2})\Delta t$$
$$v(t + \Delta t) = v(t + \frac{\Delta t}{2}) + \frac{a(t + \Delta t)\Delta t}{2}$$
- 优点:同时更新位置和速度,精度高,稳定性好
- 是目前最常用的MD积分算法
时间步长选择
- 典型值:2 fs(飞秒,10⁻¹⁵秒)
- 限制因素:体系中最快运动(键长振动,C-H键约10⁻¹⁴秒周期)
- 约束算法(SHAKE/SETTLE/LINCS):固定键长,允许更大时间步长(2-4 fs)
3. 周期性边界条件(PBC)
- 模拟盒子(如立方体、十二面体、截角八面体)被其镜像复制填满整个空间
- 原子离开盒子一侧时,从另一侧进入(保持原子数恒定)
- 最小镜像约定:每个原子只与最近的镜像相互作用
- 目的:消除边界效应,模拟无限大体系
4. 长程相互作用处理
截断法(Cutoff)
- 只计算截断距离(如10-12 Å)内的非键相互作用
- 简单高效,但对于带电体系可能引入显著误差
Particle Mesh Ewald(PME)
- 将长程静电相互作用分解为实空间短程和倒空间长程两部分
- 实空间:截断范围内直接计算
- 倒空间:使用快速傅里叶变换(FFT)在网格上计算
- 优点:精度高(~10⁻⁵),效率合理
- 缺点:需要周期性边界条件

查看详情 →
💡

四、MD模拟流程

concept

**1. 体系准备** - 获取蛋白质结构(PDB下载或预测) - 检查结构完整性:缺失原子、残基、二硫键 - 添加氢原子(根据pH确定质子化状态) - 选择力场和溶剂模型(如TIP3P、SPC/E) - 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度) - 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI **2. 能量最小化** - 目的:消除不...

1. 体系准备
- 获取蛋白质结构(PDB下载或预测)
- 检查结构完整性:缺失原子、残基、二硫键
- 添加氢原子(根据pH确定质子化状态)
- 选择力场和溶剂模型(如TIP3P、SPC/E)
- 构建模拟盒子,添加溶剂分子和离子(中和体系,模拟生理盐浓度)
- 工具:LEaP(AMBER)、pdb2gmx(GROMACS)、CHARMM-GUI
2. 能量最小化
- 目的:消除不合理的原子接触和键长/键角畸变
- 算法:最陡下降法(Steepest Descent)→ 共轭梯度法(Conjugate Gradient)
- 判断标准:体系势能达到最小值,最大受力<1000 kJ/mol/nm
3. 平衡阶段
- NVT平衡:在恒定体积下升温至目标温度(如300K),温度耦合(如V-rescale)
- NPT平衡:在恒定温度和压强下平衡密度,压强耦合(如Parrinello-Rahman)
- 判断标准:温度、密度、能量、RMSD均达到稳定波动
- 典型时长:100 ps - 1 ns
4. 生产模拟(Production Run)
- 在平衡后的构象上开始长时间采样
- 记录轨迹(坐标、速度、能量等)
- 典型时长:100 ns - 10 μs(取决于体系和计算资源)
- 现代GPU加速:RTX 4090可达~100 ns/天(~50,000原子体系)
5. 轨迹分析
- 结构分析:RMSD、RMSF、回旋半径(Rg)
- 动力学分析:主成分分析(PCA)、自由能面构建
- 相互作用分析:氢键、盐桥、疏水接触、π-π堆积
- 工具:VMD、MDAnalysis、MDTraj、CPPTRAJ

查看详情 →
💡

五、增强采样方法

concept

**1. 伞形采样(Umbrella Sampling)** - 沿反应坐标(Collective Variable, CV)划分多个窗口 - 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]² - 将系统限制在特定CV范围内采样 - 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面 - 适用:...

1. 伞形采样(Umbrella Sampling)
- 沿反应坐标(Collective Variable, CV)划分多个窗口
- 在每个窗口中添加谐振偏置势:ω_i(x) = 0.5k[s(x) - s_i^ref]²
- 将系统限制在特定CV范围内采样
- 使用WHAM(Weighted Histogram Analysis Method)整合所有窗口,重建无偏自由能面
- 适用:已知反应路径,计算自由能面
2. 副本交换分子动力学(REMD)
- 并行运行多个不同温度的副本(如300K, 310K, 320K, ...)
- 定期尝试交换相邻副本的构象(按Metropolis准则)
- 高温副本探索高能量构象,交换到低温副本中
- 适用:构象搜索、折叠/去折叠研究
- 缺点:副本数随体系自由度增加,计算成本高
3. 元动力学(Metadynamics)
- 在CV空间上不断添加高斯偏置势(负反馈机制)
- 高斯势累积"填平"势能阱,促进系统逃离局部最小值
- 适用:未知反应路径,自动探索自由能面
- 变种:Well-Tempered Metadynamics(WTMetaD)、Adaptive Bias Force(ABF)
4. 其他方法
- Steered MD(SMD):施加外力驱动系统沿特定方向运动
- Gaussian Accelerated MD(GaMD): boost 势能促进低能量区域的采样
- REST2(Replica Exchange with Solute Tempering):仅增强溶质温度,降低计算成本

查看详情 →
💡

六、粗粒化模拟

concept

**MARTINI力场**: - 将4个重原子映射为1个珠子(bead) - 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水) - 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍 - 应用:膜蛋白、脂质体、大分子复合物组装 - 局限:丧失原子细节,不适合研究化学键形成/断裂

MARTINI力场
- 将4个重原子映射为1个珠子(bead)
- 四大类珠子:Q(带电)、P(极性)、N(非极性)、C(疏水)
- 优势:时间步长可达20-40 fs,体系扩大100倍,时间尺度扩大1000倍
- 应用:膜蛋白、脂质体、大分子复合物组装
- 局限:丧失原子细节,不适合研究化学键形成/断裂

查看详情 →
💡

9.4 蛋白质功能预测与分析

section
查看详情 →
💡

一、蛋白质功能概述

concept

**1. 蛋白质功能的层次性** 蛋白质功能具有复杂性和多层次性: - **分子功能**:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活) - **生物过程**:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路) - **细胞组分**:蛋白质所在的细胞位置(如细胞核、线粒体、膜) 同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行...

1. 蛋白质功能的层次性
蛋白质功能具有复杂性和多层次性:
- 分子功能:蛋白质执行的生化活动(如激酶活性、DNA结合、转录激活)
- 生物过程:蛋白质参与的细胞或生物体层面的过程(如细胞分裂、凋亡、代谢通路)
- 细胞组分:蛋白质所在的细胞位置(如细胞核、线粒体、膜)
同一蛋白质可能具有多种功能(多功能性,pleiotropy),而同一功能可能由多个蛋白质共同执行(冗余性)。
2. GO注释系统
GO采用有向无环图(DAG)结构组织术语:
- 每个术语(GO term)有唯一ID(如GO:0004672,蛋白激酶活性)
- 术语之间存在"is_a"和"part_of"关系
- 从根节点到叶节点的路径表示功能的特异性递增
GO注释证据代码
- EXP:实验验证
- IDA:直接实验测定
- IPI:蛋白质相互作用
- ISS:序列相似性推断
- IEA:自动电子注释
- ...(共约15种证据代码)
3. CAFA竞赛
- 2010年首次举办,之后每2-3年一次
- 使用未公开蛋白质序列作为测试集
- 评估指标:Fmax(F-measure最大值)、Smin(语义距离最小值)、AUPR(精确率-召回率曲线下面积)
- 推动了功能预测方法的发展,特别是整合多源信息的方法

查看详情 →
💡

二、基于序列的功能分析

concept

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区

查看详情 →
💡

三、基于结构的功能分析

concept

**1. 基于结构相似性的功能预测** **原理**:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。 **结构比对工具**: - **DALI**:基于分子内距离矩阵的比较 - **TM-align**:基于TM-score的结构相似性度量 - **FATCAT**:允许柔性旋转的结构比对 **结构比对评估**: - **RMSD(Root Mean Square Deviation)*...

1. 基于结构相似性的功能预测
原理:结构相似的蛋白质通常具有相似的功能,即使序列相似度很低。
结构比对工具
- DALI:基于分子内距离矩阵的比较
- TM-align:基于TM-score的结构相似性度量
- FATCAT:允许柔性旋转的结构比对
结构比对评估
- RMSD(Root Mean Square Deviation):结构叠合后的原子坐标偏差,<2Å为高度相似
- TM-score(Template Modeling Score):0-1之间,>0.5表示相同折叠,>0.9表示高度相似
- GDT_TS:与CASP评估类似,用于结构相似性度量
2. 基于结构的功能预测工具
ProFunc
- 整合多种序列和结构分析方法
- 包括序列同源性搜索、结构相似性搜索、残基保守性分析、表面分析等
- 输出综合功能注释
COFACTOR
- 基于结构比对的功能注释系统
- 将待测蛋白结构比对到已知功能模板库
- 预测配体结合位点、酶学分类(EC号)、GO注释
3. 基于分子对接的功能分析
分子对接原理
- 搜索配体在受体结合口袋中的最佳位置和取向
- 评估结合模式的亲和力(打分函数)
- 预测配体-受体相互作用
对接类型
- 刚性对接:受体和配体构象均固定,适用于大分子对接(如蛋白质-蛋白质)
- 半柔性对接:配体构象可变化,受体固定,适用于小分子-蛋白质对接
- 柔性对接:受体和配体构象均可变化,精度高但计算成本高
对接流程
1. 受体准备:从PDB获取结构,添加氢原子,确定质子化状态,定义结合口袋
2. 配体准备:生成3D构象,添加电荷,确定可旋转键
3. 构象搜索:系统搜索、遗传算法、蒙特卡罗模拟等方法
4. 打分评估:基于力场、经验公式或知识的打分函数
5. 结果分析:聚类相似构象,选择最佳结合模式
常用对接软件
- AutoDock Vina:快速开源对接软件,基于经验打分函数
- GOLD:商业软件,基于遗传算法,高精度
- Glide:Schrödinger软件包,基于网格搜索
- rDOCK:基于力场的对接和打分
虚拟筛选(Virtual Screening)
- 将大型化合物库(如数百万分子)与靶蛋白对接
- 筛选结合打分最高的候选化合物
- 用于药物发现的早期阶段,大幅降低实验筛选成本
4. 结合自由能计算
MM-PBSA/MM-GBSA
- 基于分子力学和泊松-玻尔兹曼/广义Born溶剂化模型
- 计算结合自由能:ΔG_bind = ΔH - TΔS ≈ ΔE_MM + ΔG_solvation - TΔS
- 适用于快速估算相对结合亲和力
自由能微扰(FEP)
- 通过一系列"炼金术"变换(逐渐改变配体A为配体B)计算相对结合自由能
- 精度高(<1 kcal/mol),但计算成本高
- 适用于先导化合物优化
热力学积分(TI)
- 类似FEP,但使用积分而非微扰计算自由能差
- 适用于化学变化较大的体系

查看详情 →
💡

四、基于网络的蛋白质功能分析

concept

**1. 蛋白质相互作用网络(PPI Network)** PPI网络以蛋白质为节点,相互作用为边。 - 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘 - 数据库:STRING、BioGRID、IntAct、MINT **2. 基于邻域的方法(Neighborhood Method)** **邻居计数法**: - 将邻居节点中最频繁的功能分配给目标蛋白 - 简单直接,但忽略...

1. 蛋白质相互作用网络(PPI Network)
PPI网络以蛋白质为节点,相互作用为边。
- 数据来源:酵母双杂交(Y2H)、Co-IP/质谱、亲和纯化、文献挖掘
- 数据库:STRING、BioGRID、IntAct、MINT
2. 基于邻域的方法(Neighborhood Method)
邻居计数法
- 将邻居节点中最频繁的功能分配给目标蛋白
- 简单直接,但忽略了功能频率差异
χ²检验法
- 使用χ²检验或Fisher精确检验确定邻居中显著富集的功能
- 仅将显著富集的功能分配给目标蛋白
- 比简单计数法更可靠
邻居扩展法
- 将邻居扩展到一阶邻居的近邻
- 扩大功能信息来源,但可能引入噪声
3. 基于全局网络拓扑的方法
马尔可夫随机场(MRF)
- 建模网络中节点功能的依赖关系
- 利用Gibbs采样或变分推断进行概率推断
- 考虑全局网络结构,而不仅是局部邻居
4. 基于模块划分的方法
模块识别
- 识别网络中紧密连接的节点群(社区/模块)
- 同一模块内的蛋白质倾向于参与同一生物过程
常用算法
- MCL(Markov Cluster Algorithm):基于随机游走的扩展和膨胀操作
- Louvain算法:基于模块度优化的贪心算法
- RWR(Random Walk with Restart):从种子节点出发,通过重启随机游走量化节点关联性
- 谱聚类:基于图拉普拉斯矩阵的特征向量聚类
模块识别后的功能注释
- 将模块内已知功能直接分配给未知蛋白
- 使用χ²检验或Fisher精确检验对模块内功能进行富集分析
- 结合机器学习模型,利用网络拓扑特征预测功能
5. 基于网络整合的方法
GeneMANIA
- 整合多种网络(PPI、基因共表达、遗传相互作用、通路共享)
- 使用线性回归学习每个网络的权重
- 构建加权整合网络,使用标签传播算法预测功能
GAIN(Graphical Association Network)
- 基于贝叶斯网络的方法
- 将每个网络视为独立证据
- 使用条件概率和贝叶斯规则整合证据,推断功能概率
6. 基于深度学习的网络方法
DeepWalk
- 通过随机游走生成节点序列
- 使用Skip-gram模型学习节点嵌入(低维向量表示)
- 嵌入向量保留网络拓扑信息
DeepGO
- 整合DeepWalk网络特征和序列特征(3-mer编码+1D CNN)
- 分层神经网络预测GO功能,保持GO层次关系
图卷积网络(GCN)
- 直接对图结构进行卷积操作
- 每个节点的特征由邻居节点聚合得到
- DeepGraphGO:构建多物种PPI网络,使用GCN提取特征,整合序列特征预测功能

查看详情 →
💡

9.5 代谢组学

section
查看详情 →
💡

一、代谢组学技术平台

concept

**1. 核磁共振(NMR)** **原理**: - 利用原子核(主要是¹H)在磁场中的共振吸收特性 - 不同化学环境的氢原子具有不同的化学位移 - 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构 **优点**: - 非破坏性,样本可重复使用 - 无需色谱分离,样品制备简单 - 定量准确,重现性高 - 可检测所有含氢代谢物(无偏向性) **缺点**: - 灵敏度低...

1. 核磁共振(NMR)
原理
- 利用原子核(主要是¹H)在磁场中的共振吸收特性
- 不同化学环境的氢原子具有不同的化学位移
- 通过一维(¹H-NMR)和二维(COSY、HSQC、HMBC)谱图解析代谢物结构
优点
- 非破坏性,样本可重复使用
- 无需色谱分离,样品制备简单
- 定量准确,重现性高
- 可检测所有含氢代谢物(无偏向性)
缺点
- 灵敏度低(比MS低3-5个数量级)
- 分辨率有限,复杂样本谱图重叠严重
- 难以检测低丰度代谢物
应用
- 体液代谢组学(尿液、血液)
- 样本非常珍贵的情况(需要后续其他分析)
- 实时动态监测(如流动注射NMR)
2. 液相色谱-质谱联用(LC-MS)
原理
- 液相色谱(LC):根据代谢物在固定相和流动相之间的分配系数差异进行分离
- 反相色谱(RP-C18):分离非极性/中等极性代谢物(如脂质、脂肪酸)
- 亲水作用色谱(HILIC):分离极性代谢物(如氨基酸、糖类、核苷酸)
- 质谱(MS):LC洗脱的代谢物经ESI离子化,进入质谱仪检测
- 高分辨质谱(HRMS):Orbitrap、Q-TOF,精确分子量<5 ppm
- 串联质谱(MS/MS):提供碎片信息,用于结构鉴定
优点
- 灵敏度高(fmol-pmol级别)
- 覆盖范围广(可同时检测数千种代谢物)
- 分辨率高,可区分同分异构体
缺点
- 离子化效率差异导致定量偏差
- 基质效应(matrix effect):复杂样本中共同洗脱物质抑制或增强信号
- 样本制备要求高
3. 气相色谱-质谱联用(GC-MS)
原理
- 气相色谱(GC):样本气化后,在色谱柱中根据沸点和极性分离
- 质谱(MS):EI(电子轰击)电离,产生特征性碎片谱图
- 数据库:NIST/EPA/NIH Mass Spectral Library(超过250,000张标准谱图)
优点
- 重现性极高,保留时间稳定
- 有完善的EI谱图数据库,便于鉴定
- 定量准确(使用内标法)
缺点
- 需要样本衍生化(硅烷化、甲基化),增加样品制备复杂度
- 只能检测热稳定和挥发性代谢物(分子量<500 Da)
- 不适用于大分子、极性代谢物
应用
- 植物代谢组学(挥发性代谢物丰富)
- 脂肪酸分析
- 氨基酸和有机酸分析(衍生化后)
4. 其他技术
CE-MS(毛细管电泳-质谱)
- 分离原理:基于电荷/质量比的电泳迁移
- 优势:分离效率高,适合极性代谢物和离子型代谢物
- 应用:氨基酸、有机酸、核苷酸分析
MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 原理:在组织切片上直接进行质谱分析,获得代谢物的空间分布
- 应用:肿瘤代谢异质性、药物组织分布
5. 技术选择策略
| 样本类型 | 推荐技术 | 理由 |
|----------|----------|------|
| 血清/血浆 | LC-MS (RP + HILIC) | 覆盖极性和非极性代谢物 |
| 尿液 | NMR或LC-MS | NMR定量准确,LC-MS灵敏度高 |
| 组织 | LC-MS或GC-MS | 根据目标代谢物类型选择 |
| 植物提取物 | GC-MS + LC-MS | 挥发性用GC-MS,极性用LC-MS |
| 脂质组学 | LC-MS (RP-C18) | 反相色谱分离脂质效果好 |
| 单细胞 | LC-MS (高灵敏) | 需要极低样本量 |

查看详情 →
💡

二、代谢组学实验设计

concept

**1. 样本收集与制备** **样本类型**: - 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁 - 组织样本:肝脏、肌肉、肿瘤、脑组织 - 细胞样本:培养细胞、原代细胞 - 其他:粪便、肠道内容物、发酵液 **质控样本**: - **QC样本(Quality Control)**:混合等量的所有实验样本,用于监测系统稳定性和数据质量 - **空白样本**:溶剂空白,评估背景污染 - **标准...

1. 样本收集与制备
样本类型
- 生物体液:血清、血浆、尿液、唾液、脑脊液、胆汁
- 组织样本:肝脏、肌肉、肿瘤、脑组织
- 细胞样本:培养细胞、原代细胞
- 其他:粪便、肠道内容物、发酵液
质控样本
- QC样本(Quality Control):混合等量的所有实验样本,用于监测系统稳定性和数据质量
- 空白样本:溶剂空白,评估背景污染
- 标准品:已知浓度的代谢物混合物,用于方法验证
样本制备
- 蛋白质沉淀:甲醇/乙腈/氯仿提取,去除大分子
- 脂质去除:如需分析极性代谢物,使用正己烷或氯仿去除脂质
- 衍生化:GC-MS需要硅烷化(BSTFA+TMCS)或甲基化
- 注意:不同代谢物类别需要不同的提取方法,没有"一刀切"的最佳方案
2. 仪器分析
色谱条件优化
- 色谱柱选择:C18(反相)、HILIC(亲水)、T3(混合模式)
- 流动相:水/乙腈或水/甲醇,含0.1%甲酸或5mM乙酸铵
- 梯度洗脱:从低有机相到高有机相,洗脱不同极性的代谢物
- 流速:200-400 μL/min(nano-LC更低)
质谱参数
- 离子源:ESI+(正离子模式,检测碱性代谢物如氨基酸、胺类)和ESI-(负离子模式,检测酸性代谢物如脂肪酸、有机酸)
- 采集模式:Full scan(全扫描)+ DDA(数据依赖MS/MS)或DIA(全离子碎片)
- 分辨率:Orbitrap 60,000-120,000(Full scan),15,000-30,000(MS/MS)
- 扫描范围:m/z 50-1000(或更宽)
3. 数据质量监控
QC样本分析
- 每5-10个样本插入一个QC样本
- 监测保留时间漂移、信号强度变化、峰形变化
- 评估标准:QC中代谢物峰的RSD(相对标准偏差)<20%(或30%)
批次效应评估
- PCA分析:检查QC样本是否聚类,样本是否按批次聚集
- 如果样本按批次分离,说明存在显著批次效应,需要校正

查看详情 →
💡

三、代谢组学数据处理

concept

**1. 数据预处理** **峰提取和比对**: - 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer - 步骤: 1. 峰检测:识别色谱峰(保留时间、质荷比、强度) 2. 峰对齐:校正不同样本间的保留时间漂移 3. 峰分组:将不同样本中对应的峰归为同一代谢物特征 4. 填补缺失值:处理零值或缺失值 **缺失值处理**: - 缺失原因:代谢物低于...

1. 数据预处理
峰提取和比对
- 软件:XCMS、MZmine、MS-DIAL、Compound Discoverer
- 步骤:
1. 峰检测:识别色谱峰(保留时间、质荷比、强度)
2. 峰对齐:校正不同样本间的保留时间漂移
3. 峰分组:将不同样本中对应的峰归为同一代谢物特征
4. 填补缺失值:处理零值或缺失值
缺失值处理
- 缺失原因:代谢物低于检测限、色谱峰未检测到
- 方法:
- 低于检测限(LOD):用LOD的一半或最小值的一半填补
- 随机缺失:KNN填补、随机森林填补
- 注意:如果缺失比例>50%,该代谢物通常被剔除
数据归一化
- 目的:消除样本间总体差异(如取样量、稀释差异)
- 方法:
- 总离子流归一化(TIC):每个样本的总信号归一化为相同值
- 概率商归一化(PQN):基于QC样本的统计分布
- 分位数归一化(Quantile normalization):使所有样本的信号分布相同
- 内标归一化:使用加入样本的内标物信号校正
数据转换
- 对数变换(log transformation):降低数据偏度,使分布更接近正态
- 平方根变换:适用于计数数据
- 目的:满足后续统计分析的假设(如正态分布、方差齐性)
数据缩放
- 自相关缩放(Auto-scaling/UV-scaling):每个代谢物减去均值,除以标准差
- Pareto缩放:除以标准差的平方根,保留较大差异的信息
- 目的:使高丰度和低丰度代谢物在分析中具有同等权重
2. 代谢物鉴定
鉴定层次(MSI, Metabolomics Standards Initiative)
- Level 1:与标准品在相同条件下比对(保留时间、精确质量、MS/MS谱一致)
- Level 2:与公共数据库匹配(HMDB、METLIN、MassBank)
- Level 3:基于精确质量和MS/MS谱推断的候选物
- Level 4:仅知道精确质量,未知身份
数据库匹配
- 精确质量匹配:质量误差<5 ppm(HRMS)或<50 ppm(LRMS)
- 同位素模式匹配:确认元素组成
- MS/MS谱图匹配:与数据库标准谱图比对(如METLIN、MassBank、GNPS)
- 保留时间预测:使用RT预测模型(如RIKEN Retention Time Calculator)
数据库
- HMDB(Human Metabolome Database):人类代谢物综合数据库,>114,000个代谢物
- METLIN:MS/MS谱图数据库,>250,000个代谢物
- KEGG:代谢通路和化合物数据库
- MassBank:高质量质谱数据库
- LipidMaps:脂质专用数据库
- CheBI:化学本体数据库
3. 统计分析
单变量分析
- t检验/ANOVA:比较两组或多组间的代谢物差异
- fold change(FC):差异倍数,通常|FC|>1.5或2为显著
- 火山图:同时展示FC和p-value,直观识别差异代谢物
多变量分析
- PCA(主成分分析):无监督降维,观察样本整体分布和聚类
- PLS-DA(偏最小二乘判别分析):有监督降维,最大化组间差异
- OPLS-DA(正交偏最小二乘判别分析):PLS-DA的改进版,分离预测变异和正交变异
- VIP(Variable Importance in Projection)得分:识别对组间区分贡献最大的代谢物
机器学习
- 随机森林、SVM、神经网络:用于分类和生物标志物发现
- 交叉验证:评估模型泛化能力
- ROC曲线:评估分类性能

查看详情 →
💡

四、代谢通路分析

concept

**1. 过表征分析(ORA, Over-Representation Analysis)** **原理**: - 输入:差异代谢物列表 - 背景:所有检测到的代谢物 - 方法:Fisher精确检验或超几何检验 - 输出:显著富集的代谢通路(p < 0.05) **局限性**: - 忽略代谢物变化方向(上调/下调) - 忽略代谢物丰度变化幅度 - 假设通路独立,忽略通路间交互 **2. 通路拓扑分...

1. 过表征分析(ORA, Over-Representation Analysis)
原理
- 输入:差异代谢物列表
- 背景:所有检测到的代谢物
- 方法:Fisher精确检验或超几何检验
- 输出:显著富集的代谢通路(p < 0.05)
局限性
- 忽略代谢物变化方向(上调/下调)
- 忽略代谢物丰度变化幅度
- 假设通路独立,忽略通路间交互
2. 通路拓扑分析(PT, Pathway Topology)
原理
- 考虑代谢通路中的拓扑结构(代谢物连接度、位置重要性)
- 中心代谢物(如ATP、NADH)在通路中的权重更高
- 方法:Impact Factor、Node Importance
软件
- MetaboAnalyst:综合代谢组学分析平台,支持ORA、PT、联合分析
- MetPA(Metabolic Pathway Analysis):基于通路拓扑的富集分析
- KEGG Mapper:基于KEGG通路的可视化分析
3. 整合通路分析
MSEA(Metabolite Set Enrichment Analysis)
- 类似GSEA,不需要预设差异代谢物阈值
- 输入:所有代谢物的排序列表(如按|logFC|排序)
- 评估预定义代谢物集合(如通路)是否集中在排序列表的顶端或底端
联合通路分析
- 整合ORA和拓扑分析的结果
- 结合代谢物变化方向和幅度
- 更全面地解释通路调控状态

查看详情 →
💡

五、代谢组学应用实例

concept

**1. 疾病生物标志物发现** **策略**: - 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照) - 验证阶段:靶向代谢组学,在独立队列中验证候选标志物 - 临床转化:开发检测试剂盒,进行临床试验 **成功案例**: - **前列腺癌**: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009) - **心血管疾病**: TMAO(氧化三甲胺)作为心血管风险标志...

1. 疾病生物标志物发现
策略
- 发现阶段:非靶向代谢组学,比较大样本队列(病例 vs. 对照)
- 验证阶段:靶向代谢组学,在独立队列中验证候选标志物
- 临床转化:开发检测试剂盒,进行临床试验
成功案例
- 前列腺癌: sarcosine(肌氨酸)作为尿液标志物(Nature, 2009)
- 心血管疾病: TMAO(氧化三甲胺)作为心血管风险标志物(NEJM, 2013)
- 糖尿病: 支链氨基酸(BCAA)与胰岛素抵抗相关
2. 药物代谢和药代动力学
研究内容
- 药物代谢产物鉴定(I相和II相代谢)
- 药物-药物相互作用(代谢酶竞争)
- 个体化给药(基于代谢酶基因型)
3. 营养代谢和精准营养
研究内容
- 食物代谢物分析(如多酚、维生素、脂肪酸)
- 个体代谢反应差异( responder vs. non-responder)
- 肠道菌群代谢物(短链脂肪酸、吲哚衍生物)
4. 环境代谢组学
研究内容
- 污染物暴露的代谢效应
- 生物标志物监测(如重金属、农药)
- 生态毒性评估

查看详情 →
💡

六、多组学整合

concept

**代谢组学与其他组学的整合**: **基因组+代谢组**: - 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL) - 识别代谢酶的遗传变异对代谢物水平的影响 **转录组+代谢组**: - 整合基因表达和代谢物水平,构建代谢调控网络 - 识别限速酶和调控节点 **蛋白质组+代谢组**: - 同时检测酶蛋白水平和代谢物水平 - 验证代谢通路的活性状态 **微生物组+代谢组*...

代谢组学与其他组学的整合
基因组+代谢组
- 全基因组关联分析(mGWAS):代谢物作为表型,发现代谢QTL(mQTL)
- 识别代谢酶的遗传变异对代谢物水平的影响
转录组+代谢组
- 整合基因表达和代谢物水平,构建代谢调控网络
- 识别限速酶和调控节点
蛋白质组+代谢组
- 同时检测酶蛋白水平和代谢物水平
- 验证代谢通路的活性状态
微生物组+代谢组
- 肠道菌群16S/宏基因组 + 粪便/血清代谢组
- 揭示菌群-宿主代谢互作(如SCFA产生、胆汁酸代谢)
整合方法
- 相关性网络:计算代谢物与基因/蛋白质之间的Pearson/Spearman相关性
- 联合通路分析:如IMPaLA、iPEA
- 多组学因子分析(MOFA):识别跨组学的共享变异源
- 机器学习整合:使用多组学特征构建预测模型

查看详情 →
💡

9.6 蛋白质组学和代谢组学的总结与展望

section
查看详情 →
💡

一、蛋白质组学的最新进展

concept

**1. 单细胞蛋白质组学** **技术挑战**: - 单个哺乳动物细胞仅含约100-200 pg蛋白质 - 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级) - 需要极低体积的样本处理(微升级)和超灵敏的质谱检测 **技术突破**: - **SCoPE-MS(2018)**: - 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号 -...

1. 单细胞蛋白质组学
技术挑战
- 单个哺乳动物细胞仅含约100-200 pg蛋白质
- 质谱检测需要约0.1-1 ng蛋白质(比单细胞高3个数量级)
- 需要极低体积的样本处理(微升级)和超灵敏的质谱检测
技术突破
- SCoPE-MS(2018)
- 使用TMT标记的载体通道(carrier channel,约200个细胞)提供足够的离子信号
- 单个细胞通过独立的通道标记,与载体通道混合后进入质谱
- 实现单个细胞的蛋白质定量(~1,000-3,000个蛋白质)
- SCoPE2(2021)
- 改进样本处理和色谱分离
- 提高定量准确性(比率压缩校正)
- 检测深度提升至~5,000个蛋白质/单细胞
- DIA单细胞蛋白质组学
- 使用timsTOF Pro(离子淌度分离)和DIA模式
- 无需TMT标记,减少比率压缩
- 检测深度~2,000-4,000个蛋白质/单细胞
应用
- 肿瘤异质性:鉴定稀有耐药细胞亚群
- 免疫细胞图谱:揭示不同免疫细胞亚型的蛋白质特征
- 发育生物学:追踪细胞分化过程中的蛋白质动态变化
2. 空间蛋白质组学
技术方法
- LCM-MS(激光显微切割-质谱)
- 使用激光切取特定组织区域(20-100 μm,约5-10个细胞)
- 超微量蛋白质提取和酶解
- 高灵敏质谱分析
- 应用:肿瘤微环境区域分析、组织异质性研究
- 深度视觉蛋白质组学(DVP, 2022)
- 免疫荧光成像识别目标细胞类型
- LCM精确切割目标细胞
- 超灵敏质谱分析(>5,000个蛋白质)
- 在FFPE样本中实现单细胞分辨率的蛋白质组分析
- MALDI-MSI(基质辅助激光解吸电离质谱成像)
- 在组织切片上直接进行质谱分析
- 空间分辨率:10-50 μm
- 可以同时获得数千个蛋白质和代谢物的空间分布
- 应用:肿瘤边界分析、药物分布研究
3. 人工智能驱动的蛋白质组学
蛋白质语言模型
- ESM-2(Meta AI, 2022)
- 基于15亿参数Transformer,在UniRef数据库上预训练
- 从单序列提取进化信息(无需MSA搜索)
- ESMFold结构预测速度比AlphaFold2快60倍
- 应用:宏基因组蛋白质结构预测、蛋白质表示学习
- ProtTrans(2021)
- 在3930亿氨基酸上训练的Transformer模型
- 学习蛋白质的语义表示
- 用于蛋白质分类、定位预测和功能注释
AI在质谱数据分析中的应用
- 肽段从头测序(De novo sequencing)
- 传统方法:基于图的动态规划(如PEAKS、Novor)
- AI方法:使用深度学习(CNN、LSTM、Transformer)直接预测序列
- 优势:可以鉴定数据库中不存在的肽段(如未知剪接变体、新抗原)
- DIA谱图解析
- 传统方法:依赖谱图库匹配
- AI方法:使用深度学习预测肽段的MS/MS谱图,构建"预测谱图库"
- 提高DIA数据分析的覆盖度和灵敏度
- 蛋白质定量优化
- 使用深度学习模型校正批次效应和技术噪声
- 提高低丰度蛋白质的定量准确性

查看详情 →
💡

二、代谢组学的最新进展

concept

**1. 单细胞代谢组学** **技术挑战**: - 代谢物比蛋白质更不稳定(半衰期从秒到分钟) - 单细胞代谢物总量极低(fg-pg级别) - 样本处理过程中的代谢物变化难以控制 **技术方法**: - **SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)**: - 使用代谢抑制剂处理细胞 - 通过抗...

1. 单细胞代谢组学
技术挑战
- 代谢物比蛋白质更不稳定(半衰期从秒到分钟)
- 单细胞代谢物总量极低(fg-pg级别)
- 样本处理过程中的代谢物变化难以控制
技术方法
- SCENITH(Single Cell Energy metabolism analysis by mass spectrometry)
- 使用代谢抑制剂处理细胞
- 通过抗体检测代谢标志物(如ATP、NADH)
- 间接反映单细胞代谢状态
- Live-seq
- 使用微流控技术提取单细胞细胞质
- 结合质谱分析代谢物
- 实现活细胞代谢组分析
- 空间代谢组学(MALDI-MSI)
- 分辨率提升至5-10 μm(接近单细胞)
- 可以同时获得数百个代谢物的空间分布
- 应用:肿瘤代谢异质性、神经递质分布
2. 人工智能驱动的代谢组学
代谢物鉴定
- 基于深度学习的MS/MS谱图预测
- 使用生成模型(如变分自编码器、GAN)预测未知代谢物的MS/MS谱图
- 与实验谱图匹配,提高鉴定成功率
- MassGenie(2022)
- 基于Transformer框架,探索数百万种碎片模式
- 从质谱数据中识别小分子的能力前所未有
生物标志物发现
- 使用深度学习(CNN、LSTM、GNN)整合多组学数据
- 发现传统统计方法难以识别的复杂生物标志物模式
- 稳定识别算法:基于SVM和递归特征消除,提高代谢组学生物标志物的稳定性
通路分析
- 使用图神经网络(GNN)建模代谢网络
- 预测代谢通路的活性状态和扰动响应
- 整合基因表达和代谢物数据,构建动态代谢模型
3. 代谢组学数据库和标准化
数据库发展
- HMDB 5.0:超过220,000个代谢物条目,包含更多脂质和次级代谢物
- GNPS(Global Natural Products Social Molecular Networking)
- 代谢组学社区平台,支持MS/MS数据共享和协作注释
- 分子网络(molecular networking):基于MS/MS谱图相似性构建代谢物关系网络
- METLIN:超过250,000个代谢物,包含广泛的MS/MS数据
标准化进展
- 代谢组学数据标准(MSI):代谢物鉴定层次标准化
- 代谢组学报告标准(METABOLIGHTS):实验元数据记录
- 质谱数据格式标准化:mzML、mzXML通用格式

查看详情 →
💡

三、多组学整合与精准医学

concept

**1. 多组学整合策略** **数据层面整合**: - 使用MOFA+、iCluster、SNF等统计方法整合多组学数据 - 识别跨组学的共享因子(如疾病状态、批次效应) - 发现单一组学无法检测的调控关系 **知识层面整合**: - 构建多组学调控网络:基因→RNA→蛋白质→代谢物 - 使用贝叶斯网络、因果推断模型推断调控关系 - 整合通路数据库(KEGG、Reactome、Wikipathw...

1. 多组学整合策略
数据层面整合
- 使用MOFA+、iCluster、SNF等统计方法整合多组学数据
- 识别跨组学的共享因子(如疾病状态、批次效应)
- 发现单一组学无法检测的调控关系
知识层面整合
- 构建多组学调控网络:基因→RNA→蛋白质→代谢物
- 使用贝叶斯网络、因果推断模型推断调控关系
- 整合通路数据库(KEGG、Reactome、Wikipathways)进行系统解释
应用案例
- 癌症分子分型
- 整合基因组(突变、CNV)、转录组、蛋白质组和代谢组数据
- 识别新的癌症亚型,指导精准治疗
- 例如:CPTAC(Clinical Proteomic Tumor Analysis Consortium)对多种癌症进行多组学分析
- 疾病机制研究
- 整合GWAS、转录组、蛋白质组和代谢组,构建从基因变异到表型的因果链
- 识别关键调控节点和潜在药物靶点
- 药物反应预测
- 整合多组学数据预测患者对特定药物的反应
- 指导个体化用药(如化疗药物选择、免疫治疗响应预测)
2. 精准医学中的应用
疾病早期诊断
- 蛋白质/代谢标志物panel用于癌症早筛(如多癌种早期检测MCED)
- 液体活检:血液蛋白质组和代谢组分析
治疗靶点发现
- 多组学整合识别疾病驱动因素
- 蛋白质结构预测(AlphaFold)加速靶点结构解析和药物设计
患者分层
- 基于蛋白质组/代谢组特征对患者进行分层
- 预测治疗响应和预后
伴随诊断
- 蛋白质/代谢标志物指导靶向药物使用
- 监测治疗过程中的动态变化,评估疗效

查看详情 →
💡

四、未来展望

concept

**1. 技术发展趋势** **更高灵敏度**: - 单细胞蛋白质组学检测深度向10,000+蛋白质迈进 - 单细胞代谢组学实现真正的代谢物定量 **更高通量**: - 样本处理自动化(液体处理机器人) - 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral) - 每天可处理数百个样本 **更高维度**: - 空间组学:从组织水平到单细胞水平的空间分辨率 - 时间维度:动态监测...

1. 技术发展趋势
更高灵敏度
- 单细胞蛋白质组学检测深度向10,000+蛋白质迈进
- 单细胞代谢组学实现真正的代谢物定量
更高通量
- 样本处理自动化(液体处理机器人)
- 质谱仪扫描速度持续提升(timsTOF、Orbitrap Astral)
- 每天可处理数百个样本
更高维度
- 空间组学:从组织水平到单细胞水平的空间分辨率
- 时间维度:动态监测蛋白质/代谢物变化
- 多模态:同时测量蛋白质、代谢物、脂质和翻译后修饰
2. 计算方法发展趋势
AI驱动的全面革新
- 蛋白质语言模型:从结构预测到功能预测、蛋白质设计
- 深度学习质谱分析:从头测序、DIA解析、定量优化
- 生成式AI(如蛋白质扩散模型)用于从头设计蛋白质和代谢酶
多组学整合方法
- 从简单的相关性分析到因果推断
- 从静态网络到动态网络模型
- 从描述性分析到预测性模型
知识图谱
- 构建整合基因组、蛋白质组、代谢组、疾病和药物的全面知识图谱
- 使用图神经网络进行推理和预测
- 支持药物重定位和靶点发现
3. 挑战与机遇
挑战
- 数据标准化和共享:不同实验室、不同平台的数据难以直接比较
- 批次效应:大规模队列研究中的技术变异
- 缺失值和噪声:低丰度分子的检测困难
- 生物信息学瓶颈:数据量增长超过分析能力
- 临床转化:从研究发现到临床应用的鸿沟
机遇
- 技术进步:单细胞、空间、超灵敏质谱技术快速发展
- 计算能力:GPU、TPU、云计算使大规模分析成为可能
- AI革命:深度学习正在改变蛋白质组学和代谢组学的每个环节
- 精准医学:个体化诊断和治疗的需求驱动技术创新
- 国际合作:大型联盟(如HPP、CPTAC、CNHPP)推动标准化和资源共享

查看详情 →