💡 concept

二、蛋白质结构预测方法

**1. 同源建模(Homology Modeling)** **原理**:基于"序列相似→结构相似"的假设 **步骤**: 1. **模板选择**: - BLAST/PSI-BLAST搜索PDB数据库 - 序列相似度>30%:通常可获得可靠模型 - 序列相似度>50%:模型质量接近实验结构 - E-value < 0.001作为显著性阈值 2. **序列比对**:...

📖 定义

1. 同源建模(Homology Modeling)
原理:基于"序列相似→结构相似"的假设
步骤
1. 模板选择
- BLAST/PSI-BLAST搜索PDB数据库
- 序列相似度>30%:通常可获得可靠模型
- 序列相似度>50%:模型质量接近实验结构
- E-value < 0.001作为显著性阈值
2. 序列比对
- 目标序列与模板序列的全局比对
- 关键:正确对齐插入/缺失(indel)区域
3. 主链建模
- 保守区域:直接拷贝模板主链坐标
- 环区:需要专门建模(数据库搜索、从头计算)
4. 侧链建模
- 相同残基:直接拷贝模板侧链
- 不同残基:使用旋转异构体库(rotamer library)选择最佳构象
5. 模型优化
- 能量最小化(消除不合理接触)
- 分子动力学模拟(局部结构优化)
6. 模型评估
- Ramachandran图:检查主链二面角分布
- Z-score(如ProSA、QMEAN):与已知结构比较
- GMQE/Coverage:模型置信度评估
常用工具:SWISS-MODEL、Modeller、Phyre2、I-TASSER
2. 折叠识别(Fold Recognition)
原理:当序列相似度低(<30%)但可能存在结构相似性时,通过评估序列与结构的相容性来识别折叠类型。
方法
- Threading(穿针引线法):将序列"穿"到已知的结构模板中,评估能量相容性
- 3D-PSSM、FFAS03:基于序列谱和结构信息的打分函数
- I-TASSER:结合 threading 和从头计算的混合方法
适用场景
- 中等序列相似度(20-30%)的蛋白质
- 新发现的蛋白质家族,无高相似度模板
3. 从头计算法(Ab Initio)
原理:基于物理能量函数,不依赖模板,从序列直接预测结构。
Rosetta方法
- 核心思想:蛋白质中短片段(3-9个残基)的结构可以从已知结构库中找到相似片段
- 流程:
1. 将目标序列切分为短片段
2. 从结构库中搜索每个片段的最佳匹配构象
3. 使用蒙特卡罗模拟退火组装片段
4. 基于统计能量函数评估构象
5. 选择低能量构象作为预测结构
- 粗粒化模型:侧链简化为质心,降低计算复杂度
- 全原子精修:对低能量构象进行全原子优化
I-TASSER
- 结合 threading 和 fragment assembly
- 从 threading 模板中提取结构约束
- 使用 replica-exchange Monte Carlo 进行构象搜索
局限
- 计算成本高,仅适用于小蛋白(<150残基)
- 精度有限,通常低于同源建模
4. 基于深度学习的结构预测(革命性突破)
AlphaFold2(2020, CASP14)
核心创新
- Evoformer: attention-based 架构,整合MSA和配对特征
- MSA特征:多序列比对中的共进化信息(协方差)
- 配对特征:残基对之间的距离和方向信息
- 通过注意力机制在两种特征之间交换信息
- 结构模块
- 使用不变点注意力(Invariant Point Attention, IPA)
- 将抽象特征转化为具体的三维坐标
- 每个残基视为刚体( backbone frame + 侧链 torsion angles)
- 迭代优化结构,最终输出全原子坐标
- 回收机制(Recycling)
- 将预测的结构反馈到输入,进行多轮迭代
- 类似"自我修正"过程,逐步提高精度
- 自蒸馏(Self-distillation)
- 使用大量无结构标注的蛋白质MSA数据进行训练
- 网络自己生成"伪标签"作为监督信号
关键成功因素
1. 大规模MSA数据(UniRef90数据库)提供丰富的共进化信息
2. PDB中约170,000个已知结构提供训练数据
3. 端到端学习直接优化结构坐标(而非中间特征)
4. 注意力机制有效捕捉长程相互作用
RoseTTAFold(2021, Baker Lab)
- 类似AlphaFold2的架构,但采用三轨设计(sequence、pair、structure tracks)
- 开源,可本地运行
- 精度略低于AlphaFold2,但计算效率更高
ESMFold(2022, Meta AI)
- 基于预训练语言模型ESM-2
- 不依赖MSA搜索,直接从单序列提取进化信息
- 速度比AlphaFold2快60倍(短序列)
- 适合宏基因组蛋白质的结构预测
ColabFold(2022)
- 将AlphaFold2和MMseqs2集成到Google Colab平台
- 简化了MSA搜索和结构预测流程
- 使非专业用户也能进行蛋白质结构预测