💡 concept

二、基于序列的功能分析

**1. 基于序列相似性的功能预测** **原理**:序列相似→结构相似→功能相似 - 使用BLAST/PSI-BLAST搜索功能已知蛋白 - 将同源蛋白的功能注释(GO term)转移到未知蛋白 **局限性**: - 远缘同源蛋白可能功能不同(如paralogs功能分化) - 仅考虑整体序列相似性,忽略局部功能位点 **2. 基于结构域的功能分析** **结构域(Domain)**:蛋白质中独立...

📖 定义

1. 基于序列相似性的功能预测
原理:序列相似→结构相似→功能相似
- 使用BLAST/PSI-BLAST搜索功能已知蛋白
- 将同源蛋白的功能注释(GO term)转移到未知蛋白
局限性
- 远缘同源蛋白可能功能不同(如paralogs功能分化)
- 仅考虑整体序列相似性,忽略局部功能位点
2. 基于结构域的功能分析
结构域(Domain):蛋白质中独立折叠并执行特定功能的功能单元。
InterPro数据库:整合了多个结构域数据库(Pfam、PROSITE、PRINTS、SMART等),提供全面的结构域注释。
结构域功能推断
- 如果未知蛋白含有已知的激酶结构域(如PKc_like),则具有激酶活性
- 如果含有SH2结构域,则参与酪氨酸激酶信号通路
3. 基于模体(Motif)的功能分析
模体数据库
- PROSITE:正则表达式描述的功能位点模体
- ELM(Eukaryotic Linear Motif):真核生物短线性模体,参与蛋白质相互作用、定位等
- MoRF(Molecular Recognition Feature):分子识别特征,参与固有无序区介导的相互作用
模体识别方法
- 正则表达式匹配
- 隐马尔可夫模型(HMM)
- 机器学习分类器
4. 基于序列的GO注释方法
PFP(Protein Function Prediction)
- 使用PSI-BLAST搜索弱同源序列
- 整合多个弱同源蛋白的GO注释
- 加权打分:考虑E-value和GO term的语义相似性
ESG(Extended Similarity Group)
- PFP的扩展方法
- 考虑多轮PSI-BLAST迭代中的GO注释一致性
- 提高预测特异性
PANNZER(Protein ANNotation with Z-scoRE)
- 全自动GO注释工具
- 使用SANSparallel快速搜索同源序列
- 采用带权重的KNN算法对GO注释进行富集和打分
GOLabeler
- 基于LTR(Learn to Rank)方法整合多个分类器
- 在CAFA3中表现优异
5. 其他序列特征预测
信号肽预测
- SignalP:使用神经网络和HMM预测分泌蛋白信号肽
- 输出:信号肽存在概率、剪切位点位置
亚细胞定位预测
- PSORT:基于序列特征(信号肽、跨膜区、氨基酸组成)预测定位
- TargetP:基于叶绿体和线粒体靶向信号预测
- DeepLoc:基于深度学习的亚细胞定位预测
- 定位类型:细胞核、细胞质、线粒体、内质网、分泌、膜等
跨膜区预测
- TMHMM:基于HMM预测跨膜螺旋
- Phobius:同时预测信号肽和跨膜区