二、从头预测方法
从头预测的核心是利用基因组的统计特征和信号特征: **(1)开放阅读框(ORF)检测** - 寻找起始于ATG、终止于TAA/TAG/TGA的连续密码子序列 - 计算ORF长度:真核生物外显子通常>300 bp(100个氨基酸),短ORF可能是假阳性 - 计算密码子使用频率(Codon Usage Frequency, CUF):真实基因通常偏好使用特定密码子 **(2)隐马尔可夫模型(HMM)*...
📖 定义
从头预测的核心是利用基因组的统计特征和信号特征:
(1)开放阅读框(ORF)检测
- 寻找起始于ATG、终止于TAA/TAG/TGA的连续密码子序列
- 计算ORF长度:真核生物外显子通常>300 bp(100个氨基酸),短ORF可能是假阳性
- 计算密码子使用频率(Codon Usage Frequency, CUF):真实基因通常偏好使用特定密码子
(2)隐马尔可夫模型(HMM)
HMM是基因预测中最常用的统计框架:
- 隐藏状态:基因间区、外显子(起始/中间/终止)、内含子(起始/中间/终止)、UTR等
- 观测符号:A、C、G、T
- 状态转移概率:从一个状态转移到另一个状态的概率(如外显子→内含子的概率)
- 发射概率:在某个状态下观察到特定碱基的概率
- Viterbi算法:寻找最可能的隐藏状态序列(即基因结构)
经典HMM基因预测软件:
- Genscan:针对人类和脊椎动物,基于广义HMM
- Augustus:支持真核和原核生物,可整合外部证据
- Glimmer/GlimmerHMM:Glimmer用于原核,GlimmerHMM用于真核
- GeneMark/GeneMark-ES:自训练HMM,适合新物种
- SNAP:可训练参数,适合非模式生物
(3)支持向量机(SVM)和深度学习方法
近年来,机器学习方法也被用于基因预测:
- 将序列特征(k-mer频率、GC含量、密码子偏好等)编码为特征向量
- 用已知基因训练分类器(SVM、随机森林、神经网络)
- 对新序列进行预测