一、转录因子结合模体的表示方法
**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...
📖 定义
1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。