五、ChIP-Seq数据分析方法
**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...
📖 定义
1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析