💡 concept

五、组蛋白修饰ChIP-Seq数据分析

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

📖 定义

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。