转录调控和表观遗传

7 个小节 · 42 个知识点

转录调控与表观遗传概述

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →

转录调控分析

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →

DNA甲基化组学数据分析

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →

组蛋白修饰组学数据分析

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →

三维基因组学数据分析

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →

表观转录组学数据分析

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →

转录调控和表观遗传的总结与展望

💡

第8章 转录调控和表观遗传

chapter

> 章节导读:基因的表达受到精密的调控。从转录因子对基因启动子和增强子的特异性识别,到DNA甲基化、组蛋白修饰等表观遗传信息对染色质状态的动态调控,再到三维基因组结构中增强子与启动子的远程互作,以及RNA分子上的化学修饰——这些多层次、多维度的调控机制共同决定了细胞类型特异性、发育时序性和环境响应性。本章将系统介绍转录调控和表观遗传的基本概念、分析技术和数据处理方法,帮助读者理解基因表达调控的复杂网络。

查看详情 →
💡

8.1 转录调控与表观遗传概述

section
查看详情 →
💡

一、转录调控的基本框架

concept

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用: 1. **启动子(Promoter)**:位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。 2. **增强子(Enhancer)**:可以位于基因上游、下游或内含子中的DNA调控元件,通过结合...

基因转录调控是一个多层次的复杂过程,涉及多个调控元件和蛋白质的协同作用:
1. 启动子(Promoter):位于基因转录起始位点(TSS)上游的DNA区域,包含核心启动子元件(如TATA框、起始子Inr)和近端启动子元件。核心启动子负责招募RNA聚合酶II和通用转录因子,形成基础转录机器。
2. 增强子(Enhancer):可以位于基因上游、下游或内含子中的DNA调控元件,通过结合特定转录因子来增强靶基因的转录效率。增强子的特点是具有位置独立性(可以位于靶基因的任何方向)和距离独立性(可以距离靶基因数kb甚至数十kb)。
3. 绝缘子(Insulator):阻断增强子与启动子之间的通信,或防止异染色质区域的扩散,从而维持基因表达边界。
4. 沉默子(Silencer):与转录抑制因子结合,降低靶基因的转录活性。

查看详情 →
💡

二、转录因子调控机制

concept

转录因子通过以下步骤实现对基因表达的精确调控: 1. **识别与结合**:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。 2. **协同作用**:多个转录因子可以在同一调控区域形...

转录因子通过以下步骤实现对基因表达的精确调控:
1. 识别与结合:转录因子的DNA结合域识别并结合特定的DNA序列模体(motif)。常见的DNA结合域类型包括:锌指结构(Zinc finger)、同源异型域(Homeodomain)、亮氨酸拉链(Leucine zipper)、螺旋-环-螺旋(Helix-loop-helix)等。
2. 协同作用:多个转录因子可以在同一调控区域形成复合物,通过协同效应增强或抑制转录效率。这种组合调控(combinatorial regulation)使得有限的转录因子种类能够产生极其复杂的调控模式。
3. 染色质重塑:转录因子可以招募染色质重塑复合物(如SWI/SNF、ISWI、CHD家族),改变核小体的位置和组成,从而影响DNA的可及性。

查看详情 →
💡

三、表观遗传学的核心机制

concept

表观遗传信息主要通过以下四种机制调控基因表达: 1. **DNA甲基化**:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。 2. **组蛋白修饰**:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改...

表观遗传信息主要通过以下四种机制调控基因表达:
1. DNA甲基化:DNA甲基转移酶(DNMT)将甲基基团添加到胞嘧啶的5号碳位(主要发生在CpG二核苷酸中),形成5-甲基胞嘧啶(5-mC)。DNA甲基化通常与基因沉默相关,尤其是启动子区域的甲基化会抑制基因转录。
2. 组蛋白修饰:组蛋白N端尾部的氨基酸残基可以发生多种共价修饰,包括乙酰化、甲基化、磷酸化、泛素化等。这些修饰可以改变核小体的结构和DNA的缠绕松紧程度,从而影响基因的可及性。例如,组蛋白乙酰化通常与转录激活相关,而组蛋白甲基化的效应则取决于具体位点和甲基化程度。
3. 染色质重塑:ATP依赖的染色质重塑复合物通过滑动、移除或交换核小体来改变染色质结构,从而调控基因表达。
4. 非编码RNA调控:长链非编码RNA(lncRNA)、microRNA(miRNA)等可以通过多种机制调控基因表达,包括染色质重塑、转录干扰和mRNA降解等。

查看详情 →
💡

四、表观遗传信息的可遗传性

concept

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

表观遗传信息可以在细胞分裂过程中传递给子代细胞,这是表观遗传学的重要特征。DNA甲基化的维持机制:在DNA复制过程中,半甲基化的DNA(母链甲基化、子链未甲基化)可以被维持性DNA甲基转移酶DNMT1识别,并在子链对应位置添加甲基,从而维持甲基化状态。组蛋白修饰的传递则主要通过"组蛋白密码假说"和组蛋白变体的掺入来实现。

查看详情 →
💡

8.2 转录调控分析

section
查看详情 →
💡

一、转录因子结合模体的表示方法

concept

**1. DNA共有序列** 构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如: - 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA - 共有序列:TACTGHA(H表示A/C/T) 局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。 **2. 位置频率矩阵(PFM)** 对于一...

1. DNA共有序列
构建方法:对已知的多条转录因子结合序列进行多序列比对,在每个位置选择频率最高的碱基(若最高频率低于某个阈值,则使用简并码)。例如:
- 序列集合:TACTGTA, TACTGCA, TACTGTA, TACTGCA
- 共有序列:TACTGHA(H表示A/C/T)
局限性:无法反映碱基频率的连续变化,对信息的利用不够充分。
2. 位置频率矩阵(PFM)
对于一个长度为n的模体,PFM的构建步骤:
1. 收集已知的转录因子结合序列(通常来自SELEX、PBM或ChIP-Seq实验)
2. 对序列进行多序列比对
3. 统计每个位置(j=1..n)上每种碱基(i∈{A,C,G,T})的出现次数
4. 计算频率:q_{i,j} = count_{i,j} / N(N为序列总数)
3. 序列标识图(Sequence Logo)
每个位置的信息量(R_j)计算:
$$R_j = H_{max} - H_j = 2 - \left(-\sum_{i=1}^{4} q_{i,j} \log_2 q_{i,j}\right)$$
其中H_j为位置j的信息熵,H_max=2(当4种碱基均匀分布时的最大熵)。
每个碱基的高度:height_{i,j} = q_{i,j} × R_j
4. 位置权重矩阵(PWM)
$$S_{i,j} = \log_2\left(\frac{q_{i,j}}{b_i}\right)$$
其中b_i为碱基i在背景基因组中的频率。
对于待扫描序列的打分:S = Σ_{j=1}^{n} S_{i,j}
窗口滑动扫描:使用长度为n的窗口,以1 bp为步长在基因组上滑动,对每个片段计算PWM得分,筛选超过阈值的位点作为潜在结合位点。

查看详情 →
💡

二、模体从头发现(De Novo Motif Finding)

concept

**1. 基于共有序列的穷举方法** - 遍历所有可能的k-mer序列(4^k种组合) - 统计每个k-mer在输入序列集中的出现频率 - 筛选在多数序列中均有出现的显著模式 - 计算复杂度:O(4^k),适用于k≤10的情况 **2. 基于EM算法的模体发现(以MEME为代表)** EM算法包含两个迭代步骤: **E-step(期望步骤)**:假设当前位置频率矩阵为θ,对每条序列中每个可能的结合...

1. 基于共有序列的穷举方法
- 遍历所有可能的k-mer序列(4^k种组合)
- 统计每个k-mer在输入序列集中的出现频率
- 筛选在多数序列中均有出现的显著模式
- 计算复杂度:O(4^k),适用于k≤10的情况
2. 基于EM算法的模体发现(以MEME为代表)
EM算法包含两个迭代步骤:
E-step(期望步骤):假设当前位置频率矩阵为θ,对每条序列中每个可能的结合位点位置计算似然比:
$$LR = \frac{P(\text{sequence}|\theta)}{P(\text{sequence}|\theta_0)}$$
其中θ_0为背景碱基频率模型。
M-step(最大化步骤):以E-step得到的似然比为权重,重新计算位置频率矩阵,最大化观测数据的似然函数。
迭代直至收敛,最终得到最优的位置频率矩阵。
MEME算法改进:先遍历所有可能的起始矩阵,筛选具有统计学显著性的矩阵作为EM的输入,避免陷入局部最优。
3. 基于Gibbs抽样的模体发现
Gibbs抽样是一种马尔可夫链蒙特卡罗(MCMC)方法:
1. 从N条序列中随机选择一条序列S_i
2. 从剩余N-1条序列中随机提取长度为n的片段,构建初始位置频率矩阵
3. 基于该矩阵对S_i中每个可能的n长度片段计算似然比
4. 根据似然比概率随机选择一个片段作为S_i上的结合位点
5. 用选中的片段更新位置频率矩阵
6. 重复步骤1-5,遍历所有序列,完成一轮迭代
7. 多轮迭代直至矩阵收敛
Gibbs抽样的优势:随机化策略可以跳出局部最优,探索更广泛的可能性空间。

查看详情 →
💡

三、ChIP-Seq技术原理

concept

**实验流程**: 1. **交联**:甲醛处理细胞,共价固定蛋白质-DNA复合物 2. **裂解**:超声波打断染色质,获得约200 bp的DNA片段 3. **免疫沉淀**:用特异性抗体捕获目标蛋白及其结合的DNA片段 4. **解交联**:去除蛋白质,纯化DNA 5. **测序**:构建测序文库,进行高通量测序 **技术特点**: - 需要生物学重复(通常2-3次)以提高可靠性 - 人类/小...

实验流程
1. 交联:甲醛处理细胞,共价固定蛋白质-DNA复合物
2. 裂解:超声波打断染色质,获得约200 bp的DNA片段
3. 免疫沉淀:用特异性抗体捕获目标蛋白及其结合的DNA片段
4. 解交联:去除蛋白质,纯化DNA
5. 测序:构建测序文库,进行高通量测序
技术特点
- 需要生物学重复(通常2-3次)以提高可靠性
- 人类/小鼠转录因子ChIP-Seq建议测序深度约2000万reads
- 对照样本(Input或IgG)用于背景校正

查看详情 →
💡

四、ChIP-Seq数据质量控制

concept

**1. 信号峰层面的质控** **FRiP(Fraction of Reads in Peaks)**:落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。 **互相关分析(Cross-correlation)**:利用正链和负链reads的相位差估计DNA片段长度。关键指标: - NSC(Normalized Strand...

1. 信号峰层面的质控
FRiP(Fraction of Reads in Peaks):落入信号峰区域的reads占所有reads的比例。高质量数据FRiP > 0.05(转录因子)或 > 0.2(组蛋白修饰)。
互相关分析(Cross-correlation):利用正链和负链reads的相位差估计DNA片段长度。关键指标:
- NSC(Normalized Strand Coefficient)= cc(片段长度) / min(cc),通常NSC > 1.1
- RSC(Relative Strand Correlation)= [cc(片段长度) - min(cc)] / [cc(读段长度) - min(cc)],通常RSC > 0.8
IDR(Irreproducible Discovery Rate):衡量生物学重复之间信号峰的可重复性。IDR值越低,信号峰的可重复性越好。通常以IDR < 0.05筛选高置信度信号峰。
2. 注释层面的质控
- 基因组分布:信号峰应在启动子/增强子区域富集
- 序列保守性:信号峰中心应有比周围更高的PhastCons保守性得分
- 模体验证:已知结合模体应在信号峰中心富集

查看详情 →
💡

五、ChIP-Seq数据分析方法

concept

**1. 信号峰识别(Peak Calling)** 以MACS2为例: 1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离 2. 将reads向3'端移动d/2,构建富集信号 3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global}) 4. 计算每个候选区域的富集显著性(p-value) 5. 多重检验校正(Benjamini-Hochber...

1. 信号峰识别(Peak Calling)
以MACS2为例:
1. 估计片段长度d:通过互相关分析确定正链和负链reads的偏移距离
2. 将reads向3'端移动d/2,构建富集信号
3. 动态泊松分布建模:局部背景λ = max(λ_{local}, λ_{global})
4. 计算每个候选区域的富集显著性(p-value)
5. 多重检验校正(Benjamini-Hochberg FDR),筛选显著富集区域
2. 差异信号峰分析
- 定量比较:类似RNA-seq差异分析方法,比较两套ChIP-Seq数据的信号强度差异(如DiffBind、MAnorm)
- 定性比较:使用严格阈值在一套数据中识别信号峰,用宽松阈值在另一套数据中扫描,仅在一套中出现的峰为差异峰
3. 靶基因预测
- 最近TSS法:将信号峰关联到距离最近的转录起始位点
- 距离阈值法:将TSS一定距离(如±50 kb)内的信号峰关联到该基因
- 加权距离法:信号峰权重随距离增加而衰减(线性或指数衰减)
- 整合转录组法:结合RNA-seq或 knockdown/knockout 实验的转录变化,筛选靶基因(如BETA方法)
4. 功能注释
- ORA(Over-Representation Analysis):对靶基因列表进行GO/KEGG富集分析
- GREAT/Cistrome-GO:基于信号峰在全基因组的分布,直接进行区域富集分析

查看详情 →
💡

8.3 DNA甲基化组学数据分析

section
查看详情 →
💡

一、DNA甲基化的化学基础

concept

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上: - **5-甲基胞嘧啶(5-mC)**:最常见的DNA甲基化形式,由DNMT酶家族催化 - **5-羟甲基胞嘧啶(5-hmC)**:5-mC的氧化产物,近年来发现其具有独特的调控功能 - **5-甲酰基胞嘧啶(5-fC)**和**5-羧基胞嘧啶(5-caC)**:5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物 DNA甲基化状...

在哺乳动物中,DNA甲基化主要发生在CpG二核苷酸的胞嘧啶上:
- 5-甲基胞嘧啶(5-mC):最常见的DNA甲基化形式,由DNMT酶家族催化
- 5-羟甲基胞嘧啶(5-hmC):5-mC的氧化产物,近年来发现其具有独特的调控功能
- 5-甲酰基胞嘧啶(5-fC)5-羧基胞嘧啶(5-caC):5-hmC的进一步氧化产物,是主动去甲基化途径的中间产物
DNA甲基化状态的三种形式:
- 全甲基化(Fully methylated):DNA双链的CpG均被甲基化
- 半甲基化(Hemimethylated):仅一条链的CpG被甲基化(DNA复制后的中间状态)
- 未甲基化(Unmethylated):双链CpG均未甲基化

查看详情 →
💡

二、DNA甲基化的动态调控

concept

**1. 从头甲基化(De novo methylation)** - **酶**:DNMT3A、DNMT3B - **机制**:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化 - **调控**:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性 **2. 甲基化维持(Maintenance methylation)** - **酶**:D...

1. 从头甲基化(De novo methylation)
- :DNMT3A、DNMT3B
- 机制:识别未甲基化的DNA双链,以S-腺苷甲硫氨酸(SAM)为甲基供体,催化CpG位点的甲基化
- 调控:DNMT3L(无催化活性的辅助蛋白)可增强DNMT3A/3B的活性
2. 甲基化维持(Maintenance methylation)
- :DNMT1
- 机制:在DNA复制后,DNMT1识别半甲基化的CpG(母链甲基化、子链未甲基化),在子链对应位置添加甲基,维持甲基化状态
- 辅助因子:UHRF1蛋白识别半甲基化DNA并招募DNMT1
3. 主动去甲基化
- TET酶氧化:TET1/2/3将5-mC逐步氧化为5-hmC、5-fC、5-caC
- TDG切除:胸腺嘧啶DNA糖基化酶(TDG)识别并切除5-fC和5-caC
- BER修复:碱基切除修复(BER)途径填补缺口,最终完成去甲基化
4. 被动去甲基化
- 在DNMT1活性缺失或不表达的细胞中,DNA复制后甲基化无法维持
- 随细胞分裂,甲基化被逐渐"稀释",最终达到未甲基化状态

查看详情 →
💡

三、DNA甲基化的生物学功能

concept

**1. 基因表达调控** - 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默 - 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始 - 增强子甲基化:降低增强子活性,影响远端基因调控 **2. 基因组印记(Genomic Imprinting)** - 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因 - 印记基因的异常与B...

1. 基因表达调控
- 启动子CpG岛甲基化:阻碍转录因子结合,招募甲基CpG结合蛋白(如MeCP2),导致转录沉默
- 基因体甲基化:与转录活跃相关,可能促进转录延伸或抑制转录起始
- 增强子甲基化:降低增强子活性,影响远端基因调控
2. 基因组印记(Genomic Imprinting)
- 亲本等位基因特异的甲基化模式,使子代中仅表达父源或母源等位基因
- 印记基因的异常与Beckwith-Wiedemann综合征、Angelman综合征等疾病相关
3. X染色体失活(X-inactivation)
- 雌性哺乳动物通过Xist lncRNA介导的染色质沉默,使一条X染色体失活
- DNA甲基化在维持X染色体失活状态中发挥重要作用
4. 转座子沉默
- 重复序列和转座子区域的高甲基化抑制其转录活性,维持基因组稳定性
5. 细胞分化和发育
- 胚胎发育过程中经历大规模的DNA甲基化重编程
- 组织特异性甲基化模式决定细胞身份和功能

查看详情 →
💡

四、DNA甲基化组学技术

concept

**1. 全基因组重亚硫酸盐测序(WGBS)** - **原理**:亚硫酸盐转化 + 全基因组测序 - **优点**:单碱基分辨率、全基因组覆盖、定量准确 - **缺点**:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低 - **应用**:全基因组甲基化图谱绘制、DMR鉴定 **2. 简化代表性重亚硫酸盐测序(RRBS)** - **原理**:限制性内切酶(MspI)富集CpG岛区域,再进...

1. 全基因组重亚硫酸盐测序(WGBS)
- 原理:亚硫酸盐转化 + 全基因组测序
- 优点:单碱基分辨率、全基因组覆盖、定量准确
- 缺点:测序成本高、DNA损伤大、C→U转化导致序列复杂性降低
- 应用:全基因组甲基化图谱绘制、DMR鉴定
2. 简化代表性重亚硫酸盐测序(RRBS)
- 原理:限制性内切酶(MspI)富集CpG岛区域,再进行亚硫酸盐测序
- 优点:成本低、覆盖启动子和CpG岛区域
- 缺点:仅覆盖约1-5%基因组,对非CpG岛区域不敏感
3. 甲基化DNA免疫沉淀测序(MeDIP-Seq)
- 原理:使用5-mC特异性抗体富集甲基化DNA片段,然后测序
- 优点:无需亚硫酸盐处理,DNA完整性高
- 缺点:分辨率低(约100-200 bp),不能区分5-mC和5-hmC
4. 第三代测序技术
- ONT纳米孔测序:通过检测DNA通过纳米孔时的电信号差异,直接识别甲基化修饰
- PacBio SMRT测序:通过分析DNA聚合酶动力学的变化检测甲基化
- 优点:无需亚硫酸盐处理,可区分5-mC和5-hmC,长读长
- 缺点:错误率较高,需要较高测序深度

查看详情 →
💡

五、WGBS数据分析流程

concept

**1. 原始数据质控** - TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化) - FastQC:检查碱基质量、GC含量、长度分布 - 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估) **2. 序列比对** 亚硫酸盐转化的特殊性: - C→U转化后,DNA序列中C极为稀少(仅剩甲基化C) - 两条链不再互补(仅一条链发生C→T转化) - 需要专门的比对算法...

1. 原始数据质控
- TrimGalore:去除接头序列和低质量碱基(对亚硫酸盐数据优化)
- FastQC:检查碱基质量、GC含量、长度分布
- 特别关注:亚硫酸盐转化效率(通过未甲基化对照λ噬菌体DNA评估)
2. 序列比对
亚硫酸盐转化的特殊性:
- C→U转化后,DNA序列中C极为稀少(仅剩甲基化C)
- 两条链不再互补(仅一条链发生C→T转化)
- 需要专门的比对算法
两种主要比对策略
三字符法(3-letter):将参考基因组中所有C替换为T,reads也进行C→T转换,然后比对。优点:简单快速;缺点:信息量损失,部分位点无法区分。
通配符法(Wild-card):将参考基因组中所有C替换为Y(C或T),保留C的两种可能性。优点:信息完整;缺点:比对复杂度增加,可能引入偏差。
常用比对软件
- Bismark:基于Bowtie/Bowtie2,进行C→T和G→A双重转换,准确率高,使用最广泛
- BSMAP:通配符法,不转换基因组,创建种子列表进行比对
- Bwa-meth:基于BWA-MEM,支持长读长比对
- Walt:针对亚硫酸盐数据的专门优化算法
3. 甲基化水平推断
对于每个CpG位点:
$$\text{甲基化水平} = \frac{\text{覆盖该位点的甲基化reads数}}{\text{覆盖该位点的总reads数}}$$
影响因素和校正:
- DNA片段末端修复引入的非甲基化C
- 接头序列污染
- 3'端测序质量下降
- 不均衡PCR扩增
- 5-hmC的干扰(亚硫酸盐无法区分5-mC和5-hmC)
4. 差异甲基化区域(DMR)鉴定
滑动窗口法
- 将基因组划分为固定大小的窗口(如1 kb)
- 比较两组样本间每个窗口的平均甲基化水平
- 使用t检验、Wilcoxon检验或β-二项模型计算显著性
- 筛选连续显著窗口,合并为DMR
常用软件
- methylKit:R包,支持滑动窗口和CpG-wise分析
- BSmooth:基于局部似然平滑,适合WGBS数据
- MOABS:基于分层贝叶斯模型,整合生物学重复信息
- dmrFinder:结合统计检验和区域合并
5. DMR注释和功能分析
- 基因组位置注释:启动子、外显子、内含子、基因间区
- 基因关联:关联到最近的基因或TSS
- 功能富集:GO/KEGG富集分析、motif分析
- 整合分析:结合RNA-seq数据,分析DMR与差异表达基因的关系

查看详情 →
💡

8.4 组蛋白修饰组学数据分析

section
查看详情 →
💡

一、组蛋白修饰的命名规则

concept

组蛋白修饰命名由四部分组成: **组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型** 例如: - **H3K4me3**:H3组蛋白第4位赖氨酸的三甲基化 - **H3K27ac**:H3组蛋白第27位赖氨酸的乙酰化 - **H3K9me2**:H3组蛋白第9位赖氨酸的二甲基化 - **H2BK120ub**:H2B组蛋白第120位赖氨酸的泛素化 常见修饰类型缩写: - ac:乙酰化(acet...

组蛋白修饰命名由四部分组成:
组蛋白类型 + 氨基酸残基 + 位置 + 修饰类型
例如:
- H3K4me3:H3组蛋白第4位赖氨酸的三甲基化
- H3K27ac:H3组蛋白第27位赖氨酸的乙酰化
- H3K9me2:H3组蛋白第9位赖氨酸的二甲基化
- H2BK120ub:H2B组蛋白第120位赖氨酸的泛素化
常见修饰类型缩写:
- ac:乙酰化(acetylation)
- me1/me2/me3:一/二/三甲基化(mono-/di-/tri-methylation)
- me2s/me2a:对称/非对称二甲基化(dimethylation symmetric/asymmetric)
- ub:泛素化(ubiquitination)
- ph:磷酸化(phosphorylation)

查看详情 →
💡

二、组蛋白修饰的"Writer-Reader-Eraser"模型

tool

**1. Writer(写入器)** **组蛋白乙酰转移酶(HAT)**: - 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上 - 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族 - 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放 **组蛋白甲基转移酶(HMT)**: - 以S-腺苷甲硫氨酸(SAM)为甲基供...

1. Writer(写入器)
组蛋白乙酰转移酶(HAT)
- 将乙酰基从乙酰辅酶A转移到组蛋白赖氨酸残基上
- 家族分类:GNAT家族(GCN5、PCAF)、MYST家族(MOZ、YBF2、SAS2、TIP60)、p300/CBP家族
- 功能:中和赖氨酸正电荷,减弱与DNA的相互作用,促进染色质开放
组蛋白甲基转移酶(HMT)
- 以S-腺苷甲硫氨酸(SAM)为甲基供体
- 赖氨酸甲基转移酶:SET结构域家族(如MLL、EZH2、SETD2、SUV39H1)
- 精氨酸甲基转移酶:PRMT家族(PRMT1、PRMT4/CARM1、PRMT5)
- 功能:不改变电荷,但增加空间位阻,影响蛋白质相互作用
2. Eraser(擦除器)
组蛋白去乙酰化酶(HDAC)
- 去除赖氨酸残基上的乙酰基
- 家族分类:Class I(HDAC1/2/3/8)、Class II(HDAC4/5/6/7/9/10)、Class III/Sirtuins(SIRT1-7)、Class IV(HDAC11)
- 功能:恢复赖氨酸正电荷,增强与DNA的相互作用,促进染色质压缩
组蛋白去甲基化酶(KDM)
- KDM1/LSD1家族:黄素依赖氧化酶,主要去除H3K4me1/2和H3K9me2
- JmjC家族:α-酮戊二酸依赖的双加氧酶,可去除多种甲基化修饰(H3K4、H3K9、H3K27、H3K36等)
3. Reader(读取器)
溴结构域(Bromodomain)
- 识别乙酰化赖氨酸
- 家族成员:BRD2/3/4、BRDT、PBRM1等
- 功能:招募转录机器和染色质重塑复合物
染色质结构域(Chromodomain)
- 识别甲基化赖氨酸
- HP1(识别H3K9me3)、PRC1(识别H3K27me3)
- 功能:介导异染色质形成和基因沉默
Tudor结构域、PHD结构域、WD40重复等
- 识别不同甲基化状态
- 功能:参与DNA修复、转录调控和细胞信号传导

查看详情 →
💡

三、组蛋白修饰与染色质状态

concept

**转录激活相关修饰**: - **H3K4me3**:活跃启动子标记,招募TFIID复合物 - **H3K9ac**、**H3K27ac**:活跃增强子和启动子标记,与开放染色质相关 - **H3K36me3**:基因体标记,与转录延伸相关,招募RNA剪接因子 - **H3K79me2**:基因体标记,与转录活跃相关 **转录抑制相关修饰**: - **H3K27me3**:多梳蛋白抑制标记,由...

转录激活相关修饰
- H3K4me3:活跃启动子标记,招募TFIID复合物
- H3K9acH3K27ac:活跃增强子和启动子标记,与开放染色质相关
- H3K36me3:基因体标记,与转录延伸相关,招募RNA剪接因子
- H3K79me2:基因体标记,与转录活跃相关
转录抑制相关修饰
- H3K27me3:多梳蛋白抑制标记,由PRC2复合物(EZH2)催化,介导发育基因的可逆沉默
- H3K9me2/3:异染色质标记,由SUV39H1/2催化,招募HP1蛋白,介导转座子沉默和组成型异染色质形成
- H4K20me3:抑制性标记,与DNA损伤修复和细胞周期调控相关
双价修饰(Bivalent Domain)
- H3K4me3 + H3K27me3:同时存在于胚胎干细胞中发育调控基因的启动子区域
- 含义:基因处于"预备转录"状态——既被激活又被抑制,随时准备响应分化信号

查看详情 →
💡

四、组蛋白修饰组学技术

concept

**1. X-ChIP-Seq(交联ChIP-Seq)** - 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序 - 适用于大多数组蛋白修饰,特别是稳定性较差的修饰 - 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合 **2. N-ChIP-Seq(天然ChIP-Seq)** - 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免...

1. X-ChIP-Seq(交联ChIP-Seq)
- 甲醛交联蛋白质-DNA → 超声打断染色质(200-1000 bp)→ 免疫沉淀 → 测序
- 适用于大多数组蛋白修饰,特别是稳定性较差的修饰
- 缺点:分辨率受限于超声片段大小,交联可能引入非特异性结合
2. N-ChIP-Seq(天然ChIP-Seq)
- 无交联 → MNase消化(单核小体分辨率,~147 bp)→ 免疫沉淀 → 测序
- 适用于稳定的组蛋白修饰(如H3K4me3、H3K27me3)
- 优点:单核小体分辨率,保留核小体定位信息
- 缺点:不适用于不稳定的修饰或DNA结合蛋白
3. CUT&RUN
- 抗体靶向组蛋白修饰 → 融合蛋白pA-MNase切割附近DNA → 释放DNA片段 → 测序
- 优点:低背景、高分辨率、低细胞数需求(可处理10^5细胞)
- 缺点:依赖抗体质量,部分修饰可能不适用
4. CUT&Tag
- 抗体靶向组蛋白修饰 → Tn5转座酶融合蛋白在修饰位点附近插入接头并切割DNA → 测序
- 优点:无需交联和超声,操作简便,背景更低,细胞数需求更低(可处理10^3-10^4细胞)
- 缺点:对转座酶活性敏感,部分区域可能覆盖不均

查看详情 →
💡

五、组蛋白修饰ChIP-Seq数据分析

concept

**1. 数据质控** 与转录因子ChIP-Seq质控类似,但需额外关注: - **抗体特异性**:Western blot验证抗体特异性 - **信号分布特征**:不同修饰有特定的基因组分布模式 - **峰型特征**:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3) **2. 峰识别(Peak Calling)** **窄峰类型**(如H3K4me3、H3...

1. 数据质控
与转录因子ChIP-Seq质控类似,但需额外关注:
- 抗体特异性:Western blot验证抗体特异性
- 信号分布特征:不同修饰有特定的基因组分布模式
- 峰型特征:窄峰(如H3K4me3、H3K9ac)vs. 宽峰(如H3K27me3、H3K9me3)
2. 峰识别(Peak Calling)
窄峰类型(如H3K4me3、H3K9ac):
- 使用与转录因子ChIP-Seq相同的方法(MACS2、HOMER)
- 峰通常位于TSS附近或增强子区域
宽峰类型(如H3K27me3、H3K9me3、H3K36me3):
- 使用宽峰模式算法(MACS2 --broad、SICER、RSEG)
- 富集区域可跨越数十kb甚至数百kb
- 需要更大的合并窗口和更宽松的阈值
3. 差异富集区域分析
常用方法:
- DiffBind:基于DESeq2/edgeR的ChIP-Seq差异分析R包
- MAnorm:基于MA图的归一化方法,假设共有峰具有相同信号强度
- ChIPDiff:基于隐马尔可夫模型的差异分析
4. 染色质状态推断(Chromatin State Calling)
核心思想:整合多种组蛋白修饰的ChIP-Seq数据,基于修饰组合模式推断每个基因组区域的功能状态。
ChromHMM算法
1. 将基因组划分为200 bp的区间
2. 对每个区间,检查是否存在每种组蛋白修饰的标记(二值化:有/无)
3. 使用多元隐马尔可夫模型(HMM)学习染色质状态
4. 模型训练后,为每个区间分配最可能的染色质状态
常见染色质状态:
- 状态1:活跃启动子(TSS附近,H3K4me3 + H3K27ac)
- 状态2:弱启动子/预备启动子(TSS附近,H3K4me3)
- 状态3:转录延伸(基因体,H3K36me3)
- 状态4:增强子(远端,H3K4me1 + H3K27ac)
- 状态5:弱增强子(远端,H3K4me1)
- 状态6:多梳蛋白抑制(H3K27me3)
- 状态7:异染色质/重复序列(H3K9me3)
- 状态8:绝缘子(CTCF结合位点)
SegWay:另一种基于动态贝叶斯网络的方法,可以处理连续信号而非二值化标记。

查看详情 →
💡

8.5 三维基因组学数据分析

section
查看详情 →
💡

一、三维基因组结构的层级组织

concept

**1. 染色体领域(Chromosome Territory, ~1-100 Mb)** - 每条染色体在核内占据相对独立的区域 - 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域 - 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性 **2. 染色质区室(Compartment, ~1-10 Mb)** - A区室(Compartment A):转录活跃、开放染色...

1. 染色体领域(Chromosome Territory, ~1-100 Mb)
- 每条染色体在核内占据相对独立的区域
- 原因:染色体是连续的DNA-蛋白质纤维,在不受约束时自然形成连贯区域
- 功能:减少不同染色体之间的异常相互作用,维持基因组稳定性
2. 染色质区室(Compartment, ~1-10 Mb)
- A区室(Compartment A):转录活跃、开放染色质、基因密集、高表达
- B区室(Compartment B):转录抑制、紧密染色质、基因稀疏、低表达
- 检测方法:Hi-C矩阵的主成分分析(PCA),第一主成分(PC1)正负值对应A/B区室
- 动态变化:不同细胞类型中,A/B区室可以发生转换,与基因表达变化相关
3. 拓扑关联结构域(TAD, ~0.1-1 Mb)
- 域内相互作用频率显著高于域间
- TAD边界富含CTCF结合位点、管家基因和tRNA基因
- 功能:限制增强子的调控范围,防止异位调控(enhancer adoption)
- 在发育过程中,TAD边界相对稳定,但内部结构可以发生重组
4. 染色质环(Loop, ~1 kb - 1 Mb)
- 点对点的高频相互作用
- 功能类型:增强子-启动子环、启动子-启动子环、CTCF介导的环
- 环的形成通常需要CTCF蛋白和Cohesin复合物的协同作用(环挤压模型)

查看详情 →
💡

二、Hi-C技术原理

concept

**实验步骤**: 1. **固定**:甲醛交联,共价固定空间上相邻的DNA片段 2. **酶切**:限制性内切酶(如MboI,识别GATC)消化DNA 3. **末端修复**:补齐粘性末端,加入生物素标记 4. **连接**:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接) 5. **解交联**:蛋白酶消化蛋白质,纯化DNA 6. **打断和测序**:超声打断DNA,富集生物素标记的嵌...

实验步骤
1. 固定:甲醛交联,共价固定空间上相邻的DNA片段
2. 酶切:限制性内切酶(如MboI,识别GATC)消化DNA
3. 末端修复:补齐粘性末端,加入生物素标记
4. 连接:低浓度下连接DNA片段,形成嵌合分子(DNA-DNA连接)
5. 解交联:蛋白酶消化蛋白质,纯化DNA
6. 打断和测序:超声打断DNA,富集生物素标记的嵌合片段,进行双端测序
技术原理
- 两个DNA片段在核内空间距离越近,被连接形成嵌合分子的概率越高
- 测序后,嵌合分子的两个末端分别对应基因组上的两个位置
- 统计所有嵌合分子,构建全基因组相互作用矩阵
关键参数
- 分辨率:取决于酶切位点密度和测序深度
- 100 kb分辨率:识别区室(约3亿reads)
- 40 kb分辨率:识别TAD(约5-10亿reads)
- 5-10 kb分辨率:识别环(约10-20亿reads)
- 常用酶:MboI(4碱基识别,约250 bp一个位点)vs. HindIII(6碱基识别,约4 kb一个位点)
Hi-C变体技术
- Capture Hi-C:富集特定区域(如启动子)的相互作用,提高目标区域分辨率
- DNase Hi-C:使用DNase I替代限制性内切酶,提高分辨率
- Micro-C:使用MNase消化至核小体级别,分辨率可达单核小体水平
- in situ Hi-C:在细胞核内进行酶切和连接,减少随机碰撞,信噪比更高
- 单细胞Hi-C:分析单个细胞的三维基因组结构,揭示细胞间异质性

查看详情 →
💡

三、ChIA-PET技术原理

concept

**与Hi-C的区别**: - Hi-C无差别地检测全基因组所有相互作用 - ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集 **实验步骤**: 1. 甲醛 + EGS交联 2. 超声打断染色质 3. ChIP富集目标蛋白质及其结合的DNA片段 4. 连接半连接子(half-linker),形成桥连接结构 5. 酶切或Tn5片段化,产生配对末端标签...

与Hi-C的区别
- Hi-C无差别地检测全基因组所有相互作用
- ChIA-PET针对特定蛋白质(如CTCF、RNAPII、Cohesin)介导的相互作用进行富集
实验步骤
1. 甲醛 + EGS交联
2. 超声打断染色质
3. ChIP富集目标蛋白质及其结合的DNA片段
4. 连接半连接子(half-linker),形成桥连接结构
5. 酶切或Tn5片段化,产生配对末端标签(PET)
6. 测序
优势
- 信号特异性强,背景噪声低
- 分辨率可达100 bp
- 可以直接鉴定蛋白质介导的特定互作(如CTCF-CTCF环)
局限性
- 依赖高质量抗体
- 只能研究与特定蛋白质相关的相互作用
- 需要较多细胞数

查看详情 →
💡

四、Hi-C数据预处理和分析

concept

**1. 比对和嵌合分子筛选** **比对策略**: - Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理 - 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息 - 常用工具:HiC-Pro、Juicer、Chrom3D **有效嵌合分子筛选**: - 去除未连接的片段(两个末端比对到同一位置) - 去除酶切位点距离过远(>1 kb)的片段(无效连接) - 去除PCR...

1. 比对和嵌合分子筛选
比对策略
- Hi-C文库是嵌合分子(两个DNA片段连接),需要特殊处理
- 使用5'端优先比对策略:将reads比对到基因组,优先使用5'端信息
- 常用工具:HiC-Pro、Juicer、Chrom3D
有效嵌合分子筛选
- 去除未连接的片段(两个末端比对到同一位置)
- 去除酶切位点距离过远(>1 kb)的片段(无效连接)
- 去除PCR重复
- 去除比对质量低的reads
2. 相互作用矩阵构建
- 将基因组划分为等距的区间(bins),如40 kb、10 kb、5 kb
- 统计每对区间之间的有效嵌合分子数量
- 结果:N×N的相互作用矩阵(N为区间数)
3. 矩阵校准(Normalization)
校准原因:
- GC含量差异:GC-rich区域更容易被连接和测序
- 酶切位点密度:MboI位点密度不均匀
- 序列可比对性:重复序列区域比对率低
- 这些因素导致某些区间的相互作用计数系统性偏高
校准方法
显式校准(如HiC-Pro)
- 将相互作用计数与GC含量、酶切位点数量、可比对性进行回归
- 得到回归校准后的相互作用计数
隐式校准(矩阵平衡法)
- 假设:每个区间与所有其他区间的相互作用总量应该一致
- 算法:迭代地将矩阵每行除以行平均值,每列除以列平均值,直至收敛
- 结果:每个区间的行和列和均等于1(或常数)
- 优点:无需知道偏差来源,自动校正
- 缺点:对低覆盖区域敏感,可能引入噪声
4. 矩阵可视化
二维热图
- 正方形形式:展示完整矩阵
- 三角形形式:利用矩阵对称性,仅展示上三角或下三角
- 颜色深度:表示相互作用频率(通常log2变换或归一化)
- 常用工具:JuiceBox、HiGlass、3D Genome Browser
弧形图(Arc plot)
- 将基因组表示为一条直线
- 用弧线连接相互作用的两个位点
- 适合展示特定区域的相互作用

查看详情 →
💡

五、三维结构特征识别

concept

**1. 识别染色质区室(Compartment Calling)** **主成分分析法(PCA)**: 1. 将相互作用矩阵对期望值进行标准化 - 期望值计算:相同基因组距离的平均相互作用频率 - 标准化:观察值 / 期望值 2. 计算皮尔逊相关系数矩阵 3. 对相关系数矩阵进行PCA 4. 第一主成分(PC1)的特征值符号区分A/B区室: - PC1 > 0:A区室(活跃)...

1. 识别染色质区室(Compartment Calling)
主成分分析法(PCA)
1. 将相互作用矩阵对期望值进行标准化
- 期望值计算:相同基因组距离的平均相互作用频率
- 标准化:观察值 / 期望值
2. 计算皮尔逊相关系数矩阵
3. 对相关系数矩阵进行PCA
4. 第一主成分(PC1)的特征值符号区分A/B区室:
- PC1 > 0:A区室(活跃)
- PC1 < 0:B区室(抑制)
生物学验证
- A区室与基因密度、表达水平、GC含量正相关
- B区室与核纤层关联、晚期复制正相关
2. 识别拓扑关联结构域(TAD Calling)
方向指数法(Directionality Index, DI)
- 对于每个基因组区间(如40 kb bin),计算其向上游2 Mb和下游2 Mb的相互作用数目
- DI = (B - A) / |B - A| × [(A - E)²/E + (B - E)²/E]
- A:上游相互作用数;B:下游相互作用数;E:(A+B)/2
- DI > 0:倾向于与下游相互作用(TAD左边界)
- DI < 0:倾向于与上游相互作用(TAD右边界)
- |DI| ≈ 0:TAD内部
绝缘指数法(Insulation Score)
- 计算每个bin作为TAD边界的绝缘能力
- 绝缘指数 = 相邻两侧bin的平均相互作用 / 该bin与两侧的相互作用
- 绝缘指数最低点对应TAD边界
常用软件
- Arrowhead:Juicer工具包中的TAD识别算法
- TopDom:基于 DI 的TAD识别
- Armatus:基于动态规划的TAD识别
- lavaburst:多尺度TAD识别
3. 识别染色质环(Loop Calling)
HiCCUPS算法(Juicer工具包):
- 核心假设:染色质环处的相互作用频率显著高于周围背景
- 将候选区域划分为中心像素和周围背景区域(左、右、上、下)
- 计算中心像素与每个背景区域的比值
- 使用负二项分布检验,判断中心是否显著高于背景(通常要求>50%)
- 多重分辨率检测:在5 kb、10 kb、25 kb分辨率分别检测,合并结果
其他方法
- Fit-Hi-C:基于距离依赖模型的统计检验
- cLoops:基于局部密度聚类
- CHiCAGO:针对Capture Hi-C数据的环识别

查看详情 →
💡

六、ChIA-PET数据分析

concept

**主要步骤**: 1. 比对:将双末端标签比对到参考基因组 2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域) 3. 过滤:去除PCR重复和低质量连接 4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling 5. 环识别:基于锚点之间的连接频率,识别显著互作对 **常用工具**:ChIA-PET Tools

主要步骤
1. 比对:将双末端标签比对到参考基因组
2. 分类:将唯一比对标签分为自连接(同一基因组区域)和间连接(不同基因组区域)
3. 过滤:去除PCR重复和低质量连接
4. 富集分析:将相互作用锚点视为ChIP-Seq信号峰,进行peak calling
5. 环识别:基于锚点之间的连接频率,识别显著互作对
常用工具:ChIA-PET Tools

查看详情 →
💡

8.6 表观转录组学数据分析

section
查看详情 →
💡

一、RNA修饰的主要类型

tool

**1. 碱基修饰** **m⁶A(N⁶-甲基腺苷)**: - **分布**:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA - **共识序列**:DRACH(D = A/G/U, R = A/G, H = A/C/U) - **Writer复合物**:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)...

1. 碱基修饰
m⁶A(N⁶-甲基腺苷)
- 分布:mRNA(约0.1-0.4%的腺苷被修饰)、lncRNA、pri-miRNA
- 共识序列:DRACH(D = A/G/U, R = A/G, H = A/C/U)
- Writer复合物:METTL3(催化亚基)、METTL14(底物识别)、WTAP(调控亚基)、VIRMA/KIAA1429(底物定位)
- Eraser:FTO(肥胖相关蛋白)、ALKBH5(AlkB同源蛋白5)
- Reader:YTHDF1(促进翻译)、YTHDF2(促进降解)、YTHDF3(促进翻译)、YTHDC1(调控剪接)、YTHDC2(调控翻译)、IGF2BP1/2/3(促进稳定性)
- 功能:调控mRNA稳定性、翻译效率、剪接模式、细胞定位和相分离
m⁵C(5-甲基胞苷)
- 分布:tRNA、rRNA、mRNA
- Writer:NSUN2(tRNA和mRNA)、NSUN6(tRNA)
- Eraser:TET家族(可氧化m⁵C为hm⁵C)
- Reader:ALYREF(核输出因子)
- 功能:影响翻译效率、密码子使用、RNA结构稳定性
m¹A(N¹-甲基腺苷)
- 分布:tRNA、rRNA、mRNA
- Writer:TRMT6/61A(tRNA)、TRMT6/61B(mRNA)
- 功能:影响翻译起始和延伸
m⁷G(N⁷-甲基鸟苷)
- 分布:mRNA 5'帽子结构、rRNA、tRNA
- Writer:RNMT(mRNA帽子)、METTL1(tRNA)
- 功能:mRNA帽子识别、翻译起始
Ψ(假尿苷)
- 分布:tRNA、rRNA、snRNA、少量mRNA
- Writer:PUS酶家族(蛋白质)或snoRNP(snoRNA指导)
- 功能:增强RNA结构稳定性、影响密码子解码、调控剪接
A→I(腺苷到肌苷编辑)
- :ADAR家族(ADAR1、ADAR2)
- 功能:改变密码子(如谷氨酰胺密码子CAG变为精氨酸密码子CGG),影响蛋白质序列
2. 核糖修饰
2'-O-Me(2'-O-核糖甲基化)
- 分布:rRNA、tRNA、snRNA、部分mRNA
- Writer:snoRNP复合物(C/D box snoRNA指导)
- 功能:增强RNA对碱水解的抗性,影响翻译效率
3. 混合型修饰
m⁶Am(N⁶,2'-O-二甲基腺苷)
- 分布:mRNA 5'帽子结构
- 功能:保护mRNA 5'端,调控翻译效率

查看详情 →
💡

二、RNA修饰的生物学功能

tool

**1. 调控mRNA稳定性** - YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解 - IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA) - m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂 **2. 调控翻译效率** - 5'UTR m⁶A:促进cap-independent翻译(如热休克响应) - 3'...

1. 调控mRNA稳定性
- YTHDF2识别m⁶A修饰,招募CCR4-NOT去腺苷酸化复合物,促进mRNA降解
- IGF2BP1/2/3识别m⁶A修饰,稳定靶mRNA(如Myc mRNA)
- m⁶A修饰在5'UTR可以通过YTHDF2促进降解,在3'UTR则效应更复杂
2. 调控翻译效率
- 5'UTR m⁶A:促进cap-independent翻译(如热休克响应)
- 3'UTR m⁶A:YTHDF1/3促进翻译起始
- CDS m⁶A:通常抑制翻译延伸
- m⁵C在5'UTR:促进翻译起始
3. 调控可变剪接
- YTHDC1识别内含子m⁶A,促进外显子 inclusion
- METTL3/METTL14可以调控特定外显子的剪接
- m⁶A修饰可以影响SR蛋白的RNA结合
4. 调控RNA定位和运输
- m⁶A修饰影响mRNA的核滞留和核输出
- YTHDC1调控 circRNA的核输出
- m⁵C促进mRNA的核输出(通过ALYREF)
5. 调控细胞命运和发育
- 胚胎干细胞中m⁶A水平调控多能性维持和分化
- 精子发生、卵子成熟、神经发育等过程依赖精确的RNA修饰调控
- m⁶A缺失(Mettl3敲除)导致胚胎致死,显示其必不可少的作用
6. 与疾病的关联
- 癌症:FTO和ALKBH5在多种癌症中高表达,通过降低m⁶A水平促进肿瘤增殖
- 肥胖:FTO是第一个被发现与肥胖显著相关的基因,通过调控m⁶A影响能量代谢
- 神经退行性疾病:ADAR突变与Aicardi-Goutieres综合征、肌萎缩侧索硬化(ALS)相关
- 病毒感染:HIV等病毒利用宿主m⁶A machinery调控病毒基因表达和潜伏

查看详情 →
💡

三、表观转录组学技术

concept

**1. 基于亲和纯化的方法** **MeRIP-seq(m⁶A-seq)**: - 原理:m⁶A特异性抗体免疫沉淀 → 测序 - 分辨率:约100-200 nt(依赖片段大小) - 优点:广泛应用,可检测多种修饰 - 缺点:分辨率低,不能精确定位到单碱基 **m⁶A-label-seq**: - 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录...

1. 基于亲和纯化的方法
MeRIP-seq(m⁶A-seq)
- 原理:m⁶A特异性抗体免疫沉淀 → 测序
- 分辨率:约100-200 nt(依赖片段大小)
- 优点:广泛应用,可检测多种修饰
- 缺点:分辨率低,不能精确定位到单碱基
m⁶A-label-seq
- 原理:使用Se-烯丙基-L-硒基同型半胱氨酸替代m⁶A形成a⁶A,可被抗体富集,碘诱导环化后在反转录中产生碱基错配
- 分辨率:单碱基
- 限制:仅适用于细胞培养,不能用于组织样本
2. 基于反转录诊断事件的方法
miCLIP(m⁶A individual-nucleotide-resolution cross-linking and immunoprecipitation)
- 原理:254 nm UV交联 → m⁶A抗体免疫沉淀 → 反转录中m⁶A位点附近产生C→T突变或截断 → 测序
- 分辨率:单碱基
- 优点:分辨率高
- 缺点:交联效率低,只能鉴定部分位点
PA-m⁶A-seq
- 原理:将4SU整合到mRNA → 365 nm UV交联 → 抗体免疫沉淀 → 反转录中4SU附近U被误读为C → 约20 nt分辨率
RNA-BisSeq(m⁵C检测)
- 原理:亚硫酸盐处理RNA → 未修饰C→U,m⁵C保留 → 测序
- 注意:RNA亚硫酸盐处理条件比DNA更苛刻
Ψ检测方法
- CMC处理:羧甲基纤维素(CMC)在Ψ位点引入庞大基团,导致反转录终止
- PSI-Seq/Pseudo-Seq/CeU-Seq:基于CMC的Ψ检测方法
- RBS-Seq:亚硫酸盐处理RNA,Ψ位点产生碱基缺失
m¹A检测
- m¹A-MAP/m¹A-seq-TGIRT:基于m¹A在反转录中诱导碱基错配,使用耐高温TGIRT酶增加错配率
3. 基于化学或酶抗性的方法
RiboMeth-seq(2'-O-Me检测)
- 原理:2'-O-Me增强磷酸二酯键对碱水解的抗性 → 有2'-O-Me的位点保护相邻核苷酸不被降解 → 测序后检测保护末端
- 缺点:背景高,需要高测序深度
Nm-seq
- 原理:无2'-O-Me的3'端核苷酸被高碘酸盐氧化后降解,有2'-O-Me的则保留 → 富集3'端有2'-O-Me的片段
- 缺点:碎片化偏好性,需要多次氧化循环
Nm-REP-seq
- 原理:结合MgR酶消化(在2'-O-Me前一位停顿)和化学处理(在2'-O-Me位点停顿)→ 两种方法共同验证,降低假阳性
4. 基于第三代测序的方法
ONT纳米孔测序
- 原理:DNA/RNA通过纳米孔时产生特征性电流信号,甲基化修饰改变电流特征
- 优点:无需亚硫酸盐处理,长读长,可区分多种修饰
- 缺点:错误率较高,需要高深度
- 软件:EpiNano(用于m⁶A、Ψ、2'-O-Me鉴定)
PacBio SMRT测序
- 原理:实时监测DNA聚合酶动力学,修饰碱基影响聚合速率(脉冲间隔)和信号强度(脉冲宽度)
- 优点:单分子分辨率,可同时检测序列和修饰
- 缺点:通量较低,成本高

查看详情 →
💡

四、表观转录组学数据分析方法

concept

**1. 基于亲和纯化数据的峰识别** **exomePeak**: - 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input)) - 统计检验:C-test(基于二项分布) - 优点:考虑了整体修饰水平 **MACS2**: - 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling) - 动态泊松分布建模背景 **MeTPeak...

1. 基于亲和纯化数据的峰识别
exomePeak
- 原理:IP样本 vs. input样本,计算每个位点的修饰程度(IP / (IP + input))
- 统计检验:C-test(基于二项分布)
- 优点:考虑了整体修饰水平
MACS2
- 可直接用于RNA修饰IP数据(类似ChIP-Seq peak calling)
- 动态泊松分布建模背景
MeTPeak
- 采用分层β-二项模型模拟读段富集方差
- 使用隐马尔可夫模型解释相邻富集的依赖性
CTK
- 使用"寻谷算法"(valley-seeking)分离重叠峰
- 计算相邻局部最大值之间的谷深度,判断是否应分为两个峰
- 支持多种背景模型和扫描统计
2. 基于反转录诊断事件的单碱基鉴定
CTK/miCLIP数据分析
- 关注诊断事件:突变(C→T)、截断、缺失
- 对于每个候选位点,计算:
- k:覆盖该位点的总reads数
- m:具有特定诊断事件的reads数
- 使用排列检验(permutation test)评估显著性:
- 随机将突变插入到其他reads中(保持相对于5'端的偏移)
- 比较实际数据和排列数据中(k, m)的分布
- 为每个位点分配经验FDR
- 额外过滤:排除与已知SNP重叠的位点,检查"RRAC"模体(m⁶A consensus)
PARalyzer
- 分析用户指定的突变类型
- 通过聚类和统计检验识别高置信度修饰位点
3. 基于化学/酶抗性的数据鉴定
endSeeker(Nm-REP-seq数据分析)
- 计算每个转录本位置的3'端覆盖度
- 候选位点应满足:
- 覆盖度显著高于上下游各1 nt
- 覆盖度显著高于对照组(未处理样本)
- 计算四个变量:
- upFC = 候选位点覆盖度 / 上游1 nt覆盖度
- downFC = 候选位点覆盖度 / 下游1 nt覆盖度
- upCtrlFC = upFC / 对照组upFC
- downCtrlFC = downFC / 对照组downFC
- 结合四个变量筛选高置信度2'-O-Me位点
4. 基于第三代测序的修饰鉴定
EpiNano-Error模式
- 比较修饰酶敲除/敲低样本与野生型样本
- 分析碱基识别错误(突变、缺失、插入)的频率差异
- 基于错误模式差异预测修饰位点
EpiNano-SVM模式
- 使用已知修饰位点训练SVM模型
- 提取纳米孔测序信号特征(电流、持续时间等)
- 预测新样本中的修饰位点
5. RNA修饰位点分布分析
Meta-gene分析(MetaPlotR)
- 将转录本坐标归一化为元坐标:
- 5'UTR:0-1
- CDS:1-2
- 3'UTR:2-3
- 绘制修饰位点在元基因模型上的分布
- 揭示修饰特征:如m⁶A在终止密码子附近富集
Motif分析
- m⁶A:"RRAC" consensus motif
- 在鉴定位点周围搜索显著富集的序列模式
- 使用MEME、DREME等工具
6. 差异RNA修饰分析
Differential m⁶A分析
- 比较两组样本(如疾病 vs. 正常)的m⁶A水平
- 方法:exomePeak2、MeTDiff、QNB(基于β-二项模型)
- 输出:差异甲基化位点或区域,以及关联的基因

查看详情 →
💡

8.7 转录调控和表观遗传的总结与展望

section
查看详情 →
💡

一、表观遗传信息的交叉对话

concept

**1. DNA甲基化与组蛋白修饰的互作** **DNA甲基化 → 组蛋白修饰**: - 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩 - DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3 **组蛋白修饰 → DNA甲基化**: - H3K4me3可以阻止DNMT3L与核小体结合,...

1. DNA甲基化与组蛋白修饰的互作
DNA甲基化 → 组蛋白修饰
- 甲基化CpG可以被MBD蛋白(如MeCP2)识别,招募HDAC和SIN3A复合物,导致去乙酰化和染色质压缩
- DNMT3A/3B可以与EZH2(PRC2)相互作用,在新靶基因上同时建立DNA甲基化和H3K27me3
组蛋白修饰 → DNA甲基化
- H3K4me3可以阻止DNMT3L与核小体结合,从而抑制DNA甲基化(保护CpG岛)
- H3K36me3可以招募DNMT3B,促进基因体的DNA甲基化
- H3K9me3可以招募DNMT3A/3B,促进异染色质区域的DNA甲基化
2. 组蛋白修饰之间的交叉对话
H3K4me3与H3K27me3的双价修饰
- PRC2复合物(EZH2)在H3K4me3存在时活性受抑
- KDM5B(H3K4me3去甲基化酶)可以与PRC2协同,使H3K4me3减少,H3K27me3增加
- 这种动态平衡决定了基因的"预备态"或"激活态"
H3K9me3与H3K27me3的互斥
- H3K9me3(异染色质)和H3K27me3(多梳抑制)通常不共存
- 在特定发育阶段,H3K27me3标记的基因可以转变为H3K9me3标记,实现从"可逆沉默"到"不可逆沉默"的转换
3. 三维基因组与表观遗传修饰的互作
CTCF与Cohesin的协同
- CTCF结合到基因组特定位置,作为Cohesin复合物的"锚点"
- Cohesin通过"环挤压"(loop extrusion)机制将DNA拉成环,直到遇到另一个CTCF位点
- 环的形成使增强子和启动子空间接近,促进转录激活
- CTCF位点的甲基化或突变可以破坏环化,导致增强子异位调控
TAD边界与表观遗传状态
- TAD边界通常富含CTCF和H3K4me3,处于活跃状态
- TAD内部的表观遗传状态可以多样化,但边界维持域内的一致性
- TAD边界破坏后,域内的表观遗传信息可以"泄漏"到相邻TAD
4. RNA修饰与表观遗传的互作
m⁶A与DNA甲基化的互作
- METTL3可以催化染色质相关RNA(caRNA)的m⁶A修饰
- caRNA的m⁶A修饰可以招募YTHDC1,促进染色质开放和转录激活
- 在某些基因上,m⁶A修饰与DNA去甲基化协同作用
m⁶A与组蛋白修饰的互作
- H3K36me3由SETD2催化,可以招募METTL3/14,促进新生RNA的m⁶A修饰
- 这种耦合机制确保了活跃转录基因的高m⁶A水平

查看详情 →
💡

二、多组学整合分析策略

concept

**1. 数据整合层次** **基因组层次**: - 结合基因组变异(SNP、CNV、SV)和表观遗传数据 - 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL) **转录调控层次**: - 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本) - 构建转录调控网络:TF → 表观遗传 → 基因表达 **表观遗传层次**: - 整合DNA...

1. 数据整合层次
基因组层次
- 结合基因组变异(SNP、CNV、SV)和表观遗传数据
- 分析变异对表观遗传状态的影响(如eQTL、caQTL、meQTL)
转录调控层次
- 整合ChIP-seq(TF、组蛋白)、ATAC-seq(染色质可及性)、RNA-seq(转录本)
- 构建转录调控网络:TF → 表观遗传 → 基因表达
表观遗传层次
- 整合DNA甲基化、组蛋白修饰、三维结构、RNA修饰
- 构建多层表观遗传调控图谱
2. 整合分析方法
关联分析
- 相关性分析:表观遗传特征与基因表达的相关性
- 回归分析:预测基因表达的最优表观遗传特征组合
- 因果推断:使用中介分析或孟德尔随机化推断因果关系
网络分析
- 构建多组学调控网络(如ARACNE、WGCNA)
- 识别多组学模块(multi-omics modules)
- 模块富集分析:揭示协同调控的功能通路
机器学习
- 使用随机森林、梯度提升树、深度学习等方法整合多组学特征
- 预测基因表达、细胞状态或疾病风险
- 特征重要性分析:识别关键调控因子

查看详情 →
💡

三、单细胞表观基因组学

concept

**1. 单细胞技术** **scATAC-seq**: - 原理:Tn5转座酶切割开放染色质,加入测序接头 - 应用:单细胞染色质可及性分析 - 特点:检测数千个单细胞,揭示细胞类型特异性调控元件 **scRNA-seq + 表观遗传整合**: - 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq) - 揭示转录异质性的...

1. 单细胞技术
scATAC-seq
- 原理:Tn5转座酶切割开放染色质,加入测序接头
- 应用:单细胞染色质可及性分析
- 特点:检测数千个单细胞,揭示细胞类型特异性调控元件
scRNA-seq + 表观遗传整合
- 同时测量单个细胞的转录组和表观遗传状态(如scNMT-seq:scRNA-seq + scWGBS + scATAC-seq)
- 揭示转录异质性的表观遗传基础
scHi-C
- 原理:在单细胞中进行Hi-C实验
- 挑战:需要极高的灵敏度(每个细胞仅有一份基因组)
- 应用:揭示细胞间三维结构的异质性
2. 单细胞数据分析挑战
数据稀疏性
- 单个细胞中只有部分基因组区域被检测到(如scATAC-seq中每个细胞仅约1,000-10,000个开放位点)
- 需要专门的降维和插补方法(如LSA、cisTopic、SnapATAC)
批次效应
- 不同实验批次、不同 donor 之间的技术差异
- 整合方法:Harmony、Seurat CCA、LIGER、scVI
细胞类型鉴定
- 基于染色质可及性峰进行聚类和注释
- 使用基因活性评分(peak-to-gene linkage)推断细胞类型

查看详情 →
💡

四、长读长表观遗传测序

concept

**1. 纳米孔测序(ONT)在表观遗传中的应用** **DNA甲基化检测**: - 直接检测5-mC和5-hmC,无需亚硫酸盐处理 - 可以区分CpG、CHG和CHH甲基化 - 同时检测DNA序列和甲基化信息 **RNA修饰检测**: - 直接检测m⁶A、Ψ、2'-O-Me等修饰 - 保留全长RNA信息,包括可变剪接和融合基因 - 软件:EpiNano、Nanocompore、Tombo **优...

1. 纳米孔测序(ONT)在表观遗传中的应用
DNA甲基化检测
- 直接检测5-mC和5-hmC,无需亚硫酸盐处理
- 可以区分CpG、CHG和CHH甲基化
- 同时检测DNA序列和甲基化信息
RNA修饰检测
- 直接检测m⁶A、Ψ、2'-O-Me等修饰
- 保留全长RNA信息,包括可变剪接和融合基因
- 软件:EpiNano、Nanocompore、Tombo
优势
- 长读长(可达数百万bp)可以跨越重复序列和复杂区域
- 单分子分辨率揭示等位基因特异性修饰
- 可以检测结构变异和甲基化的同时存在
挑战
- 错误率较高(约5-10%),需要高深度覆盖
- 碱基识别和修饰检测的准确性仍在改进中
- 成本和通量与二代测序相比仍有差距
2. PacBio SMRT在表观遗传中的应用
DNA甲基化检测
- 通过IPD(interpulse duration)和PW(pulse width)检测甲基化
- 可以检测m⁶A(腺嘌呤甲基化)和4-mC(胞嘧啶甲基化)
- 在细菌中应用广泛,真核生物中主要用于m⁶A检测

查看详情 →
💡

五、人工智能在表观遗传学中的应用

concept

**1. 表观遗传数据预测** **DNA甲基化预测**: - DeepSignal:基于深度学习的纳米孔测序甲基化检测 - CpG Transformer:利用Transformer模型预测CpG甲基化状态 **组蛋白修饰预测**: - DeepSEA:从DNA序列预测染色质特征 - ChromatinNN:基于图神经网络预测染色质状态 **三维结构预测**: - 使用CNN和Transform...

1. 表观遗传数据预测
DNA甲基化预测
- DeepSignal:基于深度学习的纳米孔测序甲基化检测
- CpG Transformer:利用Transformer模型预测CpG甲基化状态
组蛋白修饰预测
- DeepSEA:从DNA序列预测染色质特征
- ChromatinNN:基于图神经网络预测染色质状态
三维结构预测
- 使用CNN和Transformer预测Hi-C接触矩阵
- 从DNA序列预测TAD边界和环化位点
2. 多模态数据整合
多组学深度学习
- MOFA+:基于变分自编码器的多组学因子分析
- VAE-based integration:使用变分自编码器整合多组学数据
- 优势:可以处理缺失数据,发现非线性关系
3. 单细胞数据分析
scVI(Single-cell Variational Inference)
- 基于变分自编码器的单细胞数据整合和降维
- 可以处理多批次、多组学数据
- 应用:单细胞多组学整合、批次校正、缺失插补
AI在表观遗传中的挑战
- 数据标注困难,监督学习受限
- 需要解释性AI来理解生物学机制
- 模型的泛化能力受限于训练数据的多样性

查看详情 →