💡 concept

二、SV检测的四种主要策略

**(1)基于Read深度(Read Depth, RD)的方法** 原理:测序深度与基因组拷贝数成正比。 - 缺失区域:reads深度显著低于平均值(约50%对于杂合缺失) - 重复区域:reads深度显著高于平均值 **代表软件**:CNVnator、BIC-seq、CNV-seq、DELLY(结合RD和PE) **优点**: - 可以检测大尺度的CNV - 计算相对简单 **局限**: -...

📖 定义

(1)基于Read深度(Read Depth, RD)的方法
原理:测序深度与基因组拷贝数成正比。
- 缺失区域:reads深度显著低于平均值(约50%对于杂合缺失)
- 重复区域:reads深度显著高于平均值
代表软件:CNVnator、BIC-seq、CNV-seq、DELLY(结合RD和PE)
优点
- 可以检测大尺度的CNV
- 计算相对简单
局限
- 无法精确定位断点(只能确定区域)
- 无法检测平衡性SV(如倒位、易位不改变拷贝数)
- 受GC含量、比对偏好等因素影响
(2)基于Split Read(SR)的方法
原理:识别一条read的两部分分别比对到不同位置的"split reads",从而精确定位断点。
代表软件:Pindel、DELLY、LUMPY、Manta
工作流程
1. 提取未完全比对或部分比对的reads(soft-clipped reads)
2. 将未比对部分重新比对到基因组其他位置
3. 如果找到匹配,确定断点坐标
优点
- 断点定位精确(可达bp级别)
- 可以检测小至50 bp的SV
局限
- 只能检测被reads跨越的SV
- 需要足够长的reads(对Illumina短读长有限制)
(3)基于Paired-End(PE)的方法
原理:利用paired-end测序中insert size和方向的异常来检测SV。
正常配对特征:
- 两个read在同一染色体上
- 方向相对(read1正向,read2反向)
- 距离在预期insert size范围内
异常配对类型及对应的SV:
| 异常类型 | 提示的SV |
|---------|---------|
| 距离远大于预期 | 缺失(reads跨越了被删除的区域) |
| 距离远小于预期 | 插入(reads之间的区域被插入序列替代) |
| 方向相同 | 倒位 |
| 位于不同染色体 | 易位 |
代表软件:DELLY、LUMPY、BreakDancer、Manta
优点
- 可以检测大尺度SV
- 对read长度要求不高
局限
- 断点定位不精确(通常在数百bp范围内)
- 受insert size分布的影响
(4)基于de novo组装的方法
原理:对SV区域进行局部de novo组装,将组装结果与参考基因组比对来识别SV。
代表软件:TIGRA、MindTheGap、SMRT-SV(PacBio专用)、Sniffles(Nanopore专用)
优点
- 可以检测最复杂的SV,包括串联重复扩增、倒位等
- 可以获得SV的完整序列
局限
- 计算资源需求大
- 组装质量依赖于数据质量和覆盖度