🔧 tool

一、16S rRNA数据分析流程

``` 原始测序数据 (FASTQ) ↓ 质量控制 (FastQC, cutadapt) ↓ 去接头、去低质量、去嵌合体 (DADA2/Deblur/QIIME2) ↓ 生成ASV/OTU表 ↓ 物种注释 (SILVA/Greengenes/RDP数据库) ↓ 多样性分析 (α, β) ↓ 统计分析 (LEfSe, ANCOM, DESeq2)...

📖 定义

原始测序数据 (FASTQ)
    ↓
质量控制 (FastQC, cutadapt)
    ↓
去接头、去低质量、去嵌合体 (DADA2/Deblur/QIIME2)
    ↓
生成ASV/OTU表
    ↓
物种注释 (SILVA/Greengenes/RDP数据库)
    ↓
多样性分析 (α, β)
    ↓
统计分析 (LEfSe, ANCOM, DESeq2)
    ↓
可视化 (phyloseq, ggplot2)

(1)DADA2去噪算法
DADA2(Divisive Amplicon Denoising Algorithm 2)通过以下步骤生成ASV:
1. 质控过滤:去除低质量和含N的reads
2. 去重复:将相同序列合并,记录丰度
3. 错误学习:从数据中估计测序错误模型
4. 去噪:将含错误的序列纠正回其真实序列
5. 去嵌合体:识别并去除PCR嵌合体
6. 合并双端reads
(2)OTU聚类 vs ASV
- OTU聚类以97%相似性为阈值,将序列分组。缺点:阈值是人为设定的;近缘种可能因高于阈值而无法区分;信息在聚类过程中丢失
- ASV保留了每个独特的真实序列,分辨率更高,且可重复性更好