🔧
tool
示例:一个完整的RNA-seq分析项目
假设我们要比较某种处理条件下(Treatment)和对照(Control)的基因表达差异,每组3个生物学重复。 **项目结构**: ``` rnaseq_project/ ├── data/ │ ├── raw/ # 原始测序数据(FASTQ) │ ├── reference/ # 参考基因组和注释文件 │ └── processed/...
📖 定义
假设我们要比较某种处理条件下(Treatment)和对照(Control)的基因表达差异,每组3个生物学重复。
项目结构:
rnaseq_project/
├── data/
│ ├── raw/ # 原始测序数据(FASTQ)
│ ├── reference/ # 参考基因组和注释文件
│ └── processed/ # 处理后的数据
├── scripts/ # 分析脚本
│ ├── 01_qc.sh
│ ├── 02_alignment.sh
│ ├── 03_quantification.sh
│ └── 04_de_analysis.R
├── results/ # 分析结果
│ ├── qc_reports/
│ ├── bam_files/
│ ├── counts/
│ └── de_results/
├── envs/ # 环境配置文件
│ └── rnaseq_env.yml
├── README.md # 项目说明文档
└── Snakefile # Snakemake工作流文件
分析流程概览:
# 第一步:质量控制
fastqc data/raw/*.fastq.gz -o results/qc_reports/
multiqc results/qc_reports/ -o results/qc_reports/summary/
# 第二步:序列比对
hisat2 -p 8 -x reference/genome -1 sample_R1.fq.gz -2 sample_R2.fq.gz | \
samtools sort -@ 4 -o results/bam_files/sample.bam
# 第三步:表达量定量
featureCounts -T 8 -a reference/genes.gtf -o results/counts/counts.txt \
results/bam_files/*.bam
# 第四步:差异表达分析(在R中完成)
# DESeq2分析