三、表达量定量
**(1)基于count的方法** 统计比对到每个基因区域的reads数。 - **featureCounts**:快速、准确,广泛使用的计数工具 - **HTSeq-count**:早期标准工具,灵活性高 **(2)基于比对的定量(RPKM/FPKM/TPM)** 原始count需要标准化才能进行样本内和样本间比较: - **RPKM(Reads Per Kilobase of exon per...
📖 定义
(1)基于count的方法
统计比对到每个基因区域的reads数。
- featureCounts:快速、准确,广泛使用的计数工具
- HTSeq-count:早期标准工具,灵活性高
(2)基于比对的定量(RPKM/FPKM/TPM)
原始count需要标准化才能进行样本内和样本间比较:
- RPKM(Reads Per Kilobase of exon per Million mapped reads):
$$RPKM = \frac{ reads \times 10^9 }{ gene_length \times total_mapped_reads }$$
- FPKM(Fragments Per Kilobase of exon per Million mapped fragments):
与RPKM类似,但使用fragment(pair-end测序中的一对reads)代替reads
- TPM(Transcripts Per Million):
$$TPM_i = \frac{ RPKM_i }{ \sum_j RPKM_j } \times 10^6$$
TPM vs FPKM的关键区别:
- FPKM先标准化到总reads数,再除以基因长度
- TPM先除以基因长度得到RPKM-like值,再标准化到总和为10⁶
- TPM的优势:所有样本的TPM总和相同(10⁶),更适合样本间比较
- FPKM的问题:样本间总FPKM不同,受高表达基因影响大
(3)基于转录本估计的定量(Salmon, Kallisto, RSEM)
不依赖基因组比对,直接从reads推断转录本丰度:
- 使用伪比对(pseudoalignment)或EM算法
- 速度极快(Kallisto比传统方法快约100倍)
- 可直接输出TPM值