生物信息学应用

4 个小节 · 29 个知识点

精准医学

💡

第12章 生物信息学应用

chapter
查看详情 →
💡

12.1 精准医学

section
查看详情 →
💡

基因组医学的原理

concept

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析: 1. **变异检测**:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。 2. *...

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析:
1. 变异检测:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。
2. 变异注释:使用ANNOVAR、VEP(Variant Effect Predictor)等工具对检测到的变异进行功能注释,判断变异位于基因组的什么位置(编码区、非编码区、调控区)、是否改变氨基酸序列(同义突变、错义突变、无义突变、移码突变)等。
3. 致病性评估:结合人群频率数据库(如gnomAD)、致病性预测工具(如SIFT、PolyPhen-2、CADD)和临床数据库(如ClinVar、OMIM),评估变异的致病可能性。
4. 多组学整合:将基因组数据与转录组(RNA-seq)、蛋白质组、代谢组等数据整合,构建全面的分子图谱。

查看详情 →
💡

肿瘤基因组学的原理

concept

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括: 1. **肿瘤-正常配对分析**:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。 2. **突变特征分析**:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺...

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括:
1. 肿瘤-正常配对分析:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。
2. 突变特征分析:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺陷)会产生特定的突变模式,称为突变特征(mutational signatures)。通过分解突变谱,可以推断肿瘤的致突变因素。
3. 驱动突变识别:并非所有突变都对肿瘤发展有贡献。乘客突变(passenger mutations)是随机累积的,而驱动突变(driver mutations)则赋予细胞生长优势。生物信息学工具如OncodriveCLUST、MutSigCV通过统计方法识别显著的驱动突变。
4. 肿瘤异质性分析:肿瘤内部存在多个亚克隆,每个亚克隆具有不同的突变谱。通过PyClone、SciClone等工具可以重建肿瘤进化树,理解治疗耐药性的产生机制。

查看详情 →
💡

药物基因组学的原理

concept

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控: 1. **药物代谢酶**:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。 2. **药物转运体**:ABCB1(MDR1)、SLC...

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控:
1. 药物代谢酶:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。
2. 药物转运体:ABCB1(MDR1)、SLCO1B1等转运体基因的多态性影响药物的吸收和分布。
3. 药物靶点:VKORC1基因变异影响华法林的靶点敏感性,决定抗凝治疗剂量。
4. 剂量预测模型:基于患者的基因型和临床特征(年龄、体重、合并用药等),建立剂量预测算法,如华法林剂量预测模型整合VKORC1和CYP2C9基因型信息。

查看详情 →
💡

案例一:新生儿罕见病基因组诊断

concept

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。 分析流程: 1. WES测序(约2×10^7 reads...

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。
分析流程:
1. WES测序(约2×10^7 reads,150bp paired-end)
2. BWA-MEM比对到GRCh38参考基因组
3. GATK HaplotypeCaller检测变异
4. VEP注释变异效应
5. 过滤:保留罕见变异(gnomAD AF<0.01)、蛋白截断或错义变异
6. 候选基因筛选:聚焦代谢疾病相关基因 panel
7. Sanger测序验证突变

查看详情 →
💡

案例二:非小细胞肺癌的精准治疗

concept

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。 融合基因检测流程: 1. RNA-seq数据质控...

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。
融合基因检测流程:
1. RNA-seq数据质控(FastQC)
2. STAR比对(使用chimeric alignment模式)
3. STAR-Fusion或Arriba检测融合基因
4. 可视化验证(IGV查看融合断点)
5. 临床解读(OncoKB数据库查询靶向药物)

查看详情 →
💡

案例三:华法林个体化给药

concept

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C9*1/*3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C91/3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

查看详情 →
💡

12.2 智能药学

section
查看详情 →
💡

药物靶点发现的生物信息学策略

concept

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略: **1. 基因组学方法** - **全基因组关联分析(GWAS)**:通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。 - **表达数量性状位点(eQTL)分析**:将GWAS发现的疾病关联位点与...

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略:
1. 基因组学方法
- 全基因组关联分析(GWAS):通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。
- 表达数量性状位点(eQTL)分析:将GWAS发现的疾病关联位点与基因表达数据整合,推断因果基因。
2. 网络药理学方法
- 疾病模块识别:利用蛋白质相互作用网络(PPI),识别与疾病相关的功能模块。一个理想的药物靶点应位于疾病模块的中心位置(高介数中心性),干扰它可以最大程度地影响疾病进程。
- 网络邻近性分析:计算药物靶点与疾病基因在网络中的距离,预测药物重定位(drug repurposing)的可能性。
3. 多组学整合方法
- 整合基因组、转录组、蛋白质组和代谢组数据,构建多层次的疾病分子图谱,系统性地识别关键节点作为潜在靶点。
- 差异表达分析(如DESeq2、edgeR)识别疾病状态下显著上调或下调的基因。
4. 靶点可药性评估
- 并非所有与疾病相关的蛋白都是好的药物靶点。可药性(druggability)评估考虑:是否有适合小分子结合的口袋、靶点的组织特异性表达、靶向该靶点是否会产生严重毒副作用等。
- 工具如DrugMAP、canSAR数据库提供蛋白质可药性预测。

查看详情 →
💡

计算机辅助药物设计的原理

concept

**基于结构的药物设计(SBDD)** SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为: 1. **靶点结构准备**:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。 2. **活性位点识别**:使用Fpocket、SiteMap等工具预测结合口袋。 3. **虚拟筛选**:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口...

基于结构的药物设计(SBDD)
SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为:
1. 靶点结构准备:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。
2. 活性位点识别:使用Fpocket、SiteMap等工具预测结合口袋。
3. 虚拟筛选:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口袋,根据对接打分排序。
4. 先导化合物优化:基于对接结果和相互作用分析,进行结构修饰以提高活性、选择性和成药性。
基于配体的药物设计(LBDD)
当靶点结构未知时,可以利用已知活性配体的信息:
1. 药效团建模:提取活性分子共同的化学特征(氢键供体/受体、疏水中心、芳环中心)及其空间排布,建立药效团模型,用于数据库搜索。
2. 定量构效关系(QSAR):建立分子描述符与生物活性之间的统计模型,预测新化合物的活性。
3. 分子相似性搜索:基于"相似结构的分子具有相似活性"的原则,在化学空间中搜索与已知活性分子相似的化合物。

查看详情 →
💡

分子对接的原理

concept

分子对接模拟配体与受体的结合过程,包括两个核心问题: **1. 构象搜索(Pose Prediction)** - 在构象空间中搜索配体的最优结合姿态。 - 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。 - 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。 **2. 结合亲和力预测(Scoring...

分子对接模拟配体与受体的结合过程,包括两个核心问题:
1. 构象搜索(Pose Prediction)
- 在构象空间中搜索配体的最优结合姿态。
- 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。
- 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。
2. 结合亲和力预测(Scoring)
- 打分函数评估每个结合姿态的亲和力,用于排序。
- 打分函数类型:
- 力场打分:基于分子力学能量项(范德华力、静电相互作用)
- 经验打分:拟合实验数据得到的加权能量项
- 知识-based打分:基于蛋白质-配体复合物结构数据库的统计势能
- 机器学习打分:使用RF、SVM、CNN等算法学习结构-亲和力关系
常用分子对接软件包括AutoDock Vina、Glide、GOLD、rDock等。

查看详情 →
💡

AI药物设计的原理

concept

**1. 生成式分子设计** - **变分自编码器(VAE)**:学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。 - **生成对抗网络(GAN)**:生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。 - **强化学习(RL)**:将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。 - **扩散模型(Diff...

1. 生成式分子设计
- 变分自编码器(VAE):学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。
- 生成对抗网络(GAN):生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。
- 强化学习(RL):将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。
- 扩散模型(Diffusion Model):目前最先进的生成模型,通过逐步去噪生成高质量分子,在3D分子生成方面表现优异。
2. 分子性质预测
- 图神经网络(GNN):将分子表示为图(原子为节点,键为边),利用消息传递机制学习分子表征,预测生物活性、毒性、药代动力学性质(ADMET)。
- Transformer架构:如ChemBERTa、MolBERT,将SMILES字符串作为输入序列,利用自注意力机制学习化学语言模型。
3. 蛋白质结构预测
- AlphaFold2:利用注意力机制和多序列比对(MSA)实现接近实验精度的蛋白质结构预测,为SBDD提供了前所未有的结构基础。
- RoseTTAFold:另一种高精度蛋白质结构预测方法。

查看详情 →
💡

案例一:COVID-19靶点发现与药物重定位

concept

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点: 1. **基因组注释**:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。 2. **人类-病毒蛋白质相互作用**:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式...

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点:
1. 基因组注释:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。
2. 人类-病毒蛋白质相互作用:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式,预测关键宿主因子(如ACE2受体、TMPRSS2)。
3. 药物重定位:通过网络邻近性分析,筛选已上市药物中可能有效对抗SARS-CoV-2的候选药物。例如,基于病毒-宿主相互作用网络,预测氯喹和瑞德西韦(Remdesivir)可能有效(后续临床试验验证了瑞德西韦的疗效)。
4. 虚拟筛选:以Mpro为靶点,对ZINC数据库进行虚拟筛选,识别潜在抑制剂。德国研究团队通过高通量X射线晶体学筛选,发现了Mpro抑制剂的前导化合物。

# 使用RDKit进行分子对接准备示例
from rdkit import Chem
from rdkit.Chem import AllChem
# 读取配体分子
ligand = Chem.MolFromSmiles("CC(C)Cc1ccc(cc1)C(C)C(=O)O")  # 布洛芬
ligand = Chem.AddHs(ligand)
AllChem.EmbedMolecule(ligand, AllChem.ETKDG())
# 保存为PDB格式用于对接
Chem.MolToPDBFile(ligand, "ligand.pdb")
查看详情 →
💡

案例二:AlphaFold驱动的药物设计——靶向KRAS G12C

algorithm

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。 1. **结构解析**:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。 2. **共价抑制剂设计**:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sot...

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。
1. 结构解析:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。
2. 共价抑制剂设计:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sotorasib(AMG 510)和Adagrasib(MRTX849)通过共价结合Cys12,将KRAS锁定在非活性状态。
3. AI优化:利用机器学习模型预测化合物的选择性、代谢稳定性和口服生物利用度,优化先导化合物。
这一案例展示了从"不可成药"到"可成药"的转变如何依赖于精准的结构信息和计算设计。

查看详情 →
💡

案例三:AI生成全新抗生素——Halicin的发现

concept

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin: 1. **训练数据**:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。 2. **虚拟筛选**:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。 3. **实验验证**:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝...

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin:
1. 训练数据:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。
2. 虚拟筛选:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。
3. 实验验证:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝杆菌)表现出强效杀菌活性,且与现有抗生素无交叉耐药性。
4. 作用机制:后续研究表明Halicin通过干扰细菌的质子动力势发挥作用,这是一种全新的作用机制。

# 使用DeepChem进行分子性质预测示例
import deepchem as dc
from deepchem.models import GraphConvModel
# 加载Tox21毒性数据集
tasks, datasets, transformers = dc.molnet.load_tox21()
train_dataset, valid_dataset, test_dataset = datasets
# 构建图卷积网络模型
model = GraphConvModel(
    n_tasks=len(tasks),
    mode='classification',
    batch_size=64,
    learning_rate=0.001
)
# 训练模型
model.fit(train_dataset, nb_epoch=20)
查看详情 →
💡

12.3 智能育种

section
查看详情 →
💡

基因组选择(GS)的原理

concept

**1. 基本概念** 基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。 假设个体的表型值P可以分解为: P = μ + g + e 其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。 GS的目标是利用标记基因型X来预测遗传效应...

1. 基本概念
基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。
假设个体的表型值P可以分解为:
P = μ + g + e
其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。
GS的目标是利用标记基因型X来预测遗传效应g:
g = Xβ + ε
其中,β为标记效应向量。
2. 统计模型
基因组选择的核心是估计每个标记的效应。由于标记数(p,通常为数千至数百万)远大于个体数(n,数百至数千),传统的最小二乘法无法直接使用,需要借助特殊统计方法:
- 岭回归最佳线性无偏预测(RR-BLUP):假设所有标记效应服从正态分布,通过L2正则化(岭回归)解决过拟合问题。计算速度快,是GS的基准方法。
- 贝叶斯方法(BayesA、BayesB、Bayesian LASSO等):假设标记效应服从不同的先验分布。BayesB假设只有少数标记具有大效应(大部分标记效应为0),更符合真实遗传架构。
- GBLUP(Genomic BLUP):利用标记信息构建基因组关系矩阵G,替代传统的系谱关系矩阵A,进行最佳线性无偏预测。
- 机器学习算法:随机森林(RF)、支持向量机(SVM)、神经网络等也被用于GS,在处理非加性遗传效应时可能优于线性模型。
3. 实施流程
(1) 训练群体构建:选择具有代表性的群体,测定高密度SNP基因型和目标性状表型。
(2) 统计模型训练:利用训练数据估计标记效应。
(3) 育种值预测:对候选个体(仅有基因型)计算GEBV。
(4) 选择决策:根据GEBV排名,选择最优个体进入下一代。
(5) 模型更新:定期用新收集的表型数据更新预测模型,保持预测准确性。
4. 影响预测准确性的因素
- 训练群体大小:一般而言,训练群体越大,预测准确性越高。
- 训练群体与候选群体的亲缘关系:关系越近,预测越准确。
- 性状遗传力:遗传力越高,GS效果越好。
- 标记密度:需要足够密度的标记覆盖全基因组,捕获LD信息。
- 性状遗传架构:由大量微效基因控制的性状更适合GS。

查看详情 →
💡

分子标记辅助育种的原理

concept

**1. QTL定位** 数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。 常用方法: - **单标记分析(SMA)**:检验单个标记与性状的关联 - **区间作图(IM)**:利用两侧标记信息,检测标记区间内的QTL - **复合区间作图(...

1. QTL定位
数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。
常用方法:
- 单标记分析(SMA):检验单个标记与性状的关联
- 区间作图(IM):利用两侧标记信息,检测标记区间内的QTL
- 复合区间作图(CIM):在区间作图基础上,加入背景标记控制多QTL效应
- 全基因组关联分析(GWAS):利用自然群体中的连锁不平衡(LD),不需要构建专门的家系
2. MAS(Marker-Assisted Selection)策略
- 前景选择:利用与目标QTL紧密连锁的标记,选择携带有利等位基因的个体。
- 背景选择:利用全基因组标记,监测轮回亲本的基因组恢复程度,加速回交育种进程。
- 基因聚合(Gene Pyramiding):将多个有利基因/QTL聚合到同一个品种中。
3. 标记类型
从RFLP、AFLP、SSR发展到目前的SNP(单核苷酸多态性)。SNP标记具有密度高、分布广、自动化检测等优点,已成为MAB和GS的主流标记。

查看详情 →
💡

种质资源鉴定的原理

concept

**1. 遗传多样性分析** - **群体结构分析**:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。 - **主成分分析(PCA)**:降维可视化种质间的遗传关系。 - **进化树构建**:基于遗传距离构建系统发育树,揭示种质的亲缘关系。 **2. 核心种质构建** - 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。 - 常用策略:基于遗传...

1. 遗传多样性分析
- 群体结构分析:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。
- 主成分分析(PCA):降维可视化种质间的遗传关系。
- 进化树构建:基于遗传距离构建系统发育树,揭示种质的亲缘关系。
2. 核心种质构建
- 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。
- 常用策略:基于遗传距离的逐步聚类采样、基于等位基因覆盖率的优化算法。
3. 指纹图谱构建
- 利用一组高度多态性的SSR或SNP标记,为每个品种建立独特的DNA指纹。
- 用于品种真实性鉴定、纯度检测和知识产权保护。
4. 优异等位基因发掘
- 通过GWAS或候选基因关联分析,在种质资源中挖掘与重要农艺性状相关的优异等位基因。
- 这些优异等位基因可作为分子标记辅助育种或转基因育种的靶点。

查看详情 →
💡

案例一:玉米基因组选择育种

concept

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测: 1. **训练群体**:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。 2. **模型建立**:使用rrBLUP或BayesB模型训练。 3. **预测应用**:对新合成的杂交组合(仅有基因型)预测配合力。 4. **效果**:GS可将育种周期从传统的5-6年缩短至2-3年,预...

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测:
1. 训练群体:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。
2. 模型建立:使用rrBLUP或BayesB模型训练。
3. 预测应用:对新合成的杂交组合(仅有基因型)预测配合力。
4. 效果:GS可将育种周期从传统的5-6年缩短至2-3年,预测准确性达到0.5-0.8(取决于性状和群体)。

# 使用rrBLUP包进行基因组选择
library(rrBLUP)
# 读取基因型矩阵(n×m,n个体,m标记)和表型
marker_data <- read.table("snps.txt", header=TRUE)
phenotype <- read.table("yield.txt", header=TRUE)
# 训练模型
model <- mixed.solve(y=phenotype$yield, Z=marker_data)
# 预测育种值
gebv <- marker_data %*% model$u
查看详情 →
💡

案例二:水稻分子标记辅助抗病育种

concept

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。 1. **标记开发**:开发与Xa21紧密连锁的PCR标记(如PTA248)。 2. **前景选择**:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。 3. **背景选择**:利用全基因组SNP标记,选择轮回亲本基因...

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。
1. 标记开发:开发与Xa21紧密连锁的PCR标记(如PTA248)。
2. 前景选择:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。
3. 背景选择:利用全基因组SNP标记,选择轮回亲本基因组恢复率最高的个体。
4. 结果:仅需2-3个回交世代即可获得基因组恢复率>95%的抗性近等基因系,而传统回交需要6-7代。

# Xa21前景选择PCR标记检测
# 引物序列:正向 5'-GCTCGATCGATAATGGAAGG-3'
#          反向 5'-TTGGTGATGGTTCGACGAGC-3'
PCR反应体系(20 μL):
- 2× PCR Mix: 10 μL
- 正向引物 (10 μM): 0.5 μL
- 反向引物 (10 μM): 0.5 μL
- DNA模板 (50 ng/μL): 1 μL
- ddH2O: 8 μL
PCR程序:
94°C 5min
[94°C 30s → 55°C 30s → 72°C 1min] × 35 cycles
72°C 7min
预期结果:携带Xa21的个体扩增出约500 bp的条带
查看详情 →
💡

案例三:小麦种质资源的遗传多样性分析

concept

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布: 1. **SNP基因型**:使用35K SNP芯片对约8,000份核心种质进行基因分型。 2. **群体结构**:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。 3. **多样性评估**:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基...

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布:
1. SNP基因型:使用35K SNP芯片对约8,000份核心种质进行基因分型。
2. 群体结构:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。
3. 多样性评估:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基因数(Ne)降低,表明育种过程中存在遗传瓶颈。
4. 核心种质构建:基于等位基因丰富度,从8,000份种质中选择约1,000份核心种质,保留了>95%的等位基因。
5. 优异等位基因发掘:GWAS分析在核心种质中鉴定了与产量、抗病性、品质相关的多个显著位点。

# 使用scikit-allel进行群体遗传分析
import allel
import numpy as np
# 读取VCF文件
callset = allel.read_vcf('wheat_samples.vcf.gz', 
                          fields=['calldata/GT', 'variants/POS', 'samples'])
gt = allel.GenotypeArray(callset['calldata/GT'])
# 计算等位基因频率
ac = gt.count_alleles()
# 计算多态性信息含量(PIC)
n = ac.sum(axis=1)
p = ac[:, 0] / n
q = ac[:, 1] / n
pic = 1 - (p**2 + q**2) - 2 * p**2 * q**2
查看详情 →
💡

12.4 其他应用

section
查看详情 →
💡

合成生物学中的生物信息学原理

concept

**1. 生物元件标准化与表征** 合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元: - **启动子(Promoter)**:控制基因表达的"开关" - **核糖体结合位点(RBS)**:调控翻译起始效率 - **编码序列(CDS)**:编码蛋白质的功能基因 - **终止子(Terminator)**:终止转录的信号 生物信息学通过建立元件库(如iGE...

1. 生物元件标准化与表征
合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元:
- 启动子(Promoter):控制基因表达的"开关"
- 核糖体结合位点(RBS):调控翻译起始效率
- 编码序列(CDS):编码蛋白质的功能基因
- 终止子(Terminator):终止转录的信号
生物信息学通过建立元件库(如iGEM Registry、SynBioHub)和标准化表征数据,使元件可以像电子元件一样被组合使用。
2. 基因线路设计
基因线路是由多个生物元件组成的遗传回路,实现逻辑运算(如AND门、OR门、NOT门):
- 布尔逻辑门:例如,双输入AND门需要两个诱导物同时存在才能激活报告基因表达。
- 振荡器:如repressilator,由三个抑制子基因组成的负反馈环,产生周期性基因表达振荡。
- 双稳态开关:两个相互抑制的基因,使系统可以稳定处于两种状态之一。
生物信息学工具(如Cello、Genetic Constructor)提供图形化界面设计基因线路,并自动转换为DNA序列。
3. 代谢工程与通路设计
代谢工程旨在改造细胞代谢网络,使其高效生产目标化合物:
- 通路搜索:利用KEGG、MetaCyc等数据库,搜索从天然底物到目标产物的已知或潜在代谢路径。
- 通量平衡分析(FBA):利用代谢网络的化学计量矩阵,在稳态假设下(Sv=0),通过线性规划优化目标产物产量。
- 酶选择与优化:在已知反应步骤中,从不同物种中筛选催化效率最高的酶,并通过蛋白质工程(定向进化、理性设计)优化酶性质。
4. DNA序列优化
- 密码子优化:根据宿主细胞的密码子使用偏好,调整外源基因的密码子组成,提高翻译效率。
- mRNA二级结构优化:避免在RBS区域形成发夹结构,保证翻译起始效率。
- 避免重复序列和限制性酶切位点:防止DNA重组和克隆困难。

查看详情 →
💡

生物多样性保护的生物信息学原理

concept

**1. DNA条形码鉴定** -DNA条形码的原理是:物种内遗传距离应远小于物种间距离。 - 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。 - 对于未知物种,构建系统发育树,推断其分类地位。 **2. eDNA Metabarcoding** -eDNA metabarcoding结合了环境采样和高通量测序: (1) 环境DNA提取:从水样、...

1. DNA条形码鉴定
-DNA条形码的原理是:物种内遗传距离应远小于物种间距离。
- 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。
- 对于未知物种,构建系统发育树,推断其分类地位。
2. eDNA Metabarcoding
-eDNA metabarcoding结合了环境采样和高通量测序:
(1) 环境DNA提取:从水样、土壤等环境基质中提取总DNA。
(2) 通用引物PCR:使用覆盖多个物种的通用引物扩增目标区域(如16S rRNA、COI、ITS)。
(3) 高通量测序:Illumina或Nanopore平台测序。
(4) 生物信息学分析:序列质控、去嵌合体、OTU/ASV聚类、物种注释(与参考数据库比对)、多样性分析。
3. 群体遗传学在保护中的应用
- 有效种群大小(Ne)估计:反映种群的遗传健康状况,Ne越小,遗传多样性丧失越快。
- 近亲繁殖评估:利用杂合度降低、ROH(连续纯合子片段)分析评估近亲繁殖程度。
- 迁徙与基因流分析:利用STRUCTURE、MIGRATE等工具分析种群间的基因交流。
- 适应性遗传变异检测:利用选择信号扫描(如FST离群值、环境关联分析)识别与环境适应相关的基因。
4. 保护基因组学(Conservation Genomics)
- 利用全基因组数据指导保护决策:
- 识别具有独特遗传适应性的种群,优先保护
- 评估近交衰退风险
- 指导遗传 rescue(引入外来基因恢复遗传多样性)
- 追踪非法野生动物贸易(通过DNA溯源)

查看详情 →
💡

案例一:酵母青蒿酸合成通路的设计

concept

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路: 1. **通路设计**:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。 2. **基因来源选择**:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。 3. **密码子优化**:将所有外源基因按照酵母密...

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路:
1. 通路设计:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。
2. 基因来源选择:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。
3. 密码子优化:将所有外源基因按照酵母密码子偏好进行优化。
4. 代谢流调控:通过FBA分析,鉴定限制产量的代谢瓶颈。过表达tHMG1增加FPP供应,下调ERG9减少FPP向麦角固醇分流。
5. 启动子强度平衡:利用不同强度的启动子组合,平衡通路中各酶的表达量,避免中间产物积累。
6. 结果:工程酵母的青蒿酸产量从初始的约100 mg/L提升到超过25 g/L,实现了工业化生产。

# 使用cobra进行通量平衡分析
import cobra
from cobra.io import read_sbml_model
# 读取酵母代谢模型
model = read_sbml_model('yeast-GEM.xml')
# 设置目标函数:最大化青蒿酸产量
model.objective = model.reactions.DM_artemisinic_acid
# 优化
solution = model.optimize()
print(f"最大理论产量: {solution.objective_value} mmol/gDW/h")
print(f"生长速率: {solution.fluxes['BIOMASS_Ec_iML1515_core_75p37M']}")
# 查找关键通量
for rxn in model.reactions:
    if abs(solution.fluxes[rxn.id]) > 1:
        print(f"{rxn.id}: {solution.fluxes[rxn.id]:.2f}")
查看详情 →
💡

案例二:eDNA监测入侵物种——亚洲鲤鱼

concept

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。 1. **eDNA采样**:在河流和湖泊的关键位置采集水样。 2. **引物设计**:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。 3. **qPCR检测**:检测水样中是否存在亚洲鲤鱼的DNA。 4. **结果**:eDNA检测可以在亚...

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。
1. eDNA采样:在河流和湖泊的关键位置采集水样。
2. 引物设计:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。
3. qPCR检测:检测水样中是否存在亚洲鲤鱼的DNA。
4. 结果:eDNA检测可以在亚洲鲤鱼实际到达前数月预警其入侵路径,比传统方法更灵敏。
5. ** metabarcoding扩展**:进一步利用12S rRNA通用引物进行eDNA metabarcoding,同时监测所有鱼类群落组成,评估入侵对本地群落的影响。

# eDNA metabarcoding分析流程(示例)
# 1. 原始数据质控
fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \
      -o clean_R1.fastq.gz -O clean_R2.fastq.gz \
      -q 20 -u 30 -l 50
# 2. DADA2去重(R中运行)
# library(dada2)
# seqtab <- dada2::mergePairs(dadaF, derepF, dadaR, derepR)
# 3. OTU聚类和物种注释(使用VSEARCH)
vsearch --cluster_size clean.fasta --id 0.97 \
        --centroids otus.fasta --relabel OTU_
vsearch --usearch_global clean.fasta --db reference_db.fasta \
        --id 0.97 --otutabout otu_table.txt
# 4. 多样性分析(使用QIIME 2或R的vegan包)
查看详情 →
💡

案例三:大熊猫保护基因组学

concept

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据: 1. **全基因组测序**:对多个野生和圈养大熊猫种群进行全基因组重测序。 2. **遗传多样性评估**:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。 3. **近交分析**:检测到长片段ROH,证实近亲繁殖的存在。 4. **有害突变负荷**:发现大熊猫携带大量有害突变,但...

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据:
1. 全基因组测序:对多个野生和圈养大熊猫种群进行全基因组重测序。
2. 遗传多样性评估:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。
3. 近交分析:检测到长片段ROH,证实近亲繁殖的存在。
4. 有害突变负荷:发现大熊猫携带大量有害突变,但由于近亲繁殖,这些突变以纯合状态暴露,可能影响种群适应性和繁殖成功率。
5. 保护建议
- 优先保护遗传独特性高的种群(如秦岭亚种)
- 圈养繁殖计划应避免近亲交配
- 考虑栖息地连通性,促进野生种群间的基因交流

查看详情 →

智能药学

💡

第12章 生物信息学应用

chapter
查看详情 →
💡

12.1 精准医学

section
查看详情 →
💡

基因组医学的原理

concept

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析: 1. **变异检测**:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。 2. *...

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析:
1. 变异检测:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。
2. 变异注释:使用ANNOVAR、VEP(Variant Effect Predictor)等工具对检测到的变异进行功能注释,判断变异位于基因组的什么位置(编码区、非编码区、调控区)、是否改变氨基酸序列(同义突变、错义突变、无义突变、移码突变)等。
3. 致病性评估:结合人群频率数据库(如gnomAD)、致病性预测工具(如SIFT、PolyPhen-2、CADD)和临床数据库(如ClinVar、OMIM),评估变异的致病可能性。
4. 多组学整合:将基因组数据与转录组(RNA-seq)、蛋白质组、代谢组等数据整合,构建全面的分子图谱。

查看详情 →
💡

肿瘤基因组学的原理

concept

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括: 1. **肿瘤-正常配对分析**:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。 2. **突变特征分析**:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺...

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括:
1. 肿瘤-正常配对分析:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。
2. 突变特征分析:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺陷)会产生特定的突变模式,称为突变特征(mutational signatures)。通过分解突变谱,可以推断肿瘤的致突变因素。
3. 驱动突变识别:并非所有突变都对肿瘤发展有贡献。乘客突变(passenger mutations)是随机累积的,而驱动突变(driver mutations)则赋予细胞生长优势。生物信息学工具如OncodriveCLUST、MutSigCV通过统计方法识别显著的驱动突变。
4. 肿瘤异质性分析:肿瘤内部存在多个亚克隆,每个亚克隆具有不同的突变谱。通过PyClone、SciClone等工具可以重建肿瘤进化树,理解治疗耐药性的产生机制。

查看详情 →
💡

药物基因组学的原理

concept

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控: 1. **药物代谢酶**:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。 2. **药物转运体**:ABCB1(MDR1)、SLC...

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控:
1. 药物代谢酶:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。
2. 药物转运体:ABCB1(MDR1)、SLCO1B1等转运体基因的多态性影响药物的吸收和分布。
3. 药物靶点:VKORC1基因变异影响华法林的靶点敏感性,决定抗凝治疗剂量。
4. 剂量预测模型:基于患者的基因型和临床特征(年龄、体重、合并用药等),建立剂量预测算法,如华法林剂量预测模型整合VKORC1和CYP2C9基因型信息。

查看详情 →
💡

案例一:新生儿罕见病基因组诊断

concept

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。 分析流程: 1. WES测序(约2×10^7 reads...

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。
分析流程:
1. WES测序(约2×10^7 reads,150bp paired-end)
2. BWA-MEM比对到GRCh38参考基因组
3. GATK HaplotypeCaller检测变异
4. VEP注释变异效应
5. 过滤:保留罕见变异(gnomAD AF<0.01)、蛋白截断或错义变异
6. 候选基因筛选:聚焦代谢疾病相关基因 panel
7. Sanger测序验证突变

查看详情 →
💡

案例二:非小细胞肺癌的精准治疗

concept

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。 融合基因检测流程: 1. RNA-seq数据质控...

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。
融合基因检测流程:
1. RNA-seq数据质控(FastQC)
2. STAR比对(使用chimeric alignment模式)
3. STAR-Fusion或Arriba检测融合基因
4. 可视化验证(IGV查看融合断点)
5. 临床解读(OncoKB数据库查询靶向药物)

查看详情 →
💡

案例三:华法林个体化给药

concept

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C9*1/*3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C91/3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

查看详情 →
💡

12.2 智能药学

section
查看详情 →
💡

药物靶点发现的生物信息学策略

concept

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略: **1. 基因组学方法** - **全基因组关联分析(GWAS)**:通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。 - **表达数量性状位点(eQTL)分析**:将GWAS发现的疾病关联位点与...

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略:
1. 基因组学方法
- 全基因组关联分析(GWAS):通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。
- 表达数量性状位点(eQTL)分析:将GWAS发现的疾病关联位点与基因表达数据整合,推断因果基因。
2. 网络药理学方法
- 疾病模块识别:利用蛋白质相互作用网络(PPI),识别与疾病相关的功能模块。一个理想的药物靶点应位于疾病模块的中心位置(高介数中心性),干扰它可以最大程度地影响疾病进程。
- 网络邻近性分析:计算药物靶点与疾病基因在网络中的距离,预测药物重定位(drug repurposing)的可能性。
3. 多组学整合方法
- 整合基因组、转录组、蛋白质组和代谢组数据,构建多层次的疾病分子图谱,系统性地识别关键节点作为潜在靶点。
- 差异表达分析(如DESeq2、edgeR)识别疾病状态下显著上调或下调的基因。
4. 靶点可药性评估
- 并非所有与疾病相关的蛋白都是好的药物靶点。可药性(druggability)评估考虑:是否有适合小分子结合的口袋、靶点的组织特异性表达、靶向该靶点是否会产生严重毒副作用等。
- 工具如DrugMAP、canSAR数据库提供蛋白质可药性预测。

查看详情 →
💡

计算机辅助药物设计的原理

concept

**基于结构的药物设计(SBDD)** SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为: 1. **靶点结构准备**:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。 2. **活性位点识别**:使用Fpocket、SiteMap等工具预测结合口袋。 3. **虚拟筛选**:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口...

基于结构的药物设计(SBDD)
SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为:
1. 靶点结构准备:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。
2. 活性位点识别:使用Fpocket、SiteMap等工具预测结合口袋。
3. 虚拟筛选:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口袋,根据对接打分排序。
4. 先导化合物优化:基于对接结果和相互作用分析,进行结构修饰以提高活性、选择性和成药性。
基于配体的药物设计(LBDD)
当靶点结构未知时,可以利用已知活性配体的信息:
1. 药效团建模:提取活性分子共同的化学特征(氢键供体/受体、疏水中心、芳环中心)及其空间排布,建立药效团模型,用于数据库搜索。
2. 定量构效关系(QSAR):建立分子描述符与生物活性之间的统计模型,预测新化合物的活性。
3. 分子相似性搜索:基于"相似结构的分子具有相似活性"的原则,在化学空间中搜索与已知活性分子相似的化合物。

查看详情 →
💡

分子对接的原理

concept

分子对接模拟配体与受体的结合过程,包括两个核心问题: **1. 构象搜索(Pose Prediction)** - 在构象空间中搜索配体的最优结合姿态。 - 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。 - 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。 **2. 结合亲和力预测(Scoring...

分子对接模拟配体与受体的结合过程,包括两个核心问题:
1. 构象搜索(Pose Prediction)
- 在构象空间中搜索配体的最优结合姿态。
- 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。
- 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。
2. 结合亲和力预测(Scoring)
- 打分函数评估每个结合姿态的亲和力,用于排序。
- 打分函数类型:
- 力场打分:基于分子力学能量项(范德华力、静电相互作用)
- 经验打分:拟合实验数据得到的加权能量项
- 知识-based打分:基于蛋白质-配体复合物结构数据库的统计势能
- 机器学习打分:使用RF、SVM、CNN等算法学习结构-亲和力关系
常用分子对接软件包括AutoDock Vina、Glide、GOLD、rDock等。

查看详情 →
💡

AI药物设计的原理

concept

**1. 生成式分子设计** - **变分自编码器(VAE)**:学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。 - **生成对抗网络(GAN)**:生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。 - **强化学习(RL)**:将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。 - **扩散模型(Diff...

1. 生成式分子设计
- 变分自编码器(VAE):学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。
- 生成对抗网络(GAN):生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。
- 强化学习(RL):将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。
- 扩散模型(Diffusion Model):目前最先进的生成模型,通过逐步去噪生成高质量分子,在3D分子生成方面表现优异。
2. 分子性质预测
- 图神经网络(GNN):将分子表示为图(原子为节点,键为边),利用消息传递机制学习分子表征,预测生物活性、毒性、药代动力学性质(ADMET)。
- Transformer架构:如ChemBERTa、MolBERT,将SMILES字符串作为输入序列,利用自注意力机制学习化学语言模型。
3. 蛋白质结构预测
- AlphaFold2:利用注意力机制和多序列比对(MSA)实现接近实验精度的蛋白质结构预测,为SBDD提供了前所未有的结构基础。
- RoseTTAFold:另一种高精度蛋白质结构预测方法。

查看详情 →
💡

案例一:COVID-19靶点发现与药物重定位

concept

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点: 1. **基因组注释**:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。 2. **人类-病毒蛋白质相互作用**:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式...

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点:
1. 基因组注释:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。
2. 人类-病毒蛋白质相互作用:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式,预测关键宿主因子(如ACE2受体、TMPRSS2)。
3. 药物重定位:通过网络邻近性分析,筛选已上市药物中可能有效对抗SARS-CoV-2的候选药物。例如,基于病毒-宿主相互作用网络,预测氯喹和瑞德西韦(Remdesivir)可能有效(后续临床试验验证了瑞德西韦的疗效)。
4. 虚拟筛选:以Mpro为靶点,对ZINC数据库进行虚拟筛选,识别潜在抑制剂。德国研究团队通过高通量X射线晶体学筛选,发现了Mpro抑制剂的前导化合物。

# 使用RDKit进行分子对接准备示例
from rdkit import Chem
from rdkit.Chem import AllChem
# 读取配体分子
ligand = Chem.MolFromSmiles("CC(C)Cc1ccc(cc1)C(C)C(=O)O")  # 布洛芬
ligand = Chem.AddHs(ligand)
AllChem.EmbedMolecule(ligand, AllChem.ETKDG())
# 保存为PDB格式用于对接
Chem.MolToPDBFile(ligand, "ligand.pdb")
查看详情 →
💡

案例二:AlphaFold驱动的药物设计——靶向KRAS G12C

algorithm

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。 1. **结构解析**:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。 2. **共价抑制剂设计**:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sot...

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。
1. 结构解析:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。
2. 共价抑制剂设计:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sotorasib(AMG 510)和Adagrasib(MRTX849)通过共价结合Cys12,将KRAS锁定在非活性状态。
3. AI优化:利用机器学习模型预测化合物的选择性、代谢稳定性和口服生物利用度,优化先导化合物。
这一案例展示了从"不可成药"到"可成药"的转变如何依赖于精准的结构信息和计算设计。

查看详情 →
💡

案例三:AI生成全新抗生素——Halicin的发现

concept

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin: 1. **训练数据**:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。 2. **虚拟筛选**:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。 3. **实验验证**:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝...

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin:
1. 训练数据:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。
2. 虚拟筛选:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。
3. 实验验证:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝杆菌)表现出强效杀菌活性,且与现有抗生素无交叉耐药性。
4. 作用机制:后续研究表明Halicin通过干扰细菌的质子动力势发挥作用,这是一种全新的作用机制。

# 使用DeepChem进行分子性质预测示例
import deepchem as dc
from deepchem.models import GraphConvModel
# 加载Tox21毒性数据集
tasks, datasets, transformers = dc.molnet.load_tox21()
train_dataset, valid_dataset, test_dataset = datasets
# 构建图卷积网络模型
model = GraphConvModel(
    n_tasks=len(tasks),
    mode='classification',
    batch_size=64,
    learning_rate=0.001
)
# 训练模型
model.fit(train_dataset, nb_epoch=20)
查看详情 →
💡

12.3 智能育种

section
查看详情 →
💡

基因组选择(GS)的原理

concept

**1. 基本概念** 基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。 假设个体的表型值P可以分解为: P = μ + g + e 其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。 GS的目标是利用标记基因型X来预测遗传效应...

1. 基本概念
基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。
假设个体的表型值P可以分解为:
P = μ + g + e
其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。
GS的目标是利用标记基因型X来预测遗传效应g:
g = Xβ + ε
其中,β为标记效应向量。
2. 统计模型
基因组选择的核心是估计每个标记的效应。由于标记数(p,通常为数千至数百万)远大于个体数(n,数百至数千),传统的最小二乘法无法直接使用,需要借助特殊统计方法:
- 岭回归最佳线性无偏预测(RR-BLUP):假设所有标记效应服从正态分布,通过L2正则化(岭回归)解决过拟合问题。计算速度快,是GS的基准方法。
- 贝叶斯方法(BayesA、BayesB、Bayesian LASSO等):假设标记效应服从不同的先验分布。BayesB假设只有少数标记具有大效应(大部分标记效应为0),更符合真实遗传架构。
- GBLUP(Genomic BLUP):利用标记信息构建基因组关系矩阵G,替代传统的系谱关系矩阵A,进行最佳线性无偏预测。
- 机器学习算法:随机森林(RF)、支持向量机(SVM)、神经网络等也被用于GS,在处理非加性遗传效应时可能优于线性模型。
3. 实施流程
(1) 训练群体构建:选择具有代表性的群体,测定高密度SNP基因型和目标性状表型。
(2) 统计模型训练:利用训练数据估计标记效应。
(3) 育种值预测:对候选个体(仅有基因型)计算GEBV。
(4) 选择决策:根据GEBV排名,选择最优个体进入下一代。
(5) 模型更新:定期用新收集的表型数据更新预测模型,保持预测准确性。
4. 影响预测准确性的因素
- 训练群体大小:一般而言,训练群体越大,预测准确性越高。
- 训练群体与候选群体的亲缘关系:关系越近,预测越准确。
- 性状遗传力:遗传力越高,GS效果越好。
- 标记密度:需要足够密度的标记覆盖全基因组,捕获LD信息。
- 性状遗传架构:由大量微效基因控制的性状更适合GS。

查看详情 →
💡

分子标记辅助育种的原理

concept

**1. QTL定位** 数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。 常用方法: - **单标记分析(SMA)**:检验单个标记与性状的关联 - **区间作图(IM)**:利用两侧标记信息,检测标记区间内的QTL - **复合区间作图(...

1. QTL定位
数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。
常用方法:
- 单标记分析(SMA):检验单个标记与性状的关联
- 区间作图(IM):利用两侧标记信息,检测标记区间内的QTL
- 复合区间作图(CIM):在区间作图基础上,加入背景标记控制多QTL效应
- 全基因组关联分析(GWAS):利用自然群体中的连锁不平衡(LD),不需要构建专门的家系
2. MAS(Marker-Assisted Selection)策略
- 前景选择:利用与目标QTL紧密连锁的标记,选择携带有利等位基因的个体。
- 背景选择:利用全基因组标记,监测轮回亲本的基因组恢复程度,加速回交育种进程。
- 基因聚合(Gene Pyramiding):将多个有利基因/QTL聚合到同一个品种中。
3. 标记类型
从RFLP、AFLP、SSR发展到目前的SNP(单核苷酸多态性)。SNP标记具有密度高、分布广、自动化检测等优点,已成为MAB和GS的主流标记。

查看详情 →
💡

种质资源鉴定的原理

concept

**1. 遗传多样性分析** - **群体结构分析**:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。 - **主成分分析(PCA)**:降维可视化种质间的遗传关系。 - **进化树构建**:基于遗传距离构建系统发育树,揭示种质的亲缘关系。 **2. 核心种质构建** - 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。 - 常用策略:基于遗传...

1. 遗传多样性分析
- 群体结构分析:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。
- 主成分分析(PCA):降维可视化种质间的遗传关系。
- 进化树构建:基于遗传距离构建系统发育树,揭示种质的亲缘关系。
2. 核心种质构建
- 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。
- 常用策略:基于遗传距离的逐步聚类采样、基于等位基因覆盖率的优化算法。
3. 指纹图谱构建
- 利用一组高度多态性的SSR或SNP标记,为每个品种建立独特的DNA指纹。
- 用于品种真实性鉴定、纯度检测和知识产权保护。
4. 优异等位基因发掘
- 通过GWAS或候选基因关联分析,在种质资源中挖掘与重要农艺性状相关的优异等位基因。
- 这些优异等位基因可作为分子标记辅助育种或转基因育种的靶点。

查看详情 →
💡

案例一:玉米基因组选择育种

concept

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测: 1. **训练群体**:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。 2. **模型建立**:使用rrBLUP或BayesB模型训练。 3. **预测应用**:对新合成的杂交组合(仅有基因型)预测配合力。 4. **效果**:GS可将育种周期从传统的5-6年缩短至2-3年,预...

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测:
1. 训练群体:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。
2. 模型建立:使用rrBLUP或BayesB模型训练。
3. 预测应用:对新合成的杂交组合(仅有基因型)预测配合力。
4. 效果:GS可将育种周期从传统的5-6年缩短至2-3年,预测准确性达到0.5-0.8(取决于性状和群体)。

# 使用rrBLUP包进行基因组选择
library(rrBLUP)
# 读取基因型矩阵(n×m,n个体,m标记)和表型
marker_data <- read.table("snps.txt", header=TRUE)
phenotype <- read.table("yield.txt", header=TRUE)
# 训练模型
model <- mixed.solve(y=phenotype$yield, Z=marker_data)
# 预测育种值
gebv <- marker_data %*% model$u
查看详情 →
💡

案例二:水稻分子标记辅助抗病育种

concept

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。 1. **标记开发**:开发与Xa21紧密连锁的PCR标记(如PTA248)。 2. **前景选择**:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。 3. **背景选择**:利用全基因组SNP标记,选择轮回亲本基因...

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。
1. 标记开发:开发与Xa21紧密连锁的PCR标记(如PTA248)。
2. 前景选择:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。
3. 背景选择:利用全基因组SNP标记,选择轮回亲本基因组恢复率最高的个体。
4. 结果:仅需2-3个回交世代即可获得基因组恢复率>95%的抗性近等基因系,而传统回交需要6-7代。

# Xa21前景选择PCR标记检测
# 引物序列:正向 5'-GCTCGATCGATAATGGAAGG-3'
#          反向 5'-TTGGTGATGGTTCGACGAGC-3'
PCR反应体系(20 μL):
- 2× PCR Mix: 10 μL
- 正向引物 (10 μM): 0.5 μL
- 反向引物 (10 μM): 0.5 μL
- DNA模板 (50 ng/μL): 1 μL
- ddH2O: 8 μL
PCR程序:
94°C 5min
[94°C 30s → 55°C 30s → 72°C 1min] × 35 cycles
72°C 7min
预期结果:携带Xa21的个体扩增出约500 bp的条带
查看详情 →
💡

案例三:小麦种质资源的遗传多样性分析

concept

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布: 1. **SNP基因型**:使用35K SNP芯片对约8,000份核心种质进行基因分型。 2. **群体结构**:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。 3. **多样性评估**:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基...

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布:
1. SNP基因型:使用35K SNP芯片对约8,000份核心种质进行基因分型。
2. 群体结构:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。
3. 多样性评估:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基因数(Ne)降低,表明育种过程中存在遗传瓶颈。
4. 核心种质构建:基于等位基因丰富度,从8,000份种质中选择约1,000份核心种质,保留了>95%的等位基因。
5. 优异等位基因发掘:GWAS分析在核心种质中鉴定了与产量、抗病性、品质相关的多个显著位点。

# 使用scikit-allel进行群体遗传分析
import allel
import numpy as np
# 读取VCF文件
callset = allel.read_vcf('wheat_samples.vcf.gz', 
                          fields=['calldata/GT', 'variants/POS', 'samples'])
gt = allel.GenotypeArray(callset['calldata/GT'])
# 计算等位基因频率
ac = gt.count_alleles()
# 计算多态性信息含量(PIC)
n = ac.sum(axis=1)
p = ac[:, 0] / n
q = ac[:, 1] / n
pic = 1 - (p**2 + q**2) - 2 * p**2 * q**2
查看详情 →
💡

12.4 其他应用

section
查看详情 →
💡

合成生物学中的生物信息学原理

concept

**1. 生物元件标准化与表征** 合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元: - **启动子(Promoter)**:控制基因表达的"开关" - **核糖体结合位点(RBS)**:调控翻译起始效率 - **编码序列(CDS)**:编码蛋白质的功能基因 - **终止子(Terminator)**:终止转录的信号 生物信息学通过建立元件库(如iGE...

1. 生物元件标准化与表征
合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元:
- 启动子(Promoter):控制基因表达的"开关"
- 核糖体结合位点(RBS):调控翻译起始效率
- 编码序列(CDS):编码蛋白质的功能基因
- 终止子(Terminator):终止转录的信号
生物信息学通过建立元件库(如iGEM Registry、SynBioHub)和标准化表征数据,使元件可以像电子元件一样被组合使用。
2. 基因线路设计
基因线路是由多个生物元件组成的遗传回路,实现逻辑运算(如AND门、OR门、NOT门):
- 布尔逻辑门:例如,双输入AND门需要两个诱导物同时存在才能激活报告基因表达。
- 振荡器:如repressilator,由三个抑制子基因组成的负反馈环,产生周期性基因表达振荡。
- 双稳态开关:两个相互抑制的基因,使系统可以稳定处于两种状态之一。
生物信息学工具(如Cello、Genetic Constructor)提供图形化界面设计基因线路,并自动转换为DNA序列。
3. 代谢工程与通路设计
代谢工程旨在改造细胞代谢网络,使其高效生产目标化合物:
- 通路搜索:利用KEGG、MetaCyc等数据库,搜索从天然底物到目标产物的已知或潜在代谢路径。
- 通量平衡分析(FBA):利用代谢网络的化学计量矩阵,在稳态假设下(Sv=0),通过线性规划优化目标产物产量。
- 酶选择与优化:在已知反应步骤中,从不同物种中筛选催化效率最高的酶,并通过蛋白质工程(定向进化、理性设计)优化酶性质。
4. DNA序列优化
- 密码子优化:根据宿主细胞的密码子使用偏好,调整外源基因的密码子组成,提高翻译效率。
- mRNA二级结构优化:避免在RBS区域形成发夹结构,保证翻译起始效率。
- 避免重复序列和限制性酶切位点:防止DNA重组和克隆困难。

查看详情 →
💡

生物多样性保护的生物信息学原理

concept

**1. DNA条形码鉴定** -DNA条形码的原理是:物种内遗传距离应远小于物种间距离。 - 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。 - 对于未知物种,构建系统发育树,推断其分类地位。 **2. eDNA Metabarcoding** -eDNA metabarcoding结合了环境采样和高通量测序: (1) 环境DNA提取:从水样、...

1. DNA条形码鉴定
-DNA条形码的原理是:物种内遗传距离应远小于物种间距离。
- 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。
- 对于未知物种,构建系统发育树,推断其分类地位。
2. eDNA Metabarcoding
-eDNA metabarcoding结合了环境采样和高通量测序:
(1) 环境DNA提取:从水样、土壤等环境基质中提取总DNA。
(2) 通用引物PCR:使用覆盖多个物种的通用引物扩增目标区域(如16S rRNA、COI、ITS)。
(3) 高通量测序:Illumina或Nanopore平台测序。
(4) 生物信息学分析:序列质控、去嵌合体、OTU/ASV聚类、物种注释(与参考数据库比对)、多样性分析。
3. 群体遗传学在保护中的应用
- 有效种群大小(Ne)估计:反映种群的遗传健康状况,Ne越小,遗传多样性丧失越快。
- 近亲繁殖评估:利用杂合度降低、ROH(连续纯合子片段)分析评估近亲繁殖程度。
- 迁徙与基因流分析:利用STRUCTURE、MIGRATE等工具分析种群间的基因交流。
- 适应性遗传变异检测:利用选择信号扫描(如FST离群值、环境关联分析)识别与环境适应相关的基因。
4. 保护基因组学(Conservation Genomics)
- 利用全基因组数据指导保护决策:
- 识别具有独特遗传适应性的种群,优先保护
- 评估近交衰退风险
- 指导遗传 rescue(引入外来基因恢复遗传多样性)
- 追踪非法野生动物贸易(通过DNA溯源)

查看详情 →
💡

案例一:酵母青蒿酸合成通路的设计

concept

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路: 1. **通路设计**:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。 2. **基因来源选择**:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。 3. **密码子优化**:将所有外源基因按照酵母密...

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路:
1. 通路设计:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。
2. 基因来源选择:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。
3. 密码子优化:将所有外源基因按照酵母密码子偏好进行优化。
4. 代谢流调控:通过FBA分析,鉴定限制产量的代谢瓶颈。过表达tHMG1增加FPP供应,下调ERG9减少FPP向麦角固醇分流。
5. 启动子强度平衡:利用不同强度的启动子组合,平衡通路中各酶的表达量,避免中间产物积累。
6. 结果:工程酵母的青蒿酸产量从初始的约100 mg/L提升到超过25 g/L,实现了工业化生产。

# 使用cobra进行通量平衡分析
import cobra
from cobra.io import read_sbml_model
# 读取酵母代谢模型
model = read_sbml_model('yeast-GEM.xml')
# 设置目标函数:最大化青蒿酸产量
model.objective = model.reactions.DM_artemisinic_acid
# 优化
solution = model.optimize()
print(f"最大理论产量: {solution.objective_value} mmol/gDW/h")
print(f"生长速率: {solution.fluxes['BIOMASS_Ec_iML1515_core_75p37M']}")
# 查找关键通量
for rxn in model.reactions:
    if abs(solution.fluxes[rxn.id]) > 1:
        print(f"{rxn.id}: {solution.fluxes[rxn.id]:.2f}")
查看详情 →
💡

案例二:eDNA监测入侵物种——亚洲鲤鱼

concept

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。 1. **eDNA采样**:在河流和湖泊的关键位置采集水样。 2. **引物设计**:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。 3. **qPCR检测**:检测水样中是否存在亚洲鲤鱼的DNA。 4. **结果**:eDNA检测可以在亚...

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。
1. eDNA采样:在河流和湖泊的关键位置采集水样。
2. 引物设计:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。
3. qPCR检测:检测水样中是否存在亚洲鲤鱼的DNA。
4. 结果:eDNA检测可以在亚洲鲤鱼实际到达前数月预警其入侵路径,比传统方法更灵敏。
5. ** metabarcoding扩展**:进一步利用12S rRNA通用引物进行eDNA metabarcoding,同时监测所有鱼类群落组成,评估入侵对本地群落的影响。

# eDNA metabarcoding分析流程(示例)
# 1. 原始数据质控
fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \
      -o clean_R1.fastq.gz -O clean_R2.fastq.gz \
      -q 20 -u 30 -l 50
# 2. DADA2去重(R中运行)
# library(dada2)
# seqtab <- dada2::mergePairs(dadaF, derepF, dadaR, derepR)
# 3. OTU聚类和物种注释(使用VSEARCH)
vsearch --cluster_size clean.fasta --id 0.97 \
        --centroids otus.fasta --relabel OTU_
vsearch --usearch_global clean.fasta --db reference_db.fasta \
        --id 0.97 --otutabout otu_table.txt
# 4. 多样性分析(使用QIIME 2或R的vegan包)
查看详情 →
💡

案例三:大熊猫保护基因组学

concept

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据: 1. **全基因组测序**:对多个野生和圈养大熊猫种群进行全基因组重测序。 2. **遗传多样性评估**:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。 3. **近交分析**:检测到长片段ROH,证实近亲繁殖的存在。 4. **有害突变负荷**:发现大熊猫携带大量有害突变,但...

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据:
1. 全基因组测序:对多个野生和圈养大熊猫种群进行全基因组重测序。
2. 遗传多样性评估:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。
3. 近交分析:检测到长片段ROH,证实近亲繁殖的存在。
4. 有害突变负荷:发现大熊猫携带大量有害突变,但由于近亲繁殖,这些突变以纯合状态暴露,可能影响种群适应性和繁殖成功率。
5. 保护建议
- 优先保护遗传独特性高的种群(如秦岭亚种)
- 圈养繁殖计划应避免近亲交配
- 考虑栖息地连通性,促进野生种群间的基因交流

查看详情 →

智能育种

💡

第12章 生物信息学应用

chapter
查看详情 →
💡

12.1 精准医学

section
查看详情 →
💡

基因组医学的原理

concept

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析: 1. **变异检测**:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。 2. *...

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析:
1. 变异检测:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。
2. 变异注释:使用ANNOVAR、VEP(Variant Effect Predictor)等工具对检测到的变异进行功能注释,判断变异位于基因组的什么位置(编码区、非编码区、调控区)、是否改变氨基酸序列(同义突变、错义突变、无义突变、移码突变)等。
3. 致病性评估:结合人群频率数据库(如gnomAD)、致病性预测工具(如SIFT、PolyPhen-2、CADD)和临床数据库(如ClinVar、OMIM),评估变异的致病可能性。
4. 多组学整合:将基因组数据与转录组(RNA-seq)、蛋白质组、代谢组等数据整合,构建全面的分子图谱。

查看详情 →
💡

肿瘤基因组学的原理

concept

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括: 1. **肿瘤-正常配对分析**:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。 2. **突变特征分析**:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺...

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括:
1. 肿瘤-正常配对分析:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。
2. 突变特征分析:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺陷)会产生特定的突变模式,称为突变特征(mutational signatures)。通过分解突变谱,可以推断肿瘤的致突变因素。
3. 驱动突变识别:并非所有突变都对肿瘤发展有贡献。乘客突变(passenger mutations)是随机累积的,而驱动突变(driver mutations)则赋予细胞生长优势。生物信息学工具如OncodriveCLUST、MutSigCV通过统计方法识别显著的驱动突变。
4. 肿瘤异质性分析:肿瘤内部存在多个亚克隆,每个亚克隆具有不同的突变谱。通过PyClone、SciClone等工具可以重建肿瘤进化树,理解治疗耐药性的产生机制。

查看详情 →
💡

药物基因组学的原理

concept

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控: 1. **药物代谢酶**:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。 2. **药物转运体**:ABCB1(MDR1)、SLC...

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控:
1. 药物代谢酶:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。
2. 药物转运体:ABCB1(MDR1)、SLCO1B1等转运体基因的多态性影响药物的吸收和分布。
3. 药物靶点:VKORC1基因变异影响华法林的靶点敏感性,决定抗凝治疗剂量。
4. 剂量预测模型:基于患者的基因型和临床特征(年龄、体重、合并用药等),建立剂量预测算法,如华法林剂量预测模型整合VKORC1和CYP2C9基因型信息。

查看详情 →
💡

案例一:新生儿罕见病基因组诊断

concept

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。 分析流程: 1. WES测序(约2×10^7 reads...

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。
分析流程:
1. WES测序(约2×10^7 reads,150bp paired-end)
2. BWA-MEM比对到GRCh38参考基因组
3. GATK HaplotypeCaller检测变异
4. VEP注释变异效应
5. 过滤:保留罕见变异(gnomAD AF<0.01)、蛋白截断或错义变异
6. 候选基因筛选:聚焦代谢疾病相关基因 panel
7. Sanger测序验证突变

查看详情 →
💡

案例二:非小细胞肺癌的精准治疗

concept

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。 融合基因检测流程: 1. RNA-seq数据质控...

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。
融合基因检测流程:
1. RNA-seq数据质控(FastQC)
2. STAR比对(使用chimeric alignment模式)
3. STAR-Fusion或Arriba检测融合基因
4. 可视化验证(IGV查看融合断点)
5. 临床解读(OncoKB数据库查询靶向药物)

查看详情 →
💡

案例三:华法林个体化给药

concept

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C9*1/*3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C91/3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

查看详情 →
💡

12.2 智能药学

section
查看详情 →
💡

药物靶点发现的生物信息学策略

concept

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略: **1. 基因组学方法** - **全基因组关联分析(GWAS)**:通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。 - **表达数量性状位点(eQTL)分析**:将GWAS发现的疾病关联位点与...

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略:
1. 基因组学方法
- 全基因组关联分析(GWAS):通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。
- 表达数量性状位点(eQTL)分析:将GWAS发现的疾病关联位点与基因表达数据整合,推断因果基因。
2. 网络药理学方法
- 疾病模块识别:利用蛋白质相互作用网络(PPI),识别与疾病相关的功能模块。一个理想的药物靶点应位于疾病模块的中心位置(高介数中心性),干扰它可以最大程度地影响疾病进程。
- 网络邻近性分析:计算药物靶点与疾病基因在网络中的距离,预测药物重定位(drug repurposing)的可能性。
3. 多组学整合方法
- 整合基因组、转录组、蛋白质组和代谢组数据,构建多层次的疾病分子图谱,系统性地识别关键节点作为潜在靶点。
- 差异表达分析(如DESeq2、edgeR)识别疾病状态下显著上调或下调的基因。
4. 靶点可药性评估
- 并非所有与疾病相关的蛋白都是好的药物靶点。可药性(druggability)评估考虑:是否有适合小分子结合的口袋、靶点的组织特异性表达、靶向该靶点是否会产生严重毒副作用等。
- 工具如DrugMAP、canSAR数据库提供蛋白质可药性预测。

查看详情 →
💡

计算机辅助药物设计的原理

concept

**基于结构的药物设计(SBDD)** SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为: 1. **靶点结构准备**:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。 2. **活性位点识别**:使用Fpocket、SiteMap等工具预测结合口袋。 3. **虚拟筛选**:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口...

基于结构的药物设计(SBDD)
SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为:
1. 靶点结构准备:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。
2. 活性位点识别:使用Fpocket、SiteMap等工具预测结合口袋。
3. 虚拟筛选:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口袋,根据对接打分排序。
4. 先导化合物优化:基于对接结果和相互作用分析,进行结构修饰以提高活性、选择性和成药性。
基于配体的药物设计(LBDD)
当靶点结构未知时,可以利用已知活性配体的信息:
1. 药效团建模:提取活性分子共同的化学特征(氢键供体/受体、疏水中心、芳环中心)及其空间排布,建立药效团模型,用于数据库搜索。
2. 定量构效关系(QSAR):建立分子描述符与生物活性之间的统计模型,预测新化合物的活性。
3. 分子相似性搜索:基于"相似结构的分子具有相似活性"的原则,在化学空间中搜索与已知活性分子相似的化合物。

查看详情 →
💡

分子对接的原理

concept

分子对接模拟配体与受体的结合过程,包括两个核心问题: **1. 构象搜索(Pose Prediction)** - 在构象空间中搜索配体的最优结合姿态。 - 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。 - 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。 **2. 结合亲和力预测(Scoring...

分子对接模拟配体与受体的结合过程,包括两个核心问题:
1. 构象搜索(Pose Prediction)
- 在构象空间中搜索配体的最优结合姿态。
- 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。
- 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。
2. 结合亲和力预测(Scoring)
- 打分函数评估每个结合姿态的亲和力,用于排序。
- 打分函数类型:
- 力场打分:基于分子力学能量项(范德华力、静电相互作用)
- 经验打分:拟合实验数据得到的加权能量项
- 知识-based打分:基于蛋白质-配体复合物结构数据库的统计势能
- 机器学习打分:使用RF、SVM、CNN等算法学习结构-亲和力关系
常用分子对接软件包括AutoDock Vina、Glide、GOLD、rDock等。

查看详情 →
💡

AI药物设计的原理

concept

**1. 生成式分子设计** - **变分自编码器(VAE)**:学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。 - **生成对抗网络(GAN)**:生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。 - **强化学习(RL)**:将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。 - **扩散模型(Diff...

1. 生成式分子设计
- 变分自编码器(VAE):学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。
- 生成对抗网络(GAN):生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。
- 强化学习(RL):将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。
- 扩散模型(Diffusion Model):目前最先进的生成模型,通过逐步去噪生成高质量分子,在3D分子生成方面表现优异。
2. 分子性质预测
- 图神经网络(GNN):将分子表示为图(原子为节点,键为边),利用消息传递机制学习分子表征,预测生物活性、毒性、药代动力学性质(ADMET)。
- Transformer架构:如ChemBERTa、MolBERT,将SMILES字符串作为输入序列,利用自注意力机制学习化学语言模型。
3. 蛋白质结构预测
- AlphaFold2:利用注意力机制和多序列比对(MSA)实现接近实验精度的蛋白质结构预测,为SBDD提供了前所未有的结构基础。
- RoseTTAFold:另一种高精度蛋白质结构预测方法。

查看详情 →
💡

案例一:COVID-19靶点发现与药物重定位

concept

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点: 1. **基因组注释**:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。 2. **人类-病毒蛋白质相互作用**:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式...

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点:
1. 基因组注释:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。
2. 人类-病毒蛋白质相互作用:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式,预测关键宿主因子(如ACE2受体、TMPRSS2)。
3. 药物重定位:通过网络邻近性分析,筛选已上市药物中可能有效对抗SARS-CoV-2的候选药物。例如,基于病毒-宿主相互作用网络,预测氯喹和瑞德西韦(Remdesivir)可能有效(后续临床试验验证了瑞德西韦的疗效)。
4. 虚拟筛选:以Mpro为靶点,对ZINC数据库进行虚拟筛选,识别潜在抑制剂。德国研究团队通过高通量X射线晶体学筛选,发现了Mpro抑制剂的前导化合物。

# 使用RDKit进行分子对接准备示例
from rdkit import Chem
from rdkit.Chem import AllChem
# 读取配体分子
ligand = Chem.MolFromSmiles("CC(C)Cc1ccc(cc1)C(C)C(=O)O")  # 布洛芬
ligand = Chem.AddHs(ligand)
AllChem.EmbedMolecule(ligand, AllChem.ETKDG())
# 保存为PDB格式用于对接
Chem.MolToPDBFile(ligand, "ligand.pdb")
查看详情 →
💡

案例二:AlphaFold驱动的药物设计——靶向KRAS G12C

algorithm

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。 1. **结构解析**:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。 2. **共价抑制剂设计**:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sot...

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。
1. 结构解析:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。
2. 共价抑制剂设计:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sotorasib(AMG 510)和Adagrasib(MRTX849)通过共价结合Cys12,将KRAS锁定在非活性状态。
3. AI优化:利用机器学习模型预测化合物的选择性、代谢稳定性和口服生物利用度,优化先导化合物。
这一案例展示了从"不可成药"到"可成药"的转变如何依赖于精准的结构信息和计算设计。

查看详情 →
💡

案例三:AI生成全新抗生素——Halicin的发现

concept

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin: 1. **训练数据**:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。 2. **虚拟筛选**:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。 3. **实验验证**:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝...

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin:
1. 训练数据:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。
2. 虚拟筛选:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。
3. 实验验证:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝杆菌)表现出强效杀菌活性,且与现有抗生素无交叉耐药性。
4. 作用机制:后续研究表明Halicin通过干扰细菌的质子动力势发挥作用,这是一种全新的作用机制。

# 使用DeepChem进行分子性质预测示例
import deepchem as dc
from deepchem.models import GraphConvModel
# 加载Tox21毒性数据集
tasks, datasets, transformers = dc.molnet.load_tox21()
train_dataset, valid_dataset, test_dataset = datasets
# 构建图卷积网络模型
model = GraphConvModel(
    n_tasks=len(tasks),
    mode='classification',
    batch_size=64,
    learning_rate=0.001
)
# 训练模型
model.fit(train_dataset, nb_epoch=20)
查看详情 →
💡

12.3 智能育种

section
查看详情 →
💡

基因组选择(GS)的原理

concept

**1. 基本概念** 基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。 假设个体的表型值P可以分解为: P = μ + g + e 其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。 GS的目标是利用标记基因型X来预测遗传效应...

1. 基本概念
基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。
假设个体的表型值P可以分解为:
P = μ + g + e
其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。
GS的目标是利用标记基因型X来预测遗传效应g:
g = Xβ + ε
其中,β为标记效应向量。
2. 统计模型
基因组选择的核心是估计每个标记的效应。由于标记数(p,通常为数千至数百万)远大于个体数(n,数百至数千),传统的最小二乘法无法直接使用,需要借助特殊统计方法:
- 岭回归最佳线性无偏预测(RR-BLUP):假设所有标记效应服从正态分布,通过L2正则化(岭回归)解决过拟合问题。计算速度快,是GS的基准方法。
- 贝叶斯方法(BayesA、BayesB、Bayesian LASSO等):假设标记效应服从不同的先验分布。BayesB假设只有少数标记具有大效应(大部分标记效应为0),更符合真实遗传架构。
- GBLUP(Genomic BLUP):利用标记信息构建基因组关系矩阵G,替代传统的系谱关系矩阵A,进行最佳线性无偏预测。
- 机器学习算法:随机森林(RF)、支持向量机(SVM)、神经网络等也被用于GS,在处理非加性遗传效应时可能优于线性模型。
3. 实施流程
(1) 训练群体构建:选择具有代表性的群体,测定高密度SNP基因型和目标性状表型。
(2) 统计模型训练:利用训练数据估计标记效应。
(3) 育种值预测:对候选个体(仅有基因型)计算GEBV。
(4) 选择决策:根据GEBV排名,选择最优个体进入下一代。
(5) 模型更新:定期用新收集的表型数据更新预测模型,保持预测准确性。
4. 影响预测准确性的因素
- 训练群体大小:一般而言,训练群体越大,预测准确性越高。
- 训练群体与候选群体的亲缘关系:关系越近,预测越准确。
- 性状遗传力:遗传力越高,GS效果越好。
- 标记密度:需要足够密度的标记覆盖全基因组,捕获LD信息。
- 性状遗传架构:由大量微效基因控制的性状更适合GS。

查看详情 →
💡

分子标记辅助育种的原理

concept

**1. QTL定位** 数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。 常用方法: - **单标记分析(SMA)**:检验单个标记与性状的关联 - **区间作图(IM)**:利用两侧标记信息,检测标记区间内的QTL - **复合区间作图(...

1. QTL定位
数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。
常用方法:
- 单标记分析(SMA):检验单个标记与性状的关联
- 区间作图(IM):利用两侧标记信息,检测标记区间内的QTL
- 复合区间作图(CIM):在区间作图基础上,加入背景标记控制多QTL效应
- 全基因组关联分析(GWAS):利用自然群体中的连锁不平衡(LD),不需要构建专门的家系
2. MAS(Marker-Assisted Selection)策略
- 前景选择:利用与目标QTL紧密连锁的标记,选择携带有利等位基因的个体。
- 背景选择:利用全基因组标记,监测轮回亲本的基因组恢复程度,加速回交育种进程。
- 基因聚合(Gene Pyramiding):将多个有利基因/QTL聚合到同一个品种中。
3. 标记类型
从RFLP、AFLP、SSR发展到目前的SNP(单核苷酸多态性)。SNP标记具有密度高、分布广、自动化检测等优点,已成为MAB和GS的主流标记。

查看详情 →
💡

种质资源鉴定的原理

concept

**1. 遗传多样性分析** - **群体结构分析**:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。 - **主成分分析(PCA)**:降维可视化种质间的遗传关系。 - **进化树构建**:基于遗传距离构建系统发育树,揭示种质的亲缘关系。 **2. 核心种质构建** - 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。 - 常用策略:基于遗传...

1. 遗传多样性分析
- 群体结构分析:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。
- 主成分分析(PCA):降维可视化种质间的遗传关系。
- 进化树构建:基于遗传距离构建系统发育树,揭示种质的亲缘关系。
2. 核心种质构建
- 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。
- 常用策略:基于遗传距离的逐步聚类采样、基于等位基因覆盖率的优化算法。
3. 指纹图谱构建
- 利用一组高度多态性的SSR或SNP标记,为每个品种建立独特的DNA指纹。
- 用于品种真实性鉴定、纯度检测和知识产权保护。
4. 优异等位基因发掘
- 通过GWAS或候选基因关联分析,在种质资源中挖掘与重要农艺性状相关的优异等位基因。
- 这些优异等位基因可作为分子标记辅助育种或转基因育种的靶点。

查看详情 →
💡

案例一:玉米基因组选择育种

concept

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测: 1. **训练群体**:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。 2. **模型建立**:使用rrBLUP或BayesB模型训练。 3. **预测应用**:对新合成的杂交组合(仅有基因型)预测配合力。 4. **效果**:GS可将育种周期从传统的5-6年缩短至2-3年,预...

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测:
1. 训练群体:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。
2. 模型建立:使用rrBLUP或BayesB模型训练。
3. 预测应用:对新合成的杂交组合(仅有基因型)预测配合力。
4. 效果:GS可将育种周期从传统的5-6年缩短至2-3年,预测准确性达到0.5-0.8(取决于性状和群体)。

# 使用rrBLUP包进行基因组选择
library(rrBLUP)
# 读取基因型矩阵(n×m,n个体,m标记)和表型
marker_data <- read.table("snps.txt", header=TRUE)
phenotype <- read.table("yield.txt", header=TRUE)
# 训练模型
model <- mixed.solve(y=phenotype$yield, Z=marker_data)
# 预测育种值
gebv <- marker_data %*% model$u
查看详情 →
💡

案例二:水稻分子标记辅助抗病育种

concept

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。 1. **标记开发**:开发与Xa21紧密连锁的PCR标记(如PTA248)。 2. **前景选择**:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。 3. **背景选择**:利用全基因组SNP标记,选择轮回亲本基因...

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。
1. 标记开发:开发与Xa21紧密连锁的PCR标记(如PTA248)。
2. 前景选择:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。
3. 背景选择:利用全基因组SNP标记,选择轮回亲本基因组恢复率最高的个体。
4. 结果:仅需2-3个回交世代即可获得基因组恢复率>95%的抗性近等基因系,而传统回交需要6-7代。

# Xa21前景选择PCR标记检测
# 引物序列:正向 5'-GCTCGATCGATAATGGAAGG-3'
#          反向 5'-TTGGTGATGGTTCGACGAGC-3'
PCR反应体系(20 μL):
- 2× PCR Mix: 10 μL
- 正向引物 (10 μM): 0.5 μL
- 反向引物 (10 μM): 0.5 μL
- DNA模板 (50 ng/μL): 1 μL
- ddH2O: 8 μL
PCR程序:
94°C 5min
[94°C 30s → 55°C 30s → 72°C 1min] × 35 cycles
72°C 7min
预期结果:携带Xa21的个体扩增出约500 bp的条带
查看详情 →
💡

案例三:小麦种质资源的遗传多样性分析

concept

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布: 1. **SNP基因型**:使用35K SNP芯片对约8,000份核心种质进行基因分型。 2. **群体结构**:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。 3. **多样性评估**:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基...

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布:
1. SNP基因型:使用35K SNP芯片对约8,000份核心种质进行基因分型。
2. 群体结构:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。
3. 多样性评估:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基因数(Ne)降低,表明育种过程中存在遗传瓶颈。
4. 核心种质构建:基于等位基因丰富度,从8,000份种质中选择约1,000份核心种质,保留了>95%的等位基因。
5. 优异等位基因发掘:GWAS分析在核心种质中鉴定了与产量、抗病性、品质相关的多个显著位点。

# 使用scikit-allel进行群体遗传分析
import allel
import numpy as np
# 读取VCF文件
callset = allel.read_vcf('wheat_samples.vcf.gz', 
                          fields=['calldata/GT', 'variants/POS', 'samples'])
gt = allel.GenotypeArray(callset['calldata/GT'])
# 计算等位基因频率
ac = gt.count_alleles()
# 计算多态性信息含量(PIC)
n = ac.sum(axis=1)
p = ac[:, 0] / n
q = ac[:, 1] / n
pic = 1 - (p**2 + q**2) - 2 * p**2 * q**2
查看详情 →
💡

12.4 其他应用

section
查看详情 →
💡

合成生物学中的生物信息学原理

concept

**1. 生物元件标准化与表征** 合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元: - **启动子(Promoter)**:控制基因表达的"开关" - **核糖体结合位点(RBS)**:调控翻译起始效率 - **编码序列(CDS)**:编码蛋白质的功能基因 - **终止子(Terminator)**:终止转录的信号 生物信息学通过建立元件库(如iGE...

1. 生物元件标准化与表征
合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元:
- 启动子(Promoter):控制基因表达的"开关"
- 核糖体结合位点(RBS):调控翻译起始效率
- 编码序列(CDS):编码蛋白质的功能基因
- 终止子(Terminator):终止转录的信号
生物信息学通过建立元件库(如iGEM Registry、SynBioHub)和标准化表征数据,使元件可以像电子元件一样被组合使用。
2. 基因线路设计
基因线路是由多个生物元件组成的遗传回路,实现逻辑运算(如AND门、OR门、NOT门):
- 布尔逻辑门:例如,双输入AND门需要两个诱导物同时存在才能激活报告基因表达。
- 振荡器:如repressilator,由三个抑制子基因组成的负反馈环,产生周期性基因表达振荡。
- 双稳态开关:两个相互抑制的基因,使系统可以稳定处于两种状态之一。
生物信息学工具(如Cello、Genetic Constructor)提供图形化界面设计基因线路,并自动转换为DNA序列。
3. 代谢工程与通路设计
代谢工程旨在改造细胞代谢网络,使其高效生产目标化合物:
- 通路搜索:利用KEGG、MetaCyc等数据库,搜索从天然底物到目标产物的已知或潜在代谢路径。
- 通量平衡分析(FBA):利用代谢网络的化学计量矩阵,在稳态假设下(Sv=0),通过线性规划优化目标产物产量。
- 酶选择与优化:在已知反应步骤中,从不同物种中筛选催化效率最高的酶,并通过蛋白质工程(定向进化、理性设计)优化酶性质。
4. DNA序列优化
- 密码子优化:根据宿主细胞的密码子使用偏好,调整外源基因的密码子组成,提高翻译效率。
- mRNA二级结构优化:避免在RBS区域形成发夹结构,保证翻译起始效率。
- 避免重复序列和限制性酶切位点:防止DNA重组和克隆困难。

查看详情 →
💡

生物多样性保护的生物信息学原理

concept

**1. DNA条形码鉴定** -DNA条形码的原理是:物种内遗传距离应远小于物种间距离。 - 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。 - 对于未知物种,构建系统发育树,推断其分类地位。 **2. eDNA Metabarcoding** -eDNA metabarcoding结合了环境采样和高通量测序: (1) 环境DNA提取:从水样、...

1. DNA条形码鉴定
-DNA条形码的原理是:物种内遗传距离应远小于物种间距离。
- 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。
- 对于未知物种,构建系统发育树,推断其分类地位。
2. eDNA Metabarcoding
-eDNA metabarcoding结合了环境采样和高通量测序:
(1) 环境DNA提取:从水样、土壤等环境基质中提取总DNA。
(2) 通用引物PCR:使用覆盖多个物种的通用引物扩增目标区域(如16S rRNA、COI、ITS)。
(3) 高通量测序:Illumina或Nanopore平台测序。
(4) 生物信息学分析:序列质控、去嵌合体、OTU/ASV聚类、物种注释(与参考数据库比对)、多样性分析。
3. 群体遗传学在保护中的应用
- 有效种群大小(Ne)估计:反映种群的遗传健康状况,Ne越小,遗传多样性丧失越快。
- 近亲繁殖评估:利用杂合度降低、ROH(连续纯合子片段)分析评估近亲繁殖程度。
- 迁徙与基因流分析:利用STRUCTURE、MIGRATE等工具分析种群间的基因交流。
- 适应性遗传变异检测:利用选择信号扫描(如FST离群值、环境关联分析)识别与环境适应相关的基因。
4. 保护基因组学(Conservation Genomics)
- 利用全基因组数据指导保护决策:
- 识别具有独特遗传适应性的种群,优先保护
- 评估近交衰退风险
- 指导遗传 rescue(引入外来基因恢复遗传多样性)
- 追踪非法野生动物贸易(通过DNA溯源)

查看详情 →
💡

案例一:酵母青蒿酸合成通路的设计

concept

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路: 1. **通路设计**:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。 2. **基因来源选择**:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。 3. **密码子优化**:将所有外源基因按照酵母密...

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路:
1. 通路设计:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。
2. 基因来源选择:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。
3. 密码子优化:将所有外源基因按照酵母密码子偏好进行优化。
4. 代谢流调控:通过FBA分析,鉴定限制产量的代谢瓶颈。过表达tHMG1增加FPP供应,下调ERG9减少FPP向麦角固醇分流。
5. 启动子强度平衡:利用不同强度的启动子组合,平衡通路中各酶的表达量,避免中间产物积累。
6. 结果:工程酵母的青蒿酸产量从初始的约100 mg/L提升到超过25 g/L,实现了工业化生产。

# 使用cobra进行通量平衡分析
import cobra
from cobra.io import read_sbml_model
# 读取酵母代谢模型
model = read_sbml_model('yeast-GEM.xml')
# 设置目标函数:最大化青蒿酸产量
model.objective = model.reactions.DM_artemisinic_acid
# 优化
solution = model.optimize()
print(f"最大理论产量: {solution.objective_value} mmol/gDW/h")
print(f"生长速率: {solution.fluxes['BIOMASS_Ec_iML1515_core_75p37M']}")
# 查找关键通量
for rxn in model.reactions:
    if abs(solution.fluxes[rxn.id]) > 1:
        print(f"{rxn.id}: {solution.fluxes[rxn.id]:.2f}")
查看详情 →
💡

案例二:eDNA监测入侵物种——亚洲鲤鱼

concept

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。 1. **eDNA采样**:在河流和湖泊的关键位置采集水样。 2. **引物设计**:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。 3. **qPCR检测**:检测水样中是否存在亚洲鲤鱼的DNA。 4. **结果**:eDNA检测可以在亚...

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。
1. eDNA采样:在河流和湖泊的关键位置采集水样。
2. 引物设计:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。
3. qPCR检测:检测水样中是否存在亚洲鲤鱼的DNA。
4. 结果:eDNA检测可以在亚洲鲤鱼实际到达前数月预警其入侵路径,比传统方法更灵敏。
5. ** metabarcoding扩展**:进一步利用12S rRNA通用引物进行eDNA metabarcoding,同时监测所有鱼类群落组成,评估入侵对本地群落的影响。

# eDNA metabarcoding分析流程(示例)
# 1. 原始数据质控
fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \
      -o clean_R1.fastq.gz -O clean_R2.fastq.gz \
      -q 20 -u 30 -l 50
# 2. DADA2去重(R中运行)
# library(dada2)
# seqtab <- dada2::mergePairs(dadaF, derepF, dadaR, derepR)
# 3. OTU聚类和物种注释(使用VSEARCH)
vsearch --cluster_size clean.fasta --id 0.97 \
        --centroids otus.fasta --relabel OTU_
vsearch --usearch_global clean.fasta --db reference_db.fasta \
        --id 0.97 --otutabout otu_table.txt
# 4. 多样性分析(使用QIIME 2或R的vegan包)
查看详情 →
💡

案例三:大熊猫保护基因组学

concept

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据: 1. **全基因组测序**:对多个野生和圈养大熊猫种群进行全基因组重测序。 2. **遗传多样性评估**:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。 3. **近交分析**:检测到长片段ROH,证实近亲繁殖的存在。 4. **有害突变负荷**:发现大熊猫携带大量有害突变,但...

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据:
1. 全基因组测序:对多个野生和圈养大熊猫种群进行全基因组重测序。
2. 遗传多样性评估:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。
3. 近交分析:检测到长片段ROH,证实近亲繁殖的存在。
4. 有害突变负荷:发现大熊猫携带大量有害突变,但由于近亲繁殖,这些突变以纯合状态暴露,可能影响种群适应性和繁殖成功率。
5. 保护建议
- 优先保护遗传独特性高的种群(如秦岭亚种)
- 圈养繁殖计划应避免近亲交配
- 考虑栖息地连通性,促进野生种群间的基因交流

查看详情 →

其他应用

💡

第12章 生物信息学应用

chapter
查看详情 →
💡

12.1 精准医学

section
查看详情 →
💡

基因组医学的原理

concept

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析: 1. **变异检测**:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。 2. *...

人类基因组由约30亿个碱基对组成,其中包含着决定个体特征的遗传信息。基因组医学的核心是通过测序技术获取个体基因组信息,然后利用生物信息学方法进行分析:
1. 变异检测:将测序reads比对到参考基因组(如GRCh38),识别单核苷酸多态性(SNP)、插入缺失(Indel)、结构变异(SV)等。常用的比对工具包括BWA、Bowtie2,变异检测工具包括GATK、Samtools等。
2. 变异注释:使用ANNOVAR、VEP(Variant Effect Predictor)等工具对检测到的变异进行功能注释,判断变异位于基因组的什么位置(编码区、非编码区、调控区)、是否改变氨基酸序列(同义突变、错义突变、无义突变、移码突变)等。
3. 致病性评估:结合人群频率数据库(如gnomAD)、致病性预测工具(如SIFT、PolyPhen-2、CADD)和临床数据库(如ClinVar、OMIM),评估变异的致病可能性。
4. 多组学整合:将基因组数据与转录组(RNA-seq)、蛋白质组、代谢组等数据整合,构建全面的分子图谱。

查看详情 →
💡

肿瘤基因组学的原理

concept

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括: 1. **肿瘤-正常配对分析**:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。 2. **突变特征分析**:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺...

肿瘤是一种基因组疾病,其特征是体细胞突变的累积。肿瘤基因组学的分析流程包括:
1. 肿瘤-正常配对分析:同时测序肿瘤组织和患者的正常组织(如血液),通过比对识别肿瘤特异性体细胞突变。这可以排除胚系突变(germline variants),聚焦于驱动肿瘤发展的体细胞突变(somatic variants)。
2. 突变特征分析:不同类型的致突变因子(如紫外线、烟草烟雾、DNA修复缺陷)会产生特定的突变模式,称为突变特征(mutational signatures)。通过分解突变谱,可以推断肿瘤的致突变因素。
3. 驱动突变识别:并非所有突变都对肿瘤发展有贡献。乘客突变(passenger mutations)是随机累积的,而驱动突变(driver mutations)则赋予细胞生长优势。生物信息学工具如OncodriveCLUST、MutSigCV通过统计方法识别显著的驱动突变。
4. 肿瘤异质性分析:肿瘤内部存在多个亚克隆,每个亚克隆具有不同的突变谱。通过PyClone、SciClone等工具可以重建肿瘤进化树,理解治疗耐药性的产生机制。

查看详情 →
💡

药物基因组学的原理

concept

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控: 1. **药物代谢酶**:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。 2. **药物转运体**:ABCB1(MDR1)、SLC...

药物在体内的代谢和作用涉及多个阶段:吸收、分布、代谢、排泄(ADME)和靶点作用。这些过程由特定基因编码的酶和受体调控:
1. 药物代谢酶:细胞色素P450(CYP)酶家族负责代谢约75%的临床药物。CYP2D6、CYP2C19、CYP2C9等基因存在高度多态性,导致个体间代谢速率差异(快代谢型、正常代谢型、慢代谢型、超快代谢型)。
2. 药物转运体:ABCB1(MDR1)、SLCO1B1等转运体基因的多态性影响药物的吸收和分布。
3. 药物靶点:VKORC1基因变异影响华法林的靶点敏感性,决定抗凝治疗剂量。
4. 剂量预测模型:基于患者的基因型和临床特征(年龄、体重、合并用药等),建立剂量预测算法,如华法林剂量预测模型整合VKORC1和CYP2C9基因型信息。

查看详情 →
💡

案例一:新生儿罕见病基因组诊断

concept

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。 分析流程: 1. WES测序(约2×10^7 reads...

一名出生3天的婴儿出现不明原因的代谢性酸中毒和低血糖。传统检测未能明确诊断。全外显子组测序(WES)在48小时内完成,生物信息学分析发现MMACHC基因存在复合杂合突变(c.271dupA和c.609G>A),诊断为钴胺素代谢障碍型C(cobalamin C disease)。这一诊断指导了维生素B12补充治疗,避免了不可逆的神经系统损伤。
分析流程:
1. WES测序(约2×10^7 reads,150bp paired-end)
2. BWA-MEM比对到GRCh38参考基因组
3. GATK HaplotypeCaller检测变异
4. VEP注释变异效应
5. 过滤:保留罕见变异(gnomAD AF<0.01)、蛋白截断或错义变异
6. 候选基因筛选:聚焦代谢疾病相关基因 panel
7. Sanger测序验证突变

查看详情 →
💡

案例二:非小细胞肺癌的精准治疗

concept

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。 融合基因检测流程: 1. RNA-seq数据质控...

一名65岁女性患者诊断为晚期肺腺癌。肿瘤组织RNA-seq和DNA-seq分析显示EML4-ALK基因融合(variant 1)。生物信息学分析通过STAR-Fusion检测到EML4基因的第13号外显子与ALK基因的第20号外显子融合。基于这一结果,患者接受了ALK抑制剂克唑替尼(Crizotinib)治疗,而非传统的化疗,获得了显著的临床获益。
融合基因检测流程:
1. RNA-seq数据质控(FastQC)
2. STAR比对(使用chimeric alignment模式)
3. STAR-Fusion或Arriba检测融合基因
4. 可视化验证(IGV查看融合断点)
5. 临床解读(OncoKB数据库查询靶向药物)

查看详情 →
💡

案例三:华法林个体化给药

concept

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C9*1/*3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

一名70岁房颤患者需要抗凝治疗。药物基因组学检测显示CYP2C91/3和VKORC1 -1639A/A基因型。基于IWPC(国际华法林药物基因组学联盟)算法,预测该患者的华法林维持剂量为2.1 mg/天(标准剂量为5 mg/天)。医生据此调整了初始剂量,避免了过量使用导致的出血风险。

查看详情 →
💡

12.2 智能药学

section
查看详情 →
💡

药物靶点发现的生物信息学策略

concept

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略: **1. 基因组学方法** - **全基因组关联分析(GWAS)**:通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。 - **表达数量性状位点(eQTL)分析**:将GWAS发现的疾病关联位点与...

药物靶点发现的核心是识别与疾病发生发展密切相关的生物分子。生物信息学提供了系统性的靶点发现策略:
1. 基因组学方法
- 全基因组关联分析(GWAS):通过比较病例和对照群体的基因组变异,识别与疾病风险显著相关的基因位点。例如,PCSK9基因的功能获得性突变与高胆固醇血症相关,使其成为降脂药物的理想靶点。
- 表达数量性状位点(eQTL)分析:将GWAS发现的疾病关联位点与基因表达数据整合,推断因果基因。
2. 网络药理学方法
- 疾病模块识别:利用蛋白质相互作用网络(PPI),识别与疾病相关的功能模块。一个理想的药物靶点应位于疾病模块的中心位置(高介数中心性),干扰它可以最大程度地影响疾病进程。
- 网络邻近性分析:计算药物靶点与疾病基因在网络中的距离,预测药物重定位(drug repurposing)的可能性。
3. 多组学整合方法
- 整合基因组、转录组、蛋白质组和代谢组数据,构建多层次的疾病分子图谱,系统性地识别关键节点作为潜在靶点。
- 差异表达分析(如DESeq2、edgeR)识别疾病状态下显著上调或下调的基因。
4. 靶点可药性评估
- 并非所有与疾病相关的蛋白都是好的药物靶点。可药性(druggability)评估考虑:是否有适合小分子结合的口袋、靶点的组织特异性表达、靶向该靶点是否会产生严重毒副作用等。
- 工具如DrugMAP、canSAR数据库提供蛋白质可药性预测。

查看详情 →
💡

计算机辅助药物设计的原理

concept

**基于结构的药物设计(SBDD)** SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为: 1. **靶点结构准备**:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。 2. **活性位点识别**:使用Fpocket、SiteMap等工具预测结合口袋。 3. **虚拟筛选**:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口...

基于结构的药物设计(SBDD)
SBDD需要靶蛋白的三维结构信息(通常来自X射线晶体学、冷冻电镜或同源建模)。其工作流程为:
1. 靶点结构准备:获取蛋白质结构(PDB数据库),去除水分子、添加氢原子、优化侧链构象。
2. 活性位点识别:使用Fpocket、SiteMap等工具预测结合口袋。
3. 虚拟筛选:将大型化合物库(如ZINC数据库的数百万分子)对接到靶点口袋,根据对接打分排序。
4. 先导化合物优化:基于对接结果和相互作用分析,进行结构修饰以提高活性、选择性和成药性。
基于配体的药物设计(LBDD)
当靶点结构未知时,可以利用已知活性配体的信息:
1. 药效团建模:提取活性分子共同的化学特征(氢键供体/受体、疏水中心、芳环中心)及其空间排布,建立药效团模型,用于数据库搜索。
2. 定量构效关系(QSAR):建立分子描述符与生物活性之间的统计模型,预测新化合物的活性。
3. 分子相似性搜索:基于"相似结构的分子具有相似活性"的原则,在化学空间中搜索与已知活性分子相似的化合物。

查看详情 →
💡

分子对接的原理

concept

分子对接模拟配体与受体的结合过程,包括两个核心问题: **1. 构象搜索(Pose Prediction)** - 在构象空间中搜索配体的最优结合姿态。 - 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。 - 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。 **2. 结合亲和力预测(Scoring...

分子对接模拟配体与受体的结合过程,包括两个核心问题:
1. 构象搜索(Pose Prediction)
- 在构象空间中搜索配体的最优结合姿态。
- 常用算法包括:系统搜索(Systematic Search)、随机搜索(Monte Carlo、遗传算法)、基于物理的搜索(分子动力学模拟)。
- 搜索空间包括配体的平移、旋转和可旋转键的二面角变化。
2. 结合亲和力预测(Scoring)
- 打分函数评估每个结合姿态的亲和力,用于排序。
- 打分函数类型:
- 力场打分:基于分子力学能量项(范德华力、静电相互作用)
- 经验打分:拟合实验数据得到的加权能量项
- 知识-based打分:基于蛋白质-配体复合物结构数据库的统计势能
- 机器学习打分:使用RF、SVM、CNN等算法学习结构-亲和力关系
常用分子对接软件包括AutoDock Vina、Glide、GOLD、rDock等。

查看详情 →
💡

AI药物设计的原理

concept

**1. 生成式分子设计** - **变分自编码器(VAE)**:学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。 - **生成对抗网络(GAN)**:生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。 - **强化学习(RL)**:将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。 - **扩散模型(Diff...

1. 生成式分子设计
- 变分自编码器(VAE):学习化学空间的连续潜在表示,通过在潜在空间中采样和插值生成新分子。
- 生成对抗网络(GAN):生成器生成分子,判别器判断分子是否"真实",通过对抗训练提高生成分子的质量。
- 强化学习(RL):将分子生成视为序列决策过程,通过奖励函数(如预测活性、合成可行性)引导生成满足特定性质的分子。
- 扩散模型(Diffusion Model):目前最先进的生成模型,通过逐步去噪生成高质量分子,在3D分子生成方面表现优异。
2. 分子性质预测
- 图神经网络(GNN):将分子表示为图(原子为节点,键为边),利用消息传递机制学习分子表征,预测生物活性、毒性、药代动力学性质(ADMET)。
- Transformer架构:如ChemBERTa、MolBERT,将SMILES字符串作为输入序列,利用自注意力机制学习化学语言模型。
3. 蛋白质结构预测
- AlphaFold2:利用注意力机制和多序列比对(MSA)实现接近实验精度的蛋白质结构预测,为SBDD提供了前所未有的结构基础。
- RoseTTAFold:另一种高精度蛋白质结构预测方法。

查看详情 →
💡

案例一:COVID-19靶点发现与药物重定位

concept

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点: 1. **基因组注释**:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。 2. **人类-病毒蛋白质相互作用**:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式...

2020年初,SARS-CoV-2病毒基因组序列公布后不久,生物信息学分析迅速识别了关键药物靶点:
1. 基因组注释:分析病毒基因组(约30kb RNA),预测开放阅读框(ORF),识别出编码主要蛋白:刺突蛋白(S)、主蛋白酶(Mpro/3CLpro)、RNA依赖性RNA聚合酶(RdRp)等。
2. 人类-病毒蛋白质相互作用:利用PPI网络分析,发现病毒蛋白与人体蛋白的相互作用模式,预测关键宿主因子(如ACE2受体、TMPRSS2)。
3. 药物重定位:通过网络邻近性分析,筛选已上市药物中可能有效对抗SARS-CoV-2的候选药物。例如,基于病毒-宿主相互作用网络,预测氯喹和瑞德西韦(Remdesivir)可能有效(后续临床试验验证了瑞德西韦的疗效)。
4. 虚拟筛选:以Mpro为靶点,对ZINC数据库进行虚拟筛选,识别潜在抑制剂。德国研究团队通过高通量X射线晶体学筛选,发现了Mpro抑制剂的前导化合物。

# 使用RDKit进行分子对接准备示例
from rdkit import Chem
from rdkit.Chem import AllChem
# 读取配体分子
ligand = Chem.MolFromSmiles("CC(C)Cc1ccc(cc1)C(C)C(=O)O")  # 布洛芬
ligand = Chem.AddHs(ligand)
AllChem.EmbedMolecule(ligand, AllChem.ETKDG())
# 保存为PDB格式用于对接
Chem.MolToPDBFile(ligand, "ligand.pdb")
查看详情 →
💡

案例二:AlphaFold驱动的药物设计——靶向KRAS G12C

algorithm

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。 1. **结构解析**:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。 2. **共价抑制剂设计**:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sot...

KRAS基因是肿瘤中最常见的突变癌基因之一,但长期以来被认为是"不可成药"的靶点,因为其蛋白表面光滑,缺乏适合小分子结合的口袋。
1. 结构解析:AlphaFold2预测了KRAS蛋白的多种构象状态,揭示了Switch II口袋(仅在KRAS的GDP结合非活性状态下开放)。
2. 共价抑制剂设计:基于结构信息,设计了与KRAS G12C突变位点(半胱氨酸)形成共价键的抑制剂。Sotorasib(AMG 510)和Adagrasib(MRTX849)通过共价结合Cys12,将KRAS锁定在非活性状态。
3. AI优化:利用机器学习模型预测化合物的选择性、代谢稳定性和口服生物利用度,优化先导化合物。
这一案例展示了从"不可成药"到"可成药"的转变如何依赖于精准的结构信息和计算设计。

查看详情 →
💡

案例三:AI生成全新抗生素——Halicin的发现

concept

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin: 1. **训练数据**:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。 2. **虚拟筛选**:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。 3. **实验验证**:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝...

MIT的研究团队利用深度学习方法发现了一种新型抗生素Halicin:
1. 训练数据:使用2,335个已知具有抗菌活性的分子训练图神经网络模型。
2. 虚拟筛选:对Drug Repurposing Hub中的约6,000个分子进行活性预测,识别出Halicin(原本用于糖尿病的候选药物)具有强抗菌活性。
3. 实验验证:Halicin对多种耐药菌(包括鲍曼不动杆菌、结核分枝杆菌)表现出强效杀菌活性,且与现有抗生素无交叉耐药性。
4. 作用机制:后续研究表明Halicin通过干扰细菌的质子动力势发挥作用,这是一种全新的作用机制。

# 使用DeepChem进行分子性质预测示例
import deepchem as dc
from deepchem.models import GraphConvModel
# 加载Tox21毒性数据集
tasks, datasets, transformers = dc.molnet.load_tox21()
train_dataset, valid_dataset, test_dataset = datasets
# 构建图卷积网络模型
model = GraphConvModel(
    n_tasks=len(tasks),
    mode='classification',
    batch_size=64,
    learning_rate=0.001
)
# 训练模型
model.fit(train_dataset, nb_epoch=20)
查看详情 →
💡

12.3 智能育种

section
查看详情 →
💡

基因组选择(GS)的原理

concept

**1. 基本概念** 基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。 假设个体的表型值P可以分解为: P = μ + g + e 其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。 GS的目标是利用标记基因型X来预测遗传效应...

1. 基本概念
基因组选择的理论基础是:全基因组标记可以捕获个体间的大部分遗传变异,通过统计模型可以利用标记信息预测个体的基因组育种值(Genomic Estimated Breeding Value, GEBV)。
假设个体的表型值P可以分解为:
P = μ + g + e
其中,μ为群体均值,g为遗传效应(加性+显性+上位性),e为环境误差。
GS的目标是利用标记基因型X来预测遗传效应g:
g = Xβ + ε
其中,β为标记效应向量。
2. 统计模型
基因组选择的核心是估计每个标记的效应。由于标记数(p,通常为数千至数百万)远大于个体数(n,数百至数千),传统的最小二乘法无法直接使用,需要借助特殊统计方法:
- 岭回归最佳线性无偏预测(RR-BLUP):假设所有标记效应服从正态分布,通过L2正则化(岭回归)解决过拟合问题。计算速度快,是GS的基准方法。
- 贝叶斯方法(BayesA、BayesB、Bayesian LASSO等):假设标记效应服从不同的先验分布。BayesB假设只有少数标记具有大效应(大部分标记效应为0),更符合真实遗传架构。
- GBLUP(Genomic BLUP):利用标记信息构建基因组关系矩阵G,替代传统的系谱关系矩阵A,进行最佳线性无偏预测。
- 机器学习算法:随机森林(RF)、支持向量机(SVM)、神经网络等也被用于GS,在处理非加性遗传效应时可能优于线性模型。
3. 实施流程
(1) 训练群体构建:选择具有代表性的群体,测定高密度SNP基因型和目标性状表型。
(2) 统计模型训练:利用训练数据估计标记效应。
(3) 育种值预测:对候选个体(仅有基因型)计算GEBV。
(4) 选择决策:根据GEBV排名,选择最优个体进入下一代。
(5) 模型更新:定期用新收集的表型数据更新预测模型,保持预测准确性。
4. 影响预测准确性的因素
- 训练群体大小:一般而言,训练群体越大,预测准确性越高。
- 训练群体与候选群体的亲缘关系:关系越近,预测越准确。
- 性状遗传力:遗传力越高,GS效果越好。
- 标记密度:需要足够密度的标记覆盖全基因组,捕获LD信息。
- 性状遗传架构:由大量微效基因控制的性状更适合GS。

查看详情 →
💡

分子标记辅助育种的原理

concept

**1. QTL定位** 数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。 常用方法: - **单标记分析(SMA)**:检验单个标记与性状的关联 - **区间作图(IM)**:利用两侧标记信息,检测标记区间内的QTL - **复合区间作图(...

1. QTL定位
数量性状位点(Quantitative Trait Locus, QTL)定位是MAB的基础。通过构建分离群体(如F2、RIL、DH),获得标记基因型和表型数据,利用统计分析检测与性状显著关联的染色体区域。
常用方法:
- 单标记分析(SMA):检验单个标记与性状的关联
- 区间作图(IM):利用两侧标记信息,检测标记区间内的QTL
- 复合区间作图(CIM):在区间作图基础上,加入背景标记控制多QTL效应
- 全基因组关联分析(GWAS):利用自然群体中的连锁不平衡(LD),不需要构建专门的家系
2. MAS(Marker-Assisted Selection)策略
- 前景选择:利用与目标QTL紧密连锁的标记,选择携带有利等位基因的个体。
- 背景选择:利用全基因组标记,监测轮回亲本的基因组恢复程度,加速回交育种进程。
- 基因聚合(Gene Pyramiding):将多个有利基因/QTL聚合到同一个品种中。
3. 标记类型
从RFLP、AFLP、SSR发展到目前的SNP(单核苷酸多态性)。SNP标记具有密度高、分布广、自动化检测等优点,已成为MAB和GS的主流标记。

查看详情 →
💡

种质资源鉴定的原理

concept

**1. 遗传多样性分析** - **群体结构分析**:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。 - **主成分分析(PCA)**:降维可视化种质间的遗传关系。 - **进化树构建**:基于遗传距离构建系统发育树,揭示种质的亲缘关系。 **2. 核心种质构建** - 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。 - 常用策略:基于遗传...

1. 遗传多样性分析
- 群体结构分析:利用Structure、Admixture等软件推断群体的遗传结构和亚群划分。
- 主成分分析(PCA):降维可视化种质间的遗传关系。
- 进化树构建:基于遗传距离构建系统发育树,揭示种质的亲缘关系。
2. 核心种质构建
- 从大规模种质库中选择最少数量的样本,最大程度保留原始群体的遗传多样性。
- 常用策略:基于遗传距离的逐步聚类采样、基于等位基因覆盖率的优化算法。
3. 指纹图谱构建
- 利用一组高度多态性的SSR或SNP标记,为每个品种建立独特的DNA指纹。
- 用于品种真实性鉴定、纯度检测和知识产权保护。
4. 优异等位基因发掘
- 通过GWAS或候选基因关联分析,在种质资源中挖掘与重要农艺性状相关的优异等位基因。
- 这些优异等位基因可作为分子标记辅助育种或转基因育种的靶点。

查看详情 →
💡

案例一:玉米基因组选择育种

concept

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测: 1. **训练群体**:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。 2. **模型建立**:使用rrBLUP或BayesB模型训练。 3. **预测应用**:对新合成的杂交组合(仅有基因型)预测配合力。 4. **效果**:GS可将育种周期从传统的5-6年缩短至2-3年,预...

玉米是基因组选择应用最成功的作物之一。美国玉米育种中,GS已广泛应用于配合力预测:
1. 训练群体:500-2000个杂交组合,测定SNP基因型(约50K SNP芯片)和测交产量表型。
2. 模型建立:使用rrBLUP或BayesB模型训练。
3. 预测应用:对新合成的杂交组合(仅有基因型)预测配合力。
4. 效果:GS可将育种周期从传统的5-6年缩短至2-3年,预测准确性达到0.5-0.8(取决于性状和群体)。

# 使用rrBLUP包进行基因组选择
library(rrBLUP)
# 读取基因型矩阵(n×m,n个体,m标记)和表型
marker_data <- read.table("snps.txt", header=TRUE)
phenotype <- read.table("yield.txt", header=TRUE)
# 训练模型
model <- mixed.solve(y=phenotype$yield, Z=marker_data)
# 预测育种值
gebv <- marker_data %*% model$u
查看详情 →
💡

案例二:水稻分子标记辅助抗病育种

concept

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。 1. **标记开发**:开发与Xa21紧密连锁的PCR标记(如PTA248)。 2. **前景选择**:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。 3. **背景选择**:利用全基因组SNP标记,选择轮回亲本基因...

水稻白叶枯病是由Xanthomonas oryzae pv. oryzae引起的严重病害。通过QTL定位,科学家发现了多个抗性基因(如Xa21、Xa23、Xa27)。
1. 标记开发:开发与Xa21紧密连锁的PCR标记(如PTA248)。
2. 前景选择:在BC1F1回交后代中,利用PCR标记筛选携带Xa21的个体。
3. 背景选择:利用全基因组SNP标记,选择轮回亲本基因组恢复率最高的个体。
4. 结果:仅需2-3个回交世代即可获得基因组恢复率>95%的抗性近等基因系,而传统回交需要6-7代。

# Xa21前景选择PCR标记检测
# 引物序列:正向 5'-GCTCGATCGATAATGGAAGG-3'
#          反向 5'-TTGGTGATGGTTCGACGAGC-3'
PCR反应体系(20 μL):
- 2× PCR Mix: 10 μL
- 正向引物 (10 μM): 0.5 μL
- 反向引物 (10 μM): 0.5 μL
- DNA模板 (50 ng/μL): 1 μL
- ddH2O: 8 μL
PCR程序:
94°C 5min
[94°C 30s → 55°C 30s → 72°C 1min] × 35 cycles
72°C 7min
预期结果:携带Xa21的个体扩增出约500 bp的条带
查看详情 →
💡

案例三:小麦种质资源的遗传多样性分析

concept

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布: 1. **SNP基因型**:使用35K SNP芯片对约8,000份核心种质进行基因分型。 2. **群体结构**:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。 3. **多样性评估**:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基...

国际玉米小麦改良中心(CIMMYT)保存了超过15万份小麦种质资源。生物信息学分析揭示了这些资源的遗传结构和多样性分布:
1. SNP基因型:使用35K SNP芯片对约8,000份核心种质进行基因分型。
2. 群体结构:STRUCTURE分析识别出4个主要亚群,对应不同的地理来源和育种历史。
3. 多样性评估:比较地方品种和现代育成品种的遗传多样性,发现现代品种的有效等位基因数(Ne)降低,表明育种过程中存在遗传瓶颈。
4. 核心种质构建:基于等位基因丰富度,从8,000份种质中选择约1,000份核心种质,保留了>95%的等位基因。
5. 优异等位基因发掘:GWAS分析在核心种质中鉴定了与产量、抗病性、品质相关的多个显著位点。

# 使用scikit-allel进行群体遗传分析
import allel
import numpy as np
# 读取VCF文件
callset = allel.read_vcf('wheat_samples.vcf.gz', 
                          fields=['calldata/GT', 'variants/POS', 'samples'])
gt = allel.GenotypeArray(callset['calldata/GT'])
# 计算等位基因频率
ac = gt.count_alleles()
# 计算多态性信息含量(PIC)
n = ac.sum(axis=1)
p = ac[:, 0] / n
q = ac[:, 1] / n
pic = 1 - (p**2 + q**2) - 2 * p**2 * q**2
查看详情 →
💡

12.4 其他应用

section
查看详情 →
💡

合成生物学中的生物信息学原理

concept

**1. 生物元件标准化与表征** 合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元: - **启动子(Promoter)**:控制基因表达的"开关" - **核糖体结合位点(RBS)**:调控翻译起始效率 - **编码序列(CDS)**:编码蛋白质的功能基因 - **终止子(Terminator)**:终止转录的信号 生物信息学通过建立元件库(如iGE...

1. 生物元件标准化与表征
合成生物学的核心理念是"生物元件(BioBrick)"——将DNA序列定义为标准化的功能单元:
- 启动子(Promoter):控制基因表达的"开关"
- 核糖体结合位点(RBS):调控翻译起始效率
- 编码序列(CDS):编码蛋白质的功能基因
- 终止子(Terminator):终止转录的信号
生物信息学通过建立元件库(如iGEM Registry、SynBioHub)和标准化表征数据,使元件可以像电子元件一样被组合使用。
2. 基因线路设计
基因线路是由多个生物元件组成的遗传回路,实现逻辑运算(如AND门、OR门、NOT门):
- 布尔逻辑门:例如,双输入AND门需要两个诱导物同时存在才能激活报告基因表达。
- 振荡器:如repressilator,由三个抑制子基因组成的负反馈环,产生周期性基因表达振荡。
- 双稳态开关:两个相互抑制的基因,使系统可以稳定处于两种状态之一。
生物信息学工具(如Cello、Genetic Constructor)提供图形化界面设计基因线路,并自动转换为DNA序列。
3. 代谢工程与通路设计
代谢工程旨在改造细胞代谢网络,使其高效生产目标化合物:
- 通路搜索:利用KEGG、MetaCyc等数据库,搜索从天然底物到目标产物的已知或潜在代谢路径。
- 通量平衡分析(FBA):利用代谢网络的化学计量矩阵,在稳态假设下(Sv=0),通过线性规划优化目标产物产量。
- 酶选择与优化:在已知反应步骤中,从不同物种中筛选催化效率最高的酶,并通过蛋白质工程(定向进化、理性设计)优化酶性质。
4. DNA序列优化
- 密码子优化:根据宿主细胞的密码子使用偏好,调整外源基因的密码子组成,提高翻译效率。
- mRNA二级结构优化:避免在RBS区域形成发夹结构,保证翻译起始效率。
- 避免重复序列和限制性酶切位点:防止DNA重组和克隆困难。

查看详情 →
💡

生物多样性保护的生物信息学原理

concept

**1. DNA条形码鉴定** -DNA条形码的原理是:物种内遗传距离应远小于物种间距离。 - 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。 - 对于未知物种,构建系统发育树,推断其分类地位。 **2. eDNA Metabarcoding** -eDNA metabarcoding结合了环境采样和高通量测序: (1) 环境DNA提取:从水样、...

1. DNA条形码鉴定
-DNA条形码的原理是:物种内遗传距离应远小于物种间距离。
- 分析流程:DNA提取→PCR扩增标准片段→Sanger测序→序列比对(BLAST)→物种鉴定。
- 对于未知物种,构建系统发育树,推断其分类地位。
2. eDNA Metabarcoding
-eDNA metabarcoding结合了环境采样和高通量测序:
(1) 环境DNA提取:从水样、土壤等环境基质中提取总DNA。
(2) 通用引物PCR:使用覆盖多个物种的通用引物扩增目标区域(如16S rRNA、COI、ITS)。
(3) 高通量测序:Illumina或Nanopore平台测序。
(4) 生物信息学分析:序列质控、去嵌合体、OTU/ASV聚类、物种注释(与参考数据库比对)、多样性分析。
3. 群体遗传学在保护中的应用
- 有效种群大小(Ne)估计:反映种群的遗传健康状况,Ne越小,遗传多样性丧失越快。
- 近亲繁殖评估:利用杂合度降低、ROH(连续纯合子片段)分析评估近亲繁殖程度。
- 迁徙与基因流分析:利用STRUCTURE、MIGRATE等工具分析种群间的基因交流。
- 适应性遗传变异检测:利用选择信号扫描(如FST离群值、环境关联分析)识别与环境适应相关的基因。
4. 保护基因组学(Conservation Genomics)
- 利用全基因组数据指导保护决策:
- 识别具有独特遗传适应性的种群,优先保护
- 评估近交衰退风险
- 指导遗传 rescue(引入外来基因恢复遗传多样性)
- 追踪非法野生动物贸易(通过DNA溯源)

查看详情 →
💡

案例一:酵母青蒿酸合成通路的设计

concept

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路: 1. **通路设计**:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。 2. **基因来源选择**:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。 3. **密码子优化**:将所有外源基因按照酵母密...

青蒿素是治疗疟疾的关键药物,传统来源是从青蒿植物中提取。Keasling实验室通过合成生物学方法在酵母中重建了青蒿素合成通路:
1. 通路设计:利用KEGG和文献挖掘,确定从酵母天然代谢物法尼基焦磷酸(FPP)到青蒿酸的完整通路,涉及多个酶促步骤。
2. 基因来源选择:从不同物种筛选最优酶源(如青蒿的ADS、CYP71AV1等)。
3. 密码子优化:将所有外源基因按照酵母密码子偏好进行优化。
4. 代谢流调控:通过FBA分析,鉴定限制产量的代谢瓶颈。过表达tHMG1增加FPP供应,下调ERG9减少FPP向麦角固醇分流。
5. 启动子强度平衡:利用不同强度的启动子组合,平衡通路中各酶的表达量,避免中间产物积累。
6. 结果:工程酵母的青蒿酸产量从初始的约100 mg/L提升到超过25 g/L,实现了工业化生产。

# 使用cobra进行通量平衡分析
import cobra
from cobra.io import read_sbml_model
# 读取酵母代谢模型
model = read_sbml_model('yeast-GEM.xml')
# 设置目标函数:最大化青蒿酸产量
model.objective = model.reactions.DM_artemisinic_acid
# 优化
solution = model.optimize()
print(f"最大理论产量: {solution.objective_value} mmol/gDW/h")
print(f"生长速率: {solution.fluxes['BIOMASS_Ec_iML1515_core_75p37M']}")
# 查找关键通量
for rxn in model.reactions:
    if abs(solution.fluxes[rxn.id]) > 1:
        print(f"{rxn.id}: {solution.fluxes[rxn.id]:.2f}")
查看详情 →
💡

案例二:eDNA监测入侵物种——亚洲鲤鱼

concept

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。 1. **eDNA采样**:在河流和湖泊的关键位置采集水样。 2. **引物设计**:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。 3. **qPCR检测**:检测水样中是否存在亚洲鲤鱼的DNA。 4. **结果**:eDNA检测可以在亚...

亚洲鲤鱼(如鲢鱼、鳙鱼)是北美五大湖区的入侵物种,对当地生态系统构成严重威胁。传统监测方法(电击捕捞、刺网)效率低且对生态系统有干扰。
1. eDNA采样:在河流和湖泊的关键位置采集水样。
2. 引物设计:利用NCBI数据库中的亚洲鲤鱼COI基因序列,设计特异性qPCR引物。
3. qPCR检测:检测水样中是否存在亚洲鲤鱼的DNA。
4. 结果:eDNA检测可以在亚洲鲤鱼实际到达前数月预警其入侵路径,比传统方法更灵敏。
5. ** metabarcoding扩展**:进一步利用12S rRNA通用引物进行eDNA metabarcoding,同时监测所有鱼类群落组成,评估入侵对本地群落的影响。

# eDNA metabarcoding分析流程(示例)
# 1. 原始数据质控
fastp -i sample_R1.fastq.gz -I sample_R2.fastq.gz \
      -o clean_R1.fastq.gz -O clean_R2.fastq.gz \
      -q 20 -u 30 -l 50
# 2. DADA2去重(R中运行)
# library(dada2)
# seqtab <- dada2::mergePairs(dadaF, derepF, dadaR, derepR)
# 3. OTU聚类和物种注释(使用VSEARCH)
vsearch --cluster_size clean.fasta --id 0.97 \
        --centroids otus.fasta --relabel OTU_
vsearch --usearch_global clean.fasta --db reference_db.fasta \
        --id 0.97 --otutabout otu_table.txt
# 4. 多样性分析(使用QIIME 2或R的vegan包)
查看详情 →
💡

案例三:大熊猫保护基因组学

concept

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据: 1. **全基因组测序**:对多个野生和圈养大熊猫种群进行全基因组重测序。 2. **遗传多样性评估**:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。 3. **近交分析**:检测到长片段ROH,证实近亲繁殖的存在。 4. **有害突变负荷**:发现大熊猫携带大量有害突变,但...

大熊猫是濒危物种保护的旗舰物种,全基因组研究为保护策略提供了重要依据:
1. 全基因组测序:对多个野生和圈养大熊猫种群进行全基因组重测序。
2. 遗传多样性评估:发现野生大熊猫的遗传多样性极低(杂合度约0.0015,远低于人类),反映出历史上种群瓶颈的影响。
3. 近交分析:检测到长片段ROH,证实近亲繁殖的存在。
4. 有害突变负荷:发现大熊猫携带大量有害突变,但由于近亲繁殖,这些突变以纯合状态暴露,可能影响种群适应性和繁殖成功率。
5. 保护建议
- 优先保护遗传独特性高的种群(如秦岭亚种)
- 圈养繁殖计划应避免近亲交配
- 考虑栖息地连通性,促进野生种群间的基因交流

查看详情 →