本综述重点介绍前沿的多组学方法,包括代谢组学、基因组学、转录组学和蛋白质组学,这些方法结合人工智能与机器学习以及网络分析,以促进天然产物的发现及其功能验证。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本综述重点介绍前沿的多组学方法,包括代谢组学、基因组学、转录组学和蛋白质组学,这些方法结合人工智能与机器学习以及网络分析,以促进天然产物的发现及其功能验证。
天然产物(NPs)长期以来一直是药物发现中新生物活性化合物的重要来源;然而,传统筛选和分离这些化合物的方法往往耗时较长,且常出现回报递减的情况。幸运的是,先进的多组学与计算方法为应对这些挑战提供了强有力的解决方案。本综述重点介绍了一系列创新性方法,这些方法将代谢组学、基因组学、转录组学和蛋白质组学与生物信息学及分析化学相结合,以加速天然产物的发现进程。例如,非靶向代谢组学平台,如高分辨液相色谱-串联质谱(LC-MS/MS)以及全球天然产物社会分子网络(GNPS),能够对新化合物进行全面的谱型分析,而靶向同位素标记策略则可进一步增强该过程。此外,基因组和宏基因组挖掘工具,如抗生素及次级代谢产物分析平台(antiSMASH)、深度生物合成基因簇预测工具(DeepBGC)以及代谢物合成通路重建流程(PRISM),可快速识别已培养和未培养生物中的生物合成基因簇(BGCs),并常通过异源表达来验证其产物。转录组学分析方法,包括RNA测序(RNA-seq)、共表达网络和通量组学,有助于阐明代谢通路的调控机制;定量蛋白质组学技术,如串联质谱标签/相对与绝对定量同重标记(TMT/iTRAQ)和无标记定量方法,以及化学生物学蛋白质组学方法,如细胞热转移分析和热蛋白质组分析(TPP),可用于揭示分子靶点及其作用机制。本综述还特别强调了人工智能(AI)与机器学习(ML)在整合多组学数据中的关键作用,涵盖从构建基因-代谢物相关性网络,到利用知识图谱和图神经网络实现数据融合与功能预测等多个方面。最后,本文总结了多组学策略在天然产物发现中的协同优势,讨论了当前面临的技术挑战,并展望了未来向高通量、智能化数据整合发展的方向,以推动下一代天然产物研究。
天然产物是由包括微生物和植物在内的多种生物体产生的分子,长期以来一直是药物的重要来源,从青霉素等抗生素到紫杉醇等抗癌药物均源于此类分子。目前我们使用的大量抗生素和化疗药物均源自这些天然化合物1。然而,发现新天然产物(NPs)的传统方法,如微生物培养和基于生物活性检测引导的分离技术,正变得日益困难。20世纪后期,由于制药企业面临投入产出比下降的问题,对天然产物的兴趣逐渐减弱;许多易于发现的化合物已被反复发现,而筛选和表征这些化合物所伴随的技术难题又使得整个过程极为耗时费力。幸运的是,这一趋势目前正在逆转。组学和分析技术的最新进展正在重新激发人们对天然产物的探索2,3。例如,高通量DNA测序技术使研究人员能够从基因组中挖掘隐藏的生物合成基因簇(BGCs),而超灵敏质谱(MS)则可在复杂混合物中识别出微量的新代谢物。这些技术创新恰逢其时,因为全球对新型治疗药物,特别是能够对抗耐药菌的抗生素,正有着迫切需求4。当前天然产物领域的研究正通过将传统的天然产物研究专长与前沿的基因组学和化学分析技术相结合,积极应对这一挑战。
多组学整合是当前生物学研究进展的核心。所谓"多组学",是指对多种生物数据层次进行同步分析,例如生物体的DNA(基因组)、mRNA转录本、蛋白质和代谢物。组学方法的应用已彻底改变了天然产物(NPs)研究,实现了高通量筛选、新型化合物的快速鉴定,以及对塑造生物系统的复杂网络进行更深入的探索5。通过整合这些多层次的数据集,研究人员能够直接将基因与其编码的代谢物关联起来,从而更全面地理解天然产物的生物合成过程6。例如,基因组挖掘算法可以定位可能编码新抗生素的一组基因,而转录组数据则可揭示这些基因是否处于活跃表达状态。此外,代谢组学分析可在生物体的培养提取物中鉴定出相应的抗生素分子7,8,9。这种整合方法显著加快了新型化合物的发现及其生物合成途径的解析。更重要的是,药物靶点的鉴定正日益依赖于整合性的多组学方法,这类方法正逐步取代传统的单组学策略10。分析化学领域的最新进展,包括高分辨率液相色谱-质谱联用技术(LC-MS)和核磁共振(NMR),使研究人员能够从复杂的生物样品中检测并进行新天然产物的结构分析11,12。这些技术产生了海量数据,此时生物信息学与机器学习(ML)便显得至关重要。人工智能(AI)算法和基于网络的分析方法正被越来越多地用于分析多组学数据,以发现难以通过人工识别的重要模式和预测结果13,14。通过将前沿的组学技术与人工智能驱动的数据挖掘相结合,研究人员如今能够建立比以往更快、更系统化的天然产物发现与分析的高效流程。
尽管多组学策略已显著推动了天然产物(NPs)的发现,但其成功实施在很大程度上依赖于严谨的实验设计。例如,样本的类型和质量至关重要;必须在能最大限度减少核酸和代谢物降解的条件下,采集保存良好的微生物培养物、环境分离株或临床样本15。测序深度也对数据分辨率起着关键作用:全基因组测序通常需要至少30×的覆盖深度以实现准确组装,而转录组分析则通常需要数千万条测序读长,才能鉴定出低丰度的转录本,Genohub对此有明确建议16。此外,在代谢组学中,需要选择合适的提取溶剂和方法,以捕获多样化的化学成分类别;应有意识地选择能够最小化偏差并最大化可重复性的提取方案17。然而,这些方法本身也面临一系列挑战。整合大规模且异质性的数据集可能带来巨大的计算负担,而代谢物的不稳定性或低丰度也会使后续分析变得复杂18。此外,高昂的成本或有限的样本量可能限制研究设计的可行性19。测序数据中的污染和偏差,特别是在低输入量或稀释样本中,也构成重大风险,Lusk 等人已就高通量测序中的污染问题提出了警示20。通过充分认识这些实际和技术上的局限性,研究人员能够更合理地选择适合的多组学组合策略,并以必要的谨慎态度解读其研究结果。
本文综述了利用多组学与整合分析技术推动天然产物(NPs)发现的创新方法。同时探讨了机器学习(ML)与人工智能(AI)在整合各类数据流方面的日益重要作用,包括构建基因-代谢物相关性网络,以及鉴定可能产生新型生物活性化合物的基因簇。此外,本文还分析了这种整合策略的重要意义及其未来潜力。总之,多种组学技术与先进分析方法的结合,不仅正在加速当今新型天然产物的发现,也为开发社会迫切需要的下一代药物奠定了基础。
访问受限。请登录或开始试用以查看此内容。
为撰写本综述,我们对多个数据库和索引平台(包括 PubMed、Scopus、Web of Science、ScienceDirect 和 Google Scholar)进行了全面的文献检索。检索范围涵盖 2015 年 1 月 至 2025 年 7 月 发表的文献。检索关键词及布尔组合包括: "天然产物发现" "组学," "代谢组学" "基因组学" "转录组学" "蛋白质组学" "机器学习" "人工智能," "生物合成基因簇" 和 "多组学整合" 关键文章和近期综述的参考文献列表也经过筛选,以确定其他相关出版物。除同行评审的研究外,还纳入了来自诸如 bioRxiv 和 medRxiv 在提供尚未见于已发表文献中的及时且相关见解时,会参考预印本。所有预印本均已明确标注,以确保透明度。本节综述基于组学的天然产物(NPs)发现关键领域——特别是代谢组学、基因组学、转录组学和蛋白质组学——的最新进展与未来展望,以及这些组学技术的整合应用 通过 人工智能/机器学习。这些领域讨论的主要工具和资源已汇总供参考 表1.
1. 代谢组学在天然产物发现中的应用
2. 基因组学在天然产物发现中的应用
在过去十年中,微生物天然产物研究在高通量测序、超灵敏高分辨质谱以及整合多组学方法等技术进步的推动下,进入了一个变革性的"深度挖掘时代"35。这些工具使发现工作从偶然性的分离转向以数据驱动、有针对性的探索。如今,借助antiSMASH 7.0和DeepBGC等基因组挖掘流程,可系统性地识别隐秘的生物合成基因簇(BGCs),尤其是在尚未充分研究的分类群中36,37。
3. 天然产物发现中的转录组学
转录组分析通过在不同条件下测量 mRNA 的表达水平,为生物合成基因簇(BGCs)的活性提供了动态视角。具体而言,RNA-seq 实验能够揭示哪些 BGCs 正在被主动转录,以及它们的表达水平如何随环境或实验条件的变化而波动。通过比较不同条件下的转录本水平,利用 DESeq2 或 edgeR 等工具进行差异表达分析,可以识别出上调或下调的 BGCs,从而突出那些可能在特定条件下被诱导表达或在标准条件下保持沉默的基因簇51。尽管针对大量培养细胞的传统 RNA-seq 是研究 BGC 表达的常用方法,但单细胞 RNA-seq 等更先进的技术正开始应用于复杂的微生物组研究中。这一转变使得研究人员能够观察那些难以培养的环境来源生物体中的基因表达情况52,53。标准的 RNA-seq 工作流程通常包括使用 STAR 或 HISAT2 等比对工具将测序读段映射到参考基因组,利用 featureCounts 或 Kallisto 等工具进行基因表达定量,并对数据进行标准化以识别显著的表达变化。在此基础上,常使用 WGCNA 软件包进行共表达网络分析,将具有相似表达模式的基因聚类。当同时具备代谢物数据时,这些网络还可进一步扩展以整合代谢物信息,从而将特定化合物与共表达的基因关联起来54。
转录组数据已被证明在识别条件性激活的生物合成途径方面具有重要价值。这一方法的一个典型例子是对四种Salinispora菌株进行的详细比较51。该研究发现,每种菌株中超过一半的生物合成基因簇(BGCs)在某种程度上都有表达,许多在一个菌株中不活跃的基因簇在其他菌株中则表现出表达活性。通过分析这些菌株中的基因表达谱,研究人员成功鉴定出多个似乎能够沉默或激活特定基因簇的调控因子。这种整合性方法促成了一类此前未知的天然产物(NPs)——salinipostins的发现。转录组数据提示一个隐性基因簇可能是某种未识别化合物的潜在来源;当通过调控改变诱导该基因簇表达时,成功产生了salinipostin分子,随后这些分子被分离并进行了结构表征。该研究展示了转录组学如何促进天然产物的发现:通过分析差异基因表达,研究人员可识别出候选的生物合成基因簇,而基因表达与代谢物谱之间的相关性则为基因-代谢物关系提供了支持性证据,并可通过靶向实验加以验证。
4. 蛋白质组学在纳米颗粒发现中的应用
5. 用于组学整合与预测的机器学习和人工智能
访问受限。请登录或开始试用以查看此内容。
目前,天然产物(NPs)的发现依赖于分析化学与生物信息学的结合,形成了强大的协同效应。如图1所示,先进的组学技术(如液相色谱-质谱代谢组学、高通量测序、RNA-Seq 和蛋白质组学)与计算分析方法(包括分子网络和机器学习(ML))协同作用,构建了一条高效的发现流程。该领域的最新进展包括单细胞组学技术,可用于识别稀有产生菌;同时,扩展的质谱谱图数据库和人工智能(AI)工具也助力代谢物的鉴定。此外,对新生态环境开展的大规模宏基因组挖掘正在揭示此前未知的化合物。整合型数据框架以及GNPS、antiSMASH 和 NPAtlas 等社区资源为协作研究提供了支持。随着机器学习与人工智能技术的持续发展,未来有望实现多组学数据的自动化整合,从基因组信息中预测新型化学化合物,并推荐具有优先研究价值的生物活性。这一由创新方法驱动的策略,有望通过将复杂的组学数据转化为实用的生物学见解,显著加快新一代抗生素等新型天然产物的发现进程。
访问受限。请登录或开始试用以查看此内容。
所有作者声明不存在可能被视为潜在利益冲突的财务或个人关系。
本工作得到了国家自然科学基金(32500813)、中国博士后科学基金资助项目(GZC20251503)、四川省科技计划项目(2024ZYD0149)、四川省博士后专项研究基金(TB2024017)、德阳市科学技术局重点研发项目(2024SZY016,2023SZZ009)、国家卫生健康委员会能力建设和继续教育中心项目(GWJJMB202510025060)以及德阳市人民医院孵化项目专项基金(FRH202501,FHT202501)的支持。我们确认图1使用BioRender绘制,
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。