需要JoVE订阅才能观看此内容。 请登录或开始免费试用

综述文章

天然产物发现中的多组学与整合分析

1.5K 次观看

DOI:

10.3791/69458

2025年11月28日

本文内容

摘要

本综述重点介绍前沿的多组学方法,包括代谢组学、基因组学、转录组学和蛋白质组学,这些方法结合人工智能与机器学习以及网络分析,以促进天然产物的发现及其功能验证。

摘要

天然产物(NPs)长期以来一直是药物发现中新生物活性化合物的重要来源;然而,传统筛选和分离这些化合物的方法往往耗时较长,且常出现回报递减的情况。幸运的是,先进的多组学与计算方法为应对这些挑战提供了强有力的解决方案。本综述重点介绍了一系列创新性方法,这些方法将代谢组学、基因组学、转录组学和蛋白质组学与生物信息学及分析化学相结合,以加速天然产物的发现进程。例如,非靶向代谢组学平台,如高分辨液相色谱-串联质谱(LC-MS/MS)以及全球天然产物社会分子网络(GNPS),能够对新化合物进行全面的谱型分析,而靶向同位素标记策略则可进一步增强该过程。此外,基因组和宏基因组挖掘工具,如抗生素及次级代谢产物分析平台(antiSMASH)、深度生物合成基因簇预测工具(DeepBGC)以及代谢物合成通路重建流程(PRISM),可快速识别已培养和未培养生物中的生物合成基因簇(BGCs),并常通过异源表达来验证其产物。转录组学分析方法,包括RNA测序(RNA-seq)、共表达网络和通量组学,有助于阐明代谢通路的调控机制;定量蛋白质组学技术,如串联质谱标签/相对与绝对定量同重标记(TMT/iTRAQ)和无标记定量方法,以及化学生物学蛋白质组学方法,如细胞热转移分析和热蛋白质组分析(TPP),可用于揭示分子靶点及其作用机制。本综述还特别强调了人工智能(AI)与机器学习(ML)在整合多组学数据中的关键作用,涵盖从构建基因-代谢物相关性网络,到利用知识图谱和图神经网络实现数据融合与功能预测等多个方面。最后,本文总结了多组学策略在天然产物发现中的协同优势,讨论了当前面临的技术挑战,并展望了未来向高通量、智能化数据整合发展的方向,以推动下一代天然产物研究。

引言

天然产物是由包括微生物和植物在内的多种生物体产生的分子,长期以来一直是药物的重要来源,从青霉素等抗生素到紫杉醇等抗癌药物均源于此类分子。目前我们使用的大量抗生素和化疗药物均源自这些天然化合物1。然而,发现新天然产物(NPs)的传统方法,如微生物培养和基于生物活性检测引导的分离技术,正变得日益困难。20世纪后期,由于制药企业面临投入产出比下降的问题,对天然产物的兴趣逐渐减弱;许多易于发现的化合物已被反复发现,而筛选和表征这些化合物所伴随的技术难题又使得整个过程极为耗时费力。幸运的是,这一趋势目前正在逆转。组学和分析技术的最新进展正在重新激发人们对天然产物的探索2,3。例如,高通量DNA测序技术使研究人员能够从基因组中挖掘隐藏的生物合成基因簇(BGCs),而超灵敏质谱(MS)则可在复杂混合物中识别出微量的新代谢物。这些技术创新恰逢其时,因为全球对新型治疗药物,特别是能够对抗耐药菌的抗生素,正有着迫切需求4。当前天然产物领域的研究正通过将传统的天然产物研究专长与前沿的基因组学和化学分析技术相结合,积极应对这一挑战。

多组学整合是当前生物学研究进展的核心。所谓"多组学",是指对多种生物数据层次进行同步分析,例如生物体的DNA(基因组)、mRNA转录本、蛋白质和代谢物。组学方法的应用已彻底改变了天然产物(NPs)研究,实现了高通量筛选、新型化合物的快速鉴定,以及对塑造生物系统的复杂网络进行更深入的探索5。通过整合这些多层次的数据集,研究人员能够直接将基因与其编码的代谢物关联起来,从而更全面地理解天然产物的生物合成过程6。例如,基因组挖掘算法可以定位可能编码新抗生素的一组基因,而转录组数据则可揭示这些基因是否处于活跃表达状态。此外,代谢组学分析可在生物体的培养提取物中鉴定出相应的抗生素分子7,8,9。这种整合方法显著加快了新型化合物的发现及其生物合成途径的解析。更重要的是,药物靶点的鉴定正日益依赖于整合性的多组学方法,这类方法正逐步取代传统的单组学策略10。分析化学领域的最新进展,包括高分辨率液相色谱-质谱联用技术(LC-MS)和核磁共振(NMR),使研究人员能够从复杂的生物样品中检测并进行新天然产物的结构分析11,12。这些技术产生了海量数据,此时生物信息学与机器学习(ML)便显得至关重要。人工智能(AI)算法和基于网络的分析方法正被越来越多地用于分析多组学数据,以发现难以通过人工识别的重要模式和预测结果13,14。通过将前沿的组学技术与人工智能驱动的数据挖掘相结合,研究人员如今能够建立比以往更快、更系统化的天然产物发现与分析的高效流程。

尽管多组学策略已显著推动了天然产物(NPs)的发现,但其成功实施在很大程度上依赖于严谨的实验设计。例如,样本的类型和质量至关重要;必须在能最大限度减少核酸和代谢物降解的条件下,采集保存良好的微生物培养物、环境分离株或临床样本15。测序深度也对数据分辨率起着关键作用:全基因组测序通常需要至少30×的覆盖深度以实现准确组装,而转录组分析则通常需要数千万条测序读长,才能鉴定出低丰度的转录本,Genohub对此有明确建议16。此外,在代谢组学中,需要选择合适的提取溶剂和方法,以捕获多样化的化学成分类别;应有意识地选择能够最小化偏差并最大化可重复性的提取方案17。然而,这些方法本身也面临一系列挑战。整合大规模且异质性的数据集可能带来巨大的计算负担,而代谢物的不稳定性或低丰度也会使后续分析变得复杂18。此外,高昂的成本或有限的样本量可能限制研究设计的可行性19。测序数据中的污染和偏差,特别是在低输入量或稀释样本中,也构成重大风险,Lusk 等人已就高通量测序中的污染问题提出了警示20。通过充分认识这些实际和技术上的局限性,研究人员能够更合理地选择适合的多组学组合策略,并以必要的谨慎态度解读其研究结果。

本文综述了利用多组学与整合分析技术推动天然产物(NPs)发现的创新方法。同时探讨了机器学习(ML)与人工智能(AI)在整合各类数据流方面的日益重要作用,包括构建基因-代谢物相关性网络,以及鉴定可能产生新型生物活性化合物的基因簇。此外,本文还分析了这种整合策略的重要意义及其未来潜力。总之,多种组学技术与先进分析方法的结合,不仅正在加速当今新型天然产物的发现,也为开发社会迫切需要的下一代药物奠定了基础。

访问受限。请登录或开始试用以查看此内容。

综述与观点

为撰写本综述,我们对多个数据库和索引平台(包括 PubMed、Scopus、Web of Science、ScienceDirect 和 Google Scholar)进行了全面的文献检索。检索范围涵盖 2015 年 1 月 至 2025 年 7 月 发表的文献。检索关键词及布尔组合包括: "天然产物发现" "组学," "代谢组学" "基因组学" "转录组学" "蛋白质组学" "机器学习" "人工智能," "生物合成基因簇" 和 "多组学整合" 关键文章和近期综述的参考文献列表也经过筛选,以确定其他相关出版物。除同行评审的研究外,还纳入了来自诸如 bioRxivmedRxiv 在提供尚未见于已发表文献中的及时且相关见解时,会参考预印本。所有预印本均已明确标注,以确保透明度。本节综述基于组学的天然产物(NPs)发现关键领域——特别是代谢组学、基因组学、转录组学和蛋白质组学——的最新进展与未来展望,以及这些组学技术的整合应用 通过 人工智能/机器学习。这些领域讨论的主要工具和资源已汇总供参考 表1.

1. 代谢组学在天然产物发现中的应用

  1. 代谢组学分析平台
    代谢组学对于天然产物(NPs)的发现至关重要,因为它能够对各类生物体产生的小分子进行详细分析。用于表征NPs代谢组的主要分析工具包括高分辨率质谱技术,如液相色谱-串联质谱(LC-MS/MS)和气相色谱-质谱(GC-MS),以及核磁共振(NMR)波谱法21,22。非靶向LC-MS/MS工作流程,例如超高效液相色谱-质谱联用结合串联质谱分析,可实现对复杂混合物中多种代谢物的鉴定,而GC-MS在挥发性化合物的分析方面表现优异。此外,直接进样-串联质谱和质谱成像等新兴方法正在进一步丰富NPs代谢组学的研究工具23,24。先进的质谱技术,包括多模式质谱(结合正负离子模式或采用多级MSn碎裂)以及联用技术如LC-MS与NMR联用,可为所检测到的代谢物提供更深入的结构信息25,26
  2. 数据处理与计算工具
    专用软件工具在代谢组学数据的处理与解读中发挥着关键作用。XCMS、MZmine和OpenMS等程序常用于检测和对齐色谱特征(即峰信号),而精细的数据预处理步骤,如峰对齐、归一化和过滤,对于获得可重复的代谢谱至关重要27。化合物的鉴定依赖于MS/MS谱图数据库,如NIST和mzCloud,以及SIRIUS和MetFrag等基于计算机的碎片预测工具28。全球天然产物社交平台(GNPS)已成为分子网络分析的重要资源,该平台通过组织相关的MS/MS谱图以突出化学家族,并促进已知化合物的去重(dereplication)29。例如,利用GNPS对链霉菌(Streptomyces)培养物的LC-MS/MS数据进行分析,成功鉴定了螺旋霉素和放线菌素等已知抗生素,同时发现了此前未报道的类似物30,31。分子网络技术有效地将相关的未知谱图聚类,而离子身份网络(ion-identity networking)的引入进一步增强了特征之间的关联性。当这类基于网络的分析与主成分分析、正交偏最小二乘判别分析等多元统计工具以及相关性网络分析相结合时,可将代谢物生成模式与特定的生物学或环境条件相联系。在一项研究中,对一种植物相关链霉菌(Streptomyces)发酵提取物进行GNPS分子网络分析,结果显示其代谢物谱型随所用生长介质的不同而呈现明显差异。研究检测到了包括螺旋霉素、放线菌素以及一种名为鱼腥藻毒素(lyngbyatoxin)的致癌物质在内的已知代谢物;然而,许多网络节点在现有谱图数据库中并无匹配项32。这一发现提示存在真正意义上的新代谢物,凸显了非靶向代谢组学结合GNPS在识别潜在新型天然产物以供进一步研究方面的强大能力。
    将代谢组学筛选与功能性生物测定相结合,有助于快速优先筛选出能够产生活性化合物的菌株或提取物。此外,诸如天然产物图谱数据库(Natural Products Atlas, NPAtlas)等新兴公共资源,以及整合型代谢组-基因组分析流程,在将检测到的代谢物与其来源生物中的生物合成基因簇(BGCs)相关联方面发挥着重要作用33,34。这种整合策略使研究人员能够将代谢物信号与基因组数据相互关联,从而提高天然产物的鉴定效率并追溯其生物合成来源。

2. 基因组学在天然产物发现中的应用

在过去十年中,微生物天然产物研究在高通量测序、超灵敏高分辨质谱以及整合多组学方法等技术进步的推动下,进入了一个变革性的"深度挖掘时代"35。这些工具使发现工作从偶然性的分离转向以数据驱动、有针对性的探索。如今,借助antiSMASH 7.0和DeepBGC等基因组挖掘流程,可系统性地识别隐秘的生物合成基因簇(BGCs),尤其是在尚未充分研究的分类群中36,37

  1. 高通量测序与混合组装
    高通量DNA测序技术,例如短读长高通量DNA测序结合长读长测序平台,已显著改变了产生天然产物(NPs)的生物体基因组研究。通过采用整合长读长和短读长的混合组装策略,研究人员可以获得高连续性的基因组组装结果,这对于捕获基因组内的完整生物合成基因簇(BGCs)至关重要38。此外,宏基因组测序(包括宏基因组组装基因组的回收)将BGCs的发现范围扩展至未培养的微生物,使科学家能够探索环境DNA的生物合成潜力39。在传统基因组组装方法难以解析大型或重复基因簇的情况下,可利用基于文库的技术(如cosmid文库或细菌人工染色体文库)来分离和克隆较大的基因组片段。该方法可通过靶向测序或异源表达对完整基因簇进行表征,从而加深我们对天然产物生物合成遗传基础的理解40,41
  2. 基因组挖掘工具
    专门的生物信息学工具对于分析基因组数据以识别次级代谢产物通路的独特特征至关重要。antiSMASH、PRISM和DeepBGC等程序在此过程中发挥关键作用,能够自动检测候选BGCs。它们通过识别特定的生物合成结构域(如非核糖体肽合成酶、聚酮合酶、核糖体合成并翻译后修饰肽(RiPP)通路以及萜类环化酶等)实现这一目标。为辅助去重复化,MIBiG数据库(汇编已知BGCs及其产物)和NPAtlas数据库(收录已知天然产物)可帮助研究人员将新序列或化合物与已有实例进行比对37,42,43。BiG-SCAPE等聚类算法以及CORASON等工具可将相关的BGCs归类为家族,提供生物合成多样性的网络视图,并通过与已知家族的比较促进新簇家族的识别44。其他生物信息学分析,包括BLAST搜索和隐马尔可夫模型扫描,可用于预测BGC内编码酶的潜在功能;而比较基因组学方法(如同线性分析和基因共进化)则有助于进一步优化这些功能预测45。此外,基因组数据还支持对与天然产物生物合成相关的调控元件进行注释,包括通路特异性启动子和转录调控因子46。这些见解为通路工程提供了基础;例如,合成生物学技术(如转化相关重组克隆和Red/ET重组工程)使研究人员能够在异源宿主中捕获并表达沉默或隐匿的BGCs,从而激活其代谢产物的生产47
    基因组挖掘工作已通过聚焦特定遗传信号成功发现了新的天然产物。例如,系统性搜索与糖肽类抗生素耐药性相关的基因,揭示了多个预测编码新型抗生素的异常BGCs。该方法最终鉴定出两种新化合物——compstatin和cobramycin,二者均通过靶向细菌自溶素表现出独特的作用机制48。类似地,对人类微生物组中生物合成基因内容的探索发现了一种名为"humicin"的脂肽类抗生素候选物,其对StaphylococcusStreptococcus属物种具有潜在的有效性49。在这些案例中,化合物最初通过计算方法被识别,其化学结构基于基因组数据进行预测。随后,这些预测分子被化学合成,并表现出预期的抗生素活性,从而验证了基于基因组的发现策略。从更广泛的角度看,对多种细菌(包括许多稀有放线菌)的大规模测序正在揭示大量"隐匿"的BGCs——即产物尚不明确的基因簇。例如,对Streptomyces基因组的研究已揭示出数千个未表征的BGCs50。将这些孤儿簇与实际代谢物关联的一种新兴方法是将代谢组学分析与基因组调查相结合。通过将基因簇的存在或表达与GNPS平台或质谱数据库中检测到的独特代谢物特征相关联,研究人员可开始为大量新发现的BGCs分配暂定的化学产物,从而促进从基因组数据中发现真正新颖的天然产物。

3. 天然产物发现中的转录组学

转录组分析通过在不同条件下测量 mRNA 的表达水平,为生物合成基因簇(BGCs)的活性提供了动态视角。具体而言,RNA-seq 实验能够揭示哪些 BGCs 正在被主动转录,以及它们的表达水平如何随环境或实验条件的变化而波动。通过比较不同条件下的转录本水平,利用 DESeq2 或 edgeR 等工具进行差异表达分析,可以识别出上调或下调的 BGCs,从而突出那些可能在特定条件下被诱导表达或在标准条件下保持沉默的基因簇51。尽管针对大量培养细胞的传统 RNA-seq 是研究 BGC 表达的常用方法,但单细胞 RNA-seq 等更先进的技术正开始应用于复杂的微生物组研究中。这一转变使得研究人员能够观察那些难以培养的环境来源生物体中的基因表达情况52,53。标准的 RNA-seq 工作流程通常包括使用 STAR 或 HISAT2 等比对工具将测序读段映射到参考基因组,利用 featureCounts 或 Kallisto 等工具进行基因表达定量,并对数据进行标准化以识别显著的表达变化。在此基础上,常使用 WGCNA 软件包进行共表达网络分析,将具有相似表达模式的基因聚类。当同时具备代谢物数据时,这些网络还可进一步扩展以整合代谢物信息,从而将特定化合物与共表达的基因关联起来54

转录组数据已被证明在识别条件性激活的生物合成途径方面具有重要价值。这一方法的一个典型例子是对四种Salinispora菌株进行的详细比较51。该研究发现,每种菌株中超过一半的生物合成基因簇(BGCs)在某种程度上都有表达,许多在一个菌株中不活跃的基因簇在其他菌株中则表现出表达活性。通过分析这些菌株中的基因表达谱,研究人员成功鉴定出多个似乎能够沉默或激活特定基因簇的调控因子。这种整合性方法促成了一类此前未知的天然产物(NPs)——salinipostins的发现。转录组数据提示一个隐性基因簇可能是某种未识别化合物的潜在来源;当通过调控改变诱导该基因簇表达时,成功产生了salinipostin分子,随后这些分子被分离并进行了结构表征。该研究展示了转录组学如何促进天然产物的发现:通过分析差异基因表达,研究人员可识别出候选的生物合成基因簇,而基因表达与代谢物谱之间的相关性则为基因-代谢物关系提供了支持性证据,并可通过靶向实验加以验证。

4. 蛋白质组学在纳米颗粒发现中的应用

  1. 鸟枪法与靶向蛋白质组学方法
    蛋白质组学涉及对蛋白质的大规模研究,通过直接检测在生物合成途径中起作用的酶和蛋白质,为天然产物(NPs)研究提供了重要视角。通常,蛋白质组学方法可分为两大类:鸟枪法(非靶向)蛋白质组学和靶向蛋白质组学。在鸟枪法蛋白质组学中,从微生物或植物样品中提取的蛋白质通常经胰蛋白酶等酶消化后,产生的肽段通过高分辨率液相色谱-串联质谱(LC-MS/MS)进行分析,常使用四极杆飞行时间(QTOF)或高分辨率轨道阱质谱仪等先进设备55。所采集的质谱数据,即MS/MS谱图,通过与来源于该生物体基因组或近缘物种的蛋白质数据库比对,利用MaxQuant或Mascot等软件工具进行肽段序列匹配56,57。该过程可实现不同条件下蛋白质丰度变化的定量分析,可通过无标记方法或同位素标记技术(如细胞培养中氨基酸的稳定同位素标记SILAC,或使用TMT/iTRAQ试剂的等压标记)来确定哪些生物合成酶被上调或下调58,59。相比之下,靶向蛋白质组学方法(如选择反应监测SRM或平行反应监测PRM)则聚焦于特定的一组肽离子,通常是关键生物合成酶或调控蛋白的独特肽段,从而实现对这些肽段在多个样品中的精确且灵敏的定量60,61
  2. 蛋白质组学中的创新方法
    次级代谢蛋白质组分析的一个重大挑战是检测大型生物合成酶,例如非核糖体肽合成酶(NRPS)和聚酮合酶(PKS),这些酶分子量常超过100 kDa,在标准消化条件下产生的可检测肽段较少,因而难以被观察到。为解决这一问题,Bumpus等人开发了一种名为PrISM的方法,该方法通过利用这些酶上特有的辅因子来增强NRPS和PKS蛋白的检测62。PrISM将传统的鸟枪法蛋白质组学与磷酸泛酰巯基乙胺(Ppant)释放检测相结合。值得注意的是,NRPS和PKS酶在其酰基载体蛋白或肽基载体蛋白结构域上共价连接有Ppant臂;在MS/MS碎裂过程中,这一辅基常产生一个独特的碎片离子,称为"Ppant释放"离子。通过在计算上对LC-MS/MS数据中该诊断性离子进行筛选,PrISM方法能够有效突出显示来自NRPS和PKS酶的肽段,从而在复杂的全细胞蛋白质混合物中识别其存在。该策略已成功通过蛋白质组学揭示了隐藏的生物合成途径。例如,PrISM工作流程在短小芽孢杆菌(Bacillus brevis)培养物中检测到了杆菌肽S合成酶复合物(GrsA/GrsB)的肽段,建立了这些NRPS酶与该生物体中抗生素杆菌肽S生成之间的直接联系62。重要的是,GrsA/GrsB的蛋白质组学鉴定并不依赖于B. brevis的先验基因组信息,表明在某些情况下,仅通过蛋白质组学分析即可揭示尚未测序生物体中活跃的天然产物生物合成途径。
  3. 基于基因组信息的蛋白质组学
    当存在基因组序列时,可通过使用菌株特异性的数据库进行肽段鉴定,从而显著增强蛋白质组学的分析能力。例如,在一项对淡紫链霉菌(Streptomyces lilacinus)蛋白质组的分析研究中,研究人员进行了两次分析:一次是将谱图比对至通用蛋白质数据库,另一次则是比对至基于该菌株测序基因组构建的自定义数据库63。基于基因组信息的分析鉴定出的肽段数量约为前者的十倍,并检测到与该生物体内六个不同生物合成基因簇(BGCs)相关的肽段。值得注意的是,其中三个已鉴定的基因簇对应于此前已知的"孤儿"代谢物,包括灰霉素、拉基西丁D和一种特定的铁载体,并确认其生物合成酶确实表达。其余检测到的基因簇似乎为新颖且尚未表征的。此例表明,将基因组信息整合到蛋白质组学工作流程中,可确认哪些生物合成途径在特定菌株中处于活跃表达状态,从而优先选择这些基因簇用于其产物的分离与表征。
    此外,蛋白质组学方法还可揭示天然产物的分子靶点及其作用机制,这一领域通常被称为化学生物学蛋白质组学。例如,基于活性的蛋白质分析(ABPP)利用小分子探针(通常是天然产物的衍生物或类似物),这些探针可与化合物的细胞靶标发生反应,标记目标蛋白,进而通过质谱实现富集与鉴定64。该技术可用于发现特定天然产物或相关分子在细胞内结合的蛋白质靶标。另一种方法——热蛋白质组分析(TPP),则通过在有或无化合物存在下加热蛋白质样品,检测哪些蛋白质的热稳定性发生变化,从而指示其发生了结合相互作用65。这些化学生物学蛋白质组学方法对于验证天然产物的生物学靶标并阐明其作用机制具有重要价值,从而补充天然产物本身的发现过程。

5. 用于组学整合与预测的机器学习和人工智能

  1. 多组学数据与机器学习的整合
    将机器学习与人工智能应用于整合组学数据以进行功能预测,是天然产物(NPs)发现领域的一个激动人心的前沿方向。在基因组学领域,已开发出包括随机森林、支持向量机和深度神经网络在内的有监督机器学习算法,用于识别与特定类型天然产物相关的生物合成基因簇(BGCs)中的模式。例如,这些机器学习模型可根据BGCs所产生的分子大类对其进行分类,甚至可基于基因序列预测化学结构的某些特征。Dason MS 及其同事的一篇综述概述了多种旨在破译 "语言" 利用DNA或氨基酸序列数据推断相应天然产物的结构和生物活性的BGCs66这些模型通常依赖于已知基因簇和化合物的庞大数据库,以学习它们之间的关联,从而预测新化合物潜在的生物活性。例如,它们可以评估一个未表征的生物合成基因簇(BGC)产物是否可能具有抗生素或抗癌特性。推动这些能力取得显著进展的关键因素包括:使用大规模训练数据集(如数千个已知的天然产物结构和基因簇)、创新的表征技术(如能够捕捉基因簇和化学结构特征的序列嵌入和图神经网络),以及结合多种基因组和化学描述符的多参数模型,以提高预测准确性。
    在代谢组学领域,人工智能技术显著提升了对复杂质谱数据的解析能力。一个典型的例子是工具 CSI:FingerID,该工具利用机器学习从分子的 MS/MS 谱图中预测其结构指纹。这一功能有助于识别未知代谢物,通过推荐可能的子结构和候选化合物实现67类似地,深度学习模型已被用于光谱注释;卷积神经网络以及近期基于变换器的架构,例如 "DreaMS" 模型,通过从大规模谱图库中学习碎片化模式,能够基于所学模式为未知谱图提出结构推测,其性能通常优于传统启发式方法,尤其适用于在现有数据库中没有完全匹配的代谢物。68除了结构注释之外,机器学习还通过识别全局模式为代谢组学研究提供支持。例如,t-SNE(t分布随机邻域嵌入)和UMAP(均匀流形近似与投影)等无监督可视化算法可降低非靶向代谢组学数据集的维度,从而根据样本代谢物谱的相似性实现样本聚类。与此同时,有监督分类器能够将特定的代谢物特征与样本的表型特征或生物活性相关联,进一步丰富分析内容69,70,71.
    机器学习正越来越多地被用于整合各类组学数据集,从而更全面地理解天然产物(NPs)的生物合成及其功能。通过整合基因组学、转录组学、蛋白质组学和代谢组学的数据,整合模型能够揭示在单独分析每类数据时可能被忽略的关联。例如,研究人员可以构建基因-代谢物相关性网络,将基因或蛋白质的表达水平与代谢物的生成水平关联起来。基于此类整合数据训练的机器学习模型,可进一步预测哪些基因簇可能负责特定代谢物的生成或生物学活性72,73先进的多变量分析技术,例如多组学因子分析(可在 MOFA 等工具中实现)和正则化多变量方法(见于 mixOmics 等软件包),有助于识别涵盖多种数据类型的潜在因子,例如一组共表达的基因与一组共发生的代谢物。74,75,76在实际应用中,为了发现天然产物(NPs),多种方法可通过建立候选基因簇与观测到的代谢物或表型之间的关联,来帮助优先排序候选基因簇。这种整合性、人工智能引导策略的一个显著实例是利用DecRiPPter算法发现了一类新的核糖体合成的核糖体合成与翻译后修饰肽类(RiPPs)。该算法采用基于支持向量机(SVM)的模型分析基因组数据中的隐性RiPP前体肽,并将这些预测结果与泛基因组分析进行交叉比对,以排除已知化合物。当应用于1,295个 链霉菌属 基因组中,DecRiPPter 成功鉴定了 42 个此前被传统基因组挖掘方法遗漏的假定新型 RiPP 家族。在这些预测的基因簇中,其中一个经实验验证可产生一类新的 V 型羊毛硫肽,研究人员将其命名为 "pristinin A3" 通过诱导该沉默基因簇的表达,分离得到了化合物pristinin A3,并利用核磁共振(NMR)和质谱(MS)确定其结构,揭示了该生物合成途径中编码的两种此前未知的兰肽形成酶77这一成果凸显了人工智能驱动的分析在揭示隐性天然产物方面的潜力:机器学习模型检测到一个此前未被识别的遗传信号,从而指导实验工作,成功发现了一种新型分子。
  2. 新兴人工智能应用
    除了当前的应用之外,一些新兴的人工智能驱动策略有望进一步革新天然产物(NPs)研究。其中一个颇具前景的领域是计算逆合成分析与途径设计,即开发深度学习模型以提出已知天然产物及其类似物的生物合成路线或合成化学步骤,这将显著提升新型化合物的设计与生产能力78,79另一个令人振奋的前沿领域是利用人工智能预测酶的功能。通过结合基于深度学习算法的现代蛋白质结构预测工具,以及蛋白质序列上的对比学习等机器学习技术,研究人员正逐步推断出生物合成基因簇(BGCs)中未表征酶的潜在功能。这有助于揭示这些酶所催化的化学转化类型。80,81,82正在开发完全整合的从组学到化学的分析流程,其中人工智能平台旨在将质谱特征与基因组数据自动关联起来83,84原则上,此类系统可同时分析来自复杂样品的LC-MS/MS数据集以及相同环境中的基因组序列,从而通过评分基因簇-代谢物匹配关系,预测每种未识别代谢物所对应的基因簇。尽管这些方法仍处于初期阶段,但它们预示着未来人工智能将能够自主地将基因与分子关联起来,从而极大加快从组学数据到新天然产物发现的进程。
  3. 人工智能辅助天然产物发现中的数据治理与伦理挑战
    现代多组学研究产生了大量多样化数据,但人工智能预测的有效性在很大程度上依赖于这些数据集的质量和一致性。当训练数据集注释不充分或存在偏差时,可能导致误导性结果和验证失败85为解决这一问题,研究人员应实施FAIR原则——可发现(Findable)、可访问(Accessible)、可互操作(Interoperable)和可重用(Reusable),以促进数据的透明性、可重复性及广泛重用性86该方法包括共享阳性与阴性结果,详尽记录数据预处理流程,并提供分析代码以促进独立验证。此外,采用新兴的数字基础设施(如电子实验记录本(ELNs)和容器化工作流)对于提升数据采集能力并确保标准化的数据管理至关重要。87,88.
    尽管人工智能显著加快了天然产物的发现速度,但也引发了重要的伦理问题。在不完整或存在偏见的数据集上训练的算法可能加剧现有的不平等现象,因此必须使用多样化且具有代表性的训练数据。89此外,采用可解释的人工智能方法对于提高透明度、帮助科研人员理解预测结果至关重要,可确保人工智能作为人类掌控下的辅助工具,而非决策主体。85伦理考量还包括数据隐私,尤其是在使用临床或人类来源的数据集时,以及随着自动化日益影响研究环境,其对科研人员队伍所带来的影响90为解决这些问题,人工智能系统应接受定期审计、偏见评估以及严格的监管监督,以确保神经科学领域研究的公平性、可问责性和可信度。

访问受限。请登录或开始试用以查看此内容。

结论

目前,天然产物(NPs)的发现依赖于分析化学与生物信息学的结合,形成了强大的协同效应。如图1所示,先进的组学技术(如液相色谱-质谱代谢组学、高通量测序、RNA-Seq 和蛋白质组学)与计算分析方法(包括分子网络和机器学习(ML))协同作用,构建了一条高效的发现流程。该领域的最新进展包括单细胞组学技术,可用于识别稀有产生菌;同时,扩展的质谱谱图数据库和人工智能(AI)工具也助力代谢物的鉴定。此外,对新生态环境开展的大规模宏基因组挖掘正在揭示此前未知的化合物。整合型数据框架以及GNPS、antiSMASH 和 NPAtlas 等社区资源为协作研究提供了支持。随着机器学习与人工智能技术的持续发展,未来有望实现多组学数据的自动化整合,从基因组信息中预测新型化学化合物,并推荐具有优先研究价值的生物活性。这一由创新方法驱动的策略,有望通过将复杂的组学数据转化为实用的生物学见解,显著加快新一代抗生素等新型天然产物的发现进程。

访问受限。请登录或开始试用以查看此内容。

披露

所有作者声明不存在可能被视为潜在利益冲突的财务或个人关系。

致谢

本工作得到了国家自然科学基金(32500813)、中国博士后科学基金资助项目(GZC20251503)、四川省科技计划项目(2024ZYD0149)、四川省博士后专项研究基金(TB2024017)、德阳市科学技术局重点研发项目(2024SZY016,2023SZZ009)、国家卫生健康委员会能力建设和继续教育中心项目(GWJJMB202510025060)以及德阳市人民医院孵化项目专项基金(FRH202501,FHT202501)的支持。我们确认图1使用BioRender绘制,

访问受限。请登录或开始试用以查看此内容。

参考文献

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

访问受限。请登录或开始试用以查看此内容。

重印与许可

标签