Reviewartikel

Multi-Omics en integratieve analyse in de ontdekking van natuurlijke producten

1.5K weergaven

DOI:

10.3791/69458

28 november 2025

In dit artikel

Samenvatting

Deze review legt de nadruk op baanbrekende multi-omics methodologieën, waaronder metabolomics, genomics, transcriptomics en proteomics, die geïntegreerd zijn met kunstmatige intelligentie en machine learning, evenals netwerkanalyse, om de ontdekking en functionele validatie van nieuwe natuurlijke producten te verbeteren.

Samenvatting

Natuurlijke producten (NP's) zijn al lange tijd een essentiële bron van nieuwe bioactieve verbindingen voor geneesmiddelenontwikkeling; Traditionele methoden om deze verbindingen te screenen en te isoleren kunnen echter traag zijn en vaak afnemende opbrengsten opleveren. Gelukkig bieden geavanceerde multi-omics en computationele benaderingen krachtige oplossingen voor deze uitdagingen. Deze review belicht innovatieve methodologieën die metabolomics, genomics, transcriptomics en proteomics integreren met bio-informatica en analytische chemie om de ontdekking van NP's te versnellen. Zo maken niet-gerichte metabolomics-platforms zoals hoogresolutie vloeistofchromatografie-tandem massaspectrometrie (LC-MS/MS) en Global Natural Products Social (GNPS) moleculaire netwerken uitgebreide profilering van nieuwe verbindingen mogelijk, terwijl gerichte isotooplabelingsstrategieën dit proces verbeteren. Daarnaast identificeren genoom- en metagenoomminingtools zoals antibiotica en de secundaire metabolietanalyseshell (antiSMASH), Deep Biosynthetic Gene Cluster (DeepBGC) en Pipeline for Reconstructing Integrated Syntheses of Metabolites (PRISM) snel biosynthetische genclusters (BGC's) in zowel gekweekte als niet-gekweekte organismen, vaak met heterologe expressie om producten te valideren. Transcriptomische analyses, waaronder RNA-sequencing (RNA-seq), co-expressienetwerken en fluxomics, helpen verduidelijken hoe routes worden gereguleerd, terwijl kwantitatieve proteomica-technieken zoals tandem mass tags/isobaric tags for relative and absolute quantitation (TMT/iTRAQ) en labelvrije methoden, samen met chemoproteomics-benaderingen zoals cellulaire thermal shift assay en thermische proteoomprofilering (TPP), moleculaire doelen en hun werkingsmechanismen aan het licht brengen. Deze review legt ook veel nadruk op de rol van kunstmatige intelligentie (AI) en machine learning (ML) bij het integreren van multi-omics-data, met activiteiten variërend van het construeren van gen-metaboliet-correlatienetwerken tot het benutten van kennisgrafen en neurale grafnetwerken voor datafusie en functionele voorspelling. Tot slot besluit deze review met een bespreking van de synergetische voordelen van multi-omics voor de ontdekking van natuurlijke producten, het aanpakken van huidige technische uitdagingen en het verkennen van toekomstige richtingen naar high-throughput, intelligente data-integratie voor onderzoek naar de volgende generatie NP.

Inleiding

Natuurlijke producten, moleculen geproduceerd door verschillende organismen, waaronder microben en planten, zijn al lange tijd een essentiële bron van medicijnen, variërend van antibiotica zoals penicilline tot kankerbestrijdende middelen zoals Taxol. Een aanzienlijk deel van onze huidige antibiotica en chemotherapiemiddelen is afkomstig van deze natuurlijke verbindingen1. De traditionele methoden om nieuwe NP's te ontdekken, zoals het kweken van microben en het toepassen van bioassay-geleide isolatie, zijn echter steeds moeilijker geworden. Aan het eind van de 20e eeuw nam de interesse in verpleegkundig personeel af, omdat bedrijven te maken kregen met afnemende opbrengsten; Veel verbindingen die gemakkelijk te vinden waren, waren al herontdekt, en de technische uitdagingen die gepaard gingen met het screenen en karakteriseren van deze verbindingen maakten het proces arbeidsintensief. Gelukkig keert deze trend zich nu om. Recente ontwikkelingen in omics en analytische technologieën geven de zoektocht naar NPs nieuw levenin. Zo stelt high-throughput DNA-sequencing onderzoekers in staat genomen te onderzoeken voor verborgen biosynthetische genclusters (BGC's), terwijl ultragevoelige massaspectrometrie (MS) kleine hoeveelheden nieuwe metabolieten kan identificeren binnen complexe mengsels. Deze technologische innovaties komen op een cruciaal moment, omdat er wereldwijd dringend vraag is naar nieuwe therapieën, met name antibiotica die resistente bacteriën kunnen bestrijden. Modern onderzoek bij NP's neemt deze uitdaging aan door traditionele expertise in NP's te integreren met geavanceerde genomische en chemische analysetechnieken.

Multi-omics integratie staat centraal in de huidige vooruitgang in biologisch onderzoek. Het concept van "multi-omics" omvat de gelijktijdige analyse van verschillende biologische datalagen, zoals het DNA (genoom) van een organisme, mRNA-transcripten, eiwitten en metabolieten. De toepassing van omics-benaderingen heeft het onderzoek van NP's getransformeerd, waardoor high-throughput screening, snelle identificatie van nieuwe verbindingen en diepere verkenning van de ingewikkelde netwerken die biologische systemen vormgevenmogelijk maken. Door deze meerlaagse datasets te integreren, kunnen onderzoekers genen direct koppelen aan de metabolieten die ze coderen, waardoor een uitgebreider begrip van de biosynthese van NP'sopgebouwd wordt 6. Zo kunnen genome mining-algoritmen een cluster genen aanwijzen die mogelijk coderen voor een nieuw antibioticum, terwijl transcriptomische data kan aangeven of die genen actief tot expressie komen. Daarnaast kan metabolomische profilering het bijbehorende antibioticummolecuul in het kweekextract 7,8,9 van het organisme identificeren. Deze geïntegreerde aanpak versnelt aanzienlijk de ontdekking van nieuwe verbindingen en het begrip van hun biosynthetische paden. Belangrijker nog, de identificatie van geneesmiddeldoelen vertrouwt steeds meer op geïntegreerde multi-omics-benaderingen, die geleidelijk de traditionele single-omics-strategieënvervangen. Recente ontwikkelingen in de analytische chemie, waaronder hoogresolutie vloeistofchromatografie-MS (LC-MS) en kernmagnetische resonantie (NMR), stellen onderzoekers in staat nieuwe NP's te detecteren en structureel te analyseren uit complexe biologische monsters11,12. Deze technieken leveren enorme hoeveelheden data op, en daar worden bio-informatica en machine learning (ML) essentieel. Kunstmatige intelligentie (AI)-algoritmen en netwerkgebaseerde analyses worden steeds vaker gebruikt om multi-omics-gegevens te analyseren, waarbij significante patronen en voorspellingen worden blootgelegd die moeilijk handmatig te achterhalen zijn13,14. Door geavanceerde omics-technologieën te combineren met AI-gedreven data mining, kunnen onderzoekers nu een robuuste pijplijn opzetten voor snellere en systematischere ontdekking en analyse van NP's dan ooit tevoren.

Hoewel multi-omics-strategieën de ontdekking van NP's aanzienlijk hebben bevorderd, is hun succesvolle implementatie sterk afhankelijk van nauwgezette experimentele planning. Zo zijn bijvoorbeeld het type en de kwaliteit van de monsters cruciaal; Het is essentieel om goed bewaarde microbiële culturen, omgevingsisolaten of klinisch materiaal te verzamelen onder omstandigheden die de afbraak van nucleïnezurenen metabolieten minimaliseren. De diepte van sequencing speelt ook een cruciale rol bij dataresolutie: sequencing van het hele genoom vereist doorgaans een dekking van minstens 30× voor nauwkeurige assemblage, terwijl transcriptomische profilering vaak tientallen miljoenen lezingen vereist om transcripten met lage abundantie te identificeren, zoals aanbevolen door Genohub16. Daarnaast zijn voor metabolomics geschikte extractiemiddelen en methoden nodig om diverse chemische klassen vast te leggen; men moet bewust kiezen voor extractieprotocollen die bias minimaliseren en reproduceerbaarheidmaximaliseren 17. Deze methodologieën brengen echter hun eigen uitdagingen met zich mee. Het integreren van grote, heterogene datasets kan rekenintensief zijn, en de instabiliteit of lage hoeveelheid metabolieten kan latere analyses bemoeilijken18. Bovendien kunnen de hoge kosten of beperkte steekproefgroottes het ontwerp van studiesbeperken. Verontreiniging en bias in sequencinggegevens, vooral bij laag-input of verdunde monsters, brengen ook aanzienlijke risico's met zich mee, zoals benadrukt door Lusk et al. met betrekking tot besmetting in high-throughput sequencing20. Door deze praktische en technische beperkingen te erkennen, kunnen onderzoekers weloverwogen beslissingen nemen over geschikte multi-omics-combinaties en hun resultaten met de nodige voorzichtigheid interpreteren.

Deze review benadrukt de innovatieve methoden die de ontdekking van NP's revolutioneren door het gebruik van multi-omics en integratieve analyse. Het onderzoekt ook het groeiende belang van ML en AI bij het verbinden van deze verschillende datastromen, waaronder de opbouw van gen-metabolietcorrelatienetwerken en de identificatie van genclusters die waarschijnlijk nieuwe bioactieve verbindingen zullen produceren. Daarnaast onderzoekt het de betekenis en het toekomstige potentieel van deze geïntegreerde aanpak. Samenvattend versnelt de combinatie van verschillende omics-technologieën met geavanceerde analyses niet alleen de ontdekking van nieuwe NP's vandaag, maar effent ook de weg voor de ontwikkeling van geneesmiddelen van de volgende generatie die dringend nodig zijn voor de samenleving.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Review en perspectief

Om deze review samen te stellen, hebben we een uitgebreide literatuurzoektocht uitgevoerd in meerdere databases en indexeringsplatforms, waaronder PubMed, Scopus, Web of Science, ScienceDirect en Google Scholar. De zoektocht omvatte publicaties van januari 2015 tot juli 2025. Trefwoorden en Booleaanse combinaties waren onder andere: "natuurlijke productontdekking," "omics," "metabolomics," "genomics," "transcriptomics," "proteomics," "machine learning," "kunstmatige intelligentie," "biosynthetische genclusters" en "multi-omics integratie." Referentielijsten van belangrijke artikelen en recente reviews werden ook gescreend om aanvullende relevante publicaties te identificeren. Naast peer-reviewed studies werden een beperkt aantal preprint-artikelen van platforms als bioRxiv en medRxiv geraadpleegd wanneer deze actuele en relevante inzichten boden die nog niet beschikbaar waren in gepubliceerde literatuur. Alle preprints zijn duidelijk gelabeld om transparantie te waarborgen. Deze sectie bespreekt de nieuwste ontwikkelingen en toekomstperspectieven op de belangrijkste gebieden van de ontdekking van omics-gebaseerde NP's, met specifieke focus op metabolomics, genomics, transcriptomics en proteomics. Evenals hun integratie via AI/ML. De belangrijkste hulpmiddelen en bronnen die over deze vakgebieden worden besproken, zijn ter referentie samengevoegd in Tabel 1.

1. Metabolomics in de ontdekking van NP's

  1. Analytische platforms voor metabolomics
    Metabolomica is cruciaal voor het ontdekken van NP's, omdat het een gedetailleerde analyse mogelijk maakt van de kleine moleculen die door verschillende organismen worden gevormd. De belangrijkste analytische instrumenten die worden gebruikt voor het karakteriseren van de metabolomen van NP's zijn hoogresolutie MS-technieken, zoals LC-MS/MS en gaschromatografie-MS (GC-MS), samen met NMR-spectroscopie21,22. Niet-gerichte LC-MS/MS-workflows, zoals ultra-high-performance LC-MS gecombineerd met MS/MS, maken het mogelijk een breed scala aan metabolieten in complexe mengsels te identificeren, terwijl GC-MS uitblinkt in het profileren van vluchtige verbindingen. Daarnaast verbeteren nieuwe methoden zoals directe infusie-tandem MS en MS-beeldvorming de metabolomica-toolkit voor NPs23,24. Geavanceerde massaspectrometrische technieken, waaronder multimodale MS, die positieve en negatieve ionmodi combineert of multi-traps MSn-fragmentatie toepast, en gekoppelde methoden zoals LC-MS in combinatie met NMR, bieden diepere structurele inzichten in de metabolieten die worden gedetecteerd25,26.
  2. Gegevensverwerking en computationele tools
    Gespecialiseerde softwaretools spelen een cruciale rol bij de verwerking en interpretatie van metabolomics-gegevens. Programma's zoals XCMS, MZmine en OpenMS worden vaak gebruikt om chromatografische kenmerken, of pieken, te detecteren en uit te lijnen, terwijl nauwgezette datapreprocessing-stappen zoals piekuitlijning, normalisatie en filtering essentieel zijn voor reproduceerbare metabole profielen27. De identificatie van verbindingen wordt ondersteund door MS/MS spectrale bibliotheken, waaronder NIST en mzCloud, evenals in silico fragmentatietools zoals SIRIUS en MetFrag28. Het Global Natural Products Social (GNPS) platform is uitgegroeid tot een belangrijke bron voor moleculaire netwerken, dat gerelateerde MS/MS-spectra organiseert om chemische families te benadrukken en de dereplicatie van bekende verbindingen te faciliteren29. Zo heeft een analyse met GNPS op LC-MS/MS-gegevens uit Streptomyces-culturen met succes bekende antibiotica zoals spiramycine en actinomycine geïdentificeerd, naast eerder niet gerapporteerde analogen30,31. De moleculaire netwerktechniek groepeerde effectief gerelateerde onbekende spectra, en de toevoeging van ionenidentiteitsnetwerken verbeterde de connectiviteit van features. Deze netwerkgebaseerde analyses, gecombineerd met multivariate statistische instrumenten zoals principal component analyse en orthogonale partiële least squares discriminant analyse, evenals correlatienetwerkanalyse, kunnen patronen van metabolietproductie koppelen aan specifieke biologische of omgevingscondities. In een specifieke studie toonde GNPS moleculaire netwerken van fermentatie-extracten van een plantgeassocieerde Streptomyces verschillende metabolietprofielen aan die varieerden afhankelijk van de gebruikte groeimediator. Bekende metabolieten, waaronder spiramycine, actinomycine en een kankerverwekkende verbinding genaamd lyngbyatoxine, werden aangetroffen; Veel netwerkknooppunten kwamen echter niet overeen met enige vermeldingen in spectrale databases32. Deze bevinding suggereert de aanwezigheid van echt nieuwe metabolieten, wat aantoont hoe niet-gerichte metabolomics, in combinatie met GNPS, potentieel nieuwe NP's kunnen identificeren voor verder onderzoek.
    Het combineren van metabolomische screening met functionele bioassays vergemakkelijkt de snelle prioritering van stammen of extracten die bioactieve verbindingen opleveren. Daarnaast zijn opkomende gemeenschapsbronnen zoals de Natural Products Atlas (NPAtlas), samen met geïntegreerde metaboloom-genoomanalysepijplijnen, van groot belang bij het koppelen van gedetecteerde metabolieten aan hun BGC's in de bronorganismen33,34. Deze integratieve strategie stelt onderzoekers in staat metabolietsignalen te correleren met genomische gegevens, waardoor de efficiëntie van het identificeren van NP's en het traceren van hun oorsprong toeneemt.

2. Genomica in de ontdekking van NP's

In het afgelopen decennium is het onderzoek van microbiële NP's een transformerende "deep-mining era" binnengegaan, aangedreven door vooruitgang zoals high-throughput sequencing, ultra-gevoelige high-resolution MS en geïntegreerde multi-omics benaderingen35. Deze tools hebben de ontdekkingsinspanningen verschoven van toevallige isolatie naar data-gedreven, gerichte verkenning. Genome mining-pijplijnen, waaronder antiSMASH 7.0 en DeepBGC, maken nu systematische identificatie van cryptische BGC's mogelijk, met name in onderbelichte taxa36,37.

  1. High-throughput sequencing en hybride assemblage
    Technologieën voor high-throughput DNA-sequencing, zoals short-read high-throughput DNA-sequencing gecombineerd met long-read sequencingplatforms, hebben de genomische studie van organismen die NP's produceren aanzienlijk getransformeerd. Door gebruik te maken van hybride assemblagestrategieën die zowel lange als korte reads integreren, kunnen onderzoekers genoomassemblages met hoge contentuiteit bereiken, die essentieel zijn voor het vastleggen van volledige BGC's binnen eengenoom 38. Daarnaast verbreedt metagenomische sequencing, waarbij metagenoomgenoomgenomen worden teruggevonden, de ontdekking van BGC's naar niet-gekweekte microben, waardoor wetenschappers milieu-DNA kunnen onderzoeken voor het biosynthetische potentieel39. In gevallen waarin conventionele genoomassemblagemethoden tekortschieten in het oplossen van grote of repetitieve genclusters, kunnen bibliotheekgebaseerde technieken, zoals cosmid- of bacteriële kunstmatige chromosoombibliotheken, worden ingezet om aanzienlijke genomische fragmenten te isoleren en te klonen. Deze benadering vergemakkelijkt de karakterisering van complete genclusters door gerichte sequencing of heterologe expressie, waardoor ons begrip van de genetische basis voor de biosynthese van NP's40,41 wordt vergroot.
  2. Genoommijngereedschappen
    Gespecialiseerde bio-informatische tools zijn essentieel voor het analyseren van genomische gegevens om de verschillende signaturen van secundaire metabolietroutes te identificeren. Programma's zoals antiSMASH, PRISM en DeepBGC spelen een cruciale rol in dit proces door automatisch kandidaat-BGC's te detecteren. Zij doen dit door specifieke biosynthetische domeinen te herkennen, zoals die geassocieerd met niet-ribosomale peptide-synthetasen, polyketidensynthasen, ribosomaal gesynthetiseerde en post-translationeel gemodificeerde peptide (RiPP)-routes, en terpenecyclasen, onder andere. Om dereplicatie te ondersteunen, helpen databases zoals MIBiG, dat bekende BGC's en hun producten samenstelt, en NPAtlas, dat bekende NP's catalogiseert, onderzoekers om nieuwe sequenties of verbindingen te koppelen aan gevestigde voorbeelden 37,42,43. Clustering-algoritmen, zoals BiG-SCAPE, samen met tools zoals CORASON, organiseren gerelateerde BGC's in families, bieden een netwerkbeeld van biosynthetische diversiteit en faciliteren de identificatie van nieuwe clusterfamilies door vergelijkingen met bekende groepen44. Aanvullende bio-informatische analyses, waaronder BLAST-zoekopdrachten en verborgen Markov-modelscans, kunnen de potentiële functies voorspellen van enzymen die in een BGC zijn gecodeerd, terwijl vergelijkende genomica-benaderingen, zoals syntenie-analyse en de co-evolutie van genen, helpen deze functionele voorspellingen te verfijnen45. Bovendien maken genomische gegevens het mogelijk om regulerende elementen die gekoppeld zijn aan de biosynthese van NP te annoteren, waaronder route-specifieke promotoren en transcriptionele regulatoren46. Deze inzichten vormen een basis voor pathway engineering; bijvoorbeeld stellen synthetische biologische technieken zoals transformatie-geassocieerd recombinatieklonen en Red/ET-recombinering onderzoekers in staat stille of cryptische BGC's te vangen en tot expressie te brengen in een heteroloog gastheerorganisme, waardoor de productie van hun metabolietenwordt geactiveerd.
    Genome mining-inspanningen hebben met succes geleid tot de ontdekking van nieuwe NP's door zich te concentreren op specifieke genetische signalen. Zo bracht een systematische zoektocht naar genen die gekoppeld zijn aan glycopeptide-antibioticaresistentie verschillende ongebruikelijke BGC's aan het licht die naar verwachting nieuwe antibiotica coderen. Deze methode resulteerde in de identificatie van twee nieuwe verbindingen, compstatine en cobramycine, die beide unieke werkingsmechanismen vertonen door bacteriële autolysins48 aan te pakken. In een vergelijkbare lijn leverde het onderzoek naar biosynthetische geninhoud in het menselijk microbioom een lipopeptide-antibioticumkandidaat op, bekend als "humicine", bekend om zijn potentiële effectiviteit tegen Staphylococcus en Streptococcus soort49. In deze gevallen werden de verbindingen aanvankelijk geïdentificeerd via computationele methoden, waarbij hun chemische structuren werden voorspeld op basis van genomische gegevens. Vervolgens werden deze voorspelde moleculen chemisch gesynthetiseerd en toonden ze de verwachte antibiotica-activiteiten aan, waarmee de genoomgebaseerde ontdekkingsstrategie werd gevalideerd. Op grotere schaal onthult grootschalige sequencing van diverse bacteriën, waaronder veel zeldzame actinomyceten, een rijkdom aan "cryptische" BGCS-genclusters waarvan de producten onbekend blijven. Zo hebben onderzoeken naar Streptomyces-genomen duizenden niet-gekarakteriseerde BGCs50 aan het licht gebracht. Een opkomende benadering om deze weesclusters te koppelen aan daadwerkelijke metabolieten is het integreren van metabolomische analyses met genomische onderzoeken. Door de aanwezigheid of expressie van een gencluster te correleren met de detectie van unieke metabolietkenmerken via platforms zoals GNPS of massaspectrale databases, kunnen onderzoekers voorlopige chemische producten toewijzen aan de talrijke nieuwe BGC's, waardoor de ontdekking van echt nieuwe NP's uit genomische data mogelijk wordt.

3. Transcriptomics in de ontdekking van natuurlijke producten

Transcriptomische analyses bieden een dynamisch perspectief op de activiteit van BGC's door mRNA-expressie onder verschillende omstandigheden te meten. Specifiek kunnen RNA-seq-experimenten aantonen welke BGC's actief worden getranscribeerd en hoe hun expressieniveaus fluctueren als reactie op omgevings- of experimentele veranderingen. Door transcriptniveaus te vergelijken onder verschillende omstandigheden, kan differentiële expressieanalyse, met behulp van tools zoals DESeq2 of edgeR, BGC's identificeren die ofwel up- of downreguleerd zijn, waardoor genclusters worden benadrukt die mogelijk induceerbaar zijn of stil blijven onder standaardcondities51. Hoewel conventionele RNA-seq uitgevoerd op bulkgekweekte cellen de gebruikelijke benadering is voor het onderzoeken van BGC-expressie, beginnen meer geavanceerde technieken zoals single-cell RNA-seq te worden gebruikt in complexe microbiomen. Deze verschuiving maakt het mogelijk om genexpressie te observeren in organismen in de omgeving die moeilijkte kweken zijn. Een standaard RNA-seq workflow omvat doorgaans mapping readings naar een referentiegenoom met behulp van aligners zoals STAR of HISAT2, het kwantificeren van genexpressie met tools zoals featureCounts of Kallisto, en het normaliseren van de data om significante expressieveranderingen te identificeren. Hierna kan co-expressienetwerkanalyse, vaak uitgevoerd met het WGCNA-pakket, genen clusteren met vergelijkbare expressiepatronen. Wanneer metabolietgegevens ook beschikbaar zijn, kunnen deze netwerken verder worden uitgebreid om metabolieten te bevatten, waardoor specifieke verbindingen worden gekoppeld aan co-expressieve genen54.

Transcriptomische gegevens zijn waardevol gebleken bij het identificeren van conditioneel actieve biosynthetische routes. Een opvallend voorbeeld van deze benadering is te vinden in een gedetailleerde vergelijking van vier Salinispora-stammen51. In deze studie bleek dat meer dan de helft van de BGC's in elke stam in enige mate tot expressie kwam, waarbij veel clusters die in de ene stam inactief waren, ook expressie in een andere vertoonden. Door genexpressieprofielen over deze stammen te analyseren, konden de onderzoekers verschillende regulerende factoren aanwijzen die specifieke clusters leken te dempen of te activeren. Deze integratieve methode leidde tot de identificatie van een voorheen onbekende familie NP's, bekend als salinipostinen. Transcriptomische gegevens gaven een cryptisch genencluster aan als potentiële bron voor een niet-geïdentificeerde verbinding; Wanneer deze cluster werd geïnduceerd tot expressie (door regulatieveranderingen), resulteerde dit in de productie van salinipostinemoleculen, die vervolgens werden geïsoleerd en structureel gekarakteriseerd. Deze studie illustreert hoe transcriptomics de ontdekking van NP's kan vergemakkelijken: door differentiële genexpressie te analyseren, kunnen onderzoekers kandidaat-BGC's benadrukken, en de correlatie tussen genexpressie en metabolietprofielen levert ondersteunend bewijs voor gen-metabolietrelaties die kunnen worden gevalideerd door gerichte experimenten.

4. Proteomics in de ontdekking van NP's

  1. Shotgun- en gerichte proteomica-benaderingen
    Proteomics, waarbij eiwitten op grote schaal bestudeerd worden, biedt een essentieel perspectief in het onderzoek van NP's door direct de enzymen en eiwitten te meten die een rol spelen in biosynthetische routes. Over het algemeen kunnen proteomische benaderingen worden ingedeeld in twee hoofdtypen: shotgun (ongerichte) proteomica en gerichte proteomica. In shotgun-proteomics ondergaan eiwitten die uit microbiële of plantmonsters worden geëxtraheerd enzymatische vertering, meestal met trypsine, en worden de resulterende peptiden geanalyseerd met behulp van hoogresolutie LC-MS/MS, vaak met behulp van geavanceerde massaspectrometers zoals quadrupole time-of-flight (QTOF) of hoogresolutie orbitale val massaspectrometers55. De verzamelde MS-gegevens, bekend als MS/MS-spectra, worden vervolgens gekoppeld aan peptidesequenties door te zoeken naar een eiwitdatabase die is afgeleid van het genoom van het organisme of een nauw verwante soort, gebruikmakend van softwaretools zoals MaxQuant of Mascot56,57. Dit proces maakt het mogelijk veranderingen in eiwitabundantie onder verschillende omstandigheden te kwantificeren, wat kan worden bereikt via labelvrije methoden of door gebruik te maken van isotooplabelingstechnieken, zoals stabiele isotooplabeling met aminozuren in celcultuur (SILAC) of isobare tagging met TMT/iTRAQ-reagentia, om te bepalen welke biosynthetische enzymen up- of downgereguleerd zijn58, 59. Daarentegen concentreren gerichte proteomics-methoden, waaronder geselecteerde reactiemonitoring (SRM) of parallelle reactiemonitoring (PRM), zich op een specifieke set peptiden, vaak unieke peptiden uit belangrijke biosynthetische enzymen of regulerende eiwitten, waardoor precieze en gevoelige kwantificering van deze peptiden over meerdere monstersmogelijk is.
  2. Innovatieve benaderingen in de proteomica
    Een belangrijke uitdaging bij de proteomische analyse van secundaire metabolisme is de detectie van grote biosynthetische enzymen, zoals niet-ribosomale peptide-synthetasen en polyketide-synthasen, die vaak meer dan 100 kDa in grootte zijn en weinig detecteerbare peptiden opleveren met standaard verteringsprotocollen, waardoor ze moeilijk waarneembaar zijn. Om dit probleem aan te pakken, ontwikkelden Bumpus et al. een methode genaamd PrISM, die de detectie van NRPS- en PKS-eiwitten verbetert door gebruik te maken van een specifieke cofactor die op deze enzymen62 voorkomt. PrISM integreert conventionele shotgun-proteomica met een fosfopantetheinyl (Ppant) ejectie-assay. Opmerkelijk is dat NRPS- en PKS-enzymen een covalent gehechte Ppant-arm hebben op hun acyldrager- of peptidyldragerdomeinen; tijdens MS/MS-fragmentatie genereert deze prothetische groep vaak een uniek fragmention, aangeduid als het "Ppant-ejectie"-ion. Door de LC-MS/MS-gegevens computationeel te filteren op dit diagnostische ion, kan de PrISM-methode effectief peptiden hervormen die zijn afgeleid van NRPS- en PKS-enzymen te midden van de complexe mix van alle cellulaire eiwitten. Deze strategie heeft met succes verborgen biosynthetische routes blootgelegd via proteomica. Zo maakte de PrISM-workflow het mogelijk om peptiden uit het gramicidine S synthetasecomplex (GrsA/GrsB) in culturen van Bacillus brevis te detecteren, waardoor een directe link werd gelegd tussen deze NRPS-enzymen en de productie van het antibioticum gramicidin S in dat organisme62. Belangrijk is dat de proteomische identificatie van GrsA/GrsB geen voorafgaande genomische kennis van B. brevis vereiste, wat illustreert dat in bepaalde gevallen alleen proteomische analyse actieve NP-biosynthetische routes kan onthullen, zelfs in organismen waarvan het genomen nog niet is gesequenced.
  3. Genoom-geïnformeerde proteomica
    Wanneer een genoomsequentie beschikbaar is, kan de kracht van proteomics aanzienlijk worden versterkt door gebruik te maken van een stamspecifieke database voor peptide-identificatie. Zo voerden onderzoekers in een studie die het proteoom van Streptomyces lilacinus analyseerde twee analyses uit: één door spectra te doorzoeken met een algemene eiwitdatabase en een andere met een aangepaste database die is afgeleid van het gesequencede genoom van die stam63. De genoom-geïnformeerde analyse leverde ongeveer tien keer meer geïdentificeerde peptiden op en detecteerde peptiden die gekoppeld waren aan zes verschillende BGC's binnen het organisme. Opmerkelijk is dat drie van deze geïdentificeerde clusters overeenkwamen met eerder bekende "wees"-metabolieten, waaronder graybactine, rakicidine D en een specifieke siderofor, waarvan de biosynthetische enzymen bevestigd zijn tot expressie. De overige gedetecteerde clusters leken nieuw en onkarakteriseerd te zijn. Dit voorbeeld toont aan dat het integreren van genomische informatie in proteomische workflows kan bevestigen welke biosynthetische routes actief tot expressie komen in een stam, waardoor die genclusters worden geprioriteerd voor de isolatie en karakterisering van hun producten.
    Daarnaast kunnen proteomische methoden de moleculaire doelen en werkingswijzen van NP's verhelderen, een gebied dat vaak wordt aangeduid als chemische proteomica. Zo maakt activiteitsgebaseerde eiwitprofilering (ABPP) gebruik van kleine molecuulprobes, meestal derivaten of analogen van NP's, die reageren met de cellulaire doelen van de verbinding, waarbij deze eiwitten worden gelabeld voor verrijking en identificatie via MS64. Deze techniek kan de eiwitdoelen ontdekken waaraan een specifiek NP of gerelateerd molecuul zich binnen de cel bindt. Een andere methode, thermisch proteoomprofilering (TPP), houdt in dat eiwitmonsters worden verwarmd in aanwezigheid of afwezigheid van een verbinding om te bepalen welke eiwitten veranderde thermische stabiliteit vertonen, wat wijst op een bindingsinteractie65. Deze chemische proteomische benaderingen zijn van onschatbare waarde voor het valideren van de biologische doelwitten van NP's en het verduidelijken van hun werkingsmechanismen, waarmee ze de ontdekking van de NP's zelf aanvullen.

5. ML en AI voor omics-integratie en -voorspelling

  1. Integratie van multi-omics-gegevens met ML
    Een spannend vooruitzicht in de ontdekking van NP's is de toepassing van ML en AI om omics-data te integreren voor functionele voorspellingen. Op het gebied van genomica zijn begeleide ML-algoritmen, waaronder random forests, support vector machines en deep neural networks, ontwikkeld om patronen in BGC's te identificeren die geassocieerd zijn met specifieke typen NP's. Deze ML-modellen kunnen bijvoorbeeld BGC's categoriseren op basis van de algemene klasse moleculen die ze produceren of zelfs bepaalde kenmerken van de chemische structuur voorspellen die uit de gensequentie zijn afgeleid. Een review van Dason MS en collega's belicht verschillende ML-tools die zijn ontworpen om de "taal" van BGC's te ontcijferen, waarbij DNA- of aminozuursequentiegegevens worden gebruikt om de structuren en bioactiviteit van de overeenkomstige NP's af te leiden66. Deze modellen zijn doorgaans gebaseerd op uitgebreide databases van bekende genclusters en verbindingen om de relaties tussen deze verbindingen te leren, waardoor voorspellingen mogelijk zijn over de potentiële biologische activiteit van nieuwe verbindingen. Zo kunnen ze beoordelen of een product van een niet-gekarakteriseerd BGC antibiotische of antikanker-eigenschappen kan hebben. Belangrijke ontwikkelingen die deze mogelijkheden hebben vergemakkelijkt zijn onder meer het gebruik van grote trainingsdatasets, zoals duizenden bekende NP-structuren en genclusters, innovatieve representatietechnieken zoals sequentie-embeddings en grafneurale netwerken die de kenmerken van genclusters en chemische structuren vastleggen, en multiparametrische modellen die verschillende genomische en chemische descriptors combineren om de voorspellingsnauwkeurigheid te verbeteren.
    Op het gebied van metabolomics verbeteren AI-technieken de interpretatie van complexe massaspectrale data aanzienlijk. Een opvallend voorbeeld is het hulpmiddel CSI:FingerID, dat ML gebruikt om de structurele vingerafdruk van een molecuul te voorspellen uit het MS/MS-spectrum. Deze capaciteit helpt bij het identificeren van onbekende metabolieten door potentiële substructuren en kandidaatverbindingen voor te stellen67. Evenzo zijn deep learning-modellen gebruikt voor spectrale annotatie; convolutionele neurale netwerken en, recenter, transformer-gebaseerde architecturen, zoals het "DreaMS"-model, leren fragmentatiepatronen uit uitgebreide spectrale bibliotheken. Deze modellen kunnen structuren voorstellen voor onbekende spectra op basis van de patronen die ze hebben geleerd, vaak beter presteren dan traditionele heuristische methoden, vooral voor metabolieten die geen exacte matches hebben in bestaande databases68. Naast structurele annotatie draagt ML ook bij aan metabolomics door globale patronen te identificeren. Zo kunnen ongecontroleerde visualisatie-algoritmen zoals t-SNE (t-distributed stochastic neighbor embedding) en UMAP (Uniform Manifold Approximation and Projection) de dimensionaliteit van niet-gerichte metabolomics-datasets verminderen, waardoor het clusteren van monsters op basis van overeenkomsten in hun metabolietprofielen mogelijk wordt. Ondertussen kunnen begeleide classifiers specifieke metabolietsignaturen koppelen aan de fenotypische eigenschappen of bioactiviteit van de monsters, wat de analyse verder verrijkt69,70,71.
    ML wordt steeds vaker gebruikt om verschillende omics-datasets te integreren, waardoor een meer volledig begrip ontstaat van de biosynthese en functie van NP's. Door gegevens uit genomica, transcriptomics, proteomics en metabolomics samen te voegen, kunnen integratieve modellen verbanden blootleggen die over het hoofd worden gezien bij het afzonderlijk onderzoeken van elk datatype. Zo kunnen onderzoekers gen-metabolietencorrelatienetwerken construeren die de expressieniveaus van genen of eiwitten koppelen aan de productieniveaus van metabolieten. ML-modellen die op deze geïntegreerde data zijn getraind, kunnen vervolgens voorspellen welke genclusters waarschijnlijk verantwoordelijk zijn voor specifieke metabolieten of biologische activiteiten72,73. Geavanceerde multivariate technieken, zoals multi-omics factoranalyse (beschikbaar in tools zoals MOFA) en geregulariseerde multivariate methoden (te vinden in pakketten zoals mixOmics), vergemakkelijken de identificatie van latente factoren die verschillende datatypes omvatten, zoals een set co-expressieve genen naast een groep co-voorkomende metabolieten74,75,76. In praktische termen helpen verschillende benaderingen bij het prioriteren van kandidaatgenclusters voor NP's door een verband aan te tonen met waargenomen metabolieten of fenotypen. Een opvallend voorbeeld van deze integratieve, door AI geleide strategie is de ontdekking van een nieuwe familie van ribosomaal gesynthetiseerde en RiPP's met behulp van het DecRiPPter-algoritme. Dit algoritme maakt gebruik van een ondersteuningsvectormachine (SVM)-gebaseerd model om genomische gegevens te analyseren voor cryptische RiPP-precursorpeptiden en deze voorspellingen vervolgens te vergelijken met pangenoomanalyse om bekende verbindingen te elimineren. Wanneer toegepast op 1.295 Streptomyces DecRiPPter identificeerde met succes 42 vermoedelijke nieuwe RiPP-families die eerder over het hoofd waren gezien door traditionele genoommijnmethoden. Onder deze voorspelde clusters werd er één experimenteel gevalideerd om een nieuwe klasse V lanthipeptide te produceren, die de onderzoekers "pristinine A3" noemden. Door de expressie van deze stille gencluster te induceren, werd de verbinding pristinine A3 geïsoleerd en werd de structuur ervan bepaald met behulp van NMR en MS, waarbij twee voorheen onbekende lanthioninevormende enzymen werden onthuld die binnen het pad gecodeerd zijn77. Deze prestatie benadrukt hoe AI-gedreven analyses verborgen NP's kunnen blootleggen: het ML-model detecteerde een anders niet herkend genetisch signaal, wat experimentele inspanningen om een nieuw molecuul te ontdekken stuurde.
  2. Opkomende AI-toepassingen
    Naast de huidige toepassingen zullen verschillende opkomende AI-gedreven strategieën het onderzoek van NP's verder revolutioneren. Een veelbelovend gebied is computationele retrosynthese en routeontwerp, waar deep learning-modellen worden ontwikkeld om biosynthetische routes of synthetische chemische stappen voor bekende NP's en hun analogen voor te stellen, wat het ontwerp en de productie van nieuwe verbindingen aanzienlijk kan verbeteren78,79. Een andere spannende grens is de voorspelling van enzymfunctie met behulp van AI. Door gebruik te maken van moderne eiwitstructuurvoorspellingstools gebaseerd op deep learning-algoritmen, naast ML-technieken zoals contrastief leren op eiwitsequenties, beginnen onderzoekers de waarschijnlijke activiteiten van niet-gekarakteriseerde enzymen in BGC's af te leiden. Dit zou inzicht kunnen geven in de soorten chemische transformaties die deze enzymenkatalyseren. Volledig geïntegreerde omics-naar-chemie pijplijnen worden ontwikkeld, waarbij AI-platforms automatisch massaspectrale kenmerken koppelen aan genomische data 83,84. In principe zou zo'n systeem een LC-MS/MS-dataset uit een complex monster kunnen analyseren naast genoomsequenties uit dezelfde omgeving, waardoor het kan voorspellen welke gencluster verantwoordelijk is voor elke niet-geïdentificeerde metaboliet door gen-cluster-metaboliet-overeenkomsten te scoren. Hoewel deze benaderingen nog in de kinderschoenen staan, suggereren ze een toekomst waarin AI autonoom genen aan moleculen kan koppelen, waardoor het proces van omics-data naar de ontdekking van nieuwe NP's sterk wordt versneld.
  3. Databeheer en ethische uitdagingen bij de ontdekking van AI-ondersteunde NP's
    Modern multi-omics-onderzoek levert een aanzienlijke hoeveelheid diverse data op, maar de effectiviteit van AI-voorspellingen hangt sterk af van de kwaliteit en consistentie van deze datasets. Wanneer trainingssets slecht geannoteerd of bevooroordeeld zijn, kunnen ze leiden tot misleidende uitkomsten en mislukte validaties85. Om dit probleem aan te pakken, zouden onderzoekers de FAIR-principes moeten implementeren – Findable, Accessible, Interoperaable en Reusable – om datatransparantie, reproduceerbaarheid en uitgebreide herbruikbaarheid86 te bevorderen. Deze aanpak omvat het delen van zowel positieve als negatieve resultaten, het grondig documenteren van data-preprocessing pijplijnen en het leveren van analysecode om onafhankelijke verificatie te vergemakkelijken. Daarnaast is de adoptie van opkomende digitale infrastructuren, zoals elektronische laboratoriumnotitieboeken (ELN's) en containergeïntegreerde workflows, essentieel om dataverzameling te verbeteren en gestandaardiseerde curatiete waarborgen 87,88.
    Hoewel AI de ontdekking van NP's aanzienlijk versnelt, brengt het ook cruciale ethische zorgen met zich mee. Algoritmen die zijn getraind op onvolledige of bevooroordeelde datasets kunnen bestaande ongelijkheden versterken, wat de noodzaak van diverse en representatievetrainingsdata benadrukt. Daarnaast is het gebruik van verklaarbare AI-methoden essentieel om transparantie te vergroten en wetenschappers te helpen voorspellingen te begrijpen, zodat AI dient als een ondersteunend hulpmiddel onder menselijke controle in plaats van als een besluitvormer85. Ethische overwegingen omvatten ook gegevensprivacy, vooral bij het gebruik van klinische of door mensen afgeleide datasets, evenals de gevolgen voor het personeelsbestand nu automatisering steeds meer invloed heeft op deonderzoeksomgeving. Om deze problemen aan te pakken, moeten AI-systemen onderworpen worden aan regelmatige audits, beoordelingen van vooringenomenheid en strenge regelgevende controle, wat helpt om eerlijkheid, verantwoording en betrouwbaarheid in het onderzoek van NP's te waarborgen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Conclusies

De huidige stand van zaken in de ontdekking van NP's maakt gebruik van een combinatie van analytische chemie en bio-informatica, wat een krachtige synergie creëert. Zoals beschreven in Figuur 1, werken geavanceerde omics-technologieën zoals LC-MS metabolomics, high-throughput sequencing, RNA-Seq en proteomics samen met computationele analyse, waaronder netwerken en ML, om een effectieve pijplijn voor ontdekking te vormen. Rec...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Alle auteurs stellen dat er geen financiële of persoonlijke relaties zijn die als potentiële belangenconflicten kunnen worden gezien.

Dankbetuigingen

Dit werk werd ondersteund door de National Natural Science Foundation of China (32500813), het Postdoctoraal Fellowship Program van CPSF (GZC20251503), het Sichuan Science and Technology Program (2024ZYD0149), de Special Research Foundation for the Postdoctoral Program van de provincie Sichuan (TB2024017), het Key Research and Development Project van het Deyang Science and Technology Bureau (2024SZY016, 2023SZZ009), het Capacity Building and Continuing Education Center van de National Health Commission (GWJJMB202510025060), en Speciaal Fonds voor Incubatieprojecten van het Deyang People's Hospital (FRH202501, FHT202501). We erkennen dat Figuur 1 is gemaakt met BioRender,

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Referenties

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Multi omics analysemetabolomics platformsgenomics benaderingenproteomics techniekenbio informatica toolsmoleculair netwerkengenome miningkunstmatige intelligentie

Gerelateerde artikelen