Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de revue

Multi-omiques et analytique intégrative dans la découverte de produits naturels

1.5K vues

DOI :

10.3791/69458

28 novembre 2025

Dans cet article

Résumé

Cette revue met l’accent sur des méthodologies multi-omiques de pointe, incluant la métabolomique, la génomique, la transcriptomique et la protéomique, qui sont intégrées à l’intelligence artificielle et à l’apprentissage automatique, ainsi qu’à l’analyse de réseaux, afin d’améliorer la découverte et la validation fonctionnelle de nouveaux produits naturels.

Résumé

Les produits naturels (NP) sont depuis longtemps une source essentielle de nouveaux composés bioactifs pour la découverte de médicaments ; cependant, les méthodes traditionnelles de criblage et d’isolement de ces composés peuvent être lentes et souvent produire des rendements décroissants. Heureusement, la multi-omiques avancée et les approches computationnelles offrent des solutions puissantes à ces défis. Cette revue met en lumière des méthodologies innovantes qui intègrent la métabolomique, la génomique, la transcriptomique et la protéomique avec la bioinformatique et la chimie analytique afin d’accélérer la découverte des NP. Par exemple, des plateformes métabolomiques non ciblées comme la chromatographie liquide haute résolution et la spectrométrie de masse tandem (LC-MS/MS) et le réseau moléculaire Global Natural Products Social (GNPS) permettent un profilage complet de nouveaux composés, tandis que des stratégies ciblées de marquage isotopique améliorent ce processus. De plus, des outils d’exploration du génome et du métagénome tels que les antibiotiques et la coque d’analyse des métabolites secondaires (antiSMASH), le cluster génétique biosynthétique profond (DeepBGC) et le pipeline pour la reconstruction des synthèses intégrées de métabolites (PRISM) identifient rapidement les groupes de gènes biosynthétiques (BGC) chez des organismes cultivés et non cultivés, utilisant souvent une expression hétérologue pour valider les produits. Les analyses transcriptomiques, incluant le séquençage de l’ARN (RNA-seq), les réseaux de co-expression et la fluxomique, aident à clarifier la régulation des voies, tandis que les techniques de protéomique quantitative telles que les tags de masse tandem / les tags isobares pour la quantification relative et absolue (TMT/iTRAQ) et les méthodes sans marqueur, ainsi que des approches chimioprotéomiques telles que le test de déplacement thermique cellulaire et le profilage thermique du protéome (TPP), révèlent des cibles moléculaires et leurs mécanismes d’action. Cette revue met également un accent particulier sur le rôle de l’intelligence artificielle (IA) et de l’apprentissage automatique (ML) dans l’intégration des données multi-omiques, couvrant des activités allant de la construction de réseaux de corrélation gène-métabolites à l’exploitation des graphes de connaissance et des réseaux de neurones graphiques pour la fusion des données et la prédiction fonctionnelle. Enfin, cette revue conclut en discutant des avantages synergiques de la multi-omiques pour la découverte de produits naturels, en abordant les défis techniques actuels et en explorant les orientations futures vers une intégration intelligente et à haut débit des données pour la recherche de nouvelle génération sur les NP.

Introduction

Les produits naturels, qui sont des molécules produites par divers organismes, y compris les microbes et les plantes, ont longtemps servi de source vitale de médicaments, allant des antibiotiques comme la pénicilline aux anticancéreux comme le Taxol. Une part importante de nos antibiotiques et agents chimiothérapies actuels provient de ces composésnaturels 1. Cependant, les méthodes traditionnelles utilisées pour découvrir de nouveaux NP, telles que la culture des microbes et l’isolement guidé par bioanalyse, sont devenues de plus en plus difficiles. À la fin du XXe siècle, l’intérêt pharmaceutique pour les parcs nationaux a diminué alors que les entreprises faisaient face à des rendements décroissants ; de nombreux composés faciles à trouver avaient déjà été redécouverts, et les défis techniques liés au criblage et à la caractérisation de ces composés rendaient le procédé laborieux. Heureusement, cette tendance s’inverse maintenant. Les avancées récentes dans les technologies omiques et analytiques revitalisent la recherche des NP 2,3. Par exemple, le séquençage de l’ADN à haut débit permet aux chercheurs d’explorer les génomes à la recherche de groupes de gènes biosynthétiques cachés (BGC), tandis que la spectrométrie de masse ultra-sensible (SEP) peut identifier de minuscules quantités de métabolites nouveaux dans des mélanges complexes. Ces innovations technologiques arrivent à un moment crucial, car la demande mondiale est urgente pour de nouveaux traitements, en particulier des antibiotiques capables de combattre les bactéries résistantesaux médicaments 4. La recherche moderne sur les NP s’apprête à relever ce défi en intégrant l’expertise traditionnelle des NP avec des techniques génomiques et chimiques de pointe.

L’intégration multi-omique est au cœur des avancées actuelles en recherche biologique. Le concept de « multi-omique » implique l’analyse simultanée de diverses couches de données biologiques, telles que l’ADN (génome) d’un organisme, les transcriptes d’ARNm, les protéines et les métabolites. L’application des approches omiques a transformé la recherche sur les NP, permettant un dépistage à haut débit, l’identification rapide de nouveaux composés et une exploration approfondie des réseaux complexes qui façonnent les systèmesbiologiques 5. En intégrant ces ensembles de données multi-couches, les chercheurs peuvent directement relier les gènes aux métabolites qu’ils codent, construisant ainsi une compréhension plus complète de la biosynthèsedes NP 6. Par exemple, les algorithmes d’exploration du génome peuvent identifier un groupe de gènes pouvant coder pour un nouvel antibiotique, tandis que les données transcriptomiques peuvent indiquer si ces gènes sont activement exprimés. De plus, le profilage métabolomique peut identifier la molécule antibiotique correspondante dans l’extrait de culturede l’organisme 7,8,9. Cette approche intégrée accélère considérablement la découverte de nouveaux composés et la compréhension de leurs voies biosynthétiques. Plus important encore, l’identification des cibles médicamenteuses repose de plus en plus sur des approches multi-omiques intégrées, qui supplantent progressivement les stratégies traditionnellesmono-omiques 10. Les avancées récentes en chimie analytique, notamment la chromatographie liquide à haute résolution (LC-MS) et la résonance magnétique nucléaire (RMN), permettent aux chercheurs de détecter et d’analyser structurellement de nouveaux NP à partir d’échantillons biologiquescomplexes 11,12. Ces techniques produisent d’énormes quantités de données, c’est là que la bioinformatique et l’apprentissage automatique (ML) deviennent essentiels. Les algorithmes d’intelligence artificielle (IA) et les analyses basées sur réseau sont de plus en plus utilisés pour analyser les données multi-omiques, révélant des schémas et prédictions significatifs qui seraient difficiles à discernermanuellement 13,14. En fusionnant les technologies omiques de pointe avec l’exploration de données pilotée par l’IA, les chercheurs peuvent désormais établir un pipeline robuste pour une découverte et une analyse plus rapides et systématiques des NP que jamais auparavant.

Bien que les stratégies multi-omiques aient considérablement fait progresser la découverte des NP, leur mise en œuvre réussie repose fortement sur une planification expérimentale méticuleuse. Par exemple, le type et la qualité des échantillons sont cruciaux ; Il est essentiel de collecter des cultures microbiennes bien conservées, des isolats environnementaux ou des matériaux cliniques dans des conditions qui minimisent la dégradation des acides nucléiques et desmétabolites 15. La profondeur du séquençage joue également un rôle essentiel dans la résolution des données : le séquençage du génome entier nécessite généralement une couverture d’au moins 30× pour un assemblage précis, tandis que le profilage transcriptomique nécessite souvent des dizaines de millions de lectures pour identifier des transcrits à faible abondance, comme le recommande Genohub16. De plus, pour la métabolomique, des solvants et méthodes d’extraction appropriés sont nécessaires pour capturer diverses classes chimiques ; Il faut consciemment choisir des protocoles d’extraction qui minimisent les biais et maximisent lareproductibilité 17. Cependant, ces méthodologies comportent leur lot de défis. L’intégration de grands ensembles de données hétérogènes peut être très exigeante en calcul, et l’instabilité ou la faible abondance des métabolites peuvent compliquer les analysesultérieures 18. De plus, les coûts élevés ou la taille limitée des échantillons peuvent limiter la conception des études19. La contamination et le biais dans les données de séquençage, en particulier dans les échantillons à faible entrée ou dilués, présentent également des risques importants, comme l’ont souligné Lusk et al. concernant la contamination dans le séquençageà haut débit 20. En reconnaissant ces limites pratiques et techniques, les chercheurs peuvent prendre des décisions éclairées sur les combinaisons multi-omiques appropriées et interpréter leurs résultats avec la prudence nécessaire.

Cette revue met en lumière les méthodes innovantes qui révolutionnent la découverte des NP grâce à l’utilisation de la multi-omique et de l’analytique intégrative. Il explore également l’importance croissante de l’apprentissage automatique et de l’IA dans la liaison de ces différents flux de données, y compris la construction de réseaux de corrélation gène-métabolite et l’identification de clusters géniques susceptibles de produire de nouveaux composés bioactifs. De plus, il examine l’importance et le potentiel futur de cette approche intégrée. En conclusion, la combinaison de différentes technologies omiques avec des analyses avancées n’accélère pas seulement la découverte de nouveaux NP aujourd’hui, mais ouvre aussi la voie au développement de médicaments de nouvelle génération dont la société a urgemment besoin.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Revue et perspective

Pour rédiger cette revue, nous avons effectué une recherche complète de la littérature sur plusieurs bases de données et plateformes d’indexation, notamment PubMed, Scopus, Web of Science, ScienceDirect et Google Scholar. La recherche a couvert des publications de janvier 2015 à juillet 2025. Les mots-clés et combinaisons booléennes comprenaient : « découverte de produits naturels », « omiques », « métabolomique », « génomique », « transcriptomique », « protéomique », « apprentissage automatique », « intelligence artificielle », « clusters de gènes biosynthétiques » et « intégration multi-omiques ». Les listes de références des articles clés et des revues récentes ont également été examinées pour identifier d’autres publications pertinentes. En plus des études évaluées par des pairs, un nombre limité d’articles de prépublication provenant de plateformes telles que bioRxiv et medRxiv ont été consultés lorsqu’ils ont fourni des informations opportunes et pertinentes, encore non disponibles dans la littérature publiée. Tous les préprints sont clairement étiquetés pour maintenir la transparence. Cette section passe en revue les derniers développements et perspectives d’avenir dans les domaines clés de la découverte des NP basés sur l’omique, en se concentrant spécifiquement sur la métabolomique, la génomique, la transcriptomique et la protéomique. Ainsi que leur intégration via l’IA/le ML. Les principaux outils et ressources discutés dans ces domaines sont compilés pour référence dans le Tableau 1.

1. La métabolomique dans la découverte des NP

  1. Plateformes analytiques pour la métabolomique
    La métabolomique est cruciale pour la découverte des NP car elle permet une analyse détaillée des petites molécules générées par divers organismes. Les principaux outils analytiques utilisés pour caractériser les métabolomes des NP incluent les techniques de MS haute résolution, telles que la LC-MS/MS et la chromatographie en phase gazeuse-MS (GC-MS), ainsi que la spectroscopieRMN 21,22. Les flux de travail LC-MS/MS non ciblés, comme le LC-MS ultra-haute performance associé à MS/MS, permettent d’identifier une large gamme de métabolites dans des mélanges complexes, tandis que GC-MS excelle dans le profilage des composés volatils. De plus, de nouvelles méthodes telles que la SEP par infusion directe en tandem et l’imagerie en SEP enrichissent la boîte à outils de métabolomique pour les NP23,24. Des techniques avancées de spectrométrie de masse, y compris la MS multimodale, qui combine les modes ioniques positifs et négatifs ou utilise la fragmentation MSn à plusieurs étapes, ainsi que les méthodes à traits d’union comme la LC-MS associées à la RMN, offrent des connaissances structurelles plus approfondies sur les métabolitesdétectés 25,26.
  2. Outils de traitement des données et de calcul
    Les outils logiciels spécialisés jouent un rôle crucial dans le traitement et l’interprétation des données métabolonomiques. Des programmes comme XCMS, MZmine et OpenMS sont couramment utilisés pour détecter et aligner les caractéristiques chromatographiques, ou pics, tandis que des étapes méticuleuses de prétraitement des données telles que l’alignement, la normalisation et le filtrage des pics sont essentielles pour obtenir des profils métaboliquesreproductibles 27. L’identification des composés est prise en charge par les bibliothèques spectrales MS/MS, dont NIST et mzCloud, ainsi que par des outils de fragmentation in silico comme SIRIUS et MetFrag28. La plateforme Global Natural Products Social (GNPS) est devenue une ressource clé pour le réseautage moléculaire, qui organise les spectres MS/MS apparentés afin de mettre l’accent sur les familles chimiques et de faciliter la déréplication des composésconnus 29. Par exemple, une analyse utilisant le GNPS sur des données de LC-MS/MS issues de cultures de Streptomyces a permis d’identifier avec succès des antibiotiques connus comme la spiramycine et l’actinomycine, ainsi que des analogues non rapportésauparavant 30,31. La technique de réseau moléculaire regroupait efficacement des spectres inconnus apparentés, et l’ajout du réseau à identité ionique améliorait la connectivité des caractéristiques. Ces analyses basées sur le réseau, combinées à des outils statistiques multivariés tels que l’analyse des composantes principales et l’analyse discriminante par moindres carrés partiels orthogonals, ainsi que l’analyse par réseau de corrélation, peuvent relier les schémas de production de métabolites à des conditions biologiques ou environnementales spécifiques. Dans une étude particulière, le réseau moléculaire GNPS d’extraits de fermentation d’un Streptomyces associé à une plante a démontré des profils métabolitiques distincts qui variaient selon le médiateur de croissance utilisé. Des métabolites connus, dont la spiramycine, l’actinomycine et un composé cancérigène appelé lyngbyatoxine, ont été détectés ; cependant, de nombreux nœuds réseau ne correspondaient à aucune entrée dans les bases de donnéesspectrales 32. Cette découverte suggère la présence de métabolites véritablement nouveaux, mettant en lumière comment la métabolomique non ciblée, conjointement avec le GNPS, peut identifier de nouveaux NP potentiellement pour une exploration plus approfondie.
    Combiner le criblage métabolomique avec des bioessais fonctionnels facilite la priorisation rapide des souches ou extraits qui produisent des composés bioactifs. De plus, des ressources communautaires émergentes comme l’Atlas des produits naturels (NPAtlas), ainsi que des pipelines intégrés d’analyse métabolome-génome, jouent un rôle clé pour associer les métabolites détectés à leurs BGC dans les organismessources 33,34. Cette stratégie intégrative permet aux chercheurs de corréler les signaux métabolitiques avec les données génomiques, améliorant ainsi l’efficacité de l’identification des NP et de la traçabilité de leurs origines.

2. Découverte de la génomique dans les NP

Au cours de la dernière décennie, la recherche sur les NP microbiens est entrée dans une « ère de minage profond » transformative, alimentée par des avancées telles que le séquençage à haut débit, la SEP ultra-sensible à haute résolution et les approches multi-omiquesintégrées 35. Ces outils ont fait évoluer les efforts de découverte d’une isolation fortuite vers une exploration ciblée et axée sur les données. Les pipelines d’extraction génomique, y compris antiSMASH 7.0 et DeepBGC, permettent désormais l’identification systématique des BGC cryptiques, en particulier dans des taxonssous-explorés 36,37.

  1. Séquençage à haut débit et assemblage hybride
    Les technologies de séquençage de l’ADN à haut débit, telles que le séquençage de l’ADN à lecture courte et à haut débit combiné à des plateformes de séquençage à lecture longue, ont profondément transformé l’étude génomique des organismes produisant des NP. En employant des stratégies d’assemblage hybrides intégrant à la fois des lectures longues et courtes, les chercheurs peuvent obtenir des assemblages génomes à haute contiguïté, essentiels pour capturer des BGC entiers dans ungénome 38. De plus, le séquençage métagénomique, qui inclut la récupération de génomes assemblés dans le métagénome, élargit la découverte des BGC aux microbes non cultivés, permettant aux scientifiques d’explorer l’ADN environnemental pour son potentielbiosynthétique 39. Dans les cas où les méthodes conventionnelles d’assemblage du génome échouent à résoudre de grands groupes de gènes ou répétitifs, des techniques basées sur des bibliothèques, telles que les bibliothèques de chromosomes artificiels cosmides ou bactériennes, peuvent être utilisées pour isoler et cloner des fragments génomiques importants. Cette approche facilite la caractérisation de clusters génétiques complets par séquençage ciblé ou expression hétérologue, enrichissant ainsi notre compréhension de la base génétique de la biosynthèsedes NP 40,41.
  2. Outils d’extraction du génome
    Des outils bioinformatiques spécialisés sont essentiels pour analyser les données génomiques afin d’identifier les signatures distinctes des voies secondaires des métabolites. Des programmes comme antiSMASH, PRISM et DeepBGC jouent un rôle crucial dans ce processus en détectant automatiquement les BGC candidats. Ils le font en reconnaissant des domaines biosynthétiques spécifiques, tels que ceux associés aux peptides synthétases non ribosomals, aux synthèses polycétides, aux voies peptidiques synthétisées et post-traductionnellement synthétisées (RiPP), ainsi qu’aux terpènes cyclases, entre autres. Pour faciliter la déréplication, des bases de données comme MIBiG, qui compile les BGC connus et leurs produits, et NPAtlas, qui catalogue les NP connus, aident les chercheurs à associer de nouvelles séquences ou composés à des exemplesétablis 37,42,43. Des algorithmes de regroupement, tels que BiG-SCAPE, ainsi que des outils comme CORASON, organisent les BGC apparentés en familles, offrant une vue en réseau de la diversité biosynthétique et facilitant l’identification de nouvelles familles de clusters par comparaison avec des famillesconnues 44. Des analyses bioinformatiques supplémentaires, incluant les recherches BLAST et les scans cachés du modèle de Markov, peuvent prédire les fonctions potentielles des enzymes codées dans un BGC, tandis que des approches génomiques comparatives, telles que l’analyse de synténie et la coévolution des gènes, aident à affiner ces prédictionsfonctionnelles 45. De plus, les données génomiques permettent l’annotation des éléments régulateurs liés à la biosynthèse des NP, y compris les promoteurs spécifiques aux voies et les régulateurstranscriptionnels 46. Ces connaissances fournissent une base pour l’ingénierie des voies ; par exemple, des techniques de biologie synthétique telles que le clonage de recombinaison associé à la transformation et le recombinaison Red/ET permettent aux chercheurs de capturer et d’exprimer des BGC silencieuses ou cryptiques dans un organisme hôte hétérologue, activant ainsi la production de leursmétabolites 47.
    Les efforts d’extraction du génome ont conduit avec succès à la découverte de nouveaux NP en se concentrant sur des signaux génétiques spécifiques. Par exemple, une recherche systématique de gènes liés à la résistance aux antibiotiques glycopeptidiques a révélé plusieurs BGC inhabituelles prédisant coder de nouveaux antibiotiques. Cette méthode a permis d’identifier deux nouveaux composés, la compstatine et la cobramycine, qui présentent tous deux des mécanismes d’action uniques en ciblant les autolysinesbactériennes 48. Dans le même esprit, l’exploration du microbiome humain pour la recherche de gènes biosynthétiques a permis de produire un candidat antibiotique lipopeptidique appelé « humicine », reconnu pour son efficacité potentielle contre Staphylococcus et les espèces 49 de Streptococcus. Dans ces cas, les composés ont été initialement identifiés par des méthodes informatiques, leurs structures chimiques étant prédites à partir de données génomiques. Par la suite, ces molécules prédites ont été synthétisées chimiquement et ont démontré les activités antibiotiques attendues, validant ainsi la stratégie de découverte basée sur le génome. À plus grande échelle, le séquençage à grande échelle de diverses bactéries, y compris de nombreux actinomycètes rares, met au jour une multitude de clusters génétiques « cryptiques » de BGC dont les produits restent inconnus. Par exemple, des recherches sur les génomes de Streptomyces ont révélé des milliers de BGCsnon caractérisés 50. Une approche émergente pour relier ces groupes d’orphelins à de véritables métabolites consiste à intégrer des analyses métabolomiques avec des enquêtes génomiques. En corrélant la présence ou l’expression d’un groupe de gènes à la détection de caractéristiques métabolitiques uniques via des plateformes telles que le GNPS ou les bases de données spectrales de masse, les chercheurs peuvent commencer à attribuer des produits chimiques provisoires aux nombreux nouveaux BGC, facilitant ainsi la découverte de NP véritablement nouveaux à partir de données génomiques.

3. La transcriptomique dans la découverte de produits naturels

Les analyses transcriptomiques offrent une perspective dynamique sur l’activité des BGC en mesurant l’expression de l’ARNm dans diverses conditions. Plus précisément, les expériences RNA-seq peuvent découvrir quels BGC sont activement transcrits et comment leurs niveaux d’expression fluctuent en réponse à des changements environnementaux ou expérimentaux. En comparant les niveaux de transcripts dans différentes conditions, l’analyse d’expression différentielle, utilisant des outils tels que DESeq2 ou edgeR, peut identifier les BGC qui sont soit régulés à la hausse, soit à la baisse, mettant ainsi en évidence des groupes de gènes qui peuvent être inductibles ou rester silencieux dans des conditions standard51. Bien que l’ARN-seq conventionnel réalisé sur des cellules cultivées en vrac soit l’approche typique pour étudier l’expression de la BGC, des techniques plus avancées comme le RNA-seq monocellulaire commencent à être utilisées dans des microbiomes complexes. Ce changement permet d’observer l’expression génique chez les organismes environnementaux difficiles àcultiver 52,53. Un flux de travail standard RNA-seq inclut généralement la correspondance des lectures vers un génome de référence à l’aide d’aligneurs tels que STAR ou HISAT2, la quantification de l’expression génique avec des outils comme featureCounts ou Kallisto, et la normalisation des données pour identifier des changements significatifs d’expression. Par la suite, l’analyse des réseaux de co-expression, souvent réalisée avec le package WGCNA, peut regrouper des gènes présentant des schémas d’expression similaires. Lorsque des données sur les métabolites sont également disponibles, ces réseaux peuvent être étendus pour incorporer des métabolites, reliant ainsi des composés spécifiques aux gènesco-exprimés 54.

Les données transcriptomiques se sont révélées précieuses pour identifier les voies biosynthétiques conditionnellement actives. Un exemple notable de cette approche se trouve dans une comparaison détaillée de quatre souchesde Salinispora 51. Dans cette étude, il a été révélé que plus de la moitié des BGC de chaque souche étaient exprimées dans une certaine mesure, de nombreux groupes inactifs dans une souche s’exprimant dans une autre. En analysant les profils d’expression génique de ces souches, les chercheurs ont pu identifier plusieurs facteurs régulateurs qui semblaient soit faire taire soit activer des clusters spécifiques. Cette méthode intégrative a conduit à l’identification d’une famille de NP jusque-là inconnue, connue sous le nom de salinipostines. Les données transcriptomiques indiquaient un groupe génétique cryptique comme source potentielle d’un composé non identifié ; Lorsque cet amas a été induit à s’exprimer (par des changements de régulation), cela a entraîné la production de molécules de salinipostine, qui ont ensuite été isolées et caractérisées structurellement. Cette étude illustre comment la transcriptomique peut faciliter la découverte des NP : en analysant l’expression différentielle des gènes, les chercheurs peuvent mettre en évidence les BGC candidates, et la corrélation entre l’expression génique et les profils métabolitiques fournit des preuves solides des relations gène-métabolite qui peuvent être validées par des expériences ciblées.

4. Protéomique dans la découverte des NP

  1. Approches de fusil à pompe et protéomique ciblée
    La protéomique, qui consiste à étudier à grande échelle les protéines, offre une perspective essentielle dans la recherche sur les NP en mesurant directement les enzymes et protéines qui jouent un rôle dans les voies biosynthétiques. En général, les approches protéomiques peuvent être catégorisées en deux grands types : la protéomique à fusil à pompe (non ciblée) et la protéomique ciblée. En protéomique shotgun, les protéines extraites d’échantillons microbiens ou végétaux subissent une digestion enzymatique, généralement avec de la trypsine, et les peptides obtenus sont analysés à l’aide de LC-MS/MS à haute résolution, souvent en utilisant des spectromètres de masse avancés tels que le quadrupôle de temps de vol (QTOF) ou le spectromètre de masse à piège orbitalhaute résolution 55. Les données de SEP collectées, appelées spectres MS/MS, sont ensuite comparées à des séquences peptidiques en effectuant des recherches dans une base de données protéique dérivée du génome de l’organisme ou d’une espèce étroitement apparentée, en utilisant des outils logiciels tels que MaxQuant ou Mascot56,57. Ce procédé permet de quantifier les variations d’abondance protéique sous différentes conditions, ce qui peut être obtenu soit par des méthodes sans marquage, soit par l’utilisation de techniques de marquage isotopique, telles que le marquage isotopique stable par acides aminés en culture cellulaire (SILAC) ou le marquage isobarique avec des réactifs TMT/iTRAQ, afin de déterminer quelles enzymes biosynthétiques sont régulées à la hausse ou à la baisse58, 59. En revanche, les méthodes de protéomique ciblée, y compris la surveillance de réactions sélectionnées (SRM) ou la surveillance parallèle des réactions (PRM), se concentrent sur un ensemble spécifique d’ions peptidiques, souvent des peptides uniques issus d’enzymes biosynthétiques clés ou de protéines régulatrices, permettant une quantification précise et sensible de ces peptides sur plusieurséchantillons 60,61.
  2. Approches innovantes en protéomique
    Un défi majeur dans l’analyse protéomique du métabolisme secondaire est la détection de grandes enzymes biosynthétiques, telles que les peptides synthétases non ribosomiques et les synthases polycétides, qui dépassent souvent 100 kDa et produisent peu de peptides détectables selon les protocoles digératifs standards, ce qui les rend difficiles à observer. Pour remédier à ce problème, Bumpus et al. ont développé une méthode appelée PrISM, qui améliore la détection des protéines NRPS et PKS en utilisant un cofacteur spécifique présent sur cesenzymes 62. PrISM intègre la protéomique conventionnelle de fusil à pompe avec un test d’éjection phosphopantetheinyl (Ppant). Notamment, les enzymes NRPS et PKS possèdent un bras Ppant covalentement attaché sur leurs domaines porteurs acyl ou porteurs peptidyl ; lors de la fragmentation de la MS/MS, ce groupe prothétique génère fréquemment un ion fragment unique, appelé ion « éjection de Ppant ». En filtrant informatiquement les données LC-MS/MS pour cet ion de diagnostic, la méthode PrISM peut mettre efficacement en évidence les peptides dérivés des enzymes NRPS et PKS au sein du mélange complexe de toutes les protéines cellulaires. Cette stratégie a permis de découvrir avec succès des voies biosynthétiques cachées grâce à la protéomique. Par exemple, le flux de travail PrISM a permis la détection de peptides issus du complexe gramicidine S synthétase (GrsA/GrsB) dans des cultures de Bacillus brevis, établissant un lien direct entre ces enzymes NRPS et la production de l’antibiotique gramicidine S chez cet organisme62. Il est important de noter que l’identification protéomique de GrsA/GrsB n’a pas nécessité une connaissance génomique préalable de B. brevis, ce qui montre que dans certains cas, l’analyse protéomique seule peut révéler des voies biosynthétiques NP actives même chez des organismes dont les génomes n’ont pas encore été séquencés.
  3. Protéomique informée par le génome
    Lorsqu’une séquence génomique est disponible, la puissance de la protéomique peut être considérablement renforcée en utilisant une base de données spécifique à chaque souche pour l’identification des peptides. Par exemple, dans une étude analysant le protéome de Streptomyces lilacinus, les chercheurs ont mené deux analyses : l’une en recherchant les spectres dans une base de données protéique générale et l’autre sur une base de données personnalisée dérivée du génome séquencé de cette souche63. L’analyse informée par le génome a permis d’identifier environ dix fois plus de peptides et de détecter des peptides liés à six CGB distincts au sein de l’organisme. Notamment, trois de ces groupes identifiés correspondaient à des métabolites « orphelins » déjà connus, dont la graybactine, la rakicidine D et un sidérophore spécifique, dont l’expression d’enzymes biosynthétiques a été confirmée. Les amas restants détectés semblaient nouveaux et non caractérisés. Cet exemple démontre que l’intégration des informations génomiques dans les flux de travail protéomiques peut confirmer quelles voies biosynthétiques sont activement exprimées dans une souche, priorisant ainsi ces clusters de gènes pour l’isolement et la caractérisation de leurs produits.
    De plus, les méthodes protéomiques peuvent éclairer les cibles moléculaires et les modes d’action des NP, un domaine souvent appelé protéomique chimique. Par exemple, le profilage protéique basé sur l’activité (ABPP) utilise de petites sondes moléculaires, généralement des dérivés ou analogues de NP, qui réagissent avec les cibles cellulaires du composé, marquant ces protéines pour enrichissement et identification via MS64. Cette technique permet de découvrir les cibles protéiques auxquelles une NP spécifique ou une molécule apparentée se lie à l’intérieur de la cellule. Une autre méthode, le profilage thermique du protéome (TPP), consiste à chauffer des échantillons de protéines en présence ou en l’absence d’un composé afin de déterminer quelles protéines présentent une stabilité thermique modifiée, indiquant une interactionde liaison 65. Ces approches protéomiques chimiques sont inestimables pour valider les cibles biologiques des NP et élucider leurs mécanismes d’action, complétant ainsi la découverte des NP eux-mêmes.

5. ML et IA pour l’intégration et la prédiction des omiques

  1. Intégration des données multi-omiques avec l’apprentissage automatique
    Une frontière passionnante dans la découverte des NP est l’application du ML et de l’IA pour intégrer les données omiques afin de prédire des fonctions. Dans le domaine de la génomique, des algorithmes d’apprentissage automatique supervisés, incluant les forêts aléatoires, les machines à vecteurs de support et les réseaux neuronaux profonds, ont été développés pour identifier des motifs dans les BGC associés à des types spécifiques de NP. Par exemple, ces modèles ML peuvent catégoriser les BGC en fonction de la classe générale de molécules qu’ils produisent ou même prévoir certaines caractéristiques de la structure chimique dérivées de la séquence génique. Une revue menée par Dason MS et ses collègues met en lumière divers outils de ML conçus pour décoder le « langage » des BGC, en utilisant des données d’ADN ou de séquences d’acides aminés pour déduire les structures et bioactivités des NP correspondants66. Ces modèles s’appuient généralement sur de vastes bases de données de clusters et composés de gènes connus pour apprendre les relations entre eux, permettant ainsi de prédire l’activité biologique potentielle de nouveaux composés. Par exemple, ils peuvent évaluer si un produit issu d’une CGB non caractérisée pourrait posséder des propriétés antibiotiques ou anticancéreuses. Les avancées significatives qui ont facilité ces capacités incluent l’utilisation de grands ensembles de données d’entraînement, tels que des milliers de structures NP connues et de clusters géniques, des techniques de représentation innovantes comme les plongements de séquences et les réseaux neuronaux graphiques capturant les caractéristiques des clusters de gènes et des structures chimiques, ainsi que des modèles multiparamétriques combinant divers descripteurs génomiques et chimiques pour améliorer la précision des prédictions.
    Dans le domaine de la métabolomique, les techniques d’IA améliorent considérablement l’interprétation des données spectrales de masse complexes. Un exemple notable est l’outil CSI :FingerID, qui utilise le ML pour prédire l’empreinte structurelle d’une molécule à partir de son spectre MS/MS. Cette capacité aide à identifier les métabolites inconnus en suggérant des sous-structures potentielles et des composés candidats67. De même, des modèles d’apprentissage profond ont été utilisés pour l’annotation spectrale ; les réseaux neuronaux convolutionnels et, plus récemment, les architectures basées sur des transformateurs, telles que le modèle « DreaMS », apprennent des motifs de fragmentation à partir de vastes bibliothèques spectrales. Ces modèles peuvent proposer des structures pour des spectres inconnus en fonction des schémas qu’ils ont appris, surpassant souvent les méthodes heuristiques traditionnelles, en particulier pour les métabolites qui ne présentent pas de correspondance exacte dans les bases de données existantes68. Au-delà de l’annotation structurelle, l’apprentissage automatique contribue également à la métabolomique en identifiant des motifs globaux. Par exemple, des algorithmes de visualisation non supervisée tels que t-SNE (plongement stochastique des voisins distribués t) et UMAP (Uniform Manifold Approximation and Projection) peuvent réduire la dimensionnalité des ensembles de données métabolomiques non ciblés, facilitant le regroupement des échantillons en fonction des similitudes dans leurs profils de métabolites. Parallèlement, des classificateurs supervisés peuvent relier des signatures métabolitiques spécifiques aux traits phénotypiques ou aux bioactivités des échantillons, enrichissant ainsi l’analyse69,70,71.
    L’apprentissage automatique est de plus en plus utilisé pour intégrer divers ensembles de données omiciques, créant une compréhension plus complète de la biosynthèse et de la fonction des NP. En fusionnant les données de la génomique, de la transcriptomique, de la protéomique et de la métabolomique, les modèles intégratifs peuvent révéler des liens qui peuvent être négligés lors de l’examen séparé de chaque type de données. Par exemple, les chercheurs peuvent construire des réseaux de corrélation gène-métabolite qui relient les niveaux d’expression des gènes ou des protéines aux niveaux de production des métabolites. Les modèles d’apprentissage automatique entraînés sur ces données intégrées peuvent alors prédire quels groupes de gènes sont probablement responsables de métabolites spécifiques ou d’activités biologiques72,73. Des techniques multivariées avancées, telles que l’analyse factorielle multi-omiques (disponible dans des outils comme MOFA) et les méthodes multivariées régularisées (présentes dans des logiciels comme mixOmics), facilitent l’identification de facteurs latents englobant différents types de données, comme un ensemble de gènes co-exprimés aux côtés d’un groupe de métabolites coexistants74,75,76. Concrètement, pour la découverte des NP, différentes approches aident à prioriser les groupes de gènes candidats en démontrant un lien avec les métabolites ou phénotypes observés. Un exemple notable de cette stratégie intégrative guidée par l’IA est la découverte d’une nouvelle famille de RiPPs synthétisés ribosomal et RiPP utilisant l’algorithme DecRiPPter. Cet algorithme utilise un modèle basé sur une machine à vecteurs de support (SVM) pour analyser les données génomiques de peptides précurseurs cryptiques de RiPP, puis croise ces prédictions avec une analyse pangénomique afin d’éliminer les composés connus. Lorsqu’on l’applique à 1 295 Streptomyces Génomes, DecRiPPter a identifié avec succès 42 familles RiPP potentiellement nouvelles qui avaient auparavant été manquées par les méthodes traditionnelles d’extraction du génome. Parmi ces amas prédits, l’un d’eux a été validé expérimentalement pour produire un nouveau lanthipeptide de classe V, que les chercheurs ont nommé « pristinine A3 ». En induisant l’expression de cet amas de gènes silencieux, le composé pristinine A3 a été isolé, et sa structure a été déterminée par RMN et SEP, révélant deux enzymes formant la lanthionine jusque-là inconnues codées dans la voie77. Cette réussite met en lumière comment des analyses pilotées par l’IA peuvent révéler des NP cachés : le modèle ML a détecté un signal génétique autrement non reconnu, guidant les efforts expérimentaux pour découvrir une nouvelle molécule.
  2. Applications émergentes de l’IA
    En plus des applications actuelles, plusieurs stratégies émergentes pilotées par l’IA devraient encore révolutionner la recherche sur les NP. Un domaine prometteur est la rétrosynthèse computationnelle et la conception de voies, où des modèles d’apprentissage profond sont développés pour suggérer des voies biosynthétiques ou des étapes de chimie synthétique pour les NP connus et leurs analogues, ce qui pourrait considérablement améliorer la conception et la production de nouveauxcomposés 78,79. Une autre frontière passionnante est la prédiction de la fonction enzymatique grâce à l’IA. En tirant parti des outils modernes de prédiction de la structure des protéines basés sur des algorithmes d’apprentissage profond, ainsi que des techniques d’apprentissage automatique comme l’apprentissage contrastif sur les séquences protéiques, les chercheurs commencent à déduire les activités probables d’enzymes non caractérisées présentes dans les BGC. Cela pourrait fournir des éclairages sur les types de transformations chimiques catalyséespar ces enzymes 80,81,82. Des pipelines entièrement intégrés entre l’omique-et la chimie sont en cours de développement, où les plateformes d’IA visent à connecter automatiquement les caractéristiques spectrales de masse aux donnéesgénomiques 83,84. En principe, un tel système pourrait analyser un ensemble de données LC-MS/MS à partir d’un échantillon complexe ainsi que des séquences génometiques du même environnement, lui permettant de prédire quel groupe de gènes est responsable de chaque métabolite non identifié en notant les correspondances entre groupes de gènes et métabolites. Bien que ces approches en soient encore à leurs débuts, elles suggèrent un avenir où l’IA pourrait relier de manière autonome les gènes aux molécules, accélérant considérablement le processus des données omiques à la découverte de nouveaux NP.
  3. Gouvernance des données et défis éthiques dans la découverte des NP assistés par l’IA
    La recherche moderne en multi-omiques produit une quantité significative de données diversifiées, mais l’efficacité des prédictions par IA dépend fortement de la qualité et de la cohérence de ces ensembles de données. Lorsque les ensembles d’entraînement sont mal annotés ou biaisés, ils peuvent entraîner des résultats trompeurs et des validationsinfructueuses 85. Pour résoudre ce problème, les chercheurs devraient mettre en œuvre les principes FAIR — Trouvable, Accessible, Interopérable et Réutilisable — afin de promouvoir la transparence des données, la reproductibilité et une réutilisabilitéétendue 86. Cette approche consiste à partager à la fois des résultats positifs et négatifs, à documenter minutieusement les pipelines de prétraitement des données et à fournir un code d’analyse pour faciliter une vérification indépendante. De plus, l’adoption d’infrastructures numériques émergentes, telles que les carnets de laboratoire électroniques (ELN) et les flux de travail conteneurisés, est essentielle pour améliorer la capture des données et garantir une curationstandardisée 87,88.
    Bien que l’IA accélère considérablement la découverte des NP, elle soulève également des préoccupations éthiques cruciales. Les algorithmes entraînés sur des ensembles de données incomplets ou biaisés peuvent renforcer les inégalités existantes, soulignant la nécessité de données d’entraînement diverses et représentatives89. De plus, l’utilisation de méthodes d’IA explicables est essentielle pour accroître la transparence et aider les scientifiques à comprendre les prédictions, garantissant que l’IA sert d’outil de soutien sous contrôle humain plutôt que dedécideur 85. Les considérations éthiques englobent également la confidentialité des données, en particulier lors de l’utilisation de jeux de données cliniques ou d’origine humaine, ainsi que les implications pour la main-d’œuvre alors que l’automatisation influence de plus en plus l’environnement de recherche90. Pour faire face à ces problèmes, les systèmes d’IA devraient être soumis à des audits réguliers, des évaluations de biais et une surveillance réglementaire stricte, ce qui aidera à maintenir l’équité, la responsabilité et la fiabilité dans le domaine de la recherche sur les NP.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Conclusions

L’état actuel de la découverte des NP s’appuie sur une combinaison de chimie analytique et de bioinformatique, créant une synergie puissante. Comme indiqué dans la Figure 1, les technologies omiques avancées telles que la métabolomique LC-MS, le séquençage à haut débit, l’ARN-Seq et la protéomique travaillent conjointement avec l’analytique computationnelle, incluant le réseau et le ML, pour former un pipeline efficace de déc...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Tous les auteurs affirment qu’il n’existe aucune relation financière ou personnelle pouvant être perçue comme un conflit d’intérêts potentiel.

Remerciements

Ce travail a été soutenu par la Fondation nationale des sciences naturelles de Chine (32500813), le programme de bourses postdoctorales de la CPSF (GZC20251503), le programme de sciences et technologies du Sichuan (2024ZYD0149), la Fondation spéciale de recherche pour le programme postdoctoral de la province du Sichuan (TB2024017), le projet clé de recherche et développement du Bureau des sciences et technologies de Deyang (2024SZY016, 2023SZZ009), ainsi que le Centre de renforcement des capacités et de formation continue de la Commission nationale de la santé (GWJJMB202510025060). et le Fonds spécial pour les projets d’incubation de l’Hôpital populaire de Deyang (FRH202501 FHT202501). Nous reconnaissons que la Figure 1 a été créée à l’aide de BioRender,

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Références

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Mots-clés

Analyses multi omiquesplateformes m tabolomiquesapproches g nomiquestechniques prot omiquesoutils bioinformatiquesr seautage mol culaireexploration du g nomeintelligence artificielle