Übersichtsartikel

Multi-Omics und integrative Analytik in der Entdeckung natürlicher Produkte

1.4K Ansichten

DOI:

10.3791/69458

28. November 2025

In diesem Artikel

Zusammenfassung

Diese Übersichtsarbeit legt den Schwerpunkt auf modernste Multi-Omics-Methoden, darunter Metabolomik, Genomik, Transkriptomik und Proteomik, die mit künstlicher Intelligenz und maschinellem Lernen sowie Netzwerkanalyse integriert sind, um die Entdeckung und funktionelle Validierung neuer Naturprodukte zu verbessern.

Zusammenfassung

Naturprodukte (NPs) sind seit langem eine unverzichtbare Quelle neuer bioaktiver Verbindungen für die Arzneimittelentwicklung; traditionelle Methoden zur Screening und Isolierung dieser Verbindungen können jedoch langsam sein und oft abnehmende Erträge bringen. Glücklicherweise bieten fortschrittliche Multi-Omics und rechnergestützte Ansätze leistungsstarke Lösungen für diese Herausforderungen. Diese Übersichtsarbeit hebt innovative Methoden hervor, die Metabolomik, Genomik, Transkriptomik und Proteomik mit Bioinformatik und analytischer Chemie verbinden, um die NP-Entdeckungen zu beschleunigen. So ermöglichen beispielsweise untargeted Metabolomics-Plattformen wie hochauflösende Flüssigchromatographie-Tandem-Massenspektrometrie (LC-MS/MS) und Global Natural Products Social (GNPS) Molekularnetzwerke eine umfassende Profilierung neuer Verbindungen, während gezielte Isotopen-Markierungsstrategien diesen Prozess verbessern. Darüber hinaus identifizieren Genom- und Metagenom-Mining-Tools wie Antibiotika und Sekundärmetabolitenanalyse-Shell (AntiSMASH), Deep Biosynthetic Gene Cluster (DeepBGC) und Pipeline for Reconstructing Integrated Syntheses of Metabolites (PRISM) schnell biosynthetische Gencluster (BGCs) sowohl in kultivierten als auch in unkultivierten Organismen, wobei häufig heterologe Expression zur Validierung von Produkten verwendet wird. Transkriptomische Analysen, einschließlich RNA-Sequenzierung (RNA-Seq), Co-Expressionsnetzwerke und Fluxomics, helfen zu klären, wie Signalwege reguliert werden, während quantitative Proteomik-Techniken wie Tandem-Massen-Tags/isobarische Tags für relative und absolute Quantifizierung (TMT/iTRAQ) und labelfreie Methoden sowie Chemoproteomik-Ansätze wie zelluläre Thermoverschiebungstests und thermisches Proteom-Profiling (TPP) molekulare Ziele und deren Wirkmechanismen aufdecken. Diese Übersichtsarbeit legt zudem großen Wert auf die Rolle von Künstlicher Intelligenz (KI) und maschinellem Lernen (ML) bei der Integration von Multi-Omics-Daten und reicht von Aktivitäten vom Aufbau von Gen-Metaboliten-Korrelationsnetzwerken bis hin zur Nutzung von Wissensgraphen und neuronalen Graphen für Datenfusion und funktionale Vorhersage. Abschließend schließt diese Übersicht mit der Diskussion der synergistischen Vorteile von Multi-Omics für die Entdeckung natürlicher Produkte, der Behandlung aktueller technischer Herausforderungen und der Erforschung zukünftiger Richtungen für eine hochdurchgängige, intelligente Datenintegration für die Forschung der nächsten Generation NPs.

Einleitung

Naturprodukte, die Moleküle sind, die von verschiedenen Organismen, darunter Mikroben und Pflanzen, produziert werden, dienen seit langem als wichtige Quelle für Medikamente, von Antibiotika wie Penicillin bis hin zu Krebsmedikamenten wie Taxol. Ein erheblicher Teil unserer aktuellen Antibiotika und Chemotherapiemittel stammt aus diesen natürlichen Verbindungen1. Die traditionellen Methoden zur Entdeckung neuer NPs, wie die Kultivierung von Mikroben und die Anwendung von bioassay-gesteuerter Isolation, sind jedoch zunehmend schwieriger geworden. Ende des 20. Jahrhunderts nahm das pharmazeutische Interesse an NPs ab, da Unternehmen mit abnehmenden Erträgen zu kämpfen hatten; Viele leicht auffindbare Verbindungen waren bereits wiederentdeckt worden, und die technischen Herausforderungen bei der Screening und Charakterisierung dieser Verbindungen machten den Prozess arbeitsintensiv. Glücklicherweise kehrt sich dieser Trend nun um. Jüngste Fortschritte in der Omics und analytischen Technologien beleben die Suche nach NPs 2,3 neu. Zum Beispiel ermöglicht die hochdurchsatzfähige DNA-Sequenzierung Forschern, Genome für versteckte biosynthetische Gencluster (BGCs) zu erforschen, während ultrasensitive Massenspektrometrie (MS) winzige Mengen neuartiger Metaboliten in komplexen Mischungen identifizieren kann. Diese technologischen Innovationen kommen zu einem entscheidenden Zeitpunkt, da weltweit dringend neue Therapeutika benötigt werden, insbesondere Antibiotika, die gegen medikamentenresistente Bakterien kämpfenkönnen. Die moderne Forschung in NPs begegnet dieser Herausforderung, indem sie traditionelle Expertise in NPs mit modernsten genomischen und chemischen Analysetechniken integriert.

Die Integration von Multi-Omics ist zentral für die aktuellen Fortschritte in der biologischen Forschung. Das Konzept der "Multi-Omics" beinhaltet die gleichzeitige Analyse verschiedener biologischer Datenschichten, wie der DNA (das Genom) eines Organismus, mRNA-Transkripte, Proteine und Metaboliten. Der Einsatz von Omics-Ansätzen hat die Forschung von NPs grundlegend verändert und ermöglicht Hochdurchsatz-Screening, schnelle Identifikation neuartiger Verbindungen und eine tiefere Erforschung der komplexen Netzwerke, diebiologische Systeme prägen. Durch die Integration dieser mehrschichtigen Datensätze können Forscher Gene direkt mit den von ihnen kodierten Metaboliten verknüpfen und so ein umfassenderes Verständnis der Biosynthese von NPsaufbauen. Beispielsweise können Genom-Mining-Algorithmen einen Gencluster identifizieren, der ein neues Antibiotikum codieren könnte, während transkriptomische Daten anzeigen können, ob diese Gene aktiv exprimiert sind. Zusätzlich kann metabolomisches Profiling das entsprechende Antibiotikummolekül im Kulturextrakt 7,8,9 des Organismus identifizieren. Dieser integrierte Ansatz beschleunigt die Entdeckung neuartiger Verbindungen und das Verständnis ihrer biosynthetischen Wege erheblich. Noch wichtiger ist, dass die Identifizierung von Medikamentenzielen zunehmend auf integrierte Multi-Omics-Ansätze setzt, die allmählich die traditionellen Single-Omics-Strategienablösen. Jüngste Fortschritte in der analytischen Chemie, darunter hochauflösende Flüssigkeitschromatographie (MS (LC-MS) und Kernmagnetresonanz (NMR), ermöglichen es Forschern, neue NPs aus komplexen biologischen Proben zu entdecken und strukturell zu analysieren11,12. Diese Techniken erzeugen riesige Datenmengen, weshalb Bioinformatik und maschinelles Lernen (ML) unerlässlich werden. Künstliche Intelligenz (KI)-Algorithmen und netzwerkbasierte Analysen werden zunehmend genutzt, um Multi-Omics-Daten zu analysieren und bedeutende Muster und Vorhersagen aufzudecken, die manuell schwer zu erkennen wären13,14. Durch die Verbindung modernster Omics-Technologien mit KI-gesteuertem Data Mining können Forscher nun eine robuste Pipeline für die schnellere und systematischere Entdeckung und Analyse von NPs aufbauen als je zuvor.

Während Multi-Omics-Strategien die Entdeckung von NPs erheblich vorangebracht haben, beruht ihre erfolgreiche Umsetzung stark auf sorgfältiger experimenteller Planung. Zum Beispiel sind Typ und Qualität der Proben entscheidend; Es ist unerlässlich, gut erhaltene mikrobielle Kulturen, Umweltisolate oder klinische Materialien unter Bedingungen zu sammeln, die den Abbau von Nukleinsäuren und Metaboliten minimieren15. Die Tiefe der Sequenzierung spielt ebenfalls eine entscheidende Rolle bei der Datenauflösung: Die Ganzgenomsequenzierung erfordert in der Regel eine Abdeckung von mindestens 30 × für eine genaue Assemblierung, während transkriptomisches Profilieren oft zig Millionen Lesungen erfordert, um Transkripte mit geringer Häufigkeit zu identifizieren, wie von Genohub16 empfohlen. Zusätzlich werden für die Metabolomik geeignete Extraktionslösungsmittel und Methoden benötigt, um verschiedene chemische Klassen zu erfassen; Man sollte bewusst Extraktionsprotokolle wählen, die Verzerrung minimieren und die Reproduzierbarkeitmaximieren 17. Diese Methoden bringen jedoch ihre eigenen Herausforderungen mit sich. Die Integration großer, heterogener Datensätze kann rechenintensiv sein, und die Instabilität oder geringe Häufigkeit von Metaboliten kann nachfolgende Analysen erschweren18. Darüber hinaus können die hohen Kosten oder begrenzte Stichprobengrößen das Design von Studien19 einschränken. Kontamination und Verzerrung in Sequenzierungsdaten, insbesondere bei Proben mit geringem Input oder verdünntem Input, bergen ebenfalls erhebliche Risiken, wie Lusk et al. im Zusammenhang mit Kontamination in der Hochdurchsatzsequenzierung20 hervorgehoben haben. Indem Forscher diese praktischen und technischen Einschränkungen erkennen, können sie fundierte Entscheidungen über geeignete Multi-Omics-Kombinationen treffen und deren Ergebnisse mit der nötigen Vorsicht interpretieren.

Diese Übersicht hebt die innovativen Methoden hervor, die die Entdeckung von NPs durch den Einsatz von Multi-Omics und integrativer Analytik revolutionieren. Es untersucht außerdem die wachsende Bedeutung von ML und KI bei der Verbindung dieser verschiedenen Datenströme, einschließlich des Aufbaus von Gen-Metaboliten-Korrelationsnetzwerken und der Identifikation von Genclustern, die wahrscheinlich neue bioaktive Verbindungen produzieren werden. Darüber hinaus untersucht er die Bedeutung und das zukünftige Potenzial dieses integrierten Ansatzes. Abschließend lässt sich sagen, dass die Kombination verschiedener Omics-Technologien mit fortschrittlicher Analytik nicht nur die Entdeckung neuer NPs heute beschleunigt, sondern auch den Weg für die Entwicklung von Medikamenten der nächsten Generation ebnet, die von der Gesellschaft dringend benötigt werden.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Überprüfung und Perspektive

Um diese Übersicht zusammenzustellen, führten wir eine umfassende Literaturrecherche in mehreren Datenbanken und Indexierungsplattformen durch, darunter PubMed, Scopus, Web of Science, ScienceDirect und Google Scholar. Die Suche umfasste Publikationen von Januar 2015 bis Juli 2025. Schlüsselwörter und boolesche Kombinationen waren: "Entdeckung natürlicher Produkte", "Omics", "Metabolomik", "Genomik", "Transkriptomik", "Proteomik", "maschinelles Lernen", "künstliche Intelligenz", "biosynthetische Gencluster" und "Multi-Omics-Integration". Auch Literaturverzeichnisse von Schlüsselartikeln und aktuellen Übersichtswerken wurden überprüft, um weitere relevante Publikationen zu identifizieren. Neben peer-reviewten Studien wurden auch eine begrenzte Anzahl von Preprint-Artikeln von Plattformen wie bioRxiv und medRxiv konsultiert, wenn sie zeitnahe und relevante Erkenntnisse lieferten, die in der veröffentlichten Literatur noch nicht verfügbar waren. Alle Preprints sind klar beschriftet, um Transparenz zu gewährleisten. Dieser Abschnitt beleuchtet die neuesten Entwicklungen und Zukunftsaussichten in den Schlüsselbereichen der Entdeckung von Omics-basierten NPs, mit besonderem Fokus auf Metabolomik, Genomik, Transkriptomik und Proteomik. Ebenso wie deren Integration durch KI/ML. Die wichtigsten Werkzeuge und Ressourcen, die in diesen Bereichen behandelt werden, sind in Tabelle 1 zur Referenz zusammengestellt.

1. Metabolomik in der Entdeckung von NPs

  1. Analytische Plattformen für Metabolomik
    Metabolomik ist entscheidend für die Entdeckung von NPs, da sie eine detaillierte Analyse der kleinen Moleküle ermöglicht, die von verschiedenen Organismen erzeugt werden. Die wichtigsten analytischen Werkzeuge zur Charakterisierung der Metabolome von NPs umfassen hochauflösende MS-Techniken wie LC-MS/MS und Gaschromatographie-MS (GC-MS) sowie NMR-Spektroskopie21,22. Nicht gezielte LC-MS/MS-Workflows, wie ultra-leistungsstarke LC-MS in Kombination mit MS/MS, ermöglichen die Identifikation einer Vielzahl von Metaboliten in komplexen Mischungen, während GC-MS in der Profilierung flüchtiger Verbindungen hervorragend ist. Zusätzlich erweitern neue Methoden wie direkte Infusions-Tandem-MS und MS-Bildgebung das Metabolomik-Toolkit für NPs23,24. Fortschrittliche massenspektrometrische Techniken, darunter multimodale MS, die positive und negative Ionenmodi kombiniert oder mehrstufige MSn-Fragmentierung verwendet, sowie bindestrichsbasierte Methoden wie LC-MS in Kombination mit NMR, bieten tiefere strukturelle Einblicke in die nachweisbarenMetaboliten.
  2. Datenverarbeitungs- und Rechenwerkzeuge
    Spezialisierte Softwaretools spielen eine entscheidende Rolle bei der Verarbeitung und Interpretation von Metabolomik-Daten. Programme wie XCMS, MZmine und OpenMS werden häufig verwendet, um chromatografische Merkmale oder Peaks zu erkennen und auszurichten, während sorgfältige Datenvorverarbeitungsschritte wie Peak-Ausrichtung, Normalisierung und Filterung unerlässlich sind, um reproduzierbare Stoffwechselprofilezu erreichen. Die Identifizierung von Verbindungen wird von MS/MS-Spektralbibliotheken, darunter NIST und mzCloud, sowie von In-silico-Fragmentierungstools wie SIRIUS und MetFrag28 unterstützt. Die Global Natural Products Social (GNPS)-Plattform hat sich als Schlüsselressource für molekulare Netzwerke etabliert, die verwandte MS/MS-Spektren organisiert, um chemische Familien zu betonen und die Dereplikation bekannter Verbindungenzu erleichtern 29. So identifizierte beispielsweise eine Analyse mit GNPS auf LC-MS/MS-Daten aus Streptomyces-Kulturen erfolgreich bekannte Antibiotika wie Spiramycin und Actinomycin sowie zuvor nicht gemeldete Analoga30,31. Die molekulare Netzwerktechnik gruppierte effektiv verwandte unbekannte Spektren, und die Hinzufügung von Ionenidentitätsnetzwerken verbesserte die Konnektivität der Merkmale. Diese netzwerkbasierten Analysen können, kombiniert mit multivariaten statistischen Werkzeugen wie der Hauptkomponentenanalyse und der orthogonalen partiellen kleinsten Quadrat-Diskriminantenanalyse sowie der Korrelationsnetzwerkanalyse, Muster der Metabolitenproduktion mit spezifischen biologischen oder Umweltbedingungen verknüpfen. In einer bestimmten Studie zeigte das molekulare Netzwerk von GNPS-Fermentationsextrakten aus einem pflanzenassoziierten Streptomyces unterschiedliche Metabolitprofile, die je nach verwendetem Wachstumsmediator variierten. Bekannte Metaboliten, darunter Spiramycin, Actinomycin und eine krebserregende Verbindung namens Lyngbyatoxin, wurden nachgewiesen; Viele Netzwerkknoten stimmten jedoch mit keinem Eintrag in Spektraldatenbanken32 überein. Dieser Befund deutet auf das Vorhandensein wirklich neuartiger Metaboliten hin und verdeutlicht, wie ungezielte Metabolomik in Verbindung mit GNPS potenziell neue NPs für weitere Erforschung identifizieren kann.
    Die Kombination von metabolomischem Screening mit funktionellen Bioassays erleichtert die schnelle Priorisierung von Stämmen oder Extrakten, die bioaktive Verbindungen erzeugen. Darüber hinaus sind aufstrebende Gemeinschaftsressourcen wie der Natural Products Atlas (NPAtlas) sowie integrierte Metabolom-Genom-Analyse-Pipelines maßgeblich daran beteiligt, nachgewiesene Metaboliten mit ihren BGCs in den Quellorganismen33,34 zu verknüpfen. Diese integrative Strategie ermöglicht es Forschern, Metabolitensignale mit genomischen Daten zu korrelieren, wodurch die Effizienz bei der Identifizierung von NPs und deren Ursprünge verbessert wird.

2. Genomik bei der Entdeckung von NPs

In den letzten zehn Jahren hat die Forschung mikrobieller NPs eine transformative "Deep-Mining-Ära" erreicht, die durch Fortschritte wie Hochdurchsatzsequenzierung, ultrasensitives, hochauflösendes MS und integrierte Multi-Omics-Ansätze35 angetrieben wird. Diese Werkzeuge haben die Entdeckungsbemühungen von glücklicher Isolation hin zu datengetrieben, gezielter Erkundung verlagert. Genom-Mining-Pipelines, darunter AntiSMASH 7.0 und DeepBGC, ermöglichen nun eine systematische Identifikation kryptischer BGCs, insbesondere in untererforschtenTaxa 36,37.

  1. Hochdurchsatzsequenzierung und hybride Montage
    Hochdurchsatz-DNA-Sequenzierungstechnologien, wie kurzlesende, hochdurchsatzfähige DNA-Sequenzierung in Kombination mit Langlese-Sequenzierungsplattformen, haben die genomische Studie von Organismen, die NPs produzieren, maßreich verändert. Durch den Einsatz hybrider Assemblierungsstrategien, die sowohl Long- als auch Short-Reads integrieren, können Forscher Genomassemblierungen mit hoher Zusammenhängung erreichen, die für die Erfassung ganzer BGCs innerhalb einesGenoms 38 unerlässlich sind. Darüber hinaus erweitert die metagenomische Sequenzierung, die die Rückgewinnung metagenom-zusammengesetzter Genome umfasst, die Entdeckung von BGCs auf unkultivierte Mikroben und ermöglicht es Wissenschaftlern, Umwelt-DNA für ihr biosynthetisches Potenzial zu erforschen39. In Fällen, in denen herkömmliche Genomassemblierungsmethoden bei der Auflösung großer oder repetitiver Gencluster nicht ausreichen, können bibliotheksbasierte Techniken wie Cosmid- oder bakterielle künstliche Chromosomenbibliotheken verwendet werden, um wesentliche genomische Fragmente zu isolieren und zu klonieren. Dieser Ansatz erleichtert die Charakterisierung vollständiger Gencluster durch gezielte Sequenzierung oder heterologe Expression und erweitert so unser Verständnis der genetischen Grundlage für NPs Biosynthese40,41.
  2. Werkzeuge des Genomabbaus
    Spezialisierte bioinformatische Werkzeuge sind unerlässlich, um genomische Daten zu analysieren, um die unterschiedlichen Signaturen sekundärer Metabolitwege zu identifizieren. Programme wie AntiSMASH, PRISM und DeepBGC spielen in diesem Prozess eine entscheidende Rolle, indem sie Kandidaten-BGCs automatisch erkennen. Sie tun dies, indem sie spezifische biosynthetische Domänen erkennen, wie solche, die mit nicht-ribosomalen Peptidsynthetasen, Polyketidsynthasen, ribosomal synthetisierten und posttranslational modifizierten Peptidwegen (RiPP) sowie Terpenzyklasen verbunden sind, unter anderem. Zur Unterstützung der Dereplikation helfen Datenbanken wie MIBiG, das bekannte BGCs und deren Produkte zusammenstellt, und NPAtlas, das bekannte NPs katalogisiert, Forschern, neue Sequenzen oder Verbindungen mit etablierten Beispielen 37,42,43 abzugleichen. Clustering-Algorithmen wie BiG-SCAPE sowie Tools wie CORASON organisieren verwandte BGCs in Familien, bieten eine Netzwerkansicht der biosynthetischen Diversität und erleichtern die Identifikation neuer Clusterfamilien durch Vergleiche mit bekannten44. Zusätzliche bioinformatische Analysen, darunter BLAST-Suchen und versteckte Markov-Modellscans, können die potenziellen Funktionen von in einem BGC codierten Enzymen vorhersagen, während vergleichende genomische Ansätze wie Synteny-Analyse und die Ko-Evolution von Genen dazu beitragen, diesefunktionellen Vorhersagen zu verfeinern. Darüber hinaus ermöglichen genomische Daten die Annotation regulatorischer Elemente, die mit der Biosynthese des NPs verknüpft sind, einschließlich wegspezifischer Promotoren und transkriptionaler Regulatoren46. Diese Erkenntnisse bilden die Grundlage für Pathway Engineering; zum Beispiel ermöglichen synthetische biologische Techniken wie transformationsassoziiertes Rekombinationsklonen und Red/ET-Rekombinierung Forschern, stille oder kryptische BGCs in einem heterologen Wirtsorganismus einzufangen und auszudrücken, wodurch die Produktion ihrer Metabolitenaktiviert wird.
    Genom-Mining-Bemühungen haben erfolgreich zur Entdeckung neuer NPs geführt, indem sie sich auf spezifische genetische Signale konzentrieren. So zeigte beispielsweise eine systematische Suche nach Genen, die mit Glykopeptid-Antibiotikaresistenz verbunden sind, mehrere ungewöhnliche BGCs, die voraussichtlich neue Antibiotika codieren. Diese Methode führte zur Identifikation von zwei neuartigen Verbindungen, Compstatin und Cobramycin, die beide einzigartige Wirkmechanismen zeigen, indem sie bakterielle Autolysineangreifen 48. In ähnlicher Weise ergab die Erforschung des menschlichen Mikrobiom auf biosynthetischen Geninhalt einen Lipopeptid-Antibiotikumkandidaten namens "Humicin", der für seine potenzielle Wirksamkeit gegen Staphylococcus und Streptococcus-Arten 49 bekannt ist. In diesen Fällen wurden die Verbindungen zunächst durch rechnergestützte Methoden identifiziert, wobei ihre chemischen Strukturen anhand genomischer Daten vorhergesagt wurden. Anschließend wurden diese vorhergesagten Moleküle chemisch synthetisiert und zeigten die erwarteten antibiotischen Aktivitäten, wodurch die genombasierte Entdeckungsstrategie validiert wurde. Im größeren Maßstab deckt groß angelegte Sequenzierung verschiedener Bakterien, darunter viele seltene Actinomyceten, eine Fülle von "kryptischen" BGCs-Genclustern auf, deren Produkte weiterhin unbekannt sind. Beispielsweise haben Untersuchungen an Streptomyces-Genomen Tausende uncharakterisierter BGCs50 enthüllt. Ein neuer Ansatz, diese Waisencluster mit tatsächlichen Metaboliten zu verknüpfen, besteht darin, metabolomische Analysen mit genomischen Erhebungen zu integrieren. Indem das Vorhandensein oder die Expression eines Genclusters mit der Erkennung einzigartiger Metabolitenmerkmale über Plattformen wie GNPS oder Massenspektraldatenbanken korreliert wird, können Forscher beginnen, den zahlreichen neuen BGCs vorläufige chemische Produkte zuzuordnen, was die Entdeckung wirklich neuartiger NPs aus genomischen Daten erleichtert.

3. Transkriptomik bei der Entdeckung natürlicher Produkte

Transkriptomische Analysen bieten eine dynamische Perspektive auf die Aktivität von BGCs, indem sie die mRNA-Expression unter verschiedenen Bedingungen messen. Konkret können RNA-seq-Experimente herausfinden, welche BGCs aktiv transkribiert werden und wie deren Expressionsniveaus als Reaktion auf Umwelt- oder experimentelle Veränderungen schwanken. Durch den Vergleich von Transkriptniveaus über verschiedene Bedingungen hinweg kann die differentielle Expressionsanalyse mit Werkzeugen wie DESeq2 oder edgeR BGCs identifizieren, die entweder hoch- oder herunterreguliert sind, und so Gencluster hervorheben, die unter den Standardbedingungen(51) induzierbar oder still bleiben können. Obwohl konventionelle RNA-Seq, die an bulkkultivierten Zellen durchgeführt wird, der übliche Ansatz zur Untersuchung der BGC-Expression ist, werden in komplexen Mikrobiomen zunehmend fortschrittlichere Techniken wie Einzelzell-RNA-Seq eingesetzt. Diese Verschiebung ermöglicht die Beobachtung der Genexpression in Umweltorganismen, die schwerzu kultivieren sind. Ein Standard-RNA-Seq-Workflow umfasst in der Regel das Mapping von Reads auf ein Referenzgenom mit Alignern wie STAR oder HISAT2, die Quantifizierung der Genexpression mit Tools wie featureCounts oder Kallisto sowie die Normalisierung der Daten zur Identifikation signifikanter Expressionsänderungen. Anschließend kann die Koexpressionsnetzwerkanalyse, die oft mit dem WGCNA-Paket durchgeführt wird, Gene mit ähnlichen Expressionsmustern clustern. Wenn auch Metabolitendaten verfügbar sind, können diese Netzwerke weiter erweitert werden, um Metaboliten einzubeziehen, wodurch spezifische Verbindungen mit ko-exprimierten Genen54 verknüpft werden.

Transkriptomische Daten haben sich als wertvoll erwiesen, um bedingt aktive biosynthetische Signalwege zu identifizieren. Ein bemerkenswertes Beispiel für diesen Ansatz findet sich in einem detaillierten Vergleich von vier Salinispora-Stämmen51. In dieser Studie wurde gezeigt, dass mehr als die Hälfte der BGCs in jedem Stamm in gewissem Maße exprimiert wurde, wobei viele Cluster, die in einem Stamm inaktiv waren, in einem anderen eine Expression zeigten. Durch die Analyse von Genexpressionsprofilen über diese Stämme hinweg konnten die Forscher mehrere regulatorische Faktoren identifizieren, die entweder bestimmte Cluster zum Schweigen bringen oder aktivieren schienen. Diese integrative Methode führte zur Identifikation einer bisher unbekannten Familie von NPs, bekannt als Salinipostine. Transkriptomische Daten deuteten auf einen kryptischen Gencluster als potenzielle Quelle für eine unbekannte Verbindung hin; wenn dieser Cluster durch regulatorische Veränderungen zur Expression gebracht wurde, führte dies zur Produktion von Salinipostin-Molekülen, die anschließend isoliert und strukturell charakterisiert wurden. Diese Studie zeigt, wie Transkriptomik die Entdeckung von NPs erleichtern kann: Durch die Analyse der differenzierten Genexpression können Forscher Kandidaten-BGCs hervorheben, und die Korrelation zwischen Genexpression und Metabolitenprofilen liefert unterstützende Belege für Gen-Metabolit-Beziehungen, die durch gezielte Experimente validiert werden können.

4. Proteomik bei der Entdeckung von NPs

  1. Schrotflinten- und gezielte Proteomik-Ansätze
    Die Proteomik, die die großflächige Untersuchung von Proteinen umfasst, bietet eine wichtige Perspektive in der Forschung von NPs, indem sie direkt die Enzyme und Proteine misst, die eine Rolle in biosynthetischen Signalwegen spielen. Im Allgemeinen lassen sich proteomische Ansätze in zwei Haupttypen einteilen: Schrotflinten-(ungezielte) Proteomik und gezielte Proteomik. In der Shotgun-Proteomik werden Proteine, die aus mikrobiellen oder pflanzlichen Proben extrahiert werden, enzymatisch verdaut, typischerweise mit Trypsin, und die resultierenden Peptide werden mit hochauflösenden LC-MS/MS analysiert, oft mit fortschrittlichen Massenspektrometern wie Quadrupol-Zeit-of-Flug (QTOF) oder hochauflösenden Orbitalfall-Massenspektrometern55. Die gesammelten MS-Daten, bekannt als MS/MS-Spektren, werden anschließend mit Peptidsequenzen abgeglich, indem sie mit einer Proteindatenbank aus dem Genom des Organismus oder einer eng verwandten Spezies recherchiert werden, wobei Software-Tools wie MaxQuant oder Mascot56,57 verwendet werden. Dieser Prozess ermöglicht die Quantifizierung von Veränderungen der Proteinhäufigkeit unter verschiedenen Bedingungen, was entweder durch etikettfreie Methoden oder durch den Einsatz von Isotopen-Markierungstechniken wie stabiler Isotopenkennzeichnung durch Aminosäuren in Zellkultur (SILAC) oder isobarische Markierung mit TMT/iTRAQ-Reagenzien erreicht werden kann, um zu bestimmen, welche biosynthetischen Enzyme hoch- oder herunterreguliert sind58, 59. Im Gegensatz dazu konzentrieren sich gezielte Proteomik-Methoden, einschließlich ausgewählter Reaktionsüberwachung (SRM) oder paralleler Reaktionsüberwachung (PRM), auf eine spezifische Gruppe von Peptidionen, oft einzigartige Peptide aus wichtigen biosynthetischen Enzymen oder regulatorischen Proteinen, was eine präzise und sensible Quantifizierung dieser Peptide übermehrere Proben hinweg ermöglicht.
  2. Innovative Ansätze in der Proteomik
    Eine bedeutende Herausforderung bei der proteomischen Analyse des sekundären Stoffwechsels ist der Nachweis großer biosynthetischer Enzyme, wie nicht-ribosomale Peptidsynthetasen und Polyketidsynthasen, die oft über 100 kDa Größe haben und mit Standardverdauungsprotokollen nur wenige nachweisbare Peptide liefern, was sie schwer beobachtbar macht. Um dieses Problem anzugehen, entwickelten Bumpus et al. eine Methode namens PrISM, die den Nachweis von NRPS- und PKS-Proteinen verbessert, indem ein spezifischer Cofaktor auf diesenEnzymen 62 verwendet wird. PrISM integriert konventionelle Schrotflinten-Proteomik mit einem Phosphopantetheinyl (Ppant) Auswurfassay. Bemerkenswert ist, dass NRPS- und PKS-Enzyme einen kovalent gebundenen Ppant-Arm an ihren Acylträger- oder Peptidylträgerdomänen besitzen; während der MS/MS-Fragmentierung erzeugt diese Prothesengruppe häufig ein einzigartiges Fragmention, das als "Ppant-Auswurf"-Ion bezeichnet wird. Durch die rechnergestützte Filterung der LC-MS/MS-Daten auf dieses diagnostische Ion kann die PrISM-Methode effektiv Peptide hervorheben, die aus NRPS- und PKS-Enzymen gewonnen wurden, inmitten der komplexen Mischung aller zellulären Proteine. Diese Strategie hat erfolgreich verborgene biosynthetische Wege durch Proteomik aufgedeckt. So ermöglichte der PrISM-Workflow beispielsweise den Nachweis von Peptiden aus dem Gramicidin-S-Synthetase-Komplex (GrsA/GrsB) in Kulturen von Bacillus brevis, wodurch eine direkte Verbindung zwischen diesen NRPS-Enzymen und der Produktion des Antibiotikums Gramicidin S in diesem Organismus62 hergestellt wurde. Wichtig ist, dass die proteomische Identifikation von GrsA/GrsB kein vorheriges genomisches Wissen über B. brevis erforderte, was zeigt, dass in bestimmten Fällen allein proteomische Analysen aktive NP-Biosynthetikwege selbst in Organismen aufdecken können, deren Genome noch nicht sequenziert wurden.
  3. Genombasierte Proteomik
    Wenn eine Genomsequenz verfügbar ist, kann die Potenz der Proteomik durch die Nutzung einer stammspezifischen Datenbank zur Peptididentifikation erheblich verbessert werden. So führten Forscher beispielsweise in einer Studie, die das Proteom von Streptomyces lilacinus analysierte, zwei Analysen durch: eine durch Durchsuchung von Spektren mit einer allgemeinen Proteindatenbank und eine weitere mit einer benutzerdefinierten Datenbank, die aus dem sequenzierten Genom dieses Stammes63 abgeleitet wurde. Die genombasierte Analyse ergab etwa zehnmal mehr identifizierte Peptide und entdeckte Peptide, die mit sechs verschiedenen BGCs im Organismus verknüpft sind. Bemerkenswert ist, dass drei dieser identifizierten Cluster zuvor bekannten "Waisen"-Metaboliten entsprachen, darunter Graybactin, Rakicidin D und ein spezifischer Siderophor, deren biosynthetische Enzyme als exprimiert bestätigt wurden. Die übrigen detektierten Cluster schienen neu und uncharakterisiert zu sein. Dieses Beispiel zeigt, dass die Integration genomischer Informationen in proteomische Workflows bestätigen kann, welche biosynthetischen Signalwege in einem Stamm aktiv exprimiert werden, wodurch diese Gencluster für die Isolierung und Charakterisierung ihrer Produkte priorisiert werden.
    Darüber hinaus können proteomische Methoden die molekularen Ziele und Wirkungsweisen von NPs beleuchten, ein Bereich, der oft als chemische Proteomik bezeichnet wird. Beispielsweise verwendet das aktivitätsbasierte Proteinprofiling (ABPP) kleine Molekülsonden, typischerweise Derivate oder Analoga von NPs, die mit den zellulären Zielen der Verbindung reagieren und diese Proteine für die Anreicherung und Identifikation durch MS64 markieren. Diese Technik kann die Proteinziele aufdecken, an die ein bestimmtes NP oder verwandtes Molekül innerhalb der Zelle bindet. Eine weitere Methode, das thermische Proteomprofiling (TPP), beinhaltet das Erhitzen von Proteinproben in Anwesenheit oder Abwesenheit einer Verbindung, um zu bestimmen, welche Proteine eine veränderte thermische Stabilität zeigen, was auf eine Bindungsinteraktion65 hinweist. Diese chemischen, proteomischen Ansätze sind von unschätzbarem Wert, um die biologischen Ziele von NPs zu validieren und ihre Wirkmechanismen aufzuklären, wodurch sie die Entdeckung der NPs selbst ergänzen.

5. ML und KI für die Integration und Vorhersage von Omics

  1. Integration von Multi-Omics-Daten mit ML
    Eine spannende Grenze bei der Entdeckung von NPs ist die Anwendung von ML und KI zur Integration von Omics-Daten für funktionale Vorhersagen. Im Bereich der Genomik wurden überwachte ML-Algorithmen entwickelt, darunter Zufallswälder, Support-Vector-Maschinen und tiefe neuronale Netzwerke, um Muster in BGCs zu identifizieren, die mit bestimmten NP-Typen assoziiert sind. Diese ML-Modelle können beispielsweise BGCs basierend auf der allgemeinen Molekülklasse, die sie produzieren, kategorisieren oder sogar bestimmte Eigenschaften der chemischen Struktur vorhersagen, die aus der Gensequenz abgeleitet sind. Eine Übersicht von Dason MS und Kollegen hebt verschiedene ML-Tools hervor, die dazu entwickelt wurden, die "Sprache" von BGCs zu entschlüsseln und dabei DNA- oder Aminosäuresequenzdaten zu nutzen, um die Strukturen und Bioaktivitäten der entsprechenden NPs zu deduktieren.66. Diese Modelle basieren typischerweise auf umfangreichen Datenbanken bekannter Gencluster und Verbindungen, um die Beziehungen zwischen ihnen zu erforschen und so Vorhersagen über die potenzielle biologische Aktivität neuer Verbindungen zu ermöglichen. Beispielsweise können sie beurteilen, ob ein Produkt aus einem nicht charakterisierten BGC antibiotische oder krebshemmende Eigenschaften besitzen könnte. Bedeutende Fortschritte, die diese Fähigkeiten ermöglicht haben, umfassen die Nutzung großer Trainingsdatensätze, wie Tausende bekannter NP-Strukturen und Gencluster, innovative Repräsentationstechniken wie Sequenzeinbettungen und graphische neuronale Netzwerke, die die Merkmale von Genclustern und chemischen Strukturen erfassen, sowie multiparametrische Modelle, die verschiedene genomische und chemische Deskriptoren kombinieren, um die Vorhersagegenauigkeit zu erhöhen.
    Im Bereich der Metabolomik verbessern KI-Techniken die Interpretation komplexer massenspektraler Daten erheblich. Ein bemerkenswertes Beispiel ist das Werkzeug CSI:FingerID, das ML nutzt, um den strukturellen Fingerabdruck eines Moleküls anhand seines MS/MS-Spektrums vorherzusagen. Diese Fähigkeit hilft, unbekannte Metaboliten zu identifizieren, indem sie potenzielle Substrukturen und Kandidatenverbindungen vorschlägt.67. Ähnlich wurden Deep-Learning-Modelle für spektrale Annotation verwendet; Faltungsneuronale Netze und neuerdings transformatorbasierte Architekturen wie das "DreaMS"-Modell lernen Fragmentierungsmuster aus umfangreichen spektralen Bibliotheken. Diese Modelle können Strukturen für unbekannte Spektren basierend auf den gelernten Mustern vorschlagen und oft traditionelle heuristische Methoden übertreffen, insbesondere für Metaboliten, die in bestehenden Datenbanken keine exakten Übereinstimmungen haben68. Über die strukturelle Annotation hinaus trägt ML auch zur Metabolomik bei, indem es globale Muster identifiziert. Beispielsweise können unüberwachte Visualisierungsalgorithmen wie t-SNE (t-verteilte stochastische Nachbar-Einbettung) und UMAP (Uniform Manifold Approximation and Projection) die Dimensionalität untargetierter Metabolomik-Datensätze reduzieren und so das Clustern von Proben basierend auf Ähnlichkeiten in ihren Metabolitprofilen erleichtern. Gleichzeitig können überwachte Klassifikatoren spezifische Metabolit-Signaturen mit den phänotypischen Merkmalen oder Bioaktivitäten der Proben verknüpfen und so die Analyse weiter bereichern69,70,71.
    ML wird zunehmend genutzt, um verschiedene Omics-Datensätze zu integrieren, wodurch ein umfassenderes Verständnis der Biosynthese und Funktion von NPs entsteht. Durch die Zusammenführung von Daten aus der Genomik, Transkriptomik, Proteomik und Metabolomik können integrative Modelle Verbindungen aufdecken, die bei der separaten Untersuchung der einzelnen Datentypen übersehen werden können. So können Forscher beispielsweise Gen-Metaboliten-Korrelationsnetzwerke aufbauen, die die Expressionsniveaus von Genen oder Proteinen mit den Produktionsniveaus von Metaboliten verknüpfen. ML-Modelle, die auf diesen integrierten Daten trainiert sind, können dann vorhersagen, welche Gencluster wahrscheinlich für bestimmte Metaboliten oder biologische Aktivitäten verantwortlich sind.72,73. Fortschrittliche multivariate Techniken wie Multi-Omics-Faktorenanalyse (verfügbar in Tools wie MOFA) und regularisierte multivariate Methoden (gefunden in Paketen wie mixOmics) erleichtern die Identifikation latenter Faktoren, die verschiedene Datentypen umfassen, wie etwa eine Menge ko-exprimierter Gene neben einer Gruppe ko-vorkommender Metaboliten74,75,76. Praktisch gesehen helfen für die Entdeckung von NPs verschiedene Ansätze, Kandidatengencluster zu priorisieren, indem sie eine Verbindung zu beobachteten Metaboliten oder Phänotypen nachweisen. Ein bemerkenswertes Beispiel für diese integrative, KI-gesteuerte Strategie ist die Entdeckung einer neuen Familie von ribosomal synthetisierten und RiPPs mit dem DecRiPPter-Algorithmus. Dieser Algorithmus verwendet ein auf Basis von Support Vector Machine (SVM)-basiertem Modell, um genomische Daten für kryptische RiPP-Vorläuferpeptide zu analysieren und diese Vorhersagen dann mit der Pan-Genom-Analyse abzugleichen, um bekannte Verbindungen auszuschließen. Bei Anwendung auf 1.295 Streptomyces DecRiPPter identifizierte erfolgreich 42 mutmaßliche neuartige RiPP-Familien, die zuvor bei traditionellen Genom-Mining-Methoden übersehen wurden. Unter diesen vorhergesagten Clustern wurde einer experimentell validiert, um ein neues Klasse-V-Lanthipeptid zu erzeugen, das die Forscher "Pristinin A3" nannten. Durch die Induzierung der Expression dieses stillen Genclusters wurde die Verbindung Pristinin A3 isoliert und ihre Struktur mittels NMR und MS bestimmt, wodurch zwei bisher unbekannte lanthioninbildende Enzyme entdeckt wurden, die im Weg codiert sind77. Dieser Erfolg zeigt, wie KI-gesteuerte Analysen versteckte NPs aufdecken können: Das ML-Modell entdeckte ein sonst unerkanntes genetisches Signal und leitete so die experimentellen Bemühungen, ein neuartiges Molekül zu entdecken.
  2. Aufkommende KI-Anwendungen
    Neben den aktuellen Anwendungen sollen mehrere aufkommende KI-gesteuerte Strategien die Forschung von NPs weiter revolutionieren. Ein vielversprechendes Gebiet ist die rechnergestützte Retrosynthese und das Design von Signalwegen, in dem Deep-Learning-Modelle entwickelt werden, um biosynthetische Routen oder synthetische chemische Schritte für bekannte NPs und deren Analoga vorzuschlagen, was das Design und die Produktion neuartiger Verbindungen erheblich verbessern könnte78,79. Eine weitere spannende Grenze ist die Vorhersage der Enzymfunktion mithilfe von KI. Durch den Einsatz moderner Werkzeuge zur Vorhersage von Proteinstrukturen, die auf Deep-Learning-Algorithmen basieren, sowie ML-Techniken wie kontrastives Lernen auf Proteinsequenzen, beginnen Forscher, die wahrscheinlichen Aktivitäten uncharakterisierter Enzyme in BGCs abzuleiten. Dies könnte Einblicke in die Arten chemischer Umwandlungen liefern, die diese Enzyme katalysieren. Vollständig integrierte Omics-zu-Chemie-Pipelines werden entwickelt, wobei KI-Plattformen darauf abzielen, massenspektrale Merkmale automatisch mit genomischen Daten83,84 zu verbinden. Prinzipiell könnte ein solches System einen LC-MS/MS-Datensatz aus einer komplexen Probe zusammen mit Genomsequenzen aus derselben Umgebung analysieren, wodurch es vorhersagen kann, welcher Gencluster für jeden nicht identifizierten Metaboliten verantwortlich ist, indem es Gen-Cluster-Metaboliten-Übereinstimmungen bewertet. Obwohl diese Ansätze noch in den Kinderschuhen stecken, deuten sie auf eine Zukunft hin, in der KI autonom Gene mit Molekülen verknüpfen und so den Prozess von Omics-Daten bis zur Entdeckung neuer NPs erheblich beschleunigen könnte.
  3. Datenverwaltung und ethische Herausforderungen bei der Entdeckung von KI-unterstützten NPs
    Moderne Multi-Omics-Forschung liefert eine beträchtliche Menge an vielfältigen Daten, aber die Wirksamkeit von KI-Vorhersagen hängt stark von der Qualität und Konsistenz dieser Datensätze ab. Wenn Trainingssets schlecht annotiert oder verzerrt sind, können sie zu irreführenden Ergebnissen und erfolglosenValidierungen führen. Um dieses Problem anzugehen, sollten Forscher die FAIR-Prinzipien – Findbar, Accessible, Interoperable und Reusable – umsetzen, um Datentransparenz, Reproduzierbarkeit und umfangreiche Wiederverwendbarkeit86 zu fördern. Dieser Ansatz beinhaltet das Teilen sowohl positiver als auch negativer Ergebnisse, die gründliche Dokumentation von Datenvorverarbeitungs-Pipelines und die Bereitstellung von Analysecode zur unabhängigen Verifikation. Darüber hinaus ist die Einführung neuer digitaler Infrastrukturen wie elektronischer Labornotizbücher (ELNs) und containerisierter Arbeitsabläufe unerlässlich, um die Datenerfassung zu verbessern und eine standardisierte Kuratierung87,88 sicherzustellen.
    Während KI die Entdeckung von NPs erheblich beschleunigt, wirft sie auch wichtige ethische Fragen auf. Algorithmen, die auf unvollständigen oder verzerrten Datensätzen trainiert sind, können bestehende Ungleichheiten verstärken und die Notwendigkeit vielfältiger und repräsentativerTrainingsdaten unterstreichen. Darüber hinaus ist der Einsatz erklärbarer KI-Methoden entscheidend, um die Transparenz zu erhöhen und Wissenschaftlern beim Verständnis von Vorhersagen zu helfen, sodass KI als unterstützendes Werkzeug unter menschlicher Kontrolle dient und nicht als Entscheidungsträger85. Ethische Überlegungen umfassen auch den Datenschutz, insbesondere bei der Nutzung klinischer oder menschlich entwickelter Datensätze, sowie die Auswirkungen auf die Belegschaft, da Automatisierung dasForschungsumfeld zunehmend beeinflusst. Um diese Probleme anzugehen, sollten KI-Systeme regelmäßigen Audits, Verzerrungsbewertungen und strenger regulatorischer Aufsicht unterzogen werden, was dazu beiträgt, Fairness, Verantwortlichkeit und Vertrauenswürdigkeit im Bereich der NP-Forschung zu gewährleisten.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Schlussfolgerungen

Der aktuelle Stand der Entdeckung von NPs nutzt eine Kombination aus analytischer Chemie und Bioinformatik und schafft so eine starke Synergie. Wie in Abbildung 1 dargestellt, arbeiten fortschrittliche Omics-Technologien wie LC-MS-Metabolomik, Hochdurchsatzsequenzierung, RNA-Seq und Proteomik zusammen mit computergestützter Analyse, einschließlich Netzwerken und ML, um eine effektive Pipeline für Entdeckungen zu bilden. Jüngs...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Alle Autoren erklären, dass es keine finanziellen oder persönlichen Beziehungen gibt, die als potenzielle Interessenkonflikte wahrgenommen werden könnten.

Danksagungen

Diese Arbeit wurde unterstützt von der National Natural Science Foundation of China (32500813), dem Postdoktorandenstipendium der CPSF (GZC20251503), dem Sichuan Science and Technology Program (2024ZYD0149), der Sonderforschungsstiftung für das Postdoktorandenprogramm der Provinz Sichuan (TB2024017), dem Key Research and Development Project des Deyang Science and Technology Bureau (2024SZY016, 2023SZZ009), dem Kapazitätsaufbau und Weiterbildungszentrum der National Health Commission (GWJJMB202510025060), und Sonderfonds für Inkubationsprojekte des Deyang People's Hospital (FRH202501, FHT202501). Wir erkennen an, dass Abbildung 1 mit BioRender erstellt wurde,

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Referenzen

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Genehmigung beantragen, um den Text oder die Abbildungen dieses JoVE-Artikels zu verwenden

Genehmigung beantragen

Schlagwörter

Multi Omics AnalytikMetabolomics PlattformenGenomics Ans tzeProteomics TechnikenBioinformatik ToolsMolekulares NetworkingGenome MiningK nstliche Intelligenz

Verwandte Artikel