Artykuł przeglądowy

Multi-omika i integratywna analityka w odkrywaniu produktów naturalnych

1.4K wyświetleń

DOI:

10.3791/69458

28 listopada 2025

W tym artykule

Podsumowanie

Niniejszy przegląd kładzie nacisk na najnowocześniejsze metodologie multiomiki, w tym metabolomikę, genomikę, transkryptomikę i proteomikę, które są zintegrowane ze sztuczną inteligencją i uczeniem maszynowym oraz analizą sieci, aby usprawnić odkrywanie i funkcjonalną walidację nowych produktów naturalnych.

Streszczenie

Produkty naturalne (NP) od dawna stanowią niezbędne źródło nowych bioaktywnych związków do odkrywania leków; jednak tradycyjne metody przesiewania i izolowania tych związków mogą być powolne i często przynosić malejące korzyści. Na szczęście zaawansowane podejścia multi-omics i obliczeniowe stanowią potężne rozwiązania tych wyzwań. Niniejszy przegląd podkreśla innowacyjne metodologie integrujące metabolomikę, genomikę, transkryptomikę i proteomikę z bioinformatyką i chemią analityczną, aby przyspieszyć odkrywanie NP. Na przykład nieukierunkowane platformy metabolomiki, takie jak wysokorozdzielcza chromatografia cieczowa z tandemową spektrometrią mas (LC-MS/MS) oraz sieci molekularne Global Natural Products Social (GNPS), umożliwiają kompleksowe profilowanie nowych związków, podczas gdy strategie ukierunkowanego oznaczania izotopów wspierają ten proces. Dodatkowo, narzędzia do eksploracji genomu i metagenomu, takie jak antybiotyki i analiza wtórnych metabolitów (antySMASH), Deep Biosynthetic Gene Cluster (DeepBGC) oraz Pipeline for Reconstructing Integrated Syntheses of Metabolites (PRISM), szybko identyfikują biosyntetyczne klastry genowe (BGC) zarówno w organizmach hodowanych, jak i niehodowanych, często wykorzystując heterologiczną ekspresję do weryfikacji produktów. Analizy transkryptomiczne, w tym sekwencjonowanie RNA (RNA-seq), sieci współekspresji oraz fluxomika, pomagają wyjaśnić, jak szlaki są regulowane, podczas gdy techniki ilościowej proteomiki, takie jak tagi masowe tandemowe i izobaryczne do ilościowania względnego i absolutnego (TMT/iTRAQ) oraz metody bez oznakowania, wraz z podejściami chemoproteomicznymi, takimi jak test termiczny przesunięcia komórkowego i profilowanie termicznego proteomu (TPP), odkrywają cele molekularne i ich mechanizmy działania. Niniejszy przegląd kładzie również duży nacisk na rolę sztucznej inteligencji (AI) i uczenia maszynowego (ML) w integracji danych wieloomicznych, obejmując działania od budowy sieci korelacji gen-metabolit po wykorzystanie grafów wiedzy i sieci neuronowych grafów do fuzji danych i przewidywania funkcjonalnego. Na koniec przegląd kończy się omówieniem synergicznych korzyści płynących z multi-omiki dla odkrywania produktów naturalnych, rozwiązywania obecnych wyzwań technicznych oraz poszukiwania przyszłych kierunków w kierunku wysokoprzepustowej, inteligentnej integracji danych dla badań nad NP nowej generacji.

Wprowadzenie

Produkty naturalne, czyli cząsteczki produkowane przez różne organizmy, w tym mikroby i rośliny, od dawna stanowią kluczowe źródło leków, od antybiotyków takich jak penicylina po leki przeciwnowotworowe, takie jak Taxol. Znaczna część naszych obecnych antybiotyków i leków chemioterapeutycznych pochodzi z tych naturalnych związków:1. Jednak tradycyjne metody wykorzystywane do odkrywania nowych NP, takie jak hodowla mikroorganizmów czy stosowanie izolacji sterowanej bioasejem, stają się coraz trudniejsze. Pod koniec XX wieku zainteresowanie farmaceutycznymi NP spadło, gdy firmy zaczęły czerpać zyski; Wiele związków, które łatwo było znaleźć, zostało już na nowo odkrytych, a techniczne wyzwania związane z przesiewaniem i charakteryzacją tych związków sprawiły, że proces ten był pracochłonny. Na szczęście ten trend teraz się odwraca. Najnowsze osiągnięcia w omice i technologiach analitycznych ożywiają poszukiwania NPs 2,3. Na przykład sekwencjonowanie DNA o wysokiej przepustowości pozwala badaczom badać genomy pod kątem ukrytych biosyntetycznych klastrów genów (BGC), podczas gdy ultraczuła spektrometria masowa (MS) może identyfikować niewielkie ilości nowych metabolitów w złożonych mieszaninach. Te innowacje technologiczne pojawiają się w kluczowym momencie, ponieważ na całym świecie rośnie pilne zapotrzebowanie na nowe terapie, zwłaszcza antybiotyki walczące z bakteriami opornymi na leki4. Nowoczesne badania nad NP stają na wysokości zadania, łącząc tradycyjną wiedzę NP z najnowocześniejszymi technikami analizy genomowej i chemicznej.

Integracja multi-omics jest kluczowa dla obecnych postępów w badaniach biologicznych. Koncepcja "multi-omiki" polega na jednoczesnej analizie różnych warstw danych biologicznych, takich jak DNA (genom) organizmu, transkrypcje mRNA, białka i metabolity. Zastosowanie podejść omicznych przekształciło badania NP, umożliwiając wysokoprzepustowe badania przesiewowe, szybkie identyfikowanie nowych związków oraz głębszą eksplorację złożonych sieci kształtujących systemy biologiczne5. Integrując te wielowarstwowe zbiory danych, naukowcy mogą bezpośrednio powiązać geny z kodowanymi przez nie metabolitami, co pozwala na zbudowanie bardziej kompleksowego zrozumienia biosyntezy NP6. Na przykład algorytmy eksploracji genomu mogą wskazać skupisko genów, które mogą kodować nowy antybiotyk, podczas gdy dane transkryptomiczne wskazują, czy te geny są aktywnie ekspresowane. Dodatkowo, metabolomiczne profilowanie pozwala zidentyfikować odpowiadającą cząsteczkę antybiotyku w wyciągu hodowlowym organizmu 7,8,9. To zintegrowane podejście znacząco przyspiesza odkrywanie nowych związków oraz zrozumienie ich szlaków biosyntetycznych. Co ważniejsze, identyfikacja celów leków coraz częściej opiera się na zintegrowanych podejściach multiomicznych, które stopniowo wypierają tradycyjne strategie single-omics10. Najnowsze osiągnięcia w chemii analitycznej, w tym wysokorozdzielcza chromatografia cieczowa – MS (LC-MS) oraz jądrowa rezonans magnetyczny (NMR), pozwalają badaczom wykrywać i analizować strukturalnie nowe NP ze złożonych próbek biologicznych11,12. Techniki te generują ogromne ilości danych, dlatego bioinformatyka i uczenie maszynowe (ML) stają się niezbędne. Algorytmy sztucznej inteligencji (AI) oraz analizy sieciowe są coraz częściej wykorzystywane do analizy danych multi-omics, odkrywając istotne wzorce i prognozy, które trudno byłoby rozróżnić ręcznie13,14. Łącząc najnowocześniejsze technologie omiki z eksploracją danych opartą na AI, naukowcy mogą teraz stworzyć solidny pipeline umożliwiający szybsze i bardziej systematyczne odkrywanie oraz analizę NP niż kiedykolwiek wcześniej.

Chociaż strategie multiomiczne znacząco przyczyniły się do rozwoju NP, ich skuteczna implementacja w dużej mierze opiera się na skrupulatnym planowaniu eksperymentalnym. Na przykład rodzaj i jakość próbek są kluczowe; Niezbędne jest zbieranie dobrze zachowanych hodowli mikroorganizmów, izolatów środowiskowych lub materiałów klinicznych w warunkach minimalizujących degradację kwasów nukleinowych i metabolitów15. Głębokość sekwencjonowania odgrywa również kluczową rolę w rozdzielczości danych: sekwencjonowanie całego genomu zazwyczaj wymaga pokrycia co najmniej 30 × dla dokładnego składania, podczas gdy profilowanie transkrypcyjne często wymaga dziesiątek milionów odczytów w celu identyfikacji transkryptów o niskiej ilości, zgodnie z zaleceniami Genohub16. Dodatkowo, w metabolomice potrzebne są odpowiednie rozpuszczalniki i metody ekstrakcyjne, aby wychwycić różne klasy chemiczne; należy świadomie wybierać protokoły ekstrakcji, które minimalizują stronniczość i maksymalizują powtarzalność17. Jednak te metody niosą ze sobą własne wyzwania. Integracja dużych, heterogenicznych zbiorów danych może być wymagająca obliczeniowo, a niestabilność lub niska ilość metabolitów mogą skomplikować kolejne analizy18. Ponadto wysokie koszty lub ograniczona wielkość prób mogą ograniczać projektowanie badań19. Zanieczyszczenie i błędy w danych sekwencjonowania, szczególnie w próbkach o niskim wejściu lub rozcieńczeniu, również stanowią istotne ryzyko, co podkreślają Lusk i in. w odniesieniu do skażenia w sekwencjonowaniu wysokoprzepustowym20. Uznając te praktyczne i techniczne ograniczenia, naukowcy mogą podejmować świadome decyzje dotyczące odpowiednich kombinacji multi-omiki i interpretować ich wyniki z odpowiednią ostrożnością.

Niniejszy przegląd podkreśla innowacyjne metody, które rewolucjonicznie zmieniają odkrywanie NP poprzez wykorzystanie multi-omiki i analityki integracyjnej. Analizuje także rosnące znaczenie ML i AI w łączeniu tych różnych strumieni danych, w tym budowę sieci korelacji gen-metabolit oraz identyfikację klastrów genów, które prawdopodobnie produkują nowe bioaktywne związki. Ponadto analizuje znaczenie i przyszły potencjał tego zintegrowanego podejścia. Podsumowując, połączenie różnych technologii omiki z zaawansowaną analityką nie tylko przyspiesza odkrywanie nowych NP dzisiaj, ale także toruje drogę do rozwoju leków nowej generacji, które są pilnie potrzebne społeczeństwu.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przegląd i perspektywa

Aby sporządzić ten przegląd, przeprowadziliśmy kompleksowe wyszukiwanie literatury w wielu bazach danych i platformach indeksujących, w tym PubMed, Scopus, Web of Science, ScienceDirect oraz Google Scholar. Poszukiwania objęły publikacje od stycznia 2015 do lipca 2025 roku. Słowa kluczowe i kombinacje boole'owskie obejmowały: "odkrywanie produktów naturalnych", "omikę", "metabolomikę", "genomikę", "transkryptomikę", "proteomikę", "uczenie maszynowe", "sztuczną inteligencję", "biosyntetyzujące klastry genowe" oraz "integrację multi-omiki". Przeanalizowano również listy referencyjne kluczowych artykułów oraz najnowsze przeglądy w celu zidentyfikowania dodatkowych istotnych publikacji. Oprócz recenzowanych badań, konsultowano ograniczoną liczbę preprintów z platform takich jak bioRxiv i medRxiv , gdy dostarczały one aktualnych i istotnych informacji niedostępnych jeszcze w literaturze opublikowanej. Wszystkie preprinty są wyraźnie oznaczone, aby zachować przejrzystość. Ta sekcja przegląda najnowsze osiągnięcia i perspektywy na przyszłość w kluczowych obszarach odkrywania NP opartych na omice, ze szczególnym uwzględnieniem metabolomiki, genomiki, transkryptomiki i proteomiki. A także ich integracja przez AI/ML. Główne narzędzia i zasoby omawiane w tych dziedzinach są zebrane do odniesienia w Tabeli 1.

1. Metabolomika w odkrywaniu NP

  1. Platformy analityczne do metabolomiki
    Metabolomika jest kluczowa dla odkrywania NP, ponieważ pozwala na szczegółową analizę małych cząsteczek wytwarzanych przez różne organizmy. Główne narzędzia analityczne stosowane do charakteryzacji metabolomów NP to techniki wysokorozdzielcze MS, takie jak LC-MS/MS oraz chromatografia gazowa-MS (GC-MS), a także spektroskopia NMR21,22. Nieukierunkowane procesy LC-MS/MS, takie jak ultrawydajny LC-MS w połączeniu z MS/MS, umożliwiają identyfikację szerokiego zakresu metabolitów w złożonych mieszaninach, podczas gdy GC-MS wyróżnia się w profilowaniu lotnych związków. Dodatkowo nowe metody, takie jak bezpośrednia infuzja tandemowa SM oraz obrazowanie SM, wzbogacają zestaw narzędzi metabolomicznych dla NP23,24. Zaawansowane techniki spektrometryczne mas, w tym multimodalne MS, łączące mody jonów dodatnich i ujemnych lub stosujące fragmentację MSn wieloetapową, oraz metody połączone z łącznikiem, takie jak LC-MS w połączeniu z NMR, oferują głębsze wglądy strukturalne w wykrywanemetabolity 25,26.
  2. Narzędzia do przetwarzania danych i obliczeń
    Specjalistyczne narzędzia programistyczne odgrywają kluczową rolę w przetwarzaniu i interpretacji danych metabolomicznych. Programy takie jak XCMS, MZmine i OpenMS są powszechnie wykorzystywane do wykrywania i wyrównywania cech chromatograficznych, czyli pików, podczas gdy szczegółowe kroki przetwarzania danych, takie jak wyrównanie pików, normalizacja i filtrowanie, są niezbędne do uzyskania powtarzalnych profili metabolicznych27. Identyfikacja związków jest wspierana przez biblioteki spektralne MS/MS, w tym NIST i mzCloud, a także narzędzia do fragmentacji in silico, takie jak SIRIUS i MetFrag28. Platforma Global Natural Products Social (GNPS) stała się kluczowym źródłem sieci molekularnych, organizując powiązane widma MS/MS, aby podkreślić rodziny chemiczne i ułatwić dereplikację znanych związków29. Na przykład analiza wykorzystująca GNPS na danych LC-MS/MS z hodowli Streptomyces skutecznie zidentyfikowała znane antybiotyki, takie jak spiramycyna i aktinomycyna, obok wcześniej niezgłaszanych analogów 30,31. Technika sieci molekularnej skutecznie grupowała powiązane nieznane widma, a dodanie sieci tożsamości jonowej poprawiło łączność cech. Te analizy oparte na sieciach, połączone z wielowymiarowymi narzędziami statystycznymi, takimi jak analiza głównych składowych i ortogonalna analiza rozróżniających metodą najmniejszych kwadratów, a także analiza sieci korelacji, mogą powiązać wzorce produkcji metabolitów z konkretnymi warunkami biologicznymi lub środowiskowymi. W jednym z konkretnych badań molekularne sieci GNPS ekstraktów fermentacyjnych z roślinnego Streptomyces wykazały różne profile metabolitów różniące się w zależności od użytego mediatora wzrostu. Wykryto znane metabolity, w tym spiramycynę, aktinomycynę oraz rakotwórczy związek zwany lyngbyatoksyną; Jednak wiele węzłów sieciowych nie dopasowało żadnych wpisów w Spectral Databases32. To odkrycie sugeruje obecność naprawdę nowych metabolitów, podkreślając, jak nieukierunkowana metabolomika w połączeniu z GNPS może identyfikować potencjalnie nowe NP do dalszych badań.
    Połączenie przesiewowego badania metabolomicznego z biotestami funkcjonalnymi ułatwia szybkie priorytetyzowanie szczepów lub ekstraktów dających związki bioaktywne. Dodatkowo, nowe zasoby społecznościowe, takie jak Atlas Produktów Naturalnych (NPAtlas), wraz z zintegrowanymi pipeline'ami analizy metabolomu i genomu, odgrywają kluczową rolę w powiązaniu wykrytych metabolitów z ich BGC w organizmach źródłowych33,34. Ta integracyjna strategia umożliwia naukowcom korelację sygnałów metabolitów z danymi genomowymi, co zwiększa efektywność identyfikacji NP i śledzenia ich pochodzenia.

2. Genomika w odkrywaniu NP

W ciągu ostatniej dekady badania nad NP mikroorganizmów weszły w transformacyjną "erę głębokiego wydobycia", napędzaną postępami takimi jak sekwencjonowanie o wysokiej przepustowości, ultraczuła rozsiana rozsiana o wysokiej rozdzielczości oraz zintegrowane podejścia multi-omiczne35. Narzędzia te przesunęły wysiłki odkrywcze z przypadkowej izolacji na eksplorację opartą na danych, ukierunkowaną eksplorację. Potoki do eksploracji genomu, w tym antiSMASH 7.0 i DeepBGC, umożliwiają obecnie systematyczną identyfikację kryptycznych BGC, szczególnie w niedostatecznie zbadanych taksonach36,37.

  1. Sekwencjonowanie o wysokiej przepustowości i montaż hybrydowy
    Technologie sekwencjonowania DNA o wysokiej przepustowości, takie jak sekwencjonowanie DNA o krótkim odczytie i wysokiej przepustowości połączone z platformami sekwencjonowania długiego odczytu, znacząco zrewolucjonizowały badania genomowe organizmów produkujących NP. Stosując hybrydowe strategie składania integrujące zarówno długie, jak i krótkie odczyty, naukowcy mogą osiągnąć zespoły genomu o wysokiej ciągłości, które są niezbędne do uchwycenia całych BGC w ramach genomu38. Dodatkowo, sekwencjonowanie metagenomowe, obejmujące odzyskiwanie genomów złożonych w metagenomie, poszerza odkrycie BGC na niehodowane mikroorganizmy, umożliwiając naukowcom badanie środowiskowego DNA pod kątem jego potencjału biosyntetycznego39. W przypadkach, gdy konwencjonalne metody składania genomu zawodzą w rozróżnianiu dużych lub powtarzalnych klastrów genów, można wykorzystać techniki biblioteczne, takie jak cosmid lub biblioteki sztucznych chromosomów bakterii, do izolowania i klonowania znaczących fragmentów genomu. Takie podejście ułatwia charakteryzację kompletnych klastrów genów poprzez ukierunkowane sekwencjonowanie lub heterologiczne ekspresje, co poszerza naszą wiedzę o genetycznych podstawach biosyntezy NP40,41.
  2. Narzędzia do eksploracji genomu
    Specjalistyczne narzędzia bioinformatyczne są niezbędne do analizy danych genomowych w celu identyfikacji charakterystycznych sygnałów wtórnych szlaków metabolitów. Programy takie jak antiSMASH, PRISM i DeepBGC odgrywają kluczową rolę w tym procesie, automatycznie wykrywając kandydujące BGC. Robią to, rozpoznając specyficzne domeny biosyntetyczne, takie jak te związane z syntetazami peptydowych nierybosomalnych, syntazami poliketydowymi, szlakami syntetyzowanych rybosomalnie i posttranslacyjnie zmodyfikowanych peptydów (RiPP) oraz cyklazami terpenowymi, między innymi. Aby wspomóc replikację, bazy danych takie jak MIBiG, która kompiluje znane BGC i ich produkty, oraz NPAtlas, katalogująca znane NP, pomagają badaczom dopasować nowe sekwencje lub związki do ustalonych przykładów 37,42,43. Algorytmy klasteryzacji, takie jak BiG-SCAPE, wraz z narzędziami takimi jak CORASON, organizują powiązane BGC w rodziny, oferując sieciowy wgląd w różnorodność biosyntetyczną i ułatwiając identyfikację nowych rodzin klastrów poprzez porównania z znanymi44. Dodatkowe analizy bioinformatyczne, w tym wyszukiwania BLAST i ukryte skany modeli Markowa, mogą przewidywać potencjalne funkcje enzymów zakodowanych w BGC, podczas gdy porównawcze podejścia genomowe, takie jak analiza synteny i współewolucja genów, pomagają doprecyzować te funkcjonalne przewidywania45. Ponadto dane genomowe umożliwiają anotację elementów regulacyjnych powiązanych z biosyntezą NP, w tym promotorów specyficznych dla szlaku i regulatorów transkrypcji46. Te spostrzeżenia stanowią podstawę dla inżynierii ścieżek; na przykład techniki biologii syntetycznej, takie jak klonowanie rekombinacji związanej z transformacją oraz rekombinacja Red/ET, umożliwiają badaczom wychwytywanie i ekspresję cichych lub kryptycznych BGC w heterologicznym organizmie gospodarza, aktywując tym samym produkcję ich metabolitów47.
    Wysiłki w eksploracji genomu skutecznie doprowadziły do odkrycia nowych NP poprzez koncentrację na konkretnych sygnałach genetycznych. Na przykład systematyczne poszukiwania genów powiązanych z opornością na antybiotyki glikopeptydowymi ujawniły kilka nietypowych BGC, które miały kodować nowe antybiotyki. Metoda ta doprowadziła do identyfikacji dwóch nowych związków: komstatyny i kobramycyny, które wykazują unikalne mechanizmy działania poprzez celowanie w bakteryjne autolizyny48. Podobnie badanie ludzkiego mikrobiomu pod kątem zawartości genów biosyntetycznych zaowocowało powstaniem kandydata na antybiotyk lipopeptydowy znany jako "humicyn", uznany za potencjalną skuteczność przeciwko gronkowcowcowi i Streptococcus species 49. W tych przypadkach związki początkowo identyfikowano metodami obliczeniowymi, a ich struktury chemiczne przewidywano na podstawie danych genomowych. Następnie te przewidywane cząsteczki zostały chemicznie zsyntetyzowane i wykazały oczekiwane działanie antybiotykowe, co potwierdziło strategię odkrycia opartą na genomie. Na szerszą skalę, sekwencjonowanie różnych bakterii, w tym wielu rzadkich aktinomycetów, ujawnia bogactwo "kryptycznych" klastrów genów BGC, których produkty pozostają nieznane. Na przykład badania genomów Streptomyces ujawniły tysiące niescharakteryzowanych BGC50. Nowym podejściem do łączenia tych sierotowych klastrów z rzeczywistymi metabolitami jest integracja analiz metabolomicznych z badaniami genomowymi. Korelując obecność lub ekspresję klastra genów z wykrywaniem unikalnych cech metabolitów za pomocą platform takich jak GNPS czy baz danych spektralnych mas, naukowcy mogą zacząć przypisywać wstępne produkty chemiczne licznym nowym BGC, ułatwiając tym samym odkrywanie naprawdę nowych NP na podstawie danych genomowych.

3. Transkryptomika w odkrywaniu produktów naturalnych

Analizy transkryptomiczne oferują dynamiczną perspektywę aktywności BGC poprzez pomiar ekspresji mRNA w różnych warunkach. Eksperymenty RNA-seq mogą ujawnić, które BGC są aktywnie transkrybowane i jak ich poziomy ekspresji zmieniają się w odpowiedzi na zmiany środowiskowe lub eksperymentalne. Poprzez porównanie poziomów transkrypcji w różnych warunkach, analiza różnicowej ekspresji, wykorzystując narzędzia takie jak DESeq2 czy edgeR, pozwala wskazać BGC, które są albo zwykłe, albo obniżone, co wskazuje klastry genów, które mogą być indukowalne lub pozostawać ciche w warunkach standardowych51. Chociaż konwencjonalne RNA-seq przeprowadzane na komórkach objętych hodowlami jest typowym podejściem do badania ekspresji BGC, bardziej zaawansowane techniki, takie jak jednokomórkowe RNA-seq, zaczynają być stosowane w złożonych mikrobiomach. Ta zmiana pozwala na obserwację ekspresji genów u organizmów środowiskowych, które trudno hodować52,53. Standardowy workflow RNA-seq zazwyczaj obejmuje mapowanie odczytów do genomu referencyjnego za pomocą nakładek takich jak STAR lub HISAT2, ilościowe określenie ekspresji genów za pomocą narzędzi takich jak featureCounts czy Kallito oraz normalizację danych w celu identyfikacji istotnych zmian w ekspresji. Następnie analiza sieci współekspresji, często przeprowadzana za pomocą pakietu WGCNA, może klastrować geny o podobnych wzorcach ekspresji. Gdy dostępne są również dane metabolitów, sieci te można dalej rozszerzać, aby włączyć metabolity, łącząc tym samym konkretne związki z genami współekspresyjnymi54.

Dane transkryptomiczne okazały się cenne w identyfikacji warunkowo aktywnych szlaków biosyntezy. Znaczącym przykładem tego podejścia jest szczegółowe porównanie czterech szczepów Salinispora51. W tym badaniu ujawniono, że ponad połowa BGC w każdym szczepie była wyrażana w pewnym stopniu, a wiele klastrów nieaktywnych w jednym szczepie wykazywało ekspresję w innym. Analizując profile ekspresji genów w tych szczepach, naukowcy byli w stanie wskazać kilka czynników regulacyjnych, które zdawały się albo uciszać, albo aktywować konkretne klastry. Ta metoda integracyjna doprowadziła do identyfikacji wcześniej nieznanej rodziny NP, znanej jako salinipostyny. Dane transkryptomiczne wskazywały na kryptyczny klaster genów jako potencjalne źródło niezidentyfikowanego związku; Gdy ten klaster został wywołany do ekspresji (poprzez zmiany regulacyjne), dochodziło do powstawania cząsteczek salinipostyny, które następnie zostały wyizolowane i strukturalnie scharakteryzowane. Badanie to pokazuje, jak transkryptomika może ułatwić odkrywanie NP: analizując różnicową ekspresję genów, badacze mogą wskazać kandydatów BGC, a korelacja między ekspresją genów a profilami metabolitów dostarcza dowodów wspierających relacje gen-metabolit, które można zweryfikować poprzez ukierunkowane eksperymenty.

4. Proteomika w odkrywaniu NP

  1. Podejścia typu shotgun i proteomika celowana
    Proteomika, która obejmuje szeroko zakrojone badania białek, dostarcza istotnej perspektywy w badaniach NP poprzez bezpośrednie pomiary enzymów i białek odgrywających rolę w szlakach biosyntetycznych. Ogólnie podejścia proteomiczne można podzielić na dwa główne typy: proteomikę shotgun (niecelowaną) oraz proteomikę celowaną. W proteomice shotgun białka wyekstrahowane z próbek mikroorganizmów lub roślin poddawane są trawieniu enzymatycznemu, zazwyczaj z trypsyną, a uzyskane peptydy analizowane są za pomocą wysokorozdzielczych LC-MS/MS, często z użyciem zaawansowanych spektrometrów masowych, takich jak quadrupole time-of-flight (QTOF) lub wysokorozdzielcze spektrometry masowe orbitalne typupułapki masowej 55. Zebrane dane MS, znane jako spektra MS/MS, są następnie dopasowywane do sekwencji peptydów poprzez wyszukiwanie w bazie danych białek pochodzących z genomu organizmu lub blisko spokrewnionego gatunku, korzystając z narzędzi takich jak MaxQuant czy Mascot56,57. Proces ten pozwala na ilościowe określenie zmian w obdarzeniu białkami w różnych warunkach, co można osiągnąć albo metodami bez oznakowania, albo stosując techniki znakowania izotopów, takie jak stabilne znakowanie izotopów przez aminokwasy w hodowli komórkowej (SILAC) lub znakowanie izobaryczne odczynnikami TMT/iTRAQ, aby określić, które enzymy biosyntetyczne są zwykłe lub obniżone58, 59. Natomiast metody ukierunkowanej proteomiki, w tym monitorowanie wybranych reakcji (SRM) lub monitorowanie reakcji równoległych (PRM), koncentrują się na określonym zestawie jonów peptydowych, często unikalnych peptydów z kluczowych enzymów biosyntetycznych lub białek regulatorowych, umożliwiając precyzyjną i czułą ilościową identyfikację tych peptydów w wielu próbkach60,61.
  2. Innowacyjne podejścia w proteomice
    Jednym z istotnych wyzwań w analizie proteomicznej wtórnego metabolizmu jest wykrywanie dużych enzymów biosyntetycznych, takich jak syntetazy peptydowe nierybosomalne i syntazy poliketydów, które często przekraczają rozmiar 100 kDa i dają niewiele wykrywalnych peptydów przy standardowych protokołach trawienia, co utrudnia ich obserwację. Aby rozwiązać ten problem, Bumpus i in. opracowali metodę znaną jako PrISM, która poprawia wykrywanie białek NRPS i PKS poprzez wykorzystanie specyficznego kofaktora obecnego na tych enzymach62. PrISM integruje konwencjonalną proteomikę z strzelby z testem wyrzutowym fosfopanteinylu (Ppant). Warto zauważyć, że enzymy NRPS i PKS posiadają kowalencyjnie przyłączone ramię Ppant na swoich nośnikach acyklowych lub nośnikach peptydowych; podczas fragmentacji MS/MS ta grupa protetyczna często generuje unikalny jon fragmentu, zwany jonem "Ppant ejection". Dzięki komputerowemu filtrowaniu danych LC-MS/MS dla tego jonu diagnostycznego, metoda PrISM może skutecznie uwidocznić peptydy pochodzące z enzymów NRPS i PKS w złożonej mieszance wszystkich białek komórkowych. Ta strategia skutecznie odkryła ukryte szlaki biosyntezy dzięki proteomice. Na przykład workflow PrISM umożliwił wykrywanie peptydów z kompleksu syntezazy gramicidyny S (GrsA/GrsB) w hodowlach Bacillus brevis, ustanawiając bezpośredni związek między tymi enzymami NRPS a produkcją antybiotyku gramicidyny S w tym organizmie62. Co ważne, proteomiczna identyfikacja GrsA/GrsB nie wymagała wcześniejszej wiedzy genomowej o B. brevis, co pokazuje, że w niektórych przypadkach sama analiza proteomiczna może odkryć aktywne biosyntetyczne szlaki NP nawet u organizmów, których genomy nie zostały jeszcze zsekwencjonowane.
  3. Proteomika oparta na genomie
    Gdy dostępna jest sekwencja genomu, moc proteomiki może zostać znacznie zwiększona dzięki wykorzystaniu bazy danych specyficznej dla szczepu do identyfikacji peptydów. Na przykład w badaniu analizującym proteom Streptomyces lilacinus badacze przeprowadzili dwie analizy: jedną poprzez przeszukiwanie widm w ogólnej bazie białek oraz drugą na niestandardowej bazie danych pochodzącej z zsekwencjonowanego genomu tego szczepu63. Analiza oparta na genomie wykazała około dziesięciokrotnie więcej zidentyfikowanych peptydów i wykryła peptydy powiązane z sześcioma odrębnymi BGC w organizmie. Warto zauważyć, że trzy z tych zidentyfikowanych klastrów odpowiadały wcześniej znanym metabolitom "sierocy", w tym graybaktynie, rakicydynie D oraz specyficznemu sideroforowi, a ich enzymy biosyntetyczne zostały potwierdzone jako ekspresyjne. Pozostałe wykryte skupiska wydawały się nowe i niescharakteryzowane. Ten przykład pokazuje, że integracja informacji genomowych z przepływami pracy proteomicznej może potwierdzić, które szlaki biosyntezy są aktywnie wyrażane w szczepie, co nadaje priorytet tym klastrom genowym do izolacji i charakteryzacji ich produktów.
    Dodatkowo metody proteomiczne mogą oświetlić molekularne cele i sposoby działania NP, obszar ten często nazywany jest proteomiką chemiczną. Na przykład profilowanie białek oparte na aktywności (ABPP) wykorzystuje sondy małocząsteczkowe, zazwyczaj pochodne lub analogi NP, które reagują z celami komórkowymi związku, oznaczając te białka w celu wzbogacenia i identyfikacji za pomocą MS64. Ta technika pozwala wykryć cele białkowe, do których wiąże się konkretny NP lub powiązana cząsteczka wewnątrz komórki. Inna metoda, termiczne profilowanie proteomowe (TPP), polega na podgrzewaniu próbek białek w obecności lub bez związku w celu określenia, które białka wykazują zmienioną stabilność termiczną, co wskazuje na interakcję wiązania65. Te podejścia chemiczne proteomiczne są nieocenione do weryfikacji biologicznych celów NP i wyjaśniania ich mechanizmów działania, uzupełniając tym samym odkrycie NP.

5. ML i AI do integracji i predykcji omiki

  1. Integracja danych multi-omics z ML
    Ekscytującym obszarem odkrywania NP jest zastosowanie ML i AI do integracji danych omics w celu przewidywania funkcjonalnych. W dziedzinie genomiki opracowano nadzorowane algorytmy ML, w tym losowe lasy, maszyny wektorów wspierających oraz głębokie sieci neuronowe, które pozwalają identyfikować wzorce w BGC powiązane z konkretnymi typami NP. Na przykład modele ML mogą kategoryzować BGC na podstawie ogólnej klasy cząsteczek, które produkują, a nawet przewidywać określone cechy struktury chemicznej pochodzącej z sekwencji genowej. Przegląd przeprowadzony przez Dasona MS i współpracowników podkreśla różne narzędzia ML zaprojektowane do dekodowania "języka" BGC, wykorzystując dane sekwencji DNA lub aminokwasów do wywnioskowania struktur i bioaktywności odpowiadających NP66. Modele te zazwyczaj opierają się na rozległych bazach danych znanych klastrów genów i związków, aby poznać między nimi relacje, co umożliwia przewidywanie potencjalnej aktywności biologicznej nowych związków. Na przykład mogą ocenić, czy produkt z niescharakteryzowanego BGC może posiadać właściwości antybiotykowe lub przeciwnowotworowe. Znaczące postępy, które umożliwiły te możliwości, obejmują wykorzystanie dużych zbiorów danych treningowych, takich jak tysiące znanych struktur NP i klastrów genów, innowacyjne techniki reprezentacji, takie jak osadzenia sekwencji i sieci neuronowe grafów, które oddają cechy klastrów genów i struktur chemicznych, oraz modele wieloparametryczne łączące różne deskryptory genomowe i chemiczne w celu zwiększenia dokładności predykcji.
    W dziedzinie metabolomiki techniki AI znacząco poprawiają interpretację złożonych danych spektralnych mas. Znanym przykładem jest narzędzie CSI:FingerID, które wykorzystuje ML do przewidywania strukturalnego odcisku cząsteczki na podstawie jej widma MS/MS. Ta zdolność pomaga w identyfikacji nieznanych metabolitów poprzez sugerowanie potencjalnych podstruktur i związków kandydatów67. Podobnie modele głębokiego uczenia były wykorzystywane do adnotacji spektralnej; konwolucyjne sieci neuronowe oraz, ostatnio, architektury oparte na transformerach, takie jak model "DreaMS", uczą się wzorców fragmentacji z rozległych bibliotek spektralnych. Modele te mogą proponować struktury nieznanych widm na podstawie wzorców, których się nauczyły, często przewyższając tradycyjne metody heurystyczne, szczególnie dla metabolitów, które nie mają dokładnych zgodności w istniejących bazachdanych 68. Poza annotacją strukturalną, ML przyczynia się także do metabolomiki poprzez identyfikację globalnych wzorców. Na przykład algorytmy wizualizacji bez nadzoru, takie jak t-SNE (t-distributed stochastic neighbor embedding) i UMAP (Uniform Manifold Approximation and Projection), mogą zmniejszyć wymiarowość niecelowanych zbiorów danych metabolomicznych, ułatwiając klasteryzację próbek na podstawie podobieństw ich profili metabolitów. Tymczasem nadzorowane klasyfikatory mogą powiązać specyficzne sygnatury metabolitów z cechami fenotypowymi lub bioaktywnością próbek, co dodatkowo wzbogaca analizę 69,70,71.
    Uczenie maszynowe jest coraz częściej wykorzystywane do integracji różnych zbiorów danych omikowych, co pozwala na pełniejsze zrozumienie biosyntezy i funkcji NP. Łącząc dane z genomiki, transkryptomiki, proteomiki i metabolomiki, modele integracyjne mogą ujawnić powiązania, które mogą zostać przeoczone przy osobnej analizie każdego typu danych. Na przykład naukowcy mogą stworzyć sieci korelacji gen-metabolit, które łączą poziomy ekspresji genów lub białek z poziomem produkcji metabolitów. Modele ML trenowane na tych zintegrowanych danych mogą następnie przewidzieć, które klastry genów prawdopodobnie odpowiadają za konkretne metabolity lub aktywności biologiczne72,73. Zaawansowane techniki wielowymiarowe, takie jak analiza czynników wieloomicznych (dostępna w narzędziach takich jak MOFA) oraz regularizowane metody wielowymiarowe (dostępne w pakietach takich jak mixOmics), ułatwiają identyfikację utajonych czynników obejmujących różne typy danych, takich jak zestaw współekspresyjnych genów obok grupy współwystępujących metabolitów 74,75,76. W praktyce, w przypadku odkrycia NP różne podejścia pomagają w priorytetyzacji klastrów genów kandydatów, wykazując związek z obserwowanymi metabolitami lub fenotypami. Znaczącym przykładem tej integracyjnej, sterowanej przez AI strategii jest odkrycie nowej rodziny rybosomalnie syntetyzowanych RiPP za pomocą algorytmu DecRiPPter. Algorytm ten wykorzystuje model oparty na maszynie wektorowej wspierającej (SVM) do analizy danych genomowych dotyczących kryptycznych peptydów prekursorowych RiPP, a następnie porównuje te prognozy z analizą pangenomową, aby wyeliminować znane związki. Po zastosowaniu do 1 295 genomów Streptomyces, DecRiPPter z powodzeniem zidentyfikował 42 domniemane nowe rodziny RiPP, które wcześniej były pomijane przez tradycyjne metody eksploracji genomu. Spośród tych przewidywanych klastrów jeden eksperymentalnie zweryfikowano, aby wytworzyć nowy anthipoptyd klasy V, który badacze nazwali "pristynina A3." Poprzez indukcję ekspresji tego cichego klastra genów wyizolowano związek pristyniny A3, a jego strukturę określono za pomocą NMR i MS, ujawniając dwa wcześniej nieznane enzymy tworzące lantioniny zakodowane w szlaku77. To osiągnięcie pokazuje, jak analizy oparte na AI mogą odkrywać ukryte NP: model ML wykrył inaczej nierozpoznany sygnał genetyczny, kierując eksperymentalnymi działaniami mającymi na celu odkrycie nowej cząsteczki.
  2. Pojawiające się zastosowania AI
    Oprócz obecnych zastosowań, kilka nowych strategii opartych na AI ma jeszcze bardziej zrewolucjonizować badania nad NP. Obiecującym obszarem jest retrosynteza obliczeniowa i projektowanie ścieżek, gdzie rozwijane są modele głębokiego uczenia sugerujące ścieżki biosyntezy lub kroki chemii syntetycznej dla znanych NP i ich analogów, co mogłoby znacząco usprawnić projektowanie i produkcję nowych związków78,79. Kolejnym ekscytującym obszarem jest przewidywanie funkcji enzymów za pomocą AI. Wykorzystując nowoczesne narzędzia do przewidywania struktury białek oparte na algorytmach głębokiego uczenia oraz techniki ML, takie jak uczenie kontrastowe na sekwencjach białek, naukowcy zaczynają wywnioskować prawdopodobne aktywności niescharakteryzowanych enzymów występujących w BGC. Może to dostarczyć wglądu w rodzaje przemian chemicznych, które te enzymy katalizują 80,81,82. Rozwijane są w pełni zintegrowane pipeline'y omics to-chemistry, gdzie platformy AI mają na celu automatyczne łączenie cech spektralnych mas z danymigenomowymi 83,84. W zasadzie taki system mógłby analizować zbiór danych LC-MS/MS z złożonej próbki wraz z sekwencjami genomu z tego samego środowiska, co pozwoliłoby przewidzieć, który klaster genów odpowiada za każdy niezidentyfikowany metabolit poprzez punktowanie dopasowań klastrów genów z metabolitem. Chociaż te podejścia są jeszcze w powijakach, sugerują przyszłość, w której AI mogłaby autonomicznie łączyć geny z cząsteczkami, znacznie przyspieszając proces od danych omicznych do odkrywania nowych NP.
  3. Zarządzanie danymi i wyzwania etyczne w odkrywaniu NP wspomaganych przez AI
    Współczesne badania multi-omic dostarczają znaczną ilość różnorodnych danych, ale skuteczność prognoz AI w dużej mierze zależy od jakości i spójności tych zbiorów danych. Gdy zbiory treningowe są słabo anotowane lub stronnicze, mogą prowadzić do mylących wyników i nieudanych walidacji85. Aby rozwiązać ten problem, badacze powinni wdrożyć zasady FAIR – Findable, Availableable, Interoperable i Reusable – aby promować przejrzystość, powtarzalność i szeroko zakrojoną ponowną użytecznośćdanych 86. To podejście polega na dzieleniu się zarówno pozytywnymi, jak i negatywnymi wynikami, dokładnym dokumentowaniem pipeline'ów wstępnego przetwarzania danych oraz dostarczaniem kodu analitycznego ułatwiającego niezależną weryfikację. Dodatkowo, wdrożenie rozwijających się infrastruktur cyfrowych, takich jak elektroniczne notatniki laboratoryjne (ELN) oraz procesy kontenerowe, jest niezbędne dla poprawy przechwytywania danych i zapewnienia standaryzowanej kuracji87,88.
    Choć AI znacznie przyspiesza odkrywanie NP, rodzi też kluczowe kwestie etyczne. Algorytmy trenowane na niekompletnych lub stronniczych zbiorach danych mogą wzmacniać istniejące nierówności, podkreślając potrzebę różnorodnych i reprezentatywnych danych treningowych89. Dodatkowo, stosowanie wyjaśnialnych metod AI jest kluczowe dla zwiększenia przejrzystości i wspomagania naukowców w zrozumieniu prognoz, zapewniając, że AI będzie narzędziem wspierającym pod kontrolą człowieka, a nie decydentem85. Kwestie etyczne obejmują również ochronę danych, zwłaszcza przy korzystaniu z danych klinicznych lub pochodzących od ludzi, a także implikacje dla siły roboczej, gdy automatyzacja coraz bardziej wpływa na środowisko badawcze90. Aby rozwiązać te problemy, systemy AI powinny być regularnie kontrolowane, oceniane pod kątem stronniczości oraz rygorystyczny nadzór regulacyjny, co pomoże utrzymać uczciwość, odpowiedzialność i wiarygodność w dziedzinie badań nad NP.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wnioski

Obecny stan odkrywania NP wykorzystuje połączenie chemii analitycznej i bioinformatyki, tworząc potężną synergię. Jak przedstawiono na Rysunku 1, zaawansowane technologie omiki, takie jak metabolomika LC-MS, sekwencjonowanie wysokoprzepustowe, RNA-Seq oraz proteomika, współpracują z analityką obliczeniową, w tym sieciami i ML, tworząc skuteczny pipeline do odkrywania. Najnowsze osiągnięcia w tej dziedzinie obejmują omikę pojedynczych komórek, umożliwiającą id...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Wszyscy autorzy twierdzą, że nie istnieją żadne relacje finansowe ani osobiste, które mogłyby być postrzegane jako potencjalne konflikty interesów.

Podziękowania

Prace te były wspierane przez Narodową Fundację Nauk Przyrodniczych Chin (32500813), Program Stypendialny CPSF (GZC20251503), Program Nauki i Technologii Syczuan (2024ZYD0149), Specjalną Fundację Badawczą dla programu podoktorskiego prowincji Syczuan (TB2024017), kluczowy projekt badawczo-rozwojowy Biura Nauki i Technologii Deyang (2024SZY016, 2023SZZ009), Centrum Budowania Potencjału i Kształcenia Ustawicznego Komisji Zdrowia (GWJJMB202510025060), oraz Specjalny Fundusz na Projekty Inkubacyjne Szpitala Ludowego Deyang (FRH202501, FHT202501). Potwierdzamy, że Rysunek 1 został stworzony za pomocą BioRender,

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Bibliografia

  1. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  2. Shang, X., et al. Natural products in antiparasitic drug discovery: Advances, opportunities and challenges. Nat Prod Rep. 42 (9), 1419-1458 (2025).
  3. Atanasov, A. G., et al. Natural products in drug discovery: Advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  4. Xie, S., Zhan, F., Zhu, J., Xu, S., Xu, J. The latest advances with natural products in drug discovery and opportunities for the future: A 2025 update. Expert Opin Drug Discov. 20 (7), 827-843 (2025).
  5. Sahana, S., et al. Multi-omics approaches: Transforming the landscape of natural product isolation. Funct Integr Genomics. 25 (1), 132(2025).
  6. Zhang, H. W., et al. Application of omics- and multi-omics-based techniques for natural product target discovery. Biomed Pharmacother. 141, 111833(2021).
  7. Blin, K., et al. antiSMASH 5.0: Updates to the secondary metabolite genome mining pipeline. Nucleic Acids Res. 47 (W1), W81-W87 (2019).
  8. Song, C., et al. Comparative transcriptomics unveil the crucial genes involved in coumarin biosynthesis in Peucedanum praeruptorum Dunn. Front Plant Sci. 13, 899819(2022).
  9. Bayona, L. M., De Voogd, N. J., Choi, Y. H. Metabolomics on the study of marine organisms. Metabolomics. 18 (3), 17(2022).
  10. Du, P., Fan, R., Zhang, N., Wu, C., Zhang, Y. Advances in integrated multi-omics analysis for drug-target identification. Biomolecules. 14 (6), 692(2024).
  11. Elgahamy, A. A., El-Desoky, A. H., Otify, A. M., El Fishawy, A. M., El-Beih, A. A. Molecular networking derived from untargeted LC-MS/MS analysis to discover inhibitors of RANKL-induced osteoclastogenesis from Egyptian marine sponge-associated fungi. Sci Rep. 15 (1), 27137(2025).
  12. Bustamam, M. S. A., et al. Complementary analytical platforms of NMR spectroscopy and LCMS analysis in the metabolite profiling of Isochrysis galbana. Mar Drugs. 19 (3), 139(2021).
  13. Hu, G., Qiu, M. Machine learning-assisted structure annotation of natural products based on MS and NMR data. Nat Prod Rep. 40 (11), 1735-1753 (2023).
  14. Gaudencio, S. P., et al. Advanced methods for natural products discovery: Bioactivity screening, dereplication, metabolomics profiling, genomic sequencing, databases and informatics tools, and structure elucidation. Mar Drugs. 21 (5), 308(2023).
  15. Sedighikamal, H., Mashayekhan, S. Critical assessment of quenching and extraction/sample preparation methods for microorganisms in metabolomics. Metabolomics. 21 (2), 40(2025).
  16. Recommended Coverage and Read Depth for NGS Applications. , https://genohub.com/recommended-sequencing-coverage-by-application/?utm_source (2025).
  17. Brockbals, L., Ueland, M., Fu, S., Padula, M. P. Development and thorough evaluation of a multi-omics sample preparation workflow for comprehensive LC-MS/MS-based metabolomics, lipidomics and proteomics datasets. Talanta. 286, 127442(2025).
  18. Graw, S., et al. Multi-omics data integration considerations and study design for biological systems and disease. Mol Omics. 17 (2), 170-185 (2021).
  19. Han, E., Kwon, H., Jung, I. A review on multi-omics integration for aiding study design of large-scale TCGA cancer datasets. BMC Genomics. 26 (1), 769(2025).
  20. Lusk, R. W. Diverse and widespread contamination evident in the unmapped depths of high-throughput sequencing data. PloS one. 9 (10), e110808(2014).
  21. Queiroz, E. F., Guillarme, D., Wolfender, J. L. Advanced high-resolution chromatographic strategies for efficient isolation of natural products from complex biological matrices: From metabolite profiling to pure chemical entities. Phytochem Rev. 23 (5), 1415-1442 (2024).
  22. Huang, Z., Bi, T., Jiang, H., Liu, H. Review on NMR as a tool to analyse natural products extract directly: Molecular structure elucidation and biological activity analysis. Phytochem Anal. 35 (1), 5-16 (2024).
  23. Li, T., et al. Direct infusion-tandem mass spectrometry combining with data mining strategies enables rapid chemome characterization of medicinal plants: A case study of Polygala tenuifolia. J Pharm Biomed Anal. 204, 114281(2021).
  24. Zou, Y., Tang, W., Li, B. Exploring natural product biosynthesis in plants with mass spectrometry imaging. Trends Plant Sci. 30 (1), 69-84 (2025).
  25. Zhang, A., et al. Qualitative and quantitative determination of chemical constituents in Jinbei oral liquid, a modern Chinese medicine for coronavirus disease 2019, by ultra-performance liquid chromatography coupled with mass spectrometry. Front Chem. 11, 1079288(2023).
  26. Liu, Y., et al. Discovery of bioactive-chemical Q-markers of Acanthopanax sessiliflorus leaves: An integrated strategy of plant metabolomics, fingerprint and spectrum-efficacy relationship research. J Chromatogr B Analyt Technol Biomed Life Sci. 1233, 124009(2024).
  27. LC-MS analysis: Mini review frequently used open source softwares. Binanto, I., Warnars, H. L. H. S., Sianipar, N. F., Abbas, B. S. 2019 6th International Conference on Information Technology, Computer and Electrical Engineering (ICITACEE), , IEEE. 1-5 (2019).
  28. Blazenovic, I., Kind, T., Ji, J., Fiehn, O. Software tools and approaches for compound identification of LC-MS/MS data in metabolomics. Metabolites. 8 (2), 31(2018).
  29. Wang, M., et al. Sharing and community curation of mass spectrometry data with Global Natural Products Social Molecular Networking. Nat Biotechnol. 34 (8), 828-837 (2016).
  30. Leclair, M. M., et al. Discovery of Levesquamide B through Global Natural Products Social Molecular Networking. Molecules. 27 (22), 7794(2022).
  31. Yanagisawa, K., et al. A new pyranonaphthoquinone, actinoquinonal A, and its congeners from the combined-culture of Streptomyces sp. 23-50 and Tsukamurella pulmonis TP-B0596. J Antibiot (Tokyo). 78 (6), 350-358 (2025).
  32. Kum, E., Ince, E. Metabolomics approach to explore bioactive natural products derived from plant-root-associated streptomyces. Appl Biochem Biotechnol. 196 (10), 7293-7306 (2024).
  33. Poynton, E. F., et al. The Natural Products Atlas 3.0: Extending the database of microbially derived natural products. Nucleic Acids Res. 53 (D1), D691-D699 (2025).
  34. Zhang, S., et al. Global analysis of natural products biosynthetic diversity encoded in fungal genomes. J Fungi (Basel). 10 (9), 653(2024).
  35. Wang, Z., et al. The deep mining era: Genomic, metabolomic, and integrative approaches to microbial natural products from 2018 to 2024. Mar Drugs. 23 (7), 261(2025).
  36. Blin, K., et al. antiSMASH 7.0: New and improved predictions for detection, regulation, chemical structures and visualisation. Nucleic Acids Res. 51 (W1), W46-W50 (2023).
  37. Hannigan, G. D., et al. A deep learning genome-mining strategy for biosynthetic gene cluster prediction. Nucleic Acids Res. 47 (18), e110(2019).
  38. Sanchez-Navarro, R., et al. Long-read metagenome-assembled genomes improve identification of novel complete biosynthetic gene clusters in a complex microbial activated sludge ecosystem. mSystems. 7 (6), e0063222(2022).
  39. Waschulin, V., et al. Biosynthetic potential of uncultured Antarctic soil bacteria revealed through long-read metagenomic sequencing. ISME J. 16 (1), 101-111 (2022).
  40. Xu, M., et al. Functional genome mining for metabolites encoded by large gene clusters through heterologous expression of a whole-genome bacterial artificial chromosome library in Streptomyces spp. Appl Environ Microbiol. 82 (19), 5795-5805 (2016).
  41. Liu, Z., Zhao, Y., Huang, C., Luo, Y. Recent advances in silent gene cluster activation in Streptomyces. Front Bioeng Biotechnol. 9, 632230(2021).
  42. Blin, K., et al. antiSMASH 6.0: Improving cluster detection and comparison capabilities. Nucleic Acids Res. 49 (W1), W29-W35 (2021).
  43. Skinnider, M. A., et al. Comprehensive prediction of secondary metabolite structure and biological activity from microbial genome sequences. Nat Commun. 11 (1), 6058(2020).
  44. Navarro-Munoz, J. C., et al. A computational framework to explore large-scale biosynthetic diversity. Nat Chem Biol. 16 (1), 60-68 (2020).
  45. Zhu, S., et al. Computational advances in biosynthetic gene cluster discovery and prediction. Biotechnol Adv. 79, 108532(2025).
  46. Zhao, C., et al. Genome sequencing provides potential strategies for drug discovery and synthesis. Acupunc Herbal Med. 3 (4), 244-255 (2023).
  47. Bomfiglio, I. F., Mendes, I. S. M., Bonatto, D. A review of DNA restriction-free overlapping sequence cloning techniques for synthetic biology. Biotechnol J. 20 (7), e70084(2025).
  48. Culp, E. J., et al. Evolution-guided discovery of antibiotics that inhibit peptidoglycan remodelling. Nature. 578 (7796), 582-587 (2020).
  49. Chu, J., et al. Discovery of MRSA active antibiotics using primary sequence from the human microbiome. Nat Chem Biol. 12 (12), 1004-1006 (2016).
  50. Kloosterman, A. M., et al. Expansion of RiPP biosynthetic space through integration of pan-genomics and machine learning uncovers a novel class of lanthipeptides. PLoS Biol. 18 (12), e3001026(2020).
  51. Amos, G. C. A., et al. Comparative transcriptomics as a guide to natural product discovery and biosynthetic gene cluster functionality. Proc Natl Acad Sci U S A. 114 (52), E11121-E11130 (2017).
  52. Imdahl, F., Saliba, A. E. Advances and challenges in single-cell RNA-seq of microbial communities. Curr Opin Microbiol. 57, 102-110 (2020).
  53. Llorens-Rico, V., Simcock, J. A., Huys, G. R. B., Raes, J. Single-cell approaches in human microbiome research. Cell. 185 (15), 2725-2738 (2022).
  54. Hirsch, P., et al. ABC-HuMi: The Atlas of biosynthetic gene clusters in the human microbiome. Nucleic Acid Res. 52 (D1), D579-D585 (2024).
  55. Tyanova, S., Temu, T., Cox, J. The MaxQuant computational platform for mass spectrometry-based shotgun proteomics. Nat Protoc. 11 (12), 2301-2319 (2016).
  56. Lepretre, M., et al. From shotgun to targeted proteomics: rapid Scout- MRM assay development for monitoring potential immunomarkers in Dreissena polymorpha. Anal Bioanal Chem. 412 (26), 7333-7347 (2020).
  57. Rani, P., Alam, S. I., Singh, S., Kumar, S. Elucidation of peptide screen for targeted identification of Yersinia pestis by nano-liquid chromatography tandem mass spectrometry. Sci Rep. 15 (1), 1096(2025).
  58. Beller, N. C., Hummon, A. B. Advances in stable isotope labeling: Dynamic labeling for spatial and temporal proteomic analysis. Mol Omics. 18 (7), 579-590 (2022).
  59. Meng, J. Y., et al. Identification of differentially expressed proteins in sugarcane in response to infection by Xanthomonas albilineans using iTRAQ quantitative proteomics. Microorganisms. 8 (1), 76(2020).
  60. Vidova, V., Spacil, Z. A review on mass spectrometry-based quantitative proteomics: Targeted and data independent acquisition. Anal Chim Acta. 964, 7-23 (2017).
  61. Rauniyar, N. Parallel reaction monitoring: A targeted experiment performed using high resolution and high mass accuracy mass spectrometry. Int J Mol Sci. 16 (12), 28566-28581 (2015).
  62. Bumpus, S. B., Evans, B. S., Thomas, P. M., Ntai, I., Kelleher, N. L. A proteomics approach to discovering natural products and their biosynthetic pathways. Nat Biotechnol. 27 (10), 951-956 (2009).
  63. Albright, J. C., Goering, A. W., Doroghazi, J. R., Metcalf, W. W., Kelleher, N. L. Strain-specific proteogenomics accelerates the discovery of natural products via their biosynthetic pathways. J Ind Microbiol Biotechnol. 41 (2), 451-459 (2014).
  64. Chen, X., et al. Target identification with quantitative activity-based protein profiling (ABPP). Proteomics. 17 (3-4), (2017).
  65. Cui, Z., Li, C., Chen, P., Yang, H. An update of label-free protein target identification methods for natural active products. Theranostics. 12 (4), 1829-1854 (2022).
  66. Dason, M. S., Cora, D., Re, A. Sequence modeling tools to decode the biosynthetic diversity of the human microbiome. mSystems. 10 (7), e0033325(2025).
  67. Ludwig, M., Duhrkop, K., Bocker, S. Bayesian networks for mass spectrometric metabolite identification via molecular fingerprints. Bioinformatics. 34 (13), i333-i340 (2018).
  68. Bushuiev, R., et al. Self-supervised learning of molecular representations from millions of tandem mass spectra using DreaMS. Nat Biotechnol. , (2025).
  69. Tian, M., et al. Pure ion chromatograms combined with advanced machine learning methods improve accuracy of discriminant models in LC-MS-based untargeted metabolomics. Molecules. 26 (9), 2715(2021).
  70. Mildau, K., et al. Effective data visualization strategies in untargeted metabolomics. Nat Prod Rep. 42 (6), 982-1019 (2025).
  71. Yuan, X., Smith, N. S., Moghe, G. D. Analysis of plant metabolomics data using identification-free approaches. Applications in Plant Sciences. 13 (4), e70001(2025).
  72. Ji, J., Jung, S. PredCMB: Predicting changes in microbial metabolites based on the gene-metabolite network analysis of shotgun metagenome data. Bioinformatics. 41 (1), btaf020(2024).
  73. Wang, X., Kadarmideen, H. N. Metabolite genome-wide association study (m GWAS) and gene-metabolite interaction network analysis reveal potential biomarkers for feed efficiency in pigs. Metabolites. 10 (5), 201(2020).
  74. Argelaguet, R., et al. Multi-Omics Factor Analysis-a framework for unsupervised integration of multi-omics data sets. Mol Syst Biol. 14 (6), e8124(2018).
  75. Rohart, F., Gautier, B., Singh, A., Le Cao, K. A. mixOmics: An R package for 'omics feature selection and multiple data integration. PLoS Comput Biol. 13 (11), e1005752(2017).
  76. Arikan, M., Muth, T. Integrated multi-omics analyses of microbial communities: A review of the current state and future directions. Mol Omics. 19 (8), 607-623 (2023).
  77. Kloosterman, A. M., et al. Integration of machine learning and pan-genomics expands the biosynthetic landscape of RiPP natural products. bioRxiv. , (2020).
  78. Sathyanarayana, S. V., et al. DeepRetro: Retrosynthetic pathway discovery using iterative LLM reasoning. arXiv e-prints. , (2025).
  79. Zheng, S., et al. Deep learning driven biosynthetic pathways navigation for natural products with BioNavi-NP. Nat Commun. 13 (1), 3342(2022).
  80. Wang, W., Shuai, Y., Zeng, M., Fan, W., Li, M. DPFunc: Accurately predicting protein function via deep learning with domain-guided structure information. Nat Commun. 16 (1), 70(2025).
  81. Yu, T., et al. Enzyme function prediction using contrastive learning. Science. 379 (6639), 1358-1363 (2023).
  82. Casadevall, G., Duran, C., Osuna, S. AlphaFold2 and deep learning for elucidating enzyme conformational flexibility and its application for design. JACS Au. 3 (6), 1554-1562 (2023).
  83. Lee, Y. Y., et al. HypoRiPPAtlas as an Atlas of hypothetical natural products for mass spectrometry database search. Nat Commun. 14 (1), 4219(2023).
  84. Leao, T. F., et al. NPOmix: A machine learning classifier to connect mass spectrometry fragmentation data to biosynthetic gene clusters. PNAS Nexus. 1 (5), pgac257(2022).
  85. Hermann, E., Hermann, G., Tremblay, J. C. Ethical artificial intelligence in chemical research and development: A dual advantage for sustainability. Sci Eng Ethics. 27 (4), (2021).
  86. Mugahid, D., et al. A practical guide to FAIR data management in the age of multi-OMICS and AI. Front Immunol. 15, 1439434(2024).
  87. Lin, C. L., et al. Addressing standardization and semantics in an electronic lab notebook for multidisciplinary use: LabIMotion. J Cheminform. 17 (1), 75(2025).
  88. Alser, M., et al. Packaging and containerization of computational methods. Nat Protoc. 19 (9), 2529-2539 (2024).
  89. Blanco-Gonzalez, A., et al. The role of AI in drug discovery: Challenges, opportunities, and strategies. Pharmaceuticals (Basel). 16 (6), 891(2023).
  90. Mirakhori, F., Niazi, S. K. Harnessing the AI/ML in drug and biological products discovery and development: The regulatory perspective. Pharmaceuticals (Basel). 18 (1), 47(2025).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

Analityka multiomicznaplatformy metabolomicznepodej cia genomicznetechniki proteomicznenarz dzia bioinformatycznesieciowanie molekularneeksploracja genomusztuczna inteligencja

Powiązane artykuły