Badania nad metabolizmem wtórnym często polegają na przesiewaniu surowych ekstraktów pod kątem specyficznych aktywności biologicznych, a następnie na oczyszczaniu, identyfikacji i charakterystyce składników należących do aktywnych frakcji. Proces ten okazał się efektywny, umożliwiając izolację wielu związków chemicznych. Obecnie uznaje się go jednak za nieefektywny, głównie ze względu na wysoki odsetek ponownych odkryć tych samych substancji. Ponieważ przemysł farmaceutyczny rozwijał się bez pełnej wiedzy na temat ról i funkcji wyspecjalizowanych metabolitów, ich identyfikacja była przeprowadzana w warunkach laboratoryjnych, które nie odzwierciedlały wiernie natury1. Obecnie istnieje lepsze zrozumienie naturalnych wpływów sygnałowych, wydzielania oraz obecności większości celów w niewykrywalnie niskich stężeniach. Ponadto regulacja tego procesu pomoże środowisku akademickiemu i przemysłowi farmaceutycznemu w wykorzystaniu tej wiedzy. Przyniesie to również korzyści badaniom obejmującym bezpośrednią izolację metabolitów związanych z milczącymi klastrami genów biosyntezy (BGCs)2.
W tym kontekście postępy w sekwencjonowaniu genomicznym odnowiły zainteresowanie badaniami przesiewowymi metabolitów mikroorganizmów. Wynika to z faktu, że analiza informacji genomicznych odkrytych klastrów biosyntetycznych może ujawnić geny kodujące nowe związki, których nie zaobserwowano lub których nie wytworzono w warunkach laboratoryjnych. Obecnie dostępnych jest wiele projektów lub szkiców pełnych genomów drobnoustrojów, a ich liczba rośnie z każdym rokiem, co stwarza ogromne perspektywy odkrywania nowych cząsteczek biologicznie czynnych poprzez eksplorację genomów (genome mining)3,4.
Atlas Biosyntetycznych Klastrów Genów (Atlas of Biosynthetic Gene Clusters) jest obecnie największym zbiorem automatycznie zidentyfikowanych klastrów genów, stanowiącym element Zintegrowanej Platformy Genomów Mikrobialnych (Integrated Microbial Genomes Platform) Joint Genome Institute (JGI IMG-ABC)2. Niedawno inicjatywa standaryzacyjna Minimum Information for Biosynthetic Gene Clusters (MIBiG) promowała ręczną reanotację BGC, dostarczając wysoko wykuratorowany zestaw danych referencyjnych5. Obecnie dostępnych jest wiele narzędzi umożliwiających obliczeniowe przeszukiwanie danych genetycznych i powiązanie ich ze znanymi metabolitami wtórnymi. Opracowano również różne strategie pozyskiwania nowych bioaktywnych produktów naturalnych (np. ekspresję heterologiczną, delecję genów docelowych, rekonstrukcję in vitro, analizę sekwencji genomowej, screening z wykorzystaniem izotopów [podejście genomizotopowe], manipulację regulatorami lokalnymi i globalnymi, przeszukiwanie oparte na celach oporności, przeszukiwanie niezależne od hodowli, a ostatnio podejścia sterowane spektrometrią mas lub kodem2,6,7,8,9,10,1,12,13,14,15).
Przeszukiwanie genomu (genome mining) jako strategia pojedyncza wymaga wysiłków w celu adnotacji jednej lub małej grupy cząsteczek; w związku z tym w procesie tym wciąż istnieją luki w zakresie ustalania priorytetów dla nowych związków do izolacji i wyznaczania struktury. W teorii podejścia te celują w tylko jedną ścieżkę biosyntetyczną na eksperyment, co skutkuje powolnym tempem odkryć. W tym sensie stosowanie GM wraz z podejściem sieci molekularnych stanowi istotny postęp w badaniach nad produktami naturalnymi14,15.
Wszechstronność, dokładność i wysoka czułość chromatografii cieczowej sprzężonej ze spektrometrią mas (LC-MS) sprawiają, że jest to doskonała metoda do identyfikacji związków. Obecnie wiele platform udostępnia algorytmy i pakiety oprogramowania do niezorientowanej metabolomiki16,17,18,19,20. Rdzeniem tych programów jest detekcja cech (wykrywanie pików)21 oraz wyrównywanie pików, co umożliwia dopasowanie identycznych cech w serii próbek oraz poszukiwanie wzorców. Algorytmy oparte na wzorcach MS2,23 porównują charakterystyczne wzorce fragmentacji i dopasowują podobieństwa MS2, generując rodziny molekularne o wspólnych cechach strukturalnych. Cechy te mogą być następnie wyróżnione i pogrupowane, co pozwala na szybkie odkrywanie znanych i nieznanych cząsteczek w złożonym ekstrakcie biologicznym za pomocą tandemowej spektrometrii mas MS2,24,25. Zatem tandemowa spektrometria mas jest wszechstronną metodą pozyskiwania informacji strukturalnych o wielu chemotypach zawartych w dużym zbiorze danych jednocześnie.
Algorytm Global Natural Products Social Molecular Networking (GNPS)26 wykorzystuje znormalizowaną intensywność jonów fragmentowych do konstruowania wektorów wielowymiarowych, w których podobieństwa są porównywane przy użyciu funkcji cosinusowej. Relacje między różnymi jonami prekursorowymi są przedstawione na schemacie, w którym każda fragmentacja jest wizualizowana jako węzeł (okręgi), a stopień powiązania poszczególnych węzłów jest definiowany przez krawędź (linie). Globalna wizualizacja cząsteczek pochodzących z jednego źródła jest definiowana jako sieć molekularna. Cząsteczki rozbieżne strukturalnie, które ulegają unikalnej fragmentacji, tworzą własne, specyficzne klastry lub konstelacje, podczas gdy cząsteczki spokrewnione grupują się razem. Klastrowanie chemotypów umożliwia hipotetyczne powiązanie podobnych cech strukturalnych z ich pochodzeniem biosyntetycznym.
Łączenie podejść chemotyp-genotyp oraz genotyp-chemotyp jest niezwykle skuteczne podczas tworzenia powiązań bioinformatycznych między BGC a ich małocząsteczkowymi produktami27. W związku z tym poszukiwanie genomowe sterowane przez MS jest szybką metodą i strategią wymagającą niewielkiej ilości materiału, co pomaga powiązać jony rodzime ze szlakami biosyntezy ujawnionymi przez WGS jednego lub wielu szczepów w różnych warunkach metabolicznych i środowiskowych.
Przebieg tego protokołu (Rycina 1) polega na wprowadzeniu danych WGS do platformy adnotacji biosyntetycznych klastrów genów, takiej jak antiSMASH28,29,30. Pomaga to oszacować różnorodność i klasę związków zakodowanych w genomie. Należy przyjąć strategię nakierowaną na biosyntetyczny klaster genów kodujący interesującą jednostkę chemiczną, a następnie przeanalizować ekstrakty hodowlane szczepu dzikiego i/lub szczepu heterologicznego zawierającego BGC, aby wygenerować klastry jonów na podstawie podobieństw przy użyciu GNPS26,31. W konsekwencji możliwe jest zidentyfikowanie nowych cząsteczek powiązanych z docelowym BGC, których nie ma w bazie danych (głównie nieznane analogi, czasami produkowane w niskich mianach). Warto zauważyć, że użytkownicy mogą współtworzyć te platformy, a dostępność danych bioinformatycznych i MS/MS szybko rośnie, co prowadzi do ciągłego rozwoju i aktualizacji skutecznych narzędzi obliczeniowych oraz algorytmów umożliwiających efektywne łączenie złożonych ekstraktów z cząsteczkami.

Rysunek 1: Przegląd całego schematu postępowania. Przedstawiono ilustrację etapów bioinformatycznych, klonowania oraz sieciowania molekularnego, które wchodzą w skład opisanego podejścia do przeszukiwania genomu z wykorzystaniem spektrometrii mas (MS) w celu identyfikacji nowych metabolitów. Prosimy kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Niniejszy protokół opisuje szybki i efektywny schemat pracy łączący analizę genomu (genome mining) z sieciowaniem molekularnym (molecular networking) jako punkt wyjścia dla procesu odkrywania produktów naturalnych. Choć wiele aplikacji pozwala na wizualizację składu i pokrewieństwa cząsteczek wykrywanych metodą MS w ramach jednej sieci, w niniejszej pracy zastosowano kilka z nich w celu wizualizacji strukturalnie podobnych, zgrupowanych cząsteczek. Dzięki zastosowaniu tej strategii pomyślnie zidentyfikowano nowe cyklodepsypeptydy zaobserwowane w ekstraktach metabolicznych Streptomyces sp. CBMAI 2042. Na podstawie analizy genomu rozpoznano cały biosyntetyczny klaster genowy (BGC) kodujący walinomycyny i sklonowano go do szczepu produkcyjnego Streptomyces coelicolor M146. Ostatecznie, po przeprowadzeniu sieciowania molekularnego opartego na wzorcach MS, cząsteczki wykryte metodą MS skorelowano z BGC odpowiedzialnymi za ich biogenezę32.