Artykuł metodologiczny

Kuratorstwo obliczeniowych bibliotek chemicznych zademonstrowanych za pomocą alfa-aminokwasów

2.7K wyświetleń

DOI:

10.3791/63632

13 kwietnia 2022

W tym artykule

Podsumowanie

Celem tego protokołu jest efektywne generowanie i zarządzanie bibliotekami struktur małych cząsteczek za pomocą oprogramowania open-source.

Streszczenie

Wyczerpujące generowanie struktur molekularnych ma liczne zastosowania chemiczne i biochemiczne, takie jak projektowanie leków, budowa molekularnych baz danych, eksploracja alternatywnych biochemii i wiele innych. Matematycznie rzecz biorąc, są to generatory grafów z ograniczeniami chemicznymi. W tej dziedzinie najbardziej wydajnym obecnie generatorem (MOLGEN) jest produkt komercyjny, co ogranicza jego zastosowanie. Alternatywnie do tego, inny generator struktury molekularnej, MAYGEN, jest najnowszym narzędziem typu open source o wydajności porównywalnej z MOLGEN i zdolnością użytkowników do zwiększania jego wydajności poprzez dodawanie nowych funkcji. Jedną z dziedzin badań, które mogą skorzystać na tym rozwoju, jest astrobiologia; Generatory struktur umożliwiają naukowcom uzupełnianie danych eksperymentalnych o możliwości obliczeniowe dla alternatywnej biochemii. Protokół ten szczegółowo opisuje jeden przypadek użycia do generowania struktur w astrobiologii, a mianowicie generowania i selekcjonowania bibliotek alfa-aminokwasów. Korzystając z generatorów struktur typu open source i narzędzi cheminoinformatycznych, opisane tutaj praktyki mogą być wdrażane poza astrobiologię w celu taniego tworzenia i zarządzania bibliotekami struktur chemicznych dla dowolnego pytania badawczego.

Wprowadzenie

Generowanie struktur molekularnych służy jako praktyczne zastosowanie ogólnego problemu wyczerpującego generowania grafów; biorąc pod uwagę kilka węzłów (atomów) i ograniczenia ich łączności (np. wartościowości, wielokrotności wiązań, pożądane/niepożądane podstruktury), ile połączonych grafów (molekuł) jest możliwych? Generatory struktur znalazły szerokie zastosowanie w odkrywaniu leków i rozwoju farmaceutycznym, gdzie mogą tworzyć ogromne biblioteki nowych struktur do badań przesiewowych in silico1.

Pierwszy generator struktur, CONGEN, został opracowany dla pierwszego projektu sztucznej inteligencji w chemii organicznej, DENDRAL2 (skrót od DENDRitic ALgorithm). W literaturze opisano kilka następców oprogramowania DENDRAL; Jednak nie wszystkie z nich były utrzymywane lub wydajne. Obecnie MOLGEN3 jest najnowocześniejszym generatorem struktur molekularnych. Niestety dla większości potencjalnych użytkowników jest to oprogramowanie o zamkniętym kodzie źródłowym i wymaga opłaty licencyjnej. W związku z tym zaistniała potrzeba wydajnego generatora struktur typu open source, który można łatwo dostosować do określonych zastosowań. Jednym z wyzwań stojących przed wydajnym generatorem struktur jest zarządzanie eksplozją kombinatoryczną; Wraz ze wzrostem rozmiaru wzoru cząsteczkowego wykładniczo zwiększa się rozmiar chemicznej przestrzeni wyszukiwania. Niedawny przegląd dokładniej bada historię i wyzwania związane z generowaniem struktur molekularnych4.

Przed 2021 rokiem, Parallel Molecule Generator (PMG)5 był najszybszym generatorem struktur open-source, ale nadal był wolniejszy od MOLGEN o rzędy wielkości. MAYGEN6 jest około 47 razy szybszy niż PMG i około 3 razy wolniejszy niż MOLGEN, co czyni MAYGEN najszybszym i najbardziej wydajnym generatorem struktur open-source dostępnym na rynku. Bardziej szczegółowe porównania i testy porównawcze można znaleźć w artykule wprowadzającym MAYGEN6. Kluczową cechą programu jest test oparty na porządkowaniu leksykograficznym dla struktur kanonicznych, uporządkowana metoda generowania grafów oparta na algorytmie Schreier-Sims7. Oprogramowanie można łatwo zintegrować z innymi projektami i ulepszyć zgodnie z potrzebami użytkowników.

Podobnie jak MOLGEN i PMG, MAYGEN bierze zdefiniowany przez użytkownika wzór molekularny i generuje wszystkie możliwe struktury dla tego wzoru. Na przykład, jeśli użytkownik uruchomi MAYGEN ze wzorem C5H12, MAYGEN wygeneruje wszystkie możliwe struktury zawierające pięć atomów węgla i dwanaście atomów wodoru. W przeciwieństwie do swojego odpowiednika PMG o otwartym kodzie źródłowym, MAYGEN może również obsługiwać "rozmyte" wzory molekularne, które używają interwałów zamiast dyskretnych liczb do liczenia każdego pierwiastka. Na przykład, jeśli użytkownik uruchomi MAYGEN ze wzorem C5-7H12-15, MAYGEN wygeneruje wszystkie możliwe struktury, które zawierają od pięciu do siedmiu atomów węgla i dwanaście do piętnastu atomów wodoru, co pozwala na proste generowanie struktur o szerokim zakresie składu atomowego.

Astrobiologia jest jedną z takich dziedzin, która może skorzystać z generatorów struktur molekularnych. Popularnym tematem w astrobiologii jest ewolucja alfabetu aminokwasów wspólnego dla całego istniejącego życia na Ziemi. Jedną z cech charakterystycznych Ostatniego Uniwersalnego Wspólnego Przodka (LUCA) jest użycie dwudziestu genetycznie kodowanych aminokwasów do budowy białek8,9. Na podstawie metaanaliz pracy w wielu dziedzinach10,11,12, około 10 z tych aminokwasów (Gly, Ala, Val, Asp, Glu, Ser, Thr, Leu, Ile, Pro) łatwo tworzy się w warunkach abiotycznych i prawdopodobnie tworzy alfabet aminokwasów organizmów pre-Luca. Z biegiem czasu ten "wczesny" alfabet został rozszerzony w odpowiedzi na różne potrzeby strukturalne i funkcjonalne. Na przykład, niedawna recenzja z Moosmann13 twierdzi, że dodanie nowszych członków genetycznie kodowanych aminokwasów (mianowicie Met, Tyr i Trp) pozwoliło na przetrwanie w środowisku bogatym w tlen, zapobiegając wewnątrzkomórkowej proliferacji reaktywnych form tlenu.

Stale rosnący zestaw technik chemii analitycznej pozwala na wgląd w struktury aminokwasów, które mogą powstawać w warunkach abiotycznych. Niedawny przegląd14 autorstwa Simkusa i innych szczegółowo opisuje metody używane do wykrywania licznych związków organicznych w meteorytach, a także związków organicznych z symulacji in vitro wczesnych środowisk Ziemi15,16,17. Systematyczne generowanie struktur chemicznych pozwala naukowcom na eksplorację poza związki organiczne wykryte za pomocą oprzyrządowania, wypełniając przestrzeń strukturalną wokół strukturalnych "wysp" zidentyfikowanych przez chemię analityczną. W przypadku "wczesnych" aminokwasów, to systematyczne generowanie struktur pokazuje możliwe chemie białek dostępne dla wczesnego życia, bez ograniczania eksploracji do struktur, które zostały eksperymentalnie wykryte w warunkach syntezy abiotycznej. Dzięki zestawom narzędzi chemicznych i wydajnym generatorom struktur, takim jak MAYGEN, tworzenie i eksplorowanie nowatorskich bibliotek struktur chemicznych jest teraz łatwiejsze niż kiedykolwiek wcześniej i może prowadzić bardziej szczegółowe badania nad alternatywnymi substancjami chemicznymi życia.

Protokół

UWAGA: Podsumowanie protokołu znajduje się na Rysunku 1, natomiast szczegółowe informacje o wykorzystanym oprogramowaniu zawiera Tabela materiałów.

Schemat generowania struktury molekularnej, przedstawiający kroki: filtrowanie substruktur, zastępowanie pseudoatomów.
Rysunek 1: Schemat podsumowujący protokół. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

1. Pobieranie oprogramowania i plików

UWAGA: Wszystkie programy są bezpłatne do użytku indywidualnego i mogą być uruchamiane na komputerze osobistym.

  1. Utwórz nowy katalog dla tego projektu. Umieść w nim pliki i pliki wykonywalne, aby zapewnić do nich łatwy dostęp.
  2. Pobierz i zainstaluj niezbędne pakiety oprogramowania.
    1. Pobierz najnowszą wersję MAYGEN jako plik .jar.
      UWAGA: MAYGEN jest dostępny bezpłatnie jako plik .jar pod adresem https://github.com/MehmetAzizYirik/MAYGEN/releases
    2. Pobierz i zainstaluj oprogramowanie do zarządzania pakietami Conda oraz zestaw narzędzi chemoinformatycznych RDKit18.
      UWAGA: RDKit będzie filtrować struktury molekularne generowane przez MAYGEN i najlepiej działa w środowisku Conda. Instrukcje dotyczące pobierania platformy Conda znajdują się na stronie https://conda.io/projects/conda/en/latest/user-guide/install/index.html. Instrukcje dotyczące instalacji RDKit i konfiguracji środowiska można znaleźć pod adresem https://www.rdkit.org/docs/Install.html.
      1. Zainstaluj RDKit w głównym środowisku Conda zamiast w osobnym środowisku RDKit za pomocą wiersza poleceń Anaconda prompt. W systemach Windows wyszukaj „Anaconda prompt” i kliknij wynikający z tego skrót, aby go uruchomić. W systemach MacOS i Linux komunikuj się z Condą poprzez terminal bez uruchamiania dodatkowych programów. Następnie wpisz poniższą komendę i naciśnij Enter, aby ją wykonać, a na wszelkie pytania pojawiające się podczas instalacji odpowiedz twierdząco:
        conda install -c rdkit rdkit.
        Choć istnieje wiele bezpłatnych programów do obliczania deskryptorów, w tym przykładzie zastosowano PaDEL-Descriptor19, bezpłatny i szybki kalkulator deskryptorów molekularnych i odcisków palców (fingerprints).
    3. Pobierz i zapisz plik .jar w folderze projektu.
      UWAGA: PaDEL-Descriptor można pobrać bezpłatnie ze strony http://www.yapcwsoft.com/dd/padeldescriptor/.
  3. Pobierz notatniki Jupyter oraz pliki tekstowe z wzorcami podstruktur z Plików uzupełniających 1-5.
    UWAGA: Notatniki Jupyter można również pobrać z następującej strony GitHub: https://github.com/cmayerb1/AA-structure-manip.

2. Generowanie struktury przy użyciu MAYGEN

  1. W wierszu poleceń przejdź do katalogu zawierającego plik wykonywalny MAYGEN .jar.
  2. Dla każdego interesującego wzoru chemicznego uruchom MAYGEN za pomocą następującego polecenia:
    java -jar [nazwa pliku MAYGEN .jar] -f [wzór chemiczny] -v -o [folder na wyniki MAYGEN] -m -sdf.
    UWAGA: Spowoduje to zapisanie pliku .sdf w wyznaczonym folderze, nazwanego zgodnie z użytym wzorem.
    1. Jeśli zamiast wzoru dyskretnego użyto wzoru rozmytego, zastąp flagę -f flagą -fuzzy i zamknij przedziały pierwiastków w nawiasach kwadratowych (np. użyj C[5-7]H[12-15], aby zapewnić, że wszystkie wygenerowane struktury posiadają od 5 do 7 atomów węgla i od 12 do 15 atomów wodoru).

3. Filtrowanie związków z niepożądanymi podstrukturami

  1. Otwórz wiersz poleceń Anaconda (patrz krok 1.2.2.1) i przejdź do folderu zawierającego notatniki Jupyter pobrane z Supplemental File 1.
  2. Otwórz notatnik Jupyter do filtrowania podstruktur za pomocą następującego polecenia:
    jupyter notebook [nazwa pliku notatnika]
  3. W wyznaczonej komórce na początku notatnika wprowadź jako ciągi znaków (w cudzysłowie) pełną ścieżkę do pliku wejściowego .sdf (wygenerowanego przez MAYGEN), pełną ścieżkę do pożądanego pliku wyjściowego .sdf oraz ścieżkę do pliku „badlist”. Przykład pliku badlist znajduje się w Supplemental File 2.
    1. Jeśli niektóre podstruktury w filtrowanej bibliotece (tzw. goodlist) mają zostać zachowane, utwórz plik .txt z wzorami SMARTS20 dla tych podstruktur (goodlist) i wpisz ścieżkę do pliku goodlist w wyznaczonej linii na początku notatnika. Przykład pliku goodlist znajduje się w Supplemental File 3.
  4. Zrestartuj jądro (kernel) notatnika i uruchom wszystkie komórki (z menu na górze wybierz Kernel, Restart & Run All), aby uzyskać plik .sdf o żądanej nazwie w określonym folderze wyjściowym.
  5. Powtórz dwa poprzednie kroki dla każdego pliku struktur wygenerowanego przez MAYGEN w kroku 2.

4. (Opcjonalnie) Dodatkowe modyfikacje struktury

UWAGA: Czynności te zostały wykonane w tym przykładzie, lecz mogą nie być wymagane przy kurateli innych bibliotek.

  1. Zastępowanie pseudoatomami.
    UWAGA: W tym kontekście pseudoatom to unikalny atom używany do reprezentacji większej podstruktury wspólnej dla wszystkich generowanych struktur, co skraca czas generowania w programie MAYGEN. Przykład zastępowania pseudoatomami znajduje się w Pliku uzupełniającym 4.
    1. Otwórz wiersz poleceń Anaconda (patrz krok 1.2.2.1) i przejdź do folderu zawierającego notatniki Jupyter.
    2. Otwórz notatnik Jupyter do zastępowania pseudoatomami:
      jupyter notebook [nazwa pliku notatnika]
    3. W wyznaczonej komórce na początku notatnika wprowadź pełną ścieżkę do pliku wejściowego .sdf oraz pełną ścieżkę do pożądanego pliku wyjściowego .sdf w formie ciągów znaków (w cudzysłowie).
    4. Zrestartuj jądro (kernel) notatnika i uruchom wszystkie komórki, aby uzyskać plik .sdf o żądanej nazwie w określonym folderze wyjściowym.
  2. Blokowanie końców N- i C- aminokwasów
    UWAGA: Ta procedura jest specyficzna dla alfa-aminokwasów i polega na dodawaniu bloków molekularnych do końców N- i C- szkieletów alfa-aminokwasów. Przykład blokowania aminokwasów znajduje się w Pliku uzupełniającym 5.
    1. Otwórz wiersz poleceń Anaconda (patrz krok 1.2.2.1) i przejdź do folderu zawierającego notatniki Jupyter.
    2. Otwórz notatnik Jupyter do blokowania aminokwasów:
      jupyter notebook [nazwa pliku notatnika]
    3. W wyznaczonej komórce na początku notatnika wprowadź pełną ścieżkę do pliku wejściowego .sdf oraz pełną ścieżkę do pożądanego pliku wyjściowego .sdf w formie ciągów znaków (w cudzysłowie).
    4. Zrestartuj jądro (kernel) notatnika i uruchom wszystkie komórki, aby uzyskać plik .sdf o żądanej nazwie w określonym folderze wyjściowym.

5. Generowanie deskryptorów

  1. Przed generowaniem deskryptorów umieść wszystkie pliki .sdf, dla których mają zostać obliczone deskryptory, w jednym folderze.
    UWAGA: Jeśli nie zostało to jeszcze zrobione, nadaj tym plikom opisowe nazwy, aby ułatwić filtrowanie po wygenerowaniu deskryptorów.
  2. Otwórz wiersz poleceń i przejdź do folderu zawierającego plik .jar programu PaDEL-Descriptor.
  3. Uruchom PaDEL-Descriptor dla zebranych plików .sdf, używając następującej komendy:
    java -jar PaDEL-Descriptor.jar -dir [ścieżka do katalogu z plikami .sdf] -file [ścieżka do pliku .csv dla wyników] -2d -retainorder -usefilenameasmolname
    UWAGA: Plik z wynikami będzie zawierał nazwę cząsteczki w pierwszej kolumnie oraz każdy deskryptor w kolejnych kolumnach.
  4. Wyeksportuj te dane do dowolnego programu arkusza kalkulacyjnego w celu dalszej analizy.

Wyniki

BibliotekaWzórDodatkowe ograniczeniaAminokwasy kodowane jako „wczesne”Czas generowania (ms)Struktury
PoczątkoweKońcowe
1GlyC2H5NO2zawierać podstrukturę GlyGly192841
2VAILPC0-3H3-9Val, Ala, Ile, Leu1727022
3DESTPC0-3O1-2H3-5Asp, Glu, Ser, Thr4811928254
4ProC2-5NO2H7-11Zawierać podstrukturę N-meGly lub N-meAlaPro40357977716
5VAIL_SPSC0-2H3-71226531
6DEST_SPSC0-2O1-2H3349107579
7Pro_SC2-4SNO2H7-9Zawierać podstrukturę N-meGly lub N-meAla39997573410

Tabela 1: Biblioteki związków użyte w tym przykładzie. Biblioteki zbudowane na podstawie wzorów 1-4 (Gly, VAIL, DEST i Pro) opierają się na wcześniej opublikowanych wzorach rozmytych (fuzzy formulae) dla „wczesnych” kodowanych aminokwasów21, natomiast biblioteki zbudowane na podstawie wzorów 5-7 (VAIL_S, DEST_S i Pro_S) opierają się na wariantach wzorów 2-4, w których jeden z atomów węgla zostaje zastąpiony dwuwartościową siarką. Liczba struktur odzwierciedla liczbę cząsteczek wygenerowanych przez MAYGEN dla każdego wzoru („Wstępna”) oraz liczbę cząsteczek pozostałych po odfiltrowaniu tych z niepożądanymi podstrukturami („Końcowa”). Skróty: VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X; N-meX = N-metyloX.

Powyższe metody ogólne zastosowano do formuł opartych na „wczesnych” kodowanych aminokwasach, zgodnie z procedurą Meringera i wsp.21 Struktury z tzw. „czarnej listy” (badlist) pobrano z tego samego źródła i przekształcono w ciągi SMARTS, aby łatwo reprezentować wzorce podstrukturalne. W tym przykładzie nie wykorzystano dwóch podstruktur z czarnej listy: struktura 018 (CH3-CH-N) odpowiadała niemal izomerom proliny, które same w sobie nie były niestabilne; struktura 106 (R-C-C-OH, gdzie R=podstruktura alaniny przyłączona w węglu beta) odpowiadała kwasowi glutaminowemu, który jest kodowanym aminokwasem. Oprócz tych formuł chemicznych stworzono warianty, w których dwuwartościowa siarka zajmuje miejsce jednego atomu węgla i dwóch atomów wodoru. Ze względów wydajnościowych w kilku z tych formuł zastosowano trójwartościowy atom fosforu (np. „pseudoatom”) jako zamiennik węgla beta w podstrukturze alaniny. Tabela 1 przedstawia biblioteki wygenerowane w tym przykładzie, formuły użyte do ich utworzenia oraz liczbę zawartych w nich związków. Nazwy bibliotek opierają się na kodowanych aminokwasach, z których pochodzą: przy użyciu skrótu 3-literowego (Gly = glicyna, Pro = prolina) lub skrótu 1-literowego (VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina). Sufiks „_S” oznacza, że w formule oryginalnej biblioteki węgiel zastąpiono siarką (np. VAIL_S jest zbudowany na podstawie tej samej formuły przybliżonej co VAIL, ale z dwuwartościową siarką zastępującą jeden z atomów węgla).

Po wygenerowaniu struktur za pomocą MAYGEN, wynikające z tego biblioteki przefiltrowano w celu usunięcia związków zawierających co najmniej jedną podstrukturę znajdującą się na liście wykluczeń (badlist). Po tym filtrowaniu wszystkie atomy fosforu zastąpiono podstrukturą alaniny. Następnie utworzono wersje „zablokowane” (capped) wszystkich struktur, dodając grupę acetylową do N-końca oraz grupę N-metyloamidową do C-końca. Wykonano to, aby wyeliminować wpływ wolnych grup aminowych i karboksylowych w szkielecie alfa-aminokwasów na hydrofobowość. Program PaDEL-Descriptor został wykorzystany do obliczenia XLogP dla wszystkich struktur zablokowanych oraz obliczenia objętości van der Waalsa (VABC) dla wszystkich struktur niezablokowanych.

Rysunek 2 przedstawia przestrzeń chemiczną przefiltrowanych bibliotek, zdefiniowaną przez deskryptory VABC i XLogP. Tutaj zakres możliwych wartości logP rośnie wraz z objętością cząsteczki, nawet w bibliotekach pozbawionych wyraźnych łańcuchów bocznych hydrofilowych (np. VAIL, Pro). Aminokwasy kodowane z hydrokarbonowymi łańcuchami bocznymi były bardziej hydrofobowe niż większość innych aminokwasów o porównywalnej objętości z ich odpowiedniej biblioteki. Wydaje się, że tak samo jest w przypadku Met i Cys w porównaniu z innymi członkami biblioteki VAIL_S o podobnych objętościach. Aminokwasy kodowane z hydroksylowymi łańcuchami bocznymi (Ser i Thr) należały do najmniejszych członków biblioteki DEST, przy czym Asp był tylko nieco większy od Thr.

Rysunek 3 oraz Rysunek 4 przedstawiają wpływ zastąpienia węgla dwuwartościową siarką w łańcuchu bocznym alfa-aminokwasu na objętość i logP. Podstawienie siarką doprowadziło do niewielkiego wzrostu objętości cząsteczkowej we wszystkich bibliotekach (Rysunek 3). Wpływ podstawienia siarką na logP nie jest tak jednolity jak w przypadku objętości (Rysunek 4). Średni logP biblioteki VAIL_S jest nieco niższy niż w bibliotece VAIL, jednak efekt ten nie występuje w żadnej z pozostałych par bibliotek (DEST i DEST_S, Pro i Pro_S).

Rysunek 5 ilościowo określa wpływ na generowanie struktur zastosowania pseudoatomu zastępującego powszechną podstrukturę; w tym przypadku trójkoordynowany P zastąpił resztę alaniny podczas generowania struktury. Wykorzystanie pseudoatomu w procesie generowania struktur znacznie zmniejszyło liczbę wygenerowanych struktur o ok. 3 rzędy wielkości (Rysunek 5A) oraz całkowity czas potrzebny na wygenerowanie tych struktur o 1-2 rzędy wielkości (Rysunek 5B).

Wykres rozrzutu właściwości chemicznych; xLogP w funkcji objętości Van der Waalsa; wykres porównawczy aminokwasów.
Rycina 2: Przestrzeń chemiczna wszystkich przefiltrowanych bibliotek aminokwasów. Czarne markery reprezentują aminokwasy z bibliotek bez siarki; żółte markery reprezentują aminokwasy z bibliotek wzbogaconych o siarkę. Koła: VAIL i VAIL_S; kwadraty: DEST i DEST_S; trójkąty: Pro i Pro_S; gwiazdki: aminokwasy kodowane. Należy zauważyć, że dwa kodowane aminokwasy zawierające siarkę (Met i Cys) nie są uznawane za aminokwasy „wczesne”, lecz znajdują się w bibliotece VAIL_S. Skróty: XLogP = współczynnik podziału; VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Wykres słupkowy porównujący objętości van der Waalsa (ų) dla VAIL, DEST i Pro z słupkami błędów.
Rysunek 3: Średnie objętości van der Waalsa (w Å3) bibliotek z siarką i bez siarki. Czarne słupki reprezentują średnie objętości bibliotek bez siarki (VAIL, DEST, Pro), natomiast żółte słupki reprezentują średnie objętości wersji tych bibliotek z podstawioną siarką (VAIL_S, DEST_S, Pro_S). Słupki błędów przedstawiają odchylenie standardowe. Skróty: VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Wykres słupkowy porównujący wartości XLogP dla VAIL, DEST, Pro z słupkami błędów, przedstawiający hydrofobowość.
Rysunek 4: Średnie wartości XLogP bibliotek z siarką i bez siarki. Czarne słupki reprezentują biblioteki bez siarki (VAIL, DEST, Pro), natomiast żółte słupki reprezentują wersje tych bibliotek z podstawnikiem siarkowym (VAIL_S, DEST_S, Pro_S). Słupki błędów przedstawiają odchylenie standardowe. Skróty: XLogP = współczynnik podziału; VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Wykresy słupkowe porównujące liczbę wygenerowanych struktur i czas wykonania dla VAIL i DEST, analiza w skali logarytmicznej.
Rysunek 5: Wpływ trójwalentnego pseudoatomu na generowanie struktur w MAYGEN. Wszystkie testy przeprowadzono na komputerze PC z procesorem Intel i7-7700HQ o taktowaniu 2.8 GHz i 16 GB pamięci RAM, bez zapisywania struktur do pliku oraz z opcją -m w celu wykorzystania wielowątkowości. W testach z użyciem pseudoatomu zastosowano formuły rozmyte opisane w Tabeli 1. W testach bez pseudoatomu zastosowano te same formuły rozmyte, co w Tabeli 1, z następującymi zmianami: P zastąpiono N; liczbę atomów węgla zwiększono o 3; liczbę atomów wodoru zwiększono o 7; liczbę atomów tlenu zwiększono o 2. Czarne słupki przedstawiają biblioteki wygenerowane z pseudoatomem; szare słupki przedstawiają biblioteki wygenerowane bez pseudoatomu. (A) Liczba struktur wygenerowanych przy użyciu formuł rozmytych zastosowanych do budowy bibliotek VAIL i DEST z trójwalentnym fosforem zastępującym podstrukturę alaniny oraz bez niego. (B) Czas (w ms) potrzebny do zbudowania bibliotek VAIL i DEST z trójwalentnym fosforem zastępującym podstrukturę alaniny oraz bez niego. Skróty: VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Plik uzupełniający 1: Notatnik przesiewowy podstruktur. Aby pobrać ten plik, kliknij tutaj.

Plik uzupełniający 2: Przykładowa lista błędów (badlist). Kliknij tutaj, aby pobrać ten plik.

Plik uzupełniający 3: Przykładowa lista prawidłowych próbek (goodlist). Kliknij tutaj, aby pobrać ten plik.

Plik uzupełniający 4: Notatnik zastępowania pseudoatomów. Kliknij tutaj, aby pobrać ten plik.

Plik uzupełniający 5: Notatnik dotyczący blokowania grup aminowych. Kliknij tutaj, aby pobrać ten plik.

Dyskusja

Jedną z cech "wczesnych" aminokwasów jest brak siarki. Wspomniane wcześniej metaanalizy generalnie uważają, że kodowane aminokwasy zawierające siarkę (Cys i Met) były stosunkowo późnymi dodatkami do kodu genetycznego, a wnioski te potwierdza brak aminokwasów zawierających siarkę w meteorytach i eksperymentach z lampami zapłonowymi. Jednak związki siarkoorganiczne są łatwo wykrywalne w kometach i meteorytach22, a ponowna analiza eksperymentów z lampą iskrową z użyciem gazuH2Swykazała aminokwasy i inne związki organiczne zawierające siarkę16. Rozważając alternatywny alfabet aminokwasów, warto zapoznać się z tym wzbogaconym w siarkę.

W powyższym protokole generowanie struktury i filtrowanie podstruktury są uważane za kroki krytyczne; W zależności od składu gotowej biblioteki struktur, badacz może być zmuszony do wykonania tylko tych dwóch kroków. Instrukcje i oprogramowanie do dodatkowych działań (zastępowanie pseudoatomów i dodawanie podstruktur (w tym przypadku capping aminokwasów)) są dołączone w celu uzyskania bardziej odpowiednich obliczeń deskryptorowych (capping zapewnia, że na obliczenia XLogP ma wpływ łańcuch boczny, a nie grupy aminowe lub karboksylowe w szkielecie) oraz szybszego generowania struktury za pomocą pseudoatomu, co omówiono bardziej szczegółowo poniżej. Dodatkowo wykonywane są tutaj obliczenia deskryptorowe, które w łatwy sposób pozwalają na wizualizację różnorodności generowanych struktur i porównanie efektów wzbogacania siarką w gotowych bibliotekach.

Podczas gdy PaDEL-Descriptor może obliczyć tysiące właściwości molekularnych, objętość cząsteczkowa (obliczona objętość van der Waalsa) i współczynnik podziału (jako XLogP) zostały tutaj użyte z dwóch różnych powodów. Po pierwsze, te dwa deskryptory mierzą właściwości molekularne (odpowiednio rozmiar i hydrofobowość), które są znane większości chemików i biologów. Po drugie, w przypadku aminokwasów te dwie właściwości są znaczące. Przez dziesięciolecia wiadomo było, że wielkość aminokwasów i hydrofobowość wpływają na termodynamikę fałdowania białek23. Te dwie właściwości pomagają wyjaśnić częstotliwości podstawiania aminokwasów, które były integralną częścią zrozumienia ewolucji białek24.

Powyższy przykład pokazuje, że w dwóch badanych deskryptorach (objętość cząsteczkowa i hydrofobowość) podstawienie dwuwartościowej siarki na węgiel i dwa wodory nie powoduje istotnych zmian. Niewielki, nieistotny wzrost średniej objętości cząsteczkowej spowodowany podstawieniem siarki (ryc. 3) można przypisać większemu promieniowi kowalencyjnemu siarki (~103 pm) w porównaniu z węglem sp3 (~75 pm) lub sp2 (~73 pm)25. Podobnie, podstawienie siarki ma minimalny wpływ na średnią XLogP (ryc. 4). Największy efekt zaobserwowano między bibliotekami VAIL i VAIL_S, prawdopodobnie ze względu na połączenie biblioteki VAIL szczególnie hydrofobowej (łańcuchy boczne to tylko węglowodory) i grup sulfhydrylowych, które byłyby znacznie bardziej kwaśne niż grupy metylowe, które miałyby zastąpić. Minimalny efekt podstawiania siarki jest widoczny na rysunku 2, gdzie biblioteki z podstawieniem siarki zajmują tę samą przestrzeń chemiczną, co analogiczne biblioteki bez podstawiania siarki.

Zmniejszenie liczby struktur (Rysunek 5A) i czasu potrzebnego do wygenerowania tych struktur (Rysunek 5B) przy użyciu pseudoatomu nie jest zaskakujące. Użycie pseudoatomu zmniejsza liczbę ciężkich atomów, które muszą zostać włączone do wykresu chemicznego, zmniejszając liczbę węzłów grafu i powodując wykładnicze skrócenie czasu generowania i liczby struktur. W tym przypadku wybór fosforu trójwartościowego jako pseudoatomu wynika z podstawowej biochemii (brak potranslacyjnego dodawania grup fosforanowych, żadne genetycznie kodowane aminokwasy nie zawierają fosforu) oraz wartościowości atomu, który by go zastąpił (fosfor trójwartościowy można łatwo zastąpić czterowartościowym węglem, który jest pojedynczo związany z innym atomem lub grupą atomów). Podczas gdy dostarczony kod do podstawiania pseudoatomów jest specyficzny dla zastąpienia trójwartościowego fosforu podstrukturą alaniny, użytkownicy mogą dostosować kod do pracy z różnymi pseudoatomami lub podstrukturami zastępczymi, potencjalnie używając wielu pseudoatomów podczas początkowego generowania struktury, a następnie zastępując każdy pseudoatom większą podstrukturą molekularną.

Metody generowania struktur podobne do tych stosowanych w ramach projektu MAYGEN (i inne metody, takie jak sieci neuronowe) są już wykorzystywane w odkrywaniu leków do generowania bibliotek związków do badań przesiewowych in silico ; W niedawnym przeglądzie4 omówiono te metody bardziej szczegółowo. Ponieważ metody te są przeznaczone przede wszystkim do tworzenia cząsteczek podobnych do leków, istnieją pewne ograniczenia ich zdolności do generowania cząsteczek, takie jak wykorzystanie właściwości biologicznych lub farmaceutycznych w celu ograniczenia tworzonych struktur (odwrotne QSPR/QSAR) lub tworzenie struktur z ustalonej liczby bloków budulcowych podstruktury. Ponieważ astrobiologia skupia się bardziej na mnogości związków organicznych, które mogą tworzyć się abiotycznie, a mniej na jakichkolwiek produktach końcowych lub ich właściwościach, wyczerpujące generowanie struktur w ramach projektu MAYGEN jest idealne do tworzenia bibliotek struktur w celu odpowiedzi na pytania astrobiologiczne. Opisane tutaj podejście do filtrowania podkonstrukcji (wykonywane po wygenerowaniu struktury za pomocą zewnętrznego programu) różni się od konkurencyjnego programu MOLGEN tym, że filtrowanie podstruktury MOLGEN następuje podczas generowania konstrukcji. Ponieważ MAYGEN jest oprogramowaniem typu open source, jest nie tylko bardziej dostępny niż MOLGEN ze względu na koszt licencji MOLGEN, ale osoby fizyczne mogą wdrażać nowe funkcje, takie jak filtrowanie podstruktur podczas generowania struktury.

Jak napisano, opisany tutaj protokół koncentruje się na generowaniu i utrzymywaniu bibliotek stosunkowo małych alfa-aminokwasów. Aby wygenerować różne biblioteki, użytkownicy mogą nadać MAYGENOWI różne wzory molekularne, zmienić filtrowanie podstruktury, zmieniając maksymalny dozwolony rozmiar pierścienia i wartościowość wiązania, lub edytować pliki goodlist i badlist, aby dodać lub usunąć wzorce podstruktury. Modyfikacje protokołu, które obejmują zmianę sposobu dodawania lub zastępowania atomów i podstruktur (podstawienie pseudoatomów i ograniczenie molekularne) są wykonalne, ale będą wymagały zwrócenia większej uwagi na ograniczenia walencyjne, aby uniknąć błędów RDKit dotyczących nieprawidłowych wartościowości w zmodyfikowanych strukturach.

Opisany powyżej protokół jest przeznaczony dla małych alfa-aminokwasów. Jednak ogólny format (kompleksowe generowanie struktury za pomocą pseudoatomów, a następnie filtrowanie podstruktury i modyfikacje molekularne) jest bardzo elastyczny dla związków innych niż małe aminokwasy. Nawet w astrobiologii podobną niedawną procedurę z użyciem MOLGEN zastosowano do zbadania konstytucyjnych izomerów kwasów nukleinowych26. Oprócz narzędzi opisanych powyżej, MAYGEN można połączyć z innymi narzędziami chemicznymi typu open source, aby tworzenie i analizowanie nowych struktur chemicznych było przystępne cenowo i dostępne dla szerokiego wachlarza dziedzin badawczych.

Oświadczenia

Autorzy nie mają do ujawnienia żadnych konfliktów interesów.

Podziękowania

MAY dziękuje za sfinansowanie przez Fundację Carl-Zeiss. Wszystkie rysunki zostały wygenerowane przy użyciu programu Microsoft Excel.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
conda v. 4.10.3https://www.anaconda.com/products/individual
Java 17https://java.com/en/download/help/download_options.html
MAYGEN v. 1.8https://github.com/MehmetAzizYirik/MAYGEN/releases
PaDEL-Descriptor v. 2.21http://www.yapcwsoft.com/dd/padeldescriptor/
python v. 3.7.11zawarty w środowisku Anaconda
RDKit v. 2020.09.1.0https://www.rdkit.org/docs/Install.html, lub zainstalowany przez conda: https://anaconda.org/rdkit/rdkit
*Te konkretne wersje zostały użyte w tym manuskrypcie; użytkownik może uzyskać nowsze wersje, jeśli są dostępne.

Bibliografia

  1. Ruddigkeit, L., van Deursen, R., Blum, L. C., Reymond, J. -L. Enumeration of 166 billion organic small molecules in the chemical universe database GDB-17. Journal of Chemical Information and Modeling. 52 (11), 2864-2875 (2012).
  2. Buchanan, B. G., Feigenbaum, E. A. Dendral and Meta-Dendral: their applications dimension. Readings in Artificial Intelligence. Webber, B. L., Nilsson, N. J. , Morgan Kaufmann. 313-322 (1981).
  3. Gugisch, R., et al. MOLGEN 5.0, A Molecular Structure Generator. Advances in Mathematical Chemistry and Applications. Basak, S. C., Restrepo, G., Villaveces, J. L. , Bentham Science Publishers. 113-138 (2015).
  4. Yirik, M. A., Steinbeck, C. Chemical graph generators. PLOS Computational Biology. 17 (1), 1008504(2021).
  5. Jaghoori, M. M., et al. PMG: multi-core metabolite identification. Electronic Notes in Theoretical Computer Science. 299, 53-60 (2013).
  6. Yirik, M. A., Sorokina, M., Steinbeck, C. MAYGEN: an open-source chemical structure generator for constitutional isomers based on the orderly generation principle. Journal of Cheminformatics. 13 (1), 48(2021).
  7. Sims, C. C. Computational methods in the study of permutation groups. Computational Problems in Abstract Algebra. Leech, J. , Pergamon. 169-183 (1970).
  8. Mat, W. -K., Xue, H., Wong, J. T. -F. The genomics of LUCA. Frontiers in Bioscience. 13, 5605-5613 (2008).
  9. Fournier, G. P., Alm, E. J. Ancestral reconstruction of a pre-LUCA aminoacyl-tRNA synthetase ancestor supports the late addition of Trp to the genetic code. Journal of Molecular Evolution. 80 (3-4), 171-185 (2015).
  10. Higgs, P. G., Pudritz, R. E. A Thermodynamic basis for prebiotic amino acid synthesis and the nature of the first genetic code. Astrobiology. 9 (5), 483-490 (2009).
  11. Trifonov, E. N. Consensus temporal order of amino acids and evolution of the triplet code. Gene. 261 (1), 139-151 (2000).
  12. Cleaves, H. J. The origin of the biologically coded amino acids. Journal of Theoretical Biology. 263 (4), 490-498 (2010).
  13. Moosmann, B. Redox biochemistry of the genetic code. Trends in Biochemical Sciences. 46 (2), 83-86 (2021).
  14. Simkus, D. N., et al. Methodologies for analyzing soluble organic compounds in extraterrestrial samples: amino acids, amines, monocarboxylic acids, aldehydes, and ketones. Life. 9 (2), 47(2019).
  15. Criado-Reyes, J., Bizzarri, B. M., García-Ruiz, J. M., Saladino, R., Di Mauro, E. The role of borosilicate glass in Miller-Urey experiment. Scientific Reports. 11 (1), 21009(2021).
  16. Parker, E. T., et al. Primordial synthesis of amines and amino acids in a 1958 Miller H2S-rich spark discharge experiment. Proceedings of the National Academy of Sciences of the United States of America. 108 (14), 5526-5531 (2011).
  17. Bada, J. L. New insights into prebiotic chemistry from Stanley Miller's spark discharge experiments. Chemical Society Reviews. 42 (5), 2186-2196 (2013).
  18. RDKit: Open-source cheminformatics. , Available from: http://www.rdkit.org (2021).
  19. Yap, C. W. PaDEL-descriptor: An open source software to calculate molecular descriptors and fingerprints. Journal of Computational Chemistry. 32 (7), 1466-1474 (2011).
  20. SMARTS - A language for describing molecular patterns. Daylight Chemical Information Systems, Inc. , Available from: https://www.daylight.com/html/doc/theory/theory.smarts.html (2019).
  21. Meringer, M., Cleaves, H. J., Freeland, S. J. Beyond terrestrial biology: charting the chemical universe of α-amino acid structures. Journal of Chemical Information and Modeling. 53 (11), 2851-2862 (2013).
  22. Zherebker, A., et al. Speciation of organosulfur compounds in carbonaceous chondrites. Scientific Reports. 11 (1), 7410(2021).
  23. Tanford, C. The hydrophobic effect and the organization of living matter. Science. 200 (4345), 1012-1018 (1978).
  24. Grantham, R. Amino acid difference formula to help explain protein evolution. Science. 185 (4154), 862-864 (1974).
  25. Cordero, B., et al. Covalent radii revisited. Dalton Transactions. (21), 2832-2838 (2008).
  26. Cleaves, H. J., Butch, C., Burger, P. B., Goodwin, J., Meringer, M. One among millions: the chemical space of nucleic acid-like molecules. Journal of Chemical Information and Modeling. 59 (10), 4266-4277 (2019).

Przedruki i uprawnienia

Tagi

Generowanie strukturGenerator struktur molekularnychChemoinformatyka open sourcePoszukiwanie lekówFiltrowanie podstrukturGenerowanie deskryptorówTworzenie baz danych molekularnychAlternatywna biochemia