Celem tego protokołu jest efektywne generowanie i zarządzanie bibliotekami struktur małych cząsteczek za pomocą oprogramowania open-source.
Artykuł metodologiczny
Celem tego protokołu jest efektywne generowanie i zarządzanie bibliotekami struktur małych cząsteczek za pomocą oprogramowania open-source.
Wyczerpujące generowanie struktur molekularnych ma liczne zastosowania chemiczne i biochemiczne, takie jak projektowanie leków, budowa molekularnych baz danych, eksploracja alternatywnych biochemii i wiele innych. Matematycznie rzecz biorąc, są to generatory grafów z ograniczeniami chemicznymi. W tej dziedzinie najbardziej wydajnym obecnie generatorem (MOLGEN) jest produkt komercyjny, co ogranicza jego zastosowanie. Alternatywnie do tego, inny generator struktury molekularnej, MAYGEN, jest najnowszym narzędziem typu open source o wydajności porównywalnej z MOLGEN i zdolnością użytkowników do zwiększania jego wydajności poprzez dodawanie nowych funkcji. Jedną z dziedzin badań, które mogą skorzystać na tym rozwoju, jest astrobiologia; Generatory struktur umożliwiają naukowcom uzupełnianie danych eksperymentalnych o możliwości obliczeniowe dla alternatywnej biochemii. Protokół ten szczegółowo opisuje jeden przypadek użycia do generowania struktur w astrobiologii, a mianowicie generowania i selekcjonowania bibliotek alfa-aminokwasów. Korzystając z generatorów struktur typu open source i narzędzi cheminoinformatycznych, opisane tutaj praktyki mogą być wdrażane poza astrobiologię w celu taniego tworzenia i zarządzania bibliotekami struktur chemicznych dla dowolnego pytania badawczego.
Generowanie struktur molekularnych służy jako praktyczne zastosowanie ogólnego problemu wyczerpującego generowania grafów; biorąc pod uwagę kilka węzłów (atomów) i ograniczenia ich łączności (np. wartościowości, wielokrotności wiązań, pożądane/niepożądane podstruktury), ile połączonych grafów (molekuł) jest możliwych? Generatory struktur znalazły szerokie zastosowanie w odkrywaniu leków i rozwoju farmaceutycznym, gdzie mogą tworzyć ogromne biblioteki nowych struktur do badań przesiewowych in silico1.
Pierwszy generator struktur, CONGEN, został opracowany dla pierwszego projektu sztucznej inteligencji w chemii organicznej, DENDRAL2 (skrót od DENDRitic ALgorithm). W literaturze opisano kilka następców oprogramowania DENDRAL; Jednak nie wszystkie z nich były utrzymywane lub wydajne. Obecnie MOLGEN3 jest najnowocześniejszym generatorem struktur molekularnych. Niestety dla większości potencjalnych użytkowników jest to oprogramowanie o zamkniętym kodzie źródłowym i wymaga opłaty licencyjnej. W związku z tym zaistniała potrzeba wydajnego generatora struktur typu open source, który można łatwo dostosować do określonych zastosowań. Jednym z wyzwań stojących przed wydajnym generatorem struktur jest zarządzanie eksplozją kombinatoryczną; Wraz ze wzrostem rozmiaru wzoru cząsteczkowego wykładniczo zwiększa się rozmiar chemicznej przestrzeni wyszukiwania. Niedawny przegląd dokładniej bada historię i wyzwania związane z generowaniem struktur molekularnych4.
Przed 2021 rokiem, Parallel Molecule Generator (PMG)5 był najszybszym generatorem struktur open-source, ale nadal był wolniejszy od MOLGEN o rzędy wielkości. MAYGEN6 jest około 47 razy szybszy niż PMG i około 3 razy wolniejszy niż MOLGEN, co czyni MAYGEN najszybszym i najbardziej wydajnym generatorem struktur open-source dostępnym na rynku. Bardziej szczegółowe porównania i testy porównawcze można znaleźć w artykule wprowadzającym MAYGEN6. Kluczową cechą programu jest test oparty na porządkowaniu leksykograficznym dla struktur kanonicznych, uporządkowana metoda generowania grafów oparta na algorytmie Schreier-Sims7. Oprogramowanie można łatwo zintegrować z innymi projektami i ulepszyć zgodnie z potrzebami użytkowników.
Podobnie jak MOLGEN i PMG, MAYGEN bierze zdefiniowany przez użytkownika wzór molekularny i generuje wszystkie możliwe struktury dla tego wzoru. Na przykład, jeśli użytkownik uruchomi MAYGEN ze wzorem C5H12, MAYGEN wygeneruje wszystkie możliwe struktury zawierające pięć atomów węgla i dwanaście atomów wodoru. W przeciwieństwie do swojego odpowiednika PMG o otwartym kodzie źródłowym, MAYGEN może również obsługiwać "rozmyte" wzory molekularne, które używają interwałów zamiast dyskretnych liczb do liczenia każdego pierwiastka. Na przykład, jeśli użytkownik uruchomi MAYGEN ze wzorem C5-7H12-15, MAYGEN wygeneruje wszystkie możliwe struktury, które zawierają od pięciu do siedmiu atomów węgla i dwanaście do piętnastu atomów wodoru, co pozwala na proste generowanie struktur o szerokim zakresie składu atomowego.
Astrobiologia jest jedną z takich dziedzin, która może skorzystać z generatorów struktur molekularnych. Popularnym tematem w astrobiologii jest ewolucja alfabetu aminokwasów wspólnego dla całego istniejącego życia na Ziemi. Jedną z cech charakterystycznych Ostatniego Uniwersalnego Wspólnego Przodka (LUCA) jest użycie dwudziestu genetycznie kodowanych aminokwasów do budowy białek8,9. Na podstawie metaanaliz pracy w wielu dziedzinach10,11,12, około 10 z tych aminokwasów (Gly, Ala, Val, Asp, Glu, Ser, Thr, Leu, Ile, Pro) łatwo tworzy się w warunkach abiotycznych i prawdopodobnie tworzy alfabet aminokwasów organizmów pre-Luca. Z biegiem czasu ten "wczesny" alfabet został rozszerzony w odpowiedzi na różne potrzeby strukturalne i funkcjonalne. Na przykład, niedawna recenzja z Moosmann13 twierdzi, że dodanie nowszych członków genetycznie kodowanych aminokwasów (mianowicie Met, Tyr i Trp) pozwoliło na przetrwanie w środowisku bogatym w tlen, zapobiegając wewnątrzkomórkowej proliferacji reaktywnych form tlenu.
Stale rosnący zestaw technik chemii analitycznej pozwala na wgląd w struktury aminokwasów, które mogą powstawać w warunkach abiotycznych. Niedawny przegląd14 autorstwa Simkusa i innych szczegółowo opisuje metody używane do wykrywania licznych związków organicznych w meteorytach, a także związków organicznych z symulacji in vitro wczesnych środowisk Ziemi15,16,17. Systematyczne generowanie struktur chemicznych pozwala naukowcom na eksplorację poza związki organiczne wykryte za pomocą oprzyrządowania, wypełniając przestrzeń strukturalną wokół strukturalnych "wysp" zidentyfikowanych przez chemię analityczną. W przypadku "wczesnych" aminokwasów, to systematyczne generowanie struktur pokazuje możliwe chemie białek dostępne dla wczesnego życia, bez ograniczania eksploracji do struktur, które zostały eksperymentalnie wykryte w warunkach syntezy abiotycznej. Dzięki zestawom narzędzi chemicznych i wydajnym generatorom struktur, takim jak MAYGEN, tworzenie i eksplorowanie nowatorskich bibliotek struktur chemicznych jest teraz łatwiejsze niż kiedykolwiek wcześniej i może prowadzić bardziej szczegółowe badania nad alternatywnymi substancjami chemicznymi życia.
UWAGA: Podsumowanie protokołu znajduje się na Rysunku 1, natomiast szczegółowe informacje o wykorzystanym oprogramowaniu zawiera Tabela materiałów.

Rysunek 1: Schemat podsumowujący protokół. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
1. Pobieranie oprogramowania i plików
UWAGA: Wszystkie programy są bezpłatne do użytku indywidualnego i mogą być uruchamiane na komputerze osobistym.
2. Generowanie struktury przy użyciu MAYGEN
3. Filtrowanie związków z niepożądanymi podstrukturami
4. (Opcjonalnie) Dodatkowe modyfikacje struktury
UWAGA: Czynności te zostały wykonane w tym przykładzie, lecz mogą nie być wymagane przy kurateli innych bibliotek.
5. Generowanie deskryptorów
| Biblioteka | Wzór | Dodatkowe ograniczenia | Aminokwasy kodowane jako „wczesne” | Czas generowania (ms) | Struktury | ||||
| Początkowe | Końcowe | ||||||||
| 1 | Gly | C2H5NO2 | zawierać podstrukturę Gly | Gly | 192 | 84 | 1 | ||
| 2 | VAIL | PC0-3H3-9 | Val, Ala, Ile, Leu | 172 | 70 | 22 | |||
| 3 | DEST | PC0-3O1-2H3-5 | Asp, Glu, Ser, Thr | 481 | 1928 | 254 | |||
| 4 | Pro | C2-5NO2H7-11 | Zawierać podstrukturę N-meGly lub N-meAla | Pro | 4035 | 79777 | 16 | ||
| 5 | VAIL_S | PSC0-2H3-7 | 122 | 65 | 31 | ||||
| 6 | DEST_S | PSC0-2O1-2H3 | 349 | 1075 | 79 | ||||
| 7 | Pro_S | C2-4SNO2H7-9 | Zawierać podstrukturę N-meGly lub N-meAla | 3999 | 75734 | 10 | |||
Tabela 1: Biblioteki związków użyte w tym przykładzie. Biblioteki zbudowane na podstawie wzorów 1-4 (Gly, VAIL, DEST i Pro) opierają się na wcześniej opublikowanych wzorach rozmytych (fuzzy formulae) dla „wczesnych” kodowanych aminokwasów21, natomiast biblioteki zbudowane na podstawie wzorów 5-7 (VAIL_S, DEST_S i Pro_S) opierają się na wariantach wzorów 2-4, w których jeden z atomów węgla zostaje zastąpiony dwuwartościową siarką. Liczba struktur odzwierciedla liczbę cząsteczek wygenerowanych przez MAYGEN dla każdego wzoru („Wstępna”) oraz liczbę cząsteczek pozostałych po odfiltrowaniu tych z niepożądanymi podstrukturami („Końcowa”). Skróty: VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X; N-meX = N-metyloX.
Powyższe metody ogólne zastosowano do formuł opartych na „wczesnych” kodowanych aminokwasach, zgodnie z procedurą Meringera i wsp.21 Struktury z tzw. „czarnej listy” (badlist) pobrano z tego samego źródła i przekształcono w ciągi SMARTS, aby łatwo reprezentować wzorce podstrukturalne. W tym przykładzie nie wykorzystano dwóch podstruktur z czarnej listy: struktura 018 (CH3-CH-N) odpowiadała niemal izomerom proliny, które same w sobie nie były niestabilne; struktura 106 (R-C-C-OH, gdzie R=podstruktura alaniny przyłączona w węglu beta) odpowiadała kwasowi glutaminowemu, który jest kodowanym aminokwasem. Oprócz tych formuł chemicznych stworzono warianty, w których dwuwartościowa siarka zajmuje miejsce jednego atomu węgla i dwóch atomów wodoru. Ze względów wydajnościowych w kilku z tych formuł zastosowano trójwartościowy atom fosforu (np. „pseudoatom”) jako zamiennik węgla beta w podstrukturze alaniny. Tabela 1 przedstawia biblioteki wygenerowane w tym przykładzie, formuły użyte do ich utworzenia oraz liczbę zawartych w nich związków. Nazwy bibliotek opierają się na kodowanych aminokwasach, z których pochodzą: przy użyciu skrótu 3-literowego (Gly = glicyna, Pro = prolina) lub skrótu 1-literowego (VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina). Sufiks „_S” oznacza, że w formule oryginalnej biblioteki węgiel zastąpiono siarką (np. VAIL_S jest zbudowany na podstawie tej samej formuły przybliżonej co VAIL, ale z dwuwartościową siarką zastępującą jeden z atomów węgla).
Po wygenerowaniu struktur za pomocą MAYGEN, wynikające z tego biblioteki przefiltrowano w celu usunięcia związków zawierających co najmniej jedną podstrukturę znajdującą się na liście wykluczeń (badlist). Po tym filtrowaniu wszystkie atomy fosforu zastąpiono podstrukturą alaniny. Następnie utworzono wersje „zablokowane” (capped) wszystkich struktur, dodając grupę acetylową do N-końca oraz grupę N-metyloamidową do C-końca. Wykonano to, aby wyeliminować wpływ wolnych grup aminowych i karboksylowych w szkielecie alfa-aminokwasów na hydrofobowość. Program PaDEL-Descriptor został wykorzystany do obliczenia XLogP dla wszystkich struktur zablokowanych oraz obliczenia objętości van der Waalsa (VABC) dla wszystkich struktur niezablokowanych.
Rysunek 2 przedstawia przestrzeń chemiczną przefiltrowanych bibliotek, zdefiniowaną przez deskryptory VABC i XLogP. Tutaj zakres możliwych wartości logP rośnie wraz z objętością cząsteczki, nawet w bibliotekach pozbawionych wyraźnych łańcuchów bocznych hydrofilowych (np. VAIL, Pro). Aminokwasy kodowane z hydrokarbonowymi łańcuchami bocznymi były bardziej hydrofobowe niż większość innych aminokwasów o porównywalnej objętości z ich odpowiedniej biblioteki. Wydaje się, że tak samo jest w przypadku Met i Cys w porównaniu z innymi członkami biblioteki VAIL_S o podobnych objętościach. Aminokwasy kodowane z hydroksylowymi łańcuchami bocznymi (Ser i Thr) należały do najmniejszych członków biblioteki DEST, przy czym Asp był tylko nieco większy od Thr.
Rysunek 3 oraz Rysunek 4 przedstawiają wpływ zastąpienia węgla dwuwartościową siarką w łańcuchu bocznym alfa-aminokwasu na objętość i logP. Podstawienie siarką doprowadziło do niewielkiego wzrostu objętości cząsteczkowej we wszystkich bibliotekach (Rysunek 3). Wpływ podstawienia siarką na logP nie jest tak jednolity jak w przypadku objętości (Rysunek 4). Średni logP biblioteki VAIL_S jest nieco niższy niż w bibliotece VAIL, jednak efekt ten nie występuje w żadnej z pozostałych par bibliotek (DEST i DEST_S, Pro i Pro_S).
Rysunek 5 ilościowo określa wpływ na generowanie struktur zastosowania pseudoatomu zastępującego powszechną podstrukturę; w tym przypadku trójkoordynowany P zastąpił resztę alaniny podczas generowania struktury. Wykorzystanie pseudoatomu w procesie generowania struktur znacznie zmniejszyło liczbę wygenerowanych struktur o ok. 3 rzędy wielkości (Rysunek 5A) oraz całkowity czas potrzebny na wygenerowanie tych struktur o 1-2 rzędy wielkości (Rysunek 5B).

Rycina 2: Przestrzeń chemiczna wszystkich przefiltrowanych bibliotek aminokwasów. Czarne markery reprezentują aminokwasy z bibliotek bez siarki; żółte markery reprezentują aminokwasy z bibliotek wzbogaconych o siarkę. Koła: VAIL i VAIL_S; kwadraty: DEST i DEST_S; trójkąty: Pro i Pro_S; gwiazdki: aminokwasy kodowane. Należy zauważyć, że dwa kodowane aminokwasy zawierające siarkę (Met i Cys) nie są uznawane za aminokwasy „wczesne”, lecz znajdują się w bibliotece VAIL_S. Skróty: XLogP = współczynnik podziału; VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3: Średnie objętości van der Waalsa (w Å3) bibliotek z siarką i bez siarki. Czarne słupki reprezentują średnie objętości bibliotek bez siarki (VAIL, DEST, Pro), natomiast żółte słupki reprezentują średnie objętości wersji tych bibliotek z podstawioną siarką (VAIL_S, DEST_S, Pro_S). Słupki błędów przedstawiają odchylenie standardowe. Skróty: VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rysunek 4: Średnie wartości XLogP bibliotek z siarką i bez siarki. Czarne słupki reprezentują biblioteki bez siarki (VAIL, DEST, Pro), natomiast żółte słupki reprezentują wersje tych bibliotek z podstawnikiem siarkowym (VAIL_S, DEST_S, Pro_S). Słupki błędów przedstawiają odchylenie standardowe. Skróty: XLogP = współczynnik podziału; VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina; X_S = dwuwartościowa siarka zastępuje jeden z atomów węgla w bibliotece X. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 5: Wpływ trójwalentnego pseudoatomu na generowanie struktur w MAYGEN. Wszystkie testy przeprowadzono na komputerze PC z procesorem Intel i7-7700HQ o taktowaniu 2.8 GHz i 16 GB pamięci RAM, bez zapisywania struktur do pliku oraz z opcją -m w celu wykorzystania wielowątkowości. W testach z użyciem pseudoatomu zastosowano formuły rozmyte opisane w Tabeli 1. W testach bez pseudoatomu zastosowano te same formuły rozmyte, co w Tabeli 1, z następującymi zmianami: P zastąpiono N; liczbę atomów węgla zwiększono o 3; liczbę atomów wodoru zwiększono o 7; liczbę atomów tlenu zwiększono o 2. Czarne słupki przedstawiają biblioteki wygenerowane z pseudoatomem; szare słupki przedstawiają biblioteki wygenerowane bez pseudoatomu. (A) Liczba struktur wygenerowanych przy użyciu formuł rozmytych zastosowanych do budowy bibliotek VAIL i DEST z trójwalentnym fosforem zastępującym podstrukturę alaniny oraz bez niego. (B) Czas (w ms) potrzebny do zbudowania bibliotek VAIL i DEST z trójwalentnym fosforem zastępującym podstrukturę alaniny oraz bez niego. Skróty: VAIL = walina, alanina, izoleucyna, leucyna; DEST = kwas asparaginowy, kwas glutaminowy, seryna, treonina. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Plik uzupełniający 1: Notatnik przesiewowy podstruktur. Aby pobrać ten plik, kliknij tutaj.
Plik uzupełniający 2: Przykładowa lista błędów (badlist). Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 3: Przykładowa lista prawidłowych próbek (goodlist). Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 4: Notatnik zastępowania pseudoatomów. Kliknij tutaj, aby pobrać ten plik.
Plik uzupełniający 5: Notatnik dotyczący blokowania grup aminowych. Kliknij tutaj, aby pobrać ten plik.
Jedną z cech "wczesnych" aminokwasów jest brak siarki. Wspomniane wcześniej metaanalizy generalnie uważają, że kodowane aminokwasy zawierające siarkę (Cys i Met) były stosunkowo późnymi dodatkami do kodu genetycznego, a wnioski te potwierdza brak aminokwasów zawierających siarkę w meteorytach i eksperymentach z lampami zapłonowymi. Jednak związki siarkoorganiczne są łatwo wykrywalne w kometach i meteorytach22, a ponowna analiza eksperymentów z lampą iskrową z użyciem gazuH2Swykazała aminokwasy i inne związki organiczne zawierające siarkę16. Rozważając alternatywny alfabet aminokwasów, warto zapoznać się z tym wzbogaconym w siarkę.
W powyższym protokole generowanie struktury i filtrowanie podstruktury są uważane za kroki krytyczne; W zależności od składu gotowej biblioteki struktur, badacz może być zmuszony do wykonania tylko tych dwóch kroków. Instrukcje i oprogramowanie do dodatkowych działań (zastępowanie pseudoatomów i dodawanie podstruktur (w tym przypadku capping aminokwasów)) są dołączone w celu uzyskania bardziej odpowiednich obliczeń deskryptorowych (capping zapewnia, że na obliczenia XLogP ma wpływ łańcuch boczny, a nie grupy aminowe lub karboksylowe w szkielecie) oraz szybszego generowania struktury za pomocą pseudoatomu, co omówiono bardziej szczegółowo poniżej. Dodatkowo wykonywane są tutaj obliczenia deskryptorowe, które w łatwy sposób pozwalają na wizualizację różnorodności generowanych struktur i porównanie efektów wzbogacania siarką w gotowych bibliotekach.
Podczas gdy PaDEL-Descriptor może obliczyć tysiące właściwości molekularnych, objętość cząsteczkowa (obliczona objętość van der Waalsa) i współczynnik podziału (jako XLogP) zostały tutaj użyte z dwóch różnych powodów. Po pierwsze, te dwa deskryptory mierzą właściwości molekularne (odpowiednio rozmiar i hydrofobowość), które są znane większości chemików i biologów. Po drugie, w przypadku aminokwasów te dwie właściwości są znaczące. Przez dziesięciolecia wiadomo było, że wielkość aminokwasów i hydrofobowość wpływają na termodynamikę fałdowania białek23. Te dwie właściwości pomagają wyjaśnić częstotliwości podstawiania aminokwasów, które były integralną częścią zrozumienia ewolucji białek24.
Powyższy przykład pokazuje, że w dwóch badanych deskryptorach (objętość cząsteczkowa i hydrofobowość) podstawienie dwuwartościowej siarki na węgiel i dwa wodory nie powoduje istotnych zmian. Niewielki, nieistotny wzrost średniej objętości cząsteczkowej spowodowany podstawieniem siarki (ryc. 3) można przypisać większemu promieniowi kowalencyjnemu siarki (~103 pm) w porównaniu z węglem sp3 (~75 pm) lub sp2 (~73 pm)25. Podobnie, podstawienie siarki ma minimalny wpływ na średnią XLogP (ryc. 4). Największy efekt zaobserwowano między bibliotekami VAIL i VAIL_S, prawdopodobnie ze względu na połączenie biblioteki VAIL szczególnie hydrofobowej (łańcuchy boczne to tylko węglowodory) i grup sulfhydrylowych, które byłyby znacznie bardziej kwaśne niż grupy metylowe, które miałyby zastąpić. Minimalny efekt podstawiania siarki jest widoczny na rysunku 2, gdzie biblioteki z podstawieniem siarki zajmują tę samą przestrzeń chemiczną, co analogiczne biblioteki bez podstawiania siarki.
Zmniejszenie liczby struktur (Rysunek 5A) i czasu potrzebnego do wygenerowania tych struktur (Rysunek 5B) przy użyciu pseudoatomu nie jest zaskakujące. Użycie pseudoatomu zmniejsza liczbę ciężkich atomów, które muszą zostać włączone do wykresu chemicznego, zmniejszając liczbę węzłów grafu i powodując wykładnicze skrócenie czasu generowania i liczby struktur. W tym przypadku wybór fosforu trójwartościowego jako pseudoatomu wynika z podstawowej biochemii (brak potranslacyjnego dodawania grup fosforanowych, żadne genetycznie kodowane aminokwasy nie zawierają fosforu) oraz wartościowości atomu, który by go zastąpił (fosfor trójwartościowy można łatwo zastąpić czterowartościowym węglem, który jest pojedynczo związany z innym atomem lub grupą atomów). Podczas gdy dostarczony kod do podstawiania pseudoatomów jest specyficzny dla zastąpienia trójwartościowego fosforu podstrukturą alaniny, użytkownicy mogą dostosować kod do pracy z różnymi pseudoatomami lub podstrukturami zastępczymi, potencjalnie używając wielu pseudoatomów podczas początkowego generowania struktury, a następnie zastępując każdy pseudoatom większą podstrukturą molekularną.
Metody generowania struktur podobne do tych stosowanych w ramach projektu MAYGEN (i inne metody, takie jak sieci neuronowe) są już wykorzystywane w odkrywaniu leków do generowania bibliotek związków do badań przesiewowych in silico ; W niedawnym przeglądzie4 omówiono te metody bardziej szczegółowo. Ponieważ metody te są przeznaczone przede wszystkim do tworzenia cząsteczek podobnych do leków, istnieją pewne ograniczenia ich zdolności do generowania cząsteczek, takie jak wykorzystanie właściwości biologicznych lub farmaceutycznych w celu ograniczenia tworzonych struktur (odwrotne QSPR/QSAR) lub tworzenie struktur z ustalonej liczby bloków budulcowych podstruktury. Ponieważ astrobiologia skupia się bardziej na mnogości związków organicznych, które mogą tworzyć się abiotycznie, a mniej na jakichkolwiek produktach końcowych lub ich właściwościach, wyczerpujące generowanie struktur w ramach projektu MAYGEN jest idealne do tworzenia bibliotek struktur w celu odpowiedzi na pytania astrobiologiczne. Opisane tutaj podejście do filtrowania podkonstrukcji (wykonywane po wygenerowaniu struktury za pomocą zewnętrznego programu) różni się od konkurencyjnego programu MOLGEN tym, że filtrowanie podstruktury MOLGEN następuje podczas generowania konstrukcji. Ponieważ MAYGEN jest oprogramowaniem typu open source, jest nie tylko bardziej dostępny niż MOLGEN ze względu na koszt licencji MOLGEN, ale osoby fizyczne mogą wdrażać nowe funkcje, takie jak filtrowanie podstruktur podczas generowania struktury.
Jak napisano, opisany tutaj protokół koncentruje się na generowaniu i utrzymywaniu bibliotek stosunkowo małych alfa-aminokwasów. Aby wygenerować różne biblioteki, użytkownicy mogą nadać MAYGENOWI różne wzory molekularne, zmienić filtrowanie podstruktury, zmieniając maksymalny dozwolony rozmiar pierścienia i wartościowość wiązania, lub edytować pliki goodlist i badlist, aby dodać lub usunąć wzorce podstruktury. Modyfikacje protokołu, które obejmują zmianę sposobu dodawania lub zastępowania atomów i podstruktur (podstawienie pseudoatomów i ograniczenie molekularne) są wykonalne, ale będą wymagały zwrócenia większej uwagi na ograniczenia walencyjne, aby uniknąć błędów RDKit dotyczących nieprawidłowych wartościowości w zmodyfikowanych strukturach.
Opisany powyżej protokół jest przeznaczony dla małych alfa-aminokwasów. Jednak ogólny format (kompleksowe generowanie struktury za pomocą pseudoatomów, a następnie filtrowanie podstruktury i modyfikacje molekularne) jest bardzo elastyczny dla związków innych niż małe aminokwasy. Nawet w astrobiologii podobną niedawną procedurę z użyciem MOLGEN zastosowano do zbadania konstytucyjnych izomerów kwasów nukleinowych26. Oprócz narzędzi opisanych powyżej, MAYGEN można połączyć z innymi narzędziami chemicznymi typu open source, aby tworzenie i analizowanie nowych struktur chemicznych było przystępne cenowo i dostępne dla szerokiego wachlarza dziedzin badawczych.
Autorzy nie mają do ujawnienia żadnych konfliktów interesów.
MAY dziękuje za sfinansowanie przez Fundację Carl-Zeiss. Wszystkie rysunki zostały wygenerowane przy użyciu programu Microsoft Excel.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| conda v. 4.10.3 | https://www.anaconda.com/products/individual | ||
| Java 17 | https://java.com/en/download/help/download_options.html | ||
| MAYGEN v. 1.8 | https://github.com/MehmetAzizYirik/MAYGEN/releases | ||
| PaDEL-Descriptor v. 2.21 | http://www.yapcwsoft.com/dd/padeldescriptor/ | ||
| python v. 3.7.11 | zawarty w środowisku Anaconda | ||
| RDKit v. 2020.09.1.0 | https://www.rdkit.org/docs/Install.html, lub zainstalowany przez conda: https://anaconda.org/rdkit/rdkit | ||
| *Te konkretne wersje zostały użyte w tym manuskrypcie; użytkownik może uzyskać nowsze wersje, jeśli są dostępne. |