Subskrypcja JoVE jest wymagana do oglądania tego materiału. Zaloguj się lub rozpocznij bezpłatny okres próbny.

Artykuł metodologiczny

Wizualizacja i analiza przestrzeni chemicznej baz danych produktów naturalnych w celu odkrywania leków

1.5K wyświetleń

⸱

DOI:

10.3791/66349

⸱

6 września 2024

 ,  ,  , 

W tym artykule

Podsumowanie

Tutaj oferujemy metodologię, która wykorzystuje różne reprezentacje molekularne do wyświetlania i analizowania przestrzeni chemicznej zestawów danych o związkach naturalnych, z naciskiem na aplikacje związane z odkrywaniem leków.

Streszczenie

Przestrzeń chemiczna to wielowymiarowa przestrzeń deskryptorowa, która zawiera wszystkie możliwe cząsteczki, a co najmniej 1 x 1060 substancji organicznych o masie cząsteczkowej poniżej 500 Da uważa się za potencjalnie istotne dla odkrywania leków. Produkty naturalne były głównym źródłem nowych jednostek farmakologicznych wprowadzonych na rynek w ciągu ostatnich czterdziestu lat i nadal są jednym z najbardziej produktywnych źródeł tworzenia innowacyjnych leków. Narzędzia obliczeniowe oparte na chemoinformatyce przyspieszają proces opracowywania leków dla produktów naturalnych. Zastosowano metody obejmujące szacowanie bioaktywności, profile bezpieczeństwa, ADME i pomiar naturalnego podobieństwa produktu. W tym miejscu omówimy najnowsze osiągnięcia w narzędziach chemoinformatycznych przeznaczonych do wizualizacji, charakteryzowania i rozszerzania przestrzeni chemicznej zbiorów danych związków naturalnych przy użyciu różnych reprezentacji molekularnych, tworzenia wizualnych reprezentacji takich przestrzeni i badania relacji struktura-właściwości w przestrzeniach chemicznych. Kładąc nacisk na aplikacje do odkrywania leków, oceniamy bazy danych typu open source BIOFACQUIM i PeruNPDB jako dowód słuszności koncepcji.

Wprowadzenie

Produkty naturalne (NP), które są związkami chemicznymi tworzonymi przez żywe istoty, były wykorzystywane jako tradycyjne metody leczenia od wieków. Poszczególne nanocząsteczki zostały stworzone jako leki w epoce nowożytnej i z powodzeniem wykorzystywane jako związki ołowiowe w odkrywaniu leków1. Substancje morskie, grzybowe, bakteryjne, roślinne i endogenne wytwarzane przez ludzi i zwierzęta zaliczane są do kategorii związków bioaktywnych, podobnie jak jady i trucizny wytwarzane przez różne zwierzęta2. W rezultacie, przez czterdzieści lat, liczba leków wytwarzanych przez NPs stanowiła znaczące źródło nowych substancji farmakologicznych3, podkreślając, że NP były kluczowe w rozwoju nowych leków, szczególnie w leczeniu raka i chorób zakaźnych, a także w innych stanach terapeutycznych, takich jak stwardnienie rozsiane i choroby sercowo-naczyniowe4. Co więcej, 64,9% ze 185 małych związków, które zostały dopuszczone do leczenia raka w latach 1981-2019, było niezmodyfikowanymi NP lub lekami syntetycznymi z farmakoforem NP3.

Chemoinformatics, dobrze ugruntowana interdyscyplina, która opiera się na koncepcji przestrzeni chemicznej, została wykorzystana do analizy i wizualizacji przestrzeni chemicznej właściwości fizykochemicznych NP związanych z cechami podobnymi do leków5. Chemoinformatyka wykazała znaczący wpływ na projektowanie i odkrywanie leków w oparciu o NPs6. Przestrzeń chemiczna grupy związków nie zawsze jest unikalna. Będzie to zależało od zbioru deskryptorów użytych do jego zdefiniowania, co oznacza, że badanie przestrzeni chemicznej nanocząsteczek jako każdego innego zestawu związków, stanowi szczególne wyzwanie, które opiera się na reprezentacji molekularnej7. Do tego przedsięwzięcia można podejść za pomocą różnych deskryptorów molekularnych i technik wizualizacji danych. Natomiast najczęściej stosowanymi technikami są analiza głównych składowych (PCA), drzewa rusztowaniowe, mapy samoorganizujące się, generatywne mapowanie topograficzne (GTM) oraz nowatorska technika wizualizacji zwana mapami drzew (TMAPs)8. Również gromadzenie, ocena i rozpowszechnianie informacji chemicznych o nanocząsteczkach w bazach danych związków jest jednym z zastosowań chemoinformatyki w badaniach nad nanocząsteczkami. W przeciwieństwie do wprowadzenia dużych zbiorów danych, jest to szczególnie istotne9.

Tutaj bazy danych NP o otwartym kodzie źródłowym BIOFACQUIM10 i PeruNPDB11 są używane do opisania protokołu, który wyszukuje wizualizację i charakterystykę przestrzeni chemicznej zestawów danych związków naturalnych przy użyciu różnych reprezentacji molekularnych, tworzy wizualne reprezentacje takich przestrzeni i bada relacje struktura-właściwości w przestrzeniach chemicznych, z naciskiem na aplikacje do odkrywania leków.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

1. Pobieranie i instalacja oprogramowania

  1. Spraw, aby katalog tego projektu był świeży. Aby uzyskać wygodny dostęp, umieść pliki wykonywalne i pliki w tym katalogu.
  2. Zainstaluj wymagane pakiety oprogramowania po ich pobraniu.
  3. Pobierz najnowszą wersję oprogramowania The Osiris DataWarrior (OSIRIS), którą można znaleźć pod adresem https://openmolecules.org/datawarrior/
  4. Pobierz najnowszą wersję platformy analitycznej The Konstanz Information Miner (KNIME), którą można znaleźć pod adresem https://www.knime.com/
  5. Pobierz najnowszą wersję oprogramowania The GraphPad Prism, którą można znaleźć pod adresem https://www.graphpad.com/
    UWAGA: Oprogramowanie Osiris DataWarrior i platforma analityczna Konstanz Information Miner (KNIME) mogą być używane na komputerze osobistym i są bezpłatne do użytku indywidualnego, podczas gdy oprogramowanie GraphPad Prism można kupić pod adresem (https://www.graphpad.com/).

2. Budowa i opieka nad bazą danych złożonych

UWAGA: Znajdź substancje i źródła, które zawierają niezbędne dane. Zaleca się, aby użytkownik miał następujące szczegóły dla każdego związku w arkuszu kalkulacyjnym.

  1. Nazwij każdy związek. Dodaj nazwy wszystkich związków, które są opisane u źródła, w pierwszej kolumnie arkusza kalkulacyjnego.
  2. Przypisz wewnętrzny, ustandaryzowany kod w przypadku tworzenia kolekcji wewnętrznej lub przypisz numer, który jednoznacznie identyfikuje ten związek w konsultowanej bazie danych.
  3. Podaj dane wejściowe struktury za pomocą kanonicznej notacji SMILES, którą można zaimportować do innych narzędzi do edycji molekularnej.
    1. Zapisz bazę danych najlepiej w .csv formacie po zebraniu tych danych w arkuszu kalkulacyjnym.
    2. Wykorzystanie oprogramowania OSIRIS do wygenerowania plików danych strukturalnych zestawu danych (SDF), pliku danych molekularnych (mol) i mol2, które zawierają również informacje chemiczne i są kompatybilne z większością pakietów oprogramowania. W tym celu prześlij archiwum .csv, klikając przycisk Plik, a następnie przycisk Otwórz.
    3. Prześlij zestaw danych na platformę analityczną KNIME, aby poprawić jakość danych i zapobiec niedokładnym wynikom. W tym celu prześlij plik .sdf lub .mol2, klikając przycisk Plik, a następnie przycisk Otwórz.
  4. Zapewnij jednorodność w strukturach chemicznych.
    1. Zbadaj każdą strukturę chemiczną pod kątem prawidłowych typów atomów i kontroli walencyjnych. Standaryzacja struktur poprzez przekształcenie ich w kanoniczną formę tautomeryczną, kekulizację struktur aromatycznych, standaryzację położenia wiązań stereo i przekształcenie wszystkich niejawnych wodorów w jawne wodory za pomocą przepływu pracy Standaryzacji Struktur Molekularnych KNIME.
    2. Znajdź i wyeliminuj duplikaty po prawidłowej standaryzacji cząsteczek, wykorzystując przepływ pracy Standaryzacji Struktur Molekularnych KNIME. Wykorzystaj klucze InChI jako notację liniową do lokalizowania różnych stanów protonacji i tautomerów.
    3. Wyeliminuj duplikaty.
    4. Wylicz tautomery i stereoizomery. Ten krok ma kluczowe znaczenie w wirtualnych badaniach przesiewowych, zwłaszcza w przypadku korzystania z metod wyszukiwania, takich jak dokowanie lub filtrowanie oparte na farmakoforze.

3. Deskryptory molekularne i analiza różnorodności

UWAGA: Deskryptory molekularne, takie jak właściwości fizykochemiczne, molekularne odciski palców i chemiczne rusztowania, są najczęstszymi metodami przedstawiania cząsteczek w zastosowaniach chemoinformatycznych. Analizę można przeprowadzić tutaj: http://132.248.103.152:3838/PUMA/. Wszystkie kroki opisane poniżej są szczegółowo opisane na stronie internetowej PUMA.

  1. Oblicz sześć najbardziej rozpowszechnionych cech fizykochemicznych o znaczeniu farmakologicznym: masa cząsteczkowa (MW), współczynnik podziału oktanol/woda (clogP), pole powierzchni topologicznej (TPSA), rozpuszczalność w wodzie (clogS), liczba atomów donorowych wiązania H (HBD) i liczba atomów akceptorowych wiązań H (HBA). Więcej informacji można znaleźć na stronie internetowej PUMA.
  2. Oblicz 166-bitowe klucze MACCS, parami podobieństwo Tanimoto i rozszerzone odciski palców łączności o średnicy 4 (ECFP4), a także inne okrągłe odciski palców odpowiednie do wirtualnego badania przesiewowego, modelowania krajobrazu aktywności i badań zależności struktura-aktywność (SAR).
  3. Obliczanie statystyki tendencji centralnej dla każdego porównania parami. Zapewnij różnorodność w zbiorze danych za pomocą mniejszej średniej lub mediany w przeciwieństwie do odległości euklidesowej lub dowolnej ogólnej metryki odległości.
  4. Sprawdź, czy obliczone wartości zostały zapisane w literaturze lub obliczone dla innych referencyjnych baz danych w celach porównawczych. W tym celu zapoznaj się ze stronami internetowymi, takimi jak PubChem lub CHEMBL.
  5. Generuj wykresy skrzypiec do wizualizacji w oprogramowaniu GraphPad Prism, wyświetlając wartości maksymalne i minimalne.

4. Wizualizacja przestrzeni chemicznej

UWAGA: Możliwe jest skondensowanie większości istotnych danych do niewielkiej liczby zmiennych za pomocą PCA i innych technik redukcji wymiarowości. Dzięki temu możliwe są wizualizacje przestrzeni chemicznej.

  1. Zaznacz wszystkie sześć deskryptorów, aby określić podobieństwo lub odległość. Utwórz odpowiednio macierz podobieństwa (lub odległości).
  2. Wykonaj analizę PCA na matrycy. Wybierz dwa lub trzy główne komponenty do drukowania. Należy wziąć pod uwagę proporcję wariancji uchwyconej przez każdy składnik podstawowy.
  3. Generowanie dwu- lub trójwymiarowych reprezentacji wykresów punktowych dla PCA za pomocą węzła Plotly KNIME.

5. Wykresy różnorodności konsensusu

UWAGA: Wizualne reprezentacje zostały opracowane w celu podsumowania kilku cech, które mogą być użyte do ilościowego określenia różnorodności. Wykresy różnorodności konsensusu (CDP)12 analizy można przeprowadzić tutaj http://132.248.103.152:3838/CDPlots/.

  1. Utwórz wykres z liczbą związków w bazie danych, aby określić rozmiar punktu danych. Użyj różnorodności molekularnych odcisków palców dla osi x, różnorodności rusztowań dla osi y, różnorodności opartej na właściwościach fizykochemicznych dla ciągłej skali koloru oraz względnej liczby związków w zestawie danych dla rozmiaru punktu danych.
  2. Wygeneruj wykres wielu zmiennych za pomocą oprogramowania GraphPad Prism.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Właściwości molekularne i wizualizacja przestrzeni chemicznej
Wszystkie związki w zestawach danych BIOFACQUIM10, PeruNPDB11 i FDA13 miały obliczone sześć właściwości fizykochemicznych. Cechy te zostały następnie naniesione na wykresy skrzypiec, które pozwalają zobaczyć, jak rozkładają się właściwości trzech badanych zestawów danych (Rysunek 1). Profile rozkładu sześciu parametrów fizykochemicznych o znaczeniu ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Ze względu na wiele potencjalnych zastosowań, takich jak klasyfikacja związków, selekcja związków, badanie powiązań struktura-aktywność i nawigowanie po interakcjach struktura-właściwość, koncepcja przestrzeni chemicznej jest obecnie szeroko stosowana w procesie odkrywania i opracowywanialeków14. Również tworzenie baz danych NP jest podstawową procedurą wykonywania różnych badań obliczeniowych, w tym projektowania bibliotek chemicznych, charakteryzacji i porównania przestrzeni chemicznej, badania ...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Autorzy oświadczają, że nie ma dla nich konfliktu interesów.

Podziękowania

HLBC i MACH dziękują za dofinansowanie Universidad Catolica de Santa Maria (granty 27499-R-2020, 27574-R-2020, 7309-CU-2020 i 28048-R-2021). JLMF dziękuje za dofinansowanie DGAPA, UNAM, Programa de Apoyo a Proyectos de Investigación e Innovación Tecnológica (PAPIIT), grant No. IN201321.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
GraphPad PrismGraphPad Prismhttps://www.graphpad.com/
platforma KNIMEKNIMEhttps://www.knime.com
Osiris DataWarrior (OSIRIS)openmolecules.org https://openmolecules.org/datawarrior/
PUMA: Platforma do ujednoliconej analizy molekularnejhttp://132.248.103.152:3838/PUMA/
Oprogramowanie

Bibliografia

  1. Boufridi, A., Quinn, R. J. Harnessing the properties of natural products. Annu Rev Pharmacol Toxicol. 58, 451-470 (2018).
  2. Gómez-García, A., et al. Navigating the chemical space and chemical multiverse of a unified Latin American natural product database: LANaPDB. ChemRxiv. , (2023).
  3. Newman, D. J., Cragg, G. M. Natural products as sources of new drugs over the nearly four decades from 01/1981 to 09/2019. J Nat Prod. 83 (3), 770-803 (2020).
  4. Atanasov, A. G., Zotchev, S. B., Dirsch, V. M., Supuran, C. T. Natural products in drug discovery: advances and opportunities. Nat Rev Drug Discov. 20 (3), 200-216 (2021).
  5. Medina-Franco, J. L., Saldívar-González, F. I. Cheminformatics to characterize pharmacologically active natural products. Biomolecules. 10 (11), 1566(2020).
  6. Chen, Y., Garcia De Lomana, M., Friedrich, N. O., Kirchmair, J. Characterization of the Chemical Space of Known and Readily Obtainable Natural Products. J Chem Inf Model. 58 (8), 1518-1532 (2018).
  7. Gaytán-Hernández, D., Chávez-Hernández, A. L., López-López, E., Miranda-Salas, J., Saldívar-González, F. I., Medina-Franco, J. L. Art driven by visual representations of chemical space. ChemRxiv. , (2023).
  8. Zabolotna, Y., Ertl, P., Horvath, D., Bonachera, F., Marcou, G., Varnek, A. NP Navigator: A new look at the natural product chemical space. Mol Inform. 40 (9), e2100068(2021).
  9. Martinez-Mayorga, K., Madariaga-Mazon, A., Medina-Franco, J. L., Maggiora, G. The impact of chemoinformatics on drug discovery in the pharmaceutical industry. Expert Opin Drug Discov. 15 (3), 293-306 (2020).
  10. Pilón-Jiménez, B., Saldívar-González, F., Díaz-Eufracio, B., Medina-Franco, J. BIOFACQUIM: A Mexican compound database of natural products. Biomolecules. 9 (1), 31(2019).
  11. Barazorda-Ccahuana, H. L., et al. PeruNPDB: the Peruvian natural products database for in silico drug screening. Sci Rep. 13 (1), 7577(2023).
  12. González-Medina, M., Prieto-Martínez, F. D., Owen, J. R., Medina-Franco, J. L. Consensus diversity plots: a global diversity analysis of chemical libraries. J Cheminform. 8, 63(2016).
  13. Irwin, J. J., et al. ZINC20-A free ultralarge-scale chemical database for ligand discovery. J Chem Inf Model. 60 (12), 6065-6073 (2020).
  14. Naveja, J. J., Medina-Franco, J. L. Finding constellations in chemical space through core analysis. Front Chem. 7, 510(2019).
  15. Cavasotto, C. N., Di Filippo, J. I. Artificial intelligence in the early stages of drug discovery. Arch Biochem Biophys. 698, 108730(2021).
  16. Rosén, J., Gottfries, J., Muresan, S., Backlund, A., Oprea, T. I. Novel chemical space exploration via natural products. J Med Chem. 52 (7), 1953-1962 (2009).
  17. Sliwoski, G., Kothiwale, S., Meiler, J., Lowe Jr, E. W. Computational methods in drug discovery. Pharmacol Rev. 66 (1), 334-395 (2014).
  18. Goyzueta-Mamani, L. D., Barazorda-Ccahuana, H. L., Mena-Ulecia, K., Chávez-Fumagalli, M. A. Antiviral activity of metabolites from Peruvian plants against SARS-CoV-2: An in silico approach. Molecules. 26 (13), 3882(2021).
  19. Goyzueta-Mamani, L. D., et al. In silico analysis of metabolites from Peruvian native plants as potential therapeutics against Alzheimer's disease. Molecules. 27 (3), 918(2022).
  20. Barazorda-Ccahuana, H. L., et al. Computer-aided drug design approaches applied to screen natural product's structural analogs targeting arginase in Leishmania spp. F1000Research. 12, 93(2023).
  21. McGrady, M. Y., Colby, S. M., Nuñez, J. R., Renslow, R. S., Metz, T. O. AI for chemical space gap filling and novel compound generation. arXiv. , (2022).
  22. Medina-Franco, J., Martinez-Mayorga, K., Giulianotti, M., Houghten, R., Pinilla, C. Visualization of the chemical space in drug discovery. Curr Comput Aided-Drug Des. 4 (4), 322-333 (2008).
  23. Osolodkin, D. I., Radchenko, E. V., Orlov, A. A., Voronkov, A. E., Palyulin, V. A., Zefirov, N. S. Progress in visual representations of chemical space. Expert Opin Drug Discov. 10 (9), 959-973 (2015).
  24. Sheridan, R. P., Kearsley, S. K. Why do we need so many chemical similarity search methods. Drug Discov Today. 7 (17), 903-911 (2002).
  25. Singh, N., Guha, R., Giulianotti, M. A., Pinilla, C., Houghten, R. A., Medina-Franco, J. L. Chemoinformatic analysis of combinatorial libraries, drugs, natural products, and molecular libraries Small Molecule Repository. J Chem Inf Model. 49 (4), 1010-1024 (2009).
  26. Medina-Franco, J. L., Chávez-Hernández, A. L., López-López, E., Saldívar-González, F. I. Chemical multiverse: An expanded view of chemical space. Mol Inform. 41 (11), e2200116(2022).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Przedruki i uprawnienia

Przeglądaj więcej artykułów

Narzędzia chemoinformatycznereprezentacje molekularnezależności struktura-właściwośćprzewidywanie bioaktywnościszacowanie parametrów ADMEpodobieństwo do produktów naturalnychbazy danych open source

Ten artykuł został opublikowany

Film wkrótce dostępny