Tutaj oferujemy metodologię, która wykorzystuje różne reprezentacje molekularne do wyświetlania i analizowania przestrzeni chemicznej zestawów danych o związkach naturalnych, z naciskiem na aplikacje związane z odkrywaniem leków.
Artykuł metodologiczny
Tutaj oferujemy metodologię, która wykorzystuje różne reprezentacje molekularne do wyświetlania i analizowania przestrzeni chemicznej zestawów danych o związkach naturalnych, z naciskiem na aplikacje związane z odkrywaniem leków.
Przestrzeń chemiczna to wielowymiarowa przestrzeń deskryptorowa, która zawiera wszystkie możliwe cząsteczki, a co najmniej 1 x 1060 substancji organicznych o masie cząsteczkowej poniżej 500 Da uważa się za potencjalnie istotne dla odkrywania leków. Produkty naturalne były głównym źródłem nowych jednostek farmakologicznych wprowadzonych na rynek w ciągu ostatnich czterdziestu lat i nadal są jednym z najbardziej produktywnych źródeł tworzenia innowacyjnych leków. Narzędzia obliczeniowe oparte na chemoinformatyce przyspieszają proces opracowywania leków dla produktów naturalnych. Zastosowano metody obejmujące szacowanie bioaktywności, profile bezpieczeństwa, ADME i pomiar naturalnego podobieństwa produktu. W tym miejscu omówimy najnowsze osiągnięcia w narzędziach chemoinformatycznych przeznaczonych do wizualizacji, charakteryzowania i rozszerzania przestrzeni chemicznej zbiorów danych związków naturalnych przy użyciu różnych reprezentacji molekularnych, tworzenia wizualnych reprezentacji takich przestrzeni i badania relacji struktura-właściwości w przestrzeniach chemicznych. Kładąc nacisk na aplikacje do odkrywania leków, oceniamy bazy danych typu open source BIOFACQUIM i PeruNPDB jako dowód słuszności koncepcji.
Produkty naturalne (NP), które są związkami chemicznymi tworzonymi przez żywe istoty, były wykorzystywane jako tradycyjne metody leczenia od wieków. Poszczególne nanocząsteczki zostały stworzone jako leki w epoce nowożytnej i z powodzeniem wykorzystywane jako związki ołowiowe w odkrywaniu leków1. Substancje morskie, grzybowe, bakteryjne, roślinne i endogenne wytwarzane przez ludzi i zwierzęta zaliczane są do kategorii związków bioaktywnych, podobnie jak jady i trucizny wytwarzane przez różne zwierzęta2. W rezultacie, przez czterdzieści lat, liczba leków wytwarzanych przez NPs stanowiła znaczące źródło nowych substancji farmakologicznych3, podkreślając, że NP były kluczowe w rozwoju nowych leków, szczególnie w leczeniu raka i chorób zakaźnych, a także w innych stanach terapeutycznych, takich jak stwardnienie rozsiane i choroby sercowo-naczyniowe4. Co więcej, 64,9% ze 185 małych związków, które zostały dopuszczone do leczenia raka w latach 1981-2019, było niezmodyfikowanymi NP lub lekami syntetycznymi z farmakoforem NP3.
Chemoinformatics, dobrze ugruntowana interdyscyplina, która opiera się na koncepcji przestrzeni chemicznej, została wykorzystana do analizy i wizualizacji przestrzeni chemicznej właściwości fizykochemicznych NP związanych z cechami podobnymi do leków5. Chemoinformatyka wykazała znaczący wpływ na projektowanie i odkrywanie leków w oparciu o NPs6. Przestrzeń chemiczna grupy związków nie zawsze jest unikalna. Będzie to zależało od zbioru deskryptorów użytych do jego zdefiniowania, co oznacza, że badanie przestrzeni chemicznej nanocząsteczek jako każdego innego zestawu związków, stanowi szczególne wyzwanie, które opiera się na reprezentacji molekularnej7. Do tego przedsięwzięcia można podejść za pomocą różnych deskryptorów molekularnych i technik wizualizacji danych. Natomiast najczęściej stosowanymi technikami są analiza głównych składowych (PCA), drzewa rusztowaniowe, mapy samoorganizujące się, generatywne mapowanie topograficzne (GTM) oraz nowatorska technika wizualizacji zwana mapami drzew (TMAPs)8. Również gromadzenie, ocena i rozpowszechnianie informacji chemicznych o nanocząsteczkach w bazach danych związków jest jednym z zastosowań chemoinformatyki w badaniach nad nanocząsteczkami. W przeciwieństwie do wprowadzenia dużych zbiorów danych, jest to szczególnie istotne9.
Tutaj bazy danych NP o otwartym kodzie źródłowym BIOFACQUIM10 i PeruNPDB11 są używane do opisania protokołu, który wyszukuje wizualizację i charakterystykę przestrzeni chemicznej zestawów danych związków naturalnych przy użyciu różnych reprezentacji molekularnych, tworzy wizualne reprezentacje takich przestrzeni i bada relacje struktura-właściwości w przestrzeniach chemicznych, z naciskiem na aplikacje do odkrywania leków.
1. Pobieranie i instalacja oprogramowania
2. Budowa i opieka nad bazą danych złożonych
UWAGA: Znajdź substancje i źródła, które zawierają niezbędne dane. Zaleca się, aby użytkownik miał następujące szczegóły dla każdego związku w arkuszu kalkulacyjnym.
3. Deskryptory molekularne i analiza różnorodności
UWAGA: Deskryptory molekularne, takie jak właściwości fizykochemiczne, molekularne odciski palców i chemiczne rusztowania, są najczęstszymi metodami przedstawiania cząsteczek w zastosowaniach chemoinformatycznych. Analizę można przeprowadzić tutaj: http://132.248.103.152:3838/PUMA/. Wszystkie kroki opisane poniżej są szczegółowo opisane na stronie internetowej PUMA.
4. Wizualizacja przestrzeni chemicznej
UWAGA: Możliwe jest skondensowanie większości istotnych danych do niewielkiej liczby zmiennych za pomocą PCA i innych technik redukcji wymiarowości. Dzięki temu możliwe są wizualizacje przestrzeni chemicznej.
5. Wykresy różnorodności konsensusu
UWAGA: Wizualne reprezentacje zostały opracowane w celu podsumowania kilku cech, które mogą być użyte do ilościowego określenia różnorodności. Wykresy różnorodności konsensusu (CDP)12 analizy można przeprowadzić tutaj http://132.248.103.152:3838/CDPlots/.
Właściwości molekularne i wizualizacja przestrzeni chemicznej
Wszystkie związki w zestawach danych BIOFACQUIM10, PeruNPDB11 i FDA13 miały obliczone sześć właściwości fizykochemicznych. Cechy te zostały następnie naniesione na wykresy skrzypiec, które pozwalają zobaczyć, jak rozkładają się właściwości trzech badanych zestawów danych (Rysunek 1). Profile rozkładu sześciu parametrów fizykochemicznych o znaczeniu farmaceutycznym, a mianowicie masy cząsteczkowej (MW), współczynnika podziału oktanol/woda (clogP), powierzchni topologicznej (TPSA), rozpuszczalności w wodzie (clogS), liczby atomów donorowych wiązania H (HBD) i liczby atomów akceptorowych wiązań H (HBA), różnią się między zestawami danych. Jednak wyniki TPSA wykazały znaczne odchylenia podczas porównywania zestawów danych BIOFACQUIM i FDA z PeruNPDB. Korzystając z PCA, przeprowadzono wizualizację przestrzeni chemicznej zestawu danych. Jednak wizualna analiza PCA w 3D ujawnia, że cząsteczki w obu zestawach danych NP z grubsza pokrywają się z przestrzenią chemiczną z kolekcją zatwierdzonych farmaceutyków FDA. Podczas gdy w niektórych obszarach dominują chemikalia z PeruNPDB lub BIOFACQUIM (Rysunek 2).
Analiza różnorodności
Ponadto do oceny różnorodności zestawów danych wykorzystano CDP oparty na molekularnych odciskach palców, rusztowaniach i atrybutach fizykochemicznych. Różnorodność baz danych z PeruNPDB, BIOFAQUIM i FDA została obliczona na podstawie odległości euklidesowej skalowanych właściwości. Poza tym do oceny różnorodności zbiorów danych wykorzystano CDP oparty na molekularnych odciskach palców, rusztowaniach i atrybutach fizykochemicznych. Różnorodność baz danych z PeruNPDB, BIOFAQUIM i FDA została obliczona na podstawie odległości euklidesowej skalowanych właściwości. Wartości na kolorowym wykresie CD są reprezentowane przez punkty danych na ciągłej skali kolorów. Jaśniejsze odcienie oznaczają większą różnorodność, podczas gdy ciemniejsze kolory oznaczają mniejszą różnorodność. Wreszcie, co nie mniej ważne, różne rozmiary punktów są wykorzystywane do pokazania względnej liczby związków w każdej bazie danych, przy czym mniejsze punkty danych reprezentują bazy danych z mniejszą liczbą cząsteczek. Ponieważ odkryto go w regionie, w którym powinno znajdować się największe zróżnicowanie rusztowań i odcisków palców, wyniki wykazały, że związki w PeruNPDB miały największą globalną różnorodność (Rysunek 3).

Rysunek 1: Wykresy skrzypiec dla właściwości fizykochemicznych. Wykresy skrzypcowe dla właściwości fizykochemicznych zestawów danych BIOFACQUIM, PeruNPDB i FDA. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 2: Wizualna reprezentacja przestrzeni chemicznej. Wizualna reprezentacja zbiorów danych BIOFACQUIM, PeruNPDB i FDA oparta na głównych składnikach sześciu właściwości o znaczeniu farmaceutycznym. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.

Rysunek 3: Wykres różnorodności konsensusu. Wykres różnorodności konsensusu porównujący globalną różnorodność zbiorów danych BIOFACQUIM, PeruNPDB i FDA. Kliknij tutaj, aby zobaczyć większą wersję tego rysunku.
Ze względu na wiele potencjalnych zastosowań, takich jak klasyfikacja związków, selekcja związków, badanie powiązań struktura-aktywność i nawigowanie po interakcjach struktura-właściwość, koncepcja przestrzeni chemicznej jest obecnie szeroko stosowana w procesie odkrywania i opracowywanialeków14. Również tworzenie baz danych NP jest podstawową procedurą wykonywania różnych badań obliczeniowych, w tym projektowania bibliotek chemicznych, charakteryzacji i porównania przestrzeni chemicznej, badania SAR i wirtualnych badań przesiewowych, między innymi, w wyniku wzrostu ilości informacji chemicznych. Z kolei szkolenie w algorytmach sztucznej inteligencji (AI) jest kolejnym kluczowym zastosowaniem. Sztuczna inteligencja odnosi się do grupy technik obliczeniowych, które umożliwiają maszynom naśladowanie ludzkich procesów poznawczych, w tym rozwiązywanie problemów i uczenie się na podstawie doświadczenia15,16.
Chociaż bazy danych związków chemicznych, w tym bazy danych NP, są ważnymi narzędziami w odkrywaniu leków, możliwe jest również wykrywanie potencjalnie trafionych cząsteczek przy użyciu różnych wirtualnych technik przesiewowych17. Ponadto w bazach danych NP znaleziono kilka kandydatów na leki, które mogą potencjalnie leczyć choroby, w tym między innymi chorobę koronawirusową18, chorobę Alzheimera19 i leiszmaniozę20. Jednak ze względu na obecne ograniczenia w przetwarzaniu "dużych zbiorów danych", przestrzeń chemiczna wszystkich potencjalnych cząsteczek w danej próbce biologicznej lub środowiskowej może być niezwykle duża i w większościniezbadana. Chociaż nie ma unikalnych ani uniwersalnych technik reprezentacji przestrzeni chemicznej, jednym z powszechnie stosowanych sposobów jest tworzenie macierzy podobieństwa, które zawierają wszystkie porównania parami22. Większość istotnych informacji można sprowadzić do niewielkiej liczby zmiennych (aczkolwiek tracąc informacje) za pomocą PCA i innych technik redukcji wymiarowości, umożliwiając wizualizację przestrzeni chemicznej23.
Różnorodność biblioteki chemicznej może być oceniana na różne sposoby, w dużej mierze w zależności od badanych danych i, co najważniejsze, celu badania. Reprezentacja molekularna jest kluczowym elementem analizy różnorodności, obok miary różnorodności24. Chociaż rusztowania chemiczne i deskryptory molekularne są dwoma podejściami najczęściej stosowanymi do reprezentowania cząsteczek w analizie chemoinformatycznej, niektóre z nich mają tę wadę, że są trudniejsze do zrozumienia25 i niekoniecznie identyfikują zbiory; Na przykład typowe jest, że różne związki mają niezwykle porównywalne profile właściwości. W związku z tym uwzględnienie różnych reprezentacji struktury daje bardziej wszechstronny obraz różnorodności bibliotek złożonych. Jest to podstawa koncepcji wieloświata chemicznego, który można zdefiniować jako grupę lub zbiór przestrzeni chemicznych dla tego samego zestawu danych, z których każda jest zdefiniowana przez zestaw deskryptorów26.
Ponieważ CDP używają wielu reprezentacji, które można podzielić na trzy lub dwa wymiary, aby analizować globalną różnorodność złożonych zestawów danych przy użyciu różnych wskaźników, pomagają one porównywać i kategoryzować biblioteki chemiczne12.
Autorzy oświadczają, że nie ma dla nich konfliktu interesów.
HLBC i MACH dziękują za dofinansowanie Universidad Catolica de Santa Maria (granty 27499-R-2020, 27574-R-2020, 7309-CU-2020 i 28048-R-2021). JLMF dziękuje za dofinansowanie DGAPA, UNAM, Programa de Apoyo a Proyectos de Investigación e Innovación Tecnológica (PAPIIT), grant No. IN201321.
| Nazwa | Firma | Numer katalogowy | Komentarze |
|---|---|---|---|
| GraphPad Prism | GraphPad Prism | https://www.graphpad.com/ | |
| platforma KNIME | KNIME | https://www.knime.com | |
| Osiris DataWarrior (OSIRIS) | openmolecules.org https://openmolecules.org/datawarrior/ | ||
| PUMA | : Platforma do ujednoliconej analizy molekularnej | http://132.248.103.152:3838/PUMA/ |
Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE
Poproś o pozwolenie