Qui, forniamo una metodologia che utilizza diverse rappresentazioni molecolari per visualizzare e analizzare lo spazio chimico dei set di dati dei composti naturali, con particolare attenzione alle applicazioni relative alla scoperta di farmaci.
Articolo metodologico
Qui, forniamo una metodologia che utilizza diverse rappresentazioni molecolari per visualizzare e analizzare lo spazio chimico dei set di dati dei composti naturali, con particolare attenzione alle applicazioni relative alla scoperta di farmaci.
Lo spazio chimico è uno spazio descrittore multidimensionale che racchiude tutte le possibili molecole, e si ritiene che almeno 1 x 1060 sostanze organiche con un peso molecolare inferiore a 500 Da siano potenzialmente rilevanti per la scoperta di farmaci. I prodotti naturali sono stati la fonte primaria delle nuove entità farmacologiche commercializzate negli ultimi quarant'anni e continuano ad essere una delle fonti più produttive per la creazione di farmaci innovativi. Gli strumenti computazionali basati sulla chemioinformatica accelerano il processo di sviluppo di farmaci per prodotti naturali. Sono stati utilizzati metodi che includono la stima delle bioattività, i profili di sicurezza, l'ADME e la misurazione della somiglianza dei prodotti naturali. Qui, esaminiamo i recenti sviluppi negli strumenti chemioinformatici progettati per visualizzare, caratterizzare ed espandere lo spazio chimico di set di dati di composti naturali utilizzando varie rappresentazioni molecolari, creare rappresentazioni visive di tali spazi e studiare le relazioni struttura-proprietà all'interno degli spazi chimici. Con un'enfasi sulle applicazioni di scoperta di farmaci, valutiamo i database open source BIOFACQUIM e PeruNPDB come prova di concetto.
I prodotti naturali (NP), che sono composti chimici creati dagli esseri viventi, sono stati utilizzati come trattamenti tradizionali per secoli. Le singole NP sono state create come farmaci nell'era moderna e sfruttate con successo come composti guida nella scoperta di farmaci1. Le sostanze marine, fungine, batteriche, vegetali ed endogene create dall'uomo e dagli animali sono incluse nella categoria dei composti bioattivi, così come i veleni e i veleni prodotti da vari animali2. Di conseguenza, per quarant'anni, il numero di farmaci prodotti dalle NP ha rappresentato una fonte significativa di nuove sostanze farmacologiche3, sottolineando che le NP sono state cruciali nello sviluppo di nuovi farmaci, in particolare per il trattamento del cancro e delle malattie infettive, nonché per altre condizioni terapeutiche come la sclerosi multipla e le malattie cardiovascolari4. Inoltre, il 64,9% dei 185 piccoli composti autorizzati per il trattamento del cancro tra il 1981 e il 2019 erano NP non modificati o farmaci sintetici con un farmacoforoNP 3.
La chemioinformatica, un'interdisciplinarietà ben consolidata che si basa sul concetto di spazio chimico, è stata utilizzata per analizzare e visualizzare lo spazio chimico delle qualità fisico-chimiche delle NP legate a tratti farmaco-simili5. La chemioinformatica ha dimostrato un impatto sostanziale sulla progettazione e la scoperta di farmaci basati su NP6. Lo spazio chimico di un gruppo di composti non è sempre unico. Dipenderà dall'insieme di descrittori utilizzati per definirlo, il che significa che lo studio dello spazio chimico delle NP come qualsiasi altro insieme di composti, presenta sfide particolari che si basano sulla rappresentazione molecolare7. Questo sforzo può essere affrontato utilizzando una varietà di descrittori molecolari e tecniche di visualizzazione dei dati. Al contrario, le tecniche più utilizzate sono l'analisi delle componenti principali (PCA), gli alberi delle impalcature, le mappe auto-organizzanti, la mappatura topografica generativa (GTM) e una nuova tecnica di visualizzazione chiamata mappe ad albero (TMAP)8. Inoltre, la raccolta, la valutazione e la diffusione delle informazioni chimiche delle NP nei database dei composti è uno degli usi della chemioinformatica nella ricerca sulle NP. Al contrario, con l'introduzione dei big data, questo è particolarmente pertinente9.
Qui, i database NP open-source BIOFACQUIM10 e PeruNPDB11 sono utilizzati per descrivere il protocollo che cerca la visualizzazione e la caratterizzazione dello spazio chimico di set di dati di composti naturali utilizzando varie rappresentazioni molecolari, crea rappresentazioni visive di tali spazi e studia le relazioni struttura-proprietà all'interno degli spazi chimici, con particolare attenzione alle applicazioni di scoperta di farmaci.
1. Download e installazione del software
2. Costruzione e cura di un database composto
NOTA: Trova sostanze e fonti che dispongano dei dati necessari. Si consiglia all'utente di avere i seguenti dettagli per ogni composto in un foglio di calcolo.
3. Descrittori molecolari e analisi della diversità
NOTA: I descrittori molecolari, come le qualità fisico-chimiche, le impronte digitali molecolari e gli scaffold chimici, sono gli approcci più comuni per rappresentare le molecole nelle applicazioni chemioinformatiche. L'analisi può essere eseguita qui: http://132.248.103.152:3838/PUMA/. Tutti i passaggi descritti di seguito sono descritti in dettaglio sul sito web PUMA.
4. Visualizzazione dello spazio chimico
NOTA: È possibile condensare la maggior parte dei dati pertinenti in un piccolo numero di variabili utilizzando la PCA e altre tecniche di riduzione della dimensionalità. In questo modo è possibile visualizzare lo spazio chimico.
5. Grafici di diversità del consenso
NOTA: Le rappresentazioni visive sono state sviluppate per riassumere alcune caratteristiche che possono essere utilizzate per quantificare la varietà. L'analisi dei grafici della diversità di consenso (CDP)12 può essere eseguita qui http://132.248.103.152:3838/CDPlots/.
Proprietà molecolari e visualizzazione dello spazio chimico
Tutti i composti nei set di dati BIOFACQUIM10, PeruNPDB11 e FDA13 avevano sei proprietà fisico-chimiche calcolate per loro. Queste qualità sono state poi tracciate su grafici a violino, che consentono di vedere come sono distribuite le proprietà dei tre set di dati studiati (Figura 1). I profili di distribuzione dei sei parametri fisico-chimici di interesse farmaceutico, vale a dire il peso molecolare (MW), il coefficiente di ripartizione ottanolo/acqua (clogP), l'area della superficie topologica (TPSA), la solubilità acquosa (clogS), il numero di atomi donatori di legami H (HBD) e il numero di atomi accettori di legami H (HBA), differiscono tra i set di dati. Tuttavia, i risultati del TPSA hanno dimostrato variazioni significative quando si confrontano i set di dati BIOFACQUIM e FDA con PeruNPDB. Utilizzando la PCA, è stata effettuata la visualizzazione dello spazio chimico del set di dati. Tuttavia, l'analisi PCA visiva 3D rivela che le molecole in entrambi i set di dati di NP si sovrappongono approssimativamente allo spazio chimico con la raccolta di farmaci approvati dalla FDA. Mentre in alcune aree, predominano le sostanze chimiche provenienti da PerùNPDB o BIOFACQUIM (Figura 2).
Analisi della diversità
Inoltre, per valutare la diversità dei set di dati è stato utilizzato un CDP basato su impronte molecolari, scaffold e attributi fisico-chimici. La diversità basata sulle proprietà dei database di PeruNPDB, BIOFAQUIM e FDA è stata calcolata utilizzando la distanza euclidea delle proprietà scalate. Inoltre, per valutare la diversità dei set di dati è stato utilizzato un CDP basato su impronte molecolari, scaffold e attributi fisico-chimici. La diversità basata sulle proprietà dei database di PeruNPDB, BIOFAQUIM e FDA è stata calcolata utilizzando la distanza euclidea delle proprietà scalate. I valori sul grafico CD a colori sono rappresentati da punti dati su una scala di colori continua. Le tonalità più luminose denotano una maggiore diversità, mentre i colori più scuri denotano una minore diversità. Ultimo ma non meno importante, vengono utilizzate varie dimensioni di punti per mostrare il numero relativo di composti in ciascun database, con punti dati più piccoli che rappresentano database con meno molecole. Poiché è stato scoperto nella regione in cui dovrebbe essere localizzata la maggiore diversità di impalcature e impronte digitali, i risultati hanno mostrato che i composti nel PerùNPDB avevano la più grande diversità globale (Figura 3).

Figura 1: Grafici a violino per le proprietà fisico-chimiche. Diagrammi a violino per le proprietà fisico-chimiche dei set di dati BIOFACQUIM, PeruNPDB e FDA. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 2: Rappresentazione visiva dello spazio chimico. Rappresentazione visiva dei set di dati BIOFACQUIM, PeruNPDB e FDA basata sui componenti principali di sei proprietà di rilevanza farmaceutica. Clicca qui per visualizzare una versione più grande di questa figura.

Figura 3: Grafico della diversità del consenso. Grafico della diversità di consenso che confronta la diversità globale dei set di dati BIOFACQUIM, PeruNPDB e FDA. Clicca qui per visualizzare una versione più grande di questa figura.
A causa dei suoi numerosi usi potenziali, come la classificazione dei composti, la selezione dei composti, l'esplorazione dei legami struttura-attività e la navigazione attraverso le interazioni struttura-proprietà, il concetto di spazio chimico è oggi ampiamente impiegato nel processo di scoperta e sviluppo di farmaci14. Inoltre, la creazione di database NP è una procedura fondamentale per eseguire vari studi computazionali, tra cui la progettazione di librerie chimiche, la caratterizzazione e il confronto dello spazio chimico, lo studio del SAR e lo screening virtuale, tra gli altri studi, a seguito dell'aumento della quantità di informazioni chimiche. Al contrario, l'addestramento agli algoritmi di intelligenza artificiale (AI) è un'altra applicazione cruciale. L'intelligenza artificiale si riferisce a un gruppo di tecniche computazionali che consentono alle macchine di imitare i processi cognitivi umani, tra cui la risoluzione dei problemi e l'apprendimento dall'esperienza15,16.
Sebbene i database di composti chimici, compresi i database NP, siano strumenti importanti nella scoperta di farmaci, è anche possibile rilevare potenziali molecole di successo utilizzando una varietà di tecniche di screening virtuale17. Inoltre, nei database NP sono stati trovati diversi farmaci candidati che hanno il potenziale per trattare malattie, tra cui la malattia da coronavirus18, la malattia di Alzheimer19 e la leishmaniosi20, tra le altre. Tuttavia, a causa degli attuali vincoli nell'elaborazione dei "big data", lo spazio chimico di tutte le potenziali molecole in un particolare campione biologico o ambientale potrebbe essere estremamente ampio e per lo più inesplorato21. Sebbene non esistano tecniche uniche o universali per le rappresentazioni chimiche dello spazio, un modo ampiamente utilizzato prevede la creazione di matrici di somiglianza che includono tutti i confronti a coppie22. La maggior parte delle informazioni pertinenti può essere ridotta in un piccolo numero di variabili (anche se perdendo informazioni) utilizzando la PCA e altre tecniche di riduzione della dimensionalità, consentendo la visualizzazione dello spazio chimico23.
La diversità di una libreria chimica può essere valutata in vari modi, in gran parte a seconda dei dati esaminati e, soprattutto, dell'obiettivo dello studio. La rappresentazione molecolare è una componente cruciale dell'analisi della diversità in aggiunta alla misura della diversità24. Sebbene gli scaffold chimici e i descrittori molecolari siano i due approcci utilizzati più frequentemente per rappresentare le molecole nell'analisi chemioinformatica, alcuni di essi hanno lo svantaggio di essere più difficili da comprendere25 e non identificano necessariamente le collezioni; Ad esempio, è tipico che vari composti abbiano profili di proprietà estremamente comparabili. Pertanto, considerare varie rappresentazioni di struttura offre un quadro più completo della diversità delle librerie composte. Questa è la base del concetto di multiverso chimico, che può essere definito come un gruppo o una raccolta di spazi chimici per lo stesso insieme di dati, ciascuno definito da un insieme di descrittori26.
Poiché i CDP utilizzano rappresentazioni multiple che possono essere suddivise in tre o due dimensioni per analizzare la diversità globale dei set di dati composti utilizzando una varietà di metriche, aiutano a confrontare e classificare le librerie chimiche12.
Gli autori dichiarano di non avere alcun conflitto di interessi.
HLBC e MACH ringraziano il finanziamento dell'Universidad Catolica de Santa Maria (sovvenzioni 27499-R-2020, 27574-R-2020, 7309-CU-2020 e 28048-R-2021). JLMF ringrazia il finanziamento di DGAPA, UNAM, Programa de Apoyo a Proyectos de Investigación e Innovación Tecnológica (PAPIIT), grant No. IN201321.
| Nome | Azienda | Numero di catalogo | Commenti |
|---|---|---|---|
| Piattaforma GraphPad Prism | GraphPad Prism | https://www.graphpad.com/ | |
| KNIME | Software KNIME | https://www.knime.com | |
| Osiris DataWarrior (OSIRIS) | openmolecules.org | https://openmolecules.org/datawarrior/ | |
| PUMA | PUMA: Piattaforma per l'analisi molecolare unificata | http://132.248.103.152:3838/PUMA/ |
Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE
Richiedi permesso