$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Seguendo questo protocollo sono stati prodotti risultati rappresentativi per studiare le associazioni tra le proteine mitocondriali (Tabella 2) e otto categorie di malattie cardiovascolari (Tabella 3). In queste categorie, abbiamo trovato 363.567 pubblicazioni pubblicate dal 2012 all'ottobre 2022 (362.878 classificate in base ai metadati MeSH, 6.923 classificate in base all'imputazione dell'etichetta). Tutte le pubblicazioni avevano un titolo, 276.524 avevano un abstract e 51.065 avevano il testo completo disponibile. Complessivamente, 584 delle 1.687 proteine mitocondriali interrogate sono state identificate all'interno delle pubblicazioni, mentre 3.284 delle loro 8.026 proteine funzionalmente correlate sono state identificate. In totale, sono state identificate 14 proteine uniche con punteggi significativi in tutte le categorie di malattia, con una soglia di z-score di 3,0 (Figura 5). L'analisi del pathway Reactome di queste proteine ha rivelato 12 pathway significativi per tutte le malattie (Figura 6). Tutte le proteine, i percorsi, le malattie e i punteggi sono stati integrati in un grafo della conoscenza (Tabella 4). Questo grafico di conoscenza è stato sfruttato per prevedere 12.688 nuove associazioni proteina-malattia e filtrato con un punteggio di probabilità di 0,90 per produrre 1.583 previsioni ad alta confidenza. Un esempio evidenziato di due associazioni proteina-malattia è mostrato nella Figura 7, illustrata nel contesto di altre entità biologiche rilevanti funzionalmente correlate alle proteine. Le metriche di valutazione del modello sono riportate nella Tabella 5.

Figura 1: Visualizzazione dinamica del flusso di lavoro. Questa figura rappresenta i quattro passaggi principali di questo flusso di lavoro. In primo luogo, le proteine rilevanti vengono curate in base ai termini OB forniti dall'utente (ad esempio, i componenti cellulari) e le categorie di malattie vengono preparate in base agli identificatori MeSH della malattia forniti dall'utente. In secondo luogo, le associazioni tra proteine e malattie vengono calcolate nella fase di estrazione del testo. Le pubblicazioni all'interno di un determinato intervallo di date vengono scaricate e indicizzate. Le pubblicazioni che studiano le malattie vengono identificate (tramite etichette MeSH e, facoltativamente, tramite etichette imputate) e i loro testi integrali vengono scaricati e indicizzati. I nomi delle proteine vengono interrogati all'interno delle pubblicazioni e utilizzati per calcolare i punteggi di associazione proteina-malattia. Successivamente, dopo l'estrazione del testo, questi punteggi aiutano a identificare le principali associazioni di proteine e percorsi. Infine, viene costruito un grafo della conoscenza che comprende queste proteine, malattie e le loro relazioni all'interno della base di conoscenza biomedica. Le nuove associazioni proteina-malattia sono previste sulla base del grafo della conoscenza costruito. Questi passaggi utilizzano i dati più recenti disponibili provenienti dalle basi di conoscenza biomedica e da PubMed. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 2: Architettura tecnica del flusso di lavoro. I dettagli tecnici di questo flusso di lavoro sono illustrati in questa figura. L'utente fornisce i numeri dell'albero MeSH delle categorie di malattie e dei termini GO. I documenti di testo vengono scaricati da PubMed, i documenti rilevanti per la malattia vengono identificati in base alle etichette MeSH fornite e i documenti senza etichette MeSH che indicano l'argomento ricevono etichette di categoria imputate. Vengono acquisite le proteine associate al/ai termine/i OB fornito/i. Questo set di proteine è stato ampliato per includere proteine che sono funzionalmente correlate tramite interazioni proteina-proteina, percorsi biologici condivisi e dipendenza da fattori di trascrizione. Queste proteine vengono interrogate all'interno di documenti rilevanti per la malattia e valutate da CaseOLAP. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 3: Esempio di documento elaborato. Di seguito viene presentato un esempio di documento di testo analizzato e indicizzato. In ordine, i campi pertinenti indicano il nome dell'indice (_index, _type), l'ID PubMed (_id, pmid), le sottosezioni del documento (titolo, abstract, full_text, introduzione, metodi, risultati, discussione) e altri metadati (anno, MeSH, posizione, rivista). Solo a scopo di visualizzazione, le sottosezioni del documento vengono troncate con puntini di sospensione. Il campo MeSH contiene gli argomenti del documento, che a volte possono essere forniti dal passaggio di imputazione dell'etichetta. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 4: Schema del grafo della conoscenza e risorse biomediche. Questa figura illustra lo schema del Knowledge Graph. Ogni nodo e spigolo rappresenta rispettivamente un tipo di nodo o di spigolo. I margini tra le malattie cardiovascolari (CVD) e le proteine sono ponderati in base ai punteggi CaseOLAP. I bordi dell'interazione proteina-proteina (PPI) sono ponderati in base ai punteggi di confidenza STRING. I bordi di dipendenza dal fattore di trascrizione (TFD) derivati da GRNdb/GTEx, i bordi dell'albero della malattia derivati da MeSH e i bordi del percorso derivati dal reattoma non sono ponderati. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 5: Principali associazioni proteine-malattie. Questa figura presenta le proteine mitocondriali significative per ogni categoria di malattia. La trasformazione Z-score è stata applicata ai punteggi CaseOLAP all'interno di ciascuna categoria per identificare le proteine significative utilizzando una soglia di 3,0. (Torna su) Numero di proteine mitocondriali significative per ciascuna malattia: questi grafici a violino mostrano la distribuzione dei punteggi z per le proteine in ciascuna categoria di malattia. Il numero totale di proteine significative per ciascuna categoria di malattia è mostrato sopra ogni grafico a violino. Un totale di 14 proteine uniche sono state identificate come significative in tutte le malattie e alcune proteine erano significative per più malattie. (In basso) Proteine con il punteggio più alto: la mappa di calore mostra le prime 10 proteine che hanno ottenuto i punteggi z medi più alti in tutte le malattie. I valori vuoti non rappresentano alcun punteggio ottenuto tra la proteina e la malattia. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 6: Principali associazioni pathway-malattia. Questa figura illustra i principali percorsi biologici associati alle categorie di malattie studiate, come determinato tramite l'analisi del percorso del reattoma. Tutte le analisi del percorso sono state filtrate con p < 0,05. I valori della mappa di calore rappresentano lo z-score medio di tutte le proteine all'interno del percorso. (Torna su) Percorsi conservati tra tutte le malattie: Complessivamente, sono state identificate 14 proteine con rilevanza per tutte le categorie di malattia e sono stati rivelati 12 percorsi conservati tra tutte le categorie di malattia. È stato costruito un dendrogramma basato sulla struttura gerarchica del percorso per collegare i percorsi con funzioni biologiche simili. L'altezza del dendrogramma rappresenta la profondità relativa all'interno della gerarchia del percorso; Le funzioni biologiche più ampie hanno arti più lunghi e percorsi più specifici hanno arti più corti. (In basso) Percorsi distinti per una categoria di malattia: l'analisi del percorso è stata eseguita utilizzando proteine che hanno raggiunto un punteggio z significativo in ciascuna malattia. Le prime tre vie con i valori p più bassi associati a ciascuna malattia sono mostrate e indicate da asterischi. I percorsi potrebbero essere tra i primi tre in più malattie. Fare clic qui per visualizzare una versione più grande di questa figura.

Figura 7: Applicazione del deep learning per il completamento del knowledge graph. In questa figura viene presentato un esempio di applicazione del deep learning a un grafo della conoscenza specifico della malattia. Sono previste relazioni nascoste tra proteine e malattia, e queste sono indicate in blu. Vengono visualizzate le probabilità calcolate per entrambe le stime, con valori compresi tra 0,0 e 1,0 e con 1,0 che indica una previsione forte. Sono incluse diverse proteine con interazioni note, che rappresentano le interazioni proteina-proteina, la dipendenza dal fattore di trascrizione e i percorsi biologici condivisi. Per la visualizzazione, viene mostrato un sottografo di alcuni nodi con rilevanza per l'esempio evidenziato. Legenda: IHD = cardiopatia ischemica; R-HSA-1430728 = metabolismo; O14949 = subunità 8 del complesso del citocromo b-c1; P17568 = NADH deidrogenasi (ubichinone) 1 subunità 7 del sottocomplesso beta; Q9NYF8 Fattore di trascrizione associato a Bcl-2 1, punteggio: 7,24 x 10−7; P49821 = NADH deidrogenasi (ubichinone) flavoproteina 1, mitocondriale, punteggio: 1,06 x 10−5; P31930 = subunità 1 del complesso del citocromo b-c1, mitocondriale, punteggio: 4,98 x 10−5; P99999 = citocromo c, punteggio: 0,399. Fare clic qui per visualizzare una versione più grande di questa figura.
Tabella 1: Flusso di lavoro e passaggi di limitazione della velocità. Questa tabella presenta stime approssimative del tempo di calcolo per ogni fase del flusso di lavoro. Le opzioni per includere i componenti della pipeline modificheranno il tempo di esecuzione totale necessario per completare l'analisi. La stima del tempo totale varia a seconda delle risorse computazionali disponibili, comprese le specifiche hardware e le impostazioni software. Come stima approssimativa, il protocollo ha impiegato 36 ore di runtime attivo per essere eseguito sul nostro server di calcolo, con sei core, 32 Gb di RAM e 2 Tb di spazio di archiviazione, ma questo potrebbe essere più veloce o più lento su altri dispositivi. Clicca qui per scaricare questa tabella.
Tabella 2: Assemblaggio automatico delle proteine componenti cellulari. Questa tabella mostra il numero di proteine associate a un dato componente cellulare (cioè il termine GO), le proteine funzionalmente correlate ad esse tramite interazioni proteina-proteina (PPI), percorsi condivisi (PW) e dipendenza da fattori di trascrizione (TFD). Il numero di proteine totali è il numero di proteine di tutte le categorie precedenti combinate. Tutte le proteine funzionalmente correlate sono state ottenute utilizzando i parametri predefiniti di CaseOLAP LIFT. Clicca qui per scaricare questa tabella.
Tabella 3: Statistiche sull'imputazione delle etichette MeSH. Questa tabella mostra le categorie di malattie, i numeri dell'albero MeSH utilizzati come termine padre di tutte le malattie incluse nella categoria, il numero di articoli PubMed trovati in ciascuna categoria dal 2012 al 2022 e il numero di articoli aggiuntivi inclusi in base alla fase di imputazione dell'etichetta. Clicca qui per scaricare questa tabella.
Tabella 4: Statistiche sulla costruzione del grafo della conoscenza. Questa tabella descrive le statistiche per le dimensioni del Knowledge Graph costruito, inclusi i vari nodi e tipi di spigoli. I punteggi CaseOLAP rappresentano la relazione tra una proteina e una categoria di malattie cardiovascolari (CVD). Clicca qui per scaricare questa tabella.
Tabella 5: Statistiche e convalide di previsione del Knowledge Graph. Questa tabella riporta le metriche di valutazione per la previsione del collegamento del grafo della conoscenza di associazioni proteina-malattia nuove/nascoste. Gli archi del grafo della conoscenza sono stati partizionati in set di dati di training e test 70/30 e la connettività del grafo degli archi è stata mantenuta in entrambi i set di dati. L'accuratezza indica la proporzione di stime classificate correttamente, mentre l'accuratezza bilanciata corregge lo squilibrio di classe. La specificità indica la proporzione di previsioni negative correttamente classificate. La precisione indica la proporzione di previsioni positive corrette rispetto a tutte le previsioni positive, mentre il richiamo indica la proporzione di previsioni positive corrette tra tutti i bordi positivi (ad esempio, le associazioni proteina-malattia identificate tramite text-mining). Il punteggio F1 è la media armonica della precisione e del richiamo. L'area sotto la curva caratteristica operativa del ricevitore (AUROC) descrive quanto bene il modello distingue tra previsioni positive e negative, con 1,0 che indica un classificatore perfetto. L'area sotto la curva di precisione-richiamo (AUPRC) misura il compromesso tra precisione e richiamo a soglie di probabilità variabili, con valori più alti che indicano prestazioni migliori. Clicca qui per scaricare questa tabella.