Articolo metodologico

DeepOmicsAE: Rappresentazione dei moduli di segnalazione nella malattia di Alzheimer con analisi di deep learning di proteomica, metabolomica e dati clinici

2.3K visualizzazioni

DOI:

10.3791/65910

15 dicembre 2023

In questo articolo

Sommario

DeepOmicsAE è un flusso di lavoro incentrato sull'applicazione di un metodo di deep learning (ad esempio, un autoencoder) per ridurre la dimensionalità dei dati multi-omici, fornendo una base per modelli predittivi e moduli di segnalazione che rappresentano più livelli di dati omici.

Abstract

I grandi set di dati omici stanno diventando sempre più disponibili per la ricerca sulla salute umana. Questo documento presenta DeepOmicsAE, un flusso di lavoro ottimizzato per l'analisi di set di dati multi-omici, tra cui proteomica, metabolomica e dati clinici. Questo flusso di lavoro utilizza un tipo di rete neurale chiamata autoencoder, per estrarre un insieme conciso di funzionalità dai dati di input multi-omici ad alta dimensionalità. Inoltre, il flusso di lavoro fornisce un metodo per ottimizzare i parametri chiave necessari per implementare l'autoencoder. Per mostrare questo flusso di lavoro, i dati clinici sono stati analizzati da una coorte di 142 individui sani o con diagnosi di Alzheimer, insieme al proteoma e al metaboloma dei loro campioni cerebrali post-mortem. Le caratteristiche estratte dallo strato latente dell'autoencoder conservano le informazioni biologiche che separano i pazienti sani da quelli malati. Inoltre, le singole caratteristiche estratte rappresentano moduli di segnalazione molecolare distinti, ognuno dei quali interagisce in modo univoco con le caratteristiche cliniche degli individui, fornendo un mezzo per integrare la proteomica, la metabolomica e i dati clinici.

Introduzione

Una percentuale sempre più ampia della popolazione sta invecchiando e si prevede che l'onere delle malattie legate all'età, come la neurodegenerazione, aumenterà notevolmente nei prossimi decenni1. Il morbo di Alzheimer è il tipo più comune di malattia neurodegenerativa2. I progressi nella ricerca di un trattamento sono stati lenti data la nostra scarsa comprensione dei meccanismi molecolari fondamentali che guidano l'insorgenza e il progresso della malattia. La maggior parte delle informazioni sulla malattia di Alzheimer viene ottenuta post-mortem dall'esame del tessuto cerebrale, il che ha reso difficile distinguere le....

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

NOTA: i dati utilizzati in questo caso sono dati ROSMAP scaricati dal portale AD Knowledge. Il consenso informato non è necessario per scaricare e riutilizzare i dati. Il protocollo qui presentato utilizza il deep learning per analizzare i dati multi-omici e identificare i moduli di segnalazione che distinguono specifici pazienti o gruppi di campioni in base, ad esempio, alla loro diagnosi. Il protocollo fornisce anche un piccolo set di funzionalità estratte che riepilogano i dati originali su larga scala e possono essere utilizzate per ulteriori analisi, ad esempio per l'addestramento di un modello predittivo utilizzando algoritmi di apprendimento automatico (

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Per mostrare il protocollo, abbiamo analizzato un set di dati che comprendeva il proteoma, il metaboloma e le informazioni cliniche derivate dai cervelli post-mortem di 142 individui sani o con diagnosi di Alzheimer.

Dopo aver eseguito la sezione 1 del protocollo per pre-elaborare i dati, il set di dati includeva 6.497 proteine, 443 metaboliti e tre caratteristiche cliniche (sesso, età alla morte e istruzione). La caratteristica target è la diagnosi di consenso clinico dello stato cogn.......

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

La struttura del set di dati è fondamentale per il successo del protocollo e deve essere attentamente controllata. I dati devono essere formattati come indicato nella sezione 1 del protocollo. Anche la corretta assegnazione delle posizioni delle colonne è fondamentale per il successo del metodo. I dati di proteomica e metabolomica vengono pre-elaborati in modo diverso e la selezione delle caratteristiche viene condotta separatamente a causa della diversa natura dei dati. Pertanto, è fondamentale assegnare correttamente l.......

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

L'autore dichiara di non avere conflitti di interesse.

Ringraziamenti

Questo lavoro è stato sostenuto dalla sovvenzione NIH CA201402 e dal Cornell Center for Vertebrate Genomics (CVG) Distinguished Scholar Award. I risultati qui pubblicati si basano, in tutto o in parte, sui dati ottenuti dall'AD Knowledge Portal (https://adknowledgeportal.org). I dati dello studio sono stati forniti attraverso l'Accelerating Medicine Partnership for AD (U01AG046161 e U01AG061357) sulla base di campioni forniti dal Rush Alzheimer's Disease Center, Rush University Medical Center, Chicago. La raccolta dei dati è stata supportata attraverso il finanziamento delle sovvenzioni NIA P30AG10161, R01AG15819, R01AG17917, R01AG30146, R01AG36836, U01AG32984, U01AG4....

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
ComputerAppleMac StudioApple M1 Ultra con CPU a 20 core, GPU a 48 core, Neural Engine a 32 core; 64 GB di memoria unificata
Conda v23.3.1Anaconda, Inc.N/Asistema di gestione dei pacchetti e gestore dell'ambiente
conda environment
DeepOmicsAE
N/ADeepOmicsAE_env.ymlcontiene i pacchetti necessari per eseguire il repository github worflow
DeepOmicsAEMicrosofthttps://github.com/elepan84/DeepOmicsAE/fornisce script, notebook Jupyter e il file dell'ambiente
conda Jupyter notebook v6.5.4Project JupyterN/Auna piattaforma per la scienza interattiva dei dati e il calcolo scientifico
DT01-metabolomics dataN/AROSMAP_Metabolon_HD4_Brain
514_assay_data.csv
Questi dati sono stati utilizzati per generare i risultati riportati nell'articolo. In particolare, DT01-DT04 sono stati uniti abbinandoli in base all'ID individuale. La colonna della diagnosi finale di consenso (cogdx) è stata filtrata per mantenere solo i pazienti classificati come sani o AD. Le caratteristiche cliniche sono state filtrate per mantenere quanto segue: età alla morte, sesso e istruzione. Infine, l'età riportata come 90+ è stata impostata su 91, quindi la colonna dell'età è stata trasformata in float64.
I dati sono disponibili all'indirizzo
https://adknowledgeportal.synapse.org DT02-TMT proteomics dataN/AC2.median_polish_corrected_log2
(abundanceRatioCenteredOn
MedianOfBatchMediansPer
Protein)-8817x400.csv
DT03-clinical dataN/AROSMAP_clinical.csv
DT04-biospecimen metadataN/AROSMAP_biospecimen_metadata
.csv
Python 3.11.3 Linguaggio di programmazionePython Software FoundationN/A

Riferimenti

  1. Hou, Y., et al. Ageing as a risk factor for neurodegenerative disease. Nature Reviews Neurology. 15 (10), 565-581 (2019).
  2. Scheltens, P., et al. Alzheimer’s disease. The Lancet. 397 (10284), 1577-1590 (2021).
  3. Breijyeh, Z., Karaman, R.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Analisi multiomicaautoencoder per deep learningdati proteomicidati metabolomiciintegrazione di dati cliniciestrazione delle caratteristichearricchimento dei pathwayworkflow in Jupyter Notebook

Articoli correlati