16 agosto 2017
Forniamo un protocollo standardizzato per l'utilizzo di analisi del gene arricchimento set di dati di trascrittomica per identificare un modello di mouse ideale per la ricerca traslazionale.
Questo protocollo può essere utilizzato con DNA microarray e dati di sequenziamento di RNA e ulteriore può essere esteso ad altri dati di omics se sono disponibili dati.
L'obiettivo generale di questa procedura è identificare il modello animale appropriato per domande di ricerca traslazionale. Questo metodo può aiutare a rispondere a una domanda fondamentale nella ricerca traslazionale: come posso selezionare un modello animale adeguato per una specifica malattia umana che desidero studiare? Il principale vantaggio di questa tecnica consiste nel confronto dei dati di intero genoma tra modelli animali e studi su malattie umane.
Questo approccio evita quindi interpretazioni soggette a bias relative al confronto di singoli geni. Sebbene questo metodo fornisca informazioni sull'idoneità dei modelli murini per le malattie infiammatorie, può essere applicato anche ad altri modelli di malattia. L'analisi dell'arricchimento genico (GSEA) aiuta a indagare la regolamentazione delle politiche negli studi sull'espressione genica.
L'output per ogni modello animale e studio di malattia costituisce la base per ulteriori confronti. Iniziare questa procedura con il download del software e dei dati, seguito dalla gestione e formattazione dei dati come descritto nel protocollo testuale. Successivamente, aprire lo strumento software GSEA.
Fare clic sul pulsante Carica dati situato sul lato sinistro della finestra principale. Si aprirà una nuova scheda per l'importazione dei file di dati necessari. Nella nuova scheda, individuare il file dei dati di espressione genica e il file del fenotipo.
Nel caso in cui GSEA non riesca a connettersi a internet, caricare anche i file del database delle firme molecolari scaricati e i file di annotazione della DNA chip. I dati importati correttamente vengono visualizzati nella sezione di caricamento dei dati. Fare clic sul pulsante Esegui GSEA situato sul lato sinistro della finestra principale.
Si aprirà una nuova scheda per impostare i parametri dell'analisi. La scheda è suddivisa in tre parti: campi obbligatori, campi basilari e campi avanzati. Nei campi obbligatori, selezionare innanzitutto il set di dati di espressione.
Quindi selezionare il database di set genici dal sito web collegato o da un file di set genici importato manualmente. Modificare le etichette dei fenotipi per selezionare i gruppi di campioni che devono essere confrontati tra loro. Ad esempio, gruppo con malattia rispetto al gruppo di controllo sano.
Successivamente, selezionare "collapse dataset to gene symbols" uguale a vero per tradurre gli identificatori delle sonde nel set di dati di espressione nei simboli ufficiali dei geni Hugo utilizzati nel database dei set di geni. Selezionare falso se il set di dati di espressione contiene già i simboli dei geni Hugo. Impostare il numero di permutazioni sul valore predefinito di 1.000.
Modificare il tipo di permutazione in "gene set", poiché la permutazione del fenotipo è consigliata solo quando ci sono più di sette campioni per ogni fenotipo. Infine, selezionare la piattaforma chip utilizzata per generare i dati di espressione genica, sia dal sito web collegato che da un file di annotazioni del chip di DNA importato manualmente. Nei campi principali, modificare il nome dell'analisi e la sezione in cui salvare i risultati.
Inoltre, ulteriori parametri statistici possono essere modificati. Per maggiori dettagli sui parametri e sulla sezione dei campi avanzati, consultare la guida utente di GSEA. Se vengono applicate metriche di gruppo calcolate esternamente per dati di espressione genica, utilizzare uno strumento GSEA pre-rank.
Quest'analisi viene eseguita sulla base di un semplice elenco di geni preassegnati a metriche di gruppo precalcolate che vengono utilizzate per ordinare i geni. Dopo aver caricato il file alternativo di espressione genica, andare alla barra di navigazione principale e fare clic su Strumenti, GseaPreranked. Analogamente, verrà aperta una nuova scheda per impostare i parametri dell'analisi.
Successivamente, fare clic sul pulsante Esegui nell'angolo inferiore destro della finestra. Fare clic sull'analisi completata nella sezione del rapporto GSEA per aprire i risultati dell'analisi. Successivamente, fare clic sui risultati dettagliati del riprodimento in formato Excel per esportare i risultati dell'analisi in un foglio di calcolo.
Esportare i risultati separatamente per entrambi i fenotipi. In Excel, unire i dati dei risultati in un unico file di foglio elettronico. Per il confronto successivo tra i dati di espressione genica di diversi studi, mantenere almeno il nome del set genico, il relativo punteggio di arricchimento normalizzato e il valore di FDR.
Ripetere l'analisi di arricchimento dell'insieme genico per il secondo studio e per tutti gli ulteriori studi che devono essere confrontati tra loro. Includere il maggior numero possibile di studi clinici umani e diversi modelli murini per identificare il modello murino ottimale rispetto alla domanda di ricerca traslazionale. Per identificare il modello animale ottimale per riprodurre la situazione umana, confrontare tra loro i risultati dell'analisi di arricchimento genico (GSEA) di tutti gli studi.
Utilizzare i punteggi di arricchimento e i valori FDR per classificare i percorsi come attivati, inibiti o nessuno dei due. Per confrontare molti studi, si consiglia di utilizzare script R. Per ogni confronto tra due studi, contare il numero di realizzazioni delle nove possibili combinazioni di regolazione del percorso, come indicato da una tabella di contingenza tre per tre.
Valutare la correlazione tra due studi calcolando il valore predittivo positivo e il valore predittivo negativo, definito come la frazione di percorsi che mostrano la stessa regolazione in due studi. Inoltre, stimare la frazione di percorsi che ci si aspetterebbe fosse correlata solo per caso, rappresentata dal valore predittivo positivo casuale e dal valore predittivo negativo casuale. Quindi, calcolare il guadagno di informazione.
Tutti i calcoli possono essere eseguiti utilizzando programmi per fogli di calcolo, ma si consiglia l'uso di funzioni R. Utilizzare la tabella di contingenza di una coppia di studi per calcolare il valore P con il test chi-quadrato, ad esempio mediante la funzione R per il test chi-quadrato o programmi per fogli di calcolo. Memorizzare i dati della tabella di contingenza in una matrice X. Successivamente, confrontare i risultati dell'analisi GSEA per tutte le combinazioni degli studi selezionati per l'analisi.
Ordinare tutte le combinazioni in base al guadagno di informazione. Per il confronto di numerosi set di dati, utilizzare una matrice e visualizzare i risultati mediante una mappa termica colorata. Selezionare il modello animale con il maggiore guadagno di informazione.
Per valutare il significato dell'aumento di informazioni, prendere in considerazione anche il test del chi-quadrato. Viene qui mostrata una matrice di correlazione dei confronti tra percorsi biologici negli studi su esseri umani e topi. L'overlapping nella regolazione dei percorsi è indicato come aumento di informazioni ottenibile da uno studio per prevedere gli effetti in un altro studio.
Il blu indica una bassa correlazione e il rosso indica una elevata correlazione tra i dati. Il confronto tra i set di dati umani e murini ha rivelato un sottogruppo di modelli murini altamente correlati agli studi umani. Pertanto, questi modelli murini sono i più adatti per riprodurre la situazione umana.
Al contrario, gli studi sette, otto e nove non hanno mostrato alcuna correlazione con gli studi sulla malattia umana. Una volta padroneggiata, questa tecnica può essere eseguita in diversi giorni, se effettuata correttamente. Dipende dalla quantità di dati e dalla disponibilità dei dati.
Nel tentativo di eseguire questa procedura, è importante ricordare che la validità dei risultati dipende dalla qualità e dalla pertinenza dei dati scelti. Dopo aver visto questo video, si dovrebbe avere una buona comprensione di come selezionare un modello animale appropriato per una specifica malattia umana in base ai dati trascrittomici.
Visualizza la trascrizione completa e accedi a migliaia di video scientifici
Questo articolo presenta un protocollo standardizzato per l'analisi di arricchimento di insiemi genici (GSEA) di dati trascrittomici, al fine di identificare modelli murini appropriati per la ricerca traslazionale. Il metodo confronta dati del genoma intero tra modelli animali e studi su malattie umane, fornendo indicazioni nella scelta dei modelli per diverse patologie.
La selezione di modelli animali appropriati rimane una sfida fondamentale nella ricerca traslazionale, in cui un'allineamento improprio del modello contribuisce all'abbandono in fasi avanzate. Questo protocollo consente una valutazione sistematica di modelli murini mediante la concordanza trascrittomica con dati di malattie umane, riducendo la dipendenza da filtri genici soggettivi. Fornendo un framework standardizzato basato su GSEA, supporta la fiducia predittiva nella selezione del modello e orienta decisioni di avanzamento o interruzione già nelle fasi iniziali della scoperta.
Il metodo si inserisce nel percorso di scoperta che va dalla validazione del target alla selezione del modello preclinico, consentendo ai dati trascrittomici di guidare la scelta del modello animale prima di investire significativamente in studi di screening o di efficacia.