È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo metodologico

Protocollo computazionale per quantificare gli spostamenti trascritomici associati agli artesunati nel tessuto cerebrale sperimentale della malaria cerebrale utilizzando DESeq2

75 visualizzazioni

DOI:

10.3791/70870

31 luglio 2026

* These authors contributed equally

In questo articolo

Sommario

La malaria cerebrale sperimentale (ECM) causa neuroinfiammazione e disfunzione della barriera emato-encefalica. Utilizzando GSE162535, questo flusso di lavoro RNA-seq riproducibile basato su R confronta cervelli di controllo (CB), ECM (MB) e trattati con artesunati (AB), eseguendo analisi QC, PCA e DESeq2. Identifica i cambiamenti trascrizionali guidati dalla ECM e valuta la modulazione mediata dagli artesunati delle vie infiammatorie e neurovascolari.

Abstract

Il sequenziamento dell'RNA (RNA-seq) è ampiamente utilizzato per definire programmi trascrizionali associati alla malattia, ma sono necessari flussi di lavoro coerenti e end-to-end per garantire confronti riproducibili tra i gruppi sperimentali e per facilitare risultati biologicamente interpretabili. Qui viene presentato un protocollo completo di analisi RNA-seq per valutare i cambiamenti trascrittomici cerebrali nella malaria cerebrale sperimentale (ECM) e dopo il trattamento con artesunati utilizzando il dataset pubblico GSE162535. Il flusso di lavoro analizza tre gruppi—cervello di controllo (CB), cervello ECM (MB) e cervello ECM (AB) trattato con artesunati—partendo da una matrice di conteggio HTSeq. Dopo aver importato e formattato i conteggi grezzi, il protocollo costruisce un dataset DESeq2 con CB come livello di riferimento, filtra i geni a basso numero ed esegue il controllo qualità utilizzando la visualizzazione della dimensione della libreria, l'analisi dei componenti principali e il clustering della distanza del campione. L'espressione differenziale viene poi calcolata per tre contrasti primari (MB vs CB, AB vs MB, AB vs CB), con un ritiro a variazione di volte log2 applicato per una stima stabile della dimensione dell'effetto. Il protocollo esporta tabelle di espressione differenziale complete e significative, genera grafici vulcanici e grafici MA, e produce mappe di calore dei geni più variabili e dei geni differenzialmente espressi di alto rango per contrasto. Per supportare l'interpretazione meccanicistica, il flusso di lavoro include l'estrazione mirata di marcatori immunitari (ad esempio, citochine, chemochine, marcatori di attivazione microgliali, BBB/geni endoteliali) e conduce analisi di Ontologia Genica e arricchimento KEGG per insiemi genici significativamente regolati al rialzo e al ribasso. Questo protocollo fornisce un modello riproducibile per caratterizzare i programmi di trascrizione neuroinfiammatori associati all'ECM e per quantificare la modulazione associata agli artesunati di queste firme.

Introduzione

La malaria cerebrale (MC) è una complicazione neurologica potenzialmente letale dell'infezione da Plasmodium falciparum e rimane un contributo importante alla mortalità malaria nonostante i progressi nella gestione dei casi. La MC è caratterizzata da encefalopatia acuta, disfunzione microvascolare, attivazione endoteliale e alterazione della barriera emato-encefalica (BBB), con neuroinfiammazione a valle che può portare al coma e, tra i sopravvissuti, sequela neurocognitivepersistenti 1. La patogenesi della MC è multifattoriale e coinvolge risposte infiammatorie dell'ospite che interagiscono con fattori derivati dal parassita e dall'ospite all'interfaccia neurovascolare, rendendo difficile dedurre i meccanismi causali solo dagli endpointclinici 1.

I modelli sperimentali di malaria cerebrale (ECM), in particolare l'infezione da Plasmodium berghei ANKA nei topi C57BL/6, forniscono una piattaforma trattabile per esaminare immunopatologie specifiche del cervello, lesioni della BBB e segnalazione neuroinfiammatoria in un contestocontrollato 2,3. Questi modelli sono stati utilizzati per mappare le risposte cellulari e molecolari tra le fasi della malattia e per testare interventi aggiuntivi in vivo 2,3. Tuttavia, la patobiologia ECM è complessa e altamente dinamica, e i saghi mirati possono mancare di cambiamenti coordinati a livello di percorso che avvengono in molteplici programmi immunitari e neurovascolari.

L'artesunato è la terapia parenterale di prima linea raccomandata per la malaria grave e ha dimostrato un beneficio sostanziale di sopravvivenza rispetto alla chinina nelle principali basidi evidenze 4. Sebbene la rapida eliminazione dei parassiti sia centrale per l'efficacia degli artesunati, gli esiti neurologici probabilmente riflettono sia la riduzione dei parassiti sia la modulazione secondaria delle vie infiammatorie eneurovascolari 1,4. Comprendere come il trattamento con artemisinina rimodelli i programmi di trascrizione cerebrale durante la ECM può quindi fornire intuizioni meccanicistiche che integrano i dati sull'efficacia clinica e può identificare vie candidate per strategie neuroprotettive aggiuntive.

Il sequenziamento dell'RNA (RNA-seq) consente una profilazione imparziale e a livello genomico delle risposte trascrizionali in condizioni di malattia e trattamento, supportando l'analisi dell'espressione differenziale e l'interpretazione funzionale a valle. Repository pubblici come il NCBI Gene Expression Omnibus (GEO) forniscono dataset curati adatti per la rianalisi riproducibile, inclusa GSE162535, che contiene RNA-seq cerebrale da cervelli di controllo (CB), cervelli ECM (MB) e cervelli ECM (AB)5 trattati con artesunati. Per supportare la scoperta riproducibile da tali dataset, sono necessari quadri statistici robusti per l'espressione differenziale basata sul conteggio, e strumenti di arricchimento per interpretare i cambiamenti a livello genico in termini di vie e processi biologici.

Questo studio presenta un flusso di lavoro di analisi RNA-seq riproducibile e end-to-end per il tessuto cerebrale nei gruppi di controllo (CB), sperimentali con malaria cerebrale (MB) e trattati con artesunati (AB). La novità di questo articolo risiede nella sua pipeline standardizzata basata su DESeq2, che incorpora contrasti biologicamente rilevanti predefiniti (MB vs CB, AB vs MB e AB vs CB), rigorosi output di controllo qualità (valutazione della dimensione della libreria, analisi dei componenti principali e heatmap della distanza campionaria) e interpretazione integrata a valle tramite Gene Ontology (GO) e arricchimento dei percorsi KEGG tramite clusterProfiler 6,7. Inoltre, il flusso di lavoro implementa un'interpretazione strutturata basata su panel immunitario, consentendo la caratterizzazione sistematica delle risposte trascrizionali neuroinfiammatorie, immunitarie e neurovascolari. Combinando rigore statistico, trasparenza e risultati pronti per la pubblicazione, questo protocollo fornisce un quadro solido e riutilizzabile per analizzare la disregolazione trascritomica associata all'ECM e per valutare la modulazione guidata dal trattamento negli studi preclinici sulla malaria.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Questo studio ha utilizzato dati RNA-seq disponibili al pubblico e non ha coinvolto nuovi esperimenti su uomini o animali. Pertanto, non erano richieste approvazioni etiche e consenso informato (Tabella dei Materiali).

1. Preparare l'ambiente informatico e la struttura delle cartelle

  1. Configura hardware e sistema operativo
    1. Usa una workstation o un portatile con almeno 8 GB di RAM (consigliati 16 GB) e ≥10 GB di spazio libero su disco per download e output.
    2. Usa Windows, macOS o Linux con il permesso per installare pacchetti R e scrivere file nella directory operativa.
  2. Installa il software necessario
    1. Installa R (versione 4.2 o successiva). Installa RStudio Desktop (consigliato) per eseguire il flusso di lavoro in modo interattivo e per gestire la directory del progetto.
  3. Crea una directory progetto e cartelle di output
    1. Crea una nuova cartella per l'analisi (ad esempio, GSE162535_RNAseq_DESeq2). Imposta questa cartella come la directory di lavoro R.
    2. Crea le cartelle di output esattamente come segue:
      1. Crea risultati/. Crea risultati/fighe/. Crea risultati/tabelle/.
  4. Installa i pacchetti R necessari
    1. Installa i pacchetti CRAN: tidyverse, pheatmap e RColorBrewer. Installa pacchetti Bioconductor: DESeq2, apeglm (opzionale), clusterProfiler e org. Mm.eg.db.
    2. Carica i pacchetti richiesti all'inizio dello script: DESeq2, tidyverse, pheatmap, RColorBrewer, clusterProfiler, org. Mm.eg.db, e ggplot2. Impostare un seed per la riproducibilità eseguendo set.seed(123).
  5. Applicare le tutele di integrità dei dati e privacy
    1. Memorizza i file scaricati solo nella cartella del progetto. Limitare l'accesso alla directory del progetto se l'ambiente contiene dati sensibili o soggetti a embargo. Registra le versioni del software esportando sessionInfo() in risultati/sessionInfo.txt alla fine del workflow.
      NOTA: Questo protocollo esegue un'analisi in silico dei dati pubblici di conteggio RNA-seq e non prevede la gestione di campioni biologici.

2. Ottenere la matrice di conteggio RNA-seq e definire i gruppi sperimentali

  1. Scarica i file di dataset GEO per GSE162535
    1. Scarica il file HTSeq per il conteggio GSE162535 da GEO e salvalo nella cartella del progetto come GSE162535_All.HTSeq.counts.txt.gz. Verifica l'integrità del file confermando che il file si apre senza errori usando gzfile() e read.delim().
  2. Carica i conteggi HTSeq in R
    1. Importa la tabella del conteggio compresso usando read.delim(gzfile(...), header = TRUE, check.names = FALSE, quote = "", comment.char = ""). Ispezionare l'oggetto importato usando str(), head() e colnames() per confermare che:
      1. La prima colonna contiene gli identificatori geni (ad esempio, AccID). Le colonne rimanenti contengono conteggi a livello di campione.
  3. Standardizzare i tipi di dati e risolvere identificatori genici duplicati
    1. Definisci le colonne di campione come tutte le colonne tranne quella dell'identificatore genetico (AccID). Costringi tutte le colonne campione a conteggiare interi. Collassa gli identificatori geni duplicati sommando i conteggi tra le righe che condividono lo stesso AccID.
    2. Converti la tabella compressa in un frame dati standard. Imposta i nomi delle righe all'identificatore del gene e rimuovi la colonna dell'identificatore dalla matrice di conteggio.
  4. Verifica la struttura della matrice di conteggio
    1. Conferma che la matrice di conteggio abbia 12 colonne di esempio. Conferma che i nomi delle colonne di esempio seguano il formato AB_1..AB_4, CB_1..CB_4 e MB_1.MB_4.
    2. Fermare l'esecuzione se la matrice di conteggio non ha 12 colonne.
  5. Creare e validare i metadati del campione
    1. Crea una tabella di metadati di esempio (colData) contenente le seguenti colonne:
      1. Esempio: identificatori campionari unici corrispondenti ai nomi delle colonne della matrice di conteggio. Gruppo: condizione biologica assegnata a ciascun campione.
    2. Recupera le corrispondenti annotazioni campionari per il dataset GSE162535 dal Gene Expression Omnibus (GEO).
    3. Verifica l'identità di ogni campione utilizzando le informazioni di accessione GEO e i campi di annotazione del campione che descrivono la condizione sperimentale. Mappare ogni identificatore di campione nella matrice di conteggio alla sua annotazione GEO verificata.
    4. Assegnare ogni campione verificato a uno dei seguenti gruppi: cervello di controllo (CB), cervello sperimentale per la malaria cerebrale (MB) o cervello sperimentale con artesunati per la malaria (AB).
    5. Organizza la tabella dei metadati in modo che l'ordine del campione corrisponda all'ordine delle colonne della matrice di conteggio.
    6. Confronta gli identificatori campioni nella tabella dei metadati con la matrice di conteggio per confermare la corrispondenza uno a uno. Codifica la variabile di gruppo come un fattore con livelli ordinati come CB, MB e AB.
    7. Imposta CB come livello di riferimento per definire il gruppo cerebrale di controllo come base per l'analisi differenziale dell'espressione a valle.
    8. Imposta i nomi delle righe della tabella dei metadati uguali agli identificatori di campione.
      NOTA:Le etichette di gruppo non sono state assegnate esclusivamente in base all'ordine dei campioni nella matrice di conteggio. Le identità dei campioni sono state verificate indipendentemente utilizzando metadati GEO e informazioni di accessione prima dell'allineamento con la matrice di espressione per migliorare la riproducibilità e ridurre il rischio di errata classificazione del campione.

3. Costruire il dataset DESeq2 ed eseguire un controllo qualità di base

  1. Sterilizza la matrice del conteggio
    1. Sostituire i valori mancanti nella matrice di conteggio con zero. Confermare l'assenza di valori mancanti utilizzando riassunti is.na() per colonne.
  2. Crea il dataset DESeq2
    1. Crea un DESeqDataSet usando DESeqDataSetFromMatrix() con: countData = counts; colData = sample_info; disegno = ~ gruppo.
  3. Filtrare i geni a basso numero
    1. Rimuovere geni con conteggi totali <10 su tutti i campioni usando dds <- dds[rowSums(counts(dds)) >= 10, ]. Registra il numero di geni conservati stampando il riepilogo dell'oggetto.
  4. Valuta le dimensioni delle librerie
    1. Calcolare le dimensioni delle librerie come somme delle colonne della matrice di conteggio filtrata. Genera un barplot della dimensione della libreria e salvalo come risultati/figura/library_sizes.pdf.
    2. Ispezionare il grafico delle dimensioni della libreria e confermare che nessun campione abbia una profondità di sequenziamento estrema incoerente con il disegno dello studio.

4. Eseguire DESeq2 e generare oggetti di trasformazione per la visualizzazione

  1. Adattarsi al modello DESeq2
    1. Esegui modellazione differenziale di espressioni usando dds <- DESeq(dds). Mantenere l'oggetto DDS adattato per tutte le estrazioni dei risultati a valle.
  2. Crea matrici di espressione trasformate
    1. Calcola la trasformazione logaritmica regolarizzata usando rld <- rlog(dds, cieco = FALSO). Calcola la trasformazione stabilizzante della varianza usando vsd <- vst(dds, cieco = FALSO). Usa RLD e VSD per PCA, clustering e heatmap.
      NOTA: Usa cieco = FALSO per preservare la struttura di varianza dipendente dal gruppo.

5. Eseguire il controllo qualità globale utilizzando PCA e clustering tra distanza campione e campione

  1. Generare analisi delle componenti principali (PCA)
    1. Calcolare PCA usando plotPCA(rld, intgroup = "group", returnData = TRUE). Estrarre la percentuale di varianza spiegata per PC1 e PC2. Traccia PC1 vs PC2 usando ggplot2, etichettando i punti per nome campione e colorando per gruppo.
    2. Salva il grafico PCA come risultati/figura/PCA_samples.pdf. Confermare che biologico si replica cluster per gruppo e che nessun campione si separi come outlier.
  2. Genera una mappa della distanza di campionamento
    1. Calcola le distanze campione a coppie usando dist(t(assay(vsd))). Converti l'oggetto di distanza in una matrice per la visualizzazione. Crea una tabella di annotazione a colonna contenente il fattore di gruppo per ogni campione.
    2. Traccia la matrice delle distanze usando pheatmap() e salva come risultati/fig/sample_distance_heatmap.pdf. Conferma che i campioni si raggruppano principalmente per gruppo.

6. Calcolare l'espressione differenziale per i tre contrasti primari

  1. Definisci i contrasti
    1. Definisci l'effetto della malattia come ECM vs controllo: MB vs CB. Definisci l'effetto del trattamento all'interno dell'ECM come trattato con artesunati vs ECM: AB vs MB. Definisci trattamento vs base come trattato con artesunati vs controllo: AB vs CB.
  2. Estrarre i risultati DESeq2 con il ritiro a variazione di fold log2
    1. Estrai i risultati grezzi per ogni contrasto usando risultati (dds, contrasto = c("gruppo", gruppoA, gruppoB)). Shrink log2 fold cambia usando lfcShrink(dds, contrast = c("gruppo", groupA, groupB), res = res, type = "normale").
    2. Converti i risultati in un data frame e memorizza l'identificatore del gene come una colonna chiamata gene_id. Ordina i risultati per valore p nominale per una rendicontazione stabile.
    3. Salva ogni tabella dei risultati completa nei risultati/tabelle/ come:
      1. DESeq2_MB_vs_CB_all_genes.csv, DESeq2_AB_vs_MB_all_genes.csv, DESeq2_AB_vs_CB_all_genes.csv
        NOTA: Se il ritiro fallisce a causa della configurazione del pacchetto, si riesegue con un tipo di ritiro alternativo supportato nell'installazione locale.
  3. Definire soglie di significatività ed esportare set genici significativi
    1. Definire geni espressi differenzialmente (DEG) utilizzando: valore p aggiustato (FDR) < 0,05 e variazione assoluta log2 volte ≥ 1. Filtrare ogni contrasto per escludere geni con valori p aggiusti mancanti.
    2. Esporta le tabelle DEG significative in: risultati/tabelle/DESeq2_MB_vs_CB_sig.csv, risultati/tabelle/DESeq2_AB_vs_MB_sig.csv, risultati/tabelle/DESeq2_AB_vs_CB_sig.csv
  4. Riassumi i conteggi di DEG per contrasto
    1. Calcolare il numero di geni significativi per contrasto. Salva la tabella riassuntiva come risultati/tabelle/DE_summary_counts.csv.

7. Generare grafici vulcanici per ogni contrasto.

  1. Crea una funzione di grafica del vulcano.
    1. Calcolare -log10 (valore p aggiustato) per ogni gene. Classifica ogni gene come Up, Down o Non Significativo usando le soglie: FDR < 0,05 e |log2FC| ≥ 1.
    2. Tracciare log2FC (asse x) vs -log10(FDR) (asse y) usando ggplot2. Aggiungi linee di soglia tratteggiate a log2FC = ±1 e -log10(0.05).
  2. Grafici di vulcani di esportazione
    1. Salva ogni grafico come PDF nei risultati/fig/: volcano_MB_vs_CB.pdf, volcano_AB_vs_MB.pdf, volcano_AB_vs_CB.pdf.
      NOTA: Usa limiti di assi coerenti tra i contrasti per supportare il confronto visivo tra le figure.

8. Generare grafici MA per ogni contrasto

  1. Esporta i grafici MA in un unico PDF.
    1. Apri un dispositivo PDF chiamato results/fig/MA_plots.pdf. Traccia i grafici MA per ogni oggetto risultato grezzo DESeq2 usando plotMA(). Etichetta ogni parcella con il nome a contrasto. Chiudi il dispositivo PDF.

9. Generare heatmap di espressione per variabilità globale e geni DE specifici per contrasto.

  1. Traccia i geni delle principali variabili su tutti i campioni.
    1. Calcolare la varianza riga per riga tra campioni dalla matrice del saggio vsd. Seleziona i 100 geni più variabili. Centra nella media ogni gene tra i campioni.
    2. Genera una heatmap usando pheatmap() con annotazioni dei gruppi campionari. Salva la figura come risultati/figura/heatmap_top100_variable_genes.pdf.
  2. Traccia i geni più espressi differenzialmente per ogni contrasto.
    1. Seleziona i primi 50 geni tramite il valore p aggiustato per ogni contrasto. Estrai la loro matrice di espressione VSD e il centro medio per gene. Genera una heatmap per ogni contrasto e salva come:
    2. Risultati/Fig/heatmap_top50_MB_vs_CB.pdf, Risultati/Fig/heatmap_top50_AB_vs_MB.pdf, Risultati/Figura/heatmap_top50_AB_vs_CB.pdf
      NOTA: Aumenta la larghezza e l'altezza del PDF se le etichette delle righe sono attivate.

10. Eseguire un'analisi mirata dei marcatori immunitari.

  1. Riassumi geni immunitari selezionati attraverso i contrasti.
    1. Definisci un insieme di marcatori immunitari: Il6, Il1b, Il10, Tnf, Ifng, Il21 e Icam1. Estrarre log2FC, p-value e p-value aggiustato per questi geni da ciascuna tabella dei risultati di contrasto.
    2. Unisci i tre riassunti di contrasto per identificatore genico. Salva la tabella unita come risultati/tabelle/immune_genes_summary.csv.
  2. Genera una heatmap dei marcatori immunitari (rlog).
    1. Identificare i geni immunitari presenti nella matrice trasformata del saggio. Estrai la matrice di espressione rlog per i geni immunitari presenti.
    2. Espressione del centro medio per gene. Genera e salva la heatmap su risultati/figura/heatmap_immune_genes.pdf.

11. Eseguire analisi estese del pannello immunitario per categoria funzionale

  1. Definisci i panel immunitari.
    1. Definire i panel dei marcatori immunitari per categoria, tra cui: citochine pro-infiammatorie e geni di risposta all'interferone, geni antinfiammatori e regolatori, chemimochine, marcatori di attivazione microgliale, marcatori di astrociti, marcatori BBB e di attivazione endoteliale, marcatori di cellule T e marcatori di esaurimento, marcatori monociti/macrofagi, geni della via del complemento e geni dello stress ossidativo e della morte cellulare.
  2. Estrarre i risultati del pannello immunitario DE per ogni contrasto.
    1. Crea una tabella di mappatura dai simboli genici alle categorie immunitarie. Filtra ogni tabella dei risultati del contrasto per i geni del pannello immunitario. Unisci la mappatura delle categorie a ogni tabella dei risultati filtrata.
    2. Concatena le tre tabelle immunitarie specifiche per contrasto in un'unica tabella. Salva la tabella combinata come risultati/tabelle/immune_panels_DE_all_contrasts.csv. Genera una heatmap classificata dell'espressione del pannello immunitario.
    3. Identificare i geni del pannello immunitario presenti nella matrice del test rld. Aggiungi etichette di categoria ai nomi delle righe per preservare la classificazione dei pannelli nella figura. Traccia la heatmap rlog con annotazioni dei gruppi campioni.
  3. Salva le uscite.
    1. Salva come: risultati/figura/heatmap_immune_panels_all.pdf, risultati/figura/heatmap_immune_panels_all.png

12. Generare grafici di vulcani a sovrapposizione immunitaria

  1. Crea plot di vulcani a sovrapposizione immune.
    1. Segna i geni come immunitari o non immuni collegando il pannello immunitario che mappa ogni tabella dei risultati del contrasto. Traccia tutti i geni non immuni come punti di fondo grigio. Traccia i geni immuni colorati per categoria immunitaria in primo piano. Aggiungi le linee di soglia a log2FC = ±1 e -log10(0.05).
  2. Esporta i piani di vulcano con sovrapposizione immune.
    1. Conserva i grafici di vulcani a sovrapposizione immunitaria MB vs CB come:
      1. Risultati/Figura/volcano_MB_vs_CB_immune_overlay.pdf
      2. risultati/fig/volcano_MB_vs_CB_immune_overlay.png
    2. Salva i grafici di vulcani con sovrapposizione immune AB vs MB come:
      1. Risultati/Figura/volcano_AB_vs_MB_immune_overlay.pdf
      2. Risultati/Fig/volcano_AB_vs_MB_immune_overlay.png
        NOTA: Panel genici immunitari selezionati erano predefiniti e raggruppati in categorie funzionali; l'elenco completo dei simboli genici con annotazioni è fornito nella Tabella Supplementare S1. Questa tabella garantisce trasparenza e riproducibilità, permettendo il riutilizzo diretto e la validazione delle analisi basate su panel tra gli studi.

13. Eseguire analisi di arricchimento funzionale (GO e KEGG)

  1. Definire insiemi genici per l'arricchimento
    1. Per ogni contrasto (MB vs CB e AB vs MB), estrarre geni espressi in modo significativamente differenziale (DEG) utilizzando una soglia di p-value aggiustata di < 0,05 e una soglia assoluta log₂ di variazione di fold ≥ 1.
    2. Dividere i DEG in geni alzati (log₂FC > 0) e geni sottoregolati (log₂FC < 0).
  2. Definisci il set genico di background (universo)
    1. Utilizzare tutti i geni trattenuti dopo il filtraggio del conteggio nel dataset DESeq2 come universo di fondo. Estrai i simboli genici dall'oggetto DESeq2 filtrato. Converti i simboli genici di fondo in identificatori Entrez usando la funzione bitr() con org. Mm.eg.db.
      NOTA: L'uso di un set genetico di fondo coerente garantisce risultati di arricchimento imparziali.
  3. Mappa gli identificatori geni per l'arricchimento
    1. Converti i simboli genici di ogni set DEG in identificatori Entrez usando bitr(). Conservare solo i geni mappati con successo per l'arricchimento KEGG. Saltare l'analisi di arricchimento per un insieme genico se nessun genio è stato mappato con successo.
      NOTA: L'arricchimento Gene Ontology (GO) utilizza simboli genici, mentre l'arricchimento KEGG richiede identificatori Entrez.
  4. Eseguire l'arricchimento dell'ontologia genica (GO) (Processo biologico)
    1. Esegui l'arricchimento GO usando enrichGO() con OrgDb = org. Mm.eg.db. Set keyType = "SYMBOL" e ontologia (ont) = "BP". Specifica l'universo come tutti i simboli genici filtrati dal dataset DESeq2.
    2. Usa pAdajustMethod = "BH" per la correzione con test multiplo. Applicare le soglie di significatività di pvalueCutoff = 0,05 e qvalueCutoff = 0,05. Limitare le dimensioni dei set geni usando minGSSize = 10 e maxGSSize = 500.
    3. Esporta i risultati dell'arricchimento GO nei risultati/tabelle/directory. Genera barplot dei termini GO arricchiti e salva nei risultati/fig/.
  5. Eseguire l'arricchimento dei percorsi KEGG
    1. Esegui l'arricchimento KEGG usando enrichKEGG() con organismo = "mmu". Fornire identificatori Entrez degli insiemi DEG come geni di input. Usa lo sfondo mappato di Entrez come l'universo.
    2. Applica pAdajustMethod = "BH". Usare le soglie di significatività di pvalueCutoff = 0,05 e qvalueCutoff = 0,05. Limitare le dimensioni dei set geni usando minGSSize = 10 e maxGSSize = 500.
    3. Esporta le tabelle di arricchimento KEGG nei risultati/tabelle/. Genera barplot di percorsi KEGG arricchiti e salva in risultati/fig/.
      NOTA: L'arricchimento KEGG potrebbe non restituire risultati se la mappatura genica è insufficiente; tali casi vengono gestiti senza interrompere il flusso di lavoro.

14. Eseguire analisi di arricchimento solo immunitario (modulo opzionale)

  1. Costruire insiemi genici specifici per il sistema immunitario
    1. Definisci i geni del panel immunitario basandosi su categorie funzionali selezionate. Intersecano le liste DEG con i geni del panel immunitario. Dividere i DEG immunospecifici in insiemi al rialzo e al ribasso per ogni contrasto.
  2. Effettuare arricchimenti su set genetici specifici per il sistema immunitario.
    1. Applicare le stesse procedure di arricchimento GO e KEGG descritte nella Sezione 13. Usa impostazioni identiche di universo di background e parametri. Salva gli output utilizzando nomi file contenenti l'etichetta "immune" per distinguerli dai risultati di arricchimento globale.

15. Generare dot plot di arricchimento (modulo opzionale)

  1. Risultati di arricchimento del carico.
    1. Importare le tabelle di arricchimento GO o KEGG dai risultati/tabelle/directory.
  2. Trasforma le metriche di arricchimento.
    1. Converti i valori di GeneRatio dal formato frazionario (x/y) a rapporti numerici. Calcola −log₁₀ (p-valori aggiustati) per la visualizzazione.
  3. Genera dot plot.
    1. Tracciare il rapporto genico sull'asse x e le descrizioni dei termini arricchite sull'asse y. Scala la dimensione del punto in base al numero di geni e colore a −log₁₀ (valore p modificato).
    2. Seleziona i termini arricchiti in base alla classifica del p-value aggiustata. Salva i dot plot come file PDF e PNG nella directory results/fig/.

16. Salva le informazioni della sessione e finalizza la run

  1. Esporta le informazioni della sessione.
    1. Salva sessionInfo() output nei risultati/sessionInfo.txt nel documento versione R e versioni del pacchetto.
  2. Conferma il completamento con successo
    1. Conferma che il flusso di lavoro generato: Figure nei risultati/fighe/, tabelle nei risultati/tabelle/.
    2. Conferma che le tre principali uscite di contrasto esistono e siano non vuote: DESeq2_MB_vs_CB_all_genes.csv, DESeq2_AB_vs_MB_all_genes.csv, DESeq2_AB_vs_CB_all_genes.csv

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Valutazione della qualità dei dati e struttura trascrittomica globale

I dati RNA-seq di 12 campioni cerebrali (CB, MB, AB; n = 4 per gruppo) sono stati processati utilizzando il flusso di lavoro standardizzato. Dopo aver filtrato i geni a basso numero (≥10 conteggi totali), il dataset è stato mantenuto per analisi a valle. L'analisi delle componenti principali (PCA) dei conteggi trasformati in rlog ha dimostrato la separazione dei campioni per...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo studio presenta un flusso di lavoro riproducibile basato su DESeq2 per l'analisi di dati di RNA-seq in massa tra contrasti biologici predefiniti. Il protocollo integra preprocessing standardizzato, assegnazione verifica dei metadati, normalizzazione, test di espressione differenziale e output strutturati a valle, consentendo una generazione coerente e trasparente di risultati trascrittomi. Definendo esplicitamente passaggi analitici e parametri, il flusso di lavoro è progettato pe...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori non hanno interessi in conflitto.

Ringraziamenti

Gli autori non hanno alcun riconoscimento.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

```html
Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
clusterProfiler (R package)BioconductorRRID:SCR_016884Analisi di arricchimento funzionale (percorsi GO e KEGG)
DESeq2 (R package)BioconductorRRID:SCR_015687Analisi dell'espressione differenziale dei dati RNA-seq basati su conteggi
ggplot2 (R package)CRANRRID:SCR_014601Visualizzazione di grafici PCA, grafici a vulcano e figure di sintesi
GitHub (opzionale)GitHub Inc.RRID:SCR_002630Controllo versione e condivisione di script riproducibili
HTSeq-count RNA-seq dataset (GSE162535)NCBI Gene Expression Omnibus (GEO)RRID:SCR_005012Matrice di conteggi RNA-seq bulk utilizzata come input per l'analisi
matrixStats (R package)CRANRRID:SCR_016361Calcolo efficiente di statistiche di riga/colonna (ad es. varianza)
openxlsx (R package)CRANRRID:SCR_019215Esportazione di tabelle dei risultati in formato Excel
Sistema operativoMicrosoft / Apple / LinuxN/ASupporto di Windows 10+, macOS o Linux
org.Mm.eg.db (R package)BioconductorRRID:SCR_002815Database di annotazione geni del topo per il mapping degli ID geni
Visualizzatore PDFQualsiasiN/AVisualizzazione delle figure di output (PCA, heatmap, grafici a vulcano)
Computer personale o workstationQualsiasiN/AMinimo 16 GB di RAM consigliato per l'analisi RNA-seq
pheatmap (R package)CRANRRID:SCR_016418Visualizzazione delle heatmap dell'espressione genica e del clustering
R Statistical Software (versione >= 4.2)R Foundation for Statistical ComputingRRID:SCR_001905Ambiente computazionale di base per tutta l'analisi RNA-seq
RColorBrewer (R package)CRANRRID:SCR_015742Palette di colori per heatmap e grafici
RStudio DesktopPosit SoftwareRRID:SCR_000432Ambiente di sviluppo integrato (IDE) per la scrittura di script e la riproducibilità
File di metadati del campione (formato CSV)Generato / Annotazioni GEON/AAnnotazione del campione curata che collega i campioni ai gruppi CB, MB e AB
stringr (R package)CRANRRID:SCR_019195Elaborazione delle stringhe per la visualizzazione e il formattaggio dell'arricchimento
tibble (R package)CRANRRID:SCR_019186Gestione dei data frame e strutture di dati puliti
tidyverse (suite di pacchetti R)CRANRRID:SCR_019186Manipolazione, trasformazione e visualizzazione dei dati
```

Riferimenti

  1. Storm J, Craig AG. Pathogenesis of cerebral malaria—inflammation and cytoadherence. Front Cell Infect Microbiol. 2014;4:100.
  2. Hinduja S, Kunieda M. Modelling of ECM and EDM processes. CIRP Annals. 2013 Jan 1;62(2):775–97.
  3. Soares SMA, Gualberto ACM, da Costa AC, Gonçalves DA, Gameiro J. A high-fat diet protects C57BL/6 mice from Plasmodium berghei ANKA infection in an experimental malaria study. Front Trop Dis. 2023;4:1188902.
  4. Manzoni G, Try R, Guintran JO, Christiansen-Jucht C, Jacoby E, Sovannaroth S, Zhang Z, Banouvong V, Shortus MS, Reyburn R, Chanthavisouk C. Progress towards malaria elimination in the Greater Mekong Subregion: perspectives from the World Health Organization. Malaria Journal. 2024 Mar 1;23(1):64.
  5. Wang Q, Tang Y, Pan Z, Yuan Y, Zou Y, Zhang H, et al. RNA-seq-based transcriptome analysis of the anti-inflammatory effect of artesunate in early treatment of a mouse cerebral malaria model. Mol Omics. 2022;18(8):716–30.
  6. Love MI, Huber W, Anders S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 2014;15(12):550.
  7. Anders S, Huber W. Differential expression analysis for sequence count data. Genome Biol. 2010;11(10):R106.
  8. Robinson MD, McCarthy DJ, Smyth GK. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data. bioinformatics. 2010 Jan 1;26(1):139-40.
  9. McCarthy DJ, Chen Y, Smyth GK. Differential expression analysis of multifactor RNA-Seq experiments with respect to biological variation. Nucleic Acids Res. 2012;40(10):4288–97.
  10. Conesa A, Madrigal P, Tarazona S, Gomez-Cabrero D, Cervera A, McPherson A, et al. A survey of best practices for RNA-seq data analysis. Genome Biol. 2016;17:13.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–7.
  12. Hänzelmann S, Castelo R, Guinney J. GSVA: gene set variation analysis for microarray and RNA-seq data. BMC Bioinformatics. 2013 Jan 16;14(1):7.
  13. Shen-Orr SS, Gaujoux R. Computational deconvolution: extracting cell type–specific information from heterogeneous samples. Curr Opin Immunol. 2013;25(5):571–8.
  14. Subramanian A, Tamayo P, Mootha VK, Mukherjee S, Ebert BL, Gillette MA, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545–50.
  15. Stark R, Grzelak M, Hadfield J. RNA sequencing: the teenage years. Nat Rev Genet. 2019;20(11):631–56.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Immunologia e InfezioniNumero 233Numero 233Valore VuotoNumeroSequenziamento dell'RNA bulkAnalisi trascrittomicaneuroinfiammazionetrattamento con artesunatoespressione genica differenzialeprofilazione delle vie immunitarie

Questo articolo è stato pubblicato

Video in arrivo