È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo metodologico

Un protocollo riproducibile basato su seurat per l'analisi del sequenziamento di RNA a cellule monocellulari del sangue periferico CD4+ durante la reinfezione da malaria

106 visualizzazioni

DOI:

10.3791/70858

31 luglio 2026

In questo articolo

Sommario

Qui presentiamo un protocollo riproducibile basato su Seurat per l'analisi dei dati di sequenziamento dell'RNA a cellule singole provenienti dalle cellule mononucleari del sangue periferico CD4⁺ T al fine di caratterizzare l'eterogeneità trascrizionale e i programmi immunitari funzionali durante la reinfezione malariaca. Questo protocollo consente un'identificazione, confronto e interpretazione biologica coerente degli stati dinamici delle cellule T CD4⁺ e delle risposte immunitarie in diverse condizioni.

Abstract

Qui presentiamo un protocollo riproducibile basato su Seurat per analizzare i dati di sequenziamento dell'RNA a cellule T PBMC CD4⁺ nelle singole cellule T nei momenti temporali della reinfezione malaria. Questo protocollo dimostra un flusso di lavoro riproducibile basato su Seurat per l'analisi dei dati di scRNA-seq di cellule T CD4⁺ PBMC attraverso i momenti temporali di reinfezione malaria, utilizzando dataset pubblici rappresentativi per dimostrarne l'applicazione: un dataset di cellule T TCR-transgeniche CD4⁺ specifico per Plasmodium (GSE233703) e un dataset policlonale CD4⁺ di cellule T che confronta i momenti temporali associati alla reinfezione (GSE233713; D27₍₃₎ contro D30). Il flusso di lavoro include preelaborazione standardizzata, integrazione, clustering e analisi trascritomiche a valle all'interno di un quadro computazionale unificato. Il metodo consente il calcolo sistematico dei punteggi dei moduli per programmi immunocellulari e CD4⁺ predefiniti, l'identificazione di geni marker specifici per cluster, l'analisi dell'espressione differenziale risolta nei momenti temporali e l'arricchimento della Gene Ontology e delle vie KEGG a valle. L'applicazione di questo flusso di lavoro identifica stati funzionali distinti delle cellule T CD4⁺ e rivela cambiamenti trascrizionali dinamici nei momenti temporali della reinfezione malaria. Il protocollo genera output di visualizzazione standardizzati e risultati tabulati e fornisce indicazioni pratiche sulla selezione dei parametri e la risoluzione dei problemi, facilitando un'analisi coerente e riproducibile dei dataset scRNA-seq delle cellule T CD4⁺ in contesti immunologici correlati. Questo protocollo consente un'analisi riproducibile e biologicamente interpretabile delle risposte immunitarie e può essere applicato a dataset simili a singole cellule nella ricerca immunologica.

Introduzione

La malaria rimane un importante onere globale per la salute, con infezioni ripetute che plasmano l'immunità dell'ospite in modi complessi e incompletamentecompresi: 1. I lecci CD4⁺ T svolgono un ruolo centrale nelle risposte immunitarie antimalariche coordinando la produzione di citochine effettrici, supportando l'aiuto delle cellule B e regolando l'infiammazione 2,3. Durante la reinfezione da malaria, le cellule T CD4⁺ subiscono una riprogrammazione trascrizionale dinamica, riflettendo spostamenti tra stati effettori, regolatori, di memoria, proliferatori ed esausti che influenzano sia il controllo dei parassiti sial'immunopatologia 4,5. Risolvere accuratamente questa eterogeneità è essenziale per comprendere la protezione immunitaria, la disfunzione immunitaria e la durabilità dell'immunità acquisita naturalmente o indotta da vaccino all'infezione da Plasmodium. Qui presentiamo un protocollo riproducibile basato su Seurat per analizzare i dati di scRNA-seq delle cellule T CD4⁺ attraverso i momenti temporali di reinfezione da malaria.

Il sequenziamento dell'RNA a singola cellula (scRNA-seq) consente la caratterizzazione ad alta risoluzione dell'eterogeneità immunitaria e ha identificato sottoinsiemi di cellule T CD4⁺ rispondenti ai parassiti, programmi di esaurimento e reti regolatorie nella malaria 6,7,8,9. Tuttavia, la variabilità analitica nel controllo qualità, nella normalizzazione, nel clustering e nell'integrazione può limitare la riproducibilità e complicare i confrontiincrociati 10,11. Tuttavia, manca un flusso di lavoro standardizzato e guidato biologicamente ottimizzato per analizzare la dinamica delle cellule T CD4⁺ durante la reinfezione da malaria.

I framework computazionali esistenti per l'analisi scRNA-seq, inclusi Seurat e Scanpy, forniscono strumenti completi per la pre-elaborazione, il clustering e l'interpretazione a valle dei dati a singolacella 12,13,14. Seurat, implementato in R, offre flussi di lavoro strettamente integrati per la normalizzazione, l'integrazione dei dati e la visualizzazione, inclusi approcci di stabilizzazione della varianza come SCTransform che migliorano la rilevazione dei segnali in dataset immunitarieterogenei 13. Scanpy, implementato in Python, offre soluzioni scalabili ottimizzate per grandi dataset e un uso efficiente della memoria, rendendolo particolarmente adatto per analisi ad alto throughput o basate sucloud 12,14. Nonostante questi progressi, rimane necessario flussi di lavoro standardizzati e riproducibili che affrontino esplicitamente le questioni biologiche nei contesti di infezione, mantenendo trasparenza, adattabilità e coerenza tra i dataset. L'attuale protocollo colma questa lacuna combinando la robustezza della pre-elaborazione basata su Seurat con un'interpretazione biologica strutturata adattata alle risposte delle cellule T CD4⁺ durante la reinfezione da malaria. Rispetto ai flussi di lavoro generali esistenti, questo protocollo enfatizza la riproducibilità, la selezione dei parametri biologicamente informata e un'analisi coerente cross-timepoint adattata ai modelli di infezione.

Una caratteristica chiave di questo protocollo è la sua enfasi sulla riproducibilità e sull'usabilità pratica. Le soglie di controllo qualità non sono fisse, ma sono derivate utilizzando approcci adatti ai dati basati sulla deviazione assoluta mediana, permettendo di scalare soglie per la complessità dei trascrivi, la profondità di sequenziamento e il contenuto mitocondriale con distribuzioni specifiche per dataset. Questo design rende il flusso di lavoro applicabile a dataset di dimensioni variabili, tipicamente da diverse migliaia a decine di migliaia di cellule, e su un'ampia gamma di profondità di sequenziamento comunemente incontrate negli esperimenti scRNA-seq basati su gocce. Le linee guida incorporate nel flusso di lavoro supportano la selezione appropriata dei parametri per la riduzione della dimensionalità, la risoluzione del clustering e l'integrazione, garantendo che le analisi rimangano sia biologicamente significative che tecnicamente robuste. Tuttavia, il flusso di lavoro dipende dalla qualità dei dati e dalla profondità del sequenziamento e può richiedere aggiustamenti per dataset con effetti di scarsità estrema o batch.

Questo protocollo è progettato per utenti intermedi o avanzati con una conoscenza di base dell'analisi R e single-cell, pur rimanendo accessibile ai principianti motivati grazie alla sua implementazione strutturata, a passi e output completamente riproducibili. Il flusso di lavoro genera tabelle e figure standardizzate in ogni fase, inclusi riassunti di controllo qualità, clustering output, risultati di espressioni differenziali e analisi di arricchimento, facilitando così trasparenza, validazione e riutilizzo in contesti collaborativi o multi-studio. Questo protocollo è particolarmente adatto per studi che indagano l'eterogeneità immunitaria tra momenti temporali o condizioni nella ricerca sull'infezione e nell'immunologia.

Il metodo fornisce un flusso di lavoro riproducibile e end-to-end basato su Seurat per l'analisi del seq scRNA-seq delle cellule T CD4⁺ nei momenti temporali della reinfezione malaria. Integra controllo qualità adattivo, stabilizzazione della varianza, riduzione dimensionale, clustering e integrazione multi-campione quandoappropriato 13,15. Per migliorare l'interpretabilità biologica, il flusso di lavoro incorpora la valutazione dei moduli genici del sottoinsieme delle cellule T CD4⁺ per quantificare programmi funzionali tra cui Th1, Tfh, Tr1, Treg, memoria centrale, memoria degli effettori, proliferazione, citotossicità ed esaurimento 16,17,18. Sono inclusi l'identificazione complementare dei marcatori di cluster, l'analisi dell'espressione differenziale nei momenti e l'arricchimento delle vie utilizzando Gene Ontology e database KEGG per supportare un'annotazione robusta e il confronto degli stati delle celluleT 19,20. Sebbene dimostrato utilizzando dataset pubblici di Plasmodium scRNA-seq, questo protocollo è ampiamente applicabile ad altri modelli di reinfezione da malaria e a perturbazioni immunologiche dove è necessaria un'analisi riproducibile e interpretabile a singola cellula delle cellule T CD4⁺. Nel complesso, questo protocollo fornisce un quadro riproducibile e biologicamente interpretabile per l'analisi a singola cellula delle risposte delle cellule T CD4⁺, supportando un'indagine approfondita della dinamica immunitaria nella malaria e nei sistemi correlati.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Dichiarazione etica:

Tutti i dati utilizzati in questo studio sono stati ottenuti da dataset pubblici (GSE233703 e GSE233713). Gli studi originali rispettavano le linee guida istituzionali ed etiche per la sperimentazione animale. Questo studio ha coinvolto l'analisi bioinformatica secondaria di dataset di sequenziamento di RNA a cellule singole disponibili pubblicamente e deidentificati ottenuti dal repository Gene Expression Omnibus (GEO) (GSE233703 e GSE233713). Non sono stati coinvolti nuovi partecipanti umani, campioni clinici o informazioni identificabili sui pazienti in questo studio. Secondo le linee guida istituzionali e nazionali per la ricerca che coinvolge dataset anonimizzati pubblicamente disponibili, non era necessaria un'approvazione etica aggiuntiva e un consenso informato per questa analisi bioinformatica. Gli studi originali associati a questi dataset sono stati condotti in conformità con gli standard etici istituzionali pertinenti e le linee guida applicabili per la ricerca biomedica.

1. Flusso di lavoro di analisi scRNA-seq CD4⁺ basato su Seurat riproducibile per GSE233703 e GSE233713

NOTA: Questo flusso di lavoro è fornito come File Supplementare S1. Consulta anche uno schema che offre una panoramica dell'intero flusso di lavoro (Figura 1).

  1. Definire l'ambito e gli utenti previsti prima di iniziare il protocollo
  2. Definire gli utenti destinati
    1. Utilizzare questo protocollo se l'utente ha una familiarità intermedia o avanzata con l'analisi del sequenziamento R e del sequenziamento dell'RNA a singola cellula (scRNA-seq).
    2. Applica questo flusso di lavoro ai dataset di cellule T CD4⁺ della milza murina generati in formato matriciale stile 10x. Usa la struttura a passo a passo e le uscite attese per verificare ogni fase prima di procedere.
      NOTA: Garantire pratiche adeguate di gestione dei dati e una conservazione sicura quando si lavora con grandi dataset di sequenziamento.
  3. Definisci scRNA-seq
    1. Considerare il sequenziamento dell'RNA a singola cellula (scRNA-seq) come un metodo trascrittomico²¹ che quantifica l'espressione genica nelle singole cellule.
    2. Utilizzare scRNA-seq per identificare stati cellulari discreti, popolazioni di transizione e programmi immunitari eterogenei all'interno di tessuti complessi.
  4. Prepara i requisiti del software e del pacchetto
  5. Installa il software base
    1. Installa R 4.2 o versioni successive.
    2. Apri l'interfaccia RStudio. Imposta la directory di lavoro usando setwd().
    3. Esegui gli script in sequenza usando la funzione source(). Annota le versioni esatte di R, RStudio e del sistema operativo nelle note del progetto.
  6. Installa pacchetti R
    1. Installa i pacchetti CRAN richiesti: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi e ggplot2.
    2. Installa i pacchetti Bioconductor richiesti: clusterProfiler, org. Mm.eg.db, enrichplot e DESeq2.
    3. Installare pacchetti opzionali solo se necessario: DoubletFinder per la rimozione dei doublet e monocle3 per l'analisi delle traiettorie. Carica tutti i pacchetti necessari all'inizio della sessione di analisi.
  7. Versioni discografiche
    1. Salva le informazioni di pacchetto e sessione alla fine del workflow usando sessionInfo() o una funzione equivalente.
    2. Riportare esplicitamente i componenti chiave di analisi nel manoscritto, inclusi la versione R, la versione Serat, la versione DESeq2 e la versione clusterProster.
  8. Esegui comandi di installazione di esempio menzionati nel file supplementare 2
  9. Conferma requisiti hardware e di archiviazione
  10. Conferma le risorse minime
    1. Usa una workstation con almeno 16 GB di RAM, 4 core CPU e 20 GB di spazio libero su disco per l'analisi di routine di dataset contenenti diverse migliaia fino a decine di migliaia di celle.
  11. Conferma le risorse consigliate
    1. Utilizzare 32 GB di RAM o più per analisi integrate, tracciature ripetute o il rilevamento opzionale del doppietto.
    2. Aumenta future.globals.maxSize se oggetti grandi o dataset integrati producono errori legati alla memoria.
    3. Applica un esempio di impostazione di memoria
  12. Esegui i seguenti comandi per impostare le opzioni di memoria menzionate nel file supplementare 2

2. Creare la struttura del progetto

  1. Crea la directory del progetto radice
    1. Crea una directory di progetti per l'analisi.
    2. Crea sottodirectory chiamate data/, script/ e results_spleen_cd4/.
  2. Utilizzo di una struttura di output standardizzata
    1. Assicurati che il flusso di lavoro scriva l'output nelle seguenti directory:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/tabelle/
      results_spleen_cd4/GSE233703/rds/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/tabelle/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. Usa una denominazione coerente dei file
    1. Rinomina i file di input GEO per corrispondere ai percorsi previsti dallo script.
    2. Usa i seguenti nomi di file esatti:
      dati/GSE233703_matrix.mtx.gz
      dati/GSE233703_genes.tsv.gz
      dati/GSE233703_barcodes.tsv.gz
      dati/GSE233713_d27_3_matrix.mtx.gz
      dati/GSE233713_d27_3_features.tsv.gz
      dati/GSE233713_d27_3_barcodes.tsv.gz
      dati/GSE233713_d30_matrix.mtx.gz
      dati/GSE233713_d30_features.tsv.gz
      dati/GSE233713_d30_barcodes.tsv.gz
    3. Nomina i file di metadati opzionali come segue:
      dati/GSE233703_cell_metadata.csv
      dati/GSE233713_cell_metadata.csv
  4. Confermare i requisiti di metadati
    1. Conferma che ogni file di metadati contenga una colonna di codice a barre. Aggiungi colonne opzionali come campione, timepoint e replica quando disponibile.
    2. Usa corrispondenze esatte di codici a barre tra metadati e matrici di conteggio.
      Attenzione: Conferma che i triplici di matrici e i file di metadati esistano sui percorsi attesi prima di iniziare l'importazione.

3. Importare le matrici di conteggio e validare l'integrità degli input

  1. Leggi matrici in stile 10x
    1. Leggi ogni matrix.mtx.gz file come una matrice sparsa.
    2. Leggi il corrispondente file di caratteristiche (o geni) e il file di codice a barre come tabelle delimitate da tab.
    3. Assegna i simboli geni alle righe della matrice usando la seconda colonna del file feature quando disponibile. Imporre simboli genici unici usando make.unique().
    4. Assegnare gli identificatori di codice a barre alle colonne della matrice.'
  2. Esegui la funzione di importazione di esempi
    1. Esegui il codice menzionato nel file supplementare 2, per importare la matrice e assegnare gli identificatori.
  3. Valida l'integrità della matrice
    1. Verifica che il numero di righe della matrice sia uguale al numero di caratteristiche. Verifica che il numero di colonne della matrice sia uguale al numero di codici a barre.
    2. Interrompi il flusso di lavoro se si rileva qualche disallineamento.
      NOTA: Se vengono rilevati disallineamenti, verifica l'integrità dei file e assicurati il corretto allineamento dei file feature e codice a barre prima di rieseguire il passaggio.
      Checkpoint: Procedi solo se i conteggi delle righe corrispondono alle caratteristiche e i conteggi delle colonne corrispondono ai codici a barre.

4. Definire i pannelli di marcatori e moduli

  1. Definire i panel di cellule T CD4⁺ rilevanti per la malaria
    1. Definisci i pannelli genetici nominati per: Th1, Tfh, Tr1, Treg, Tcm, Tem, Esaurimento, Proliferazione, Citotossico, Activation_early, Interferon_response, Immune_regulation
    2. Conserva questi pannelli in una lista R nominata per la punteggio dei moduli a valle.
  2. Esegui il codice R menzionato nel file supplementare 2 per definire i pannelli genici.
  3. Definire geni di validazione dei marcatori
    1. Definire un pannello di validazione separato contenente geni marcatori canonici come Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 e Lef1.

5. Creare oggetti Seurat e calcolare metriche di controllo qualità

  1. Inizializzare oggetti Seurat
    1. Crea un oggetto Seurat per ogni dataset usando min.celle = 3 e min.features = 0. Non imporre tagli di funzionalità arbitrari all'importazione.
    2. Aggiungi dataset, campione e metadati di timepoint. Unisci i metadati opzionali usando il matching dei codici a barre.
  2. Esegui esempio di inizializzazione di oggetti Seurat
    1. Esegui il codice R menzionato nel file supplementare 2 per creare un oggetto Seurat e assegnare i metadati.
  3. Calcolare metriche di controllo qualità
    1. Calcola la frazione del trascrito mitocondriale usando il prefisso murino ^mt-.
    2. Quantifica le seguenti metriche
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Esegui il codice di esempio menzionato nel file supplementare 2.
  5. Visualizza il controllo qualità pre-filtro
    1. Genera trame di violino per nFeature_RNA, nCount_RNA e percent.mt. Genera diagrammi di scatter per nCount_RNA contro nFeature_RNA e nCount_RNA contro percent.mt.
    2. Salva le figure pre-filtro usando nomi standardizzati come QC_pre_filter_AllCells_vln.png e QC_pre_filter_AllCells_scatter.png.
      Attenzione: Aspettatevi ampie distribuzioni pre-filtro con code di bassa qualità e possibili outlier ad alto conteggio.

6. Derivare soglie di QC adattive e filtrare celle di bassa qualità

  1. Derivare soglie specifiche per dataset
    1. Trasformata logaritmica nFeature_RNA + 1 e nCount_RNA + 1. Calcolare la deviazione assoluta mediana e mediana (MAD) per entrambe le variabili trasformate.
    2. Definisci le seguenti soglie:
      min_features = 10^(mediana - 3 × MAD) - 1
      max_features = 10^(mediana + 3 × MAD) - 1
      min_counts = 10^(mediana - 3 × MAD) - 1
      max_counts = 10^(mediana + 3 × MAD) – 1
    3. Definire la soglia mitocondriale come il 95° percentile di percent.mt più 3 × MAD, vincolata tra il 5% e il 20%.
    4. Assicurati che dataset_id, sample_id e out_dir siano correttamente specificati prima di eseguire la funzione.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. Applicare il filtraggio
    1. Conservare le cellule che soddisfano tutti i criteri adattivi:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Esegui il codice di esempio menzionato nel file supplementare 2.
  3. Salva gli output di filtraggio
    1. Salva QC_thresholds_*.csv e cell_counts_summary_*.csv.
      PUNTO DI PAUSA: Salva output intermedi e riprendi l'analisi da questo passaggio se necessario.
    2. Genera e salva i diagrammi di violino e scatter di controllo qualità post-filtro.
      Checkpoint: Aspettati distribuzioni post-filtro più strette, rimozione di celle a bassa complessità e riduzione degli outlier estremi.

7. Normalizzare i dati ed eseguire PCA

  1. Normalizzare e stabilizzare la varianza
    1. Normalizzare il saggio sull'RNA prima del punteggio del ciclo cellulare. Esegui la registrazione del cellulare se attivata. Usa SCTransform() per la stabilizzazione della varianza.
    2. Regressi il contenuto mitocondriale solo se biologicamente giustificato ed esplicitamente abilitato.
    3. Regressi i punteggi del ciclo cellulare solo se necessario per il disegno dello studio.
  2. Esegui la normalizzazione di esempio come menzionato nel file supplementare 2.
  3. Definire i valori dei parametri
    1. Usa n_variable_features = 3000.
    2. Usa dims_max_for_pca = 50.
    3. Dichiarare esplicitamente questi valori nel manoscritto.
  4. Eseguire PCA e selezionare componenti principali
    1. Esegui PCA sull'analisi normalizzata. Confermare l'esecuzione PCA riuscita ispezionando la varianza spiegata e i carichi dei componenti principali.
    2. Calcolare la varianza spiegata da ogni componente principale.
  5. Seleziona i PC seguendo tutti e tre i criteri:
    1. Mantenere i PG che spiegano almeno l'1% della varianza,
    2. Assicurarsi che la varianza cumulativa raggiunga circa l'80 %,
    3. Limita la selezione finale tra 10 e 40 PG.
    4. Salva PCA_variance_table_*.csv, PCA_selection_rationale_*.csv e PCA_Elbow_*.png.
  6. Esegui esempio PCA
    1. Esempio come menzionato nel file supplementare 2.
      Checkpoint: Aspettati un grafico a gomito con una diminuzione visibile del guadagno marginale della varianza dopo la soglia selezionata.

8. Costruire vicini, selezionare la risoluzione e ammassare celle

  1. Struttura del grafo di costruzione
    1. Costruisci un grafo condiviso del vicino più prossimo usando i PC selezionati.
    2. Esegui un clustering iniziale a bassa risoluzione se il rilevamento dei doppi è necessario il cluster label.
  2. Opzionalmente rimuovere i doppietti
    1. Esegui DoubletFinder solo se installato e compatibile.
      NOTA: Esegui la rilevazione dei doppietti solo per dataset con elevato numero di celle in cui si prevedono artefatti multipletti.
    2. Ricalcolare la normalizzazione e la PCA dopo la rimozione del doppietto.
  3. Seleziona risoluzione di clustering
    1. Valutare le risoluzioni 0.2, 0.4, 0.6, 0.8, 1.0 e 1.2.8.3.2
    2. Calcola la larghezza media della silhouette per ogni risoluzione testata. Seleziona la risoluzione con il punteggio silhouette più alto tra le soluzioni con almeno due cluster.
    3. Salva resolution_sweep_*.csv, resolution_selection_rationale_*.csv e resolution_sweep_*.png.
  4. Esegui la selezione della risoluzione degli esempi eseguendo il codice menzionato nel file supplementare 2
  5. Esegui UMAP e clustering finale.
    1. Esegui UMAP usando i PC selezionati.
    2. Ricostruisci il grafo del vicino più prossimo. Cluster celle usando la risoluzione selezionata.
    3. Salva i grafici UMAP etichettati per cluster e raggruppati per campione o timepoint. Esegui il seguente codice menzionato nel file supplementare 2.
      Attenzione: Aspettatevi una separazione stabile dei cluster e una struttura UMAP interpretabile coerente con stati immunitari principali.

9. Eseguire l'integrazione basata su SCT per GSE233713

  1. Prepara oggetti separati
    1. Crea oggetti Seurat separati per D27_3 e D30.
    2. Applica il controllo qualità e il filtraggio in modo indipendente a ogni campione. Normalizzare ogni campione separatamente con SCTransform().
  2. Giustificare l'integrazione
    1. Utilizzare l'integrazione basata su SCT per ridurre le differenze tecniche tra i punti temporali preservando la struttura biologica condivisa.
    2. Non dare per scontato che l'integrazione sia automaticamente vantaggiosa. Validalo esplicitamente.
  3. Integrare campioni
    1. Seleziona le funzionalità di integrazione utilizzando SelectIntegrationFeatures(). Prepara gli oggetti con PrepSCTIntegration().
    2. Trova ancoraggi con FindIntegrationAnchors(normalization.method = "SCT"). Integra i dataset con IntegrateData(normalization.method = "SCT").
  4. Esegui l'integrazione di esempio menzionata nel file supplementare 2
  5. Validare l'integrazione
    1. Genera grafici UMAP pre-integrazione e post-integrazione raggruppati per punto temporale. Interpretare il miglioramento della miscelazione delle celle tra i punti temporali come prova di integrazione di successo.
    2. Calcolare il mixing dei vicini prima e dopo l'integrazione. Calcola la composizione del cluster per punto temporale e genera grafici di composizione impilato.
    3. Salva i seguenti risultati:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Attenzione: Aspettatevi una riduzione della segregazione dei punti temporali dopo l'integrazione, un aumento del mescolaggio dei vicini e un contributo multi-punti temporali alla maggior parte dei cluster senza una perdita completa di una struttura biologicamente significativa.

10. Annotare cluster e validare la struttura dei marker

  1. Valuta i moduli rilevanti per la malaria
    1. Esegui AddModuleScore() per i pannelli predefiniti delle cellule T CD4⁺ della malaria.
    2. Salva le medie a livello di cluster dei moduli e le classifiche dei moduli.
  2. Esegui esempi di punteggio modulo menzionato nel file supplementare 2
  3. Assegna le etichette del cluster previsto
    1. Assegnare il modulo con il primo rango a ciascun cluster come etichetta prevista.
    2. Salva:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Convalida i cluster con marcatori canonici
    1. Esegui DotPlots e FeaturePlots di validazione dei marcatori utilizzando il pannello dei marker canonico.
    2. Salva:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Attenzione: Aspettatevi espressione concordante di più geni canonici per stato funzionale, non segnali isolati di un singolo gene.

11. Identificare i marcatori ed eseguire espressioni differenziali.

  1. Trova i marcatori di cluster
    1. Esegui FindAllMarkers() usando solo i marker positivi.
    2. Risparmia markers_all_clusters_*.csv.
  2. Esegui il codice menzionato nel file supplementare per eseguire l'identificazione dell'esempio del marcatore
  3. Utilizzare espressione differenziale consapevole della replica quando disponibile
    1. Controlla se sono disponibili metadati replicati validi. Se sono disponibili repliche, si aggregano i conteggi per replica e condizione ed eseguire pseudobulk DE con DESeq2.
    2. Salva DE_pseudobulk_*.
  4. Utilizzare espressione differenziale esplorativa a livello cellulare quando le repliche sono assenti
    1. Se i metadati replicati sono assenti o insufficienti, eseguire DE a singola cella come analisi esplorativa.
    2. Salva DE_WARNING_* per documentare lo stato esplorativo. Salva i risultati esplorativi come DE_exploratory_celllevel_*.
  5. Generare output di espressione differenziale globale
    1. Crea grafici di vulcani per i risultati delle DE e salva Volcano_*.
    2. Salva i risultati significativi delle DE come tabelle filtrate.
  6. Generare output di arricchimento funzionale
    1. Esegui l'arricchimento del processo biologico GO e risparmia GO_BP_*. Esegui l'arricchimento KEGG e salva KEGG_*.
    2. Esegui GSEA usando i fold-changes classificati log2 e salva GSEA_GO_*. Salva i corrispondenti diagrammi di barre e punti grafici.
  7. Generare output differenziali specifici per cluster
    1. Esegui DE all'interno di ogni cluster tra i momenti temporali.
    2. Salva DE_cluster_* e DE_cluster_specific_combined_*.
  8. Generare output differenziali di espressione focalizzati sull'immunità
    1. Estraggiamo i risultati della DE per geni immunitari selezionati come Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 e Tbx21.
    2. Salva DE_immune_focus_*.
    3. Genera e salva i seguenti output:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Attenzione: aspettati coerenza tra DE globale, output di arricchimento, DE specifico per cluster e firme focalizzate sull'immune.

12. Salva gli output finali e archivia la sessione

  1. Salva oggetti Seurat
    1. Salva gli oggetti finali Seurat in formato .rds per ogni dataset.
  2. Salva le informazioni della sessione
    1. Scrivi sessionInfo() in un file di testo nella cartella di output.
  3. Esegui il codice menzionato nel file supplementare 2 per eseguire l'esportazione di sessioni di esempio
  4. Verifica la completezza dell'uscita
    1. Conferma che le fig/, tabelle/ e rds/directory attese contengano i file corrispondenti.
    2. Archiviare script, informazioni di sessione e output insieme.
      Attenzione: Non procedere alla scrittura dei report finché riassunti QC, output PCA, output di selezione della risoluzione, diagnostiche di integrazione, file di annotazione dei moduli, output DE e file di arricchimento non sono tutti presenti e internamente coerenti.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Qualità del sequenziamento e controllo qualità a livello cellulare (cellule TCR-transgeniche CD4⁺ (GSE233703)) specifiche per antigeni (reattive a PcAS))

Le distribuzioni QC pre-filtro (Figura 2A) hanno mostrato complessità eterogenea dei trascrivi, con la maggior parte delle cellule che mostrano conteggi genici e UMI moderati e un sottoinsieme più piccolo che mostra profili di outlier ad alto numero coerenti con ...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo studio presenta un flusso di lavoro standardizzato e riproducibile basato su Seurat per analizzare la dinamica trascrizionale delle cellule T CD4⁺ durante la reinfezione da malaria. Il protocollo integra il controllo di qualità adattivo, la normalizzazione, la riduzione della dimensionalità, il clustering, l'integrazione di dataset, la validazione dei marker, il rating dei moduli e l'analisi differenziale delle espressioni all'interno di un quadro computazionale unificato. Insieme...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori non hanno nulla da rivelare.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Nome del materiale / EquipaggiamentoAzienda / FonteNumero di catalogoCommenti / Descrizione
Matrici di conteggio in formato 10x Genomics–NCBI GEON/AFile Matrix Market (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (pacchetto R)BioconductorN/ARRID:SCR_016884; Analisi di arricchimento funzionale (GO, KEGG)
enrichplot (pacchetto R)BioconductorN/ARRID:SCR_017030; Visualizzazione dei risultati dell'analisi di arricchimento
Dataset GEO GSE233703NCBI Gene Expression OmnibusGSE233703Dataset scRNA-seq di cellule T CD4+ transgeniche TCR-specifiche per PcAS
Dataset GEO GSE233713NCBI Gene Expression OmnibusGSE233713Dataset scRNA-seq di cellule T CD4+ policlonali (D273 vs D30)
GitHub (opzionale)GitHub Inc.N/ARRID:SCR_002630; Controllo versione e riproducibilità (opzionale)
glmGamPoi (pacchetto R)BioconductorN/ARRID:SCR_021001; Modello SCTransform accelerato
Matrix (pacchetto R)CRANN/ARRID:SCR_008389; Gestione matrici sparse per dati scRNA-seq
Sistema operativoMicrosoft / Apple / LinuxN/ASupportato Windows 10+, macOS, o Linux
org.Mm.eg.db (pacchetto R)BioconductorN/ARRID:SCR_002643; Database di annotazione geni del topo
patchwork (pacchetto R)CRANN/ARRID:SCR_018787; Assemblaggio di figure multi-pannello
Visualizzatore PDFQualsiasiN/AVisualizzazione di grafici QC, UMAP e heatmap
Computer personale o workstationQualsiasiN/AMinimo 16–32 GB RAM consigliato per l'integrazione
pheatmap (pacchetto R)CRANN/ARRID:SCR_016418; Visualizzazione heatmap dell'espressione genica
Software statistico R (versione >= 4.2)R Foundation for Statistical ComputingN/ARRID:SCR_001905; Ambiente computazionale di base
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Ambiente di sviluppo integrato per R
Seurat (pacchetto R, v4 o successivo)Satija LabN/ARRID:SCR_016341; Analisi scRNA-seq
tidyverse (suite di pacchetti R)CRANN/ARRID:SCR_019186; Manipolazione e visualizzazione dati

Riferimenti

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Immunologia e InfezioniNumero 233Numero 233Valore VuotoNumeroscRNA-seqPBMCIntegrazione trascrittomicaScoring dei moduli immunitari

Questo articolo è stato pubblicato

Video in arrivo