Ein Abonnement von JoVE ist erforderlich, um diesen Inhalt anzuzeigen. Melden Sie sich an oder beginnen Sie noch heute mit einer kostenlosen Testphase.

Methodenartikel

Ein reproduzierbares, seuratbasiertes Protokoll zur Einzelzell-RNA-Sequenzierungsanalyse peripherer Blutmononuklearzellen CD4+ T-Zellen während einer Malaria-Reinfektion

106 Aufrufe

DOI:

10.3791/70858

31. Juli 2026

In diesem Artikel

Zusammenfassung

Hier präsentieren wir ein reproduzierbares, auf Seurat basierendes Protokoll zur Analyse von Einzelzell-RNA-Sequenzierungsdaten aus peripheren Blutmononuklearzellen CD4⁺ T-Zellen, um die transkriptionelle Heterogenität und funktionelle Immunprogramme während einer Malaria-Reinfektion zu charakterisieren. Dieses Protokoll ermöglicht eine konsistente Identifikation, Vergleichsweise und biologische Interpretation dynamischer CD4⁺-T-Zellzustände und Immunantworten über verschiedene Erkrankungen hinweg.

Zusammenfassung

Hier präsentieren wir ein reproduzierbares, auf Seurat basierendes Protokoll zur Analyse von PBMC CD4⁺ T-Zell-Einzelzell-RNA-Sequenzierungsdaten über Malaria-Reinfektionszeitpunkte hinweg. Dieses Protokoll demonstriert einen reproduzierbaren Seurat-basierten Workflow zur Analyse von PBMC CD4⁺ T-Zell scRNA-seq-Daten über Malaria-Reinfektionszeitpunkte hinweg, wobei repräsentative öffentlich verfügbare Datensätze verwendet werden, um seine Anwendung zu demonstrieren: ein Plasmodium-spezifischer TCR-transgener CD4⁺ T-Zell-Datensatz (GSE233703) und ein polyklonaler CD4⁺-T-Zell-Datensatz, der reinfektionsassoziierte Zeitpunkte (GSE233713; D27₍₃₎ gegenüber D30). Der Workflow umfasst standardisierte Vorverarbeitung, Integration, Clustering und nachgelagerte transkriptomische Analysen innerhalb eines einheitlichen rechnergestützten Rahmens. Die Methode ermöglicht die systematische Berechnung von Modulwerten für vordefinierte Immun- und CD4⁺-T-Zell-Programme, die Identifikation clusterspezifischer Markergene, zeitpunktaufgelöste differenzielle Expressionsanalyse sowie die nachfolgende Anreicherung der Genontologie und KEGG-Wege. Die Anwendung dieses Workflows identifiziert unterschiedliche CD4⁺-T-Zell-Funktionszustände und zeigt dynamische transkriptionelle Veränderungen über Malaria-Reinfektionszeitpunkte hinweg. Das Protokoll erzeugt standardisierte Visualisierungsergebnisse und tabellierte Ergebnisse und bietet praktische Anleitungen zur Parameterauswahl und -fehlerbehebung, was eine konsistente und reproduzierbare Analyse von CD4⁺-T-Zell-scRNA-seq-Datensätzen in Malaria- und verwandten immunologischen Kontexten erleichtert. Dieses Protokoll ermöglicht reproduzierbare und biologisch interpretierbare Analysen von Immunantworten und kann auf ähnliche Einzelzell-Datensätze in der immunologischen Forschung angewendet werden.

Einleitung

Malaria bleibt eine große globale Gesundheitsbelastung, wobei wiederholte Infektionen die Immunität des Wirts auf komplexe und unvollständig verstandene Weise formen1. CD4⁺-T-Zellen spielen eine zentrale Rolle bei den antimalarialen Immunantworten, indem sie die Produktion von Effektorzytokinen koordinieren, die Unterstützung der B-Zellen unterstützen und Entzündungenregulieren. Während der Malaria-Reinfektion durchlaufen CD4⁺-T-Zellen eine dynamische transkriptionelle Reprogrammierung, die Veränderungen zwischen Effektor-, regulatorischen, Gedächtnis-, proliferativen und erschöpften Zuständen widerspiegelt, die sowohl die Parasitenkontrolle als auch die Immunpathologiebeeinflussen 4,5. Die genaue Lösung dieser Heterogenität ist entscheidend, um den Immunschutz, die Immunfunktionsstörungen und die Beständigkeit der natürlich erworbenen oder impfstoffinduzierten Immunität gegen Plasmodium-Infektionen zu verstehen. Hier präsentieren wir ein reproduzierbares Seurat-basiertes Protokoll zur Analyse von CD4⁺ T-Zell scRNA-seq-Daten über Zeitpunkte der Malaria-Reinfektion.

Die Einzelzell-RNA-Sequenzierung (scRNA-seq) ermöglicht eine hochauflösende Charakterisierung der Immunheterogenität und hat parasiten-responsive CD4⁺-T-Zell-Subsets, Erschöpfungsprogramme und regulatorische Netzwerke bei Malaria 6,7,8,9 identifiziert. Allerdings kann analytische Variabilität in der Qualitätskontrolle, Normalisierung, Clusterbildung und Integration die Reproduzierbarkeit einschränken und Studienvergleiche erschweren. Es fehlt jedoch ein standardisierter und biologisch geführter Workflow, der speziell für die Analyse der CD4⁺-T-Cell-Dynamik während einer Malaria-Reinfektion optimiert ist.

Bestehende rechnergestützte Rahmenwerke für scRNA-seq-Analysen, darunter Seurat und Scanpy, bieten umfassende Werkzeuge für die Vorverarbeitung, Clusterbildung und nachgelagerte Interpretation von Einzelzelldaten 12,13,14. Seurat, implementiert in R, bietet eng integrierte Arbeitsabläufe für Normalisierung, Datenintegration und Visualisierung, einschließlich varianzstabilisierender Ansätze wie SCTransform, die die Signalerkennung in heterogenen Immundatensätzen verbessern13. Scanpy, implementiert in Python, bietet skalierbare Lösungen, die für große Datensätze und effiziente Speichernutzung optimiert sind, was es besonders für Hochdurchsatz- oder cloudbasierte Analysen geeignet macht12,14. Trotz dieser Fortschritte besteht weiterhin Bedarf an standardisierten, reproduzierbaren Arbeitsabläufen, die biologische Fragen in Infektionskontexten explizit adressieren und gleichzeitig Transparenz, Anpassungsfähigkeit und Konsistenz über Datensätze hinweg gewährleisten. Das vorliegende Protokoll schließt diese Lücke, indem es die Robustheit der Seurat-basierten Vorverarbeitung mit einer strukturierten biologischen Interpretation kombiniert, die auf CD4⁺-T-Zell-Antworten während einer Malaria-Reinfektion zugeschnitten ist. Im Vergleich zu bestehenden allgemeinen Arbeitsabläufen legt dieses Protokoll Wert auf Reproduzierbarkeit, biologisch informierte Parameterauswahl und konsistente zeitübergreifende Analyse, die auf Infektionsmodelle zugeschnitten ist.

Ein zentrales Merkmal dieses Protokolls ist sein Fokus auf Reproduzierbarkeit und praktische Benutzerfreundlichkeit. Qualitätskontrollschwellenwerte sind nicht festgelegt, sondern werden mit datenadaptiven Ansätzen auf Basis der medianen absoluten Abweichung abgeleitet, wodurch Schwellenwerte für Transkriptkomplexität, Sequenzierungstiefe und mitochondrialen Inhalt mit datensatzspezifischen Verteilungen skaliert werden können. Dieses Design macht den Arbeitsablauf auf Datensätze unterschiedlicher Größe anwendbar, typischerweise von mehreren Tausend bis Zehntausenden von Zellen, sowie über eine breite Palette von Sequenzierungstiefen, wie sie häufig in tropfenbasierten scRNA-Seq-Experimenten vorkommen. Im Workflow eingebettete Leitlinien unterstützen die passende Parameterauswahl zur Dimensionsreduktion, Clusterauflösung und Integration, sodass Analysen sowohl biologisch sinnvoll als auch technisch robust bleiben. Dennoch hängt der Arbeitsablauf von der Datenqualität und der Sequenztiefe ab und kann Anpassungen bei Datensätzen mit extremer Sparsamkeit oder Batch-Effekten erfordern.

Dieses Protokoll ist für fortgeschrittene bis mittlere Nutzer mit grundlegender Kenntnisse in R und Einzelzellanalyse konzipiert und bleibt dennoch für motivierte Anfänger durch seine strukturierte, schrittweise Implementierung und vollständig reproduzierbaren Ausgaben zugänglich. Der Workflow generiert in jeder Stufe standardisierte Tabellen und Abbildungen, einschließlich Qualitätskontrollzusammenfassungen, Clustering-Ausgaben, Differenziell-Expressionsergebnissen und Anreicherungsanalysen, wodurch Transparenz, Validierung und Wiederverwendung in kollaborativen oder mehrfachen Studienkontexten ermöglicht werden. Dieses Protokoll eignet sich besonders gut für Studien, die die Immunheterogenität über Zeitpunkte oder Zustände in der Infektions- und Immunologieforschung hinweg untersuchen.

Die Methode bietet einen reproduzierbaren, End-to-End-Seurat-basierten Workflow für CD4⁺ T-Zell scRNA-seq-Analyse über Zeitpunkte der Malaria-Reinfektion hinweg. Es integriert adaptive Qualitätskontrolle, Varianzstabilisierung, Dimensionsreduktion, Clustering und Multi-Sample-Integration, wenn angebracht13,15. Um die biologische Interpretierbarkeit zu verbessern, integriert der Arbeitsablauf immune und CD4⁺-T-Zell-Subset-Genmodul-Bewertung, um funktionelle Programme wie Th1, Tfh, Tr1, Treg, zentrales Gedächtnis, Effektorgedächtnis, Proliferation, Zytotoxizität und Erschöpfung 16,17,18 zu quantifizieren. Komplementäre Clustermarker-Identifikation, Zeitpunkt-Differentialexpressionsanalyse und Signalweganreicherung mittels Gene Ontology- und KEGG-Datenbanken sind enthalten, um eine robuste Annotation und den Vergleich von T-Zell-Zuständenzu unterstützen 19,20. Obwohl dies mit öffentlich zugänglichen Plasmodium scRNA-seq-Datensätzen demonstriert wurde, ist dieses Protokoll weitgehend auf andere Malaria-Reinfektionsmodelle und immunologische Störungen anwendbar, bei denen eine reproduzierbare und interpretierbare Einzelzellanalyse von CD4⁺-T-Zellen erforderlich ist. Insgesamt bietet dieses Protokoll einen reproduzierbaren und biologisch interpretierbaren Rahmen für die Einzelzellanalyse der CD4⁺-T-Zell-Antworten und unterstützt eine robuste Untersuchung der Immundynamik in Malaria und verwandten Systemen.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Protokoll

Ethik-Erklärung:

Alle in dieser Studie verwendeten Daten stammen aus öffentlich zugänglichen Datensätzen (GSE233703 und GSE233713). Die ursprünglichen Studien entsprachen institutionellen und ethischen Richtlinien für Tierversuche. Diese Studie umfasste sekundäre bioinformatische Analyse öffentlich zugänglicher und deidentifizierter Einzelzell-RNA-Sequenzierungsdatensätze, die aus dem Gene Expression Omnibus (GEO)-Repository (GSE233703 und GSE233713) bezogen wurden. An dieser Studie waren keine neuen menschlichen Teilnehmer, klinischen Proben oder identifizierbare Patientendaten beteiligt. Nach den institutionellen und nationalen Richtlinien für Forschung mit öffentlich zugänglichen anonymisierten Datensätzen waren für diese bioinformatische Analyse keine zusätzliche ethische Genehmigung und informierte Zustimmung erforderlich. Die ursprünglichen Studien, die mit diesen Datensätzen verbunden sind, wurden gemäß den relevanten institutionellen ethischen Standards und den anwendbaren Richtlinien für biomedizinische Forschung durchgeführt.

1. Reproduzierbarer Seurat-basierter CD4⁺ T-Zell scRNA-seq Analyse-Workflow für GSE233703 und GSE233713

HINWEIS: Dieser Workflow wird als Supplementary File S1 bereitgestellt. Siehe auch einen Schaltplan, der einen Überblick über den gesamten Arbeitsablauf gibt (Abbildung 1).

  1. Definieren Sie den Umfang und die vorgesehenen Benutzer, bevor Sie das Protokoll starten
  2. Definieren Sie die beabsichtigten Benutzer
    1. Verwenden Sie dieses Protokoll, wenn der Nutzer mittlere bis fortgeschrittene Kenntnisse mit R- und Einzelzell-RNA-Sequenzierung (scRNA-seq) Analysen hat.
    2. Wenden Sie diesen Workflow auf Milz-CD4⁺-T-Zell-Datensätze an, die im 10x-Matrixformat generiert werden. Verwenden Sie die schrittweise Struktur und die erwarteten Ausgaben, um jede Stufe zu überprüfen, bevor Sie fortfahren.
      HINWEIS: Stellen Sie angemessene Datenhandhabungspraktiken und sichere Speicherung bei der Arbeit mit großen Sequenzierungsdatensätzen sicher.
  3. Definiere scRNA-seq
    1. Behandle die Einzelzell-RNA-Sequenzierung (scRNA-seq) als transkriptomische Methode²¹, die die Genexpression in einzelnen Zellen quantifiziert.
    2. Verwenden Sie scRNA-seq, um diskrete Zellzustände, Übergangspopulationen und heterogene Immunprogramme innerhalb komplexer Gewebe zu identifizieren.
  4. Software- und Paketanforderungen vorbereiten
  5. Kernsoftware installieren
    1. Installiere R 4.2 oder neuer.
    2. Öffne die RStudio-Schnittstelle. Setze das Arbeitsverzeichnis mit setwd().
    3. Führen Sie Skripte sequentiell mit der Quellfunktion (source() aus. Zeichnen Sie die genauen Versionen von R, RStudio und dem Betriebssystem in den Projektnotizen auf.
  6. Installiere R-Pakete
    1. Installiere die erforderlichen CRAN-Pakete: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi und ggplot2.
    2. Installieren Sie die erforderlichen Bioconductor-Pakete: clusterProfiler, org. Mm.eg.db, Enrichplot und DESeq2.
    3. Optionale Pakete nur bei Bedarf installieren: DoubletFinder zur Entfernung von Doublets und Monocle3 zur Trajektorienanalyse. Laden Sie alle erforderlichen Pakete zu Beginn der Analysesitzung.
  7. Schallplattenversionen
    1. Speichere Paket- und Sitzungsinformationen am Ende des Workflows mit sessionInfo() oder einer gleichwertigen Funktion.
    2. Berichte die wichtigsten Analysekomponenten explizit im Manuskript, einschließlich der R-Version, der Seurat-Version, der DESeq2-Version und der clusterProfiler-Version.
  8. Führe Beispielinstallationsbefehle aus, die in der Ergänzungsdatei 2 erwähnt werden
  9. Bestätigen Sie Hardware- und Speicheranforderungen
  10. Bestätigen Sie Mindestressourcen
    1. Verwenden Sie eine Arbeitsstation mit mindestens 16 GB RAM, 4 CPU-Kerne und 20 GB freiem Festplattenspeicher für routinemäßige Analyse von Datensätzen mit mehreren tausend bis zehntausenden Zellen.
  11. Bestätigen Sie empfohlene Ressourcen
    1. Verwenden Sie 32 GB oder mehr RAM für integrierte Analysen, wiederholtes Plotten oder optionale Doublet-Erkennung.
    2. Erhöhe future.globals.maxSize, wenn große Objekte oder integrierte Datensätze speicherbezogene Fehler erzeugen.
    3. Beispiel-Speichereinstellung anwenden
  12. Führe die folgenden Befehle aus, um Speicheroptionen zu setzen, die in der Ergänzungsdatei 2 erwähnt werden

2. Erstellen Sie die Projektstruktur

  1. Erstellen Sie das Root-Projektverzeichnis
    1. Erstellen Sie ein Projektverzeichnis für die Analyse.
    2. Erstelle Unterverzeichnisse namens data/, script/, und results_spleen_cd4//.
  2. Verwenden Sie eine standardisierte Ausgabestruktur
    1. Stellen Sie sicher, dass der Workflow die Ausgabe in die folgenden Verzeichnisse schreibt:
      results_spleen_cd4/GSE233703/Fig/
      results_spleen_cd4/GSE233703/Tabellen/
      results_spleen_cd4/GSE233703/rds/
      results_spleen_cd4/GSE233713/Fig/
      results_spleen_cd4/GSE233713/tables/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. Verwenden Sie konsistente Dateibenennungen
    1. Umbenenne GEO-Eingabedateien, damit sie zu den vom Skript erwarteten Pfaden passen.
    2. Verwenden Sie die folgenden genauen Dateinamen:
      Daten/GSE233703_matrix.mtx.gz
      Daten/GSE233703_genes.tsv.gz
      Daten/GSE233703_barcodes.tsv.gz
      Daten/GSE233713_d27_3_matrix.mtx.gz
      Daten/GSE233713_d27_3_features.tsv.gz
      Daten/GSE233713_d27_3_barcodes.tsv.gz
      Daten/GSE233713_d30_matrix.mtx.gz
      Daten/GSE233713_d30_features.tsv.gz
      Daten/GSE233713_d30_barcodes.tsv.gz
    3. Benennen optionale Metadatendateien wie folgt:
      Daten/GSE233703_cell_metadata.csv
      Daten/GSE233713_cell_metadata.csv
  4. Metadatenanforderungen bestätigen
    1. Bestätigen Sie, dass jede Metadatendatei eine Barcode-Spalte enthält. Fügen Sie optionale Spalten wie Sample, Timepoint und Replizieren ein, wenn verfügbar.
    2. Verwenden Sie exakte Barcode-Übereinstimmungen zwischen Metadaten- und Zählmatrizen.
      Vorsicht: Bestätigen Sie, dass Matrix-Triplets und Metadatendateien auf den erwarteten Pfaden existieren, bevor Sie mit dem Import beginnen.

3. Importiere Zählmatrizen und validiere die Eingabeintegrität

  1. Lies Matrizen im 10x-Stil
    1. Lesen Sie jede matrix.mtx.gz Datei als Sparse-Matrix.
    2. Lesen Sie die entsprechende Features- (oder Gen-)Datei und die Barcode-Datei als tab-deseparate Tabellen.
    3. Weisen Sie Gen-Symbole den Matrixzeilen anhand der zweiten Spalte der Features-Datei zu, wenn verfügbar. Ersetze einzigartige Gensymbole mit make.unique().
    4. Weisen Sie Barcode-Kennungen den Matrixspalten zu.'
  2. Beispiel-Importfunktion ausführen
    1. Führe den in der Ergänzungsdatei 2 erwähnten Code aus, um die Matrix zu importieren und Identifikatoren zuzuweisen.
  3. Matrixintegrität validieren
    1. Überprüfen Sie, dass die Anzahl der Matrixzeilen der Anzahl der Merkmale entspricht. Überprüfen Sie, dass die Anzahl der Matrixspalten der Anzahl der Barcodes entspricht.
    2. Stoppen Sie den Workflow, wenn eine Diskrepanz festgestellt wird.
      HINWEIS: Wenn Unstimmigkeiten festgestellt werden, überprüfen Sie die Dateiintegrität und stellen Sie sicher, dass die Funktions- und Barcodedateien korrekt ausgerichtet sind, bevor Sie den Schritt erneut ausführen.
      Checkpoint: Fahren Sie nur vor, wenn die Zeilenanzahl mit den Merkmalen übereinstimmt und die Spaltenzahlen mit den Barcodes übereinstimmen.

4. Definition von Markier- und Modulpanels

  1. Definieren Sie malaria-relevante CD4⁺-T-Zellpanels
    1. Definieren Sie benannte Genpanels für: Th1, Tfh, Tr1, Treg, Tcm, Tem, Erschöpfung, Proliferation, Zytotoxisch, Activation_early, Interferon_response, Immune_regulation
    2. Speichern Sie diese Panels in einer benannten R-Liste für die nachgelagerte Modulbewertung.
  2. Führe den in Supplementary File 2 erwähnten R-Code aus, um Genpanels zu definieren.
  3. Markervalidierungsgene definieren
    1. Definieren Sie ein separates Validierungspanel mit kanonischen Markergenen wie Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 und Lef1.

5. Erstellung von Seurat-Objekten und Berechnung von Qualitätskontrollkennzahlen

  1. Initialisieren von Seurat-Objekten
    1. Erstellen Sie für jeden Datensatz ein Seurat-Objekt mit min.cells = 3 und min.features = 0. Erzwingen Sie beim Import keine willkürlichen Feature-Cutoffs.
    2. Fügen Sie Metadaten aus Datensatz, Stichproben und Zeitpunkten hinzu. Optionale Metadaten mit Barcode-Abgleich zusammenführen.
  2. Führe Beispiel-Seurat-Objektinitialisierung aus
    1. Führen Sie den in der ergänzenden Datei 2 erwähnten R-Code aus, um ein Seurat-Objekt zu erstellen und Metadaten zuzuweisen.
  3. Berechnen Sie Qualitätskontrollmetriken
    1. Berechnen Sie den mitochondrialen Transkriptanteil mit dem murinen Präfix ^mt-.
    2. Quantifizieren Sie die folgenden Metriken
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Führe den Beispielcode aus, der in der Zusatzdatei 2 erwähnt wurde.
  5. Visuelle Qualitätskontrolle vor dem Filter
    1. Generiere Geigendiagramme für nFeature_RNA, nCount_RNA und percent.mt. Generiere Feature-Scatter-Plots für nCount_RNA versus nFeature_RNA und nCount_RNA versus percent.mt.
    2. Speichern Sie Vorfilterfiguren mit standardisierten Namen wie QC_pre_filter_AllCells_vln.png und QC_pre_filter_AllCells_scatter.png.
      Vorsicht: Erwarten Sie breite Pre-Filter-Verteilungen mit minderwertigen Tails und möglichen Ausreißern mit hoher Anzahl.

6. Adaptive QC-Schwellenwerte ableiten und Zellen von niedriger Qualität filtern

  1. Leite datensatzspezifische Schwellenwerte ab
    1. Log-Transformation nFeature_RNA + 1 und nCount_RNA + 1. Berechnen Sie die Median- und Medianabweichung (MAD) für beide transformierten Variablen.
    2. Definieren Sie die folgenden Schwellenwerte:
      min_features = 10^(Median - 3 × MAD) - 1
      max_features = 10^(Median + 3 × MAD) - 1
      min_counts = 10^(Median - 3 × MAD) - 1
      max_counts = 10^(Median + 3 × MAD) – 1
    3. Definieren Sie die mitochondriale Schwelle als das 95. Perzentil von percent.mt plus 3 × MAD, begrenzt zwischen 5 % und 20 %.
    4. Stellen Sie sicher, dass dataset_id, sample_id und out_dir korrekt angegeben sind, bevor Sie die Funktion ausführen.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. Filterung anwenden
    1. Behalten Sie Zellen, die alle adaptiven Kriterien erfüllen:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Führe den Beispielcode aus, der in der Zusatzdatei 2 erwähnt wurde.
  3. Filterausgänge speichern
    1. Rette QC_thresholds_*.csv und cell_counts_summary_*.csv.
      PAUSENPUNKT: Speichere Zwischenausgaben und setze die Analyse bei Bedarf von diesem Schritt fort.
    2. Erstellen und speichern Sie nach dem Filter QC-Violin- und Streudiagramme.
      Checkpoint: Erwarten Sie engere Post-Filter-Verteilungen, die Entfernung von Zellen mit geringer Komplexität und die Reduzierung extremer Ausreißer.

7. Daten normalisieren und PCA ausführen

  1. Normalisieren und Varianzstabilisierung
    1. Normalisieren Sie den RNA-Test vor der Zellzyklusbewertung. Führe Zellzyklus-Scoring durch, wenn aktiviert. Verwenden Sie SCTransform() zur Varianzstabilisierung.
    2. Regressiere den mitochondrialen Inhalt nur, wenn es biologisch gerechtfertigt und explizit ermöglicht wird.
    3. Regressieren Sie Zellzykluswerte nur, wenn dies für das Studiendesign erforderlich ist.
  2. Führe die Beispielnormalisierung aus, wie in der Zusatzdatei 2 erwähnt.
  3. Definiere Parameterwerte
    1. Verwenden Sie n_variable_features = 3000.
    2. Verwenden Sie dims_max_for_pca = 50.
    3. Geben Sie diese Werte ausdrücklich im Manuskript an.
  4. Führe PCA aus und wähle Hauptkomponenten aus
    1. Führe PCA am normalisierten Test durch. Bestätigen Sie die erfolgreiche Ausführung der PCA, indem Sie die erklärten Varianz- und Hauptkomponentenlasten inspizieren.
    2. Berechnen Sie die Varianz, erklärt durch jede Hauptkomponente.
  5. Wählen Sie die PCs nach allen drei Kriterien aus:
    1. Behalten Sie PCs, die mindestens 1 % Varianz erklären,
    2. Stellen Sie sicher, dass die kumulative Varianz etwa 80 % erreicht.
    3. Beschränke die endgültige Auswahl auf 10 bis 40 SCs.
    4. Spar PCA_variance_table_*.csv, PCA_selection_rationale_*.csv und PCA_Elbow_*.png.
  6. Beispiel-PCA ausführen
    1. Beispiel, wie in ergänzender Akte 2 erwähnt.
      Checkpoint: Erwarten Sie ein Ellbogendiagramm mit sichtbarem Rückgang des marginalen Varianzzuwachs nach dem gewählten Cutoff.

8. Umgebungen konstruieren, Auflösung auswählen und Zellen clustern.

  1. Aufbau der Graphenstruktur
    1. Konstruiere den Graphen eines gemeinsamen nächstgelegenen Nachbarn mit den ausgewählten PCs.
    2. Führen Sie ein anfängliches niedrigauflösendes Clustering durch, wenn die Doublet-Erkennung Cluster-Labels erfordert.
  2. Optional Doublets entfernen
    1. Führe DoubletFinder nur aus, wenn es installiert und kompatibel ist.
      HINWEIS: Führen Sie die Doublet-Erkennung nur für Datensätze mit hoher Zellanzahl durch, bei denen Multiplet-Artefakte erwartet werden.
    2. Berechnen Sie die Normalisierung und PCA nach der Entfernung des Doppels erneut.
  3. Cluster-Auflösung auswählen
    1. Bewerten Sie die Auflösungen 0.2, 0.4, 0.6, 0.8, 1.0 und 1.2.8.3.2
    2. Berechnen Sie die mittlere Silhouettenbreite für jede getestete Auflösung. Wählen Sie die Auflösung mit dem höchsten Silhouettenwert unter Lösungen mit mindestens zwei Clustern aus.
    3. Spare resolution_sweep_*.csv, resolution_selection_rationale_*.csv und resolution_sweep_*.png.
  4. Führen Sie eine Beispiellösungsauswahl aus, indem Sie den in der Ergänzungsdatei 2 genannten Code ausführen
  5. Führe UMAP und finale Clustering aus.
    1. Führe UMAP mit den ausgewählten PCs aus.
    2. Bauen Sie den nächstgelegenen Nachbargraphen neu auf. Clustere Zellen mit der gewählten Auflösung.
    3. Speichern Sie UMAP-Plots, die nach Cluster beschriftet und nach Stichprobe oder Zeitpunkt gruppiert sind. Führe den folgenden Code aus, der in der Ergänzungsdatei 2 erwähnt wurde.
      Vorsicht: Erwarten Sie eine stabile Clustertrennung und eine interpretierbare UMAP-Struktur, die mit wichtigen Immunerkrankungen übereinstimmt.

9. SCT-basierte Integration für GSE233713

  1. Bereite separate Objekte vor
    1. Erstelle separate Seurat-Objekte für D27_3 und D30.
    2. Wenden Sie Qualitätskontrolle und Filterung unabhängig auf jede Probe an. Normalisieren Sie jede Probe separat mit SCTransform().
  2. Rechtfertigung der Integration
    1. Nutzen Sie SCT-basierte Integration, um technische Unterschiede zwischen Zeitpunkten zu verringern und gleichzeitig die gemeinsame biologische Struktur zu erhalten.
    2. Gehen Sie nicht davon aus, dass Integration automatisch vorteilhaft ist. Validiere es explizit.
  3. Integriere Samples
    1. Wählen Sie Integrationsfunktionen mit SelectIntegrationFeatures() aus. Bereite Objekte mit PrepSCTIntegration() vor.
    2. Finden Sie Anker mit FindIntegrationAnchors(normalization.method = "SCT"). Integriere Datensätze mit IntegrateData(normalization.method = "SCT").
  4. Führe ein Beispiel-Integration aus, das in der Ergänzungsdatei 2 erwähnt wird
  5. Integration validieren
    1. Erstellen Sie vor und nach der Integration UMAP-Plots, gruppiert nach Zeitpunkt. Interpretieren Sie die verbesserte Mischung von Zellen über Zeitpunkte hinweg als Beweis für eine erfolgreiche Integration.
    2. Berechnen Sie Nachbar-Mixing vor und nach der Integration. Berechnen Sie die Clusterzusammensetzung nach Zeitpunkt und erstellen Sie gestapelte Kompositionsdiagramme.
    3. Speichere die folgenden Ausgaben:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Vorsicht: Erwarten Sie eine reduzierte Zeitpunkt-Segregation nach der Integration, erhöhte Nachbarmischung und einen mehrfachen Zeitpunktbeitrag zu den meisten Clustern, ohne vollständigen Verlust biologisch bedeutsamer Struktur.

10. Cluster annotieren und die Markerstruktur validieren

  1. Score-Malaria-relevante Module
    1. Führen Sie AddModuleScore() für die vordefinierten Malaria-CD4⁺-T-Zellpanels aus.
    2. Speichere Cluster-Level-Modul-Mittel und Modul-Rankings.
  2. Führe Beispiel-Modulbewertungen aus, die in der Zusatzdatei 2 erwähnt werden
  3. Vorhergesagte Cluster-Labels zuweisen
    1. Weisen Sie jedem Cluster das bestbewertete Modul als vorhergesagtes Label zu.
    2. Speichern:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Validiere Cluster mit kanonischen Markern
    1. Führen Sie Marker-Validierungs-DotPlots und FeaturePlots mit dem kanonischen Marker-Panel durch.
    2. Speichern:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Vorsicht: Erwarten Sie eine konkordante Expression mehrerer kanonischer Gene pro funktionalem Zustand, nicht isolierte Einzelgen-Signale.

11. Marker identifizieren und differentielle Ausdrücke durchführen.

  1. Finde Clustermarker
    1. Führe FindAllMarkers() ausschließlich mit positiven Markern aus.
    2. Rette markers_all_clusters_*.csv.
  2. Führen Sie den im ergänzenden Code genannten Code aus, um die Beispiel-Marker-Identifikation auszuführen
  3. Verwenden Sie replizierungsbewusste Differentialausdrücke, wenn verfügbar,
    1. Überprüfen Sie, ob gültige Replikationsmetadaten verfügbar sind. Wenn Replikate verfügbar sind, aggregieren Sie die Zählungen pro Replikat und Bedingung und führen Sie Pseudobulk DE mit DESeq2 aus.
    2. Rette DE_pseudobulk_*.
  4. Verwenden Sie explorative Zellebene-Differentialexpression, wenn Replikate fehlen
    1. Fehlen Replikationsmetadaten oder sind unzureichend, führe Einzelzell-DE als explorative Analyse durch.
    2. Speichere DE_WARNING_*, um den Explorationsstatus zu dokumentieren. Speichere die Erkundungsergebnisse als DE_exploratory_celllevel_*.
  5. Generiere globale Differentialausdrucksausgaben
    1. Erstellen Sie Vulkandiagramme für DE-Ergebnisse und speichern Sie Volcano_*.
    2. Speichere signifikante DE-Ergebnisse als gefilterte Tabellen.
  6. Erzeugen Sie funktionale Anreicherungsausgaben
    1. Führe GO Biological Process Enrichment aus und spare GO_BP_*. Führe KEGG-Anreicherung aus und speichere KEGG_*.
    2. Führe GSEA mit ranked log2 fold-changes aus und speichere GSEA_GO_*. Speichere entsprechende Barplots und Dotplots.
  7. Cluster-spezifische differentielle Ausdrucksausgaben erzeugen
    1. Führe DE innerhalb jedes Clusters zwischen Zeitpunkten aus.
    2. Rette DE_cluster_* und DE_cluster_specific_combined_*.
  8. Immunfokussierte differentielle Expressionsausgaben erzeugen
    1. Extrahiere DE-Ergebnisse für ausgewählte Immungene wie Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 und Tbx21.
    2. Rette DE_immune_focus_*.
    3. Erzeugen und speichern Sie die folgenden Ausgaben:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Vorsicht Erwarten Sie Kohärenz zwischen globalem DE, Anreicherungsausgaben, cluster-spezifischen DEs und immunfokussierten Signaturen.

12. Speichern der endgültigen Ausgaben und Archivierung der Sitzung

  1. Seurat-Objekte speichern
    1. Speichere die finalen Seurat-Objekte im .rds-Format für jeden Datensatz.
  2. Sitzungsinformationen speichern
    1. Schreibe sessionInfo() in eine Textdatei im Ausgabeverzeichnis.
  3. Führen Sie den in der ergänzenden Datei 2 erwähnten Code aus, um einen Beispiel-Session-Export auszuführen
  4. Überprüfen Sie die Vollständigkeit der Ausgabe
    1. Bestätigen Sie, dass die erwarteten Verzeichnisse fig/, tabellen/ und rds/die entsprechenden Dateien enthalten.
    2. Archiviere Skripte, Sitzungsinformationen und Ausgaben zusammen.
      Vorsicht: Beginnen Sie nicht mit dem Schreiben von Meldungen, bis QC-Zusammenfassungen, PCA-Ausgaben, Auflösungsauswahl-Ausgaben, Integrationsdiagnosen, Modulannotationsdateien, DE-Ausgaben und Anreicherungsdateien alle vorhanden und intern konsistent sind.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Ergebnisse

Sequenzierungsqualität und zellbezogene Qualitätskontrolle (antigenspezifische (PcAS-reaktive) TCR-transgene CD4⁺ T-Zellen (GSE233703))

Pre-Filter-QC-Verteilungen (Abbildung 2A) zeigten eine heterogene Transkriptkomplexität, wobei die meisten Zellen moderate Gen- und UMI-Zählungen aufwiesen und eine kleinere Teilmenge hohe Ausreißerprofile aufwies, die mit potenziellen Multiplets übereinstimmen. Streudiagramme (

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Diskussion

Diese Studie präsentiert einen standardisierten und reproduzierbaren Seurat-basierten Workflow zur Analyse der CD4⁺-T-Zell-Transkriptionsdynamik während der Malaria-Reinfektion. Das Protokoll integriert adaptive Qualitätskontrolle, Normalisierung, Dimensionsreduktion, Clustering, Datensatzintegration, Markervalidierung, Modulbewertung und Analyse differenzieller Ausdrücke innerhalb eines einheitlichen rechnerischen Rahmens. Zusammen ermöglichten diese analytischen Schritte eine reproduzi...

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Offenlegungen

Die Autoren haben nichts offenzulegen.

Materialien

Liste der in diesem Artikel verwendeten Materialien
NameUnternehmenKatalognummerKommentare
Name of Material / EquipmentCompany / SourceCatalog NumberComments / Description
10x Genomics–formatted count matricesNCBI GEON/AMatrix Market files (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (R package)BioconductorN/ARRID:SCR_016884; Funktionelle Anreicherungsanalyse (GO, KEGG)
enrichplot (R package)BioconductorN/ARRID:SCR_017030; Visualisierung von Ergebnissen der Anreicherungsanalyse
GEO Dataset GSE233703NCBI Gene Expression OmnibusGSE233703PcAS-spezifisches TCR-transgenes CD4+ T-Zell-scRNA-seq-Dataset
GEO Dataset GSE233713NCBI Gene Expression OmnibusGSE233713Polyklonales CD4+ T-Zell-scRNA-seq-Dataset (D273 vs D30)
GitHub (optional)GitHub Inc.N/ARRID:SCR_002630; Versionskontrolle und Reproduzierbarkeit (optional)
glmGamPoi (R package)BioconductorN/ARRID:SCR_021001; Beschleunigte SCTransform-Modellanpassung
Matrix (R package)CRANN/ARRID:SCR_008389; Sparse Matrix-Handling für scRNA-seq-Daten
BetriebssystemMicrosoft / Apple / LinuxN/AWindows 10+, macOS oder Linux unterstützt
org.Mm.eg.db (R package)BioconductorN/ARRID:SCR_002643; Maus-Gen-Annotation-Datenbank
patchwork (R package)CRANN/ARRID:SCR_018787; Zusammenstellung von Multi-Panel-Abbildungen
PDF-ViewerJederN/AAnzeige von QC-Plots, UMAPs und Heatmaps
Persönlicher Computer oder WorkstationJederN/AMindestens 16–32 GB RAM empfohlen für Integration
pheatmap (R package)CRANN/ARRID:SCR_016418; Heatmap-Visualisierung der Genexpression
R Statistical Software (Version ≥ 4.2)R Foundation for Statistical ComputingN/ARRID:SCR_001905; Kern-Rechenumgebung
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Integrierte Entwicklungsumgebung für R
Seurat (R package, v4 oder höher)Satija LabN/ARRID:SCR_016341; Single-Cell RNA-seq-Analyse
tidyverse (R package suite)CRANN/ARRID:SCR_019186; Datenmanipulation und Visualisierung

Referenzen

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Zugriff eingeschränkt. Bitte melden Sie sich an oder starten Sie eine Testversion, um diesen Inhalt anzuzeigen.

Nachdrucke und Genehmigungen

Tags

Immunologie und InfektionskrankheitenAusgabe 233Ausgabe 233Leerer WertAusgabescRNA-seqPBMCTranskriptomische IntegrationImmune-Module-Scoring

Dieser Artikel wurde veröffentlicht

Video demnächst verfügbar