Een abonnement op JoVE is vereist om deze inhoud te bekijken. Log in of start vandaag met uw gratis proefperiode.

Methodenartikel

Een reproduceerbaar Seurat-gebaseerd protocol voor single-cell RNA-sequencinganalyse van perifere mononucleaire cellen CD4+ T-cellen tijdens malaria-herinfectie

106 weergaven

DOI:

10.3791/70858

31 juli 2026

In dit artikel

Samenvatting

Hier presenteren we een reproduceerbaar Seurat-gebaseerd protocol voor de analyse van single-cell RNA-sequencinggegevens van perifere bloed mononucleaire cellen CD4⁺ T-cellen om transcriptionele heterogeniteit en functionele immuunprogramma's tijdens malaria-reinfectie te karakteriseren. Dit protocol maakt consistente identificatie, vergelijking en biologische interpretatie mogelijk van dynamische CD4⁺ T-celtoestanden en immuunresponsen tussen aandoeningen.

Samenvatting

Hier presenteren we een reproduceerbaar Seurat-gebaseerd protocol om PBMC CD4⁺ T-cel single-cell RNA-sequencinggegevens te analyseren over tijdstippen van malaria-herinfectie. Dit protocol demonstreert een reproduceerbare Seurat-gebaseerde workflow voor het analyseren van PBMC CD4⁺ T-cel scRNA-seq-gegevens over malaria-herinfectietijdpunten, waarbij representatieve publiek beschikbare datasets worden gebruikt om de toepassing aan te tonen: een Plasmodium-specifieke TCR-transgene CD4⁺ T-cel dataset (GSE233703) en een polyklonale CD4⁺ T-cel dataset die reinfectie-geassocieerde tijdspunten (GSE233713; D27₍₃₎ versus D30). De workflow omvat gestandaardiseerde preprocessing, integratie, clustering en downstream transcriptomische analyses binnen een uniform computationeel kader. De methode maakt systematische berekening van modulescores voor vooraf gedefinieerde immuun- en CD4⁺ T-celprogramma's mogelijk, identificatie van clusterspecifieke markergenen, tijdspuntopgeloste differentiële expressie-analyse, en verrijking van downstream Gene Ontology en KEGG-routes. De toepassing van deze workflow identificeert verschillende CD4⁺ T-cel functionele toestanden en onthult dynamische transcriptieveranderingen over malaria-herinfectietijden. Het protocol genereert gestandaardiseerde visualisatie-uitkomsten en getabelde resultaten en biedt praktische richtlijnen voor parameterselectie en probleemoplossing, wat consistente en reproduceerbare analyse van CD4⁺ T-cel scRNA-seq datasets in malaria en gerelateerde immunologische contexten vergemakkelijkt. Dit protocol maakt reproduceerbare en biologisch interpreteerbare analyse van immuunresponsen mogelijk en kan worden toegepast op vergelijkbare single-cell datasets in immunologisch onderzoek.

Inleiding

Malaria blijft een grote wereldwijde gezondheidslast, waarbij herhaalde infecties de immuniteit van de gastheer op complexe en onvolledig begrepenmanieren vormgeven. CD4⁺ T-cellen spelen een centrale rol in antimalaria-immuunresponsen door de productie van effectorcytokines te coördineren, B-celhulp te ondersteunen en ontstekingente reguleren 2,3. Tijdens malaria-reinfectie ondergaan CD4⁺ T-cellen dynamische transcriptionele herprogrammering, wat verschuivingen weerspiegelt tussen effector-, regulatie-, geheugen-, proliferatieve en uitgeputte toestanden die zowel parasietcontrole als immunopathologiebeïnvloeden 4,5. Het nauwkeurig oplossen van deze heterogeniteit is essentieel om immuunbescherming, immuundysfunctie en de duurzaamheid van natuurlijk verworven of door vaccins veroorzaakte immuniteit tegen Plasmodium-infectie te begrijpen. Hier presenteren we een reproduceerbaar Seurat-gebaseerd protocol om CD4⁺ T-cel scRNA-seq-gegevens te analyseren over tijdstippen van malaria-herinfectie.

Single-cell RNA-sequencing (scRNA-seq) maakt een hoogresolutie karakterisering van immuunheterogeniteit mogelijk en heeft parasietresponsieve CD4⁺ T-cel subsets, uitputtingsprogramma's en regulerende netwerken geïdentificeerd in malaria 6,7,8,9. Echter, analytische variabiliteit in kwaliteitscontrole, normalisatie, clustering en integratie kan de reproduceerbaarheid beperken en kruisvergelijkingen bemoeilijken10,11. Echter, een gestandaardiseerde en biologisch geleide workflow die specifiek is geoptimaliseerd voor het analyseren van CD4⁺ T-celdynamiek tijdens malaria-herinfectie ontbreekt.

Bestaande computationele kaders voor scRNA-seq-analyse, waaronder Seurat en Scanpy, bieden uitgebreide toolsets voor preprocessing, clustering en downstream interpretatie van single-cell data 12,13,14. Seurat, geïmplementeerd in R, biedt nauw geïntegreerde workflows voor normalisatie, data-integratie en visualisatie, waaronder variantie-stabiliserende benaderingen zoals SCTransform die signaaldetectie verbeteren in heterogene immuundatasets13. Scanpy, geïmplementeerd in Python, biedt schaalbare oplossingen geoptimaliseerd voor grote datasets en efficiënt geheugengebruik, waardoor het bijzonder geschikt is voor hoge-doorvoer- of cloudgebaseerde analyses12,14. Ondanks deze vooruitgang blijft er behoefte aan gestandaardiseerde, reproduceerbare workflows die expliciet biologische vragen in infectieomgevingen behandelen, terwijl transparantie, aanpassingsvermogen en consistentie tussen datasets behouden blijven. Het huidige protocol pakt deze kloof aan door de robuustheid van Seurat-gebaseerde preprocessing te combineren met gestructureerde biologische interpretatie die is afgestemd op CD4⁺ T-celresponsen tijdens malaria-herinfectie. In vergelijking met bestaande algemene workflows legt dit protocol de nadruk op reproduceerbaarheid, biologisch geïnformeerde parameterselectie en consistente cross-timepoint-analyse die is afgestemd op infectiemodellen.

Een belangrijk kenmerk van dit protocol is de nadruk op reproduceerbaarheid en praktische bruikbaarheid. Kwaliteitscontroledrempels zijn niet vast, maar worden afgeleid met behulp van data-adaptieve benaderingen op basis van mediane absolute afwijking, waardoor drempels voor transcriptcomplexiteit, sequencingdiepte en mitochondriale inhoud kunnen schalen met dataset-specifieke verdelingen. Dit ontwerp maakt de workflow toepasbaar op datasets van verschillende groottes, doorgaans variërend van enkele duizenden tot tienduizenden cellen, en over een breed scala aan sequencingdieptes die vaak voorkomen in druppelgebaseerde scRNA-seq-experimenten. Richtlijnen die in de workflow zijn ingebed ondersteunen de juiste parameterkeuze voor dimensionaliteitsreductie, clusteringresolutie en integratie, zodat analyses zowel biologisch betekenisvol als technisch robuust blijven. Desalniettemin hangt de workflow af van de datakwaliteit en sequencingdiepte en kan aanpassing vereisen voor datasets met extreme schaarsheid of batch-effecten.

Dit protocol is ontworpen voor gevorderde tot gevorderde gebruikers met basiskennis van R en single-cell analyse, terwijl het toegankelijk blijft voor gemotiveerde beginners via de gestructureerde, stapsgewijze implementatie en volledig reproduceerbare outputs. De workflow genereert in elke fase gestandaardiseerde tabellen en cijfers, waaronder kwaliteitscontrole-samenvattingen, clustering-outputs, differentiële expressieresultaten en verrijkingsanalyses, waardoor transparantie, validatie en hergebruik in samenwerkings- of multi-studiecontexten mogelijk wordt. Dit protocol is bijzonder geschikt voor studies die de heterogeniteit van het immuunsysteem over tijdstippen of omstandigheden in infectie- en immunologieonderzoek onderzoeken.

De methode biedt een reproduceerbare, end-to-end Seurat-gebaseerde workflow voor CD4⁺ T-cel scRNA-seq analyse over malaria-herinfectietijdstippen. Het integreert adaptieve kwaliteitscontrole, variantiestabilisatie, dimensionale reductie, clustering en multisample-integratie waar passend13,15. Om de biologische interpreteerbaarheid te verbeteren, maakt de workflow gebruik van scoring van immuun- en CD4⁺ T-cel subset genmodule-scoring om functionele programma's zoals Th1, Tfh, Tr1, Treg, centraal geheugen, effectorgeheugen, proliferatie, cytotoxiciteit en uitputtingte kwantificeren. Complementaire clustermarkeridentificatie, tijdpuntdifferentiële expressieanalyse en padverrijking met behulp van Gene Ontology- en KEGG-databases zijn opgenomen om robuuste annotatie en vergelijking van T-celtoestandente ondersteunen 19,20. Hoewel aangetoond met behulp van publiek beschikbare Plasmodium scRNA-seq datasets, is dit protocol breed toepasbaar op andere malaria-reinfectiemodellen en immunologische verstoringen waarbij reproduceerbare en interpreteerbare enkelcelanalyse van CD4⁺ T-cellen vereist is. Al met al biedt dit protocol een reproduceerbaar en biologisch interpreteerbaar kader voor single-cel analyse van CD4⁺ T-celreacties, wat robuust onderzoek naar immuundynamiek in malaria en aanverwante systemen ondersteunt.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Ethische verklaring:

Alle gegevens die in deze studie zijn gebruikt, zijn verkregen uit openbaar beschikbare datasets (GSE233703 en GSE233713). De oorspronkelijke studies voldeden aan institutionele en ethische richtlijnen voor dierproeven. Deze studie omvatte secundaire bio-informatische analyse van publiek beschikbare en gedeïdentificeerde single-cell RNA-sequencingdatasets verkregen uit de Gene Expression Omnibus (GEO) repository (GSE233703 en GSE233713). Er waren geen nieuwe menselijke deelnemers, klinische monsters of identificeerbare patiëntinformatie betrokken bij deze studie. Volgens de institutionele en nationale richtlijnen voor onderzoek met publiek beschikbare geanonimiseerde datasets waren aanvullende ethische goedkeuring en geïnformeerde toestemming niet vereist voor deze bio-informatische analyse. De oorspronkelijke studies die bij deze datasets horen, zijn uitgevoerd in overeenstemming met relevante institutionele ethische normen en toepasselijke richtlijnen voor biomedisch onderzoek.

1. Reproduceerbare Seurat-gebaseerde CD4⁺ T-cel scRNA-seq analyseworkflow voor GSE233703 en GSE233713

OPMERKING: Deze workflow wordt geleverd als Aanvullend Bestand S1. Raadpleeg ook een schema dat een overzicht geeft van de volledige workflow (Figuur 1).

  1. Definieer de scope en de beoogde gebruikers voordat het protocol wordt gestart
  2. Definieer de beoogde gebruikers
    1. Gebruik dit protocol als de gebruiker middelmatige tot gevorderde kennis heeft met R- en single-cell RNA-sequencing (scRNA-seq) analyse.
    2. Pas deze workflow toe op muismilt CD4⁺ T-cel datasets die zijn gegenereerd in 10x-matrixformaat. Gebruik de stapsgewijze structuur en verwachte output om elke stap te verifiëren voordat je verder gaat.
      OPMERKING: Zorg voor passende gegevensverwerking en veilige opslag bij het werken met grote sequencing-datasets.
  3. Definieer scRNA-seq
    1. Behandel single-cell RNA-sequencing (scRNA-seq) als een transcriptomische methode²¹ die genexpressie in individuele cellen kwantificeert.
    2. Gebruik scRNA-seq om discrete celtoestanden, overgangspopulaties en heterogene immuunprogramma's binnen complexe weefsels te identificeren.
  4. Bereid software- en pakketvereisten voor
  5. Installeer kernsoftware
    1. Installeer R 4.2 of later.
    2. Open de RStudio-interface. Stel de werkmap in met setwd().
    3. Voer scripts sequentieel uit met behulp van de source()-functie. Noteer de exacte versies van R, RStudio en het besturingssysteem in de projectnotities.
  6. Installeer R-pakketten
    1. Installeer de vereiste CRAN-pakketten: Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi en ggplot2.
    2. Installeer de benodigde Bioconductor-pakketten: clusterProfiler, org. Mm.eg.db, enrichplot en DESeq2.
    3. Installeer optionele pakketten alleen indien nodig: DoubletFinder voor het verwijderen van de dubbel en monocle3 voor trajectanalyse. Laad alle benodigde pakketten aan het begin van de analysesessie.
  7. Plaatversies
    1. Sla pakket- en sessieinformatie op aan het einde van de workflow met sessionInfo() of een vergelijkbare functie.
    2. Rapporteer de belangrijkste analysecomponenten expliciet in het manuscript, waaronder R-versie, Seurat-versie, DESeq2-versie en clusterProfiler-versie.
  8. Voer voorbeeldinstallatiecommando's uit die genoemd zijn in het aanvullende bestand 2
  9. Bevestig hardware- en opslagvereisten
  10. Bevestig minimale middelen
    1. Gebruik een werkstation met minstens 16 GB RAM, 4 CPU-cores en 20 GB vrije schijfruimte voor routinematige analyse van datasets met enkele duizenden tot tienduizenden cellen.
  11. Bevestig aanbevolen bronnen
    1. Gebruik 32 GB RAM of meer voor geïntegreerde analyses, herhaald plotten of optionele dubbeldetectie.
    2. Verhoog future.globals.maxSize als grote objecten of geïntegreerde datasets geheugengerelateerde fouten veroorzaken.
    3. Pas een voorbeeldgeheugeninstelling toe
  12. Voer de volgende commando's uit om geheugenopties in te stellen die in het aanvullende bestand 2 worden genoemd

2. Creëer de projectstructuur

  1. Maak de rootprojectmap aan
    1. Maak een projectmap aan voor de analyse.
    2. Maak submappen aan met de namen data/, scripts/ en results_spleen_cd4/.
  2. Gebruik een gestandaardiseerde outputstructuur
    1. Zorg ervoor dat de workflow output schrijft naar de volgende mappen:
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/tabellen/
      results_spleen_cd4/GSE233703/rds/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/tabellen/
      results_spleen_cd4/GSE233713/rds/
      results_spleen_cd4/post_markers/
  3. Gebruik consistente bestandsnaamgeving
    1. Hernoem GEO-invoerbestanden zodat ze overeenkomen met de paden die door het script worden verwacht.
    2. Gebruik de volgende exacte bestandsnamen:
      Data/GSE233703_matrix.mtx.gz
      Data/GSE233703_genes.tsv.gz
      Data/GSE233703_barcodes.tsv.gz
      Data/GSE233713_d27_3_matrix.mtx.gz
      Data/GSE233713_d27_3_features.tsv.gz
      Data/GSE233713_d27_3_barcodes.tsv.gz
      Data/GSE233713_d30_matrix.mtx.gz
      Data/GSE233713_d30_features.tsv.gz
      Data/GSE233713_d30_barcodes.tsv.gz
    3. Noem optionele metadatabestanden als volgt:
      Data/GSE233703_cell_metadata.csv
      Data/GSE233713_cell_metadata.csv
  4. Bevestig de vereisten voor metadata
    1. Controleer of elk metadatabestand een barcodekolom bevat. Voeg optionele kolommen toe zoals sample, tijdstip en repliceer wanneer beschikbaar.
    2. Gebruik exacte barcode-overeenkomsten tussen metadata en telmatrices.
      Let op: Controleer of matrix-triplets en metadatabestanden bestaan op de verwachte paden voordat je begint met importeren.

3. Import van count-matrices en validatie van inputintegriteit

  1. Lees 10x-stijl matrices
    1. Lees elk matrix.mtx.gz bestand als een sparse matrix.
    2. Lees het bijbehorende feature- (of genen-) bestand en barcodebestand als tab-gescheiden tabellen.
    3. Wijs gensymbolen toe aan matrixrijen met behulp van de tweede kolom van het feature-bestand wanneer beschikbaar. Handvol unieke gensymbolen met make.unique().
    4. Wijs barcode-identificaties toe aan matrixkolommen.'
  2. Voer voorbeeldimportfunctie uit
    1. Voer de code uit die in het aanvullende bestand 2 wordt genoemd, om de matrix te importeren en identificaties toe te wijzen.
  3. Valideer matrixintegriteit
    1. Controleer dat het aantal matrixrijen gelijk is aan het aantal features. Controleer of het aantal matrixkolommen gelijk is aan het aantal barcodes.
    2. Stop de workflow als er een mismatch wordt ontdekt.
      OPMERKING: Als er mismatches worden ontdekt, controleer dan de integriteit van het bestand en zorg voor de correcte uitlijning van feature- en barcodebestanden voordat je de stap opnieuw uitvoert.
      Checkpoint: Ga alleen door als het aantal rijen overeenkomt met kenmerken en het aantal kolommen overeenkomt met barcodes.

4. Definieer markerings- en modulepanelen

  1. Definieer malaria-relevante CD4⁺ T-celpanelen
    1. Definieer benoemde genpanelen voor: Th1, Tfh, Tr1, Treg, Tcm, Tem, Uitputting, Proliferatie, Cytotoxisch, Activation_early, Interferon_response, Immune_regulation
    2. Sla deze panelen op in een benoemde R-lijst voor de scoring van de modules stroomaf.
  2. Voer de R-code uit die in Supplementair bestand 2 wordt genoemd om genpanelen te definiëren.
  3. Definieer markervalidatiegenen
    1. Definieer een apart validatiepaneel met canonieke markergenen zoals Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 en Lef1.

5. Seurat-objecten aanmaken en kwaliteitscontrole-metrics berekenen

  1. Initialiseer Seurat-objecten
    1. Maak een Seurat-object aan voor elke dataset met behulp van min.cells = 3 en min.features = 0. Leg geen willekeurige feature-cutoffs op bij import.
    2. Voeg dataset-, steekproef- en tijdpuntmetadata toe. Voeg optionele metadata samen met barcodematching.
  2. Voer voorbeeld Seurat-objectinitialisatie uit
    1. Voer de R-code uit die in het aanvullende bestand 2 wordt genoemd om een Seurat-object te creëren en metadata toe te wijzen.
  3. Bereken kwaliteitscontrole-metrics
    1. Bereken de mitochondriale transcriptfractie met behulp van het muisvoorvoegsel ^mt-.
    2. Kwantificeer de volgende metrics
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Voer de voorbeeldcode uit die in het aanvullende bestand 2 wordt genoemd.
  5. Visualiseer pre-filter kwaliteitscontrole
    1. Maak vioolplots voor nFeature_RNA, nCount_RNA en percent.mt. Genereer feature-scatter plots voor nCount_RNA versus nFeature_RNA en nCount_RNA versus percent.mt.
    2. Sla pre-filterfiguren op met gestandaardiseerde namen zoals QC_pre_filter_AllCells_vln.png en QC_pre_filter_AllCells_scatter.png.
      Let op: Verwacht brede pre-filter verdelingen met zwakke staarten en mogelijke uitschieters met hoge tellingen.

6. Afleiden van adaptieve kwaliteitscontrole-drempels en filteren van cellen van lage kwaliteit

  1. Leid dataset-specifieke drempels af
    1. Log-transformatie nFeature_RNA + 1 en nCount_RNA + 1. Bereken de mediaan en mediaan absolute deviatie (MAD) voor beide getransformeerde variabelen.
    2. Definieer de volgende drempels:
      min_features = 10^(mediaan - 3 × MAD) - 1
      max_features = 10^(mediaan + 3 × MAD) - 1
      min_counts = 10^(mediaan - 3 × MAD) - 1
      max_counts = 10^(mediaan + 3 × MAD) – 1
    3. Definieer de mitochondriale drempel als het 95e percentiel van percent.mt plus 3 × MAD, beperkt tussen 5% en 20%.
    4. Zorg ervoor dat dataset_id, sample_id en out_dir correct zijn gespecificeerd voordat de functie wordt uitgevoerd.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = "GSE233703", sample_id = "AllCells", out_dir = "results_spleen_cd4/GSE233703")
  2. Filter toepassen
    1. Behoud cellen die aan alle adaptieve criteria voldoen:
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Voer de voorbeeldcode uit die in het aanvullende bestand 2 wordt genoemd.
  3. Sla filteruitgangen op
    1. Red QC_thresholds_*.csv en cell_counts_summary_*.csv.
      PAUZEPUNT: Sla tussentijdse outputs op en hervat de analyse indien nodig vanuit deze stap.
    2. Genereer en sla post-filter QC viool- en spreidingsdiagrammen op.
      Checkpoint: Verwacht strakkere post-filter distributies, verwijdering van laagcomplexe cellen en vermindering van extreme uitschieters.

7. Normaliseer data en voer PCA uit

  1. Normaliseren en variantie-stabiliseren
    1. Normaliseer de RNA-assay vóór celcyclusscore. Voer celcyclus-scoring uit als ingeschakeld. Gebruik SCTransform() voor variantiestabilisatie.
    2. Verminder de mitochondriale inhoud alleen als het biologisch gerechtvaardigd en expliciet mogelijk is.
    3. Regresseer celcyclusscores alleen als dat vereist is voor het onderzoeksontwerp.
  2. Voer voorbeeldnormalisatie uit zoals vermeld in supplementair bestand 2.
  3. Definieer parameterwaarden
    1. Gebruik n_variable_features = 3000.
    2. Gebruik dims_max_for_pca = 50.
    3. Vermeld deze waarden expliciet in het manuscript.
  4. Voer PCA uit en selecteer hoofdcomponenten
    1. Voer PCA uit op de genormaliseerde assay. Bevestig de succesvolle uitvoering van de PCA door de uitgelegde variantie en de belasting van de hoofdcomponenten te inspecteren.
    2. Bereken variantie verklaard door elk hoofdcomponent.
  5. Selecteer de spelers met alle drie de criteria:
    1. Houd PC's die minstens 1% variantie uitleggen,
    2. Zorg ervoor dat de cumulatieve variantie ongeveer 80% bedraagt.
    3. Beperk de uiteindelijke selectie tussen 10 en 40 personages.
    4. Red PCA_variance_table_*.csv, PCA_selection_rationale_*.csv en PCA_Elbow_*.png.
  6. Voer voorbeeld PCA uit
    1. Voorbeeld zoals vermeld in aanvullend dossier 2.
      Checkpoint: Verwacht een elbowplot met een zichtbare afname van marginale variantiewinst na de geselecteerde cutoff.

8. Bouw buurten, selecteer resolutie en cluster cellen

  1. Bouw graafstructuur
    1. Bouw de grafiek van een gedeelde dichtstbijzijnde buren met behulp van de geselecteerde PC's.
    2. Voer een eerste laagresolutie-clustering uit als doubletdetectie clusterlabels vereist.
  2. Verwijder optioneel dubbels
    1. Gebruik DoubletFinder alleen als het geïnstalleerd en compatibel is.
      OPMERKING: Voer alleen doubletdetectie uit voor datasets met een hoog aantal cellen waarbij multiplet-artefacten worden verwacht.
    2. Normalisatie en PCA opnieuw berekenen na het verwijderen van de dubbel.
  3. Selecteer clusterresolutie
    1. Evalueer resoluties 0.2, 0.4, 0.6, 0.8, 1.0 en 1.2.8.3.2
    2. Bereken de gemiddelde silhouetbreedte voor elke geteste resolutie. Selecteer de resolutie met de hoogste silhouetscore onder oplossingen met ten minste twee clusters.
    3. Red resolution_sweep_*.csv, resolution_selection_rationale_*.csv en resolution_sweep_*.png.
  4. Voer voorbeeldresolutieselectie uit door de code uit te voeren die in het aanvullende bestand 2 wordt genoemd
  5. Voer UMAP uit en laat de laatste clustering draaien.
    1. Voer UMAP uit met de geselecteerde pc's.
    2. Herbouw de dichtstbijzijnde-naburen-grafiek. Clustercellen met de geselecteerde resolutie.
    3. Sla UMAP-grafieken op die per cluster zijn gelabeld en gegroepeerd op steekproef of tijdstip. Voer de volgende code uit die in het aanvullende bestand 2 wordt genoemd.
      Voorzichtigheid: Verwacht een stabiele cluster-scheiding en een interpreteerbare UMAP-structuur die consistent is met belangrijke immuunstaten.

9. Voer SCT-gebaseerde integratie uit voor GSE233713

  1. Bereid afzonderlijke objecten voor
    1. Maak aparte Seurat-objecten aan voor D27_3 en D30.
    2. Pas kwaliteitscontrole en filtering onafhankelijk toe op elk monster. Normaliseer elk monster afzonderlijk met SCTransform().
  2. Rechtvaardig integratie
    1. Gebruik SCT-gebaseerde integratie om technische verschillen tussen tijdspunten te verkleinen en tegelijkertijd de gedeelde biologische structuur te behouden.
    2. Ga er niet van uit dat integratie automatisch voordelig is. Bevestig het expliciet.
  3. Integreer samples
    1. Selecteer integratiefuncties met SelectIntegrationFeatures(). Bereid objecten voor met PrepSCTIntegration().
    2. Vind ankers met FindIntegrationAnchors(normalization.method = "SCT"). Integreer datasets met IntegrateData(normalization.method = "SCT").
  4. Run voorbeeld van integratie genoemd in het aanvullende bestand 2
  5. Valideer integratie
    1. Genereer pre-integratie en post-integratie UMAP-plots, gegroepeerd op tijdstip. Interpreteer verbeterde menging van cellen over tijdstippen als bewijs van succesvolle integratie.
    2. Bereken het mengen van de buren voor en na de integratie. Bereken clustersamenstelling op tijdstip en genereer gestapelde samenstellingsgrafieken.
    3. Sla de volgende uitgangen op:
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Let op: Verwacht verminderde tijdpuntsegregatie na integratie, meer burenmenging en bijdrage van meerdere tijdpunten aan de meeste clusters zonder volledig verlies van biologisch betekenisvolle structuur.

10. Annoteer clusters en valideer de markerstructuur

  1. Score malaria-relevante modules
    1. Voer AddModuleScore() uit voor de vooraf gedefinieerde malaria CD4⁺ T-celpanelen.
    2. Sla cluster-niveau module-middelen en moduleranglijsten op.
  2. Voer voorbeeldmodule-scores uit die in het aanvullende bestand 2 genoemd worden
  3. Wijs voorspelde clusterlabels toe
    1. Wijs de hoogst gerangschikte module toe aan elk cluster als het voorspelde label.
    2. Opslaan:
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Valideer clusters met canonieke markers
    1. Voer markervalidatie DotPlots en FeaturePlots uit met behulp van het canonieke markerpanel.
    2. Opslaan:
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Let op: Verwacht concordante expressie van meerdere canonieke genen per functionele toestand, niet geïsoleerde enkelvoudige gensignalen.

11. Markers identificeren en differentiële expressies uitvoeren.

  1. Zoek clustermarkers
    1. Voer FindAllMarkers() uit met alleen positieve markers.
    2. Red markers_all_clusters_*.csv.
  2. Voer de code uit die in het aanvullende bestand wordt genoemd om de voorbeeldmarkeridentificatie uit te voeren
  3. Gebruik replicate-aware differentiële expressie waar beschikbaar
    1. Controleer of er geldige replicatieve metadata beschikbaar zijn. Als replicates beschikbaar zijn, tel dan per replicate en conditie samen en voer pseudobulk DE uit met DESeq2.
    2. Red DE_pseudobulk_*.
  4. Gebruik verkennende differentiële expressie op celniveau wanneer replicaten ontbreken
    1. Als replicate metadata ontbreken of onvoldoende zijn, voer dan single-cell DE uit als verkennende analyse.
    2. Bewaar DE_WARNING_* om de verkennende status te documenteren. Bewaar verkennende resultaten als DE_exploratory_celllevel_*.
  5. Genereer globale differentiaalexpressie-outputs
    1. Maak vulkaangrafieken voor DE-resultaten en sla Volcano_*.
    2. Sla belangrijke DE-resultaten op als gefilterde tabellen.
  6. Genereer functionele verrijkingsoutputs
    1. Voer GO Biological Process enrichment uit en bespaar GO_BP_*. Voer KEGG enrichment uit en sla KEGG_*.
    2. Voer GSEA uit met ranked log2 fold-changes en sla GSEA_GO_*. Sla de bijbehorende barplots en dotplots op.
  7. Genereer cluster-specifieke differentiële expressie-outputs
    1. Voer DE uit binnen elk cluster tussen tijdstippen.
    2. Red DE_cluster_* en DE_cluster_specific_combined_*.
  8. Genereer immuungerichte differentiële expressie-outputs
    1. Haal DE-resultaten uit voor geselecteerde immuungenen zoals Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 en Tbx21.
    2. Red DE_immune_focus_*.
    3. Genereer en sla de volgende uitvoeren op:
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Let op: Verwacht coherentie tussen globale DE, verrijkingsoutputs, cluster-specifieke DE en immuungerichte signaturen.

12. Definitieve output opslaan en de sessie archiveren

  1. Seurat-objecten opslaan
    1. Sla de laatste Seurat-objecten op in .rds-formaat voor elke dataset.
  2. Sessie-informatie opslaan
    1. Schrijf sessionInfo() naar een tekstbestand in de uitvoermap.
  3. Voer de code uit die in het aanvullende bestand 2 wordt genoemd om een voorbeeldsessie-export uit te voeren
  4. Controleer de voltooiing van de uitvoer
    1. Controleer of de verwachte fig/, tabellen/ en rds/mappen de bijbehorende bestanden bevatten.
    2. Archiveer scripts, sessie-informatie en outputs samen.
      Let op: Ga niet verder met het schrijven van rapporten totdat QC-samenvattingen, PCA-uitvoeren, resolutieselectie-uitvoeren, integratiediagnostiek, moduleannotatiebestanden, DE-uitvoeren en verrijkingsbestanden allemaal aanwezig en intern consistent zijn.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Sequencingkwaliteit en celniveau-kwaliteitscontrole (Antigeen-specifiek (PcAS-reactief) TCR-transgene CD4⁺ T-cellen (GSE233703))

Pre-filter QC-verdelingen (Figuur 2A) toonden heterogene transcriptcomplexiteit, waarbij de meeste cellen matige gen- en UMI-tellingen vertoonden en een kleinere subset high-count outlierprofielen vertoonde die consistent waren met potentiële multiplets. Scatterplots (

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Deze studie presenteert een gestandaardiseerde en reproduceerbare Seurat-gebaseerde workflow voor het analyseren van de transcriptiedynamiek van CD4⁺ T-cel tijdens malaria-reinfectie. Het protocol integreert adaptieve kwaliteitscontrole, normalisatie, dimensionaliteitsreductie, clustering, datasetintegratie, markervalidatie, modulebeoordeling en differentiële expressie-analyse binnen een uniform computationeel kader. Samen maakten deze analytische stappen reproduceerbare identificatie en...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

De auteurs hebben niets te onthullen.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Naam van materiaal / apparatuurBedrijf / BronCatalogusnummerOpmerkingen / Beschrijving
10x Genomics–geformatteerde telmatricesNCBI GEON/AMatrix Market-bestanden (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (R-pakket)BioconductorN/ARRID:SCR_016884; Functionele verrijkingsanalyse (GO, KEGG)
enrichplot (R-pakket)BioconductorN/ARRID:SCR_017030; Visualisatie van verrijkingsanalyseresultaten
GEO-dataset GSE233703NCBI Gene Expression OmnibusGSE233703PcAS-specifieke TCR-transgene CD4+ T-cel scRNA-seq dataset
GEO-dataset GSE233713NCBI Gene Expression OmnibusGSE233713Polyklonale CD4+ T-cel scRNA-seq dataset (D273 vs D30)
GitHub (optioneel)GitHub Inc.N/ARRID:SCR_002630; Versiebeheer en reproduceerbaarheid (optioneel)
glmGamPoi (R-pakket)BioconductorN/ARRID:SCR_021001; Versnelde SCTransform modelaanpassing
Matrix (R-pakket)CRANN/ARRID:SCR_008389; Sparse matrixverwerking voor scRNA-seq data
BesturingssysteemMicrosoft / Apple / LinuxN/AWindows 10+, macOS, of Linux ondersteund
org.Mm.eg.db (R-pakket)BioconductorN/ARRID:SCR_002643; Muisgen-annotatiedatabase
patchwork (R-pakket)CRANN/ARRID:SCR_018787; Multi-paneel figuursamenstelling
PDF-viewerElkN/ABekijken van QC-plots, UMAP's en heatmaps
Persoonlijke computer of werkstationElkN/AMinimaal 16–32 GB RAM aanbevolen voor integratie
pheatmap (R-pakket)CRANN/ARRID:SCR_016418; Heatmapvisualisatie van genexpressie
R Statistisch Software (versie ≥ 4.2)R Foundation for Statistical ComputingN/ARRID:SCR_001905; Kernberekeningsomgeving
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Geïntegreerde ontwikkelomgeving voor R
Seurat (R-pakket, v4 of later)Satija LabN/ARRID:SCR_016341; Single-cell RNA-seq analyse
tidyverse (R-pakketsuite)CRANN/ARRID:SCR_019186; Gegevensmanipulatie en visualisatie

Referenties

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Tags

Immunologie en InfectieEditie 233Editie 233Lege WaardeEditiescRNA-seqPBMCTranscriptomische integratieImmuunmodulescoring

Dit artikel is gepubliceerd

Video binnenkort beschikbaar