Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Un protocole reproductible basé sur le seurat pour l’analyse du séquençage d’ARN unicellulaire des cellules T CD4+ mononucléaires du sang périphérique lors d’une réinfection paludiste

106 vues

DOI :

10.3791/70858

31 juillet 2026

Dans cet article

Résumé

Ici, nous présentons un protocole reproductible basé sur Seurat pour l’analyse des données de séquençage de l’ARN unicellulaire provenant des cellules T CD4⁺ mononucléaires du sang périphérique, afin de caractériser l’hétérogénéité transcriptionnelle et les programmes immunitaires fonctionnels lors d’une réinfection paludique. Ce protocole permet une identification, une comparaison et une interprétation biologique cohérentes des états dynamiques des lymphocytes T CD4⁺ et des réponses immunitaires à travers les conditions.

Résumé

Ici, nous présentons un protocole reproductible basé sur Seurat pour analyser les données de séquençage de l’ARN unicellulaire CD4⁺ des cellules T PBMC à travers les temps de la réinfection paludique. Ce protocole démontre un flux de travail reproductible basé sur Seurat pour analyser les données PBMC CD4⁺ scRNA-seq à travers les périodes de réinfection du paludisme, en utilisant des ensembles de données représentatifs publiques pour démontrer son application : un jeu de données TCR-transgénique CD4⁺ spécifique au Plasmodium (GSE233703) et un jeu de données polyclonal CD4⁺ T-lymphocytes comparant les points temporels associés à la réinfection (GSE233713 ; D27₍₃₎ contre D30). Le flux de travail comprend un prétraitement standardisé, l’intégration, le clustering et des analyses transcriptomiques en aval au sein d’un cadre informatique unifié. La méthode permet le calcul systématique des scores de modules pour des programmes immuno-cellulaires et CD4⁺ prédéfinis, l’identification de gènes marqueurs spécifiques à un cluster, l’analyse d’expression différentielle résolue en points de temps, ainsi que l’enrichissement en aval de l’ontologie génique et des voies KEGG. L’application de ce flux de travail identifie des états fonctionnels distincts des lymphocytes T CD4⁺ et révèle des changements transcriptionnels dynamiques à travers les moments de réinfection du paludisme. Le protocole génère des résultats de visualisation standardisés et des résultats tabulats, et fournit des conseils pratiques sur la sélection des paramètres et le dépannage, facilitant une analyse cohérente et reproductible des ensembles de données scRNA-seq des cellules T CD4⁺ dans le paludisme et dans des contextes immunologiques connexes. Ce protocole permet une analyse reproductible et biologiquement interprétable des réponses immunitaires et peut être appliqué à des ensembles de données unicellulaires similaires en recherche immunologique.

Introduction

Le paludisme reste un fardeau sanitaire mondial majeur, les infections répétées façonnant l’immunité de l’hôte de manière complexe et incomplètementcomprise 1. Les lymphocytes T CD4⁺ jouent un rôle central dans les réponses immunitaires antipaludiques en coordonnant la production de cytokines effectrices, en soutenant l’aide des cellules B et en régulantl’inflammation 2,3. Lors d’une réinfection paludique, les lymphocytes T CD4⁺ subissent une reprogrammation transcriptionnelle dynamique, reflétant des déplacements entre les états effecteurs, régulateurs, de mémoire, prolifératifs et d’épuisement qui influencent à la fois le contrôle parasitaire et l’immunopathologie 4,5. Résoudre précisément cette hétérogénéité est essentiel pour comprendre la protection immunitaire, les dysfonctionnements immunitaires et la durabilité de l’immunité acquise naturellement ou induite par le vaccin face à l’infection au Plasmodium. Ici, nous présentons un protocole reproductible basé sur Seurat pour analyser les données CD4⁺ scRNA-seq des cellules T à travers les temps de réinfection du paludisme.

Le séquençage à ARN unicellulaire (scRNA-seq) permet une caractérisation à haute résolution de l’hétérogénéité immunitaire et a identifié des sous-ensembles de cellules T CD4⁺ réactifs aux parasites, des programmes d’épuisement et des réseaux régulateurs dans lepaludisme 6,7,8,9. Cependant, la variabilité analytique dans le contrôle qualité, la normalisation, le regroupement et l’intégration peut limiter la reproductibilité et compliquer les comparaisons croisées10,11. Cependant, un flux de travail standardisé et guidé biologiquement, spécifiquement optimisé pour analyser la dynamique des lymphocytes T CD4⁺ lors d’une réinfection paludique, fait défaut.

Les cadres computationnels existants pour l’analyse scRNA-seq, y compris Seurat et Scanpy, fournissent des ensembles d’outils complets pour le prétraitement, le clustering et l’interprétation en aval des donnéesmonocellulaires 12,13,14. Seurat, implémenté en R, propose des flux de travail étroitement intégrés pour la normalisation, l’intégration des données et la visualisation, incluant des approches de stabilisation de la variance telles que SCTransform qui améliorent la détection du signal dans des ensembles de données immunitaireshétérogènes 13. Scanpy, implémenté en Python, offre des solutions évolutives optimisées pour de grands ensembles de données et une utilisation efficace de la mémoire, ce qui le rend particulièrement adapté aux analyses à haut débit ou basées surle cloud 12,14. Malgré ces avancées, il reste nécessaire de faire des flux de travail standardisés et reproductibles qui abordent explicitement les questions biologiques dans les contextes d’infection tout en maintenant transparence, adaptabilité et cohérence entre les ensembles de données. Le protocole actuel répond à cette lacune en combinant la robustesse du prétraitement basé sur Seurat avec une interprétation biologique structurée adaptée aux réponses des lymphocytes T CD4⁺ lors d’une réinfection paludique. Comparé aux flux de travail polyvalents existants, ce protocole met l’accent sur la reproductibilité, la sélection des paramètres biologiquement informée et une analyse cohérente à travers les points temporels, adaptée aux modèles d’infection.

Une caractéristique clé de ce protocole est son accent mis sur la reproductibilité et l’utilisabilité pratique. Les seuils de contrôle qualité ne sont pas fixes mais sont dérivés à l’aide d’approches adaptatives aux données basées sur la déviation absolue médiane, permettant aux seuils de complexité des transcriptions, de profondeur de séquençage et de contenu mitochondrial d’évoluer avec les distributions spécifiques à chaque ensemble de données. Cette conception rend le flux de travail applicable à des ensembles de données de tailles variées, généralement allant de plusieurs milliers à des dizaines de milliers de cellules, ainsi qu’à une large gamme de profondeurs de séquençage couramment rencontrées dans les expériences scRNA-seq à base de gouttelettes. Les directives intégrées au flux de travail permettent la sélection appropriée des paramètres pour la réduction de dimensionnalité, la résolution de clustering et l’intégration, garantissant que les analyses restent à la fois biologiquement significatives et techniquement robustes. Néanmoins, le flux de travail dépend de la qualité des données et de la profondeur du séquençage, et peut nécessiter des ajustements pour des ensembles de données à effets très rares ou batch.

Ce protocole est conçu pour des utilisateurs intermédiaires à avancés ayant une connaissance de base de l’analyse R et monocellule, tout en restant accessible aux débutants motivés grâce à sa mise en œuvre structurée, progressive et à ses sorties entièrement reproductibles. Le flux de travail génère des tableaux et des figures standardisés à chaque étape, incluant des résumés de contrôle qualité, des résultats de regroupement, des résultats d’expressions différentielles et des analyses d’enrichissement, facilitant ainsi la transparence, la validation et la réutilisation dans des contextes collaboratifs ou multi-études. Ce protocole est particulièrement adapté aux études étudiant l’hétérogénéité immunitaire à travers des périodes ou des conditions dans la recherche en infection et en immunologie.

La méthode fournit un flux de travail reproductible et complet basé sur Seurat pour l’analyse du scRNA-seq des cellules T CD4⁺ à travers les périodes de réinfection du paludisme. Il intègre un contrôle qualité adaptatif, la stabilisation de la variance, la réduction dimensionnelle, le clustering et l’intégration multi-échantillons lorsque celaest approprié 13,15. Pour améliorer l’interprétabilité biologique, le flux de travail intègre le score des modules de gènes immuno-immunitaires et du sous-ensemble des lymphocytes T CD4⁺ pour quantifier les programmes fonctionnels tels que Th1, Tfh, Tr1, Treg, mémoire centrale, mémoire effectrice, prolifération, cytotoxicité etépuisement 16,17,18. L’identification complémentaire des marqueurs de cluster, l’analyse d’expression différentielle en points temporels et l’enrichissement des voies à l’aide de bases de données Gene Ontology et KEGG sont incluses pour soutenir une annotation robuste et une comparaison des états des lymphocytesT 19,20. Bien que démontré à l’aide de jeux de données Plasmodium scRNA-seq disponibles publiquement, ce protocole est largement applicable à d’autres modèles de réinfection du paludisme et perturbations immunologiques où une analyse reproductible et interprétable par cellules unicellulaires des cellules T CD4⁺ est requise. Dans l’ensemble, ce protocole fournit un cadre reproductible et biologiquement interprétable pour l’analyse unicellulaire des réponses des lymphocytes T CD4⁺, soutenant une investigation approfondie de la dynamique immunitaire dans le paludisme et les systèmes apparentés.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Déclaration d’éthique :

Toutes les données utilisées dans cette étude ont été obtenues à partir de jeux de données publics (GSE233703 et GSE233713). Les études originales respectaient les directives institutionnelles et éthiques pour l’expérimentation animale. Cette étude a porté sur une analyse bioinformatique secondaire de jeux de données de séquençage d’ARN unicellulaire disponibles publiquement et désidentifiés, obtenus à partir du dépôt Gene Expression Omnibus (GEO) (GSE233703 et GSE233713). Aucun nouveau participant humain, échantillon clinique ou information identifiable des patients n’a été impliqué dans cette étude. Selon les directives institutionnelles et nationales pour la recherche impliquant des ensembles de données anonymisés accessibles au public, une approbation éthique supplémentaire ni un consentement éclairé n’étaient pas nécessaires pour cette analyse bioinformatique. Les études initiales associées à ces ensembles de données ont été menées conformément aux normes éthiques institutionnelles pertinentes et aux directives applicables pour la recherche biomédicale.

1. Flux de travail d’analyse de l’analyse de scRNA-seq CD4⁺ à cellules scRNA basées sur des seurat reproductibles pour GSE233703 et GSE233713

REMARQUE : Ce flux de travail est fourni sous forme de fichier supplémentaire S1. Référez-vous également à un schéma qui donne un aperçu de l’ensemble du flux de travail (Figure 1).

  1. Définir le périmètre et les utilisateurs visés avant de commencer le protocole
  2. Définir les utilisateurs visés
    1. Utilisez ce protocole si l’utilisateur a une familiarité intermédiaire à avancée avec l’analyse R et du séquençage de l’ARN à cellule unique (scRNA-seq).
    2. Appliquer ce flux de travail aux ensembles de données de cellules T CD4⁺ de la rate murine générés au format matriciel de type 10x. Utilisez la structure par étapes et les sorties attendues pour vérifier chaque étape avant de continuer.
      REMARQUE : Assurez-vous de pratiques appropriées de gestion des données et d’un stockage sécurisé lors du travail avec de grands ensembles de données de séquençage.
  3. Définir scRNA-seq
    1. Considérez le séquençage à ARN unicellulaire (scRNA-seq) comme une méthode transcriptomique²¹ qui quantifie l’expression génique dans les cellules individuelles.
    2. Utilisez le scRNA-seq pour identifier des états cellulaires discrets, des populations transitoires et des programmes immunitaires hétérogènes au sein de tissus complexes.
  4. Préparer les exigences logicielles et du paquet
  5. Installer le logiciel de base
    1. Installez R 4.2 ou une version ultérieure.
    2. Ouvre l’interface RStudio. Définissez le répertoire de travail à l’aide de setwd().
    3. Exécutez les scripts séquentiellement en utilisant la fonction source(). Notez les versions exactes de R, RStudio et du système d’exploitation dans les notes de projet.
  6. Installer les paquets R
    1. Installez les paquets CRAN requis : Seurat, Matrix, tidyverse, patchwork, pheatmap, RColorBrewer, cluster, glmGamPoi, et ggplot2.
    2. Installez les paquets Bioconductor requis : clusterProfiler, org. Mm.eg.db, enrichplot et DESeq2.
    3. Installez uniquement des packages optionnels si nécessaire : DoubletFinder pour la suppression des doublets et Monocle3 pour l’analyse de trajectoire. Chargez tous les paquets nécessaires au début de la session d’analyse.
  7. Versions disques
    1. Sauvegardez les informations de paquet et de session à la fin du workflow en utilisant sessionInfo() ou une fonction équivalente.
    2. Rapportez explicitement les composants clés d’analyse dans le manuscrit, y compris la version R, la version Seurat, la version DESeq2 et la version clusterProfiler.
  8. Exécutez des commandes d’installation d’exemple mentionnées dans le fichier supplémentaire 2
  9. Confirmer les exigences matérielles et de stockage
  10. Confirmez les ressources minimales
    1. Utilisez un poste de travail avec au moins 16 Go de RAM, 4 cœurs CPU et 20 Go d’espace disque libre pour l’analyse de routine de jeux de données contenant plusieurs milliers à des dizaines de milliers de cellules.
  11. Confirmez les ressources recommandées
    1. Utilisez 32 Go de RAM ou plus pour des analyses intégrées, des tracés répétés ou une détection optionnelle de doublet.
    2. Augmentez future.globals.maxSize si de gros objets ou des ensembles de données intégrés produisent des erreurs liées à la mémoire.
    3. Appliquer un exemple de réglage mémoire
  12. Exécutez les commandes suivantes pour définir les options mémoire mentionnées dans le fichier supplémentaire 2

2. Créer la structure du projet

  1. Créer le répertoire racine du projet
    1. Créez un annuaire de projet pour l’analyse.
    2. Créez des sous-répertoires nommés data/, scripts/ et results_spleen_cd4/.
  2. Utilisation d’une structure de sortie standardisée
    1. Assurez-vous que le flux de travail écrit les sorties dans les répertoires suivants :
      results_spleen_cd4/GSE233703/fig/
      results_spleen_cd4/GSE233703/tables/
      results_spleen_cd4/GSE233703/RDS/
      results_spleen_cd4/GSE233713/fig/
      results_spleen_cd4/GSE233713/tables/
      results_spleen_cd4/GSE233713/RDS/
      results_spleen_cd4/post_markers/
  3. Utiliser un nom de fichier cohérent
    1. Renommer les fichiers d’entrée GEO pour qu’ils correspondent aux chemins attendus par le script.
    2. Utilisez les noms exacts de fichiers suivants :
      data/GSE233703_matrix.mtx.gz
      data/GSE233703_genes.tsv.gz
      données/GSE233703_barcodes.tsv.gz
      données/GSE233713_d27_3_matrix.mtx.gz
      données/GSE233713_d27_3_features.tsv.gz
      data/GSE233713_d27_3_barcodes.tsv.gz
      data/GSE233713_d30_matrix.mtx.gz
      data/GSE233713_d30_features.tsv.gz
      données/GSE233713_d30_barcodes.tsv.gz
    3. Nommez les fichiers de métadonnées optionnels comme suit :
      data/GSE233703_cell_metadata.csv
      data/GSE233713_cell_metadata.csv
  4. Confirmer les exigences en métadonnées
    1. Confirmez que chaque fichier de métadonnées contient une colonne de code-barres. Ajoutez des colonnes optionnelles telles que sample, timepoint, et répliquez lorsque c’est possible.
    2. Utilisez des correspondances exactes de codes-barres entre les métadonnées et les matrices de comptage.
      Attention : Vérifiez que les triplets matriciels et les fichiers de métadonnées existent sur les chemins attendus avant de commencer l’importation.

3. Importer les matrices de comptage et valider l’intégrité des entrées

  1. Lisez des matrices de style 10x
    1. Lisez chaque fichier matrix.mtx.gz comme une matrice clairsemée.
    2. Lisez le fichier de caractéristiques (ou gènes) et le fichier de codes-barres correspondants sous forme de tables délimitées par des tabulations.
    3. Assigner des symboles de gènes aux lignes de matrice en utilisant la deuxième colonne du fichier features lorsque disponible. Faire respecter les symboles génétiques uniques en utilisant make.unique().
    4. Attribuer des identifiants de code-barres aux colonnes matricielles. »
  2. Exécuter une fonction d’importation d’exemple
    1. Exécutez le code mentionné dans le fichier supplémentaire 2, pour importer la matrice et attribuer des identifiants.
  3. Valider l’intégrité de la matrice
    1. Vérifiez que le nombre de lignes de matrice est égal au nombre de caractéristiques. Vérifiez que le nombre de colonnes matricielles est égal au nombre de codes-barres.
    2. Arrêtez le flux de travail si un décalage est détecté.
      REMARQUE : Si des incompatibilités sont détectées, vérifiez l’intégrité du fichier et assurez-vous d’aligner correctement les fichiers de caractéristiques et de codes-barres avant de relancer l’étape.
      Point de contrôle : Ne procéder que si le nombre de lignes correspond à des caractéristiques et le nombre de colonnes correspond aux codes-barres.

4. Définir les panneaux de marqueurs et de modules

  1. Définir les panneaux de cellules T CD4⁺ pertinents pour le paludisme
    1. Définissez les panels génétiques nommés pour : Th1, Tfh, Tr1, Treg, Tcm, Tem, Épuisement, Prolifération, Cytotoxique, Activation_early, Interferon_response, Immune_regulation
    2. Stockez ces panneaux dans une liste R nommée pour le score des modules en aval.
  2. Exécutez le code R mentionné dans le fichier supplémentaire 2 pour définir les panneaux de gènes.
  3. Définir les gènes de validation des marqueurs
    1. Définissez un panneau de validation distinct contenant des gènes marqueurs canoniques tels que Foxp3, Bcl6, Cxcr5, Il21, Ifng, Ctla4, Pdcd1, Lag3, Tbx21, Tcf7 et Lef1.

5. Créer des objets Seurat et calculer des métriques de contrôle qualité

  1. Initialisation des objets Seurat
    1. Créez un objet Seurat pour chaque jeu de données en utilisant min.cells = 3 et min.features = 0. N’imposez pas de coupures de fonctionnalités arbitraires à l’importation.
    2. Ajoutez des métadonnées de données de données, échantillons et points temporels. Fusionner les métadonnées optionnelles en utilisant la correspondance de codes-barres.
  2. Exécuter exemple d’initialisation d’objet Seurat
    1. Exécutez le code R mentionné dans le fichier supplémentaire 2 pour créer un objet Seurat et assigner des métadonnées.
  3. Calculer les métriques de contrôle qualité
    1. Calculez la fraction de transcript mitochondrial en utilisant le préfixe murin ^mt-.
    2. Quantifiez les indicateurs suivants
      nFeature_RNA
      nCount_RNA
      percent.mt
  4. Exécutez le code d’exemple mentionné dans le fichier supplémentaire 2.
  5. Visualisez le contrôle qualité avant le filtre
    1. Générez des intrigues de violon pour nFeature_RNA, nCount_RNA et percent.mt. Générez des diagrammes de dispersion de caractéristiques pour nCount_RNA contre nFeature_RNA et nCount_RNA par rapport à percent.mt.
    2. Sauvegardez les figures pré-filtre avec des noms standardisés tels que QC_pre_filter_AllCells_vln.png et QC_pre_filter_AllCells_scatter.png.
      Attention : Attendez-vous à des distributions larges avant le filtrage avec des queues de faible qualité et des valeurs aberrantes à fort dénombrement.

6. Dériver des seuils de contrôle qualité adaptatif et filtrer les cellules de faible qualité

  1. Dériver des seuils spécifiques à chaque jeu de données
    1. Transformée logaritriste nFeature_RNA + 1 et nCount_RNA + 1. Calculez la médiane et la médiane absolue (MAD) pour les deux variables transformées.
    2. Définissez les seuils suivants :
      min_features = 10^(médiane - 3 × MAD) - 1
      max_features = 10^(médiane + 3 × MAD) - 1
      min_counts = 10^(médiane - 3 × MAD) - 1
      max_counts = 10^(médiane + 3 × MAD) – 1
    3. Définissez le seuil mitochondrial comme le 95e percentile de percent.mt plus 3 × DMA, contraint entre 5 % et 20 %.
    4. Assurez-vous que dataset_id, sample_id et out_dir sont correctement spécifiés avant d’exécuter la fonction.
      qc_thr <- derive_qc_thresholds(seu, dataset_id = « GSE233703 », sample_id = « AllCells », out_dir = « results_spleen_cd4/GSE233703 »)
  2. Appliquer le filtrage
    1. Conserver les cellules satisfaisant tous les critères adaptatifs :
      nFeature_RNA >= min_features
      nFeature_RNA <= max_features
      nCount_RNA >= min_counts
      nCount_RNA <= max_counts
      percent.mt <= max_percent_mt
    2. Exécutez le code d’exemple mentionné dans le fichier supplémentaire 2.
  3. Sauvegarder les sorties de filtrage
    1. Gardez QC_thresholds_*.csv et cell_counts_summary_*.csv.
      POINT DE PAUSE : Sauvegardez les sorties intermédiaires et l’analyse de reprise de cette étape si nécessaire.
    2. Générez et enregistrez des nuages de contrôle qualité post-filtre et des nuages de points.
      Point de contrôle : Attendez-vous à des distributions post-filtre plus serrées, à la suppression des cellules de faible complexité et à la réduction des valeurs extrêmes.

7. Normaliser les données et effectuer l’ACP

  1. Normaliser et stabiliser la variance
    1. Normaliser le test d’ARN avant le score du cycle cellulaire. Effectuez la notation du cycle cellulaire si activée. Utilisez SCTransform() pour la stabilisation de la variance.
    2. Ne régressez le contenu mitochondrial que si biologiquement justifié et explicitement autorisé.
    3. Régressez les scores du cycle cellulaire uniquement si nécessaire pour la conception de l’étude.
  2. Exécutez une normalisation d’exemple comme mentionné dans le fichier supplémentaire 2.
  3. Définir les valeurs des paramètres
    1. Utilisez n_variable_features = 3000.
    2. Utilisez dims_max_for_pca = 50.
    3. Énoncez explicitement ces valeurs dans le manuscrit.
  4. Exécuter la PCA et sélectionner les composants principaux
    1. Faites un PCA sur le test normalisé. Confirmez la réussite de l’exécution de la PCA en inspectant les charges expliquées par la variance et les composants principaux.
    2. Calculer la variance expliquée par chaque composante principale.
  5. Sélectionnez les PJ en suivant les trois critères :
    1. Conservez les PJ expliquant au moins 1 % de variance,
    2. Assurez-vous que la variance cumulative atteigne environ 80 %,
    3. Limitez la sélection finale entre 10 et 40 PJ.
    4. Sauvegardez PCA_variance_table_*.csv, PCA_selection_rationale_*.csv et PCA_Elbow_*.png.
  6. Exécuter un exemple de PCA
    1. Exemple comme mentionné dans le fichier supplémentaire 2.
      Point de contrôle : Attendez-vous à un diagramme coude avec une diminution visible du gain de variance marginale après le seuil sélectionné.

8. Construire des voisinages, sélectionner la résolution et regrouper les cellules

  1. Structure de graphe de construction
    1. Construisez un graphe partagé du plus proche voisin en utilisant les PC sélectionnés.
    2. Effectuez un premier clustering basse résolution si la détection de doublets nécessite des étiquettes de cluster.
  2. Retirez éventuellement les doublets
    1. Utilisez DoubletFinder uniquement si l’installation est compatible et installée.
      REMARQUE : Effectuer la détection de doublets uniquement pour les ensembles de données avec un grand nombre de cellules où des artefacts multiplet sont attendus.
    2. Recalculer la normalisation et l’ACP après la suppression du doublet.
  3. Sélectionnez la résolution de clustering
    1. Évaluer les résolutions 0.2, 0.4, 0.6, 0.8, 1.0 et 1.2.8.3.2
    2. Calculez la largeur moyenne de la silhouette pour chaque résolution testée. Sélectionnez la résolution avec le score de silhouette le plus élevé parmi les solutions ayant au moins deux clusters.
    3. Sauvegardez resolution_sweep_*.csv, resolution_selection_rationale_*.csv et resolution_sweep_*.png.
  4. Exécutez la sélection de résolution d’exemple en exécutant le code mentionné dans le fichier Supplémentaire 2
  5. Exécutez UMAP et le clustering final.
    1. Exécutez UMAP en utilisant les PC sélectionnés.
    2. Reconstruis le graphe du plus proche voisin. Clusterez les cellules en utilisant la résolution sélectionnée.
    3. Sauvegardez les graphiques UMAP étiquetés par cluster et regroupés par échantillon ou point temporel. Exécutez le code suivant mentionné dans le fichier supplémentaire 2.
      Attention : Attendez-vous à une séparation stable en grappes et une structure UMAP interprétable compatible avec les principaux états immunitaires.

9. Effectuer une intégration basée sur SCT pour GSE233713

  1. Préparez des objets séparés
    1. Créez des objets Seurat séparés pour D27_3 et D30.
    2. Appliquez le contrôle qualité et le filtrage indépendamment à chaque échantillon. Normalisez chaque échantillon séparément avec SCTransform().
  2. Justifier l’intégration
    1. Utilisez l’intégration basée sur SCT pour réduire les différences techniques entre les points temporels tout en préservant la structure biologique partagée.
    2. Ne supposez pas que l’intégration est automatiquement bénéfique. Validez-le explicitement.
  3. Intégrer les échantillons
    1. Sélectionnez les fonctionnalités d’intégration à l’aide de SelectIntegrationFeatures(). Préparez les objets avec PrepSCTIntegration().
    2. Trouver des ancres avec FindIntegrationAnchors(normalization.method = « SCT »). Intégrez les ensembles de données avec IntegrateData (normalisation.method = « SCT »).
  4. Exécuter l’intégration d’exemples mentionnée dans le fichier Supplémentaire 2
  5. Valider l’intégration
    1. Générez des graphiques UMAP avant et après intégration regroupés par point temporel. Interpréter l’amélioration du mélange des cellules entre les différents moments comme une preuve d’intégration réussie.
    2. Calculer le mélange des voisins avant et après l’intégration. Calculez la composition des clusters par point temporel et générez des graphiques de composition empilés.
    3. Sauvegardez les sorties suivantes :
      UMAP_preintegration_*
      UMAP_postintegration_*
      integration_diagnostics_*
      cluster_timepoint_composition_*
      Attention : Attendez-vous à une réduction de la ségrégation des points temporels après intégration, à une augmentation du mélange des voisins et à une contribution multi-points temporels à la plupart des amas sans perte totale de structure biologiquement significative.

10. Annoter les clusters et valider la structure des marqueurs

  1. Notez les modules liés au paludisme
    1. Exécutez AddModuleScore() pour les panneaux prédéfinis de cellules T CD4⁺ du paludisme.
    2. Conservez les moyennes et classements de modules au niveau du cluster.
  2. Exécutez l’exemple de notation des modules mentionnée dans le fichier supplémentaire 2
  3. Attribuer les labels prédits de cluster
    1. Attribuez le module le mieux classé à chaque groupe comme étiquette prédite.
    2. Sauvegarde :
      cluster_module_score_means_*
      cluster_module_score_rankings_*
      cluster_predicted_labels_*
  4. Valider les clusters avec des marqueurs canoniques
    1. Exécutez les DotPlots et FeaturePlots de validation des marqueurs en utilisant le panneau de marqueurs canonique.
    2. Sauvegarde :
      DotPlot_marker_validation_*
      FeaturePlot_marker_validation_*
      Attention : Attendez-vous à une expression concordante de plusieurs gènes canoniques par état fonctionnel, pas à des signaux isolés d’un seul gène.

11. Identifier les marqueurs et effectuer des expressions différentielles.

  1. Trouver les marqueurs de groupe
    1. Exécutez FindAllMarkers() uniquement en utilisant les marqueurs positifs.
    2. Économisez markers_all_clusters_*.csv.
  2. Exécutez le code mentionné dans le fichier supplémentaire pour exécuter l’identification des marqueurs d’exemple
  3. Utiliser une expression différentielle consciente des réplications lorsque cela est disponible
    1. Vérifiez si des métadonnées réplicatives valides sont disponibles. Si des réplications sont disponibles, il faut agréger les comptes par réplication et par condition et exécuter un pseudobulk DE avec DESeq2.
    2. Sauve DE_pseudobulk_*.
  4. Utilisez une expression différentielle exploratoire au niveau cellulaire lorsque les réplications sont absentes
    1. Si les métadonnées réplicatives sont absentes ou insuffisantes, exécutez une DE monocellule comme analyse exploratoire.
    2. Sauvegardez DE_WARNING_* pour documenter le statut exploratoire. Enregistrez les résultats exploratoires sous forme de DE_exploratory_celllevel_*.
  5. Générer des sorties d’expression différentielles globales
    1. Créez des graphiques volcaniques pour les résultats de DE et enregistrez Volcano_*.
    2. Sauvegardez les résultats importants des ED sous forme de tables filtrées.
  6. Générer des sorties d’enrichissement fonctionnel
    1. Exécutez l’enrichissement du processus biologique GO et économisez GO_BP_*. Faites KEGG enrichment et enregistrez KEGG_*.
    2. Exécutez GSEA en utilisant les changements de pliage classés log2 et sauvegardez GSEA_GO_*. Sauvegardez les barres et dotplots correspondants.
  7. Générer des sorties d’expression différentielles spécifiques à chaque cluster
    1. Exécutez DE dans chaque cluster entre les points temporels.
    2. Sauver DE_cluster_* et DE_cluster_specific_combined_*.
  8. Générer des sorties d’expression différentielles axées sur l’immunité
    1. Extraire les résultats de la DE pour certains gènes immunitaires tels que Ifng, Cxcl10, Ctla4, Il10, Foxp3, Bcl6, Cxcr5, Pdcd1, Lag3, Havcr2, Il21 et Tbx21.
    2. Sauve DE_immune_focus_*.
    3. Générez et enregistrez les sorties suivantes :
      DotPlot_selected_genes_by_timepoint_*
      Heatmap_immune_focus_*
      Attention : Attendez-vous à une cohérence entre les DE mondiaux, les sorties d’enrichissement, les DE spécifiques au cluster et les signatures axées sur l’immunité.

12. Sauvegarder les résultats finaux et archiver la session

  1. Sauvegarder les objets Seurat
    1. Sauvegardez les objets finaux Seurat en format .rds pour chaque jeu de données.
  2. Enregistrer les informations de la session
    1. Écrivez sessionInfo() dans un fichier texte dans le répertoire de sortie.
  3. Exécutez le code mentionné dans le fichier supplémentaire 2 pour exécuter l’exportation de session d’exemple
  4. Vérifier la complétude des sorties
    1. Confirmez que les fig/, tables/ et rds/répertoires attendus contiennent les fichiers correspondants.
    2. Archivez les scripts, les informations de session et les résultats ensemble.
      Attention : Ne procédez pas à l’écriture de rapports tant que les résumés QC, les sorties PCA, les sorties de sélection de résolution, les diagnostics d’intégration, les fichiers d’annotation de modules, les sorties DE et les fichiers d’enrichissement ne sont pas tous présents et cohérents en interne.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Qualité du séquençage et contrôle qualité au niveau cellulaire (cellules T TCR-transgéniques spécifiques à l’antigène (réactifs à PcAS) (GSE233703))

Les distributions de contrôle qualité avant filtre (Figure 2A) ont montré une complexité de transcripts hétérogène, la plupart des cellules présentant des décomptes modérés de gènes et d’UMI, et un sous-ensemble plus petit présentant des profils aberrants à fort nombr...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Cette étude présente un flux de travail standardisé et reproductible basé sur Seurat pour analyser la dynamique transcriptionnelle des lymphocytes T CD4⁺ lors d’une réinfection paludique. Le protocole intègre le contrôle qualité adaptatif, la normalisation, la réduction de dimensionnalité, le clustering, l’intégration de jeux de données, la validation des marqueurs, le notation de modules et l’analyse d’expression différentielle au sein d’un cadre informatique unifié. Ensemble, ces étape...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont rien à divulguer.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Nom du matériel / ÉquipementSociété / SourceNuméro de catalogueCommentaires / Description
Matrices de comptage formatées 10x Genomics–NCBI GEON/AFichiers Matrix Market (matrix.mtx, features.tsv, barcodes.tsv)
clusterProfiler (paquet R)BioconductorN/ARRID:SCR_016884; Analyse d'enrichissement fonctionnel (GO, KEGG)
enrichplot (paquet R)BioconductorN/ARRID:SCR_017030; Visualisation des résultats d'analyse d'enrichissement
Ensemble de données GEO GSE233703NCBI Gene Expression OmnibusGSE233703Jeu de données scRNA-seq de cellules T CD4+ transgéniques TCR spécifiques au PcAS
Ensemble de données GEO GSE233713NCBI Gene Expression OmnibusGSE233713Jeu de données scRNA-seq de cellules T CD4+ polyclonales (D273 vs D30)
GitHub (facultatif)GitHub Inc.N/ARRID:SCR_002630; Contrôle de version et reproductibilité (facultatif)
glmGamPoi (paquet R)BioconductorN/ARRID:SCR_021001; Ajustement accéléré du modèle SCTransform
Matrix (paquet R)CRANN/ARRID:SCR_008389; Manipulation de matrices éparses pour les données scRNA-seq
Système d'exploitationMicrosoft / Apple / LinuxN/AWindows 10+, macOS, ou Linux supporté
org.Mm.eg.db (paquet R)BioconductorN/ARRID:SCR_002643; Base de données d'annotation des gènes de souris
patchwork (paquet R)CRANN/ARRID:SCR_018787; Assemblage de figures à panneaux multiples
Visualiseur PDFN'importe quelN/AVisualisation des plots QC, UMAPs et heatmaps
Ordinateur personnel ou station de travailN'importe quelN/AMinimum 16–32 GB RAM recommandé pour l'intégration
pheatmap (paquet R)CRANN/ARRID:SCR_016418; Visualisation de heatmaps d'expression génique
Logiciel statistique R (version ≥ 4.2)R Foundation for Statistical ComputingN/ARRID:SCR_001905; Environnement de calcul central
RStudio DesktopPosit SoftwareN/ARRID:SCR_000432; Environnement de développement intégré pour R
Seurat (paquet R, v4 ou plus récent)Satija LabN/ARRID:SCR_016341; Analyse scRNA-seq
tidyverse (suite de paquets R)CRANN/ARRID:SCR_019186; Manipulation et visualisation des données

Références

  1. World Health Organization. WHO malaria policy advisory group (MPAG) meeting report, 18–20 April 2023. Geneva: World Health Organization; 2023.
  2. Stevenson MM, Riley EM. Innate immunity to malaria. Nat Rev Immunol. 2004;4(3):169-80.
  3. Langhorne J, Ndungu FM, Sponaas AM, Marsh K. Immunity to malaria: more questions than answers. Nat Immunol. 2008;9(7):725-32.
  4. Perez-Mazliah D, Langhorne J. CD4 T-cell subsets in malaria: TH1/TH2 revisited. Front Immunol. 2015;5:671.
  5. Illingworth J, et al. Chronic exposure to Plasmodium falciparum is associated with phenotypic evidence of B and T cell exhaustion. J Immunol. 2013;190(3):1038-47.
  6. Tang F, et al. mRNA-Seq whole-transcriptome analysis of a single cell. Nat Methods. 2009;6(5):377-82.
  7. Lönnberg T, et al. Single-cell RNA-seq and computational analysis using temporal mixture modeling resolves TH1/TFH fate bifurcation in malaria. Sci Immunol. 2017;2(9):eaal2192.
  8. Butler NS, et al. Therapeutic blockade of PD-L1 and LAG-3 rapidly clears established blood-stage Plasmodium infection. Nat Immunol. 2012;13(2):188-95.
  9. Soon MS, Haque A. Recent insights into CD4+ Th cell differentiation in malaria. J Immunol. 2018;200(6):1965-75.
  10. Slovin S, et al. Single-cell RNA sequencing analysis: a step-by-step overview. RNA Bioinformatics. 2021:343-65.
  11. Vieth B, Parekh S, Ziegenhain C, Enard W, Hellmann I. A systematic evaluation of single cell RNA-seq analysis pipelines. Nat Commun. 2019;10(1):4667.
  12. Wolf FA, Angerer P, Theis FJ. SCANPY: large-scale single-cell gene expression data analysis. Genome Biol. 2018;19(1):15.
  13. Hafemeister C, Satija R. Normalization and variance stabilization of single-cell RNA-seq data using regularized negative binomial regression. Genome Biol. 2019;20(1):296.
  14. Stuart T, et al. Comprehensive integration of single-cell data. Cell. 2019;177(7):1888-902.
  15. Satija R, Farrell JA, Gennert D, Schier AF, Regev A. Spatial reconstruction of single-cell gene expression data. Nat Biotechnol. 2015;33(5):495-502.
  16. Crotty S. T follicular helper cell differentiation, function, and roles in disease. Immunity. 2014;41(4):529-42.
  17. Wherry EJ, Kurachi M. Molecular and cellular insights into T cell exhaustion. Nat Rev Immunol. 2015;15(8):486-99.
  18. Belkaid Y, Rouse BT. Natural regulatory T cells in infectious disease. Nat Immunol. 2005;6(4):353-60.
  19. Ashburner M, et al. Gene ontology: tool for the unification of biology. Nat Genet. 2000;25(1):25-9.
  20. Kanehisa M, Goto S. KEGG: kyoto encyclopedia of genes and genomes. Nucleic Acids Res. 2000;28(1):27-30.
  21. Gulati GS, et al. Profiling cell identity and tissue architecture with single-cell and spatial transcriptomics. Nat Rev Mol Cell Biol. 2025;26(1):11-31.
  22. Schofield L, Grau GE. Immunological processes in malaria pathogenesis. Nat Rev Immunol. 2005;5(9):722-35.
  23. Plebanski M, Hill AV. The immunology of malaria infection. Curr Opin Immunol. 2000;12(4):437-41.
  24. Crotty S. T follicular helper cell biology: a decade of discovery and diseases. Immunity. 2019;50(5):1132-48.
  25. Vinuesa CG, Linterman MA, Yu D, MacLennan IC. Follicular helper T cells. Annu Rev Immunol. 2016;34:335-68.
  26. Wherry EJ. T cell exhaustion. Nat Immunol. 2011;12(6):492-9.
  27. Maizels RM, Smith KA. Regulatory T cells in infection. Adv Immunol. 2011;112:73-136.
  28. Choudhary S, Satija R. Comparison and evaluation of statistical error models for scRNA-seq. Genome Biol. 2022;23(1):27.
  29. Li M, et al. Rediscovering publicly available single-cell data with the DISCO platform. Nucleic Acids Res. 2025;53(D1):D932-8.
  30. Islam MT, Xing L. Cartography of genomic interactions enables deep analysis of single-cell expression data. Nat Commun. 2023;14(1):679.
  31. Luecken MD, Theis FJ. Current best practices in single-cell RNA-seq analysis: a tutorial. Mol Syst Biol. 2019;15(6):e8746.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Immunologie et InfectionNuméro 233Numéro 233Valeur videNuméroscRNA-seqPBMCIntégration transcriptomiqueScore de module immunitaire

Cet article a été publié

Vidéo bientôt disponible