Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de méthode

Protocole informatique pour quantifier les déplacements transcriptomiques associés aux artesunates dans le tissu cérébral expérimental du paludisme cérébral à l’aide de DESeq2

75 vues

DOI :

10.3791/70870

31 juillet 2026

* These authors contributed equally

Dans cet article

Résumé

Le paludisme cérébral expérimental (ECM) provoque une neuroinflammation et un dysfonctionnement de la barrière hémato-encéphalique. En utilisant GSE162535, ce flux de travail RNA-seq reproductible basé sur R compare les cerveaux témoins (CB), ECM (MB) et traités à l’artesunate (AB), en réalisant des analyses QC, PCA et DESeq2. Il identifie les changements transcriptionnels provoqués par la MCE et évalue la modulation médiée par les artesunates des voies inflammatoire et neurovasculaire.

Résumé

Le séquençage ARN (RNA-seq) est largement utilisé pour définir des programmes transcriptionnels associés à la maladie, mais des flux de travail cohérents et complets sont nécessaires pour garantir des comparaisons reproductibles entre groupes expérimentaux et faciliter des résultats biologiquement interprétables. Ici, un protocole complet d’analyse ARN-seq est présenté pour évaluer les modifications transcriptomiques cérébrales dans le paludisme cérébral expérimental (ECM) et après un traitement par artesunate en utilisant le jeu de données public GSE162535. Le flux de travail analyse trois groupes — cerveau de contrôle (CB), cerveau ECM (MB) et cerveau ECM (AB) traité à l’artesunate — en partant d’une matrice de comptage HTSeq. Après avoir importé et formaté les comptages bruts, le protocole construit un jeu de données DESeq2 avec CB comme niveau de référence, filtre les gènes à faible nombre et effectue un contrôle qualité via la visualisation de la taille de la bibliothèque, l’analyse des composantes principales et le regroupement de distance d’échantillon. L’expression différentielle est ensuite calculée pour trois contrastes principaux (MB vs CB, AB vs MB, AB vs CB), avec un rétrécissement par variation de log2 fois appliqué pour une estimation stable de la taille de l’effet. Le protocole exporte des tableaux d’expression différentielle complets et significatifs, génère des graphiques volcaniques et MA, et produit des cartes thermiques des gènes les plus variables ainsi que des gènes différenciellement exprimés les mieux classés par contraste. Pour soutenir l’interprétation mécanistique, le flux de travail inclut l’extraction ciblée de marqueurs immunitaires (par exemple, cytokines, chimiokines, marqueurs d’activation microgliale, gènes BBB/endothéliaux) et réalise des analyses d’ontologie génique et d’enrichissement KEGG pour des ensembles de gènes fortement régulés à la hausse ou à la baisse. Ce protocole fournit un modèle reproductible pour caractériser les programmes transcriptionnels neuroinflammatoires associés à la MCE et pour quantifier la modulation associée aux artesunates de ces signatures.

Introduction

Le paludisme cérébral (MC) est une complication neurologique potentiellement mortelle de l’infection à Plasmodium falciparum et reste un facteur majeur de mortalité par paludisme malgré les avancées en gestion des cas. La MC se caractérise par une encéphalopathie aiguë, un dysfonctionnement microvasculaire, une activation endothéliale et une perturbation de la barrière hémato-encéphalique (BBB), avec une neuroinflammation en aval pouvant entraîner un coma et, chez les survivants, des séquelles neurocognitivespersistantes 1. La pathogenèse de la MC est multifactorielle et implique des réponses inflammatoires de l’hôte interagissant avec des facteurs d’origine parasite et d’origine hôte à l’interface neurovasculaire, ce qui rend difficile l’inférence des mécanismes causaux uniquement à partir des critèrescliniques 1.

Les modèles expérimentaux de paludisme cérébral (ECM), en particulier l’infection par Plasmodium berghei ANKA chez les souris C57BL/6, offrent une plateforme facile pour interroger l’immunopathologie cérébrale spécifique, les lésions du BBB et la signalisation neuroinflammatoire dans un cadrecontrôlé 2,3. Ces modèles ont été utilisés pour cartographier les réponses cellulaires et moléculaires à travers les stades de la maladie et pour tester des interventions complémentaires in vivo 2,3. Cependant, la pathobiologie de la MCE est complexe et très dynamique, et les tests ciblés peuvent manquer de changements coordonnés au niveau des voies qui surviennent à travers plusieurs programmes immunitaires et neurovasculaires.

L’artésunate est la thérapie parentérale de première intention recommandée pour le paludisme sévère et a démontré un bénéfice substantiel en survie par rapport à la quinine sur des bases de preuvesclés 4. Bien que l’élimination rapide des parasites soit centrale à l’efficacité des artésunates, les résultats neurologiques reflètent probablement à la fois la réduction parasitaire et la modulation secondaire des voies inflammatoires etneurovasculaires 1,4. Comprendre comment le traitement par artémisinine modifie les programmes de transcription cérébrale pendant la MCE peut donc fournir des perspectives mécanistes qui complètent les données d’efficacité clinique et peut identifier des voies candidates pour des stratégies neuroprotectrices complémentaires.

Le séquençage de l’ARN (RNA-seq) permet un profilage non biaisé et à l’échelle du génome des réponses transcriptionnelles dans les états de maladie et de traitement, soutenant l’analyse d’expression différentielle et l’interprétation fonctionnelle en aval. Des dépôts publics tels que le NCBI Gene Expression Omnibus (GEO) fournissent des ensembles de données sélectionnés adaptés à une réanalyse reproductible, y compris GSE162535, qui contient l’ARN-seq du cerveau provenant de cerveaux témoins (CB), de cerveaux ECM (MB) et de cerveaux ECM (AB)5 traités à l’artesunate. Pour soutenir la découverte reproductible à partir de tels ensembles de données, des cadres statistiques robustes sont nécessaires à l’expression différentielle basée sur le comptage, et des outils d’enrichissement sont nécessaires pour interpréter les changements au niveau des gènes en termes de voies et de processus biologiques.

Cette étude présente un flux de travail reproductible et complet d’analyse RNA-seq pour les tissus cérébraux à travers les groupes témoins (CB), le paludisme cérébral expérimental (MB) et les groupes traités par artésunate (AB). La nouveauté de cet article réside dans son pipeline standardisé basé sur DESeq2, incorporant des contrastes biologiquement pertinents prédéfinis (MB vs CB, AB vs MB, et AB vs CB), des résultats rigoureux de contrôle qualité (évaluation de la taille de la bibliothèque, analyse des composants principaux et cartes de chaleur de la distance d’échantillonnage), ainsi qu’une interprétation intégrée en aval via l’ontologie génique (GO) et l’enrichissement des voies KEGG utilisant clusterProfiler 6,7. De plus, le flux de travail met en œuvre une interprétation structurée basée sur un panel immunitaire, permettant une caractérisation systématique des réponses transcriptionnelles neuroinflammatoires, immunitaires et neurovasculaires. En combinant rigueur statistique, transparence et résultats prêts à être publiés, ce protocole offre un cadre robuste et réutilisable pour analyser la dysrégulation transcriptomique associée à la MCE et évaluer la modulation pilotée par le traitement dans les études précliniques sur le paludisme.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Cette étude a utilisé des données d’ARN-seq accessibles au public et n’a impliqué aucune nouvelle expérience humaine ou animale. Par conséquent, l’approbation éthique et le consentement éclairé n’étaient pas requis (Table of Materials).

1. Préparer l’environnement informatique et la structure des dossiers

  1. Configuration du matériel et du système d’exploitation
    1. Utilisez un poste de travail ou un ordinateur portable avec au moins 8 Go de RAM (16 Go recommandés) et ≥10 Go d’espace disque libre pour les téléchargements et les sorties.
    2. Utilisez Windows, macOS ou Linux avec la permission d’installer des paquets R et d’écrire des fichiers dans le répertoire de travail.
  2. Installer le logiciel requis
    1. Installez R (version 4.2 ou ultérieure). Installez RStudio Desktop (recommandé) pour exécuter le flux de travail de manière interactive et gérer le répertoire du projet.
  3. Créez un répertoire de projet et des dossiers de sortie
    1. Créez un nouveau dossier pour l’analyse (par exemple, GSE162535_RNAseq_DESeq2). Définissez ce dossier comme le répertoire de travail R.
    2. Créez les dossiers de sortie exactement comme suit :
      1. Créez des résultats. Créez des résultats/figures/. Créez des résultats/tables/.
  4. Installer les paquets R requis
    1. Installez les paquets CRAN : tidyverse, pheatmap et RColorBrewer. Installer les paquets Bioconductor : DESeq2, apeglm (optionnel), clusterProfiler et org. Mm.eg.db.
    2. Chargez les packages requis au début du script : DESeq2, tidyverse, pheatmap, RColorBrewer, clusterProfiler, org. Mm.eg.db, et ggplot2. Posez une seed de reproductibilité en lançant set.seed(123).
  5. Appliquer des garanties d’intégrité des données et de confidentialité
    1. Stockez uniquement les fichiers téléchargés dans le répertoire du projet. Restreignez l’accès au répertoire du projet si l’environnement contient des données sensibles ou sous embargo. Enregistrez les versions du logiciel en exportant sessionInfo() vers les résultats/sessionInfo.txt à la fin du workflow.
      REMARQUE : Ce protocole effectue une analyse in silico des données publiques de comptage ARN-seq et n’implique pas de manipulation d’échantillons biologiques.

2. Obtenir la matrice de comptage ARN-seq et définir les groupes expérimentaux

  1. Téléchargez les fichiers de jeux de données GEO pour GSE162535
    1. Téléchargez le fichier de comptage HTSeq pour GSE162535 depuis GEO et enregistrez-le dans le répertoire du projet sous forme de GSE162535_All.HTSeq.counts.txt.gz. Vérifiez l’intégrité du fichier en confirmant que le fichier s’ouvre sans erreur en utilisant gzfile() et read.delim().
  2. Chargez les comptes HTSeq dans R
    1. Importez la table de comptage compressée en utilisant read.delim(gzfile(...), header = TRUE, check.names = FALSE, quote = «  », comment.char = «  »). Inspectez l’objet importé à l’aide de str(), head() et colnames() pour confirmer que :
      1. La première colonne contient les identifiants de gènes (par exemple, AccID). Les colonnes restantes contiennent des comptages au niveau de l’échantillon.
  3. Standardiser les types de données et résoudre les identifiants de gènes dupliqués
    1. Définissez les colonnes d’échantillon comme toutes les colonnes sauf la colonne identifiant de gène (AccID). Forcez toutes les colonnes d’échantillonnage à des comptes entiers. Effondrez les identifiants de gènes dupliqués en additionnant les comptes sur les lignes partageant le même AccID.
    2. Convertir la table repliée en trame de données standard. Définissez les noms des lignes à l’identifiant du gène et supprimez la colonne d’identifiant de la matrice de comptage.
  4. Vérifier la structure de la matrice de comptage
    1. Confirmez que la matrice de comptage contient 12 colonnes d’exemple. Confirmez que les noms des colonnes d’exemple suivent le format AB_1..AB_4, CB_1..CB_4 et MB_1.MB_4.
    2. Arrêtez l’exécution si la matrice de comptage ne contient pas 12 colonnes.
  5. Créer et valider les métadonnées d’échantillons
    1. Créez un tableau de métadonnées d’exemple (colData) contenant les colonnes suivantes :
      1. Exemple : identifiants uniques correspondant aux noms des colonnes de la matrice de comptage. Groupe : condition biologique attribuée à chaque échantillon.
    2. Récupérez les annotations d’échantillons correspondantes pour les GSE162535 de jeu de données depuis le Gene Expression Omnibus (GEO).
    3. Vérifiez l’identité de chaque échantillon en utilisant les informations d’accès GEO et les champs d’annotation d’échantillons décrivant l’état expérimental. Associez chaque identifiant d’échantillon dans la matrice de comptage à son annotation GEO vérifiée.
    4. Attribuez chaque échantillon vérifié à l’un des groupes suivants : cerveau témoin (CB), cerveau expérimental du paludisme cérébral (MB) ou cerveau expérimental du paludisme cérébral (AB) traité à l’artesunate.
    5. Organisez la table de métadonnées de façon à ce que l’ordre de l’échantillon corresponde à l’ordre des colonnes de la matrice de comptage.
    6. Comparez les identifiants d’échantillons dans la table de métadonnées avec la matrice de comptage pour confirmer la correspondance un à un. Codez la variable de groupe en un facteur avec des niveaux ordonnés en CB, MB et AB.
    7. Fixez CB comme niveau de référence pour définir le groupe cérébral témoin comme référence pour l’analyse différentielle des expressions en aval.
    8. Fixez les noms de lignes de la table de métadonnées égaux aux identifiants d’échantillon.
      REMARQUE :Les étiquettes de groupe n’étaient pas attribuées uniquement à partir de l’ordre des échantillons dans la matrice de comptage. Les identités des échantillons ont été vérifiées indépendamment à l’aide de métadonnées GEO et des informations d’accès avant l’alignement avec la matrice d’expression afin d’améliorer la reproductibilité et de réduire le risque de mauvaise classification des échantillons.

3. Construire le jeu de données DESeq2 et effectuer un contrôle qualité de base

  1. Désinfectez la matrice de comptage
    1. Remplacer les valeurs manquantes dans la matrice de comptage par zéro. Confirmez l’absence de valeurs manquantes à l’aide de résumés is.na() par colonnes.
  2. Créer le jeu de données DESeq2
    1. Créez un DESeqDataSet en utilisant DESeqDataSetFromMatrix() avec : countData = counts ; colData = sample_info ; Conception = ~ groupe.
  3. Filtrer les gènes à faible nombre
    1. Retirer les gènes dont le total compte <10 sur tous les échantillons en utilisant dds <- dds[rowSums(counts(dds)) >= 10, ]. Notez le nombre de gènes conservés en imprimant le résumé de l’objet.
  4. Évaluer la taille des bibliothèques
    1. Calculer la taille des bibliothèques comme les sommes de colonnes de la matrice de comptage filtrée. Générez un diagramme de barres de la taille de la bibliothèque et enregistrez-le comme résultats/figures/library_sizes.pdf.
    2. Inspectez le graphique de taille de la bibliothèque et confirmez qu’aucun échantillon n’a une profondeur de séquençage extrême incompatible avec le plan de l’étude.

4. Exécuter DESeq2 et générer des objets de transformation pour la visualisation

  1. Ajuster le modèle DESeq2
    1. Exécutez la modélisation différentielle des expressions en utilisant dds <- DESeq(dds). Conserver l’objet DDS ajusté pour toutes les extraits des résultats en aval.
  2. Créer des matrices d’expression transformées
    1. Calculer la transformation logarithmique régularisée en utilisant rld <- rlog(dds, aveugle = FAUX). Calculez la transformation stabilisatrice de la variance en utilisant vsd <- vst(dds, aveugle = FAUX). Utilise RLD et VSD pour PCA, clustering et heatmaps.
      REMARQUE : Utilisez aveugle = FAUX pour préserver la structure de variance dépendante du groupe.

5. Effectuer la QC globale en utilisant l’ACP et le clustering entre distances échantillon

  1. Générer l’analyse en composantes principales (ACP)
    1. Calculer la PCA en utilisant plotPCA(rld, intgroup = « group », returnData = TRUE). Extraire la variance en pourcentage expliquée pour PC1 et PC2. Tracez PC1 vs PC2 en utilisant ggplot2, en étiquetant les points par nom d’échantillon et en coloriant par groupe.
    2. Enregistrez le graphique PCA comme résultats/figure/PCA_samples.pdf. Confirmez que le biologique se réplique groupe par groupe et qu’aucun échantillon ne se sépare comme un cas atypique.
  2. Générez une carte thermique de la distance d’échantillonnage
    1. Calculer les distances d’échantillonnage par paires en utilisant dist(t(assay(vsd))). Convertissez l’objet distance en matrice pour la visualisation. Créez une table d’annotation de colonnes contenant le facteur de groupe pour chaque échantillon.
    2. Tracez la matrice de distance avec pheatmap() et enregistrez comme résultats/fig/sample_distance_heatmap.pdf. Confirmez que les échantillons se regroupent principalement par groupe.

6. Calculer l’expression différentielle pour les trois contrastes principaux

  1. Définissez les contrastes
    1. Définissez l’effet de la maladie comme ECM vs contrôle : MB vs CB. Définissez l’effet du traitement dans la MCE comme traité par artésunate vs MCE : AB vs MB. Définissez traitement vs base comme traité par artesunate vs contrôle : AB vs CB.
  2. Extraire les résultats DESeq2 avec le retrait par changement de fold log2
    1. Extraire les résultats bruts pour chaque contraste en utilisant les résultats (dds, contrast = c(« groupe », groupeA, groupB)). Shrink log2 fold change en utilisant lfcShrink(dds, contrast = c(« group », groupA, groupB), res = res, type = « normal »).
    2. Convertir les résultats en une trame de données et stocker l’identifiant du gène sous forme de colonne nommée gene_id. Ordonner les résultats par valeur p nominale pour un rapport stable.
    3. Enregistrez chaque tableau complet des résultats dans les résultats/tableaux/ comme suit :
      1. DESeq2_MB_vs_CB_all_genes.csv, DESeq2_AB_vs_MB_all_genes.csv, DESeq2_AB_vs_CB_all_genes.csv
        REMARQUE : Si le retrait échoue à cause de la configuration du boîtier, relancer avec un type de retrait alternatif pris en charge dans l’installation locale.
  3. Définir des seuils de signification et exporter des ensembles de gènes significatifs
    1. Définissez les gènes exprimés différemment (DEG) en utilisant : la valeur p ajustée (FDR) < 0,05 et la variation absolue log2 multipliée ≥ 1. Filtrez chaque contraste pour exclure les gènes dont les valeurs p ajustées manquantes.
    2. Exportez les tables DEG significatives vers : résultats/tableaux/DESeq2_MB_vs_CB_sig.csv, résultats/tableaux/DESeq2_AB_vs_MB_sig.csv, résultats/tableaux/DESeq2_AB_vs_CB_sig.csv
  4. Résumez les décomptes de DEG par contraste
    1. Calculez le nombre de gènes significatifs par contraste. Enregistrez le tableau résumé comme résultats/tableaux/DE_summary_counts.csv.

7. Générer des graphiques volcaniques pour chaque contraste.

  1. Créez une fonction de tracé volcanique.
    1. Calculez -log10 (valeur p ajustée) pour chaque gène. Classez chaque gène comme Haut, Inférieur ou Non Significatif en utilisant les seuils : FDR < 0,05 et |log2FC| ≥ 1.
    2. Tracez log2FC (axe x) vs -log10(FDR) (axe y) en utilisant ggplot2. Ajoutez des lignes de seuil pointillées à log2FC = ±1 et -log10(0,05).
  2. Parcelles volcaniques d’exportation
    1. Enregistrez chaque graphique en PDF dans résultats/figures/ : volcano_MB_vs_CB.pdf, volcano_AB_vs_MB.pdf, volcano_AB_vs_CB.pdf.
      REMARQUE : Utilisez des limites d’axe cohérentes à travers les contrastes pour soutenir la comparaison visuelle entre les figures.

8. Générer des graphiques MA pour chaque contraste

  1. Exportez les graphiques MA en un seul PDF.
    1. Ouvrez un appareil PDF nommé results/fig/MA_plots.pdf. Tracez les graphiques MA pour chaque objet résultat brut DESeq2 en utilisant plotMA(). Étiquetez chaque parcelle avec le nom de contraste. Fermez l’appareil PDF.

9. Générer des cartes thermiques d’expression pour la variabilité globale et les gènes DE spécifiques au contraste.

  1. Tracez les gènes des principales variables sur tous les échantillons.
    1. Calculer la variance rangée par rangée à travers les échantillons à partir de la matrice d’essai vsd. Sélectionnez les 100 gènes les plus variables. Centrez chaque gène à travers les échantillons.
    2. Générez une carte thermique en utilisant pheatmap() avec des annotations de groupes d’échantillons. Enregistrez la figure comme résultats/figure/heatmap_top100_variable_genes.pdf.
  2. Tracez les gènes les plus exprimés différenciellement pour chaque contraste.
    1. Sélectionnez les 50 gènes principaux en ajustant la valeur p pour chaque contraste. Extraire leur matrice d’expression VSD et leur centre moyen par gène. Générez une carte thermique pour chaque contraste et enregistrez comme :
    2. résultats/figure/heatmap_top50_MB_vs_CB.pdf, résultats/figure/heatmap_top50_AB_vs_MB.pdf, résultats/figure/heatmap_top50_AB_vs_CB.pdf
      REMARQUE : Augmentez la largeur et la hauteur du PDF si les étiquettes de ligne sont activées.

10. Effectuer une analyse ciblée des marqueurs immunitaires.

  1. Résumez certains gènes immunitaires à travers des contrastes.
    1. Définissez un ensemble de marqueurs immunitaires : Il6, Il1b, Il10, Tnf, Ifng, Il21 et Icam1. Extraire log2FC, p-value et p-value ajusté pour ces gènes de chaque tableau de résultats de contraste.
    2. Fusionner les trois résumés de contraste par identifiant de gène. Enregistrez la table fusionnée comme résultats/tableaux/immune_genes_summary.csv.
  2. Générez une carte thermique des marqueurs immunitaires (rlog).
    1. Identifier les gènes immunitaires présents dans la matrice de test transformée. Extraire la matrice d’expression rlog pour les gènes immunitaires actuels.
    2. Expression du centre moyen par gène. Générez et enregistrez la carte thermique dans les résultats/figures/heatmap_immune_genes.pdf.

11. Effectuer une analyse étendue du panel immunitaire par catégorie fonctionnelle

  1. Définissez les panels immunitaires.
    1. Définir les panels de marqueurs immunitaires par catégorie, notamment : cytokines pro-inflammatoires et gènes de réponse à l’interféron, gènes anti-inflammatoires et régulateurs, chimiokines, marqueurs d’activation microgliale, marqueurs d’astrocytes, marqueurs BBB et d’activation endothéliale, marqueurs de lymphocytes T et marqueurs d’épuisement, marqueurs monocytes/macrophagues, gènes de la voie du complément, et gènes du stress oxydatif et de la mort cellulaire.
  2. Extraire les résultats du panel immunitaire de la DE pour chaque contraste.
    1. Créez une table de correspondance des symboles génétiques aux catégories immunitaires. Filtrez chaque table de résultats de contraste pour les gènes du panel immunitaire. Rejoignez la correspondance de catégories à chaque table de résultats filtrée.
    2. Concaténer les trois tables immunitaires spécifiques au contraste en une seule table. Enregistrez le tableau combiné comme résultats/tableaux/immune_panels_DE_all_contrasts.csv. Générez une carte thermique classifiée des expressions du panel immunitaire.
    3. Identifier les gènes du panel immunitaire présents dans la matrice du test rld. Ajoutez des étiquettes de catégorie aux noms de lignes pour préserver la classification des panneaux dans la figure. Tracez la carte thermique rlog avec des annotations de groupes d’exemple.
  3. Sauvegardez les sorties.
    1. Enregistrer comme : résultats/figure/heatmap_immune_panels_all.pdf, résultats/figure/heatmap_immune_panels_all.png

12. Générer des graphiques volcaniques à superposition immunitaire

  1. Créez des graphiques volcaniques à superposition immunitaire.
    1. Marquez les gènes comme immunitaires ou non immunisés en rejoignant le panel immunitaire correspondant à chaque tableau de résultats de contraste. Tracez tous les gènes non immunisés comme des points de fond gris. Tracez les gènes immunitaires colorés par catégorie immunitaire au premier plan. Ajouter des lignes seuil à log2FC = ±1 et -log10(0,05).
  2. Exportez des parcelles volcaniques à superposition immunisée.
    1. Conservez les graphiques de volcans en superposition immunisée MB vs CB comme suit :
      1. résultats/figures/volcano_MB_vs_CB_immune_overlay.pdf
      2. résultats/figures/volcano_MB_vs_CB_immune_overlay.png
    2. Conservez les graphiques de volcans à superposition immunisée AB vs MB comme suit :
      1. résultats/figures/volcano_AB_vs_MB_immune_overlay.pdf
      2. résultats/figures/volcano_AB_vs_MB_immune_overlay.png
        REMARQUE : Les panels génétiques immunitaires sélectionnés ont été prédéfinis et regroupés en catégories fonctionnelles ; la liste complète des symboles génétiques avec annotations est fournie dans le tableau supplémentaire S1. Ce tableau garantit transparence et reproductibilité, permettant la réutilisation directe et la validation des analyses basées sur des panels à travers les études.

13. Effectuer une analyse d’enrichissement fonctionnel (GO et KEGG)

  1. Définir les ensembles de gènes pour l’enrichissement
    1. Pour chaque contraste (MB vs CB et AB vs MB), extraire des gènes significativement exprimés différemment (DEG) en utilisant un seuil de p-value ajusté de < 0,05 et un seuil absolu log₂ de variation de pliage ≥ 1.
    2. Séparer les DEG en gènes à la hausse (log₂FC > 0) et en gènes à la baisse (log₂FC < 0).
  2. Définir l’ensemble génétique de fond (univers)
    1. Utilisez tous les gènes conservés après le filtrage de comptage dans l’ensemble de données DESeq2 comme univers de fond. Extraire les symboles géniques de l’objet DESeq2 filtré. Convertir les symboles de gènes en arrière-plan en identifiants Entrez en utilisant la fonction bitr() avec org. Mm.eg.db.
      REMARQUE : L’utilisation d’un ensemble génétique de fond cohérent garantit des résultats d’enrichissement impartials.
  3. Cartographier les identifiants génétiques pour l’enrichissement
    1. Convertir les symboles géniques de chaque ensemble DEG en identifiants Entrez en utilisant bitr(). Conservez uniquement les gènes cartographiés avec succès pour l’enrichissement KEGG. On peut éviter l’analyse d’enrichissement pour un ensemble de gènes si aucun gène n’est cartographié avec succès.
      REMARQUE : L’enrichissement de l’ontologie génique (GO) utilise des symboles génétiques, tandis que l’enrichissement KEGG nécessite des identifiants Entrez.
  4. Réaliser l’enrichissement de l’ontologie génique (GO) (processus biologique)
    1. Exécutez l’enrichissement GO en utilisant enrichGO() avec OrgDb = org. Mm.eg.db. Set keyType = « SYMBOL » et ontologie (ont) = « BP ». Spécifiez l’univers comme tous les symboles génétiques filtrés issus du jeu de données DESeq2.
    2. Utilisez pAdAjustMethod = « BH » pour la correction à tests multiples. Appliquer les seuils de signification de pvalueCutoff = 0,05 et qvalueCutoff = 0,05. Restreignez la taille des ensembles de gènes en utilisant minGSSize = 10 et maxGSSize = 500.
    3. Exportez les résultats d’enrichissement GO vers les résultats/tableaux/répertoire. Générez des barplots de termes GO enrichis et enregistrez dans les résultats/figures/.
  5. Effectuer l’enrichissement des voies KEGG
    1. Exécutez l’enrichissement KEGG en utilisant enrichKEGG() avec organisme = « mmu ». Fournir des identifiants Entrez des ensembles DEG comme gènes d’entrée. Utilisez l’arrière-plan cartographié d’Entrez comme l’univers.
    2. Appliquer pAdajustMethod = « BH ». Utilisez les seuils de signification de pvalueCutoff = 0,05 et qvalueCutoff = 0,05. Restreignez la taille des ensembles de gènes en utilisant minGSSize = 10 et maxGSSize = 500.
    3. Exportez les tables d’enrichissement KEGG vers résultats/tables/. Générez des barplots de voies enrichies KEGG et enregistrez selon les résultats/figur/.
      REMARQUE : L’enrichissement KEGG peut ne pas donner de résultats si la cartographie génique est insuffisante ; Ces cas sont traités sans interrompre le flux de travail.

14. Effectuer une analyse d’enrichissement immunitaire uniquement (module optionnel)

  1. Construire des ensembles de gènes spécifiques à l’immunité
    1. Définir les gènes du panel immunitaire en fonction de catégories fonctionnelles sélectionnées. On croise les listes DEG avec les gènes du panel immunitaire. Divisez les DEG spécifiques à l’immunité en ensembles à la hausse et à la baisse pour chaque contraste.
  2. Effectuez un enrichissement sur des ensembles de gènes spécifiques à l’immunité.
    1. Appliquer les mêmes procédures d’enrichissement GO et KEGG décrites à l’article 13. Utilisez les mêmes paramètres d’univers et de paramètres en arrière-plan. Sauvegarder les sorties en utilisant des noms de fichiers contenant l’étiquette « immune » pour les distinguer des résultats d’enrichissement global.

15. Générer des diagrammes d’enrichissement (module optionnel)

  1. Résultats d’enrichissement de charge.
    1. Importez les tables d’enrichissement GO ou KEGG depuis les résultats/tables/répertoire.
  2. Transformez les métriques d’enrichissement.
    1. Convertir les valeurs de GeneRatio du format fractionnaire (x/y) en ratios numériques. Calculer −log₁₀ (p-values ajustées) pour la visualisation.
  3. Générez des diagrammes de points.
    1. Tracez le ratio génique sur l’axe des x et les descriptions des termes enrichis sur l’axe des y. Ajustez la taille du point par nombre de gènes et la couleur selon −log₁₀ (valeur p ajustée).
    2. Sélectionnez les termes les plus enrichis en fonction du classement ajusté de la valeur p. Sauvegardez les diagrammes de points sous forme de fichiers PDF et PNG dans le répertoire résultats/figur/.

16. Sauvegarder les informations de la session et finaliser la partie

  1. Exportez les informations de session.
    1. Sauvegardez la sortie sessionInfo() dans les résultats/sessionInfo.txt dans les versions R et paquets du document.
  2. Confirmez la réussite de l’achèvement
    1. Confirmez que le flux de travail généré : Figures dans les résultats/figures/, tableaux dans les résultats/tableaux/.
    2. Confirmez que les trois sorties principales de contraste existent et ne sont pas vides : DESeq2_MB_vs_CB_all_genes.csv, DESeq2_AB_vs_MB_all_genes.csv, DESeq2_AB_vs_CB_all_genes.csv

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Évaluation de la qualité des données et structure transcriptomique mondiale

Les données RNA-seq de 12 échantillons cérébraux (CB, MB, AB ; n = 4 par groupe) ont été traitées selon le flux de travail standardisé. Après avoir filtré les gènes à faible comptage (≥10 comptages totaux), l’ensemble de données a été conservé pour des analyses en aval. L’analyse des composantes principales (PCA) des comptages transformés en rlog a démontré la séparati...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Cette étude présente un flux de travail reproductible basé sur DESeq2 pour l’analyse des données en vrac d’ARN-seq à travers des contrastes biologiques prédéfinis. Le protocole intègre un prétraitement standardisé, une attribution vérifiée de métadonnées, la normalisation, le test d’expression différentielle et des sorties structurées en aval, permettant une génération cohérente et transparente de résultats transcriptomiques. En définissant explicitement les étapes et paramètres analytiq...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs n’ont pas d’intérêts concurrents.

Remerciements

Les auteurs n’ont aucun remerciement.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
clusterProfiler (R package)BioconductorRRID:SCR_016884Analyse d'enrichissement fonctionnel (GO et voies KEGG)
DESeq2 (R package)BioconductorRRID:SCR_015687Analyse d'expression différentielle des données RNA-seq basées sur le comptage
ggplot2 (R package)CRANRRID:SCR_014601Visualisation des tracé de PCA, des tracé volcans et des figures récapitulatives
GitHub (optionnel)GitHub Inc.RRID:SCR_002630Contrôle de version et partage de scripts reproductibles
HTSeq-count RNA-seq dataset (GSE162535)NCBI Gene Expression Omnibus (GEO)RRID:SCR_005012Matrice de comptage RNA-seq en vrac utilisée comme entrée pour l'analyse
matrixStats (R package)CRANRRID:SCR_016361Calcul efficace des statistiques ligne/colonne (par exemple, variance)
openxlsx (R package)CRANRRID:SCR_019215Exportation des tableaux de résultats au format Excel
Système d'exploitationMicrosoft / Apple / LinuxN/AWindows 10+, macOS ou Linux supporté
org.Mm.eg.db (R package)BioconductorRRID:SCR_002815Base de données d'annotation de gènes de souris pour le mappage des identifiants de gènes
Lecteur PDFN'importe quelN/AAffichage des figures de sortie (PCA, heatmaps, tracé volcans)
Ordinateur personnel ou station de travailN'importe quelN/AMinimum 16 Go de RAM recommandé pour l'analyse RNA-seq
pheatmap (R package)CRANRRID:SCR_016418Visualisation en heatmap de l'expression génique et du clustering
R Statistical Software (version ≥ 4.2)R Foundation for Statistical ComputingRRID:SCR_001905Environnement de calcul de base pour toute analyse RNA-seq
RColorBrewer (R package)CRANRRID:SCR_015742Palettes de couleurs pour les heatmaps et les tracé
RStudio DesktopPosit SoftwareRRID:SCR_000432Environnement de développement intégré (IDE) pour le scripting et la reproductibilité
Fichier de métadonnées d'échantillon (format CSV)Généré / annotations GEON/AAnnotation d'échantillons organisée reliant les échantillons aux groupes CB, MB et AB
stringr (R package)CRANRRID:SCR_019195Traitement de chaîne pour la visualisation et le formatage de l'enrichissement
tibble (R package)CRANRRID:SCR_019186Gestion de cadres de données et structures de données ordonnées
tidyverse (suite de packages R)CRANRRID:SCR_019186Manipulation, transformation et visualisation des données

Références

  1. Storm J, Craig AG. Pathogenesis of cerebral malaria—inflammation and cytoadherence. Front Cell Infect Microbiol. 2014;4:100.
  2. Hinduja S, Kunieda M. Modelling of ECM and EDM processes. CIRP Annals. 2013 Jan 1;62(2):775–97.
  3. Soares SMA, Gualberto ACM, da Costa AC, Gonçalves DA, Gameiro J. A high-fat diet protects C57BL/6 mice from Plasmodium berghei ANKA infection in an experimental malaria study. Front Trop Dis. 2023;4:1188902.
  4. Manzoni G, Try R, Guintran JO, Christiansen-Jucht C, Jacoby E, Sovannaroth S, Zhang Z, Banouvong V, Shortus MS, Reyburn R, Chanthavisouk C. Progress towards malaria elimination in the Greater Mekong Subregion: perspectives from the World Health Organization. Malaria Journal. 2024 Mar 1;23(1):64.
  5. Wang Q, Tang Y, Pan Z, Yuan Y, Zou Y, Zhang H, et al. RNA-seq-based transcriptome analysis of the anti-inflammatory effect of artesunate in early treatment of a mouse cerebral malaria model. Mol Omics. 2022;18(8):716–30.
  6. Love MI, Huber W, Anders S. Moderated estimation of fold change and dispersion for RNA-seq data with DESeq2. Genome Biol. 2014;15(12):550.
  7. Anders S, Huber W. Differential expression analysis for sequence count data. Genome Biol. 2010;11(10):R106.
  8. Robinson MD, McCarthy DJ, Smyth GK. edgeR: a Bioconductor package for differential expression analysis of digital gene expression data. bioinformatics. 2010 Jan 1;26(1):139-40.
  9. McCarthy DJ, Chen Y, Smyth GK. Differential expression analysis of multifactor RNA-Seq experiments with respect to biological variation. Nucleic Acids Res. 2012;40(10):4288–97.
  10. Conesa A, Madrigal P, Tarazona S, Gomez-Cabrero D, Cervera A, McPherson A, et al. A survey of best practices for RNA-seq data analysis. Genome Biol. 2016;17:13.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–7.
  12. Hänzelmann S, Castelo R, Guinney J. GSVA: gene set variation analysis for microarray and RNA-seq data. BMC Bioinformatics. 2013 Jan 16;14(1):7.
  13. Shen-Orr SS, Gaujoux R. Computational deconvolution: extracting cell type–specific information from heterogeneous samples. Curr Opin Immunol. 2013;25(5):571–8.
  14. Subramanian A, Tamayo P, Mootha VK, Mukherjee S, Ebert BL, Gillette MA, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545–50.
  15. Stark R, Grzelak M, Hadfield J. RNA sequencing: the teenage years. Nat Rev Genet. 2019;20(11):631–56.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Immunologie et InfectionNuméro 233Numéro 233Valeur videNuméroSéquençage d'ARN globalAnalyse transcriptomiqueneuroinflammationTraitement à l'artésunateExpression différentielle des gènesProfilage des voies immunitaires

Cet article a été publié

Vidéo bientôt disponible