Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Signature immunitaire liée au stress du réticulum endoplasmique dans la fibrillation auriculaire : apprentissage automatique et transcriptomique unicellulaire

123 vues

DOI :

10.3791/71532

7 août 2026

* These authors contributed equally

Dans cet article

Résumé

Ici, nous présentons un protocole pour identifier les signatures immunitaires liées au stress du réticulum endoplasmique dans la fibrillation auriculaire en intégrant transcriptomique publique en masse, apprentissage automatique, analyse d’infiltration immunitaire et transcriptomique unicellulaire pour la priorisation des biomarqueurs reproductibles et la localisation par type cellulaire.

Résumé

Cette étude décrit un flux de travail computationnel reproductible pour identifier les signatures géniques liées au stress du réticulum endoplasmique (ERS) dans la fibrillation auriculaire (FA) en intégrant transcriptomique en masse, apprentissage automatique, analyse d’infiltration immunitaire et transcriptomique unicellulaire. Des ensembles de données transcriptomiques en masse publics ont été extraits du Gene Expression Omnibus (GEO), suivis d’harmonisation phénotypique, de normalisation, de correction par effet batch et d’analyse d’expression différentielle. L’analyse pondérée du réseau de co-expression génique (WGCNA) a été combinée avec des ensembles de gènes liés à l’ERS pour identifier les gènes candidats associés à l’ERS. Un cadre d’apprentissage automatique multi-algorithmes a ensuite été utilisé pour comparer les stratégies de sélection de caractéristiques et d’ajustement de modèles. Le modèle sélectionné a été évalué dans une cohorte de validation externe indépendante (GSE115574) puis ensuite évalué dans une cohorte supplémentaire (GSE14975), avec une performance discriminatoire quantifiée par analyse de caractéristique opérationnelle du récepteur (ROC) et la zone sous la courbe (AUC). Grâce à ce flux de travail, 22 gènes centraux liés à l’ERS ont été identifiés, et un modèle Elastic Net (Enet) à 18 gènes a montré la performance discriminatoire globale la plus élevée parmi les cohortes d’entraînement et de validation. L’analyse SHapley Additive ExPlanations (SHAP) a mis en lumière la contribution majeure de gènes tels que RPS11, NCF2 et S100A4 à la prédiction des modèles. La déconvolution immunitaire et l’analyse transcriptomique unicellulaire ont davantage cartographié la signature liée au ERS principalement vers la lignée monocyte-macrophage, suggérant son implication potentielle dans le remodelage immunitaire associé à la FA. Ce flux de travail fournit une stratégie reproductible pour relier les signatures transcriptomiques associées à la maladie à des populations cellulaires immunitaires spécifiques et peut être adapté à d’autres contextes pathologiques avec des ensembles de données en vrac et unicellulaires appropriés.

Introduction

La fibrillation auriculaire (FA) est l’arythmie soutenue la plus courante en pratique clinique, caractérisée par un trouble de l’activité électrique dans les oreilles et une perte de fonction mécanique. Elle augmente considérablement les risques d’AVC, d’insuffisance cardiaque et de mortalité toutes causes confondues, devenant un fardeau majeur pour la santé publiquemondiale 1. La prise en charge clinique actuelle de la FA est confrontée à des défis importants : les médicaments antiarythmiques traditionnels ont une efficacité limitée à long terme pour maintenir le rythme sinusal, et leurs effets indésirables, tels que les arythmies et la cardiotoxicité, limitent leur usage continu 2,3. L’ablation par cathéter reste également difficile pour maintenir un rythme sinusal à long terme en cas deFAA 4 persistante. Les nouvelles stratégies de traitement sont actuellement limitées par l’absence de compréhension systématique du paysage moléculaire des mécanismes en amont de la FA, ce qui entrave l’identification et la translation de cibles précises. Des recherches ont montré que la progression pathologique de la FA implique des interactions complexes à travers plusieurs dimensions, incluant le remodelage électrique, structurel et du système nerveux autonome. Parmi celles-ci, la remodelation structurelle auriculaire, centrée sur la fibrose myocardique, est un mécanisme clé pour le maintien de laFA 5,6,7.

Par conséquent, élucider les voies de stress en amont qui favorisent la fibrose est l’une des clés pour surmonter le goulot d’étranglement thérapeutique dans la FA persistante. Des études récentes suggèrent que le stress du réticulum endoplasmique (ERS), un centre régulateur clé permettant aux cellules de faire face aux perturbations intra- et extracellulaires, est une réponse adaptative hautement conservée déclenchée lorsque l’homéostasie du RE est perturbée, entraînant une accumulation excessive de protéines non repliées ou mal repliées dans la lumière du RE. Le RES peut participer au remodelage auriculaire en régulant la protéostasie, le cycle du calcium, les réponses inflammatoires et l’apoptose 8,9. Cependant, les déclencheurs en amont, les molécules effectrices clés et les voies en aval de l’ERS en AF n’ont pas encore été caractérisés de manière systématique, ce qui rend difficile la définition de ses nœuds critiques et des points d’intervention exploitables dans le remodelage auriculaire.

Comparée aux études transcriptomiques traditionnelles en masse, l’intégration multi-omiques peut produire des signaux associés à la maladie au niveau de la population plus robustes. De plus, l’intégration de la transcriptomique unicellulaire permet de disséquer l’hétérogénéité cellulaire et d’identifier les sources cellulaires de ces signaux, cartographiant ainsi les résultats d’association à des types cellulaires spécifiques et à leurs voies d’interaction potentielles. Cela constitue une base pour les enquêtes mécanistes ultérieures et la priorisation des cibles. Dans la présente étude, des ensembles de données transcriptomiques en vrac et transcriptomique unicellulaire liés à la FA ont été extraits de la base de données Gene Expression Omnibus (GEO). Les modules centraux liés à l’ERS ont été identifiés par analyse d’expression différentielle et analyse pondérée du réseau de co-expression génique (WGCNA). En intégrant des analyses monocellulaires, les molécules clés ont été localisées davantage à des types cellulaires spécifiques et à leurs réseaux d’interaction. Collectivement, cette étude vise à délimiter les réseaux clés liés au ERS en AF et leurs associations avec le remodelage structurel, fournissant ainsi une justification pour la découverte de cibles et des stratégies thérapeutiques stratifiées et basées sur les mecanismes.

Comparé à l’analyse différentielle d’expression à un seul ensemble de données ou au criblage de biomarqueurs à algorithme unique, ce flux de travail améliore la robustesse et l’interprétabilité en intégrant la validation intercohorte, la sélection de caractéristiques biologiquement contraintes, la comparaison de modèles multi-algorithmes, la déconvolution immunitaire et la transcriptomique unicellulaire. Ces étapes permettent de prioriser les signatures reproductibles liées au RSA et de localiser les signaux dérivés en masse vers des populations cellulaires immunitaires spécifiques et des réseaux d’interactions. Ce flux de travail convient aux études utilisant des ensembles de données transcriptomiques publiques ou internes avec des groupes de maladies et de témoins bien définis, des sources tissulaires comparables, une taille d’échantillon adéquate et des annotations phénotypiques disponibles. Il est particulièrement utile pour la génération d’hypothèses, la priorisation des biomarqueurs et la localisation par type cellulaire des programmes moléculaires associés à la maladie. Cependant, ses performances dépendent de la qualité du jeu de données, de la cohérence du phénotype et de la correction efficace de l’effet de lot ; Par conséquent, les signatures candidates identifiées par ce flux de travail nécessitent une validation dans des cohortes indépendantes et des modèles expérimentaux avant la traduction clinique. Le flux global de l’étude est illustré à la Figure 1.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Conformément aux Mesures d’examen éthique des sciences de la vie et de la recherche médicale impliquant des sujets humains, promulguées en Chine le 18 février 2023, la recherche utilisant des données publiques peut répondre aux critères d’exemption de l’examen éthique. Cette étude n’a utilisé que des données transcriptomiques secondaires publiques et désidentifiées, et n’a pas impliqué le recrutement de nouveaux participants humains, la collecte d’échantillons humains ni les expériences animales. Par conséquent, une approbation éthique institutionnelle supplémentaire n’était pas nécessaire. Aucune expérience animale n’a été réalisée dans cette étude. Par conséquent, l’approbation du comité institutionnel de soins et d’utilisation des animaux n’était pas applicable.

Sources de données pour les gènes liés au stress du réticulum endoplasmique dans la fibrillation auriculaire
Dans cette étude, des ensembles de données transcriptomiques liées à la FA, accessibles au public, ont été extraits de la base de données GEO, incluant GSE41177, GSE79768, GSE115574, GSE14975 et GSE165838. Des informations détaillées sur les ensembles de données GSE sont fournies dans le Fichier Supplémentaire 1—Tableau Supplémentaire S1. GSE41177 et GSE79768 ont été utilisés pour construire la cohorte intégrée de formation transcriptomique en masse, tandis que GSE115574 et GSE14975 ont été utilisés comme deux cohortes de validation externes indépendantes. GSE165838 était utilisé pour l’analyse transcriptomique unicellulaire. Comme ces ensembles de données ont été générés sur différentes plateformes et peuvent différer par la source tissulaire, le contexte clinique et la composition de l’échantillon, chaque ensemble a été prétraité séparément selon les caractéristiques de sa plateforme avant l’intégration ou la validation. La correction par effet de lot a ensuite été réalisée à l’aide du package sva R pour la cohorte de formation fusionnée. L’ensemble de gènes liés au stress du réticulum endoplasmique a été extrait de la base de données GeneCards avec un score de pertinence ≥ 3 et, après déduplication, a constitué la liste des gènes cibles utilisée dans cette étude.

Analyse des gènes exprimés différemment
Après standardisation et normalisation des données, le limma du package R a été utilisé pour identifier les gènes différenciellement exprimés (DEG) dans l’ensemble d’entraînement intégré. Les DEG ont été définis selon les critères de signification suivants : valeur P ajustée au taux de fausse découverte (adj. P.Val) < 0,05 et |log2FC| > 0,58510. Pour visualiser les schémas d’expression des DEG, des graphiques volcaniques et des cartes thermiques ont été générés à l’aide des packages ggplot2 et pheatmap, respectivement.

Analyse de WGCNA
Pour élucider les mécanismes potentiels de la régulation génique coordonnée, définir les schémas d’association entre les modules de co-expression et les variables de traits cliniques, et identifier les biomarqueurs principaux ou cibles thérapeutiques à potentiel translationnel, WGCNA a été appliqué11.

Un réseau de co-expressions pondérées a été construit en utilisant le paquet WGCNA dans R. La puissance de seuil doux (β) a été sélectionnée selon le critère de topologie sans échelle ; la valeur de β correspondante a été choisie pour les analyses ultérieures lorsque l’indice d’ajustement de topologie sans échelle (R2) a atteint et est resté au-dessus de 0,8512. Lors de l’identification des modules, les paramètres liés à la coupe dynamique de l’arbre et à la sensibilité à la détection des modules ont été optimisés pour améliorer la résolution et la stabilité des limites des modules. Enfin, des modules significativement associés au trait cible ont été extraits, et des gènes hubs intramodulaires ont été identifiés comme ensembles de gènes candidats pour des analyses en aval.

Analyse d’enrichissement des DEG liées à la FA.
Pour identifier précisément les gènes centrals, les DEG ont d’abord été croisés avec des gènes des modules clés du WGCNA afin de définir un ensemble de gènes impliqués dans la pathogenèse de la FA. Ensuite, cet ensemble de gènes AF a été ensuite croisé avec des gènes liés à l’ERS, et les gènes qui se chevauchent ont été conservés pour des analyses ultérieures.

L’enrichissement fonctionnel des gènes criblés a été évalué à l’aide des analyses de Gene Ontology (GO) et de la Kyoto Encyclopedia of Genes and Genomes (KEGG). Les termes GO ont été analysés avec le cluster Profiler du package R pour résumer l’enrichissement à travers les catégories13 de processus biologique (BP), de composante cellulaire (CC) et de fonction moléculaire (MF). L’analyse KEGG a ensuite été utilisée pour identifier les voies enrichies associées aux gènescibles 14. Les résultats d’enrichissement avec une valeur P ajustée < 0,05 ont été considérés comme statistiquement significatifs. Les termes GO principaux et les voies KEGG étaient affichés sous forme de diagrammes en barres et de bulles à l’aide de ggplot2.

Analyse des interactions protéine-protéine (IPP)
L’analyse IPP a été réalisée en téléchargeant l’ensemble de gènes intersectés dans la base de données STRING, l’organisme étant limité à Homo sapiens. Les nœuds déconnectés ont été supprimés et les interactions ont été récupérées en utilisant un seuil de score de confiance moyen (score combiné ≥ 0,4). Le réseau PPI résultant a ensuite été importé dans un outil de visualisation et d’analyse réseau pour l’analyse topologique afin d’identifier les nœuds clés.

Construction d’un modèle candidat de classification AF-ERS basé sur 12 algorithmes d’apprentissage automatique
Dans cette étude, un cadre de classification d’ensemble basé sur douze algorithmes conventionnels d’apprentissage automatique a été développé pour dépister les gènes de signature candidats liés à l’ERS associés à la FA et optimiser la performance de classification. Pour le partitionnement des données, après standardisation et normalisation, GSE41177 et GSE79768 ont été fusionnés pour générer la matrice d’expression de cohorte d’entraînement. GSE115574 a été utilisé comme une cohorte externe de validation indépendante pour évaluer la généralisabilité du modèle. Plus précisément, les DEG ont été identifiés pour la première fois dans la cohorte d’entraînement (|log2FC| >0,585, ajusté p < 0,05). Ces DEG ont ensuite été croisés avec des gènes des modules clés WGCNA et des gènes liés à l’ERS, et l’ensemble de gènes résultant a été utilisé comme caractéristiques d’entrée pour la construction du modèle.

Pour relier les gènes liés à l’ERS au phénotype AF, un modèle de classification candidat a été développé à l’aide de 12 approches d’apprentissage automatique : Lasso, Ridge, modèle linéaire généralisé par étapes (Stepglm), augmentation du gradient extrême (XGBoost), forêt aléatoire (RF), filet élastique (Enet), régression partielle des moindres carrés pour les modèles linéaires généralisés (plsRglm), modélisation généralisée de régression boostée (GBM), Bayes naïve, analyse discriminante linéaire (LDA), glmBoost, et machine à vecteurs de support (SVM). Une stratégie systématique de modélisation combinatoire a été adoptée en ajoutant un second algorithme au premier et en les intégrant via le paramètre d’ajustement α, obtenant 113 combinaisons de sélection de caractéristiques et d’ajustement de modèle qui ont été évaluées de manière exhaustive. La discrimination du modèle a été évaluée en calculant la surface sous la courbe caractéristique de fonctionnement du récepteur (AUC). Selon les critères de sélection du modèle précédemment rapportés, le cadre final du candidat a été défini comme le modèle ayant la meilleure performance globale, tel qu’évalué par la moyenne de l’AUC à travers les cohortes de formation et de validation.

Cette stratégie de modélisation combinatoire a été informée par des études antérieures en apprentissage automatiquebiomédical 15,16,17. Collectivement, ces études indiquent qu’aucun algorithme ne surpasse systématiquement les autres à travers les ensembles de données et les tâches analytiques. Sur la base de cette prémisse, adopter un cadre d’apprentissage d’ensemble et de modélisation combinatoire peut augmenter la probabilité d’obtenir un modèle candidat performant avec une généralisabilité plus stable et améliorer la robustesse de la sélection du modèle.

Par la suite, des valeurs SHapley Additive ExPlanations (SHAP) ont été appliquées pour interpréter le modèle d’apprentissage automatique en visualisant les caractéristiques clés à l’origine de la classification AF, quantifiant ainsi la contribution de chaque caractéristique au résultat prédit et illustrant comment les gènes de signature individuels influencent la sortie finaledu modèle 18.

Évaluation des performances du modèle et validation externe du modèle optimal
La performance du modèle optimal a été évaluée dans la cohorte d’entraînement et dans la cohorte externe indépendante de validation (GSE115574). Au niveau du modèle, une matrice de confusion a été construite à partir des labels de classes prédits, et les métriques de classification correspondantes ont été rapportées. Les courbes caractéristiques de fonctionnement du récepteur (ROC) étaient générées à l’aide du package R pROC, et l’AUC était calculé pour quantifier la performance discriminative.

Au niveau des biomarqueurs, des courbes ROC monogènes ont été tracées pour chaque gène clé du modèle optimal, et les AUC correspondants ont été calculés pour évaluer leur capacité discriminatoire individuelle. De plus, l’expression différentielle des gènes clés a été résumée à l’aide d’un graphique volcanique, et des diagrammes en boîte ont été utilisés pour représenter leur répartition d’expression dans des échantillons de maladies par rapport à ceux des échantillons sains. Pour évaluer davantage la généralisabilité de la signature génique optimale précédemment définie par le modèle, une validation externe indépendante supplémentaire a été réalisée à l’aide de GSE14975. GSE14975 contient des données transcriptomiques provenant d’échantillons d’appendice auriculaire gauche, incluant cinq échantillons de fibrillation auriculaire et cinq échantillons de rythme sinusal/contrôle. Tous les gènes inclus dans la signature verrouillée étaient disponibles dans ce jeu de données. Pour maintenir la cohérence avec le flux de travail analytique croisé d’origine des cohortes, la cohorte de développement et les GSE14975 ont été harmonisées en utilisant ComBat avec la source du jeu de données comme variable batch. Cette harmonisation était réalisée de manière non supervisée. Il est important de noter que les étiquettes maladie/contrôle de GSE14975 n’ont pas été utilisées pour la sélection des caractéristiques, l’estimation des coefficients, la détermination du seuil ou l’ajustement des hyperparamètres.

Le modèle de notation dérivé du modèle optimal a été ajusté uniquement en utilisant la cohorte de développement, puis appliqué à GSE14975 pour validation externe. La performance du modèle en GSE14975 a été évaluée à l’aide de l’analyse de la courbe caractéristique de fonctionnement du récepteur, de la surface sous la courbe, de l’intervalle de confiance (IC) à 95 %, de la sensibilité, de la spécificité, de la précision, des valeurs prédictives positives et négatives, ainsi que du score Brier. De plus, des courbes ROC sur un seul gène ont été générées pour tous les gènes optimaux dérivés du modèle en GSE14975 afin d’illustrer leur capacité individuelle à discriminer. Pour évaluer davantage le surapprentissage potentiel dans la cohorte de développement, des validations croisées répétées 10 fois et une correction d’optimisme bootstrap ont été réalisées à l’aide de la signature génique dérivée du modèle optimal verrouillé. Pour une validation croisée répétée, la cohorte de développement a été partitionnée en 10 parties, et la discrimination des modèles a été résumée à travers toutes les itérations. Pour la validation bootstrap, 1 000 rééchantillons bootstrap ont été générés pour estimer l’optimisme de la performance apparente de l’ensemble de développement et calculer l’AUC corrigé par optimisme. Comme la signature finale a été dérivée du modèle optimal, la contribution de chaque gène a été interprétée principalement en fonction de la magnitude absolue et de la direction des coefficients du modèle. De plus, des analyses ROC sur un seul gène ont été réalisées en GSE14975 pour illustrer la capacité discriminatoire individuelle de chaque gène composant. À des fins de visualisation, les courbes ROC monogènes étaient orientées pour refléter la capacité discriminatoire, que l’expression soit plus élevée ou plus faible associée à la FA.

Analyse d’enrichissement d’ensembles de gènes (GSEA)
Pour explorer les implications fonctionnelles des gènes clés, la GSEA a été réalisée à partir d’échantillons du groupe de maladies19. Pour chaque gène clé, les échantillons ont été stratifiés en sous-groupes à haute et basse expression en utilisant la valeur médiane d’expression dans le groupe de la maladie comme seuil. La différence d’expression moyenne entre les deux sous-groupes pour chaque gène a été calculée, et une liste de gènes classée a été générée par ordre décroissant comme entrée pour l’analyse d’enrichissement. GSEA a été réalisé à l’aide du cluster Profile du package R, avec des ensembles de gènes obtenus à partir de la collection MSigDB c2.cp.kegg.Hs.symbols.gmt. La signification statistique a été définie comme p < 0,05. La direction de l’enrichissement a été déterminée par le signe du score d’enrichissement normalisé (NES), et des graphiques d’enrichissement ont été générés pour les voies représentatives.

Évaluation de l’abondance des sous-types cellulaires immunitaires et de l’expression différentielle
L’algorithme de déconvolution CIBERSORT a été appliqué pour estimer l’abondance relative des sous-ensembles de cellules immunitaires infiltrantes et leurs interrelations entre échantillons. Sur la base de la matrice de signature leucocytaire LM22, la composition des cellules immunitaires a été inférée quantitativement à partir des profils d’expression génique à l’aide du package RCIBERSORT 20. Un seuil de p < 0,05 a été utilisé pour filtrer les résultats, et seuls les échantillons remplissant ce critère ont été conservés pour les analyses ultérieures. Des diagrammes en boîte ont été générés pour comparer les fractions relatives estimées des sous-ensembles des cellules immunitaires entre les groupes AF et témoins. De plus, l’analyse de corrélation de Spearman a été réalisée pour évaluer les associations entre les niveaux d’infiltration des cellules immunitaires et l’expression des gènes centrals.

Analyse à cellule unique
L’analyse transcriptomique unicellulaire a été réalisée à l’aide du jeu de données GEO GSE165838. Les matrices brutes de comptage des gènes et cellules ont été importées dans R et traitées à l’aide de Seurat v4.4.0. Pour chaque échantillon, un objet Seurat a été généré en utilisant CreateSeuratObject avec min.cells = 5 et min.features = 300. Des indicateurs de contrôle qualité, incluant le nombre de gènes détectés, le nombre total d’identifiants moléculaires uniques (UMI), le pourcentage de gènes mitochondriaux, le pourcentage de gènes ribosomiaux et le pourcentage de gènes d’hémoglobine, ont été calculés pour chaque cellule. Les cellules étaient conservées si elles avaient plus de 500 gènes détectés, moins de 5 000 dénombres d’UMI, un pourcentage de gènes mitochondriaux < 25 %, un pourcentage de gènes ribosomiaux > 3 %, et un pourcentage de gènes d’hémoglobine < 1 %. Les gènes détectés dans moins de trois cellules ont été retirés. MALAT1 et les gènes mitochondriaux ont également été exclus avant analyse en aval. DoubletFinder était utilisé pour détecter et exclure les doublets potentiels. En résumé, les cellules ont été séparées par identité d’échantillon, et la détection des doublets a été réalisée séparément pour chaque échantillon en utilisant les composantes principales 1 à 30.

Le paramètre pN était fixé à 0,25, et la valeur pK optimale était sélectionnée selon la métrique BC maximale obtenue par le balayage des paramètres. Le taux de doubles taux attendu a été estimé en fonction du nombre de cellules récupérées dans chaque échantillon, avec des taux de 2,5 %, 5 % et 6,5 % utilisés pour des échantillons présentant respectivement des nombres cellulaires relativement faibles, intermédiaires et élevés. Seules les cellules classées comme singlets ont été conservées. La contamination à l’ARN ambiant a été ensuite estimée à l’aide de DecontX, et les cellules présentant un score de contamination ≥ 0,2 ont été exclues. Après contrôle qualité, retrait des doublets et filtrage de l’ARN ambiant, 40 886 cellules et 23 947 gènes ont été conservés pour une analyse en aval. L’ensemble de données filtré d’une seule cellule a été normalisé avec la méthode LogNormalize en utilisant un facteur d’échelle de 10 000, suivi de l’identification de gènes très variables. Les données ont ensuite été mises à l’échelle avant analyse des composantes principales.

Pour réduire les effets batch spécifiques à chaque échantillon, Harmony a été appliqué en utilisant orig.ident comme variable batch. La visualisation par approximation et projection uniforme de variété (UMAP) et la construction du graphe du plus proche voisin ont été réalisées en utilisant les 15 premières dimensions corrigéespar Harmony 21. Le clustering a été réalisé à l’aide de l’algorithme de Louvain, et plusieurs résolutions de clustering ont été évaluées. L’annotation finale majeure de type de cellule était basée sur le résultat de regroupement à la résolution 0,05. Les groupes cellulaires étaient annotés manuellement selon l’expression canonique des marqueurs géniques. Cette stratégie d’annotation basée sur des marqueurs est cohérente avec les études antérieures de profilage immunitaireunicellulaire 22. Les lymphocytes T ont été identifiés par CD3D, CD3E et TRAC ; des cellules tueuses naturelles (NK) par NKG7, GNLY, NCAM1 et KLRG1 ; cellules monocytes-macrophages par LYZ, CD14, FCGR3A, CD68, CD163, FCN1, TYROBP, S100A8 et S100A9 ; les cellules B par MS4A1 et CD79A ; des plasmocytes par MZB1 et XBP1 ; les cellules endothéliales par PECAM1, VWF et CDH5 ; des cellules musculaires lisses vasculaires par ACTA2, TAGLN, MYH11 et MYL9 ; les fibroblastes par DCN, LUM, COL1A1, COL1A2 et PDGFRA ; des cellules neutrophiles par FCGR3B, CXCR2, S100A8 et MPO ; les mastocytes par TPSB2 ; et les cellules dendritiques par LILRA4, CD1C et XCR1. L’expression des marqueurs et des gènes à travers les clusters a été visualisée à l’aide de diagrammes de points, et la distribution d’expression des gènes centraux finaux liés à l’ERS a été visualisée sur des embeddings UMAP.

Pour quantifier l’activité transcriptionnelle liée à l’ERS au niveau d’une seule cellule, l’ensemble final de gènes hub a été utilisé pour calculer les scores de signature cellulaires à l’aide de AUCell, de l’analyse d’enrichissement d’un ensemble de gènes à échantillon unique, et du Seurat AddModuleScore. Pour AUCell, les classements cellulaires ont été construits à partir de la matrice d’expression d’ARN normalisée, et les scores AUC ont été calculés à l’aide de l’ensemble du gène hub, avec les 10 % des gènes classés comme seuil maximal de classement. Pour ssGSEA, les scores d’enrichissement ont été calculés à l’aide du package GSVA. Les trois sorties de notation ont été centrées et mises à l’échelle, puis normalisées au minimum, et enfin additionnées pour générer un score composite intégré lié à l’ERS pour chaque cellule. La distribution du score composite a été comparée entre les populations cellulaires annotées afin d’évaluer l’hétérogénéité des types cellulaires du programme lié à l’ERS. Parce que la lignée monocyte-macrophage présentait un enrichissement prononcé de signature liée au ERS et était étroitement associée au remodelage immunitaire-inflammatoire, elle a été sélectionnée pour des analyses ultérieures au sein de la lignée. Les cellules monocytes-macrophages ont été divisées en groupes à score élevé et faible selon le score composite médian lié au ERS. Une analyse de trajectoire pseudo-temporelle a ensuite été réalisée sur des cellules monocytes-macrophages à l’aide de Monocle.

Pour l’analyse pseudo-temps, un objet CellDataSet a été créé à partir de la matrice de comptage brute à l’aide d’un modèle d’expression binomiale négative. Les facteurs de taille et les dispersions ont ensuite été estimés. Les gènes d’ordre ont été sélectionnés en utilisant un seuil d’expression moyen de ≥ 0,1 et une dispersion empirique supérieure à la dispersion adaptée. La dimensionnalité a été réduite avec l’algorithme DDRTree, et les cellules ont été ordonnées selon la trajectoire inférée. Les schémas d’expression dynamiques des gènes hubs liés au ERS sur le pseudo-temps ont été visualisés. Une analyse de communication cellulaire a été réalisée à l’aide de CellChat pour explorer les interactions potentielles ligand-récepteur impliquant des cellules monocyte-macrophage présentant différents scores liés au ERS. Pour cette analyse, les cellules monocytes-macrophages ont été marquées comme étant de score élevé ou faible selon le score composite médian, tandis que d’autres cellules ont conservé leurs marques de type cellulaire d’origine. La matrice d’expression de l’ARN normalisée et les annotations correspondantes par groupes cellulaires ont été utilisées pour créer l’objet CellChat. Pour l’analyse de la communication cellulaire-cellule, la base de données humaine CellChatDB a été sélectionnée, et seules les interactions de signalisation sécrétées ont été évaluées. Des gènes surexprimés et des paires ligand-récepteur ont été détectés avant le calcul des probabilités de communication. Les groupes cellulaires contenant moins de 10 cellules ont été exclus de l’analyse d’interaction. Les probabilités de communication au niveau des voies ont ensuite été estimées et agrégées pour comparer le nombre et la force des interactions entre populations cellulaires. Pour faciliter la reproductibilité, une table de points de contrôle est fournie ci-dessous, reliant chaque étape du protocole à sa figure ou tableau de sortie attendu correspondant (Fichier Supplémentaire 1—Tableau Supplémentaire S2).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Identification de gènes exprimés différemment dans la FA
Pour améliorer la comparabilité entre cohortes, deux ensembles de données transcriptomiques liés à la FA (GSE41177 et GSE79768) ont été intégrés, et les effets de lot ont été corrigés sur la matrice d’expression fusionnée. La figure 2A,B présente des diagrammes de boxplots des distributions globales d’expression avant et après la correction par effet de lot, qui ont...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Cette étude a intégré des transcriptomes en vrac et unicellulaires pour étudier le rôle du ERS dans la FA. Une signature génique liée à l’ERS avec une discrimination favorable entre cohortes croisées a été établie, et ces signaux ont été principalement mappés vers la lignée monocyte-macrophage et étaient associés à une communication intercellulaire étendue. Collectivement, les résultats suggèrent que les programmes associés au ERS sont associés à un remodelage centré sur les cellules imm...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs ne rapportent aucun conflit d’intérêts dans ce travail. Lors de la révision de ce manuscrit, ChatGPT d’OpenAI a été utilisé uniquement pour aider au polissage de la langue anglaise. Les auteurs ont examiné, vérifié et édité tout le texte assisté par l’IA et assument l’entière responsabilité de l’exactitude et de l’intégrité du manuscrit final. Aucun outil assisté par l’IA n’a été utilisé pour générer des idées de recherche, analyser les données, interpréter les résultats, créer des figures ou des tableaux, ou tirer des conclusions scientifiques. Le travail rapporté dans l’article a été réalisé par les auteurs. F.T., PR. W : Rédaction - brouillon original, logiciel, méthodologie, visualisation, validation et curation des données. SY. T : Investigation et méthodologie. FF. B : Supervision. QR. L : Supervision, méthodologie, curation des données. XY. J, YX. X : Recherche de littérature et interprétation des données.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
AddModuleScoreFonction Seuratversion 4.4.0NA
AUCellBioconductorversion 1.32.0RRID:SCR_021327
caretCRANversion 7.0.1RRID:SCR_022524
celda / decontXBioconductorversion 1.24.0NA
CellChatGitHub / CellChatversion 2.2.0RRID:SCR_021946
CIBERSORT / LM22 signature matrixCIBERSORTLM22NA
clusterProfilerBioconductorversion 4.12.6RRID:SCR_016884
CytoscapeConsortium Cytoscapeversion 3.10RRID:SCR_003032
DoubletFinderGitHub / McGinnis Labversion 2.0.4NA
e1071CRANversion 1.7.16NA
gbmCRANversion 2.2.2NA
Gene Expression Omnibus (GEO) databaseNational Center for Biotechnology Information (NCBI)GSE41177NA
Gene Expression Omnibus (GEO) databaseNCBIGSE79768NA
Gene Expression Omnibus (GEO) databaseNCBIGSE115574NA
Gene Expression Omnibus (GEO) databaseNCBIGSE14975NA
Gene Expression Omnibus (GEO) databaseNCBIGSE165838NA
glmnetCRANversion 4.1.8NA
HarmonyCRANversion 1.2.4NA
limmaBioconductorversion 3.60.6RRID:SCR_010943
MASSCRANversion 7.3.61NA
mboostCRANversion 2.9.11NA
MonocleBioconductorversion 2.38.0RRID:SCR_016339
org.Hs.eg.dbBioconductorversion 3.19.1NA
plsRglmCRANversion 1.5.1NA
pROCCRANversion 1.18.5RRID:SCR_024286
R statistical softwareR Foundation for Statistical Computingversion 4.4.2RRID:SCR_001905
randomForestCRANversion 4.7.1.2RRID:SCR_015718
RStudioPosit Software, PBCversion 2024.4.1.748RRID:SCR_000432
SeuratCRAN / Satija Labversion 4.4.0RRID:SCR_016341
shapvizCRANversion 0.10.2NA
svaBioconductorversion 3.52.0NA
WGCNACRANversion 1.73RRID:SCR_003302
xgboostCRANversion 1.7.8.1NA

Références

  1. Saleh K, Haldar S. Atrial fibrillation: a contemporary update. Clin Med (Lond). 2023;23(5):437-41.
  2. Lemme M, et al. Atrial-like engineered heart tissue: an in vitro model of the human atrium. Stem Cell Reports. 2018;11(6):1378-90.
  3. van Gorp PRR, Trines SA, Pijnappels DA, de Vries AAF. Multicellular in vitro models of cardiac arrhythmias: focus on atrial fibrillation. Front Cardiovasc Med. 2020;7:43.
  4. Scherr D, et al. Five-year outcome of catheter ablation of persistent atrial fibrillation using termination of atrial fibrillation as a procedural endpoint. Circ Arrhythm Electrophysiol. 2015;8(1):18-24.
  5. Staerk L, et al. Atrial fibrillation: epidemiology, pathophysiology, and clinical outcomes. Circ Res. 2017;120(9):1501-17.
  6. Schotten U, Verheule S, Kirchhof P, Goette A. Pathophysiological mechanisms of atrial fibrillation: a translational appraisal. Physiol Rev. 2011;91(1):265-325.
  7. Van Wagoner DR, Chung MK. Inflammation, inflammasome activation, and atrial fibrillation. Circulation. 2018;138(20):2243-6.
  8. Yuan M, et al. IP3R1/GRP75/VDAC1 complex mediates endoplasmic reticulum stress-mitochondrial oxidative stress in diabetic atrial remodeling. Redox Biol. 2022;52:102289.
  9. Wang M, Kaufman RJ. Protein misfolding in the endoplasmic reticulum as a conduit to human disease. Nature. 2016;529(7586):326-35.
  10. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47.
  11. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559.
  12. Hu H, et al. Dissection of metabolome and transcriptome: insights into capsaicin and flavonoid accumulation in two typical Yunnan Xiaomila fruits. Int J Mol Sci. 2024;25(14):7761.
  13. Chen GY, et al. Integrating network pharmacology and experimental validation to explore the key mechanism of Gubitong Recipe in the treatment of osteoarthritis. Comput Math Methods Med. 2022;2022:7858925.
  14. Chen GY, et al. Prediction of Rhizoma Drynariae targets in the treatment of osteoarthritis based on network pharmacology and experimental verification. Evid Based Complement Alternat Med. 2021;2021:5233462.
  15. Díaz-Uriarte R, Alvarez de Andrés S. Gene selection and classification of microarray data using random forest. BMC Bioinformatics. 2006;7:3.
  16. Saeys Y, Inza I, Larrañaga P. A review of feature selection techniques in bioinformatics. Bioinformatics. 2007;23(19):2507-17.
  17. Statnikov A, Wang L, Aliferis CF. A comprehensive comparison of random forests and support vector machines for microarray-based cancer classification. BMC Bioinformatics. 2008;9:319.
  18. Liu H, et al. Unraveling diethyl phthalate-induced prostate carcinogenesis: core targets revealed by integrated network toxicology, machine learning, and structural validation. Hum Genomics. 2025;19(1):149.
  19. Subramanian A, et al. Gene set enrichment analysis: a knowledge-based approach for interpreting genome-wide expression profiles. Proc Natl Acad Sci U S A. 2005;102(43):15545-50.
  20. Newman AM, et al. Robust enumeration of cell subsets from tissue expression profiles. Nat Methods. 2015;12(5):453-7.
  21. Xu H, et al. Single-cell transcriptomics reveals CCL3+ classical monocyte subset linked to autoimmune pathogenesis. J Inflamm Res. 2025;18:16273-91.
  22. Wang Y, et al. Immunological profiling of rheumatoid factor-positive primary Sjögren’s syndrome by single-cell RNA sequencing. Front Immunol. 2026;17:1822615.
  23. Wiersma M, et al. Endoplasmic reticulum stress is associated with autophagy and cardiomyocyte remodeling in experimental and human atrial fibrillation. J Am Heart Assoc. 2017;6(10):e006458.
  24. Hu HJ, et al. Hydrogen sulfide ameliorates angiotensin II-induced atrial fibrosis progression to atrial fibrillation through inhibition of the Warburg effect and endoplasmic reticulum stress. Front Pharmacol. 2021;12:690371.
  25. Liu Y, et al. Integrative transcriptomic, proteomic, and machine learning approach to identifying feature genes of atrial fibrillation using atrial samples from patients with valvular heart disease. BMC Cardiovasc Disord. 2021;21(1):52.
  26. Fu S, et al. Using integrative bioinformatics approaches and machine-learning strategies to identify potential signatures for atrial fibrillation. Int J Cardiol Heart Vasc. 2025;56:101592.
  27. Wu S, et al. Multiplex proteomics identifies inflammation-related plasma biomarkers for aging and cardio-metabolic disorders. Clin Proteomics. 2024;21(1):30.
  28. Xie Z, et al. Identification and verification of biomarkers and immune infiltration in obesity-related atrial fibrillation. Biology (Basel). 2023;12(1):121.
  29. Huo TM, Wang ZW. Comprehensive analysis to identify key genes involved in advanced atherosclerosis. Dis Markers. 2021;2021:4026604.
  30. Chen M, et al. Weighted gene co-expression network analysis identifies crucial genes mediating progression of carotid plaque. Front Physiol. 2021;12:601952.
  31. Wang S, et al. S100A8/A9 in inflammation. Front Immunol. 2018;9:1298.
  32. Wang Q, et al. Myeloid-specific S100A8/A9 deficiency attenuates atrial fibrillation through prevention of TLR4/NF-κB-mediated immune cell recruitment and inflammation. Front Immunol. 2025;16:1623486.
  33. Wu CL, Yin R, Wang SN, Ying R. A review of CXCL1 in cardiac fibrosis. Front Cardiovasc Med. 2021;8:674498.
  34. Zhang YF, et al. CXCR4 and TYROBP mediate the development of atrial fibrillation via inflammation. J Cell Mol Med. 2022;26(12):3557-67.
  35. Hulsmans M, et al. Recruited macrophages elicit atrial fibrillation. Science. 2023;381(6654):231-9.
  36. van der Net JB, et al. Arachidonate 5-lipoxygenase-activating protein gene and coronary heart disease risk in familial hypercholesterolemia. Atherosclerosis. 2009;203(2):472-8.
  37. Ye X, et al. ALOX5AP predicts poor prognosis by enhancing M2 macrophage polarization and immunosuppression in serous ovarian cancer microenvironment. Front Oncol. 2021;11:675104.
  38. Song P, Deng H, Liu Y, Zhang M. Integrated bioinformatics analysis and experimental validation reveal the relationship between ALOX5AP and the prognosis and immune microenvironment in glioma. BMC Med Genomics. 2024;17(1):218.
  39. Chen S, Tang L, Guillot A, Liu H. Bariatric surgery associates with nonalcoholic steatohepatitis/hepatocellular carcinoma amelioration via SPP1 suppression. Metabolites. 2023;13(1):11.
  40. Ji H, et al. Integrated genomic, transcriptomic, and epigenetic analyses identify a leukotriene synthesis-related M2 macrophage gene signature that predicts prognosis and treatment vulnerability in gliomas. Front Immunol. 2022;13:970702.
  41. Sirish P, et al. The critical roles of proteostasis and endoplasmic reticulum stress in atrial fibrillation. Front Physiol. 2021;12:793171.
  42. Sun Z, et al. Cross-talk between macrophages and atrial myocytes in atrial fibrillation. Basic Res Cardiol. 2016;111(6):63.
  43. Schall TJ, Proudfoot AEI. Overcoming hurdles in developing successful drugs targeting chemokine receptors. Nat Rev Immunol. 2011;11(5):355-63.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

MédecineNuméro 234Numéro 234Valeur videNuméroAnalyse sur cellule uniqueAnalyse SHAP