L’étude a été menée conformément à la Déclaration d’Helsinki. Le protocole a été approuvé par le Comité d’éthique du Centre clinique de santé publique de l’Anhui le 19 septembre 2025 (identifiant d’approbation : PJ-YX2025-062). Un consentement éclairé écrit a été obtenu de tous les participants avant la prélèvement sanguin. La cohorte locale comprenait huit patients atteints d’infarctus aigu du myocarde (IAM) et huit témoins sains. Les outils de recherche utilisés dans le protocole sont listés dans le tableau des matériaux.
1. Sources de données et traitement
Des ensembles de données de séquençage d’ARN en vrac liés à l’infarctus du myocarde ont été obtenus à partir du Gene Expression Omnibus (GEO). Les ensembles de données GSE59867 et GSE48060 ont été utilisés pour des analyses transcriptomiques en masse, et le GSE269269 jeu de données de séquençage d’ARN unicellulaire a été utilisé pour des analyses au niveau cellulaire (Tableau 1). Un ensemble de 255 gènes liés à la calmoduline a été obtenu à partir de l’Atlas des protéines humaines pour des analyses ultérieures de l’ensemble de gènes.
| Jeu de données | Type d’échantillon | Échantillon (témoins) | Échantillon (patients) | Plateforme de séquençage |
| GSE59867 | Bulk RNA-seq | 46 | 111 | GPL6244 |
| GSE48060 | Bulk RNA-seq | 21 | 31 | GPL570 |
| GSE269269 | scRNA-seq (sang périphérique) | | 10 | GPL24676 |
Tableau 1 : Caractéristiques des ensembles de données utilisés dans l’étude. Le tableau liste les numéros d’accès aux ensembles de données, les types d’échantillons, le nombre d’échantillons témoins et patients, ainsi que les plateformes de séquençage pour les ensembles de données de séquençage ARN en vrac et ARN unicellulaire. RNA-seq, séquençage d’ARN ; scRNA-seq, séquençage de l’ARN à cellule unique.
La variabilité inter-échantillons dans les ensembles de données transcriptomiques en masse a été corrigée à l’aide de la fonction normalizeBetweenArrays dans le package limma, version 3.60.6. Une analyse différentielle de l’expression génique a ensuite été réalisée à l’aide de limma. Les gènes différenciellement exprimés (DEG) ont été définis en utilisant les seuils P < 0,05 et |log₂ changement de pliage| > 0,5. Les DEG résultants ont été visualisés à l’aide de graphiques volcaniques et cartes thermiques, et classés comme fortement augmentés, fortement à la baisse ou non significativement modifiés.
2. Analyse d’enrichissement d’ensembles géniques à échantillon unique et analyse pondérée du réseau de co-expression génique
L’analyse d’enrichissement de l’ensemble de gènes sur un seul échantillon (ssGSEA) a été réalisée à l’aide des 255 gènes liés à la calmoduline. Le package GSVA a été utilisé pour calculer un score génétique lié à la calmoduline, désigné Calmodulin_score, pour chaque échantillon AMI et témoin. Les différences de Calmodulin_score entre les groupes AMI et témoins ont été évaluées à l’aide du test de somme des rangs de Wilcoxon.
L’analyse pondérée du réseau de co-expression génique (WGCNA) a été réalisée à partir des données transcriptomiques massives de patients atteints d’AMA. Les gènes dont la valeur moyenne des fragments par kilobase de transcrit par million de lectures cartographiées ≤0,5 étaient exclus. Les échantillons ont été regroupés pour identifier et éliminer les valeurs aberrantes.
Une puissance de seuil doux permettant d’obtenir un ajustement topologique sans échelle de R² > 0,8 a été sélectionnée. Une matrice de chevauchement topologique a alors été construite. Les modules géniques ont été identifiés à l’aide de l’algorithme de coupe en arbre dynamique avec une taille minimale de module de 200. Les modules avec des gènes propres très similaires ont été fusionnés en utilisant un seuil de corrélation de >0,75, correspondant à un seuil de fusion de modules de 0,25.
Les relations entre les gènes propres du module et les traits cliniques, y compris Calmodulin_score, ont été évaluées à l’aide d’une analyse de corrélation de Pearson. Les relations module-trait résultantes étaient affichées dans une carte thermique annotée avec des coefficients de corrélation et des valeurs P correspondantes. L’appartenance aux modules et la signification des gènes ont été calculées pour chaque gène. Des schémas de points de l’appartenance aux modules par rapport à la signification génique ont été générés pour identifier des gènes présentant une forte connectivité intramodulaire et une pertinence de traits.
3. Identification des gènes liés à la calmoduline associés à l’AMI
Les gènes liés à la calmoduline associés à l’AMI ont été identifiés en intersectant les DEG avec des gènes issus des modules WGCNA significativement corrélés avec Calmodulin_score. Les gènes qui se chevauchent ont été conservés pour les analyses en aval.
L’analyse d’enrichissement fonctionnel a été réalisée à l’aide du package clusterProfiler. Gene Ontology et Kyoto Encyclopedia of Genes and Genomes annotations ont été utilisées pour identifier les processus biologiques, les fonctions moléculaires, les composants cellulaires et les voies de signalisation associées aux gènes qui se chevauchent.
4. Identification et validation de gènes clés grâce à l’apprentissage automatique
Une analyse de régression logistique univariée a été réalisée en utilisant les gènes qui se chevauchent. Trois algorithmes d’apprentissage automatique ont ensuite été appliqués indépendamment en utilisant les packages et paramètres R suivants : forêt aléatoire, XGBoost et machine à vecteurs de support.
Chaque algorithme a été utilisé pour prioriser des gènes ayant une valeur prédictive pour l’AMI. Les gènes clés candidats ont été définis comme les gènes identifiés par les trois algorithmes. Les gènes qui ont également montré une expression différentielle significative et directionnellement cohérente tant dans le jeu de données d’entraînement GSE59867 que dans le jeu de données externe de validation GSE48060 ont été conservés comme gènes clés finaux.
5. Construction et évaluation de modèles diagnostiques
Un modèle de régression logistique a été construit à partir des gènes clés identifiés et de la fonction lrm. Un nomogramme a été généré à l’aide de la fonction regplot pour afficher la contribution de chaque gène caractéristique à la probabilité prédite d’AMI.
La discrimination du modèle a été évaluée par analyse des caractéristiques de fonctionnement du récepteur à l’aide du package pROC. La surface sous la courbe caractéristique de fonctionnement du récepteur a été calculée pour évaluer la capacité du modèle à distinguer l’AMI des échantillons témoins.
Des courbes d’étalonnage ont été générées pour comparer les probabilités prédites aux résultats observés. Une analyse par courbe de décision a été réalisée pour estimer le bénéfice clinique net du modèle sur une plage de probabilités seuils.
6. Analyse d’enrichissement de l’ensemble génétique et construction de réseaux endogènes d’ARN concurrents
L’analyse d’enrichissement des ensembles géniques a été réalisée séparément pour chaque gène clé en utilisant sa matrice de corrélation génique et le package clusterProfer. Les résultats d’enrichissement des voies des gènes et génomes de Kyoto ont été classés selon le score d’enrichissement absolument normalisé. Les cinq voies les plus bien classées étaient affichées pour chaque gène.
Les associations fonctionnelles et les réseaux d’interactions géniques ont été examinés à l’aide de GeneMANIA. Les régulateurs potentiels des microARN des gènes clés ont été prédits à l’aide de miRanda, miRTarBase, TargetScan et miRDB. Les interactions microARNmm candidates ont été identifiées en croisant les prédictions issues des quatre bases de données.
De longues interactions ARN-microARN non codants ont été obtenues à partir de spongeScan. Les longues relations ARN-microARN et microARN-m non codantes ont ensuite été intégrées pour construire un réseau régulateur endogène concurrent. Le réseau a été visualisé sous forme de diagramme de Sankey utilisant le package ggalluvial.
7. Prédiction des médicaments et amarrage moléculaire
Les interactions médicament-gène ont été prédites à l’aide de la base de données d’interaction médicamente-gène. Le réseau d’interaction résultant a été visualisé à l’aide d’un logiciel d’analyse de réseau.
L’identifiant de la protéine UniProt pour CCL4 a été récupéré sous la forme P13236. La structure protéique tridimensionnelle correspondante a été obtenue au format Protein Data Bank (PDB) sous le numéro d’accession 1HUM (MIP-1β humain, structure de diffraction des rayons X), qui a été sélectionné pour l’amarrage. La chaîne A, représentant le monomère biologiquement pertinent, a été sélectionnée pour l’amarrage. La préparation des protéines a été réalisée à l’aide du module Prepare Protein dans CB-Dock2, ce qui inclut l’élimination des molécules d’eau, l’ajout d’hydrogènes polaires et l’assignation des charges de Gasteiger. Les structures chimiques tridimensionnelles des composés candidats (acide clodronique et époétine alfa) ont été extraites de la base de données PubChem au format Structure-Data File (SDF). Les simulations d’amarrage ont été réalisées en utilisant la plateforme en ligne CB-Dock2, qui utilise l’algorithme AutoDock Vina pour l’amarrage à l’aveugle. Le site d’amarrage était configuré pour couvrir toute la surface protéique afin de permettre une identification impartiale des poches de liaison potentielles. L’affinité de liaison a été calculée comme l’énergie libre de liaison prédite (ΔG) en kcal/mol. Les poses finales d’amarrage et les interactions protéine-ligand (par exemple, liaisons hydrogène, contacts hydrophobes) ont été visualisés à l’aide du visualiseur d’interactions intégré de PyMOL et CB-Dock2.
8. Prétraitement des données de séquençage d’ARN à cellule unique
Le contrôle qualité a été effectué avant l’analyse du séquençage de l’ARN unicellulaire en aval. Les cellules ont été conservées lorsque le nombre de gènes détectés était compris entre 200 et 10 000, le nombre total d’identifiants moléculaires uniques était de ≥1 000, et la proportion de transcrits mitochondriaux était de ≤20 %.
Les cellules exprimant moins de 200 gènes et les gènes détectés dans moins de trois cellules ont été exclues. Ces filtres ont été appliqués pour réduire l’inclusion de cellules de faible qualité et le bruit technique. Les valeurs d’expression génique ont été normalisées à l’aide de la fonction NormalizeData dans le package Seurat. Des gènes très variables ont été identifiés à l’aide de la fonction FindVariableFeatures. Les valeurs d’expression des gènes très variables ont été centrées et standardisées à l’aide de la fonction ScaleData.
Les effets de lot associés à la variation expérimentale ou de séquençage ont été corrigés à l’aide de la fonction RunHarmony du cadre d’intégrationHarmony 17.
9. Réduction de dimensionnalité monocellulaire, regroupement et annotation
L’analyse en composantes principales a d’abord été appliquée pour réduire la dimensionnalité du jeu de données de séquençage de l’ARN à cellule unique. L’approximation et la projection uniformes de variétés, ainsi que l’inclusion stochastique des voisins distribués par t ont ensuite été utilisées pour visualiser l’hétérogénéité cellulaire.
Des cellules transcriptionnellement similaires ont été regroupées à l’aide des fonctions FindNeighbors et FindClusters dans Seurat. Les gènes marqueurs exprimés différemment pour chaque groupe ont été identifiés à l’aide de la fonction FindAllMarkers en comparant chaque groupe avec tous les autres clusters.
Les types cellulaires ont été attribués à l’aide de gènes marqueurs canoniques obtenus à partir de la littérature publiée et des bases de données établies de marqueurs cellulaires. La distribution spatiale et les niveaux d’expression des gènes clés ont été visualisés à l’aide de la fonctionFeaturePlot 18.
10. Analyse quantitative de la réaction en chaîne par polymérase
Des échantillons de sang périphérique ont été prélevés sur 8 patients atteints d’AMI et 8 témoins sains au Centre clinique de santé publique de l’Anhui. Le groupe AMI comprenait des patients diagnostiqués selon la Quatrième Définition universelle de l’infarctus du myocarde, avec des symptômes compatibles avec une ischémie myocarde et des niveaux élevés de troponine I cardiaque au-dessus de la limite supérieure de référence du 99e percentile. Le groupe témoin comprenait des individus en bonne santé appariés selon leur âge et sexe, sans antécédents de maladies cardiovasculaires, avec des électrocardiogrammes normaux et sans anomalies dans les analyses sanguines de routine, la fonction hépatique ou la fonction rénale. Pour les patients atteints d’IMA, 3 mL de sang éthylénédiamine-acide tétraacétique anticoagulant ont été prélevés dans les 24 heures suivant l’hospitalisation. Le même volume a été collecté chez des témoins sains durant la période correspondante de l’étude.
L’ARN total a été isolé à partir du sang périphérique selon le protocole fourni avec le kit d’isolement de l’ARN sanguin. La concentration et la pureté de l’ARN ont été évaluées à l’aide d’un spectrophotomètre NanoDrop, et l’intégrité de l’ARN a été vérifiée par électrophorèse sur gel d’agarose. Seuls des échantillons présentant un rapport A260/A280 compris entre 1,8 et 2,1 ont été utilisés pour les analyses ultérieures. Un total de 500 ng d’ARN ont été rétrotranscrits en ADN complémentaire à l’aide d’un réactif de synthèse complémentaire de l’ADN de premier brin. L’ADN complémentaire résultant a été dilué à une concentration finale de 150 ng/mL. L’amplification quantitative par réaction en chaîne par polymérases a été réalisée sur un volume total de réaction de 10 μL à l’aide d’un mélange maître à base de SYBR Green, sans colorant de référence passif. Toutes les réactions qPCR ont été effectuées deux fois en duplicatas techniques, et les calculs suivants étaient basés sur les valeurs moyennes de Ct.
L’amplification a été réalisée à l’aide d’un instrument de réaction en chaîne de polymérase en temps réel. Les conditions de cyclage consistaient en une dénaturation initiale à 95 °C pendant 5 minutes, suivie de 40 cycles de dénaturation à 95 °C pendant 10 s, un recuit à 60 °C pendant 30 s, et une extension à 72 °C pendant 30 s. L’analyse de la courbe de fusion a été réalisée après amplification.
Les niveaux d’expression génique ont été normalisés en β-actine. L’expression relative a été calculée à l’aide de la méthode 2−ΔΔCt .
11. Analyse statistique
Les analyses statistiques ont été réalisées en R. Les visualisations de réseau ont été générées à l’aide d’un logiciel d’analyse de réseau. Les différences entre les deux groupes ont été évaluées à l’aide du test de Wilcoxon, sauf indication contraire. Les variables continues avec une distribution normale ont été comparées à l’aide du test t de Student. Les variables continues non distribuées anormalement ont été comparées à l’aide du test U de Mann-Whitney, également appelé test de somme de rang de Wilcoxon. Tous les tests statistiques étaient à deux queues. Une valeur P de <0,05 était considérée comme statistiquementsignificative 19.