Les ensembles de données publiques du Gene Expression Omnibus (GEO) analysés dans cette étude contenaient des données transcriptomiques dé-identifiées provenant d'études précédemment publiées et n'ont pas nécessité d'approbation éthique supplémentaire. Le comité d'éthique de l'Université Huaihua a approuvé l'étude indépendante de validation par transcription inverse quantitative en temps réel (qRT-PCR) sur des tissus pulmonaires humains (numéro d'approbation : 2024(A05112)). Un consentement éclairé écrit a été obtenu auprès de tous les participants ou de leurs représentants légalement habilités avant le prélèvement des échantillons. Les procédures d'approbation et de consentement se sont appliquées à l'ensemble des 20 échantillons de tissus pulmonaires provenant de patients atteints d'hypertension artérielle pulmonaire (PAH) et des 20 échantillons témoins inclus dans la validation par qRT-PCR. Les outils de recherche utilisés pour ce protocole sont répertoriés dans le Tableau des matériaux.
1. Collecte et prétraitement des jeux de données transcriptomiques publics
Les jeux de données de puces à ADN liés à l'hypertension pulmonaire (PH) GSE22356, GSE33463 et GSE48149 ont été obtenus à partir de la base de données GEO. Les échantillons de PH/hypertension artérielle pulmonaire (PAH) et les échantillons témoins ont été extraits selon les annotations phénotypiques d'origine. Les matrices d'expression et les fichiers d'annotation de la plateforme ont été téléchargés à l'aide de scripts R reproductibles et du package GEOquery.
L'annotation des sondes et la correspondance des symboles génétiques ont été effectuées de manière cohérente pour l'ensemble des jeux de données. Lorsque plusieurs sondes correspondaient au même gène, la valeur moyenne d'expression a été calculée. Une normalisation par quantiles a été appliquée, et les gènes présentant une faible expression ou une faible variance ont été éliminés. Les jeux de données ont été fusionnés, et les effets de lot ont été corrigés à l'aide de l'algorithme ComBat du package sva8. La correction a été évaluée à l'aide de boîtes à moustaches et d'une analyse en composantes principales.
2. Identification des gènes différentiellement exprimés
Le package limma a été utilisé pour comparer les niveaux d'expression entre les échantillons de PH et les échantillons témoins dans la matrice d'expression corrigée par lot9Un modèle linéaire a été ajusté et des statistiques de Bayes empirique ont été appliquées. Les gènes différentiellement exprimés ont été définis à l'aide d'une valeur seuil ajustée P valeur <0,05 et un changement de l'expression différentielle absolu en échelle log2 > 0,585. Les résultats ont été visualisés à l'aide de diagrammes en volcan et de cartes thermiques.
3. Construction d'un réseau de co-expression génique pondéré
Un réseau de co-expression génique pondéré a été construit à l'aide du package WGCNA10. Un regroupement des échantillons a été effectué afin de détecter les valeurs aberrantes. La puissance de seuil doux a été choisie en fonction de l'indice d'ajustement à la topologie sans échelle. Les modules géniques ont été identifiés à l'aide de l'algorithme de découpage dynamique de l'arbre. Les eigengènes des modules ont été corrélés au phénotype HP, et le module associé à la maladie présentant la corrélation la plus forte a été sélectionné. Les gènes du module clé ont été croisés avec les gènes différentiellement exprimés afin d'obtenir les gènes consensus.
4. Analyse d'enrichissement fonctionnel
Les catégories biologiques du Gene Ontology, concernant le processus biologique, le composant cellulaire et la fonction moléculaire, ont été analysées à l'aide de clusterProfiler11. Une analyse d'enrichissement des voies du Kyoto Encyclopedia of Genes and Genomes a été réalisée afin d'identifier les voies de signalisation12. Une valeur de P < 0,05 et une valeur de q < 0,2 ont été utilisées comme seuils d'enrichissement, et les termes enrichis ont été visualisés à l'aide de graphiques en bulles11.
5. Construction du réseau d'interactions protéine-protéine et identification des gènes centraux
La liste de gènes consensus a été soumise à la base de données STRING, avec Homo sapiens sélectionné comme espèce et un seuil de confiance d'interaction > 0,413. Le fichier d'interactions a été importé dans Cytoscape, et le plug-in CytoHubba a été utilisé pour classer les gènes selon leur degré de nœud. Les gènes fortement connectés ont été définis comme des gènes centraux.
6. Sélection de gènes caractéristiques diagnostiques à l'aide de l'apprentissage automatique
Trois algorithmes indépendants de sélection de caractéristiques ont été appliqués. Premièrement, une régression logistique utilisant l'opérateur de sélection et de réduction absolue minimale a été effectuée à l'aide du package glmnet et d'une validation croisée en 10 folds afin d'identifier les gènes possédant des coefficients non nuls14. Deuxièmement, une élimination récursive de caractéristiques par machines à vecteurs de support a été appliquée pour supprimer les caractéristiques redondantes et sélectionner le sous-ensemble de caractéristiques offrant la plus grande précision en validation croisée15. Troisièmement, un modèle de forêt aléatoire a été construit, et les caractéristiques ont été classées selon la diminution moyenne de l'impureté de Gini16. L'intersection des ensembles de gènes obtenus à partir des trois algorithmes a été utilisée pour définir l'ensemble final des gènes caractéristiques principaux. Le package pROC a été utilisé pour générer les courbes caractéristiques de fonctionnement du récepteur et calculer les valeurs de la surface sous la courbe17.
7. Validation des gènes centraux à l'aide de jeux de données indépendants en masse et en cellule unique
GSE117261 a été utilisé comme cohorte externe indépendante de validation sur tissu pulmonaire, comprenant 58 échantillons de HAP et 25 échantillons témoins de donneurs décédés18. Cet ensemble de données n’a pas été utilisé dans l’analyse de découverte de l’expression différentielle, la construction du réseau de co-expression génique pondéré ou la sélection des caractéristiques par apprentissage automatique. La matrice d’expression a été normalisée et annotée, et l’expression différentielle a été analysée à l’aide de limma v3.68.0. Une correction du taux de fausses découvertes de Benjamini-Hochberg a été appliquée à l’ensemble du transcrit annoté. Des courbes caractéristiques de fonctionnement du récepteur (ROC) pour un gène unique ont été calculées à l’aide de pROC v1.19.0.1, d’intervalles de confiance à 95 % de DeLong et de seuils basés sur l’indice de Youden. Un modèle exploratoire de régression logistique à cinq gènes a été ajusté dans GSE117261, et ses performances internes ont été évaluées supplémentairement par une validation croisée imbriquée répétée.
GSE210248 (Tableau 1) a été utilisé comme jeu de données de validation à l'échelle cellulaire unique provenant de l'artère pulmonaire, comprenant des échantillons de trois patients atteints d'hypertension artérielle pulmonaire (PAH) et de trois donneurs sains19. Les données ont été traitées à l'aide de Seurat v5.5.1 pour le contrôle de qualité, la normalisation, la réduction de la dimensionnalité, le regroupement en clusters et l'annotation cellulaire20. Les principales populations cellulaires, notamment les cellules endothéliales, les cellules musculaires lisses, les fibroblastes, les monocytes/macrophages et les cellules T/cellules tueuses naturelles, ont été identifiées. La communication intercellulaire a été analysée à l'aide de CellChat v2.1.2 et de la base de données de ligands-récepteurs CellChatDB.human21. Un objet CellChat a été créé à partir de la matrice d'expression normalisée de Seurat et des métadonnées relatives aux types cellulaires. Les gènes surexprimés ainsi que les interactions ligand-récepteur ont été identifiés ; les probabilités de communication ont été calculées ; les interactions impliquant des groupes cellulaires comportant moins de 10 cellules ont été éliminées ; et les réseaux de communication au niveau des voies ont été inférés et agrégés. Ce jeu de données a été utilisé uniquement pour une validation mécanistique externe et non pour l'entraînement du modèle.
| Élément | Description |
| Ensemble de données | GSE210248 |
| Type de données | Séquençage RNA unicellulaire basé sur les gouttelettes 10x Genomics ; profilage transcriptomique à haut débit |
| Échantillons humains | Trois échantillons d'artère pulmonaire de patients atteints de HAP et trois échantillons d'artère pulmonaire de donneurs sains |
| Origine du tissu | Tissu artériel pulmonaire ex vivo, reflétant principalement l'écologie cellulaire de la paroi vasculaire pulmonaire et le processus de remodelage vasculaire |
| Objectif principal de l'analyse | Localisation des types cellulaires, transition phénotypique des cellules musculaires lisses, communication entre cellules immunitaires et structurelles, et validation de la cohérence mécanistique des gènes candidats |
Tableau 1 : Informations de base pour le jeu de données de validation unique-cellule GSE210248. Le tableau résume l'identifiant du jeu de données, la plateforme de séquençage, la source tissulaire, la composition de l'échantillon et l'objectif analytique de l'analyse de validation de l'artère pulmonaire à l'échelle unique-cellule.
8. Validation de l'expression génique par qRT-PCR
La validation par qRT-PCR a inclus 20 échantillons de tissu pulmonaire atteint de MAP, biologiquement indépendants, provenant de patients présentant une HP/MAP et 20 échantillons de tissu pulmonaire contrôles, biologiquement indépendants. L'ARN total a été extrait à l'aide du kit d'extraction d'ARN total. La concentration et la pureté de l'ARN ont été évaluées à l'aide d'un spectrophotomètre, et l'intégrité de l'ARN a été analysée par électrophorèse sur gel d'agarose. Seuls les échantillons d'ARN dont les valeurs A260/280 se situaient entre 1,8 et 2,1 et ne présentaient aucune dégradation visible ont été retenus.
Des quantités équivalentes d'ARN ont été rétrotranscrites en ADN complémentaire à l'aide du kit Solarbio Universal RT-PCR (AMV ; n° de catalogue RP1200). Une PCR quantitative pour CXCL10, JUN, IFIH1, MX1 et TLR7 a été réalisée à l'aide du mélange maître SYBR Green PCR sur un système de PCR en temps réel. Chaque échantillon biologique a été analysé en trois réplicats techniques, accompagné de témoins sans matrice et sans rétrotranscription. La valeur moyenne de Ct des trois réplicats techniques a été utilisée pour les analyses ultérieures ; les réplicats techniques n'ont pas été considérés comme des observations indépendantes. Des amorces chevauchant les jonctions exon-exon et produisant des amplicons de 80 à 200 pb ont été utilisées (Tableau 2). La spécificité des amorces a été vérifiée à l'aide de NCBI Primer-BLAST et d'une analyse de la courbe de fusion22.
β-actine (ACTB) a été utilisée comme gène de référence interne pour normaliser les niveaux d'expression des gènes cibles. L'expression relative a été calculée en utilisant la méthode 2-ΔΔCt méthode23Des tests de Mann-Whitney U bilatéraux ont été utilisés pour les comparaisons entre groupes en fonction de la distribution des données, et une correction du taux de fausses découvertes selon Benjamini-Hochberg a été appliquée pour les cinq gènes. Des courbes ROC pour chaque gène ont été générées avec des intervalles de confiance à 95 % selon la méthode de DeLong, et les seuils optimaux ont été déterminés à l'aide de l'indice de Youden. Le modèle de régression logistique à cinq gènes a d'abord été ajusté et évalué sur les mêmes 40 échantillons biologiques ; cette estimation a donc été définie comme la performance apparente dans l'échantillon. Afin d'évaluer un éventuel surajustement, 100 répétitions de validation croisée stratifiée en cinq parties ont été réalisées à l'aide d'un modèle de régression logistique régularisé L2, et la performance moyenne ROC hors pli a été calculée.
| Gène | Numéro d'accès RefSeq | Amorce sens (5′–3′) | Amorce antisens (5′–3′) | Taille du produit (pb) | Tm (°C) | Enjambement d'introns |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Oui |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Oui |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Oui |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Oui |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Oui |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Oui |
Tableau 2 : Séquences des amorces utilisées pour la PCR quantitative par transcription inverse. Le tableau recense les gènes cibles, les numéros d'accès RefSeq, les séquences des amorces sens et antisens, les tailles des produits, les températures de fusion et le statut relatif au franchissement d'introns des amorces utilisées pour la qRT-PCR.
9. Analyse de criblage des composés candidats et docking moléculaire
Les signatures des gènes centraux surexprimés et sous-exprimés ont été soumises à la base de données Connectivity Map afin d'identifier les petites molécules susceptibles d'inverser le profil d'expression associé à l'HTAP7. Les candidats ont été classés selon leur score Logit et leur probabilité de prédiction.
La structure tridimensionnelle du BRD-K91900765/VX-745 a été obtenue à partir de PubChem sous le CID 303852524. Les informations pharmacologiques relatives au composé ont été recueillies à partir de bases de données publiques sur les médicaments, et les descripteurs structuraux ont été calculés à l’aide de DrugBank et de SwissADME25,26. Les structures protéiques ont été obtenues à partir de la base de données RCSB Protein Data Bank en utilisant les identifiants PDB suivants : CXCL10, 1LV9 ; JUN, 1JUN ; IFIH1, 3B6E ; MX1, 5GTM ; TLR7, 7CYN ; et MAPK14/p38α, 1OUK27. La détection aveugle de cavités et le dockage moléculaire ont été réalisés à l’aide de CB-Dock2 v2.0 avec le moteur de scoring AutoDock Vina v1.2.028,29. Les fichiers protéiques et ligand ont été téléchargés sur CB-Dock2, les cavités candidates ont été automatiquement détectées, et le dockage a été effectué dans les boîtes spécifiques aux cavités générées par le serveur. Pour chaque protéine, l’identifiant de la cavité, le score Vina, le volume de la cavité, le centre de la boîte de dockage, les dimensions de la boîte de dockage et le fichier du complexe protéine-ligand ont été enregistrés. La conformation présentant le score Vina le plus négatif a été sélectionnée comme la pose prédite la mieux classée. MAPK14/p38α a été inclus comme cible pharmacologique établie et protéine de référence positive pour le dockage de VX-745. Le dockage contre CXCL10, JUN, IFIH1, MX1 et TLR7 était exploratoire et n’a pas été interprété comme une preuve de ciblage pharmacologique direct, de liaison, d’inhibition ou d’efficacité.
10. Analyse statistique et contrôle de la reproductibilité
Toutes les analyses statistiques ont été effectuées avec R, sauf indication contraire. Les valeurs de P bilatérales < 0,05 ont été considérées comme statistiquement significatives. Une correction pour tests multiples a été appliquée aux analyses d'expression différentielle, d'enrichissement, de validation externe et de qRT-PCR, comme précisé ci-dessus. Une validation croisée a été utilisée pour évaluer la stabilité des modèles d'apprentissage automatique et combinés de qRT-PCR.