Un abonnement JoVE est requis pour visualiser ce contenu. Connectez-vous ou commencez votre période d'essai gratuite.

Article de recherche

Identification par bioinformatique et apprentissage automatique de biomarqueurs de l'hypertension pulmonaire et de composés thérapeutiques candidats

82 vues

⸱

DOI :

10.3791/73519

⸱

25 août 2026

Dans cet article

Résumé

Cet article présente un flux de travail bioinformatique reproductible intégrant des jeux de données transcriptomiques publics, l'apprentissage automatique, une validation externe, la PCR quantitative en temps réel, le criblage de la carte de connectivité (Connectivity Map) et le dockage moléculaire afin d'identifier des biomarqueurs de l'hypertension pulmonaire et des composés thérapeutiques candidats.

Résumé

Cette étude visait à identifier des biomarqueurs moléculaires associés à l'hypertension pulmonaire (PH) ainsi que des composés candidats de petite molécule en utilisant des données transcriptomiques publiques et des ressources de validation indépendantes. Trois jeux de données du Gene Expression Omnibus (GSE22356, GSE33463 et GSE48149) ont été intégrés après normalisation, annotation des sondes et correction des effets de lot par ComBat. Une analyse différentielle d'expression, une analyse de réseau de co-expression génique pondérée, une analyse d'enrichissement fonctionnel, une analyse de réseau d'interactions protéine-protéine et trois algorithmes d'apprentissage automatique ont été utilisés pour identifier les gènes caractéristiques centraux. La performance diagnostique a été évaluée à l'aide de courbes ROC (caractéristique de fonctionnement du récepteur). La validation externe a inclus une cohorte indépendante de tissus pulmonaires (GSE117261), un jeu de données de séquençage de l'ARN monocellulaire de l'artère pulmonaire (GSE210248) et une validation par PCR en temps réel quantitative sur des échantillons pulmonaires indépendants. Le répositionnement de médicaments basé sur Connectivity Map et la modélisation moléculaire ont été utilisés pour cribler les composés candidats. Soixante-dix-huit gènes différentiellement exprimés ont été identifiés, et CXCL10, JUN, IFIH1, MX1 et TLR7 ont été sélectionnés comme gènes caractéristiques centraux. Dans la cohorte indépendante de tissus pulmonaires GSE117261, JUN a montré le soutien externe le plus fort, tandis que la réplication des autres gènes était variable. La PCR en temps réel quantitative réalisée sur 20 échantillons biologiquement indépendants d'hypertension artérielle pulmonaire et 20 échantillons témoins a confirmé la surexpression des cinq gènes. Le modèle apparent de qRT-PCR à cinq gènes et les 100 analyses de validation croisée stratifiée en cinq parties répétées ont tous deux donné une aire sous la courbe de 1,000, bien que la petite taille de la cohorte impose une interprétation prudente et une validation prospective indépendante. L'analyse monocellulaire de GSE210248 a soutenu une communication altérée entre les cellules immunitaires et les cellules structurelles ainsi qu'un changement phénotypique des cellules musculaires lisses. BRD-K91900765/VX-745 a obtenu le classement le plus élevé lors du criblage Connectivity Map. MAPK14/p38α, sa cible pharmacologique établie, a été inclus comme protéine de référence positive, tandis que la modélisation moléculaire contre les cinq protéines associées aux biomarqueurs a été considérée comme exploratoire. Ces résultats soutiennent l'idée que ces cinq gènes sont des biomarqueurs candidats pour la PH et que VX-745 constitue une hypothèse de répositionnement thérapeutique computationnel nécessitant une validation expérimentale.

Introduction

L'hypertension pulmonaire (HP) est un syndrome cardio-pulmonaire progressif caractérisé par une pression artérielle pulmonaire élevée de manière persistante, une résistance vasculaire pulmonaire accrue et, à terme, une insuffisance ventriculaire droite. Les critères hémodynamiques actuels définissent l'HP comme une pression artérielle pulmonaire moyenne au repos supérieure ou égale à >20 mmHg, mesuré par cathétérisme cardiaque droit1Parmi les différents sous-types cliniques, l'hypertension artérielle pulmonaire (HAP) est l'une des formes les plus sévères et se caractérise par un remodelage progressif des vaisseaux pulmonaires. Ses caractéristiques pathologiques incluent une dysfonction endothéliale, une prolifération et une migration anormales des cellules musculaires lisses des artères pulmonaires, une activation des fibroblastes de l'adventice, un dépôt de matrice extracellulaire, une infiltration de cellules inflammatoires, ainsi qu'un rétrécissement ou une oblitération des artères pulmonaires distales.2Ces modifications indiquent que l'HP/APH n'est pas seulement un trouble de la vasoconstriction, mais également une maladie complexe de remodelage vasculaire induite par des mécanismes moléculaires, cellulaires et immuno-inflammatoires coordonnés.

Les traitements actuels de l'HTAP ciblent principalement les voies de la prostacycline, de l'endothéline, de l'oxyde nitrique–guanylate cyclase soluble et de la phosphodiestérase de type 53˒4. Bien que ces traitements améliorent les symptômes, la capacité à l'exercice et les paramètres hémodynamiques, leurs effets restent largement vasodilatateurs et hémodynamiques. Leur capacité à inverser le remodelage vasculaire pulmonaire installé est limitée, et de nombreux patients continuent de présenter une progression de la maladie malgré un traitement combiné. Par conséquent, l'identification de nouveaux biomarqueurs moléculaires et de candidats thérapeutiques reflétant le processus de remodelage constitue un besoin médical important encore insatisfait. En particulier, l'activation immuno-inflammatoire, les voies de signalisation liées à l'interféron, les voies des récepteurs de type Toll, le recrutement immunitaire médié par les chimioattractants et la transition phénotypique des cellules musculaires lisses se sont révélés comme des facteurs potentiels contribuant à la progression de l'HP/HTAP5˒6.

Les jeux de données transcriptomiques à haut débit fournissent des ressources précieuses pour l'identification de signatures moléculaires associées aux maladies dans l'HP/APH. Toutefois, les études fondées sur un seul jeu de données sont souvent limitées par des tailles d'échantillon réduites, des effets de lot, une hétérogénéité des plateformes et une validation insuffisante. L'analyse d'expression différentielle permet d'identifier des gènes dont l'expression est modifiée, mais elle risque de ne pas rendre pleinement compte des modules de co-expression liés à la maladie ou des interactions au niveau du réseau. L'analyse de réseau de co-expression génique pondéré (WGCNA) peut identifier des modules de gènes associés à des caractères pathologiques, tandis que l'analyse du réseau d'interactions protéine-protéine (PPI) peut révéler des gènes fortement connectés au sein de réseaux biologiques. Les méthodes d'apprentissage automatique peuvent également hiérarchiser les gènes ayant une valeur diagnostique ou de classification. Cependant, le recours à un seul algorithme peut introduire un biais propre au modèle. L'intégration de l'analyse d'expression différentielle, de la WGCNA, de l'analyse du réseau PPI et de plusieurs algorithmes d'apprentissage automatique pourrait donc améliorer la robustesse de la découverte de biomarqueurs.

Un autre défi majeur dans les études de biomarqueurs transcriptomiques est l'interprétation biologique. Les signaux provenant de tissus bruts peuvent refléter des changements d'expression génique au sein des cellules vasculaires résidentes, une infiltration de cellules immunitaires ou des proportions modifiées de plusieurs populations cellulaires. Le séquençage de l'ARN au niveau de la cellule unique offre la possibilité de situer les gènes candidats issus des analyses en masse dans un contexte cellulaire. Dans l'hypertension pulmonaire (HP/APH), le remodelage vasculaire pulmonaire implique les cellules endothéliales, les cellules musculaires lisses, les fibroblastes, les monocytes/macrophages, les lymphocytes et d'autres cellules immunitaires ou structurelles. La progression de la maladie est également associée à une communication altérée entre les cellules et à un basculement phénotypique des cellules musculaires lisses. Ainsi, la combinaison d'un criblage transcriptomique en masse avec une validation à la cellule unique peut aider à déterminer si les biomarqueurs candidats sont associés à une activation immunitaire, à un remodelage structurel vasculaire ou à un déséquilibre dans la communication multicellulaire.

En plus de la découverte de biomarqueurs, les signatures transcriptomiques peuvent être utilisées pour le repositionnement computationnel de médicaments. La carte de connectivité (Connectivity Map, CMap) relie les profils d'expression génique associés aux maladies à des petites molécules susceptibles d'inverser ou de moduler ces signatures7. Lorsqu'elle est combinée à la curation de composés et au dockage moléculaire, cette stratégie peut générer des hypothèses thérapeutiques pouvant être testées expérimentalement. Bien que la prédiction par CMap et le dockage moléculaire ne puissent pas établir l'efficacité d'un médicament, elles permettent de hiérarchiser les composés candidats pour des essais futurs d'interaction avec la cible, des expériences cellulaires et une validation dans des modèles animaux.

Un flux de travail intégré et reproductible a été mis au point pour identifier des biomarqueurs de l'hypertension pulmonaire (HP)/l'hypertension artérielle pulmonaire (HAP) ainsi que des composés thérapeutiques candidats. Trois jeux de données transcriptomiques publics du Gene Expression Omnibus ont été intégrés après normalisation et correction des effets de lot. Une analyse d'expression différentielle, une analyse WGCNA, une analyse d'enrichissement fonctionnel, une analyse du réseau d'interactions protéine-protéine (PPI) et trois algorithmes d'apprentissage automatique ont été utilisés pour sélectionner des gènes caractéristiques robustes. Une analyse de la courbe ROC (receiver operating characteristic), une cohorte de validation indépendante sur tissu pulmonaire, des données de séquençage de l'ARN à la cellule unique provenant de l'artère pulmonaire et une validation par PCR quantitative en temps réel sur des échantillons indépendants ont été utilisées pour évaluer davantage les gènes sélectionnés. Enfin, un répositionnement de médicaments basé sur CMap et un dockage moléculaire ont été appliqués pour identifier des composés candidats. L'originalité de l'étude réside dans son cadre de validation multicouche, qui relie la découverte transcriptomique à partir d'échantillons massifs, la priorisation par apprentissage automatique, la validation indépendante, la confirmation expérimentale par PCR quantitative en temps réel, l'interprétation mécanistique à la cellule unique et le criblage computationnel de composés. L'hypothèse de l'étude était que l'HP/l'HAP est induite par un programme coordonné d'inflammation immunitaire et de remodelage vasculaire, et que des gènes robustes appartenant à ce programme pourraient servir de biomarqueurs candidats et offrir des opportunités de répositionnement thérapeutique.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Protocole

Les ensembles de données publiques du Gene Expression Omnibus (GEO) analysés dans cette étude contenaient des données transcriptomiques dé-identifiées provenant d'études précédemment publiées et n'ont pas nécessité d'approbation éthique supplémentaire. Le comité d'éthique de l'Université Huaihua a approuvé l'étude indépendante de validation par transcription inverse quantitative en temps réel (qRT-PCR) sur des tissus pulmonaires humains (numéro d'approbation : 2024(A05112)). Un consentement éclairé écrit a été obtenu auprès de tous les participants ou de leurs représentants légalement habilités avant le prélèvement des échantillons. Les procédures d'approbation et de consentement se sont appliquées à l'ensemble des 20 échantillons de tissus pulmonaires provenant de patients atteints d'hypertension artérielle pulmonaire (PAH) et des 20 échantillons témoins inclus dans la validation par qRT-PCR. Les outils de recherche utilisés pour ce protocole sont répertoriés dans le Tableau des matériaux.

1. Collecte et prétraitement des jeux de données transcriptomiques publics

Les jeux de données de puces à ADN liés à l'hypertension pulmonaire (PH) GSE22356, GSE33463 et GSE48149 ont été obtenus à partir de la base de données GEO. Les échantillons de PH/hypertension artérielle pulmonaire (PAH) et les échantillons témoins ont été extraits selon les annotations phénotypiques d'origine. Les matrices d'expression et les fichiers d'annotation de la plateforme ont été téléchargés à l'aide de scripts R reproductibles et du package GEOquery.

L'annotation des sondes et la correspondance des symboles génétiques ont été effectuées de manière cohérente pour l'ensemble des jeux de données. Lorsque plusieurs sondes correspondaient au même gène, la valeur moyenne d'expression a été calculée. Une normalisation par quantiles a été appliquée, et les gènes présentant une faible expression ou une faible variance ont été éliminés. Les jeux de données ont été fusionnés, et les effets de lot ont été corrigés à l'aide de l'algorithme ComBat du package sva8. La correction a été évaluée à l'aide de boîtes à moustaches et d'une analyse en composantes principales.

2. Identification des gènes différentiellement exprimés

Le package limma a été utilisé pour comparer les niveaux d'expression entre les échantillons de PH et les échantillons témoins dans la matrice d'expression corrigée par lot9Un modèle linéaire a été ajusté et des statistiques de Bayes empirique ont été appliquées. Les gènes différentiellement exprimés ont été définis à l'aide d'une valeur seuil ajustée P valeur <0,05 et un changement de l'expression différentielle absolu en échelle log2 > 0,585. Les résultats ont été visualisés à l'aide de diagrammes en volcan et de cartes thermiques.

3. Construction d'un réseau de co-expression génique pondéré

Un réseau de co-expression génique pondéré a été construit à l'aide du package WGCNA10. Un regroupement des échantillons a été effectué afin de détecter les valeurs aberrantes. La puissance de seuil doux a été choisie en fonction de l'indice d'ajustement à la topologie sans échelle. Les modules géniques ont été identifiés à l'aide de l'algorithme de découpage dynamique de l'arbre. Les eigengènes des modules ont été corrélés au phénotype HP, et le module associé à la maladie présentant la corrélation la plus forte a été sélectionné. Les gènes du module clé ont été croisés avec les gènes différentiellement exprimés afin d'obtenir les gènes consensus.

4. Analyse d'enrichissement fonctionnel

Les catégories biologiques du Gene Ontology, concernant le processus biologique, le composant cellulaire et la fonction moléculaire, ont été analysées à l'aide de clusterProfiler11. Une analyse d'enrichissement des voies du Kyoto Encyclopedia of Genes and Genomes a été réalisée afin d'identifier les voies de signalisation12. Une valeur de P < 0,05 et une valeur de q < 0,2 ont été utilisées comme seuils d'enrichissement, et les termes enrichis ont été visualisés à l'aide de graphiques en bulles11.

5. Construction du réseau d'interactions protéine-protéine et identification des gènes centraux

La liste de gènes consensus a été soumise à la base de données STRING, avec Homo sapiens sélectionné comme espèce et un seuil de confiance d'interaction > 0,413. Le fichier d'interactions a été importé dans Cytoscape, et le plug-in CytoHubba a été utilisé pour classer les gènes selon leur degré de nœud. Les gènes fortement connectés ont été définis comme des gènes centraux.

6. Sélection de gènes caractéristiques diagnostiques à l'aide de l'apprentissage automatique

Trois algorithmes indépendants de sélection de caractéristiques ont été appliqués. Premièrement, une régression logistique utilisant l'opérateur de sélection et de réduction absolue minimale a été effectuée à l'aide du package glmnet et d'une validation croisée en 10 folds afin d'identifier les gènes possédant des coefficients non nuls14. Deuxièmement, une élimination récursive de caractéristiques par machines à vecteurs de support a été appliquée pour supprimer les caractéristiques redondantes et sélectionner le sous-ensemble de caractéristiques offrant la plus grande précision en validation croisée15. Troisièmement, un modèle de forêt aléatoire a été construit, et les caractéristiques ont été classées selon la diminution moyenne de l'impureté de Gini16. L'intersection des ensembles de gènes obtenus à partir des trois algorithmes a été utilisée pour définir l'ensemble final des gènes caractéristiques principaux. Le package pROC a été utilisé pour générer les courbes caractéristiques de fonctionnement du récepteur et calculer les valeurs de la surface sous la courbe17.

7. Validation des gènes centraux à l'aide de jeux de données indépendants en masse et en cellule unique

GSE117261 a été utilisé comme cohorte externe indépendante de validation sur tissu pulmonaire, comprenant 58 échantillons de HAP et 25 échantillons témoins de donneurs décédés18. Cet ensemble de données n’a pas été utilisé dans l’analyse de découverte de l’expression différentielle, la construction du réseau de co-expression génique pondéré ou la sélection des caractéristiques par apprentissage automatique. La matrice d’expression a été normalisée et annotée, et l’expression différentielle a été analysée à l’aide de limma v3.68.0. Une correction du taux de fausses découvertes de Benjamini-Hochberg a été appliquée à l’ensemble du transcrit annoté. Des courbes caractéristiques de fonctionnement du récepteur (ROC) pour un gène unique ont été calculées à l’aide de pROC v1.19.0.1, d’intervalles de confiance à 95 % de DeLong et de seuils basés sur l’indice de Youden. Un modèle exploratoire de régression logistique à cinq gènes a été ajusté dans GSE117261, et ses performances internes ont été évaluées supplémentairement par une validation croisée imbriquée répétée.

GSE210248 (Tableau 1) a été utilisé comme jeu de données de validation à l'échelle cellulaire unique provenant de l'artère pulmonaire, comprenant des échantillons de trois patients atteints d'hypertension artérielle pulmonaire (PAH) et de trois donneurs sains19. Les données ont été traitées à l'aide de Seurat v5.5.1 pour le contrôle de qualité, la normalisation, la réduction de la dimensionnalité, le regroupement en clusters et l'annotation cellulaire20. Les principales populations cellulaires, notamment les cellules endothéliales, les cellules musculaires lisses, les fibroblastes, les monocytes/macrophages et les cellules T/cellules tueuses naturelles, ont été identifiées. La communication intercellulaire a été analysée à l'aide de CellChat v2.1.2 et de la base de données de ligands-récepteurs CellChatDB.human21. Un objet CellChat a été créé à partir de la matrice d'expression normalisée de Seurat et des métadonnées relatives aux types cellulaires. Les gènes surexprimés ainsi que les interactions ligand-récepteur ont été identifiés ; les probabilités de communication ont été calculées ; les interactions impliquant des groupes cellulaires comportant moins de 10 cellules ont été éliminées ; et les réseaux de communication au niveau des voies ont été inférés et agrégés. Ce jeu de données a été utilisé uniquement pour une validation mécanistique externe et non pour l'entraînement du modèle.

ÉlémentDescription
Ensemble de donnéesGSE210248
Type de donnéesSéquençage RNA unicellulaire basé sur les gouttelettes 10x Genomics ; profilage transcriptomique à haut débit
Échantillons humainsTrois échantillons d'artère pulmonaire de patients atteints de HAP et trois échantillons d'artère pulmonaire de donneurs sains
Origine du tissuTissu artériel pulmonaire ex vivo, reflétant principalement l'écologie cellulaire de la paroi vasculaire pulmonaire et le processus de remodelage vasculaire
Objectif principal de l'analyseLocalisation des types cellulaires, transition phénotypique des cellules musculaires lisses, communication entre cellules immunitaires et structurelles, et validation de la cohérence mécanistique des gènes candidats

Tableau 1 : Informations de base pour le jeu de données de validation unique-cellule GSE210248. Le tableau résume l'identifiant du jeu de données, la plateforme de séquençage, la source tissulaire, la composition de l'échantillon et l'objectif analytique de l'analyse de validation de l'artère pulmonaire à l'échelle unique-cellule.

8. Validation de l'expression génique par qRT-PCR

La validation par qRT-PCR a inclus 20 échantillons de tissu pulmonaire atteint de MAP, biologiquement indépendants, provenant de patients présentant une HP/MAP et 20 échantillons de tissu pulmonaire contrôles, biologiquement indépendants. L'ARN total a été extrait à l'aide du kit d'extraction d'ARN total. La concentration et la pureté de l'ARN ont été évaluées à l'aide d'un spectrophotomètre, et l'intégrité de l'ARN a été analysée par électrophorèse sur gel d'agarose. Seuls les échantillons d'ARN dont les valeurs A260/280 se situaient entre 1,8 et 2,1 et ne présentaient aucune dégradation visible ont été retenus.

Des quantités équivalentes d'ARN ont été rétrotranscrites en ADN complémentaire à l'aide du kit Solarbio Universal RT-PCR (AMV ; n° de catalogue RP1200). Une PCR quantitative pour CXCL10, JUN, IFIH1, MX1 et TLR7 a été réalisée à l'aide du mélange maître SYBR Green PCR sur un système de PCR en temps réel. Chaque échantillon biologique a été analysé en trois réplicats techniques, accompagné de témoins sans matrice et sans rétrotranscription. La valeur moyenne de Ct des trois réplicats techniques a été utilisée pour les analyses ultérieures ; les réplicats techniques n'ont pas été considérés comme des observations indépendantes. Des amorces chevauchant les jonctions exon-exon et produisant des amplicons de 80 à 200 pb ont été utilisées (Tableau 2). La spécificité des amorces a été vérifiée à l'aide de NCBI Primer-BLAST et d'une analyse de la courbe de fusion22.

β-actine (ACTB) a été utilisée comme gène de référence interne pour normaliser les niveaux d'expression des gènes cibles. L'expression relative a été calculée en utilisant la méthode 2-ΔΔCt méthode23Des tests de Mann-Whitney U bilatéraux ont été utilisés pour les comparaisons entre groupes en fonction de la distribution des données, et une correction du taux de fausses découvertes selon Benjamini-Hochberg a été appliquée pour les cinq gènes. Des courbes ROC pour chaque gène ont été générées avec des intervalles de confiance à 95 % selon la méthode de DeLong, et les seuils optimaux ont été déterminés à l'aide de l'indice de Youden. Le modèle de régression logistique à cinq gènes a d'abord été ajusté et évalué sur les mêmes 40 échantillons biologiques ; cette estimation a donc été définie comme la performance apparente dans l'échantillon. Afin d'évaluer un éventuel surajustement, 100 répétitions de validation croisée stratifiée en cinq parties ont été réalisées à l'aide d'un modèle de régression logistique régularisé L2, et la performance moyenne ROC hors pli a été calculée.

GèneNuméro d'accès RefSeqAmorce sens (5′–3′)Amorce antisens (5′–3′)Taille du produit (pb)Tm (°C)Enjambement d'introns
CXCL10NM_001565.4GTCAAGCCAT
AATTGTTC
ATAGTGCCAG
GGTAGAGT
14146.1Oui
JUNNM_002228.4ACAAGTGGCA
GAGTCCCG
CGCCCAAGTT
CAACAACC
15254.5Oui
IFIH1NM_022168GCACAGAGCG
GTAGACCCT
GCCCTGAAGC
ACGAGATG
18254.7Oui
MX1NM_002462.5TTAGCCGTGG
TGATTTAGC
CAAGGTGGAG
CGATTCTG
15652.3Oui
TLR7NM_016562.4ATTGCCCTCGT
TGTTATA
TTCCTGGAGTT
TGTTGAT
17948.1Oui
ACTBNM_001101.3CTCACCATGGAT
GATGATATCGC
AGGAATCCTTCT
GACCCATGC
19456.2Oui

Tableau 2 : Séquences des amorces utilisées pour la PCR quantitative par transcription inverse. Le tableau recense les gènes cibles, les numéros d'accès RefSeq, les séquences des amorces sens et antisens, les tailles des produits, les températures de fusion et le statut relatif au franchissement d'introns des amorces utilisées pour la qRT-PCR.

9. Analyse de criblage des composés candidats et docking moléculaire

Les signatures des gènes centraux surexprimés et sous-exprimés ont été soumises à la base de données Connectivity Map afin d'identifier les petites molécules susceptibles d'inverser le profil d'expression associé à l'HTAP7. Les candidats ont été classés selon leur score Logit et leur probabilité de prédiction.

La structure tridimensionnelle du BRD-K91900765/VX-745 a été obtenue à partir de PubChem sous le CID 303852524. Les informations pharmacologiques relatives au composé ont été recueillies à partir de bases de données publiques sur les médicaments, et les descripteurs structuraux ont été calculés à l’aide de DrugBank et de SwissADME25,26. Les structures protéiques ont été obtenues à partir de la base de données RCSB Protein Data Bank en utilisant les identifiants PDB suivants : CXCL10, 1LV9 ; JUN, 1JUN ; IFIH1, 3B6E ; MX1, 5GTM ; TLR7, 7CYN ; et MAPK14/p38α, 1OUK27. La détection aveugle de cavités et le dockage moléculaire ont été réalisés à l’aide de CB-Dock2 v2.0 avec le moteur de scoring AutoDock Vina v1.2.028,29. Les fichiers protéiques et ligand ont été téléchargés sur CB-Dock2, les cavités candidates ont été automatiquement détectées, et le dockage a été effectué dans les boîtes spécifiques aux cavités générées par le serveur. Pour chaque protéine, l’identifiant de la cavité, le score Vina, le volume de la cavité, le centre de la boîte de dockage, les dimensions de la boîte de dockage et le fichier du complexe protéine-ligand ont été enregistrés. La conformation présentant le score Vina le plus négatif a été sélectionnée comme la pose prédite la mieux classée. MAPK14/p38α a été inclus comme cible pharmacologique établie et protéine de référence positive pour le dockage de VX-745. Le dockage contre CXCL10, JUN, IFIH1, MX1 et TLR7 était exploratoire et n’a pas été interprété comme une preuve de ciblage pharmacologique direct, de liaison, d’inhibition ou d’efficacité.

10. Analyse statistique et contrôle de la reproductibilité

Toutes les analyses statistiques ont été effectuées avec R, sauf indication contraire. Les valeurs de P bilatérales < 0,05 ont été considérées comme statistiquement significatives. Une correction pour tests multiples a été appliquée aux analyses d'expression différentielle, d'enrichissement, de validation externe et de qRT-PCR, comme précisé ci-dessus. Une validation croisée a été utilisée pour évaluer la stabilité des modèles d'apprentissage automatique et combinés de qRT-PCR.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Résultats

Prétraitement des données transcriptomiques publiques et identification des gènes différentiellement exprimés

L'intégration et la correction par ComBat des jeux de données GSE22356, GSE33463 et GSE48149 ont réduit les différences systématiques entre ces derniers. Les boîtes à moustaches ont montré que les distributions d'expression des échantillons sont devenues plus cohérentes après correction. L'analyse en composantes principales a indiqué que les échantillons s'agrégeaient ...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Discussion

Un flux de travail intégré et reproductible a été mis au point pour identifier des biomarqueurs moléculaires associés à l'HTAP/AAPH et des composés thérapeutiques candidats, en combinant des données transcriptomiques publiques, une analyse de réseau de coexpression génique pondérée, un enrichissement fonctionnel, une analyse de réseau d'interactions protéine-protéine, trois algorithmes d'apprentissage automatique, une validation externe, une interprétation transcriptomique unicellulaire, une confirmation par PCR quantita...

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Déclarations de divulgation

Les auteurs déclarent qu’ils n’ont aucun intérêt concurrentiel.

Remerciements

Cette étude a été soutenue par le projet de construction de la province innovante du Hunan (n° 2022JJ30465).

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
2× SYBR Green PCR MastermixBeijing Solarbio Science & Technology Co., Ltd.Catalog no. SR1110Amplification PCR en temps réel quantitative basée sur un colorant et détection de fluorescence
AI21.msvmRFE.R et e1071Script R personnalisé avec le package CRAN e1071AI21.msvmRFE.R ; e1071 v1.7-17Élimination récursive de caractéristiques par machine à vecteurs de support
AgaroseBeijing Solarbio Science & Technology Co., Ltd.Catalog no. A8201 ; CAS 9012-36-6Évaluation de l'intégrité de l'ARN total par électrophorèse sur gel d'agarose
Appareil d'électrophorèse sur gel d'agaroseBeijing Liuyi Biotechnology Co., Ltd.Modèle DYCZ-24DNÉvaluation électrophorétique de l'intégrité de l'ARN
Moteur de scoring AutoDock VinaCenter for Computational Structural Biology, Scripps Researchv1.2.0 ; RRID : SCR_011958Évaluation des poses ligand-protéine dans le cadre de flux CB-Dock2
CB-Dock2Laboratoire Cao, serveur web CB-Dock2v2.0 ; accédé en juillet 2026Détection aveugle de cavités et docking moléculaire de VX-745 avec les structures protéiques sélectionnées
CellChatPackage R CellChatv2.1.2Inférence et visualisation des communications intercellulaires à partir de la matrice d'expression unicellulaire
CellChatDB.humanDistribué avec le package R CellChatCellChatDB.human ; sous-ensemble Signaling Secreted ; seuil minimal de cellules = 10Base de données d'interactions ligand-récepteur humaines pour CellChat
clusterProfilerPackage R Bioconductorv4.20.0 ; version Bioconductor 3.23Analyses d'enrichissement Gene Ontology et Kyoto Encyclopedia of Genes and Genomes
Connectivity Map (CMap/CLUE)Broad InstituteRessource L1000/CLUE ; RRID : SCR_016204 ; accédée en juillet 2026Analyse computationnelle de réaffectation thérapeutique
Amorces oligonucléotidiques personnaliséesBeijing Solarbio Science & Technology Co., Ltd.Synthétisées sur mesure ; séquences des amorces fournies dans le tableau 2Amplification de ACTB, CXCL10, JUN, IFIH1, MX1 et TLR7
cytoHubbaBoutique d'applications Cytoscapev0.1Classement des gènes centraux (hub genes) basé sur le degré dans le réseau d'interactions protéine-protéine
CytoscapeConsortium Cytoscapev3.10.4 ; RRID : SCR_003032Visualisation et analyse du réseau d'interactions protéine-protéine
DrugBankBase de connaissances DrugBankv6.0 ; RRID : SCR_002700Curation de l'identité des composés et des informations pharmacologiques
Système de documentation des gelsBeijing Liuyi Biotechnology Co., Ltd.Modèle WO-9413BVisualisation et enregistrement des résultats d'intégrité de l'ARN sur gel d'agarose
Gene Expression Omnibus (GEO)National Center for Biotechnology InformationGSE22356, GSE33463, GSE48149, GSE117261 et GSE210248 ; RRID : SCR_005012Récupération de jeux de données transcriptomiques en masse et unicellulaires
GEOqueryPackage R Bioconductorv2.80.0 ; version Bioconductor 3.23Téléchargement et importation programmés des données d'expression et de phénotype de GEO
glmnetPackage R CRANv5.0Régression logistique avec opérateur de sélection et de réduction absolue (LASSO) et modélisation logistique régularisée
limmaPackage R Bioconductorv3.68.0 ; version Bioconductor 3.23 ; RRID : SCR_010943Analyse d'expression différentielle et statistiques bayésiennes empiriques
Spectrophotomètre NanoDropThermo Fisher ScientificNanoDrop ND-1000 ; logiciel v3.8Mesure de la concentration en ARN et des rapports de pureté A260/280 et A260/230
NCBI Primer-BLASTNational Center for Biotechnology InformationOutil web ; RRID : SCR_003095 ; accédé en juillet 2026Vérification de la spécificité des amorces
pROCPackage R CRANv1.19.0.1 ; RRID : SCR_024286Analyse de la courbe ROC, intervalles de confiance de DeLong et seuils basés sur l'indice de Youden
Protein Data Bank (PDB)RCSB Protein Data BankCXCL10 : 1LV9 ; JUN : 1JUN ; IFIH1 : 3B6E ; MX1 : 5GTM ; TLR7 : 7CYN ; MAPK14/p38α : 1OUK ; RRID : SCR_012820Récupération de structures protéiques déterminées expérimentalement pour le docking moléculaire
PubChemNational Center for Biotechnology InformationPubChem CID 3038525 ; RRID : SCR_004284Récupération de la structure tridimensionnelle et des identifiants chimiques de BRD-K91900765/VX-745
RR Foundation for Statistical Computingv4.6.1 ; RRID : SCR_001905Calcul statistique, traitement des données, apprentissage automatique et visualisation
randomForestPackage R CRANv4.7-1.2Sélection de caractéristiques par forêt aléatoire et classement de l'importance des variables
Système PCR en temps réelStratagene, maintenant Agilent TechnologiesSystème Mx3000P Real-Time PCRAmplification qRT-PCR, acquisition de fluorescence, analyse de courbe de fusion et exportation des valeurs Ct
SeuratPackage R CRAN ; Laboratoire Satijav5.5.1 ; RRID : SCR_016341Contrôle qualité, normalisation, réduction de dimensionnalité, regroupement et annotation en séquençage d'ARN unicellulaire
STRINGConsortium STRINGv12.0 ; RRID : SCR_005223Construction du réseau d'interactions protéine-protéine
sva (ComBat)Package R Bioconductorv3.60.0 ; version Bioconductor 3.23Correction des effets de lot entre jeux de données
SwissADMEInstitut suisse de bioinformatiqueServeur web ; accédé en juillet 2026Présélection de la similitude avec un médicament, des propriétés physico-chimiques et des paramètres ADME
Kit d'extraction d'ARN totalBeijing Solarbio Science & Technology Co., Ltd.Catalog no. R1200Extraction et purification de l'ARN total à partir d'échantillons de tissu pulmonaire
Kit RT-PCR universel (AMV)Beijing Solarbio Science & Technology Co., Ltd.Catalog no. RP1200Transcription inverse de l'ARN total en ADN complémentaire
WGCNAPackage R CRANv1.74Construction de réseaux de co-expression génique pondérés et analyse module-trait

Références

  1. Simonneau G, et al. Haemodynamic definitions and updated clinical classification of pulmonary hypertension. Eur Respir J. 2019;53(1):1801913. doi: 10.1183/13993003.01913-2018.
  2. Rabinovitch M, Guignabert C, Humbert M, Nicolls MR. Inflammation and immunity in the pathogenesis of pulmonary arterial hypertension. Circ Res. 2014;115(1):165–175.
  3. Humbert M, et al. 2022 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Heart J. 2022;43(38):3618–3731.
  4. Galiè N, et al. 2015 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Respir J. 2015;46(4):903–975.
  5. Soon E, et al. Elevated levels of inflammatory cytokines predict survival in idiopathic and familial pulmonary arterial hypertension. Circulation. 2010;122(9):920–927.
  6. George PM, et al. Evidence for the involvement of type I interferon in pulmonary arterial hypertension. Circ Res. 2014;114(4):677–688.
  7. Subramanian A, et al. A next-generation Connectivity Map: L1000 platform and the first 1,000,000 profiles. Cell. 2017;171(6):1437–1452.e17.
  8. Leek JT, et al. The sva package for removing batch effects and other unwanted variation in high-throughput experiments. Bioinformatics. 2012;28(6):882–883.
  9. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47. doi: 10.1093/nar/gkv007.
  10. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559. doi: 10.1186/1471-2105-9-559.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–287.
  12. Kanehisa M, Goto S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 2000;28(1):27–30.
  13. Szklarczyk D, et al. The STRING database in protein–protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638–D646.
  14. Friedman J, Hastie T, Tibshirani R. Regularization paths for generalized linear models via coordinate descent. J Stat Softw. 2010;33(1):1–22.
  15. Guyon I, Weston J, Barnhill S, Vapnik V. Gene selection for cancer classification using support vector machines. Mach Learn. 2002;46:389–422.
  16. Breiman L. Random forests. Mach Learn. 2001;45(1):5–32.
  17. Robin X, et al. pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics. 2011;12:77. doi: 10.1186/s12859-011-0077-8.
  18. Stearman RS, et al. Systems analysis of the human pulmonary arterial hypertension lung transcriptome. Am J Respir Cell Mol Biol. 2019;60(6):637–649.
  19. Crnkovic S, et al. Single-cell transcriptomics reveals skewed cellular communication and phenotypic shift in pulmonary artery remodeling. JCI Insight. 2022;7(20):e153471. doi: 10.1172/jci.insight.153471.
  20. Hao Y, et al. Integrated analysis of multimodal single-cell data. Cell. 2021;184(13):3573–3587.e29.
  21. Jin S, et al. Inference and analysis of cell–cell communication using CellChat. Nat Commun. 2021;12(1):1088. doi: 10.1038/s41467-021-21246-9.
  22. Bustin SA, et al. MIQE 2.0: revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments guidelines. Clin Chem. 2025;71(6):634–651.
  23. Livak KJ, Schmittgen TD. Analysis of relative gene expression data using real-time quantitative PCR and the 2−ΔΔCt method. Methods. 2001;25(4):402–408.
  24. Kim S, et al. PubChem 2023 update. Nucleic Acids Res. 2023;51(D1):D1373–D1380.
  25. Knox C, et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res. 2024;52(D1):D1265–D1275.
  26. Daina A, Michielin O, Zoete V. SwissADME: a free web tool to evaluate pharmacokinetics, drug-likeness, and medicinal chemistry friendliness of small molecules. Sci Rep. 2017;7:42717. doi: 10.1038/srep42717.
  27. Burley SK, et al. RCSB Protein Data Bank: powerful new tools for exploring 3D structures of biological macromolecules for basic and applied research and education. Nucleic Acids Res. 2021;49(D1):D437–D451. doi: 10.1093/nar/gkaa1038.
  28. Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: new docking methods, expanded force field, and Python bindings. J Chem Inf Model. 2021;61(8):3891–3898. doi: 10.1021/acs.jcim.1c00203.
  29. Liu Y, et al. CB-Dock2: improved protein-ligand blind docking by integrating cavity detection, docking, and homologous template fitting. Nucleic Acids Res. 2022;50(W1):W159–W164. doi: 10.1093/nar/gkac394.
  30. Duffy JP, et al. The discovery of VX-745: a novel and selective p38α kinase inhibitor. ACS Med Chem Lett. 2011;2(10):758–763.
  31. Sheng Y, et al. Crocin inhibits neutrophil migration and activation to treat hypoxic pulmonary hypertension through targeting HCK. Phytomedicine. 2025;148:157334. doi: 10.1016/j.phymed.2025.157334.
  32. Cui H, et al. Leonurine ameliorates hypoxic pulmonary hypertension by inhibiting cross-talk between neutrophils and endothelial cells via SERPINB3 targeting. Int Immunopharmacol. 2026;176:116467. doi: 10.1016/j.intimp.2026.116467.

Accès restreint. Veuillez vous connecter ou commencer un essai pour afficher ce contenu.

Réimpressions et autorisations

Étiquettes

Identification de biomarqueursdonnées transcriptomiquesexpression différentiellecoexpression géniqueréseau d'interaction protéine-protéineséquençage d'ARN en cellule uniquerepositionnement de médicamentsPCR quantitative