$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Aperçu du flux de travail d’analyse
La conception globale de l’analyse transcriptomique et basée sur l’apprentissage automatique de cette étude est illustrée à la Figure 1, qui englobe les étapes clés : collecte des gènes liés au système rénine-angiotensine (RASRG) ; le dépistage des gènes différenciellement exprimés (RASRDEG) liés au SAR à partir de jeux de données sur l’hypertension ; analyse d’enrichissement fonctionnel (GO/KEGG/GSEA) ; analyse de l’infiltration immunitaire (CIBERSORT) ; la construction d’interactions protéine-protéine (IPP) et de réseaux régulateurs ; sélection des gènes clés basée sur l’apprentissage automatique (régression logistique, forêt aléatoire [RF]) ; et l’évaluation du modèle diagnostique de l’hypertension. Une liste complète des logiciels, bases de données et outils en ligne utilisés dans cette étude est fournie dans le tableau des matériaux.
Téléchargement de données
Les ensembles de données sur l’hypertension GSE753608 et GSE74144 (Homo sapiens) ont été obtenus via le paquet R GEOquery9 à partir de la base de donnéesGEO 10. GSE75360 dérivés de cellules mononucléaires du sang périphérique (plateforme : GPL10558) comprenaient 10 échantillons d’hypertension et 11 échantillons témoins ; GSE74144 dérivés des globules blancs (plateforme : GPL13497) comprenaient 14 échantillons d’hypertension et 8 échantillons témoins (tableau 1). Les RASRG codant pour les protéines (1 264) ont été initialement identifiés via GeneCards11 (mot-clé : « Système rénine-angiotensine ») et PubMed (mot-clé : « Système rénine-angiotensine »)12,13. L’intersection de ces RASRG avec des gènes en GSE75360/GSE74144 a donné 1 159 RASRGfinaux 14. Les deux ensembles de données ont été traités séparément car ils ont été générés sur des plateformes micro-array différentes. L’annotation par sonde a été effectuée selon les fichiers d’annotation correspondants de la plateforme GPL, et des matrices d’expression génique normalisées ont été utilisées pour les analyses en aval. Les diagrammes de boîte étaient utilisés pour comparer les distributions d’expression avant et après la normalisation.
Gènes différencieusement exprimés différencieusement liés à l’hypertension rénine-angiotensine
Les échantillons du jeu de données GSE75360 ont été classés en groupe hypertension et groupe témoin. Le logiciel limma a été utilisé pour effectuer une analyse différentielle de l’expression génique entre les deuxgroupes 14, avec des gènes différenciellement exprimés (DEG) identifiés par le seuil de |logFC| > 0,45 et la valeur p < 0,05. Les résultats de cette analyse différentielle ont été visualisés via des graphiques volcaniques (générés à l’aide du package R ggplot2).
Pour obtenir les RASRDEG, les DEG atteignant le seuil ci-dessus (|logFC| > 0,45, valeur p < 0,05) ont été croisés avec des gènes liés au RAS (RASRG), et le résultat de l’intersection a été présenté via un diagramme de Venn. Par la suite, les schémas d’expression des RASRDEG identifiés ont été visualisés sous forme de carte thermique utilisant la carte de paquet R, et la localisation chromosomique des RASRDEG a été affichée via des cartes chromosomais générées avec le paquet RRCircos 15.
Validation différentielle des gènes exprimés et analyse de la courbe ROC
Un graphique intergroupe a été construit pour analyser les différences d’expression RASRDEG entre hypertension/contrôle dansGSE75360 16, le pROC du package R a été utilisé pour tracer les courbes ROC et calculer l’AUC (0,5–0,7 : faible précision ; 0,7–0,9 : modéré ; >0,9 : élevé) pour l’efficacité diagnostique du RASRDEG.
Analyse de corrélation
L’analyse de corrélation de Spearman a été réalisée sur l’expression du RASRDEG en GSE75360 ; les résultats ont été visualisés via une carte thermique (paquet R ggplot2) (|r| < 0,3 : corrélation nulle/faible ; 0,3–0,5 : faible ; 0,5–0,8 : modérée ; >0,8 : forte).
Analyse d’enrichissement de GO et KEGG
GO (Gene Ontology, parution 2024, http://geneontology.org/) est une ressource largement utilisée pour l’enrichissement fonctionnel à grande échelle, couvrant trois domaines : les processus biologiques (BP), les composants cellulaires (CC) et les fonctions moléculaires (MF)17. KEGG (Kyoto Encyclopedia of Genes and Genomes, Release 109.0, 2024, https://www.genome.jp/kegg/) stocke des données sur les génomes, les biopathes, les maladies etles médicaments 18.
Les RASRDEG ont été soumis à une annotation GO et à une analyse d’enrichissement des voies KEGG en utilisant le cluster R packageProfiler 19. Méthode d’essai d’enrichissement : test hypergéométrique ; méthode de correction de tests multiples : méthode de Benjamini-Hochberg (BH). Critère de sélection : valeur p ajustée < 0,05.
Analyse d’enrichissement d’ensembles de gènes (GSEA)
Pour le GSEA au niveau de la cohorte, tous les gènes testés dans l’analyse d’expression différentielle de GSE75360 ont été classés par ordre décroissant selon logFC et utilisés comme liste de gènes d’entrée pour clusterProfiler19. Aucun préfiltrage DEG n’a été appliqué avant GSEA. La collection de gènes C2 de MSigDB20. Paramètres : graine = 2022, 10–500 gènes par ensemble ; critères de dépistage : p < corrigé 0,05 (méthode Benjamini-Hochberg, BH), FDR < 0,2521.
Construction d’un modèle diagnostique de l’hypertension
Pour identifier les gènes clés associés à l’hypertension, nous avons utilisé deux types d’algorithmes d’apprentissage automatique : la régression logistique et les forêts aléatoires (RF). La régression logistique (variable binaire dépendante : hypertension/contrôle) a dépisté les RASRDEG avec p < 0,05. Random Forest (RF, package R randomForest) : paramètres set.seed(520), ntree = 1000 ; MeanDecreaseGini (indicateur d’importance variable) a été extrait, et les 15 meilleurs RASRDEG ont été sélectionnés. Les RASRDEG étaient examinés avec une valeur p < 0,05 comme norme.
L’algorithme RF (Random Forest), une méthode d’apprentissage en ensemble sous la catégorie de Sagging (intégrant plusieurs arbres de décision), a été appliqué via le package RrandomForest 22 (paramètres : set.seed(520), ntree = 1000). MeanDecreaseGini (reflétant l’importance variable par la diminution moyenne de pureté lors de la division des nœuds) des gènes de caractéristiques a été extrait, et les 15 meilleurs RASRDEG ont été sélectionnés. Enfin, un diagramme de Venn des gènes sélectionnés par régression logistique et RF a été tracé pour identifier les gènes clés liés à l’hypertension.
Validation du modèle diagnostique de l’hypertension
Un modèle de régression logistique a été construit basé sur des gènes clés ; La valeur linéaire prédite (η) a été calculée comme suit :

Le package R pROC16 a été utilisé pour tracer les courbes ROC et évaluer l’efficacité du modèle dans la prédiction du risque d’hypertension. Un nomogramme a été construit via le package R rms23 pour visualiser la contribution de chaque gène clé au modèle de régression logistique (reflétant l’association entre gènes clés et risque d’hypertension). Des courbes d’étalonnage ont été générées pour évaluer la cohérence entre les probabilités d’hypertension prédite et réelles ; L’analyse de la courbe de décision (DCA, paquet R ggDCA24) a été réalisée pour évaluer l’utilité clinique du modèle (bénéfice net) en GSE75360 et GSE74144.
GSEA à un seul gène
GSEA explore le rôle des gènes associés à un gène spécifique dans les processus/voies/maladies biologiques en analysant son expression, aidant à comprendre le rôle fonctionnel du gène. Pour chaque gène focal dans GSE75360, les échantillons ont été divisés à la médiane en groupes à haute et faible expression. Une analyse différentielle de l’expression a ensuite été réalisée sur tous les gènes testés, et les valeurs de logFC à l’échelle du génome ont été classées du plus élevé au plus bas avant GSEA avecclusterProfiler 19. Aucun préfiltrage DEG n’a été appliqué avant GSEA. Paramètres : graine = 2020, 10 à 500 gènes par ensemble (collection de gènes c2 issue de MSigDB21). Critères de dépistage : p < 0,05 (adj. p corrigé via la méthode BH).
Analyse de l’infiltration immunitaire (CIBERSORT)
L’algorithmeCIBERSORT 25 (basé sur la régression linéaire du vecteur de support) a décomplexé la matrice transcriptomique pour estimer la composition des cellules immunitaires dans des échantillons mixtes (les données avec un score d’enrichissement des cellules immunitaires > 0 ont été sélectionnées). La matrice finale d’infiltration des cellules immunitaires de GSE75360 a été visualisée à l’aide d’un graphique à barres proportionnelle. La corrélation de Spearman a été utilisée pour analyser les associations clés entre cellules immunitaires et cellules immunitaires et gène-immunité, avec des résultats présentés respectivement sous forme d’une carte thermique de corrélation (R package pheatmap) et d’un graphique à bulles de corrélation (R package ggplot2).
Réseau d’interaction protéine-protéine (IPP)
Les réseaux PPI sont des systèmes de protéines interconnectées régulant les processus biologiques via des interactions. À l’aide de la base de donnéesSTRING 26, un réseau PPI pour les gènes clés a été construit (score d’interaction minimal : 0,150, faible confiance). Les gènes centraux liés à la rénine-angiotensine ont été sélectionnés par criblage des gènes interactifs. La base de donnéesGeneMANIA 27, qui identifie des gènes fonctionnellement similaires à l’aide de jeux de données génomiques et protéomiques, a été utilisée pour prédire des gènes fonctionnellement similaires de gènes clés du RAS et pour construire un réseau d’interactions protéiques.
Construction du réseau de régulation
Réseau ARNm-TF : Les facteurs de transcription (TF) régulent l’expression génique via l’interaction post-transcriptionnelle avec les gènes cibles. Les TF ciblant les gènes hubs et leurs relations régulatrices ont été récupérées à partir de la base de donnéesChIPBase 28, et le réseau ARNm-TF a été visualisé à l’aide de Cytoscape29.
Réseau ARNm-miARN : les miARN modulent plusieurs gènes cibles (une cible unique peut être co-régulée par plusieurs miARN). StarBase v3.030 a été utilisé pour identifier les miARN associés aux RASRDEG, et le réseau ARNm-miARN a été visualisé via Cytoscape.
Réseau ARNm-médicaments : Les bases de donnéestoxicogénomiques 31 ont été utilisées pour prédire les cibles directes/indirectes des gènes hubs des médicaments. Le réseau ARNm-médicament (montrant les interactions gène-médicament) a été visualisé avec Cytoscape pour compléter la construction du réseau.
Modèle HUVEC induit par Ang II
Les cellules endothéliales de la veine ombilicale humaine (HUVEC) ont été maintenues à 37°C dans un incubateur humidifié avec 5 % deCO-2. Les cellules étaient maintenues dans un milieu de culture cellulaire endothéliale complet, complétés avec du sérum bovin fœtal et des antibiotiques selon les instructions du fournisseur. Pour établir un modèle de lésion endothéliale liée à l’hypertension in vitro, les HUVEC ont été traités avec l’angiotensine II (Ang II ; 100 nM) pendant 48 heures. Des cellules traitées par véhicule ont été utilisées comme groupe témoin.
Pour les expériences d’intervention génique, de petits ARN interférents ciblant CST3 ou FURIN (si-CST3 et si-FURIN), les siRNA témoins négatifs correspondants (si-NC), les plasmides de surexpression CST3 ou FURIN (oe-CST3 et oe-FURIN), ainsi que le contrôle du vecteur vide correspondant (oe-NC) ont été transfectés dans les HUVEC à l’aide d’un réactif commercial de transfection selon le protocole du fabricant. Après la transfection, les cellules étaient exposées à l’Ang II puis prélevées pour validation de l’expression et tests fonctionnels. Les efficacités de knockdown et de surexpression ont été confirmées par la qRT-PCR et le western blotting.
qRT-PCR
L’ARN total a été isolé à partir de HUVEC avec un réactif d’extraction d’ARN standard, et de l’ADN complémentaire a été généré à l’aide d’un kit de transcription inversée. SYBR La chimie verte a été utilisée pour la qRT-PCR. Les niveaux d’expression de LRP1, CTSD, MTHFR, AUTS2, FURIN, CST3, FCER1G, TBXAS1, IL-6, TNF-α, VCAM1, ICAM1 et eNOS ont été normalisés en GAPDH. et calculés par la méthode 2−ΔΔCt .
Plaque western
Pour l’analyse western blot, les protéines ont été extraites avec un tampon de lyse RIPA et quantifiées à l’aide d’un test BCA. Des quantités égales de protéines ont été résolues par SDS-PAGE et transférées dans les membranes de PVDF. Après le blocage, les membranes ont été incubées avec des anticorps primaires contre CST3, FURIN, TBXAS1 ou GAPDH, puis avec des anticorps secondaires appropriés. Les bandes ont été détectées par chimiluminescence, et la densitométrie a été normalisée en GAPDH. Le CST3 sécrété dans des surnatants en culture a été quantifié avec un kit ELISA selon le protocole du fabricant.
Viabilité cellulaire
La viabilité cellulaire a été évaluée à l’aide du test Cell Counting Kit-8 (CCK-8). En résumé, des HUVEC transfectés et traités à l’Ang II ont été ensemencés en plaques de 96 puits, et l’absorption à 450 nm a été mesurée à 0, 24, 48 et 72 h après ajout du réactif CCK-8. La migration cellulaire a été évaluée à l’aide de chambres Transwell. Après les interventions indiquées, les cellules ont été ensemencées dans les chambres supérieures, et les cellules migrées à la surface de la membrane inférieure ont été fixées, colorées et comptées au microscope dans des champs sélectionnés au hasard.
Test inflammatoire
Évaluer l’activation inflammatoire, le stress oxydatif et la fonction endothéliale, ainsi que l’IL-6, le TNF-α, le VCAM1, l’ICAM1 et l’eNOS.Les niveaux d’ARNm ont été détectés par qRT-PCR. Les niveaux d’oxyde nitrique (NO) dans le surnageant en culture ont été mesurés à l’aide d’un kit commercial de test de NO, et les niveaux d’espèces réactives intracellulaires d’oxygène (ROS) ont été détectés à l’aide de fluorescence DCF selon les instructions du fabricant.
Analyse statistique
Le traitement transcriptomique et la modélisation ont été réalisés en R. Des variables continues ont été évaluées pour la normalité avec le test de Shapiro-Wilk. Pour les comparaisons en deux groupes, des tests t à échantillons indépendants étaient utilisés pour les variables normalement distribuées, tandis que les tests de Wilcoxon à somme de rangs étaient utilisés pour les variables non normales. Pour trois groupes ou plus, une analyse unidirectionnelle de la variance avec des tests post-hoc appropriés a été utilisée lorsque la normalité et l’homogénéité des hypothèses de variance étaient remplies ; sinon, le test de Kruskal-Wallis était appliqué. Les données du CCK-8 sur la trajectoire temporelle ont été analysées à l’aide d’une analyse bidirectionnelle de la variance. Les coefficients de corrélation de Spearman ont été calculés pour les analyses d’association. Sauf indication contraire, les résultats expérimentaux sont présentés comme une moyenne ± DS, et un p < à deux queues 0,05 a été considéré comme significatif.