$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Visión general del flujo de trabajo de análisis
El diseño general del análisis transcriptómico y basado en aprendizaje automático de este estudio se ilustra en la Figura 1, que abarca pasos clave: recogida de genes relacionados con el Sistema Renina-Angiotensina (RASRGs); cribado de genes diferencialmente expresados relacionados con el SAR (RASRDEGs) a partir de conjuntos de datos de hipertensión; análisis de enriquecimiento funcional (GO/KEGG/GSEA); análisis de infiltración inmune (CIBERSORT); la construcción de interacción proteína-proteína (PPI) y redes reguladoras; selección de genes clave basada en aprendizaje automático (regresión logística, bosque aleatorio [RF]); y la evaluación del modelo diagnóstico de hipertensión. Una lista completa de software, bases de datos y herramientas online utilizadas en este estudio se proporciona en la Tabla de Materiales.
Descarga de datos
Los conjuntos de datos de hipertensión GSE753608 y GSE74144 (Homo sapiens) se obtuvieron mediante el paquete RGEOquery 9 de la base de datosGEO 10. GSE75360 derivadas de células mononucleares de sangre periférica (plataforma: GPL10558) incluyeron 10 muestras de hipertensión y 11 muestras de control; GSE74144 derivadas de glóbulos blancos (plataforma: GPL13497) incluyeron 14 muestras de hipertensión y 8 muestras de control (Tabla 1). Los RASRGs codificadores de proteínas (1.264) fueron identificados inicialmente mediante GeneCards11 (palabra clave: "Sistema Renina-Angiotensina") y PubMed (palabra clave: "Sistema Renina-Angiotensina")12,13. La intersección de estos RASRGs con genes en GSE75360/GSE74144 produjo 1.159 RASRGsfinales 14. Los dos conjuntos de datos se procesaron por separado porque se generaron en diferentes plataformas de microarrays. La anotación de la sonda se realizó según los archivos de anotación correspondientes de la plataforma GPL, y se usaron matrices de expresión génica normalizadas para análisis posteriores. Se usaron diagramas de caja para comparar distribuciones de expresión antes y después de la normalización.
Genes diferencialmente expresados diferencialmente relacionados con renina-angiotensina relacionados con hipertensión
Las muestras del conjunto de datos GSE75360 se clasificaron en grupo de hipertensión y grupo de control. El software limma se empleó para realizar análisis diferenciales de expresión génica entre los dosgrupos 14, identificando genes diferencialmente expresados (DEGs) mediante el umbral de |logFC| > 0,45 y el valor p < 0,05. Los resultados de este análisis diferencial se visualizaron mediante gráficos de volcán (generados usando el paquete R ggplot2).
Para obtener los RASRDEGs, los DEGs que cumplían el umbral anterior (|logFC| > 0,45, valor p < 0,05) se cruzaron con genes relacionados con el RAS (RASRGs), y el resultado de la intersección se presentó mediante un diagrama de Venn. Posteriormente, los patrones de expresión de los RASRDEGs identificados se visualizaron como un mapa de calor usando el paquete R pheatmap, y la localización cromosómica de los RASRDEGs se mostró mediante mapas cromosómicos generados con el paquete RRCircos 15.
Validación génica diferencialmente expresada y análisis de curvas ROC
Se construyó un gráfico intergrupal para analizar las diferencias de expresión de RASRDEG entre hipertensión/control en GSE7536016, se utilizó el paquete R pROC para trazar curvas ROC y calcular AUC (0,5–0,7: baja precisión; 0,7–0,9: moderado; >0,9: alto) para la eficacia diagnóstica de RASRDEG.
Análisis de correlación
El análisis de correlación de Spearman se realizó sobre la expresión de RASRDEG en GSE75360; los resultados se visualizaron mediante mapa de calor (paquete R ggplot2) (|r| < 0,3: correlación nula/débil; 0,3–0,5: débil; 0,5–0,8: moderada; >0,8: fuerte).
Análisis de enriquecimiento de GO y KEGG
GO (Gene Ontology, publicación 2024, http://geneontology.org/) es un recurso ampliamente utilizado para el enriquecimiento funcional a gran escala, que abarca tres dominios: procesos biológicos (BP), componentes celulares (CC) y funciones moleculares (MF)17. KEGG (Kyoto Encyclopedia of Genes and Genomes, Release 109.0, 2024, https://www.genome.jp/kegg/) almacena datos sobre genomas, biovías, enfermedades yfármacos 18.
Los RASRDEG fueron sometidos a anotación GO y análisis de enriquecimiento de vías KEGG utilizando el paquete R clusterProfiler19. Método de prueba de enriquecimiento: prueba hipergeométrica; método de corrección de pruebas múltiples: método Benjamini-Hochberg (BH). Criterio de cribado: valor p ajustado < 0,05.
Análisis de enriquecimiento de conjuntos génicos (GSEA)
Para GSEA a nivel de cohorte, todos los genes analizados en el análisis de expresión diferencial de GSE75360 fueron clasificados en orden descendente según logFC y se utilizaron como lista de genes de entrada para el Profiler19 del clúster. No se aplicó prefiltrado DEG antes de GSEA. La colección del conjunto de genes C2 de MSigDB20. Parámetros: semilla = 2022, 10–500 genes por conjunto; criterios de cribado: p < corregido 0,05 (método Benjamini-Hochberg, BH), FDR < 0,2521.
Construcción del modelo diagnóstico de hipertensión
Para identificar genes clave asociados con la hipertensión, empleamos dos tipos de algoritmos de aprendizaje automático: regresión logística y bosques aleatorios (RF). La regresión logística (variable dependiente binaria: hipertensión/control) evaluó los RASRDEG con p < 0,05. Random Forest (RF, paquete R randomForest): parámetros set.seed(520), ntree = 1000; Se extrajo MeanDecreaseGini (indicador de importancia variable) y se seleccionaron los 15 mejores RASRDEGs. Los RASRDEG se examinaron con un valor p < 0,05 como estándar.
El algoritmo RF (Random Forest), un método de aprendizaje en conjunto bajo la categoría de Encapsulamiento (integrando múltiples árboles de decisión), se aplicó mediante el paquete RrandomForest 22 (parámetros: set.seed(520), ntree = 1000). Se extrajo MeanDecreaseGini (que refleja la importancia variable por la disminución media de la pureza durante la división de nodos) de los genes de características, y se seleccionaron los 15 mejores RASRDEGs. Finalmente, se graficó un diagrama de Venn de genes cribados mediante regresión logística y RF para identificar genes clave relacionados con la hipertensión.
Validación del modelo diagnóstico de hipertensión
Se construyó un modelo de regresión logística basado en genes clave; El valor predicho lineal (η) se calculó como:

El paquete R pROC16 se utilizó para representar curvas ROC y evaluar la eficacia del modelo en la predicción del riesgo de hipertensión. Se construyó un nomograma mediante el paquete R rms23 para visualizar la contribución de cada gen clave al modelo de regresión logística (reflejando la asociación entre genes clave y riesgo de hipertensión). Se generaron curvas de calibración para evaluar la consistencia entre las probabilidades de hipertensión predichas y reales; Se realizó análisis de la curva de decisión (DCA, paquete R ggDCA24) para evaluar la utilidad clínica del modelo (beneficio neto) en GSE75360 y GSE74144.
GSEA de un solo gen
GSEA explora el papel de los genes asociados a un gen específico en procesos/vías/enfermedades biológicas analizando su expresión, ayudando a comprender el papel funcional del gen. Para cada gen focal en GSE75360, las muestras se dividieron en la mediana en grupos de alta y baja expresión. Posteriormente se realizó un análisis de expresión diferencial en todos los genes probados, y los valores de logFC a nivel genómico se clasificaron de mayor a menor antes de GSEA con clusterProfiler19. No se aplicó prefiltrado DEG antes de GSEA. Parámetros: semilla = 2020, 10–500 genes por conjunto (colección de conjuntos de genes c2 de MSigDB21). Criterios de cribado: p < 0,05 (adj. p corregida mediante el método BH).
Análisis de infiltración inmune (CIBERSORT)
El algoritmoCIBERSORT 25 (basado en regresión lineal de vectores de soporte) desconvolució la matriz transcriptoma para estimar la composición de las células inmunitarias en muestras mixtas (se seleccionaron datos con puntuación de enriquecimiento de células inmunitarias > 0). La matriz final de infiltración de células inmunitarias de GSE75360 se visualizó mediante un gráfico de barras proporcional. La correlación de Spearman se utilizó para analizar las asociaciones clave entre células inmunitarias y célula inmune y genes y células inmunes, presentándose los resultados como un mapa de calor de correlación (R package pheatmap) y un gráfico de burbujas de correlación (R package ggplot2), respectivamente.
Red de interacción proteína-proteína (IBP)
Las redes de IBP son sistemas de proteínas interconectadas que regulan procesos biológicos mediante interacciones. Utilizando la base de datosSTRING 26, se construyó una red PPI para genes clave (puntuación mínima de interacción: 0,150, baja confianza). Los genes hub relacionados con renina-angiotensina se seleccionaron mediante el cribado de genes interactuantes. La base de datosGeneMANIA 27, que identifica genes funcionalmente similares utilizando conjuntos de datos genómicos y proteómicos, se utilizó para predecir genes funcionalmente similares de genes clave de RAS y para construir una red de interacción proteica.
Construcción de la red reguladora
Red ARNm-TF: Los factores de transcripción (TF) regulan la expresión génica mediante la interacción post-transcripcional con los genes objetivo. Los TF dirigidos a genes hub y sus relaciones regulatorias se recuperaron de la base de datosChIPBase 28, y la red mRNA-TF se visualizó usando Cytoscape29.
Red de ARNm-miARN: los miARN modulan múltiples genes objetivo (un solo objetivo puede estar co-regulado por múltiples miARN). Se utilizó StarBase v3.030 para identificar miARN asociados con RASRDEGs, y la red de ARNm-miARN se visualizó mediante Cytoscape.
Red de ARNm-fármacos: Se utilizaron las bases de datostoxicogenómicas 31 para predecir objetivos directos/indirectos de fármacos de genes centrales. La red ARNm-fármaco (que muestra interacciones génico-fármaco) se visualizó con Cytoscape para completar la construcción de la red.
Modelo HUVEC inducido por Ang II
Las células endoteliales de la vena umbilical, humanas, se mantuvieron a 37°C en una incubadora humidificada con un 5% deCO2. Las células se mantuvieron en un medio completo de cultivo endotelial suplementado con suero fetal bovino y antibióticos según las instrucciones del proveedor. Para establecer un modelo de lesión endotelial relacionada con la hipertensión in vitro, los HUVEC fueron tratados con angiotensina II (Ang II; 100 nM) durante 48 horas. Se utilizaron células tratadas con vehículos como grupo de control.
Para experimentos de intervención génica, pequeños ARN interferentes dirigidos a CST3 o FURIN (si-CST3 y si-FURIN), siRNA de control negativo correspondiente (si-NC), clásmidos de sobreexpresión de CST3 o FURIN (oe-CST3 y oe-FURIN), y el control de vector vacío correspondiente (oe-NC) se transfectaron en HUVECs utilizando un reactivo de transfección comercial según el protocolo del fabricante. Tras la transfección, las células se expusieron a Ang II y luego se extrajeron para validación de la expresión y ensayos funcionales. Las eficiencias de knockdown y sobreexpresión se confirmaron mediante qRT-PCR y western bloting.
qRT-PCR
El ARN total se aisló de HUVECs con un reactivo estándar de extracción de ARN, y se generó ADN complementario utilizando un kit de transcripción inversa. SYBR Se utilizó química verde para qRT-PCR. Los niveles de expresión de LRP1, CTSD, MTHFR, AUTS2, FURIN, CST3, FCER1G, TBXAS1, IL-6, TNF-α, VCAM1, ICAM1 y eNOS se normalizaron a GAPDH. y se calcularon mediante el método 2−ΔΔCt .
Western blot
Para el análisis western blot, las proteínas se extrajeron con tampón de lisis RIPA y se cuantificaron mediante un ensayo BCA. Se resolvieron cantidades iguales de proteínas mediante SDS-PAGE y se transfirieron a las membranas de PVDF. Tras el bloqueo, se incubaron membranas con anticuerpos primarios contra CST3, FURIN, TBXAS1 o GAPDH y luego con anticuerpos secundarios adecuados. Las bandas se detectaban mediante quimioluminiscencia y la densitometría se normalizaba a GAPDH. El CST3 secretado en supernadantes de cultivo se cuantificó con un kit ELISA siguiendo el protocolo del fabricante.
Viabilidad celular
La viabilidad celular se evaluó utilizando el ensayo Kit de Recuento Celular-8 (CCK-8). Brevemente, se sembraron HUVECs transfectados y tratados con Ang II en placas de 96 pozos, y la absorbancia a 450 nm se midió a 0, 24, 48 y 72 horas tras la adición del reactivo CCK-8. La migración celular se evaluó utilizando cámaras Transwell. Tras las intervenciones indicadas, las células se siembraron en las cámaras superiores y las células migradas en la superficie inferior de la membrana fueron fijadas, teñidas y contadas bajo un microscopio en campos seleccionados al azar.
Prueba inflamatoria
Evaluar la activación inflamatoria, el estrés oxidativo y la función endotelial, IL-6, TNF-α, VCAM1, ICAM1 y eNOS.Los niveles de ARNm se detectaron mediante qRT-PCR. Los niveles de óxido nítrico (NO) en el sobrenadante del cultivo se midieron utilizando un kit comercial de ensayo de NO, y los niveles de especies reactivas intracelulares de oxígeno (ROS) se detectaron mediante fluorescencia DCF según las instrucciones del fabricante.
Análisis estadístico
Se realizaron procesamientos y modelados transcriptómicos en R. Se evaluaron variables continuas para comprobar su normalidad con la prueba de Shapiro-Wilk. Para comparaciones de dos grupos, se usaron pruebas t de muestras independientes para variables distribuidas normalmente, mientras que para variables no normales se emplearon pruebas de suma de rangos de Wilcoxon. Para tres o más grupos, se utilizó un análisis unidireccional de la varianza con pruebas a posteriori adecuadas cuando se cumplían las suposiciones de normalidad y homogeneidad de la varianza; de lo contrario, se aplicó la prueba de Kruskal-Wallis. Los datos de curso temporal de CCK-8 se analizaron mediante análisis bidireccional de la varianza. Se calcularon coeficientes de correlación de Spearman para análisis de asociación. Salvo que se indique lo contrario, los resultados experimentales se muestran como media ± DS, y se consideró significativo p < 0,05 de dos colas.