$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Visão geral do fluxo de trabalho de análise
O design geral da análise baseada em transcriptômica e aprendizado de máquina deste estudo é ilustrado na Figura 1, abrangendo etapas chave: coleta de genes relacionados ao Sistema Renina-Angiotensina (RASRGs); triagem de genes diferencialmente expressos relacionados à SAR (RASRDEGs) a partir de conjuntos de dados de hipertensão; análise de enriquecimento funcional (GO/KEGG/GSEA); análise de infiltração imune (CIBERSORT); construção de interação proteína-proteína (PPI) e redes regulatórias; seleção de genes-chave baseada em aprendizado de máquina (regressão logística, floresta aleatória [RF]); e avaliação do modelo diagnóstico de hipertensão. Uma lista completa de softwares, bancos de dados e ferramentas online usadas neste estudo é fornecida na Tabela de Materiais.
Download de dados
Os conjuntos de dados de hipertensão GSE753608 e GSE74144 (Homo sapiens) foram obtidos via o pacote RGEOquery 9 do banco de dadosGEO 10. GSE75360 derivadas de células mononucleares do sangue periférico (plataforma: GPL10558) incluíram 10 amostras de hipertensão e 11 amostras controle; GSE74144 derivadas de glóbulos brancos (plataforma: GPL13497) incluíram 14 amostras de hipertensão e 8 amostras controle (Tabela 1). RASRGs codificadores de proteínas (1.264) foram inicialmente identificados via GeneCards11 (palavra-chave: "Sistema Renina-Angiotensina") e PubMed (palavra-chave: "Sistema Renina-Angiotensina")12,13. A interseção desses RASRGs com genes em GSE75360/GSE74144 resultou em 1.159 RASRGsfinais 14. Os dois conjuntos de dados foram processados separadamente porque foram gerados em plataformas de microarray diferentes. A anotação da sonda foi realizada de acordo com os arquivos correspondentes da plataforma GPL, e matrizes de expressão gênica normalizadas foram usadas para análises posteriores. Diagramas de caixa foram usados para comparar distribuições de expressão antes e depois da normalização.
Genes diferencialmente expressos relacionados à hipertensão renina-angiotensina
As amostras do conjunto de dados GSE75360 foram categorizadas no grupo de hipertensão e no grupo controle. O software limma foi empregado para realizar análises diferenciais de expressão gênica entre os doisgrupos 14, com genes diferencialmente expressos (DEGs) identificados pelo limiar de |logFC| > 0,45 e o valor-p < 0,05. Os resultados dessa análise diferencial foram visualizados por meio de gráficos vulcânicos (gerados usando o pacote R ggplot2).
Para obter RASRDEGs, DEGs que atenderam ao limiar acima (|logFC| > 0,45, valor p < 0,05) foram cruzados com genes relacionados à RAS-Re (RASRGs), e o resultado da interseção foi apresentado via um diagrama de Venn. Subsequentemente, os padrões de expressão dos RASRDEGs identificados foram visualizados como um mapa de calor usando o paqueta Pheatmap do pacote R, e a localização cromossômica dos RASRDEGs foi exibida por meio de mapas cromossômicos gerados usando o pacote RRCircos 15.
Validação diferencialmente expressa de genes e análise da curva ROC
Um gráfico intergrupo foi construído para analisar as diferenças de expressão do RASRDEG entre hipertensão/controle em16 de GSE75360, o pacote R pROC foi usado para plotar curvas ROC e calcular o AUC (0,5–0,7: baixa precisão; 0,7–0,9: moderado; >0,9: alto) para a eficácia diagnóstica do RASRDEG.
Análise de correlação
A análise de correlação de Spearman foi realizada sobre a expressão do RASRDEG em GSE75360; os resultados foram visualizados via mapa de calor (pacote R ggplot2) (|r| < 0,3: correlação nenhuma/fraca; 0,3–0,5: fraca; 0,5–0,8: moderada; >0,8: forte).
Análise de enriquecimento de GO e KEGG
GO (Gene Ontology, release 2024, http://geneontology.org/) é um recurso amplamente utilizado para enriquecimento funcional em larga escala, abrangendo três domínios: processos biológicos (BP), componentes celulares (CC) e funções moleculares (MF)17. KEGG (Kyoto Encyclopedia of Genes and Genomes, Release 109.0, 2024, https://www.genome.jp/kegg/) armazena dados sobre genomas, biovias, doenças e medicamentos18.
Os RASRDEGs foram submetidos à anotação GO e à análise de enriquecimento de vias KEGG usando o cluster Profile19 do pacote R. Método de teste de enriquecimento: teste hipergeométrico; método de correção múltipla de teste: método Benjamini-Hochberg (BH). Critério de triagem: valor p ajustado < 0,05.
Análise de enriquecimento de conjuntos gênicos (GSEA)
Para o GSEA em nível de coorte, todos os genes testados na análise de expressão diferencial de GSE75360 foram classificados em ordem decrescente pelo logFC e usados como lista de genes de entrada para o clusterProfiler19. Nenhum pré-filtro DEG foi aplicado antes do GSEA. A coleção do conjunto de genes c2 do MSigDB20. Parâmetros: semente = 2022, 10–500 genes por conjunto; critérios de triagem: p < corrigido 0,05 (método Benjamini-Hochberg, BH), FDR < 0,2521.
Construção do modelo diagnóstico de hipertensão
Para identificar genes-chave associados à hipertensão, empregamos dois tipos de algoritmos de aprendizado de máquina: regressão logística e florestas aleatórias (RF). Regressão logística (variável dependente binária: hipertensão/controle) fez triagem dos RASRDEGs com p < 0,05. Random Forest (RF, pacote R randomForest): parâmetros set.seed(520), ntree = 1000; MeanDecreaseGini (indicador de importância variável) foi extraído, e os 15 melhores RASRDEGs foram selecionados. Os RASRDEGs foram avaliados com um valor p < 0,05 como padrão.
O algoritmo RF (Random Forest), um método de aprendizado em conjunto sob a categoria de Ensacamento (integrando múltiplas árvores de decisão), foi aplicado via o pacote RrandomForest 22 (parâmetros: set.seed(520), ntree = 1000). MeanDecreaseGini (refletindo a importância variável pela diminuição média da pureza durante a divisão dos nós) dos genes das características foi extraído, e os 15 melhores RASRDEGs foram selecionados. Por fim, um diagrama de Venn dos genes triados por regressão logística e RF foi traçado para identificar genes-chave relacionados à hipertensão.
Validação do modelo diagnóstico de hipertensão
Foi construído um modelo de regressão logística baseado em genes-chave; Valor linear previsto (η) foi calculado como:

O pacote R pROC16 foi usado para traçar curvas ROC e avaliar a eficácia do modelo na previsão do risco de hipertensão. Um nomograma foi construído via o pacote R rms23 para visualizar a contribuição de cada gene chave para o modelo de regressão logística (refletindo a associação entre genes-chave e risco de hipertensão). Curvas de calibração foram geradas para avaliar a consistência entre as probabilidades previstas e reais de hipertensão; A análise da curva de decisão (DCA, pacote R ggDCA24) foi realizada para avaliar a utilidade clínica do modelo (benefício líquido) em GSE75360 e GSE74144.
GSEA de gene único
O GSEA explora o papel dos genes associados a um gene específico em processos/vias/doenças biológicas analisando sua expressão, auxiliando na compreensão do papel funcional do gene. Para cada gene focal em GSE75360, as amostras foram divididas na mediana em grupos de alta e baixa expressão. A análise diferencial de expressão foi então realizada em todos os genes testados, e os valores de logFC em todo o genoma foram classificados do maior ao menor antes do GSEA com o clusterProfiler19. Nenhum pré-filtro DEG foi aplicado antes do GSEA. Parâmetros: semente = 2020, 10–500 genes por conjunto (coleção do conjunto de genes c2 do MSigDB21). Critérios de triagem: p < 0,05 (adj. p corrigido pelo método BH).
Análise de infiltração imune (CIBERSORT)
O algoritmoCIBERSORT 25 (baseado em regressão linear de vetores de suporte) desconvolucionou a matriz do transcriptoma para estimar a composição das células imunes em amostras mistas (dados com escore de enriquecimento de células imunes > 0 foram selecionados). A matriz final de infiltração das células imunes de GSE75360 foi visualizada por meio de um gráfico de barras proporcional. A correlação de Spearman foi usada para analisar as associações chave entre célula imunocelular e célula imune e gene-imune, com resultados apresentados como um mapa de calor de correlação (R package pheatmap) e um gráfico de bolhas de correlação (R package ggplot2), respectivamente.
Rede de interação proteína-proteína (PPI)
Redes PPI são sistemas de proteínas interconectadas que regulam processos biológicos por meio de interações. Usando o banco de dadosSTRING 26, foi construída uma rede PPI para genes-chave (pontuação mínima de interação: 0,150, baixa confiança). Genes centrais relacionados à renina-angiotensina foram selecionados por meio de triagem de genes interagentes. O banco de dadosGeneMANIA 27, que identifica genes funcionalmente semelhantes usando conjuntos de dados genômicos e proteômicos, foi usado para prever genes funcionalmente semelhantes de genes-chave do RAS e para construir uma rede de interação proteica.
Construção da rede regulatória
Rede mRNA-TF: Fatores de transcrição (TFs) regulam a expressão gênica por meio da interação pós-transcricional com os genes-alvo. As TFs que visavam genes hub e suas relações regulatórias foram recuperadas do banco de dadosChIPBase 28, e a rede mRNA-TF foi visualizada usando o Cytoscape29.
Rede mRNA-miRNA: os miRNAs modulam múltiplos genes-alvo (alvos únicos podem ser co-regulados por múltiplos miRNAs). O StarBase v3.030 foi usado para identificar miRNAs associados a RASRDEGs, e a rede mRNA-miRNA foi visualizada via Cytoscape.
Rede de fármacos de mRNA: Os bancos de dadostoxicogenômicos 31 foram usados para prever alvos diretos/indiretos de fármacos dos genes hub. A rede mRNA-fármaco (mostrando interações gene-fármaco) foi visualizada com o Cytoscape para completar a construção da rede.
Modelo HUVEC induzido por Ang II
As células endoteliais da veia umbilicais humana (HUVECs) foram mantidas a 37°C em uma incubadora umidificada com 5% deCO2. As células foram mantidas em meio completo de cultura endotelial com suplemento com soro fetal bovino e antibióticos, conforme as instruções do fornecedor. Para estabelecer um modelo de lesão endotelial relacionada à hipertensão in vitro, os HUVECs foram tratados com angiotensina II (Ang II; 100 nM) por 48 horas. Células tratadas por veículos foram usadas como grupo controle.
Para experimentos de intervenção gênica, pequenos RNAs interferentes direcionados a CST3 ou FURIN (si-CST3 e si-FURIN), os respectivos plasmídeos de controle negativo (si-NC), CST3 ou FURIN (oe-CST3 e oe-FURIN) e o controle de vetor vazio correspondente (oe-NC) foram transfectados em HUVECs usando um reagente comercial de transfecção, conforme o protocolo do fabricante. Após a transfecção, as células foram expostas ao Ang II e então colhidas para validação da expressão e ensaios funcionais. As eficiências de knockdown e superexpressão foram confirmadas por qRT-PCR e western bloting.
qRT-PCR
O RNA total foi isolado de HUVECs com um reagente padrão de extração de RNA, e DNA complementar foi gerado usando um kit de transcrição reversa. SYBR A química verde foi usada para qRT-PCR. Os níveis de expressão de LRP1, CTSD, MTHFR, AUTS2, FURIN, CST3, FCER1G, TBXAS1, IL-6, TNF-α, VCAM1, ICAM1 e eNOS foram normalizados para GAPDH. e calculados pelo método 2−ΔΔCt .
Western blot
Para a análise de western blot, proteínas foram extraídas com tampão de lise RIPA e quantificadas usando um ensaio BCA. Quantidades iguais de proteína foram resolvidas pelo SDS-PAGE e transferidas para as membranas do PVDF. Após o bloqueio, as membranas foram incubadas com anticorpos primários contra CST3, FURIN, TBXAS1 ou GAPDH e, em seguida, com anticorpos secundários adequados. As bandas foram detectadas por quimioluminescência, e a densitometria foi normalizada para GAPDH. O CST3 secretado em supernadantes de cultura foi quantificado com um kit ELISA seguindo o protocolo do fabricante.
Viabilidade celular
A viabilidade celular foi avaliada usando o ensaio Kit de Contagem Celular-8 (CCK-8). Brevemente, HUVECs transfectados e tratados com Ang II foram semeados em placas de 96 poços, e a absorção a 450 nm foi medida em 0, 24, 48 e 72 horas após a adição do reagente CCK-8. A migração celular foi avaliada usando câmaras Transwell. Após as intervenções indicadas, as células foram semeadas nas câmaras superiores, e as células migradas na superfície inferior da membrana foram fixadas, coradas e contadas ao microscópio em campos selecionados aleatoriamente.
Teste inflamatório
Avaliar ativação inflamatória, estresse oxidativo e função endotelial, IL-6, TNF-α, VCAM1, ICAM1 e eNOS.Os níveis de mRNA foram detectados por qRT-PCR. Os níveis de óxido nítrico (NO) no supernadante da cultura foram medidos usando um kit comercial de ensaio de NO, e os níveis de espécies reativas intracelulares de oxigênio (ROS) foram detectados usando fluorescência DCF conforme as instruções do fabricante.
Análise estatística
O processamento e a modelagem transcriptômica foram realizados em R. Variáveis contínuas foram avaliadas quanto à normalidade com o teste de Shapiro-Wilk. Para comparações em dois grupos, testes t de amostras independentes foram usados para variáveis normalmente distribuídas, enquanto testes de soma de ranks de Wilcoxon foram usados para variáveis não normais. Para três ou mais grupos, foi utilizada uma análise unidirecional da variância com testes post-hoc apropriados quando as suposições de normalidade e homogeneidade da variância foram atendidas; caso contrário, o teste de Kruskal-Wallis era aplicado. Os dados do curso temporal do CCK-8 foram analisados usando análise bidirecional da variância. Coeficientes de correlação de Spearman foram calculados para análises de associação. Salvo indicação em contrário, os resultados experimentais são apresentados como média ± DS, e p < de duas caudas 0,05 foi considerado significativo.