Os conjuntos de dados públicos do Gene Expression Omnibus (GEO) analisados neste estudo continham dados transcriptômicos desidentificados de estudos previamente publicados e não exigiram aprovação ética adicional. O Comitê de Ética da Universidade Huaihua aprovou o estudo independente de validação por PCR quantitativa de transcrição reversa (qRT-PCR) em tecido pulmonar humano (número de aprovação: 2024(A05112)). O consentimento informado por escrito foi obtido de todos os participantes ou de seus representantes legalmente autorizados antes da coleta das amostras. Os procedimentos de aprovação e consentimento aplicaram-se a todas as 20 amostras de tecido pulmonar de hipertensão arterial pulmonar (PAH) e 20 amostras de controle incluídas na validação por qRT-PCR. As ferramentas de pesquisa utilizadas neste protocolo estão listadas na Tabela de Materiais.
1. Coleta e pré-processamento de conjuntos de dados transcriptômicos públicos
Conjuntos de dados de microarranjos relacionados à hipertensão pulmonar (HP) GSE22356, GSE33463 e GSE48149 foram obtidos a partir do banco de dados GEO. Amostras de HP/hipertensão arterial pulmonar (HAP) e controles foram extraídas de acordo com as anotações fenotípicas originais. Matrizes de expressão e arquivos de anotação da plataforma foram baixados usando scripts reprodutíveis em R e o pacote GEOquery.
A anotação das sondas e a associação aos símbolos gênicos foram realizadas de forma consistente entre os conjuntos de dados. Quando múltiplas sondas correspondiam ao mesmo gene, o valor médio de expressão foi calculado. Foi aplicada normalização por quantis, e os genes com baixa expressão ou baixa variância foram removidos. Os conjuntos de dados foram combinados, e os efeitos de lote foram corrigidos utilizando o algoritmo ComBat do pacote sva8. A correção foi avaliada por meio de boxplots e análise de componentes principais.
2. Identificação de genes diferencialmente expressos
O pacote limma foi utilizado para comparar os níveis de expressão entre amostras de PH e controles na matriz de expressão corrigida por lote9. Um modelo linear foi ajustado e estatísticas Bayesiana empíricas foram aplicadas. Os genes diferencialmente expressos foram definidos utilizando um valor de P ajustado <0,05 e uma mudança absoluta no log2 da razão > 0,585. Os resultados foram visualizados usando gráficos de vulcão e mapas de calor.
3. Construção da rede de coexpressão gênica ponderada
Uma rede de coexpressão gênica ponderada foi construída utilizando o pacote WGCNA10. A clusterização de amostras foi realizada para detectar valores atípicos. A potência de limiarização suave foi selecionada com base no índice de ajuste à topologia livre de escala. Os módulos gênicos foram identificados utilizando o algoritmo de corte dinâmico de árvores. Os eigengenes dos módulos foram correlacionados com o fenótipo de HP, e o módulo associado à doença com a correlação mais forte foi selecionado. Os genes no módulo principal foram intersectados com os genes diferencialmente expressos para obter os genes de consenso.
4. Análise de enriquecimento funcional
As categorias de processo biológico, componente celular e função molecular da Gene Ontology foram analisadas utilizando o clusterProfiler11. Foi realizada a análise de enriquecimento de vias do Kyoto Encyclopedia of Genes and Genomes para identificar vias de sinalização12. Um valor de P < 0,05 e um valor de q < 0,2 foram utilizados como limiares de enriquecimento, e os termos enriquecidos foram visualizados utilizando gráficos de bolhas11.
5. Construção da rede de interação proteína-proteína e identificação de genes centrais
A lista consenso de genes foi submetida ao banco de dados STRING, com Homo sapiens selecionado como a espécie e um limiar de confiança de interação > 0,413. O arquivo de interação foi importado para o Cytoscape, e o plug-in CytoHubba foi utilizado para classificar os genes pelo grau do nó. Os genes altamente conectados foram definidos como genes centrais.
6. Seleção de genes com características diagnósticas utilizando aprendizado de máquina
Três algoritmos independentes de seleção de características foram aplicados. Primeiro, realizou-se uma regressão logística com operador de redução e seleção por módulo mínimo utilizando o pacote glmnet e validação cruzada com 10 dobras para identificar genes com coeficientes não nulos14. Segundo, aplicou-se a eliminação recursiva de características com máquinas de vetores de suporte para remover características redundantes e selecionar o subconjunto de características que alcançou a maior precisão na validação cruzada15. Terceiro, construiu-se um modelo de floresta aleatória, e as características foram classificadas com base na diminuição média da impureza de Gini16. A intersecção dos conjuntos de genes derivados dos três algoritmos foi utilizada para definir o conjunto final de genes característicos centrais. O pacote pROC foi utilizado para gerar curvas de característica operacional do receptor e calcular os valores da área sob a curva17.
7. Validação de genes centrais utilizando conjuntos de dados independentes de bulk e de célula única
GSE117261 foi utilizado como uma coorte externa independente de validação de tecido pulmonar, contendo 58 amostras de HAP e 25 amostras de controle de doadores falecidos18. Este conjunto de dados não foi utilizado na análise de descoberta de expressão diferencial, na construção da rede de coexpressão gênica ponderada ou na seleção de características por aprendizado de máquina. A matriz de expressão foi normalizada e anotada, e a expressão diferencial foi analisada usando o limma v3.68.0. A correção da taxa de falsa descoberta de Benjamini-Hochberg foi aplicada em todo o transcriptoma anotado. Curvas de característica operacional do receptor (ROC) para genes individuais foram calculadas usando o pROC v1.19.0.1, intervalos de confiança de 95% de DeLong e pontos de corte do índice de Youden. Um modelo exploratório de regressão logística com cinco genes foi ajustado dentro do GSE117261, e seu desempenho interno foi adicionalmente avaliado usando validação cruzada aninhada repetida.
O GSE210248 (Tabela 1) foi utilizado como conjunto de dados de validação de artéria pulmonar em nível de célula única, contendo amostras de três pacientes com HAP e três doadores saudáveis19. Os dados foram processados usando o Seurat v5.5.1 para controle de qualidade, normalização, redução de dimensionalidade, agrupamento e anotação celular20. Foram identificadas as principais populações celulares, incluindo células endoteliais, células musculares lisas, fibroblastos, monócitos/macrófagos e células T/células natural killer. A comunicação célula-célula foi analisada usando o CellChat v2.1.2 e a base de dados de ligantes-receptores CellChatDB.human21. Um objeto CellChat foi criado a partir da matriz de expressão normalizada do Seurat e dos metadados de tipo celular. Foram identificados genes superexpressos e interações ligante-receptor; as probabilidades de comunicação foram calculadas; foram removidas interações envolvendo grupos celulares com menos de 10 células; e foram inferidas e agregadas redes de comunicação em nível de vias. Este conjunto de dados foi utilizado apenas para validação mecanicista externa e não para o treinamento do modelo.
| Item | Descrição |
| Conjunto de dados | GSE210248 |
| Tipo de dado | Sequenciamento de RNA de célula única baseado em microgotas da 10x Genomics; perfilagem transcriptômica de alto rendimento |
| Amostras humanas | Três amostras de artéria pulmonar de PAH e três amostras de artéria pulmonar de doadores saudáveis |
| Origem do tecido | Tecido de artéria pulmonar ex vivo, refletindo principalmente a ecologia celular da parede vascular pulmonar e o processo de remodelação vascular |
| Objetivo analítico principal | Localização do tipo celular, mudança fenotípica de células musculares lisas, comunicação entre células imunes e estruturais, e validação da consistência mecanicista de genes candidatos |
Tabela 1: Informações básicas do conjunto de dados de validação de célula única GSE210248. A tabela resume o acesso ao conjunto de dados, plataforma de sequenciamento, origem do tecido, composição da amostra e finalidade analítica da análise de validação de artéria pulmonar em célula única.
8. Validação da expressão gênica por qRT-PCR
A validação por qRT-PCR incluiu 20 amostras de tecido pulmonar de pacientes com PH/PAH independentes do ponto de vista biológico e 20 amostras de controle de tecido pulmonar independentes do ponto de vista biológico. O RNA total foi extraído utilizando o Kit de Extração de RNA Total. A concentração e a pureza do RNA foram avaliadas por meio de um espectrofotômetro, e a integridade do RNA foi analisada por eletroforese em gel de agarose. Somente amostras de RNA com valores de A260/280 entre 1,8 e 2,1 e sem degradação visível foram incluídas.
Quantidades iguais de RNA foram transcritas reversamente em DNA complementar utilizando o Kit Solarbio Universal RT-PCR (AMV; número de catálogo RP1200). A PCR quantitativa para CXCL10, JUN, IFIH1, MX1 e TLR7 foi realizada utilizando o SYBR Green PCR Master Mix em um Sistema de PCR em Tempo Real. Cada amostra biológica foi analisada em três réplicas técnicas, juntamente com controles sem molde e sem transcrição reversa. O valor médio de Ct das três réplicas técnicas foi utilizado para a análise subsequente; as réplicas técnicas não foram tratadas como observações independentes. Foram utilizados primers que abrangem junções exon-exon e produzem amplicons de 80–200 pb (Tabela 2). A especificidade dos primers foi verificada utilizando o NCBI Primer-BLAST e análise da curva de dissociação22.
A β-actina (ACTB) foi utilizada como gene de referência interno para normalizar os níveis de expressão dos genes-alvo. A expressão relativa foi calculada utilizando o método 2-ΔΔCt23. Testes Mann-Whitney U bicaudais foram utilizados para comparações entre grupos com base na distribuição dos dados, e foi aplicada a correção da taxa de falsas descobertas de Benjamini-Hochberg entre os cinco genes. Curvas ROC de um único gene foram geradas com intervalos de confiança de 95% de DeLong, e os pontos de corte ótimos foram selecionados utilizando o índice de Youden. O modelo de regressão logística de cinco genes foi inicialmente ajustado e avaliado nas mesmas 40 amostras biológicas; essa estimativa foi, portanto, definida como o desempenho aparente dentro da amostra. Para avaliar o possível superajuste, foram realizadas 100 repetições de validação cruzada estratificada em cinco partes utilizando um modelo de regressão logística com regularização L2, e o desempenho ROC combinado fora das dobras foi calculado.
| Gene | Acesso RefSeq | Primer sentido (5′–3′) | Primer antissentido (5′–3′) | Tamanho do produto (pb) | Tm (°C) | Com travessia de éxon |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Sim |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Sim |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Sim |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Sim |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Sim |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Sim |
Tabela 2: Sequências de iniciadores utilizadas para PCR quantitativa de transcrição reversa. A tabela lista os genes-alvo, números de acesso RefSeq, sequências dos iniciadores direto e reverso, tamanhos dos produtos, temperaturas de fusão e status de abrangência de éxons dos iniciadores utilizados para qRT-PCR.
9. Triagem de compostos candidatos e acoplamento molecular
As assinaturas de genes centrais reguladas para cima e para baixo foram submetidas ao banco de dados Connectivity Map para identificar moléculas pequenas previstas para reverter o perfil de expressão associado à HP7. Os candidatos foram classificados pelo escore Logit e pela probabilidade de predição.
A estrutura tridimensional da BRD-K91900765/VX-745 foi obtida do PubChem sob o CID 303852524. Informações farmacológicas relacionadas ao composto foram compiladas a partir de bancos de dados públicos de fármacos, e descritores estruturais foram calculados utilizando o DrugBank e o SwissADME25,26. As estruturas proteicas foram obtidas do Banco de Dados de Estruturas Proteicas RCSB utilizando os seguintes identificadores PDB: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; e MAPK14/p38α, 1OUK27. A detecção cega de cavidades e o encaixe molecular foram realizados usando o CB-Dock2 v2.0 com o mecanismo de pontuação AutoDock Vina v1.2.028,29. Os arquivos da proteína e do ligante foram enviados ao CB-Dock2, cavidades candidatas foram detectadas automaticamente, e o encaixe foi realizado dentro das caixas específicas para cada cavidade geradas pelo servidor. Para cada proteína, foram registrados o identificador da cavidade, a pontuação Vina, o volume da cavidade, o centro da caixa de encaixe, as dimensões da caixa de encaixe e o arquivo do complexo proteína-ligante. A conformação com a pontuação Vina mais negativa foi selecionada como a conformação prevista de melhor classificação. MAPK14/p38α foi incluída como o alvo farmacológico estabelecido e proteína de referência positiva para o encaixe do VX-745. O encaixe contra CXCL10, JUN, IFIH1, MX1 e TLR7 foi exploratório e não foi interpretado como evidência de direcionamento farmacológico direto, ligação, inibição ou eficácia.
10. Análise estatística e controle de reprodutibilidade
Todas as análises estatísticas foram realizadas em R, salvo indicação em contrário. Valores de P bicaudais < 0,05 foram considerados estatisticamente significativos. A correção para múltiplos testes foi aplicada às análises de expressão diferencial, enriquecimento, validação externa e qRT-PCR conforme especificado acima. A validação cruzada foi utilizada para avaliar a estabilidade dos modelos de aprendizado de máquina e combinados de qRT-PCR.