Los conjuntos de datos públicos del Gene Expression Omnibus (GEO) analizados en este estudio contenían datos transcriptómicos desidentificados de estudios previamente publicados y no requirieron aprobación ética adicional. El Comité de Ética de la Universidad Huaihua aprobó el estudio independiente de validación mediante reacción en cadena de la polimerasa con retrotranscripción cuantitativa (qRT-PCR) en tejido pulmonar humano (número de aprobación: 2024(A05112)). Se obtuvo consentimiento informado por escrito de todos los participantes o de sus representantes legalmente autorizados antes de la recolección de muestras. Los procedimientos de aprobación y consentimiento se aplicaron a todas las 20 muestras de tejido pulmonar de pacientes con hipertensión arterial pulmonar (PAH) y a las 20 muestras de control incluidas en la validación mediante qRT-PCR. Las herramientas de investigación utilizadas para este protocolo se enumeran en la Tabla de Materiales.
1. Recolección y preprocesamiento de conjuntos de datos transcriptómicos públicos
Los conjuntos de datos de microarreglos relacionados con hipertensión pulmonar (PH) GSE22356, GSE33463 y GSE48149 se obtuvieron de la base de datos GEO. Las muestras de PH/hipertensión arterial pulmonar (PAH) y controles se extrajeron según las anotaciones fenotípicas originales. Las matrices de expresión y los archivos de anotación de la plataforma se descargaron utilizando scripts reproducibles en R y el paquete GEOquery.
Se realizó de manera consistente la anotación de sondas y la asignación de símbolos génicos en todos los conjuntos de datos. Cuando múltiples sondas se asignaban al mismo gen, se calculó el valor medio de expresión. Se aplicó la normalización por cuantiles y se eliminaron los genes con baja expresión o baja varianza. Los conjuntos de datos se combinaron y los efectos de lote se corrigieron utilizando el algoritmo ComBat del paquete sva8. La corrección se evaluó mediante diagramas de caja y análisis de componentes principales.
2. Identificación de genes diferencialmente expresados
Se utilizó el paquete limma para comparar los niveles de expresión entre muestras de PH y controles en la matriz de expresión corregida por lotes9. Se ajustó un modelo lineal y se aplicaron estadísticas bayesianas empíricas. Los genes diferencialmente expresados se definieron utilizando un valor de P ajustado <0.05 y un cambio absoluto en el log2 de la razón > 0.585. Los resultados se visualizaron mediante gráficos de volcan y mapas de calor.
3. Construcción de la red de coexpresión génica ponderada
Se construyó una red de coexpresión génica ponderada utilizando el paquete WGCNA10. Se realizó la agrupación de muestras para detectar valores atípicos. Se seleccionó la potencia de umbralización suave en función del índice de ajuste a la topología libre de escala. Se identificaron módulos génicos mediante el algoritmo de corte dinámico de árboles. Se correlacionaron los eigengenes de los módulos con el fenotipo de HP, y se seleccionó el módulo asociado a la enfermedad con la correlación más fuerte. Los genes del módulo clave se intersectaron con los genes diferencialmente expresados para obtener los genes de consenso.
4. Análisis de enriquecimiento funcional
Se analizaron las categorías de proceso biológico, componente celular y función molecular de Gene Ontology utilizando clusterProfiler11. Se realizó un análisis de enriquecimiento de vías de la Enciclopedia de Kyoto de Genes y Genomas para identificar las vías de señalización12. Se utilizaron un valor de P < 0,05 y un valor de q < 0,2 como umbrales de enriquecimiento, y los términos enriquecidos se visualizaron mediante gráficos de burbujas11.
5. Construcción de la red de interacciones proteína-proteína e identificación de genes centrales
La lista consenso de genes se envió a la base de datos STRING, seleccionando Homo sapiens como especie y un umbral de confianza en la interacción > 0,413. El archivo de interacciones se importó a Cytoscape, y se utilizó el complemento CytoHubba para clasificar los genes según el grado del nodo. Los genes altamente conectados se definieron como genes centrales.
6. Selección de genes característicos diagnósticos mediante aprendizaje automático
Se aplicaron tres algoritmos independientes de selección de características. Primero, se realizó una regresión logística mediante el operador de contracción y selección de mínimos absolutos utilizando el paquete glmnet y validación cruzada de 10 grupos para identificar genes con coeficientes distintos de cero14. Segundo, se aplicó la eliminación recursiva de características con máquinas de vectores de soporte para eliminar características redundantes y seleccionar el subconjunto de características que alcanzó la mayor precisión en la validación cruzada15. Tercero, se construyó un modelo de bosque aleatorio y las características se clasificaron según la disminución media de la impureza de Gini16. Se utilizó la intersección de los conjuntos de genes derivados de los tres algoritmos para definir el conjunto final de genes característicos principales. El paquete pROC se empleó para generar curvas de característica operativa del receptor y calcular los valores del área bajo la curva17.
7. Validación de genes centrales utilizando conjuntos de datos independientes de muestras agrupadas y de célula individual
GSE117261 se utilizó como una cohorte externa e independiente de validación en tejido pulmonar que contenía 58 muestras de HAP y 25 muestras de controles de donantes fallidos18. Este conjunto de datos no se utilizó en el análisis de expresión diferencial de descubrimiento, la construcción de la red de coexpresión génica ponderada ni en la selección de características mediante aprendizaje automático. La matriz de expresión fue normalizada y anotada, y el análisis de expresión diferencial se realizó utilizando limma v3.68.0. Se aplicó la corrección de la tasa de falsos descubrimientos de Benjamini-Hochberg en todo el transcriptoma anotado. Las curvas de característica operativa del receptor (ROC) para un solo gen se calcularon utilizando pROC v1.19.0.1, intervalos de confianza del 95 % de DeLong y puntos de corte del índice de Youden. Se ajustó un modelo exploratorio de regresión logística de cinco genes dentro de GSE117261, y su rendimiento interno se evaluó adicionalmente mediante validación cruzada anidada repetida.
GSE210248 (Tabla 1) se utilizó como conjunto de datos de validación a nivel de célula individual de la arteria pulmonar que contiene muestras de tres pacientes con HAP y tres donantes sanos19. Los datos se procesaron utilizando Seurat v5.5.1 para el control de calidad, la normalización, la reducción de dimensionalidad, la agrupación en clústeres y la anotación celular20. Se identificaron las principales poblaciones celulares, incluyendo células endoteliales, células musculares lisas, fibroblastos, monocitos/macrófagos y células T/células asesinas naturales. La comunicación entre células se analizó utilizando CellChat v2.1.2 y la base de datos de ligandos y receptores CellChatDB.human21. Se creó un objeto CellChat a partir de la matriz de expresión normalizada de Seurat y los metadatos de tipo celular. Se identificaron genes sobrerexpresados e interacciones de ligando-receptor; se calcularon las probabilidades de comunicación; se eliminaron las interacciones que involucraban grupos celulares con menos de 10 células; y se infirieron y agregaron redes de comunicación a nivel de vía. Este conjunto de datos se utilizó únicamente para la validación mecanicista externa y no para el entrenamiento del modelo.
| Elemento | Descripción |
| Conjunto de datos | GSE210248 |
| Tipo de datos | Secuenciación de ARN unicelular basada en gotas de 10x Genomics; perfilado transcriptómico de alto rendimiento |
| Muestras humanas | Tres muestras de arteria pulmonar de PAH y tres muestras de arteria pulmonar de donantes sanos |
| Origen del tejido | Tejido de arteria pulmonar ex vivo, que refleja principalmente la ecología celular de la pared vascular pulmonar y el proceso de remodelación vascular |
| Objetivo analítico principal | Localización de tipos celulares, cambio fenotípico de células musculares lisas, comunicación entre células inmunitarias y estructurales, y validación de consistencia mecanicista de genes candidatos |
Tabla 1: Información básica del conjunto de datos de validación de célula individual GSE210248. La tabla resume el acceso al conjunto de datos, la plataforma de secuenciación, la fuente del tejido, la composición de la muestra y el propósito analítico del análisis de validación de arteria pulmonar a nivel de célula individual.
8. Validación de la expresión génica mediante qRT-PCR
La validación mediante qRT-PCR incluyó 20 muestras de tejido pulmonar de pacientes con HP/HPA independientes desde el punto de vista biológico y 20 muestras de control de tejido pulmonar independientes desde el punto de vista biológico. El ARN total se extrajo utilizando el Total RNA Extraction Kit. La concentración y pureza del ARN se evaluaron mediante un espectrofotómetro, y la integridad del ARN se analizó mediante electroforesis en gel de agarosa. Solo se incluyeron muestras de ARN con valores de A260/280 entre 1,8 y 2,1 y sin degradación visible.
Se transcribieron cantidades iguales de ARN a ADN complementario utilizando el Kit Solarbio Universal RT-PCR (AMV; número de catálogo RP1200). Se realizó PCR cuantitativa para CXCL10, JUN, IFIH1, MX1 y TLR7 utilizando la Mezcla Maestra de PCR con SYBR Green en un Sistema de PCR en Tiempo Real. Cada muestra biológica se analizó en tres réplicas técnicas, junto con controles sin plantilla y sin transcripción inversa. Se utilizó el valor promedio de Ct de las tres réplicas técnicas para el análisis subsiguiente; las réplicas técnicas no se consideraron observaciones independientes. Se utilizaron cebadores que abarcan uniones exón-exón y producen amplicones de 80–200 pb (Tabla 2). La especificidad de los cebadores se verificó mediante el análisis NCBI Primer-BLAST y el análisis de la curva de disociación22.
Se utilizó β-actina (ACTB) como gen de referencia interno para normalizar los niveles de expresión de los genes diana. La expresión relativa se calculó mediante el método 2-ΔΔCt23. Para comparaciones entre grupos, se emplearon pruebas U de Mann-Whitney bilaterales según la distribución de los datos, y se aplicó la corrección de tasa de falsos descubrimientos de Benjamini-Hochberg en los cinco genes. Se generaron curvas ROC de un solo gen con intervalos de confianza del 95 % de DeLong, y los puntos de corte óptimos se seleccionaron utilizando el índice de Youden. El modelo de regresión logística de cinco genes se ajustó e inicialmente evaluó en las mismas 40 muestras biológicas; por lo tanto, esta estimación se definió como el rendimiento aparente dentro de la muestra. Para evaluar un posible sobreajuste, se realizaron 100 repeticiones de validación cruzada estratificada de cinco pliegues utilizando un modelo de regresión logística regularizado con L2, y se calculó el rendimiento ROC agrupado fuera de los pliegues.
| Gen | Acceso RefSeq | Primer directo (5′–3′) | Primer inverso (5′–3′) | Tamaño del producto (pb) | Tm (°C) | Que abarque exones |
| CXCL10 | NM_001565.4 | GTCAAGCCAT
AATTGTTC | ATAGTGCCAG
GGTAGAGT | 141 | 46.1 | Sí |
| JUN | NM_002228.4 | ACAAGTGGCA
GAGTCCCG | CGCCCAAGTT
CAACAACC | 152 | 54.5 | Sí |
| IFIH1 | NM_022168 | GCACAGAGCG
GTAGACCCT | GCCCTGAAGC
ACGAGATG | 182 | 54.7 | Sí |
| MX1 | NM_002462.5 | TTAGCCGTGG
TGATTTAGC | CAAGGTGGAG
CGATTCTG | 156 | 52.3 | Sí |
| TLR7 | NM_016562.4 | ATTGCCCTCGT
TGTTATA | TTCCTGGAGTT
TGTTGAT | 179 | 48.1 | Sí |
| ACTB | NM_001101.3 | CTCACCATGGAT
GATGATATCGC | AGGAATCCTTCT
GACCCATGC | 194 | 56.2 | Sí |
Tabla 2: Secuencias de cebadores utilizadas para la PCR cuantitativa de transcripción reversa. La tabla enumera los genes diana, los números de acceso de RefSeq, las secuencias de los cebadores directos e inversos, los tamaños de los productos, las temperaturas de fusión y el estado de los cebadores respecto al cruce de exones utilizados para la qRT-PCR.
9. Selección de compuestos candidatos y acoplamiento molecular
Las firmas génicas centrales reguladas al alza y reguladas a la baja se enviaron a la base de datos Connectivity Map para identificar moléculas pequeñas que se predijo revertirían el perfil de expresión asociado a la HP7. Los candidatos se clasificaron según la puntuación Logit y la probabilidad de predicción.
La estructura tridimensional de BRD-K91900765/VX-745 se obtuvo de PubChem bajo el CID 303852524. La información farmacológica relacionada con el compuesto fue curada a partir de bases de datos públicas de fármacos, y los descriptores estructurales se calcularon utilizando DrugBank y SwissADME25,26. Las estructuras de proteínas se obtuvieron del RCSB Protein Data Bank utilizando los siguientes identificadores PDB: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; y MAPK14/p38α, 1OUK27. La detección ciega de cavidades y el acoplamiento molecular se realizaron utilizando CB-Dock2 v2.0 con el motor de puntuación AutoDock Vina v1.2.028,29. Los archivos de proteína y ligando se cargaron en CB-Dock2, las cavidades candidatas se detectaron automáticamente, y el acoplamiento se realizó dentro de las cajas específicas para cada cavidad generadas por el servidor. Para cada proteína, se registraron el identificador de la cavidad, la puntuación Vina, el volumen de la cavidad, el centro de la caja de acoplamiento, las dimensiones de la caja de acoplamiento y el archivo del complejo proteína-ligando. La conformación con la puntuación Vina más negativa se seleccionó como la conformación predicha de mayor rango. MAPK14/p38α se incluyó como el blanco farmacológico establecido y la proteína de referencia positiva para el acoplamiento de VX-745. El acoplamiento frente a CXCL10, JUN, IFIH1, MX1 y TLR7 fue exploratorio y no se interpretó como evidencia de un targeting farmacológico directo, unión, inhibición o eficacia.
10. Análisis estadístico y control de la reproducibilidad
Todos los análisis estadísticos se realizaron en R, salvo que se indique lo contrario. Se consideraron estadísticamente significativos los valores de P bilaterales < 0,05. Se aplicó corrección por múltiples pruebas a los análisis de expresión diferencial, enriquecimiento, validación externa y qRT-PCR, tal como se especificó anteriormente. Se utilizó validación cruzada para evaluar la estabilidad de los modelos de aprendizaje automático y del modelo combinado de qRT-PCR.