Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Identificación de biomarcadores y compuestos terapéuticos candidatos para la hipertensión pulmonar mediante bioinformática y aprendizaje automático

82 visualizaciones

⸱

DOI:

10.3791/73519

⸱

25 de agosto de 2026

En este artículo

Resumen

Este artículo presenta un flujo de trabajo bioinformático reproducible que integra conjuntos de datos transcriptómicos públicos, aprendizaje automático, validación externa, PCR cuantitativa de transcripción inversa, cribado del Mapa de Conectividad y acoplamiento molecular para identificar biomarcadores de hipertensión pulmonar y compuestos terapéuticos candidatos.

Resumen

Este estudio tuvo como objetivo identificar biomarcadores moleculares asociados a la hipertensión pulmonar (HP) y compuestos candidatos de bajo peso molecular mediante el uso de datos transcriptómicos públicos y recursos de validación independientes. Tres conjuntos de datos del Gene Expression Omnibus (GSE22356, GSE33463 y GSE48149) se integraron tras la normalización, la anotación de sondas y la corrección del efecto de lote mediante ComBat. Se utilizaron análisis de expresión diferencial, análisis de redes de coexpresión génica ponderada, análisis de enriquecimiento funcional, análisis de redes de interacción proteína-proteína y tres algoritmos de aprendizaje automático para identificar genes centrales característicos. El rendimiento diagnóstico se evaluó mediante curvas de característica operativa del receptor. La validación externa incluyó una cohorte independiente de tejido pulmonar (GSE117261), un conjunto de datos de secuenciación de ARN a nivel de célula individual de la arteria pulmonar (GSE210248) y la validación mediante reacción en cadena de la polimerasa con retrotranscripción cuantitativa en muestras independientes de tejido pulmonar. Se empleó la reubicación de fármacos basada en Connectivity Map y el acoplamiento molecular para seleccionar compuestos candidatos. Se identificaron setenta y ocho genes expresados diferencialmente, y CXCL10, JUN, IFIH1, MX1 y TLR7 se seleccionaron como genes centrales característicos. En la cohorte independiente de tejido pulmonar GSE117261, JUN mostró el mayor respaldo externo, mientras que la replicación de los otros genes fue variable. La reacción en cadena de la polimerasa con retrotranscripción cuantitativa en 20 muestras biológicamente independientes de hipertensión arterial pulmonar y 20 muestras de control confirmó la sobreexpresión de los cinco genes. El modelo aparente de qRT-PCR de cinco genes y los análisis de validación cruzada estratificada repetida cinco veces (100 repeticiones) arrojaron un área bajo la curva de 1.000, aunque la pequeña cohorte requiere una interpretación cautelosa y una validación prospectiva independiente. El análisis a nivel de célula individual del conjunto de datos GSE210248 respaldó una alteración en la comunicación entre células inmunitarias y estructurales, así como un cambio fenotípico en las células del músculo liso. BRD-K91900765/VX-745 obtuvo la puntuación más alta en el cribado mediante Connectivity Map. MAPK14/p38α, su diana farmacológica establecida, se incluyó como proteína de referencia positiva en el acoplamiento, mientras que el acoplamiento frente a las cinco proteínas asociadas a biomarcadores se consideró exploratorio. Estos hallazgos respaldan a los cinco genes como biomarcadores candidatos de HP y a VX-745 como una hipótesis computacional de reubicación de fármacos que requiere validación experimental.

Introducción

La hipertensión pulmonar (PH) es un síndrome cardiorrespiratorio progresivo caracterizado por una presión arterial pulmonar elevada de forma persistente, un aumento de la resistencia vascular pulmonar y, eventualmente, insuficiencia ventricular derecha. Los criterios hemodinámicos actuales definen la PH como una presión arterial pulmonar media en reposo de >20 mmHg, medida mediante cateterización del lado derecho del corazón1. Entre los diferentes subtipos clínicos, la hipertensión arterial pulmonar (PAH) es una de las formas más graves y se caracteriza por un remodelado vascular pulmonar progresivo. Sus características patológicas incluyen disfunción endotelial, proliferación y migración anormal de células del músculo liso arterial pulmonar, activación de fibroblastos adventiciales, depósito de matriz extracelular, infiltración de células inflamatorias y estrechamiento u oclusión de las arterias pulmonares distales2. Estos cambios indican que la PH/PAH no es solo un trastorno de vasoconstricción, sino también una enfermedad compleja de remodelado vascular impulsada por mecanismos moleculares, celulares e inmuno-inflamatorios coordinados.

Las terapias actuales para la HAP se dirigen principalmente a las vías de la prostaciclina, endotelina, óxido nítrico–guanilato ciclasa soluble y fosfodiesterasa tipo 53˒4. Aunque estos tratamientos mejoran los síntomas, la capacidad de ejercicio y los parámetros hemodinámicos, sus efectos siguen siendo principalmente vasodilatadores y hemodinámicos. Su capacidad para revertir el remodelado vascular pulmonar establecido es limitada, y muchos pacientes continúan experimentando progresión de la enfermedad a pesar de la terapia combinada. Por lo tanto, la identificación de nuevos biomarcadores moleculares y candidatos terapéuticos que reflejen el proceso de remodelado representa una necesidad médica importante no satisfecha. En particular, la activación inmune-inflamatoria, la señalización relacionada con interferones, las vías de los receptores tipo Toll, el reclutamiento inmune mediado por quimioquinas y el cambio fenotípico de las células musculares lisas han surgido como posibles factores que contribuyen a la progresión de la HP/HAP5˒6.

Los conjuntos de datos transcriptómicos de alto rendimiento proporcionan recursos valiosos para identificar firmas moleculares asociadas a enfermedades en la HP/APH. Sin embargo, los estudios basados en un único conjunto de datos suelen estar limitados por tamaños muestrales pequeños, efectos de lote, heterogeneidad de plataformas y validación insuficiente. El análisis de expresión diferencial puede identificar genes con expresión alterada, pero podría no captar completamente los módulos de coexpresión relacionados con la enfermedad ni las interacciones a nivel de red. El análisis de redes de coexpresión génica ponderada (WGCNA) puede identificar módulos de genes asociados a rasgos de la enfermedad, mientras que el análisis de redes de interacción proteína-proteína (PPI) puede revelar genes altamente conectados dentro de redes biológicas. Los métodos de aprendizaje automático también pueden priorizar genes con valor diagnóstico o de clasificación. No obstante, la dependencia de un solo algoritmo podría introducir sesgos específicos del modelo. Por lo tanto, la integración del análisis de expresión diferencial, WGCNA, análisis de redes PPI y múltiples algoritmos de aprendizaje automático podría mejorar la solidez en el descubrimiento de biomarcadores.

Otro desafío importante en los estudios de biomarcadores transcriptómicos es la interpretación biológica. Las señales de tejido total pueden reflejar cambios en la expresión génica dentro de células vasculares residentes, la infiltración de células inmunitarias o proporciones alteradas de múltiples poblaciones celulares. La secuenciación de ARN a nivel de célula individual ofrece la oportunidad de ubicar los genes candidatos derivados del tejido total en un contexto celular. En la HP/APH, la remodelación vascular pulmonar implica células endoteliales, células musculares lisas, fibroblastos, monocitos/macrófagos, linfocitos y otras células inmunitarias o estructurales. La progresión de la enfermedad también se asocia con una comunicación alterada entre células y el cambio fenotípico de las células musculares lisas. Por lo tanto, combinar el cribado transcriptómico de tejido total con la validación a nivel de célula individual puede ayudar a determinar si los biomarcadores candidatos están asociados con la activación inmunitaria, la remodelación estructural vascular o un desequilibrio en la comunicación multicelular.

Además del descubrimiento de biomarcadores, las firmas transcriptómicas pueden utilizarse para la reubicación computacional de fármacos. El Mapa de Conectividad (CMap) vincula perfiles de expresión génica asociados a enfermedades con moléculas pequeñas que podrían revertir o modular dichas firmas7. Cuando se combina con la curación de compuestos y el acoplamiento molecular, esta estrategia puede generar hipótesis terapéuticas susceptibles de verificación experimental. Aunque la predicción mediante CMap y el acoplamiento molecular no pueden establecer la eficacia de un fármaco, sí pueden priorizar compuestos candidatos para futuros ensayos de unión a dianas, experimentos con células y validación en modelos animales.

Se desarrolló un flujo de trabajo integrado y reproducible para identificar biomarcadores de HP/APH y compuestos terapéuticos candidatos. Se integraron tres conjuntos de datos transcriptómicos públicos del Gene Expression Omnibus tras la normalización y la corrección del efecto de lote. Se utilizaron análisis de expresión diferencial, WGCNA, análisis de enriquecimiento funcional, análisis de redes de interacción de proteínas (PPI) y tres algoritmos de aprendizaje automático para seleccionar genes característicos robustos. El análisis de la curva ROC, una cohorte independiente de validación en tejido pulmonar, evidencia de secuenciación de ARN de célula única en la arteria pulmonar y la validación mediante PCR cuantitativa de transcripción inversa en muestras independientes se emplearon para evaluar aún más los genes seleccionados. Finalmente, se aplicó la reubicación de fármacos basada en CMap y el acoplamiento molecular para identificar compuestos candidatos. La novedad del estudio radica en su marco de validación multinivel, que conecta el descubrimiento transcriptómico en muestras masivas, la priorización mediante aprendizaje automático, la validación independiente, la confirmación experimental mediante PCR cuantitativa de transcripción inversa, la interpretación mecanicista a nivel de célula única y el cribado computacional de compuestos. La hipótesis del estudio fue que la HP/APH está impulsada por un programa coordinado de inflamación inmunitaria y remodelación vascular, y que los genes robustos dentro de este programa podrían servir como biomarcadores candidatos y ofrecer oportunidades de reubicación de fármacos.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Los conjuntos de datos públicos del Gene Expression Omnibus (GEO) analizados en este estudio contenían datos transcriptómicos desidentificados de estudios previamente publicados y no requirieron aprobación ética adicional. El Comité de Ética de la Universidad Huaihua aprobó el estudio independiente de validación mediante reacción en cadena de la polimerasa con retrotranscripción cuantitativa (qRT-PCR) en tejido pulmonar humano (número de aprobación: 2024(A05112)). Se obtuvo consentimiento informado por escrito de todos los participantes o de sus representantes legalmente autorizados antes de la recolección de muestras. Los procedimientos de aprobación y consentimiento se aplicaron a todas las 20 muestras de tejido pulmonar de pacientes con hipertensión arterial pulmonar (PAH) y a las 20 muestras de control incluidas en la validación mediante qRT-PCR. Las herramientas de investigación utilizadas para este protocolo se enumeran en la Tabla de Materiales.

1. Recolección y preprocesamiento de conjuntos de datos transcriptómicos públicos

Los conjuntos de datos de microarreglos relacionados con hipertensión pulmonar (PH) GSE22356, GSE33463 y GSE48149 se obtuvieron de la base de datos GEO. Las muestras de PH/hipertensión arterial pulmonar (PAH) y controles se extrajeron según las anotaciones fenotípicas originales. Las matrices de expresión y los archivos de anotación de la plataforma se descargaron utilizando scripts reproducibles en R y el paquete GEOquery.

Se realizó de manera consistente la anotación de sondas y la asignación de símbolos génicos en todos los conjuntos de datos. Cuando múltiples sondas se asignaban al mismo gen, se calculó el valor medio de expresión. Se aplicó la normalización por cuantiles y se eliminaron los genes con baja expresión o baja varianza. Los conjuntos de datos se combinaron y los efectos de lote se corrigieron utilizando el algoritmo ComBat del paquete sva8. La corrección se evaluó mediante diagramas de caja y análisis de componentes principales.

2. Identificación de genes diferencialmente expresados

Se utilizó el paquete limma para comparar los niveles de expresión entre muestras de PH y controles en la matriz de expresión corregida por lotes9. Se ajustó un modelo lineal y se aplicaron estadísticas bayesianas empíricas. Los genes diferencialmente expresados se definieron utilizando un valor de P ajustado <0.05 y un cambio absoluto en el log2 de la razón > 0.585. Los resultados se visualizaron mediante gráficos de volcan y mapas de calor.

3. Construcción de la red de coexpresión génica ponderada

Se construyó una red de coexpresión génica ponderada utilizando el paquete WGCNA10. Se realizó la agrupación de muestras para detectar valores atípicos. Se seleccionó la potencia de umbralización suave en función del índice de ajuste a la topología libre de escala. Se identificaron módulos génicos mediante el algoritmo de corte dinámico de árboles. Se correlacionaron los eigengenes de los módulos con el fenotipo de HP, y se seleccionó el módulo asociado a la enfermedad con la correlación más fuerte. Los genes del módulo clave se intersectaron con los genes diferencialmente expresados para obtener los genes de consenso.

4. Análisis de enriquecimiento funcional

Se analizaron las categorías de proceso biológico, componente celular y función molecular de Gene Ontology utilizando clusterProfiler11. Se realizó un análisis de enriquecimiento de vías de la Enciclopedia de Kyoto de Genes y Genomas para identificar las vías de señalización12. Se utilizaron un valor de P < 0,05 y un valor de q < 0,2 como umbrales de enriquecimiento, y los términos enriquecidos se visualizaron mediante gráficos de burbujas11.

5. Construcción de la red de interacciones proteína-proteína e identificación de genes centrales

La lista consenso de genes se envió a la base de datos STRING, seleccionando Homo sapiens como especie y un umbral de confianza en la interacción > 0,413. El archivo de interacciones se importó a Cytoscape, y se utilizó el complemento CytoHubba para clasificar los genes según el grado del nodo. Los genes altamente conectados se definieron como genes centrales.

6. Selección de genes característicos diagnósticos mediante aprendizaje automático

Se aplicaron tres algoritmos independientes de selección de características. Primero, se realizó una regresión logística mediante el operador de contracción y selección de mínimos absolutos utilizando el paquete glmnet y validación cruzada de 10 grupos para identificar genes con coeficientes distintos de cero14. Segundo, se aplicó la eliminación recursiva de características con máquinas de vectores de soporte para eliminar características redundantes y seleccionar el subconjunto de características que alcanzó la mayor precisión en la validación cruzada15. Tercero, se construyó un modelo de bosque aleatorio y las características se clasificaron según la disminución media de la impureza de Gini16. Se utilizó la intersección de los conjuntos de genes derivados de los tres algoritmos para definir el conjunto final de genes característicos principales. El paquete pROC se empleó para generar curvas de característica operativa del receptor y calcular los valores del área bajo la curva17.

7. Validación de genes centrales utilizando conjuntos de datos independientes de muestras agrupadas y de célula individual

GSE117261 se utilizó como una cohorte externa e independiente de validación en tejido pulmonar que contenía 58 muestras de HAP y 25 muestras de controles de donantes fallidos18. Este conjunto de datos no se utilizó en el análisis de expresión diferencial de descubrimiento, la construcción de la red de coexpresión génica ponderada ni en la selección de características mediante aprendizaje automático. La matriz de expresión fue normalizada y anotada, y el análisis de expresión diferencial se realizó utilizando limma v3.68.0. Se aplicó la corrección de la tasa de falsos descubrimientos de Benjamini-Hochberg en todo el transcriptoma anotado. Las curvas de característica operativa del receptor (ROC) para un solo gen se calcularon utilizando pROC v1.19.0.1, intervalos de confianza del 95 % de DeLong y puntos de corte del índice de Youden. Se ajustó un modelo exploratorio de regresión logística de cinco genes dentro de GSE117261, y su rendimiento interno se evaluó adicionalmente mediante validación cruzada anidada repetida.

GSE210248 (Tabla 1) se utilizó como conjunto de datos de validación a nivel de célula individual de la arteria pulmonar que contiene muestras de tres pacientes con HAP y tres donantes sanos19. Los datos se procesaron utilizando Seurat v5.5.1 para el control de calidad, la normalización, la reducción de dimensionalidad, la agrupación en clústeres y la anotación celular20. Se identificaron las principales poblaciones celulares, incluyendo células endoteliales, células musculares lisas, fibroblastos, monocitos/macrófagos y células T/células asesinas naturales. La comunicación entre células se analizó utilizando CellChat v2.1.2 y la base de datos de ligandos y receptores CellChatDB.human21. Se creó un objeto CellChat a partir de la matriz de expresión normalizada de Seurat y los metadatos de tipo celular. Se identificaron genes sobrerexpresados e interacciones de ligando-receptor; se calcularon las probabilidades de comunicación; se eliminaron las interacciones que involucraban grupos celulares con menos de 10 células; y se infirieron y agregaron redes de comunicación a nivel de vía. Este conjunto de datos se utilizó únicamente para la validación mecanicista externa y no para el entrenamiento del modelo.

ElementoDescripción
Conjunto de datosGSE210248
Tipo de datosSecuenciación de ARN unicelular basada en gotas de 10x Genomics; perfilado transcriptómico de alto rendimiento
Muestras humanasTres muestras de arteria pulmonar de PAH y tres muestras de arteria pulmonar de donantes sanos
Origen del tejidoTejido de arteria pulmonar ex vivo, que refleja principalmente la ecología celular de la pared vascular pulmonar y el proceso de remodelación vascular
Objetivo analítico principalLocalización de tipos celulares, cambio fenotípico de células musculares lisas, comunicación entre células inmunitarias y estructurales, y validación de consistencia mecanicista de genes candidatos

Tabla 1: Información básica del conjunto de datos de validación de célula individual GSE210248. La tabla resume el acceso al conjunto de datos, la plataforma de secuenciación, la fuente del tejido, la composición de la muestra y el propósito analítico del análisis de validación de arteria pulmonar a nivel de célula individual.

8. Validación de la expresión génica mediante qRT-PCR

La validación mediante qRT-PCR incluyó 20 muestras de tejido pulmonar de pacientes con HP/HPA independientes desde el punto de vista biológico y 20 muestras de control de tejido pulmonar independientes desde el punto de vista biológico. El ARN total se extrajo utilizando el Total RNA Extraction Kit. La concentración y pureza del ARN se evaluaron mediante un espectrofotómetro, y la integridad del ARN se analizó mediante electroforesis en gel de agarosa. Solo se incluyeron muestras de ARN con valores de A260/280 entre 1,8 y 2,1 y sin degradación visible.

Se transcribieron cantidades iguales de ARN a ADN complementario utilizando el Kit Solarbio Universal RT-PCR (AMV; número de catálogo RP1200). Se realizó PCR cuantitativa para CXCL10, JUN, IFIH1, MX1 y TLR7 utilizando la Mezcla Maestra de PCR con SYBR Green en un Sistema de PCR en Tiempo Real. Cada muestra biológica se analizó en tres réplicas técnicas, junto con controles sin plantilla y sin transcripción inversa. Se utilizó el valor promedio de Ct de las tres réplicas técnicas para el análisis subsiguiente; las réplicas técnicas no se consideraron observaciones independientes. Se utilizaron cebadores que abarcan uniones exón-exón y producen amplicones de 80–200 pb (Tabla 2). La especificidad de los cebadores se verificó mediante el análisis NCBI Primer-BLAST y el análisis de la curva de disociación22.

Se utilizó β-actina (ACTB) como gen de referencia interno para normalizar los niveles de expresión de los genes diana. La expresión relativa se calculó mediante el método 2-ΔΔCt23. Para comparaciones entre grupos, se emplearon pruebas U de Mann-Whitney bilaterales según la distribución de los datos, y se aplicó la corrección de tasa de falsos descubrimientos de Benjamini-Hochberg en los cinco genes. Se generaron curvas ROC de un solo gen con intervalos de confianza del 95 % de DeLong, y los puntos de corte óptimos se seleccionaron utilizando el índice de Youden. El modelo de regresión logística de cinco genes se ajustó e inicialmente evaluó en las mismas 40 muestras biológicas; por lo tanto, esta estimación se definió como el rendimiento aparente dentro de la muestra. Para evaluar un posible sobreajuste, se realizaron 100 repeticiones de validación cruzada estratificada de cinco pliegues utilizando un modelo de regresión logística regularizado con L2, y se calculó el rendimiento ROC agrupado fuera de los pliegues.

GenAcceso RefSeqPrimer directo (5′–3′)Primer inverso (5′–3′)Tamaño del producto (pb)Tm (°C)Que abarque exones
CXCL10NM_001565.4GTCAAGCCAT
AATTGTTC
ATAGTGCCAG
GGTAGAGT
14146.1Sí
JUNNM_002228.4ACAAGTGGCA
GAGTCCCG
CGCCCAAGTT
CAACAACC
15254.5Sí
IFIH1NM_022168GCACAGAGCG
GTAGACCCT
GCCCTGAAGC
ACGAGATG
18254.7Sí
MX1NM_002462.5TTAGCCGTGG
TGATTTAGC
CAAGGTGGAG
CGATTCTG
15652.3Sí
TLR7NM_016562.4ATTGCCCTCGT
TGTTATA
TTCCTGGAGTT
TGTTGAT
17948.1Sí
ACTBNM_001101.3CTCACCATGGAT
GATGATATCGC
AGGAATCCTTCT
GACCCATGC
19456.2Sí

Tabla 2: Secuencias de cebadores utilizadas para la PCR cuantitativa de transcripción reversa. La tabla enumera los genes diana, los números de acceso de RefSeq, las secuencias de los cebadores directos e inversos, los tamaños de los productos, las temperaturas de fusión y el estado de los cebadores respecto al cruce de exones utilizados para la qRT-PCR.

9. Selección de compuestos candidatos y acoplamiento molecular

Las firmas génicas centrales reguladas al alza y reguladas a la baja se enviaron a la base de datos Connectivity Map para identificar moléculas pequeñas que se predijo revertirían el perfil de expresión asociado a la HP7. Los candidatos se clasificaron según la puntuación Logit y la probabilidad de predicción.

La estructura tridimensional de BRD-K91900765/VX-745 se obtuvo de PubChem bajo el CID 303852524. La información farmacológica relacionada con el compuesto fue curada a partir de bases de datos públicas de fármacos, y los descriptores estructurales se calcularon utilizando DrugBank y SwissADME25,26. Las estructuras de proteínas se obtuvieron del RCSB Protein Data Bank utilizando los siguientes identificadores PDB: CXCL10, 1LV9; JUN, 1JUN; IFIH1, 3B6E; MX1, 5GTM; TLR7, 7CYN; y MAPK14/p38α, 1OUK27. La detección ciega de cavidades y el acoplamiento molecular se realizaron utilizando CB-Dock2 v2.0 con el motor de puntuación AutoDock Vina v1.2.028,29. Los archivos de proteína y ligando se cargaron en CB-Dock2, las cavidades candidatas se detectaron automáticamente, y el acoplamiento se realizó dentro de las cajas específicas para cada cavidad generadas por el servidor. Para cada proteína, se registraron el identificador de la cavidad, la puntuación Vina, el volumen de la cavidad, el centro de la caja de acoplamiento, las dimensiones de la caja de acoplamiento y el archivo del complejo proteína-ligando. La conformación con la puntuación Vina más negativa se seleccionó como la conformación predicha de mayor rango. MAPK14/p38α se incluyó como el blanco farmacológico establecido y la proteína de referencia positiva para el acoplamiento de VX-745. El acoplamiento frente a CXCL10, JUN, IFIH1, MX1 y TLR7 fue exploratorio y no se interpretó como evidencia de un targeting farmacológico directo, unión, inhibición o eficacia.

10. Análisis estadístico y control de la reproducibilidad

Todos los análisis estadísticos se realizaron en R, salvo que se indique lo contrario. Se consideraron estadísticamente significativos los valores de P bilaterales < 0,05. Se aplicó corrección por múltiples pruebas a los análisis de expresión diferencial, enriquecimiento, validación externa y qRT-PCR, tal como se especificó anteriormente. Se utilizó validación cruzada para evaluar la estabilidad de los modelos de aprendizaje automático y del modelo combinado de qRT-PCR.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Preprocesamiento de datos transcriptómicos públicos e identificación de genes diferencialmente expresados

La integración y la corrección con ComBat de GSE22356, GSE33463 y GSE48149 redujeron las diferencias sistemáticas entre los conjuntos de datos. Los diagramas de caja mostraron que las distribuciones de expresión de las muestras se volvieron más consistentes tras la corrección. El análisis de componentes principales indicó que las muestras se agrupaban principalmente según ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Se desarrolló un flujo de trabajo integrado y reproducible para identificar biomarcadores moleculares asociados a la HP/APH y compuestos terapéuticos candidatos, combinando transcriptómica pública, análisis de redes de coexpresión génica ponderada, enriquecimiento funcional, análisis de redes de interacción proteína-proteína, tres algoritmos de aprendizaje automático, validación externa, interpretación transcriptómica a nivel de célula individual, confirmación mediante PCR cuantitativa de transcripción inversa, cribado d...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores declaran que no tienen intereses competidores.

Agradecimientos

Este estudio fue apoyado por el Proyecto de Construcción de la Provincia Innovadora de Hunan (No. 2022JJ30465).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
2× Mezcla maestra de PCR con SYBR GreenBeijing Solarbio Science & Technology Co., Ltd.n.º de catálogo SR1110Amplificación por PCR cuantitativa en tiempo real basada en colorante y detección de fluorescencia
AI21.msvmRFE.R y e1071Script personalizado en R con el paquete CRAN e1071AI21.msvmRFE.R; e1071 v1.7-17Eliminación recursiva de características mediante máquinas de vectores de soporte
AgarosaBeijing Solarbio Science & Technology Co., Ltd.n.º de catálogo A8201; CAS 9012-36-6Evaluación de la integridad del ARN total mediante electroforesis en gel de agarosa
Aparato de electroforesis en gel de agarosaBeijing Liuyi Biotechnology Co., Ltd.Modelo DYCZ-24DNEvaluación electroforética de la integridad del ARN
Motor de puntuación AutoDock VinaCentro de Biología Estructural Computacional, Scripps Researchv1.2.0; RRID: SCR_011958Puntuación de la posición del ligando-proteína dentro del flujo de trabajo CB-Dock2
CB-Dock2Laboratorio Cao, servidor web CB-Dock2v2.0; acceso julio 2026Detección ciega de cavidades y acoplamiento molecular de VX-745 con las estructuras proteicas seleccionadas
CellChatPaquete R CellChatv2.1.2Inferencia y visualización de la comunicación célula-célula a partir de la matriz de expresión de célula individual
CellChatDB.humanDistribuido con el paquete R CellChatCellChatDB.human; subconjunto de señalización secretada; umbral mínimo de células = 10Base de datos humana de interacciones ligando-receptor para CellChat
clusterProfilerPaquete R Bioconductorv4.20.0; versión 3.23 de BioconductorAnálisis de enriquecimiento de Ontología Genética y del Enciclopedia de Genes y Genomas de Kioto
Mapa de Conectividad (CMap/CLUE)Instituto BroadRecurso L1000/CLUE; RRID: SCR_016204; acceso julio 2026Análisis computacional de reposicionamiento de fármacos
Primeros oligonucleotídicos personalizadosBeijing Solarbio Science & Technology Co., Ltd.Sintetizados a medida; las secuencias de los cebadores se proporcionan en la Tabla 2Amplificación de ACTB, CXCL10, JUN, IFIH1, MX1 y TLR7
cytoHubbaTienda de aplicaciones Cytoscapev0.1Clasificación de genes centrales basada en grado en la red de interacción proteína-proteína
CytoscapeConsortium Cytoscapev3.10.4; RRID: SCR_003032Visualización y análisis de redes de interacción proteína-proteína
DrugBankBase de conocimientos DrugBankv6.0; RRID: SCR_002700Curación de identidad de compuestos e información farmacológica
Sistema de documentación de gelesBeijing Liuyi Biotechnology Co., Ltd.Modelo WO-9413BVisualización y registro de los resultados de integridad del ARN en gel de agarosa
Gene Expression Omnibus (GEO)Centro Nacional de Información BiotecnológicaGSE22356, GSE33463, GSE48149, GSE117261 y GSE210248; RRID: SCR_005012Recuperación de conjuntos de datos transcriptómicos masivos y de célula individual
GEOqueryPaquete R Bioconductorv2.80.0; versión 3.23 de BioconductorDescarga programática e importación de datos de expresión y fenotipo de GEO
glmnetPaquete R CRANv5.0Regresión logística con operador de contracción y selección absoluta mínima y modelado logístico regularizado
limmaPaquete R Bioconductorv3.68.0; versión 3.23 de Bioconductor; RRID: SCR_010943Análisis de expresión diferencial y estadísticas bayesianas empíricas
Espectrofotómetro NanoDropThermo Fisher ScientificNanoDrop ND-1000; software v3.8Medición de la concentración de ARN y de las relaciones de pureza A260/280 y A260/230
NCBI Primer-BLASTCentro Nacional de Información BiotecnológicaHerramienta web; RRID: SCR_003095; acceso julio 2026Verificación de la especificidad de los cebadores
pROCPaquete R CRANv1.19.0.1; RRID: SCR_024286Análisis de características operativas del receptor, intervalos de confianza de DeLong y puntos de corte del índice de Youden
Banco de Datos de Proteínas (PDB)Banco de Datos de Proteínas RCSBCXCL10: 1LV9; JUN: 1JUN; IFIH1: 3B6E; MX1: 5GTM; TLR7: 7CYN; MAPK14/p38α: 1OUK; RRID: SCR_012820Recuperación de estructuras proteicas determinadas experimentalmente para acoplamiento molecular
PubChemCentro Nacional de Información BiotecnológicaPubChem CID 3038525; RRID: SCR_004284Recuperación de la estructura tridimensional e identificadores químicos de BRD-K91900765/VX-745
RFoundation R para Computación Estadísticav4.6.1; RRID: SCR_001905Computación estadística, procesamiento de datos, aprendizaje automático y visualización
randomForestPaquete R CRANv4.7-1.2Selección de características mediante bosque aleatorio y clasificación de importancia de variables
Sistema de PCR en tiempo realStratagene, ahora Agilent TechnologiesSistema Mx3000P de PCR en Tiempo RealAmplificación por qRT-PCR, adquisición de fluorescencia, análisis de curva de fusión y exportación de Ct
SeuratPaquete R CRAN; Laboratorio Satijav5.5.1; RRID: SCR_016341Control de calidad, normalización, reducción de dimensionalidad, agrupamiento y anotación en secuenciación de ARN de célula individual
STRINGConsortium STRINGv12.0; RRID: SCR_005223Construcción de red de interacción proteína-proteína
sva (ComBat)Paquete R Bioconductorv3.60.0; versión 3.23 de BioconductorCorrección de efectos de lote entre conjuntos de datos
SwissADMEInstituto Suizo de BioinformáticaServidor web; acceso julio 2026Preselección de similitud con fármacos, propiedades fisicoquímicas y ADME
Kit de extracción de ARN totalBeijing Solarbio Science & Technology Co., Ltd.n.º de catálogo R1200Extracción y purificación de ARN total a partir de muestras de tejido pulmonar
Kit RT-PCR universal (AMV)Beijing Solarbio Science & Technology Co., Ltd.n.º de catálogo RP1200Transcripción inversa de ARN total a ADN complementario
WGCNAPaquete R CRANv1.74Construcción de red de coexpresión génica ponderada y análisis de módulo-carácter

Referencias

  1. Simonneau G, et al. Haemodynamic definitions and updated clinical classification of pulmonary hypertension. Eur Respir J. 2019;53(1):1801913. doi: 10.1183/13993003.01913-2018.
  2. Rabinovitch M, Guignabert C, Humbert M, Nicolls MR. Inflammation and immunity in the pathogenesis of pulmonary arterial hypertension. Circ Res. 2014;115(1):165–175.
  3. Humbert M, et al. 2022 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Heart J. 2022;43(38):3618–3731.
  4. Galiè N, et al. 2015 ESC/ERS Guidelines for the diagnosis and treatment of pulmonary hypertension. Eur Respir J. 2015;46(4):903–975.
  5. Soon E, et al. Elevated levels of inflammatory cytokines predict survival in idiopathic and familial pulmonary arterial hypertension. Circulation. 2010;122(9):920–927.
  6. George PM, et al. Evidence for the involvement of type I interferon in pulmonary arterial hypertension. Circ Res. 2014;114(4):677–688.
  7. Subramanian A, et al. A next-generation Connectivity Map: L1000 platform and the first 1,000,000 profiles. Cell. 2017;171(6):1437–1452.e17.
  8. Leek JT, et al. The sva package for removing batch effects and other unwanted variation in high-throughput experiments. Bioinformatics. 2012;28(6):882–883.
  9. Ritchie ME, et al. limma powers differential expression analyses for RNA-sequencing and microarray studies. Nucleic Acids Res. 2015;43(7):e47. doi: 10.1093/nar/gkv007.
  10. Langfelder P, Horvath S. WGCNA: an R package for weighted correlation network analysis. BMC Bioinformatics. 2008;9:559. doi: 10.1186/1471-2105-9-559.
  11. Yu G, Wang LG, Han Y, He QY. clusterProfiler: an R package for comparing biological themes among gene clusters. OMICS. 2012;16(5):284–287.
  12. Kanehisa M, Goto S. KEGG: Kyoto Encyclopedia of Genes and Genomes. Nucleic Acids Res. 2000;28(1):27–30.
  13. Szklarczyk D, et al. The STRING database in protein–protein association networks and functional enrichment analyses for any sequenced genome of interest. Nucleic Acids Res. 2023;51(D1):D638–D646.
  14. Friedman J, Hastie T, Tibshirani R. Regularization paths for generalized linear models via coordinate descent. J Stat Softw. 2010;33(1):1–22.
  15. Guyon I, Weston J, Barnhill S, Vapnik V. Gene selection for cancer classification using support vector machines. Mach Learn. 2002;46:389–422.
  16. Breiman L. Random forests. Mach Learn. 2001;45(1):5–32.
  17. Robin X, et al. pROC: an open-source package for R and S+ to analyze and compare ROC curves. BMC Bioinformatics. 2011;12:77. doi: 10.1186/s12859-011-0077-8.
  18. Stearman RS, et al. Systems analysis of the human pulmonary arterial hypertension lung transcriptome. Am J Respir Cell Mol Biol. 2019;60(6):637–649.
  19. Crnkovic S, et al. Single-cell transcriptomics reveals skewed cellular communication and phenotypic shift in pulmonary artery remodeling. JCI Insight. 2022;7(20):e153471. doi: 10.1172/jci.insight.153471.
  20. Hao Y, et al. Integrated analysis of multimodal single-cell data. Cell. 2021;184(13):3573–3587.e29.
  21. Jin S, et al. Inference and analysis of cell–cell communication using CellChat. Nat Commun. 2021;12(1):1088. doi: 10.1038/s41467-021-21246-9.
  22. Bustin SA, et al. MIQE 2.0: revision of the Minimum Information for Publication of Quantitative Real-Time PCR Experiments guidelines. Clin Chem. 2025;71(6):634–651.
  23. Livak KJ, Schmittgen TD. Analysis of relative gene expression data using real-time quantitative PCR and the 2−ΔΔCt method. Methods. 2001;25(4):402–408.
  24. Kim S, et al. PubChem 2023 update. Nucleic Acids Res. 2023;51(D1):D1373–D1380.
  25. Knox C, et al. DrugBank 6.0: the DrugBank Knowledgebase for 2024. Nucleic Acids Res. 2024;52(D1):D1265–D1275.
  26. Daina A, Michielin O, Zoete V. SwissADME: a free web tool to evaluate pharmacokinetics, drug-likeness, and medicinal chemistry friendliness of small molecules. Sci Rep. 2017;7:42717. doi: 10.1038/srep42717.
  27. Burley SK, et al. RCSB Protein Data Bank: powerful new tools for exploring 3D structures of biological macromolecules for basic and applied research and education. Nucleic Acids Res. 2021;49(D1):D437–D451. doi: 10.1093/nar/gkaa1038.
  28. Eberhardt J, Santos-Martins D, Tillack AF, Forli S. AutoDock Vina 1.2.0: new docking methods, expanded force field, and Python bindings. J Chem Inf Model. 2021;61(8):3891–3898. doi: 10.1021/acs.jcim.1c00203.
  29. Liu Y, et al. CB-Dock2: improved protein-ligand blind docking by integrating cavity detection, docking, and homologous template fitting. Nucleic Acids Res. 2022;50(W1):W159–W164. doi: 10.1093/nar/gkac394.
  30. Duffy JP, et al. The discovery of VX-745: a novel and selective p38α kinase inhibitor. ACS Med Chem Lett. 2011;2(10):758–763.
  31. Sheng Y, et al. Crocin inhibits neutrophil migration and activation to treat hypoxic pulmonary hypertension through targeting HCK. Phytomedicine. 2025;148:157334. doi: 10.1016/j.phymed.2025.157334.
  32. Cui H, et al. Leonurine ameliorates hypoxic pulmonary hypertension by inhibiting cross-talk between neutrophils and endothelial cells via SERPINB3 targeting. Int Immunopharmacol. 2026;176:116467. doi: 10.1016/j.intimp.2026.116467.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Identificación de biomarcadoresdatos ómicosexpresión diferencialcoexpresión génicared de interacción proteicasecuenciación de ARN de célula únicareposicionamiento de fármacosPCR cuantitativa