Identificación de genes superpuestos, análisis de enriquecimiento y construcción de la red de interacción de proteínas (PPI)
Del conjunto de datos GSE54837, se identificaron 3.371 genes diferencialmente expresados (DEG), incluyendo 1.675 DEG regulados hacia arriba y 1.696 DEG regulados hacia abajo. Los 10 genes con mayor regulación diferencial significativa, tanto hacia arriba como hacia abajo, se muestran en Figura 1A. Se realizó un agrupamiento jerárquico de los datos de GSE54837 (Figura Suplementaria 1A), y se aplicó una potencia de umbralización suave de 10 para asegurar una topología de red libre de escala (Figura 1B). Los módulos de coexpresión génica se construyeron utilizando el método de corte dinámico de árboles con un tamaño mínimo del módulo de 50 genes, y a cada módulo se le asignó un color distinto (Figura Suplementaria 1B). Los módulos con correlaciones de eigengenes > 0,75 se fusionaron posteriormente (Figura Suplementaria 1C, Figura 1C), lo que dio lugar a 14 módulos distintos. Basado en el análisis de correlación de Pearson entre los eigengenes de los módulos y las características clínicas, el módulo MEsalmon (compuesto por 5.226 genes) mostró la correlación positiva más significativa con la EPOC (r = 0,35, p = 7 x 10⁻8, Figura 1D). El análisis de Venn identificó 160 genes superpuestos entre los 3.371 DEG, los 5.226 genes del módulo MEsalmon y los 2.118 ac4C-RG (Figura 1E). El análisis de enriquecimiento funcional de estos 160 genes mostró que los términos GO significativos incluyeron unión a ARN de cadena sencilla, regulación del proceso metabólico del ARNm y vía de señalización RIG-I (Figura 1F). Además, el análisis KEGG demostró que estos genes se enriquecieron principalmente en la fagocitosis mediada por Fc gamma R, la vía de vigilancia del ARNm y la adhesión focal (Figura 1G). La red PPI de los genes superpuestos contenía 118 nodos y 196 enlaces (Figura 1H).
Identificación de seis genes clave en la EPOC
Para identificar aún más los posibles genes clave entre los 160 candidatos superpuestos, se aplicaron tres algoritmos de aprendizaje automático. Primero se aplicó la regresión LASSO, utilizando validación cruzada para determinar el parámetro de penalización óptimo (λ) ≈ 0,091 (Figura 2A). El gráfico del perfil de coeficientes indicó que se conservaron 17 genes en el valor óptimo de λ (Figura 2B). El análisis XGBoost identificó los 30 genes principales con la mayor ganancia, entre los cuales PTRF, WBP11 y LDOC1L mostraron un alto valor predictivo (Figura 2C). El algoritmo RF clasificó de manera similar los 30 genes principales según sus puntuaciones de importancia Gini, siendo PTRF, RFX5 y PRKCDBP los de mayor capacidad predictiva (Figura 2D). El análisis de intersección de los genes seleccionados por los tres métodos identificó seis genes clave superpuestos: PTRF, PRKCDBP, UPP1, TOR3A, FAM168B y B4GALT2 (Figura 2E).
Construcción del modelo diagnóstico y análisis de expresión de genes clave
Utilizando el 70 % del conjunto de datos GSE54837 como conjunto de entrenamiento, se estableció un modelo de regresión logística que incorpora los seis genes clave. El análisis de la curva ROC indicó un rendimiento diagnóstico moderado, con AUC de 0,766 (IC del 95 %: 0,691–0,8417), 0,759 (IC del 95 %: 0,6368–0,8817) y 0,723 (IC del 95 %: 0,6085–0,8596) para los conjuntos de entrenamiento, prueba interna y validación externa, respectivamente (Figura 3A–C). El análisis de calibración confirmó una alta fiabilidad, y el DCA indicó un beneficio clínico neto claro en un amplio rango de probabilidades umbral tanto en los conjuntos de entrenamiento (Figura 3D–E) como de validación (Figura 3F–G). Se construyó un nomograma para visualizar la contribución de cada gen y facilitar la estimación individualizada del riesgo (Figura 3H). El análisis de expresión reveló que B4GALT2, PRKCDBP y UPP1 estaban significativamente sobreexpresados en muestras de EPOC, mientras que FAM168B, PTRF y TOR3A estaban subexpresados (Figura 3I).
Red reguladora y análisis funcional de los genes clave en la EPOC
Se construyó una red de interacciones funcionales que comprende los 20 genes principales más relacionados con los genes centrales identificados mediante análisis GeneMANIA (Figura 4A). Las interacciones físicas representaron la mayoría de las conexiones, seguidas por correlaciones de coexpresión y dominios proteicos compartidos. La anotación funcional indicó un enriquecimiento significativo en procesos como el proceso catabólico de moléculas pequeñas que contienen nucleobases, el proceso catabólico de nucleósidos y la balsa de membrana plasmática. Se investigó la regulación postranscripcional mediante la intersección de predicciones de miARN procedentes de las bases de datos DIANA-microT y miRanda, identificándose ocho miARN superpuestos (Figura 4B). Posteriormente, se construyó un eje regulador lncARN-miARN-mARN. Según el diagrama de Sankey, se predijo que dos de los miARN identificados, ambos asociados con la regulación de FAM168B, fueran diana de siete lncARN; no se identificaron interacciones reguladoras de este tipo para los cinco genes centrales restantes (Figura 4C). La regulación transcripcional se exploró además utilizando la plataforma ChEA3, que predijo factores de transcripción (TF) upstream para B4GALT2, UPP1, FAM168B y TOR3A. Se seleccionaron los diez principales TF para cada gen con el fin de construir una red reguladora de tipo TF-diana (Figura 4D). Se realizó un análisis GSEA para investigar las funciones biológicas de los seis genes clave. UPP1 mostró un enriquecimiento significativo en procesos biológicos como el proceso metabólico del diacilglicerol y el proceso biosintético del trifosfato de nucleósido de purina, así como en vías incluyendo el proteasoma y el metabolismo de xenoobióticos por citocromo P450 (Figura 4E–F). Los resultados de enriquecimiento para los cinco genes clave restantes se proporcionan en la Figura Suplementaria 2A–J.
Infiltración inmunitaria de UPP1 y predicción de dianas terapéuticas en la EPOC
Se evaluaron los niveles de infiltración inmunitaria de 28 tipos de células inmunitarias en los grupos control y EPOC mediante el algoritmo ssGSEA. En pacientes con EPOC, las células B de memoria, las células supresoras derivadas de la médula ósea y las células dendríticas activadas mostraron puntuaciones de enriquecimiento significativamente más altas. En contraste, las células T auxiliares tipo 1, las células B activadas y las células B inmaduras mostraron puntuaciones de enriquecimiento significativamente más bajas (Figura 5A). Cabe señalar que el ssGSEA proporciona estimaciones relativas de enriquecimiento de células inmunitarias basadas en datos transcriptómicos, en lugar de mediciones directas de las proporciones de células inmunitarias. El análisis de correlación reveló que los seis genes clave exhibieron patrones diferenciales de asociación con subconjuntos de células inmunitarias. Específicamente, UPP1, PRKCDBP y B4GALT2 mostraron correlación positiva con los niveles de infiltración de células B de memoria, células dendríticas activadas y células supresoras derivadas de la médula ósea (Spearman ρ > 0.4, p < 0.05), mientras que PTRF, TOR3A y FAM168B mostraron correlaciones negativas con las células T auxiliares tipo 1 y las células B activadas (Spearman ρ < −0.3, p < 0.05). La matriz completa de correlación se presenta en el mapa de calor (Figura 5B). El análisis de predicción de fármacos identificó a UPP1 como el único gen entre los seis candidatos con interacciones predichas con moléculas pequeñas. Tres compuestos, incluyendo fluorouracilo, capecitabina y 5-bencilacilouridina, se identificaron en la base de datos como compuestos potenciales que interactúan con UPP1 (Figura 5C). Estos compuestos se utilizan principalmente en oncología o en entornos experimentales, y su relevancia en la EPOC requiere una investigación adicional. Los cálculos de energía libre de enlace revelaron que la 5-bencilacilouridina exhibió la afinidad de enlace más fuerte, lo que sugiere una afinidad de enlace predicha relativamente más alta (Tabla 3). Las visualizaciones del acoplamiento molecular para los tres compuestos indicaron conformaciones de enlace predichas favorables con UPP1, consistentes con predicciones computacionales de acoplamiento, más que con validación experimental (Figura 5D–F). Además, el análisis CTD indicó que los seis genes clave estaban fuertemente asociados con diversos fenotipos de enfermedad, incluyendo efectos tardíos de la exposición prenatal, pérdida de peso, hepatomegalia e inflamación (Figura 5G–L).
Validación mediante RT-qPCR de genes diagnósticos clave en muestras clínicas
Para validar los niveles de expresión de genes clave, se recolectaron muestras de sangre de ocho pacientes con EPOC y ocho sujetos de control, y este análisis se consideró una validación preliminar debido al tamaño limitado de la muestra. Como se muestra en la Figura 6A–F, PTRF, TOR3A y FAM168B estuvieron significativamente subregulados, mientras que PRKCDBP y UPP1 estuvieron significativamente sobrerregulados en las muestras de EPOC, lo cual es consistente con las tendencias observadas en el análisis de bioinformática. En contraste, no se observó ninguna diferencia significativa en la expresión de B4GALT2 entre los dos grupos. Esta discrepancia podría atribuirse al tamaño limitado de la muestra o a diferencias en los tipos de muestra entre los conjuntos de datos y los especímenes clínicos.
DECLARACIÓN DE DISPONIBILIDAD DE DATOS:
Todos los datos de secuenciación de ARN se obtuvieron de la base de datos Gene Expression Omnibus (GEO, https://www.ncbi.nlm.nih.gov), seleccionándose GSE54837 como conjunto de entrenamiento y GSE112811 como conjunto de validación. El código utilizado en este análisis puede obtenerse desde https://doi.org/10.5281/zenodo.21771476.

Figura 1: Identificación de genes superpuestos, análisis de enriquecimiento y construcción de la red PPI. (A) Gráfico de volcán de los genes diferencialmente expresados (DEGs) en el conjunto de datos GSE54837. (B) Selección del umbral suave. (C) Dendrograma de agrupamiento por módulos (tras la fusión). (D) Mapa de calor de la correlación entre módulos y rasgos. (E) Diagrama de Venn para identificar genes superpuestos. (F) Diagrama de morera del análisis de enriquecimiento GO, que muestra los principales resultados de enriquecimiento de los genes de intersección en MF, CC y BP. (G) Diagrama de paloteles del análisis de enriquecimiento de vías de señalización KEGG, donde el tamaño de la burbuja representa el número de genes enriquecidos. (H) Red PPI de los genes superpuestos; los nodos representan proteínas y los enlaces representan interacciones proteína-proteína. Abreviaturas: DEGs = genes diferencialmente expresados; PPI = interacción proteína-proteína; GO = Ontología Genética; MF = función molecular; CC = componente celular; BP = proceso biológico; KEGG = Enciclopedia de Genes y Genomas de Kioto; ac4C-RGs = genes relacionados con la N4-acetilcitosina. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Identificación de seis genes clave en la EPOC. (A) Curva de validación cruzada de LASSO. (B) Diagrama de trayectoria de coeficientes de regresión LASSO. A medida que λ aumenta, los coeficientes de los genes no importantes convergen a 0. (C) Clasificación de importancia de características de XGBoost. El eje x representa el valor de ganancia, el eje y representa el nombre del gen, y la intensidad del color representa la importancia. (D) Clasificación de importancia de características de RF. El eje x representa la disminución media del índice de Gini. (E) Diagrama de Venn de los genes superpuestos obtenidos mediante el análisis cruzado de los tres algoritmos. Abreviaturas: LASSO = operador de contracción y selección por mínima absoluta; XGBoost = incremento de gradiente extremo; RF = bosque aleatorio. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Construcción de un modelo diagnóstico y análisis de expresión de genes clave. (A) Curva ROC del conjunto de entrenamiento. (B) Curva ROC del conjunto de prueba interno. (C) Curva ROC del conjunto de validación externo. (D) Curva de calibración del conjunto de entrenamiento. (E) Análisis de curvas de decisión (DCA) del conjunto de entrenamiento. (F) Curva de calibración del conjunto de validación externo. (G) Análisis de curvas de decisión (DCA) del conjunto de validación externo. (H) Nomograma de seis genes clave. Para la predicción del riesgo individual de EPOC, a cada gen se le asigna una puntuación correspondiente. (I) Análisis de expresión de seis genes clave en muestras de EPOC y controles del conjunto de datos GSE54837. Abreviaturas: ROC = característica de operación del receptor; AUC = área bajo la curva; DCA = análisis de curvas de decisión; EPOC = enfermedad pulmonar obstructiva crónica. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Red reguladora y significado funcional de los genes clave en la EPOC. (A) Resultados del análisis GeneMANIA de 6 genes clave. El color de las líneas indica la correlación entre genes, y el color de los nodos indica diferentes categorías funcionales. (B) Diagrama de Venn del análisis cruzado de las bases de datos DIANA-microT y miRanda. (C) Diagrama de morera de la red reguladora ceRNA. (D) Red reguladora de factores de transcripción potenciales. Los nodos azules representan factores de transcripción, y los nodos naranjas representan genes diana. (E) Análisis de enriquecimiento GSEA de un solo gen para UPP1, que incluye GO. (F) Análisis de enriquecimiento GSEA de un solo gen para UPP1, que incluye KEGG. Abreviaturas: GO = Gene Ontology; KEGG = Kyoto Encyclopedia of Genes and Genomes. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Infiltración inmunitaria de genes clave y predicción de dianas farmacológicas en la EPOC. (A) Diferencias en la abundancia de células inmunitarias entre grupos. (B) Mapa de calor de la correlación entre células inmunitarias y genes clave. (C) Red de interacción entre genes clave y fármacos predichos. (D) Acoplamiento molecular de fluorouracilo con UPP1. (E) Acoplamiento molecular de capecitabina con UPP1. (F) Acoplamiento molecular de 5-bencilacilouridina con UPP1. Para cada compuesto, la imagen izquierda muestra la conformación general del acoplamiento, y la imagen derecha muestra las interacciones locales de unión. (G) Análisis CTD de B4GALT2. (H) Análisis CTD de FAM168B. (I) Análisis CTD de PRKCDBP. (J) Análisis CTD de PTRF. (K) Análisis CTD de TOR3A. (L) Análisis CTD de UPP1. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Validación mediante RT-qPCR de la expresión génica clave en muestras de EPOC y controles. (A) Expresión relativa de PTRF. (B) Expresión relativa de PRKCDBP. (C) Expresión relativa de UPP1. (D) Expresión relativa de TOR3A. (E) Expresión relativa de FAM168B. (F) Expresión relativa de B4GALT2. ns = no significativo, p > 0.05; * p < 0.05; ** p < 0.01; *** p < 0.001; **** p < 0.0001. Abreviatura: RT-qPCR = reacción en cadena de la polimerasa cuantitativa por transcripción inversa. Haga clic aquí para ver una versión más grande de esta figura.
Figura suplementaria 1: Muestras del conjunto de datos GSE54837 y agrupamiento de módulos genéticos. (A) Diagrama de agrupamiento de muestras del conjunto de datos GSE54837. (B) Dendrograma de agrupamiento de módulos antes de la fusión. Los genes se agruparon mediante el método de corte de árbol dinámico para identificar módulos distintos. (C) Dendrograma de agrupamiento jerárquico de eigengenes de módulos. Los módulos con patrones de expresión similares se agruparon según la similitud de sus eigengenes.Haga clic aquí para descargar este archivo.
Figura suplementaria 2: Análisis de enriquecimiento GSEA. (A) Análisis GO de PRKCDBP. (B) Análisis KEGG de PRKCDBP. (C) Análisis GO de PTRF. (D) Análisis KEGG de PTRF. (E) Análisis GO de TOR3A. (F) Análisis KEGG de TOR3A. (G) Análisis GO de FAM168B. (H) Análisis KEGG de FAM168B. (I) Análisis GO de B4GALT2. (J) Análisis KEGG de B4GALT2. Abreviaturas: GO = Ontología Genética; KEGG = Enciclopedia de Genes y Genomas de Kioto.Haga clic aquí para descargar este archivo.
| Conjunto de datos | Controles | Pacientes | Plataforma de secuenciación |
| GSE54837 | 90 | 136 | GPL570 |
| GSE112811 | 44 | 20 | GPL570 |
Tabla 1: Conjuntos de datos de expresión génica utilizados en el estudio. Características de los conjuntos de datos GSE54837 y GSE112811 utilizados para el desarrollo/prueba interna del modelo y la validación externa, respectivamente.
| Paciente | 1 | 2 | 3 | 4 | 5 | 6 | 7 | 8 |
| Género (F/M) | M | M | M | F | M | M | M | M |
| Edad (años) | 69 | 72 | 75 | 73 | 68 | 70 | 69 | 71 |
| Estado de tabaquismo | Sí | Sí | Dejó de fumar (2 años) | No | Sí | Sí | Sí | Dejó de fumar (5 años) |
| Paquetes-año | 20 por día / 30 años | 15 por día / 35 años | 20 por día / 50 años | | 20 por día / 40 años | 30 por día / 40 años | 15 por día / 40 años | 20 por día / 30 años |
| Grupo de EPOC | 2 | 3 | 3 | 2 | 2 | 3 | 2 | 3 |
Tabla 2: Características basales de los participantes del estudio. Características demográficas y clínicas basales de los pacientes con EPOC y los controles sanos incluidos en la validación mediante RT-qPCR.
| Nombre molecular | Gen | Puntuación (kcal/mol) |
| 5-Benzilacilouridina | UPP1 | -9.6 |
| Capecitabina | UPP1 | -6.1 |
| Fluorouracilo | UPP1 | -5.5 |
Tabla 3: Resultados de acoplamiento molecular para UPP1 y compuestos candidatos.
Resultados predichos de acoplamiento molecular para la interacción de UPP1 con fluorouracilo, capecitabina y 5-bencilacilouridina, incluyendo sus afinidades de unión.