Este estudio fue aprobado por la Junta de Revisión Institucional del Primer Hospital Afiliado de la Universidad Médica de Bengbu (Número de aprobación: 2023YJS162). Se obtuvo el consentimiento informado por escrito de todos los participantes antes de la recogida de la muestra.
Recogida de datos
Los datos transcriptómicos utilizados en este estudio se obtuvieron de la base de datos Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/; RRID: SCR_005012). El conjunto de datos principal de entrenamiento, GSE150910, se generó utilizando la plataforma Illumina NovaSeq 6000 (GPL24676) y comprendía 103 muestras de tejido pulmonar IPF y 103 de tejido pulmonar normal. Para validar los hallazgos, se emplearon conjuntos de datos independientes GSE24206, GSE110147, GSE93606 y GSE38958. La información detallada de cada conjunto de datos se proporciona en la Tabla 1. Además, se seleccionaron un total de 636 GRGs de un estudiopreviamente publicado 14.
Análisis de expresión diferencial y caracterización funcional de DEGs relacionados con la glicosilación
Se realizó un análisis diferencial de expresión entre muestras de tejido pulmonar IPF y normal del conjunto de datos GSE150910 utilizando el paquete R DESeq2 (RRID: SCR_015687). Genes con un valor p ajustado (padj) < 0,05 y |log2FoldChange| > 0,5 se consideraron genes expresados diferencialmente (DEGs). Las DEGs relacionadas con la glicosilación (GR-DEGs) se identificaron intersectando las DEGs con un conjunto predefinido de 636 GRGs. Para investigar más a fondo los roles biológicos de estos genes, se realizaron análisis de enriquecimiento por Ontología Génica (GO) y análisis de vías de la Enciclopedia de Genes y Genomas de Kioto (KEGG) para esclarecer sus funciones funcionales y su implicación en las vías. Se generó una red de interacción proteína-proteína (PPI) utilizando la base de datos STRING (RRID: SCR_005223)15 con un umbral de puntuación de confianza en la interacción de > 0,7, para dilucidar las interacciones moleculares y los posibles mecanismos reguladores de los GR-DEGs en la IPF.
Cribado de genes clave y construcción de un modelo diagnóstico
Para detectar genes clave para la IPF a partir de GR-DEGs, empleamos múltiples algoritmos de aprendizaje automático. Inicialmente, la regresión LASSO (RRID: SCR_003418) se equipó con regresión logística binaria (familia = "binomial") y el parámetro de penalización óptimo λ se seleccionó mediante validación cruzada de 10 veces (nfold = 10). Los resultados finales de selección fueron las características con coeficientes distintos de cero correspondientes a λ_(min) (0,01700442). Para SVM-RFE, se utilizó la función rfe del caret de paquete R. La eliminación recursiva de características se realizó mediante validación cruzada de 10 veces (método = "cv", número = 10), filtrando progresivamente características de 1 a 126, utilizando la precisión para determinar el subconjunto óptimo de características. En XGBoost, la función objetivo se configuró en regresión logística binaria (objetivo = "binario: logístico"), con la métrica de evaluación en pérdida logarítmica (eval_metric = "logloss"), el número de iteraciones (rondas) en 100 y la tasa de aprendizaje (eta) en 0,1. Los 20 genes principales fueron seleccionados en función de sus puntuaciones de importancia de características (Ganancia). Al intersectar los resultados de estos métodos, se identificó un conjunto refinado de genes clave. A partir de este conjunto génico, se construyó un modelo diagnóstico XGBoost utilizando el conjunto de datos de entrenamiento (GSE150910), y su rendimiento predictivo se evaluó mediante análisis de características operativas del receptor (ROC) en conjuntos de datos externos de validación (GSE110147, GSE24206, GSE93606 y GSE38958). Además, se desarrolló un nomograma para visualizar la contribución de cada gen seleccionado a la probabilidad de la enfermedad, y la utilidad clínica del modelo se evaluó a fondo mediante curvas de calibración y análisis de curvas de decisión (DCA).
Exploración de las vías biológicas de genes clave
Explorar el contexto biológico de los genes clave identificados por el aprendizaje automático. El Análisis de Enriquecimiento de Conjuntos Génicos (GSEA)16 se realizó basándose en las listas de genes de la Molecular Signatures Database (MSigDB) (RRID: SCR_016863)17y las vías fueron evaluadas para NES > 1. Las vías enriquecidas por el tope se visualizaron usando la función enrichplot.
Explorando la función biológica y las diferencias en el panorama inmunológico en subtipos de FPI basándose en puntuaciones génicas clave
Basándose en los perfiles de expresión de los genes clave identificados, se calcularon puntuaciones del Análisis de Enriquecimiento de Conjuntos Génicos (ssGSEA) de muestra única y se utilizaron para estratificar a los pacientes con IPF en grupos de alta y baja puntuación basándose en la mediana de la puntuación. Se realizó un análisis diferencial de expresión entre ambos grupos, seguido por GSEA (RRID: SCR_003199)18 para realizar análisis de Procesos Biológicos GO (GOBP) y de enriquecimiento de vías KEGG sobre los DEGs.
Análisis de la infiltración de células inmunitarias y diferencias clave en la expresión génica
Tras la estratificación de subgrupos basada en las puntuaciones ssGSEA, se evaluaron las diferencias en infiltración inmune entre los grupos con puntuación alta y baja. Primero, calculamos las abundancias relativas de 22 tipos de células inmunitarias en las muestras utilizando el algoritmo CIBERSORT (RRID: SCR_016955)19 en combinación con la matriz de características LM22. Específicamente, se utilizó la función deconv_tme en el paquete R IOBR (parámetros: método = "cibersort", arrays = FALSE, perm = 200) para los cálculos, y se generaron diagramas de caja usando el paquete ggpubr (RRID: SCR_021139) para evaluar las diferencias en la infiltración de células inmunitarias entre los grupos con puntuación alta y baja. Además, la función gsva en el paquete R GSVA (usando el método ssGSEA) se utilizó para calcular las puntuaciones de enriquecimiento de 28 tipos de células inmunitarias. Estas puntuaciones se normalizaron luego mediante escalado Min-Max para mapearlas al intervalo [0, 1], facilitando comparaciones entre tipos celulares. Finalmente, se realizaron pruebas de suma de rangos de Wilcoxon para comparar la expresión de genes clave entre muestras normales y pacientes con IPF en los conjuntos de datos GSE150910 y GSE110147, proporcionando un análisis exhaustivo de la infiltración celular inmunitaria y las diferencias de expresión génica entre subgrupos de IPF.
Validación de genes clave en pacientes con IPF mediante análisis RT-qPCR
Para validar la relevancia diagnóstica de los genes identificados, se seleccionaron seis genes con las puntuaciones de mayor importancia según el algoritmo XGBoost para validación de niveles de expresión en pacientes con IPF y controles sanos mediante PCR cuantitativa de transcripción inversa (RT-qPCR). Se recogieron un total de 20 muestras de sangre, incluyendo 9 de pacientes con IPF y 11 de individuos sanos, del Primer Hospital Afiliado de la Universidad Médica de Bengbu. Se extrajo ARN total de las muestras de sangre y se midió la concentración de ARN utilizando un microlector multifuncional. La calidad del ARN se evaluó antes de los análisis posteriores. El ADN genómico fue eliminado durante la transcripción inversa, y las secuencias de cebador utilizadas para RT-qPCR se enumeran en la Tabla 2. La especificidad del cebador fue verificada mediante análisis de curva de fusión. GAPDH se utilizó como gen de referencia interno. Los niveles relativos de expresión génica se calcularon utilizando el método 2-ΔΔCt . Este paso de validación proporciona un apoyo experimental preliminar para la expresión diferencial y la posible relevancia diagnóstica de los genes identificados en la IPF.
Análisis estadístico
Los datos se analizaron en R, y se utilizó la prueba de Wilcoxon para detectar diferencias entre ambos grupos. El análisis de enriquecimiento GSEA, GO y KEGG se realizó utilizando el cluster Profiler de paquetes R (RRID: SCR_016884). Un valor p < 0,05 se consideraba significativo salvo que se especificara lo contrario.