Este estudio utilizó únicamente conjuntos de datos públicos y desidentificados y no implicó experimentación directa en humanos o animales; Por lo tanto, no se requería aprobación adicional del comité de ética ni consentimiento informado.
Descarga y procesamiento de datos
Los datos de secuenciación de ARN y la información clínica correspondiente para el carcinoma escamoso pulmonar (LUSC) se obtuvieron de la base de datos The Cancer Genome Atlas (TCGA) a través del portal de datos Genomic Data Commons bajo el proyecto TCGA-LUSC. La matriz de expresión TCGA-LUSC utilizada en este estudio se basó en valores FPKM. Los valores de expresión génica se transformaron y normalizaron antes de los análisis posteriores. Las variables clínicas incluyeron edad, sexo, estadio tumoral, estadio patológico de la MTN, grado, tiempo de supervivencia y estado de supervivencia cuando estaban disponibles. Inicialmente se recogieron un total de 489 casos de TCGA-LUSC, y se incluyeron 381 pacientes con perfiles de expresión completos e información de supervivencia global en la construcción del modelo pronóstico y la evaluación interna.
Los conjuntos de datos de validación independientes se descargaron de la base de datos Gene Expression Omnibus (GEO) el 3 de enero de 2026. GSE30219 se basó en la plataforma GPL570 e incluyó 307 pacientes con LUSC con información disponible sobre expresión y supervivencia global. GSE37745 también se basó en la plataforma GPL570 e incluyó 196 pacientes con LUSC con información disponible sobre expresión y supervivencia global. GSE57148 se basó en la plataforma GPL11154 e incluyó 91 tejidos pulmonares normales y 98 tejidos pulmonares de pacientes con enfermedad pulmonar obstructiva crónica (EPOC), sumando un total de 189 muestras. GSE57148 se utilizó para identificar genes diferencialmente expresados asociados a la EPOC, mientras que GSE30219 y GSE37745 se emplearon como cohortes externas independientes de validación.
Para conjuntos de datos GEO, la anotación de sonda se realizaba utilizando el correspondiente paquete de anotación R y los archivos de anotación de plataforma. Los identificadores de la sonda se convirtieron en símbolos genéticos oficiales. Cuando varias sondas se asignaban al mismo gen, la sonda con el valor medio de expresión más alto se mantenía para representar ese gen. No se detectaron genes de modelo faltantes en los conjuntos de datos de validación tras la coincidencia gen-símbolo. TCGA-LUSC, GSE30219 y GSE37745 fueron analizados como cohortes generales de LUSC porque el estado de comorbilidad a nivel de paciente no se confirmó en las anotaciones utilizadas para este análisis.
Como los conjuntos de datos TCGA y GEO se generaban utilizando diferentes plataformas de expresión, la normalización multiplataforma y la corrección de efectos por lotes se realizaban utilizando métodos estándar de preprocesamiento basados en R antes de la aplicación del modelo. El modelo de riesgo se entrenó en la cohorte TCGA-LUSC y luego se evaluó de forma independiente en cada cohorte externa de GEO, en lugar de fusionar directamente todas las cohortes. El análisis diferencial de expresión se realizó utilizando el paquete limma R. Los genes de expresión diferencial asociados a la EPOC en GSE57148 fueron cribados utilizando |log2FC| > 0,263 y P < 0,05. Este umbral log2FC corresponde a un cambio de aproximadamente 1,2 veces y se utilizó como criterio exploratorio para retener genes potencialmente relevantes asociados a PANoptosis. Un total de 277 genes asociados a PANoptosis fueron seleccionados a partir de estudios previamente publicados relacionados con apoptosis, pirooptosis, necroptosis y PANoptosis, y se proporcionan en la Tabla Suplementaria 1.
Análisis de enriquecimiento funcional de genes
Para aclarar las implicaciones funcionales de los genes seleccionados de PANoptosis asociados a la EPOC, se realizaron análisis de enriquecimiento de Gene Ontology (GO) y Kyoto Encyclopedia of Genes and Genomes (KEGG) utilizando el paquete clusterProfiler R y la organización. Hs.eg.db paquete de anotaciones. Se evaluaron las categorías de procesos biológicos, componentes celulares y función molecular de GO. Se realizó un análisis de enriquecimiento de vías KEGG para identificar vías de señalización asociadas a los genes seleccionados. Los valores p se ajustaron para múltiples pruebas utilizando el método de tasa de descubrimiento de falsos errores de Benjamini-Hochberg cuando fue aplicable. Los términos de enriquecimiento con P < 0,05 se consideraron estadísticamente significativos en este análisis exploratorio. Los gráficos de enriquecimiento se generaban usando ggplot2.
Análisis de agrupamiento no supervisado de patrones de expresión génica asociados a PANoptosis
Para explorar la heterogeneidad molecular asociada a la expresión génica asociada a PANoptosis en LUSC, se realizó un agrupamiento por consenso utilizando el paquete Consensus ClusterPlus R. Las muestras de LUSC se agruparon según los perfiles de expresión de genes de PANoptosis asociados a la supervivencia. Se aplicó agrupamiento jerárquico con distancia de correlación de Pearson. El número máximo de clústeres se estableció en seis y se realizaron 1.000 iteraciones de remuestreo para evaluar la robustez de los agrupamientos. El número óptimo de conglomerado se determinó evaluando la matriz de consenso, la curva de función de distribución acumulada, el gráfico de área delta y la interpretabilidad biológica de los grupos resultantes. Según estos criterios, se seleccionó k = 2 para el análisis posterior. Las diferencias de supervivencia entre los dos grupos moleculares se evaluaron mediante el análisis de Kaplan-Meier y la prueba logarítmica de rango.
Análisis de las diferencias entre microambientes inmunes entre subtipos
Para comparar las características del microambiente inmune entre subtipos moleculares, se estimó la infiltración de células inmunitarias utilizando el algoritmo de deconvolución CIBERSORT con la matriz de firma leucocitaria LM22. El análisis se realizó en R utilizando los paquetes e1071 y preprocessCore. Se registraron los valores P de la permutación de CIBERSORT para evaluar la fiabilidad de las estimaciones de desconvolución. Debido a que este estudio fue exploratorio y se basó en datos transcriptómicos retrospectivos, las diferencias entre las células inmunitarias se interpretaron como patrones de infiltración inmune inferidos computacionalmente en lugar de mediciones celulares directas.
El algoritmo ESTIMATE se utilizó para calcular la puntuación estromal, la puntuación inmune, la puntuación ESTIMATE y la pureza tumoral para cada muestra tumoral. Se aplicó GSVA para estimar las puntuaciones de enriquecimiento a nivel de vía basándose en conjuntos génicos seleccionados. Se evaluaron diferencias por grupo en fracciones de células inmunes, genes de puntos de control inmunitarios, genes de la familia HLA y puntuaciones derivadas de ESTIMATE mediante pruebas no paramétricas. Para múltiples comparaciones relacionadas con el sistema inmunitario, se aplicó la corrección de Benjamini-Hochberg cuando fue apropiado; los análisis reportados utilizando valores nominales de P se interpretaron como exploratorios. El análisis de correlación de rangos de Spearman se utilizó para evaluar las asociaciones entre la expresión génica y los marcadores relacionados con el sistema inmunológico, reportándose tanto coeficientes de correlación como valores P cuando correspondía. Las diferencias en los transcritos HLA se interpretaron como cambios transcripcionales relacionados con la presentación de antígenos más que como evidencia funcional directa de una mayor capacidad de presentación de antígenos.
Establecimiento de una firma pronóstica relacionada con genes asociados a PANoptosis
La cohorte TCGA-LUSC con perfiles de expresión completos e información de supervivencia global se utilizó para la construcción pronóstica del modelo. Entre los 489 casos inicialmente recuperados de TCGA-LUSC, se incluyeron 381 pacientes con datos completos de supervivencia global en el análisis pronóstico. Estos pacientes se dividieron aleatoriamente en una cohorte de entrenamiento y una cohorte interna de pruebas con una proporción de 7:3. Se realizó aleatorización estratificada según el estado de supervivencia para mantener una distribución comparable de eventos de supervivencia entre las cohortes de entrenamiento y prueba.
En la cohorte de entrenamiento, se utilizó por primera vez la regresión de riesgos proporcionales de Cox univariante para evaluar la asociación entre cada gen candidato asociado a PANoptosis y la supervivencia global. Los genes con P < 0,05 se consideraron genes pronósticos candidatos y posteriormente se introdujeron en la regresión LASSO Cox usando el paquete glmnet R. Se utilizó una validación cruzada de diez veces para seleccionar el parámetro de penalización óptimo y reducir el sobreajuste. Basándose en los coeficientes de regresión de Cox de LASSO y los valores de expresión génica normalizados correspondientes, se calculó una puntuación de riesgo individualizada para cada paciente utilizando la fórmula:
Puntuación de riesgo = Σ(coefi × Xi)
donde coefi representa el coeficiente de regresión de cada gen seleccionado y Xi representa el valor de expresión normalizado del gen correspondiente. El modelo pronóstico final contenía 12 genes: GSDMD, IL18, NFKBIA, PIK3CA, IL1B, BIRC3, MCL1, PSMB10, LMNA, CFLAR, IL1R1 y AKT3. La ecuación completa basada en coeficientes de la puntuación de riesgo se proporciona en la Tabla Suplementaria 2.
La puntuación mediana de riesgo en la cohorte de formación se utilizó como corte para clasificar a los pacientes en grupos de alto y bajo riesgo. La misma fórmula de puntuación de riesgo se aplicó a la cohorte interna de pruebas y a las cohortes externas de validación GSE30219 y GSE37745. Se utilizaron análisis de supervivencia de Kaplan-Meier, pruebas logarítmicas y análisis de curvas características de funcionamiento del receptor dependientes del tiempo para evaluar el rendimiento del modelo. Dado que los conjuntos de datos de validación se generaron utilizando plataformas de microarrays y no contenían anotación confirmada de comorbilidad de EPOC, la validación externa se interpretó como evaluación retrospectiva en cohortes independientes de LUSC en lugar de validación en pacientes clínicamente confirmados con LUSC con EPOC comórbida.
Análisis de predicción de sensibilidad a fármacos
La sensibilidad a los fármacos se estimó utilizando el paquete pRRophetic R, que predice la respuesta a los fármacos a partir de los perfiles de expresión génica tumoral basándose en datos de referencia farmacogenómicos de la base de datos Genomics of Drug Sensitivity in Cancer. Se calcularon valores predichos de concentración inhibitoria media máxima (IC50) para cada muestra de paciente. Las matrices de expresión se procesaron según los requisitos de entrada pRRophetic, y la corrección de efectos por lotes se realizó utilizando el flujo de trabajo estándar compatible con pRRophetic. Los valores predichos de IC50 se informaron en la escala de salida pRRofética.
Ocho agentes candidatos, incluyendo sorafenib, gefitinib, bleomicina, bosutinib, etopósido, lenalidomida, camptotecina y metotrexato, fueron evaluados como un panel exploratorio de sensibilidad al fármaco. Se compararon las diferencias en los valores predichos de IC50 entre grupos de alto y bajo riesgo utilizando la prueba de suma de rangos de Wilcoxon. Estos resultados se interpretaron como estimaciones computacionales de sensibilidad al fármaco en lugar de respuesta medida a la quimioterapia clínica o resistencia confirmada experimentalmente al fármaco.
Análisis estadístico
Todos los análisis estadísticos se realizaron utilizando el software R. Las variables continuas entre dos grupos se compararon utilizando la prueba de suma de rangos de Wilcoxon, mientras que las comparaciones entre más de dos grupos se realizaron mediante la prueba de Kruskal-Wallis cuando era apropiado. La supervivencia global se definió como el principal punto final de supervivencia. Se generaron curvas de supervivencia de Kaplan-Meier para comparar las diferencias de supervivencia entre grupos, y se evaluó la significación estadística mediante la prueba log-rank. Univariado y multivariante
Se utilizaron análisis de regresión de riesgos proporcionales de Cox para evaluar asociaciones pronósticas entre variables clínicas, grupo de riesgo y supervivencia global. Se consideraron variables con relevancia clínica o significación estadística en el análisis de Cox univariante para la regresión multivariante de Cox. La hipótesis de riesgos proporcionales se evaluó utilizando residuos de Schoenfeld. Las variables clínicas ausentes se manejaron mediante análisis de casos completos para la regresión de Cox y la construcción de nomogramas. La colinealidad entre variables clínicas se evaluó antes de la modelización multivariante.
Se utilizaron curvas ROC dependientes del tiempo para evaluar el rendimiento predictivo del modelo de riesgo para la supervivencia global a 1, 3 y 5 años. Se construyó un nomograma utilizando variables retenidas en el modelo multivariante o variables con disponibilidad clínica suficiente. Se utilizaron gráficos de calibración para comparar las probabilidades de supervivencia global predichas y observadas. El análisis de la curva de decisión se realizó como una evaluación exploratoria del beneficio neto potencial a través de probabilidades umbral seleccionadas.
El análisis de correlación de rangos de Spearman se utilizó para evaluar las asociaciones entre la expresión génica y las características relacionadas con el sistema inmune. Se informaron coeficientes de correlación y valores P cuando fue aplicable. Para comparaciones múltiples, se aplicó la corrección de la tasa de descubrimiento de errores de Benjamini-Hochberg cuando era apropiado. Los análisis reportados utilizando valores nominales de P se consideraron exploratorios. Se consideró estadísticamente significativo un valor P bilateral < 0,05.