$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
1. Fuentes de datos y preprocesamiento
- Procesar datos en bruto en R (versión 4.1.3; Windows 10 Pro).
- Para GSE115002, aplicar la normalización de cuantiles usando limma (versión 3.52.3).
- Filtrar genes de baja expresión para TCGA: retener genes con CPM > 0,5 en ≥50% de las muestras.
- Filtrar genes de baja expresión para GSE115002: retener genes con señal media >50.
- log2Transformar valores de expresión con un pseudoconteo de +1.
NOTA: La expresión génica y los datos clínicos de LUAD se obtuvieron de TCGA-LUAD (versión 33.0, GDC Portal, descargada el 7 de agosto de 2025) y GSE115002 (microarray Agilent, GEO, descargada el 7 de agosto de 2025). TCGA-LUAD incluyó 535 tumores y 59 muestras normales. GSE115002 incluyeron 52 tumores y 52 muestras normales coincidentes.
2. Identificación de genes expresados diferencialmente
- Utiliza DESeq2 (versión 1.36.0) para TCGA RNA-seq y limma (versión 3.52.3) para GSE115002 para análisis de expresión diferencial. Calcula los valores P ajustados (FDR) usando el método de Benjamini–Hochberg.
- Para garantizar la comparabilidad entre conjuntos de datos, un |log₂FC| unificado ≥ 1.0 se aplicó para ambas cohortes. Los DEG se definieron como FDR < 0,05 y |log₂FC| ≥ 1.0. Los DEGs superpuestos se identificaron usando VennDiagram (versión 1.7.3). B3GNT3, FERMT1 y SPP1 fueron seleccionados como candidatos consistentemente con relevancia al alza y relevancia cancerígena.
3. Evaluación del valor diagnóstico
- Construye curvas ROC para cada gen candidato.
- Determina los valores de corte óptimos usando el índice de Youden.
- Calcula la UCA, la sensibilidad y la especificidad de cada gen.
- Construye un panel diagnóstico combinado usando regresión logística multivariante.
NOTA: El paquete pROC v1.18.0 se utilizó para el análisis ROC. La función glm con la familia binomial se utilizó para construir el modelo diagnóstico.
4. Análisis de supervivencia
- Estratificar a los pacientes en grupos de alta y baja expresión usando la expresión mediana.
- Genera curvas de supervivencia de Kaplan–Meier para cada gen.
- Realizar pruebas log-rank para comparar las diferencias de supervivencia.
- Realizar un análisis de regresión de Cox univariante.
- Realizar un análisis de regresión de Cox multivariante.
- Incluir covariables clínicas en los modelos de regresión.
- Verificar la suposición de riesgos proporcionales usando residuos de Schoenfeld.
- Calcula una puntuación de riesgo de tres genes.
NOTA: Se usaron Survival v3.3.1 y survminer v0.4.9. Las covariables incluían edad, sexo, etapa T, etapa N y etapa M. La puntuación de riesgo se calculó como:
Puntuación de riesgo = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)
5. Enriquecimiento de conjuntos génicos y anotación funcional
- Realiza un análisis de enriquecimiento GO usando DEGs.
- Realizar análisis de enriquecimiento de vías KEGG utilizando DEGs.
- Realizar un análisis de enriquecimiento de conjuntos génicos (GSEA).
- Clasificar genes por correlación de Pearson con la expresión génica candidata.
- Identificar términos significativos usando P ajustado < 0,05.
NOTA: se utilizó clusterProfiler v4.6.2 para análisis GO y KEGG. FGSEA v1.22.0 y MSigDB Hallmark v7.5 se usaron para GSEA.
6. Correlación y análisis de redes
NOTA: La correlación de Pearson se utilizó para la expresión génica distribuida normalmente; Correlación de Spearman para fracciones de células inmunitarias. Las redes PPI se generaron usando STRING (versión 11.5, confianza > 0.7) y se visualizaron en Cytoscape (versión 3.9.1). La infiltración inmunitaria se estimó usando CIBERSORT (modo absoluto, 100 permutaciones). Se ha demostrado que la secuenciación de ARN unicelular revela transiciones específicas en el microambiente NSCLC, relevantes para el análisis de infiltracióninmunitaria 21,22, y el análisis integrativo de célula única puede diseccionar aún más los roles de las células inmunitarias, como las células de memoria CD8+, en LUAD 23,24,25.
7. Construcción y validación de nomogramas
NOTA: Las variables para el nomograma se seleccionaron en función de la significación multivariante de Cox (P < 0,05): Etapa T, etapa N, B3GNT3, FERMT1 y SPP1. El nomograma se construyó usando rms (versión 6.5.0). La validación interna utilizaba 1000 remuestreos bootstrap con reemplazo. Se realizaron curvas de calibración y análisis de curvas de decisión (DCA) utilizando RMDA (versión 1.7). El entorno computacional incluía R 4.1.3, Windows 10 Pro y Bioconductor 3.15. Los guiones de análisis están disponibles en https://github.com/[redactado]/LUAD-biomarker-2025 previa solicitud razonable.
8. Análisis estadístico
NOTA: Todas las pruebas estadísticas fueron bidireccionales; P < 0,05 se consideró significativo.