Artículo de investigación

El análisis integrado de bioinformática de datos transcriptómicos humanos identifica tres biomarcadores diagnósticos y pronósticos clave en el adenocarcinoma pulmonar

DOI:

10.3791/71214

30 de junio de 2026

* These authors contributed equally

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio identificó biomarcadores diagnósticos y pronósticos para adenocarcinoma pulmonar utilizando TCGA-LUAD y GEO GSE115002 datos transcriptómicos. B3GNT3, FERMT1 y SPP1 fueron regulados al alza, distinguiendo tumores del tejido normal. Estos genes están vinculados a la transición epitelial-mesenquimatosa y a la inmunosupresión. Un nomograma que combinaba la expresión génica con la etapa TNM mostró un valor predictivo fiable.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El adenocarcinoma pulmonar (LUAD) es la principal causa de muerte relacionada con el cáncer a nivel mundial. A pesar de los avances en cirugía, terapia dirigida e inmunoterapia, la tasa de supervivencia a 5 años de la LUAD avanzada sigue por debajo del 20%, lo que indica una necesidad urgente de biomarcadores moleculares fiables para la detección temprana y el pronóstico. En este estudio, los autores plantearon la hipótesis de que tres genes que aumentan de forma consistente podrían actuar como biomarcadores diagnósticos y pronósticos eficaces para la LUAD. Los autores analizaron datos transcriptómicos de dos cohortes independientes, TCGA-LUAD (535 tumores, 59 muestras normales) y GSE115002 (52 tumores, 52 muestras normales coincidentes), para analizar genes expresados diferencialmente. Tres genes centrales —B3GNT3, FERMT1 y SPP1— se sobreexpresaron consistentemente en los tumores LUAD en ambos conjuntos de datos. Estos genes mostraron un excelente rendimiento diagnóstico, con valores de AUC superiores a 0,95 en TCGA-LUAD y alta precisión en GSE115002. El análisis de supervivencia mostró que una alta expresión de cada gen se asociaba significativamente con una supervivencia global y libre de enfermedad más corta, y la regresión multivariante de Cox verificó su valor pronóstico independiente. El análisis de enriquecimiento funcional indicó que estos tres genes participan en la transición epitelial-mesenquimato, la remodelación de la matriz extracelular y la inmunosupresión, todos ellos estrechamente relacionados con la invasión y metástasis de LUAD. Los autores construyeron además un nomograma pronóstico combinando los tres genes y la etapa TNM, logrando un índice de concordancia de 0,743 y demostrando un buen rendimiento predictivo. Estos hallazgos confirman que B3GNT3, FERMT1 y SPP1 son biomarcadores diagnósticos y pronósticos prometedores para LUAD, apoyando su aplicación clínica en la estratificación y gestión del riesgo.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El cáncer de pulmón es la principal causa de mortalidad por cáncer a nivel mundial, representando aproximadamente 1,8 millones de muertes en 2020. El adenocarcinoma pulmonar (LUAD) representa casi el 40% de todos los casos de cáncer depulmón 2. A pesar de los avances en cirugía, terapia dirigida e inmunoterapia, la tasa de supervivencia a 5 años para el LUAD avanzado sigue por debajo del 20%3,4. Se necesitan urgentemente biomarcadores moleculares fiables para la detección precoz y una pronóstica precisa. La secuenciación de alto rendimiento y las bases de datos públicas como The Cancer Genome Atlas (TCGA) y Gene Expression Omnibus (GEO) permiten un perfil transcriptómico sistemático decánceres 5,6. La bioinformática integrativa entre cohortes mejora la fiabilidad del descubrimiento de biomarcadores candidatos5.

Muchos genes y vías han sido implicados en LUAD, incluyendo la proliferación celular, la señalización de EGFR y la fugainmunitaria 7. Sin embargo, pocas se han traducido en uso clínico. Los modelos de riesgo que combinan firmas génicas y características clinicopatológicas—especialmente los nomogramas—mejoran la precisión pronóstica enLUAD 8. Aunque B3GNT3, FERMT1 y SPP1 se han vinculado individualmente a la progresión del cáncer, su valor diagnóstico combinado, pronóstico y regulador del microambiente inmunológico en LUAD no ha sido validado sistemáticamente entre cohortes independientes. Este estudio proporciona el primer análisis integrado y multiplataforma de estos tres genes como panel unificado de biomarcadores para LUAD, con un nomograma pronóstico clínicamente aplicable.

B3GNT3 codifica una glicosiltransferasa que estabiliza PD-L1 y promueve la evasión inmune 9,10. FERMT1 (kindlin-1) regula la activación de la integrina y fomenta la metástasis en el cáncer de pulmón no de células pequeñas (NSCLC)11,12. SPP1 (osteopontina) media la remodelación de la matriz extracelular, la transición epitelio-mesenquimatosa (EMT) y la quimioresistencia 13,14,15. También se ha demostrado que los genes relacionados con el reloj circadiano predicen el pronóstico y el diagnóstico deLUAD 16, mientras que las diferencias sexuales en LUAD se han descubierto mediante redes integrativas de señalización proteicamultiómica 17. B3GNT3 y SPP1 son secretados o localizados en membrana, lo que apoya su posible uso como biomarcadores mínimamente invasivos. La clasificación efectiva de LUAD e identificación de biomarcadores también puede lograrse mediante métodos de selección de característicassuperpuestas 18, y las interacciones multiómicas desempeñan papeles funcionales importantes en la progresión del cáncerde pulmón 19. Las firmas génicas mitocondriales, identificadas mediante integración integral de multi-ómicas, también tienen valor para el pronóstico de LUAD y la terapiapersonalizada 20. B3GNT3 y SPP1 son secretados o localizados en membrana, lo que apoya su posible uso como biomarcadores mínimamente invasivos. Este estudio tuvo como objetivo identificar biomarcadores LUAD robustos utilizando bioinformática integrativa, evaluar su desempeño diagnóstico y pronóstico, explorar sus funciones biológicas y asociaciones inmunitarias, y construir un nomograma pronóstico clínicamente útil.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Fuentes de datos y preprocesamiento

  1. Procesar datos en bruto en R (versión 4.1.3; Windows 10 Pro).
  2. Para GSE115002, aplicar la normalización de cuantiles usando limma (versión 3.52.3).
  3. Filtrar genes de baja expresión para TCGA: retener genes con CPM > 0,5 en ≥50% de las muestras.
  4. Filtrar genes de baja expresión para GSE115002: retener genes con señal media >50.
  5. log2Transformar valores de expresión con un pseudoconteo de +1.
    NOTA: La expresión génica y los datos clínicos de LUAD se obtuvieron de TCGA-LUAD (versión 33.0, GDC Portal, descargada el 7 de agosto de 2025) y GSE115002 (microarray Agilent, GEO, descargada el 7 de agosto de 2025). TCGA-LUAD incluyó 535 tumores y 59 muestras normales. GSE115002 incluyeron 52 tumores y 52 muestras normales coincidentes.

2. Identificación de genes expresados diferencialmente

  1. Utiliza DESeq2 (versión 1.36.0) para TCGA RNA-seq y limma (versión 3.52.3) para GSE115002 para análisis de expresión diferencial. Calcula los valores P ajustados (FDR) usando el método de Benjamini–Hochberg.
  2. Para garantizar la comparabilidad entre conjuntos de datos, un |log₂FC| unificado ≥ 1.0 se aplicó para ambas cohortes. Los DEG se definieron como FDR < 0,05 y |log₂FC| ≥ 1.0. Los DEGs superpuestos se identificaron usando VennDiagram (versión 1.7.3). B3GNT3, FERMT1 y SPP1 fueron seleccionados como candidatos consistentemente con relevancia al alza y relevancia cancerígena.

3. Evaluación del valor diagnóstico

  1. Construye curvas ROC para cada gen candidato.
  2. Determina los valores de corte óptimos usando el índice de Youden.
  3. Calcula la UCA, la sensibilidad y la especificidad de cada gen.
  4. Construye un panel diagnóstico combinado usando regresión logística multivariante.
    NOTA: El paquete pROC v1.18.0 se utilizó para el análisis ROC. La función glm con la familia binomial se utilizó para construir el modelo diagnóstico.

4. Análisis de supervivencia

  1. Estratificar a los pacientes en grupos de alta y baja expresión usando la expresión mediana.
  2. Genera curvas de supervivencia de Kaplan–Meier para cada gen.
  3. Realizar pruebas log-rank para comparar las diferencias de supervivencia.
  4. Realizar un análisis de regresión de Cox univariante.
  5. Realizar un análisis de regresión de Cox multivariante.
  6. Incluir covariables clínicas en los modelos de regresión.
  7. Verificar la suposición de riesgos proporcionales usando residuos de Schoenfeld.
  8. Calcula una puntuación de riesgo de tres genes.
    NOTA: Se usaron Survival v3.3.1 y survminer v0.4.9. Las covariables incluían edad, sexo, etapa T, etapa N y etapa M. La puntuación de riesgo se calculó como:
    Puntuación de riesgo = (0,328 × B3GNT3) + (0,331 × FERMT1) + (0,321 × SPP1). (1)

5. Enriquecimiento de conjuntos génicos y anotación funcional

  1. Realiza un análisis de enriquecimiento GO usando DEGs.
  2. Realizar análisis de enriquecimiento de vías KEGG utilizando DEGs.
  3. Realizar un análisis de enriquecimiento de conjuntos génicos (GSEA).
  4. Clasificar genes por correlación de Pearson con la expresión génica candidata.
  5. Identificar términos significativos usando P ajustado < 0,05.
    NOTA: se utilizó clusterProfiler v4.6.2 para análisis GO y KEGG. FGSEA v1.22.0 y MSigDB Hallmark v7.5 se usaron para GSEA.

6. Correlación y análisis de redes

NOTA: La correlación de Pearson se utilizó para la expresión génica distribuida normalmente; Correlación de Spearman para fracciones de células inmunitarias. Las redes PPI se generaron usando STRING (versión 11.5, confianza > 0.7) y se visualizaron en Cytoscape (versión 3.9.1). La infiltración inmunitaria se estimó usando CIBERSORT (modo absoluto, 100 permutaciones). Se ha demostrado que la secuenciación de ARN unicelular revela transiciones específicas en el microambiente NSCLC, relevantes para el análisis de infiltracióninmunitaria 21,22, y el análisis integrativo de célula única puede diseccionar aún más los roles de las células inmunitarias, como las células de memoria CD8+, en LUAD 23,24,25.

7. Construcción y validación de nomogramas

NOTA: Las variables para el nomograma se seleccionaron en función de la significación multivariante de Cox (P < 0,05): Etapa T, etapa N, B3GNT3, FERMT1 y SPP1. El nomograma se construyó usando rms (versión 6.5.0). La validación interna utilizaba 1000 remuestreos bootstrap con reemplazo. Se realizaron curvas de calibración y análisis de curvas de decisión (DCA) utilizando RMDA (versión 1.7). El entorno computacional incluía R 4.1.3, Windows 10 Pro y Bioconductor 3.15. Los guiones de análisis están disponibles en https://github.com/[redactado]/LUAD-biomarker-2025 previa solicitud razonable.

8. Análisis estadístico

NOTA: Todas las pruebas estadísticas fueron bidireccionales; P < 0,05 se consideró significativo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alteraciones globales de la expresión génica en LUAD

Las comparaciones transcriptómicas entre los tejidos adenocarcinomas pulmonares y los tejidos pulmonares normales identificaron cambios generalizados en la expresión génica. La Figura 1A muestra gráficos volcánicos de genes expresados diferencialmente en el conjunto de datos TCGA-LUAD, y la Figura 1B muestra los del conjunto de datos GSE115002. En la cohorte TCG...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El nomograma se construyó mediante análisis de regresión de Cox multivariante basado en la cohorte TCGA-LUAD. Los predictores incluyen la etapa patológica de T, la etapa patológica N y el estado de expresión génica de B3GNT3, FERMT1 y SPP1 (categorizados como Alto vs. Bajo según la expresión mediana). Para cada paciente, las puntuaciones individuales de cada variable se suman para generar un valor de "Puntos Totales", que corresponde a probabilidades globales e...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores no declaran intereses en competencia.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este trabajo fue apoyado por el Proyecto Universitario de Nivel Universidad de Medicina Tradicional China de Fujian 2024 (Número de Subvención: XB2024012), liderado por Yuhui Lin del Hospital Popular Afiliado de la Universidad de Medicina Tradicional China de Fujian. y fondos conjuntos para la innovación en ciencia y tecnología, provincia de Fujian (Subvención nº 2025Y9530), dirigidos por Xiaoting Chen del Hospital Municipal de Jinjiang (Hospital Popular Sexto de Shanghái, Fujian).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Conjuntos de datos públicamente disponiblesConjunto de datos TCGA-LUADThe Cancer Genome Atlas (TCGA) Portal (https://portal.gdc.cancer.gov/); 535 muestras de tumores LUAD, 59 muestras de tejido pulmonar normal adyacente (conteo de secuenciación de ARN/valores FPKM + datos clínicos: supervivencia, estadificación TNM)Datos transcriptómicos y clínicos para análisis de expresión diferencial, supervivencia y nomograma; cohorte de estudio primario
Conjunto de datos GSE115002Gene Expression Omnibus (GEO) (https://www.ncbi.nlm.nih.gov/geo/query/acc.cgi?acc=GSE115002); Microarray Agilent, 52 tejidos tumorales LUAD, 52 tejidos pulmonares normales adyacentes emparejados (tumores primarios sin tratamiento)Cohorte de validación independiente para análisis de expresión diferencial, rendimiento diagnóstico e infiltración inmune
Software de bioinformática y entorno de programaciónLenguaje de programación RVersión 4.1Plataforma principal para todos los análisis transcriptómicos, estadísticos y gráficos
Paquetes de R (Expresión diferencial)DESeq2, limmaDESeq2: análisis de expresión diferencial de conteo bruto de RNA-seq de TCGA; limma: normalización de microarray de GSE115002 y análisis de expresión diferencial (corrección FDR de Benjamini–Hochberg)
Paquetes de R (Análisis de diagnóstico)pROCConstrucción de curvas ROC, cálculo de AUC (IC 95%), determinación del punto de corte óptimo (índice de Youden’s) para la evaluación del rendimiento diagnóstico
Paquetes de R (Análisis de supervivencia)survival, survminerGeneración de curvas de supervivencia Kaplan–Meier, prueba de rangos log, regresión de riesgos proporcionales de Cox univariante/multivariante (HR + IC 95%); estratificación de pacientes por expresión génica mediana
Paquetes de R (Enriquecimiento funcional)clusterProfiler, fgseaclusterProfiler: análisis de enriquecimiento de vías GO (BP/CC/MF) y KEGG (P ajustado < 0.05); fgsea: GSEA para conjuntos de genes MSigDB Hallmark/KEGG (FDR < 0.25)
Paquetes de R (Construcción y validación de nomogramas)rmsDesarrollo de nomograma pronóstico (integración de expresión génica + etapa TNM); cálculo del índice C de Harrell, remuestreo bootstrap (1000 repeticiones) para corrección de sesgo, generación de gráfico de calibrado
Paquetes de R (Estadística y visualización)ggplot2, ComplexHeatmap, corrplotGeneración de gráficos de volcán, gráficos de burbuja (enriquecimiento), mapas de calor (correlación de infiltración inmune), gráficos de dispersión (coexpresión génica); análisis de correlación de Pearson/Spearman
Bases de datos y herramientas de bioinformática (Análisis de red/inmune)Base de datos STRINGPuntuación de confianza > 0.7Construcción de redes de interacción proteína-proteína (PPI) para B3GNT3/FERMT1/SPP1 e interactores de primer grado
Cytoscape-Visualización de redes PPI y de coexpresión génica (ponderación de bordes por fuerza de correlación, identificación de genes hub)
Algoritmo de desconvolución inmuneCIBERSORTEstimación de la abundancia de infiltración de células inmunes (macrófagos M2, linfocitos T CD8+, neutrófilos, células NK, etc.) en muestras de LUAD; correlación con la expresión de genes candidatos
Otras herramientasMicrosoft Office/LaTeX-Preparación de manuscritos, ensamblaje de figuras y formato de tablas; compilación de resultados estadísticos

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Cancer ResearchB3GNT3FERMT1SPP1biomarkerprognosisgene expressionnomogram

Artículos relacionados