Artículo de investigación

Identificación basada en aprendizaje automático de genes asociados a la resistencia al tamoxifeno y su aplicación en la modelización pronóstica del cáncer de mama

DOI:

10.3791/71327

26 de junio de 2026

* These authors contributed equally

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Desarrollamos una firma de resistencia al tamoxifeno derivada del aprendizaje automático de seis genes que está estratificando a las pacientes con cáncer de mama según el riesgo de supervivencia y puede apoyar la evaluación pronóstica personalizada y la toma de decisiones terapéuticas en la práctica clínica.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El tamoxifeno es una terapia endocrina clave para el cáncer de mama positivo por receptores de estrógeno (ER+), pero la resistencia adquirida limita la eficacia a largo plazo. Los mecanismos moleculares siguen siendo complejos y faltan biomarcadores predictivos. Los datos de expresión génica relacionados con la resistencia al tamoxifeno se obtuvieron de GEO (GSE67916), y se identificaron genes diferencialmente expresados (DEGs) mediante el algoritmo limma. Los análisis de enriquecimiento funcional (GO y KEGG) revelaron implicación en los procesos inmunitarios, respuestas antivirales, endocitosis, vías de lisosomas y señalización de estrógenos. Tres algoritmos de aprendizaje automático (LASSO, SVM-RFE y RF) identificaron seis genes hub (CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5). Se construyó un modelo pronóstico de riesgo basado en estos genes utilizando datos TCGA-BRCA, estratificando eficazmente a los pacientes en grupos de alto y bajo riesgo con supervivencia global significativamente diferente. El modelo demostró buena precisión predictiva (AUC = 0,70) y un rendimiento estable en análisis ROC dependientes del tiempo, validados en una cohorte independiente. Este estudio proporciona una firma genética robusta relacionada con la resistencia al tamoxifeno y un modelo pronóstico multigénico, aportando nuevas perspectivas sobre los mecanismos de resistencia y una posible orientación para un pronóstico y terapia individualizados en el cáncer de mama ER+ .

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El cáncer de mama es el cáncer más comúnmente diagnosticado entre las mujeres a nivel mundial y sigue siendo un factor importante en las muertes asociadasal cáncer 1. Según el perfilado molecular, aproximadamente el 60-70% de los pacientes presentan el subtipo positivo para receptores de estrógeno (ER+), que generalmente responde bien a la terapia endocrina inicial. Entre los diversos agentes endocrinos, el tamoxifeno—un modulador selectivo de receptores de estrógeno (SERM)—ha sido durante mucho tiempo el estándar de atención para el tratamiento adyuvante y metastásico del cáncer de mama ER+ , mejorando significativamente los resultados de supervivencia en ensayos aleatorizados a granescala 2.

A pesar de su eficacia clínica establecida, una proporción considerable de pacientes acaba desarrollando resistencia adquirida, lo que conduce a la recurrencia y progresión de laenfermedad 3. En consecuencia, la resistencia al tamoxifeno representa un cuello de botella crítico en el manejo a largo plazo del cáncer de mama. Estudios previos indican que los mecanismos que impulsan la resistencia son altamente heterogéneos, implicando señalización aberrante del RE, activación de vías alternativas de factores de crecimiento (por ejemplo, PI3K/AKT, MAPK), desregulación de la apoptosis y reprogramaciónmetabólica 4.

Recientemente, el microambiente tumoral (TME), especialmente el microambiente inmunitario, ha recibido cada vez más atención por su papel en la respuesta terapéutica y la resistencia. La infiltración de células inmunitarias y la señalización inflamatoria están estrechamente relacionadas con la progresión del cáncer de mama y la sensibilidad al tratamiento. La evidencia emergente sugiere que los procesos relacionados con el sistema inmunitario pueden modular las respuestas al estrés celular y promover la evasión inmunitaria, contribuyendo así a la resistenciaendocrina 5. Sin embargo, el panorama inmunitario específico asociado a la resistencia al tamoxifeno aún está por esclarecer completamente.

Con la llegada de la secuenciación de alto rendimiento y la bioinformática, analizar datos transcriptómicos ofrece un enfoque poderoso para decodificar la base molecular de la resistencia a los fármacos. En comparación con los biomarcadores de un solo gen, las firmas multigénicas capturan la heterogeneidad tumoral de forma más eficaz, ofreciendo una estabilidad y precisión superiores en el pronóstico. Algoritmos de aprendizaje automático, como la regresión LASSO, las Máquinas de Vectores de Soporte (SVM) y el Bosque Aleatorio (RF), se han convertido en herramientas esenciales para identificar biomarcadores robustos y construir modelos predictivos en medicinade precisión 6. Aunque se han propuesto varias firmas génicas 7,8,9, a menudo falta una validación robusta.

Aunque estudios previos han explorado genes de resistencia al tamoxifeno, pocos han integrado sistemáticamente múltiples estrategias de aprendizaje automático para construir un modelo pronóstico robusto validado en cohortes independientes. En este estudio, integramos datos transcriptómicos de GEO y TCGA para detectar genes asociados a la resistencia al tamoxifeno. Aplicando un conjunto de algoritmos de aprendizaje automático, identificamos genes de resistencia centrales y construimos un modelo de riesgo pronóstico. Además, evaluamos la asociación del modelo con el microambiente inmunitario y validamos su valor predictivo en una cohorte independiente, con el objetivo de aportar nueva evidencia teórica para estrategias de tratamiento personalizadas.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Todos los datos utilizados en este estudio se obtuvieron de bases de datos de acceso público (TCGA, GEO y METABRIC). No participaron ni animales humanos involucrados; por lo tanto, no se requería la aprobación del comité de revisión institucional ni el consentimiento informado.

Adquisición y preprocesamiento de datos

Los datos de expresión génica relacionados con la resistencia al tamoxifeno se obtuvieron de la base de datos Gene Expression Omnibus (GEO) 10. El conjunto de datos GSE67916 (Affymetrix Human Genome U133 Plus 2.0 Array) incluye 18 muestras de células de cáncer de mama: 8 muestras de control sin tratar y 10 muestras resistentes al tamoxifeno generadas mediante exposición prolongada a fármacos. Los datos de secuenciación de ARN y la información de seguimiento clínico correspondiente para la cohorte de Carcinoma Invasivo de Mama (TCGA-BRCA) se descargaron del Atlas del Genoma del Cáncer (TCGA)11.

Los archivos CEL de microarray en bruto se procesaban en R (versión 4.4.2) usando el paquete affy. La corrección de fondo y la normalización se realizaron con el algoritmo Robust Multi-array Average (RMA), incluyendo la transformación log2 y la normalización de cuantiles. Los IDs de las sondas se asignaban a símbolos genéticos usando archivos de anotación de plataforma; para genes con múltiples sondas, se utilizó el valor medio de expresión. Para los datos de RNA-seq de TCGA, los valores de transcritos por millón (TPM) fueron transformados log2 [log2(TPM + 1)]. Se excluyeron muestras con información incompleta de supervivencia o con variables clínicas ausentes.

Identificación de genes expresados diferencialmente

La expresión diferencial entre muestras resistentes al tamoxifeno y las de control se evaluó utilizando el paquete LimmaR 12 con moderación empírica de Bayes. Genes con cambio de pliegue |log2| > 1 y un valor P ajustado < 0,05 (Benjamini–Hochberg FDR) se definieron como genes expresados diferencialmente (DEGs).

Análisis de enriquecimiento funcional

Se realizaron análisis de Gene Ontology (GO)13y Kyoto Encyclopedia of Genes and Genomes (KEGG)14 utilizando el paqueteclusterProfiler 15 R. Las categorías de GO incluían proceso biológico (BP), componente celular (CC) y función molecular (MF). Los valores de P ajustados < 0,05 se consideraron significativos.

Selección de características basada en aprendizaje automático

Se aplicaron tres algoritmos de aprendizaje automático para identificar genes hub: (1) regresión LASSO16 (paquete glmnet) con validación cruzada de 10 veces para seleccionar el parámetro de penalización óptimo (lambda.min); (2) Soporte para la eliminación de características vectorial máquina-recursiva (SVM-RFE)17 (paquete e1071) con validación cruzada de cinco veces para identificar el subconjunto genético mínimo con menor error de clasificación; (3) Random Forest (RF)18 (paquete randomForest) con 500 árboles (ntree = 500); los genes fueron clasificados por MeanDecreaseGini. Los genes identificados por los tres métodos se definieron como genes hub.

Construcción del modelo de riesgo pronóstico

Se construyó un modelo de riesgo pronóstico multigénico utilizando datos de expresión génica y supervivencia TCGA-BRCA. Los genes asociados a la supervivencia fueron evaluados mediante regresión de Cox univariante, seguida de regresión multivariante de Cox para desarrollar la firma final. La fórmula de la puntuación de riesgo se calculó como: Puntuación de riesgo = (0,01297 × CAMK1D) + (0,03021 × CHAC1) + (0,02018 × KIAA0513) + (0,00647 × MED13) + (0,00108 × NDRG1) + (0,04551 × STXBP5). Los pacientes se estratificaron en grupos de alto y bajo riesgo según la puntuación mediana de riesgo.

Evaluación y validación del modelo pronóstico

Las diferencias globales de supervivencia entre grupos se evaluaron mediante el análisis de Kaplan–Meier y la prueba log-rank. El rendimiento predictivo se evaluó utilizando curvas ROC (paquete pROC) y análisis ROC dependiente del tiempo (paquete timeROC). Se construyó un nomograma que integraba las puntuaciones de riesgo y las variables clínicas utilizando el paquete rms. Las curvas de calibración evaluaron la concordancia entre las probabilidades de supervivencia predichas y observadas. La validación externa se realizó en la cohorte19 del Consorcio Internacional de Taxonomía Molecular del Cáncer de Mama (METABRIC) independiente, utilizando la misma fórmula y el mismo punto de corte.

Análisis de infiltración inmune

La infiltración de células inmunitarias se estimó usando CIBERSORT20 con 1.000 permutaciones basadas en datos de TCGA. Se incluyeron muestras con P < 0,05. Las diferencias en la composición de las células inmunitarias entre grupos de alto y bajo riesgo se evaluaron con la prueba de suma de rangos de Wilcoxon, y se evaluaron las correlaciones entre la expresión génica central y la abundancia de células inmunitarias utilizando la correlación de rangos de Spearman.

Análisis estadístico

Todos los análisis se realizaron en R. Se compararon variables continuas usando la prueba de suma de rangos de Wilcoxon y las variables categóricas usando la prueba del chi-cuadrado. Se consideró estadísticamente significativo un P bilateral < 0,05.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Identificación de genes expresados diferencialmente asociados con la resistencia al tamoxifeno

Se identificaron un total de 854 genes de expresión diferencial (DEGs) entre muestras resistentes y de control al tamoxifeno, incluyendo 556 genes con regulación al alza y 298 genes con regulación a la baja. La distribución de los DEG mostró una predominancia de genes regulados al alza en muestras resistentes, lo que sugiere una activación transcripc...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La resistencia al tamoxifeno sigue siendo un obstáculo fundamental en el tratamiento del cáncer de mama ER+ . Aunque mecanismos como las mutaciones en el REE son bien conocidos, las adaptaciones moleculares sistémicas a la terapia a largo plazo siguen siendo menos comprendidas. En este estudio, integramos transcriptómica y aprendizaje automático para identificar una firma robusta de seis genes (CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5) que predice tanto la resistencia al ...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no tienen ningún conflicto de interés.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio fue apoyado por el Proyecto del Centro de Investigación de Ingeniería de la Provincia de Jiangsu de Terapia Molecular de Objetivos y Diagnóstico Complementario en Oncología (SGK2202319), el equipo de investigación innovadora de la institución de educación superior de Jiangsu en ciencia y tecnología (2021), el Programa del Centro de Investigación en Tecnología de la Facultad de Ingeniería Profesional de Jiangsu (2023), la Fundación Clave de Ciencias Naturales de las Instituciones de Educación Superior de Jiangsu de China (Subvención nº 24KJA310008). los Programas Clave de la Facultad de Salud Profesional de Suzhou (szwzy szwzy202406), el Proyecto del Laboratorio Estatal Clave de Medicina y Protección de Radiaciones, Universidad de Soochow (Nº GZK1202506), el Proyecto del Centro de Investigación de Ingeniería de la Provincia de Jiangsu para Terapia Molecular de Dianas y Diagnóstico Complementario en Oncología (SGK1202413), el Programa de Talento en Salud de Dongwu (DWWS2024002, DWWS2025001).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Paquete AffyBioconductor-Procesamiento de datos de microarray
Paquete clusterProfilerBioconductorv4.4.2Análisis de enriquecimiento GO y KEGG
Algoritmo CIBERSORTNewman et al.-Estimación de infiltración de células inmunes
Paquete e1071 (SVM-RFE)CRAN-Eliminación recursiva de características de máquina de vector de soporte
Gene Expression Omnibus (GEO)NCBIGSE67916Conjunto de datos de resistencia al tamoxifeno
Paquete glmnetCRAN / Bioconductor-Regresión LASSO
Paquete limmaBioconductor-Análisis de expresión diferencial
Conjunto de datos METABRICcBioPortal / Curtis et al.-Cohorte de validación
Paquete pROCCRAN-Análisis de curva ROC
Software RR Core Teamv4.4.2Entorno de computación estadística
Paquete Random forestCRAN-Algoritmo Random Forest
Paquete rmsCRAN-Construcción de nomogramas
Cohorte TCGA-BRCAThe Cancer Genome Atlas (TCGA)-Datos de RNA-seq de la cohorte de entrenamiento
Paquete timeROCCRAN-Análisis ROC dependiente del tiempo

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Biolog aN mero 232N mero 232Valor vac oN meroC ncer de mama ERalgoritmos de aprendizaje autom ticoModelo de riesgo pron sticoFirma multig nicaMicroambiente inmunitario

Artículos relacionados