$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Todos los datos utilizados en este estudio se obtuvieron de bases de datos de acceso público (TCGA, GEO y METABRIC). No participaron ni animales humanos involucrados; por lo tanto, no se requería la aprobación del comité de revisión institucional ni el consentimiento informado.
Adquisición y preprocesamiento de datos
Los datos de expresión génica relacionados con la resistencia al tamoxifeno se obtuvieron de la base de datos Gene Expression Omnibus (GEO) 10. El conjunto de datos GSE67916 (Affymetrix Human Genome U133 Plus 2.0 Array) incluye 18 muestras de células de cáncer de mama: 8 muestras de control sin tratar y 10 muestras resistentes al tamoxifeno generadas mediante exposición prolongada a fármacos. Los datos de secuenciación de ARN y la información de seguimiento clínico correspondiente para la cohorte de Carcinoma Invasivo de Mama (TCGA-BRCA) se descargaron del Atlas del Genoma del Cáncer (TCGA)11.
Los archivos CEL de microarray en bruto se procesaban en R (versión 4.4.2) usando el paquete affy. La corrección de fondo y la normalización se realizaron con el algoritmo Robust Multi-array Average (RMA), incluyendo la transformación log2 y la normalización de cuantiles. Los IDs de las sondas se asignaban a símbolos genéticos usando archivos de anotación de plataforma; para genes con múltiples sondas, se utilizó el valor medio de expresión. Para los datos de RNA-seq de TCGA, los valores de transcritos por millón (TPM) fueron transformados log2 [log2(TPM + 1)]. Se excluyeron muestras con información incompleta de supervivencia o con variables clínicas ausentes.
Identificación de genes expresados diferencialmente
La expresión diferencial entre muestras resistentes al tamoxifeno y las de control se evaluó utilizando el paquete LimmaR 12 con moderación empírica de Bayes. Genes con cambio de pliegue |log2| > 1 y un valor P ajustado < 0,05 (Benjamini–Hochberg FDR) se definieron como genes expresados diferencialmente (DEGs).
Análisis de enriquecimiento funcional
Se realizaron análisis de Gene Ontology (GO)13y Kyoto Encyclopedia of Genes and Genomes (KEGG)14 utilizando el paqueteclusterProfiler 15 R. Las categorías de GO incluían proceso biológico (BP), componente celular (CC) y función molecular (MF). Los valores de P ajustados < 0,05 se consideraron significativos.
Selección de características basada en aprendizaje automático
Se aplicaron tres algoritmos de aprendizaje automático para identificar genes hub: (1) regresión LASSO16 (paquete glmnet) con validación cruzada de 10 veces para seleccionar el parámetro de penalización óptimo (lambda.min); (2) Soporte para la eliminación de características vectorial máquina-recursiva (SVM-RFE)17 (paquete e1071) con validación cruzada de cinco veces para identificar el subconjunto genético mínimo con menor error de clasificación; (3) Random Forest (RF)18 (paquete randomForest) con 500 árboles (ntree = 500); los genes fueron clasificados por MeanDecreaseGini. Los genes identificados por los tres métodos se definieron como genes hub.
Construcción del modelo de riesgo pronóstico
Se construyó un modelo de riesgo pronóstico multigénico utilizando datos de expresión génica y supervivencia TCGA-BRCA. Los genes asociados a la supervivencia fueron evaluados mediante regresión de Cox univariante, seguida de regresión multivariante de Cox para desarrollar la firma final. La fórmula de la puntuación de riesgo se calculó como: Puntuación de riesgo = (0,01297 × CAMK1D) + (0,03021 × CHAC1) + (0,02018 × KIAA0513) + (0,00647 × MED13) + (0,00108 × NDRG1) + (0,04551 × STXBP5). Los pacientes se estratificaron en grupos de alto y bajo riesgo según la puntuación mediana de riesgo.
Evaluación y validación del modelo pronóstico
Las diferencias globales de supervivencia entre grupos se evaluaron mediante el análisis de Kaplan–Meier y la prueba log-rank. El rendimiento predictivo se evaluó utilizando curvas ROC (paquete pROC) y análisis ROC dependiente del tiempo (paquete timeROC). Se construyó un nomograma que integraba las puntuaciones de riesgo y las variables clínicas utilizando el paquete rms. Las curvas de calibración evaluaron la concordancia entre las probabilidades de supervivencia predichas y observadas. La validación externa se realizó en la cohorte19 del Consorcio Internacional de Taxonomía Molecular del Cáncer de Mama (METABRIC) independiente, utilizando la misma fórmula y el mismo punto de corte.
Análisis de infiltración inmune
La infiltración de células inmunitarias se estimó usando CIBERSORT20 con 1.000 permutaciones basadas en datos de TCGA. Se incluyeron muestras con P < 0,05. Las diferencias en la composición de las células inmunitarias entre grupos de alto y bajo riesgo se evaluaron con la prueba de suma de rangos de Wilcoxon, y se evaluaron las correlaciones entre la expresión génica central y la abundancia de células inmunitarias utilizando la correlación de rangos de Spearman.
Análisis estadístico
Todos los análisis se realizaron en R. Se compararon variables continuas usando la prueba de suma de rangos de Wilcoxon y las variables categóricas usando la prueba del chi-cuadrado. Se consideró estadísticamente significativo un P bilateral < 0,05.