$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
El cáncer de mama sigue siendo el cáncer más comúnmente diagnosticado y la segunda causa principal de muerte relacionada con el cáncer entre las mujeres en todo el mundo1. Solo en los Estados Unidos, representa casi el 30% de todas las neoplasias malignas femeninas nuevas, con más de 280,000 nuevos casos diagnosticados anualmente2. A pesar de los avances terapéuticos, particularmente en los subtipos HER2 positivo y receptor hormonal positivo, la resistencia al tratamiento y la recurrencia siguen siendo desafíos críticos, especialmente para subtipos agresivos como el cáncer de mama triple negativo (TNBC), que carece de terapias dirigidas 3,4. Esto subraya la necesidad urgente de un descubrimiento de fármacos basado en la precisión para identificar agentes terapéuticos efectivos y combinaciones adaptadas a perfiles moleculares individuales. El descubrimiento de fármacos, tradicionalmente guiado por métodos experimentales y de prueba y error, ha experimentado una notable aceleración a través de la integración de técnicas de aprendizaje automático (ML) 5,6. ML permite el modelado de relaciones complejas y no lineales a través de datos biomédicos de alta dimensión y puede ayudar en la identificación de objetivos, el descubrimiento de biomarcadores, la predicción de la sensibilidad a los fármacos y el diseño de terapias combinadas 7,8. Sin embargo, el despliegue práctico de modelos de ML en oncología enfrenta varios obstáculos, incluida la interpretabilidad del modelo, la reproducibilidad, el sobreajuste en conjuntos de datos dispersos y la generalización entre los subtipos de cáncer 9,10,11.
Para superar estas limitaciones, la investigación reciente se ha centrado en combinar el aprendizaje profundo para la extracción de características con el aprendizaje de conjuntos para una predicción sólida. En estudios que evaluaron múltiples algoritmos, modelos como las Redes Neuronales Artificiales (RNA) alcanzaron niveles de precisión de hasta el 93,2%, superando a clasificadores convencionales como Naïve Bayes y Decision Trees12. Además, las técnicas integradas de minería de características han descubierto genes impulsores clave y objetivos moleculares a través de bases de datos como GEO (Gene Expression Omnibus) y GSE45827, identificando hasta 1.700 genes expresados diferencialmente, algunos de los cuales exhiben interacciones farmacológicas conocidas13. Además, los nuevos estudios de reutilización de fármacos han revelado el potencial de los compuestos no oncológicos como el calcitriol para reducir la viabilidad de las células del cáncer de mama de manera más efectiva que los tratamientos estándar como el neratinib, especialmente en líneas celulares HER2+14. Las investigaciones sobre la vía de señalización de Akt también han demostrado ser prometedoras para superar la resistencia al trastuzumab, lo que sugiere la orientación de la vía molecular como una alternativa a la terapia centrada en el receptor15,16. Sin embargo, a pesar de estos avances, un marco sistemático y explicable capaz de predecir los valores continuos de respuesta a los fármacos, clasificar las combinaciones efectivas de medicamentos y visualizar las similitudes farmacológicas sigue siendo poco explorado en la literatura actual. Muchos modelos se basan en clasificaciones o carecen de claridad traslacional, especialmente cuando se aplican a conjuntos de datos farmacogenómicos del mundo real.
El descubrimiento de fármacos y la toma de decisiones se pueden mejorar mediante el aprendizaje automático (ML), que ofrece instrumentos para datos de alta calidad. Todas las fases del descubrimiento de fármacos, incluida la validación de objetivos, la identificación de biomarcadores y el análisis de ensayos clínicos, pueden beneficiarse del uso del aprendizaje automático. La interpretabilidad y la reproducibilidad de los resultados generados por ML también son obstáculos17. Se pueden reducir las tasas de falla y acelerar el proceso abordando estos problemas y aumentando el conocimiento de las variables de validación. Usando algoritmos de aprendizaje automático, los investigadores evaluaron muestras de biopsia en varias etapas del cáncer. Las precisiones de las pruebas fueron altas, con RNA 93,2%, Bayes ingenuo (NB) 90,4%, árbol de decisión (DT) 87,8% y FR 85,9%, según los hallazgos. Se encontraron un total de 350 genes predichos y 164 genes expresados diferencialmente combinando la base de datos GEO de Rakhshaninejad et al.18. En el conjunto de datos combinado, el algoritmo Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) encontró 1404 genes, mientras que en el conjunto de datos GSE45827, encontró 1710. Se encontraron alrededor de 35 genes superiores, junto con sus funciones en vías importantes y las relaciones entre los genes superiores y los medicamentos contra el cáncer. Para encontrar genes diana de la vía de señalización de sobreexpresión del receptor del factor de crecimiento epidérmico (EGFR) y sus miembros relacionados de la familia, Nagaraj et al.19 Un medicamento llamado calcitriol, que está autorizado para tratar afecciones no relacionadas con el cáncer, tenía fuertes afinidades de unión con cada uno de los cuatro receptores. Según in vitro estudios de citotoxicidad, el calcitriol redujo la viabilidad de las células SK-BR-3 de una manera dependiente de la dosis, lo que indica una citotoxicidad superior y una proliferación reducida de células de cáncer de mama en comparación con neratinib. Jernström et al.20 que dos líneas celulares que eran insensibles al trastuzumab respondían a un inhibidor de la quinasa Akt1/2. En lugar de centrarse en la amplificación o expresión de HER2, el estudio recomienda dirigirse a la vía de señalización de Akt y tener en cuenta los aspectos moleculares al tomar decisiones de tratamiento. El treinta por ciento de las nuevas neoplasias malignas femeninas en los EE. UU. son cánceres de mama, lo que la convierte en la enfermedad maligna más frecuente entre las mujeres. El gol de Witt y Tollefsbol21 fue desarrollar una herramienta fundamental que ayudaría a los investigadores a seleccionar una línea celular de cáncer de mama para su uso en experimentos de xenoinjerto, prevención del cáncer y descubrimientos epigenéticos, entre otros campos. También se cubren los debates sobre la procedencia de líneas celulares específicas de cáncer de mama y las ventajas de emplear xenoinjerto derivado del paciente (PDX) en lugar del xenoinjerto derivado de células (CDX). El uso de técnicas de predicción de fármacos para proporcionar nuevas hipótesis de descubrimiento de fármacos se examinó en Gruener et al.22, con un enfoque en el cáncer de mama triple negativo (CMTN). Sobre la base de los datos del transcriptoma de la línea celular, se construyeron modelos de aprendizaje automático de la respuesta a los fármacos y luego se aplicaron a los datos tumorales de los pacientes. Los hallazgos demostraron que el inhibidor de Wee1 AZD-1775 tenía una acción preferencial en TNBC y que las mutaciones de TP53 estaban fuertemente relacionadas con su efectividad. Con el fin de pronosticar interacciones desconocidas entre fármacos y dianas en la investigación del cáncer de mama, Song et al23 presentar un enfoque basado en características denominado Composición derivada de propiedades fisicoquímicas pseudo específicas de posición para la predicción de la interacción fármaco-objetivo (PsePDC-DTI), que hace uso de secuencias de proteínas, el coeficiente de análisis de correlación canónica profunda (DCCA) y un descriptor de huellas dactilares moleculares. La técnica predice DTI en cuatro conjuntos de datos estándar de oro utilizando un clasificador de bosque aleatorio y maneja datos desequilibrados usando SMOTE. Además, el modelo utiliza genes de riesgo de la investigación genética de todo el genoma para investigar nuevos objetivos para la terapia del cáncer de mama. La superioridad y validez del modelo se demuestran por los diez posibles DTI que ofrece para la terapia. Del diez al veinte por ciento de los casos de cáncer de mama son cáncer de mama triple negativo (TNBC). Actualmente no existen terapias dirigidas para el CMTN, a pesar de los avances en los tratamientos con HER2+ y receptores hormonales+24. Aunque la mayoría de los pacientes expresan el EGFR, los primeros estudios no encontraron ninguna actividad discernible. Los futuros tratamientos experimentales para el CMTN son sugeridos por hallazgos recientes y avances clínicos25.
A pesar de la creciente integración del aprendizaje automático en el descubrimiento de fármacos, los modelos actuales a menudo carecen de interpretabilidad y reproducibilidad, lo que limita su aplicación traslacional. Si bien estudios anteriores han explorado la precisión de la clasificación y la minería de genes, pocos han predicho sistemáticamente la sensibilidad continua a los medicamentos (como LN_IC50) utilizando modelos híbridos interpretables. Además, la combinación de técnicas de reducción de dimensionalidad con regresores robustos sigue siendo poco explorada en el contexto del tratamiento del cáncer de mama. Este estudio aborda esa brecha mediante la introducción y evaluación de una estrategia de doble canalización, XGBoost y Autoencoder-XGBoost, para la predicción de alta fidelidad de la respuesta a los medicamentos, junto con herramientas de mapeo de sinergias y explicabilidad para la aplicabilidad clínica en el mundo real.