Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de método

Optimización del descubrimiento de fármacos basada en datos para el cáncer de mama mediante modelos de aprendizaje automático interpretables

855 vistas

DOI:

10.3791/68705

12 de septiembre de 2025

En este artículo

Resumen

Este protocolo presenta una línea de aprendizaje automático que utiliza XGBoost y SHAP para predecir la sensibilidad a los medicamentos en el cáncer de mama. El flujo de trabajo incluye preprocesamiento de datos, modelado híbrido, interpretación basada en SHAP, puntuación de sinergias y agrupación de PCA para identificar fármacos potentes y comprender los factores biológicos clave que influyen en la respuesta terapéutica.

Resumen

El cáncer de mama sigue siendo una de las neoplasias malignas más prevalentes en todo el mundo, lo que plantea importantes desafíos terapéuticos debido a la heterogeneidad tumoral y la resistencia a los medicamentos. Este estudio presenta un protocolo de aprendizaje automático reproducible y basado en datos para predecir la sensibilidad a los fármacos en líneas celulares de cáncer de mama, con el doble objetivo de identificar potentes agentes únicos y combinaciones sinérgicas de fármacos. Utilizando conjuntos de datos seleccionados de la Genómica de la Sensibilidad a los Medicamentos en el Cáncer (GDSC), se implementaron dos enfoques predictivos: un regresor XGBoost independiente y una canalización híbrida Autoencoder-XGBoost. El preprocesamiento incluyó codificación de etiquetas, codificación en un solo momento, estandarización de puntuación Z, imputación de valores faltantes y reducción de dimensionalidad a través de PCA. La evaluación del modelo demostró que XGBoost logró un rendimiento superior (MSE = 1.3789, R2 = 0.8145) en comparación con el modelo híbrido (MSE = 4.0322, R2 = 0.4577). La interpretabilidad se abordó utilizando SHapley Additive exPlanations (SHAP), que identificó TARGET_PATHWAY, DRUG_ID, TARGET y CELL_LINE_NAME como características predictivas clave, alineándose con los mecanismos farmacológicos establecidos. Las puntuaciones de sinergia predichas, derivadas de la combinación de los resultados del modelo con los datos de DrugComb y SynergyDB, destacaron pares de fármacos prometedores como Bortezomib + Romidepsina y Paclitaxel + Bortezomib. Estos hallazgos fueron respaldados por la agrupación farmacológica basada en PCA, que revela agrupaciones biológicamente relevantes de fármacos con mecanismos de acción similares. El protocolo propuesto proporciona un marco transparente y adaptable para la investigación oncológica de precisión, lo que permite tanto la precisión predictiva como la interpretabilidad biológica. Al integrar un riguroso preprocesamiento, validación de modelos, explicabilidad y análisis de sinergia de fármacos, este flujo de trabajo ofrece una base escalable para el descubrimiento y la reutilización traslacional de fármacos en el tratamiento del cáncer de mama.

Introducción

El cáncer de mama sigue siendo el cáncer más comúnmente diagnosticado y la segunda causa principal de muerte relacionada con el cáncer entre las mujeres en todo el mundo1. Solo en los Estados Unidos, representa casi el 30% de todas las neoplasias malignas femeninas nuevas, con más de 280,000 nuevos casos diagnosticados anualmente2. A pesar de los avances terapéuticos, particularmente en los subtipos HER2 positivo y receptor hormonal positivo, la resistencia al tratamiento y la recurrencia siguen siendo desafíos críticos, especialmente para subtipos agresivos como el cáncer de mama triple....

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

1. Adquisición de conjuntos de datos

  1. Descargue los datos de sensibilidad a los medicamentos de GDSC (https://www.cancerrxgene.org/downloads/drug_data). En la Tabla 1 se proporciona un resumen del conjunto de datos utilizado. Los archivos utilizados son gdsc_drug_data.csv (respuesta a fármacos), gdsc_expression_data.csv (expresión génica) y gdsc_cell_metadata.csv (información de la línea celular).
    Consulte la Figura 1 para ver un ejemplo de la estructura del conjunto de datos utilizada en este flujo de trabajo.
  2. Filtre el conjunto de datos para incluir solo líneas celulares de cánce....

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Este estudio se centró en optimizar la selección de fármacos y predecir la eficacia combinatoria para el cáncer de mama utilizando modelos avanzados de aprendizaje automático. El conjunto de datos incluía un panel curado y filtrado de líneas celulares de cáncer de mama, métricas de sensibilidad a los medicamentos (LN_IC50, AUC, Z-Score) y descriptores moleculares como CNA, metilación, expresión génica, descriptores tisulares y objetivos farmacológicos. El objetivo principal era predecir el LN_IC50 (logaritmo natural de l.......

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Este estudio presenta una línea de aprendizaje automático integrada para adaptarse a la elección del fármaco, predecir combinaciones sinérgicas e identificar las posibilidades de reutilización de fármacos. Los datos de la base de datos GDSC y los repositorios de sinergias (p. ej., SynergyDB, DrugComb) se integraron para seleccionar un panel completo de interacciones entre fármacos y líneas celulares, que abarca características moleculares (p. ej., expresión génica, alteraciones en el núm.......

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores declaran que no existen conflictos de intereses relacionados con este trabajo. Confirmamos que la tecnología de modelo de lenguaje grande (LLM) (ChatGPT, desarrollada por OpenAI) se utilizó de manera limitada durante las primeras etapas de preparación del manuscrito. Específicamente, ChatGPT se empleó para la generación de ideas y la lluvia de ideas preliminar de marcos conceptuales, que posteriormente fueron refinados, validados y reescritos por completo por los autores. Todo el contenido científico básico, el análisis de datos, la interpretación y la redacción final fueron realizados exclusivamente por los autores. Los resultados de ChatGPT se revisaron críticamente para verificar su precisión, coherencia e integridad antes de su inclusión, de conformidad con las pautas éticas y de transparencia de la revista. Todos los autores han revisado y aprobado la versión final del manuscrito y confirman que no existen relaciones financieras, personales o profesionales que puedan interpretarse como una influencia en el contenido de esta publicación.

Agradecimientos

Los autores agradecen sinceramente el apoyo institucional brindado por el Departamento de Ciencias de la Computación de la Universidad de Cristo, que facilitó los recursos computacionales y el entorno académico necesarios para llevar a cabo esta investigación. También estamos agradecidos por la orientación colaborativa y el aliento brindado por nuestros colegas y mentores a lo largo de este trabajo.

CONTRIBUCIÓN DEL AUTOR:
Dyuti Banerjee concibió el estudio, diseñó la metodología y seleccionó el conjunto de datos. Sivaneasan Bala Krishnan y Kamal Upreti implementaron los modelos de apren....

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Autocodificador (modelo de aprendizaje profundo)TensorFlow (Google)https://www.tensorflow.orgReducción de dimensionalidad y codificación de características para el modelado de respuesta a fármacos
BortezomibProductos químicos SelleckS1013Fármaco utilizado en el análisis de sinergias
DactinomicinaSigma-AldrichD1037Fármaco utilizado en el análisis de sinergias
DocetaxelSigma-AldrichD1080Fármaco utilizado para la validación de agrupaciones basadas en mecanismos
Biblioteca MatplotlibÍndice de paquetes de Python (PyPI)https://matplotlib.orgVisualización y trazado de datos en Python
Biblioteca NumPyÍndice de paquetes de Python (PyPI)https://numpy.orgComputación numérica y operaciones matriciales
PaclitaxelSigma-AldrichT7191Fármaco utilizado para la validación de agrupaciones basadas en mecanismos
Biblioteca de pandasÍndice de paquetes de Python (PyPI)https://pandas.pydata.orgManipulación y procesamiento de datos
Python 3.10Fundación de software Pythonhttps://www.python.orgLenguaje de programación principal
RomidepsinaProductos químicos SelleckS3020Fármaco utilizado en el análisis de sinergias
Biblioteca Scikit-learnÍndice de paquetes de Python (PyPI)https://scikit-learn.orgHerramientas de modelado y preprocesamiento de aprendizaje automático
Biblioteca SeabornÍndice de paquetes de Python (PyPI)https://seaborn.pydata.orgVisualización de datos y trazado estadístico
Biblioteca SHAPÍndice de paquetes de Python (PyPI)https://shap.readthedocs.ioInterpretabilidad del modelo de IA explicable
Datos de sinergia (DrugComb)FIMM, Finlandiahttps://drugcomb.fimm.fiConjunto de datos de referencia de sinergia de fármacos
Datos de Synergy (SynergyDB)Universidad de Groningenhttps://synergy.bioinformatics.nlConjunto de datos de referencia de sinergia de fármacos
TensorFlow 2.11Googlehttps://www.tensorflow.orgImplementación del modelo de aprendizaje profundo del autocodificador
VinblastinaSigma-AldrichV1377Fármaco utilizado en el análisis de sinergias
Biblioteca XGBoostÍndice de paquetes de Python (PyPI)https://xgboost.readthedocs.ioModelado de regresión de aumento de gradiente

Referencias

  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Sensibilidad a los f rmacosmodelo XGBoostflujo de trabajo de autocodificadorsinergia farmacol gicaan lisis SHAPoncolog a de precisi nagrupamiento farmacol gico