Artículo de método

Optimización del descubrimiento de fármacos basada en datos para el cáncer de mama mediante modelos de aprendizaje automático interpretables

DOI:

10.3791/68705

12 de septiembre de 2025

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo presenta una línea de aprendizaje automático que utiliza XGBoost y SHAP para predecir la sensibilidad a los medicamentos en el cáncer de mama. El flujo de trabajo incluye preprocesamiento de datos, modelado híbrido, interpretación basada en SHAP, puntuación de sinergias y agrupación de PCA para identificar fármacos potentes y comprender los factores biológicos clave que influyen en la respuesta terapéutica.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El cáncer de mama sigue siendo una de las neoplasias malignas más prevalentes en todo el mundo, lo que plantea importantes desafíos terapéuticos debido a la heterogeneidad tumoral y la resistencia a los medicamentos. Este estudio presenta un protocolo de aprendizaje automático reproducible y basado en datos para predecir la sensibilidad a los fármacos en líneas celulares de cáncer de mama, con el doble objetivo de identificar potentes agentes únicos y combinaciones sinérgicas de fármacos. Utilizando conjuntos de datos seleccionados de la Genómica de la Sensibilidad a los Medicamentos en el Cáncer (GDSC), se implementaron dos enfoques predictivos: un regresor XGBoost independiente y una canalización híbrida Autoencoder-XGBoost. El preprocesamiento incluyó codificación de etiquetas, codificación en un solo momento, estandarización de puntuación Z, imputación de valores faltantes y reducción de dimensionalidad a través de PCA. La evaluación del modelo demostró que XGBoost logró un rendimiento superior (MSE = 1.3789, R2 = 0.8145) en comparación con el modelo híbrido (MSE = 4.0322, R2 = 0.4577). La interpretabilidad se abordó utilizando SHapley Additive exPlanations (SHAP), que identificó TARGET_PATHWAY, DRUG_ID, TARGET y CELL_LINE_NAME como características predictivas clave, alineándose con los mecanismos farmacológicos establecidos. Las puntuaciones de sinergia predichas, derivadas de la combinación de los resultados del modelo con los datos de DrugComb y SynergyDB, destacaron pares de fármacos prometedores como Bortezomib + Romidepsina y Paclitaxel + Bortezomib. Estos hallazgos fueron respaldados por la agrupación farmacológica basada en PCA, que revela agrupaciones biológicamente relevantes de fármacos con mecanismos de acción similares. El protocolo propuesto proporciona un marco transparente y adaptable para la investigación oncológica de precisión, lo que permite tanto la precisión predictiva como la interpretabilidad biológica. Al integrar un riguroso preprocesamiento, validación de modelos, explicabilidad y análisis de sinergia de fármacos, este flujo de trabajo ofrece una base escalable para el descubrimiento y la reutilización traslacional de fármacos en el tratamiento del cáncer de mama.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El cáncer de mama sigue siendo el cáncer más comúnmente diagnosticado y la segunda causa principal de muerte relacionada con el cáncer entre las mujeres en todo el mundo1. Solo en los Estados Unidos, representa casi el 30% de todas las neoplasias malignas femeninas nuevas, con más de 280,000 nuevos casos diagnosticados anualmente2. A pesar de los avances terapéuticos, particularmente en los subtipos HER2 positivo y receptor hormonal positivo, la resistencia al tratamiento y la recurrencia siguen siendo desafíos críticos, especialmente para subtipos agresivos como el cáncer de mama triple negativo (TNBC), que carece de terapias dirigidas 3,4. Esto subraya la necesidad urgente de un descubrimiento de fármacos basado en la precisión para identificar agentes terapéuticos efectivos y combinaciones adaptadas a perfiles moleculares individuales. El descubrimiento de fármacos, tradicionalmente guiado por métodos experimentales y de prueba y error, ha experimentado una notable aceleración a través de la integración de técnicas de aprendizaje automático (ML) 5,6. ML permite el modelado de relaciones complejas y no lineales a través de datos biomédicos de alta dimensión y puede ayudar en la identificación de objetivos, el descubrimiento de biomarcadores, la predicción de la sensibilidad a los fármacos y el diseño de terapias combinadas 7,8. Sin embargo, el despliegue práctico de modelos de ML en oncología enfrenta varios obstáculos, incluida la interpretabilidad del modelo, la reproducibilidad, el sobreajuste en conjuntos de datos dispersos y la generalización entre los subtipos de cáncer 9,10,11.

Para superar estas limitaciones, la investigación reciente se ha centrado en combinar el aprendizaje profundo para la extracción de características con el aprendizaje de conjuntos para una predicción sólida. En estudios que evaluaron múltiples algoritmos, modelos como las Redes Neuronales Artificiales (RNA) alcanzaron niveles de precisión de hasta el 93,2%, superando a clasificadores convencionales como Naïve Bayes y Decision Trees12. Además, las técnicas integradas de minería de características han descubierto genes impulsores clave y objetivos moleculares a través de bases de datos como GEO (Gene Expression Omnibus) y GSE45827, identificando hasta 1.700 genes expresados diferencialmente, algunos de los cuales exhiben interacciones farmacológicas conocidas13. Además, los nuevos estudios de reutilización de fármacos han revelado el potencial de los compuestos no oncológicos como el calcitriol para reducir la viabilidad de las células del cáncer de mama de manera más efectiva que los tratamientos estándar como el neratinib, especialmente en líneas celulares HER2+14. Las investigaciones sobre la vía de señalización de Akt también han demostrado ser prometedoras para superar la resistencia al trastuzumab, lo que sugiere la orientación de la vía molecular como una alternativa a la terapia centrada en el receptor15,16. Sin embargo, a pesar de estos avances, un marco sistemático y explicable capaz de predecir los valores continuos de respuesta a los fármacos, clasificar las combinaciones efectivas de medicamentos y visualizar las similitudes farmacológicas sigue siendo poco explorado en la literatura actual. Muchos modelos se basan en clasificaciones o carecen de claridad traslacional, especialmente cuando se aplican a conjuntos de datos farmacogenómicos del mundo real.

El descubrimiento de fármacos y la toma de decisiones se pueden mejorar mediante el aprendizaje automático (ML), que ofrece instrumentos para datos de alta calidad. Todas las fases del descubrimiento de fármacos, incluida la validación de objetivos, la identificación de biomarcadores y el análisis de ensayos clínicos, pueden beneficiarse del uso del aprendizaje automático. La interpretabilidad y la reproducibilidad de los resultados generados por ML también son obstáculos17. Se pueden reducir las tasas de falla y acelerar el proceso abordando estos problemas y aumentando el conocimiento de las variables de validación. Usando algoritmos de aprendizaje automático, los investigadores evaluaron muestras de biopsia en varias etapas del cáncer. Las precisiones de las pruebas fueron altas, con RNA 93,2%, Bayes ingenuo (NB) 90,4%, árbol de decisión (DT) 87,8% y FR 85,9%, según los hallazgos. Se encontraron un total de 350 genes predichos y 164 genes expresados diferencialmente combinando la base de datos GEO de Rakhshaninejad et al.18. En el conjunto de datos combinado, el algoritmo Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) encontró 1404 genes, mientras que en el conjunto de datos GSE45827, encontró 1710. Se encontraron alrededor de 35 genes superiores, junto con sus funciones en vías importantes y las relaciones entre los genes superiores y los medicamentos contra el cáncer. Para encontrar genes diana de la vía de señalización de sobreexpresión del receptor del factor de crecimiento epidérmico (EGFR) y sus miembros relacionados de la familia, Nagaraj et al.19 Un medicamento llamado calcitriol, que está autorizado para tratar afecciones no relacionadas con el cáncer, tenía fuertes afinidades de unión con cada uno de los cuatro receptores. Según in vitro estudios de citotoxicidad, el calcitriol redujo la viabilidad de las células SK-BR-3 de una manera dependiente de la dosis, lo que indica una citotoxicidad superior y una proliferación reducida de células de cáncer de mama en comparación con neratinib. Jernström et al.20 que dos líneas celulares que eran insensibles al trastuzumab respondían a un inhibidor de la quinasa Akt1/2. En lugar de centrarse en la amplificación o expresión de HER2, el estudio recomienda dirigirse a la vía de señalización de Akt y tener en cuenta los aspectos moleculares al tomar decisiones de tratamiento. El treinta por ciento de las nuevas neoplasias malignas femeninas en los EE. UU. son cánceres de mama, lo que la convierte en la enfermedad maligna más frecuente entre las mujeres. El gol de Witt y Tollefsbol21 fue desarrollar una herramienta fundamental que ayudaría a los investigadores a seleccionar una línea celular de cáncer de mama para su uso en experimentos de xenoinjerto, prevención del cáncer y descubrimientos epigenéticos, entre otros campos. También se cubren los debates sobre la procedencia de líneas celulares específicas de cáncer de mama y las ventajas de emplear xenoinjerto derivado del paciente (PDX) en lugar del xenoinjerto derivado de células (CDX). El uso de técnicas de predicción de fármacos para proporcionar nuevas hipótesis de descubrimiento de fármacos se examinó en Gruener et al.22, con un enfoque en el cáncer de mama triple negativo (CMTN). Sobre la base de los datos del transcriptoma de la línea celular, se construyeron modelos de aprendizaje automático de la respuesta a los fármacos y luego se aplicaron a los datos tumorales de los pacientes. Los hallazgos demostraron que el inhibidor de Wee1 AZD-1775 tenía una acción preferencial en TNBC y que las mutaciones de TP53 estaban fuertemente relacionadas con su efectividad. Con el fin de pronosticar interacciones desconocidas entre fármacos y dianas en la investigación del cáncer de mama, Song et al23 presentar un enfoque basado en características denominado Composición derivada de propiedades fisicoquímicas pseudo específicas de posición para la predicción de la interacción fármaco-objetivo (PsePDC-DTI), que hace uso de secuencias de proteínas, el coeficiente de análisis de correlación canónica profunda (DCCA) y un descriptor de huellas dactilares moleculares. La técnica predice DTI en cuatro conjuntos de datos estándar de oro utilizando un clasificador de bosque aleatorio y maneja datos desequilibrados usando SMOTE. Además, el modelo utiliza genes de riesgo de la investigación genética de todo el genoma para investigar nuevos objetivos para la terapia del cáncer de mama. La superioridad y validez del modelo se demuestran por los diez posibles DTI que ofrece para la terapia. Del diez al veinte por ciento de los casos de cáncer de mama son cáncer de mama triple negativo (TNBC). Actualmente no existen terapias dirigidas para el CMTN, a pesar de los avances en los tratamientos con HER2+ y receptores hormonales+24. Aunque la mayoría de los pacientes expresan el EGFR, los primeros estudios no encontraron ninguna actividad discernible. Los futuros tratamientos experimentales para el CMTN son sugeridos por hallazgos recientes y avances clínicos25.

A pesar de la creciente integración del aprendizaje automático en el descubrimiento de fármacos, los modelos actuales a menudo carecen de interpretabilidad y reproducibilidad, lo que limita su aplicación traslacional. Si bien estudios anteriores han explorado la precisión de la clasificación y la minería de genes, pocos han predicho sistemáticamente la sensibilidad continua a los medicamentos (como LN_IC50) utilizando modelos híbridos interpretables. Además, la combinación de técnicas de reducción de dimensionalidad con regresores robustos sigue siendo poco explorada en el contexto del tratamiento del cáncer de mama. Este estudio aborda esa brecha mediante la introducción y evaluación de una estrategia de doble canalización, XGBoost y Autoencoder-XGBoost, para la predicción de alta fidelidad de la respuesta a los medicamentos, junto con herramientas de mapeo de sinergias y explicabilidad para la aplicabilidad clínica en el mundo real.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Adquisición de conjuntos de datos

  1. Descargue los datos de sensibilidad a los medicamentos de GDSC (https://www.cancerrxgene.org/downloads/drug_data). En la Tabla 1 se proporciona un resumen del conjunto de datos utilizado. Los archivos utilizados son gdsc_drug_data.csv (respuesta a fármacos), gdsc_expression_data.csv (expresión génica) y gdsc_cell_metadata.csv (información de la línea celular).
    Consulte la Figura 1 para ver un ejemplo de la estructura del conjunto de datos utilizada en este flujo de trabajo.
  2. Filtre el conjunto de datos para incluir solo líneas celulares de cáncer de mama usando Python (biblioteca Pandas).
    1. Seleccione registros donde la columna TCGA_DESC sea igual a "Pecho".
    2. Extraiga los valores de CELL_LINE_NAME correspondientes.
    3. Consulte el Código complementario 1 (Archivo complementario 1) para su implementación.
      NOTA: Restringir el conjunto de datos a líneas celulares de cáncer de mama garantiza el entrenamiento del modelo específico del dominio y mejora la validez biológica. El conjunto de datos empleado en este estudio se recuperó de la base de datos Genomics of Drug Sensitivity in Cancer (GDSC), y sus características clave se presentan en la Tabla 2.

2. Preprocesamiento de datos

  1. La canalización de preprocesamiento:
    1. Codifique variables categóricas como DRUG_ID, CELL_LINE_NAME y TARGET_PATHWAY usando LabelEncoder para convertirlas en formatos basados en enteros adecuados para la entrada XGBoost.
    2. Normalice las características numéricas, incluidos los datos de expresión génica, las alteraciones del número de copias (CNA) y las características de metilación, utilizando la estandarización de la puntuación Z (StandardScaler) para garantizar una media y una varianza unitaria cero.
    3. Elimine muestras con más del 30% de características faltantes.
    4. Impute los valores faltantes restantes utilizando la mediana de cada columna de características respectiva con SimpleImputer(strategy='median').
    5. Aplique la codificación one-hot a variables categóricas (DRUG_ID y TARGET_PATHWAY) mediante OneHotEncoder de scikit-learn.
    6. Realice una reducción de dimensionalidad en características de expresión génica utilizando el análisis de componentes principales (PCA) para reducir el espacio de características y preservar la varianza.
    7. Divida el conjunto de datos limpio final en conjuntos de entrenamiento (80%) y prueba (20%) utilizando train_test_split de scikit-learn, manteniendo la distribución de pares de células farmacológicas.
      NOTA: La justificación detallada de cada paso de preprocesamiento y las dimensiones del conjunto de datos resultantes se analizan en la sección Discusión.
  2. Manejo de variables categóricas
    1. Identifique variables categóricas (CELL_LINE_NAME, DRUG_NAME, TARGET_PATHWAY) usando Pandas.
    2. Aplique la codificación de etiquetas a estas variables mediante LabelEncoder de scikit-learn.
    3. Implemente este paso mediante programación como se muestra en el código complementario 2 (archivo complementario 1).
      NOTA: Los algoritmos de aprendizaje automático requieren entradas numéricas; La codificación de etiquetas convierte las variables categóricas en formato entero al tiempo que conserva las distinciones de clase.
  3. Estandarizar características numéricas
    1. Identifique variables numéricas a través de la expresión génica, la alteración del número de copias (CNA) y las características de metilación.
    2. Aplique StandardScaler para normalizar las características a una media y una varianza unitaria cero.
      NOTA: La estandarización garantiza que todas las características numéricas contribuyan por igual al modelo al reescalarlas para que tengan una media y una varianza unitaria cero. Esto evita que las entidades con escalas más grandes dominen el entrenamiento del modelo y mejora la convergencia en los algoritmos de optimización.
  4. Tratar los valores que faltan
    1. Detecte entradas faltantes en todas las funciones.
    2. Elimine los registros con más del 30% de datos faltantes.
    3. Impute los valores faltantes restantes utilizando la estrategia de imputación mediana.
      NOTA: Los datos incompletos pueden introducir sesgos y reducir la solidez del modelo. La eliminación de los registros que faltan en gran medida garantiza la confiabilidad de los datos, mientras que la imputación mediana proporciona un método estable y resistente a los valores atípicos para preservar la información utilizable sin introducir suposiciones distributivas sólidas.
  5. Dividir el conjunto de datos
    1. Utilice un método automatizado (por ejemplo, train_test_split de sikit-learn) para dividir el conjunto de datos limpio final en subconjuntos de entrenamiento y prueba.
    2. Especifique una semilla aleatoria (por ejemplo, random_state=42) para garantizar la reproducibilidad.
    3. Asigne el 80 % de los datos al conjunto de entrenamiento y el 20 % al conjunto de pruebas.
    4. Consulte el Código complementario 3 (Archivo complementario 1) para obtener la implementación completa del código.
      NOTA: La división de los datos en subconjuntos de entrenamiento y prueba permite una evaluación imparcial de la generalización del modelo.

3. Marco de modelado

  1. Definir el objetivo de regresión
    1. Enmarque la tarea de predicción como un problema de regresión para estimar el logaritmo natural de la concentración inhibitoria media máxima (LN_IC50) para cada par de líneas celulares de fármacos.
    2. Elija LN_IC50 como variable objetivo para estabilizar la varianza y mejorar el modelo.
      NOTA: La transformación de IC50 a LN_IC50 reduce la asimetría y mejora el rendimiento del modelo.
  2. Entrenamiento del regresor XGBoost (modelo 1)
    1. Seleccione XGBoost como modelo principal debido a su sólido rendimiento en conjuntos de datos farmacogenómicos estructurados y su capacidad para modelar interacciones de características no lineales con regularización para evitar el sobreajuste.
    2. Inicialice el modelo mediante programación mediante la clase XGBRegressor de la biblioteca xgboost. Especifique hiperparámetros ajustados (tasa de aprendizaje, profundidad máxima, número de estimadores y semilla aleatoria) identificados a través de la validación cruzada.
    3. Entrene el modelo en el subconjunto de entrenamiento (X_train, y_train) mediante el método fit().
    4. Genere predicciones en el subconjunto de prueba (X_test) utilizando el método predict().
    5. Evalúe el rendimiento utilizando el error cuadrático medio (MSE) y la puntuación R² con las funciones mean_squared_error y r2_score de scikit-learn.
      NOTA: Consulte el Código complementario 4 (Archivo complementario 1) para conocer la implementación completa.
  3. Considere modelos alternativos
    1. Evalúe la regresión de vectores de soporte (SVR) por su solidez en entornos de datos de muestras pequeñas y alta dimensión.
    2. Evalúe un híbrido Autoencoder-XGBoost para obtener posibles ganancias de rendimiento a través de la extracción profunda de características latentes y el modelado no lineal.
    3. Compare el rendimiento entre modelos utilizando métricas de evaluación idénticas y validación cruzada.
      NOTA: SVR se excluyó de los resultados finales debido a una menor precisión predictiva en comparación con XGBoost, mientras que el híbrido Autoencoder-XGBoost se mantuvo para comparar los enfoques de aprendizaje profundo y aprendizaje automático.
  4. Modelo 1: Regresor XGBoost
    1. Seleccione XGBoost como modelo de referencia debido a su sólido rendimiento en datos biomédicos estructurados, su capacidad para modelar interacciones de características no lineales y su regularización incorporada que reduce el sobreajuste.
    2. Configure el modelo XGBoost con hiperparámetros learning_rate = 0,05, max_depth = 6 y n_estimators = 100.
    3. Optimice los hiperparámetros mediante la búsqueda de cuadrícula y valide el rendimiento con una validación cruzada 5 veces.
    4. Entrene el modelo en el conjunto de datos de entrenamiento preparado (X_train, y_train).
    5. Evalúe el rendimiento predictivo utilizando el error cuadrático medio (MSE) y la puntuación R² calculada con las funciones mean_squared_error y r2_score de scikitlearn.
      NOTA: Estudios anteriores26 han demostrado que XGBoost supera constantemente a los modelos de aprendizaje profundo en conjuntos de datos biomédicos tabulares con un menor costo computacional.
  5. Construir un autocodificador híbrido + modelo XGBoost (Model 2)
    1. Diseño de un autocodificador para la reducción de dimensionalidad no supervisada
      NOTA: El codificador comprime las entidades de entrada en una representación latente de baja dimensión. El descodificador reconstruye la entrada para minimizar el error de reconstrucción.
    2. Entrene el Autocodificador en la matriz de características completa para extraer características latentes.
    3. Pase la salida del codificador (características latentes) como entrada a un regresor XGBoost, como se muestra en el código complementario 5A (archivo complementario 1).
    4. Entrene el regresor XGBoost en el conjunto de características codificadas con LN_IC50 como variable de destino, como se muestra en el código complementario 5B (archivo complementario 1).
    5. Evalúe el rendimiento del modelo utilizando las mismas métricas que el modelo 1 para la comparación directa.
      NOTA: Este enfoque híbrido aprovecha el aprendizaje de representación basado en el aprendizaje profundo y la sólida capacidad de regresión de XGBoost, lo que proporciona una ventaja para los datos biológicos de alta dimensión.
  6. Evaluación del modelo
    1. Evalúe el modelo de regresión entrenado mediante la predicción de valores objetivo mediante el método predict() en el conjunto de datos de prueba (X_test).
    2. Calcule el error cuadrático medio (MSE) para medir la diferencia cuadrática promedio entre los valores de LN_IC50 predichos y reales utilizando mean_squared_error(y_test, y_pred) de scikit-learn.
      NOTA: Juntos, estos modelos combinan interpretabilidad y precisión, formando un marco sólido para predecir la sensibilidad a los medicamentos en la investigación del cáncer de mama27,28.
      figure-protocol-1
      donde yi denota el verdadero LN_IC50 para el i-ésimo par de células farmacológicas, figure-protocol-2 es el valor predicho correspondiente, y n es el número total de observaciones. Para el autocodificador, la pérdida de reconstrucción viene dada por,
      figure-protocol-3
      donde X es la matriz de características de entrada, E(·) es la función codificadora que asigna X a una representación latente y D(·) es la función decodificadora que reconstruye X a partir del espacio latente.
    3. Calcule la puntuación R2 para determinar la proporción de varianza en la variable objetivo explicada por el modelo utilizando r2_score(y_test, y_pred) de scikit-learn.
    4. Registre los valores calculados de MSE y R2 para la generación de informes. Los valores calculados de MSE y R² se resumen en la Tabla 3 para presentar claramente y comparar directamente el rendimiento de los diferentes modelos.
    5. Interprete las métricas de evaluación: un MSE más bajo indica una mayor precisión predictiva y una puntuación R2 más cercana a 1 indica un mayor poder explicativo y una mejor capacidad de generalización del modelo.
  7. Explicabilidad de SHAP
    1. Instale e importe la biblioteca SHAP (import shap). Asegúrese de que la versión sea 0.41.0 para la reproducibilidad.
    2. Inicialice el explicador SHAP mediante el modelo XGBoost entrenado siguiendo el código complementario 6 (Archivo complementario 1).
    3. Calcule los valores SHAP del conjunto de datos de prueba para obtener puntuaciones de contribución de características.
    4. Genere un gráfico de resumen de importancia de características globales para visualizar qué características contribuyen más a las predicciones.
    5. Cree una explicación de predicción individual para una muestra seleccionada utilizando el gráfico de cascada SHAP.
    6. Interprete los gráficos para identificar las características clave que influyen en las predicciones. Como se muestra en la Tabla 4, las características críticas incluyen TARGET_PATHWAY, DRUG_ID, CELL_LINE_NAME, proteína TARGET y medio de cribado, lo que indica que las propiedades específicas del fármaco y de la célula afectan significativamente las predicciones de respuesta al fármaco.
      NOTA: Los valores SHAP se calcularon utilizando shap. TreeExplainer() para modelos XGBoost. La importancia de las características globales se visualizó utilizando shap.summary_plot(), y las explicaciones por muestra se generaron con shap.dependence_plot() y shap.waterfall_plot() (SHAP v0.41.0) Como se muestra en la Tabla 4, las características más influyentes incluyeron TARGET_PATHWAY, DRUG_ID y CELL_LINE_NAME, lo que indica que las propiedades específicas del fármaco y específicas de las células fueron fundamentales para determinar la respuesta al fármaco. Otros contribuyentes clave fueron la proteína TARGET y el medio de cribado, lo que enfatiza aún más la alineación del modelo con factores relevantes para el dominio en la farmacogenómica del cáncer.
  8. Sinergia y agrupación de fármacos
    1. Descargar datos de sinergia
      1. Descargue los datos de sinergia de combinaciones de fármacos de los repositorios disponibles públicamente:
        DrugComb: https://drugcomb.fimm.fi
        SynergyDB: https://synergy.bioinformatics.nl
    2. Combine los datos de sinergia con la respuesta prevista.
      1. Utilice combinaciones de líneas farmacológicas y celulares como claves únicas para fusionar las puntuaciones de sinergia descargadas (ZIP, Bliss, Loewe, HSA) con los valores de respuesta a los fármacos previstos (LN_IC50).
      2. Garantice la alineación de los identificadores de medicamentos y los nombres de las líneas celulares entre los conjuntos de datos antes de fusionarlos.
    3. Calcule las puntuaciones de sinergia basadas en modelos.
      1. Para cada par de fármacos, calcule la eficacia predicha combinada utilizando el promedio de los valores de LN_IC50 predichos por el modelo individual:
        figure-protocol-4
        Donde, Scomb denota la puntuación combinada de LN_IC50 predicha para un par de fármacos, figure-protocol-5 es el LN_IC50 predicho para el fármaco 1.
      2. Clasifique las combinaciones de medicamentos según los puntajes de sinergia.
      3. Identifique las combinaciones principales (p. ej., Bortezomib + Romidepsina, Vinblastina + Dactinomicina) que exhiben los puntajes de sinergia más bajos, lo que indica una mayor efectividad predicha.
        NOTA: Una puntuación de sinergia más baja refleja un mayor potencial terapéutico previsto, lo que hace que estos pares de fármacos sean candidatos para una mayor validación experimental. Siga los pasos indicados en el código complementario 7A y el código complementario 7B (archivo complementario 1).
  9. Clasificación de sinergias y agrupación basada en PCA
    1. Clasifique los pares de medicamentos por puntaje de sinergia.
      1. Combine las puntuaciones de sinergia (ZIP, Bliss, Loewe, HSA) con los valores de LN_IC50 predichos utilizando combinaciones de líneas celulares de fármacos como claves únicas.
      2. Calcule las puntuaciones de sinergia para cada par de fármacos utilizando los valores de LN_IC50 promedio previstos:
      3. Clasifique los pares de fármacos en función de las puntuaciones de sinergia calculadas.
      4. Identificar los pares de fármacos con las puntuaciones más bajas (más negativas) como posibles combinaciones sinérgicas (p. ej., Bortezomib + Romidepsina, Vinblastina + Dactinomicina).
    2. Realice PCA en la matriz de respuesta a fármacos.
      1. Construya una matriz de respuesta a medicamentos utilizando valores de LN_IC50 predichos con medicamentos como filas y líneas celulares como columnas, siguiendo los pasos que se muestran en el Código complementario 8 (Archivo complementario 1).
      2. Estandarice la matriz mediante la normalización zscore.
      3. Realice un análisis de componentes principales (PCA) con dos componentes principales (n_components = 2) para reducir la dimensionalidad y capturar la varianza principal.
    3. Visualización de clústeres de PCA
      1. Trace la proyección PCA bidimensional usando Matplotlib o Seaborn.
      2. Confirme que los fármacos con mecanismos de acción similares (por ejemplo, Docetaxel y Paclitaxel) se agrupan, validando la capacidad del modelo para capturar relaciones biológicamente significativas.
    4. Estabilidad del modelo y equilibrio de características
      1. Filtre las variables categóricas poco frecuentes durante la codificación para evitar problemas de dispersión.
      2. Ajuste las tasas de aprendizaje del codificador automático e incluya capas de abandono para evitar problemas de convergencia.
      3. Restrinja el análisis SHAP a las 100 características principales para reducir la sobrecarga de memoria y garantizar la eficiencia computacional.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio se centró en optimizar la selección de fármacos y predecir la eficacia combinatoria para el cáncer de mama utilizando modelos avanzados de aprendizaje automático. El conjunto de datos incluía un panel curado y filtrado de líneas celulares de cáncer de mama, métricas de sensibilidad a los medicamentos (LN_IC50, AUC, Z-Score) y descriptores moleculares como CNA, metilación, expresión génica, descriptores tisulares y objetivos farmacológicos. El objetivo principal era predecir el LN_IC50 (logaritmo natural de l...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este estudio presenta una línea de aprendizaje automático integrada para adaptarse a la elección del fármaco, predecir combinaciones sinérgicas e identificar las posibilidades de reutilización de fármacos. Los datos de la base de datos GDSC y los repositorios de sinergias (p. ej., SynergyDB, DrugComb) se integraron para seleccionar un panel completo de interacciones entre fármacos y líneas celulares, que abarca características moleculares (p. ej., expresión génica, alteraciones en el núm...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores declaran que no existen conflictos de intereses relacionados con este trabajo. Confirmamos que la tecnología de modelo de lenguaje grande (LLM) (ChatGPT, desarrollada por OpenAI) se utilizó de manera limitada durante las primeras etapas de preparación del manuscrito. Específicamente, ChatGPT se empleó para la generación de ideas y la lluvia de ideas preliminar de marcos conceptuales, que posteriormente fueron refinados, validados y reescritos por completo por los autores. Todo el contenido científico básico, el análisis de datos, la interpretación y la redacción final fueron realizados exclusivamente por los autores. Los resultados de ChatGPT se revisaron críticamente para verificar su precisión, coherencia e integridad antes de su inclusión, de conformidad con las pautas éticas y de transparencia de la revista. Todos los autores han revisado y aprobado la versión final del manuscrito y confirman que no existen relaciones financieras, personales o profesionales que puedan interpretarse como una influencia en el contenido de esta publicación.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen sinceramente el apoyo institucional brindado por el Departamento de Ciencias de la Computación de la Universidad de Cristo, que facilitó los recursos computacionales y el entorno académico necesarios para llevar a cabo esta investigación. También estamos agradecidos por la orientación colaborativa y el aliento brindado por nuestros colegas y mentores a lo largo de este trabajo.

CONTRIBUCIÓN DEL AUTOR:
Dyuti Banerjee concibió el estudio, diseñó la metodología y seleccionó el conjunto de datos. Sivaneasan Bala Krishnan y Kamal Upreti implementaron los modelos de aprendizaje automático y realizaron el análisis computacional. Sumegh Shrikant Tharewal y Uma Shankar contribuyeron al preprocesamiento de datos, la ingeniería de características y la validación de los resultados. Pravin Kshirsagar realizó el análisis de sinergias y la agrupación basada en PCA. Manoj Kumar ayudó con la revisión de la literatura, la interpretación de los hallazgos y la redacción del manuscrito. Todos los autores contribuyeron a la revisión del manuscrito, aprobaron la versión final y aceptan ser responsables de todos los aspectos del trabajo.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Autocodificador (modelo de aprendizaje profundo)TensorFlow (Google)https://www.tensorflow.orgReducción de dimensionalidad y codificación de características para el modelado de respuesta a fármacos
BortezomibProductos químicos SelleckS1013Fármaco utilizado en el análisis de sinergias
DactinomicinaSigma-AldrichD1037Fármaco utilizado en el análisis de sinergias
DocetaxelSigma-AldrichD1080Fármaco utilizado para la validación de agrupaciones basadas en mecanismos
Biblioteca MatplotlibÍndice de paquetes de Python (PyPI)https://matplotlib.orgVisualización y trazado de datos en Python
Biblioteca NumPyÍndice de paquetes de Python (PyPI)https://numpy.orgComputación numérica y operaciones matriciales
PaclitaxelSigma-AldrichT7191Fármaco utilizado para la validación de agrupaciones basadas en mecanismos
Biblioteca de pandasÍndice de paquetes de Python (PyPI)https://pandas.pydata.orgManipulación y procesamiento de datos
Python 3.10Fundación de software Pythonhttps://www.python.orgLenguaje de programación principal
RomidepsinaProductos químicos SelleckS3020Fármaco utilizado en el análisis de sinergias
Biblioteca Scikit-learnÍndice de paquetes de Python (PyPI)https://scikit-learn.orgHerramientas de modelado y preprocesamiento de aprendizaje automático
Biblioteca SeabornÍndice de paquetes de Python (PyPI)https://seaborn.pydata.orgVisualización de datos y trazado estadístico
Biblioteca SHAPÍndice de paquetes de Python (PyPI)https://shap.readthedocs.ioInterpretabilidad del modelo de IA explicable
Datos de sinergia (DrugComb)FIMM, Finlandiahttps://drugcomb.fimm.fiConjunto de datos de referencia de sinergia de fármacos
Datos de Synergy (SynergyDB)Universidad de Groningenhttps://synergy.bioinformatics.nlConjunto de datos de referencia de sinergia de fármacos
TensorFlow 2.11Googlehttps://www.tensorflow.orgImplementación del modelo de aprendizaje profundo del autocodificador
VinblastinaSigma-AldrichV1377Fármaco utilizado en el análisis de sinergias
Biblioteca XGBoostÍndice de paquetes de Python (PyPI)https://xgboost.readthedocs.ioModelado de regresión de aumento de gradiente

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

Artículos relacionados