È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo metodologico

Ottimizzazione della scoperta di farmaci basata sui dati per il cancro al seno utilizzando modelli di apprendimento automatico interpretabili

855 visualizzazioni

DOI:

10.3791/68705

12 settembre 2025

In questo articolo

Sommario

Questo protocollo presenta una pipeline di apprendimento automatico che utilizza XGBoost e SHAP per prevedere la sensibilità ai farmaci nel cancro al seno. Il flusso di lavoro include la pre-elaborazione dei dati, la modellazione ibrida, l'interpretazione basata su SHAP, il punteggio delle sinergie e il clustering PCA per identificare farmaci potenti e comprendere i fattori biologici chiave che influenzano la risposta terapeutica.

Abstract

Il cancro al seno rimane una delle neoplasie maligne più diffuse in tutto il mondo, ponendo sfide terapeutiche significative a causa dell'eterogeneità del tumore e della resistenza ai farmaci. Questo studio presenta un protocollo di apprendimento automatico riproducibile e basato sui dati per prevedere la sensibilità ai farmaci nelle linee cellulari di cancro al seno, con il duplice obiettivo di identificare potenti agenti singoli e combinazioni di farmaci sinergici. Utilizzando set di dati curati dal Genomics of Drug Sensitivity in Cancer (GDSC), sono stati implementati due approcci predittivi: un regressore XGBoost autonomo e una pipeline ibrida Autoencoder-XGBoost. La pre-elaborazione includeva la codifica delle etichette, la codifica one-hot, la standardizzazione dello Z-score, l'imputazione del valore mancante e la riduzione della dimensionalità tramite PCA. La valutazione del modello ha dimostrato che XGBoost ha ottenuto prestazioni superiori (MSE = 1,3789, R2 = 0,8145) rispetto al modello ibrido (MSE = 4,0322, R2 = 0,4577). L'interpretabilità è stata affrontata utilizzando SHapley Additive exPlanations (SHAP), che ha identificato TARGET_PATHWAY, DRUG_ID, TARGET e CELL_LINE_NAME come caratteristiche predittive chiave, allineandosi con i meccanismi farmacologici stabiliti. I punteggi di sinergia previsti, derivati dalla combinazione dei risultati del modello con i dati di DrugComb e SynergyDB, hanno evidenziato coppie di farmaci promettenti come Bortezomib + Romidepsin e Paclitaxel + Bortezomib. Questi risultati sono stati ulteriormente supportati dal clustering farmacologico basato sulla PCA, rivelando raggruppamenti biologicamente rilevanti di farmaci con meccanismi d'azione simili. Il protocollo proposto fornisce un quadro trasparente e adattabile per la ricerca oncologica di precisione, consentendo sia l'accuratezza predittiva che l'interpretabilità biologica. Integrando una rigorosa pre-elaborazione, la convalida del modello, la spiegabilità e l'analisi delle sinergie farmacologiche, questo flusso di lavoro offre una base scalabile per la scoperta e il riposizionamento traslazionale dei farmaci nel trattamento del cancro al seno.

Introduzione

Il cancro al seno rimane il tumore più comunemente diagnosticato e la seconda causa di morte correlata al cancro tra le donne a livello globale1. Solo negli Stati Uniti, rappresenta quasi il 30% di tutti i nuovi tumori maligni femminili, con oltre 280.000 nuovi casi diagnosticati ogni anno2. Nonostante i progressi terapeutici, in particolare nei sottotipi HER2-positivi e positivi al recettore ormonale, la resistenza al trattamento e la recidiva rimangono sfide critiche, soprattutto per i sottotipi aggressivi come il carcinoma mammario triplo negativo (TNBC), che m....

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

1. Acquisizione di dataset

  1. Scarica i dati sulla sensibilità ai farmaci da GDSC (https://www.cancerrxgene.org/downloads/drug_data). Un riepilogo del set di dati utilizzato è fornito nella Tabella 1. I file utilizzati sono gdsc_drug_data.csv (risposta ai farmaci), gdsc_expression_data.csv (espressione genica) e gdsc_cell_metadata.csv (informazioni sulla linea cellulare).
    Vedere la Figura 1 per un esempio della struttura del set di dati utilizzata in questo flusso di lavoro.
  2. Filtrare il set di dati per includere solo le linee cellulari di cancro al seno utilizzando Python (libreria P....

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Questo studio si è concentrato sull'ottimizzazione della selezione dei farmaci e sulla previsione dell'efficacia combinatoria per il cancro al seno utilizzando modelli avanzati di apprendimento automatico. Il set di dati includeva un pannello curato e filtrato di linee cellulari di cancro al seno, metriche di sensibilità ai farmaci (LN_IC50, AUC, Z-Score) e descrittori molecolari come CNA, metilazione, espressione genica, descrittori tissutali e bersagli farmacologici. L'obiettivo primario era quello di prevedere la LN_I.......

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo studio presenta una pipeline integrata di apprendimento automatico per adattarsi alla scelta del farmaco, prevedere combinazioni sinergiche e identificare le possibilità di riposizionamento del farmaco. I dati provenienti dal database GDSC e dai repository di sinergie (ad esempio, SynergyDB, DrugComb) sono stati integrati per curare un pannello completo di interazioni farmaco-linea cellulare, comprendente caratteristiche molecolari (ad esempio, espressione genica, alterazioni del .......

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori dichiarano che non ci sono conflitti di interesse relativi a questo lavoro. Confermiamo che la tecnologia LLM (Large Language Model) (ChatGPT, sviluppata da OpenAI) è stata utilizzata in modo limitato durante le prime fasi di preparazione del manoscritto. In particolare, ChatGPT è stato impiegato per la generazione di idee e il brainstorming preliminare di quadri concettuali, che sono stati successivamente perfezionati, convalidati e completamente riscritti dagli autori. Tutti i contenuti scientifici di base, l'analisi dei dati, l'interpretazione e la stesura finale sono stati eseguiti esclusivamente dagli autori. I risultati di ChatGPT sono stati esaminati criticamente per verificarne l'accuratezza, la coerenza e l'integrità prima dell'inclusione, in conformità con le linee guida etiche e di trasparenza della rivista. Tutti gli autori hanno esaminato e approvato la versione finale del manoscritto e confermano che non ci sono relazioni finanziarie, personali o professionali che potrebbero essere interpretate per influenzare il contenuto di questa pubblicazione.

Ringraziamenti

Gli autori riconoscono sinceramente il supporto istituzionale fornito dal Dipartimento di Informatica della Christ University, che ha facilitato le risorse computazionali e l'ambiente accademico necessari per condurre questa ricerca. Siamo anche grati per la guida e l'incoraggiamento collaborativi offerti dai nostri colleghi e mentori nel corso di questo lavoro.

CONTRIBUTO DELL'AUTORE:
Dyuti Banerjee ha ideato lo studio, progettato la metodologia e curato il set di dati. Sivaneasan Bala Krishnan e Kamal Upreti hanno implementato i modelli di apprendimento automatico e hanno eseguito l'an....

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Autoencoder (modello di deep learning)TensorFlow (Google)https://www.tensorflow.orgRiduzione della dimensionalità e codifica delle caratteristiche per la modellazione della risposta ai farmaci
BortezomibSelleck Prodotti chimiciEpisodio 1013Farmaco utilizzato nell'analisi sinergica
DactinomicinaSigma-AldrichD1037Farmaco utilizzato nell'analisi sinergica
DocetaxelSigma-AldrichD1080Farmaco utilizzato per la validazione del clustering basata su meccanismi
Libreria MatplotlibIndice dei pacchetti Python (PyPI)https://matplotlib.orgVisualizzazione e tracciatura dei dati in Python
Libreria NumPyIndice dei pacchetti Python (PyPI)https://numpy.orgCalcolo numerico e operazioni matriciali
PaclitaxelSigma-AldrichT7191Farmaco utilizzato per la validazione del clustering basata su meccanismi
Biblioteca PandasIndice dei pacchetti Python (PyPI)https://pandas.pydata.orgManipolazione ed elaborazione dei dati
Pitone 3.10Fondazione del software Pythonhttps://www.python.orgLinguaggio di programmazione principale
RomidepsinaSelleck Prodotti chimiciS3020Farmaco utilizzato nell'analisi sinergica
Libreria Scikit-learnIndice dei pacchetti Python (PyPI)https://scikit-learn.orgStrumenti di modellazione e pre-elaborazione dell'apprendimento automatico
Biblioteca SeabornIndice dei pacchetti Python (PyPI)https://seaborn.pydata.orgVisualizzazione dei dati e tracciamento statistico
Libreria SHAPIndice dei pacchetti Python (PyPI)https://shap.readthedocs.ioInterpretabilità del modello di intelligenza artificiale spiegabile
Dati sinergici (DrugComb)FIMM, Finlandiahttps://drugcomb.fimm.fiSet di dati di riferimento sulle sinergie farmacologiche
Dati di sinergia (SynergyDB)Università di Groningenhttps://synergy.bioinformatics.nlSet di dati di riferimento sulle sinergie farmacologiche
TensorFlow 2.11Alessiohttps://www.tensorflow.orgImplementazione del modello di deep learning di Autoencoder
VinblastinaSigma-AldrichV1377Farmaco utilizzato nell'analisi sinergica
Libreria XGBoostIndice dei pacchetti Python (PyPI)https://xgboost.readthedocs.ioModellazione della regressione con boosting del gradiente

Riferimenti

  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Sensibilit ai farmacimodello XGBoostpipeline autoencodersinergia farmacologicaanalisi SHAPoncologia di precisioneclustering farmacologico