Methodenartikel

Datagestuurde optimalisatie van medicijnontdekking voor borstkanker met behulp van interpreteerbare machine learning-modellen

DOI:

10.3791/68705

12 september 2025

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dit protocol presenteert een machine learning-pijplijn met behulp van XGBoost en SHAP om de gevoeligheid voor geneesmiddelen bij borstkanker te voorspellen. De workflow omvat gegevensvoorverwerking, hybride modellering, SHAP-gebaseerde interpretatie, synergiescores en PCA-clustering om krachtige geneesmiddelen te identificeren en inzicht te krijgen in de belangrijkste biologische factoren die de therapeutische respons beïnvloeden.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Borstkanker blijft wereldwijd een van de meest voorkomende maligniteiten en brengt aanzienlijke therapeutische uitdagingen met zich mee als gevolg van tumorheterogeniteit en resistentie tegen geneesmiddelen. Deze studie presenteert een reproduceerbaar, datagestuurd machine learning-protocol voor het voorspellen van geneesmiddelgevoeligheid in borstkankercellijnen, met als tweeledig doel het identificeren van krachtige enkelvoudige middelen en synergetische geneesmiddelcombinaties. Met behulp van gecureerde datasets van de Genomics of Drug Sensitivity in Cancer (GDSC) werden twee voorspellende benaderingen geïmplementeerd: een standalone XGBoost-regressor en een hybride Autoencoder-XGBoost-pijplijn. De voorverwerking omvatte labelcodering, one-hot-codering, standaardisatie van de Z-score, imputatie van ontbrekende waarden en dimensionaliteitsreductie via PCA. Modelevaluatie toonde aan dat XGBoost superieure prestaties behaalde (MSE = 1,3789, R2 = 0,8145) in vergelijking met het hybride model (MSE = 4,0322, R2 = 0,4577). De interpreteerbaarheid werd aangepakt met behulp van SHapley Additive exPlanations (SHAP), die TARGET_PATHWAY, DRUG_ID, TARGET en CELL_LINE_NAME identificeerden als belangrijke voorspellende kenmerken, in lijn met gevestigde farmacologische mechanismen. Voorspelde synergiescores, afgeleid van het combineren van modeloutput met DrugComb- en SynergyDB-gegevens, benadrukten veelbelovende geneesmiddelparen zoals Bortezomib + Romidepsin en Paclitaxel + Bortezomib. Deze bevindingen werden verder ondersteund door op PCA gebaseerde farmacologische clustering, waarbij biologisch relevante groeperingen van geneesmiddelen met vergelijkbare werkingsmechanismen aan het licht kwamen. Het voorgestelde protocol biedt een transparant en aanpasbaar kader voor precisie-oncologisch onderzoek, waardoor zowel voorspellende nauwkeurigheid als biologische interpreteerbaarheid mogelijk zijn. Door rigoureuze voorverwerking, modelvalidatie, verklaarbaarheid en synergieanalyse van geneesmiddelen te integreren, biedt deze workflow een schaalbare basis voor translationele ontdekking en herbestemming van geneesmiddelen bij de behandeling van borstkanker.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Borstkanker blijft de meest gediagnosticeerde vorm van kanker en de op één na belangrijkste doodsoorzaak door kanker bij vrouwenwereldwijd1. Alleen al in de Verenigde Staten is het goed voor bijna 30% van alle nieuwe vrouwelijke maligniteiten, met meer dan 280.000 nieuwe gevallen die jaarlijks worden gediagnosticeerd2. Ondanks de therapeutische vooruitgang, met name in HER2-positieve en hormoonreceptor-positieve subtypes, blijven resistentie tegen behandeling en recidief kritieke uitdagingen, vooral voor agressieve subtypes zoals triple-negatieve borstkanker (TNBC), waarvoor geen gerichte therapieën zijn 3,4. Dit onderstreept de dringende behoefte aan precisiegestuurde ontdekking van geneesmiddelen om effectieve therapeutische middelen en combinaties te identificeren die zijn afgestemd op individuele moleculaire profielen. De ontdekking van geneesmiddelen, traditioneel geleid door experimentele en trial-and-error-methoden, is opmerkelijk versneld door de integratie van machine learning (ML)-technieken 5,6. ML maakt de modellering mogelijk van complexe, niet-lineaire relaties in hoogdimensionale biomedische gegevens en kan helpen bij het identificeren van doelen, het ontdekken van biomarkers, het voorspellen van geneesmiddelgevoeligheid en het ontwerpen van combinatietherapie 7,8. De praktische inzet van ML-modellen in de oncologie stuit echter op verschillende hindernissen, waaronder interpreteerbaarheid van het model, reproduceerbaarheid, overfitting op schaarse datasets en generalisatie over kankersubtypes 9,10,11.

Om deze beperkingen te overwinnen, heeft recent onderzoek zich gericht op het combineren van deep learning voor functie-extractie met ensemble learning voor robuuste voorspelling. In studies die meerdere algoritmen evalueerden, bereikten modellen zoals Artificial Neural Networks (ANN) nauwkeurigheidsniveaus tot 93,2%, beter dan conventionele classifiers zoals Naïve Bayes en Decision Trees12. Bovendien hebben geïntegreerde feature mining-technieken belangrijke drivergenen en moleculaire doelen blootgelegd via databases zoals GEO (Gene Expression Omnibus) en GSE45827, waarbij tot 1.700 differentieel tot expressie gebrachte genen zijn geïdentificeerd, waarvan sommige bekende geneesmiddelinteracties vertonen13. Verder hebben nieuwe studies naar het hergebruik van geneesmiddelen het potentieel van niet-oncologische verbindingen zoals calcitriol aangetoond om de levensvatbaarheid van borstkankercellen effectiever te verminderen dan standaardbehandelingen zoals neratinib, vooral in HER2+-cellijnen14. Onderzoek naar de Akt-signaleringsroute is ook veelbelovend gebleken bij het overwinnen van trastuzumab-resistentie, wat suggereert dat moleculaire routetargeting een alternatief is voor receptorgerichte therapie15,16. Maar ondanks deze vooruitgang blijft een systematisch en verklaarbaar raamwerk dat in staat is om continue geneesmiddelresponswaarden te voorspellen, effectieve geneesmiddelcombinaties te rangschikken en farmacologische overeenkomsten te visualiseren, onderbelicht in de huidige literatuur. Veel modellen zijn gebaseerd op classificatie of missen translationele duidelijkheid, vooral wanneer ze worden toegepast op real-world farmacogenomische datasets.

Het ontdekken en nemen van beslissingen over geneesmiddelen kan worden verbeterd door machine learning (ML), dat instrumenten biedt voor gegevens van hoge kwaliteit. Alle fasen van de ontdekking van geneesmiddelen, inclusief doelvalidatie, identificatie van biomarkers en analyse van klinische proeven, kunnen profiteren van het gebruik van machine learning. Interpreteerbaarheid en reproduceerbaarheid van door ML gegenereerde resultaten zijn ook obstakels17. Het verminderen van het aantal mislukkingen en het versnellen van het proces kan worden bereikt door deze problemen aan te pakken en de kennis van validatievariabelen te vergroten. Met behulp van machine learning-algoritmen beoordeelden de onderzoekers biopsiemonsters in verschillende stadia van kanker. De nauwkeurigheid van de tests was hoog, met ANN 93,2%, Naïve Bayes (NB) 90,4%, Decision Tree (DT) 87,8% en RF 85,9%, volgens de bevindingen. In totaal werden 350 voorspelde genen en 164 differentieel tot expressie gebrachte genen gevonden door de GEO-database van Rakhshaninejad et al. te combineren.18. In de gecombineerde dataset vond het algoritme Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) 1404 genen, terwijl het in de GSE45827-dataset 1710 vond. Ongeveer 35 superieure genen, samen met hun rol in belangrijke routes en de relaties tussen superieure genen en medicijnen tegen kanker, werden gevonden. Om doelgenen te vinden van de Epidermale Groeifactor Receptor (EGFR (EGFR) overexpressie signaalroute en hun verwante familieleden, werden moleculaire netwerkonderzoeken uitgevoerd door Nagaraj et al.19 Een medicijn genaamd calcitriol, dat is goedgekeurd voor de behandeling van aandoeningen die geen verband houden met kanker, had sterke bindingsaffiniteiten met elk van de vier receptoren. Volgens in vitro cytotoxiciteitsstudies, calcitriol verminderde de levensvatbaarheid van SK-BR-3-cellen op een dosisafhankelijke manier, wat wijst op superieure cytotoxiciteit en verminderde proliferatie van borstkankercellen in vergelijking met neratinib. Een actieve en medicamenteuze Akt-signaleringsroute werd gesuggereerd door Jernström et al.20 dat twee cellijnen die trastuzumab-ongevoelig waren, reageerden op een Akt1/2-kinaseremmer. In plaats van zich te concentreren op HER2-amplificatie of -expressie, beveelt de studie aan om zich te richten op de Akt-signaleringsroute en rekening te houden met moleculaire aspecten bij het nemen van behandelingsbeslissingen. Dertig procent van de nieuwe vrouwelijke maligniteiten in de VS zijn borstkankers, waardoor het de meest voorkomende kwaadaardige ziekte bij vrouwen is. Het doel van Witt en Tollefsbol21 was om een fundamenteel hulpmiddel te ontwikkelen dat onderzoekers zou helpen bij het selecteren van een borstkankercellijn voor gebruik in xenotransplantaatexperimenten, kankerpreventie en epigenetische ontdekkingen, onder andere gebieden. Ook komen debatten aan bod over de herkomst van specifieke borstkankercellijnen en de voordelen van het gebruik van patiënt-afgeleid xenotransplantaat (PDX) in tegenstelling tot cel-afgeleid xenotransplantaat (CDX). Het gebruik van medicijnvoorspellingstechnieken om nieuwe hypothesen voor het ontdekken van geneesmiddelen te bieden, werd onderzocht in Gruener et al.22, met een focus op triple-negatieve borstkanker (TNBC). Op basis van transcriptoomgegevens van de cellijn werden machine learning-modellen van geneesmiddelrespons geconstrueerd en vervolgens toegepast op tumorgegevens van patiënten. De bevindingen toonden aan dat de Wee1-remmer AZD-1775 een preferentiële werking had in TNBC en dat TP53-mutaties sterk verband hielden met de effectiviteit ervan. Om onbekende geneesmiddel-doelwitinteracties in borstkankeronderzoek te voorspellen, hebben Song et al23 presenteer een op kenmerken gebaseerde benadering genaamd Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction (PsePDC-DTI's), die gebruik maakt van eiwitsequenties, de Deep Canonical Correlation Analysis (DCCA)-coëfficiënt en een moleculaire vingerafdrukdescriptor. De techniek voorspelt DTI's op vier gouden standaard datasets met behulp van een willekeurige forest-classifier en verwerkt ongebalanceerde gegevens met behulp van SMOTE. Bovendien gebruikt het model risicogenen uit genoombreed genetisch onderzoek om nieuwe doelen voor de behandeling van borstkanker te onderzoeken. De superioriteit en validiteit van het model worden aangetoond door de tien mogelijke DTI's die het biedt voor therapie. Tien tot twintig procent van de gevallen van borstkanker is triple-negatieve borstkanker (TNBC). Er zijn momenteel geen gerichte therapieën voor TNBC, ondanks vooruitgang in HER2+ en hormonale receptor+ behandelingen24. Hoewel de EGFR door de meerderheid van de patiënten tot expressie wordt gebracht, vonden vroege studies geen waarneembare activiteit. Toekomstige experimentele behandelingen voor TNBC worden gesuggereerd door recente bevindingen en klinische vooruitgang25.

Ondanks de toenemende integratie van machine learning bij het ontdekken van geneesmiddelen, missen de huidige modellen vaak interpreteerbaarheid en reproduceerbaarheid, waardoor hun translationele toepassing wordt beperkt. Hoewel eerdere studies de nauwkeurigheid van de classificatie en genmining hebben onderzocht, hebben maar weinigen systematisch een continue gevoeligheid van geneesmiddelen (zoals LN_IC50) voorspeld met behulp van hybride interpreteerbare modellen. Bovendien blijft de combinatie van dimensionaliteitsreductietechnieken met robuuste regressoren onderbelicht in de context van de behandeling van borstkanker. Deze studie pakt die kloof aan door een dual-pipeline-strategie te introduceren en te evalueren - XGBoost en Autoencoder-XGBoost - voor high-fidelity voorspelling van geneesmiddelrespons, gekoppeld aan verklaarbaarheid en synergie-mappingtools voor klinische toepasbaarheid in de echte wereld.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. Verwerving van datasets

  1. Download gegevens over de gevoeligheid voor geneesmiddelen van GDSC (https://www.cancerrxgene.org/downloads/drug_data). Een samenvatting van de gebruikte dataset is te vinden in tabel 1. De gebruikte bestanden zijn gdsc_drug_data.csv (geneesmiddelrespons), gdsc_expression_data.csv (genexpressie) en gdsc_cell_metadata.csv (cellijninformatie).
    Zie Figuur 1 voor een voorbeeld van de datasetstructuur die in deze workflow wordt gebruikt.
  2. Filter de gegevensset om alleen borstkankercellijnen op te nemen met behulp van Python (Pandas-bibliotheek).
    1. Selecteer records waarbij de TCGA_DESC kolom gelijk is aan 'Borst'.
    2. Extraheer de bijbehorende CELL_LINE_NAME waarden.
    3. Zie Aanvullende Code 1 (Aanvullend Dossier 1) voor implementatie.
      OPMERKING: Het beperken van de dataset tot borstkankercellijnen zorgt voor domeinspecifieke modeltraining en verbetert de biologische validiteit. De dataset die in deze studie is gebruikt, is afkomstig uit de database Genomics of Drug Sensitivity in Cancer (GDSC) en de belangrijkste kenmerken worden weergegeven in tabel 2.

2. Voorverwerking van gegevens

  1. De voorverwerkingspijplijn:
    1. Codeer categorische variabelen zoals DRUG_ID, CELL_LINE_NAME en TARGET_PATHWAY met behulp van LabelEncoder om ze te converteren naar indelingen op basis van gehele getallen die geschikt zijn voor XGBoost-invoer.
    2. Normaliseer numerieke kenmerken, waaronder genexpressiegegevens, veranderingen in het aantal kopieën (CNA) en methyleringskenmerken, met behulp van Z-scorestandaardisatie (StandardScaler) om nul gemiddelde en eenheidsvariantie te garanderen.
    3. Verwijder monsters met meer dan 30% ontbrekende functies.
    4. Waardeer de resterende ontbrekende waarden met behulp van de mediaan van elke respectieve functiekolom met SimpleImputer(strategy='median').
    5. Pas one-hot-codering toe op categorische variabelen (DRUG_ID en TARGET_PATHWAY) met behulp van OneHotEncoder van scikit-learn.
    6. Voer dimensionaliteitsreductie uit op genexpressiekenmerken met behulp van Principal Component Analysis (PCA) om de functieruimte te verkleinen met behoud van variantie.
    7. Splits de uiteindelijke opgeschoonde dataset op in trainings- (80%) en testsets (20%) met behulp van train_test_split van scikit-learn, waarbij de verdeling van medicijn-celparen behouden blijft.
      OPMERKING: De gedetailleerde reden voor elke voorverwerkingsstap en de resulterende gegevenssetdimensies wordt besproken in de sectie Discussie.
  2. Omgaan met categorische variabelen
    1. Identificeer categorische variabelen (CELL_LINE_NAME, DRUG_NAME, TARGET_PATHWAY) met behulp van Panda's.
    2. Pas labelcodering toe op deze variabelen met behulp van de LabelEncoder van scikit-learn.
    3. Voer deze stap programmatisch uit zoals weergegeven in Aanvullende Code 2 (Aanvullend Bestand 1).
      OPMERKING: Machine learning-algoritmen vereisen numerieke invoer; Labelcodering zet categorische variabelen om in een integer formaat met behoud van klasseverschillen.
  3. Numerieke kenmerken standaardiseren
    1. Identificeer numerieke variabelen voor genexpressie, verandering van het aantal kopieën (CNA) en methyleringskenmerken.
    2. Pas StandardScaler toe om kenmerken te normaliseren naar nul, gemiddelde en eenheidsvariantie.
      OPMERKING: Standaardisatie zorgt ervoor dat alle numerieke kenmerken in gelijke mate bijdragen aan het model door ze te herschalen zodat ze geen gemiddelde en eenheidsvariantie hebben. Dit voorkomt dat functies met grotere schalen de modeltraining domineren en verbetert de convergentie in optimalisatiealgoritmen.
  4. Ontbrekende waarden behandelen
    1. Detecteer ontbrekende vermeldingen in alle functies.
    2. Verwijder records waarvan meer dan 30% gegevens ontbreken.
    3. Waardeer de resterende ontbrekende waarden met behulp van de mediaanimputatiestrategie.
      OPMERKING: Onvolledige gegevens kunnen vertekening veroorzaken en de robuustheid van het model verminderen. Het verwijderen van zwaar ontbrekende records zorgt voor de betrouwbaarheid van de gegevens, terwijl mediane imputatie een stabiele en uitbijterbestendige methode biedt om bruikbare informatie te behouden zonder sterke verdelingsaannames te introduceren.
  5. Splits de dataset
    1. Gebruik een geautomatiseerde methode (bijvoorbeeld train_test_split van sikit-learn) om de uiteindelijke opgeschoonde dataset op te delen in subsets voor training en testen.
    2. Specificeer een willekeurige seed (bijv. random_state=42) om reproduceerbaarheid te garanderen.
    3. Wijs 80% van de gegevens toe aan de trainingsset en 20% aan de testset.
    4. Zie Aanvullende Code 3 (Aanvullend Dossier 1) voor de volledige implementatie van de code.
      OPMERKING: Het verdelen van gegevens in trainings- en testsubsets maakt een onbevooroordeelde evaluatie van de generaliseerbaarheid van het model mogelijk.

3. Kader voor modellering

  1. Regressiedoelstelling definiëren
    1. Beschouw de voorspellingstaak als een regressieprobleem om de natuurlijke logaritme van de halfmaximale remmende concentratie (LN_IC50) voor elk geneesmiddel-cellijnpaar te schatten.
    2. Kies LN_IC50 als doelvariabele om de variantie te stabiliseren en het model te verbeteren.
      OPMERKING: Het transformeren van IC50 naar LN_IC50 vermindert scheefheid en verbetert de modelprestaties.
  2. Trein XGBoost Regressor (Model 1)
    1. Selecteer XGBoost als het primaire model vanwege de sterke prestaties op gestructureerde farmacogenomische datasets en het vermogen om niet-lineaire functie-interacties te modelleren met regularisatie om overfitting te voorkomen.
    2. Initialiseer het model programmatisch met behulp van de XGBRegressor-klasse uit de xgboost-bibliotheek. Specificeer afgestemde hyperparameters (leersnelheid, maximale diepte, aantal schatters en willekeurige seed) die worden geïdentificeerd door middel van kruisvalidatie.
    3. Train het model op de trainingssubset (X_train, y_train) met behulp van de fit()-methode.
    4. Genereer voorspellingen voor de testsubset (X_test) met behulp van de predict()-methode.
    5. Evalueer de prestaties met behulp van Mean Squared Error (MSE) en R²-score met de mean_squared_error- en r2_score functies van scikit-learn.
      OPMERKING: Zie Aanvullende Code 4 (Aanvullend Dossier 1) voor de volledige implementatie.
  3. Overweeg alternatieve modellen
    1. Beoordeel Support Vector Regression (SVR) op robuustheid in instellingen met kleine steekproeven en hoogdimensionale gegevens.
    2. Evalueer een Autoencoder-XGBoost-hybride op potentiële prestatieverbeteringen door middel van diepe latente functie-extractie en niet-lineaire modellering.
    3. Vergelijk de prestaties van verschillende modellen met behulp van identieke evaluatiestatistieken en kruisvalidatie.
      OPMERKING: SVR werd uitgesloten van de eindresultaten vanwege een lagere voorspellende nauwkeurigheid in vergelijking met XGBoost, terwijl de Autoencoder-XGBoost-hybride werd behouden voor de vergelijking van deep learning- en machine learning-benaderingen.
  4. Model 1: XGBoost Regressor
    1. Selecteer XGBoost als het basismodel vanwege de sterke prestaties op het gebied van gestructureerde biomedische gegevens, het vermogen om niet-lineaire functie-interacties te modelleren en de ingebouwde regularisatie die overfitting vermindert.
    2. Configureer het XGBoost-model met hyperparameters learning_rate = 0,05, max_depth = 6 en n_estimators = 100.
    3. Optimaliseer hyperparameters met behulp van rasterzoekopdrachten en valideer prestaties met 5-voudige kruisvalidatie.
    4. Train het model op de voorbereide trainingsdataset (X_train, y_train).
    5. Evalueer voorspellende prestaties met behulp van Mean Squared Error (MSE) en R²-score berekend met de mean_squared_error- en r2_score functies van scikitlearn.
      OPMERKING: Eerdere studies26 hebben aangetoond dat XGBoost consequent beter presteert dan deep learning-modellen op biomedische datasets in tabelvorm met lagere rekenkosten.
  5. Bouw Hybride Autoencoder + XGBoost Model (Model 2)
    1. Ontwerp een auto-encoder voor dimensionaliteitsreductie zonder toezicht
      OPMERKING: Encoder comprimeert invoerfuncties tot een laagdimensionale latente weergave. Decoder reconstrueert invoer om reconstructiefouten te minimaliseren.
    2. Train de Autoencoder op de volledige functiematrix om latente functies te extraheren.
    3. Geef de uitvoer van de encoder (latente kenmerken) door als invoer aan een XGBoost-regressor, zoals weergegeven in aanvullende code 5A (aanvullend bestand 1).
    4. Train de XGBoost-regressor op de gecodeerde functieset met LN_IC50 als doelvariabele, zoals weergegeven in aanvullende code 5B (aanvullend bestand 1).
    5. Evalueer de modelprestaties met behulp van dezelfde metrische gegevens als model 1 voor directe vergelijking.
      OPMERKING: Deze hybride benadering maakt gebruik van op deep learning gebaseerd representatieleren en het sterke regressievermogen van XGBoost, wat een voordeel biedt voor hoogdimensionale biologische gegevens.
  6. Model evaluatie
    1. Evalueer het getrainde regressiemodel door doelwaarden te voorspellen met behulp van de predict()-methode op de testgegevensset (X_test).
    2. Bereken de Mean Squared Error (MSE) om het gemiddelde kwadratische verschil tussen de voorspelde en werkelijke LN_IC50 waarden te meten met behulp van mean_squared_error(y_test, y_pred) van scikit-learn.
      OPMERKING: Samen combineren deze modellen interpreteerbaarheid en precisie en vormen ze een robuust kader voor het voorspellen van geneesmiddelgevoeligheid in borstkankeronderzoek 27,28.
      figure-protocol-1
      waarbij yi staat voor de ware LN_IC50 voor het i-de geneesmiddel-celpaar, figure-protocol-2 de corresponderende voorspelde waarde is en n het totale aantal waarnemingen. Voor de autoencoder wordt het reconstructieverlies gegeven door,
      figure-protocol-3
      waarbij X de matrix van de invoerfunctie is, E(·) de encoderfunctie is die X afbeeldt op een latente representatie, en D(·) de decoderfunctie is die X reconstrueert uit de latente ruimte.
    3. Bereken de R2-score om het aandeel variantie in de doelvariabele te bepalen dat door het model wordt verklaard met behulp van r2_score(y_test, y_pred) van scikit-learn.
    4. Noteer de berekende MSE- en R2-waarden voor rapportage. De berekende MSE- en R²-waarden zijn samengevat in tabel 3 om de prestaties van de verschillende modellen duidelijk weer te geven en direct te vergelijken.
    5. Interpreteer de evaluatiemaatstaven: een lagere MSE duidt op een hogere voorspellende nauwkeurigheid, en een R2-score dichter bij 1 duidt op een sterkere verklarende kracht en een beter generalisatievermogen van het model.
  7. SHAP verklaarbaarheid
    1. Installeer en importeer de SHAP-bibliotheek (import shap). Zorg ervoor dat de versie 0.41.0 is voor reproduceerbaarheid.
    2. Initialiseer de SHAP-explainer met behulp van het getrainde XGBoost-model door aanvullende code 6 te volgen (aanvullend bestand 1).
    3. Bereken SHAP-waarden voor de testgegevensset om functiebijdragescores te verkrijgen.
    4. Genereer een diagram met een globaal overzicht van de belangrijkheid van functies om te visualiseren welke functies het meest bijdragen aan voorspellingen.
    5. Maak een individuele voorspellingsverklaring voor een geselecteerd monster met behulp van de SHAP-watervalplot.
    6. Interpreteer de grafieken om de belangrijkste kenmerken te identificeren die van invloed zijn op voorspellingen. Zoals weergegeven in tabel 4, omvatten kritieke kenmerken TARGET_PATHWAY, DRUG_ID, CELL_LINE_NAME, TARGET-eiwit en Screen Medium, wat aangeeft dat geneesmiddelspecifieke en celspecifieke eigenschappen de voorspellingen van de geneesmiddelrespons aanzienlijk beïnvloeden.
      OPMERKING: SHAP-waarden zijn berekend met behulp van shap. TreeExplainer() voor XGBoost modellen. Het wereldwijde kenmerkbelang werd gevisualiseerd met behulp van shap.summary_plot(), en verklaringen per monster werden gegenereerd met shap.dependence_plot() en shap.waterfall_plot() (SHAP v0.41.0) Zoals weergegeven in tabel 4, waren de meest invloedrijke kenmerken TARGET_PATHWAY, DRUG_ID en CELL_LINE_NAME, wat aangeeft dat zowel geneesmiddelspecifieke als celspecifieke eigenschappen cruciaal waren bij het bepalen van de geneesmiddelrespons. Andere belangrijke bijdragen waren het TARGET-eiwit en het schermmedium, wat de afstemming van het model op domeinrelevante factoren in de kankerfarmacogenomica verder benadrukte.
  8. Synergie en clustering van geneesmiddelen
    1. Synergiegegevens downloaden
      1. Download synergiegegevens voor geneesmiddelencombinaties uit openbaar beschikbare repositories:
        DrugComb: https://drugcomb.fimm.fi
        SynergyDB: https://synergy.bioinformatics.nl
    2. Voeg synergiegegevens samen met voorspelde respons.
      1. Gebruik combinaties van geneesmiddel-cellijnen als unieke sleutels om gedownloade synergiescores (ZIP, Bliss, Loewe, HSA) samen te voegen met voorspelde geneesmiddelresponswaarden (LN_IC50).
      2. Zorg ervoor dat de geneesmiddel-ID's en de namen van de cellijnen tussen de datasets op elkaar zijn afgestemd voordat u ze samenvoegt.
    3. Bereken synergiescores op basis van modellen.
      1. Bereken voor elk geneesmiddelpaar de gecombineerde voorspelde werkzaamheid met behulp van het gemiddelde van individuele modelvoorspelde LN_IC50 waarden:
        figure-protocol-4
        Waar Scomb de gecombineerde voorspelde LN_IC50 score voor een medicijnpaar aangeeft, figure-protocol-5 is de voorspelde LN_IC50 voor medicijn 1.
      2. Rangschik medicijncombinaties op basis van synergiescores.
      3. Identificeer de topcombinaties (bijv. Bortezomib + Romidepsine, Vinblastine + Dactinomycine) die de laagste synergiescores vertonen, wat wijst op een hogere voorspelde effectiviteit.
        OPMERKING: Een lagere synergiescore weerspiegelt een groter voorspeld therapeutisch potentieel, waardoor deze geneesmiddelparen in aanmerking komen voor verdere experimentele validatie. Volg de stappen in Aanvullende code 7A en Aanvullende code 7B (Aanvullende Fiche 1).
  9. Synergierangschikking en clustering op basis van PCA
    1. Rangschik medicijnparen op synergiescore.
      1. Voeg synergiescores (ZIP, Bliss, Loewe, HSA) samen met voorspelde LN_IC50 waarden met behulp van geneesmiddel-cellijncombinaties als unieke sleutels.
      2. Bereken synergiescores voor elk medicijnpaar met behulp van de gemiddelde voorspelde LN_IC50 waarden:
      3. Rangschik medicijnparen op basis van berekende synergiescores.
      4. Identificeer geneesmiddelparen met de laagste (meest negatieve) scores als potentiële synergetische combinaties (bijv. Bortezomib + Romidepsine, Vinblastine + Dactinomycine).
    2. Voer PCA uit op de geneesmiddelresponsmatrix.
      1. Construeer een geneesmiddelresponsmatrix met behulp van voorspelde LN_IC50 waarden met geneesmiddelen als rijen en cellijnen als kolommen, volgens de stappen die worden weergegeven in aanvullende code 8 (aanvullend bestand 1).
      2. Standaardiseer de matrix met behulp van zscore-normalisatie.
      3. Voer Principal Component Analysis (PCA) uit met twee hoofdcomponenten (n_components = 2) om dimensionaliteit te verminderen en grote varianties vast te leggen.
    3. PCA-clusters visualiseren
      1. Plot de tweedimensionale PCA-projectie met behulp van Matplotlib of Seaborn.
      2. Bevestig dat geneesmiddelen met vergelijkbare werkingsmechanismen (bijv. Docetaxel en Paclitaxel) samenklonteren, waardoor het vermogen van het model om biologisch betekenisvolle relaties vast te leggen wordt gevalideerd.
    4. Modelstabiliteit en functiebalans
      1. Filter zeldzame categorische variabelen tijdens het coderen om problemen met schaarste te voorkomen.
      2. Stem de leersnelheden van auto-encoders af en voeg dropout-lagen toe om convergentieproblemen te voorkomen.
      3. Beperk SHAP-analyse tot de top 100 functies om de geheugenoverhead te verminderen en rekenefficiëntie te garanderen.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie richtte zich op het optimaliseren van de selectie van geneesmiddelen en het voorspellen van combinatorische werkzaamheid voor borstkanker met behulp van geavanceerde machine learning-modellen. De dataset omvatte een samengesteld en gefilterd panel van borstkankercellijnen, statistieken voor geneesmiddelgevoeligheid (LN_IC50, AUC, Z-Score) en moleculaire descriptoren zoals CNA, methylering, genexpressie, weefseldescriptoren en medicijndoelen. Het primaire doel was het voorspel...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie presenteert een geïntegreerde machine learning-pijplijn om zich aan te passen aan de keuze van het geneesmiddel, synergetische combinaties te voorspellen en de mogelijkheden van herbestemming van geneesmiddelen te identificeren. Gegevens uit de GDSC-database en synergie-repositories (bijv. SynergyDB, DrugComb) werden geïntegreerd om een uitgebreid panel van interacties tussen geneesmiddelen en cellijnen samen te stellen, waaronder moleculaire kenmerken (bijv. genexpressie, ve...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat er geen belangenconflicten zijn met betrekking tot dit werk. We bevestigen dat de technologie van het grote taalmodel (LLM) (ChatGPT, ontwikkeld door OpenAI) in beperkte mate werd gebruikt tijdens de vroege stadia van de voorbereiding van het manuscript. ChatGPT werd met name gebruikt voor het genereren van ideeën en het voorbereidend brainstormen over conceptuele kaders, die vervolgens werden verfijnd, gevalideerd en volledig herschreven door de auteurs. Alle wetenschappelijke kerninhoud, data-analyse, interpretatie en uiteindelijke opstelling werden uitsluitend door de auteurs uitgevoerd. De resultaten van ChatGPT werden kritisch beoordeeld op nauwkeurigheid, coherentie en integriteit voordat ze werden opgenomen, in overeenstemming met de transparantie- en ethische richtlijnen van het tijdschrift. Alle auteurs hebben de definitieve versie van het manuscript beoordeeld en goedgekeurd en bevestigen dat er geen financiële, persoonlijke of professionele relaties zijn die kunnen worden opgevat als invloed op de inhoud van deze publicatie.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs erkennen oprecht de institutionele steun van het Department of Computer Science, Christ University, die de computationele middelen en academische omgeving heeft gefaciliteerd die nodig zijn om dit onderzoek uit te voeren. We zijn ook dankbaar voor de gezamenlijke begeleiding en aanmoediging van onze collega's en mentoren tijdens dit werk.

BIJDRAGE VAN DE AUTEUR:
Dyuti Banerjee bedacht het onderzoek, ontwierp de methodologie en stelde de dataset samen. Sivaneasan Bala Krishnan en Kamal Upreti implementeerden de machine learning-modellen en voerden de computationele analyse uit. Sumegh Shrikant Tharewal en Uma Shankar droegen bij aan de voorverwerking van gegevens, functie-engineering en validatie van resultaten. Pravin Kshirsagar voerde de synergieanalyse en PCA-gebaseerde clustering uit. Manoj Kumar assisteerde bij het literatuuronderzoek, de interpretatie van de bevindingen en het opstellen van manuscripten. Alle auteurs hebben bijgedragen aan de revisie van het manuscript, hebben de definitieve versie goedgekeurd en stemmen ermee in verantwoording af te leggen voor alle aspecten van het werk.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Autoencoder (Deep Learning Model)TensorFlow (Google)https://www.tensorflow.orgDimensionality reduction en feature encoding voor drug response modeling
BortezomibSelleck ChemicalsS1013Geneesmiddel gebruikt in synergie-analyse
DactinomycinSigma-AldrichD1037Geneesmiddel gebruikt in synergie-analyse
DocetaxelSigma-AldrichD1080Geneesmiddel gebruikt voor validatie van mechanisme-gebaseerd clustering
Matplotlib LibraryPython Package Index (PyPI)https://matplotlib.orgDatavisualisatie en plotting in Python
NumPy LibraryPython Package Index (PyPI)https://numpy.orgNumerieke berekeningen en matrixoperaties
PaclitaxelSigma-AldrichT7191Geneesmiddel gebruikt voor validatie van mechanisme-gebaseerd clustering
Pandas LibraryPython Package Index (PyPI)https://pandas.pydata.orgGegevensmanipulatie en -verwerking
Python 3.10Python Software Foundationhttps://www.python.orgPrimaire programmeertaal
RomidepsinSelleck ChemicalsS3020Geneesmiddel gebruikt in synergie-analyse
Scikit-learn LibraryPython Package Index (PyPI)https://scikit-learn.orgMachine learning modellering en preprocessing tools
Seaborn LibraryPython Package Index (PyPI)https://seaborn.pydata.orgDatavisualisatie en statistische plotting
SHAP LibraryPython Package Index (PyPI)https://shap.readthedocs.ioInterpretabiliteit van verklaarbare AI-modellen
Synergy Data (DrugComb)FIMM, Finlandhttps://drugcomb.fimm.fiDrug synergie referentie dataset
Synergy Data (SynergyDB)University of Groningenhttps://synergy.bioinformatics.nlDrug synergie referentie dataset
TensorFlow 2.11Googlehttps://www.tensorflow.orgImplementatie van autoencoder deep learning model
VinblastineSigma-AldrichV1377Geneesmiddel gebruikt in synergie-analyse
XGBoost LibraryPython Package Index (PyPI)https://xgboost.readthedocs.ioGradient boosting regressiemodellering

Referenties

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

Gerelateerde artikelen