$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Borstkanker blijft de meest gediagnosticeerde vorm van kanker en de op één na belangrijkste doodsoorzaak door kanker bij vrouwenwereldwijd1. Alleen al in de Verenigde Staten is het goed voor bijna 30% van alle nieuwe vrouwelijke maligniteiten, met meer dan 280.000 nieuwe gevallen die jaarlijks worden gediagnosticeerd2. Ondanks de therapeutische vooruitgang, met name in HER2-positieve en hormoonreceptor-positieve subtypes, blijven resistentie tegen behandeling en recidief kritieke uitdagingen, vooral voor agressieve subtypes zoals triple-negatieve borstkanker (TNBC), waarvoor geen gerichte therapieën zijn 3,4. Dit onderstreept de dringende behoefte aan precisiegestuurde ontdekking van geneesmiddelen om effectieve therapeutische middelen en combinaties te identificeren die zijn afgestemd op individuele moleculaire profielen. De ontdekking van geneesmiddelen, traditioneel geleid door experimentele en trial-and-error-methoden, is opmerkelijk versneld door de integratie van machine learning (ML)-technieken 5,6. ML maakt de modellering mogelijk van complexe, niet-lineaire relaties in hoogdimensionale biomedische gegevens en kan helpen bij het identificeren van doelen, het ontdekken van biomarkers, het voorspellen van geneesmiddelgevoeligheid en het ontwerpen van combinatietherapie 7,8. De praktische inzet van ML-modellen in de oncologie stuit echter op verschillende hindernissen, waaronder interpreteerbaarheid van het model, reproduceerbaarheid, overfitting op schaarse datasets en generalisatie over kankersubtypes 9,10,11.
Om deze beperkingen te overwinnen, heeft recent onderzoek zich gericht op het combineren van deep learning voor functie-extractie met ensemble learning voor robuuste voorspelling. In studies die meerdere algoritmen evalueerden, bereikten modellen zoals Artificial Neural Networks (ANN) nauwkeurigheidsniveaus tot 93,2%, beter dan conventionele classifiers zoals Naïve Bayes en Decision Trees12. Bovendien hebben geïntegreerde feature mining-technieken belangrijke drivergenen en moleculaire doelen blootgelegd via databases zoals GEO (Gene Expression Omnibus) en GSE45827, waarbij tot 1.700 differentieel tot expressie gebrachte genen zijn geïdentificeerd, waarvan sommige bekende geneesmiddelinteracties vertonen13. Verder hebben nieuwe studies naar het hergebruik van geneesmiddelen het potentieel van niet-oncologische verbindingen zoals calcitriol aangetoond om de levensvatbaarheid van borstkankercellen effectiever te verminderen dan standaardbehandelingen zoals neratinib, vooral in HER2+-cellijnen14. Onderzoek naar de Akt-signaleringsroute is ook veelbelovend gebleken bij het overwinnen van trastuzumab-resistentie, wat suggereert dat moleculaire routetargeting een alternatief is voor receptorgerichte therapie15,16. Maar ondanks deze vooruitgang blijft een systematisch en verklaarbaar raamwerk dat in staat is om continue geneesmiddelresponswaarden te voorspellen, effectieve geneesmiddelcombinaties te rangschikken en farmacologische overeenkomsten te visualiseren, onderbelicht in de huidige literatuur. Veel modellen zijn gebaseerd op classificatie of missen translationele duidelijkheid, vooral wanneer ze worden toegepast op real-world farmacogenomische datasets.
Het ontdekken en nemen van beslissingen over geneesmiddelen kan worden verbeterd door machine learning (ML), dat instrumenten biedt voor gegevens van hoge kwaliteit. Alle fasen van de ontdekking van geneesmiddelen, inclusief doelvalidatie, identificatie van biomarkers en analyse van klinische proeven, kunnen profiteren van het gebruik van machine learning. Interpreteerbaarheid en reproduceerbaarheid van door ML gegenereerde resultaten zijn ook obstakels17. Het verminderen van het aantal mislukkingen en het versnellen van het proces kan worden bereikt door deze problemen aan te pakken en de kennis van validatievariabelen te vergroten. Met behulp van machine learning-algoritmen beoordeelden de onderzoekers biopsiemonsters in verschillende stadia van kanker. De nauwkeurigheid van de tests was hoog, met ANN 93,2%, Naïve Bayes (NB) 90,4%, Decision Tree (DT) 87,8% en RF 85,9%, volgens de bevindingen. In totaal werden 350 voorspelde genen en 164 differentieel tot expressie gebrachte genen gevonden door de GEO-database van Rakhshaninejad et al. te combineren.18. In de gecombineerde dataset vond het algoritme Binary Grey Wolf Optimization with Simulated Annealing Ensemble (BGWO_SA_Ens) 1404 genen, terwijl het in de GSE45827-dataset 1710 vond. Ongeveer 35 superieure genen, samen met hun rol in belangrijke routes en de relaties tussen superieure genen en medicijnen tegen kanker, werden gevonden. Om doelgenen te vinden van de Epidermale Groeifactor Receptor (EGFR (EGFR) overexpressie signaalroute en hun verwante familieleden, werden moleculaire netwerkonderzoeken uitgevoerd door Nagaraj et al.19 Een medicijn genaamd calcitriol, dat is goedgekeurd voor de behandeling van aandoeningen die geen verband houden met kanker, had sterke bindingsaffiniteiten met elk van de vier receptoren. Volgens in vitro cytotoxiciteitsstudies, calcitriol verminderde de levensvatbaarheid van SK-BR-3-cellen op een dosisafhankelijke manier, wat wijst op superieure cytotoxiciteit en verminderde proliferatie van borstkankercellen in vergelijking met neratinib. Een actieve en medicamenteuze Akt-signaleringsroute werd gesuggereerd door Jernström et al.20 dat twee cellijnen die trastuzumab-ongevoelig waren, reageerden op een Akt1/2-kinaseremmer. In plaats van zich te concentreren op HER2-amplificatie of -expressie, beveelt de studie aan om zich te richten op de Akt-signaleringsroute en rekening te houden met moleculaire aspecten bij het nemen van behandelingsbeslissingen. Dertig procent van de nieuwe vrouwelijke maligniteiten in de VS zijn borstkankers, waardoor het de meest voorkomende kwaadaardige ziekte bij vrouwen is. Het doel van Witt en Tollefsbol21 was om een fundamenteel hulpmiddel te ontwikkelen dat onderzoekers zou helpen bij het selecteren van een borstkankercellijn voor gebruik in xenotransplantaatexperimenten, kankerpreventie en epigenetische ontdekkingen, onder andere gebieden. Ook komen debatten aan bod over de herkomst van specifieke borstkankercellijnen en de voordelen van het gebruik van patiënt-afgeleid xenotransplantaat (PDX) in tegenstelling tot cel-afgeleid xenotransplantaat (CDX). Het gebruik van medicijnvoorspellingstechnieken om nieuwe hypothesen voor het ontdekken van geneesmiddelen te bieden, werd onderzocht in Gruener et al.22, met een focus op triple-negatieve borstkanker (TNBC). Op basis van transcriptoomgegevens van de cellijn werden machine learning-modellen van geneesmiddelrespons geconstrueerd en vervolgens toegepast op tumorgegevens van patiënten. De bevindingen toonden aan dat de Wee1-remmer AZD-1775 een preferentiële werking had in TNBC en dat TP53-mutaties sterk verband hielden met de effectiviteit ervan. Om onbekende geneesmiddel-doelwitinteracties in borstkankeronderzoek te voorspellen, hebben Song et al23 presenteer een op kenmerken gebaseerde benadering genaamd Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction (PsePDC-DTI's), die gebruik maakt van eiwitsequenties, de Deep Canonical Correlation Analysis (DCCA)-coëfficiënt en een moleculaire vingerafdrukdescriptor. De techniek voorspelt DTI's op vier gouden standaard datasets met behulp van een willekeurige forest-classifier en verwerkt ongebalanceerde gegevens met behulp van SMOTE. Bovendien gebruikt het model risicogenen uit genoombreed genetisch onderzoek om nieuwe doelen voor de behandeling van borstkanker te onderzoeken. De superioriteit en validiteit van het model worden aangetoond door de tien mogelijke DTI's die het biedt voor therapie. Tien tot twintig procent van de gevallen van borstkanker is triple-negatieve borstkanker (TNBC). Er zijn momenteel geen gerichte therapieën voor TNBC, ondanks vooruitgang in HER2+ en hormonale receptor+ behandelingen24. Hoewel de EGFR door de meerderheid van de patiënten tot expressie wordt gebracht, vonden vroege studies geen waarneembare activiteit. Toekomstige experimentele behandelingen voor TNBC worden gesuggereerd door recente bevindingen en klinische vooruitgang25.
Ondanks de toenemende integratie van machine learning bij het ontdekken van geneesmiddelen, missen de huidige modellen vaak interpreteerbaarheid en reproduceerbaarheid, waardoor hun translationele toepassing wordt beperkt. Hoewel eerdere studies de nauwkeurigheid van de classificatie en genmining hebben onderzocht, hebben maar weinigen systematisch een continue gevoeligheid van geneesmiddelen (zoals LN_IC50) voorspeld met behulp van hybride interpreteerbare modellen. Bovendien blijft de combinatie van dimensionaliteitsreductietechnieken met robuuste regressoren onderbelicht in de context van de behandeling van borstkanker. Deze studie pakt die kloof aan door een dual-pipeline-strategie te introduceren en te evalueren - XGBoost en Autoencoder-XGBoost - voor high-fidelity voorspelling van geneesmiddelrespons, gekoppeld aan verklaarbaarheid en synergie-mappingtools voor klinische toepasbaarheid in de echte wereld.