Onderzoeksartikel

Machine learning-gebaseerde identificatie van genen geassocieerd met Tamoxifen-resistentie en hun toepassing in prognostische modellering van borstkanker

DOI:

10.3791/71327

26 juni 2026

* These authors contributed equally

In dit artikel

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

We ontwikkelden een machine learning-afgeleide zes-genen tamoxifenresistentiehandtekening die borstkankerpatiënten stratificeert op overlevingsrisico en mogelijk gepersonaliseerde prognostische beoordeling en therapeutische besluitvorming in de klinische praktijk ondersteunt.

Samenvatting

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tamoxifen is een belangrijke endocriene therapie voor oestrogeenreceptor-positieve (ER+) borstkanker, maar verworven resistentie beperkt de langetermijneffectiviteit. De moleculaire mechanismen blijven complex en voorspellende biomarkers ontbreken. Genexpressiegegevens gerelateerd aan tamoxifenresistentie werden verkregen uit GEO (GSE67916), en differentieel tot expressie gebrachte genen (DEGs) werden geïdentificeerd met behulp van het limma-algoritme. Functionele verrijkingsanalyses (GO en KEGG) toonden betrokkenheid bij immuunprocessen, antivirale reacties, endocytose, lysosomroutes en oestrogeensignalering. Drie machine learning-algoritmen (LASSO, SVM-RFE en RF) identificeerden zes hubgenen (CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5). Een prognostisch risicomodel gebaseerd op deze genen werd opgebouwd met behulp van TCGA-BRCA-gegevens, waardoor patiënten effectief werden ingedeeld in hoog- en laagrisicogroepen met significant verschillende totale overleving. Het model toonde een goede voorspellende nauwkeurigheid (AUC = 0,70) en stabiele prestaties in tijdsafhankelijke ROC-analyses, gevalideerd in een onafhankelijke cohort. Deze studie biedt een robuuste gensignatur gerelateerd aan tamoxifenresistentie en een multigen-prognostisch model, met nieuwe inzichten in resistentiemechanismen en mogelijke richtlijnen voor individuele prognose en behandeling bij ER+ borstkanker.

Inleiding

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Borstkanker is wereldwijd de meest gediagnosticeerde kanker bij vrouwen en blijft een belangrijke oorzaak van kankergerelateerde sterfgevallen1. Op basis van moleculaire profilering presenteert ongeveer 60-70% van de patiënten het oestrogeenreceptor-positieve (ER+) subtype, dat over het algemeen goed reageert op de initiële endocriene therapie. Onder de verschillende endocriene middelen is tamoxifen—een selectieve oestrogeenreceptormodulator (SERM)—al lange tijd de standaardzorg voor adjuvante en metastatische behandeling van ER+ borstkanker, wat de overlevingsuitkomsten in grootschalige gerandomiseerde onderzoeken aanzienlijk verbetert2.

Ondanks de vastgestelde klinische effectiviteit ontwikkelt een aanzienlijk deel van de patiënten uiteindelijk verworven resistentie, wat leidt tot herhaling en progressie van de ziekte3. Daardoor vormt tamoxifenresistentie een cruciale bottleneck in de langetermijnbehandeling van borstkanker. Eerdere studies geven aan dat de mechanismen die resistentie aansturen sterk heterogeen zijn, met betrekking tot abnormale ER-signalering, activatie van alternatieve groeifactorpaden (bijv. PI3K/AKT, MAPK), disregulatie van apoptose en metabole herprogrammering4.

Recentelijk heeft de tumormicro-omgeving (TME), met name de immuunmicro-omgeving, steeds meer aandacht gekregen vanwege haar rol in therapeutische respons en resistentie. Infiltratie van immuuncellen en ontstekingssignalering zijn nauw verbonden met de progressie van borstkanker en gevoeligheid voor behandeling. Nieuw bewijs suggereert dat immuungerelateerde processen cellulaire stressreacties kunnen moduleren en immuunontwijking kunnen bevorderen, waardoor ze bijdragen aan endocriene resistentie5. Het specifieke immuunlandschap dat geassocieerd wordt met tamoxifenresistentie moet echter nog volledig worden opgehelderd.

Met de komst van high-throughput sequencing en bio-informatica biedt het analyseren van transcriptomische data een krachtige benadering om de moleculaire basis van geneesmiddelresistentie te ontcijferen. In vergelijking met biomarkers met één gen vangen multi-gensignaturen tumorheterogeniteit effectiever vast, wat superieure stabiliteit en nauwkeurigheid in prognose biedt. Machine learning-algoritmen, zoals LASSO-regressie, Support Vector Machines (SVM) en Random Forest (RF), zijn essentiële hulpmiddelen geworden voor het identificeren van robuuste biomarkers en het construeren van voorspellende modellen in precisiegeneeskunde6. Hoewel verschillende gensignaturen zijn voorgesteld 7,8,9, ontbreekt robuuste validatie vaak.

Hoewel eerdere studies tamoxifenresistentiegenen onderzochten, hebben weinig systematisch meerdere machine learning-strategieën geïntegreerd om een robuust prognostisch model te bouwen dat in onafhankelijke cohorten is gevalideerd. In deze studie integreerden we transcriptomische gegevens van GEO en TCGA om te screenen op genen geassocieerd met tamoxifenresistentie. Door een ensemble van machine learning-algoritmen toe te passen, identificeerden we kernresistentiegenen en construeerden we een prognostisch risicomodel. We evalueerden verder de associatie van het model met de immuunmicro-omgeving en valideerden de voorspellende waarde ervan in een onafhankelijke cohort, met als doel nieuw theoretisch bewijs te leveren voor gepersonaliseerde behandelstrategieën.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Alle gegevens die in deze studie werden gebruikt, zijn verkregen uit openbaar toegankelijke databases (TCGA, GEO en METABRIC). Er waren geen menselijke deelnemers of dieren betrokken; Daarom waren goedkeuring van de Institutional Review Board en informed consent niet vereist.

Gegevensverzameling en voorverwerking

Genexpressiegegevens gerelateerd aan tamoxifenresistentie zijn opgehaald uit de Gene Expression Omnibus (GEO) database10. De GSE67916 dataset (Affymetrix Human Genome U133 Plus 2.0 Array) bevat 18 borstkankercelmonsters: 8 onbehandelde controlemonsters en 10 tamoxifenresistente monsters die zijn gegenereerd door langdurige blootstelling aan medicijnen. RNA-sequencinggegevens en bijbehorende klinische vervolginformatie voor de Breast Invasive Carcinoma-cohort (TCGA-BRCA) zijn gedownload van The Cancer Genome Atlas (TCGA)11.

Ruwe microarray CEL-bestanden werden verwerkt in R (versie 4.4.2) met behulp van het affy-pakket. Achtergrondcorrectie en normalisatie werden uitgevoerd met het Robust Multi-array Average (RMA) algoritme, inclusief log2-transformatie en quantielnormalisatie. Probe-ID's werden gekoppeld aan gensymbolen met behulp van platformannotatiebestanden; Voor genen met meerdere probes werd de gemiddelde expressiewaarde gebruikt. Voor TCGA RNA-seq-gegevens werden transcripten per miljoen (TPM) waarden log2-getransformeerd [log2(TPM + 1)]. Steekproeven met onvolledige overlevingsinformatie of ontbrekende klinische variabelen werden uitgesloten.

Identificatie van differentieel tot expressie gebrachte genen

Differentiële expressie tussen tamoxifenresistente en controlemonsters werd beoordeeld met behulp van het limma R-pakket12 met empirische Bayes-moderatie. Genen met |log2-vouwverandering| > 1 en een aangepaste P-waarde < 0,05 (Benjamini–Hochberg FDR) werden gedefinieerd als differentieel tot expressie gedrukte genen (DEGs).

Functionele verrijkingsanalyse

Gene Ontology (GO)13en Kyoto Encyclopedia of Genes and Genomes (KEGG)14 analyses werden uitgevoerd met behulp van het clusterProfiler15 R-pakket. GO-categorieën omvatten biologisch proces (BP), cellulaire component (CC) en moleculaire functie (MF). Gecorrigeerde P-waarden < 0,05 werden als significant beschouwd.

Selectie van functies gebaseerd op machine learning

Drie machine learning-algoritmen werden toegepast om hubgenen te identificeren: (1) LASSO-regressie16 (glmnet-pakket) met 10-voudige kruisvalidatie om de optimale strafparameter te selecteren (lambda.min); (2) Ondersteuning van vectormachine–recursieve feature-eliminatie (SVM-RFE)17 (e1071-pakket) met vijfvoudige kruisvalidatie om de minimale gensubset met de laagste classificatiefout te identificeren; (3) Random forest (RF)18 (randomForest-pakket) met 500 bomen (ntree = 500); genen werden gerangschikt door MeanDecreaseGini. Genen die door alle drie de methoden werden geïdentificeerd, werden gedefinieerd als hubgenen.

Constructie van het prognostisch risicomodel

Er werd een multigen prognostisch risicomodel opgebouwd met behulp van TCGA-BRCA genexpressie- en overlevingsgegevens. Overlevingsgeassocieerde genen werden gescreend met univariate Cox-regressie, gevolgd door multivariate Cox-regressie om de uiteindelijke signatuur te ontwikkelen. De risicoscoreformule werd berekend als: Risicoscore = (0,01297 × CAMK1D) + (0,03021 × CHAC1) + (0,02018 × KIAA0513) + (0,00647 × MED13) + (0,00108 × NDRG1) + (0,04551 × STXBP5). Patiënten werden gestratificeerd in hoog- en laagrisicogroepen op basis van de mediane risicoscore.

Evaluatie en validatie van het prognostische model

De algehele overlevingsverschillen tussen groepen werden beoordeeld met Kaplan–Meier-analyse en de log-rank test. De voorspellende prestaties werden geëvalueerd met behulp van ROC-curves (pROC-pakket) en tijdsafhankelijke ROC-analyse (timeROC-pakket). Een nomogram dat risicoscores en klinische variabelen integreert, werd opgesteld met behulp van het rms-pakket. Kalibratiecurves beoordeelden overeenstemming tussen voorspelde en waargenomen overlevingskansen. Externe validatie werd uitgevoerd in de onafhankelijke Molecular Taxonomy of Breast Cancer International Consortium (METABRIC) cohort19 , met dezelfde formule en cutoff.

Immuuninfiltratieanalyse

De infiltratie van immuuncellen werd geschat met CIBERSORT20 en 1.000 permutaties op basis van TCGA-gegevens. Monsters met P < 0,05 werden opgenomen. Verschillen in de samenstelling van immuuncellen tussen hoog- en laagrisicogroepen werden beoordeeld met de Wilcoxon rank-sum test, en correlaties tussen hubgenexpressie en immuuncelabundantie werden geëvalueerd met behulp van Spearmans rangcorrelatie.

Statistische analyse

Alle analyses werden uitgevoerd in R. Continue variabelen werden vergeleken met de Wilcoxon rangsomtest, en categorische variabelen met de chi-kwadraattest. Tweezijdige P < 0,05 werd als statistisch significant beschouwd.

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Resultaten

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Identificatie van differentieel tot expressie gebrachte genen die geassocieerd zijn met tamoxifenresistentie

In totaal werden 854 differentieel expressieve genen (DEGs) geïdentificeerd tussen tamoxifenresistente en controlemonsters, waaronder 556 upregulated en 298 downregulated genen. De verspreiding van DEG's toonde een overheersing van opgereguleerde genen in resistente monsters, wat wijst op uitgebreide transcriptionele activatie geassocie...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Discussie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tamoxifenresistentie blijft een cruciaal obstakel bij de behandeling van ER+ borstkanker. Hoewel mechanismen zoals ER-mutaties goed bekend zijn, blijven de systemische moleculaire aanpassingen aan langdurige therapie minder goed begrepen. In deze studie integreerden we transcriptomics en machine learning om een robuuste zes-gensignatur (CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5) te identificeren die zowel tamoxifenresistentie als de prognose van de patiënt voorspelt.

<...

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Openbaarmakingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

De auteurs verklaren dat zij geen belangenconflicten hebben.

Dankbetuigingen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Deze studie werd ondersteund door het Project van het Engineering Research Center van de provincie Jiangsu voor Moleculaire Doeltherapie en Companion Diagnostics in de Oncologie (SGK2202319), het innovatieve onderzoeksteam voor wetenschap en technologie van de Jiangsu instelling voor hoger onderwijs (2021), het programma van het Jiangsu beroepscollege engineering technology research center (2023), de Natural Science Key Foundation van de Jiangsu Higher Education Institutions of China (subsidienummer 24KJA310008). de Sleutelprogramma's van het Suzhou Beroepsgezondheidscollege (szwzy szwzy202406), het Project van het Staatssleutellaboratorium voor Stralingsgeneeskunde en Bescherming, Soochow Universiteit (nr. GZK1202506), het project van het Engineering Research Center of Molecular Target Therapy and Companion Diagnostics in Oncology (SGK1202413), het Dongwu Health Talent Program (DWWS2024002, DWWS2025001).

Toegang beperkt. Log in of start een proefperiode om deze inhoud te bekijken.

Materialen

```html

Lijst van materialen gebruikt in dit artikel
NaamBedrijfCatalogusnummerOpmerkingen
Affy-pakketBioconductor-Microarray-gegevensverwerking
clusterProfiler-pakketBioconductorv4.4.2GO en KEGG verrijkingsanalyse
CIBERSORT-algoritmeNewman et al.-Schatting van infiltratie van immuuncellen
e1071-pakket (SVM-RFE)CRAN-Support vector machine recursieve functie-eliminatie
Gene Expression Omnibus (GEO)NCBIGSE67916Tamoxifen-resistentie dataset
glmnet-pakketCRAN / Bioconductor-LASSO-regressie
limma-pakketBioconductor-Differentiële expressieanalyse
METABRIC-datasetcBioPortal / Curtis et al.-Validatiecohort
pROC-pakketCRAN-ROC-curve analyse
R-softwareR Core Teamv4.4.2Statistisch computingomgeving
Random forest-pakketCRAN-Random Forest-algoritme
rms-pakketCRAN-Nomogram constructie
TCGA-BRCA cohortThe Cancer Genome Atlas (TCGA)-Training cohort RNA-seq gegevens
timeROC-pakketCRAN-Tijdsafhankelijke ROC-analyse
```

Herprints en machtigingen

Toestemming aanvragen om de tekst of afbeeldingen van dit JoVE-artikel te hergebruiken

Toestemming aanvragen

Trefwoorden

BiologieEditie 232Editie 232Lege waardeEditieER borstkankermachine learning algoritmenPrognostisch risicomodelMultigen signatuurImmuun micro omgeving

Gerelateerde artikelen