Artykuł badawczy

Oparte na uczeniu maszynowym identyfikacja genów związanych z opornością na tamoksyfen oraz ich zastosowanie w modelowaniu rokowania raka piersi

DOI:

10.3791/71327

26 czerwca 2026

* These authors contributed equally

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Opracowaliśmy sygnaturę oporu na tamoksyfen, wyznaczoną za pomocą uczenia maszynowego, opartą na sześciu genach, która klasyfikuje pacjentki z rakiem piersi na poziomy ryzyka przeżycia i może wspierać spersonalizowaną ocenę rokowania oraz podejmowanie decyzji terapeutycznych w praktyce klinicznej.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Tamoksyfen jest kluczową terapią dokrewną w leczeniu raka piersi z dodatnim receptorem estrogenowym (ER+), ale nabyta oporność ogranicza jego długoterminową skuteczność. Mechanizmy molekularne są złożone, a brakuje predykcyjnych biomarkerów. Dane dotyczące ekspresji genów związanej z opornością na tamoksyfen zostały uzyskane z GEO (GSE67916), a geny różniczkowo eksponowane (DEG) zidentyfikowano za pomocą algorytmu limma. Analizy wzbogacenia funkcjonalnego (GO i KEGG) ujawniły zaangażowanie w procesy odpornościowe, reakcje antywirusowe, endocytozę, szlaki lizosomalne i sygnał estrogenowy. Trzy algorytmy uczenia maszynowego (LASSO, SVM-RFE i RF) zidentyfikowały sześć centralnych genów (CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5). Na podstawie tych genów skonstruowano model ryzyka prognostycznego wykorzystujący dane TCGA-BRCA, skutecznie stratyfikując pacjentów na grupy wysokiego i niskiego ryzyka o znacznie różniącej się ogólnej przeżywalności. Model wykazał dobrą dokładność predykcyjną (AUC = 0,70) i stabilną wydajność w zależnych od czasu analizach ROC, zweryfikowanych w niezależnej kohorcie. To badanie dostarcza solidnego charakterystycznego znaku genów związanego z opornością na tamoksyfen i wielogenowy model prognostyczny, oferując nowe wglądy w mechanizmy oporności i potencjalne wytyczne dla indywidualnej prognozy i terapii w raku piersi ER+.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Rak piersi jest najczęściej rozpoznawanym rakiem u kobiet na całym świecie i nadal jest głównym czynnikiem przyczyniającym się do zgonów związanych z rakiem1. Na podstawie profilowania molekularnego około 60-70% pacjentów wykazuje podtyp receptora estrogenowego dodatni (ER+), który generalnie dobrze reaguje na początkową terapię hormonalną. Wśród różnych środków hormonalnych tamoksyfen – selektywny modulator receptora estrogenowego (SERM) – przez długi czas był standardem w leczeniu adjuwantowym i przerzutowym raka piersi ER+, znacznie poprawiając wyniki przeżywalności w dużych randomizowanych badaniach klinicznych2.

Mimo udowodnionej skuteczności klinicznej, znaczna część pacjentów ostatecznie rozwija nabytą oporność, co prowadzi do nawrotu choroby i jej progresji3. W związku z tym, oporność na tamoksyfen stanowi krytyczne zwężenie w długoterminowym leczeniu raka piersi. Poprzednie badania wskazują, że mechanizmy prowadzące do oporności są bardzo zróżnicowane i obejmują nieprawidłowe przekazywanie sygnałów przez receptor estrogenowy, aktywację alternatywnych ścieżek wzrostu (np. PI3K/AKT, MAPK), dysregulację apoptozy i przeprogramowanie metabolizmu4.

Ostatnio środowisko nowotworowe (TME), zwłaszcza mikrośrodowisko immunologiczne, przyciąga coraz większą uwagę ze względu na jego rolę w reakcji na leczenie i oporności. Infiltracja komórek odpornościowych i sygnalizacja zapalna są ściśle związane z progresją raka piersi i wrażliwością na leczenie. Pojawiające się dowody sugerują, że procesy immunologiczne mogą modulować reakcje komórkowe na stres i sprzyjać unikaniu odpowiedzi immunologicznej, przyczyniając się w ten sposób do oporności na hormony5. Jednakże, konkretny obraz immunologiczny związany z opornością na tamoksyfen wciąż wymaga dalszego wyjaśnienia.

Dzięki rozwojowi sekwencjonowania masowego równoległego i bioinformatyki, analiza danych transkryptomowych oferuje potężne podejście do rozszyfrowywania molekularnej podstawy oporności na leki. W porównaniu z pojedynczymi biomarkerami genowymi, wielogenowe sygnatury efektywniej odzwierciedlają różnorodność nowotworową, oferując lepszą stabilność i dokładność w prognozowaniu. Algorytmy uczenia maszynowego, takie jak regresja LASSO, Maszyny Wektorów Nośnych (SVM) i Random Forest (RF), stały się kluczowymi narzędziami do identyfikacji solidnych biomarkerów i budowy modeli predykcyjnych w medycynie precyzyjnej6. Mimo że zaproponowano kilka sygnatur genowych7,8,9, często brakuje solidnej walidacji.

Mimo że poprzednie badania eksplorowały geny odporności na tamoksyfen, niewiele systematycznie integrowało wiele strategii uczenia maszynowego, aby zbudować solidny model prognostyczny zweryfikowany w niezależnych kohortach. W niniejszym badaniu zintegrowaliśmy dane transkryptomowe z GEO i TCGA, aby przeszukiwać geny związane z opornością na tamoksyfen. Zastosowując zestaw algorytmów uczenia maszynowego, zidentyfikowaliśmy rdzeniowe geny odporności i zbudowaliśmy model ryzyka prognostycznego. Dodatkowo oceniliśmy związek modelu z mikrośrodowiskiem immunologicznym i zweryfikowaliśmy jego wartość predykcyjną w niezależnej kohorcie, mając na celu dostarczenie nowych teoretycznych dowodów na rzecz spersonalizowanych strategii leczenia.

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Wszystkie dane wykorzystane w niniejszym badaniu zostały uzyskane z publicznie dostępnych baz danych (TCGA, GEO i METABRIC). Nie było zaangażowanych ludzkich uczestników ani zwierząt; dlatego zatwierdzenie przez komitet etyczny instytucji i pisemna zgoda nie były wymagane.

Zbieranie i przetwarzanie danych

Dane ekspresji genów związane z opornością na tamoksyfen zostały pobrane z bazy danych Gene Expression Omnibus (GEO)10. Zbiór danych GSE67916 (Affymetrix Human Genome U133 Plus 2.0 Array) zawiera 18 próbek komórek raka piersi: 8 nieleczonych próbek kontrolnych i 10 próbek opornych na tamoksyfen wygenerowanych poprzez długotrwałą ekspozycję na lek. Dane sekwencjonowania RNA i odpowiednie informacje o dalszym przebiegu leczenia dla kohorty Rak Inwazyjny Piersi (TCGA-BRCA) zostały pobrane z The Cancer Genome Atlas (TCGA)11.

Surowe pliki CEL mikroarray przetwarzano w R (wersja 4.4.2) przy użyciu pakietu affy. Korekta tła i normalizacja zostały wykonane za pomocą algorytmu Robust Multi-array Average (RMA), w tym transformacja log2 i normalizacja kwantylowa. ID sond zostały przypisane do symboli genów za pomocą plików adnotacji platformy; dla genów z wieloma sondami użyto średniej wartości ekspresji. Dla danych TCGA RNA-seq wartości wartości transkryptów na milion (TPM) zostały przekształcone log2 [log2(TPM + 1)]. Próbki z niekompletnymi informacjami o przeżyciu lub brakującymi zmiennymi klinicznymi zostały wykluczone.

Identyfikacja różnicowej ekspresji genów

Różnicową ekspresję między próbkami opornymi na tamoksyfen a próbkami kontrolnymi oceniono za pomocą pakietu R limma12 z empiryczną moderacją Bayesa. Geny o wartości |log2 fold change| > 1 i wartości P skorygowanej < 0,05 (Benjamini-Hochberg FDR) zdefiniowano jako geny o różnicowej ekspresji (DEG).

Analiza wzbogacania funkcjonalnego

Analizy Gene Ontology (GO)13 i Kyoto Encyclopedia of Genes and Genomes (KEGG)14 przeprowadzono za pomocą pakietu R clusterProfiler15. Kategorie GO obejmowały proces biologiczny (BP), komponent komórkowy (CC) i funkcję molekularną (MF). Wartości P skorygowanego < 0,05 uważano za istotne.

Selekcja cech oparta na uczeniu maszynowym

Zastosowano trzy algorytmy uczenia maszynowego w celu zidentyfikowania genów hub: (1) regresja LASSO16 (pakiet glmnet) z 10-krotną walidacją krzyżową w celu wybrania optymalnego parametru kary (lambda.min); (2) Maszyna wektorowa - eliminacja rekurencyjna funkcji (SVM-RFE)17 (pakiet e1071) z pięciokrotną walidacją krzyżową w celu zidentyfikowania minimalnego podzbioru genów o najniższym błędzie klasyfikacji; (3) Las losowy (RF)18 (pakiet randomForest) z 500 drzewami (ntree = 500); geny zostały sklasyfikowane według MeanDecreaseGini. Geny zidentyfikowane za pomocą wszystkich trzech metod zdefiniowano jako geny hub.

Konstrukcja modelu ryzyka prognostycznego

Model prognostycznego ryzyka wielogenowego został skonstruowany na podstawie ekspresji genów TCGA-BRCA i danych dotyczących przeżycia. Geny związane z przeżyciem zostały przesięte za pomocą regresji Cox jednoczynnikowej, a następnie regresji Cox wieloczynnikowej w celu opracowania ostatecznego podpisu. Formuła wyniku ryzyka została obliczona jako: Wynik ryzyka = (0,01297 × CAMK1D) + (0,03021 × CHAC1) + (0,02018 × KIAA0513) + (0,00647 × MED13) + (0,00108 × NDRG1) + (0,04551 × STXBP5). Pacjenci zostali podzieleni na grupy wysokiego i niskiego ryzyka na podstawie średniej wartości wyniku ryzyka.

Ocena i walidacja modelu prognostycznego

Różnice w przeżyciu całkowitym między grupami oceniono za pomocą analizy Kaplan-Meier i testu log-rank. Wynik predykcyjny oceniono za pomocą krzywych ROC (pakiet pROC) i analizy ROC zależnej od czasu (pakiet timeROC). Nomograf integrujący wyniki ryzyka i zmienne kliniczne skonstruowano za pomocą pakietu rms. Wynik kalibracji oceniał zgodność między przewidywanymi a obserwowanymi prawdopodobieństwami przeżycia. Walidację zewnętrzną przeprowadzono w niezależnej kohorcie Molecular Taxonomy of Breast Cancer International Consortium (METABRIC)19 przy użyciu tej samej formuły i granicy.

Analiza infiltracji immunologicznej

Infiltrację komórek immunologicznych oszacowano za pomocą CIBERSORT20 z 1000 permutacjami na podstawie danych TCGA. Włączono próbki o wartości P < 0,05. Różnice w składzie komórek immunologicznych między grupami wysokiego i niskiego ryzyka oceniono za pomocą testu Wilcoxona-Manna-Whitneya, a korelacje między

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Identyfikacja genów o zróżnicowanej ekspresji związanych z opornością na tamoksyfen

W sumie zidentyfikowano 854 geny o zróżnicowanej ekspresji (DEGs) między próbkami odpornymi na tamoksyfen a kontrolnymi, w tym 556 w kierunku w górę i 298 w dół. Rozkład DEGs wykazał przewagę genów ekspresowanych w górę w próbkach odpornych, co sugeruje rozległą aktywację transkrypcyjną związaną z opornością na tamoksyfen (Rysunek 1).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Oporność na tamoksyfen pozostaje kluczową przeszkodą w leczeniu raka piersi ER+. Chociaż mechanizmy takie jak mutacje ER są dobrze znane, układowe adaptacje molekularne do długotrwałej terapii są mniej dobrze poznane. W niniejszym badaniu zintegrowaliśmy transkryptomikę i uczenie maszynowe, aby zidentyfikować solidną sześciogenową sygnaturę (CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5), która przewiduje zarówno oporność na tamoksyfen, jak i rokowanie pacjenta.

Nasza analiza funkcj...

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy deklarują, że nie mają żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

To badanie było wspierane przez Projekt Jiangsu Province Engineering Research Center of Molecular Target Therapy and Companion Diagnostics in Oncology (SGK2202319), Jiangsu higher education institution innovative research team for science and technology (2021), Program Jiangsu vocational college engineering technology research center (2023), The Natural Science key Foundation of the Jiangsu Higher Education Institutions of China (Grant No. 24KJA310008), the Key Programs of the Suzhou Vocational Health College (szwzy szwzy202406), the Project of State Key Laboratory of Radiation Medicine and Protection, Soochow University (No. GZK1202506), the Project of Jiangsu Province Engineering Research Center of Molecular Target Therapy and Companion Diagnostics in Oncology (SGK1202413), the Dongwu Health Talent Program (DWWS2024002, DWWS2025001).

Dostęp ograniczony. Zaloguj się lub rozpocznij wersję próbną, aby wyświetlić tę treść.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Pakiet AffyBioconductor-Przetwarzanie danych mikroarray
Pakiet clusterProfilerBioconductorv4.4.2Analiza wzbogacania GO i KEGG
Algorytm CIBERSORTNewman i in.-Szacowanie infiltracji komórek odpornościowych
Pakiet e1071 (SVM-RFE)CRAN-Eliminacja rekurencyjna funkcji maszyny wektorów nośnych
Gene Expression Omnibus (GEO)NCBIGSE67916Zestaw danych odporności na tamoksyfen
Pakiet glmnetCRAN / Bioconductor-Regresja LASSO
Pakiet limmaBioconductor-Analiza różnicowej ekspresji
Zestaw danych METABRICcBioPortal / Curtis i in.-Kohorta walidacyjna
Pakiet pROCCRAN-Analiza krzywych ROC
Oprogramowanie RR Core Teamv4.4.2Środowisko obliczeniowe statystyczne
Pakiet Random forestCRAN-Algorytm Random Forest
Pakiet rmsCRAN-Konstrukcja nomogramu
Kohorta TCGA-BRCAThe Cancer Genome Atlas (TCGA)-Dane RNA-seq z kohorty treningowej
Pakiet timeROCCRAN-Analiza ROC zależna od czasu

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

BiologiaNumer 232Numer 232Warto pustaNumerrak piersi ERalgorytmy uczenia maszynowegoprognostyczny model ryzykasygnatura wielogenowamikro rodowisko odporno ciowe

Powiązane artykuły