우리는 유방암 환자의 생존 위험에 따라 계층화하는 머신러닝 기반 6유전자 타목시펜 내성 서명을 개발했으며, 이는 임상 실무에서 개인 맞춤형 예후 평가와 치료 의사결정을 지원할 수 있습니다.
연구 논문
* These authors contributed equally
우리는 유방암 환자의 생존 위험에 따라 계층화하는 머신러닝 기반 6유전자 타목시펜 내성 서명을 개발했으며, 이는 임상 실무에서 개인 맞춤형 예후 평가와 치료 의사결정을 지원할 수 있습니다.
타목시펜은 에스트로겐 수용체 양성(ER+) 유방암의 주요 내분비 치료제이지만, 후천성 내성이 장기적인 효능을 제한합니다. 분자 메커니즘은 여전히 복잡하며, 예측 바이오마커는 부족합니다. 타목시펜 내성과 관련된 유전자 발현 데이터는 GEO (GSE67916)에서 얻었고, LIMMA 알고리즘을 사용해 차별발현 유전자(DEGs)를 확인하였습니다. 기능 풍부화 분석(GO 및 KEGG)은 면역 과정, 항바이러스 반응, 엔도사이토시스, 라이소좀 경로, 에스트로겐 신호 전달에 관여함을 밝혀냈습니다. 세 가지 머신러닝 알고리즘(LASSO, SVM-RFE, RF)이 여섯 개의 허브 유전자(CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5)를 확인했습니다. 이 유전자들을 기반으로 한 예후 위험 모델이 TCGA-BRCA 데이터를 사용하여 구성되어 환자를 유의미하게 다른 전체 생존 기간을 가진 고위험군과 저위험군으로 효과적으로 층화하였습니다. 이 모델은 독립적인 코호트에서 검증된 시간 의존 ROC 분석에서 우수한 예측 정확도(AUC = 0.70)와 안정적인 성능을 보였습니다. 이 연구는 견고한 타목시펜 내성 관련 유전자 서명과 다유전자 예후 모델을 제공하여 내성 기전에 대한 새로운 통찰과 ER+ 유방암의 개별화 예후 및 치료를 위한 잠재적 지침을 제공합니다.
유방암은 전 세계 여성 사이에서 가장 흔하게 진단되는 암이며, 암 관련 사망의 주요 원인으로 남아 있습니다1. 분자 프로파일링에 따르면, 약 60-70%의 환자가 에스트로겐 수용체 양성(ER+) 아형을 가지고 나타나며, 이는 일반적으로 초기 내분비 치료에 잘 반응합니다. 다양한 내분비계 약물 중에서, 선택적 에스트로겐 수용체 조절제(SERM)인 타목시펜은 ER+ 유방암의 보조제 및 전이 치료의 표준 치료로 오랫동안 사용되어 왔으며, 대규모 무작위 대조 시험에서 생존율을 크게 향상시켰다2.
임상적 효능이 확립되었음에도 불구하고, 상당수의 환자가 결국 후천성 내성을 발병하여 질병 재발과 진행으로 이어집니다. 따라서 타목시펜 내성은 유방암의 장기 관리에서 중요한 병목 현상을 나타냅니다. 이전 연구들은 내성 작용 기전이 매우 이질적임을 시사하며, 이상한 ER 신호, 대체 성장 인자 경로(예: PI3K/AKT, MAPK) 활성화, 세포자사멸사 조절 이상, 대사 재프로그래밍 등이 포함된다.
최근에는 종양 미세환경(TME), 특히 면역 미세환경이 치료 반응과 내성에서 중요한 역할을 한다는 점에서 점점 더 주목받고 있습니다. 면역 세포 침윤과 염증 신호는 유방암 진행과 치료 민감도와 밀접한 관련이 있습니다. 새로운 증거는 면역 관련 과정이 세포 스트레스 반응을 조절하고 면역 회피를 촉진하여 내분비 저항성에 기여할 수 있음을 시사합니다5. 그러나 타목시펜 내성과 관련된 구체적인 면역 구조는 아직 완전히 밝혀지지 않았습니다.
고처리량 시퀀싱과 생물정보학의 등장으로 전사체 데이터 분석은 약물 내성의 분자적 기초를 해독하는 강력한 접근법을 제공합니다. 단일 유전자 바이오마커와 비교할 때, 다중 유전자 서명은 종양의 이질성을 더 효과적으로 포착하여 예후에서 우수한 안정성과 정확성을 제공합니다. LASSO 회귀, 서포트 벡터 머신(SVM), 랜덤 포레스트(RF)와 같은 머신러닝 알고리즘은 정밀 의학에서 강력한 바이오마커를 식별하고 예측 모델을 구축하는 데 필수적인 도구가되었습니다. 여러 유전자 서명이 제안되었음에도 불구하고견고한 검증이 부족한 경우가 많습니다.
이전 연구들은 타목시펜 내성 유전자를 탐구했으나, 독립적인 코호트에서 검증된 견고한 예후 모델을 구축하기 위해 여러 기계 학습 전략을 체계적으로 통합한 연구는 거의 없습니다. 본 연구에서는 GEO와 TCGA의 전사체 데이터를 통합하여 타목시펜 내성 관련 유전자를 선별하였습니다. 기계 학습 알고리즘 집합을 적용하여 핵심 내성 유전자를 식별하고 예후 위험 모델을 구축했습니다. 우리는 이 모델과 면역 미세환경의 연관성을 추가로 평가하고, 독립적인 코호트에서 예측 가치를 검증하여 맞춤형 치료 전략에 대한 새로운 이론적 증거를 제시하고자 했습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
이 연구에 사용된 모든 데이터는 공개적으로 접근 가능한 데이터베이스(TCGA, GEO, METABRIC)에서 수집되었습니다. 인간 참가자나 동물은 없었으며; 따라서 기관 심사위원회의 승인과 사전 동의는 필요하지 않았습니다.
데이터 수집 및 전처리
타목시펜 내성과 관련된 유전자 발현 데이터는 Gene Expression Omnibus(GEO) 데이터베이스에서10번 검색되었습니다. GSE67916 데이터셋(Affymetrix Human Genome U133 Plus 2.0 Array)에는 18개의 유방암 세포 샘플이 포함되어 있습니다: 8개는 처리되지 않은 대조군 샘플, 10개는 장기 약물 노출로 생성된 타목시펜 내성 샘플입니다. 유방침윤암 코호트(TCGA-BRCA)의 RNA 시퀀싱 데이터 및 임상 추적 정보는 암 게놈 아틀라스(TCGA)11에서 다운로드되었습니다.
원시 마이크로어레이 CEL 파일은 affy 패키지를 사용하여 R(버전 4.4.2)에서 처리되었습니다. 배경 보정과 정규화는 로그2 변환과 분위수 정규화를 포함한 강인한 다중 배열 평균(RMA) 알고리즘으로 수행되었습니다. 프로브 ID는 플랫폼 주석 파일을 사용해 유전자 심볼에 매핑되었으며; 여러 프로브를 가진 유전자의 경우, 평균 발현 값을 사용했습니다. TCGA RNA-seq 데이터의 경우, 전사체는 백만분(TPM) 값으로 log2 변환 [log2(TPM + 1)]로 처리되었습니다. 생존 정보가 불완전하거나 임상 변수가 누락된 샘플은 제외하였습니다.
차별발현 유전자의 식별
타목시펜 내성 샘플과 대조군 샘플 간의 차이 발현은 경험적 베이즈 감속을 적용한 limma R 패키지12 를 사용하여 평가하였습니다. |log2 접수 변화를 가진 유전자| > 1과 조정된 P 값 0.05(벤자미니–호흐버그 FDR<)는 차별발현 유전자(DEGs)로 정의되었습니다.
기능 풍부 분석
유전자 온톨로지(GO)13및 교토 유전자 및 유전체 백과사전(KEGG)14 분석은 clusterProfiler15 R 패키지를 사용하여 수행되었습니다. GO 범주에는 생물학적 과정(BP), 세포 구성 요소(CC), 분자 기능(MF)이 포함되었습니다. 조정 P 값 < 0.05는 유의한 것으로 간주되었습니다.
머신러닝 기반 특징 선택
허브 유전자를 식별하기 위해 세 가지 머신러닝 알고리즘이 적용되었습니다: (1) 최적 페널티 매개변수를 선택하기 위한 10배 교차 검증을 포함한 LASSO회귀 16 (glmnet 패키지); (2) 분류 오차가 가장 낮은 최소 유전자 하위 집합을 식별하기 위한 5중 교차 검증을 통한 벡터 기계-재귀적 특징 제거(SVM-RFE)17 (e1071 패키지); (3) 랜덤 포레스트 (RF)18 (randomForest 패키지) 500개의 트리(ntree = 500); 유전자는 MeanDecreaseGini에 의해 순위가 매겨졌습니다. 세 가지 방법 모두로 확인된 유전자는 허브 유전자로 정의되었습니다.
예후 위험 모델 구축
TCGA-BRCA 유전자 발현 및 생존 데이터를 사용하여 다유전자 예후 위험 모델을 구축하였습니다. 생존 관련 유전자는 단변량 콕스 회귀법과 다변량 콕스 회귀를 통해 최종 서명을 개발하였습니다. 위험 점수 공식은 다음과 같이 계산되었습니다: 위험 점수 = (CAMK1D × 0.01297) + (CHAC1 × 0.03021) + (0.02018 × KIAA0513) + (0.00647 × MED13) + (0.00108 × NDRG1) + (0.04551 × STXBP5). 환자들은 중앙값 위험 점수를 기준으로 고위험군과 저위험군으로 계층화되었습니다.
예후 모델의 평가 및 검증
그룹 간 전체 생존 차이는 Kaplan–Meier 분석과 로그 랭크 검정을 통해 평가하였다. 예측 성과는 ROC 곡선(pROC 패키지)과 시간 의존 ROC 분석(timeROC 패키지)을 사용하여 평가되었습니다. 위험 점수와 임상 변수를 통합한 노모그램이 RMS 패키지를 사용하여 구축되었습니다. 보정 곡선은 예측된 생존 확률과 관찰된 생존 확률 간의 일치를 평가했습니다. 외부 검증은 독립적인 유방암 분자 분류학 국제 컨소시엄(METABRIC) 코호트19 에서 동일한 공식과 기준을 사용하여 수행되었습니다.
면역 침윤 분석
면역 세포 침윤은 TCGA 데이터를 기반으로 1,000가지 순열을 가진 CIBERSORT20 을 사용하여 추정하였습니다. P < 0.05 샘플을 포함하였습니다. 고위험군과 저위험군 간 면역세포 구성 차이는 Wilcoxon 랭크 합 검정으로 평가되었고, 허브 유전자 발현과 면역세포 풍부도 간의 상관관계는 Spearman의 랭크 상관관계를 사용해 평가되었습니다.
통계 분석
모든 분석은 R에서 수행되었으며, 연속 변수들은 Wilcoxon 랭크-합 검정을, 범주 변수는 카이제곱 검정으로 비교하였다. 양측 P < 0.05는 통계적으로 유의한 것으로 간주되었습니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
타목시펜 내성과 관련된 차별 발현 유전자의 규명
타목시펜 내성 및 대조군 샘플 사이에서 총 854개의 차등 발현 유전자(DEGs)가 확인되었으며, 이 중 556개는 상향 조절 유전자, 298개는 하향 조절 유전자였습니다. DEGs 분포는 저항성 샘플에서 상향 조절된 유전자가 우세함을 보였으며, 이는 타목시펜 내성과 관련된 광범위한 전사 활성화를 시사합니다(그림 1).
DEGs의 기능 농축 분석
GO 농축 분석 결과, DEG는 바이러스에 대한 방어 반응, 1형 인터페론 신호 전달 경로, 인터페론에 대한 세포 반응 등 면역 및 방어 관련 생물학적 과정에 주로 관여함을 밝혀냈습니다. 세포 구성 성분 분석은 엔드사이...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
타목시펜 내성은 ER+ 유방암 치료에서 여전히 중대한 장애물로 남아 있습니다. ER 돌연변이와 같은 기전은 잘 알려져 있지만, 장기 치료에 대한 전신 분자 적응은 아직 잘 이해되지 않았습니다. 본 연구에서는 전사체학과 머신러닝을 통합하여 타목시펜 내성과 환자 예후를 모두 예측하는 강력한 6유전자 서명(CAMK1D, CHAC1, KIAA0513, MED13, NDRG1, STXBP5)을 규명하였습니다.
우리의 기능 분석은 내성이 광범위한 전사체 재형성, 특히 면역 반응과 세포 내 수송 경로(리소좀/포가좀)에서 동반됨을 밝혀냈습니다. "바이러스 방어" 및 "타입 I 인터페론" 경로의 농축은 실제 바이러스 감염보다는 저항성 세포에서 무균 염증 상태 또는 스트레스 반응이 증가한 것을 반영하는 것으로 보인다21. 이는 만성 스트레스 신호가 약물 압력 하에서 생존을 지...
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
저자들은 이해 상충이 없다고 선언한다.
이 연구는 장쑤성 분자 표적 치료 및 종양학 동반 진단 공학연구센터 프로젝트(SGK2202319), 장쑤 고등교육기관 과학기술 혁신연구팀(2021), 장쑤 직업대학 공학기술연구센터 프로그램(2023), 중국 장쑤 고등교육기관 자연과학 핵심재단(보조금 번호 24KJA310008)의 지원을 받았습니다. 쑤저우 직업보건대학(szwzy szwzy202406) 핵심 프로그램, 수저우대학교 방사선 의학 및 보호 국가 중점연구소 프로젝트(번호: GZK1202506), 장쑤성 분자 표적 치료 및 종양학 동반 진단 공학연구센터 프로젝트(SGK1202413), 동우 건강 인재 프로그램(DWWS2024002, DWWS2025001)이 포함됩니다.
액세스가 제한되었습니다. 이 콘텐츠를 보려면 로그인하거나 체험판을 시작하세요.
| 이름 | 회사 | 카탈로그 번호 | 댓글 |
|---|---|---|---|
| Affy 패키지 | Bioconductor | - | 마이크로어레이 데이터 처리 |
| clusterProfiler 패키지 | Bioconductor | v4.4.2 | GO 및 KEGG 풍부화 분석 |
| CIBERSORT 알고리즘 | Newman et al. | - | 면역 세포 침윤 추정 |
| e1071 패키지 (SVM-RFE) | CRAN | - | 서포트 벡터 머신 재귀적 특징 제거 |
| Gene Expression Omnibus (GEO) | NCBI | GSE67916 | 타목시펜 저항 데이터셋 |
| glmnet 패키지 | CRAN / Bioconductor | - | LASSO 회귀 |
| limma 패키지 | Bioconductor | - | 차등 발현 분석 |
| METABRIC 데이터셋 | cBioPortal / Curtis et al. | - | 검증 코호트 |
| pROC 패키지 | CRAN | - | ROC 곡선 분석 |
| R 소프트웨어 | R Core Team | v4.4.2 | 통계 컴퓨팅 환경 |
| 랜덤 포레스트 패키지 | CRAN | - | 랜덤 포레스트 알고리즘 |
| rms 패키지 | CRAN | - | Nomogram 구성 |
| TCGA-BRCA 코호트 | The Cancer Genome Atlas (TCGA) | - | 훈련 코호트 RNA-seq 데이터 |
| timeROC 패키지 | CRAN | - | 시간 의존적 ROC 분석 |
이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청
허가 요청