이 프로토콜은 유방암의 약물 민감성을 예측하기 위해 XGBoost 및 SHAP를 사용하는 기계 학습 파이프라인을 제시합니다. 워크플로에는 데이터 전처리, 하이브리드 모델링, SHAP 기반 해석, 시너지 스코어링 및 PCA 클러스터링이 포함되어 강력한 약물을 식별하고 치료 반응에 영향을 미치는 주요 생물학적 요인을 이해합니다.
Method Article
이 프로토콜은 유방암의 약물 민감성을 예측하기 위해 XGBoost 및 SHAP를 사용하는 기계 학습 파이프라인을 제시합니다. 워크플로에는 데이터 전처리, 하이브리드 모델링, SHAP 기반 해석, 시너지 스코어링 및 PCA 클러스터링이 포함되어 강력한 약물을 식별하고 치료 반응에 영향을 미치는 주요 생물학적 요인을 이해합니다.
유방암은 전 세계적으로 가장 널리 퍼진 악성 종양 중 하나로 남아 있으며 종양 이질성과 약물 내성으로 인해 심각한 치료 문제를 야기하고 있습니다. 이 연구는 유방암 세포주에서 약물 민감도를 예측하기 위한 재현 가능한 데이터 기반 기계 학습 프로토콜을 제시하며, 강력한 단일 제제와 시너지 약물 조합을 식별한다는 이중 목표를 가지고 있습니다. GDSC(Genomics of Drug Sensitivity in Cancer)에서 선별된 데이터 세트를 사용하여 독립형 XGBoost 회귀 분석기와 하이브리드 Autoencoder-XGBoost 파이프라인이라는 두 가지 예측 접근 방식을 구현했습니다. 전처리에는 레이블 인코딩, 원핫 인코딩, Z-점수 표준화, 결측값 대치 및 PCA를 통한 차원 축소가 포함되었습니다. 모델 평가 결과 XGBoost는 하이브리드 모델(MSE = 4.0322, R2 = 0.4577)에 비해 우수한 성능(MSE = 1.3789, R2 = 0.8145)을 달성한 것으로 나타났습니다. 해석 가능성은 확립된 약리학적 메커니즘에 맞춰 TARGET_PATHWAY, DRUG_ID, TARGET 및 CELL_LINE_NAME를 주요 예측 기능으로 식별한 SHAP(SHAP) Additive exPlanations를 사용하여 해결되었습니다. 모델 출력을 DrugComb 및 SynergyDB 데이터와 결합하여 파생된 예측 시너지 점수는 보르테조밉 + 로미뎁신 및 파클리탁셀 + 보르테조밉과 같은 유망한 약물 쌍을 강조했습니다. 이러한 발견은 PCA 기반 약리학적 클러스터링에 의해 추가로 뒷받침되어 유사한 작용 메커니즘을 가진 생물학적으로 관련된 약물 그룹을 밝혔습니다. 제안된 프로토콜은 정밀 종양학 연구를 위한 투명하고 적응 가능한 프레임워크를 제공하여 예측 정확도와 생물학적 해석 가능성을 모두 가능하게 합니다. 엄격한 전처리, 모델 검증, 설명 가능성 및 약물 시너지 분석을 통합함으로써 이 워크플로는 유방암 치료의 중개 약물 발견 및 용도 변경을 위한 확장 가능한 기반을 제공합니다.
유방암은 여전히 가장 흔하게 진단되는 암이며 전 세계 여성의 암 관련 사망 원인 중 두 번째로 큰 원인입니다1. 미국에서만 모든 새로운 여성 악성 종양의 거의 30%를 차지하며 매년 280,000건 이상의 새로운 사례가 진단됩니다2. 특히 HER2 양성 및 호르몬 수용체 양성 하위 유형의 치료 발전에도 불구하고 치료에 대한 내성 및 재발은 특히 표적 치료법이 부족한 삼중 음성 유방암(TNBC)과 같은 공격적인 하위 유형의 경우 여전히 중요한 과제로 남아 있습니다 3,4. 이는 개별 분자 프로필에 맞는 효과적인 치료제와 조합을 식별하기 위한 정밀 중심의 약물 발견이 시급히 필요하다는 점을 강조합니다. 전통적으로 실험 및 시행착오 방법에 의해 안내되는 약물 발견은 기계 학습(ML) 기술의 통합을 통해 눈에 띄게 가속화되었습니다 5,6. ML은 고차원 생물의학 데이터 전반에 걸쳐 복잡한 비선형 관계를 모델링할 수 있으며 표적 식별, 바이오마커 발견, 약물 민감도 예측 및 병용 요법 설계를 지원할 수 있습니다7,8. 그러나 종양학에서 ML 모델의 실제 배포는 모델 해석 가능성, 재현성, 희소 데이터 세트에 대한 과적합, 암 하위 유형 전반에 걸친 일반화 등 여러 가지 장애물에 직면해 있습니다 9,10,11.
이러한 한계를 극복하기 위해 최근 연구는 특징 추출을 위한 딥 러닝과 강력한 예측을 위한 앙상블 학습을 결합하는 데 중점을 두었습니다. 여러 알고리즘을 평가하는 연구에서 인공 신경망(ANN)과 같은 모델은 최대 93.2%의 정확도 수준을 달성하여 Naïve Bayes 및 Decision Trees12와 같은 기존 분류기를 능가했습니다. 또한 통합 기능 마이닝 기술은 GEO(Gene Expression Omnibus) 및 GSE45827와 같은 데이터베이스를 통해 주요 드라이버 유전자와 분자 표적을 발견하여 최대 1,700개의 차등적으로 발현되는 유전자를 식별했으며 그 중 일부는 알려진 약물 상호작용을 나타냅니다13. 또한, 새로운 약물 용도 변경 연구에서는 칼시트리올과 같은 비종양학 화합물이 특히 HER2+ 세포주에서 네라티닙과 같은 표준 치료법보다 유방암 세포 생존력을 더 효과적으로 감소시킬 수 있는 잠재력이 밝혀졌습니다14. Akt-신호 전달 경로에 대한 조사는 또한 트라스투주맙 내성을 극복하는 데 가능성을 보여주었으며, 이는 수용체 집중 요법의 대안으로 분자 경로 표적화를 시사합니다15,16. 그러나 이러한 발전에도 불구하고 지속적인 약물 반응 값을 예측하고, 효과적인 약물 조합의 순위를 매기고, 약리학적 유사성을 시각화할 수 있는 체계적이고 설명 가능한 프레임워크는 현재 문헌에서 아직 탐구되지 않은 상태로 남아 있습니다. 많은 모델은 분류 기반이거나 번역 명확성이 부족하며, 특히 실제 약물유전체학 데이터 세트에 적용할 때 더욱 그렇습니다.
고품질 데이터를 위한 도구를 제공하는 기계 학습(ML)을 통해 신약 발견 및 의사 결정을 개선할 수 있습니다. 표적 검증, 바이오마커 식별, 임상 시험 분석을 포함한 신약 발견의 모든 단계에서 기계 학습을 사용하면 이점을 얻을 수 있습니다. ML 생성 결과의 해석 가능성과 재현성도 장애물입니다17. 실패율을 줄이고 프로세스를 가속화하는 것은 이러한 문제를 해결하고 검증 변수에 대한 지식을 높임으로써 달성할 수 있습니다. 연구원들은 기계 학습 알고리즘을 사용하여 암의 다양한 단계에서 생검 샘플을 평가했습니다. 조사 결과에 따르면 테스트 정확도는 ANN 93.2%, Naïve Bayes(NB) 90.4%, Decision Tree(DT) 87.8%, RF 85.9%로 높았습니다. 총 350개의 예측 유전자와 164개의 차등적으로 발현된 유전자가 Rakhshaninejad 등의 GEO 데이터베이스를 결합하여 발견되었습니다.18. 결합된 데이터 세트에서 BGWO_SA_Ens(Simulated Annealing Ensemble)을 사용한 Binary Grey Wolf Optimization 알고리즘은 1404개의 유전자를 발견한 반면, GSE45827 데이터 세트에서는 1710개의 유전자를 발견했습니다. 약 35개의 우수한 유전자와 중요한 경로에서의 역할 및 우수한 유전자와 항암제 간의 관계가 발견되었습니다. 표피 성장 인자 수용체(EGFR(EGFR) 과발현 신호 전달 경로 및 관련 계열 구성원에서 표적 유전자를 찾기 위해 Nagaraj 등에 의해 분자 네트워킹 조사가 수행되었습니다.19 암과 관련 없는 질환을 치료하도록 승인된 칼시트리올이라는 약물은 네 가지 수용체 각각과 강한 결합 친화력을 가졌습니다. 에 따르면 in vitro 세포독성 연구에서 칼시트리올은 용량 의존적 방식으로 SK-BR-3 세포 생존력을 감소시켰으며, 이는 네라티닙에 비해 우수한 세포독성과 유방암 세포의 증식 감소를 나타냅니다. 활성 및 약물 투여 가능한 Akt 신호 전달 경로는 Jernström et al.에 의해 제안되었습니다.20 트라스투주맙에 민감하지 않은 두 세포주가 Akt1/2 키나아제 억제제에 반응했다는 것입니다. HER2 증폭이나 발현에 초점을 맞추는 대신 이 연구는 치료 결정을 내릴 때 Akt 신호 전달 경로를 표적으로 삼고 분자적 측면을 고려할 것을 권장합니다. 미국에서 새로 발생하는 여성 악성 종양의 30%는 유방암으로 여성에게 가장 흔한 악성 질환입니다. Witt와 Tollefsbol의 목표21 연구자들이 이종이식 실험, 암 예방, 후성유전학적 발견 등의 분야에 사용할 유방암 세포주를 선택하는 데 도움이 되는 기본 도구를 개발하는 것이었습니다. 또한 특정 유방암 세포주의 출처와 세포 유래 이종이식(CDX)과 달리 환자 유래 이종이식(PDX) 사용의 이점에 대한 논쟁도 다룹니다. 신약 발견 가설을 제공하기 위한 약물 예측 기술의 사용은 Gruener et al.에서 조사되었습니다.22, 삼중 음성 유방암(TNBC)에 중점을 둡니다. 세포주 전사체 데이터를 기반으로 약물 반응의 기계 학습 모델을 구축한 다음 환자 종양 데이터에 적용했습니다. 연구 결과는 Wee1 억제제 AZD-1775가 TNBC에서 우선적인 작용을 갖고 TP53 돌연변이가 그 효과와 밀접하게 연관되어 있음을 보여주었습니다. 유방암 연구에서 알려지지 않은 약물-표적 상호작용을 예측하기 위해 Song et al은23 단백질 서열, DCCA(Deep Canonical Correlation Analysis) 계수 및 분자 지문 설명자를 사용하는 PsePDC-DTI(Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction)라는 특징 기반 접근 방식을 제시합니다. 이 기술은 랜덤 포레스트 분류기를 사용하여 4개의 표준 데이터 세트에서 DTI를 예측하고 SMOTE를 사용하여 불균형 데이터를 처리합니다. 또한 이 모델은 유방암 치료를 위한 새로운 표적을 조사하기 위해 게놈 전체 유전자 연구의 위험 유전자를 사용합니다. 이 모델의 우월성과 타당성은 치료에 제공하는 10가지 가능한 DTI에 의해 입증됩니다. 유방암 사례의 10-20%는 삼중 음성 유방암(TNBC)입니다. HER2+ 및 호르몬 수용체+ 치료의 발전에도 불구하고 현재 TNBC에 대한 표적 치료법은 없습니다24. EGFR은 대부분의 환자에 의해 발현되지만 초기 연구에서는 식별 가능한 활성을 발견하지 못했습니다. TNBC에 대한 미래의 실험적 치료법은 최근 연구 결과와 임상적 발전에 의해 제안됩니다25.
신약 발견에 기계 학습의 통합이 증가하고 있음에도 불구하고 현재 모델은 해석 가능성과 재현성이 부족하여 번역 적용이 제한되는 경우가 많습니다. 이전 연구에서는 분류 정확도와 유전자 마이닝을 탐구했지만 하이브리드 해석 가능한 모델을 사용하여 지속적인 약물 민감도(예: LN_IC50)를 체계적으로 예측한 연구는 거의 없습니다. 더욱이, 차원 축소 기술과 강력한 회귀 변수의 조합은 유방암 치료의 맥락에서 아직 충분히 탐구되지 않았습니다. 이 연구는 실제 임상 적용 가능성을 위한 설명 가능성 및 시너지 매핑 도구와 결합된 약물 반응의 충실도가 높은 예측을 위한 이중 파이프라인 전략인 XGBoost 및 Autoencoder-XGBoost를 도입하고 평가함으로써 이러한 격차를 해소합니다.
Access restricted. Please log in or start a trial to view this content.
1. 데이터 세트 획득
2. 데이터 전처리
3. 모델링 프레임워크

해당 예측 값이며, n은 총 관측치 수입니다. 오토인코더의 경우 재구성 손실은 다음과 같이 주어집니다.

약물 1에 대한 예측 LN_IC50입니다.Access restricted. Please log in or start a trial to view this content.
본 연구는 첨단 머신러닝 모델을 활용해 유방암에 대한 약물 선택을 최적화하고 조합 효능을 예측하는 데 중점을 두었습니다. 데이터 세트에는 선별되고 필터링된 유방암 세포주 패널, 약물 민감도 지표(LN_IC50, AUC, Z-Score) 및 CNA, 메틸화, 유전자 발현, 조직 설명자 및 약물 표적과 같은 분자 설명자가 포함되었습니다. 1차 목표는 세포주 전반에 걸쳐 개별 약물의 LN_IC50(절반 최대 억제 농도의 자연 로그)를 예측하고, 시너지 조합을 식별하고, SHAP 설명 가능성을 사용하여 해석 가능성을 제공하는 것이었습니다. 모델은 독립 실행형 기계 학습(XGBoost)과 하이브리드 Autoencoder-XGBoost 파이프라인을 모두 사용하여 개발되었습니다. 전체 워크플로는 그림 1에 나와 있습니다
모델 성능 평가
XGBoost 모델은 예측 정확도와 일반화 면에서 하이브리드 Auto...
Access restricted. Please log in or start a trial to view this content.
이 연구는 약물 선택에 적응하고, 시너지 조합을 예측하고, 약물 용도 변경 가능성을 식별하기 위한 통합 기계 학습 파이프라인을 제시합니다. GDSC 데이터베이스 및 시너지 저장소(예: SynergyDB, DrugComb)의 데이터를 통합하여 분자 특성(예: 유전자 발현, 복제 수 변경) 및 약리학적 반응을 포괄하는 약물-세포주 상호작용의 포괄적인 패널을 선별했습니다31. 여기서 주요 목적은 세포주의 약물 민감도를 정확하게 예측하고, 가장 효과적인 약물의 순위를 매기고, ZIP, Bliss, Lowe 및 HSA와 같은 설치된 모델을 사용하여 유망한 조합의 조정 능력을 평가하는 것이었습니다.
XGBOOST 모델은 MSE가 1.3789이고 R2 가 0.8145로 최고의 일반 성능을 달성했으며 하이브리드 Authen Koder-XGBOOST 파이프라인(MSE = 4...
Access restricted. Please log in or start a trial to view this content.
저자는 이 작업과 관련된 이해 상충이 없음을 선언합니다. 원고 준비 초기 단계에서 대규모 언어 모델(LLM) 기술(ChatGPT, OpenAI에서 개발)이 제한된 용량으로 사용되었음을 확인했습니다. 특히 ChatGPT는 아이디어 생성과 개념적 프레임워크의 예비 브레인스토밍에 사용되었으며, 이후 저자는 이를 개선, 검증 및 완전히 다시 작성했습니다. 모든 핵심 과학 내용, 데이터 분석, 해석 및 최종 초안 작성은 저자가 독점적으로 수행했습니다. ChatGPT의 결과물은 저널의 투명성과 윤리적 지침에 따라 포함되기 전에 정확성, 일관성 및 무결성에 대해 비판적으로 검토되었습니다. 모든 저자는 원고의 최종 버전을 검토하고 승인했으며 이 출판물의 내용에 영향을 미치는 것으로 해석될 수 있는 재정적, 개인적 또는 직업적 관계가 없음을 확인했습니다.
저자는 이 연구를 수행하는 데 필요한 계산 자원과 학업 환경을 촉진한 크라이스트 대학교 컴퓨터 과학과가 제공한 제도적 지원에 진심으로 감사드립니다. 우리는 또한 이 작업 과정 전반에 걸쳐 동료와 멘토가 제공한 협력적인 지도와 격려에 감사드립니다.
저자 기여:
Dyuti Banerjee는 연구를 구상하고 방법론을 설계하며 데이터 세트를 선별했습니다. Sivaneasan Bala Krishnan과 Kamal Upreti는 기계 학습 모델을 구현하고 계산 분석을 수행했습니다. Sumegh Shrikant Tharewal과 Uma Shankar는 데이터 전처리, 기능 엔지니어링 및 결과 검증에 기여했습니다. Pravin Kshirsagar는 시너지 분석과 PCA 기반 클러스터링을 수행했습니다. Manoj Kumar는 문헌 검토, 연구 결과 해석 및 원고 초안 작성을 지원했습니다. 모든 저자는 원고 수정에 기여하고 최종 버전을 승인했으며 작업의 모든 측면에 대해 책임을 지는 데 동의했습니다.
Access restricted. Please log in or start a trial to view this content.
| Name | Company | Catalog Number | Comments |
|---|---|---|---|
| 오토인코더(딥러닝 모델) | TensorFlow(구글) | https://www.tensorflow.org | 약물 반응 모델링을 위한 차원 축소 및 특징 인코딩 |
| 보르테조밉 | 셀렉 케미칼 | 에스1013 | 시너지 분석에 사용되는 약물 |
| 닥티노마이신 | 시그마-알드리치 | 디1037 | 시너지 분석에 사용되는 약물 |
| 도세탁셀 | 시그마-알드리치 | 디1080 | 메커니즘 기반 클러스터링 검증에 사용되는 약물 |
| Matplotlib 라이브러리 | Python 패키지 인덱스(PyPI) | https://matplotlib.org | Python의 데이터 시각화 및 플로팅 |
| NumPy 라이브러리 | Python 패키지 인덱스(PyPI) | https://numpy.org | 수치 컴퓨팅 및 행렬 연산 |
| 파클리탁셀 | 시그마-알드리치 | T7191 | 메커니즘 기반 클러스터링 검증에 사용되는 약물 |
| 팬더 도서관 | Python 패키지 인덱스(PyPI) | https://pandas.pydata.org | 데이터 조작 및 처리 |
| 파이썬 3.10 | 파이썬 소프트웨어 재단 | https://www.python.org | 기본 프로그래밍 언어 |
| 로미뎁신 | 셀렉 케미칼 | S3020 | 시너지 분석에 사용되는 약물 |
| Scikit-learn 라이브러리 | Python 패키지 인덱스(PyPI) | https://scikit-learn.org | 기계 학습 모델링 및 전처리 도구 |
| 씨본 도서관 | Python 패키지 인덱스(PyPI) | https://seaborn.pydata.org | 데이터 시각화 및 통계 플로팅 |
| SHAP 라이브러리 | Python 패키지 인덱스(PyPI) | https://shap.readthedocs.io | 설명 가능한 AI 모델 해석 가능성 |
| 시너지 데이터(DrugComb) | FIMM, 핀란드 | https://drugcomb.fimm.fi | 약물 시너지 참조 데이터 세트 |
| 시너지 데이터(SynergyDB) | 흐로닝언 대학교 | https://synergy.bioinformatics.nl | 약물 시너지 참조 데이터 세트 |
| 텐서플로우 2.11 | 구글 | https://www.tensorflow.org | Autoencoder 딥 러닝 모델 구현 |
| 빈블라스틴 | 시그마-알드리치 | V1377 시리즈 | 시너지 분석에 사용되는 약물 |
| XGBoost 라이브러리 | Python 패키지 인덱스(PyPI) | https://xgboost.readthedocs.io | 기울기 부스팅 회귀 모델링 |
Access restricted. Please log in or start a trial to view this content.
Request permission to reuse the text or figures of this JoVE article
Request Permission