Method Article

해석 가능한 기계 학습 모델을 사용한 유방암에 대한 데이터 기반 약물 발견 최적화

DOI:

10.3791/68705

September 12th, 2025

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 프로토콜은 유방암의 약물 민감성을 예측하기 위해 XGBoost 및 SHAP를 사용하는 기계 학습 파이프라인을 제시합니다. 워크플로에는 데이터 전처리, 하이브리드 모델링, SHAP 기반 해석, 시너지 스코어링 및 PCA 클러스터링이 포함되어 강력한 약물을 식별하고 치료 반응에 영향을 미치는 주요 생물학적 요인을 이해합니다.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

유방암은 전 세계적으로 가장 널리 퍼진 악성 종양 중 하나로 남아 있으며 종양 이질성과 약물 내성으로 인해 심각한 치료 문제를 야기하고 있습니다. 이 연구는 유방암 세포주에서 약물 민감도를 예측하기 위한 재현 가능한 데이터 기반 기계 학습 프로토콜을 제시하며, 강력한 단일 제제와 시너지 약물 조합을 식별한다는 이중 목표를 가지고 있습니다. GDSC(Genomics of Drug Sensitivity in Cancer)에서 선별된 데이터 세트를 사용하여 독립형 XGBoost 회귀 분석기와 하이브리드 Autoencoder-XGBoost 파이프라인이라는 두 가지 예측 접근 방식을 구현했습니다. 전처리에는 레이블 인코딩, 원핫 인코딩, Z-점수 표준화, 결측값 대치 및 PCA를 통한 차원 축소가 포함되었습니다. 모델 평가 결과 XGBoost는 하이브리드 모델(MSE = 4.0322, R2 = 0.4577)에 비해 우수한 성능(MSE = 1.3789, R2 = 0.8145)을 달성한 것으로 나타났습니다. 해석 가능성은 확립된 약리학적 메커니즘에 맞춰 TARGET_PATHWAY, DRUG_ID, TARGET 및 CELL_LINE_NAME를 주요 예측 기능으로 식별한 SHAP(SHAP) Additive exPlanations를 사용하여 해결되었습니다. 모델 출력을 DrugComb 및 SynergyDB 데이터와 결합하여 파생된 예측 시너지 점수는 보르테조밉 + 로미뎁신 및 파클리탁셀 + 보르테조밉과 같은 유망한 약물 쌍을 강조했습니다. 이러한 발견은 PCA 기반 약리학적 클러스터링에 의해 추가로 뒷받침되어 유사한 작용 메커니즘을 가진 생물학적으로 관련된 약물 그룹을 밝혔습니다. 제안된 프로토콜은 정밀 종양학 연구를 위한 투명하고 적응 가능한 프레임워크를 제공하여 예측 정확도와 생물학적 해석 가능성을 모두 가능하게 합니다. 엄격한 전처리, 모델 검증, 설명 가능성 및 약물 시너지 분석을 통합함으로써 이 워크플로는 유방암 치료의 중개 약물 발견 및 용도 변경을 위한 확장 가능한 기반을 제공합니다.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

유방암은 여전히 가장 흔하게 진단되는 암이며 전 세계 여성의 암 관련 사망 원인 중 두 번째로 큰 원인입니다1. 미국에서만 모든 새로운 여성 악성 종양의 거의 30%를 차지하며 매년 280,000건 이상의 새로운 사례가 진단됩니다2. 특히 HER2 양성 및 호르몬 수용체 양성 하위 유형의 치료 발전에도 불구하고 치료에 대한 내성 및 재발은 특히 표적 치료법이 부족한 삼중 음성 유방암(TNBC)과 같은 공격적인 하위 유형의 경우 여전히 중요한 과제로 남아 있습니다 3,4. 이는 개별 분자 프로필에 맞는 효과적인 치료제와 조합을 식별하기 위한 정밀 중심의 약물 발견이 시급히 필요하다는 점을 강조합니다. 전통적으로 실험 및 시행착오 방법에 의해 안내되는 약물 발견은 기계 학습(ML) 기술의 통합을 통해 눈에 띄게 가속화되었습니다 5,6. ML은 고차원 생물의학 데이터 전반에 걸쳐 복잡한 비선형 관계를 모델링할 수 있으며 표적 식별, 바이오마커 발견, 약물 민감도 예측 및 병용 요법 설계를 지원할 수 있습니다7,8. 그러나 종양학에서 ML 모델의 실제 배포는 모델 해석 가능성, 재현성, 희소 데이터 세트에 대한 과적합, 암 하위 유형 전반에 걸친 일반화 등 여러 가지 장애물에 직면해 있습니다 9,10,11.

이러한 한계를 극복하기 위해 최근 연구는 특징 추출을 위한 딥 러닝과 강력한 예측을 위한 앙상블 학습을 결합하는 데 중점을 두었습니다. 여러 알고리즘을 평가하는 연구에서 인공 신경망(ANN)과 같은 모델은 최대 93.2%의 정확도 수준을 달성하여 Naïve Bayes 및 Decision Trees12와 같은 기존 분류기를 능가했습니다. 또한 통합 기능 마이닝 기술은 GEO(Gene Expression Omnibus) 및 GSE45827와 같은 데이터베이스를 통해 주요 드라이버 유전자와 분자 표적을 발견하여 최대 1,700개의 차등적으로 발현되는 유전자를 식별했으며 그 중 일부는 알려진 약물 상호작용을 나타냅니다13. 또한, 새로운 약물 용도 변경 연구에서는 칼시트리올과 같은 비종양학 화합물이 특히 HER2+ 세포주에서 네라티닙과 같은 표준 치료법보다 유방암 세포 생존력을 더 효과적으로 감소시킬 수 있는 잠재력이 밝혀졌습니다14. Akt-신호 전달 경로에 대한 조사는 또한 트라스투주맙 내성을 극복하는 데 가능성을 보여주었으며, 이는 수용체 집중 요법의 대안으로 분자 경로 표적화를 시사합니다15,16. 그러나 이러한 발전에도 불구하고 지속적인 약물 반응 값을 예측하고, 효과적인 약물 조합의 순위를 매기고, 약리학적 유사성을 시각화할 수 있는 체계적이고 설명 가능한 프레임워크는 현재 문헌에서 아직 탐구되지 않은 상태로 남아 있습니다. 많은 모델은 분류 기반이거나 번역 명확성이 부족하며, 특히 실제 약물유전체학 데이터 세트에 적용할 때 더욱 그렇습니다.

고품질 데이터를 위한 도구를 제공하는 기계 학습(ML)을 통해 신약 발견 및 의사 결정을 개선할 수 있습니다. 표적 검증, 바이오마커 식별, 임상 시험 분석을 포함한 신약 발견의 모든 단계에서 기계 학습을 사용하면 이점을 얻을 수 있습니다. ML 생성 결과의 해석 가능성과 재현성도 장애물입니다17. 실패율을 줄이고 프로세스를 가속화하는 것은 이러한 문제를 해결하고 검증 변수에 대한 지식을 높임으로써 달성할 수 있습니다. 연구원들은 기계 학습 알고리즘을 사용하여 암의 다양한 단계에서 생검 샘플을 평가했습니다. 조사 결과에 따르면 테스트 정확도는 ANN 93.2%, Naïve Bayes(NB) 90.4%, Decision Tree(DT) 87.8%, RF 85.9%로 높았습니다. 총 350개의 예측 유전자와 164개의 차등적으로 발현된 유전자가 Rakhshaninejad 등의 GEO 데이터베이스를 결합하여 발견되었습니다.18. 결합된 데이터 세트에서 BGWO_SA_Ens(Simulated Annealing Ensemble)을 사용한 Binary Grey Wolf Optimization 알고리즘은 1404개의 유전자를 발견한 반면, GSE45827 데이터 세트에서는 1710개의 유전자를 발견했습니다. 약 35개의 우수한 유전자와 중요한 경로에서의 역할 및 우수한 유전자와 항암제 간의 관계가 발견되었습니다. 표피 성장 인자 수용체(EGFR(EGFR) 과발현 신호 전달 경로 및 관련 계열 구성원에서 표적 유전자를 찾기 위해 Nagaraj 등에 의해 분자 네트워킹 조사가 수행되었습니다.19 암과 관련 없는 질환을 치료하도록 승인된 칼시트리올이라는 약물은 네 가지 수용체 각각과 강한 결합 친화력을 가졌습니다. 에 따르면 in vitro 세포독성 연구에서 칼시트리올은 용량 의존적 방식으로 SK-BR-3 세포 생존력을 감소시켰으며, 이는 네라티닙에 비해 우수한 세포독성과 유방암 세포의 증식 감소를 나타냅니다. 활성 및 약물 투여 가능한 Akt 신호 전달 경로는 Jernström et al.에 의해 제안되었습니다.20 트라스투주맙에 민감하지 않은 두 세포주가 Akt1/2 키나아제 억제제에 반응했다는 것입니다. HER2 증폭이나 발현에 초점을 맞추는 대신 이 연구는 치료 결정을 내릴 때 Akt 신호 전달 경로를 표적으로 삼고 분자적 측면을 고려할 것을 권장합니다. 미국에서 새로 발생하는 여성 악성 종양의 30%는 유방암으로 여성에게 가장 흔한 악성 질환입니다. Witt와 Tollefsbol의 목표21 연구자들이 이종이식 실험, 암 예방, 후성유전학적 발견 등의 분야에 사용할 유방암 세포주를 선택하는 데 도움이 되는 기본 도구를 개발하는 것이었습니다. 또한 특정 유방암 세포주의 출처와 세포 유래 이종이식(CDX)과 달리 환자 유래 이종이식(PDX) 사용의 이점에 대한 논쟁도 다룹니다. 신약 발견 가설을 제공하기 위한 약물 예측 기술의 사용은 Gruener et al.에서 조사되었습니다.22, 삼중 음성 유방암(TNBC)에 중점을 둡니다. 세포주 전사체 데이터를 기반으로 약물 반응의 기계 학습 모델을 구축한 다음 환자 종양 데이터에 적용했습니다. 연구 결과는 Wee1 억제제 AZD-1775가 TNBC에서 우선적인 작용을 갖고 TP53 돌연변이가 그 효과와 밀접하게 연관되어 있음을 보여주었습니다. 유방암 연구에서 알려지지 않은 약물-표적 상호작용을 예측하기 위해 Song et al은23 단백질 서열, DCCA(Deep Canonical Correlation Analysis) 계수 및 분자 지문 설명자를 사용하는 PsePDC-DTI(Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction)라는 특징 기반 접근 방식을 제시합니다. 이 기술은 랜덤 포레스트 분류기를 사용하여 4개의 표준 데이터 세트에서 DTI를 예측하고 SMOTE를 사용하여 불균형 데이터를 처리합니다. 또한 이 모델은 유방암 치료를 위한 새로운 표적을 조사하기 위해 게놈 전체 유전자 연구의 위험 유전자를 사용합니다. 이 모델의 우월성과 타당성은 치료에 제공하는 10가지 가능한 DTI에 의해 입증됩니다. 유방암 사례의 10-20%는 삼중 음성 유방암(TNBC)입니다. HER2+ 및 호르몬 수용체+ 치료의 발전에도 불구하고 현재 TNBC에 대한 표적 치료법은 없습니다24. EGFR은 대부분의 환자에 의해 발현되지만 초기 연구에서는 식별 가능한 활성을 발견하지 못했습니다. TNBC에 대한 미래의 실험적 치료법은 최근 연구 결과와 임상적 발전에 의해 제안됩니다25.

신약 발견에 기계 학습의 통합이 증가하고 있음에도 불구하고 현재 모델은 해석 가능성과 재현성이 부족하여 번역 적용이 제한되는 경우가 많습니다. 이전 연구에서는 분류 정확도와 유전자 마이닝을 탐구했지만 하이브리드 해석 가능한 모델을 사용하여 지속적인 약물 민감도(예: LN_IC50)를 체계적으로 예측한 연구는 거의 없습니다. 더욱이, 차원 축소 기술과 강력한 회귀 변수의 조합은 유방암 치료의 맥락에서 아직 충분히 탐구되지 않았습니다. 이 연구는 실제 임상 적용 가능성을 위한 설명 가능성 및 시너지 매핑 도구와 결합된 약물 반응의 충실도가 높은 예측을 위한 이중 파이프라인 전략인 XGBoost 및 Autoencoder-XGBoost를 도입하고 평가함으로써 이러한 격차를 해소합니다.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. 데이터 세트 획득

  1. GDSC(https://www.cancerrxgene.org/downloads/drug_data)에서 약물 민감도 데이터를 다운로드합니다. 사용된 데이터 세트의 요약은 표 1에 나와 있습니다. 사용되는 파일은 gdsc_drug_data.csv(약물 반응), gdsc_expression_data.csv(유전자 발현) 및 gdsc_cell_metadata.csv(세포주 정보)입니다.
    이 워크플로에 사용되는 데이터 세트 구조의 예는 그림 1 을 참조하십시오.
  2. Python(Pandas 라이브러리)을 사용하여 유방암 세포주만 포함하도록 데이터 세트를 필터링합니다.
    1. TCGA_DESC 열이 "Breast"와 같은 레코드를 선택합니다.
    2. 해당 CELL_LINE_NAME 값을 추출합니다.
    3. 구현은 보충 코드 1(보충 파일 1)을 참조하십시오.
      참고: 데이터 세트를 유방암 세포주로 제한하면 도메인별 모델 훈련이 보장되고 생물학적 타당성이 향상됩니다. 이 연구에 사용된 데이터 세트는 GDSC(Genomics of Drug Sensitivity in Cancer) 데이터베이스에서 가져온 것이며 주요 특징은 표 2에 나와 있습니다.

2. 데이터 전처리

  1. 전처리 파이프라인:
    1. LabelEncoder를 사용하여 DRUG_ID, CELL_LINE_NAME 및 TARGET_PATHWAY와 같은 범주형 변수를 인코딩하여 XGBoost 입력에 적합한 정수 기반 형식으로 변환합니다.
    2. Z-점수 표준화(StandardScaler)를 사용하여 유전자 발현 데이터, 복제 수 변경(CNA) 및 메틸화 특징을 포함한 수치 특징을 정규화하여 평균 및 단위 분산이 0이 되도록 합니다.
    3. 30% 이상 누락된 특징이 있는 샘플을 제거합니다.
    4. SimpleImputer(strategy='median')를 사용하여 각 기능 열의 중앙값을 사용하여 나머지 결측값을 대치합니다.
    5. scikit-learn의 OneHotEncoder를 사용하여 범주형 변수(DRUG_ID 및 TARGET_PATHWAY)에 원핫 인코딩을 적용합니다.
    6. 주성분 분석(PCA)을 사용하여 유전자 발현 특징에 대한 차원 축소를 수행하여 분산을 유지하면서 특징 공간을 줄입니다.
    7. scikit-learn의 train_test_split을 사용하여 최종 정리된 데이터 세트를 훈련(80%)과 테스트(20%) 세트로 분할하여 약물-세포 쌍의 분포를 유지합니다.
      참고: 각 전처리 단계와 결과 데이터 세트 차원에 대한 자세한 근거는 토론 섹션에서 설명합니다.
  2. 범주형 변수 처리
    1. Pandas를 사용하여 범주형 변수(CELL_LINE_NAME, DRUG_NAME, TARGET_PATHWAY)를 식별합니다.
    2. scikit-learn의 LabelEncoder를 사용하여 이러한 변수에 레이블 인코딩을 적용합니다.
    3. 보충 코드 2(보충 파일 1)에 표시된 대로 프로그래밍 방식으로 이 단계를 구현합니다.
      참고: 기계 학습 알고리즘에는 숫자 입력이 필요합니다. 레이블 인코딩은 클래스 구분을 유지하면서 범주형 변수를 정수 형식으로 변환합니다.
  3. 수치 피처 표준화
    1. 유전자 발현, 복제 수 변경(CNA) 및 메틸화 특징 전반에 걸쳐 수치 변수를 식별합니다.
    2. StandardScaler를 적용하여 기능을 0 평균 및 단위 분산으로 정규화합니다.
      참고: 표준화는 모든 숫자 특징을 평균과 단위 분산이 0으로 조정하여 모델에 동등하게 기여하도록 합니다. 이렇게 하면 규모가 큰 기능이 모델 훈련을 지배하는 것을 방지하고 최적화 알고리즘의 수렴을 개선합니다.
  4. 결측값 처리
    1. 모든 기능에서 누락된 항목을 감지합니다.
    2. 누락된 데이터가 30% 이상 있는 레코드를 제거합니다.
    3. 중앙값 대치 전략을 사용하여 나머지 결측값을 대치합니다.
      참고: 불완전한 데이터는 편향을 유발하고 모델 견고성을 감소시킬 수 있습니다. 많이 누락된 레코드를 제거하면 데이터 신뢰성이 보장되는 반면, 중앙값 대치는 강력한 분포 가정을 도입하지 않고 사용 가능한 정보를 보존할 수 있는 안정적이고 이상치 방지 방법을 제공합니다.
  5. 데이터 세트 분할
    1. 자동화된 방법(예: sikit-learn의 train_test_split)을 사용하여 최종 정리된 데이터 세트를 훈련 및 테스트 하위 집합으로 나눕니다.
    2. 재현성을 보장하기 위해 임의의 시드(예: random_state=42)를 지정합니다.
    3. 데이터의 80%를 훈련 세트에 할당하고 20%를 테스트 세트에 할당합니다.
    4. 전체 코드 구현은 보충 코드 3(보충 파일 1)을 참조하십시오.
      참고: 데이터를 훈련 및 테스트 하위 집합으로 나누면 모델 일반화 가능성을 편견 없이 평가할 수 있습니다.

3. 모델링 프레임워크

  1. 회귀 목표 정의
    1. 예측 작업을 회귀 문제로 구성하여 각 약물-세포주 쌍에 대한 절반 최대 억제 농도(LN_IC50)의 자연 로그를 추정합니다.
    2. 분산을 안정화하고 모델을 개선하기 위해 대상 변수로 LN_IC50를 선택합니다.
      참고: IC50을 LN_IC50로 변환하면 왜도가 줄어들고 모델 성능이 향상됩니다.
  2. XGBoost 회귀 학습(모델 1)
    1. XGBoost는 구조화된 약물유전체학 데이터 세트에 대한 강력한 성능과 과적합을 방지하기 위해 정규화를 통해 비선형 특징 상호 작용을 모델링할 수 있는 능력 때문에 기본 모델로 선택합니다.
    2. xgboost 라이브러리의 XGBRegressor 클래스를 사용하여 프로그래밍 방식으로 모델을 초기화합니다. 교차 검증을 통해 식별된 조정된 하이퍼파라미터(학습률, 최대 깊이, 추정기 수 및 임의 시드)를 지정합니다.
    3. fit() 메서드를 사용하여 학습 하위 집합(X_train, y_train)에서 모델을 학습합니다.
    4. predict() 메서드를 사용하여 테스트 하위 집합(X_test)에 대한 예측을 생성합니다.
    5. scikit-learn의 mean_squared_error 및 r2_score 함수와 함께 MSE(Mean Squared Error) 및 R² 점수를 사용하여 성능을 평가합니다.
      참고: 전체 구현은 보충 코드 4(보충 파일 1)를 참조하십시오.
  3. 대체 모델 고려
    1. SVR(Support Vector Regression)의 견고성을 소표본, 고차원 데이터 설정에서 평가합니다.
    2. 심층 잠재 특징 추출 및 비선형 모델링을 통해 잠재적인 성능 향상을 위해 Autoencoder-XGBoost 하이브리드를 평가합니다.
    3. 동일한 평가 지표와 교차 검증을 사용하여 모델 간의 성능을 비교합니다.
      참고: SVR은 XGBoost에 비해 예측 정확도가 낮기 때문에 최종 결과에서 제외되었으며 Autoencoder-XGBoost 하이브리드는 딥 러닝 및 기계 학습 접근 방식의 비교를 위해 유지되었습니다.
  4. 모델 1: XGBoost 회귀
    1. 구조화된 생물 의학 데이터에 대한 강력한 성능, 비선형 기능 상호 작용을 모델링하는 기능 및 과적합을 줄이는 기본 제공 정규화 때문에 XGBoost를 기본 모델로 선택합니다.
    2. 하이퍼파라미터 learning_rate = 0.05, max_depth = 6 및 n_estimators = 100으로 XGBoost 모델을 구성합니다.
    3. 그리드 검색을 사용하여 하이퍼파라미터를 최적화하고 5배 교차 검증을 통해 성능을 검증합니다.
    4. 준비된 학습 데이터 세트(X_train, y_train)에서 모델을 학습합니다.
    5. scikitlearn의 mean_squared_error 및 r2_score 함수로 계산된 MSE(Mean Squared Error) 및 R² 점수를 사용하여 예측 성능을 평가합니다.
      참고: 이전 연구26 에서는 XGBoost가 낮은 계산 비용으로 표 형식의 생물 의학 데이터 세트에서 딥 러닝 모델을 지속적으로 능가하는 것으로 나타났습니다.
  5. 하이브리드 자동 인코더 + XGBoost 모델 빌드(모델 2)
    1. 비지도 차원 축소를 위한 자동 인코더 설계
      참고: 인코더는 입력 기능을 저차원 잠재 표현으로 압축합니다. 디코더는 재구성 오류를 최소화하기 위해 입력을 재구성합니다.
    2. 전체 기능 행렬에서 Autoencoder를 훈련하여 잠재 기능을 추출합니다.
    3. 보충 코드 5A(보충 파일 1)와 같이 인코더의 출력(잠재 기능)을 XGBoost 회귀 변수에 대한 입력으로 전달합니다.
    4. 보충 코드 5B(보충 파일 1)와 같이 LN_IC50를 대상 변수로 사용하여 인코딩된 기능 집합에서 XGBoost 회귀자를 학습합니다.
    5. 직접 비교를 위해 모델 1과 동일한 메트릭을 사용하여 모델 성능을 평가합니다.
      참고: 이 하이브리드 접근 방식은 딥 러닝 기반 표현 학습과 XGBoost의 강력한 회귀 기능을 활용하여 고차원 생물학적 데이터에 이점을 제공합니다.
  6. 모델 평가
    1. 테스트 데이터 세트(X_test)에서 predict() 메서드를 사용하여 목표 값을 예측하여 학습된 회귀 모델을 평가합니다.
    2. scikit-learn의 mean_squared_error(y_test, y_pred)를 사용하여 예측된 LN_IC50값과 실제 값 간의 평균 제곱 차이를 측정하기 위해 평균 제곱 오차(MSE)를 계산합니다.
      참고: 이러한 모델은 해석 가능성과 정밀도를 결합하여 유방암 연구에서 약물 민감도를 예측하기 위한 강력한 프레임워크를 형성합니다27,28.
      figure-protocol-1
      여기서 yi는 i번째 약물-세포 쌍에 대한 실제 LN_IC50을 나타내고, figure-protocol-2 해당 예측 값이며, n은 총 관측치 수입니다. 오토인코더의 경우 재구성 손실은 다음과 같이 주어집니다.
      figure-protocol-3
      여기서 X는 입력 특징 행렬이고, E(·)는 X를 잠재 표현에 매핑하는 인코더 함수이며, D(·)는 잠재 공간에서 X를 재구성하는 디코더 함수입니다.
    3. R2 점수를 계산하여 scikit-learn의 r2_score(y_test, y_pred)를 사용하여 모델에서 설명하는 대상 변수의 분산 비율을 결정합니다.
    4. 보고를 위해 계산된 MSE 및 R2 값을 기록합니다. 계산된 MSE 및 R² 값은 표 3 에 요약되어 다양한 모델의 성능을 명확하게 제시하고 직접 비교합니다.
    5. 평가 지표를 해석합니다: MSE가 낮을수록 예측 정확도가 높고, R2 점수가 1에 가까울수록 설명력이 더 강하고 모델의 일반화 기능이 더 우수함을 나타냅니다.
  7. SHAP 설명 가능성
    1. SHAP 라이브러리를 설치하고 가져옵니다(import shap). 재현성을 위해 버전이 0.41.0인지 확인합니다.
    2. 보충 코드 6(보충 파일 1)에 따라 학습된 XGBoost 모델을 사용하여 SHAP 설명자를 초기화합니다.
    3. 테스트 데이터 세트에 대한 SHAP 값을 계산하여 기능 기여도 점수를 얻습니다.
    4. 전역 기능 중요도 요약 그림을 생성하여 예측에 가장 많이 기여하는 기능을 시각화합니다.
    5. SHAP 폭포 플롯을 사용하여 선택한 샘플에 대한 개별 예측 설명을 생성합니다.
    6. 플롯을 해석하여 예측에 영향을 미치는 주요 기능을 식별합니다. 표 4에서 볼 수 있듯이 중요한 특징에는 TARGET_PATHWAY, DRUG_ID, CELL_LINE_NAME, TARGET 단백질 및 스크리닝 배지가 포함되며, 이는 약물 특이적 및 세포 특이적 특성이 약물 반응 예측에 상당한 영향을 미친다는 것을 나타냅니다.
      참고: SHAP 값은 shap. TreeExplainer() XGBoost 모델의 경우 전체 특징 중요도는 shap.summary_plot()를 사용하여 시각화되었고, shap.dependence_plot() 및 shap.waterfall_plot()로 샘플별 설명이 생성되었습니다(SHAP v0.41.0). 표 4에서 볼 수 있듯이 가장 영향력 있는 특징에는 TARGET_PATHWAY, DRUG_ID 및 CELL_LINE_NAME가 포함되어 있으며, 이는 약물 특이적 특성과 세포 특이적 특성이 모두 약물 반응을 결정하는 데 중요함을 나타냅니다. 추가적인 주요 기여자는 TARGET 단백질과 Screen Medium으로, 암 약물유전체학의 도메인 관련 요인과 모델의 일치를 더욱 강조했습니다.
  8. 약물 시너지 및 클러스터링
    1. 시너지 데이터 다운로드
      1. 공개적으로 사용 가능한 저장소에서 약물 조합 시너지 데이터를 다운로드하십시오.
        드럭콤:https://drugcomb.fimm.fi
        SynergyDB: https://synergy.bioinformatics.nl
    2. 시너지 데이터를 예측된 응답과 병합합니다.
      1. 약물-세포주 조합을 고유 키로 사용하여 다운로드한 시너지 점수(ZIP, Bliss, Loewe, HSA)를 예측된 약물 반응 값(LN_IC50)과 병합합니다.
      2. 병합하기 전에 데이터 세트 간에 약물 식별자와 세포주 이름이 정렬되었는지 확인하십시오.
    3. 모델 기반 시너지 점수를 계산합니다.
      1. 각 약물 쌍에 대해 개별 모델로 예측된 LN_IC50 값의 평균을 사용하여 결합된 예측 효능을 계산합니다.
        figure-protocol-4
        여기서 Scomb 은 약물 쌍에 대한 결합된 예측 LN_IC50 점수를 나타내고 figure-protocol-5 약물 1에 대한 예측 LN_IC50입니다.
      2. 시너지 점수를 기준으로 약물 조합의 순위를 매깁니다.
      3. 가장 낮은 시너지 점수를 나타내는 상위 조합(예: 보르테조밉 + 로미뎁신, 빈블라스틴 + 닥티노마이신)을 식별하여 더 높은 예측 효과를 나타냅니다.
        참고: 시너지 점수가 낮을수록 예측된 치료 잠재력이 더 크다는 것을 반영하므로 이러한 약물 쌍은 추가 실험 검증을 위한 후보가 됩니다. 보충 코드 7A 및 보충 코드 7B(보충 파일 1)에 제공된 단계를 따르십시오.
  9. 시너지 순위 및 PCA 기반 클러스터링
    1. 시너지 점수로 약물 쌍의 순위를 매깁니다.
      1. 약물-세포주 조합을 고유 키로 사용하여 시너지 점수(ZIP, Bliss, Loewe, HSA)를 예측된 LN_IC50 값과 병합합니다.
      2. 평균 예측 LN_IC50 값을 사용하여 각 약물 쌍에 대한 시너지 점수를 계산합니다.
      3. 계산된 시너지 점수를 기반으로 약물 쌍의 순위를 매깁니다.
      4. 점수가 가장 낮은(가장 부정적인) 약물 쌍을 잠재적인 시너지 조합(예: 보르테조밉 + 로미뎁신, 빈블라스틴 + 닥티노마이신)으로 식별합니다.
    2. 약물 반응 매트릭스에서 PCA를 수행합니다.
      1. 보충 코드 8(보충 파일 1)에 표시된 단계에 따라 약물을 행으로, 세포주를 열로 하여 예측된 LN_IC50 값을 사용하여 약물 반응 매트릭스를 구성합니다.
      2. zscore 정규화를 사용하여 행렬을 표준화합니다.
      3. 두 개의 주성분(n_components = 2)을 사용하여 주성분 분석(PCA)을 수행하여 차원을 줄이고 주요 분산을 포착합니다.
    3. PCA 클러스터 시각화
      1. Matplotlib 또는 Seaborn을 사용하여 2차원 PCA 투영을 플로팅합니다.
      2. 유사한 작용 메커니즘(예: 도세탁셀 및 파클리탁셀)을 가진 약물이 함께 클러스터링되어 생물학적으로 의미 있는 관계를 포착하는 모델의 능력을 검증합니다.
    4. 모델 안정성 및 기능 균형
      1. 희소성 문제를 방지하기 위해 인코딩 중에 드물게 범주형 변수를 필터링합니다.
      2. 자동 인코더 학습률을 조정하고 드롭아웃 레이어를 포함하여 수렴 문제를 방지합니다.
      3. SHAP 분석을 상위 100개 기능으로 제한하여 메모리 오버헤드를 줄이고 계산 효율성을 보장합니다.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 연구는 첨단 머신러닝 모델을 활용해 유방암에 대한 약물 선택을 최적화하고 조합 효능을 예측하는 데 중점을 두었습니다. 데이터 세트에는 선별되고 필터링된 유방암 세포주 패널, 약물 민감도 지표(LN_IC50, AUC, Z-Score) 및 CNA, 메틸화, 유전자 발현, 조직 설명자 및 약물 표적과 같은 분자 설명자가 포함되었습니다. 1차 목표는 세포주 전반에 걸쳐 개별 약물의 LN_IC50(절반 최대 억제 농도의 자연 로그)를 예측하고, 시너지 조합을 식별하고, SHAP 설명 가능성을 사용하여 해석 가능성을 제공하는 것이었습니다. 모델은 독립 실행형 기계 학습(XGBoost)과 하이브리드 Autoencoder-XGBoost 파이프라인을 모두 사용하여 개발되었습니다. 전체 워크플로는 그림 1에 나와 있습니다

모델 성능 평가
XGBoost 모델은 예측 정확도와 일반화 면에서 하이브리드 Auto...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이 연구는 약물 선택에 적응하고, 시너지 조합을 예측하고, 약물 용도 변경 가능성을 식별하기 위한 통합 기계 학습 파이프라인을 제시합니다. GDSC 데이터베이스 및 시너지 저장소(예: SynergyDB, DrugComb)의 데이터를 통합하여 분자 특성(예: 유전자 발현, 복제 수 변경) 및 약리학적 반응을 포괄하는 약물-세포주 상호작용의 포괄적인 패널을 선별했습니다31. 여기서 주요 목적은 세포주의 약물 민감도를 정확하게 예측하고, 가장 효과적인 약물의 순위를 매기고, ZIP, Bliss, Lowe 및 HSA와 같은 설치된 모델을 사용하여 유망한 조합의 조정 능력을 평가하는 것이었습니다.

XGBOOST 모델은 MSE가 1.3789이고 R2 가 0.8145로 최고의 일반 성능을 달성했으며 하이브리드 Authen Koder-XGBOOST 파이프라인(MSE = 4...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 이 작업과 관련된 이해 상충이 없음을 선언합니다. 원고 준비 초기 단계에서 대규모 언어 모델(LLM) 기술(ChatGPT, OpenAI에서 개발)이 제한된 용량으로 사용되었음을 확인했습니다. 특히 ChatGPT는 아이디어 생성과 개념적 프레임워크의 예비 브레인스토밍에 사용되었으며, 이후 저자는 이를 개선, 검증 및 완전히 다시 작성했습니다. 모든 핵심 과학 내용, 데이터 분석, 해석 및 최종 초안 작성은 저자가 독점적으로 수행했습니다. ChatGPT의 결과물은 저널의 투명성과 윤리적 지침에 따라 포함되기 전에 정확성, 일관성 및 무결성에 대해 비판적으로 검토되었습니다. 모든 저자는 원고의 최종 버전을 검토하고 승인했으며 이 출판물의 내용에 영향을 미치는 것으로 해석될 수 있는 재정적, 개인적 또는 직업적 관계가 없음을 확인했습니다.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자는 이 연구를 수행하는 데 필요한 계산 자원과 학업 환경을 촉진한 크라이스트 대학교 컴퓨터 과학과가 제공한 제도적 지원에 진심으로 감사드립니다. 우리는 또한 이 작업 과정 전반에 걸쳐 동료와 멘토가 제공한 협력적인 지도와 격려에 감사드립니다.

저자 기여:
Dyuti Banerjee는 연구를 구상하고 방법론을 설계하며 데이터 세트를 선별했습니다. Sivaneasan Bala Krishnan과 Kamal Upreti는 기계 학습 모델을 구현하고 계산 분석을 수행했습니다. Sumegh Shrikant Tharewal과 Uma Shankar는 데이터 전처리, 기능 엔지니어링 및 결과 검증에 기여했습니다. Pravin Kshirsagar는 시너지 분석과 PCA 기반 클러스터링을 수행했습니다. Manoj Kumar는 문헌 검토, 연구 결과 해석 및 원고 초안 작성을 지원했습니다. 모든 저자는 원고 수정에 기여하고 최종 버전을 승인했으며 작업의 모든 측면에 대해 책임을 지는 데 동의했습니다.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
오토인코더(딥러닝 모델)TensorFlow(구글)https://www.tensorflow.org약물 반응 모델링을 위한 차원 축소 및 특징 인코딩
보르테조밉셀렉 케미칼에스1013시너지 분석에 사용되는 약물
닥티노마이신시그마-알드리치디1037시너지 분석에 사용되는 약물
도세탁셀시그마-알드리치디1080메커니즘 기반 클러스터링 검증에 사용되는 약물
Matplotlib 라이브러리Python 패키지 인덱스(PyPI)https://matplotlib.orgPython의 데이터 시각화 및 플로팅
NumPy 라이브러리Python 패키지 인덱스(PyPI)https://numpy.org수치 컴퓨팅 및 행렬 연산
파클리탁셀시그마-알드리치T7191메커니즘 기반 클러스터링 검증에 사용되는 약물
팬더 도서관Python 패키지 인덱스(PyPI)https://pandas.pydata.org데이터 조작 및 처리
파이썬 3.10파이썬 소프트웨어 재단https://www.python.org기본 프로그래밍 언어
로미뎁신셀렉 케미칼S3020시너지 분석에 사용되는 약물
Scikit-learn 라이브러리Python 패키지 인덱스(PyPI)https://scikit-learn.org기계 학습 모델링 및 전처리 도구
씨본 도서관Python 패키지 인덱스(PyPI)https://seaborn.pydata.org데이터 시각화 및 통계 플로팅
SHAP 라이브러리Python 패키지 인덱스(PyPI)https://shap.readthedocs.io설명 가능한 AI 모델 해석 가능성
시너지 데이터(DrugComb)FIMM, 핀란드https://drugcomb.fimm.fi약물 시너지 참조 데이터 세트
시너지 데이터(SynergyDB)흐로닝언 대학교https://synergy.bioinformatics.nl약물 시너지 참조 데이터 세트
텐서플로우 2.11구글https://www.tensorflow.orgAutoencoder 딥 러닝 모델 구현
빈블라스틴시그마-알드리치V1377 시리즈시너지 분석에 사용되는 약물
XGBoost 라이브러리Python 패키지 인덱스(PyPI)https://xgboost.readthedocs.io기울기 부스팅 회귀 모델링

References

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

Access restricted. Please log in or start a trial to view this content.

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

Related Articles