このプロトコルは、XGBoost と SHAP を使用して乳がんの薬物感受性を予測する機械学習パイプラインを提示します。このワークフローには、強力な薬剤を特定し、治療反応に影響を与える主要な生物学的要因を理解するためのデータ前処理、ハイブリッドモデリング、SHAPベースの解釈、相乗効果スコアリング、PCAクラスタリングが含まれます。
方法論記事
このプロトコルは、XGBoost と SHAP を使用して乳がんの薬物感受性を予測する機械学習パイプラインを提示します。このワークフローには、強力な薬剤を特定し、治療反応に影響を与える主要な生物学的要因を理解するためのデータ前処理、ハイブリッドモデリング、SHAPベースの解釈、相乗効果スコアリング、PCAクラスタリングが含まれます。
乳がんは依然として世界中で最も蔓延している悪性腫瘍の 1 つであり、腫瘍の不均一性と薬剤耐性により治療上の重大な課題を引き起こしています。この研究は、強力な単剤と相乗的な薬物の組み合わせを特定するという 2 つの目的を掲げて、乳がん細胞株の薬物感受性を予測するための再現性のあるデータ駆動型機械学習プロトコルを提示します。がんにおける薬物感受性のゲノミクス(GDSC)から厳選されたデータセットを使用して、スタンドアロンのXGBoostリグレッサーとハイブリッドオートエンコーダー-XGBoostパイプラインの2つの予測アプローチが実装されました。前処理には、ラベルエンコーディング、ワンホットエンコーディング、Zスコアの標準化、欠損値代入、PCAによる次元削減が含まれていました。モデル評価により、XGBoostはハイブリッドモデル(MSE = 4.0322、R2 = 0.4577)と比較して優れたパフォーマンス(MSE = 1.3789、R2 = 0.8145)を達成したことが示されました。解釈可能性は、確立された薬理学的メカニズムに沿って、TARGET_PATHWAY、DRUG_ID、TARGET、およびCELL_LINE_NAMEを主要な予測機能として特定したSHapley Additive exPlanations(SHAP)を使用して対処されました。モデル出力とDrugCombおよびSynergyDBデータを組み合わせることから導き出された予測相乗効果スコアは、ボルテゾミブ+ロミデプシンやパクリタキセル+ボルテゾミブなどの有望な薬剤ペアを強調しました。これらの発見は、PCAベースの薬理学的クラスタリングによってさらに裏付けられ、同様の作用機序を持つ薬物の生物学的に関連するグループを明らかにしました。提案されたプロトコルは、精密腫瘍学研究のための透明性と適応性のあるフレームワークを提供し、予測精度と生物学的解釈可能性の両方を可能にします。このワークフローは、厳密な前処理、モデル検証、説明可能性、および薬物相乗効果分析を統合することにより、乳がん治療におけるトランスレーショナル創薬と転用のためのスケーラブルな基盤を提供します。
乳がんは依然として最も一般的に診断されるがんであり、世界の女性のがん関連死の原因の第2位です1。米国だけでも、新規女性悪性腫瘍全体のほぼ 30% を占めており、毎年 280,000 人以上の新規症例が診断されています2。特に HER2 陽性およびホルモン受容体陽性のサブタイプにおける治療の進歩にもかかわらず、特に標的療法が不足しているトリプルネガティブ乳がん (TNBC) などの攻撃的なサブタイプでは、治療に対する耐性と再発が依然として重大な課題となっています 3,4。これは、個々の分子プロファイルに合わせた効果的な治療薬と組み合わせを特定するための精密な創薬の緊急の必要性を強調しています。創薬は、伝統的に実験的手法と試行錯誤の手法によって導かれてきましたが、機械学習(ML)技術の統合によって目覚ましい加速が見られました5,6。MLは、高次元の生物医学データにわたる複雑な非線形関係のモデリングを可能にし、標的の同定、バイオマーカーの発見、薬剤感受性の予測、および併用療法の設計を支援できます7,8。しかし、腫瘍学におけるMLモデルの実用的な展開は、モデルの解釈可能性、再現性、スパースデータセットでの過学習、がんサブタイプ全体での一般化など、いくつかのハードルに直面しています9,10,11。
これらの制限を克服するために、最近の研究では、特徴抽出のための深層学習と堅牢な予測のためのアンサンブル学習を組み合わせることに焦点を当てています。複数のアルゴリズムを評価する研究では、人工ニューラルネットワーク(ANN)などのモデルが最大93.2%の精度レベルを達成し、ナイーブベイズやデシジョンツリー12などの従来の分類器を上回りました。さらに、統合された特徴マイニング技術により、GEO(Gene Expression Omnibus)やGSE45827などのデータベースを通じて主要なドライバー遺伝子と分子標的が明らかになり、最大1,700の差次的に発現する遺伝子が同定され、そのうちのいくつかは既知の薬物相互作用を示します13。さらに、新規薬物転用研究により、カルシトリオールのような非腫瘍学化合物が、特にHER2+細胞株において、ネラチニブなどの標準治療よりも効果的に乳がん細胞の生存率を低下させる可能性が明らかになりました14。Aktシグナル伝達経路の調査もトラスツズマブ耐性の克服に有望であることを示しており、受容体集束療法の代替として分子経路の標的化が示唆されています15,16。しかし、これらの進歩にもかかわらず、継続的な薬物反応値を予測し、効果的な薬物の組み合わせをランク付けし、薬理学的類似性を視覚化できる体系的で説明可能なフレームワークは、現在の文献では十分に検討されていません。多くのモデルは、特に実際の薬理ゲノムデータセットに適用した場合、分類ベースであるか、翻訳の明確さに欠けています。
創薬と意思決定は、高品質のデータのための手段を提供する機械学習 (ML) によって改善できます。標的検証、バイオマーカーの同定、臨床試験分析など、創薬のすべての段階で機械学習の使用が恩恵を受けることができます。ML によって生成された結果の解釈可能性と再現性も障害となっています17.失敗率を減らし、プロセスを迅速化するには、これらの問題に対処し、検証変数に関する知識を高めることができます。研究者らは機械学習アルゴリズムを使用して、がんのさまざまな段階で生検サンプルを評価しました。調査結果によると、テストの精度は高く、ANN 93.2%、ナイーブ ベイズ (NB) 90.4%、デシジョン ツリー (DT) 87.8%、RF 85.9% でした。RakhshaninejadらによるGEOデータベースを組み合わせることにより、合計350の予測遺伝子と164の差次的に発現する遺伝子が見つかりました。18.結合されたデータセットでは、シミュレーテッド アニーリング アンサンブル (BGWO_SA_Ens) アルゴリズムによるバイナリ グレイ ウルフ最適化により 1404 個の遺伝子が見つかり、GSE45827 データセットでは 1710 個の遺伝子が見つかりました。約35の優れた遺伝子が、重要な経路におけるそれらの役割、および優れた遺伝子と抗がん剤との関係とともに発見されました。上皮成長因子受容体(EGFR(EGFR)過剰発現シグナル伝達経路およびそれらの関連ファミリーメンバーから標的遺伝子を見つけるために、分子ネットワーク調査がNagarajらによって実施されました。19 がんとは関係のない症状の治療が認められているカルシトリオールと呼ばれる薬は、4つの受容体のそれぞれと強い結合親和性を持っていました。聞いたところでは in vitro 細胞毒性試験では、カルシトリオールは用量依存的に SK-BR-3 細胞の生存率を低下させ、ネラチニブと比較して優れた細胞毒性と乳がん細胞の増殖の減少を示しています。活性で薬剤化可能なAktシグナル伝達経路は、Jernströmらによって提案されました。20 トラスツズマブ非感受性の2つの細胞株は、Akt1 / 2キナーゼ阻害剤に応答しました。この研究では、HER2 の増幅や発現に焦点を当てるのではなく、治療を決定する際に Akt シグナル伝達経路を標的とし、分子的側面を考慮することを推奨しています。米国における新規女性悪性腫瘍の30%は乳がんであり、女性の間で最も頻度の高い悪性疾患となっています。ウィットとトレフスボールの目標21 研究者が異種移植実験、がん予防、エピジェネティックな発見などの分野で使用する乳がん細胞株を選択するのに役立つ基本的なツールを開発することでした。また、特定の乳がん細胞株の起源と、細胞由来異種移植片 (CDX) とは対照的に患者由来異種移植片 (PDX) を使用する利点についての議論も取り上げられています。新しい創薬仮説を提供するための薬物予測技術の使用は、Gruener et al.22、トリプルネガティブ乳がん (TNBC) に焦点を当てています。細胞株トランスクリプトームデータに基づいて、薬物反応の機械学習モデルを構築し、患者の腫瘍データに適用しました。この知見は、Wee1阻害剤AZD-1775がTNBCにおいて優先作用を示し、TP53変異がその有効性と強く関連していることを示しました。乳がん研究における未知の薬物と標的の相互作用を予測するために、Song et al23 タンパク質配列、深部正準相関分析(DCCA)係数、および分子フィンガープリント記述子を利用する、Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction(PsePDC-DTIs)と呼ばれる特徴ベースのアプローチを提示します。この手法は、ランダムフォレスト分類器を使用して4つのゴールドスタンダードデータセットのDTIを予測し、SMOTEを使用して不均衡なデータを処理します。さらに、このモデルは、ゲノムワイド遺伝子研究から得られたリスク遺伝子を使用して、乳がん治療の新しい標的を調査します。このモデルの優位性と妥当性は、治療に提供される 10 の可能な DTI によって実証されています。乳がんの症例の10〜20%はトリプルネガティブ乳がん(TNBC)です。HER2+ およびホルモン受容体 + 治療の進歩にもかかわらず、現在 TNBC に対する標的療法はありません24.EGFR は大多数の患者によって発現されますが、初期の研究では識別可能な活性は見つかりませんでした。TNBC の将来の実験的治療法は、最近の発見と臨床的進歩によって示唆されています25.
創薬における機械学習の統合が進んでいるにもかかわらず、現在のモデルには解釈可能性や再現性が欠けていることが多く、トランスレーショナルアプリケーションが制限されています。以前の研究では分類の精度と遺伝子マイニングが調査されてきましたが、ハイブリッド解釈可能なモデルを使用して継続的な薬物感受性(LN_IC50など)を体系的に予測した研究はほとんどありません。さらに、次元削減技術と堅牢なリグレッサーの組み合わせは、乳がん治療の文脈では十分に研究されていません。この研究では、薬物反応の忠実度の高い予測のためのデュアルパイプライン戦略(XGBoostとAutoencoder-XGBoost)を導入および評価し、実際の臨床適用性のための説明可能性と相乗効果マッピングツールを組み合わせることで、このギャップに対処します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
1. データセットの取得
2. データの前処理
3. モデリングフレームワーク

は対応する予測値、n は観測値の総数です。オートエンコーダの場合、再構成損失は次のように与えられます。

は薬物 1 の予測LN_IC50を示します。アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究は、高度な機械学習モデルを使用して、薬剤の選択を最適化し、乳がんの併用有効性を予測することに焦点を当てました。データセットには、乳がん細胞株、薬剤感受性指標(LN_IC50、AUC、Zスコア)、CNA、メチル化、遺伝子発現、組織記述子、薬物標的などの分子記述子の厳選およびフィルタリングされたパネルが含まれていました。主な目的は、細胞株全体での個々の薬物のLN_IC50(半最大阻害濃度の自然対数)を予測し、相乗的な組み合わせを特定し、SHAPの説明可能性を使用して解釈可能性を提供することでした。モデルは、スタンドアロン機械学習 (XGBoost) とハイブリッド Autoencoder-XGBoost パイプラインの両方を使用して開発されました。全体的なワークフローを図1に示します
モデル性能評価
XGBoost モデルは、予測精度と一般化において、ハイブリッド Autoencoder-XGBoost パイプラインよりも優れたパフォーマンスを発揮しました。XGBoost モデル...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
この研究は、薬剤の選択に適応し、相乗的な組み合わせを予測し、薬剤の転用の可能性を特定するための統合された機械学習パイプラインを提示します。GDSCデータベースとシナジーリポジトリ(SynergyDB、DrugCombなど)からのデータを統合して、分子特性(遺伝子発現、コピー数変化など)と薬理学的応答を網羅する薬物と細胞株の相互作用の包括的なパネルをキュレーションしました31。ここでの主な目的は、ZIP、Bliss、Lowe、HSAなどのインストールされたモデルを使用して、細胞株の薬物感受性を正確に予測し、最も効果的な薬物をランク付けし、有望な組み合わせの調整能力を評価することでした。
XGBOOSTモデルは、MSEが1.3789、R2 が0.8145で、ハイブリッドAuthen Koder-XGBOOSTパイプライン(MSE = 4.0322、R2 = 0.4577)で最高の一般性能を達成しました。XGBOOST のパフォー...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者は、この作品に関連する利益相反はないことを宣言します。大規模言語モデル(LLM)技術(ChatGPT、OpenAIが開発)は、原稿作成の初期段階で限られた容量で使用されていたことを確認しました。具体的には、ChatGPT はアイデアの生成と概念フレームワークの予備的なブレインストーミングに使用され、その後著者によって改良、検証、および完全に書き直されました。すべての主要な科学的内容、データ分析、解釈、および最終的な起草は、著者によって独占的に行われました。ChatGPT からの出力は、ジャーナルの透明性と倫理ガイドラインに準拠して、掲載前に正確性、一貫性、完全性について厳しくレビューされました。すべての著者は原稿の最終版をレビューおよび承認し、この出版物の内容に影響を与えると解釈される可能性のある金銭的、個人的、または職業上の関係がないことを確認しました。
著者らは、この研究を実施するために必要な計算リソースと学術環境を促進したクライスト大学コンピュータサイエンス学科による制度的支援に心から感謝します。また、この作業の過程を通じて、同僚やメンターによる協力的な指導と励ましにも感謝しています。
著者の貢献:
Dyuti Banerjee は、この研究を考案し、方法論を設計し、データセットをキュレーションしました。Sivaneasan Bala Krishnan と Kamal Upreti は、機械学習モデルを実装し、計算分析を実行しました。Sumegh Shrikant Tharewal と Uma Shankar は、データの前処理、特徴エンジニアリング、結果の検証に貢献しました。Pravin Kshirsagar は、相乗効果分析と PCA ベースのクラスタリングを実施しました。マノジ・クマールは、文献レビュー、調査結果の解釈、原稿の起草を支援しました。すべての著者は原稿の改訂に貢献し、最終版を承認し、作業のあらゆる側面に責任を負うことに同意しました。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| オートエンコーダー(ディープラーニングモデル) | TensorFlow(Google) | https://www.tensorflow.org | 薬物反応モデリングのための次元削減と特徴符号化 |
| ボルテゾミブ | セレックケミカルズ | S1013 | 相乗効果分析に使用される薬剤 |
| ダクチノマイシン | シグマ・アルドリッチ | D1037 | 相乗効果分析に使用される薬剤 |
| ドセタキセル | シグマ・アルドリッチ | D1080 | メカニズムベースのクラスタリング検証に使用される薬剤 |
| Matplotlibライブラリ | Python パッケージ インデックス (PyPI) | https://matplotlib.org | Python でのデータの視覚化とプロット |
| NumPyライブラリ | Python パッケージ インデックス (PyPI) | https://numpy.org | 数値計算と行列演算 |
| パクリタキセル | シグマ・アルドリッチ | T7191 | メカニズムベースのクラスタリング検証に使用される薬剤 |
| パンダスライブラリ | Python パッケージ インデックス (PyPI) | https://pandas.pydata.org | データの操作と処理 |
| パイソン3.10 | Pythonソフトウェア財団 | https://www.python.org | 主要なプログラミング言語 |
| ロミデプシン | セレックケミカルズ | S3020 | 相乗効果分析に使用される薬剤 |
| Scikit-learnライブラリ | Python パッケージ インデックス (PyPI) | https://scikit-learn.org | 機械学習モデリングおよび前処理ツール |
| シーボーン図書館 | Python パッケージ インデックス (PyPI) | https://seaborn.pydata.org | データの可視化と統計的プロット |
| SHAPライブラリ | Python パッケージ インデックス (PyPI) | https://shap.readthedocs.io | 説明可能なAIモデルの解釈可能性 |
| シナジーデータ(DrugComb) | FIMM, フィンランド | https://drugcomb.fimm.fi | 薬物シナジー参照データセット |
| Synergyデータ(SynergyDB) | フローニンゲン大学 | https://synergy.bioinformatics.nl | 薬物シナジー参照データセット |
| テンソルフロー 2.11 | ググる | https://www.tensorflow.org | オートエンコーダーディープラーニングモデルの実装 |
| ビンブラスチン | シグマ・アルドリッチ | V1377 | 相乗効果分析に使用される薬剤 |
| XGBoost ライブラリ | Python パッケージ インデックス (PyPI) | https://xgboost.readthedocs.io | 勾配ブースティング回帰モデリング |
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト