方法論記事

解釈可能な機械学習モデルを使用した乳がんのデータ駆動型創薬最適化

DOI:

10.3791/68705

2025年9月12日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このプロトコルは、XGBoost と SHAP を使用して乳がんの薬物感受性を予測する機械学習パイプラインを提示します。このワークフローには、強力な薬剤を特定し、治療反応に影響を与える主要な生物学的要因を理解するためのデータ前処理、ハイブリッドモデリング、SHAPベースの解釈、相乗効果スコアリング、PCAクラスタリングが含まれます。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳がんは依然として世界中で最も蔓延している悪性腫瘍の 1 つであり、腫瘍の不均一性と薬剤耐性により治療上の重大な課題を引き起こしています。この研究は、強力な単剤と相乗的な薬物の組み合わせを特定するという 2 つの目的を掲げて、乳がん細胞株の薬物感受性を予測するための再現性のあるデータ駆動型機械学習プロトコルを提示します。がんにおける薬物感受性のゲノミクス(GDSC)から厳選されたデータセットを使用して、スタンドアロンのXGBoostリグレッサーとハイブリッドオートエンコーダー-XGBoostパイプラインの2つの予測アプローチが実装されました。前処理には、ラベルエンコーディング、ワンホットエンコーディング、Zスコアの標準化、欠損値代入、PCAによる次元削減が含まれていました。モデル評価により、XGBoostはハイブリッドモデル(MSE = 4.0322、R2 = 0.4577)と比較して優れたパフォーマンス(MSE = 1.3789、R2 = 0.8145)を達成したことが示されました。解釈可能性は、確立された薬理学的メカニズムに沿って、TARGET_PATHWAY、DRUG_ID、TARGET、およびCELL_LINE_NAMEを主要な予測機能として特定したSHapley Additive exPlanations(SHAP)を使用して対処されました。モデル出力とDrugCombおよびSynergyDBデータを組み合わせることから導き出された予測相乗効果スコアは、ボルテゾミブ+ロミデプシンやパクリタキセル+ボルテゾミブなどの有望な薬剤ペアを強調しました。これらの発見は、PCAベースの薬理学的クラスタリングによってさらに裏付けられ、同様の作用機序を持つ薬物の生物学的に関連するグループを明らかにしました。提案されたプロトコルは、精密腫瘍学研究のための透明性と適応性のあるフレームワークを提供し、予測精度と生物学的解釈可能性の両方を可能にします。このワークフローは、厳密な前処理、モデル検証、説明可能性、および薬物相乗効果分析を統合することにより、乳がん治療におけるトランスレーショナル創薬と転用のためのスケーラブルな基盤を提供します。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

乳がんは依然として最も一般的に診断されるがんであり、世界の女性のがん関連死の原因の第2位です1。米国だけでも、新規女性悪性腫瘍全体のほぼ 30% を占めており、毎年 280,000 人以上の新規症例が診断されています2。特に HER2 陽性およびホルモン受容体陽性のサブタイプにおける治療の進歩にもかかわらず、特に標的療法が不足しているトリプルネガティブ乳がん (TNBC) などの攻撃的なサブタイプでは、治療に対する耐性と再発が依然として重大な課題となっています 3,4。これは、個々の分子プロファイルに合わせた効果的な治療薬と組み合わせを特定するための精密な創薬の緊急の必要性を強調しています。創薬は、伝統的に実験的手法と試行錯誤の手法によって導かれてきましたが、機械学習(ML)技術の統合によって目覚ましい加速が見られました5,6。MLは、高次元の生物医学データにわたる複雑な非線形関係のモデリングを可能にし、標的の同定、バイオマーカーの発見、薬剤感受性の予測、および併用療法の設計を支援できます7,8。しかし、腫瘍学におけるMLモデルの実用的な展開は、モデルの解釈可能性、再現性、スパースデータセットでの過学習、がんサブタイプ全体での一般化など、いくつかのハードルに直面しています9,10,11

これらの制限を克服するために、最近の研究では、特徴抽出のための深層学習と堅牢な予測のためのアンサンブル学習を組み合わせることに焦点を当てています。複数のアルゴリズムを評価する研究では、人工ニューラルネットワーク(ANN)などのモデルが最大93.2%の精度レベルを達成し、ナイーブベイズやデシジョンツリー12などの従来の分類器を上回りました。さらに、統合された特徴マイニング技術により、GEO(Gene Expression Omnibus)やGSE45827などのデータベースを通じて主要なドライバー遺伝子と分子標的が明らかになり、最大1,700の差次的に発現する遺伝子が同定され、そのうちのいくつかは既知の薬物相互作用を示します13。さらに、新規薬物転用研究により、カルシトリオールのような非腫瘍学化合物が、特にHER2+細胞株において、ネラチニブなどの標準治療よりも効果的に乳がん細胞の生存率を低下させる可能性が明らかになりました14。Aktシグナル伝達経路の調査もトラスツズマブ耐性の克服に有望であることを示しており、受容体集束療法の代替として分子経路の標的化が示唆されています15,16。しかし、これらの進歩にもかかわらず、継続的な薬物反応値を予測し、効果的な薬物の組み合わせをランク付けし、薬理学的類似性を視覚化できる体系的で説明可能なフレームワークは、現在の文献では十分に検討されていません。多くのモデルは、特に実際の薬理ゲノムデータセットに適用した場合、分類ベースであるか、翻訳の明確さに欠けています。

創薬と意思決定は、高品質のデータのための手段を提供する機械学習 (ML) によって改善できます。標的検証、バイオマーカーの同定、臨床試験分析など、創薬のすべての段階で機械学習の使用が恩恵を受けることができます。ML によって生成された結果の解釈可能性と再現性も障害となっています17.失敗率を減らし、プロセスを迅速化するには、これらの問題に対処し、検証変数に関する知識を高めることができます。研究者らは機械学習アルゴリズムを使用して、がんのさまざまな段階で生検サンプルを評価しました。調査結果によると、テストの精度は高く、ANN 93.2%、ナイーブ ベイズ (NB) 90.4%、デシジョン ツリー (DT) 87.8%、RF 85.9% でした。RakhshaninejadらによるGEOデータベースを組み合わせることにより、合計350の予測遺伝子と164の差次的に発現する遺伝子が見つかりました。18.結合されたデータセットでは、シミュレーテッド アニーリング アンサンブル (BGWO_SA_Ens) アルゴリズムによるバイナリ グレイ ウルフ最適化により 1404 個の遺伝子が見つかり、GSE45827 データセットでは 1710 個の遺伝子が見つかりました。約35の優れた遺伝子が、重要な経路におけるそれらの役割、および優れた遺伝子と抗がん剤との関係とともに発見されました。上皮成長因子受容体(EGFR(EGFR)過剰発現シグナル伝達経路およびそれらの関連ファミリーメンバーから標的遺伝子を見つけるために、分子ネットワーク調査がNagarajらによって実施されました。19 がんとは関係のない症状の治療が認められているカルシトリオールと呼ばれる薬は、4つの受容体のそれぞれと強い結合親和性を持っていました。聞いたところでは in vitro 細胞毒性試験では、カルシトリオールは用量依存的に SK-BR-3 細胞の生存率を低下させ、ネラチニブと比較して優れた細胞毒性と乳がん細胞の増殖の減少を示しています。活性で薬剤化可能なAktシグナル伝達経路は、Jernströmらによって提案されました。20 トラスツズマブ非感受性の2つの細胞株は、Akt1 / 2キナーゼ阻害剤に応答しました。この研究では、HER2 の増幅や発現に焦点を当てるのではなく、治療を決定する際に Akt シグナル伝達経路を標的とし、分子的側面を考慮することを推奨しています。米国における新規女性悪性腫瘍の30%は乳がんであり、女性の間で最も頻度の高い悪性疾患となっています。ウィットとトレフスボールの目標21 研究者が異種移植実験、がん予防、エピジェネティックな発見などの分野で使用する乳がん細胞株を選択するのに役立つ基本的なツールを開発することでした。また、特定の乳がん細胞株の起源と、細胞由来異種移植片 (CDX) とは対照的に患者由来異種移植片 (PDX) を使用する利点についての議論も取り上げられています。新しい創薬仮説を提供するための薬物予測技術の使用は、Gruener et al.22、トリプルネガティブ乳がん (TNBC) に焦点を当てています。細胞株トランスクリプトームデータに基づいて、薬物反応の機械学習モデルを構築し、患者の腫瘍データに適用しました。この知見は、Wee1阻害剤AZD-1775がTNBCにおいて優先作用を示し、TP53変異がその有効性と強く関連していることを示しました。乳がん研究における未知の薬物と標的の相互作用を予測するために、Song et al23 タンパク質配列、深部正準相関分析(DCCA)係数、および分子フィンガープリント記述子を利用する、Pseudo Position-Specific Physicochemical Property-Derived Composition for Drug-Target Interaction Prediction(PsePDC-DTIs)と呼ばれる特徴ベースのアプローチを提示します。この手法は、ランダムフォレスト分類器を使用して4つのゴールドスタンダードデータセットのDTIを予測し、SMOTEを使用して不均衡なデータを処理します。さらに、このモデルは、ゲノムワイド遺伝子研究から得られたリスク遺伝子を使用して、乳がん治療の新しい標的を調査します。このモデルの優位性と妥当性は、治療に提供される 10 の可能な DTI によって実証されています。乳がんの症例の10〜20%はトリプルネガティブ乳がん(TNBC)です。HER2+ およびホルモン受容体 + 治療の進歩にもかかわらず、現在 TNBC に対する標的療法はありません24.EGFR は大多数の患者によって発現されますが、初期の研究では識別可能な活性は見つかりませんでした。TNBC の将来の実験的治療法は、最近の発見と臨床的進歩によって示唆されています25.

創薬における機械学習の統合が進んでいるにもかかわらず、現在のモデルには解釈可能性や再現性が欠けていることが多く、トランスレーショナルアプリケーションが制限されています。以前の研究では分類の精度と遺伝子マイニングが調査されてきましたが、ハイブリッド解釈可能なモデルを使用して継続的な薬物感受性(LN_IC50など)を体系的に予測した研究はほとんどありません。さらに、次元削減技術と堅牢なリグレッサーの組み合わせは、乳がん治療の文脈では十分に研究されていません。この研究では、薬物反応の忠実度の高い予測のためのデュアルパイプライン戦略(XGBoostとAutoencoder-XGBoost)を導入および評価し、実際の臨床適用性のための説明可能性と相乗効果マッピングツールを組み合わせることで、このギャップに対処します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

1. データセットの取得

  1. GDSC(https://www.cancerrxgene.org/downloads/drug_data)から薬物感受性データをダウンロードします。使用したデータセットの概要を表1に示します。使用されるファイルは、gdsc_drug_data.csv(薬物応答)、gdsc_expression_data.csv(遺伝子発現)、およびgdsc_cell_metadata.csv(細胞株情報)です。
    このワークフローで使用されるデータセット構造の例については、 図 1 を参照してください。
  2. Python (Pandasライブラリ) を使用して、データセットをフィルタリングして乳がん細胞株のみを含めます。
    1. TCGA_DESC列が「乳房」と等しいレコードを選択します。
    2. 対応するCELL_LINE_NAME値を抽出します。
    3. 実装については、補足コード1(補足ファイル1)を参照してください。
      注:データセットを乳がん細胞株に限定することで、ドメイン固有のモデルトレーニングが保証され、生物学的妥当性が向上します。この研究で使用されたデータセットは、Genomics of Drug Sensitivity in Cancer(GDSC)データベースから取得され、その主な特徴を 表2に示します。

2. データの前処理

  1. 前処理パイプライン:
    1. LabelEncoder を使用して DRUG_ID、CELL_LINE_NAME、TARGET_PATHWAY などのカテゴリ変数をエンコードし、XGBoost 入力に適した整数ベースの形式に変換します。
    2. Zスコア標準化(StandardScaler)を使用して、遺伝子発現データ、コピー数変化(CNA)、メチル化特徴などの数値特徴を正規化し、平均と単位分散をゼロにします。
    3. 30%を超える欠落している特徴を持つサンプルを削除します。
    4. SimpleImputer(strategy='median') を使用して、それぞれの特徴列の中央値を使用して残りの欠損値を代入します。
    5. scikit-learn の OneHotEncoder を使用して、カテゴリ変数 (DRUG_ID と TARGET_PATHWAY) にワンホット エンコーディングを適用します。
    6. 主成分分析(PCA)を使用して遺伝子発現特徴の次元削減を実行し、分散を維持しながら特徴空間を削減します。
    7. scikit-learnのtrain_test_splitを使用して、最終的にクリーニングされたデータセットをトレーニング(80%)とテスト(20%)セットに分割し、薬物と細胞のペアの分布を維持します。
      注:各前処理ステップと結果のデータセットのディメンションの詳細な理論的根拠については、「ディスカッション」セクションで説明します。
  2. カテゴリ変数の処理
    1. Pandasを使用してカテゴリ変数(CELL_LINE_NAME、DRUG_NAME、TARGET_PATHWAY)を識別します。
    2. scikit-learnのLabelEncoderを使用して、これらの変数にラベルエンコーディングを適用します。
    3. この手順は、補足コード 2 (補足ファイル 1) に示すようにプログラムで実装します。
      注: 機械学習アルゴリズムには数値入力が必要です。ラベル エンコーディングは、クラスの区別を維持しながら、カテゴリ変数を整数形式に変換します。
  3. 数値特徴量の標準化
    1. 遺伝子発現、コピー数変化(CNA)、メチル化の特徴にわたる数値変数を同定します。
    2. StandardScaler を適用して、特徴を平均と単位分散をゼロに正規化します。
      注: 標準化により、平均と単位分散がゼロになるように再スケーリングすることで、すべての数値特徴がモデルに等しく寄与するようになります。これにより、より大きなスケールを持つ特徴がモデルのトレーニングを支配するのを防ぎ、最適化アルゴリズムの収束を改善します。
  4. 欠損値の処理
    1. すべての機能で欠落しているエントリを検出します。
    2. 30% を超える欠落データを含むレコードを削除します。
    3. 中央値代入戦略を使用して、残りの欠損値を代入します。
      注:データが不完全なデータは、バイアスを引き起こし、モデルの堅牢性を低下させる可能性があります。欠落しているレコードを大幅に削除することでデータの信頼性が確保され、中央値代入は、強力な分布仮定を導入することなく使用可能な情報を保持するための安定した外れ値耐性のある方法を提供します。
  5. データセットを分割する
    1. 自動化された方法(sikit-learnのtrain_test_splitなど)を使用して、最終的にクリーニングされたデータセットをトレーニングとテストのサブセットに分割します。
    2. 再現性を確保するために、ランダムなシード (例: random_state=42) を指定します。
    3. データの 80% をトレーニング セットに割り当て、20% をテスト セットに割り当てます。
    4. 完全なコード実装については、補足コード 3 (補足ファイル 1) を参照してください。
      注:データをトレーニングサブセットとテストサブセットに分割すると、モデルの一般化可能性を偏りなく評価できます。

3. モデリングフレームワーク

  1. 回帰目標の定義
    1. 予測タスクを回帰問題として組み立てて、各薬物-細胞株ペアの半最大阻害濃度 (LN_IC50) の自然対数を推定します。
    2. 分散を安定化し、モデルを改善するために、ターゲット変数としてLN_IC50を選択します。
      注: IC50 を LN_IC50 に変換すると、歪度が減少し、モデルのパフォーマンスが向上します。
  2. XGBoost Regressor のトレーニング (モデル 1)
    1. XGBoostは、構造化された薬理ゲノムデータセットで優れたパフォーマンスを発揮し、過適合を防ぐために正則化を使用して非線形特徴相互作用をモデル化できるため、プライマリモデルとして選択します。
    2. xgboost ライブラリの XGBRegressor クラスを使用して、プログラムでモデルを初期化します。クロスバリデーションによって識別された調整されたハイパーパラメータ(学習率、最大深度、推定器の数、ランダムシード)を指定します。
    3. fit() メソッドを使用して、トレーニング サブセット (X_train、y_train) でモデルをトレーニングします。
    4. predict() メソッドを使用して、テスト サブセット (X_test) で予測を生成します。
    5. scikit-learnのmean_squared_error関数とr2_score関数を使用して、平均二乗誤差(MSE)とR²スコアを使用してパフォーマンスを評価します。
      注:完全な実装については、補足コード4(補足ファイル1)を参照してください。
  3. 代替モデルを検討する
    1. サポートベクター回帰 (SVR) の小サンプルの高次元データ設定での堅牢性を評価します。
    2. Autoencoder-XGBoost ハイブリッドを評価して、深い潜在特徴抽出と非線形モデリングによる潜在的なパフォーマンス向上を実現します。
    3. 同一の評価指標と相互検証を使用して、モデル間でのパフォーマンスを比較します。
      注: SVR は XGBoost と比較して予測精度が低いため最終結果から除外されましたが、Autoencoder-XGBoost ハイブリッドは深層学習と機械学習アプローチの比較のために保持されました。
  4. モデル 1: XGBoost リグレッサー
    1. XGBoost は、構造化された生物医学データに対する優れたパフォーマンス、非線形特徴相互作用をモデル化する機能、および過剰適合を減らす組み込みの正則化により、ベースライン モデルとして選択します。
    2. XGBoost モデルをハイパーパラメーター learning_rate = 0.05、max_depth = 6、n_estimators = 100 で構成します。
    3. グリッド検索を使用してハイパーパラメータを最適化し、5 倍のクロスバリデーションでパフォーマンスを検証します。
    4. 準備されたトレーニングデータセット (X_train、y_train) でモデルをトレーニングします。
    5. scikitlearnのmean_squared_error関数とr2_score関数で計算された平均二乗誤差(MSE)とR²スコアを使用して、予測性能を評価します。
      注:以前の研究26 では、XGBoostが表形式の生物医学データセットで、より低い計算コストでディープラーニングモデルを一貫して上回ることが示されています。
  5. ハイブリッドオートエンコーダー + XGBoost モデルの構築 (モデル 2)
    1. 教師なし次元削減のためのオートエンコーダーの設計
      注:エンコーダーは、入力特徴を低次元潜在表現に圧縮します。デコーダは入力を再構築して再構成誤差を最小限に抑えます。
    2. 完全な特徴行列でオートエンコーダーをトレーニングして、潜在特徴を抽出します。
    3. 補足コード 5A (補足ファイル 1) に示すように、エンコーダーの出力 (潜在特徴) を XGBoost 回帰器への入力として渡します。
    4. 補足コード 5B (補足ファイル 1) に示すように、LN_IC50 をターゲット変数としてエンコードされた特徴セットで XGBoost リグレッサーをトレーニングします。
    5. モデル 1 と同じメトリックを使用してモデルのパフォーマンスを評価し、直接比較します。
      注: このハイブリッド アプローチは、深層学習ベースの表現学習と XGBoost の強力な回帰機能を活用し、高次元の生物学的データに利点をもたらします。
  6. モデル評価
    1. テストデータセット(X_test)でpredict()メソッドを使用してターゲット値を予測することにより、トレーニング済み回帰モデルを評価します。
    2. scikit-learnのmean_squared_error(y_test, y_pred)を使用して、平均二乗誤差(MSE)を計算して、予測値と実際のLN_IC50値の平均二乗差を測定します。
      注:これらのモデルは、解釈可能性と精度を組み合わせて、乳がん研究における薬物感受性を予測するための堅牢なフレームワークを形成します27,28
      figure-protocol-1
      ここで、 yi は i 番目の薬物と細胞のペアの真のLN_IC50を示し、 figure-protocol-2 は対応する予測値、n は観測値の総数です。オートエンコーダの場合、再構成損失は次のように与えられます。
      figure-protocol-3
      ここで、Xは入力特徴行列、E(·)はXを潜在表現にマッピングするエンコーダー関数、D(·)は潜在空間からXを再構築するデコーダー関数です。
    3. R2 スコアを計算して、scikit-learn の r2_score(y_test, y_pred) を使用して、モデルによって説明されるターゲット変数の分散の割合を決定します。
    4. レポート用に計算された MSE と R2 の値を記録します。計算されたMSE値とR²値を 表3 に要約して、さまざまなモデルのパフォーマンスを明確に示し、直接比較します。
    5. 評価指標を解釈します。MSE が低いほど予測精度が高く、R2 スコアが 1 に近いほど、モデルの説明力が強く、一般化能力が優れていることを示します。
  7. SHAP の説明可能性
    1. SHAPライブラリをインストールしてインポートします(インポートshap)。再現性を高めるために、バージョンが 0.41.0 であることを確認してください。
    2. 補足コード 6 (補足ファイル 1) に従って、トレーニング済みの XGBoost モデルを使用して SHAP Explainer を初期化します。
    3. テストデータセットの SHAP 値を計算して、特徴量の寄与スコアを取得します。
    4. グローバル特徴量の重要度サマリープロットを生成して、予測に最も寄与する特徴量を視覚化します。
    5. SHAPウォーターフォールプロットを使用して、選択したサンプルの個別の予測説明を作成します。
    6. プロットを解釈して、予測に影響を与える主要な特徴を特定します。 表4に示すように、重要な特徴には、TARGET_PATHWAY、DRUG_ID、CELL_LINE_NAME、TARGETタンパク質、およびスクリーニング培地が含まれており、薬物特異的および細胞特異的な特性が薬物反応の予測に大きく影響することを示しています。
      注: SHAP 値は shap を使用して計算されました。TreeExplainer() を呼び出します。グローバル特徴の重要度はshap.summary_plot()を用いて可視化し、サンプルごとの説明はshap.dependence_plot()とshap.waterfall_plot()で生成されました(SHAP v0.41.0)表 4に示すように、最も影響力のある特徴にはTARGET_PATHWAY、DRUG_ID、CELL_LINE_NAMEが含まれており、薬物反応の決定において薬物特異的特性と細胞特異的特性の両方が重要であることが示されました。その他の主要な貢献者はTARGETタンパク質とスクリーニング培地であり、このモデルとがん薬理ゲノミクスにおけるドメイン関連因子との整合性がさらに強調されました。
  8. 薬物の相乗効果とクラスタリング
    1. シナジーデータのダウンロード
      1. 一般公開されているリポジトリから薬剤の組み合わせ相乗効果データをダウンロードします。
        ドラッグコーム:https://drugcomb.fimm.fi
        SynergyDB:https://synergy.bioinformatics.nl
    2. 相乗効果データと予測応答をマージします。
      1. 薬物と細胞株の組み合わせを一意のキーとして使用して、ダウンロードした相乗効果スコア(ZIP、Bliss、Loewe、HSA)と予測された薬物反応値(LN_IC50)をマージします。
      2. マージする前に、データセット間で薬物識別子と細胞株名が一致していることを確認してください。
    3. モデルベースの相乗効果スコアを計算します。
      1. 各薬剤ペアについて、個々のモデル予測LN_IC50値の平均を使用して、複合予測有効性を計算します。
        figure-protocol-4
        ここで、 Scomb は薬物ペアの合計予測 LN_IC50 スコアを示し、 figure-protocol-5 は薬物 1 の予測LN_IC50を示します。
      2. 相乗効果スコアに基づいて薬剤の組み合わせをランク付けします。
      3. 相乗効果スコアが最も低く、予測される有効性が高いことを示す上位の組み合わせ (ボルテゾミブ + ロミデプシン、ビンブラスチン + ダクチノマイシンなど) を特定します。
        注:相乗効果スコアが低いほど、予測される治療の可能性が高いことを反映しており、これらの薬剤ペアはさらなる実験的検証の候補となります。補足コード7Aおよび補足コード7B(補足ファイル1)に記載されている手順に従ってください。
  9. シナジーランキングとPCAベースのクラスタリング
    1. 相乗効果スコアで薬物ペアをランク付けします。
      1. 薬物と細胞株の組み合わせを一意のキーとして使用して、相乗効果スコア(ZIP、Bliss、Loewe、HSA)を予測LN_IC50値とマージします。
      2. 平均予測LN_IC50値を使用して、各薬剤ペアの相乗効果スコアを計算します。
      3. 計算された相乗効果スコアに基づいて薬物ペアをランク付けします。
      4. 潜在的な相乗効果のある組み合わせとして、スコアが最も低い(最も負の)薬剤ペアを特定します(例:ボルテゾミブ+ロミデプシン、ビンブラスチン+ダクチノマイシン)。
    2. 薬物反応マトリックスに対してPCAを実行します。
      1. 補足コード8(補足ファイル1)に示す手順に従って、薬物を行、細胞株を列として、予測LN_IC50値を使用して薬物反応マトリックスを構築します。
      2. zscore正規化を使用して行列を標準化します。
      3. 2つの主成分(n_components = 2)を使用して主成分分析(PCA)を実行して、次元を減らし、主要な分散をキャプチャします。
    3. PCA クラスターの視覚化
      1. MatplotlibまたはSeabornを使用して2次元PCA投影法をプロットします。
      2. 同様の作用機序を持つ薬剤(ドセタキセルやパクリタキセルなど)が集まっていることを確認し、生物学的に意味のある関係を捉えるモデルの能力を検証します。
    4. モデルの安定性と特徴量のバランス
      1. エンコード中に頻度の低いカテゴリ変数をフィルタリングして、スパース性の問題を回避します。
      2. オートエンコーダーの学習率を調整し、ドロップアウトレイヤーを含めて収束の問題を防ぎます。
      3. SHAP分析を上位100の特徴に制限して、メモリのオーバーヘッドを削減し、計算効率を確保します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、高度な機械学習モデルを使用して、薬剤の選択を最適化し、乳がんの併用有効性を予測することに焦点を当てました。データセットには、乳がん細胞株、薬剤感受性指標(LN_IC50、AUC、Zスコア)、CNA、メチル化、遺伝子発現、組織記述子、薬物標的などの分子記述子の厳選およびフィルタリングされたパネルが含まれていました。主な目的は、細胞株全体での個々の薬物のLN_IC50(半最大阻害濃度の自然対数)を予測し、相乗的な組み合わせを特定し、SHAPの説明可能性を使用して解釈可能性を提供することでした。モデルは、スタンドアロン機械学習 (XGBoost) とハイブリッド Autoencoder-XGBoost パイプラインの両方を使用して開発されました。全体的なワークフローを図1に示します

モデル性能評価
XGBoost モデルは、予測精度と一般化において、ハイブリッド Autoencoder-XGBoost パイプラインよりも優れたパフォーマンスを発揮しました。XGBoost モデル...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

この研究は、薬剤の選択に適応し、相乗的な組み合わせを予測し、薬剤の転用の可能性を特定するための統合された機械学習パイプラインを提示します。GDSCデータベースとシナジーリポジトリ(SynergyDB、DrugCombなど)からのデータを統合して、分子特性(遺伝子発現、コピー数変化など)と薬理学的応答を網羅する薬物と細胞株の相互作用の包括的なパネルをキュレーションしました31。ここでの主な目的は、ZIP、Bliss、Lowe、HSAなどのインストールされたモデルを使用して、細胞株の薬物感受性を正確に予測し、最も効果的な薬物をランク付けし、有望な組み合わせの調整能力を評価することでした。

XGBOOSTモデルは、MSEが1.3789、R2 が0.8145で、ハイブリッドAuthen Koder-XGBOOSTパイプライン(MSE = 4.0322、R2 = 0.4577)で最高の一般性能を達成しました。XGBOOST のパフォー...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は、この作品に関連する利益相反はないことを宣言します。大規模言語モデル(LLM)技術(ChatGPT、OpenAIが開発)は、原稿作成の初期段階で限られた容量で使用されていたことを確認しました。具体的には、ChatGPT はアイデアの生成と概念フレームワークの予備的なブレインストーミングに使用され、その後著者によって改良、検証、および完全に書き直されました。すべての主要な科学的内容、データ分析、解釈、および最終的な起草は、著者によって独占的に行われました。ChatGPT からの出力は、ジャーナルの透明性と倫理ガイドラインに準拠して、掲載前に正確性、一貫性、完全性について厳しくレビューされました。すべての著者は原稿の最終版をレビューおよび承認し、この出版物の内容に影響を与えると解釈される可能性のある金銭的、個人的、または職業上の関係がないことを確認しました。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者らは、この研究を実施するために必要な計算リソースと学術環境を促進したクライスト大学コンピュータサイエンス学科による制度的支援に心から感謝します。また、この作業の過程を通じて、同僚やメンターによる協力的な指導と励ましにも感謝しています。

著者の貢献:
Dyuti Banerjee は、この研究を考案し、方法論を設計し、データセットをキュレーションしました。Sivaneasan Bala Krishnan と Kamal Upreti は、機械学習モデルを実装し、計算分析を実行しました。Sumegh Shrikant Tharewal と Uma Shankar は、データの前処理、特徴エンジニアリング、結果の検証に貢献しました。Pravin Kshirsagar は、相乗効果分析と PCA ベースのクラスタリングを実施しました。マノジ・クマールは、文献レビュー、調査結果の解釈、原稿の起草を支援しました。すべての著者は原稿の改訂に貢献し、最終版を承認し、作業のあらゆる側面に責任を負うことに同意しました。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

この記事で使用された材料の一覧
名前会社カタログ番号コメント
オートエンコーダー(ディープラーニングモデル)TensorFlow(Google)https://www.tensorflow.org薬物反応モデリングのための次元削減と特徴符号化
ボルテゾミブセレックケミカルズS1013相乗効果分析に使用される薬剤
ダクチノマイシンシグマ・アルドリッチD1037相乗効果分析に使用される薬剤
ドセタキセルシグマ・アルドリッチD1080メカニズムベースのクラスタリング検証に使用される薬剤
MatplotlibライブラリPython パッケージ インデックス (PyPI)https://matplotlib.orgPython でのデータの視覚化とプロット
NumPyライブラリPython パッケージ インデックス (PyPI)https://numpy.org数値計算と行列演算
パクリタキセルシグマ・アルドリッチT7191メカニズムベースのクラスタリング検証に使用される薬剤
パンダスライブラリPython パッケージ インデックス (PyPI)https://pandas.pydata.orgデータの操作と処理
パイソン3.10Pythonソフトウェア財団https://www.python.org主要なプログラミング言語
ロミデプシンセレックケミカルズS3020相乗効果分析に使用される薬剤
Scikit-learnライブラリPython パッケージ インデックス (PyPI)https://scikit-learn.org機械学習モデリングおよび前処理ツール
シーボーン図書館Python パッケージ インデックス (PyPI)https://seaborn.pydata.orgデータの可視化と統計的プロット
SHAPライブラリPython パッケージ インデックス (PyPI)https://shap.readthedocs.io説明可能なAIモデルの解釈可能性
シナジーデータ(DrugComb)FIMM, フィンランドhttps://drugcomb.fimm.fi薬物シナジー参照データセット
Synergyデータ(SynergyDB)フローニンゲン大学https://synergy.bioinformatics.nl薬物シナジー参照データセット
テンソルフロー 2.11ググるhttps://www.tensorflow.orgオートエンコーダーディープラーニングモデルの実装
ビンブラスチンシグマ・アルドリッチV1377相乗効果分析に使用される薬剤
XGBoost ライブラリPython パッケージ インデックス (PyPI)https://xgboost.readthedocs.io勾配ブースティング回帰モデリング

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Vamathevan, J., et al. Applications of machine learning in drug discovery and development. Nat Rev Drug Discov. 18 (6), 463-477 (2019).
  2. Dara, S., Dhamercherla, S., Jadav, S. S., Babu, C. M., Ahsan, M. J. Machine learning in drug discovery: a review. Artif Intell Rev. 55 (3), 1947-1999 (2022).
  3. Drug discovery for breast cancer based on big data analytics techniques. Constantine, R. M., Batouche, M. 5th International Conference on Information & Communication Technology and Accessibility (ICTA), Marrakech, Morocco, , (2015).
  4. Elbadawi, M., Gaisford, S., Basit, A. W. Advanced machine-learning techniques in drug discovery. Drug Discov Today. 26 (3), 769-777 (2021).
  5. Sarkar, C., et al. Artificial intelligence and machine learning technology-driven modern drug discovery and development. Int J Mol Sci. 24 (3), 2026(2026).
  6. Liao, M., et al. Small-molecule drug discovery in triple negative breast cancer: current situation and future directions. J Med Chem. 64 (5), 2382-2418 (2021).
  7. You, Y., et al. Artificial intelligence in cancer target identification and drug discovery. Signal Transduct Target Ther. 7 (1), 156(2022).
  8. Kolahi Azar, H., et al. The progressive trend of modeling and drug screening systems of breast cancer bone metastasis. J Bio Eng. 18 (1), 14(2024).
  9. Singh, A., et al. Coumarin as an elite scaffold in anti-breast cancer drug development: design strategies, mechanistic insights, and structure-activity relationships. Biomedicines. 12 (6), 1192(2024).
  10. Baptista, D., Ferreira, P. G., Rocha, M. Deep learning for drug response prediction in cancer. Brief Bioinform. 22 (1), 360-379 (2021).
  11. Priya, S., et al. Machine learning approaches and their applications in drug discovery and design. Chem Biol Drug Des. 100 (1), 136-153 (2022).
  12. Ferraro, E., et al. Accelerating drug development in breast cancer: new frontiers for ER inhibition. Cancer Treat Rev. 109, 102432(2022).
  13. Arvindekar, A., et al. Unveiling promising bioactives for breast cancer: a novel approach for herbal-based drug discovery. Phytochem Rev. 24, 3221-3264 (2024).
  14. Vatansever, S., et al. AI- and ML-aided drug discovery in CNS diseases: state-of-the-art and future directions. Med Res Rev. 41 (3), 1427-1473 (2021).
  15. Nayarisseri, A., et al. Artificial intelligence, big data, and machine learning approaches in precision medicine and drug discovery. Curr Drug Targets. 22 (6), 631-655 (2021).
  16. Eckhardt, B. L., et al. Strategies for the discovery and development of therapies for metastatic breast cancer. Nat Rev Drug Discov. 11 (6), 479-497 (2012).
  17. Optimizing drug discovery for breast cancer in a laboratory environment using machine learning. Borkhade, G., et al. 2024 International Conference on Wireless Communications Signal Processing and Networking (WiSPNET), Chennai, India, , (2024).
  18. Rakhshaninejad, M., et al. Refining breast cancer biomarker discovery and drug targeting through an advanced data-driven approach. BMC Bioinformatics. 25 (1), 33(2024).
  19. Nagaraj, B. S., et al. Vitamin D analog calcitriol for breast cancer therapy; an integrated drug discovery approach. J Biomol Struct Dyn. 41 (20), 11017-11043 (2023).
  20. Jernström, S., et al. Drug-screening and genomic analyses of HER2-positive breast cancer cell lines reveal predictors for treatment response. Breast Cancer Targets Ther. 9, 185-198 (2017).
  21. Witt, B. L., Tollefsbol, T. O. Molecular, cellular, and technical aspects of breast cancer cell lines as a foundational tool in cancer research. Life. 13 (12), 2311(2023).
  22. Gruener, R. F., et al. Facilitating drug discovery in breast cancer by virtually screening patients using in vitro drug response modeling. Cancers. 13 (4), 885(2021).
  23. Song, J., et al. The discovery of new drug-target interactions for breast cancer treatment. Molecules. 26 (24), 7474(2021).
  24. Costa, R., et al. Targeting EGFR in triple negative breast cancer: new discoveries and insights. Cancer Treat Rev. 53, 111-119 (2017).
  25. Cardoso, F., et al. Bortezomib (PS-341, Velcade) increases the efficacy of trastuzumab (Herceptin) in HER2-positive breast cancer cells synergistically. Mol Cancer Ther. 5 (12), 3042-3051 (2006).
  26. Santo, L., et al. Preclinical activity of a selective HDAC6 inhibitor, ACY-1215, in combination with bortezomib in multiple myeloma. Blood. 119 (11), 2579-2589 (2012).
  27. Martin, M., et al. Activity of docetaxel, carboplatin, and doxorubicin in patient-derived TNBC xenografts. Sci Rep. 11, 7064(2021).
  28. Iorio, F., et al. A landscape of pharmacogenomic interactions in cancer. Cell. 166 (3), 740-754 (2016).
  29. Kuenzi, B. M., et al. Predicting drug response and syn enhances antitumor efficacy in TNBC xenografts. Oncotarget. 10, 25184-25198 (2019).
  30. Kuenzi, B. M., et al. Predicting drug response and synergy using a deep learning model of human cancer cells. Cancer Cell. 38 (5), 672-684.e6 (2020).
  31. XGBoost: a scalable tree boosting system. Chen, T., et al. Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining, San Francisco, California, USA, , (2016).
  32. A unified approach to interpreting model predictions. Lundberg, S. M., Lee, S. -I. 31st Conference on Neural Information Processing Systems (NIPS 2017), Long Beach, CA, USA, , (2017).
  33. Preuer, K., et al. DeepSynergy: predicting anti-cancer drug synergy with deep learning. Bioinformatics. 34 (9), 1538-1546 (2018).
  34. Contextualizing explainable machine learning for clinical end use. Tonekaboni, S., et al. Proceedings of the 4th Machine Learning for Healthcare Conference, Ann Arbor, Michigan, , (2019).
  35. Barretina, J., et al. The Cancer Cell Line Encyclopedia enables predictive modelling of anticancer drug sensitivity. Nature. 483, 603-607 (2012).
  36. Malyutina, A., et al. Drug combination sensitivity scoring facilitates discovery of synergistic drug combinations in cancer. PLoS Comput Biol. 15 (5), e1006752(2019).
  37. Menden, M. P., et al. Machine learning prediction of cancer cell sensitivity to drugs. PLoS One. 8 (4), e61318(2013).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

Breast CancerDrug DiscoveryMachine LearningDrug SensitivityXGBoost ModelAutoencoder PipelineDrug SynergySHAP AnalysisPrecision OncologyPharmacological Clustering

関連記事