このコンテンツを表示するには、JoVEへの購読が必要です。 または、無料トライアルをお申し込みください。

研究記事

医療分析における説明可能な人工知能フレームワークの開発と評価のための再現可能なプロトコル

93 閲覧数

DOI:

10.3791/71999

2026年7月31日

この記事について

サマリー

ここでは、医療分析のための説明可能な人工知能モデルの開発と評価のための再現可能なプロトコルを提示します。このワークフローは、データ前処理、予測モデリング、SHAP、LIME、Grad-CAMに基づく説明可能性、定量的評価、人間中心の検証を統合し、透明性と信頼性のある臨床意思決定を支援します。

要約

説明可能な人工知能(XAI)は、透明性と意思決定の説明能力が臨床意思決定の重要な要素となる医療における信頼できるAIシステム構築に不可欠なツールとしてますます認識されています。本出版物は、医療分析のための説明可能なAIシステムの開発と評価に関する再現可能な実験的アプローチを提示します。開発されたパイプラインは、データ前処理、予測モデリング、解釈生成、評価の各ステップを一つのシームレスなワークフローに統合し、構造化臨床データと医療画像データセットの両方に適用可能です。アンサンブル機械学習モデルは構造化表形式データセットで強い予測性能を示しており、ディープラーニングモデルは医療画像データ内の複雑なパターンの学習に効果的です。SHAP、LIME、Grad-CAMなどの手法は、モデル解釈を促進するグローバルかつ局所的な説明です。とても参考になりました。フレームワークの定量的評価は、正確性、正確性、リコール率、F1スコア、ROC-AUC、説明指標、忠実度、安定性など多くの異なる指標にまたがります。結果は、実験条件が制御された場合、フレームワークが評価された実験条件下で予測性能と説明の質を向上させたことを示しています。プロトコルに導かれた文書として、この研究は再現性とスケーラビリティ、他の生物による持続的な実装を裏付けています。この透明で理解しやすいAIモデルは、臨床意思決定支援や医療分析システムが大規模に信頼と利用を得る基盤となっています。

概要

人工知能(AI)は、疾病診断、予後、リスク階層化、医療画像解析、臨床意思決定を支援することで、現代医療の重要な要素となっています機械学習やディープラーニングの進歩により、医療システムは大量の構造化・非構造化データを処理できるようになり、従来の統計手法と同等かそれ以上の予測性能を達成することが多い2.これらの進歩にもかかわらず、多くのAIモデルは複雑なブラックボックスシステムのように動作し、臨床医や医療関係者が予測生成の方法を理解するのが困難です。この透明性の欠如は、高リスク医療環境における信頼、採用、説明責任を制限する可能性があります 4,5.

説明可能な人工知能(XAI)は、機械学習モデルの透明性と解釈性を向上させる有望なアプローチとして浮上しています。SHAP(Shapley加法説明)、LIME(局所解釈可能なモデル非依存的説明)、勾配重みクラス活性化マッピング(Grad-CAM)など広く使われている説明手法は、特徴帰属や視覚的説明メカニズム7,8,9を通じてモデルの挙動に関する洞察を提供します。これらの手法は、臨床解釈、モデル監査、意思決定支援を支援する医療応用にますます応用されています10,11。しかし、説明可能性だけでは信頼性、再現性、臨床的有用性を保証するものではありません。最近の研究では、説明の不安定性、摂動への感受性、臨床医の検証の制限、説明出力と真のモデル推論との間の不整合性などの課題が浮き彫りになっています(12,13,14,15)。

説明可能性の課題に加え、再現性は医療機器学習研究において依然として重要な懸念事項です。多くの発表された研究は、前処理手順、ソフトウェア環境、ハイパーパラメータ設定、検証戦略、実装ワークフローに関する限定的な情報しか提供していないため、独立したレプリケーションは困難です 19,20,21。さらに、医療AI研究は予測性能に焦点を当てることが多い一方で、説明の質評価、臨床医中心の評価、実践的な実施に関する指針は限定的です。これらの制限は、説明可能なAIシステムを研究環境から実際の医療現場へと移行させることを妨げる可能性があります。

現在の医療XAIワークフローは、個々の説明技術や予測モデルを個別に評価し、データ準備、予測モデリング、説明可能性評価、人間中心の評価、再現性リソースを統合した標準化されたプロトコルを提供することは稀です。28,29,30,31.その結果、研究者や実務者はワークフローの再現、説明手法の比較、異なる医療データセットや応用領域における説明可能なAIシステムの実用的有用性の評価において困難に直面することがあります。したがって、医療説明可能なAIワークフローの一貫した実装、評価、報告を促進するために包括的かつ再現可能なプロトコルが必要です。

ここでは、医療分析における説明可能な人工知能システムの開発、評価、解釈のための再現可能なプロトコルを提示します。このプロトコルは、データ前処理、予測モデリング、SHAP、LIME、Grad-CAMを用いた説明可能性評価、臨床医中心の評価、検証手順、再現性リソースを統合した統一ワークフローに組み込まれています。目的は、多様な医療データセット36373839において透明なモデル開発、説明の質評価、再現可能な実装を支援する標準化されたフレームワークを提供することです。本研究の方法論的貢献は、予測分析、説明可能性評価、臨床医の検証、再現性実践を医療AI研究、教育、展開志向の研究に適した単一のプロトコルに統合したことにあります。

この研究の主な貢献は、新しい説明可能性アルゴリズムの開発ではありません。

むしろ、予測モデリング、説明可能性評価、可視化、評価、人間中心の解釈を統合した標準化され再現可能かつ実験的に検証されたプロトコルを提供し、医療分析やJoVEベースのプロトコル配信に適した統一ワークフローを提供します。本研究の主な目的は、新しい予測アルゴリズムを導入することではなく、医療分析における説明可能な人工知能ワークフローの実装のための標準化され、再現可能で実験的に検証されたプロトコルを提供することです。このプロトコルは、データ前処理、予測モデリング、説明可能性評価、臨床医中心の評価、再現性リソースを統合し、採用、再現、教育普及に適した統一フレームワークを構築しています。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

プロトコル

本研究で使用されたすべてのデータセットは、UCI機械学習リポジトリ、PhysioNet MIMIC-IIIデータベース、NIH胸部X線データセットを含む公開されている完全に匿名化されたリポジトリから取得されました。特定可能な患者情報はアクセスされませんでした。本研究は、公開されている非特定データの二次分析に関する機関研究倫理ガイドラインに準拠していました。人間の参加者が直接募集されておらず、保護された健康情報も使用されていなかったため、正式な機関審査委員会の承認は必要ありませんでした。

1. 実験的枠組みの概要

  1. 再現可能で説明可能な人工知能(XAI)パイプラインを開発し、透明な医療分析を実現します。ワークフローをデータ層、前処理層、モデリング層、説明可能性層、評価層、可視化層に整理します。
  2. これらのモジュールを統合し、構造化された臨床データ、電子カルテ、医療画像データセットを処理できる統一ワークフローに組み込みます。
  3. 各モジュールが再現性、解釈可能性、スケーラビリティ、標準化された実験実行に寄与することを確実にしてください。
  4. モジュラーアーキテクチャを設計し、連続的なデータストリーミングをサポートし、パイプラインの各段階が実験ワークフロー全体で再現性、解釈性、スケーラビリティに寄与するようにすること。

2. 計算環境とシステム構成

  1. ワークフローを実行する前に、コマンドラインターミナルを開き、次のコマンドを実行して必要なソフトウェア依存関係をインストールしてください。
    PIP install numpy pandas scikit-learn tensorflow shap lime opencv-python matplotlib seaborn
  2. すべてのソフトウェアパッケージのインストールが成功しているかを確認し、データ前処理やモデル開発を進める前に、材料 に記載されたソフトウェアバージョンとの互換性を確認してください。
  3. 主なプログラミング環境としてはPython 3.11を使いましょう。データ操作や特徴工学のタスクのために、NumPy 1.26とPandas 2.1をインストールして設定してください。機械学習モデルの開発と評価のためにScikit-learn 1.5をインストールしてください。
  4. ディープラーニングモデルのトレーニングと推論のためにTensorFlow 2.15をインストールしてください。説明可能性分析のためにSHAP 0.46とLIME 0.2.0をインストールしてください。画像処理タスクにはOpenCV 4.10をインストールしてください。データの可視化と結果報告のためにMatplotlib 3.9とSeaborn 0.13をインストールしてください。再現性に必要なソフトウェア仕様や実装の詳細については、 材料表 を参照してください。
  5. マルチコアプロセッサ、グラフィックス処理ユニット(GPU)アクセラレーション、そして大規模な医療データセットやディープラーニングワークロードを収容できる十分なメモリリソースを備えたワークステーションを使って計算環境を構築します。
  6. データ分割、モデル初期化、訓練手順に固定されたランダムシードを設定し、実験実行間での再現性を確保します。ワークフロー全体でデータ前処理操作、モデル設定、ハイパーパラメータ設定、トレーニング手順、評価結果を記録するロギング機構を有効にします。
  7. モデルアーキテクチャ、最適化パラメータ、学習率、バッチサイズ、訓練設定、ハイパーパラメータ値を表 1の仕様に従って構成します。再現実験中はこれらの設定を遵守し、報告結果との整合性を確保してください。
  8. 期待出力 - 必要なソフトウェアパッケージ、ハードウェアリソース、ログ機構、モデル設定設定が完備され、後続のデータ前処理、モデル開発、説明可能性分析、評価手順に対応できる、完全構成かつ再現可能な計算環境。
構成要素パラメータ価値概要
ランダムフォレストn_estimators100木の数
ランダムフォレストmax_depth全くありません樹木の深さ
XGBoostlearning_rate0.01学習率
XGBoostn_estimators100ブースト弾
CNN時代25訓練時代
CNNbatch_size32バッチサイズ
CNN最適化器アダム最適化アルゴリズム
MLPhidden_layers2隠れ層の数
MLP起動ReLU活性化関数
一般train_split70%トレーニングデータ比率
一般validation_split15%検証比率
一般test_split15%試験比率

表1:実装詳細およびハイパーパラメータ構成。

この表は、提案された説明可能なAIフレームワークの実験評価全体で使用される計算環境、ソフトウェアライブラリ、機械学習および深層学習モデルの設定、最適化設定、学習率、バッチサイズ、訓練パラメータ、ハイパーパラメータ値を要約しています。

3. データセットの準備と前処理

  1. 実験ワークフローの透明性と再現性を確保するために、公開されている医療データセットを選択してください。
  2. 提案されたフレームワークを検証するために、4つの代表的な医療シナリオを用いてください:(i) ウィスコンシン乳がんデータセットを用いた乳がん診断、(ii) Pima Indians Diabetes Datasetを用いた糖尿病リスク予測、(iii) MIMIC-III電子カルテを用いた臨床アウトカム予測、(iv) NIH胸部X線データセットを用いた胸部疾患分類。これらのデータセットを選択して、構造化臨床記録、縦断的電子カルテ、医療画像手法を通じた医療意思決定支援システム全体でフレームワークを評価するために選びましょう。
  3. 各データセットをPython環境にインポートし、レコードを入力特徴量とターゲット変数に分けます。疾患予測タスクのための構造化された臨床データ、縦断的アウトカム分析のための電子カルテ、診断分類タスクのための医療画像データセットを整理します。前処理作業を進める前に、各データセットの整合性を確認してください。
  4. 適切な補完技術を用いて欠損値を特定し、対処します。特徴量のスケーリングや正規化手順を通じて数値特徴を標準化し、変数間の比較可能性を確保します。
  5. データセットの特性に基づく適切な符号化手法でカテゴリ変数をエンコードします。相関分析やモデルベースの特徴重要度測定を用いて特徴選択を行い、最も関連性の高い変数を特定しデータの次元を低減します。
  6. モデルトレーニング前にすべての医療画像を224,224ピクセルにリサイズしてください。選定された深層学習アーキテクチャの要件に応じてピクセル強度値を正規化します。画像回転や水平反転などのデータ拡張技術を適用し、モデルの一般化を改善し過学習を軽減します。画像の品質を確認し、データセット全体で画像寸法の一貫性を確保しましょう。
  7. データセットの完全性、一貫性、特徴ラベルの整合性を評価することでデータの整合性を評価します。すべてのレコードが対応するターゲットクラスに正しく割り当てられているか確認してください。サンプルサイズ、特徴数、データモダリティなどのデータセットの特徴を表2にまとめてレビュー します。
  8. 方法論的厳密性と再現性を確保するために、データセットごとの検証手順を実装すること。各データセットごとにサンプルサイズ、クラス分布、トイン・検証・テストの分割戦略、漏れ防止策、ハイパーパラメータ最適化手順、クロスバリデーション設計、外部テストプロトコルを記録します。これらの検証手順を表3にまとめます。
  9. 欠損値処理、外れ値除去、特徴スケーリング、カテゴリカルエンコーディング、クラス分布保持、データセット分割手順の評価を通じて、前処理の品質管理チェックを行います。すべてのデータセットで前処理操作が一貫して適用されているか確認してください。
  10. データセット分割時に大幅なデータ漏洩がないことを確認する。 図1 に示された前処理検証結果を確認し、後続の機械学習および説明可能性分析のために標準化されたデータセットが生成されているか確認してください。
  11. 期待出力 - 適切に補正された欠損値、カテゴリ変数のエンコード、数値特徴の正規化、訓練、検証、テストのサブセットに分割されたクリーンかつ標準化されたデータセットを生成します。データセットの特徴、クラス分布、検証手順が表2および表3に記載されているものと一致していることを確認し、図1に示すように前処理検証が成功したことを確認します。
データセット種類サンプル特徴ターゲット
乳がん表形式56930良性/悪性
糖尿病表形式7688糖尿病転帰
ミミックIII電子健康記録(EHR)~60,000臨床変数死亡率
胸部X線イメージング~112,000画像病気ラベル

表2:データセットの特徴と医療ユースケース。

この表は、研究で使用された医療データセットの概要であり、データセットの種類、サンプル数、特徴数、ターゲット変数、医療応用領域、関連する臨床ユースケースを含みます。データセットは構造化された臨床記録、電子健康記録、医療画像データを含み、多様な医療分析シナリオにおけるフレームワークの適用性を示しています。

データセットサンプルサイズクラス分布スプリット戦略漏れ防止ハイパーパラメータ検索クロスバリデーション外部試験
乳がん(UCIウィスコンシン)569357 良性 / 212 悪性70/15/15列車専用の前処理グリッドサーチ5分割層CV独立ホールドアウト集合
ピマ・インディアンズ・糖尿病768非糖尿病500人/糖尿病268人70/15/15列車専用の前処理グリッドサーチ5分割層CV独立ホールドアウト集合
ミミックIII EHR5274アウトカム層別コホート70/15/15 患者レベル患者レベルの分離ランダムサーチ5倍患者レベルCV独立ホールドアウト集合
NIH胸部X線112120肺炎/正常な層状70/15/15画像レベルの分離ランダムサーチ5分割層CV独立ホールドアウト集合

表3:データセットレベルの検証と実験設計。

この表は、各データセットで用いられている検証手法をまとめており、サンプルサイズ、クラス分布、トレーニング・検証・テストの分割戦略、リーケージ防止手順、ハイパーパラメータ最適化手法、クロス検証設計、外部テストプロトコルなどが含まれます。これらの対策は、方法論的厳密さ、再現性、そして偏りのないモデル評価を確保するために実施されました。

figure-protocol-1
図1:データ前処理パイプラインの検証。
モデル開発前に行われた主要な前処理操作の検証結果。(A) 代表的な医療機能における欠損分析。(B) 外れ値処理の前後における数値変数の分布。(C) 標準化を用いた特徴スケーリング検証。(D) カテゴリカルエンコーディングの検証。(E) 前処理後のクラス分布。(F) トレイン検証テストデータパーティショニングの検証。これらの結果は、予測モデリングおよび説明可能性分析のためのデータセットの前処理と準備が成功していることを裏付けています。 この図の拡大版はこちらをクリックしてご覧ください。

4. 説明可能なAIフレームワークのシステムアーキテクチャ

  1. モジュール処理を促進し、ワークフローの透明性を向上させ、再現可能な実装をサポートするために、レイヤーアーキテクチャを用いてフレームワークを組織します。生の医療データセットを受信・管理するためにデータレイヤーを設定しましょう。前処理作業を開始する前に、すべての受信データセットをデータレイヤー経由でルーティングしてください。
  2. 前処理層内でのデータクリーニング、変換、正規化、特徴工学、エンコーディング手順を実行します。モデル開発前にすべての前処理作業が完了していることを確認しましょう。
  3. 機械学習および深層学習アルゴリズムを用いてモデリング層内で予測モデルを開発します。前処理データセットと最適化されたハイパーパラメータ構成を用いて、勾配ブースティング、ランダムフォレスト、多層パーセプトロン(MLP)、畳み込みニューラルネットワーク(CNN)モデルを行使します。
  4. 説明可能性レイヤー内で説明可能性技術を適用してモデル予測を解釈します。構造化データセットに対してSHAPとLIMEを用いて特徴帰属の説明を生成する。画像ベースモデル向けにGrad-CAMヒートマップを作成し、モデル予測に寄与する領域を可視化します。
  5. 評価層内で予測および説明可能性のパフォーマンスを評価します。正確性、正確性、リコール率、F1スコア、ROC-AUC、忠実度、安定性、臨床医中心の評価指標を計算します。すべての評価結果を記録し、後の分析と報告に備えてください。
  6. 可視化レイヤー内で臨床的に解釈可能な視覚出力を生成します。パフォーマンス比較プロット、特徴重要度の可視化、SHAPサマリープロット、LIME説明、Grad-CAMヒートマップ、臨床医向けのレポートダッシュボードを作成します。すべての視覚的出力を最終実験報告書に含めるために保存してください。
  7. ワークフロー実行を進める前に、 図2 に示されたフレームワーク全体のアーキテクチャを必ず確認してください。
  8. 期待されるアウトプット - 勾配ブースティング、ランダムフォレスト、CNN、MLPアーキテクチャを含む、完全に訓練された機械学習および深層学習モデルを生成します。モデル構成、最適化されたハイパーパラメータ、トレーニングログ、チェックポイントファイル、説明可能性の出力、可視化アーティファクトを保存し、その後の評価および解釈可能性分析に備えます。

figure-protocol-2
図2:医療分析のための説明可能なAIフレームワークのシステムアーキテクチャ。この図の拡大版はこちらをクリックしてご覧ください。

5. ワークフロー実行

  1. 公開されているリポジトリから医療データセットを取得し、機械学習や深層学習に適した構造化形式でデータセットを保存します。実験手順を開始する前に 、図3 に示されたワークフロー全体を確認してください。
  2. セクション3に記載された手順に従ってデータクリーニングおよび前処理を実施してください。適切なスケーリング手法で数値変数を正規化します。適切な符号化技術を用いてカテゴリ変数を符号化します。データセット固有の補完戦略を用いて欠損値を特定し補完します。モデル開発を進める前に、データの品質、特徴ラベルの整合性、データセットの完全性を確認しましょう。
  3. 各データセットをトレーニング、検証、テストのサブセットに分割し、偏りのないモデル評価をサポートします。データセット分割時にクラス分布を保持し、該当する場合は漏洩防止対策を実装します。テストのサブセットは最終モデル評価専用に予約してください。
  4. グラデーションブースティングやランダムフォレストなどのアンサンブルベースのアルゴリズムを用いて構造化データセット上で機械学習モデルを訓練します。空間画像特徴を学習可能な畳み込みニューラルネットワーク(CNN)アーキテクチャを用いてイメージングデータセット上でディープラーニングモデルを訓練します。トレーニング中にモデルパラメータを反復更新し、各トレーニングエポック後に検証性能を監視します。検証性能が悪化したり、あらかじめ定められた停止基準に従って改善しなかった場合は早期停止を適用してください。
  5. グリッド探索やランダム化探索を含む体系的な探索戦略を用いてモデルのハイパーパラメータを最適化します。学習率、推定量数、木の深さ、バッチサイズ、エポック数、その他モデル固有のパラメータを検証性能に応じて調整します。検証データセット全体の予測性能と一般化能力に基づいて最終モデルを選択します。
  6. モデルトレーニングを終えた後、説明可能性の手法を適用してください。特徴帰属技術を用いて、モデル予測に最も強く寄与する変数を特定するためのグローバルな説明を生成する。個々の予測ケースを分析し、サンプルレベルでのモデル挙動を評価するための局所的な説明を生成する。画像分類モデル用のGrad-CAMヒートマップを作成し、予測結果に寄与する画像の領域を強調します。すべての説明出力を保存し、後続の分析と報告のために保存してください。
  7. 精度、精度、リコール率、F1スコア、曲線下の受信者動作特性面積(ROC-AUC)を用いて予測性能を評価します。説明の質を忠実度と安定性指標を用いて、説明の信頼性や一貫性を評価します。データセットと説明可能性手法をまたいでモデルのパフォーマンスを比較し、フレームワークの堅牢性と一般化可能性を評価します。
  8. 可視化出力や分析レポートを生成し、臨床的に解釈可能な方法で結果を伝えます。パフォーマンス比較チャート、特徴重要度プロット、SHAP要約可視化、LIME説明出力、Grad-CAMヒートマップ、その他臨床関連の可視化を作成します。報告前にすべてのビジュアル出力を確認し、明確さと一貫性を確保してください。
  9. すべての前処理操作、モデル設定、ハイパーパラメータ設定、説明可能性手順、検証戦略、評価結果を記録します。詳細な実験記録を維持し、ワークフローの再現性と独立した再現性を促進します。繰り返しの実験実行で結果の一貫性を確認し、すべてのワークフローの成果物をアーカイブして将来の参照に備えましょう。
  10. 期待出力 - 最適化されたハイパーパラメータ、保存されたモデル重み、トレーニングログ、パフォーマンス指標、説明可能性の出力(SHAP説明、LIME説明、Grad-CAMヒートマップを含む)を備えた完全に訓練済みの予測モデルを生成する。すべてのモデル成果物、評価レポート、可視化出力を保存し、後続の分析および再現性評価に備えます。

figure-protocol-3
図3:説明可能なAIパイプラインのエンドツーエンドワークフロー。この図の拡大版はこちらをクリックしてください。

6. モデル評価と説明可能性評価

  1. 精度、精度、リコール率、F1スコア、受信者の曲線下の操作特性面積(ROC-AUC)などの標準的な分類指標を用いて予測モデルのパフォーマンスを評価します。全体の分類正確性を測定するために精度を計算します。
  2. 正しく特定されたポジティブ予測の割合を評価するために精度を計算します。リコール率を計算し、モデルが陽性症例を特定できる能力を評価します。正確さと呼び起こしのバランスを取るためにF1スコアを計算します。異なる分類閾値間での識別性能を評価するためにROC-AUCを計算します。
  3. これらの評価指標をすべてのデータセットとモデルアーキテクチャに一貫して適用し、客観的なパフォーマンス比較を促進します。すべての指標値を記録し、評価結果を保存して後続の統計分析と報告に備えます。
  4. 忠実度と安定性の指標を用いて説明可能性のパフォーマンスを評価します。生成された説明がモデルの予測や意思決定行動をどの程度正確に反映しているかを判断するために忠実度を計算します。
  5. 類似した入力サンプルから生成された説明を比較し、説明出力の一貫性を定量化することで安定性を計算します。モデルの説明を解釈する前に、忠実度と安定性の値があらかじめ定められた品質基準を満たしているかを確認してください。
  6. SHAP、LIME、Grad-CAMの出力における説明可能性パフォーマンスを比較します。
  7. 期待成果 - 正確性、精度、リコール率、F1スコア、ROC-AUC、忠実度、安定性指標を含む定量的評価結果を生成します。科学的報告、再現性評価、臨床的解釈に適した説明可能性の成果物や可視化を作成すること。

7. 人間中心の評価

  1. 医師6名、放射線科医3名、臨床データアナリスト3名の計12名の医療専門家を採用します。臨床意思決定、医療画像解釈、医療分析、または電子カルテレビューの経験がある参加者を選定します。評価手続きを開始する前に、すべての参加者からインフォームドコンセントを取得してください。
  2. モデルトレーニングと説明可能性分析が完了した後、テストデータセットから100件のケースをランダムに選びます。各ケースに対して2つの評価条件を生成します:
    1. 予測のみの出力と
    2. 予測には説明可能性の情報が添えられます。ケースの提示順や評価条件をランダム化し、提示バイアスや学習効果を最小限に抑えましょう。
  3. 予測結果、説明文、評価アンケートを含む標準化された評価フォームを作成しましょう。コンピュータベースの評価インターフェースを用いて、参加者一人ひとりにケースを提示します。
  4. 参加者には、他の評価者と回答を話し合わずに、各ケースを独立してレビューするよう指示します。参加者がすべての評価を同一の実験条件下で完了できるようにします。
  5. 公開されている説明可能な人工知能評価研究を基にした5ポイントリッカートスケール質問票を実施します。各レビューされた事例に対して、参加者に信頼度、解釈可能性、使いやすさを評価するよう指示します。アンケート回答は電子的に記録し、すべての調査項目の完了を確認してから統計分析に進みます。
  6. 評価過程で臨床的有用性の客観的指標を測定します。参加者の意思決定を対応する参照ラベルや根拠のある結果と比較することで、意思決定の合意を記録します。意思決定合意を、参加者の意思決定のうち参照結果に一致する割合として計算します。
  7. ケース発表から最終回答提出までの間隔を測定して、各ケースのレビュー時間を記録します。予測のみと説明付き予測条件の平均レビュー時間を別々に計算します。
  8. すべての参加者および評価ケースにおける平均信頼度、解釈可能性、ユーザビリティスコアを計算します。予測のみ条件下と説明付き予測条件下で得られたスコアを比較します。
  9. すべての参加者評価終了後にペアt検定を行い、信頼度、解釈可能性、ユーザビリティ、意思決定合意、レビュー時間の差異が統計的に有意かどうかを判断します。すべての統計比較には、p 0.05の有意閾値を用いてください。
  10. 全参加者の回答を集めた後、評価者間の合意度を評価するためにFleiss Kappaを計算します。集計された参加者評価を用いて、レビュアー間の評価の一貫性を判断します。Fleiss Kappaの価値を確立された合意ガイドラインに従って解釈し、その結果得られる合意統計を記録します。
  11. 参加者の人口統計、評価方法論、アンケート設計、統計分析手順、客観的業績指標、評価者間合意結果を表 4にまとめます。
  12. 両方の評価条件下でのモデル出力をレビューし、参加者の回答を条件間で比較します。説明が意思決定の質に悪影響を与えつつ、信頼度、解釈性、使いやすさを向上させることを確認してください。
  13. 計算されたフライス・カッパ統計量を用いて参加者評価の一貫性を確認します。すべての評価結果を記録し、後続の報告および再現性評価のために行ってください。
  14. 期待成果 - 臨床医の信頼スコア、解釈可能性評価、ユーザビリティ評価、意思決定合意指標、レビュー時間統計、ペアt検定結果、評価者間合意統計を生成します。説明可能な人工知能フレームワークの臨床的有用性、解釈可能性、信頼性を説明する定量的証拠を作成します。
パラメータ価値
専門家12
医師6
放射線科医3
臨床データアナリスト3
審査された事件100
評価設計ランダム化(予測のみ vs 予測+説明)
測量機器5点リッカート尺度
信託評価解釈可能性、信頼性、使いやすさ
統計検定ペアt検定(p 0.05)
審査者間信頼性フライス・カッパ
目的指標決定合意書、審査時間

表4:人間中心評価プロトコルおよび臨床医評価設計。

この表は、説明可能なAIシステムの解釈可能性、信頼性、使いやすさを評価するために用いられる臨床医の評価フレームワークを示しています。参加者の人口統計、症例レビューの方法論、調査設計、統計分析手順、評価者間信頼性評価、客観的評価指標に関する情報をまとめています。

8. 検証および再現性評価

  1. 提案されたフレームワークの堅牢性と信頼性を評価するために検証およびアブレーション研究を実施します。選択された説明可能性の手法を用いて、重要度の高い特徴を特定します。重要な特徴を段階的に除去し、各特徴除去ステップ後に予測モデルを再学習させます。
  2. 各アブレーション実験後に、精度、リコール、F1スコア、ROC-AUC指標を用いてモデルのパフォーマンスを評価します。得られた性能値とベースラインモデルのパフォーマンスを比較し、個々の特徴が予測結果にどれだけ寄与しているかを判断します。
  3. SHAP、LIME、Grad-CAMを用いて類似入力サンプルの説明を生成することで説明の安定性を評価します。繰り返し評価を経て説明出力を比較し、あらかじめ定義された安定性指標を用いて整合性を定量化します。説明がわずかな入力の変動や繰り返しの実験実行でも安定していることを確認しましょう。
  4. ワークフロー全体を通じてすべての実験手順を記録してください。データの前処理操作、データセットの分割手順、モデルアーキテクチャ、ハイパーパラメータ設定、訓練設定、説明可能性手法、検証戦略、評価指標のドキュメント化。すべての構成パラメータと実験出力を構造化形式で保存し、再現性と独立した検証を容易にします。
  5. すべての実験記録を確認し、完全性と一貫性を確保してください。ワークフローが文書化された手順、設定ファイル、ソフトウェア仕様を使って再現可能かどうかを確認しましょう。将来の研究に適応し、JoVEの方法論要件に沿ったビデオベースの実験プロトコルへの移行を支援するために、モジュール化されたワークフロー構造を維持します。

9. 再現性リソース

  1. すべての実験は固定されたランダムシードを使用して実行し、繰り返し実行に越えて再現可能な結果を確保します。ソースコード、前処理スクリプト、設定ファイル、環境仕様、モデルパラメータ、可視化スクリプトを公開リポジトリ内で維持します。
  2. データセット取得、前処理、実験実行、モデルトレーニング、説明可能性生成、検証手順、報告されたすべての表と図の再生成に関する詳細な指示を提供します。ソフトウェア仕様、前処理ワークフロー、設定ファイル、データセットアクセス指示、モデルチェックポイント、可視化資産など、独立したレプリケーションに必要なすべてのワークフローコンポーネントをアーカイブします。
  3. 表5に、フレームワーク全体で使用されるソフトウェアリソース、前処理ワークフロー、設定ファイル、データセットアクセス指示、再現性資産を要約します。
  4. 期待されるアウトプット - 前処理スクリプト、設定ファイル、訓練済みモデル、モデルチェックポイント、説明可能性の出力、検証レポート、可視化アーティファクト、ソフトウェア仕様、提案フレームワークの独立した再現と検証に必要なドキュメントを含む完全な再現可能な実験パッケージを生成すること。
リソース概要
ソースコードデータ前処理、モデルトレーニング、説明可能性、評価のためのPython実装スクリプト
環境ファイルrequirements.txtパッケージ依存関係とバージョンを含みます
設定ファイルモデルアーキテクチャの設定、ハイパーパラメータ、実験構成
固定されたランダムシード再現性実験に使用されるシード = 42
データセットアクセス手順公的医療データセット取得のためのリンクと手順
前処理スクリプトデータクリーニング、正規化、エンコーディング、機能選択のためのスクリプト
図形生成スクリプトすべての写本図を再生するスクリプト
テーブル生成スクリプト報告されたテーブルや指標を再現するスクリプト
入力例サンプルデータセットと入力ファイル
出力例予測結果、説明、評価報告

表5:再現性資源および実験資産。

この表は、実験的再現性を支援するために提供されたリソースをまとめており、ソースコード、前処理スクリプト、設定ファイル、環境仕様、データセットアクセス命令、固定ランダムシード設定、図生成スクリプト、報告結果の再現に必要な入出力ファイルの例などが含まれます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結果

私たちは、構造化臨床データや医療画像を含むさまざまな種類の医療データに対して、説明AIの要素を徹底的に評価しました。結果は評価されたデータセット全体で一貫した予測性能を示しました。テストされたモデルの中で、勾配ブースティングモデルが最も高い97.4%の精度を達成し、次いでランダムフォレストモデルが94.2%でした。画像セットに適用した深層学習手法は91.3%の精度を達成したのに対し、多層パーセプトロンモデルはわずかに低い90.8%の結果を得ました。これは、アンサンブルベースの機械学習モデルが構造化された医療データで最も効果的に機能する一方、ディープラーニングアーキテクチャがイメージングタスクで優れていることを示唆しています。 表6は 、予測関数の精度、精度、リコール率、F1スコアなどのさまざまな性能指標、さらに忠実度や安定性などの説明可能性指標を詳細に示しています。これらの性能数値は、5重クロスバリデーションを用いて結果を平均値(95%信頼区間付き)として提示することで導き出しました。信頼区間はモデルの不確実性を示すだけでなく、データセ...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

ディスカッション

本研究は、予測モデリング、説明可能性評価、臨床医中心の評価、再現性リソースを単一のプロトコル内に統合した、医療分析のための再現可能な説明可能人工知能(XAI)ワークフローを開発し評価しました。結果は、特にグラデーションブースティングやランダムフォレストなどのアンサンブルベースの機械学習モデルが、評価された構造化医療データセットにおいて最も高い予測性能を達成した一方、深層学習モデルは画像ベースの解析により適していることを示しました。これらの発見は、より複雑なモデルが常に優れた性能をもたらすと仮定するのではなく、データ特性に基づいてモデルアーキテクチャを選択する重要性を強調しています。この研究の重要な貢献は、予測モデリング、説明可能性評価、人間中心の評価、再現性実践を標準化されたワークフローに統合したことです。説明可能性技術を個別に評価する研究とは異なり、提案されたフレームワークは多様な医療データセット間で透明かつ再現可能な実験を支援するプロトコル駆動型の手法を提供します。

説明可能性分析では、評価された手法間で測定可...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

著者らは、本研究に関して競合する財政的利益や利益相反はないと宣言しています。この調査は、利益相反とみなされる可能性のある商業的または財務的関係を一切持たずに独立して行われました。

人工知能利用開示

言語の洗練、文法チェック、原稿作成中の編集支援には人工知能ツールが使用されました。すべての科学的内容、実験デザイン、データ分析、解釈、最終論文の検証は著者自身によって行われました。著者らは、すべてのAI支援出力をレビュー・検証し、正確性、完全性、ジャーナルガイドラインへの適合性を確保しました。

謝辞

著者らは、本研究を実施するために必要なインフラと研究支援を提供してくださった各機関に感謝申し上げます。著者らはまた、提案された説明可能なAIフレームワークの開発と評価を容易にした公開データセットやオープンソースツールの利用も認めています。人間中心の評価段階で貴重な洞察を提供してくださった分野の専門家に特別な感謝を申し上げます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

材料

```html
この記事で使用された材料の一覧
名前会社カタログ番号コメント
GPU WorkstationメーカーによるNA深層学習モデルのトレーニング
Jupyter NotebookProject Jupyter最新安定版対話型実験実行
LIMELIMEバージョン 0.2.0局所的な解釈可能な説明
MatplotlibMatplotlib Projectバージョン 3.9データ可視化
MIMIC-III データベースPhysioNetバージョン 1.4電子健康記録分析
NIH Chest X-ray データセットNIH Clinical Center公開データセット胸部疾患分類
NumPyNumPy 開発者たちバージョン 1.26数値計算と配列操作
OpenCVOpenCV Foundationバージョン 4.10画像前処理
PandasPandas 開発チームバージョン 2.1データ操作と前処理
Pima Indians Diabetes データセットUCI 機械学習リポジトリ公開データセット糖尿病リスク予測
Python 3.11Python Software Foundationバージョン 3.11主要なプログラミング環境
Scikit-learnscikit-learnバージョン 1.5機械学習アルゴリズムと評価
SeabornSeabornバージョン 0.13統計可視化
SHAPSHAPバージョン 0.46特徴量帰属と説明可能性
TensorFlowTensorFlowバージョン 2.15ディープラーニングモデル開発
Windows / Ubuntu LinuxMicrosoft / CanonicalNAオペレーティングシステム
Wisconsin Breast Cancer データセットUCI 機械学習リポジトリ公開データセット乳がん診断
```

参考文献

  1. Lundberg SM, et al. From local explanations to global understanding with explainable AI for trees. Nat Mach Intell. 2020;2(1):56-67.
  2. Ribeiro MT, Singh S, Guestrin C. Why should I trust you. Explaining the predictions of any classifier. Presented at: Proceedings of the 22nd ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2016. p. 1135-44. doi:10.1145/2939672.2939778.
  3. Selvaraju RR, et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 2020;128(2):336-59.
  4. Tjoa E, Guan C. A survey on explainable artificial intelligence: Toward medical XAI. IEEE Trans Neural Netw Learn Syst. 2021;32(11):4793-813.
  5. Samek W, et al. Explainable AI: Interpreting, Explaining and Visualizing Deep Learning. Springer; Cham; 2019.
  6. Arrieta AB, et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 2020;58:82-115.
  7. Holzinger A, et al. Causability and explainability of artificial intelligence in medicine. Wiley Interdiscip Rev Data Min Knowl Discov. 2020;10(5):e1312.
  8. Topol E. Deep medicine: How artificial intelligence can make healthcare human again. Nat Med. 2020;25:44-56.
  9. Esteva A, et al. A guide to deep learning in healthcare. Nat Med. 2019;25(1):24-9.
  10. Rajpurkar P, Chen E, Banerjee O, Topol EJ. AI in health and medicine. Nat Med. 2022;28:31-38.
  11. Doshi-Velez F, Kim B. Towards a rigorous science of interpretable machine learning. arXiv. 2021. doi:10.48550/arXiv.1702.08608.
  12. Molnar C. Interpretable Machine Learning. Lulu Press; 2022.
  13. Rudin C. Stop explaining black box machine learning models for high-stakes decisions and use interpretable models instead. Nat Mach Intell. 2019;1(5):206-15.
  14. Zhang Q, Zhu S. Visual interpretability for deep learning: A survey. Front Inf Technol Electron Eng. 2020;21:27-39.
  15. Holzinger A, Biemann C, Pattichis CS, Kell DB. What do we need to build explainable AI systems for the medical domain. arXiv. 2020. Available at: https://arxiv.org/abs/1712.09923.
  16. McDermott MB, et al. Reproducibility in machine learning for health. Nat Med. 2021;27:1016-23.
  17. Kelly CJ, et al. Key challenges for delivering clinical impact with AI. BMC Med. 2019;17:195.
  18. Ahmad MA, Teredesai A, Eckert C. Interpretable machine learning in healthcare. Proc ACM Conf Health Inference Learn. 2021;4:1-7.
  19. Ghassemi M, Oakden-Rayner L, Beam AL. The false hope of current approaches to explainable AI in healthcare. Lancet Digit Health. 2021;3(11):e745-50.
  20. Carvalho DV, Pereira EM, Cardoso JS. Machine learning interpretability: A survey on methods and metrics. Inf Fusion. 2020;58:82-115.
  21. Chen RJ, et al. Synthetic data in healthcare: A narrative review. Nat Biomed Eng. 2021;5:493-97.
  22. Zhou B, et al. Learning deep features for discriminative localization. Presented at: Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition; 2016. p. 2921-29.
  23. Vellido A. The importance of interpretability and visualization in machine learning for applications in medicine and health care. Expert Syst Appl. 2020;146:113222.
  24. Lipton ZC. The mythos of model interpretability. Commun ACM. 2018;61(10):36-43.
  25. Guidotti R, et al. A survey of methods for explaining black box models. ACM Comput Surv. 2018;51(5):93.
  26. Suresh H, Guttag J. A framework for understanding unintended consequences of machine learning. Commun ACM. 2021;64(12):42-50.
  27. Wiens J, et al. Do no harm: A roadmap for responsible machine learning for health care. Nat Med. 2019;25(9):1337-40.
  28. Rajkomar A, Dean J, Kohane I. Machine learning in medicine. N Engl J Med. 2019;380(14):1347-58.
  29. Lundberg SM, Lee SI. A unified approach to interpreting model predictions. Presented at: Advances in Neural Information Processing Systems. 2017;30:4765-74.
  30. Agarwal R, et al. Neural additive models: Interpretable machine learning with neural nets. Presented at: Advances in Neural Information Processing Systems. 2021;34:4699-711.
  31. Singh C, Murdoch WJ, Yu B. Hierarchical interpretations for neural network predictions. Proc Natl Acad Sci U S A. 2020;117(32):19950-57.
  32. Tonekaboni S, Joshi S, McCradden MD, Goldenberg A. What clinicians want: Contextualizing explainable machine learning for clinical end use. Nat Mach Intell. 2019;1(5):176-85.
  33. Wang F, Preininger A. AI in health care: Applications, challenges, and future directions. Annu Rev Biomed Data Sci. 2019;2:221-52.
  34. Azizi S, et al. Big self-supervised models advance medical AI. Nat Med. 2021;27(8):1431-42.
  35. Zhang Y, et al. Explainable deep learning for healthcare: Methods, applications and challenges. IEEE Access. 2020;8:120455-475.
  36. Holzinger A, et al. Explainable AI methods: A brief overview. Mach Learn Knowl Extr. 2021;3(2):606-27.
  37. Rudin C, Radin J. Why are we using black box models in AI when we do not need to  A lesson from an explainable AI competition. Nat Mach Intell. 2019;1(5):206-15.
  38. Doshi-Velez F, et al. Accountability of AI Under the Law: The Role of Explanation. Harvard University; Cambridge; 2020.
  39. Kaur H, et al. Interpreting interpretability: Understanding data scientists' use of interpretability tools for machine learning. Presented at: Proceedings of the CHI Conference on Human Factors in Computing Systems; 2020. p. 1-14.
  40. Caruana R, et al. Intelligible models for healthcare: Predicting pneumonia risk and hospital 30-day readmission. Presented at: Proceedings of the ACM SIGKDD International Conference on Knowledge Discovery and Data Mining; 2015. p. 1721-30.
  41. Mangalote IAC, et al. Development and validation of a class imbalance-resilient cardiac arrest prediction framework incorporating multiscale aggregation, ICA and explainability. IEEE Trans Biomed Eng. 2025;72(5):1674-84.
  42. Ansari MY, Mangalote IAC, Masri D, Dakua SP. Neural network-based fast liver ultrasound image segmentation. Presented at: 2023 International Joint Conference on Neural Networks; 2023. p. 1-8.
  43. Dakua SP, et al. Artificial intelligence enabled biomineralization for eco-friendly nanomaterial synthesis: Charting future trends. Nano Select. 2025;6(5):e202400118.

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

タグ

233 233 XAI