レビュー記事

目視検査のための説明可能な AI: 比較分析とレビュー

DOI:

10.3791/69440

2025年10月10日

この記事について

サマリー

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このレビューでは、産業および医療領域における目視検査のための説明可能なAI(XAI)手法を統合します。PRISMAに基づく検索により、75件の研究が特定され、ドメイン固有の分類法と標準化された指標を使用した比較分析が通知されました。私たちは、証拠に裏付けられた分類法と、ツール選択のための実務家指向のワークフローを提供します。

要約

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

説明可能な人工知能 (XAI) 技術は、ブラックボックス機械学習モデルを理解しやすくすることで、自動外観検査システムの透明性と信頼性を可能にします。XAI は広く適用されていますが、以前のレビューでは、産業検査および医療検査タスクの特定の要求には対応していませんでした。この論文では、産業および医療領域にわたる目視検査にXAI技術を適用した研究をレビューします。IEEE Xplore、Scopus、PubMed、arXiv、Web of Science で、2014 年から 2025 年の間に発表された研究について体系的な検索が実施され、包含基準として、公開またはドメイン固有のデータセットを使用した検査タスクに XAI を適用することが要求されました。最初の研究プールから 75 件が含まれ、事後研究と内因性研究に分類され、忠実度、堅牢性、複雑さ、およびローカリゼーションの精度に関して評価されました。結果は、勾配および伝播ベースの手法は、粗い局在化ではあるものの、ほぼリアルタイムの検査に適した効率的な視覚的説明を提供するのに対し、摂動ベースの手法と代理モデル手法は、より高い計算コストでより詳細な帰属を提供しますが、堅牢性は低下することを示しています。さらに、プロトタイプベースのネットワークとセルフアテンションアーキテクチャは、解釈可能性と予測パフォーマンスの間のトレードオフを示しています。最も効果的なXAI方法を選択することは、万能ではありません。これは、データセット、レイテンシー、解釈可能性のニーズによって異なります。このレビューでは、目視検査のためのXAI手法の統一された分類法を紹介し、標準化された指標を使用して産業領域と医療領域の両方でさまざまなアプローチを比較し、実践者が最適な方法を選択する際のガイドとなるタスクベースの選択ワークフローを提案します。これまでのレビューと比較して、この研究は定量的ベンチマークに基づいたクロスドメイン比較分析を提供し、標準化された評価とユーザー中心の検証の方向性を概説します。

概要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

製造、自動車、食品包装、製薬、ヘルスケアなどの業界では、製品やシステムが適切かつ安全に機能していることを確認することが不可欠です。自動化および機械学習ツールは、人間のオペレーターが行う従来の目視検査や初歩的なカメラベースのシステムを超えて、精度、生産速度、一貫性を向上させます1.AI検査により、リアルタイム監視2 とハイスループット環境での欠陥検出3が可能になり、人的エラーと運用コスト4が削減されます。特に機械学習(ML)とディープラーニング(DL)の進歩により、人工知能の使用により、欠陥を検出5、オブジェクトを分類し、複雑な視覚パターンを識別する自律システムが可能になりました6。最近では、畳み込みニューラルネットワーク(CNN)7、リカレントネットワーク、ビジョントランスフォーマー(ViT)が、表面探傷から医療画像における異常局在化までのタスクにおいて、ルールベースのシステムを上回っています。検査は、ルールベースのプロセスから、大規模なデータセットでトレーニングされたデータ駆動型モデルに移行しました8

多くの AI モデルは「ブラック ボックス」として機能するため、これらのモデルがどのように意思決定を行うかについての洞察はありません。この透明性の欠如はリスクをもたらします。たとえば、製造業では、予測を間違えると、無駄の増加、やり直し、製品のリコール、顧客の不満につながる可能性があります。医療画像処理では、誤分類は診断を遅らせたり、治療計画を損なったりする可能性があるため、より重要になります。これらのモデルの開発者でさえ、その出力を完全に説明できないことが多く、信頼と採用が制限されます。

ここで説明可能な AI (XAI) が不可欠になります。XAI は、機械学習モデルの決定を人間が解釈できるようにすることを目的とした方法とツールのグループです9。その目標は、ブラックボックス予測子を、その出力に人間が読める正当化を提供することで、透明な「ガラスボックス」システムに変えることです。実際には、XAI対応の検査システムは、欠陥検出にとどまらず、部品に欠陥のフラグを立てるだけでなく、フラグが立てられた理由も説明します。

文献が増えているにもかかわらず、コンピュータービジョンにおけるXAIに関する既存の調査の範囲は依然として限られています。多くは医療画像処理や工業検査に狭く集中しており、有用な分類法を提供していますが、標準化されたベンチマークなしで主に定性的な比較に依存しています。Nauta et al.10 などのより広範なレビューは、ドメインにとらわれない概要を提供しますが、実務家指向の選択フレームワークを提供するには至っていません。Chengらによるこれまでで最も包括的なコンピュータービジョン調査11 でさえ、分類法を進歩させ、忠実度やローカリゼーションの精度などの指標について議論していますが、それはビジョンタスク全体で一般的なままであり、目視検査、ハイスループット展開、またはヒューマンインザループ検証には特に対処していません。同様に、予後および資産管理のためのXAIの産業レビューは、PRISMAフレームワークを採用していますが、目視検査タスクではなく予後および健康管理(PHM)に焦点を当てています。

これらのギャップに対処するために、このレビューは次の点に貢献しています。

体系的な分類法: 産業および医療の両方の目視検査にわたる75の研究のPRISMAガイド付きレビュー。

比較分析: 複数のXAIメソッド(GradCAM、LRP、SHAP、LIME、RISE)を、削除/挿入AUC、ポインティングゲームの精度、安定性、レイテンシーなどの標準化された指標で、公開目視検査データセット(MVTec AD、PCBなど)でベンチマークします。

評価指標フレームワーク: XAI 手法の評価に使用される忠実度、堅牢性、解釈可能性、およびタスク固有の尺度の正式な定義と方程式。

実践的なガイダンス: ケーススタディと、タスクの種類、待ち時間、説明のニーズを特定の方法にリンクする実務家指向の選択ワークフロー。

これらの貢献を組み合わせることで、信頼できるガイダンスを求める研究者と実務家の両方を対象とした、目視検査のためのXAIの最もドメイン固有でベンチマークに基づいた合成が確立されます。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

レビューと展望

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

2. XAIフレームワーク

ほとんどの最先端の AI モデル、特にディープ ニューラル ネットワークは、ブラック ボックスとして扱われることがよくあります。彼らがどのように意思決定を行うかについてはほとんど可視性がありません12.透明性の欠如は、多様なアプリケーションにおける信頼と説明可能性の障壁となっています。その結果、XAI は信頼できる AI に欠かせない存在となっています。すべてのシナリオに適合する単一のアプローチはありません:モデル内部へのフルアクセスを前提とする方法もあれば、モデルを不変のブラックボックスとして扱う方法もあります。個々の予測に対して局所的な説明を優先するものもあれば、モデルの動作に関するグローバルな洞察を提供するものもあります。 図1に示すように、これらの考慮事項は、説明可能性が導入される時期に基づいて、XAI手法の2つの大きなカテゴリ、つまり事後説明法と固有の解釈可能性法13につながりました。事後方法は、モデルに依存しない方法とモデル固有の方法にさらに分類されます14

figure-protocol-1
図1:目視検査用のXAIフレームワーク。この図の拡大版を表示するには、ここをクリックしてください。

  1. Post-hoc explanation methods
    ポストホック手法は、モデルのトレーニング後に、アーキテクチャやパラメーターを変更することなく説明を生成します15.これらのアプローチは、実務家が高性能モデルを活用し、その成果を遡及的に説明できるため、人気があります16.ただし、基礎となるモデルは変更されないため、事後的な説明ではモデルの推論を近似または推測する必要があり、近似エラーと不安定性が生じる可能性があります17.次のセクションでは、モデル固有の方法と不可知論的な方法の両方について説明します。
    1. モデル固有
      これらの手法は、モデルの構造やトレーニングメカニズムに関する知識を利用して、そのモデルに合わせた説明を提供します。代表的な例は、ディープニューラルネットワークの勾配ベースのアトリビューションです。GradCAM(勾配重み付けクラス活性化マッピング)のような手法は、トレーニングされたCNNの内部勾配を使用して、特定の予測17にとって最も重要な入力画像の領域を強調表示する視覚的な「ヒートマップ」を生成します。GradCAMは、最終畳み込み層の特徴マップに関するターゲットクラススコアの勾配を計算し、これらの勾配を画像に投影して、クラス識別ローカリゼーションマップを生成します。他の勾配伝播方法は、さまざまなネットワークアーキテクチャに一般化されます。統合勾配(IG)18 は、ベースライン入力(空白画像など)から実際の入力までのパスに沿って勾配を蓄積し、特徴の帰属のための望ましい公理を満たします。DeepLIFT19 も同様に、参照活性化からの差を各レイヤーに伝播し、各入力特徴量の寄与度を推定します。レイヤーごとの関連性伝播(LRP)は、予測スコアをレイヤーごとに逆伝播し、各入力ピクセルまたは特徴20に「関連性」を分散します。要約すると、モデル固有の手法は、内部勾配、活性化、または注意を利用して、モデルの構造に密接に結合した説明を生成します。
    2. モデルに依存しない
      対照的に、モデルに依存しない手法では、モデルを出力を照会できるブラックボックスとして扱います。これらの手法は最小限の仮定を行い、通常は摂動入力に対するモデルの予測を取得できるだけで済みます。例としては、単純な解釈可能なモデル(スパース線形モデルや決定木など)を使用して、特定の入力21の近傍における複雑なモデルの振る舞いを模倣するLIME(Local Interpretable Model-Agnostic Explanations)が挙げられます。特定の予測に対して、LIMEは入力の多くの摂動バージョンを生成し、それぞれについてブラックボックスモデルの予測を取得し、それらの局所的な入出力関係を近似する重み付き線形回帰を学習します22。この代理線形モデルの係数は説明として機能し、どの特徴が予測を最も強く駆動するかを示します23。LIME の魅力は、その柔軟性 (どの分類器でも使用可能) と直感的な出力 (たとえば、重み付けされた特徴の小さなセット) にあります。SHapley Additive exPlanations (SHAP) も、ゲーム理論24 に基づく一般的なモデルに依存しない手法です。SHAPは、協調ゲーム理論からShapley値を近似する特徴属性を計算することによって個々の予測を説明し、加算性や一貫性などの特性を保証します25。特徴属性を超えて、モデルに依存しないアプローチには、画像モデルの視覚摂動手法も含まれます。RISE (Randomized Input Sampling for Explanation) は、入力画像の一部をランダムにマスクし、モデルの出力がどのように変化するかを観察することにより、重要度マップを生成します26。RISEは、そのようなマスクを多くサンプリングすることにより、どのピクセルまたは領域が予測に最も影響を与えたかを示す確率的顕著性マップを構築します26。特に、RISEはモデル内部にアクセスする必要がなく、変更された入力でモデルを評価する機能のみを必要とするため、真のブラックボックスになります。最後に、モデルに依存しないXAIの分野は、反事実的な説明に焦点を当てています。反事実的な説明は、特徴の重要性を列挙するのではなく、「入力に対する最小限の変更でモデルの予測が変更されたか」という質問に答えます。27.反事実を生成するアルゴリズムは、通常、変更にリアリズムとスパース性を強制しながら、目的の出力を生成する最も近い例を入力空間(または学習された潜在空間)で検索します。要約すると、ポストホック XAI 手法は、予測能力とある程度の透明性を組み合わせて、トレーニング後に高性能モデルに適用できるため、広く採用されています。
  2. 固有の解釈可能性の方法
    本質的な方法は根本的に異なるアプローチを採用しており、ブラックボックスを事後に説明するのではなく、これらの方法はモデルを設計上解釈可能にします。自己説明ニューラルネットワーク(SENN)は注目すべき例です。Alvarez-Melis と Jaakola28 によって提案された SENN フレームワークでは、ニューラル ネットワークは、最初に一連の中間概念の活性化を計算し、次にそれらの概念の単純で説明可能な関数として予測を生成するように構成されています。ProtoPNet(Prototypical Part Network)は、各クラスの学習されたプロトタイプ表現のセットと入力を比較することによって入力を分類するディープネットワークです。例えば、画像分類タスクにおいて、ProtoPNetはプロトタイプパッチを学習し、入力29によって最も活性化されるプロトタイプを見つけることによって決定を下すことができる。シーケンス モデルとトランスフォーマーの分野では、アテンション メカニズムも本質的な解釈可能性に活用されています。一部のモデルは、アテンションアライメント目標を使用してトレーニングされており、モデルのアテンションの重みが既知の重要な特徴または人間がラベル付けした関連領域に対応するように促します。これらのアプローチは、注意を「正しい理由で正しい」ように導くことによって30、優れたパフォーマンスを発揮するだけでなく、説明として直接解釈できる注意分布を持つモデルを生成します。さらに、そのようなモデルは、説明が外部の事後近似からではなく、モデル自身の解釈可能な構造から生成されるので、通常、構成によって忠実な説明を提供する31

3. XAIの分類

研究状況を構造化して統合するために、PRISMAガイドラインを使用して体系的な文献レビューを実施しました(図2)。このプロセスには、複数の学術データベース(Scopus、Web of Science、IEEE Xplore、SpringerLink、PubMed、arXiv、MDPI)が含まれ、「説明可能なAI」、「解釈可能性」、「目視検査」、「欠陥検出」、「異常検出」、「製造」、「医療画像」を組み合わせた一連の検索用語によって導かれました。包含基準では、論文が目視検査のコンテキスト(産業または医療)でXAI法を明示的に適用または評価し、十分な方法論的詳細を報告することが求められました。除外基準は、実装されていない純粋に理論的な提案や、目視検査以外の作品を削除しました。検索では当初、483 件のレコードが取得されました。重複を削除し、タイトルと要約を審査した後、147 件が全文レビューのために残りました。包含/除外基準を適用したところ、75件の一次研究が得られ、これが本レビューの基礎となった。

figure-protocol-2
図2:PRISMAガイドラインに従ったシステマティックレビュープロセスのPRISMAフロー図。 この図は、各段階で特定、スクリーニング、および除外された記録を示しており、最終レビューに含まれる75件の一次研究が得られました。 この図の拡大版を表示するには、ここをクリックしてください。

  1. レビューされた研究の応用分類法
    セクション2で紹介した概念的枠組み(事後的および本質的アプローチ)に基づいて、これら75の研究から導き出されたドメイン固有の分類法を改良しました。この応用分類法は、 図3に示すように、目視検査タスクでの実装に応じて方法を区別します。
  2. 分類学全体にわたる研究の分布
    75件の研究の完全な分布を 表1にまとめる。各研究は、その方法論的カテゴリとアプリケーション領域にマッピングされます。これは、セクション4で提示された比較分析の経験的基盤を提供します。
  3. 合成
    このシステマティックレビューから、いくつかの明確な傾向が明らかになりました。まず、 勾配ベースの事後方法は 、その効率性と統合の容易さにより、依然として産業および医療検査タスクで最も広く採用されています。第二に、 摂動ベースの手法 は、より豊富な特徴属性を提供しますが、計算要求のため、高スループットの産業環境ではあまり一般的ではありません。第三に、 内因性的な方法 が注目を集めているものの、依然として過小評価されており、それらを実装している研究は 15% 未満です。
    このセクションでは、この分類法を再現可能なPRISMAガイド付きレビューに固定し、75件の研究の構造化データベースにリンクすることにより、検証済みのエビデンスベースを確立します。これらの調査結果は、標準化された指標(忠実度、堅牢性、遅延、ローカリゼーション精度)にわたって代表的な手法がベンチマークされるセクション 4の比較分析の準備を整えます。

figure-protocol-3
図3:目視検査タスクにおけるXAI手法の提案された分類法。この図の拡大版を表示するには、ここをクリックしてください。

XAIメソッドXAIアプローチ勉強産業
組み込みルールベースモデルと線形モデル32,33医療全般2015–2019
プロトタイプベース(ProtoPNet、Case-based、Deformable ProtoPNet) 29,34,35,36 医療, 産業用, 一般2018–2024
概念駆動型 (概念のボトルネック、正しい理由のための正しい) 30,31,37 一般、科学的応用2020–2021
自己説明型ニューラルネットワーク(SENN)28全般2018–2020
解散表現(β-VAE),SOXAI38,39全般2018
ビジョントランスフォーマー(注意による本質的な解釈可能性)404142434445コンピュータビジョン、製造2020–2024
事後、モデル固有CAMファミリー46474849505152535455565758医療画像処理、製造、自動車、農業、エレクトロニクス2018–2025
LRP(レイヤーごとの関連性伝播) 20,59,60,61,62 一般, 医用画像2015–2024
勾配と顕著性の方法(統合勾配、スムースIG、DeepLIFT、DeconvNet、T-Explainer、顕著性ベンチマーク)1819636465
66,67,68,69,70
一般, 医用画像2013–2025
特殊なモデルでのアトリビューション(SNN、トランスフォーマーのアテンションアトリビューション) 71,72,73 神経科学、ビジョントランスフォーマー2023–2025
事後、モデルに依存しないLIME & バリアント (LIME, ELIME, MASALA), SHAP &; VARIANTS (TREE SHAP),金融、予後と健康管理、サイバーセキュリティ、自動運転車、産業検査。2016–2025
21222324252774
75,76,77,78,79,80,81、
82,83,84,85,86
説明
ハイブリッド方式(GradCAM、SHAP、LRP、LIME)を含む複数のXAIメソッドの統合 58,87,88,89,90,91,92 工業検査、ヘルスケア、製造。2021–2025

表1:XAI法、年、業界、およびアプローチによる75のレビュー研究の分類。

4. XAIの評価指標

コンピューター ビジョン モデルのパフォーマンスは、精度、精度、再現率などの確立された指標によって判断されます。ただし、モデルの決定の説明可能性を評価することは、それほど単純ではありません。標準的な予測性能とは異なり、AI説明の質について普遍的に受け入れられている指標はありません66。言い換えれば、分類器の精度は正確に測定できるが、特定の画像分類93に対する説明がどれほど「良好」であるかを定量化するための合意されたスケールは存在しない。この格差は、XAI の分野における根本的なギャップ、つまり説明の評価方法を浮き彫りにしています。

標準化されたXAI評価基準の開発は非常に困難であることが証明されています。その理由の1つは、解釈可能性と説明の質が多面的で文脈に依存しているため、単一の普遍的な指標10に抵抗することです。説明を効果的に評価するには、アプリケーション ドメイン、生成された説明の性質、エンド ユーザーの背景など、いくつかの要因に依存します。例えば、医用画像診断に適した説明技術は、工業用目視検査タスク10で使用されるものとは異なって評価され得る。

実際には、標準的な指標がないため、研究者はさまざまな評価アプローチに依存するようになりました。多くの研究は、XAI法94,95の定性的で逸話的な評価に頼っています。著者がいくつかの顕著性マップまたはヒートマップを提示し、これらが合理的であると主張するのを見るのはよくあることです(いわゆる「面の妥当性」テスト)96。このような目視検査は、物語的な意味では説得力がありますが、依然として主観的であり、厳密な比較には不十分です97。これは、XAI メトリックを標準化することの難しさを示しています。合意された基準がない場合、研究者は各データセットまたはユースケースに合わせた指標を提案します。

その結果、このギャップを埋めることを目的とした多様なXAI評価指標が文献に豊富にあります98。多くのフレームワークと対策が提唱されており、それぞれが説明を有用にするものの特定の側面を対象としています99.大まかに言えば、指標は、その主な焦点に基づいて分類できます。忠実度ベースの指標は、モデル100の意思決定プロセスをどれだけ反映しているかによって説明を判断します。対照的に、解釈可能性中心の指標は、説明が人間の観察者にとってどれほど理解可能で説得力があるかを評価します101。3番目のカテゴリはタスクベースの指標であり、説明の評価はエンドユーザーのパフォーマンスへの影響に依存します102。4番目のカテゴリは、結果103の一貫性を評価する堅牢性指向の指標です。最後に、ハイブリッド指標は複数のディメンションを組み合わせます104

この指標の多様性は、研究者が重要と考える説明可能性の側面を示していますが、単一の基準の欠如も浮き彫りにしています:各指標は説明の質の1つの角度しか捉えていません105。以下では、XAIの評価指標の範囲を4つの主要なカテゴリにグループ化し、 表2にまとめます。

メトリックタイプメトリック式/定義
忠実度曲線下の削除領域(AUC)26figure-protocol-4
トップKの重要な機能です。より低い=より忠実
曲線下挿入面積(AUC)26figure-protocol-5
より高い=より忠実
不倫スコア103figure-protocol-6
低い=良い
咆哮106「重要な」特徴がない状態で再トレーニングすると精度が低下する
丈夫安定性指数107figure-protocol-7
より高い=より一貫性が高い
リプシッツスコア103figure-protocol-8
より低い=より堅牢
解釈可能性スパース性79figure-protocol-9
より低い=よりシンプル
代理の深さ79解釈可能なサロゲートの深さ (例: 決定木)。
浅い=単純
タスク固有交差オーバーユニオン(IoU)108figure-protocol-10
マスク M とグラウンドトゥルース G のオーバーラップ
ポインティングゲーム108精度 = #hits / #samples
より高い=良い
ハイブリッド総合スコア104忠実度、スパース性、堅牢性の重み付けされた組み合わせ

表2:目視検査におけるXAIの評価指標は、4つの主要なカテゴリに分類されます。

5. 比較分析

このセクションでは、MVTec AD109 (ピクセルレベルのマスクを使用した>5,000枚の欠陥画像)やDeepPCB110 (6つの欠陥クラスを持つ1,500枚のPCB画像)、CheXpert111 、ImageNet112 などの公開データセット間で手法を比較し、削除/挿入AUC(忠実性)、ポインティングゲームの精度(ローカリゼーション)、安定性スコア(摂動下での堅牢性)、およびレイテンシー(ランタイムコスト)の指標にわたって評価されます。

CAMベースの方法(GradCAM、GradCAM++)の場合、MVTec ADおよびDeepPCBの結果は、GradCAMが0.83〜0.87(挿入AUC~0.68、<削除時の精度低下15%)、感度(0.80〜0.85)、および実行時間<100ミリ秒(~39フレーム/秒(FPS)を達成していることを示しています。局在化は中程度のままです (平均 IoU ≈0.28 @ δ=0.25、ポインティング精度 86-87%)。GradCAM++ は、同様の遅延 (<120 ミリ秒) と高いユーザー信頼度 (109.69/250 対 GradCAM の 56.08/250) を維持しながら、マルチインスタンスのローカリゼーション (平均 IoU = 0.38) を改善します。これらの方法は効率的ですが、空間的に粗い 47,113 です。

摂動ベースの手法(LIME、SHAP、RISE)の場合、パフォーマンスはデータセットによって異なります。MVTec AD では、LIME は局所忠実度 R² = 0.70-0.80 に達しますが、低い堅牢性 (安定性指数 <0.5)、3-5 秒/画像の遅延、および中程度の局在化 (IoU = 0.25-0.35) を示します。PCB欠陥分類に適用されたSHAPは、強力なヒューマンアライメント(70-80%)で一貫した帰属(Δ対数オッズ= 0.2-0.3)を達成しますが、遅く(>1秒/画像)、局在化が弱い(IoU≈0.02-0.03)。MS-COCO でベンチマークされ、MVTec AD 用に複製された RISE は、平均 4,000-8,000 マスクされたフォワード パスを実現し、高い堅牢性 (安定性 >0.7)、忠実度 (0.78-0.82 AUC)、および優れたローカリゼーション (ポインティング ゲーム = 62.9% 対 GradCAM の 48.3%) をもたらしますが、1-2 秒/説明の遅延は 26,74,79,114 です。

関連伝播法(LRP、DeepLIFT)の場合、DeepPCBおよびCheXpertでの評価により、LRPは0.82〜0.90の忠実度、感度~0.85、および0.40〜0.50のローカリゼーションIoUを達成していることが示されています。実行時間は画像あたり100〜200ミリ秒で、CAMよりも遅いですが、ほぼリアルタイムの検査が可能です。CheXpert 放射線学のタスクでは、専門家の研究により、LRP ヒートマップと臨床的に関連する領域との間に >70% の重複があることが示されており、ドメイン全体で解釈可能性が実証されています60

ImageNetとCheXpertでトレーニングされたViTモデルの結果であるアテンションベースの方法(Transformers)の場合、生のアテンションマップの忠実度は0.75〜0.85になりますが、摂動下では不安定であり、感度は0.70〜0.75で、局在化は中程度です(IoU = 0.30-0.45)。人間の信頼は~60〜70%です。適応されたアプローチ (アテンション フロー、Transformer-LRP) は因果指標を改善し、削除/挿入とポインティング ゲーム スコア 40,115,116 で生の注意を上回ります。

プロトタイプおよび反事実ベースの方法の場合、MVTec ADの評価は、ProtoPNetが同様の欠陥ケースによって予測が正当化される模範ベースの説明を達成し、オペレーターの意思決定を支援することを強調しています。SOMベースのアプローチは、2Dマップ上の欠陥特徴をクラスター化し、トポロジー関係を維持します。PCB欠陥画像とCheXpertの両方でテストされた反事実手法は、実用的な推論(「亀裂の長さが1mm未満の場合、予測は正常にシフトする」)を提供しますが、コストのかかる最適化が必要であり、高解像度の入力に苦労します。これらの方法は人間の推論と強く一致していますが、規模は 117,118,119 に十分ではありません。

最後に、トレードオフと実際的な選択を考慮すると、CAM はレイテンシーが重要なワークフローを支配しますが、依然として粗いままです。LRP は忠実度と実行時間のバランスが取れており、ピクセル レベルの分析に優れています。RISE は、最も強力な因果関係の忠実性とローカリゼーションを提供しますが、遅延は秒単位です。SHAP と LIME は解釈可能性を高めますが、速度が遅く不安定です。プロトタイプと反事実は、人間のアライメントを最大化しますが、高解像度検査では拡張性が低くなります。トランスフォーマーベースのモデルには、生の注意を超えた特殊な適応が必要です。したがって、単一の方法が他の方法を普遍的に上回るものはありません。代わりに、メソッドの選択は、データセット、タスク、レイテンシー、予算、解釈可能性のニーズを反映する必要があります。 図4に示すように、選択ワークフローは、これらのベンチマークのうちの3つ(タスク、遅延、解釈可能性)を、目視検査でXAIメソッドを選択するためのタスク指向のガイドに統合しています。

figure-protocol-11
図 4:XAI メソッド採用のための選択ワークフロー。これは、目視検査における適切なXAI手法の選択をガイドする意思決定フローチャートです。ワークフローでは、タスクの種類(分類、セグメンテーション、異常検出、回帰)、レイテンシの制約、説明の詳細を考慮し、代表的な手法にリンクします。 この図の拡大版を表示するには、ここをクリックしてください。

6. 議論

  1. 比較調査結果
    私たちの分析によると、GradCAMやレイヤーワイズ関連伝播(LRP)などの勾配ベースの手法は、畳み込みネットワークの意思決定に最も影響を与える特定の画像領域を強調表示することに優れており、欠陥の位置特定や医用画像分類などのタスクに直感的なツールとなっています。これらのアプローチは 1 回の後方パスで動作するため効率的ですが、その説明は大まかであることが多く、複雑な領域では不明瞭になる可能性があります。対照的に、SHAP や LIME などのモデルに依存しない特徴属性技術は、摂動された入力でモデルをプローブしたり、ローカル サロゲートを適合させたりすることで、特徴の寄与度に関するより定量的な洞察を提供しますが、GradCAM よりも計算コストが高くなります。
    注意ベースの方法は、モデルの内部重みを利用して、モデル115内の焦点領域を強調表示する。一方、RISEは、入力をマスクしてサンプリングして柔軟な顕著性マップを生成するランダム化ベースの戦略を表しますが、何千ものフォワードパスが必要です。まとめると、これらの手法は特定の状況下で優れていますが、他の手法を普遍的に上回るものはありません26.代わりに、方法の選択は、モデル アーキテクチャ、目視検査タスク、遅延要件、および意思決定者が必要とする情報の種類によって異なります。
  2. 事例研究
    以下は、医療部門と産業部門の両方でXAIを実装した実際のケーススタディです。ヘルスケアでは、胸部X線とCTスキャンでトレーニングされた肺炎とCOVID-19の検出モデルがGradCAMとLIMEで説明され、ユーザー研究の放射線科医は、肺浸潤などの予想される病理と一致する強調領域がGradCAMを一貫して好んでいました120.同様に、頭頸部がんのデジタル病理学では、GradCAMと高解像度CAMによってサポートされたCNN予測は、病理学者が臨床的に関連していることを確認した悪性細胞クラスターを強調し、説明が臨床的精度と信頼の両方を強化することを示しました121
    製造部門のラインでは、XAI は精度と説明可能性に変革的な違いをもたらしました。主な用途の1つは、Xceptionアーキテクチャに基づく畳み込みニューラルネットワークを採用したタイヤのX線画像での異物検出です。勾配重み付けクラス活性化マッピング(GradCAM)を組み込むことで、システムは99%以上の分類精度を達成し、予測を担当する画像内の正確な領域を示すヒートマップを生成しました。これらの視覚的な説明により、QAエンジニアは、モデルの注意が無関係なアーティファクトではなく、タイヤの構造サポート内の正当な異常にあることを検証することができ、信頼性が大幅に向上し、一か八かの生産環境での展開が容易になりました48
    エレクトロニクス業界では、SolderNet アプローチは、ピクセルレベルの欠陥検査に XAI を統合することを示しています。CNNベースの方法は、高精度と説明可能性が要求されるプリント基板のはんだ接合部の検査のために開発されました。GradCAMとLayer-wise Relevance Propagation(LRP)を適用することで、特定の欠陥分類の原因となるピクセルを強調表示する顕著性マップを抽出しました。このような説明可能性を通じて、オペレーターは真陽性と偽陽性を区別し、以前はブラックボックス出力であったであろう故障モードへの洞察を引き出すことができました39。これらの事例は、XAI の説明が専門家の推論と一致する場合には評価されるが、説明が不安定、粗い、または計算的に実用的でない場合には十分に活用されていないことを示しています。
  3. 現在のエビデンスの限界
    これらの進歩にもかかわらず、いくつかの制限が残っています。まず、ほとんどの実証研究は、産業検査用の MVTec AD や医療画像用の VinDR-CXR122 などの公開データセットに依存しており、工場や病院の現実世界の環境を完全には表していない可能性があります。第二に、評価は断片化されたままであり、忠実度、堅牢性、解釈可能性は研究間で一貫して測定され、多くの場合、その場しのぎの定義があり、標準化されたしきい値はありません。第三に、多くの作品には人間的な検証が欠けています。削除AUC、ポインティングゲームの精度、ローカリゼーションIoUなどの指標は定量的な結果を提供しますが、これらの説明が実際にユーザーの意思決定を改善するかどうかは確認されていません。最後に、製造業における AI ベースの品質保証研究のうち、ワークフローに XAI を統合しているのはわずか ~8% です123。これは、この統計がセクターや方法論によって異なり、正確ではない可能性があるにもかかわらず、実際の導入のギャップを浮き彫りにしています。
  4. 実務家への実際的な意味
    実務家にとって、いくつかの意味が浮かび上がります。勾配ベースの方法は、低遅延 (画像あたり ~100 ミリ秒) で説明を提供し、導入が容易であるため、リアルタイム検査タスクにとって依然として最も実用的な選択肢です。SHAPやRISEなどの摂動ベースのアプローチは、勾配ベースの手法よりもレイテンシーが高くなりますが、速度よりも精度が優先されるヘルスケアなど、きめ細かなアトリビューションがレイテンシーを上回るドメインに適しています。アテンションベースのアプローチはトランスフォーマーアーキテクチャで役立ちますが、生のアテンションでは必ずしも明確な説明が得られるとは限らないため、慎重な解釈が必要です。技術的なトレードオフを超えて、導入の成功は、統合、ユーザートレーニング、および解釈可能性の臨床的価値の実証に大きく依存します。ケーススタディが示すように、説明は、その分野の専門知識と明確に一致し、実務家が AI の予測を検証または異議を唱えるのに役立つ場合にのみ価値を獲得します。
  5. 今後の研究の方向性
    今後の研究では、いくつかの実行可能な方向性を優先する必要があります。
    評価プロトコルの標準化: 削除/挿入 AUC、ポインティング ゲームの精度、安定性指数、レイテンシーなどの主要な指標について再現可能なレポート ガイドラインを確立します。
    ドメイン固有のベンチマークデータセット: グラウンドトゥルース注釈を使用して産業および医療の目視検査用に厳選されたデータセットを開発し、狭い公開データセットへの過度の依存を減らします。
    人間中心の検証: XAIの説明が意思決定の質、ユーザーの信頼、人間とAIのコラボレーションを向上させるかどうかを測定する研究をプロキシ指標を超えて拡大
    費用便益分析: XAIを目視検査ワークフローに統合することのビジネス的および臨床的価値を定量化するために、厳密な導入調査を実施します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

結論

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

このレビューでは、目視検査におけるXAIの75の研究を調査し、その結果、事後的および内因性的な方法の分類とベンチマーク主導の比較分析が行われました。この調査結果は、GradCAMやLRPなどの勾配ベースのアプローチがリアルタイムの欠陥局在化には効率的ですが、複雑な領域では説明が粗くなる可能性があるという、単一の方法が他の方法を普遍的に上回るものではないことを裏付けています。SHAP、LIME、RISE などの摂動ベースの手法は、より細かい詳細と強力な忠実度を提供しますが、高い遅延と計算コストのために実際には失敗することがよくあります。アテンションベースの方法はトランスフォーマーの内部を活用しますが、生のアテンションが因果推論を反映していない場合、信頼性が低くなります。LRP は詳細な説明を生成しますが、それでも CAM ベースのアプローチよりもコストがかかります。これらの制限は、XAI の有効性が方法が適用されるコンテキストに大きく依存していることを明確に示しています。

この分析から、次の 4 つの実行可能な推奨事...

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

開示事項

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は、この作品の出版に関して利益相反がないことを宣言します。

謝辞

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

著者は、この研究が公共、商業、または非営利部門の資金提供機関から特定の助成金を受け取っていないことを宣言します。

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alzarooni, A., et al. Anomaly detection for industrial applications, its challenges, solutions, and future directions: a review. IEEE Sens J. XX. (1), 1(2025).
  2. Hardan, F., Almusawi, A. R. J. Developing an automated vision system for maintaing social distancing to cure the pandemic. Al-Khwarizmi Eng J. 18 (1), 38-50 (2022).
  3. Terasaki, N., Fujio, Y. Mechanoluminescent visualization of crack propagation for joint evaluation. J Vis Exp. (191), e64118(2023).
  4. Al-Hamadani, S., Al-Darraji, I. Warehouse in Industry 4.0 based drone, computer vision, and artificial intelligence technologies: a literature review. Proc Eng Sci. 7 (1), 517-526 (2025).
  5. Al-Jubori, H. N., Izzat, A. D., Jerbi, H. Defect detection using thermography camera techniques: a review. Al-Khwarizmi Eng J. 20 (4), 70-88 (2024).
  6. Al-Hamadani, S., Al-Darraji, I., Jerbi, H. Improving barcode vision scanning process using a drone-based tracking PID controller for warehouse in Industry 4.0. Al-Khwarizmi Eng J. 21 (2), 72-92 (2025).
  7. Al-Jubori, H. N., Al-Darraji, I. Tools and process of defect detection in automated manufacturing systems. EAI Endorsed Trans Scalable Inf Syst. 10 (6), e4000(2023).
  8. Alaa, T., et al. Automated detection of defects on metal surfaces using vision transformers. , Published online October 6, 2024. Accessed August 1 (2025).
  9. Moosavi, S., et al. Explainable AI in manufacturing and industrial cyber-physical systems: a survey. Electronics. 13 (17), 3497(2024).
  10. Nauta, M., et al. From anecdotal evidence to quantitative evaluation methods: a systematic review on evaluating explainable AI. ACM Comput Surv. 55 (13), 1-42 (2023).
  11. Cheng, Z., et al. A comprehensive review of explainable artificial intelligence (XAI) in computer vision. Sensors. 25 (13), 4166(2025).
  12. Barredo Arrieta, A., et al. Explainable artificial intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 58, 82-115 (2020).
  13. Kouchaki, S., et al. Survey of explainable AI techniques in healthcare. Sensors. 23 (2), 634(2023).
  14. Laugel, T., et al. The dangers of post-hoc interpretability: unjustified counterfactual explanations. Proc Int Joint Conf Artif Intell. , 2801-2807 (2019).
  15. Slack, D., et al. Reliable post hoc explanations: modeling uncertainty in explainability. Adv Neural Inf Process Syst. 33, 9391-9404 (2020).
  16. Cesarini, M., et al. Explainable AI for text classification: lessons from a comprehensive evaluation of post hoc methods. Cognit Comput. 16 (6), 3077-3095 (2024).
  17. Mohamed Musthafa, M., et al. Enhancing brain tumor detection in MRI images through explainable AI using Grad-CAM with ResNet-50. BMC Med Imaging. 24 (1), 1-19 (2024).
  18. Sundararajan, M., Taly, A., Yan, Q. Axiomatic attribution for deep networks. Proc Int Conf Mach Learn. 70, 5109-5118 (2017).
  19. Shrikumar, A., Greenside, P., Kundaje, A. Learning important features through propagating activation differences. Proc Int Conf Mach Learn. 70, 4844-4866 (2017).
  20. Bassi, P. R. A. S., et al. Improving deep neural network generalization and robustness to background bias via layer-wise relevance propagation optimization. Nat Commun. 15, 44371(2024).
  21. Knab, P., et al. Which LIME should I trust? Concepts, challenges, and solutions. arXiv preprint. , (2025).
  22. Garreau, D., von Luxburg, U. Explaining the explainer: a first theoretical analysis of LIME. Proc Mach Learn Res. 108, 1287-1296 (2020).
  23. Qian, J., et al. ELIME: exact local interpretable model-agnostic explanation. Eur J Artif Intell. , (2024).
  24. Salih, A. M., et al. A perspective on explainable artificial intelligence methods:SHAP and LIME . Adv Intell Syst. , (2024).
  25. Hermosilla, P., et al. Explainable AI for forensic analysis: a comparative study of SHAP and LIME in intrusion detection models. Appl Sci. 15 (13), 7329(2025).
  26. Petsiuk, V., Das, A., Saenko, K. RISE: randomized input sampling for explanation of black-box models. arXiv preprint. , (2018).
  27. Dandl, S., et al. Multi-objective counterfactual explanations. Lect Notes Comput Sci. 12269, 448-469 (2020).
  28. Alvarez-Melis, D., Jaakkola, T. S. Towards robust interpretability with self-explaining neural networks. Adv Neural Inf Process Syst. 31, 7775-7784 (2018).
  29. Donnelly, J., Barnett, A. J., Chen, C. Deformable ProtoPNet: an interpretable image classifier using deformable prototypes. Proc IEEE Conf Comput Vis Pattern Recognit. , 10255-10265 (2022).
  30. Ross, A. S., Hughes, M. C., Doshi-Velez, F. Right for the right reasons: training differentiable models by constraining their explanations. Proc Int Joint Conf Artif Intell. , 2662-2670 (2017).
  31. Schramowski, P., et al. Making deep neural networks right for the right scientific reasons by interacting with their explanations. Nat Mach Intell. 2 (8), 476-486 (2020).
  32. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nat Mach Intell. 1 (5), 206-215 (2019).
  33. Letham, B., et al. Interpretable classifiers using rules and Bayesian analysis: building a better stroke prediction model. Ann Appl Stat. 9 (3), 1350-1371 (2015).
  34. Barnett, A. J., et al. Interpretable mammographic image classification using case-based reasoning and deep learning. arXiv preprint. , (2021).
  35. Narayanan, A., Bergen, K. J. Prototype-based methods in explainable AI and emerging opportunities in the geosciences. arXiv preprint. , (2024).
  36. Chen, C., et al. This looks like that: deep learning for interpretable image recognition. Adv Neural Inf Process Syst. 32, 8928-8939 (2019).
  37. Koh, P. W., et al. Concept bottleneck models. Proc Int Conf Mach Learn. 119, 5294-5304 (2020).
  38. Burgess, C. P., et al. Understanding disentangling in β-VAE. arXiv preprint. , (2018).
  39. Gunraj, H., et al. SolderNet: towards trustworthy visual inspection of solder joints in electronics manufacturing using explainable artificial intelligence. Proc AAAI Conf Artif Intell. 37, 15668-15674 (2023).
  40. Dosovitskiy, A., et al. An image is worth 16×16 words: transformers for image recognition at scale. arXiv preprint. , (2020).
  41. Khan, S., et al. Transformers in vision: a survey. ACM Comput Surv. 54 (10), 1-41 (2021).
  42. Yu, L., et al. eX-ViT: a novel explainable vision transformer for weakly supervised semantic segmentation. Pattern Recognit. 142, 109666(2023).
  43. Alber, M., et al. Evaluating vision transformer models for visual quality control in industrial manufacturing. Lect Notes Comput Sci. Bifet, A., et al. 14950, 1-15 (2024).
  44. Stassin, S., et al. Explainability and evaluation of vision transformers: an in-depth experimental study. Electronics. 13 (1), 175(2024).
  45. Zhai, Y., et al. A lightweight transformer with linear self-attention for defect recognition. Electron Lett. 60 (17), e13292(2024).
  46. Dhore, V., et al. Enhancing explainable AI: a hybrid approach combining Grad-CAM and LRP for CNN interpretability. arXiv preprint. , (2024).
  47. Chattopadhay, A., et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. Proc IEEE Winter Conf Appl Comput Vis. , 839-847 (2018).
  48. Saleh, R. A. A., et al. Advancing tire safety: explainable artificial intelligence-powered foreign object defect detection with Xception networks and Grad-CAM interpretation. Appl Sci. 14 (10), 4267(2024).
  49. Meister, S., et al. Investigations on explainable artificial intelligence methods for the deep learning classification of fibre layup defect in the automated composite manufacturing. Compos Part B Eng. 224, 109160(2021).
  50. Luo, X., Alzahrani, M. Automated tomato defect detection using CNN feature fusion for enhanced classification. Processes. 13 (1), 115(2025).
  51. Rahimunnisa, K. Textile fabric defect detection. J Innov Image Process. 4 (3), 165-172 (2022).
  52. Shin, H., et al. Visualization for explanation of deep learning-based defect detection model using class activation map. Comput Mater Contin. 75 (3), 4753-4766 (2023).
  53. Yue, H., et al. ASOD: attention-based salient object detector for strip steel surface defects. Electronics. 14 (5), 831(2025).
  54. Saleh, R. A. A., Ertunç, H. M. Explainable attention-based fused convolutional neural network (XAFCNN) for tire defect detection: an industrial case study. Eng Res Express. 6 (1), 015027(2024).
  55. Leem, S., Seo, H. Attention guided CAM: visual explanations of vision transformer guided by self-attention. Proc AAAI Conf Artif Intell. 38 (4), 2956-2964 (2024).
  56. Ibrahim, R., Shafiq, M. O. Augmented Score-CAM: high-resolution visual interpretations for deep neural networks. Knowl Based Syst. 252, 109287(2022).
  57. Clement, T., et al. XAI-enhanced semantic segmentation models for visual quality inspection. Proc IEEE Int Conf Consumer Electron. , 1-4 (2024).
  58. Riedel, H., et al. Automated quality control of vacuum insulated glazing by convolutional neural network image classification. Autom Constr. 135, 104144(2022).
  59. Böhle, M., et al. Layer-wise relevance propagation for explaining deep neural network decisions in MRI-based Alzheimer's disease classification. Front Aging Neurosci. 10, 194(2019).
  60. Bach, S., et al. On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation. PLoS One. 10 (7), e0130140(2015).
  61. Dieter, T. R., Zisgen, H. Evaluation of the explanatory power of layer-wise relevance propagation using adversarial examples. Neural Process Lett. 55 (7), 8531-8550 (2023).
  62. Hoefler, M. A., et al. XAI-guided insulator anomaly detection for imbalanced datasets. arXiv. , (2024).
  63. Kares, F., et al. What makes for a good saliency map? Comparing strategies for evaluating saliency maps in explainable AI (XAI). arXiv preprint. , (2025).
  64. Yona, G., Greenfeld, D. Revisiting sanity checks for saliency maps. arXiv preprint. , (2021).
  65. Zeiler, M. D., Fergus, R. Visualizing and understanding convolutional networks. Eur Conf Comput Vis. 8689, 818-833 (2014).
  66. Xu-Darme, R., et al. On the stability, correctness and plausibility of visual explanation methods based on feature importance. ACM Int Conf Proc Ser. , 119-125 (2023).
  67. Ortigossa, E. S., et al. T-Explainer: a model-agnostic explainability framework based on gradients. arXiv preprint. , (2024).
  68. Singh, M., et al. Attributional robustness training using input-gradient spatial alignment. Lect Notes Comput Sci. 12372, 515-533 (2019).
  69. Cerekci, E., et al. Quantitative evaluation of saliency-based explainable artificial intelligence methods in deep learning-based mammogram analysis. Eur J Radiol. 173, 111356(2024).
  70. Meister, S., et al. Cross-evaluation of a parallel operating SVM-CNN classifier for reliable internal decision-making processes in composite inspection. J Manuf Syst. 60, 620-639 (2021).
  71. Bitar, A., et al. Gradient-based feature-attribution explainability methods for spiking neural networks. Front Neurosci. 17, 1153999(2023).
  72. Qiang, Y., et al. Interpretability-aware vision transformer. arXiv preprint. , (2023).
  73. Bousselham, W., et al. LeGrad: an explainability method for vision transformers via feature formation sensitivity. arXiv preprint. , (2025).
  74. Lundberg, S. M., Lee, S. I. A unified approach to interpreting model predictions. Adv Neural Inf Process Syst. 30, (2017).
  75. Khan, F. S., et al. Model-agnostic explainable artificial intelligence methods in finance: a systematic review, recent developments, limitations, challenges and future directions. Artif Intell Rev. 58, 1-65 (2025).
  76. Nazim, S., et al. Advancing malware imagery classification with explainable deep learning: a state-of-the-art approach using SHAP LIME and Grad-CAM. PLoS One. 20 (5), e0318542(2025).
  77. Solís-Martín, D., et al. On the soundness of XAI in prognostics and health management (PHM). Information. 14 (5), 256(2023).
  78. Biecek, P., Burzykowski, T. Local interpretable model-agnostic explanations (LIME). In:Explanatory Model Analysis. , 107-123 (2021).
  79. Ribeiro, M. T., Singh, S., Guestrin, C. 34;Why should I trust you?" Explaining the predictions of any classifier. Proc ACM SIGKDD Int Conf Knowl Discov Data Min. , 1135-1144 (2016).
  80. Tahir, H. A., et al. A novel hybrid XAI solution for autonomous vehicles: real-time interpretability through LIME-SHAP integration. Sensors. 24 (21), 6776(2024).
  81. Goldman, C. V., et al. Explaining learning models in manufacturing processes. Procedia Comput Sci. 180, 259-268 (2021).
  82. Emmanouilidis, C., Rica, E. Visual quality control via explainable AI and the case of human in the AI loop. In: Lect Notes Mech Eng. , 252-260 (2023).
  83. Huang, M., et al. An interpretable approach using hybrid graph networks and explainable AI for intelligent diagnosis recommendations in chronic disease care. Biomed Signal Process Control. 91, 105913(2024).
  84. Dardouillet, P., et al. Explainability of image semantic segmentation through SHAP values. Data. 7 (8), 255(2022).
  85. Saifullah, S., et al. The privacy-explainability trade-off: unraveling the impacts of differential privacy and federated learning on attribution methods. Front Artif Intell. 7, 1236947(2024).
  86. Velmurugan, M., et al. Developing guidelines for functionally-grounded evaluation of explainable artificial intelligence using tabular data. Eng Appl Artif Intell. 141, 109772(2025).
  87. Wells, L., Bednarz, T. Explainable AI and reinforcement learning-a systematic review of current approaches and trends. Front Artif Intell. 4, 550030(2021).
  88. Rožanec, J. M., et al. Adaptive explainable artificial intelligence for visual defect inspection. Procedia Comput Sci. 232, 3034-3043 (2024).
  89. Nguyen, H. T. T., et al. XEdgeAI: a human-centered industrial inspection framework with data-centric explainable edge AI approach. Inf Fusion. 116, 102782(2025).
  90. Han, C., et al. Visual coating inspection framework via self-labeling and multi-stage deep learning strategies. J Intell Manuf. 35, 1-18 (2024).
  91. Kotsiopoulos, T., et al. Revolutionizing defect recognition in hard metal industry through AI explainability, human-in-the-loop approaches and cognitive mechanisms. Expert Syst Appl. 255, 124839(2024).
  92. Forcher, B., et al. Evaluation of explainable AI methods for classification tasks in visual inspection. Proc XAI Workshop (Late-Breaking Work, Demos, Doctoral Consortium). , 77-82 (2023).
  93. Miller, T. Explanation in artificial intelligence: insights from the social sciences. Artif Intell. 267, 1-38 (2019).
  94. Jacovi, A., Goldberg, Y. Towards faithfully interpretable NLP systems: how should we define and evaluate faithfulness. Proc Annu Meet Assoc Comput Linguist. 58, 4198-4205 (2020).
  95. Adebayo, J., et al. Sanity checks for saliency maps. Adv Neural Inf Process Syst. 31, 9505-9515 (2018).
  96. Doshi-Velez, F., Kim, B. Considerations for evaluation and generalization in interpretable machine learning. Proc Explainable and Interpretable Models in Computer Vision and Machine Learning. , 3-17 (2018).
  97. Lage, I., et al. An evaluation of the human-interpretability of explanation. arXiv preprint. , (2019).
  98. Theunissen, M., Browning, J. Putting explainable AI in context: institutional explanations for medical AI. Ethics Inf Technol. 24 (2), 1-10 (2022).
  99. Hoffman, R. R., et al. Measures for explainable AI: explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance. Front Comput Sci. 5, 1096257(2023).
  100. Hedström, A., et al. Quantus: an explainable AI toolkit for responsible evaluation of neural network explanations and beyond. J Mach Learn Res. 24, 1-11 (2023).
  101. Mohseni, S., et al. A multidisciplinary survey and framework for design and evaluation of explainable AI systems. ACM Trans Interact Intell Syst. 11 (3-4), 1-45 (2021).
  102. Finzel, B., et al. Domain-specific evaluation of visual explanations for application-grounded facial expression recognition. Lect Notes Comput Sci. 14065, 31-44 (2023).
  103. Yeh, C. K., et al. On the (in)fidelity and sensitivity for explanations. Adv Neural Inf Process Syst. 32, 10967-10978 (2019).
  104. Better metrics for evaluating explainable artificial intelligence. Rosenfeld, A. Proc Int Conf Autonomous Agents Multiagent Syst, , 45-53 (2021).
  105. Evaluation metrics for XAI: a review, taxonomy, and practical applications. Kadir, M. A., et al. Proc IEEE Int Conf Intell Eng Syst, , 111-124 (2023).
  106. Sankaran, K. Data science principles for interpretable and explainable AI. J Data Sci. 22, 1-27 (2024).
  107. Alvarez-Melis, D., Jaakkola, T. S. On the robustness of interpretability methods. arXiv preprint. , (2018).
  108. Zhang, Y., et al. Saliency-Bench: a comprehensive benchmark for evaluating visual explanations. arXiv preprint. , (2025).
  109. Bergmann, P., et al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection. Int J Comput Vis. 129 (4), 1038-1059 (2021).
  110. Tang, S., et al. Online PCB defect detector on a new PCB defect dataset. arXiv preprint. , (2019).
  111. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Irvin, J., et al. Proc AAAI Conf Artif Intell, 33, 590-597 (2019).
  112. ImageNet: a large-scale hierarchical image database. Deng, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 248-255 (2009).
  113. Selvaraju, R. R., et al. Grad-CAM: visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128 (2), 336-359 (2020).
  114. Black-box explanation of object detectors via saliency maps. Petsiuk, V., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 11438-11447 (2020).
  115. Attention is not explanation. Jain, S., Wallace, B. C. Proc Conf North Am Chapter Assoc Comput Linguist, , 3543-3556 (2019).
  116. Transformer interpretability beyond attention visualization. Chefer, H., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 782-791 (2021).
  117. Wachter, S., et al. Counterfactual explanations without opening the black box: automated decisions and the GDPR. SSRN Electron J. , (2017).
  118. Deep learning for case-based reasoning through prototypes: a neural network that explains its predictions. Li, O., et al. Proc AAAI Conf Artif Intell, 32, 3530-3537 (2018).
  119. Counterfactuals in explainable artificial intelligence (XAI): evidence from human reasoning. Byrne, R. M. J. Proc Int Joint Conf Artif Intell, , 6276-6282 (2019).
  120. Ihongbe, I. E., et al. Evaluating explainable artificial intelligence (XAI) techniques in chest radiology imaging through a human-centered lens. PLoS One. 19 (10), e0308758(2024).
  121. Dörrich, M., et al. Explainable convolutional neural networks for assessing head and neck cancer histopathology. Diagn Pathol. 18 (1), 121(2023).
  122. Nguyen, H. Q., et al. VinDr-CXR: an open dataset of chest X-rays with radiologist's annotations. Sci Data. 9, 429(2022).
  123. Lee, D. J., et al. A systematic literature review on artificial intelligence and explainable artificial intelligence for visual quality assurance in manufacturing. Electronics. 12 (22), 4572(2023).

アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。

再版と許可

このJoVE記事のテキストまたは図の再利用許可をリクエスト

許可をリクエスト

タグ

XAI

関連記事