このレビューでは、産業および医療領域における目視検査のための説明可能なAI(XAI)手法を統合します。PRISMAに基づく検索により、75件の研究が特定され、ドメイン固有の分類法と標準化された指標を使用した比較分析が通知されました。私たちは、証拠に裏付けられた分類法と、ツール選択のための実務家指向のワークフローを提供します。
レビュー記事
このレビューでは、産業および医療領域における目視検査のための説明可能なAI(XAI)手法を統合します。PRISMAに基づく検索により、75件の研究が特定され、ドメイン固有の分類法と標準化された指標を使用した比較分析が通知されました。私たちは、証拠に裏付けられた分類法と、ツール選択のための実務家指向のワークフローを提供します。
説明可能な人工知能 (XAI) 技術は、ブラックボックス機械学習モデルを理解しやすくすることで、自動外観検査システムの透明性と信頼性を可能にします。XAI は広く適用されていますが、以前のレビューでは、産業検査および医療検査タスクの特定の要求には対応していませんでした。この論文では、産業および医療領域にわたる目視検査にXAI技術を適用した研究をレビューします。IEEE Xplore、Scopus、PubMed、arXiv、Web of Science で、2014 年から 2025 年の間に発表された研究について体系的な検索が実施され、包含基準として、公開またはドメイン固有のデータセットを使用した検査タスクに XAI を適用することが要求されました。最初の研究プールから 75 件が含まれ、事後研究と内因性研究に分類され、忠実度、堅牢性、複雑さ、およびローカリゼーションの精度に関して評価されました。結果は、勾配および伝播ベースの手法は、粗い局在化ではあるものの、ほぼリアルタイムの検査に適した効率的な視覚的説明を提供するのに対し、摂動ベースの手法と代理モデル手法は、より高い計算コストでより詳細な帰属を提供しますが、堅牢性は低下することを示しています。さらに、プロトタイプベースのネットワークとセルフアテンションアーキテクチャは、解釈可能性と予測パフォーマンスの間のトレードオフを示しています。最も効果的なXAI方法を選択することは、万能ではありません。これは、データセット、レイテンシー、解釈可能性のニーズによって異なります。このレビューでは、目視検査のためのXAI手法の統一された分類法を紹介し、標準化された指標を使用して産業領域と医療領域の両方でさまざまなアプローチを比較し、実践者が最適な方法を選択する際のガイドとなるタスクベースの選択ワークフローを提案します。これまでのレビューと比較して、この研究は定量的ベンチマークに基づいたクロスドメイン比較分析を提供し、標準化された評価とユーザー中心の検証の方向性を概説します。
製造、自動車、食品包装、製薬、ヘルスケアなどの業界では、製品やシステムが適切かつ安全に機能していることを確認することが不可欠です。自動化および機械学習ツールは、人間のオペレーターが行う従来の目視検査や初歩的なカメラベースのシステムを超えて、精度、生産速度、一貫性を向上させます1.AI検査により、リアルタイム監視2 とハイスループット環境での欠陥検出3が可能になり、人的エラーと運用コスト4が削減されます。特に機械学習(ML)とディープラーニング(DL)の進歩により、人工知能の使用により、欠陥を検出し5、オブジェクトを分類し、複雑な視覚パターンを識別する自律システムが可能になりました6。最近では、畳み込みニューラルネットワーク(CNN)7、リカレントネットワーク、ビジョントランスフォーマー(ViT)が、表面探傷から医療画像における異常局在化までのタスクにおいて、ルールベースのシステムを上回っています。検査は、ルールベースのプロセスから、大規模なデータセットでトレーニングされたデータ駆動型モデルに移行しました8。
多くの AI モデルは「ブラック ボックス」として機能するため、これらのモデルがどのように意思決定を行うかについての洞察はありません。この透明性の欠如はリスクをもたらします。たとえば、製造業では、予測を間違えると、無駄の増加、やり直し、製品のリコール、顧客の不満につながる可能性があります。医療画像処理では、誤分類は診断を遅らせたり、治療計画を損なったりする可能性があるため、より重要になります。これらのモデルの開発者でさえ、その出力を完全に説明できないことが多く、信頼と採用が制限されます。
ここで説明可能な AI (XAI) が不可欠になります。XAI は、機械学習モデルの決定を人間が解釈できるようにすることを目的とした方法とツールのグループです9。その目標は、ブラックボックス予測子を、その出力に人間が読める正当化を提供することで、透明な「ガラスボックス」システムに変えることです。実際には、XAI対応の検査システムは、欠陥検出にとどまらず、部品に欠陥のフラグを立てるだけでなく、フラグが立てられた理由も説明します。
文献が増えているにもかかわらず、コンピュータービジョンにおけるXAIに関する既存の調査の範囲は依然として限られています。多くは医療画像処理や工業検査に狭く集中しており、有用な分類法を提供していますが、標準化されたベンチマークなしで主に定性的な比較に依存しています。Nauta et al.10 などのより広範なレビューは、ドメインにとらわれない概要を提供しますが、実務家指向の選択フレームワークを提供するには至っていません。Chengらによるこれまでで最も包括的なコンピュータービジョン調査11 でさえ、分類法を進歩させ、忠実度やローカリゼーションの精度などの指標について議論していますが、それはビジョンタスク全体で一般的なままであり、目視検査、ハイスループット展開、またはヒューマンインザループ検証には特に対処していません。同様に、予後および資産管理のためのXAIの産業レビューは、PRISMAフレームワークを採用していますが、目視検査タスクではなく予後および健康管理(PHM)に焦点を当てています。
これらのギャップに対処するために、このレビューは次の点に貢献しています。
体系的な分類法: 産業および医療の両方の目視検査にわたる75の研究のPRISMAガイド付きレビュー。
比較分析: 複数のXAIメソッド(GradCAM、LRP、SHAP、LIME、RISE)を、削除/挿入AUC、ポインティングゲームの精度、安定性、レイテンシーなどの標準化された指標で、公開目視検査データセット(MVTec AD、PCBなど)でベンチマークします。
評価指標フレームワーク: XAI 手法の評価に使用される忠実度、堅牢性、解釈可能性、およびタスク固有の尺度の正式な定義と方程式。
実践的なガイダンス: ケーススタディと、タスクの種類、待ち時間、説明のニーズを特定の方法にリンクする実務家指向の選択ワークフロー。
これらの貢献を組み合わせることで、信頼できるガイダンスを求める研究者と実務家の両方を対象とした、目視検査のためのXAIの最もドメイン固有でベンチマークに基づいた合成が確立されます。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
2. XAIフレームワーク
ほとんどの最先端の AI モデル、特にディープ ニューラル ネットワークは、ブラック ボックスとして扱われることがよくあります。彼らがどのように意思決定を行うかについてはほとんど可視性がありません12.透明性の欠如は、多様なアプリケーションにおける信頼と説明可能性の障壁となっています。その結果、XAI は信頼できる AI に欠かせない存在となっています。すべてのシナリオに適合する単一のアプローチはありません:モデル内部へのフルアクセスを前提とする方法もあれば、モデルを不変のブラックボックスとして扱う方法もあります。個々の予測に対して局所的な説明を優先するものもあれば、モデルの動作に関するグローバルな洞察を提供するものもあります。 図1に示すように、これらの考慮事項は、説明可能性が導入される時期に基づいて、XAI手法の2つの大きなカテゴリ、つまり事後説明法と固有の解釈可能性法13につながりました。事後方法は、モデルに依存しない方法とモデル固有の方法にさらに分類されます14。

図1:目視検査用のXAIフレームワーク。この図の拡大版を表示するには、ここをクリックしてください。
3. XAIの分類
研究状況を構造化して統合するために、PRISMAガイドラインを使用して体系的な文献レビューを実施しました(図2)。このプロセスには、複数の学術データベース(Scopus、Web of Science、IEEE Xplore、SpringerLink、PubMed、arXiv、MDPI)が含まれ、「説明可能なAI」、「解釈可能性」、「目視検査」、「欠陥検出」、「異常検出」、「製造」、「医療画像」を組み合わせた一連の検索用語によって導かれました。包含基準では、論文が目視検査のコンテキスト(産業または医療)でXAI法を明示的に適用または評価し、十分な方法論的詳細を報告することが求められました。除外基準は、実装されていない純粋に理論的な提案や、目視検査以外の作品を削除しました。検索では当初、483 件のレコードが取得されました。重複を削除し、タイトルと要約を審査した後、147 件が全文レビューのために残りました。包含/除外基準を適用したところ、75件の一次研究が得られ、これが本レビューの基礎となった。

図2:PRISMAガイドラインに従ったシステマティックレビュープロセスのPRISMAフロー図。 この図は、各段階で特定、スクリーニング、および除外された記録を示しており、最終レビューに含まれる75件の一次研究が得られました。 この図の拡大版を表示するには、ここをクリックしてください。

図3:目視検査タスクにおけるXAI手法の提案された分類法。この図の拡大版を表示するには、ここをクリックしてください。
| XAIメソッド | XAIアプローチ | 勉強 | 産業 | 年 |
| 組み込み | ルールベースモデルと線形モデル | 32,33 | 医療全般 | 2015–2019 |
| プロトタイプベース(ProtoPNet、Case-based、Deformable ProtoPNet) | 29,34,35,36 | 医療, 産業用, 一般 | 2018–2024 | |
| 概念駆動型 (概念のボトルネック、正しい理由のための正しい) | 30,31,37 | 一般、科学的応用 | 2020–2021 | |
| 自己説明型ニューラルネットワーク(SENN) | 28 | 全般 | 2018–2020 | |
| 解散表現(β-VAE),SOXAI | 38,39 | 全般 | 2018 | |
| ビジョントランスフォーマー(注意による本質的な解釈可能性) | 40、41、42、43、44、45 | コンピュータビジョン、製造 | 2020–2024 | |
| 事後、モデル固有 | CAMファミリー | 46、47、48、49、50、51、52、53、54、55、56、57、58 | 医療画像処理、製造、自動車、農業、エレクトロニクス | 2018–2025 |
| LRP(レイヤーごとの関連性伝播) | 20,59,60,61,62 | 一般, 医用画像 | 2015–2024 | |
| 勾配と顕著性の方法(統合勾配、スムースIG、DeepLIFT、DeconvNet、T-Explainer、顕著性ベンチマーク) | 18、19、63、64、65、 66,67,68,69,70 | 一般, 医用画像 | 2013–2025 | |
| 特殊なモデルでのアトリビューション(SNN、トランスフォーマーのアテンションアトリビューション) | 71,72,73 | 神経科学、ビジョントランスフォーマー | 2023–2025 | |
| 事後、モデルに依存しない | LIME & バリアント (LIME, ELIME, MASALA), SHAP &; VARIANTS (TREE SHAP), | 金融、予後と健康管理、サイバーセキュリティ、自動運転車、産業検査。 | 2016–2025 | |
| 反 | 21、22、23、24、25、27、74、 75,76,77,78,79,80,81、 82,83,84,85,86 | |||
| 説明 | ||||
| ハイブリッド方式 | (GradCAM、SHAP、LRP、LIME)を含む複数のXAIメソッドの統合 | 58,87,88,89,90,91,92 | 工業検査、ヘルスケア、製造。 | 2021–2025 |
表1:XAI法、年、業界、およびアプローチによる75のレビュー研究の分類。
4. XAIの評価指標
コンピューター ビジョン モデルのパフォーマンスは、精度、精度、再現率などの確立された指標によって判断されます。ただし、モデルの決定の説明可能性を評価することは、それほど単純ではありません。標準的な予測性能とは異なり、AI説明の質について普遍的に受け入れられている指標はありません66。言い換えれば、分類器の精度は正確に測定できるが、特定の画像分類93に対する説明がどれほど「良好」であるかを定量化するための合意されたスケールは存在しない。この格差は、XAI の分野における根本的なギャップ、つまり説明の評価方法を浮き彫りにしています。
標準化されたXAI評価基準の開発は非常に困難であることが証明されています。その理由の1つは、解釈可能性と説明の質が多面的で文脈に依存しているため、単一の普遍的な指標10に抵抗することです。説明を効果的に評価するには、アプリケーション ドメイン、生成された説明の性質、エンド ユーザーの背景など、いくつかの要因に依存します。例えば、医用画像診断に適した説明技術は、工業用目視検査タスク10で使用されるものとは異なって評価され得る。
実際には、標準的な指標がないため、研究者はさまざまな評価アプローチに依存するようになりました。多くの研究は、XAI法94,95の定性的で逸話的な評価に頼っています。著者がいくつかの顕著性マップまたはヒートマップを提示し、これらが合理的であると主張するのを見るのはよくあることです(いわゆる「面の妥当性」テスト)96。このような目視検査は、物語的な意味では説得力がありますが、依然として主観的であり、厳密な比較には不十分です97。これは、XAI メトリックを標準化することの難しさを示しています。合意された基準がない場合、研究者は各データセットまたはユースケースに合わせた指標を提案します。
その結果、このギャップを埋めることを目的とした多様なXAI評価指標が文献に豊富にあります98。多くのフレームワークと対策が提唱されており、それぞれが説明を有用にするものの特定の側面を対象としています99.大まかに言えば、指標は、その主な焦点に基づいて分類できます。忠実度ベースの指標は、モデル100の意思決定プロセスをどれだけ反映しているかによって説明を判断します。対照的に、解釈可能性中心の指標は、説明が人間の観察者にとってどれほど理解可能で説得力があるかを評価します101。3番目のカテゴリはタスクベースの指標であり、説明の評価はエンドユーザーのパフォーマンスへの影響に依存します102。4番目のカテゴリは、結果103の一貫性を評価する堅牢性指向の指標です。最後に、ハイブリッド指標は複数のディメンションを組み合わせます104。
この指標の多様性は、研究者が重要と考える説明可能性の側面を示していますが、単一の基準の欠如も浮き彫りにしています:各指標は説明の質の1つの角度しか捉えていません105。以下では、XAIの評価指標の範囲を4つの主要なカテゴリにグループ化し、 表2にまとめます。
| メトリックタイプ | メトリック | 式/定義 |
| 忠実度 | 曲線下の削除領域(AUC)26 | ![]() トップKの重要な機能です。より低い=より忠実 |
| 曲線下挿入面積(AUC)26 | ![]() より高い=より忠実 | |
| 不倫スコア103 | ![]() 低い=良い | |
| 咆哮106 | 「重要な」特徴がない状態で再トレーニングすると精度が低下する | |
| 丈夫 | 安定性指数107 | ![]() より高い=より一貫性が高い |
| リプシッツスコア103 | ![]() より低い=より堅牢 | |
| 解釈可能性 | スパース性79 | ![]() より低い=よりシンプル |
| 代理の深さ79 | 解釈可能なサロゲートの深さ (例: 決定木)。 浅い=単純 | |
| タスク固有 | 交差オーバーユニオン(IoU)108 | ![]() マスク M とグラウンドトゥルース G のオーバーラップ |
| ポインティングゲーム108 | 精度 = #hits / #samples より高い=良い | |
| ハイブリッド | 総合スコア104 | 忠実度、スパース性、堅牢性の重み付けされた組み合わせ |
表2:目視検査におけるXAIの評価指標は、4つの主要なカテゴリに分類されます。
5. 比較分析
このセクションでは、MVTec AD109 (ピクセルレベルのマスクを使用した>5,000枚の欠陥画像)やDeepPCB110 (6つの欠陥クラスを持つ1,500枚のPCB画像)、CheXpert111 、ImageNet112 などの公開データセット間で手法を比較し、削除/挿入AUC(忠実性)、ポインティングゲームの精度(ローカリゼーション)、安定性スコア(摂動下での堅牢性)、およびレイテンシー(ランタイムコスト)の指標にわたって評価されます。
CAMベースの方法(GradCAM、GradCAM++)の場合、MVTec ADおよびDeepPCBの結果は、GradCAMが0.83〜0.87(挿入AUC~0.68、<削除時の精度低下15%)、感度(0.80〜0.85)、および実行時間<100ミリ秒(~39フレーム/秒(FPS)を達成していることを示しています。局在化は中程度のままです (平均 IoU ≈0.28 @ δ=0.25、ポインティング精度 86-87%)。GradCAM++ は、同様の遅延 (<120 ミリ秒) と高いユーザー信頼度 (109.69/250 対 GradCAM の 56.08/250) を維持しながら、マルチインスタンスのローカリゼーション (平均 IoU = 0.38) を改善します。これらの方法は効率的ですが、空間的に粗い 47,113 です。
摂動ベースの手法(LIME、SHAP、RISE)の場合、パフォーマンスはデータセットによって異なります。MVTec AD では、LIME は局所忠実度 R² = 0.70-0.80 に達しますが、低い堅牢性 (安定性指数 <0.5)、3-5 秒/画像の遅延、および中程度の局在化 (IoU = 0.25-0.35) を示します。PCB欠陥分類に適用されたSHAPは、強力なヒューマンアライメント(70-80%)で一貫した帰属(Δ対数オッズ= 0.2-0.3)を達成しますが、遅く(>1秒/画像)、局在化が弱い(IoU≈0.02-0.03)。MS-COCO でベンチマークされ、MVTec AD 用に複製された RISE は、平均 4,000-8,000 マスクされたフォワード パスを実現し、高い堅牢性 (安定性 >0.7)、忠実度 (0.78-0.82 AUC)、および優れたローカリゼーション (ポインティング ゲーム = 62.9% 対 GradCAM の 48.3%) をもたらしますが、1-2 秒/説明の遅延は 26,74,79,114 です。
関連伝播法(LRP、DeepLIFT)の場合、DeepPCBおよびCheXpertでの評価により、LRPは0.82〜0.90の忠実度、感度~0.85、および0.40〜0.50のローカリゼーションIoUを達成していることが示されています。実行時間は画像あたり100〜200ミリ秒で、CAMよりも遅いですが、ほぼリアルタイムの検査が可能です。CheXpert 放射線学のタスクでは、専門家の研究により、LRP ヒートマップと臨床的に関連する領域との間に >70% の重複があることが示されており、ドメイン全体で解釈可能性が実証されています60。
ImageNetとCheXpertでトレーニングされたViTモデルの結果であるアテンションベースの方法(Transformers)の場合、生のアテンションマップの忠実度は0.75〜0.85になりますが、摂動下では不安定であり、感度は0.70〜0.75で、局在化は中程度です(IoU = 0.30-0.45)。人間の信頼は~60〜70%です。適応されたアプローチ (アテンション フロー、Transformer-LRP) は因果指標を改善し、削除/挿入とポインティング ゲーム スコア 40,115,116 で生の注意を上回ります。
プロトタイプおよび反事実ベースの方法の場合、MVTec ADの評価は、ProtoPNetが同様の欠陥ケースによって予測が正当化される模範ベースの説明を達成し、オペレーターの意思決定を支援することを強調しています。SOMベースのアプローチは、2Dマップ上の欠陥特徴をクラスター化し、トポロジー関係を維持します。PCB欠陥画像とCheXpertの両方でテストされた反事実手法は、実用的な推論(「亀裂の長さが1mm未満の場合、予測は正常にシフトする」)を提供しますが、コストのかかる最適化が必要であり、高解像度の入力に苦労します。これらの方法は人間の推論と強く一致していますが、規模は 117,118,119 に十分ではありません。
最後に、トレードオフと実際的な選択を考慮すると、CAM はレイテンシーが重要なワークフローを支配しますが、依然として粗いままです。LRP は忠実度と実行時間のバランスが取れており、ピクセル レベルの分析に優れています。RISE は、最も強力な因果関係の忠実性とローカリゼーションを提供しますが、遅延は秒単位です。SHAP と LIME は解釈可能性を高めますが、速度が遅く不安定です。プロトタイプと反事実は、人間のアライメントを最大化しますが、高解像度検査では拡張性が低くなります。トランスフォーマーベースのモデルには、生の注意を超えた特殊な適応が必要です。したがって、単一の方法が他の方法を普遍的に上回るものはありません。代わりに、メソッドの選択は、データセット、タスク、レイテンシー、予算、解釈可能性のニーズを反映する必要があります。 図4に示すように、選択ワークフローは、これらのベンチマークのうちの3つ(タスク、遅延、解釈可能性)を、目視検査でXAIメソッドを選択するためのタスク指向のガイドに統合しています。

図 4:XAI メソッド採用のための選択ワークフロー。これは、目視検査における適切なXAI手法の選択をガイドする意思決定フローチャートです。ワークフローでは、タスクの種類(分類、セグメンテーション、異常検出、回帰)、レイテンシの制約、説明の詳細を考慮し、代表的な手法にリンクします。 この図の拡大版を表示するには、ここをクリックしてください。
6. 議論
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このレビューでは、目視検査におけるXAIの75の研究を調査し、その結果、事後的および内因性的な方法の分類とベンチマーク主導の比較分析が行われました。この調査結果は、GradCAMやLRPなどの勾配ベースのアプローチがリアルタイムの欠陥局在化には効率的ですが、複雑な領域では説明が粗くなる可能性があるという、単一の方法が他の方法を普遍的に上回るものではないことを裏付けています。SHAP、LIME、RISE などの摂動ベースの手法は、より細かい詳細と強力な忠実度を提供しますが、高い遅延と計算コストのために実際には失敗することがよくあります。アテンションベースの方法はトランスフォーマーの内部を活用しますが、生のアテンションが因果推論を反映していない場合、信頼性が低くなります。LRP は詳細な説明を生成しますが、それでも CAM ベースのアプローチよりもコストがかかります。これらの制限は、XAI の有効性が方法が適用されるコンテキストに大きく依存していることを明確に示しています。
この分析から、次の 4 つの実行可能な推奨事...
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
著者は、この作品の出版に関して利益相反がないことを宣言します。
著者は、この研究が公共、商業、または非営利部門の資金提供機関から特定の助成金を受け取っていないことを宣言します。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
アクセスが制限されています。このコンテンツを表示するにはログインするか、トライアルを開始してください。
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト