综述文章

可解释人工智能在视觉检测中的应用:比较分析与综述

DOI:

10.3791/69440

2025年10月10日

本文内容

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本文综述了在工业和医学领域用于视觉检测的可解释人工智能(XAI)方法。通过采用PRISMA指南的检索策略,共筛选出75项研究,据此构建了针对特定领域的分类体系,并使用标准化指标进行了比较分析。我们提出了一个基于证据的分类体系,以及一个面向实践者的工具选择工作流程。

摘要

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

可解释人工智能(XAI)技术通过使黑箱机器学习模型变得可理解,从而提升自动化视觉检测系统的透明度与可信度。尽管XAI已被广泛应用,但以往的综述尚未涵盖工业与医学检测任务的特定需求。本文综述了在工业和医学领域中将XAI技术应用于视觉检测的研究。系统性检索了IEEE Xplore、Scopus、PubMed、arXiv和Web of Science数据库中2014年至2025年间发表的研究,纳入标准要求研究在使用公开或领域特定数据集的检测任务中应用了XAI技术。从初步筛选的研究中,共纳入75项研究,并将其分为事后解释(post-hoc)和内在解释(intrinsic)两类,随后从保真度、鲁棒性、复杂性和定位准确性四个方面进行评估。结果表明,基于梯度和传播的方法能够提供适用于近实时检测的高效可视化解释,但其定位较为粗糙;而基于扰动和代理模型的方法虽计算成本较高且鲁棒性较低,却能提供更细致的归因分析。此外,基于原型的网络和自注意力架构在可解释性与预测性能之间表现出权衡关系。选择最有效的XAI方法并非“一刀切”:其效果取决于数据集特性、延迟要求和可解释性需求。本文提出了一个面向视觉检测的XAI方法统一分类体系,使用标准化指标对工业与医学领域中的不同方法进行了比较,并提出了一种基于任务的选型工作流程,以指导实践者选择最优方法。与以往综述相比,本研究基于定量基准提供了跨领域的对比分析,并指出了标准化评估与以用户为中心的验证未来发展方向。

引言

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

制造业、汽车工业、食品包装、制药和医疗保健等行业必须确保产品和系统能够充分且安全地运行。自动化和机器学习工具超越了由人工操作员或简单的基于摄像头的系统执行的传统视觉检测,提高了检测的准确性、生产速度和一致性1。人工智能检测可实现高通量环境下的实时监控2和缺陷识别3,减少人为错误和运营成本4。人工智能的应用,特别是机器学习(ML)和深度学习(DL)的进步,使得能够自主检测缺陷5、对物体进行分类并识别复杂的视觉模式6。近年来,卷积神经网络(CNNs)7、循环神经网络和视觉变换器(ViTs)在从表面缺陷检测到医学影像中异常定位等任务中,已超越基于规则的系统。检测方法已从基于规则的流程转变为基于大量数据训练的数据驱动模型8

许多人工智能模型如同“黑箱”,意味着人们无法了解这些模型如何做出决策。这种缺乏透明度的情况带来了风险。例如,在制造业中,错误的预测可能导致浪费增加、返工增多、产品召回以及客户不满。在医学影像领域,误分类问题更为严重,因为它可能延误诊断或影响治疗方案。甚至这些模型的开发者通常也无法完全解释其输出结果,这限制了人们对模型的信任与应用。

这正是可解释人工智能(XAI)至关重要的原因。XAI 是一组旨在使机器学习模型的决策能够被人理解的方法和工具9。其目标是通过为模型输出提供人类可读的解释,将“黑箱”预测器转变为透明的“玻璃箱”系统。在实际应用中,具备 XAI 功能的检测系统不仅能标记出有缺陷的部件,还能进一步说明标记该部件的原因,从而超越单纯的缺陷检测。

尽管相关文献日益增多,现有针对计算机视觉中可解释人工智能(XAI)的综述仍存在范围上的局限。许多研究集中于医学影像或工业检测领域,虽然提出了有用的分类体系,但主要依赖定性比较,缺乏标准化的基准评估。较广泛的综述,如 Nauta 等人10的工作,提供了跨领域的总体概述,但未能提出面向实践者的模型选择框架。即使迄今为止最全面的计算机视觉综述——Cheng 等人11的研究——推进了分类体系,并讨论了保真度和定位准确性等指标,其内容仍泛化于各类视觉任务,未专门针对视觉检测、高通量部署或人机协同验证等场景进行探讨。类似地,面向预测性维护与资产管理的工业领域 XAI 综述虽采用 PRISMA 框架,但其重点在于预测与健康管理(PHM),而非视觉检测任务。

为解决这些不足,本综述作出以下贡献:

系统分类学:基于PRISMA指南对75项工业与医学视觉检测研究的系统性综述。

比较分析:在公开的视觉检测数据集(例如 MVTec AD、PCB)上,使用标准化指标(包括删除/插入 AUC、指向游戏准确率、稳定性和延迟)对多种 XAI 方法(GradCAM、LRP、SHAP、LIME 和 RISE)进行基准测试。

评估指标框架:用于评估 XAI 方法的保真度、鲁棒性、可解释性及任务特定指标的形式化定义与方程。

实用指南:通过案例研究和面向实践者的选型工作流程,将任务类型、延迟和解释需求与特定方法相关联。

这些贡献共同建立了面向视觉检测的可解释人工智能(XAI)领域最具有领域特异性且以基准为依据的综合研究成果,旨在为寻求可靠指导的研究人员和实践者提供参考。

访问受限。请登录或开始试用以查看此内容。

综述与观点

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

2. 可解释人工智能框架

目前最先进的 AI 模型——尤其是深度神经网络——通常被视为黑箱;人们很难了解其决策过程12。这种缺乏透明性的问题阻碍了各类应用中的可信度与可解释性。因此,可解释人工智能(XAI)已成为可信 AI 不可或缺的组成部分。单一方法无法适用于所有场景:一些方法假设可以完全访问模型内部结构,而另一些则将模型视为不可变的黑箱;一些方法侧重于对单个预测结果进行局部解释,而另一些则提供对模型整体行为的全局洞察。如图1所示,基于可解释性引入的时机不同,这些考量将 XAI 技术大致分为两类:事后解释方法和内在可解释性方法13。事后解释方法可进一步分为模型无关方法和模型特定方法14

维恩图说明事后、内在、混合模型类别;模型无关与模型特定方法。
图1:用于视觉检查的XAI框架。 请点击此处查看此图的放大版本。

  1. 事后解释方法
    事后方法在模型训练完成后生成解释,而不改变其架构或参数15。这些方法之所以流行,是因为它们允许研究人员利用高性能模型,然后回溯性地解释其输出16。然而,由于底层模型保持不变,事后解释必须近似或推断模型的推理过程,这可能引入近似误差和不稳定性17。在接下来的章节中,将介绍模型特定方法和模型无关方法。
    1. 模型特定方法
      这些方法利用对模型结构或训练机制的了解,提供针对该模型的定制化解释。一个典型例子是深度神经网络中的基于梯度的归因方法。例如 GradCAM(梯度加权类激活映射)利用训练好的卷积神经网络(CNN)内部的梯度,生成视觉“热图”,突出显示输入图像中对特定预测最重要的区域17。GradCAM 计算目标类别得分相对于最终卷积层特征图的梯度,并将这些梯度投影到图像上,从而生成具有类别区分能力的定位图。其他梯度传播方法可推广至不同的网络架构。集成梯度法(Integrated Gradients, IG)18 沿从基线输入(例如空白图像)到实际输入的路径累积梯度,并满足特征归因的理想公理。DeepLIFT19 类似地通过每一层传播参考激活的差异,以估计每个输入特征的贡献。逐层相关性传播(Layer-wise Relevance Propagation, LRP)则逐层反向传播预测得分,将“相关性”分配给每个输入像素或特征20。总之,模型特定方法利用内部梯度、激活值或注意力机制,生成与模型结构紧密耦合的解释。
    2. 模型无关方法
      相比之下,模型无关方法将模型视为一个可查询输出的黑箱。这些技术做出的假设极少,通常仅要求能够获取模型对扰动输入的预测结果。例如 LIME(局部可解释模型无关解释),它使用一个简单且可解释的模型(如稀疏线性模型或决策树),在给定输入附近模拟复杂模型的行为21。对于某个特定预测,LIME 生成大量扰动后的输入版本,获取黑箱模型对每个版本的预测结果,然后学习一个加权线性回归模型,以近似这些局部的输入-输出关系22。该代理线性模型的系数即作为解释,指示哪些特征对预测影响最大23。LIME 的优势在于其灵活性(可用于任何分类器)以及直观的输出(例如一组带权重的特征)。SHapley Additive exPlanations(SHAP)是另一种基于博弈论的流行模型无关方法24。SHAP 通过计算特征归因来解释单个预测,这些归因近似于合作博弈论中的 Shapley 值,确保了可加性和一致性等性质25。除了特征归因外,模型无关方法还包括用于图像模型的视觉扰动方法。RISE(用于解释的随机输入采样)通过随机遮蔽输入图像的部分区域并观察模型输出的变化来生成重要性图谱26。通过采样大量此类遮罩,RISE 构建一个概率显著性图谱,指示哪些像素或区域对预测最具影响力26。值得注意的是,RISE 无需访问模型内部结构,仅需能够在修改后的输入上评估模型,因此是真正的黑箱方法。最后,日益发展的模型无关可解释人工智能(XAI)领域关注反事实解释。反事实解释不列举特征重要性,而是回答这样一个问题:“对输入进行何种最小改动会改变模型的预测?”27。生成反事实的算法通常在输入空间(或学习到的潜在空间)中搜索能产生期望输出的最近样本,同时确保变化的合理性和稀疏性。总之,事后 XAI 方法被广泛采用,因为它们可在训练后应用于高性能模型,结合了预测能力与一定程度的透明性。
  2. 内在可解释性方法
    内在方法采取了根本不同的策略:这些方法并非事后解释黑箱模型,而是在设计时就使模型具备可解释性。自解释神经网络(Self-Explaining Neural Networks, SENN)是一个显著的例子。在 Alvarez-Melis 和 Jaakola 提出的 SENN 框架中28,神经网络被设计为首先计算一组中间概念激活,然后通过这些概念的简单、可解释函数生成预测。ProtoPNet(原型部分网络)是一种深度网络,通过将输入与每个类别的学习原型表示进行比较来实现分类。例如,在图像分类任务中,ProtoPNet 可能学习原型图像块,并通过找出哪些原型被输入最大程度激活来做出决策29。在序列模型和 Transformer 领域,注意力机制也被用于实现内在可解释性。一些模型在训练时采用注意力对齐目标,促使模型的注意力权重对应于已知的重要特征或人工标注的相关区域。通过引导注意力“因正确的原因而关注”30,这些方法不仅性能良好,而且其注意力分布可直接被解释为解释。此外,这类模型生成的解释通常在构造上就是保真的,因为解释来源于模型自身可解释的结构,而非外部的事后近似31

3. 可解释人工智能分类法

为了对研究现状进行系统性综合,本研究依据 PRISMA 指南开展了一项系统性文献综述(图2)。该过程涵盖多个学术数据库(Scopus、Web of Science、IEEE Xplore、SpringerLink、PubMed、arXiv 和 MDPI),并采用一组检索词进行指导,检索词包括 “可解释人工智能”、“可解释性”、“视觉检测”、“缺陷检测”、“异常检测”、“制造业”“医学影像”。纳入标准要求论文必须在视觉检测场景(工业或医学)中明确应用或评估可解释人工智能(XAI)方法,并提供足够的方法学细节。排除标准剔除了未实现的纯理论提案,以及不属于视觉检测范畴的研究。初步检索共获得 483 篇文献记录。在去除重复项并对标题和摘要进行筛选后,保留 147 篇进行全文审查。根据纳入/排除标准,最终确定 75 项主要研究,构成本次综述的基础。

展示XAI分类法的PRISMA流程图,显示记录的识别、筛选和纳入情况。
图2:遵循PRISMA指南的系统性综述流程的PRISMA流程图。该图展示了在各个阶段识别、筛选和排除的文献记录,最终纳入75项主要研究。 请点击此处查看该图的放大版本。

  1. 已评审研究的应用分类法
    基于第2节中介绍的概念框架(事后解释与内在方法),我们从这75项研究中提炼出一种面向特定领域的分类体系。该应用分类法根据方法在视觉检测任务中的实现方式进行了区分,如图3所示。
  2. 研究在分类体系中的分布情况
    75项研究的完整分布情况汇总于表1中。每项研究均被归类至其对应的方法学类别和应用领域。这为第4节中所呈现的比较分析提供了实证基础。
  3. 综合分析
    本系统性综述揭示了若干明确趋势。首先,基于梯度的事后解释方法由于其高效性和易于集成的特点,在工业与医学检测任务中仍被最广泛采用。其次,基于扰动的方法虽能提供更丰富的特征归因,但由于计算开销较大,在高通量工业场景中应用较少。第三,内在方法正逐渐受到关注,但目前仍占比偏低,实施此类方法的研究不足15%。
    通过将该分类体系建立在可重复的PRISMA指南引导的文献回顾基础上,并将其与包含75项研究的结构化数据库相连接,本节建立了一个经过验证的证据基础。这些发现为第4节的比较分析奠定了基础,在该分析中,代表性方法将在标准化指标(保真度、鲁棒性、延迟和定位准确性)下进行基准测试。

XAI 方法分类图;包含内在方法、事后方法、模型特定方法和模型无关方法。
图 3:面向视觉检测任务的XAI方法分类体系。 请点击此处查看此图的放大版本。

XAI 方法XAI 途径研究行业年份
内在可解释性基于规则与线性模型32,33通用、医学2015–2019
基于原型的方法(ProtoPNet、基于案例的方法、可变形 ProtoPNet)29,34,35,36医学、工业、通用2018–2024
基于概念驱动的方法(概念瓶颈、正确理由的正确决策)30,31,37通用、科学应用2020–2021
自解释神经网络(SENN)28通用2018–2020
解耦表征(β-VAE)、SOXAI38,39通用2018
视觉 Transformer(通过注意力机制实现内在可解释性)40,41,42,43,44,45计算机视觉、制造业2020–2024
事后解释、模型特定CAM 系列方法46,47,48,49,50,51,52, 53,54,55,56,57,58医学影像、制造业、汽车、农业、电子2018–2025
LRP(逐层相关性传播)20,59,60,61,62通用、医学影像2015–2024
梯度与显著性方法(积分梯度、平滑 IG、DeepLIFT、反卷积网络、T-Explainer、显著性基准)18,19,63,64,65,
66,67,68,69,70
通用、医学影像2013–2025
专用模型中的归因方法(SNNs、Transformer 注意力归因)71,72,73神经科学、视觉 Transformer2023–2025
事后解释、模型无关LIME 及其变体(LIME、ELIME、MASALA)、SHAP 及其变体(Tree SHAP)金融、预测与健康管理、网络安全、自动驾驶、工业检测2016–2025
反事实解释21,22,23,24,25,27,74,
75,76,77,78,79,80,81,
82,83,84,85,86
解释方法
混合方法多种 XAI 方法的集成(包括 GradCAM、SHAP、LRP、LIME)58,87,88,89,90,91,92工业检测、医疗健康、制造业2021–2025

表1:按可解释人工智能方法、年份、行业和方法分类的75项综述研究。

4. XAI 的评估指标

计算机视觉模型的性能通常由准确率、精确率和召回率等成熟指标来评判。然而,评估模型决策的可解释性则远非易事。与标准的预测性能不同,目前尚无普遍接受的指标用于衡量人工智能解释的质量66。换句话说,尽管分类器的准确率可以被精确测量,但对于给定图像分类的解释“有多好”,却缺乏公认的量化标准93。这种差异凸显了可解释人工智能(XAI)领域的一个根本性缺口:如何评估一个解释。

建立标准化的可解释人工智能(XAI)评估标准已被证明极具挑战性。其中一个原因是,可解释性与解释质量具有多面性且依赖于具体情境,因此难以用单一的通用指标来衡量10。有效评估一个解释需依赖多个因素,包括应用领域、所生成解释的性质以及最终用户的背景。例如,适用于医学影像诊断的解释方法,其评估方式可能与用于工业视觉检测任务的解释方法有所不同10

在实际应用中,由于缺乏标准的评估指标,研究人员不得不依赖多种不同的评估方法。许多研究仍诉诸于对可解释人工智能(XAI)方法进行定性、轶事式的评估94,95。常见的情况是,作者展示若干显著性图或热图,并主张这些结果看起来合理(即所谓的“表面效度”检验)96。这种视觉检查在叙述层面可能具有说服力,但在严格比较中仍具有主观性且不足97。这说明了标准化XAI评估指标的困难所在:在缺乏共识性标准的情况下,研究人员往往针对每个数据集或具体应用场景提出定制化的评估指标。

因此,目前的文献中涌现出大量不同的可解释人工智能(XAI)评估指标,旨在填补这一空白98。众多框架和度量方法相继被提出,各自针对解释有效性中的某一特定方面99。总体而言,这些指标可根据其主要关注点进行分类。基于保真度的指标通过解释对模型决策过程的还原程度来评判其优劣100。相比之下,以可解释性为中心的指标则评估解释对人类观察者的易懂性和说服力101。第三类为基于任务的指标,其对解释的评估取决于该解释对最终用户任务表现的影响102。第四类是面向鲁棒性的指标,用于评估结果的一致性103。最后,混合型指标则融合了多个维度的评估标准104

这些多样化的指标反映了研究人员所重视的可解释性方面,同时也凸显了目前缺乏统一标准的问题:每个指标仅能捕捉解释质量的一个特定角度105。下文将可解释人工智能(XAI)的一系列评估指标分为四大类,并在表2中进行总结。

度量类型度量指标公式 / 定义
保真性删除曲线下面积(AUC)26积分方程:∫ 从 0 到 1,f(x, S<sub>k</sub>) dk,参数为 S<sub>k</sub>。
Sk 为 top-k 重要特征;数值越低表示保真性越高
插入曲线下面积(AUC)26积分方程 ∫ 从 0 到 1 f(x ∪ S_k) dk;数学公式。
数值越高表示保真性越高
不保真度评分(Infidelity score)103数学方程,Eδ[(δᵀE(x)−(f(x)−f(x−δ)))²],统计分析公式。
数值越低表示性能越好
ROAR106移除“重要”特征后重新训练导致的准确率下降
鲁棒性稳定性指数(Stability index)107数学公式,方差估计,示意图,用于教育研究。
数值越高表示结果越一致
Lipschitz 评分(Lipschitz score)103对比损失函数方程,用于机器学习中的数据编码分析。
数值越低表示鲁棒性越强
可解释性稀疏性(Sparsity)79使用特征数与总特征数的比值;特征选择的数学概念;公式表示。
数值越低表示模型越简单
代理模型深度(Surrogate depth)79可解释代理模型的深度(例如决策树);
深度越浅表示模型越简单
任务特定性交并比(intersection-over-union, IoU)108集合论方程,包含交集与并集符号,用于数学分析的公式。
掩码 M 与真实标注 G 之间的重叠程度
指向游戏(Pointing Game)108准确率 = 命中次数 / 样本总数
数值越高表示性能越好
混合型综合评分(Composite score)104保真性、稀疏性和鲁棒性的加权组合

表2:视觉检测中可解释人工智能(XAI)的评估指标,分为四个主要类别。

5. 比较分析

本节在公开数据集上对方法进行了比较,包括 MVTec AD109(>5,000 张带有像素级掩码的缺陷图像)和 DeepPCB110(1,500 张印刷电路板图像,包含六类缺陷)、CheXpert111 以及 ImageNet112,并采用以下指标进行评估:删除/插入 AUC(可信度)、指向性游戏准确率(定位能力)、稳定性分数(在扰动下的鲁棒性)以及延迟时间(运行开销)。

基于 CAM 的方法(GradCAM、GradCAM++)在 MVTec AD 和 DeepPCB 上的结果显示,GradCAM 的保真度为 0.83–0.87(插入 AUC 约 0.68;删除条件下准确率下降 <15%),敏感性为 0.80–0.85,运行时间 <100 毫秒(约每秒 39 帧(FPS))。定位性能处于中等水平(平均 IoU ≈0.28 @ δ=0.25;指向准确率为 86–87%)。GradCAM++ 在保持相似延迟(<120 毫秒)的同时提升了多实例定位能力(平均 IoU = 0.38),并获得更高的用户信任度(109.69/250 对比 GradCAM 的 56.08/250)。这些方法效率较高,但空间分辨率较粗47,113

对于 基于扰动的方法 (LIME、SHAP、RISE),在不同数据集上的表现存在差异。在 MVTec AD 上,LIME 达到局部保真度 R² = 0.70–0.80,但表现出较低的鲁棒性(稳定性指数) <0.5),延迟为3-5秒/图像,定位能力中等(IoU = 0.25–0.35)。将SHAP应用于PCB缺陷分类可实现稳定的归因结果(Δ log-odds = 0.2–0.3),且与人类判断高度一致(70%–80%),但速度较慢(>1 帧/图像),且定位能力较弱(IoU ≈ 0.02–0.03)。RISE 在 MS-COCO 上进行基准测试,并在 MVTec AD 上复现,平均需要 4,000–8,000 次掩码前向传播,从而产生较高的鲁棒性(稳定性) >0.7)、保真度(0.78–0.82 AUC)和更优的定位能力(Pointing-Game 为 62.9%,而 GradCAM 为 48.3%),但解释延迟为 1–2 秒/次26,74,79,114.

对于相关性传播方法(LRP、DeepLIFT),在 DeepPCB 和 CheXpert 上的评估表明,LRP 的保真度为 0.82–0.90,敏感性约为 0.85,定位交并比(IoU)为 0.40–0.50。每幅图像的运行时间为 100–200 毫秒,虽慢于 CAM 方法,但可用于接近实时的检测。在 CheXpert 放射学任务中,专家研究表明 >LRP热图与临床相关区域之间存在70%的重叠,表明跨领域的可解释性60.

对于基于注意力的方法(Transformers),在ImageNet和CheXpert上训练的ViT模型,其原始注意力图的保真度为0.75–0.85,但在扰动下表现不稳定,敏感性为0.70–0.75,定位能力一般(IoU = 0.30–0.45)。人类信任度约为60–70%。改进后的方法(如注意力流、Transformer-LRP)在因果性指标上表现更优,在删除/插入和指向游戏评分中均优于原始注意力图40,115,116

对于基于原型和反事实的方法,在 MVTec AD 上的评估表明,ProtoPNet 能够实现基于示例的解释,其预测结果通过与相似缺陷案例的比对加以佐证,有助于操作人员决策。基于自组织映射(SOM)的方法将缺陷特征聚类于二维图谱上,保留了特征间的拓扑关系。反事实方法在 PCB 缺陷图像和 CheXpert 数据集上均经过测试,可提供可操作的推理(例如“若裂纹长度小于 1 mm,则预测结果转为正常”),但需要高昂的优化成本,且在处理高分辨率输入时表现不佳。这些方法与人类的推理方式高度一致,但可扩展性较差117,118,119

最后,在权衡利弊并进行实际选择时,CAM 方法在对延迟敏感的工作流中占主导地位,但其结果仍较为粗略。LRP 在保真度和运行时间之间实现了平衡,在像素级分析中表现优异。RISE 在因果忠实性和定位能力方面表现最强,但延迟达到秒级。SHAP 和 LIME 可提升可解释性,但速度较慢且结果不稳定。原型与反事实方法在最大程度上实现了与人类认知的一致性,但在高分辨率检测中的可扩展性较差。基于 Transformer 的模型需要在原始注意力机制之外进行专门化改进。因此,没有任何一种方法在所有场景下均优于其他方法;相反,方法的选择必须反映数据集、任务、延迟、预算和可解释性需求。如图4所示,该选择工作流将其中三个基准(任务、延迟、可解释性)整合为一个面向任务的指南,用于在视觉检测中选择 XAI 方法。

用于分类与分割的可解释人工智能方法流程图,展示延迟与解释细节。
图 4:可解释人工智能方法选择的工作流程。该决策流程图用于指导在视觉检测中选择合适的可解释人工智能(XAI)方法。该工作流程考虑了任务类型(分类、分割、异常检测、回归)、延迟限制和解释详细程度,并将其与代表性方法相对应。请点击此处查看此图的放大版本。

6. 讨论

  1. 比较性发现
    我们的分析表明,基于梯度的方法(如 GradCAM 和逐层相关性传播(LRP))在突出卷积网络决策中最关键的图像区域方面表现优异,使其成为缺陷定位或医学图像分类等任务的直观工具。这些方法效率较高,因为它们仅需一次反向传播即可完成,但其解释结果往往较为粗糙,在复杂区域中可能变得不清晰。相比之下,模型无关的特征归因技术(如 SHAP 和 LIME)通过扰动输入或拟合局部代理模型来探测模型,从而提供更定量的特征贡献分析,但其计算成本高于 GradCAM。
    基于注意力的方法利用模型内部权重来突出模型内部的关注区域115。而 RISE 则代表一种基于随机化的策略,通过对输入进行掩码和采样以生成灵活的显著性图,但需要数千次前向传播。综合来看,这些技术在特定情况下各具优势,但没有一种方法在所有场景下均能全面优于其他方法26。相反,方法的选择取决于模型架构、视觉检测任务、延迟要求以及决策者所需的信息类型。
  2. 案例研究
    以下是 XAI 在医疗和工业领域实际应用的案例研究:在医疗领域,基于胸部 X 光片和 CT 扫描训练的肺炎和 COVID-19 检测模型通过 GradCAM 和 LIME 进行解释,在用户研究中,放射科医生始终更偏好 GradCAM,因为其高亮区域与肺部浸润等预期病理表现一致120。类似地,在头颈部癌症的数字病理学中,由 GradCAM 和高分辨率 CAM 支持的 CNN 预测结果突出了恶性细胞簇,病理学家确认这些区域具有临床相关性,表明解释性不仅提升了临床准确性,也增强了信任度121
    在制造业中,XAI 在准确性和可解释性方面带来了变革性提升。其中一个主要应用是利用基于 Xception 架构的卷积神经网络对轮胎 X 光图像进行异物检测。通过引入梯度加权类激活映射(GradCAM),该系统实现了超过 99% 的分类准确率,并生成热图以指示图像中导致预测结果的具体区域。这些可视化解释使质量控制工程师能够验证模型的关注点是否集中在轮胎结构支撑中的真实异常,而非无关的伪影,从而极大提升了信任度,并促进了其在高风险生产环境中的部署48
    在电子行业中,SolderNet 方法展示了 XAI 在像素级缺陷检测中的集成应用。该基于 CNN 的方法专为印刷电路板焊点检测而开发,该任务对高准确性和可解释性具有强制性要求。通过应用 GradCAM 和逐层相关性传播(LRP),该方法提取出显著性图,突出显示了导致特定缺陷分类的像素。借助这种可解释性,操作员能够区分真阳性和假阳性,并深入理解此前无法解释的故障模式39。这些案例表明,当 XAI 的解释与专家推理一致时,其价值得以体现;而当解释不稳定、粗糙或计算上不可行时,则往往被低估或未被充分利用。
  3. 当前证据的局限性
    尽管取得了上述进展,仍存在若干局限性。首先,大多数实证研究依赖于公共数据集,如用于工业检测的 MVTec AD 或用于医学影像的 VinDR-CXR122,这些数据集可能无法充分代表工厂或医院的真实环境。其次,评估方法仍较为分散:保真度、鲁棒性和可解释性在不同研究中衡量方式不一致,常采用临时定义且缺乏标准化阈值。第三,许多研究缺乏人类验证。尽管删除 AUC、指向游戏准确率或定位 IoU 等指标提供了定量结果,但它们无法确认这些解释是否真正改善了用户的决策过程。最后,在制造业中,仅有约 8% 的基于 AI 的质量保证研究在其工作流程中集成了 XAI123。这凸显了实际应用中的采纳差距,尽管该统计数据因行业和方法而异,可能并不完全准确。
  4. 对实践者的实际意义
    对实践者而言,有若干重要启示。基于梯度的方法仍是实时检测任务中最实用的选择,因其能以低延迟(每张图像约 100 毫秒)提供解释,且易于部署。基于扰动的方法(如 SHAP 或 RISE)延迟高于基于梯度的方法,但更适用于细粒度归因比延迟更重要的领域,例如医疗领域,其准确性优先于速度。基于注意力的方法在 Transformer 架构中具有应用价值,但需谨慎解读,因为原始注意力图并不总能提供清晰的解释。除技术权衡外,成功应用还高度依赖于系统集成、用户培训以及可解释性临床价值的展示。如案例研究所示,只有当解释明确与领域专业知识一致,并帮助实践者验证或质疑 AI 预测时,其价值才能真正体现。
  5. 未来研究方向
    未来研究应优先推进以下几个可操作的方向:
    评估协议的标准化:建立关键指标的可重复报告指南,包括删除/插入 AUC、指向游戏准确率、稳定性指数和延迟。
    领域特定的基准数据集:开发针对工业和医学视觉检测的精选数据集,并提供真实标注,以减少对有限公共数据集的过度依赖。
    以人为中心的验证:扩展研究范围,评估 XAI 解释是否真正提升了决策质量、用户信任度以及人机协作效果,而不仅限于代理指标。
    成本-效益分析:开展严格的部署研究,量化将 XAI 集入视觉检测工作流程所带来的商业和临床价值。

访问受限。请登录或开始试用以查看此内容。

结论

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

本综述分析了75项关于视觉检测中可解释人工智能(XAI)的研究,提出了事后解释与内在解释方法的分类体系,并开展了以基准测试为导向的比较分析。研究结果证实,不存在一种在所有场景下均优于其他方法的单一XAI方法:基于梯度的方法(如GradCAM和LRP)在实时缺陷定位方面效率较高,但在复杂区域中的解释可能较为粗糙;基于扰动的方法(如SHAP、LIME和RISE)能提供更精细的细节和较高的保真度,但常因延迟高和计算成本大而在实际应用中失效;基于注意力机制的方法利用了Transformer的内部结构,但当原始注意力未能反映因果推理时,其可靠性较差;LRP虽能生成详细的解释,但其计算成本仍高于基于CAM的方法。这些局限性明确表明,XAI方法的有效性高度依赖于其具体应用情境。

通过此项分析,得出四项可操作的建议:

任务需求对齐: 若方法应用不当(例如,将粗粒度显著性方法用于细粒度任务),则会导致失败;方法的选择必须与分类、分割或异常检测等任务需求相匹配。

访问受限。请登录或开始试用以查看此内容。

披露

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,本作品的发表不存在任何利益冲突。

致谢

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

作者声明,本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。

访问受限。请登录或开始试用以查看此内容。

参考文献

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Alzarooni, A., et al. Anomaly detection for industrial applications, its challenges, solutions, and future directions: a review. IEEE Sens J. XX. (1), 1(2025).
  2. Hardan, F., Almusawi, A. R. J. Developing an automated vision system for maintaing social distancing to cure the pandemic. Al-Khwarizmi Eng J. 18 (1), 38-50 (2022).
  3. Terasaki, N., Fujio, Y. Mechanoluminescent visualization of crack propagation for joint evaluation. J Vis Exp. (191), e64118(2023).
  4. Al-Hamadani, S., Al-Darraji, I. Warehouse in Industry 4.0 based drone, computer vision, and artificial intelligence technologies: a literature review. Proc Eng Sci. 7 (1), 517-526 (2025).
  5. Al-Jubori, H. N., Izzat, A. D., Jerbi, H. Defect detection using thermography camera techniques: a review. Al-Khwarizmi Eng J. 20 (4), 70-88 (2024).
  6. Al-Hamadani, S., Al-Darraji, I., Jerbi, H. Improving barcode vision scanning process using a drone-based tracking PID controller for warehouse in Industry 4.0. Al-Khwarizmi Eng J. 21 (2), 72-92 (2025).
  7. Al-Jubori, H. N., Al-Darraji, I. Tools and process of defect detection in automated manufacturing systems. EAI Endorsed Trans Scalable Inf Syst. 10 (6), e4000(2023).
  8. Alaa, T., et al. Automated detection of defects on metal surfaces using vision transformers. , Published online October 6, 2024. Accessed August 1 (2025).
  9. Moosavi, S., et al. Explainable AI in manufacturing and industrial cyber-physical systems: a survey. Electronics. 13 (17), 3497(2024).
  10. Nauta, M., et al. From anecdotal evidence to quantitative evaluation methods: a systematic review on evaluating explainable AI. ACM Comput Surv. 55 (13), 1-42 (2023).
  11. Cheng, Z., et al. A comprehensive review of explainable artificial intelligence (XAI) in computer vision. Sensors. 25 (13), 4166(2025).
  12. Barredo Arrieta, A., et al. Explainable artificial intelligence (XAI): concepts, taxonomies, opportunities and challenges toward responsible AI. Inf Fusion. 58, 82-115 (2020).
  13. Kouchaki, S., et al. Survey of explainable AI techniques in healthcare. Sensors. 23 (2), 634(2023).
  14. Laugel, T., et al. The dangers of post-hoc interpretability: unjustified counterfactual explanations. Proc Int Joint Conf Artif Intell. , 2801-2807 (2019).
  15. Slack, D., et al. Reliable post hoc explanations: modeling uncertainty in explainability. Adv Neural Inf Process Syst. 33, 9391-9404 (2020).
  16. Cesarini, M., et al. Explainable AI for text classification: lessons from a comprehensive evaluation of post hoc methods. Cognit Comput. 16 (6), 3077-3095 (2024).
  17. Mohamed Musthafa, M., et al. Enhancing brain tumor detection in MRI images through explainable AI using Grad-CAM with ResNet-50. BMC Med Imaging. 24 (1), 1-19 (2024).
  18. Sundararajan, M., Taly, A., Yan, Q. Axiomatic attribution for deep networks. Proc Int Conf Mach Learn. 70, 5109-5118 (2017).
  19. Shrikumar, A., Greenside, P., Kundaje, A. Learning important features through propagating activation differences. Proc Int Conf Mach Learn. 70, 4844-4866 (2017).
  20. Bassi, P. R. A. S., et al. Improving deep neural network generalization and robustness to background bias via layer-wise relevance propagation optimization. Nat Commun. 15, 44371(2024).
  21. Knab, P., et al. Which LIME should I trust? Concepts, challenges, and solutions. arXiv preprint. , (2025).
  22. Garreau, D., von Luxburg, U. Explaining the explainer: a first theoretical analysis of LIME. Proc Mach Learn Res. 108, 1287-1296 (2020).
  23. Qian, J., et al. ELIME: exact local interpretable model-agnostic explanation. Eur J Artif Intell. , (2024).
  24. Salih, A. M., et al. A perspective on explainable artificial intelligence methods:SHAP and LIME . Adv Intell Syst. , (2024).
  25. Hermosilla, P., et al. Explainable AI for forensic analysis: a comparative study of SHAP and LIME in intrusion detection models. Appl Sci. 15 (13), 7329(2025).
  26. Petsiuk, V., Das, A., Saenko, K. RISE: randomized input sampling for explanation of black-box models. arXiv preprint. , (2018).
  27. Dandl, S., et al. Multi-objective counterfactual explanations. Lect Notes Comput Sci. 12269, 448-469 (2020).
  28. Alvarez-Melis, D., Jaakkola, T. S. Towards robust interpretability with self-explaining neural networks. Adv Neural Inf Process Syst. 31, 7775-7784 (2018).
  29. Donnelly, J., Barnett, A. J., Chen, C. Deformable ProtoPNet: an interpretable image classifier using deformable prototypes. Proc IEEE Conf Comput Vis Pattern Recognit. , 10255-10265 (2022).
  30. Ross, A. S., Hughes, M. C., Doshi-Velez, F. Right for the right reasons: training differentiable models by constraining their explanations. Proc Int Joint Conf Artif Intell. , 2662-2670 (2017).
  31. Schramowski, P., et al. Making deep neural networks right for the right scientific reasons by interacting with their explanations. Nat Mach Intell. 2 (8), 476-486 (2020).
  32. Rudin, C. Stop explaining black box machine learning models for high stakes decisions and use interpretable models instead. Nat Mach Intell. 1 (5), 206-215 (2019).
  33. Letham, B., et al. Interpretable classifiers using rules and Bayesian analysis: building a better stroke prediction model. Ann Appl Stat. 9 (3), 1350-1371 (2015).
  34. Barnett, A. J., et al. Interpretable mammographic image classification using case-based reasoning and deep learning. arXiv preprint. , (2021).
  35. Narayanan, A., Bergen, K. J. Prototype-based methods in explainable AI and emerging opportunities in the geosciences. arXiv preprint. , (2024).
  36. Chen, C., et al. This looks like that: deep learning for interpretable image recognition. Adv Neural Inf Process Syst. 32, 8928-8939 (2019).
  37. Koh, P. W., et al. Concept bottleneck models. Proc Int Conf Mach Learn. 119, 5294-5304 (2020).
  38. Burgess, C. P., et al. Understanding disentangling in β-VAE. arXiv preprint. , (2018).
  39. Gunraj, H., et al. SolderNet: towards trustworthy visual inspection of solder joints in electronics manufacturing using explainable artificial intelligence. Proc AAAI Conf Artif Intell. 37, 15668-15674 (2023).
  40. Dosovitskiy, A., et al. An image is worth 16×16 words: transformers for image recognition at scale. arXiv preprint. , (2020).
  41. Khan, S., et al. Transformers in vision: a survey. ACM Comput Surv. 54 (10), 1-41 (2021).
  42. Yu, L., et al. eX-ViT: a novel explainable vision transformer for weakly supervised semantic segmentation. Pattern Recognit. 142, 109666(2023).
  43. Alber, M., et al. Evaluating vision transformer models for visual quality control in industrial manufacturing. Lect Notes Comput Sci. Bifet, A., et al. 14950, 1-15 (2024).
  44. Stassin, S., et al. Explainability and evaluation of vision transformers: an in-depth experimental study. Electronics. 13 (1), 175(2024).
  45. Zhai, Y., et al. A lightweight transformer with linear self-attention for defect recognition. Electron Lett. 60 (17), e13292(2024).
  46. Dhore, V., et al. Enhancing explainable AI: a hybrid approach combining Grad-CAM and LRP for CNN interpretability. arXiv preprint. , (2024).
  47. Chattopadhay, A., et al. Grad-CAM++: generalized gradient-based visual explanations for deep convolutional networks. Proc IEEE Winter Conf Appl Comput Vis. , 839-847 (2018).
  48. Saleh, R. A. A., et al. Advancing tire safety: explainable artificial intelligence-powered foreign object defect detection with Xception networks and Grad-CAM interpretation. Appl Sci. 14 (10), 4267(2024).
  49. Meister, S., et al. Investigations on explainable artificial intelligence methods for the deep learning classification of fibre layup defect in the automated composite manufacturing. Compos Part B Eng. 224, 109160(2021).
  50. Luo, X., Alzahrani, M. Automated tomato defect detection using CNN feature fusion for enhanced classification. Processes. 13 (1), 115(2025).
  51. Rahimunnisa, K. Textile fabric defect detection. J Innov Image Process. 4 (3), 165-172 (2022).
  52. Shin, H., et al. Visualization for explanation of deep learning-based defect detection model using class activation map. Comput Mater Contin. 75 (3), 4753-4766 (2023).
  53. Yue, H., et al. ASOD: attention-based salient object detector for strip steel surface defects. Electronics. 14 (5), 831(2025).
  54. Saleh, R. A. A., Ertunç, H. M. Explainable attention-based fused convolutional neural network (XAFCNN) for tire defect detection: an industrial case study. Eng Res Express. 6 (1), 015027(2024).
  55. Leem, S., Seo, H. Attention guided CAM: visual explanations of vision transformer guided by self-attention. Proc AAAI Conf Artif Intell. 38 (4), 2956-2964 (2024).
  56. Ibrahim, R., Shafiq, M. O. Augmented Score-CAM: high-resolution visual interpretations for deep neural networks. Knowl Based Syst. 252, 109287(2022).
  57. Clement, T., et al. XAI-enhanced semantic segmentation models for visual quality inspection. Proc IEEE Int Conf Consumer Electron. , 1-4 (2024).
  58. Riedel, H., et al. Automated quality control of vacuum insulated glazing by convolutional neural network image classification. Autom Constr. 135, 104144(2022).
  59. Böhle, M., et al. Layer-wise relevance propagation for explaining deep neural network decisions in MRI-based Alzheimer's disease classification. Front Aging Neurosci. 10, 194(2019).
  60. Bach, S., et al. On pixel-wise explanations for non-linear classifier decisions by layer-wise relevance propagation. PLoS One. 10 (7), e0130140(2015).
  61. Dieter, T. R., Zisgen, H. Evaluation of the explanatory power of layer-wise relevance propagation using adversarial examples. Neural Process Lett. 55 (7), 8531-8550 (2023).
  62. Hoefler, M. A., et al. XAI-guided insulator anomaly detection for imbalanced datasets. arXiv. , (2024).
  63. Kares, F., et al. What makes for a good saliency map? Comparing strategies for evaluating saliency maps in explainable AI (XAI). arXiv preprint. , (2025).
  64. Yona, G., Greenfeld, D. Revisiting sanity checks for saliency maps. arXiv preprint. , (2021).
  65. Zeiler, M. D., Fergus, R. Visualizing and understanding convolutional networks. Eur Conf Comput Vis. 8689, 818-833 (2014).
  66. Xu-Darme, R., et al. On the stability, correctness and plausibility of visual explanation methods based on feature importance. ACM Int Conf Proc Ser. , 119-125 (2023).
  67. Ortigossa, E. S., et al. T-Explainer: a model-agnostic explainability framework based on gradients. arXiv preprint. , (2024).
  68. Singh, M., et al. Attributional robustness training using input-gradient spatial alignment. Lect Notes Comput Sci. 12372, 515-533 (2019).
  69. Cerekci, E., et al. Quantitative evaluation of saliency-based explainable artificial intelligence methods in deep learning-based mammogram analysis. Eur J Radiol. 173, 111356(2024).
  70. Meister, S., et al. Cross-evaluation of a parallel operating SVM-CNN classifier for reliable internal decision-making processes in composite inspection. J Manuf Syst. 60, 620-639 (2021).
  71. Bitar, A., et al. Gradient-based feature-attribution explainability methods for spiking neural networks. Front Neurosci. 17, 1153999(2023).
  72. Qiang, Y., et al. Interpretability-aware vision transformer. arXiv preprint. , (2023).
  73. Bousselham, W., et al. LeGrad: an explainability method for vision transformers via feature formation sensitivity. arXiv preprint. , (2025).
  74. Lundberg, S. M., Lee, S. I. A unified approach to interpreting model predictions. Adv Neural Inf Process Syst. 30, (2017).
  75. Khan, F. S., et al. Model-agnostic explainable artificial intelligence methods in finance: a systematic review, recent developments, limitations, challenges and future directions. Artif Intell Rev. 58, 1-65 (2025).
  76. Nazim, S., et al. Advancing malware imagery classification with explainable deep learning: a state-of-the-art approach using SHAP LIME and Grad-CAM. PLoS One. 20 (5), e0318542(2025).
  77. Solís-Martín, D., et al. On the soundness of XAI in prognostics and health management (PHM). Information. 14 (5), 256(2023).
  78. Biecek, P., Burzykowski, T. Local interpretable model-agnostic explanations (LIME). In:Explanatory Model Analysis. , 107-123 (2021).
  79. Ribeiro, M. T., Singh, S., Guestrin, C. 34;Why should I trust you?" Explaining the predictions of any classifier. Proc ACM SIGKDD Int Conf Knowl Discov Data Min. , 1135-1144 (2016).
  80. Tahir, H. A., et al. A novel hybrid XAI solution for autonomous vehicles: real-time interpretability through LIME-SHAP integration. Sensors. 24 (21), 6776(2024).
  81. Goldman, C. V., et al. Explaining learning models in manufacturing processes. Procedia Comput Sci. 180, 259-268 (2021).
  82. Emmanouilidis, C., Rica, E. Visual quality control via explainable AI and the case of human in the AI loop. In: Lect Notes Mech Eng. , 252-260 (2023).
  83. Huang, M., et al. An interpretable approach using hybrid graph networks and explainable AI for intelligent diagnosis recommendations in chronic disease care. Biomed Signal Process Control. 91, 105913(2024).
  84. Dardouillet, P., et al. Explainability of image semantic segmentation through SHAP values. Data. 7 (8), 255(2022).
  85. Saifullah, S., et al. The privacy-explainability trade-off: unraveling the impacts of differential privacy and federated learning on attribution methods. Front Artif Intell. 7, 1236947(2024).
  86. Velmurugan, M., et al. Developing guidelines for functionally-grounded evaluation of explainable artificial intelligence using tabular data. Eng Appl Artif Intell. 141, 109772(2025).
  87. Wells, L., Bednarz, T. Explainable AI and reinforcement learning-a systematic review of current approaches and trends. Front Artif Intell. 4, 550030(2021).
  88. Rožanec, J. M., et al. Adaptive explainable artificial intelligence for visual defect inspection. Procedia Comput Sci. 232, 3034-3043 (2024).
  89. Nguyen, H. T. T., et al. XEdgeAI: a human-centered industrial inspection framework with data-centric explainable edge AI approach. Inf Fusion. 116, 102782(2025).
  90. Han, C., et al. Visual coating inspection framework via self-labeling and multi-stage deep learning strategies. J Intell Manuf. 35, 1-18 (2024).
  91. Kotsiopoulos, T., et al. Revolutionizing defect recognition in hard metal industry through AI explainability, human-in-the-loop approaches and cognitive mechanisms. Expert Syst Appl. 255, 124839(2024).
  92. Forcher, B., et al. Evaluation of explainable AI methods for classification tasks in visual inspection. Proc XAI Workshop (Late-Breaking Work, Demos, Doctoral Consortium). , 77-82 (2023).
  93. Miller, T. Explanation in artificial intelligence: insights from the social sciences. Artif Intell. 267, 1-38 (2019).
  94. Jacovi, A., Goldberg, Y. Towards faithfully interpretable NLP systems: how should we define and evaluate faithfulness. Proc Annu Meet Assoc Comput Linguist. 58, 4198-4205 (2020).
  95. Adebayo, J., et al. Sanity checks for saliency maps. Adv Neural Inf Process Syst. 31, 9505-9515 (2018).
  96. Doshi-Velez, F., Kim, B. Considerations for evaluation and generalization in interpretable machine learning. Proc Explainable and Interpretable Models in Computer Vision and Machine Learning. , 3-17 (2018).
  97. Lage, I., et al. An evaluation of the human-interpretability of explanation. arXiv preprint. , (2019).
  98. Theunissen, M., Browning, J. Putting explainable AI in context: institutional explanations for medical AI. Ethics Inf Technol. 24 (2), 1-10 (2022).
  99. Hoffman, R. R., et al. Measures for explainable AI: explanation goodness, user satisfaction, mental models, curiosity, trust, and human-AI performance. Front Comput Sci. 5, 1096257(2023).
  100. Hedström, A., et al. Quantus: an explainable AI toolkit for responsible evaluation of neural network explanations and beyond. J Mach Learn Res. 24, 1-11 (2023).
  101. Mohseni, S., et al. A multidisciplinary survey and framework for design and evaluation of explainable AI systems. ACM Trans Interact Intell Syst. 11 (3-4), 1-45 (2021).
  102. Finzel, B., et al. Domain-specific evaluation of visual explanations for application-grounded facial expression recognition. Lect Notes Comput Sci. 14065, 31-44 (2023).
  103. Yeh, C. K., et al. On the (in)fidelity and sensitivity for explanations. Adv Neural Inf Process Syst. 32, 10967-10978 (2019).
  104. Better metrics for evaluating explainable artificial intelligence. Rosenfeld, A. Proc Int Conf Autonomous Agents Multiagent Syst, , 45-53 (2021).
  105. Evaluation metrics for XAI: a review, taxonomy, and practical applications. Kadir, M. A., et al. Proc IEEE Int Conf Intell Eng Syst, , 111-124 (2023).
  106. Sankaran, K. Data science principles for interpretable and explainable AI. J Data Sci. 22, 1-27 (2024).
  107. Alvarez-Melis, D., Jaakkola, T. S. On the robustness of interpretability methods. arXiv preprint. , (2018).
  108. Zhang, Y., et al. Saliency-Bench: a comprehensive benchmark for evaluating visual explanations. arXiv preprint. , (2025).
  109. Bergmann, P., et al. The MVTec anomaly detection dataset: a comprehensive real-world dataset for unsupervised anomaly detection. Int J Comput Vis. 129 (4), 1038-1059 (2021).
  110. Tang, S., et al. Online PCB defect detector on a new PCB defect dataset. arXiv preprint. , (2019).
  111. CheXpert: a large chest radiograph dataset with uncertainty labels and expert comparison. Irvin, J., et al. Proc AAAI Conf Artif Intell, 33, 590-597 (2019).
  112. ImageNet: a large-scale hierarchical image database. Deng, J., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 248-255 (2009).
  113. Selvaraju, R. R., et al. Grad-CAM: visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128 (2), 336-359 (2020).
  114. Black-box explanation of object detectors via saliency maps. Petsiuk, V., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 11438-11447 (2020).
  115. Attention is not explanation. Jain, S., Wallace, B. C. Proc Conf North Am Chapter Assoc Comput Linguist, , 3543-3556 (2019).
  116. Transformer interpretability beyond attention visualization. Chefer, H., et al. Proc IEEE Conf Comput Vis Pattern Recognit, , 782-791 (2021).
  117. Wachter, S., et al. Counterfactual explanations without opening the black box: automated decisions and the GDPR. SSRN Electron J. , (2017).
  118. Deep learning for case-based reasoning through prototypes: a neural network that explains its predictions. Li, O., et al. Proc AAAI Conf Artif Intell, 32, 3530-3537 (2018).
  119. Counterfactuals in explainable artificial intelligence (XAI): evidence from human reasoning. Byrne, R. M. J. Proc Int Joint Conf Artif Intell, , 6276-6282 (2019).
  120. Ihongbe, I. E., et al. Evaluating explainable artificial intelligence (XAI) techniques in chest radiology imaging through a human-centered lens. PLoS One. 19 (10), e0308758(2024).
  121. Dörrich, M., et al. Explainable convolutional neural networks for assessing head and neck cancer histopathology. Diagn Pathol. 18 (1), 121(2023).
  122. Nguyen, H. Q., et al. VinDr-CXR: an open dataset of chest X-rays with radiologist's annotations. Sci Data. 9, 429(2022).
  123. Lee, D. J., et al. A systematic literature review on artificial intelligence and explainable artificial intelligence for visual quality assurance in manufacturing. Electronics. 12 (22), 4572(2023).

访问受限。请登录或开始试用以查看此内容。

重印与许可

申请许可以重复使用本 JoVE 文章的文本或图表

申请许可

标签

相关文章