本文综述了在工业和医学领域用于视觉检测的可解释人工智能(XAI)方法。通过采用PRISMA指南的检索策略,共筛选出75项研究,据此构建了针对特定领域的分类体系,并使用标准化指标进行了比较分析。我们提出了一个基于证据的分类体系,以及一个面向实践者的工具选择工作流程。
综述文章
本文综述了在工业和医学领域用于视觉检测的可解释人工智能(XAI)方法。通过采用PRISMA指南的检索策略,共筛选出75项研究,据此构建了针对特定领域的分类体系,并使用标准化指标进行了比较分析。我们提出了一个基于证据的分类体系,以及一个面向实践者的工具选择工作流程。
可解释人工智能(XAI)技术通过使黑箱机器学习模型变得可理解,从而提升自动化视觉检测系统的透明度与可信度。尽管XAI已被广泛应用,但以往的综述尚未涵盖工业与医学检测任务的特定需求。本文综述了在工业和医学领域中将XAI技术应用于视觉检测的研究。系统性检索了IEEE Xplore、Scopus、PubMed、arXiv和Web of Science数据库中2014年至2025年间发表的研究,纳入标准要求研究在使用公开或领域特定数据集的检测任务中应用了XAI技术。从初步筛选的研究中,共纳入75项研究,并将其分为事后解释(post-hoc)和内在解释(intrinsic)两类,随后从保真度、鲁棒性、复杂性和定位准确性四个方面进行评估。结果表明,基于梯度和传播的方法能够提供适用于近实时检测的高效可视化解释,但其定位较为粗糙;而基于扰动和代理模型的方法虽计算成本较高且鲁棒性较低,却能提供更细致的归因分析。此外,基于原型的网络和自注意力架构在可解释性与预测性能之间表现出权衡关系。选择最有效的XAI方法并非“一刀切”:其效果取决于数据集特性、延迟要求和可解释性需求。本文提出了一个面向视觉检测的XAI方法统一分类体系,使用标准化指标对工业与医学领域中的不同方法进行了比较,并提出了一种基于任务的选型工作流程,以指导实践者选择最优方法。与以往综述相比,本研究基于定量基准提供了跨领域的对比分析,并指出了标准化评估与以用户为中心的验证未来发展方向。
制造业、汽车工业、食品包装、制药和医疗保健等行业必须确保产品和系统能够充分且安全地运行。自动化和机器学习工具超越了由人工操作员或简单的基于摄像头的系统执行的传统视觉检测,提高了检测的准确性、生产速度和一致性1。人工智能检测可实现高通量环境下的实时监控2和缺陷识别3,减少人为错误和运营成本4。人工智能的应用,特别是机器学习(ML)和深度学习(DL)的进步,使得能够自主检测缺陷5、对物体进行分类并识别复杂的视觉模式6。近年来,卷积神经网络(CNNs)7、循环神经网络和视觉变换器(ViTs)在从表面缺陷检测到医学影像中异常定位等任务中,已超越基于规则的系统。检测方法已从基于规则的流程转变为基于大量数据训练的数据驱动模型8。
许多人工智能模型如同“黑箱”,意味着人们无法了解这些模型如何做出决策。这种缺乏透明度的情况带来了风险。例如,在制造业中,错误的预测可能导致浪费增加、返工增多、产品召回以及客户不满。在医学影像领域,误分类问题更为严重,因为它可能延误诊断或影响治疗方案。甚至这些模型的开发者通常也无法完全解释其输出结果,这限制了人们对模型的信任与应用。
这正是可解释人工智能(XAI)至关重要的原因。XAI 是一组旨在使机器学习模型的决策能够被人理解的方法和工具9。其目标是通过为模型输出提供人类可读的解释,将“黑箱”预测器转变为透明的“玻璃箱”系统。在实际应用中,具备 XAI 功能的检测系统不仅能标记出有缺陷的部件,还能进一步说明标记该部件的原因,从而超越单纯的缺陷检测。
尽管相关文献日益增多,现有针对计算机视觉中可解释人工智能(XAI)的综述仍存在范围上的局限。许多研究集中于医学影像或工业检测领域,虽然提出了有用的分类体系,但主要依赖定性比较,缺乏标准化的基准评估。较广泛的综述,如 Nauta 等人10的工作,提供了跨领域的总体概述,但未能提出面向实践者的模型选择框架。即使迄今为止最全面的计算机视觉综述——Cheng 等人11的研究——推进了分类体系,并讨论了保真度和定位准确性等指标,其内容仍泛化于各类视觉任务,未专门针对视觉检测、高通量部署或人机协同验证等场景进行探讨。类似地,面向预测性维护与资产管理的工业领域 XAI 综述虽采用 PRISMA 框架,但其重点在于预测与健康管理(PHM),而非视觉检测任务。
为解决这些不足,本综述作出以下贡献:
系统分类学:基于PRISMA指南对75项工业与医学视觉检测研究的系统性综述。
比较分析:在公开的视觉检测数据集(例如 MVTec AD、PCB)上,使用标准化指标(包括删除/插入 AUC、指向游戏准确率、稳定性和延迟)对多种 XAI 方法(GradCAM、LRP、SHAP、LIME 和 RISE)进行基准测试。
评估指标框架:用于评估 XAI 方法的保真度、鲁棒性、可解释性及任务特定指标的形式化定义与方程。
实用指南:通过案例研究和面向实践者的选型工作流程,将任务类型、延迟和解释需求与特定方法相关联。
这些贡献共同建立了面向视觉检测的可解释人工智能(XAI)领域最具有领域特异性且以基准为依据的综合研究成果,旨在为寻求可靠指导的研究人员和实践者提供参考。
访问受限。请登录或开始试用以查看此内容。
2. 可解释人工智能框架
目前最先进的 AI 模型——尤其是深度神经网络——通常被视为黑箱;人们很难了解其决策过程12。这种缺乏透明性的问题阻碍了各类应用中的可信度与可解释性。因此,可解释人工智能(XAI)已成为可信 AI 不可或缺的组成部分。单一方法无法适用于所有场景:一些方法假设可以完全访问模型内部结构,而另一些则将模型视为不可变的黑箱;一些方法侧重于对单个预测结果进行局部解释,而另一些则提供对模型整体行为的全局洞察。如图1所示,基于可解释性引入的时机不同,这些考量将 XAI 技术大致分为两类:事后解释方法和内在可解释性方法13。事后解释方法可进一步分为模型无关方法和模型特定方法14。

图1:用于视觉检查的XAI框架。 请点击此处查看此图的放大版本。
3. 可解释人工智能分类法
为了对研究现状进行系统性综合,本研究依据 PRISMA 指南开展了一项系统性文献综述(图2)。该过程涵盖多个学术数据库(Scopus、Web of Science、IEEE Xplore、SpringerLink、PubMed、arXiv 和 MDPI),并采用一组检索词进行指导,检索词包括 “可解释人工智能”、“可解释性”、“视觉检测”、“缺陷检测”、“异常检测”、“制造业” 和 “医学影像”。纳入标准要求论文必须在视觉检测场景(工业或医学)中明确应用或评估可解释人工智能(XAI)方法,并提供足够的方法学细节。排除标准剔除了未实现的纯理论提案,以及不属于视觉检测范畴的研究。初步检索共获得 483 篇文献记录。在去除重复项并对标题和摘要进行筛选后,保留 147 篇进行全文审查。根据纳入/排除标准,最终确定 75 项主要研究,构成本次综述的基础。

图2:遵循PRISMA指南的系统性综述流程的PRISMA流程图。该图展示了在各个阶段识别、筛选和排除的文献记录,最终纳入75项主要研究。 请点击此处查看该图的放大版本。

图 3:面向视觉检测任务的XAI方法分类体系。 请点击此处查看此图的放大版本。
| XAI 方法 | XAI 途径 | 研究 | 行业 | 年份 |
| 内在可解释性 | 基于规则与线性模型 | 32,33 | 通用、医学 | 2015–2019 |
| 基于原型的方法(ProtoPNet、基于案例的方法、可变形 ProtoPNet) | 29,34,35,36 | 医学、工业、通用 | 2018–2024 | |
| 基于概念驱动的方法(概念瓶颈、正确理由的正确决策) | 30,31,37 | 通用、科学应用 | 2020–2021 | |
| 自解释神经网络(SENN) | 28 | 通用 | 2018–2020 | |
| 解耦表征(β-VAE)、SOXAI | 38,39 | 通用 | 2018 | |
| 视觉 Transformer(通过注意力机制实现内在可解释性) | 40,41,42,43,44,45 | 计算机视觉、制造业 | 2020–2024 | |
| 事后解释、模型特定 | CAM 系列方法 | 46,47,48,49,50,51,52, 53,54,55,56,57,58 | 医学影像、制造业、汽车、农业、电子 | 2018–2025 |
| LRP(逐层相关性传播) | 20,59,60,61,62 | 通用、医学影像 | 2015–2024 | |
| 梯度与显著性方法(积分梯度、平滑 IG、DeepLIFT、反卷积网络、T-Explainer、显著性基准) | 18,19,63,64,65, 66,67,68,69,70 | 通用、医学影像 | 2013–2025 | |
| 专用模型中的归因方法(SNNs、Transformer 注意力归因) | 71,72,73 | 神经科学、视觉 Transformer | 2023–2025 | |
| 事后解释、模型无关 | LIME 及其变体(LIME、ELIME、MASALA)、SHAP 及其变体(Tree SHAP) | 金融、预测与健康管理、网络安全、自动驾驶、工业检测 | 2016–2025 | |
| 反事实解释 | 21,22,23,24,25,27,74, 75,76,77,78,79,80,81, 82,83,84,85,86 | |||
| 解释方法 | ||||
| 混合方法 | 多种 XAI 方法的集成(包括 GradCAM、SHAP、LRP、LIME) | 58,87,88,89,90,91,92 | 工业检测、医疗健康、制造业 | 2021–2025 |
表1:按可解释人工智能方法、年份、行业和方法分类的75项综述研究。
4. XAI 的评估指标
计算机视觉模型的性能通常由准确率、精确率和召回率等成熟指标来评判。然而,评估模型决策的可解释性则远非易事。与标准的预测性能不同,目前尚无普遍接受的指标用于衡量人工智能解释的质量66。换句话说,尽管分类器的准确率可以被精确测量,但对于给定图像分类的解释“有多好”,却缺乏公认的量化标准93。这种差异凸显了可解释人工智能(XAI)领域的一个根本性缺口:如何评估一个解释。
建立标准化的可解释人工智能(XAI)评估标准已被证明极具挑战性。其中一个原因是,可解释性与解释质量具有多面性且依赖于具体情境,因此难以用单一的通用指标来衡量10。有效评估一个解释需依赖多个因素,包括应用领域、所生成解释的性质以及最终用户的背景。例如,适用于医学影像诊断的解释方法,其评估方式可能与用于工业视觉检测任务的解释方法有所不同10。
在实际应用中,由于缺乏标准的评估指标,研究人员不得不依赖多种不同的评估方法。许多研究仍诉诸于对可解释人工智能(XAI)方法进行定性、轶事式的评估94,95。常见的情况是,作者展示若干显著性图或热图,并主张这些结果看起来合理(即所谓的“表面效度”检验)96。这种视觉检查在叙述层面可能具有说服力,但在严格比较中仍具有主观性且不足97。这说明了标准化XAI评估指标的困难所在:在缺乏共识性标准的情况下,研究人员往往针对每个数据集或具体应用场景提出定制化的评估指标。
因此,目前的文献中涌现出大量不同的可解释人工智能(XAI)评估指标,旨在填补这一空白98。众多框架和度量方法相继被提出,各自针对解释有效性中的某一特定方面99。总体而言,这些指标可根据其主要关注点进行分类。基于保真度的指标通过解释对模型决策过程的还原程度来评判其优劣100。相比之下,以可解释性为中心的指标则评估解释对人类观察者的易懂性和说服力101。第三类为基于任务的指标,其对解释的评估取决于该解释对最终用户任务表现的影响102。第四类是面向鲁棒性的指标,用于评估结果的一致性103。最后,混合型指标则融合了多个维度的评估标准104。
这些多样化的指标反映了研究人员所重视的可解释性方面,同时也凸显了目前缺乏统一标准的问题:每个指标仅能捕捉解释质量的一个特定角度105。下文将可解释人工智能(XAI)的一系列评估指标分为四大类,并在表2中进行总结。
| 度量类型 | 度量指标 | 公式 / 定义 |
| 保真性 | 删除曲线下面积(AUC)26 | ![]() Sk 为 top-k 重要特征;数值越低表示保真性越高 |
| 插入曲线下面积(AUC)26 | ![]() 数值越高表示保真性越高 | |
| 不保真度评分(Infidelity score)103 | ![]() 数值越低表示性能越好 | |
| ROAR106 | 移除“重要”特征后重新训练导致的准确率下降 | |
| 鲁棒性 | 稳定性指数(Stability index)107 | ![]() 数值越高表示结果越一致 |
| Lipschitz 评分(Lipschitz score)103 | ![]() 数值越低表示鲁棒性越强 | |
| 可解释性 | 稀疏性(Sparsity)79 | ![]() 数值越低表示模型越简单 |
| 代理模型深度(Surrogate depth)79 | 可解释代理模型的深度(例如决策树); 深度越浅表示模型越简单 | |
| 任务特定性 | 交并比(intersection-over-union, IoU)108 | ![]() 掩码 M 与真实标注 G 之间的重叠程度 |
| 指向游戏(Pointing Game)108 | 准确率 = 命中次数 / 样本总数 数值越高表示性能越好 | |
| 混合型 | 综合评分(Composite score)104 | 保真性、稀疏性和鲁棒性的加权组合 |
表2:视觉检测中可解释人工智能(XAI)的评估指标,分为四个主要类别。
5. 比较分析
本节在公开数据集上对方法进行了比较,包括 MVTec AD109(>5,000 张带有像素级掩码的缺陷图像)和 DeepPCB110(1,500 张印刷电路板图像,包含六类缺陷)、CheXpert111 以及 ImageNet112,并采用以下指标进行评估:删除/插入 AUC(可信度)、指向性游戏准确率(定位能力)、稳定性分数(在扰动下的鲁棒性)以及延迟时间(运行开销)。
基于 CAM 的方法(GradCAM、GradCAM++)在 MVTec AD 和 DeepPCB 上的结果显示,GradCAM 的保真度为 0.83–0.87(插入 AUC 约 0.68;删除条件下准确率下降 <15%),敏感性为 0.80–0.85,运行时间 <100 毫秒(约每秒 39 帧(FPS))。定位性能处于中等水平(平均 IoU ≈0.28 @ δ=0.25;指向准确率为 86–87%)。GradCAM++ 在保持相似延迟(<120 毫秒)的同时提升了多实例定位能力(平均 IoU = 0.38),并获得更高的用户信任度(109.69/250 对比 GradCAM 的 56.08/250)。这些方法效率较高,但空间分辨率较粗47,113。
对于 基于扰动的方法 (LIME、SHAP、RISE),在不同数据集上的表现存在差异。在 MVTec AD 上,LIME 达到局部保真度 R² = 0.70–0.80,但表现出较低的鲁棒性(稳定性指数) <0.5),延迟为3-5秒/图像,定位能力中等(IoU = 0.25–0.35)。将SHAP应用于PCB缺陷分类可实现稳定的归因结果(Δ log-odds = 0.2–0.3),且与人类判断高度一致(70%–80%),但速度较慢(>1 帧/图像),且定位能力较弱(IoU ≈ 0.02–0.03)。RISE 在 MS-COCO 上进行基准测试,并在 MVTec AD 上复现,平均需要 4,000–8,000 次掩码前向传播,从而产生较高的鲁棒性(稳定性) >0.7)、保真度(0.78–0.82 AUC)和更优的定位能力(Pointing-Game 为 62.9%,而 GradCAM 为 48.3%),但解释延迟为 1–2 秒/次26,74,79,114.
对于相关性传播方法(LRP、DeepLIFT),在 DeepPCB 和 CheXpert 上的评估表明,LRP 的保真度为 0.82–0.90,敏感性约为 0.85,定位交并比(IoU)为 0.40–0.50。每幅图像的运行时间为 100–200 毫秒,虽慢于 CAM 方法,但可用于接近实时的检测。在 CheXpert 放射学任务中,专家研究表明 >LRP热图与临床相关区域之间存在70%的重叠,表明跨领域的可解释性60.
对于基于注意力的方法(Transformers),在ImageNet和CheXpert上训练的ViT模型,其原始注意力图的保真度为0.75–0.85,但在扰动下表现不稳定,敏感性为0.70–0.75,定位能力一般(IoU = 0.30–0.45)。人类信任度约为60–70%。改进后的方法(如注意力流、Transformer-LRP)在因果性指标上表现更优,在删除/插入和指向游戏评分中均优于原始注意力图40,115,116。
对于基于原型和反事实的方法,在 MVTec AD 上的评估表明,ProtoPNet 能够实现基于示例的解释,其预测结果通过与相似缺陷案例的比对加以佐证,有助于操作人员决策。基于自组织映射(SOM)的方法将缺陷特征聚类于二维图谱上,保留了特征间的拓扑关系。反事实方法在 PCB 缺陷图像和 CheXpert 数据集上均经过测试,可提供可操作的推理(例如“若裂纹长度小于 1 mm,则预测结果转为正常”),但需要高昂的优化成本,且在处理高分辨率输入时表现不佳。这些方法与人类的推理方式高度一致,但可扩展性较差117,118,119。
最后,在权衡利弊并进行实际选择时,CAM 方法在对延迟敏感的工作流中占主导地位,但其结果仍较为粗略。LRP 在保真度和运行时间之间实现了平衡,在像素级分析中表现优异。RISE 在因果忠实性和定位能力方面表现最强,但延迟达到秒级。SHAP 和 LIME 可提升可解释性,但速度较慢且结果不稳定。原型与反事实方法在最大程度上实现了与人类认知的一致性,但在高分辨率检测中的可扩展性较差。基于 Transformer 的模型需要在原始注意力机制之外进行专门化改进。因此,没有任何一种方法在所有场景下均优于其他方法;相反,方法的选择必须反映数据集、任务、延迟、预算和可解释性需求。如图4所示,该选择工作流将其中三个基准(任务、延迟、可解释性)整合为一个面向任务的指南,用于在视觉检测中选择 XAI 方法。

图 4:可解释人工智能方法选择的工作流程。该决策流程图用于指导在视觉检测中选择合适的可解释人工智能(XAI)方法。该工作流程考虑了任务类型(分类、分割、异常检测、回归)、延迟限制和解释详细程度,并将其与代表性方法相对应。请点击此处查看此图的放大版本。
6. 讨论
访问受限。请登录或开始试用以查看此内容。
本综述分析了75项关于视觉检测中可解释人工智能(XAI)的研究,提出了事后解释与内在解释方法的分类体系,并开展了以基准测试为导向的比较分析。研究结果证实,不存在一种在所有场景下均优于其他方法的单一XAI方法:基于梯度的方法(如GradCAM和LRP)在实时缺陷定位方面效率较高,但在复杂区域中的解释可能较为粗糙;基于扰动的方法(如SHAP、LIME和RISE)能提供更精细的细节和较高的保真度,但常因延迟高和计算成本大而在实际应用中失效;基于注意力机制的方法利用了Transformer的内部结构,但当原始注意力未能反映因果推理时,其可靠性较差;LRP虽能生成详细的解释,但其计算成本仍高于基于CAM的方法。这些局限性明确表明,XAI方法的有效性高度依赖于其具体应用情境。
通过此项分析,得出四项可操作的建议:
任务需求对齐: 若方法应用不当(例如,将粗粒度显著性方法用于细粒度任务),则会导致失败;方法的选择必须与分类、分割或异常检测等任务需求相匹配。
访问受限。请登录或开始试用以查看此内容。
作者声明,本作品的发表不存在任何利益冲突。
作者声明,本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。
访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。
申请许可以重复使用本 JoVE 文章的文本或图表
申请许可