本文综述了在工业和医学领域用于视觉检测的可解释人工智能(XAI)方法。通过采用PRISMA指南的检索策略,共筛选出75项研究,据此构建了针对特定领域的分类体系,并使用标准化指标进行了比较分析。我们提出了一个基于证据的分类体系,以及一个面向实践者的工具选择工作流程。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本文综述了在工业和医学领域用于视觉检测的可解释人工智能(XAI)方法。通过采用PRISMA指南的检索策略,共筛选出75项研究,据此构建了针对特定领域的分类体系,并使用标准化指标进行了比较分析。我们提出了一个基于证据的分类体系,以及一个面向实践者的工具选择工作流程。
可解释人工智能(XAI)技术通过使黑箱机器学习模型变得可理解,从而提升自动化视觉检测系统的透明度与可信度。尽管XAI已被广泛应用,但以往的综述尚未涵盖工业与医学检测任务的特定需求。本文综述了在工业和医学领域中将XAI技术应用于视觉检测的研究。系统性检索了IEEE Xplore、Scopus、PubMed、arXiv和Web of Science数据库中2014年至2025年间发表的研究,纳入标准要求研究在使用公开或领域特定数据集的检测任务中应用了XAI技术。从初步筛选的研究中,共纳入75项研究,并将其分为事后解释(post-hoc)和内在解释(intrinsic)两类,随后从保真度、鲁棒性、复杂性和定位准确性四个方面进行评估。结果表明,基于梯度和传播的方法能够提供适用于近实时检测的高效可视化解释,但其定位较为粗糙;而基于扰动和代理模型的方法虽计算成本较高且鲁棒性较低,却能提供更细致的归因分析。此外,基于原型的网络和自注意力架构在可解释性与预测性能之间表现出权衡关系。选择最有效的XAI方法并非“一刀切”:其效果取决于数据集特性、延迟要求和可解释性需求。本文提出了一个面向视觉检测的XAI方法统一分类体系,使用标准化指标对工业与医学领域中的不同方法进行了比较,并提出了一种基于任务的选型工作流程,以指导实践者选择最优方法。与以往综述相比,本研究基于定量基准提供了跨领域的对比分析,并指出了标准化评估与以用户为中心的验证未来发展方向。
制造业、汽车工业、食品包装、制药和医疗保健等行业必须确保产品和系统能够充分且安全地运行。自动化和机器学习工具超越了由人工操作员或简单的基于摄像头的系统执行的传统视觉检测,提高了检测的准确性、生产速度和一致性1。人工智能检测可实现高通量环境下的实时监控2和缺陷识别3,减少人为错误和运营成本4。人工智能的应用,特别是机器学习(ML)和深度学习(DL)的进步,使得能够自主检测缺陷5、对物体进行分类并识别复杂的视觉模式6。近年来,卷积神经网络(CNNs)7、循环神经网络和视觉变换器(ViTs)在从表面缺陷检测到医学影像中异常定位等任务中,已超越基于规则的系统。检测方法已从基于规则的流程转变为基于大量数据训练的数据驱动模型8。
许多人工智能模型如同“黑箱”,意味着人们无法了解这些模型如何做出决策。这种缺乏透明度的情况带来了风险。例如,在制造业中,错误的预测可能导致浪费增加、返工增多、产品召回以及客户不满。在医学影像领域,误分类问题更为严重,因为它可能延误诊断或影响治疗方案。甚至这些模型的开发者通常也无法完全解....
访问受限。请登录或开始试用以查看此内容。
2. 可解释人工智能框架
目前最先进的 AI 模型——尤其是深度神经网络——通常被视为黑箱;人们很难了解其决策过程12。这种缺乏透明性的问题阻碍了各类应用中的可信度与可解释性。因此,可解释人工智能(XAI)已成为可信 AI 不可或缺的组成部分。单一方法无法适用于所有场景:一些方法假设可以完全访问模型内部结构,而另一些则将模型视为不可变的黑箱;一些方法侧重于对单个预测结果进行局部解释,而另一些则提供对模型整体行为的全局洞察。如图1所示,基于可解释性引入的时机不同,这些考量将 XAI 技术大致分为两类:事后解释方法和内在可解释性方法13。事后解释方法可进一步分为模型无关方法和模型特定方法14。
访问受限。请登录或开始试用以查看此内容。
本综述分析了75项关于视觉检测中可解释人工智能(XAI)的研究,提出了事后解释与内在解释方法的分类体系,并开展了以基准测试为导向的比较分析。研究结果证实,不存在一种在所有场景下均优于其他方法的单一XAI方法:基于梯度的方法(如GradCAM和LRP)在实时缺陷定位方面效率较高,但在复杂区域中的解释可能较为粗糙;基于扰动的方法(如SHAP、LIME和RISE)能提供更精细的细节和较高的保真度,但常因延迟高和计算成本大而在实际应用中失效;基于注意力机制的方法利用了Transformer的内部结构,但当原始注意力未能反映因果推理时,其可靠性较差;LRP虽能生成详细的解释,但其计算成本仍高于基于CAM的方法。这些局限性明确表明,XAI方法的有效性高度依赖于其具体应用情境。
通过此项分析,得出四项可操作的建议:
任务需求对齐: 若方法应用不当(例如,将粗粒度显著性方法用于细粒度任务),则会导致失败;方法的选择必须与分类、分割或异常检测等任务需求相匹配。
访问受限。请登录或开始试用以查看此内容。
作者声明,本作品的发表不存在任何利益冲突。
作者声明,本研究未从公共、商业或非营利部门的任何资助机构获得特定资助。
....访问受限。请登录或开始试用以查看此内容。
访问受限。请登录或开始试用以查看此内容。