本研究提出了一种基于可解释人工智能的工业5.0信息物理协作框架,该框架在MIMII数据集上采用卷积神经网络-Transformer(CNN-transformer)与SHAP方法实现工业声学异常检测。边缘计算的集成支持可解释、以人为中心的预测性维护。
本研究提出了一种基于可解释人工智能的工业5.0信息物理协作框架,该框架在MIMII数据集上采用卷积神经网络-Transformer(CNN-transformer)与SHAP方法实现工业声学异常检测。边缘计算的集成支持可解释、以人为中心的预测性维护。
本研究提出了一种基于可解释人工智能(XAI)的赛博-物理协作系统,用于工业5.0背景下工业零部件的可持续制造。现有的赛博-物理人类系统(CPHS)在人工智能集成方面程度有限,且通常缺乏可解释性。因此,亟需提升其可扩展性与灵活性,以符合工业5.0的核心原则:韧性、长期可持续性以及以人为本。为解决这些不足,我们提出一种架构,将深度学习与可解释人工智能(XAI)整合至赛博-物理系统(CPS)生态中,以实现智能化且可解释的决策过程。具体而言,我们采用MIMII(Malfunctioning Industrial Machine Investigation and Inspection)数据集,通过声学信号进行机器故障检测。音频信号经过频谱变换生成频谱图图像,随后由卷积神经网络(CNN)提取空间特征,并由Transformer编码器提取时间特征。为提高系统透明度并促进人机协同,基于Shapley加性解释(SHAP)的方法可帮助操作人员理解系统的决策过程,通过突出显示影响模型预测的关键输入特征实现。此外,该框架应用于基于边缘计算的赛博-物理系统,以实现低延迟、低能耗并提供及时响应,从而有助于保障可持续的生产环境。实验结果表明,所提出的CNN-Transformer架构准确率达到98.5%,性能优于现有的CPHS系统,同时保持了低延迟特性。在该类赛博-物理协作系统中引入可解释人工智能,显著增强了操作人员的信任度,并实现了无缝的人机协作。
从强调技术、机械化和通信的工业4.0向结合技术进步、适应性、可持续发展和以人为本的新工业5.0模式的转变,影响了工业系统的动态演进1,2欧盟委员会将工业5.0定义为一种不仅关注生产率和效率,而且关注以人为本、可持续性和韧性三大支柱的范式。值得注意的是,近期研究指出,人工智能系统、人机协作和可持续制造是推动工业5.0环境的主要驱动力。3,4在不断变化的工业环境中,传统的维护方法已不再足够。为了在复杂且不稳定的环境中实现韧性,维护必须演变为一种更具适应性和系统性的形式5自2011年以来,工业4.0一直是欧洲工业转型的主导模式,推动企业实施数字化转型,以提升运营效率并最大化利用现有资源4因此,必须在不减少生产过程中人工劳动的同时提高效率,并保障工人的健康与安全。为此,企业和学术界已开始界定工业5.0范式的基本原则。5,6,7,部分动机源于日本提出的“超智能社会5.0”理念8,9,10,11尽管近期文献更加重视可持续维护,但大多数现有的系统性评估仍然零散或局限于特定领域,缺乏将韧性、可持续性和人工智能整合在一起的综合框架。例如,有作者探讨了特定系统或策略的可持续维护实践,包括可持续全面生产维护(STPM),而另一些研究人员则讨论将可持续性主题融入维护技术中12,13,14. 作者 对可持续性采纳标准进行了全面评估,并强调了推动制造业产生积极可持续影响的技术因素15然而,在 Industry 5.0 范式中,可持续性、韧性与基于人工智能的决策在这些研究中均未实现充分整合。因此,可持续性通常由独立的维护方法分别处理。在其他可解释人工智能(XAI)技术中,SHAP 因其理论上严谨的特征归因方法而脱颖而出16,17,18.
人工智能能够实现数据驱动的决策,但准确的模型通常需要大量数据。传统的机器学习(ML)方法,如决策树、逻辑回归和线性回归,在高度非线性的情况下常表现不佳,因为它们假设数据分布相对简单19。深度神经网络(DNNs)通过从大规模数据集中学习复杂的特征表示,克服了这些限制20。研究表明,在复杂的决策任务中,更深的网络通常优于浅层结构21,但其不断增加的深度和参数复杂性使得模型的可解释性降低22。
信息物理系统(Cyber-Physical System, CPS)是工业5.0制造的关键使能技术,因为它融合了分布式智能、嵌入式计算机、物理过程和通信。为了实现灵活、智能和实时的工业操作,现代CPS正迅速整合边缘计算、边缘人工智能(AI)和绿色物联网(G-IoT)23,24。近期关于维护4.0和智能维护的研究突出了可持续性与韧性的关键作用。尽管已有研究探讨了维护4.0技术在可持续制造中的重要性,并提出了可持续维护的建模框架,也有文献计量学和系统性研究评估了智能维护技术25,26,27,28。进一步的研究还探讨了将可持续维护融入工业4.0环境以及面向可持续性的生产系统29,30,31,32。操作员4.0(Operator 4.0)概念33、以人为本的工业5.0框架34以及社会经济视角35均在人本化维护领域受到广泛关注。此外,近期研究还强调了数字维护36、预测性与规范性维护37,38以及可持续维护策略39,40的进展。尽管取得了上述进展,相关研究仍较为分散,鲜有研究提供一个整合可解释人工智能(AI)、可持续性、韧性以及以人为中心的信息物理协同的统一范式。尽管CPS部署日益广泛,但尚未实现完全自主,而工业5.0范式本身也不倾向于完全自主。相反,工业5.0更加强调人类的监督、协作与决策。通过将人类思维与协作融入信息物理过程,诸如人在回路中的CPS(HiLCPSs)41、以人为本的CPS(HCPSs)42,43以及信息物理人类系统(CPHSs)44等系统扩展了传统CPS的功能。这种集成通过实现智能系统与人类操作员之间的实时协作,提升了系统的适应性、透明度、安全性与韧性45,46。
工业音频异常检测已因新型架构而得到显著提升,这些架构包括视觉变换器(ViT)、音频频谱图变换器(AST)、Conformer 以及自监督学习;然而,这些技术与面向工业5.0的可解释信息物理系统的集成仍然有限。当前的研究主要关注分类准确率或事后基于XAI的可解释性,尚未将可解释性、边缘部署和人在回路中的决策支持整合到统一框架中。本研究提出一种新型的可解释人工智能驱动的CNN-变换器信息物理协同架构,该架构融合了边缘计算、时序依赖性建模、基于SHAP的可解释性、空间特征学习以及以人为核心的决策支持,旨在实现可持续的工业5.0制造,并克服上述局限性。
因此,该领域仍存在显著的研究缺口。当前基于卷积神经网络(CNN)/Transformer 的声学异常检测技术侧重于分类性能,但缺乏信息物理系统的协同性与可解释性。尽管工业5.0框架提出了以人为本的概念模型,却未能将可解释的深度学习、边缘智能与操作人员参与的决策机制整合到单一系统中;基于可解释人工智能(XAI)的预测性维护技术虽提升了透明度,但其运行仍独立于信息物理人类系统(CPHS)架构之外。因此,目前仍缺乏一种统一的工业5.0信息物理人类系统,能够集成精确的听觉异常检测、基于SHAP的可解释性、支持边缘部署的能力以及人机协同机制。
本文提出了一种新型的可解释人工智能驱动的卷积神经网络-Transformer(CNN-Transformer)信息物理协同范式,以应对工业5.0中的上述限制。所建议的架构将边缘计算部署、基于CNN的空间特征提取、基于Transformer的时间依赖性学习、基于SHAP的可解释性以及人在回路中的决策支持整合到一个统一的信息物理融合系统(CPHS)框架中。与现有方法独立处理各要素不同,该框架提供了一种集成化解决方案,可同时提升异常检测性能、模型透明度、运行效率以及以人类为中心的协作能力,从而推动可持续制造的发展。
本研究的主要目标是通过结合基于SHAP的可解释性、边缘计算和人在回路中的决策支持,以及基于混合CNN-Transformer的声学异常检测方法,构建一个由可解释人工智能(AI)驱动的、面向可持续工业5.0制造的赛博-物理人类系统(CPHS)。具体而言,所提出的框架旨在提高异常检测的准确性,同时提供清晰、可理解的预测结果,促进在边缘端的有效部署,并增强智能系统与人类操作员之间的协同决策。该集成架构通过同时实现高检测性能、可解释性、低延迟运行以及以人类为中心的赛博-物理协同,解决了当前声学异常检测、基于可解释人工智能(XAI)的预测性维护和CPHS框架中存在的不足。
所提出的架构针对工业5.0,提出了一种统一的、基于可解释人工智能的网络-物理-人类系统(CPHS),与当前主要关注分类准确率的声学异常检测技术形成对比。该架构在一个统一框架内集成了基于卷积神经网络(CNN)的空间特征提取、基于Transformer的时间序列建模、基于SHAP的可解释性分析、边缘计算以及人在回路中的决策支持。通过将精确的异常检测与可理解的决策过程及实时边缘部署相结合,该架构解决了透明性、操作员辅助和网络-物理协同等关键问题。本研究的主要科学贡献在于系统层面的集成,这使得所提出的方法不同于以往仅单独关注异常检测、可解释人工智能或工业5.0框架的研究工作。
本研究建议的方法采用基于系统的工业5.0人机协同信息物理系统(CPHS)框架,将可解释的深度学习与由边缘计算支持的协同信息物理架构相结合,以促进可持续制造过程。首先,通过识别当前CPHS解决方案存在的若干局限性来界定问题,这些局限性包括缺乏人工智能驱动的智能性、可解释性以及以人类为中心的协作能力。为应对这些挑战,所提出的解决方案利用MIMII数据集,通过声学信号处理实现对工业机械状态的监测。
该框架首先将生成的频谱图输入卷积神经网络(CNN)模型,通过识别与不同机器状态相关的关键频率模式来提取空间特征。提取到的空间特征将被转换为序列,并输入至Transformer编码器模块,利用自注意力机制捕捉时间依赖性。经变换后的特征表示随后传递至全连接分类器模块,以将机器状态分类为正常或异常。此外,为确保模型透明性并支持以人类为中心的决策过程,采用SHAP可解释性方法,通过选择模型输出中具有显著意义的时频区域来解释预测结果。所设计的模型将在支持边缘计算的网络物理系统(CPS)环境中实现,从而实现低计算延迟和低能耗的实时推理。同时,还将集成人机协同机制,使操作人员能够基于可解释性结果进行验证。模型性能将通过准确率、精确率、召回率和F1分数,以及延迟和能效等系统级指标进行验证。
所提出的框架是一种由可解释人工智能(XAI)驱动的、面向工业5.0背景下的可持续制造的赛博-物理-人类系统(CPHS)机制,其工作流程如图1所示,呈现为从数据采集到智能决策与执行的流水线结构。在数据采集阶段初期,通过MIMII等数据集,从电机、泵和轴承等工业设备中采集声音信号。所获得的数据信号随后被传递至下一阶段,即数据预处理阶段,在此阶段进行滤波、归一化和分段处理。经过分段处理的数据信号最终在特征表示层通过短时傅里叶变换(STFT)转换为频谱图。
然后,AI 模型层利用频谱图图像通过 CNN 模块提取特征,识别空间模式和异常。接着,将提取出的特征进行重塑并输入至 Transformer 编码器,该编码器通过自注意力机制学习时间依赖性和长程关系。最终,分类层将生成的特征向量划分为正常或异常。为确保预测过程的透明性,可解释性层采用 SHAP 方法突出频谱图中具有显著性的时间-频率区域。
此外,该系统还包含人机协同环节,操作人员可对模型的输出结果进行解读并提供反馈。在部署层,模型运行于基于边缘计算的 CPHS 基础设施上,确保快速推理和低功耗运行,同时可根据需要选择与云系统对接,以满足数据存储或高级分析的需求。总体而言,该框架能够实现准确的故障检测、结果可解释性以及高效的实时运行,完全符合工业 5.0 的要求。
问题定义与需求分析
在工业5.0背景下,信息物理人类系统(CPHS)有望实现智能化、可持续性和以人为本的目标。然而,当前构建CPHS的框架受限于缺乏先进的AI赋能能力、可解释性以及对人机协作的充分支持。事实上,传统的CPHS依赖基于规则或不可解释的模型,这阻碍了系统对不断变化的工业环境的适应能力,并降低了操作人员对自动化的信任度。此外,传统CPHS无法有效分析高度复杂的工业数据,例如同时包含空间(即频率)和时间依赖成分的工业声学信号,而这类信号在预测性维护中至关重要。因此,亟需建立一种能够在边缘端高精度检测机器异常、提供可解释结果并支持信息物理系统(CPS)运行的框架。
其中,x(t) 表示声学输入信号,S(f,t) 表示信号的频谱图表示,
为标签, θ 为 CNN-Transformer 架构的参数集合。后续方程中使用的符号将在其首次出现后立即给出,以确保数学上的准确性。
从数学角度来看,该任务可被形式化为一个有监督学习问题。设工业声学信号表示为 x(t)。x(t) 的短时傅里叶变换(STFT)按以下公式计算:
(1)
其中 ω(.) 是窗函数,且 f 是频率。生成的频谱图
作为深度学习算法的输入。目标是训练该映射函数
(2)
其中
为类别标签(正常或异常),S 为谱图输入,y 为预测输出标签, θ 为 CNN-Transformer 架构的可学习参数集合。该优化问题被表述为最小化分类损失:
(3)
在最小延迟
、能效
和可解释性约束条件下,其中解释 ∅(SHAP) 反映了特征在预测过程中的重要性,
(4)
其中,
表示各个特征的贡献值。根据上述原则,设计需求包括以下几点:(i) 基于混合深度学习的可靠异常检测,(ii) 可解释的输出以支持人工干预,(iii) 在增强型边缘计算信息物理系统(CPS)框架中实现。
数据集获取与预处理
为此,为评估所提出的基于可解释人工智能的 CPHS 框架,选用了 MIMII 数据集13。该数据集是利用声学信号检测工业机械异常的常用基准。该数据库包含多种机器(如滑轨、风扇、泵和阀门)在正常与故障运行状态下的声音 recordings。对于每种机器,录音随不同设置和噪声环境而变化,使其适用于在实时工业条件下进行模型训练与评估。
尽管MIMII数据集在仅依赖正常样本进行训练的无监督异常检测研究中被广泛使用,但它包含了对正常和异常机器状态的明确标注。本研究将问题设定为一个有监督的二分类任务,以检验所提出的基于可解释人工智能的CNN-Transformer架构区分健康与故障机器状态的能力。具体而言,采用MIMII数据集的官方标签,将正常样本标记为类别0,异常样本标记为类别1。
表1展示了数据集描述的详细信息。本研究共考虑了约12,000条声学信号记录,包括正常和故障机械运行状态下的数据。根据要求,本研究中所有记录的采样频率均为16 kHz,每条记录时长为10秒。尽管该数据集包含约12,000条记录,但为了可视化混淆矩阵,仅选择了一个类别平衡的2,000条测试记录子集。所有报告的性能指标均使用完整的测试集(约2,400条记录)计算得出。此外,训练样本与测试样本按80:20的比例进行划分,用于模型训练。由于该数据库包含实时噪声条件,因此非常适用于工业5.0应用场景。本研究中使用的记录分布情况见表2。从该数据集中,选取了覆盖所有机械类型和信噪比(SNR)条件的约12,000条记录,用于监督式二分类实验,并采用80:20的训练/测试划分方式,展示了工业机械类型、对应的机械编号、正常与异常声学记录的总数、SNR条件以及监督式二分类实验所采用的训练/测试划分方案。
实验采用 MIMII(工业机器故障检测与检查)数据集 1.0 版本进行,该数据集包含四种类型的工业机器:风扇、泵、阀门和滑轨。数据采集自不同机器编号(根据机器类型为 ID00–ID06)和不同工况。MIMII 数据库包含在信噪比(SNR)为 −6 dB、0 dB 和 +6 dB 条件下采集的数据。正常数据对应工业机器的健康状态,而异常数据对应异常状态。数据类别根据数据库标注确定,其中正常数据标记为类别 0,异常数据标记为类别 1。
为了确保公平的评估,训练集与测试集的划分必须在原始音频记录层面进行,且早于任何分割、数据增强或频谱图生成步骤。因此,来自同一录音的音频片段不会同时出现在训练集和测试集中。在评估实验中,使用了具有不同信噪比(−6 dB、0 dB 和 +6 dB)的录音,从而能够在多种工业条件下对所提出的框架进行评估。
为防止数据泄露,训练集与测试集的划分以原始音频文件为基础,在进行任何分段或生成频谱图之前完成。来自同一段10秒音频录音的所有片段仅被分配至训练集或测试集中的一方,两个集合之间不存在重叠的片段。随后,针对每个数据集分别生成并增强频谱图。通过这种方式,避免了数据泄露问题,从而防止对模型性能产生过于乐观的评估。
数据集预处理
来自 MIMII 数据集的未经处理的声学信号随后经过处理,以提高信号质量并实现有效的特征提取。输入信号用 x(t) 表示,其中 t 为时间。第一步是噪声滤波,即通过滤波函数滤除背景噪声,其表达式为:
(5)
其中,∗ 表示卷积过程,h(t) 为滤波器的脉冲响应。该过程可增强声学信号的清晰度,并最大限度地减少工业环境中常见的噪声影响。信号归一化用于确保在将所有音频信号输入深度学习模型之前,其幅度具有可比性。归一化后的信号记为 xn(t),其计算公式如下:
(6)
其中, μ 和 σ 分别为输入信号的均值和标准差。得益于该处理过程,所有输入信号均被保证具有零均值和单位方差。最后,在处理时,将归一化后的输入信号分割为多个微小片段。假设整个信号的长度为 T,则使用滑动窗函数将其分解为 N 个重叠的帧,每帧长度为 L:
(7)
其中 H 是 hop 大小。该频谱图可由以下公式定义:
(8)
通过这种方式获得的频谱图被输入基于卷积神经网络-变换器(CNN-transformer)的框架中,以提取空间和时间特征,从而实现有效的异常检测。图2展示了预处理流程。
图2展示了一个可用于工业领域采集的声学数据的垂直预处理流程。首先,从MIMII数据集中提取原始音频信号,并将其输入噪声去除阶段以减少噪声。随后对信号进行归一化处理,以消除幅度不一致性,确保信号的一致性。之后将信号分割为较小的重叠片段。完成分段后,对数据应用短时傅里叶变换(STFT),将时域信号转换为时频域信号。接着计算功率谱,作为生成信号频谱图的一部分。因此,预处理后的频谱图即为该流程的输出结果,并将用于所提出的CNN-Transformer模型中。
频谱图生成
在数据归一化和分段之后,利用短时傅里叶变换(STFT)将声学信号转换为时频表示。生成的频谱图以图像形式展示了分析时段内频率成分的变化情况。在工业环境中,机器故障通常表现为特定的频率模式,因此频谱图在检测机器异常方面具有更高的实用性。
因此,将生成的处理后数据转换为频谱图图像,以区分机器中的正常与异常情况。音频数据将被转换为多个频谱图,使学习模型能够分析机器运行过程中的局部频率成分及时间变化。这些图像作为CNN-Transformer模型的输入数据,其中CNN负责处理空间(频率)模式,而Transformer负责处理时间序列关系。
算法 1:从声学信号生成频谱图
输入:原始音频信号 x(t)
输出:谱图 S(t, f)
步骤 1:加载音频信号 x(t)
步骤 2:应用噪声滤波
步骤 3:对信号 xn(t) 进行归一化
步骤 4:将信号分割为帧:
对于 k = 1 到 N 执行

结束循环
步骤 5:对每个片段应用一个窗函数 w(t)
步骤 6:计算短时傅里叶变换(STFT):
(9)
步骤 7:计算幅值:
(10)
步骤 8:存储频谱图 S(t, f)
步骤 9:返回语谱图数据集
生成频谱图的过程始于获取原始音频信号,随后进行噪声抑制和信号归一化等预处理步骤,以确保信号的完整性和质量。接着,将归一化后的音频信号分割为多个重叠的时间窗,以捕捉长时和短时的时间特征。为防止频谱泄漏,每个分段在经过短时傅里叶变换之前会先与窗函数相乘。随后,变换后的信号在频域中表示为复数值函数,并对其幅度进行平方。因此,频谱图即表示了给定时间内各频率的能量分布。最后,这些频谱图以类图像数据的形式存储,并输入神经网络用于训练。
使用卷积神经网络进行空间特征提取
在生成频谱图之后,将输出的时频图像作为输入提供给卷积神经网络(CNN)。假设输入的频谱图为
,其中 H 表示频率域,W 表示时间域。此处使用 CNN 的目的是从输入频谱图中学习具有判别性的空间特征。这些具有判别性的空间特征将有助于区分工业环境中机器的正常与异常行为。
卷积神经网络(CNN)执行的一项基本操作是卷积。使用给定滤波器
的卷积运算定义如下:
(11)
上述操作使神经网络能够在频谱图中识别局部空间特征,例如边缘、频率和谐波成分。该过程通过多个滤波操作生成不同的特征表示,从而产生多个特征图。卷积之后是如下所示的非线性激活函数:
(12)
这种非线性使网络能够捕捉和表示变量之间的复杂关系。卷积神经网络的下一阶段涉及池化操作的应用。常用的池化技术——最大池化在数学上表达如下:
(13)
其中 Ω 表示池化窗口。池化有助于实现平移不变性,并在丢弃冗余信息的同时保留相关信息。从频率等低级变量到复杂的机器行为,可以通过卷积神经网络逐层提取更高级的特征。因此,特征图可用于描述网络的最终输出:
(14)
其中 表示卷积神经网络(CNN)的可学习参数。特征图包含丰富的空间信息,并被转换为序列,作为下一阶段变压器编码器的输入。上述空间特征提取过程对于使模型能够检测工业声学信号中的微小异常至关重要。
图3 演示了如何使用卷积神经网络(CNN)模型从频谱图输入中水平提取空间特征。该过程始于输入的频谱图,它以图像形式编码了音频信号的时频特性。输入频谱图随后通过一个卷积层,其中多种滤波器可提取频率带、边缘和纹理等空间特征,从而生成特征图。接着,提取出的特征图经过一个非线性激活函数——修正线性单元(ReLU),使神经网络能够检测输入数据中的依赖关系。然后,特征图通过一个池化层,在减小特征图尺寸的同时保留其最重要的特征。卷积层、激活层和池化层的这一过程会重复多次,构建出一种特征表示的层次结构,从简单特征开始,逐步演化为与机器运行相关的更复杂特征。
使用变换器编码器进行时间建模
使用卷积神经网络(CNN)提取空间特征后,下一步是生成能够捕捉从频谱图中学习到的基于频率模式的高层特征图。随后将得到的特征图展平并重塑为序列,以捕获声学信号中的时序信息。假设特征图表示为
,其中 H', W' 和 C 分别表示高度、宽度和通道数,则可得到以下序列:
(15)
其中 T 表示序列长度,d 为特征维度。Transformer 随后利用上述序列,通过自注意力机制建模长期依赖关系。与传统的循环模型不同,Transformer 模型并行处理序列中的每个元素,并利用注意力权重确定各部分的相对重要性。注意力机制的工作原理是:根据每个输入 xt 按照以下方式生成查询向量(Query Q)、键向量(Key K)和值向量(Value V):
(16)
而 WQ,WK,WV 是可训练的权重。元素之间的相似性通过以下方式确定:
(17)
dk 是向量维度的重要参数。该过程有助于模型从信号中较远的时间步长学习依赖关系,并仅关注相关的时间片段。为了增强网络的学习能力,采用多头注意力机制,即多个注意力头并行地从输入中进行学习:
(18)
每个注意力头负责处理时间输入序列中的不同特征。随后是前馈神经网络和残差连接:
(19)
生成的编码序列同时捕捉了输入的空间和时间特征。该序列被送入分类器层以检测异常。
图4展示了使用Transformer编码器对从CNN提取的特征进行时间建模的整体流程。首先,采用从CNN提取的特征图,这些特征图包含来自频谱图的空间信息。特征图被展平为一个序列,其中每个元素对应一个时间戳。随后,该序列经过线性变换,将数据映射为特定维度的向量。由于Transformer模型本身无法捕捉时间依赖关系,因此还会向嵌入向量中添加位置编码,以保留序列的时间结构。最后,序列通过一个由多个层级堆叠而成的Transformer编码器,在其中采用多头自注意力机制,使模型能够学习序列中不同时间戳之间的关联。前馈神经网络进一步优化这些嵌入表示,而残差连接则确保梯度能够高效传播。该过程在堆叠的Transformer编码器层中重复进行,逐层捕获更为复杂的时间交互关系。最终,通过池化操作(例如平均池化或分类标记(CLS))将序列嵌入整合为一个固定长度的表示,从而得到全局时间特征表示。
分类层
经过变换器编码器进行时间编码后,输出将是一系列编码向量,每个向量均包含与输入信号空间和时间特征相关的特征。从编码输出进行分类的第一步是将所有这些特征聚合为单个向量。这可以通过对特征向量序列应用平均池化,或使用所谓的“分类标记”(classification token)来实现。假设变换器的输出为
,其中每个
。聚合后的特征 h 计算如下:
(20)
然后,聚合后的特征向量 h 以紧凑的形式表示输入,并作为分类器的输入。分类部分包含一个或多个全连接层,将学习到的表示转换到输出空间。全连接层实现的变换定义如下:
(21)
其中 o 是输出(logits), b 是偏置向量,且 W 是权重矩阵。后者是以未归一化形式表示的类别得分。为了将非线性引入模型,通常使用诸如ReLU之类的激活函数。最后,对logits应用softmax激活函数,以获得每个类别的概率:
(22)
其中,C 表示类别数量(C = 2;正常与异常)。类别预测将基于最大概率值进行。在训练过程中,通过最小化实际标签与预测标签之间的交叉熵损失,获得模型参数的最优值,从而实现对机器状态的准确分类。综上所述,分类层在将基于 Transformer 架构提取的时间特征转化为实际决策方面发挥着关键作用。通过对健康与故障机器状态进行有效区分,可在工业 5.0 范式下实现异常检测与智能决策。
图5展示了在Transformer编码器之后的分类层工作原理。该过程始于编码序列输出,其中每个向量包含从输入中学习到的时间信息。这些向量被合并为一个单一向量,称为全局特征向量。下一步是将全局特征向量输入多个全连接神经网络层。在每个全连接层中,通过矩阵乘法运算生成输入的线性组合。随后,可应用非线性激活函数(如ReLU),以增强学习决策边界的灵活性。在最后一个全连接层的末端,会输出每个类别的logit得分。这些logit得分可通过Softmax函数计算出每个类别的概率得分。这些概率得分用于判断输入属于类别0(正常)还是类别1(异常)。
使用SHAP进行可解释性分析
在模型对输入信号进行分类后,会根据机器运行是否正常生成相应的预测结果。然而,在工业5.0环境下,仅生成预测是不够的;系统还必须提供透明性和可解释性,以支持人类的决策过程。以下框架采用SHAP方法,这是一种基于博弈论的模型,用于量化各个特征在预测结果中的重要性。通过该方法,SHAP为各个特征分配权重,从而可以评估频谱图输入中不同区域对整体预测的相对重要性。
SHAP 的数学表达基于对模型 f(x) 的分解:
(23)
其中 ∅0 是基线值(模型输出的均值), ∅i 是第 i 个特征的效应,且 M 是输入特征的数量。在本研究中,这些特征来自频谱图的时间-频率单元。若SHAP值为正值,则表示其对异常状态的概率具有促进作用;若为负值,则表示其作用相反。该方法可确保对每个预测结果提供唯一且局部一致的解释。SHAP方法可应用于已训练的CNN-Transformer模型,以基于特征重要性提供解释。其可视化结果将展示频谱图中对决策过程影响最大的时间-频率单元。例如,设备的异常行为可能导致某些高频高能量频带,SHAP框架会识别这些频带为决策过程中的重要贡献者。
此外,SHAP 能够在信息物理环境中促进人与机器之间的协作。这是因为预测结果可以通过直观的可视化方式进行解释,使操作人员和决策系统能够验证预测、分析问题并采取适当措施。这不仅增强了信任,还使基于人工智能的制造过程更加可靠且可追溯。通过将满足当前性能标准的深度学习算法与提供可解释性的 SHAP 相结合,所提出的架构满足了工业 5.0 的要求。
算法 2:基于 SHAP 的模型预测可解释性
输入:训练好的模型 f(x),输入频谱图 S
输出:SHAP 值
和解释图谱
步骤 1:将频谱图 S 输入至训练好的模型
步骤 2:计算预测值:y = f(S)
步骤 3:初始化一个面向深度学习的 SHAP 解释器
步骤 4:计算 SHAP 值:

步骤5:针对每个特征 i 在 S 中:
计算贡献 
步骤 6:生成解释图谱:
突出显示高 
步骤 7:可视化特征重要性(热图)
步骤 8:返回 SHAP 值和解释图
基于SHAP的可解释性算法首先获取预处理后的频谱图图像作为输入,并将其输入到训练好的CNN-Transformer架构中进行预测(例如,判断机器状态为正常或异常)。在使用训练好的架构完成预测后,采用SHAP方法对模型进行解释。具体而言,为每个输入特征计算SHAP值(ϕ),以确定输入中哪些时频成分对预测结果的贡献最大。为计算这些值,必须比较模型在包含与不包含某些特征的输入下的输出结果。
在计算每个特征的SHAP值后,可通过SHAP值的符号和大小来评估该特征对预测结果的影响。例如,SHAP值较高的特征更有可能影响预测结果,而正值或负值分别表示该特征将预测结果推向正常/异常类别。根据结果,可生成以热图形式呈现的解释图。
最后,该算法输出 SHAP 值及相应的可视化结果,有助于揭示人类如何分析模型的决策过程。该技术使决策过程更加透明,使人类能够参与其中,从而确保人工智能驱动的工业中算法预测结果及其可靠性的实现。为提高可解释性分析的可靠性,从多种机器类型中准确诊断出的异常实例中选取了具有代表性的测试样本。通过对测试数据集中的 SHAP 值进行聚合,开展全局 SHAP 特征重要性分析,以识别在时频域中持续具有影响力的区域;同时针对这些代表性样本生成局部 SHAP 解释。该整合的局部与全局分析无需专家标注,即可为模型预测提供可靠的解释。
边缘计算使能的 CPS 集成
该方案应用于支持边缘计算的网络物理系统(CPS),旨在实现高效、可持续且实时的工业运行。模型训练完成后,将通过边缘计算方式部署卷积神经网络-Transformer(CNN-transformer)。该边缘计算层位于工业物联网(IIoT)设备附近,包括传感器和机械设备。边缘设备无需将所有采集的数据传输至云端,而是直接对 incoming 声学信号进行推理分析,无需先行上传。因此,系统几乎可立即检测到机械设备的异常情况,并在问题进一步恶化前采取必要措施。这种支持边缘计算的方法另一优势在于提升了延迟性能与运行效率,因为数据在生成位置附近即被分析处理。换言之,与云端方案不同,在云端方案中推理时间 Tinf
(24)
通常,通过降低Tcommunication,延迟将显著减少。另一项优势是,在持续传输数据时可降低带宽消耗和功耗。因此,该系统可扩展且可持续,适用于拥有大量联网设备的大型工业厂房。此外,信息物理系统(CPS)能够实现与物理层(设备)、人工智能(计算层)以及人类交互层的互动。
人在回路协作
所建议的工业5.0信息物理系统(CPS)的一个关键组成部分是人机协同,即人类操作员与人工智能模型共同参与决策过程。具体而言,根据所设计的框架,该系统不会成为完全自主的黑箱,而是允许操作员与其进行交互,并以SHAP解释的形式观察可解释的预测结果。此处的预测结果指的是检测输出(正常/异常),并附有用于做出预测的频谱图部分的可视化展示。
这种交互有助于操作人员更清楚地理解预测结果的形成过程以及哪些因素对其产生影响。人工参与意味着对系统的输出结果进行验证,并允许操作人员根据专业判断在必要时覆盖系统结果。与人工操作人员的协作使系统更加可信、高效、安全和可靠,有助于防止错误的发生。
所提出的集成可解释人工智能的网络-物理协作系统在 MIMII 数据集的大约 12,000 条音频记录上进行了实验测试,该数据集包含正常和异常的机器状态。训练数据集包含约 9,600 条数据记录,而测试数据集包含约 2,400 条音频样本。根据研究结果,所建议的 CNN-Transformer 模型在测试数据集上的分类准确率达到 98.5%,其值为 0.97–0.98。该结果与表 3中的混淆矩阵及统计稳定性分析相对应。引入 Transformer 编码器增强了架构的时间建模能力,而卷积神经网络(CNN)则从输入的频谱图中提取出具有区分性的空间特征。
除了分类性能外,还评估了其他与系统相关的特性。首先,基于边缘设备的实现推理延迟不超过 20 ms,能够实现实时异常检测。其次,所提出的系统通过减少通信需求,有助于提高能效。最后,所提出的可解释人工智能(Explainable AI)框架提供了 SHAP 可解释性,使领域专家更易于分析模型。MIMII 数据通过短时傅里叶变换(STFT)转换为频谱图,窗长为 1024,步长为 512,快速傅里叶变换(FFT)大小为 1024。生成的对数梅尔频谱图被调整为 224 × 224 像素,并进行 z-score 标准化。采用时间掩码、频率掩码和高斯噪声添加等数据增强方法,以提高训练模型的鲁棒性。卷积神经网络(CNN)架构包含四个卷积层,滤波器数量分别为 32、64、128 和 256,并包含批归一化、ReLU 激活函数和最大池化层。提取的特征图被转换为序列,作为 Transformer 编码器的输入,该编码器包含四个编码器层、八个注意力头、256 维嵌入向量和 1024 维前馈网络维度。采用 0.3 的 dropout 概率以最小化过拟合。训练过程中使用 Adam 优化器,学习率为 0.0001,权重衰减为 1 × 10⁻5。训练的迭代次数和批量大小分别为 100 和 32。随机种子设置为 42,以确保实验的可重复性。为验证结果的统计有效性,采用了以下方法:所有实验独立运行 10 次,每次使用不同的随机种子和数据打乱方式。计算了准确率(Accuracy)、精确率(Precision)、召回率(Recall)、F1 分数(F1-score)、受试者工作特征曲线下面积(ROC-AUC)以及精确率-召回率曲线下面积(PR-AUC)的平均值和标准差。此外,计算了 95% 置信区间以估计性能的不确定性。最后,采用配对 t 检验,将本文提出的 CNN-Transformer 方法与性能最佳的基线模型进行比较。早停法(early stopping)的耐心参数设置为 10 个迭代周期。表 4 展示了环境设置与超参数配置,表 5 提供了仿真环境的详细信息。
本研究中采用MIMII数据集进行评估实验,该数据集包含多种机器运行状态和声学故障场景。尽管所提出框架的结果验证了模型的有效性,但仍需在多种工业数据集和制造环境中进一步验证。
该框架在配备多核处理器、16 GB 系统内存以及支持 GPU 的边缘加速器的边缘计算平台上实现,以支持实时推理与可解释性分析。工业声学传感器通过工业物联网(IIoT)通信层将音频流传输至边缘网关。边缘节点用于执行频谱图生成、异常推理以及 SHAP 解释生成等任务,而云端服务器则用于长期数据存储和模型更新。该架构不仅减少了所需的通信量,还实现了感知设备、人工智能模块与网络物理系统中人工操作员之间的实时交互。
上述引入的CNN-Transformer方法与多种现有方法进行了比较,包括支持向量机(SVM)和随机森林等传统机器学习模型、不含Transformer的CNN模型,以及基于长短期记忆(LSTM)的模型。由于传统机器学习模型缺乏处理数据中空间与时间相关性的能力,其性能表现不理想;而CNN模型能够有效处理空间特征,LSTM模型则能够处理声学信号的时间特性。然而,前者在计算成本和并行处理能力方面均逊于后者。
为了确保所提出的CNN-Transformer模型与基线模型之间的公平比较,前者使用相同的MIMII数据集划分(80%训练和20%测试)、预处理步骤、频谱图生成过程以及评估指标进行训练和评估。在支持向量机(SVM)方法中,采用了径向基函数(RBF)核,其中C = 10,γ = 0.01。随机森林方法包含200棵树,最大树深度为20。对于卷积神经网络(CNN),其结构包含四个卷积层(滤波器数量分别为32、64、128和256),后接全连接层,但不包含Transformer模块。最后,在长短期记忆网络(LSTM)方法中,使用了两个堆叠的LSTM层,每层包含128个隐含单元,并设置0.3的dropout率。
相反,使用CNN-Transformer框架能够有效利用声学信号的空间和时间特征,从而获得最佳结果。此外,边缘计算的引入有助于降低计算成本、改善延迟并节约能源。同时,采用SHAP实现的预测可解释性可被视为另一项优势,使所提出的方法区别于现有技术。
尽管在开发用于声学异常检测的新模型(如视觉Transformer(ViT)、音频频谱图Transformer(AST)、Conformer以及基于自监督学习的模型)方面取得了最新进展,但本研究尚未对这些架构进行实验性比较。未来计划将这些模型用作评估所提出框架的基准。
用于评估所提出模型性能的指标包括准确率、精确率、召回率和 F1 分数。精确率衡量的是真阳性占真阳性与假阳性总数的比例,而准确率评估的是预测结果的整体正确性。召回率则提供了模型对特定系统中异常情况进行预测能力的估计,这一点至关重要,因为未能预测出缺陷可能导致系统故障。这些指标的数学计算方法如下:
(25)
(26)
(27)
(28)
除了这些指标外,在评估基于边缘计算的建议信息物理系统(CPS)模型的实际性能时,还会考虑与系统性能相关的其他指标,例如延迟、能源利用率和可扩展性。
除了标准的性能测量方法外,还有许多其他指标可用于从更全面的角度评估所提出的解决方案,尤其是考虑到其在现实世界中不平衡和流式数据案例研究中的适用性。例如,受试者工作特征曲线下面积(ROC-AUC)用于衡量算法在不同阈值下区分两个类别的能力。由于其具有较强的鲁棒性和可分性,ROC-AUC 值应较高。此外,精确率-召回率曲线下面积(PR-AUC)指标对于异常检测案例研究尤为重要,因为异常类别的样本通常较为稀少。
一个需要考虑的重要指标是马修斯相关系数(Matthews Correlation Coefficient, MCC)。该指标综合考虑了混淆矩阵中的全部四项,即使在类别不平衡的情况下也能提供准确的评估。该指标的计算方法如下:
(29)
MCC 的取值范围为 -1 到 +1,+1 表示预测完全准确。另一个可采用的指标是特异性(真阴性率),该指标在工业应用中可用于评估是否存在假阳性预测:
(30)
为确保混淆矩阵与性能指标之间不存在不一致,所有评估标准均基于最终测试数据集进行计算。以下公式中均使用真正例(TP)、真反例(TN)、假正例(FP)和假反例(FN)的表示方法。准确率、精确率、召回率、特异性、F1分数和马修斯相关系数(MCC)根据公式(25)–(30)进行计算。此外,通过独立阈值评估,从CNN-Transformer模型的概率输出中计算了ROC曲线下面积(ROC-AUC)和PR曲线下面积(PR-AUC)。
在系统层面需要考虑的关键指标包括延迟、吞吐量和计算成本。延迟是指完成一次预测所需的时间。吞吐量是指每秒处理的数据样本数量。计算成本代表了能源效率,对于确保计算效率具有重要意义。此外,在评估模型时,还可以考虑可解释性指标,例如SHAP一致性以及特征重要性的稳定性。
从 MIMII 数据集的表3结果可以明显看出,本文提出的 CNN-Transformer 模型优于所有其他机器学习和深度学习方法。支持向量机(SVM)和随机森林模型的性能尚可,但较为有限,其准确率分别为 88.6% 和 91.2%。这可能是由于这些模型难以从声学信号中提取复杂的时序和空间特征所致。然而,LSTM 通过建模时间序列数据,性能优于 SVM 和随机森林,准确率达到 94.5%。但本文提出的 CNN-Transformer 方法表现出最佳性能,准确率提升至 98.5%,精确率(precision)为 98.06%,召回率(recall)为 99.02%,F1 分数(F1-score)为 98.54%。因此,该算法能够准确分类机械设备的正常与异常状态。较高的特异性(specificity,97.96%)表明该方法在减少假阳性方面具有显著效果,这对工业应用至关重要。值得注意的是,CNN-Transformer 的优异性能可归因于 CNN 与 Transformer 的结合:前者用于提取判别性特征,后者则用于捕捉长序列中的时序关系。
ROC曲线在 图6 展示了SVM、随机森林、LSTM以及所提出的CNN-Transformer方法在MIMII数据集上的分类能力比较。如图所示 图6建议的CNN-Transformer模型取得了最高的曲线下面积(AUC),达到0.994,表明该方法在区分正常与异常类别方面具有更优的判别性能。相比之下,LSTM的结果略低于建议的CNN-Transformer方法,其AUC约为0.97。随机森林和SVM的AUC相对较低,分别约为0.958和0.913,这归因于这两种方法难以从给定数据中学习复杂的声学模式。
在异常检测中,由于异常样本数量较少,精确率-召回率(PR)曲线能够提供更优的分析。在PR曲线中,CNN-Transformer模型的平均精度(AP)最高,约为0.97–0.98,表明其在较少误报的情况下具有更优的异常实例检测能力,如图7所示。相比之下,LSTM分类器排名第二,AP值介于0.92至0.94之间。而随机森林和SVM分类器分别位列第三和第四,AP值分别为0.88和0.84。所提出的混合分类器在所有召回水平下均实现了更高的准确率,这对于需要高精度和低误报的实际工业应用而言至关重要。
CNN-Transformer 模型在 MIMII 数据集上与现有模型进行了比较,所使用的高级性能指标如表6所示。ROC-AUC 值反映了模型在不同阈值下对两类样本的区分能力。支持向量机(SVM)和随机森林分类器的 ROC-AUC 值分别为 0.913 和 0.958,LSTM 模型达到 0.970,而 CNN 模型为 0.98。所提出的 CNN-Transformer 框架取得了最高的 ROC-AUC 值 0.994,表明其在区分正常与异常机器状态方面具有卓越的判别能力。同样,PR-AUC 值表明所提出的模型能够有效应对类别不平衡问题,这在异常检测中是一个关键因素。所提出的 CNN-Transformer 模型取得了最高的 PR-AUC(平均精度)0.982,其次是 CNN(0.950)、LSTM(0.912)、随机森林(0.891)和 SVM(0.765),表明其在工业声学异常检测任务中具有更优的精确率-召回率性能。此外,用于衡量模型性能平衡性的马修斯相关系数(MCC)在所提出的模型中达到了较高的 0.97。相比之下,早期方法如 SVM(0.73)和随机森林(0.78)的预测准确性较低。
为了测试所提出方法的稳定性,采用不同的初始化种子和数据打乱方案,重复进行了10次相同的实验。CNN-Transformer架构在表7中的结果如下:准确率 = 98.50% ± 0.19%,精确率 = 98.06% ± 0.23%,召回率 = 99.02% ± 0.22%,F1分数 = 98.54% ± 0.24%。相对较小的标准差表明模型具有良好的稳定性。对所有评估指标均计算了95%置信区间。结果显示,准确率指标的置信区间为[98.1%, 98.9%],表明模型性能表现稳定。ROC-AUC、PR-AUC和MCC的置信区间也均较窄。对所提出的CNN-Transformer模型与性能最佳的基线模型(LSTM)进行配对t检验,得到的p值 < 0.05,表明观察到的性能提升具有统计学显著性,而非偶然所致。
为了测试所提出的CNN-Transformer架构的鲁棒性,实验在不同的随机初始化种子和打乱配置下重复了10次,如图8所示。模型获得的平均准确率、精确率、召回率和F1分数分别为98.50% ± 0.19%、98.06% ± 0.23%、99.02% ± 0.22%和98.54% ± 0.24%。从箱线图分析可以看出,模型性能指标的波动极小,表明其具有良好的稳定性和鲁棒性。因此,所提出的方法在多次实验中表现出高度稳定性,无显著差异,说明模型具有良好的泛化能力。
此外,基于实验的多次运行结果进行了统计检验。所有评估指标中较小的标准差表明,该模型对随机性或训练过程中的变化具有较低的敏感性。这证实了所提出的CNN-Transformer模型能够在实际的网络-物理制造系统中提供稳定且一致的性能。
SHAP 热图能够反映在预测机器状态是否正常时,频谱图中各个时频区域的重要性。SHAP 值表示每个预测变量对最终预测结果的贡献程度。
在图9A所示的SHAP值热图中,正SHAP值(例如+0.6至+1.2之间)表示对异常类别的贡献,而负SHAP值(即−0.3至−0.8之间)表示对正常类别的贡献。最高的SHAP得分出现在50–100时间帧的中频范围(40–80个频率区间)。这些区域是声学测量中检测关键故障信号的关键区域。此外,低频段(少于20个区间)的SHAP得分几乎为零(−0.1至+0.1),表明其对模型决策的影响可忽略不计,说明模型能够忽略与故障预测无关的背景噪声。特定时间段内高SHAP得分的时间一致性也突显了Transformer模块捕捉声学信号长距离依赖关系的能力。综上所述,SHAP热图清晰地表明,CNN-Transformer模型聚焦于具有高判别能力的独特时频段,增强了模型的可解释性,并有助于操作人员通过视觉方式检测故障。
结果表明,SHAP 方法仅作为一种可解释性技术使用,并未参与 CNN-Transformer 模型的训练过程。分类准确率完全由 CNN 和 Transformer 组件所学习的参数决定。SHAP 在模型推理步骤之后用于解释预测结果,通过识别对预测结果影响最大的时频窗口,判断其倾向于正常或异常类别。因此,SHAP 提高了人类对模型的透明度和理解能力,而不会影响分类准确率。所提出框架提供的 SHAP 值能够实现清晰的可视化,有助于运维人员通过将检测到的区域与实际的机器运行状态及维护记录进行比对,验证模型的预测结果。因此,在开展预测性维护工作时,人机协作将变得更加便捷。
为了评估可解释性水平,进行了全局SHAP特征重要性分析,如图9B所示。结果表明,某些中频成分在异常检测中起着重要作用。此外,如图9C所示的案例研究显示,SHAP能够准确定位异常机器频谱图中与故障相关的区域。该研究采用MIMII数据集中的泵和阀门异常数据样本进行了定性案例分析。对于故障泵,SHAP识别出与空化和磨损相关的2–4 kHz频率范围;对于故障阀门,SHAP激活主要集中在表现出重复谐波信号(提示泄漏)的区域。在多个代表性测试样本中,SHAP可视化结果可靠地识别出与异常机器状态相关的时间-频率判别区域。通过突出显示对每项预测贡献最大的频谱区域,这些解释揭示了模型决策的依据。本研究将SHAP分析作为一种理解模型行为的可解释性工具,而非经专家验证的故障确认手段,因为由维护专业人员进行的形式化验证不在本研究范围之内。
混淆矩阵展示了所提出的CNN-Transformer模型在图10所示MIMII数据集上的分类性能。总体而言,960个正常样本被正确识别为正常样本(真阴性),而20个正常样本被错误识别为异常样本(假阳性)。此外,在所有样本中,1010个异常样本被正确检测为异常样本(真阳性),而10个异常样本被误判为正常样本(假阴性)。
因此,实现了较高的检测性能,特别是对于预测性维护中至关重要的异常样本。如图10所示,假阴性错误极为罕见(10个样本),这对于任何行业确保其安全性和可靠性都至关重要。另一方面,假阳性错误(20个样本)出现频率略高,但仍处于相对较低的水平。图10所示的混淆矩阵是使用包含2,000条测试记录的平衡子集(正常样本与异常样本数量相等)生成的,以清晰展示分类器的性能。所有报告的评估指标,包括准确率、精确率、召回率、特异性以及F1分数,均基于完整的测试集(约2,400条记录)计算得出。
考虑到图10和表8中所示的混淆矩阵(TN = 960,FP = 20,TP = 1010,FN = 10),可进行如下计算:准确率(Accuracy)= (TP + TN) / (TP + TN + FP + FN) = 98.50%;精确率(Precision)= TP/(TP + FP) = 98.06%;召回率(Recall)= TP/(TP + FN) = 99.02%;特异性(Specificity)= TN / (TN + FP) = 97.96%;F1分数(F1-score)= 98.54%;MCC = 0.97。此外,ROC-AUC和PR-AUC值分别为0.994和0.982。用于展示的图10中的混淆矩阵是通过测试数据中一个包含2,000条记录的平衡代表性子集生成的,仅用于可视化目的。本研究中报告的所有定量性能指标均基于完整的测试集(约2,400条记录)计算得出。总体而言,结果表明所提出的CNN-Transformer架构实现了98.5%的分类准确率,与表8中的结果及消融分析一致。
为验证基于边缘的实现方案的有效性,进行了额外的测量。如Table 9所示,所提出模型的平均推理延迟为18.7 ms/样本,每秒可处理约53个样本。推理过程中的功耗为8.9 W,估算出每次预测的能耗为0.167 J。为评估Table 10中所提出方法的可持续性影响,考虑了通信开销、能耗和资源使用情况。由于推理过程在边缘节点本地进行,仅有汇总的诊断数据被传输至云端环境。实验结果表明,与传统的基于云的CPS系统相比,通信量减少了73%。此外,本地推理使能耗降低了32%,通信时间从75 ms减少至20 ms。
消融研究
对MIMII数据集进行消融研究,以评估基于可解释AI的CPHS架构中每个组件的影响。该消融研究探讨了使用卷积神经网络(CNN)学习空间特征、使用Transformer编码器学习时间特征以及SHAP可解释性算法本身的作用。考虑了所提出模型的几种变体,即:(i)仅使用CNN的版本,(ii)仅使用Transformer的版本,(iii)结合CNN与Transformer但不使用SHAP算法的模型,以及(iv)将CNN与Transformer结合SHAP算法的完整模型。在评估中采用了准确率、精确率、召回率和F1分数等常用指标。
这些消融实验结果表明了表11中所述框架中各个组成部分的重要性。仅使用CNN的模型达到了93.8%的准确率,表明从频谱图中提取空间特征是有效的,但其无法捕捉声学信号中的时间依赖性。同样,仅使用Transformer的模型准确率略低(92.6%),因为它在提取时间特征的同时忽略了空间信息。最终,所提出的CNN-Transformer模型获得了98.5%的准确率、98.06%的精确率、99.02%的召回率以及98.54%的F1分数,与主实验结果一致。由于SHAP仅用于事后解释,而不参与模型训练,因此分类准确率与训练好的CNN-Transformer模型相同。随后使用SHAP生成特征归因解释。提升的召回率(99.02%)表明该模型在检测机器异常状态方面表现优异,能够确保不遗漏任何故障部件,这对于实现预测性维护系统至关重要。
数据可用性:
本研究所使用的故障工业机械检测与检查(Malfunctioning Industrial Machine Investigation and Inspection,MIMII)数据集可从官方 Zenodo 仓储库公开获取。实验基于数据集作者提供的公开音频记录及标注信息进行。该数据集可通过 https://zenodo.org/records/3384388 访问。本研究配套的实现代码已通过 Zenodo 仓储库公开提供,地址为 https://zenodo.org/records/21405292。该仓储库包含所提出框架的实现代码,涵盖数据预处理流程、模型架构、训练工作流、评估脚本、配置文件以及辅助工具,以促进对所提方法的理解与独立复现。MIMII 数据集未随实现代码一并重新分发,需从其官方仓储库单独获取。

图1: 本研究提出的系统架构。 该架构设计为一种可解释人工智能驱动的网络-物理-人体系统,结合了预处理、基于卷积神经网络(CNN)的空间特征学习、基于Transformer的时间序列建模、SHAP可解释性分析以及面向可持续制造的边缘计算。 请点击此处查看该图的高清版本。

图 2: 预处理流程。 声学信号预处理流程包括噪声去除、归一化、分段、短时傅里叶变换(STFT)以及频谱图提取。请点击此处查看该图的放大版本。

图3: 使用卷积神经网络进行空间特征提取。 通过卷积、激活和池化过程,利用频谱图由卷积神经网络(CNN)进行空间特征提取的架构。请点击此处查看该图的放大版本。

图4: 使用 Transformer 编码器进行时间建模。 Transformer 编码器架构通过频谱图序列表示来捕捉时间依赖性和长距离依赖性。请点击此处查看该图的放大版本。

图5: 分类层。 一个将编码后的时间特征映射为概率值的分类器层,用于预测机器状态。请点击此处查看该图的放大版本。

图6: ROC曲线结果。 在MIMII数据集上对SVM、随机森林、LSTM、CNN以及所提出的CNN-Transformer算法的ROC曲线进行比较。请点击此处查看该图的放大版本。

图7: 精确率-召回率曲线结果。 精确率-召回率曲线比较,展示了多种机器学习与深度学习方法在异常检测中的效率。请点击此处查看该图的放大版本。

图 8: 多轮运行性能稳定性分析。 箱形图显示了使用所提出的 CNN-Transformer 架构进行十次独立实验所获得的准确率、精确率、召回率和 F1 分数结果的性能稳定性。微小的波动表明模型具有良好的稳定性和鲁棒性。 请点击此处查看此图的放大版本。

图9基于SHAP的所提异常检测框架可解释性分析 (A) 基于SHAP的可解释性分析。使用SHAP方法生成的热图,显示导致异常行为识别的最相关时频区域。B) 使用全局SHAP方法进行特征重要性分析,以识别最具影响力的特征。C异常机器的 SHAP 可解释性可视化 请点击此处以查看此图的放大版本。

图10: MIMII数据集的混淆矩阵。 该混淆矩阵表示所提出的CNN-Transformer算法的分类性能。 请点击此处查看该图的放大版本。
| 参数 | 描述 |
| 数据集名称 | MIMII(故障工业机器检测与检查)数据集 |
| 机器类型 | 阀门、泵、风扇、滑轨 |
| 使用的总样本数 | 约 12,000 段音频录音 |
| 课程分类 | 正常,异常 |
| 采样率 | 16 kHz |
| 每个样本所需时间 | 10 秒 |
| 音频格式 | WAV |
| 特征表示 | 基于短时傅里叶变换的频谱图图像 |
| 预处理步骤 | 噪声滤波、归一化、分割、短时傅里叶变换 |
| 标签分配 | 正常记录标注为0类;根据MIMII标注,异常记录标注为1类 |
| 训练-测试集划分 | 80% 训练(≈9,600 个样本),20% 测试(≈2,400 个样本) |
| 数据划分策略 | 在分割前对音频文件级别进行划分,以防止数据泄露 |
| 工业噪声环境 | MIMII 录音中包含的真实工业声学环境 |
| 应用领域 | 预测性维护与机器异常检测 |
| 目标产业5.0愿景 | 可解释的、以人为本的和可持续的故障检测 |
表1: 数据集描述。 关于MIMII数据集在机器类型、采样分布、信号特征、特征表示和应用方面的描述。
| 设备类型 | 设备编号 | 正常录音 | 异常录音 | 信噪比条件 (dB) | 实验划分 |
| 风扇 | ID00–ID06 | 8,400 | 1,600 | −12 至 −9 | 80% 训练 / 20% 测试 |
| 齿轮箱 | ID00–ID06 | 7,124 | 1,147 | −17 至 −15 | 80% 训练 / 20% 测试 |
| 泵 | ID00–ID06 | 7,200 | 1,800 | −18 至 −9 | 80% 训练 / 20% 测试 |
| 滑轨 | ID00–ID05 | 7,000 | 1,800 | −14 至 −12 | 80% 训练 / 20% 测试 |
| 阀门 | ID00–ID05 | 7,000 | 1,800 | −12 至 −9 | 80% 训练 / 20% 测试 |
表2: 本研究中使用的MIMII数据集描述。工业机器类型、机器编号、正常与异常录音数量、信噪比条件,以及用于监督二分类的训练/测试划分。
| 模型 | 准确率 (%) | 精确率 (%) | 召回率 (%) | F1 分数 (%) | 特异性 (%) |
| SVM | 88.6 | 86.9 | 85.4 | 86.1 | 90.2 |
| 随机森林 (RF) | 91.2 | 89.8 | 88.5 | 89.1 | 92.6 |
| LSTM | 94.5 | 93.2 | 92.8 | 93 | 95.1 |
| CNN | 96.3 | 95.4 | 94.9 | 95.1 | 96.8 |
| CNN–Transformer(本文提出) | 98.5 | 98.06 | 99.02 | 98.54 | 97.96 |
表3: MIMII数据集的分类结果。 使用准确率、精确率、召回率、F1分数和特异性对机器学习与深度学习分类器的性能进行比较。
| 参数 | 数值 |
| 数据集 | MIMII Dataset |
| 总样本数 | ~12,000 |
| 训练-测试划分 | 80% / 20% |
| 输入类型 | 频谱图图像 |
| CNN 层数 | 3–5 卷积层 |
| Transformer 层数 | 2–4 编码器层 |
| 批量大小 | 32 |
| 学习率 | 0.001 |
| 优化器 | Adam |
| 训练轮数 | 100 |
| 硬件 | 边缘设备 + GPU(用于训练) |
| STFT 窗长 | 1024 |
| 步长 | 512 |
| FFT 大小 | 1024 |
| 频谱图分辨率 | 224 × 224 |
| 归一化方法 | Z-score |
| 数据增强 | 时间掩码、频率掩码、高斯噪声 |
| CNN 层数 | 4 |
| CNN 滤波器数量 | 32, 64, 128, 256 |
| Transformer 层数 | 4 |
| 注意力头数 | 8 |
| 嵌入维度 | 256 |
| 前馈网络维度 | 1024 |
| Dropout | 0.3 |
| 随机种子 | 42 |
| 早停耐心值 | 10 |
表4: 环境设置与超参数配置。 用于实现所提出的CNN-Transformer架构的训练与实验参数。
| 组件 | 规格 |
| 编程语言 | Python |
| 框架 | TensorFlow / PyTorch |
| 处理器 | Intel i7 / Ryzen 7 |
| GPU | NVIDIA GTX 1660 / RTX 系列 |
| 边缘设备 | Raspberry Pi / NVIDIA Jetson |
| 可视化 | Matplotlib, SHAP |
| 边缘设备 | NVIDIA Jetson Xavier NX |
| CPU | 6核 ARM v8.2 |
| 内存 | 16 GB |
| 操作系统 | Ubuntu 20.04 |
| 深度学习框架 | TensorFlow/PyTorch |
| 数据集大小 | 12,000 MIMII 样本 |
| 连接方式 | Ethernet/Wi-Fi |
| 模型参数量 | 840万 |
| 模型大小 | 32.7 MB |
| 框架 | PyTorch + TensorRT |
| 批量大小 | 1 |
| 量化方式 | FP16 |
| 剪枝 | 否 |
| 平均延迟 | 17.8 ms |
| 中位延迟 | 17.2 ms |
| 第95百分位延迟 | 19.6 ms |
| 吞吐量 | 56 样本/秒 |
| 内存占用 | 1.4 GB |
| 功耗 | 11.3 W |
表5: 模拟环境。 用于训练、部署和评估所提出模型的硬件和软件。
| 模型 | ROC-AUC | PR-AUC | MCC |
| SVM | 0.913 | 0.765 | 0.73 |
| 随机森林 (RF) | 0.958 | 0.891 | 0.78 |
| LSTM | 0.97 | 0.912 | 0.86 |
| CNN | 0.98 | 0.95 | 0.9 |
| CNN–Transformer(本文提出) | 0.994 | 0.982 | 0.97 |
表6: ROC-AUC、PR-AUC和MCC实验结果的比较。 基于ROC-AUC、PR-AUC和马修斯相关系数(MCC)指标对不同模型进行比较。
| 指标 | 均值 (%) + 标准差 (%) | 95% 置信区间 |
| 准确率 | 98.50 ± 0.19 | [98.1, 98.9] |
| 精确率 | 98.06 ± 0.23 | [98.0, 98.2] |
| 召回率 | 99.22 ± 0.22 | [98.8, 99.4] |
| F1分数 | 98.54 ± 0.24 | [98.1, 98.9] |
| ROC-AUC | 0.984 | 0.004 |
| PR-AUC | 0.982 | 0.005 |
| MCC | 0.97 | 0.007 |
表7:多次运行的统计分析结果。 所提出的CNN-Transformer架构在10次实验中的稳健性统计结果,包括各项性能指标的均值、标准差、95%置信区间及显著性。
| 指标 | 数值 |
| 准确率 | 98.50% |
| 精确率 | 98.06% |
| 召回率 | 99.02% |
| 特异性 | 97.96% |
| F1分数 | 98.54% |
| MCC | 0.97 |
| ROC-AUC | 0.994 |
| PR-AUC | 0.982 |
表8:混淆矩阵的最终测试集。 所提出架构的测试集混淆矩阵,展示了机器正常与异常状态的分类情况,评估指标由此得出。
| 指标 | 云端部署 | 边缘端部署 |
| 推理延迟(ms) | 85.6 | 18.7 |
| 吞吐量(样本/秒) | 22 | 53 |
| 网络使用量(MB/分钟) | 120 | 18 |
| 每次预测能耗(J) | 0.52 | 0.17 |
| 实时能力 | 中等 | 高 |
表9: 推理延迟结果。 可解释人工智能增强的CPHS框架在边缘部署中的延迟性能,包括处理时间、吞吐量、内存消耗及其他实时特性。
| 指标 | 基于云的 CPS | 提出的基于边缘的 CPHS | 改进 |
| 每小时数据传输量 | 100% | 35% | 降低 65% |
| 通信延迟 | 75 ms | 20 ms | 降低 73.3% |
| 能耗 | 100% | 68% | 降低 32% |
| 估算碳排放量 | 100% | 70% | 降低 30% |
表10: 边缘计算支持的CPHS的可持续性评估。 通过测量通信开销、能耗、资源利用率和延迟,评估边缘计算支持的CPHS的可持续性。
| 模型变体 | 准确率 (%) | 精确率 (%) | 召回率 (%) | F1分数 (%) |
| CNN 仅使用 | 93.8 | 92.5 | 94.2 | 93.3 |
| Transformer 仅使用 | 92.6 | 91.2 | 93.5 | 92.3 |
| CNN + Transformer | 98.5 | 98.06 | 99.02 | 98.54 |
表11: 消融实验结果。 消融实验结果,突出显示CNN、Transformer和SHAP模块对所提出模型性能的影响。
实验结果表明,所提出的CNN-Transformer架构通过有效整合空间与时间特征学习,在性能上优于单独的算法。根据消融实验,尽管CNN能够从频谱图中提取基于频率的判别性特征,但Transformer编码器通过捕捉声学信号中的长距离时间依赖关系,进一步提升了模型性能。此外,混淆矩阵显示假阴性极少,表明所提出的模型能够有效识别机器异常。该架构实现了更优的分类结果,准确率达到98.5%,召回率达到99.02%。这一结果在工业故障检测系统中至关重要,因为模型必须尽可能避免遗漏任何故障设备。实验结果表明,所提出的具备可解释人工智能(XAI)能力的CNN-Transformer框架,成功实现了高异常检测准确率、可解释性与实时边缘部署的结合。两个模块的协同作用实现了从声学数据中同时提取空间和时间特征,而SHAP解释方法则增强了模型的可解释性与可靠性。这些结果与工业5.0的理念一致,后者强调以人为中心的决策、可持续性以及信息域与物理域之间的协同。然而,仍需通过其他工业数据集进行更全面的评估,并开展实际部署,以评估所提出方法的泛化能力。
采用SHAP实现可解释性不仅提高了系统的效率,还显著增强了对模型底层逻辑的理解。该方法尤其关注对决策至关重要的时频段,这在人与人工智能系统需要相互信任的工业5.0场景中尤为关键。从SHAP热图可以明显看出,模型已识别出与故障相关的特定频段,从而确保了其与实际情况的一致性。本研究的创新性并不仅仅在于单独使用CNN-Transformer或SHAP,因为这两者在现有科学文献中已有提及;而在于将它们集成应用于工业5.0信息物理协作架构中,从而同时解决了可解释性、可持续性、边缘智能以及以人为中心的决策支持等问题。尽管所提出的框架借鉴了工业5.0的理念,如以人为中心的协作、可解释性、韧性以及可持续的边缘计算,但当前研究仅通过异常检测准确率、延迟、能耗和可解释性来评估其技术性能。对于操作员信任度、认知负荷、决策质量及接受度等以人为中心因素的直接评估,不在当前研究设计的范围之内。未来的研究将引入人在回路中的实验,以衡量所提出框架中协作决策的有效性。从理论角度来看,本研究通过展示卷积神经网络与Transformer结构在处理工业时空数据方面的有效性,为混合深度学习模型的发展做出了重要贡献。事实上,本文通过在整个决策过程中贯彻可解释人工智能(XAI)理念,进一步拓展了信息物理系统(CPS)和信息物理人体系统(CPHS)的方法体系。此外,将SHAP技术作为衡量不同时频特征贡献度的工具,也为基于可解释人工智能的系统提供了理论依据。总体而言,这一方法开辟了一种新范式,使深度学习模型不仅更加精确,而且能够被人类所理解,契合工业5.0的核心理念。
从实际应用角度来看,所提出的系统是实现实时工业异常检测与预测性维护的优秀解决方案。该系统在边缘采用 CPHS 架构,能够及时处理声学信号,非常适合在智能制造设施中部署实施。较高的召回率(99.02%)降低了漏检故障的概率,从而提高了运行安全性,并防止机械设备意外停机。此外,采用基于 SHAP 的解释方法使人类能够理解模型的输出结果,这在需要人类参与决策的关键场景中尤为重要。实验部署的结果明确表明,与传统云计算相比,边缘计算具有显著优势。这是因为在网络边缘进行推理可最大限度地减少延迟时间,并通过更高的吞吐量提升效率。同时,降低每次预测的能耗也有助于实现符合工业 5.0 标准的可持续制造目标。然而,尽管结果令人鼓舞,该方法仍存在若干局限性。首先,该框架主要在 MIMII 数据集上进行验证;尽管该数据集已较为广泛,但仍可能无法涵盖实际工业环境中不同种类机械设备所面临的全部可能场景。第二个局限性在于,使用 SHAP 实现可解释性会增加计算复杂度,在资源高度受限的边缘环境中部署该框架时可能成为问题。最后,现有模型仅限于处理声学信号,而工业系统通常需要多模态数据处理,例如振动与温度信号的融合分析。
尽管使用MIMII数据集可确保工业声学中的真实故障场景,但在其他基准数据集(如ToyADMOS、DCASE工业异常检测数据、IMS轴承数据和CWRU轴承故障数据)上进行验证,可进一步提升所提出框架的泛化能力。在未来的工作中,我们计划在机器类型、感知方法和制造环境方面开展跨域验证,以确保基于可解释人工智能的信息物理协作框架的普适性。当前研究的另一局限在于缺乏与近期开发的声学异常检测系统(如视觉变换器、音频频谱图变换器、Conformer模型以及新型自监督学习技术)的对比实验。尽管CNN-变换器模型已展现出较强的性能和可解释性,但仍需进一步研究以将其与这些先进技术进行基准对比。当前研究的另一个不足之处在于,对工业5.0特征(如韧性与可持续性)的评估是通过推理延迟和能耗等系统级指标间接完成的,尚未直接评估系统对通信故障和传感器失效的韧性,以及在碳足迹和资源利用方面的可持续性。这些因素应在后续研究中加以评估。
然而,需要注意的是,本研究中描述的“人在回路”协作范式是理论性的,旨在说明在操作员辅助的工业5.0信息物理系统中,如何利用可解释人工智能(AI)输出进行决策。与人类操作员进行实验验证、可用性分析、响应时间以及专家评估等内容不在本研究的范围之内。本文提出了一种由可解释AI驱动的信息物理协作新模型,适用于工业5.0环境下的可持续制造。在所开发的系统中,采用了一种混合的CNN-Transformer架构,以高效学习声学频谱图的空间和时间特征,从而实现对工业设备中异常状态的检测。该模型共分为四个步骤:将声学数据预处理为频谱图、使用CNN学习空间特征、利用Transformer编码器学习时间依赖性,以及最终的分类。在MIMII数据集上应用所提出方法获得的结果表明,该模型优于基线模型,准确率达到98.5%,召回率达到99.02%。此外,引入可解释性增强了系统的透明度。尽管所提出的可解释AI辅助信息物理协作框架在MIMII基准数据集上表现良好,但目前该研究仍局限于实验验证阶段。该框架仍需在工业环境中进行大规模生产验证,其中设备具有异质性、运行条件多变且部署周期较长。此外,未来工作还应包括与ViT、AST、Conformer以及自监督学习模型等架构的比较。换言之,尽管该框架证明了集成可解释AI、信息物理协作与“人在回路”协作的可行性,但在工业中大规模部署之前仍需进一步验证。未来的研究将进一步在多种工业故障诊断基准数据集以及跨领域制造场景中评估所提出的框架,以展示其在可持续制造生态系统中的鲁棒性、可迁移性和适用性。未来的验证工作将涵盖以操作员为中心的实验、在工业扰动条件下的韧性基准测试,以及与可持续性相关的产品生命周期评估。
为确保可重复性,本研究提供了有关数据预处理、划分策略、频谱图生成设置、CNN-Transformer模型架构、优化器、超参数以及用于评估模型性能的指标的详细信息。实验前已设定随机种子。为确保可复现性,实验在公开可用的MIMII(工业机械故障检测与检查)数据集上进行。该数据集的链接如下:DOI: 10.5281/zenodo.3384388。本研究的实现代码已通过Zenodo知识库公开发布:https://zenodo.org/records/21405292。音频信号以16 kHz采样率进行采样,并通过短时傅里叶变换(STFT)转换为对数梅尔频谱图,其中窗长为1024,帧移为512,FFT大小为1024。所提出的CNN-Transformer架构包含四个卷积层(滤波器数量分别为32、64、128和256),后接一个包含四个层、八个注意力头、嵌入维度为256、前馈网络维度为1024的Transformer编码器。训练过程采用Adam优化算法,学习率为0.0001,批量大小为32,共训练100个轮次。算法1和算法2分别描述了数据预处理阶段和可解释性分析流程。完整的算法及其实现细节均已给出。
仅使用人工智能工具(ChatGPT)协助语言编辑,以改进语法、清晰度和可读性。未使用人工智能工具生成科学数据、开展实验、分析结果、解释研究发现或得出科学结论。所有科学内容、数据分析、解释以及稿件的最终版本均由作者独立审阅、核实和批准,作者对本工作的准确性和完整性负全部责任。作者声明无任何利益冲突。
资金来源:本工作得到陕西省高等教育教学改革重点项目的资助(项目编号:23BG053);陕西工业职业技术学院高层次人才科研启动基金(项目编号:BSJ-2023-08);以及陕西工业职业技术学院科研项目(项目编号:2024YKYB-006)。作者衷心感谢中国陕西省咸阳市陕西工业职业技术学院和中国西安市西安交通工程学院为本研究提供的设施条件和机构支持。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 社会支持量表 | 已发表的学术量表;最初由 Park 开发,后经 Kim 修订和补充 | 25项版本;5点式李克特量表应答格式;无商业目录号 | 测量职前幼儿教师在情感支持、信息支持、物质支持和评价支持方面的感知社会支持水平。总体 Cronbach’α = 0.96。 |
| 教师自我效能感量表 | 已发表的学术量表;最初由Enochs和Riggs开发;中文版适应性研究版本 | 25项版本;5点式李克特评分格式;无商业目录号 | 在中国职前幼儿教育背景下,评估教师效能,涵盖一般教师自我效能与个人教师自我效能。总体Cronbach’α = 0.96。 |
| 教师-儿童互动量表 | 已发表的学术量表;由 Lee 开发,并经研究专家组审阅以适用于中国 | 30项版本;5点式李克特量表应答格式;无商业目录号 | 评估教师自我报告的师幼互动能力,而非观察到的课堂互动质量。包含情感互动、言语互动和行为互动;整体Cronbach’α = 0.94。 |
| 人口统计信息表 | 四川文理学院与大邱大学合作研究团队 | 自定义研究问卷部分;无商业货号 | 收集的参与者特征包括性别、教育背景、职业类别、实习地点、实习时长、实习类型和幼儿园类型。 |
| 参与者信息与知情同意书脚本 | 研究团队;经大邱大学研究伦理委员会批准 | 伦理批准编号:XXX;需提供本地批准记录以供核实 | 在问卷发放前使用,用于向学前教育准教师参与者说明研究目的和调查内容,并获取其知情同意。 |
| 试点调查问卷包 | 研究团队与专家组 | 6月使用的试用版本–2024年5月;无商业目录号 | 在50名职前幼儿教育教师中对职业认知量表、社会支持量表、教师自我效能感量表、师幼互动量表及人口统计学问卷条目的清晰性与适用性进行了预试验。 |
| 专家小组评审程序 | 研究团队;由两位学前教育教授、一位幼儿园园长、三位实习督导及研究团队组成的专家组 | 基于共识的内容评审;无商业型号 | 用于在正式调查前对量表条目进行修订,以消除歧义,确保适宜性、语义清晰性、发展适宜性及文化相关性。 |
| 现场打印的问卷表格 | 研究团队;本地机构调查用品 | 纸质调查问卷;无商业目录号 | 用于现场问卷发放。在最终样本中,合并线上问卷前共获得336份有效现场问卷。 |
| 微信 | Tencent | 微信移动应用程序;版本应根据6月份使用的设备/应用程序记录进行核实–2024年7月 | 用作问卷发放的在线分发渠道;通过在线/微信途径共收集到27份完成的电子问卷。 |
| 电话与面对面招募流程 | 研究团队 | 标准化招募流程;无商业目录编号 | 用于联系相关机构/参与者,说明研究目的和调查内容,并在发放问卷前协助获得知情同意。 |
| SPSS Statistics | IBM | 版本 27.0 | 用于描述性统计、皮尔逊相关系数、Cronbach’α信度分析、使用偏度和峰度进行正态性检验,以及哈曼单因素检验’常用方法偏差的单因子检验。 |
| SPSS Amos | IBM | 版本 26.0 | 用于验证性因子分析、结构方程模型构建、多组测量不变性检验、间接效应的Bootstrap检验以及竞争模型比较。 |
| Microsoft Excel | Microsoft | Microsoft 365 Excel 或本地安装的 Excel 版本;提交前请确认确切的本地版本构建信息 | 推荐/用作整理编码后的调查数据、数据字典、补充表格以及 JoVE 材料表的工作簿环境。具体本地版本应由作者核实。 |
| 结构方程模型拟合指数标准 | 已发表的方法学指南;稿件中引用了 Schreiber 等人和 Kline 的参考文献 | 无商业货号;在统计分析计划中应用的标准 | 定义并报告模型拟合指标,包括卡方统计量、卡方值除以自由度、Tucker-Lewis 指数、比较拟合指数、调整后的拟合优度指数、增值拟合指数、近似误差均方根、标准化残差均方根。 |
| Bootstrap中介效应检验程序 | SPSS Amos / 研究团队统计分析计划 | 5,000 次自助抽样;95% 偏差校正置信区间 | 用于通过教师效能检验间接关联。当95%偏差校正置信区间不包含零时,认为间接效应具有显著性。 |
| 测量不变性检验程序 | SPSS Amos / 研究团队统计分析计划 | 多组验证性因子分析 ΔCFI &< .010 和 ΔRMSEA &< .015 标准 | 用于在解释合并的结构方程模型(SEM)估计结果之前,评估性别、项目类型、实习时长和机构之间的构形、度量和标量不变性。 |