利用无监督结构聚类、基于隔离的异常检测以及物理信息驱动的风险映射方法,对来自伺服电机的多传感器遥测数据(电流、电压、温度、湿度、振动)进行处理。该框架可输出确定性的二值伪标签以及高精度的实时诊断状态,用于工况监测。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
利用无监督结构聚类、基于隔离的异常检测以及物理信息驱动的风险映射方法,对来自伺服电机的多传感器遥测数据(电流、电压、温度、湿度、振动)进行处理。该框架可输出确定性的二值伪标签以及高精度的实时诊断状态,用于工况监测。
随着预测性维护从工业4.0的数据中心范式转向工业5.0的可持续、以人为本的框架,伺服电机状态诊断面临数据稀缺和标注故障样本严重不足的双重挑战。为解决这一冷启动问题,我们提出一种伪监督机器学习框架,并在一个自定义的五通道数据集上进行评估,该数据集包含199个伺服电机遥测样本(电流、电压、温度、湿度和振动)。该方法结合硬性结构划分(k均值聚类)与软性后验置信度估计(高斯混合模型),在无需先验标注的情况下刻画运行模式。同时,通过孤立森林模型量化异常强度,并建立基于动态分位数的阈值。本研究的一项关键创新是基于工程先验知识构建的确定性风险映射机制;该机制通过逆向加权传感器的物理安全裕度来定义“高风险”(异常)状态,从而将无监督聚类结果严格映射为二元伪标签。这些伪标签随后用于监督下游分类器(随机森林和支持向量机)。最终的在线诊断输出由分类器概率与GMM后验概率在异常阈值门控下的评分级融合结果构成。定量评估表明,随机森林模型达到了完美的F1分数1.000,而对比的支持向量机模型F1分数为0.997,证明该框架是一种稳健、可解释且高度准确的冷启动工业健康监测解决方案。
伺服电机控制系统的可靠性历来是工业自动化领域的一项关键性能指标。随着预测性维护从工业4.0的数据中心范式逐步演进至工业5.0的可持续、以人为本的框架,系统不仅需确保高精度,还需积极提升能效与运行韧性1,2,3。在恶劣环境下长期运行过程中发生的故障可能导致设备严重停机、结构损坏以及重大经济损失4,5,6。因此,对早期微小故障的诊断已从可选功能转变为基本需求。为实现可靠的运行状态评估,现代工业系统日益依赖多传感器技术。通过同步采集多种信号模态——如电流、电压、温度和振动信号,工程人员能够构建关于电机健康状态的全面、高维表征7,8。相比单传感器方法,多源传感器数据的融合显著提升了诊断系统的鲁棒性与准确性9,10。
尽管传感器融合和机器学习技术已取得进展,但在实际应用中仍存在一个关键瓶颈:即"冷启动"问题。在典型的生产环境中,机器在其整个生命周期中绝大多数时间都处于正常运行状态,导致类别极度不平衡,即健康样本的数量远超故障样本。标准的监督式深度学习模型需要大规模、类别均衡且标注精确的数据集才能有效收敛11,12。当标签完全不可获得或获取成本过高时,这些监督学习范式便无法适用13。因此,本研究旨在解决的核心问题是:在无需手动标注训练数据的前提下,将未标注的多传感器电机数据转化为可靠、二元的诊断预警信号。
针对数据稀缺的挑战,近期研究已转向无监督异常检测技术。常用方法包括一类支持向量机(OC-SVM)、深度自编码器以及基于直接隔离的异常评分方法14。尽管这些方法能够有效标记统计偏差,但将其直接应用于电机故障诊断时仍存在显著局限性。OC-SVM 对动态工业负载的非平稳特性极为敏感,常导致较高的假阳性率。自编码器虽然在最小化重构误差方面表现强大15,但其运作如同不可解释的黑箱,难以将数学上的重构损失转化为可操作的具体物理故障类别16。此外,诸如标准隔离森林等直接异常评分方法17,仅能指出某个样本在统计上属于离群点,却无法在工程实际所定义的"正常运行"与"故障"状态之间建立确定性的决策边界。本质上,这些方法缺乏将无监督数据聚类映射到明确诊断标签所需的语义桥梁。
为弥合这一方法学上的差距,本研究提出了一种统一的伪监督机器学习框架。所提出工作流程的设计逻辑与独立的异常检测器有根本性差异。该流程并非依赖单一的全局重构误差或边界,而是首先通过无监督的硬-软聚类方法(k均值和高斯混合模型)对多传感器特征空间进行划分,以识别出不同的运行模式。随后,不是分配任意标签,而是基于既定的工程先验知识(即振动和温度的物理安全裕度)构建一个确定性的风险映射函数。这种物理映射作为启发式锚点,自动为无监督聚类结果分配二元伪标签("正常运行"或"故障")。这些基于物理信息的伪标签随后被用于训练有监督分类器(随机森林和支持向量机),以学习复杂的非线性边界。同时,孤立森林作为独立的异常门控机制,用于过滤不符合任何已知聚类模式的极端离群点。该联合流程具有显著优势,因为它在保持无监督聚类无需标签自主性的同时,充分利用了有监督学习的判别能力。
本研究的主要科学目标是开发一种能够在严格冷启动约束条件下运行的自动化状态监测系统。我们明确检验了以下假设:将无监督的结构聚类与基于工程先验的伪标签机制相结合,能够生成具有诊断性能的有监督分类边界,其性能可媲美在人工标注数据上训练的模型。通过对一个自定义的多传感器伺服电机数据集验证该半监督框架,本研究表明,将经典特征可解释性与异常门控机制相结合,可在无需标注训练数据的情况下实现高精度的故障分类,从而减轻现场工程师的认知负担,并推动工业5.0的协作理念发展。
访问受限。请登录或开始试用以查看此内容。
1. 实验设置与数据预处理
注意:本研究中提出的数据处理与建模框架是通过高级编程语言编写的自定义脚本实现的,利用了用于数值计算和机器学习的标准开源库。实验验证在一台配备多核处理器和独立图形处理单元(GPU)的高性能计算工作站上进行。所有软件环境、计算硬件及传感器组件的具体细节均在材料表中提供。所提出框架的示意图概述展示了从离线无监督学习到在线双阈值决策过程的数据流,如图1所示。该数据集包含203个聚合的时间窗样本,而非瞬时原始读数,这些样本是在伺服电机在不同负载条件下运行时采集的,以模拟真实车间环境。
,以消除对基于距离的结构学习算法至关重要的量纲差异:
(1)
来实现(图5),并不作为下游模型的输入。2. 无监督结构学习
(2)
(3)
。
后,计算每个样本的后验概率
,并提取最大后验概率作为软置信度指标:
(4)3. 异常建模与动态阈值设定
(5)
,其中 α 作为遗忘因子,Ylocal 是从当前运行窗口中推导出的分位数。4. 通过风险映射生成伪标签
(6)
的安全裕度倒数:
(7)
),来确认这些初始化权重的有效性。
。
。
(8)5. 监督分类器训练与在线融合
合成融合得分s(z):
(9)
且
时,状态被分类为“工作”状态。
(. 
访问受限。请登录或开始试用以查看此内容。
所提出的框架通过一个自采集的多传感器数据集进行了验证。在移除不完整的记录后,最终数据集包含199个有效的聚合时间窗样本。系统环境和算法参数详见表1。
特征相关性与数据集构成
为在建模前评估传感器通道之间的冗余性与互补性,进行了特征相关性分析。如皮尔逊相关性热图(图2)所示,各通道间总体呈现较弱的相关性(例如电流与电压的相关系数为-0.06),唯一较显著的正相关(约0.22)存在于温度与振动之间。这表明所选传感器提供了多样且互补的物理信号,有效降低了多重共线性的风险。关于数据集构成,无监督的结构划分根据运行状态的差异性将199个样本进行了自然分割。在执行k均值聚类后,数据集由105个被分配至基线运行簇的样本和94个被分配至互补簇的样本组成。通过后续的风险映射,这94个样本被确定性地标记为“高风险”(故障)类别,用于有监督训练,从而保持了相对均衡的类别分布,有利于构建稳健的机器学习模型。
访问受限。请登录或开始试用以查看此内容。
本方案提出了一种在冷启动场景下对电机状态进行识别的稳健方法,适用于无标注数据的情况。通过将无监督结构学习与伪监督分类相结合,该方法克服了传统监督学习严重依赖人工标注的局限性13,18,19。本方案中的关键步骤之一是聚类数量(K)的选择。尽管肘部法则和轮廓系数法(图3 和 图4)在本数据集中明确指示 K = 2,但实际数据可能表现出较不清晰的边界20。当最优 K 值不明确时,建议检查高斯混合模型(GMM)的后验概率;若多个样本的不确定性较高(pgmm 较低),则表明聚类数量可能需要调整,或当前特征空间中数据不可分17。另一个关键参数是风险映射中权重的定义(步骤 4.1)。若权重定义不当(例如,对噪声大...
访问受限。请登录或开始试用以查看此内容。
作者无任何利益冲突需要披露。
感谢湖北水利水电职业技术学院提供实验平台和计算资源。本工作得到工业自动化部门研究基金的支持。我们还感谢实验室工作人员在数据采集和传感器校准方面提供的协助。
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| 类别 | 组件及版本 | ||
| 操作系统 | Windows 11 Professional 23H2 | ||
| 处理器 | Intel Core i9-14900HX | ||
| 内存 | 32 GB | ||
| 图形处理器 | NVIDIA GeForce RTX 4070 Laptop GPU (8 GB) | ||
| Python | 3.12 | ||
| NumPy | 1.26 | ||
| pandas | 2.2 | ||
| scikit-learn | 1.5 | ||
| Matplotlib | 3.8 | ||
| Seaborn | 0.13 | ||
| 随机种子 |
访问受限。请登录或开始试用以查看此内容。