Представленная система киберфизического взаимодействия с интеграцией объяснимого ИИ была экспериментально протестирована на примерно 12 000 аудиозаписях из набора данных MIMII, содержащего записи как нормальных, так и аномальных состояний оборудования. Обучающий набор данных состоял примерно из 9 600 записей, в то время как тестовый набор включал около 2 400 аудиообразцов. Согласно полученным результатам, предложенная модель CNN-transformer достигла точности классификации 98,5% на тестовом наборе данных (0,97–0,98). Это соотносится с данными, представленными в Table 3, матрицей ошибок и анализом статистической стабильности. Интеграция трансформерного кодировщика расширяет возможности временного моделирования архитектуры, в то время как CNN извлекает дискриминативные пространственные признаки из входной спектрограммы.
Помимо эффективности классификации, оценивались и другие характеристики системы. Во-первых, задержка вывода для реализации на граничных устройствах не превышала 20 ms, что обеспечивало обнаружение аномалий в режиме реального времени. Во-вторых, представленная система позволила повысить энергоэффективность за счет снижения требований к связи. Наконец, предложенная архитектура объяснимого ИИ (Explainable AI) обеспечивает интерпретируемость с помощью SHAP, что облегчает анализ модели с точки зрения эксперта в данной области. Данные MIMII были преобразованы в спектрограммы с помощью кратковременного преобразования Фурье (STFT) с размером окна 1024, шагом сдвига (hop size) 512 и размером быстрого преобразования Фурье (FFT) 1024. Полученные логарифмические Mel-спектрограммы были приведены к размеру 224 × 224 пикселей, а затем подвергнуты z-score нормализации. Для повышения робастности обученной модели использовались методы аугментации данных, включая временное маскирование, частотное маскирование и добавление гауссовского шума. Архитектура CNN состояла из четырех сверточных слоев с 32, 64, 128 и 256 фильтрами соответственно и включала слои пакетной нормализации, ReLU и max pooling. Извлеченные карты признаков были преобразованы в последовательности и использованы в качестве входных данных для трансформерного кодировщика, который состоял из четырех слоев кодировщика, восьми голов внимания, эмбеддинга размерностью 256 и полносвязного слоя размерностью 1024. Для минимизации переобучения применялась вероятность dropout 0,3. Для обучения использовался оптимизатор Adam со скоростью обучения 0,0001 и весовым затуханием (weight decay) 1 x 10⁻5. Количество эпох и размер пакета при обучении составили 100 и 32 соответственно. Для обеспечения воспроизводимости экспериментов случайное число (random seed) было установлено равным 42. Для проверки статистической значимости результатов использовались следующие методы: все эксперименты запускались независимо 10 раз с разными значениями random seed и разной перетасовкой данных. Были рассчитаны средние значения и стандартные отклонения Accuracy, Precision, Recall, F1-score, площади под ROC-кривой (ROC-AUC) и площади под кривой точности-полноты (PR-AUC). Кроме того, были рассчитаны 95% доверительные интервалы для оценки неопределенности производительности. Наконец, был проведен парный t-критерий для сравнения результатов нашего подхода на основе CNN-transformer с лучшей базовой моделью. Метод ранней остановки применялся с параметром терпения (patience) в 10 эпох. В Таблице 4 представлены параметры окружения и конфигурация гиперпараметров, а в Таблице 5 приведены подробные сведения о симуляционной среде.
Эксперимент по оценке в данной работе был проведен с использованием набора данных MIMII, который включает различные условия работы оборудования и сценарии акустических неисправностей. Хотя результаты предложенной структуры подтверждают эффективность модели, необходима дальнейшая валидация на различных промышленных наборах данных и в условиях реального производства.
Предложенная структура была реализована на платформе граничных вычислений, оснащенной многоядерным процессором, системной памятью объемом 16 GB и граничным ускорителем с графическим процессором (GPU) для обеспечения логического вывода и объяснимости в режиме реального времени. Промышленные акустические датчики передавали аудиопотоки на граничный шлюз через коммуникационный слой IIoT. Граничные узлы использовались для выполнения таких задач, как создание спектрограмм, вывод аномалий и генерация объяснений SHAP, в то время как облачный сервер применялся для долгосрочного хранения данных и обновления модели. Такая конфигурация не только сокращает объем необходимых коммуникаций, но и обеспечивает взаимодействие в режиме реального времени между сенсорными устройствами, модулями ИИ и операторами-людьми в киберфизических системах.
Представленный выше подход на основе CNN-трансформера сравнивается с несколькими существующими методами, включая традиционные модели машинного обучения (ML), такие как метод опорных векторов (SVM) и случайный лес, модели CNN без трансформера, а также методы на основе долгой краткосрочной памяти (LSTM). В то время как традиционные модели ML не достигают удовлетворительных результатов из-за недостаточной способности обрабатывать пространственные и временные корреляции в данных, модели CNN могут эффективно обрабатывать пространственные признаки, а модели LSTM — временные аспекты акустических сигналов. Тем не менее, первые уступают последним с точки зрения вычислительных затрат и возможностей параллельной обработки.
Для обеспечения объективного сравнения предлагаемой модели CNN-transformer с базовыми моделями, первая была обучена и протестирована с использованием того же разделения набора данных MIMII (80% для обучения и 20% для тестирования), тех же этапов предварительной обработки, процесса создания спектрограмм и показателей оценки. В методе SVM использовалось ядро радиально-базисной функции (RBF) с параметрами C = 10 и γ = 0.01. Метод случайного леса (random forest) включал 200 деревьев с максимальной глубиной дерева 20. Что касается CNN, она состояла из четырех сверточных слоев (32, 64, 128 и 256 фильтров), за которыми следовали полносвязные слои без модуля Transformer. Наконец, в методе LSTM использовались два стековых слоя LSTM со 128 скрытыми блоками и коэффициентом dropout 0,3.
Напротив, использование структуры CNN-transformer позволяет достичь наилучших результатов за счет эффективного использования как пространственных, так и временных характеристик акустических сигналов. Кроме того, применение граничных вычислений позволяет снизить вычислительные затраты, уменьшить задержку и сэкономить энергию. Дополнительно, интерпретируемость прогнозов, реализованная с помощью SHAP, может рассматриваться как еще одно преимущество, которое отличает предлагаемый метод от существующих подходов.
Несмотря на недавние достижения в разработке новых моделей для обнаружения акустических аномалий, таких как Vision Transformer (ViT), Audio Spectrogram Transformer (AST), Conformer и модели на основе самообучения (self-supervised learning), экспериментальное сравнение этих архитектур в настоящем исследовании не проводилось. В будущем планируется использовать данные модели в качестве эталонов для оценки предлагаемой структуры.
Для оценки эффективности предлагаемой модели используются такие метрики, как точность (accuracy), прецизионность (precision), полнота (recall) и F1-мера (F1-score). В то время как прецизионность определяет отношение истинно положительных результатов к общему количеству истинно положительных и ложноположительных результатов, точность оценивает общую правильность прогнозов. Полнота дает представление о способности модели предсказывать аномалии в конкретной системе. Это имеет решающее значение, так как неспособность предсказать дефект может привести к сбоям в работе системы. Ниже приведен математический способ расчета этих метрик:
(25)
(26)
(27)
(28)
Помимо этого, при оценке реальной эффективности предлагаемой модели CPS на базе граничных вычислений рассматриваются дополнительные показатели производительности системы, такие как задержка, энергопотребление и масштабируемость.
Помимо стандартных методов измерения производительности, существует множество других показателей, которые могут помочь оценить предлагаемое решение с более целостной точки зрения, особенно учитывая его применимость к реальным примерам с несбалансированными данными и потоковыми данными. Например, способность алгоритма различать две группы на основе различных пороговых значений измеряется площадью под кривой рабочих характеристик приемника (ROC-AUC). Учитывая устойчивость и разделимость, значение ROC-AUC должно быть высоким. Кроме того, метрика площади под кривой точности-полноты (PR-AUC) имеет важное значение для исследования по обнаружению аномалий, поскольку аномальные классы встречаются редко.
Важным показателем, который следует учитывать, является коэффициент корреляции Мэтьюза (MCC). Он учитывает все четыре элемента матрицы ошибок и обеспечивает точную оценку даже при наличии дисбаланса классов. Этот показатель рассчитывается следующим образом:
(29)
Значения MCC варьируются от -1 до +1, где +1 указывает на идеальное прогнозирование. Другим показателем, который можно было бы применить, является специфичность (доля истинно отрицательных результатов), которая была бы полезна в промышленном применении для оценки наличия ложноположительных прогнозов:
(30)
Чтобы убедиться в отсутствии несоответствий между матрицей ошибок и показателями эффективности, все критерии оценки были вычислены на основе окончательного тестового набора данных. В следующих уравнениях используются обозначения истинно-положительных (TP), истинно-отрицательных (TN), ложноположительных (FP) и ложноотрицательных (FN) результатов. Точность (Accuracy), прецизионность (Precision), полнота (Recall), специфичность (Specificity), F1-мера (F1-score) и коэффициент корреляции Мэтьюса (MCC) были рассчитаны согласно уравнениям (25)–(30). Кроме того, значения ROC-AUC и PR-AUC были вычислены на основе вероятностных выходов модели CNN-transformer с помощью оценки независимых порогов.
К ключевым показателям на системном уровне относятся задержка, пропускная способность и вычислительные затраты. Задержка — это время, необходимое для получения прогноза. Пропускная способность представляет собой количество образцов данных, обрабатываемых в секунду. Вычислительные затраты, отражающие энергоэффективность, важны для обеспечения общей вычислительной эффективности. Кроме того, при оценке модели могут быть рассмотрены показатели интерпретируемости, такие как согласованность SHAP и стабильность значимости признаков.
Из результатов в Таблица 3 для набора данных MIMII предложенная модель CNN-transformer превосходит все остальные методы машинного и глубокого обучения. Эффективность моделей SVM и случайного леса приемлема, хотя и ограничена: точность составила 88,6% и 91,2% соответственно. Это может быть объяснено неспособностью данных моделей извлекать сложные временные и пространственные признаки из акустических сигналов. В то же время LSTM превосходит SVM и случайный лес, достигая точности 94,5% за счет моделирования данных временных рядов. Тем не менее, предложенный подход CNN-transformer демонстрирует наилучшие результаты с повышенными показателями точности (98,5%), прецизионности (98,06%), полноты (99,02%) и F1-меры (98,54%). Таким образом, предложенный алгоритм позволяет точно классифицировать нормальные и аномальные состояния оборудования. Повышенная специфичность (97,96%) свидетельствует об эффективности данного подхода в снижении количества ложноположительных результатов, что имеет решающее значение для промышленности. Следует отметить, что высокая эффективность CNN-transformer объясняется сочетанием CNN и Transformer, где первый извлекает дискриминантные признаки, а второй улавливает временные зависимости в длинных последовательностях.
ROC-кривая на рисунке 6 демонстрирует сравнительную эффективность подходов SVM, случайного леса, LSTM и предложенного CNN-трансформера с точки зрения их способности к классификации данных набора MIMII. Как показано на рисунке 6, наибольшее значение площади под кривой (AUC) наблюдалось для предложенного CNN-трансформера и составило 0,994. Очевидно, что предложенный метод обеспечивает лучшую дискриминационную способность для разграничения нормальных и аномальных категорий. С другой стороны, LSTM дает несколько более низкие результаты, чем предложенный подход на основе CNN-трансформера; его AUC составляет около 0,97. Случайный лес и SVM имеют относительно низкие значения AUC, около 0,958 и 0,913 соответственно. Это объясняется неспособностью обоих подходов извлекать сложные акустические паттерны из представленных данных.
При обнаружении аномалий, когда количество отклоняющихся образцов невелико, кривая точности-полноты (PR-кривая) обеспечивает более качественный анализ. На PR-кривой модель CNN-transformer достигает наивысшего значения средней точности (AP), примерно 0,97–0,98, что указывает на превосходную способность обнаруживать аномальные случаи с меньшим количеством ложных срабатываний, как показано на рисунке 7. Напротив, классификатор LSTM занимает второе место со значением AP в диапазоне от 0,92 до 0,94. В свою очередь, классификаторы случайного леса (random forest) и SVM занимают третье и четвертое места соответственно, с AP 0,88 и 0,84. Предложенный гибридный классификатор обеспечивает более высокую точность на всех уровнях полноты, что важно для практического промышленного применения, где требуются как высокая точность, так и низкий уровень ложных срабатываний.
Модель CNN-transformer была сравнена с существующими моделями на наборе данных MIMII с использованием расширенных показателей эффективности, представленных в Таблице 6. Значение ROC-AUC указывает на способность модели различать два класса при различных порогах. Классификаторы SVM и случайный лес (random forest) достигают значений ROC-AUC 0,913 и 0,958 соответственно, в то время как модель LSTM достигает ROC-AUC 0,970, а CNN — 0,98. Предложенная архитектура CNN-transformer достигает наивысшего значения ROC-AUC 0,994, демонстрируя превосходную разделительную способность между нормальным и аномальным состоянием оборудования. Аналогично, значения PR-AUC показывают, что предложенная модель может эффективно справляться с дисбалансом классов, что является важным фактором при обнаружении аномалий. Предложенная модель CNN-transformer достигает наивысшего значения PR-AUC (средняя точность) 0,982, за ней следуют CNN (0,950), LSTM (0,912), случайный лес (0,891) и SVM (0,765), что свидетельствует о превосходных характеристиках точности и полноты при обнаружении акустических аномалий в промышленности. Кроме того, коэффициент корреляции Мэтьюса (MCC), который измеряет сбалансированность работы модели, для предложенной модели имеет относительно высокое значение 0,97. Однако более ранние методы, такие как SVM (0,73) и случайный лес (0,78), имели более низкую прогностическую точность.
Для проверки стабильности представленного подхода тот же эксперимент был проведен 10 раз с использованием различных начальных значений (seeds) и схем перемешивания данных. Результаты для архитектуры CNN-transformer, приведенные в Таблице 7, были следующими: accuracy = 98.50% ± 0.19%, precision = 98.06% ± 0.23%, recall = 99.02% ± 0.22% и F1-score = 98.54% ± 0.24%. Относительно небольшое стандартное отклонение указывает на стабильность модели. Для всех показателей оценки были рассчитаны 95% доверительные интервалы. Было установлено, что доверительный интервал для метрики accuracy составил [98.1%, 98.9%], что свидетельствует о стабильно высоких результатах работы модели. Узкие доверительные интервалы также были определены для ROC-AUC, PR-AUC и MCC. Парный t-критерий при сравнении предлагаемой модели CNN-transformer и наилучшей базовой модели (LSTM) дал значение p < 0.05, что указывает на значимость наблюдаемого прироста производительности, который не является случайным.
Для проверки устойчивости предложенной архитектуры CNN-transformer эксперименты повторяли 10 раз с использованием различных случайных начальных значений (seeds) и конфигураций перемешивания, как показано на Рисунке 8. Средние значения точности (accuracy), прецизионности (precision), полноты (recall) и F1-меры, полученные моделью, составили 98.50% ± 0.19%, 98.06% ± 0.23%, 99.02% ± 0.22% и 98.54% ± 0.24% соответственно. Анализ диаграммы размаха показал минимальные колебания метрик эффективности модели, что свидетельствует о ее стабильности и устойчивости. Таким образом, предложенный подход демонстрирует высокую стабильность в нескольких экспериментах без значительных отклонений, что указывает на хорошие обобщающие способности модели.
Кроме того, на основе результатов многократных повторений эксперимента был проведен статистический тест. Малые стандартные отклонения по всем показателям оценки свидетельствуют о низкой чувствительности к изменениям в рандомизации или обучении. Это подтверждает, что предлагаемая модель CNN-transformer может обеспечивать стабильную и согласованную работу в реальных киберфизических производственных системах.
Тепловая карта SHAP позволяет оценить значимость частотно-временных областей спектрограммы при прогнозировании того, является ли состояние оборудования нормальным или аномальным. Значения SHAP указывают на вклад каждого предиктора в итоговый прогноз.
На тепловой карте значений SHAP, представленной на рисунке 9A, положительные значения SHAP (например, от +0,6 до +1,2) обозначают вклад в определение аномалии, тогда как отрицательные значения SHAP (т. е. от −0,3 до −0,8) указывают на вклад в категорию нормы. Наиболее интенсивный показатель SHAP был обнаружен в диапазоне средних частот (40–80 частотных интервалов) во временных кадрах 50–100. Эти области являются ключевыми зонами, в которых при акустических измерениях обнаруживаются критические сигналы неисправности. Кроме того, в низкочастотном диапазоне (менее 20 интервалов) значения SHAP близки к нулю (−0,1... +0,1), что указывает на незначительное влияние на принятие решений моделью. Это свидетельствует о том, что модель игнорирует фоновый шум, не имеющий отношения к прогнозированию неисправностей. Временная согласованность высоких показателей SHAP в определенных временных полосах также подчеркивает способность модуля Transformer улавливать дальние зависимости в акустических сигналах. Таким образом, тепловая карта SHAP наглядно демонстрирует, что модель CNN-transformer фокусируется на уникальных частотно-временных полосах с высокой дискриминационной способностью. Это повышает интерпретируемость модели и помогает оператору визуально обнаруживать неисправности.
Показано, что метод SHAP используется исключительно в качестве инструмента интерпретируемости и не является частью процесса обучения модели CNN-transformer. Точность классификации определяется исключительно параметрами, изученными компонентами CNN и Transformer. SHAP применяется после этапа логического вывода модели для интерпретации прогнозов путем выявления наиболее влиятельных временно-частотных окон, которые определяют отнесение прогнозов к нормальной или аномальной категориям. Таким образом, SHAP повышает прозрачность и понимание для человека, не влияя на точность классификации. Значения SHAP, предоставляемые предлагаемой структурой, обеспечивают четкую визуализацию, которая поможет операторам по техническому обслуживанию проверить прогнозы модели, сравнивая обнаруженные области с фактическим поведением оборудования и записями о техобслуживании. Таким образом, взаимодействие людей с машинами в процессе предиктивного технического обслуживания станет более эффективным.
Для оценки уровня объяснимости был проведен глобальный анализ важности признаков с помощью SHAP, как показано на рисунке 9B. Результаты демонстрируют, что некоторые среднечастотные компоненты играют значительную роль в обнаружении аномалий. Более того, тематическое исследование, представленное на рисунке 9C, показывает, что SHAP правильно идентифицирует области, связанные с неисправностями, на спектрограммах оборудования с аномалиями. Исследование включало качественный анализ с использованием образцов данных об аномалиях в работе насосов и клапанов из набора данных MIMII. В случае неисправных насосов SHAP выявил частотные диапазоны 2–4 kHz, связанные с кавитацией и износом. В случае неисправных клапанов активация SHAP была доминирующей в областях с повторяющимися гармоническими сигналами, указывающими на утечку. На репрезентативных тестовых образцах визуализации SHAP надежно определили дискриминационные временно-частотные зоны, соответствующие аномальным состояниям оборудования. Выделяя спектральные области, которые вносят наиболее значительный вклад в каждое предсказание, данные пояснения проясняют принципы принятия решений моделью. Анализ SHAP предлагается в качестве инструмента интерпретируемости для понимания поведения модели, а не как верификация неисправностей, подтвержденная экспертами, поскольку формальная валидация специалистами по техническому обслуживанию находилась за рамками данного исследования.
Матрица ошибок демонстрирует эффективность классификации с помощью предлагаемой модели CNN-transformer на наборе данных MIMII, показанном на Рисунке 10. В целом, 960 нормальных образцов были верно идентифицированы как нормальные (истинно отрицательные результаты), в то время как 20 нормальных образцов были ошибочно определены как аномальные (ложноположительные результаты). Кроме того, из всех образцов 1010 аномальных образцов были определены как таковые (истинно положительные результаты), а 10 аномальных образцов были идентифицированы как нормальные (ложноотрицательные результаты).
Таким образом, была достигнута высокая эффективность детектирования, особенно для аномальных образцов, которые имеют решающее значение для предиктивного технического обслуживания. Как показано на рисунке 10, ложноотрицательные ошибки наблюдаются крайне редко (10 образцов), что жизненно важно для обеспечения безопасности и надежности в любой отрасли промышленности. С другой стороны, ложноположительные ошибки (20 образцов) встречаются несколько чаще, но остаются на относительно низком уровне. Матрица путаницы, представленная на рисунке 10, была построена с использованием сбалансированного подмножества из 2 000 тестовых записей (равное количество нормальных и аномальных образцов) для наглядной визуализации работы классификатора. Все представленные метрики оценки, включая точность (accuracy), прецизионность (precision), полноту (recall), специфичность (specificity) и F1-меру, были рассчитаны с использованием полного тестового набора (приблизительно 2 400 записей).
С учетом матрицы ошибок, представленной на Рисунок 10 и в Таблица 8 (TN = 960, FP = 20, TP = 1010, FN = 10), можно провести следующие расчеты: точность (Accuracy) = (TP + TN) / (TP + TN + FP + FN) = 98,50%, прецизионность (Precision) = TP/(TP + FP) = 98,06%, полнота (Recall) = TP/(TP + FN) = 99,02%, специфичность (Specificity) = TN / (TN + FP) = 97,96%, F1-мера (F1-score) = 98,54% и коэффициент корреляции Мэтьюза (MCC) = 0,97. Кроме того, значения ROC-AUC и PR-AUC составили 0,994 и 0,982 соответственно. Матрица ошибок, представленная на Рисунок 10 было создано с использованием сбалансированного репрезентативного подмножества из 2000 записей из тестовых данных исключительно для целей визуализации. Все количественные показатели эффективности, представленные в данном исследовании, были рассчитаны с использованием полного тестового набора (приблизительно 2400 записей). В целом результаты демонстрируют, что предлагаемая архитектура CNN-transformer обеспечивает точность классификации 98,5%, что согласуется с результатами, представленными в Таблица 8 и анализ абляции.
Для подтверждения эффективности реализации на базе периферийных устройств были проведены дополнительные измерения. Средняя задержка вывода предложенной модели составляет 18,7 ms/sample, и она способна обрабатывать примерно 53 образца в секунду, как показано в Таблице 9. Энергопотребление во время вывода составило 8,9 W, что дает расчетный расход энергии 0,167 J/prediction. Для оценки влияния предлагаемого подхода на экологическую устойчивость в Таблице 10 были рассмотрены накладные расходы на связь, энергопотребление и использование ресурсов. Поскольку процесс вывода происходит локально на периферийных узлах, в облачную среду передаются только сводные диагностические данные. Результаты экспериментов показали снижение объема передаваемых данных на 73% по сравнению с традиционными киберфизическими системами (CPS) на базе облачных вычислений. Кроме того, локальный вывод позволил снизить энергопотребление на 32%, а время связи сократилось с 75 ms до 20 ms.
Абляционное исследование
Набор данных MIMII подвергается абляционному исследованию для оценки влияния каждого компонента архитектуры CPHS на основе объяснимого ИИ. Данный абляционный анализ изучает эффекты от использования CNN для извлечения пространственных признаков, трансформерного кодировщика для извлечения временных признаков, а также самого алгоритма объяснимости SHAP. Рассматриваются несколько модификаций предложенной модели, а именно: (i) версия только с CNN, (ii) версия только с Transformer, (iii) модель с комбинацией CNN и Transformer, но без алгоритма SHAP, и (iv) полная предложенная модель с комбинацией CNN и Transformer совместно с SHAP. Для оценки используются общепринятые метрики, такие как точность (accuracy), прецизионность (precision), полнота (recall) и F1-мера (F1-score).
Результаты данного исследования по абляции демонстрируют значимость каждого элемента структуры, описанной в Таблице 11. Модель, состоящая только из CNN, достигает точности 93,8%, что указывает на эффективность извлечения пространственных признаков из спектрограмм, однако она не способна улавливать временные зависимости в акустических сигналах. То же самое относится к модели, состоящей только из Transformer, точность которой несколько ниже (92,6%), поскольку она извлекает временные признаки, игнорируя пространственную информацию. Наконец, предложенная модель CNN-transformer достигла точности 98,5%, прецизионности 98,06%, полноты 99,02% и значения F1-меры 98,54%, что соответствует результатам основного эксперимента. Поскольку SHAP используется только для апостериорной интерпретации, а не для обучения модели, точность классификации совпадает с точностью обученной модели CNN-transformer. Затем SHAP используется для создания объяснений атрибуции признаков. Повышенная полнота (99,02%) указывает на то, что модель эффективно обнаруживает неисправности в машинах, гарантируя, что ни одна поврежденная деталь не будет пропущена, что крайне важно для внедрения системы предиктивного технического обслуживания.
ДОСТУПНОСТЬ ДАННЫХ:
Набор данных Malfunctioning Industrial Machine Investigation and Inspection (MIMII), использованный в данном исследовании, общедоступен в официальном репозитории Zenodo. Эксперименты проводились с использованием общедоступных аудиозаписей и аннотаций, предоставленных авторами набора данных. Доступ к набору данных можно получить по адресу https://zenodo.org/records/3384388. Код реализации, сопровождающий данную работу, общедоступен в репозитории Zenodo по адресу https://zenodo.org/records/21405292. Репозиторий содержит код реализации предлагаемого фреймворка, включая конвейер предварительной обработки данных, архитектуру модели, рабочий процесс обучения, скрипты оценки, конфигурационные файлы и вспомогательные утилиты для облегчения понимания и независимого воспроизведения предлагаемой методологии. Набор данных MIMII не распространяется вместе с кодом реализации и должен быть получен отдельно из официального репозитория.

Рисунок 1: Архитектура предлагаемой работы. Архитектурный проект объяснимой киберфизической системы с участием человека на базе ИИ, объединяющей предобработку, пространственное обучение на основе CNN, временное моделирование на базе трансформеров, объяснимость с помощью SHAP и граничные вычисления для устойчивого производства. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Схема предобработки. Конвейер предобработки акустического сигнала, включающий удаление шума, нормализацию, сегментацию, преобразование STFT и извлечение спектрограмм. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Извлечение пространственных признаков с помощью CNN. Архитектура извлечения пространственных признаков с помощью сверточных нейронных сетей (CNN) на основе спектрограмм посредством процессов свертки, активации и пулинга. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Временное моделирование с использованием трансформерного кодировщика. Архитектура трансформерного кодировщика для захвата временных и долгосрочных зависимостей посредством представления последовательности спектрограмм. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Слой классификации. Слой классификатора, который отображает закодированные временные признаки на значения вероятности для прогнозирования состояния оборудования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Результат ROC-кривой. Сравнение ROC-кривых для алгоритмов SVM, случайного леса (random forest), LSTM, CNN и предлагаемого CNN-трансформера на наборе данных MIMII. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Результат построения кривой точности-полноты. Сравнение кривых точности-полноты, отражающее эффективность обнаружения аномалий различными методами машинного и глубокого обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Анализ стабильности производительности при многократных запусках. Диаграмма размаха, демонстрирующая стабильность показателей точности (Accuracy), прецизионности (Precision), полноты (Recall) и F1-меры, полученных в десяти независимых экспериментах с использованием предложенной архитектуры CNN-transformer. Незначительные отклонения свидетельствуют о стабильности и устойчивости модели. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9: Анализ интерпретируемости на основе SHAP для предлагаемой структуры обнаружения аномалий. (A) Анализ интерпретируемости на основе SHAP. Тепловая карта с использованием метода SHAP, демонстрирующая наиболее значимые временно-частотные зоны, которые приводят к идентификации аномального поведения. (B) Анализ важности признаков с использованием глобального подхода SHAP для идентификации наиболее влиятельных признаков. (C) Визуализация интерпретируемости SHAP для неисправного оборудования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 10: Матрица ошибок для набора данных MIMII. Матрица ошибок отражает эффективность классификации предложенного алгоритма CNN-transformer. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
| Параметр | Описание |
| Название набора данных | Набор данных MIMII (Malfunctioning Industrial Machine Investigation and Inspection) |
| Типы оборудования | Клапаны, насосы, вентиляторы, направляющие салазки |
| Общее количество использованных образцов | Приблизительно 12 000 аудиозаписей |
| Классы | Норма, Патология |
| Частота дискретизации | 16 кГц |
| Длительность обработки одного образца | 10 секунд |
| Формат аудио | WAV |
| Представление признаков | Спекторограммы на основе оконного преобразования Фурье (STFT) |
| Этапы предварительной обработки | Фильтрация шума, нормализация, сегментация, преобразование STFT |
| Назначение меток | Записи с нормой обозначены как Класс 0; записи с отклонениями обозначены как Класс 1 согласно аннотациям MIMII |
| Разделение на обучающую и тестовую выборки | 80% Обучающая выборка (≈9 600 образцов), 20% тестирование (≈2 400 образцов) |
| Стратегия разделения данных | Разделение на уровне аудиофайлов, выполненное перед сегментацией для предотвращения утечки данных |
| Условия промышленного шума | Реалистичные промышленные акустические среды, представленные в записях MIMII |
| Область применения | Прогностическое техническое обслуживание и обнаружение аномалий в работе оборудования |
| Цель в рамках концепции Индустрии 5.0 | Объяснимое, человекоцентричное и устойчивое обнаружение неисправностей |
Таблица 1: Описание набора данных. Описание набора данных MIMII с точки зрения типа оборудования, распределения выборок, характеристик сигналов, представления признаков и аспектов применения.
| Тип оборудования | Идентификаторы оборудования | Нормальные записи | Аномальные записи | Условия ОСШ (дБ) | Экспериментальное разделение |
| Вентилятор | ID00–ID06 | 8,400 | 1,600 | от −12 до −9 | 80% — обучение / 20% — тестирование |
| Редуктор | ID00–ID06 | 7,124 | 1,147 | от −17 до −15 | 80% обучение / 20% тестирование |
| Насос | ID00–ID06 | 7,200 | 1,800 | от −18 до −9 | 80% — обучение / 20% — тестирование |
| Направляющая рельса | ID00–ID05 | 7,000 | 1,800 | от −14 до −12 | 80% — обучение / 20% — тестирование |
| Клапан | ID00–ID05 | 7,000 | 1,800 | от −12 до −9 | 80% для обучения / 20% для тестирования |
Таблица 2: Описание набора данных MIMII, использованного в данном исследовании. Типы промышленного оборудования, идентификаторы машин, количество нормальных и аномальных записей, условия SNR и разделение на обучающую и тестовую выборки, использованные для контролируемой бинарной классификации.
| Модель | Точность (%) | Прецизионность (%) | Полнота (%) | F1-мера (%) | Специфичность (%) |
| SVM | 88.6 | 86.9 | 85.4 | 86.1 | 90.2 |
| Random Forest (RF) | 91.2 | 89.8 | 88.5 | 89.1 | 92.6 |
| LSTM | 94.5 | 93.2 | 92.8 | 93 | 95.1 |
| CNN | 96.3 | 95.4 | 94.9 | 95.1 | 96.8 |
| CNN–Transformer (Предлагаемая) | 98.5 | 98.06 | 99.02 | 98.54 | 97.96 |
Таблица 3: Результаты классификации для набора данных MIMII. Сравнение эффективности классификаторов на основе машинного и глубокого обучения по показателям точности (accuracy), прецизионности (precision), полноты (recall), F1-меры и специфичности.
| Параметр | Значение |
| Набор данных | MIMII Dataset |
| Общее количество образцов | ~12,000 |
| Разделение на обучающую и тестовую выборки | 80% / 20% |
| Тип входных данных | Изображения спектрограмм |
| Слои CNN | 3–5 сверточных слоев |
| Слои трансформера | 2–4 слоя энкодера |
| Размер пакета (batch size) | 32 |
| Скорость обучения | 0.001 |
| Оптимизатор | Adam |
| Эпохи | 100 |
| Оборудование | Граничное устройство (Edge Device) + GPU (для обучения) |
| Длина окна STFT | 1024 |
| Размер шага (hop size) | 512 |
| Размер БПФ (FFT) | 1024 |
| Разрешение спектрограммы | 224 × 224 |
| Нормализация | Z-score |
| Аугментация данных | Временное маскирование, частотное маскирование, гауссов шум |
| Слои CNN | 4 |
| Фильтры CNN | 32, 64, 128, 256 |
| Слои трансформера | 4 |
| Количество голов внимания | 8 |
| Размерность эмбеддинга | 256 |
| Размерность сети прямого распространения | 1024 |
| Дропаут (dropout) | 0.3 |
| Случайное число (seed) | 42 |
| Терпение ранней остановки (early stopping patience) | 10 |
Таблица 4: Настройка среды и конфигурация гиперпараметров. Параметры обучения и экспериментов, использованные для реализации предлагаемой архитектуры CNN-трансформера.
| Компонент | Спецификация |
| Язык программирования | Python |
| Фреймворк | TensorFlow / PyTorch |
| Процессор | Intel i7 / Ryzen 7 |
| Графический процессор (GPU) | NVIDIA GTX 1660 / RTX Series |
| Периферийное устройство | Raspberry Pi / NVIDIA Jetson |
| Визуализация | Matplotlib, SHAP |
| Периферийное устройство | NVIDIA Jetson Xavier NX |
| ЦП (CPU) | 6-core ARM v8.2 |
| ОЗУ (RAM) | 16 GB |
| Операционная система | Ubuntu 20.04 |
| Фреймворк глубокого обучения | TensorFlow/PyTorch |
| Размер набора данных | 12,000 MIMII samples |
| Связь | Ethernet/Wi-Fi |
| Параметры модели | 8.4 Million |
| Размер модели | 32.7 MB |
| Фреймворк | PyTorch + TensorRT |
| Размер пакета (Batch Size) | 1 |
| Квантование | FP16 |
| Прунинг | Нет |
| Средняя задержка | 17.8 ms |
| Медианная задержка | 17.2 ms |
| Задержка (95-й процентиль) | 19.6 ms |
| Пропускная способность | 56 samples/s |
| Использование памяти | 1.4 GB |
| Энергопотребление | 11.3 W |
Таблица 5: Среда моделирования. Аппаратное и программное обеспечение, использованное для обучения, развертывания и оценки предлагаемой модели.
| Модель | ROC-AUC | AUC-PR | МКЦ (микрокристаллическая целлюлоза) |
| Метод опорных векторов (SVM) | 0.913 | 0.765 | 0.73 |
| Случайный лес (RF) | 0.958 | 0.891 | 0.78 |
| Долгая краткосрочная память (LSTM) | 0.97 | 0.912 | 0.86 |
| СНС (сверточная нейронная сеть) | 0.98 | 0.95 | 0.9 |
| CNN–Transformer (предлагаемая модель) | 0.994 | 0.982 | 0.97 |
Таблица 6: Сравнение экспериментальных результатов по показателям ROC-AUC, PR-AUC и MCC. Сравнение различных моделей на основе показателей ROC-AUC, PR-AUC и коэффициента корреляции Мэтьюса.
| Метрика | Среднее (%) + ст. откл. (%) | 95% доверительный интервал |
| Точность | 98.50 ± 0.19 | [98.1, 98.9] |
| Точность | 98.06 ± 0.23 | [98.0, 98.2] |
| Полнота (Recall) | 99.22 ± 0.22 | [98.8, 99.4] |
| F-мера (F1-score) | 98.54 ± 0.24 | [98.1, 98.9] |
| ROC-AUC | 0.984 | 0.004 |
| PR-AUC | 0.982 | 0.005 |
| МКЦ | 0.97 | 0.007 |
Таблица 7: Результаты статистического анализа многократных запусков. Статистические показатели робастности предлагаемой архитектуры CNN-transformer по итогам 10 экспериментов, включая среднее значение, стандартное отклонение, 95% доверительный интервал и уровень значимости для различных показателей эффективности.
| Метрика | Значение |
| Точность (Accuracy) | 98.50% |
| Прецизионность (Precision) | 98.06% |
| Полнота (Recall) | 99.02% |
| Специфичность | 97.96% |
| F1-мера | 98.54% |
| MCC | 0.97 |
| ROC-AUC | 0.994 |
| PR-AUC | 0.982 |
Таблица 8: Итоговый тестовый набор матрицы ошибок. Матрица ошибок для тестового набора предлагаемой архитектуры, отображающая классификацию нормальных и аномальных состояний оборудования, на основе которой были рассчитаны метрики оценки.
| Метрика | Развертывание в облаке | Развертывание на периферии |
| Задержка вывода (мс) | 85.6 | 18.7 |
| Пропускная способность (образцов/с) | 22 | 53 |
| Использование сети (МБ/мин) | 120 | 18 |
| Энергия на одно предсказание (Дж) | 0.52 | 0.17 |
| Возможность анализа в режиме реального времени | Умеренный | Высокий |
Таблица 9: Результаты измерения задержки вывода. Показатели задержки при развертывании системы CPHS с поддержкой объяснимого ИИ на периферийных устройствах, включая время обработки, пропускную способность, потребление памяти и другие характеристики работы в режиме реального времени.
| Метрика | Облачные киберфизические системы (CPS) | Предлагаемая CPHS с поддержкой граничных вычислений | Улучшение |
| Объем передачи данных в час | 100% | 35% | Снижение на 65% |
| Задержка связи | 75 мс | 20 мс | Снижение на 73,3% |
| Энергопотребление | 100% | 68% | Снижение на 32% |
| Расчетный объем выбросов углерода | 100% | 70% | Снижение на 30% |
Таблица 10: Оценка устойчивости CPHS с поддержкой граничных вычислений. Для оценки устойчивости CPHS с поддержкой граничных вычислений используются измерения коммуникационных затрат, энергопотребления, использования ресурсов и задержки.
| Вариант модели | Точность (%) | Прецизионность (%) | Полнота (%) | F1-мера (%) |
| только CNN | 93.8 | 92.5 | 94.2 | 93.3 |
| Только трансформер | 92.6 | 91.2 | 93.5 | 92.3 |
| CNN + Transformer | 98.5 | 98.06 | 99.02 | 98.54 |
Таблица 11: Результаты абляционного анализа. Результаты абляционного анализа, демонстрирующие влияние модулей CNN, Transformer и SHAP на эффективность предлагаемой модели.