Исследовательская статья

Киберфизическое взаимодействие с поддержкой объяснимого ИИ для устойчивого производства в рамках Индустрии 5.0

1 просмотров

DOI:

10.3791/72379

1 сентября 2026 г.

В этой статье

Краткое содержание

В данном исследовании представлена концепция киберфизического взаимодействия в рамках Индустрии 5.0 на базе объяснимого ИИ, в которой для обнаружения акустических аномалий в промышленности на наборе данных MIMII используются CNN-трансформер и SHAP. Интеграция граничных вычислений обеспечивает интерпретируемое, ориентированное на человека прогностическое техническое обслуживание.

Аннотация

В данном исследовании мы представляем инновационный подход к устойчивому производству промышленных деталей с использованием системы киберфизического взаимодействия на базе объяснимого искусственного интеллекта (XAI) для Индустрии 5.0. Было установлено, что современные киберфизические человеческие системы (CPHS) интегрируют ИИ лишь в ограниченной степени и зачастую лишены объяснимости. Следовательно, существует необходимость повышения их масштабируемости и гибкости в соответствии с принципами Индустрии 5.0: устойчивостью, долгосрочной жизнеспособностью и человекоцентричностью. Чтобы устранить эти недостатки, мы предлагаем архитектуру, которая интегрирует глубокое обучение и объяснимый ИИ в экосистему киберфизических систем (CPS) для обеспечения интеллектуального и объяснимого принятия решений. В частности, для обнаружения неисправностей оборудования по акустическим сигналам мы используем набор данных Malfunctioning Industrial Machine Investigation and Inspection (MIMII). Аудиосигналы подвергаются спектральному преобразованию для генерации изображений-спектрограмм, которые затем обрабатываются сверточной нейронной сетью (CNN) для извлечения пространственных признаков и трансформерным кодировщиком для временных признаков. Для повышения прозрачности и содействия взаимодействию по принципу «человек в контуре управления» (human-in-the-loop) используется подход на основе аддитивных объяснений Шепли (SHAP), который помогает операторам понять процесс принятия решений системой, выделяя входные признаки, влияющие на прогнозы модели. Кроме того, разработанная структура применяется в киберфизической системе на базе граничных вычислений (edge computing) для обеспечения низкой задержки и низкого энергопотребления при предоставлении своевременных ответов, что способствует созданию устойчивой производственной среды. Экспериментальные результаты показывают, что предложенная архитектура CNN-Transformer достигает точности 98,5% и превосходит существующие системы CPHS, сохраняя при этом низкую задержку. Использование объяснимого ИИ в такой системе киберфизического взаимодействия значительно повышает доверие оператора и обеспечивает бесшовное взаимодействие человека и машины.

Введение

Переход от Индустрии 4.0, в которой основной акцент делался на технологиях, механизации и коммуникациях, к новой модели Индустрии 5.0, сочетающей технологический прогресс с адаптивностью, устойчивым развитием и человекоцентричностью, повлиял на динамическую эволюцию промышленных систем1,2. Европейская комиссия определяет Индустрию 5.0 как парадигму, ориентированную не только на производительность и эффективность, но и на три столпа: человекоцентричность, устойчивость и жизнестойкость. Важно отметить, что недавние исследования указали на роль систем ИИ, взаимодействия человека и машины, а также устойчивого производства в качестве основных движущих сил среды Индустрии 5.03,4. Традиционные методы технического обслуживания более не являются достаточными в этой развивающейся промышленной среде. Чтобы обеспечить жизнестойкость в сложных, нестабильных контекстах, техническое обслуживание должно эволюционировать в более адаптивную и системную форму5. С 2011 года Индустрия 4.0 была доминирующей моделью промышленной трансформации в Европе, стимулируя цифровую трансформацию предприятий для оптимизации операций и максимального использования имеющихся ресурсов4. Таким образом, крайне важно повышать эффективность, не исключая человеческий труд из производства и обеспечивая при этом охрану здоровья и безопасность работников. В связи с этим бизнес и академическое сообщество начали определять принципы парадигмы Индустрии 5.05,6,7, отчасти опираясь на японскую концепцию Общества 5.08,9,10,11. Несмотря на повышенное внимание к устойчивому техническому обслуживанию в современной литературе, большинство существующих систематических оценок остаются фрагментарными или ограниченными конкретной областью, в них отсутствует комплексная структура, объединяющая жизнестойкость, устойчивость и ИИ. Например, авторы исследуют методы устойчивого технического обслуживания для конкретных систем или стратегий, включая устойчивое полное продуктивное обслуживание (STPM), в то время как другие исследователи говорят о внедрении аспектов устойчивости в методы технического обслуживания12,13,14. Автор провел комплексную оценку критериев внедрения устойчивого развития и выделил технологические факторы, которые позволяют производству оказывать положительное устойчивое воздействие15. Тем не менее, в рамках парадигмы Индустрии 5.0 устойчивость, жизнестойкость и принятие решений на основе ИИ не полностью интегрированы ни в одной из этих работ. В результате вопросы устойчивого развития часто решаются с помощью отдельных методов технического обслуживания. SHAP выделяется среди других методов объяснимого искусственного интеллекта (XAI) благодаря своему теоретически обоснованному методу атрибуции признаков16,17,18.

Принятие решений на основе данных стало возможным благодаря ИИ, однако для создания точных моделей часто требуются большие объемы данных. Традиционные методы машинного обучения (ML), такие как деревья решений, логистическая регрессия и линейная регрессия, часто демонстрируют низкую эффективность в ситуациях с высокой степенью нелинейности, поскольку они предполагают относительно простое распределение данных19. Глубокие нейронные сети (DNN) обходят эти ограничения за счет изучения сложных представлений признаков из массивных наборов данных20. Согласно исследованиям21, более глубокие сети часто справляются со сложными задачами принятия решений лучше, чем неглубокие структуры, однако увеличение их глубины и сложности параметров делает модель менее интерпретируемой22.

Киберфизическая система (КФС) является важнейшей вспомогательной технологией для производства в рамках Индустрии 5.0, поскольку она объединяет распределенный интеллект, встроенные компьютеры, физические процессы и связь. Для обеспечения гибких, интеллектуальных и оперативных промышленных операций современные КФС активно интегрируют граничные вычисления, граничный ИИ и «зеленый» интернет вещей (G-IoT)23,24. В последних исследованиях по техническому обслуживанию 4.0 (Maintenance 4.0) и «умному» техническому обслуживанию особое внимание уделялось устойчивости и жизнестойкости. В то время как в более ранних работах изучалась значимость технологий Maintenance 4.0 для устойчивого производства и предлагались модели для обеспечения устойчивого технического обслуживания, библиометрические и систематические исследования были посвящены оценке технологий «умного» технического обслуживания25,26,27,28. Дальнейшие исследования были направлены на интеграцию устойчивого технического обслуживания в среду Индустрии 4.0 и ориентированные на устойчивость производственные системы29,30,31,32. Концепция Оператора 4.033, человекоцентричные структуры Индустрии 5.034 и социально-экономические перспективы35 привлекли значительное внимание к человекоцентричному техническому обслуживанию. Кроме того, в последних исследованиях подчеркиваются достижения в области цифрового технического обслуживания36, прогностического и прескриптивного обслуживания37,38, а также стратегий устойчивого технического обслуживания39,40. Несмотря на эти успехи, исследования остаются разрозненными, и лишь немногие из них предлагают целостную парадигму, объединяющую объяснимый ИИ, устойчивость, жизнестойкость и человекоцентричное киберфизическое взаимодействие. Киберфизические системы (КФС) не достигли полной автономности, несмотря на их растущее внедрение, и парадигма Индустрии 5.0 не стремится к этому. Напротив, Индустрия 5.0 делает больший акцент на человеческом надзоре, сотрудничестве и принятии решений. Расширяя традиционные КФС, кибер-человеческие системы, такие как КФС с участием человека в контуре (HiLCPSs)41, человекоцентричные КФС (HCPSs)42,43 и киберфизические человеческие системы (CPHSs)44, интегрируют человеческое мышление и взаимодействие в киберфизические процессы. Эта интеграция повышает адаптивность, прозрачность, безопасность и жизнестойкость за счет обеспечения взаимодействия в режиме реального времени между интеллектуальными системами и операторами-людьми45,46.

Методы обнаружения аудиоаномалий в промышленности значительно улучшились благодаря новым архитектурам, включая Vision Transformer (ViT), Audio Spectrogram Transformer (AST), Conformer и самообучение; однако их интеграция в объяснимые киберфизические системы для Индустрии 5.0 остается ограниченной. Без объединения объяснимости, развертывания на периферии (edge deployment) и поддержки принятия решений с участием человека в рамках единой структуры, современные исследования сосредоточены преимущественно на точности классификации или на интерпретируемости на основе XAI post hoc. В данном исследовании предлагается новая киберфизическая архитектура совместной работы на базе CNN-Transformer с поддержкой объяснимого ИИ, которая объединяет периферийные вычисления, моделирование временных зависимостей, объяснимость на основе SHAP, обучение пространственным признакам и человекоориентированную поддержку принятия решений, что позволяет обеспечить устойчивое производство в рамках Индустрии 5.0 и преодолеть эти ограничения.

Таким образом, сохраняется значительный пробел в исследованиях. Современные методы обнаружения акустических аномалий на базе CNN/Transformer ориентированы на показатели классификации, но в них отсутствует киберфизическое взаимодействие и интерпретируемость. В то время как концепции Индустрии 5.0 предлагают человекоцентричные модели, которые не объединяют интерпретируемое глубокое обучение, граничные вычисления и принятие решений с участием оператора в единую систему, методы прогностического обслуживания на основе XAI повышают прозрачность, но функционируют независимо от архитектур CPHS. Следовательно, до сих пор отсутствует единая киберфизическая человеческая система Индустрии 5.0, которая интегрировала бы точное обнаружение слуховых аномалий, интерпретируемость на основе SHAP, развертывание на граничных устройствах и взаимодействие по принципу «человек в контуре управления».

В данной работе предлагается новая парадигма киберфизического взаимодействия на базе CNN-Transformer с поддержкой объяснимого ИИ для Индустрии 5.0, призванная преодолеть эти ограничения. Предложенная архитектура объединяет развертывание граничных вычислений, извлечение пространственных признаков на основе CNN, изучение временных зависимостей на основе Transformer, объяснимость на базе SHAP и поддержку принятия решений с участием человека в единую структуру CPHS. В отличие от существующих методов, в которых эти элементы рассматриваются независимо, предлагаемая структура представляет собой комплексное решение, которое одновременно повышает эффективность обнаружения аномалий, прозрачность модели, операционную эффективность и человекоцентричное взаимодействие для устойчивого производства.

Основной целью данной работы является создание киберфизической системы с участием человека (CPHS) на базе объяснимого искусственного интеллекта (XAI) для обеспечения устойчивого производства в рамках концепции «Индустрия 5.0». Это достигается путем объединения интерпретируемости на основе метода SHAP, граничных вычислений (edge computing) и поддержки принятия решений с участием человека с гибридным подходом к обнаружению акустических аномалий на базе архитектуры CNN-Transformer. В частности, предлагаемая структура направлена на повышение точности обнаружения аномалий при обеспечении четких и понятных прогнозов, что облегчает эффективное развертывание на граничных устройствах и способствует совместному принятию решений интеллектуальными системами и операторами-людьми. Благодаря одновременному достижению высокой производительности детектирования, объяснимости, работы с низкой задержкой и человекоцентричного киберфизического взаимодействия, эта интегрированная архитектура устраняет недостатки существующих систем обнаружения акустических аномалий, прогностического обслуживания на базе XAI и структур CPHS.

Предлагаемая архитектура представляет собой единую киберфизическую человеческую систему (CPHS) с поддержкой объяснимого ИИ (Explainable AI) для Индустрии 5.0, в отличие от современных методов обнаружения акустических аномалий, которые сосредоточены преимущественно на точности классификации. В рамках единой архитектуры объединяются извлечение пространственных признаков на базе CNN, временное моделирование на базе Transformer, объяснимость на базе SHAP, граничные вычисления (edge computing) и поддержка принятия решений с участием человека (human-in-the-loop). Предлагаемая архитектура решает ключевые проблемы прозрачности, помощи оператору и киберфизического взаимодействия, объединяя точное обнаружение аномалий с понятным процессом принятия решений и развертыванием на граничных устройствах в режиме реального времени. Основным научным вкладом данной работы является интеграция на системном уровне, что отличает предлагаемый подход от предыдущих исследований, сосредоточенных исключительно на обнаружении аномалий, объяснимом ИИ или концепциях Индустрии 5.0.

Протокол

Предлагаемая методология основана на системном подходе Кибер-физической человеческой системы (CPHS) в рамках Индустрии 5.0, который сочетает в себе объяснимое глубокое обучение с платформой кибер-физического взаимодействия на базе граничных вычислений для обеспечения устойчивых производственных процессов. Сначала проблема рассматривается через анализ определенных ограничений современных решений CPHS, таких как недостаток интеллекта на базе ИИ, объяснимости и человекоцентричного взаимодействия. Для решения этих задач в предлагаемом подходе используется набор данных MIMII для мониторинга состояния промышленного оборудования с помощью обработки акустических сигналов.

Предложенная структура начинается с подачи сгенерированных спектрограмм в модель CNN, которая извлекает пространственные признаки путем распознавания значимых частотных паттернов, связанных с различными состояниями оборудования. Извлеченные пространственные признаки преобразуются в последовательности и подаются в модуль энкодера трансформера для захвата временных зависимостей с помощью механизма self-attention. Преобразованное представление признаков затем передается в модуль полносвязного классификатора для классификации состояний оборудования как нормальных или аномальных. Кроме того, для обеспечения прозрачности и содействия принятию решений с участием человека используется подход к объяснимости SHAP, который позволяет обосновать прогнозы путем выбора значимых временно-частотных областей в выходных данных модели. Разработанная модель будет реализована в среде CPS с поддержкой периферийных вычислений, что обеспечит вывод в реальном времени с низкой вычислительной задержкой и низким энергопотреблением. Дополнительно будет интегрирована схема с участием человека (human-in-the-loop), позволяющая операторам проводить валидацию на основе результатов объяснимости. Эффективность подтверждается с использованием показателей точности (accuracy), прецизионности (precision), полноты (recall) и F1-меры, а также других системных метрик, таких как задержка и энергоэффективность.

Предложенная структура представляет собой механизм CPHS на базе XAI для устойчивого производства в контексте Индустрии 5.0; ее рабочий процесс представлен в виде конвейера от сбора данных до принятия интеллектуальных решений и их реализации, как показано на Рисунке 1. На начальном этапе процедуры сбора данных звуковые сигналы регистрируются с оборудования таких промышленных объектов, как двигатели, насосы и подшипники, с использованием наборов данных, включая MIMII. Полученные сигналы передаются на следующий этап, называемый предварительной обработкой данных, где они подвергаются фильтрации, нормализации и сегментации. Наконец, сегментированные сигналы данных преобразуются в спектрограмму с помощью коротковременного преобразования Фурье (STFT) на уровне представления признаков.

Затем слой модели ИИ использует изображения спектрограмм для извлечения признаков с помощью модуля CNN, выявляя пространственные закономерности и аномалии. После этого извлеченные признаки преобразуются по форме и подаются в кодировщик-трансформер, который изучает временные зависимости и долгосрочные связи с помощью механизмов самовнимания. Полученные векторы признаков классифицируются как нормальные или аномальные с помощью слоя классификации. Для обеспечения прозрачности процесса прогнозирования слой интерпретируемости использует SHAP для выделения значимых временно-частотных областей на спектрограмме.

Кроме того, предусмотрен процесс с участием оператора (human-in-the-loop), в ходе которого специалисты интерпретируют результаты работы модели и предоставляют обратную связь. На уровне развертывания модель функционирует на базе периферийной инфраструктуры CPHS, что обеспечивает высокую скорость вывода и низкое энергопотребление, с возможностью опционального взаимодействия с облачными системами для хранения данных или проведения расширенной аналитики. В совокупности данная архитектура обеспечивает точное обнаружение неисправностей, интерпретируемость результатов и эффективную работу в режиме реального времени в соответствии с требованиями Индустрии 5.0.

Определение проблемы и анализ требований

Киберфизические человеческие системы (CPHS) в условиях Индустрии 5.0 обещают обеспечить интеллект, устойчивость и человекоцентричность. Тем не менее, современные структуры для создания CPHS ограничены отсутствием расширенных возможностей на базе ИИ, объяснимости и адекватной поддержки человеко-машинного взаимодействия. Действительно, традиционные CPHS основаны на моделях на базе правил или неинтерпретируемых моделях, что препятствует адаптации к меняющимся промышленным условиям и ограничивает доверие операторов к автоматизации. Более того, традиционные CPHS не могут эффективно анализировать высокосложные данные, такие как промышленные акустические сигналы, содержащие как пространственные (т. е. частотные), так и временные компоненты, которые важны для предиктивного технического обслуживания. Следовательно, необходимо создать структуру, способную с высокой точностью обнаруживать аномалии в работе оборудования, предоставлять объяснения и функционировать на периферии, тем самым обеспечивая работу CPS.

Здесь x(t) — входной акустический сигнал, S(f,t) — спектрограммное представление сигнала, figure-protocol-1  — метка, а  θ — набор параметров архитектуры CNN-Transformer. Символы, используемые в последующих уравнениях, вводятся сразу после их первого появления для обеспечения математической корректности.

С математической точки зрения данную задачу можно формализовать как проблему обучения с учителем. Пусть промышленный акустический сигнал обозначается как x(t). Кратковременное преобразование Фурье (STFT) для x(t) вычисляется по следующей формуле:

figure-protocol-2   (1)

где ω(.) — оконная функция, а f — частота. Сгенерированная спектрограмма figure-protocol-3 служит входными данными для алгоритма глубокого обучения. Целью является обучение функции отображения

figure-protocol-4    (2)

где figure-protocol-5 — это метка класса (норма или патология), S — входной спектрограмма, y — предсказанная выходная метка, а θ — набор обучаемых параметров архитектуры CNN-Transformer. Задача оптимизации формулируется как минимизация потерь классификации:

figure-protocol-6  (3)

с учетом ограничений по минимальной задержке figure-protocol-7, энергоэффективности figure-protocol-8 и интерпретируемости, при этом объяснение ∅(SHAP) отражает значимость признаков в процессе прогнозирования,

figure-protocol-9   (4)

где figure-protocol-10 — это вклад каждого отдельного признака. В соответствии с вышеизложенным, требования к проектированию включают следующее: (i) надежное обнаружение аномалий на основе гибридного глубокого обучения, (ii) интерпретируемые результаты для возможности человеческого вмешательства и (iii) реализация в структуре CPS с расширенными граничными возможностями.

Сбор и предварительная обработка данных

В связи с этим для оценки предлагаемой структуры CPHS на основе объяснимого искусственного интеллекта (Explainable AI) был выбран набор данных MIMII13. Данный набор данных является широко используемым эталоном для обнаружения аномалий в промышленном оборудовании с помощью акустических сигналов. Эта база данных содержит звукозаписи работы различных механизмов, таких как направляющие, вентиляторы, насосы и клапаны, как в нормальных, так и в условиях возникновения неисправностей. Для каждой машины записи варьируются в зависимости от различных настроек и шумовой обстановки. Это делает данный набор данных подходящим для обучения и оценки моделей в условиях промышленной эксплуатации в режиме реального времени.

В то время как набор данных MIMII широко используется в исследованиях по обучению без учителя для обнаружения аномалий, где при обучении опираются исключительно на нормальные образцы, он содержит явные аннотации как нормальных, так и аномальных состояний оборудования. Задача сформулирована как задача контролируемой бинарной классификации для проверки способности предложенной архитектуры CNN-Transformer на базе объяснимого ИИ (Explainable AI) разделять исправные и неисправные состояния оборудования. В частности, используются официальные метки MIMII, где нормальным образцам присваивается метка класса 0, а аномальным — метка класса 1.

В таблице 1 приведены подробные сведения о наборе данных. В данном исследовании рассматриваются примерно 12 000 записей акустических сигналов, включая как нормальную, так и некорректную работу оборудования. Согласно требованиям, все записи в этом исследовании были выполнены с частотой дискретизации 16 kHz и имеют длительность 10 s. Несмотря на то что набор данных содержит около 12 000 записей, для визуализации матрицы ошибок был выбран сбалансированный по классам подмножество из 2 000 тестовых записей. Все представленные показатели эффективности были рассчитаны с использованием полного тестового набора (примерно 2 400 записей). Кроме того, обучающие и тестовые выборки разделены в соотношении 80:20 для обучения модели. Эта база данных хорошо подходит для приложений Индустрии 5.0, поскольку она учитывает условия шума в режиме реального времени. Распределение записей, использованное в данном исследовании, приведено в таблице 2. Из этого набора данных для экспериментов по контролируемой бинарной классификации с разделением на обучающую и тестовую выборки в соотношении 80:20 было выбрано примерно 12 000 записей, охватывающих все типы машин и условия отношения сигнал/шум (SNR); в таблице указаны типы промышленных машин, соответствующие идентификаторы машин, общее количество нормальных и аномальных акустических записей, условия SNR и экспериментальное разделение на обучающую и тестовую выборки, использованное для контролируемой бинарной классификации.

Эксперимент проводился с использованием набора данных MIMII (Malfunctioning Industrial Machine Investigation and Inspection) версии 1.0, который включает четыре типа промышленного оборудования: вентиляторы, насосы, клапаны и направляющие. Данные были собраны для различных идентификаторов машин (ID00–ID06, в зависимости от типа оборудования) и условий работы. База данных MIMII содержит данные, полученные при отношениях сигнал/шум (SNR) −6 dB, 0 dB и +6 dB. Нормальные данные соответствуют исправному состоянию промышленного оборудования, в то время как аномальные данные соответствуют состоянию с неисправностью. Классы были обозначены на основе аннотаций базы данных: нормальные данные помечены как класс 0, а аномальные — как класс 1.

Для обеспечения объективности процедуры оценки разделение на обучающую и тестовую выборки должно было быть произведено на уровне исходных аудиозаписей до этапов сегментации, аугментации или создания спектрограмм. Таким образом, аудиофрагменты из одной и той же записи не могли одновременно присутствовать в обучающем и тестовом наборах. В оценочном эксперименте использовались записи с различными значениями отношения сигнал/шум (−6 dB, 0 dB и +6 dB), что позволило оценить предложенную архитектуру в различных промышленных условиях.

Для предотвращения утечки данных разделение на обучающую и тестовую выборки было выполнено на основе исходных аудиофайлов до проведения какой-либо сегментации или генерации спектрограмм. Сегменты из одной и той же 10 s аудиозаписи назначались исключительно либо в обучающий, либо в тестовый набор, так что ни один сегмент не присутствовал в обоих наборах одновременно. После этого спектрограммы генерировались и дополнялись отдельно для каждого набора данных. Таким образом была решена проблема утечки данных, что позволило избежать излишне оптимистичной оценки эффективности.

Предварительная обработка набора данных

Необработанные акустические сигналы из набора данных MIMII затем подвергаются обработке для повышения качества сигнала и обеспечения эффективного извлечения признаков. Входной сигнал обозначается как x(t), где t — время. Первым этапом является фильтрация шума, при которой фоновые шумы отфильтровываются с помощью функции фильтрации следующим образом:

figure-protocol-11   (5)

где ∗ обозначает процесс свертки, а h(t) — импульсный отклик фильтра. Этот процесс повышает четкость акустического сигнала и сводит к минимуму воздействие шумов, часто присутствующих в промышленных условиях. Нормализация сигнала используется для того, чтобы амплитуды всех аудиосигналов были сопоставимы перед их подачей в модель глубокого обучения. Нормализованный сигнал, обозначаемый как xn(t), рассчитывается следующим образом:

figure-protocol-12   (6)

где μ и σ — это среднее значение и стандартное отклонение входного сигнала соответственно. Благодаря данной процедуре гарантируется, что все входные сигналы имеют нулевое среднее значение и единичную дисперсию. Наконец, для обработки нормализованный входной сигнал разделяется на множество коротких фрагментов. С учетом того, что общая длина сигнала составляет T, он разбивается на N перекрывающихся кадров длиной L с помощью функции скользящего окна:

figure-protocol-13   (7)

где H — размер шага. Спектрограмму можно определить с помощью следующей формулы:

figure-protocol-14   (8)

Полученные таким образом спектрограммы подаются в архитектуру на базе CNN-трансформера для извлечения пространственных и временных признаков с целью успешного обнаружения аномалий. На рисунке 2 показана схема предварительной обработки данных.

Рисунок 2 иллюстрирует вертикальный конвейер предварительной обработки, который может быть использован для акустических данных, полученных в промышленности. Сначала необработанные аудиосигналы извлекаются из набора данных MIMII и поступают на этап удаления шума для снижения уровня помех. Затем следует нормализация сигнала для устранения несоответствий амплитуды, что обеспечивает однородность сигнала. Впоследствии сигнал разделяется на более короткие перекрывающиеся сегменты. После сегментации к данным применяется преобразование STFT для перевода сигналов из временной области в область время-частота. Затем, в рамках генерации спектрограммы сигнала, вычисляется энергетический спектр. Таким образом, результатом данного процесса являются предварительно обработанные спектрограммы, которые будут использоваться в предлагаемой модели CNN-transformer.

Генерация спектрограммы

После нормализации и сегментации данных акустические сигналы переводятся в частотно-временное представление с помощью кратковременного преобразования Фурье (STFT). Полученная спектрограмма дает наглядное представление об изменениях частотного состава в течение периода анализа. В промышленных условиях неисправности оборудования обычно проявляются в виде частотных паттернов, что делает спектрограммы более эффективными для обнаружения аномалий в работе машин.

Таким образом, полученные обработанные данные преобразуются в спектрограммы для разграничения нормальных и аномальных состояний оборудования. Аудиоданные будут преобразованы в несколько спектрограмм, чтобы модель обучения могла анализировать локальные частотные компоненты и временные изменения в процессе работы машины. Эти изображения используются в качестве входных данных для модели CNN-Transformer, где CNN обрабатывает пространственные (частотные) паттерны, а трансформеры — временные взаимосвязи.

Алгоритм 1: Генерация спектрограммы из акустических сигналов

Вход: необработанный аудиосигнал x(t)

Результат: Спектрограмма S(t, f)

Шаг 1: Загрузка аудиосигнала  x(t)

Шаг 2: Примените фильтрацию шумаfigure-protocol-15

Шаг 3: Нормализация сигнала xn(t)

Шаг 4: Сегментация сигнала на кадры:

для k = 1 до N выполнить

figure-protocol-16

конец цикла

Шаг 5: Примените оконную функцию w(t) к каждому сегменту

Шаг 6: Вычисление STFT:

figure-protocol-17  (9)

Шаг 7: Вычислите величину:

figure-protocol-18   (10)

Шаг 8: Сохраните спектрограмму S(t, f)

Шаг 9: Возврат набора данных спектрограммы 

Процесс создания спектрограмм начинается с получения исходного аудиосигнала, за которым следуют этапы предварительной обработки, такие как шумоподавление и нормализация сигнала, для обеспечения его целостности и качества. После этого нормализованный аудиосигнал разделяется на несколько перекрывающихся окон для фиксации временных характеристик как длительных, так и краткосрочных периодов. Чтобы предотвратить спектральную утечку, каждый фрагмент умножается на оконную функцию перед подачей на короткопреобразование Фурье (STFT). Затем преобразованный сигнал представляется в виде комплексной функции в частотной области, и значения его амплитуд возводятся в квадрат. Таким образом, энергия частот за определенный промежуток времени представляется в виде спектрограмм. На заключительном этапе они сохраняются в виде данных, подобных изображениям, и подаются в нейронную сеть для обучения.

Извлечение пространственных признаков с помощью CNN

После процесса создания спектрограмм полученные время-частотные изображения используются в качестве входных данных и подаются на вход сверточной нейронной сети (CNN). Принимая входную спектрограмму за figure-protocol-19, где H — частотная область, а W — временная область. Целью использования CNN в данном случае является извлечение дискриминативных пространственных признаков из входной спектрограммы. Эти дискриминативные пространственные признаки помогут отличить нормальное поведение оборудования от аномального в условиях промышленной среды.

Базовой операцией, выполняемой сверточной нейронной сетью (CNN), является свертка. Свертка с заданным фильтром figure-protocol-20 вычисляется следующим образом:

figure-protocol-21   (11)

Описанная выше операция позволяет нейронной сети идентифицировать локальные пространственные признаки в спектрограмме, такие как границы, частоты и гармонический состав. Это осуществляется с помощью множественных операций фильтрации, которые создают различные представления признаков, формируя несколько карт признаков. За сверткой следует нелинейная функция активации, как показано ниже:

figure-protocol-22  (12)

Эта нелинейность позволяет сети улавливать и представлять сложные взаимосвязи между переменными. Следующий этап в сверточной нейронной сети включает применение операций пулинга. Распространенный метод max pooling математически выражается следующим образом:

figure-protocol-23   (13)

где Ω обозначает окно пулинга. Пулинг помогает достичь трансляционной инвариантности и сохранить только релевантную информацию, отсеивая избыточность. С помощью сверточной нейронной сети можно иерархически извлекать признаки более высокого уровня: от низкоуровневых переменных, таких как частоты, до сложного поведения машины. Следовательно, карты признаков могут быть использованы для описания итогового выходного сигнала сети:

figure-protocol-24   (14)

где представляет собой обучаемые параметры CNN. Карты признаков содержат богатую пространственную информацию и преобразуются в последовательности, которые служат входными данными для энкодера трансформера на следующем этапе. Описанный выше процесс извлечения пространственных признаков имеет решающее значение для того, чтобы модель могла обнаруживать мельчайшие аномалии в промышленных акустических сигналах.

Рисунок 3 демонстрирует процесс горизонтального извлечения пространственных признаков из входной спектрограммы с помощью модели CNN. Процесс начинается с входной спектрограммы, в которой временно-частотные характеристики аудиосигнала представлены в виде изображения. Затем входная спектрограмма проходит через сверточный слой, где фильтры различных типов извлекают пространственные признаки, такие как частотные полосы, границы и текстуры, формируя карты признаков. После этого извлеченные карты признаков подвергаются воздействию нелинейной функции активации — линейной функции выпрямления (ReLU), что позволяет нейронной сети выявлять зависимости во входных данных. Затем карты признаков проходят через слой пулинга (субдискретизации), где размер карты уменьшается с сохранением ее наиболее значимых характеристик. Этот цикл сверточных слоев, функций активации и слоев пулинга повторяется многократно, создавая иерархию представления признаков, которая начинается с простых элементов и развивается в сторону более сложных структур, связанных с работой оборудования.

Временное моделирование с использованием трансформерного энкодера

После извлечения пространственных признаков с помощью CNN следующим шагом является получение карт признаков высокого уровня, которые фиксируют частотные паттерны, изученные на основе спектрограммы. Полученные карты признаков затем выравниваются и преобразуются в последовательности для захвата временной информации в акустическом сигнале. Предполагая, что карты признаков представлены как figure-protocol-25, где H', W', и C — это соответственно высота, ширина и количество каналов, выводится следующая последовательность:

figure-protocol-26    (15)

где T обозначает длину последовательности, а d — размерность признака. Затем Transformer использует вышеуказанную последовательность для моделирования долгосрочных зависимостей с помощью механизма самовнимания (self-attention). Модель Transformer, в отличие от традиционных рекуррентных моделей, обрабатывает каждый элемент последовательности параллельно и использует веса внимания для определения относимой значимости каждой части. Механизм внимания работает с использованием векторов запроса (Query) Q, ключа (Key) K и значения (Value) V , которые генерируются для каждого входного xt следующим образом:

figure-protocol-27   (16)

в то время как WQ, WK, WV являются обучаемыми весами. Сходство между элементами определяется следующим образом:

figure-protocol-28   (17)

dk — это размерность важных векторов. Данная процедура упрощает модели процесс изучения зависимостей между удаленными временными шагами в сигнале и позволяет сосредоточиться только на значимых временных сегментах. Для повышения обучающей способности сети используется многоголовое внимание (multihead attention), которое представляет собой процесс, при котором несколько голов внимания параллельно изучают входные данные:

figure-protocol-29  (18)

Каждая головка обрабатывает определенные признаки временной входной последовательности. Далее следуют сети прямого распространения и остаточные связи:

figure-protocol-30   (19)

Полученная закодированная последовательность фиксирует как пространственные, так и временные характеристики входных данных. Эта последовательность передается на слой классификатора для обнаружения аномалий.

Рисунок 4 демонстрирует общий процесс временного моделирования с использованием трансформерного кодировщика (Encoder) на признаках, извлеченных с помощью CNN. Сначала используются карты признаков, извлеченные из CNN; они содержат пространственную информацию из спектрограммы. Карты признаков выравниваются в последовательность, где каждый элемент соответствует определенной временной метке. После этого последовательность проходит через линейное преобразование, которое отображает данные в векторы заданной размерности. Поскольку трансформерные модели не обладают способностью улавливать временные зависимости, к векторам эмбеддингов также добавляется позиционное кодирование для сохранения временной структуры последовательности. Наконец, последовательность проходит через трансформерный кодировщик, состоящий из стека нескольких слоев, в которых используется механизм многоголового самовнимания (multi-head self-attention), позволяющий модели изучать связи между временными метками в последовательности. Полносвязная нейронная сеть (feed-forward neural network) дополнительно улучшает эти эмбеддинги, в то время как остаточные связи (residual connections) обеспечивают эффективное распространение градиентов. Этот процесс повторяется в слоях стека трансформерного кодировщика, которые фиксируют все более сложные временные взаимодействия. В итоге эмбеддинги последовательности объединяются в представление фиксированной длины с помощью пулинга (например, среднего пулинга или токена классификации (CLS)), в результате чего получается глобальное представление временных признаков.

Классификационный слой

После временного кодирования с помощью трансформерного кодировщика на выходе будет получена последовательность закодированных векторов, каждый из которых содержит признаки, относящиеся как к пространственным, так и к временным аспектам входного сигнала. Первым шагом к классификации на основе закодированных выходных данных является объединение всех этих признаков в один вектор. Это достигается либо путем применения усредняющего пулинга (mean pooling) к последовательности векторов признаков, либо путем использования так называемого «классификационного токена». Предположим, что выходом трансформера является figure-protocol-31, где каждый figure-protocol-32. Агрегированный признак h вычисляется следующим образом:

figure-protocol-33   (20)

Затем агрегированный вектор признаков h представляет собой входные данные в компактной форме и служит входным сигналом для классификатора. Часть классификации состоит из одного или нескольких плотных слоев, которые преобразуют полученное представление в выходное пространство. Плотный слой реализует преобразование, которое определяется следующим образом:

figure-protocol-34   (21)

где o — это выход (логиты), b — вектор смещения, а W — матрица весов. Последние представляют собой оценки классов в ненормированном виде. Для внесения нелинейности в модель часто используются функции активации, такие как ReLU. Наконец, к логитам применяется функция активации softmax для получения вероятности для каждого класса:

figure-protocol-35   (22)

где C представляет собой количество классов (C = 2; нормальный и аномальный). Предсказание класса будет основываться на максимальном значении вероятности. В процессе обучения оптимальные значения параметров модели определяются путем минимизации перекрестной энтропии потерь между фактическими и предсказанными метками, что позволяет добиться точной классификации состояний оборудования. Таким образом, слой классификации выполняет важнейшую функцию преобразования извлеченных временных признаков, полученных с помощью архитектуры Transformer, в практические решения. Благодаря правильной дифференциации исправных и неисправных состояний оборудования в рамках парадигмы Индустрии 5.0 становится возможным обнаружение аномалий и принятие интеллектуальных решений.

Рисунок 5 демонстрирует работу классификационного слоя, который следует за энкодером трансформера. Процесс начинается с выходной закодированной последовательности, в которой каждый вектор содержит временную информацию, извлеченную из входных данных. Эти векторы объединяются в один вектор, называемый глобальным вектором признаков. Следующим шагом является передача глобального вектора признаков через несколько полносвязных слоев нейронной сети. В каждом полносвязном слое выполняются операции матричного умножения для создания линейных комбинаций входных данных. После этого может быть применена нелинейная функция активации, такая как ReLU, для повышения гибкости при обучении решающим границам. На выходе последнего полносвязного слоя формируются логиты для каждого класса. Эти логиты используются в функции Softmax для расчета вероятностей принадлежности к каждому классу. Полученные значения вероятности позволяют определить, относится ли входной сигнал к Классу 0 (Норма) или к Классу 1 (Патология).

Интерпретируемость с использованием SHAP

После классификации входных сигналов модель генерирует прогнозы о том, работает ли оборудование в нормальном или аномальном режиме. Тем не менее, в условиях Индустрии 5.0 недостаточно просто получать прогнозы; система также должна обеспечивать прозрачность и интерпретируемость для поддержки принятия решений человеком. В данной структуре используется SHAP — модель на основе теории игр, которая количественно оценивает значимость каждого признака при формировании прогноза. Таким образом, SHAP присваивает веса признакам, что позволяет оценить относительную важность различных участков входной спектрограммы для общего прогноза.

Математическая формулировка SHAP основана на разложении модели f(x):

figure-protocol-36   (23)

где ∅0 — это базовое значение (средний выход модели), ∅i — эффект i-го признака, а M — количество входных признаков. В целях данного исследования признаками являются частотно-временные интервалы спектрограммы. Значения SHAP положительны, если они способствуют вероятности аномального состояния, и отрицательны в противном случае. Такая формулировка гарантирует уникальное, локально согласованное объяснение для каждого прогноза. Метод SHAP может быть применен к обученной модели CNN-transformer для получения объяснения на основе важности признаков. Визуальное представление покажет наиболее важные частотно-временные интервалы в спектрограмме, которые влияют на процесс принятия решения. Например, аномальное поведение оборудования может привести к появлению определенных высокоэнергетических частотных полос, которые система SHAP идентифицирует как важные факторы в процессе принятия решения.

Кроме того, SHAP может способствовать сотрудничеству между человеком и машиной в киберфизической среде. Это возможно благодаря тому, что прогнозы могут быть объяснены с помощью интуитивно понятных визуальных средств, что позволяет операторам и системам принятия решений проверять прогнозы, анализировать проблему и предпринимать соответствующие шаги. Это не только повышает уровень доверия, но и делает производственные процессы на базе ИИ надежными и подотчетными. Интегрируя алгоритмы глубокого обучения, соответствующие современным стандартам производительности, с SHAP, обеспечивающим интерпретируемость, предлагаемая архитектура отвечает требованиям Индустрии 5.0.

Алгоритм 2: Интерпретируемость прогнозов модели на основе SHAP

Входные данные: обученная модель f(x), входная спектрограмма S

Результат: значения SHAP figure-protocol-37 и карта объяснений

Шаг 1: Подайте спектрограмму S на вход обученной модели

Шаг 2: Вычислите прогноз: y = f(S)

Шаг 3: Инициализация эксплейнера SHAP, ориентированного на глубокое обучение

Шаг 4: Вычисление значений SHAP:
figure-protocol-38

Шаг 5: Для каждого признака i в S:

Рассчитайте вклад figure-protocol-39

Шаг 6: Построение карты объяснений:

Выделите области с высоким значением  figure-protocol-40

Шаг 7: Визуализация важности признаков (тепловая карта)

Шаг 8: Возврат значений SHAP и карты интерпретации

Алгоритм объяснимости на основе SHAP начинается с получения в качестве входных данных предварительно обработанного изображения спектрограммы, которое подается в обученную архитектуру CNN-трансформера для формирования прогнозов (например, о нормальном или аномальном состоянии оборудования). После получения прогнозов с помощью обученной архитектуры применяется метод SHAP для интерпретации модели. В частности, для каждого входного признака вычисляются значения SHAP (ϕ), чтобы определить, какие частотно-временные компоненты входных данных вносят наибольший вклад в прогноз. Для расчета этих значений необходимо сравнить выходные данные модели для входных сигналов с определенными признаками и без них.

После расчета значений SHAP для каждого признака его влияние на прогноз можно оценить по знаку и величине значения SHAP. Например, признаки с более высокими значениями SHAP с большей вероятностью влияют на результат, а положительный или отрицательный знак указывает на то, что признак смещает прогноз в сторону класса «норма» или «патология» соответственно. На основании полученных результатов можно составить карту интерпретации в виде тепловой карты.

Наконец, алгоритм выводит как значения SHAP, так и визуализации, что позволяет понять, каким образом человек может анализировать решения модели. Данный метод делает процесс более прозрачным и позволяет специалистам участвовать в принятии решений, обеспечивая таким образом точность прогнозов и надежность алгоритма в условиях промышленного применения ИИ. Для повышения достоверности анализа объяснимости были выбраны репрезентативные тестовые образцы из точно диагностированных аномальных случаев для различных типов оборудования. В то время как глобальный анализ важности признаков SHAP проводился путем агрегирования значений SHAP по всему тестовому набору данных для выявления стабильно влиятельных частотно-временных локаций, для этих репрезентативных случаев были созданы локальные объяснения SHAP. Данный комплексный локальный и глобальный анализ, не требующий экспертной аннотации, обеспечивает надежную интерпретацию прогнозов модели.

Интеграция CPS с поддержкой граничных вычислений

Предлагаемое решение используется в рамках киберфизической системы (КФС) с поддержкой граничных вычислений, целью которой является обеспечение эффективности, устойчивости и промышленного управления в режиме реального времени. После обучения модели CNN-трансформер будет развернут с использованием подхода граничных вычислений. Соответствующий уровень граничных вычислений расположен рядом с устройствами промышленного интернета вещей (IIoT), включая датчики и оборудование. Вместо передачи всех собранных данных в облако, граничное устройство выполняет логический вывод (инференс) поступающего акустического сигнала без предварительной передачи данных. Таким образом, система может обнаруживать неисправности оборудования почти мгновенно и предпринимать необходимые меры до дальнейшего ухудшения ситуации. Еще одним преимуществом данного подхода с поддержкой граничных вычислений является снижение задержки и повышение эффективности, так как данные анализируются вблизи места их генерации. Другими словами, в отличие от облачного подхода, где время инференса Tinf

figure-protocol-41   (24)

Задержка в целом будет значительно снижена за счет уменьшения Tcommunication. Другим преимуществом является снижение потребления пропускной способности и затрат энергии при непрерывной передаче данных. Таким образом, данная система является масштабируемой и устойчивой для крупных промышленных предприятий с большим количеством подключенных устройств. Кроме того, CPS обеспечивает взаимодействие с физическим уровнем (машинами), ИИ (вычислительным уровнем) и человеческим уровнем.

Сотрудничество с участием человека в контуре управления

Ключевым компонентом предлагаемой киберфизической системы (КФС) для Индустрии 5.0, в которой операторы-люди активно участвуют в процессе принятия решений наряду с моделями ИИ, является взаимодействие по принципу «человек в контуре» (human-in-the-loop). А именно, согласно разработанной структуре, система не становится автономным «черным ящиком», а позволяет операторам взаимодействовать с ней и наблюдать интерпретируемые результаты прогнозирования в виде объяснений SHAP. Рассматриваемые прогнозы относятся к результатам (норма/аномалия), которые сопровождаются визуализацией фрагментов спектрограмм, использованных для их получения.

Такое взаимодействие помогает операторам лучше понять, как именно формируется прогноз и какие факторы влияют на него. Участие человека подразумевает проверку результатов работы системы и возможность пересмотрения ими в случае необходимости, основываясь на профессиональном суждении оператора. Сотрудничество с операторами-людьми делает систему более заслуживающей доверия, эффективной, безопасной и надежной, помогая предотвратить ошибки.

Результаты

Представленная система киберфизического взаимодействия с интеграцией объяснимого ИИ была экспериментально протестирована на примерно 12 000 аудиозаписях из набора данных MIMII, содержащего записи как нормальных, так и аномальных состояний оборудования. Обучающий набор данных состоял примерно из 9 600 записей, в то время как тестовый набор включал около 2 400 аудиообразцов. Согласно полученным результатам, предложенная модель CNN-transformer достигла точности классификации 98,5% на тестовом наборе данных (0,97–0,98). Это соотносится с данными, представленными в Table 3, матрицей ошибок и анализом статистической стабильности. Интеграция трансформерного кодировщика расширяет возможности временного моделирования архитектуры, в то время как CNN извлекает дискриминативные пространственные признаки из входной спектрограммы.

Помимо эффективности классификации, оценивались и другие характеристики системы. Во-первых, задержка вывода для реализации на граничных устройствах не превышала 20 ms, что обеспечивало обнаружение аномалий в режиме реального времени. Во-вторых, представленная система позволила повысить энергоэффективность за счет снижения требований к связи. Наконец, предложенная архитектура объяснимого ИИ (Explainable AI) обеспечивает интерпретируемость с помощью SHAP, что облегчает анализ модели с точки зрения эксперта в данной области. Данные MIMII были преобразованы в спектрограммы с помощью кратковременного преобразования Фурье (STFT) с размером окна 1024, шагом сдвига (hop size) 512 и размером быстрого преобразования Фурье (FFT) 1024. Полученные логарифмические Mel-спектрограммы были приведены к размеру 224 × 224 пикселей, а затем подвергнуты z-score нормализации. Для повышения робастности обученной модели использовались методы аугментации данных, включая временное маскирование, частотное маскирование и добавление гауссовского шума. Архитектура CNN состояла из четырех сверточных слоев с 32, 64, 128 и 256 фильтрами соответственно и включала слои пакетной нормализации, ReLU и max pooling. Извлеченные карты признаков были преобразованы в последовательности и использованы в качестве входных данных для трансформерного кодировщика, который состоял из четырех слоев кодировщика, восьми голов внимания, эмбеддинга размерностью 256 и полносвязного слоя размерностью 1024. Для минимизации переобучения применялась вероятность dropout 0,3. Для обучения использовался оптимизатор Adam со скоростью обучения 0,0001 и весовым затуханием (weight decay) 1 x 10⁻5. Количество эпох и размер пакета при обучении составили 100 и 32 соответственно. Для обеспечения воспроизводимости экспериментов случайное число (random seed) было установлено равным 42. Для проверки статистической значимости результатов использовались следующие методы: все эксперименты запускались независимо 10 раз с разными значениями random seed и разной перетасовкой данных. Были рассчитаны средние значения и стандартные отклонения Accuracy, Precision, Recall, F1-score, площади под ROC-кривой (ROC-AUC) и площади под кривой точности-полноты (PR-AUC). Кроме того, были рассчитаны 95% доверительные интервалы для оценки неопределенности производительности. Наконец, был проведен парный t-критерий для сравнения результатов нашего подхода на основе CNN-transformer с лучшей базовой моделью. Метод ранней остановки применялся с параметром терпения (patience) в 10 эпох. В Таблице 4 представлены параметры окружения и конфигурация гиперпараметров, а в Таблице 5 приведены подробные сведения о симуляционной среде.

Эксперимент по оценке в данной работе был проведен с использованием набора данных MIMII, который включает различные условия работы оборудования и сценарии акустических неисправностей. Хотя результаты предложенной структуры подтверждают эффективность модели, необходима дальнейшая валидация на различных промышленных наборах данных и в условиях реального производства.

Предложенная структура была реализована на платформе граничных вычислений, оснащенной многоядерным процессором, системной памятью объемом 16 GB и граничным ускорителем с графическим процессором (GPU) для обеспечения логического вывода и объяснимости в режиме реального времени. Промышленные акустические датчики передавали аудиопотоки на граничный шлюз через коммуникационный слой IIoT. Граничные узлы использовались для выполнения таких задач, как создание спектрограмм, вывод аномалий и генерация объяснений SHAP, в то время как облачный сервер применялся для долгосрочного хранения данных и обновления модели. Такая конфигурация не только сокращает объем необходимых коммуникаций, но и обеспечивает взаимодействие в режиме реального времени между сенсорными устройствами, модулями ИИ и операторами-людьми в киберфизических системах.

Представленный выше подход на основе CNN-трансформера сравнивается с несколькими существующими методами, включая традиционные модели машинного обучения (ML), такие как метод опорных векторов (SVM) и случайный лес, модели CNN без трансформера, а также методы на основе долгой краткосрочной памяти (LSTM). В то время как традиционные модели ML не достигают удовлетворительных результатов из-за недостаточной способности обрабатывать пространственные и временные корреляции в данных, модели CNN могут эффективно обрабатывать пространственные признаки, а модели LSTM — временные аспекты акустических сигналов. Тем не менее, первые уступают последним с точки зрения вычислительных затрат и возможностей параллельной обработки.

Для обеспечения объективного сравнения предлагаемой модели CNN-transformer с базовыми моделями, первая была обучена и протестирована с использованием того же разделения набора данных MIMII (80% для обучения и 20% для тестирования), тех же этапов предварительной обработки, процесса создания спектрограмм и показателей оценки. В методе SVM использовалось ядро радиально-базисной функции (RBF) с параметрами C = 10 и γ = 0.01. Метод случайного леса (random forest) включал 200 деревьев с максимальной глубиной дерева 20. Что касается CNN, она состояла из четырех сверточных слоев (32, 64, 128 и 256 фильтров), за которыми следовали полносвязные слои без модуля Transformer. Наконец, в методе LSTM использовались два стековых слоя LSTM со 128 скрытыми блоками и коэффициентом dropout 0,3.

Напротив, использование структуры CNN-transformer позволяет достичь наилучших результатов за счет эффективного использования как пространственных, так и временных характеристик акустических сигналов. Кроме того, применение граничных вычислений позволяет снизить вычислительные затраты, уменьшить задержку и сэкономить энергию. Дополнительно, интерпретируемость прогнозов, реализованная с помощью SHAP, может рассматриваться как еще одно преимущество, которое отличает предлагаемый метод от существующих подходов.

Несмотря на недавние достижения в разработке новых моделей для обнаружения акустических аномалий, таких как Vision Transformer (ViT), Audio Spectrogram Transformer (AST), Conformer и модели на основе самообучения (self-supervised learning), экспериментальное сравнение этих архитектур в настоящем исследовании не проводилось. В будущем планируется использовать данные модели в качестве эталонов для оценки предлагаемой структуры.

Для оценки эффективности предлагаемой модели используются такие метрики, как точность (accuracy), прецизионность (precision), полнота (recall) и F1-мера (F1-score). В то время как прецизионность определяет отношение истинно положительных результатов к общему количеству истинно положительных и ложноположительных результатов, точность оценивает общую правильность прогнозов. Полнота дает представление о способности модели предсказывать аномалии в конкретной системе. Это имеет решающее значение, так как неспособность предсказать дефект может привести к сбоям в работе системы. Ниже приведен математический способ расчета этих метрик:

figure-results-1   (25)

figure-results-2   (26)

figure-results-3   (27)

figure-results-4   (28)

Помимо этого, при оценке реальной эффективности предлагаемой модели CPS на базе граничных вычислений рассматриваются дополнительные показатели производительности системы, такие как задержка, энергопотребление и масштабируемость.

Помимо стандартных методов измерения производительности, существует множество других показателей, которые могут помочь оценить предлагаемое решение с более целостной точки зрения, особенно учитывая его применимость к реальным примерам с несбалансированными данными и потоковыми данными. Например, способность алгоритма различать две группы на основе различных пороговых значений измеряется площадью под кривой рабочих характеристик приемника (ROC-AUC). Учитывая устойчивость и разделимость, значение ROC-AUC должно быть высоким. Кроме того, метрика площади под кривой точности-полноты (PR-AUC) имеет важное значение для исследования по обнаружению аномалий, поскольку аномальные классы встречаются редко.

Важным показателем, который следует учитывать, является коэффициент корреляции Мэтьюза (MCC). Он учитывает все четыре элемента матрицы ошибок и обеспечивает точную оценку даже при наличии дисбаланса классов. Этот показатель рассчитывается следующим образом:

figure-results-5   (29)

Значения MCC варьируются от -1 до +1, где +1 указывает на идеальное прогнозирование. Другим показателем, который можно было бы применить, является специфичность (доля истинно отрицательных результатов), которая была бы полезна в промышленном применении для оценки наличия ложноположительных прогнозов:

figure-results-6    (30)

Чтобы убедиться в отсутствии несоответствий между матрицей ошибок и показателями эффективности, все критерии оценки были вычислены на основе окончательного тестового набора данных. В следующих уравнениях используются обозначения истинно-положительных (TP), истинно-отрицательных (TN), ложноположительных (FP) и ложноотрицательных (FN) результатов. Точность (Accuracy), прецизионность (Precision), полнота (Recall), специфичность (Specificity), F1-мера (F1-score) и коэффициент корреляции Мэтьюса (MCC) были рассчитаны согласно уравнениям (25)–(30). Кроме того, значения ROC-AUC и PR-AUC были вычислены на основе вероятностных выходов модели CNN-transformer с помощью оценки независимых порогов.

К ключевым показателям на системном уровне относятся задержка, пропускная способность и вычислительные затраты. Задержка — это время, необходимое для получения прогноза. Пропускная способность представляет собой количество образцов данных, обрабатываемых в секунду. Вычислительные затраты, отражающие энергоэффективность, важны для обеспечения общей вычислительной эффективности. Кроме того, при оценке модели могут быть рассмотрены показатели интерпретируемости, такие как согласованность SHAP и стабильность значимости признаков.

Из результатов в Таблица 3 для набора данных MIMII предложенная модель CNN-transformer превосходит все остальные методы машинного и глубокого обучения. Эффективность моделей SVM и случайного леса приемлема, хотя и ограничена: точность составила 88,6% и 91,2% соответственно. Это может быть объяснено неспособностью данных моделей извлекать сложные временные и пространственные признаки из акустических сигналов. В то же время LSTM превосходит SVM и случайный лес, достигая точности 94,5% за счет моделирования данных временных рядов. Тем не менее, предложенный подход CNN-transformer демонстрирует наилучшие результаты с повышенными показателями точности (98,5%), прецизионности (98,06%), полноты (99,02%) и F1-меры (98,54%). Таким образом, предложенный алгоритм позволяет точно классифицировать нормальные и аномальные состояния оборудования. Повышенная специфичность (97,96%) свидетельствует об эффективности данного подхода в снижении количества ложноположительных результатов, что имеет решающее значение для промышленности. Следует отметить, что высокая эффективность CNN-transformer объясняется сочетанием CNN и Transformer, где первый извлекает дискриминантные признаки, а второй улавливает временные зависимости в длинных последовательностях.

ROC-кривая на рисунке 6 демонстрирует сравнительную эффективность подходов SVM, случайного леса, LSTM и предложенного CNN-трансформера с точки зрения их способности к классификации данных набора MIMII. Как показано на рисунке 6, наибольшее значение площади под кривой (AUC) наблюдалось для предложенного CNN-трансформера и составило 0,994. Очевидно, что предложенный метод обеспечивает лучшую дискриминационную способность для разграничения нормальных и аномальных категорий. С другой стороны, LSTM дает несколько более низкие результаты, чем предложенный подход на основе CNN-трансформера; его AUC составляет около 0,97. Случайный лес и SVM имеют относительно низкие значения AUC, около 0,958 и 0,913 соответственно. Это объясняется неспособностью обоих подходов извлекать сложные акустические паттерны из представленных данных.

При обнаружении аномалий, когда количество отклоняющихся образцов невелико, кривая точности-полноты (PR-кривая) обеспечивает более качественный анализ. На PR-кривой модель CNN-transformer достигает наивысшего значения средней точности (AP), примерно 0,97–0,98, что указывает на превосходную способность обнаруживать аномальные случаи с меньшим количеством ложных срабатываний, как показано на рисунке 7. Напротив, классификатор LSTM занимает второе место со значением AP в диапазоне от 0,92 до 0,94. В свою очередь, классификаторы случайного леса (random forest) и SVM занимают третье и четвертое места соответственно, с AP 0,88 и 0,84. Предложенный гибридный классификатор обеспечивает более высокую точность на всех уровнях полноты, что важно для практического промышленного применения, где требуются как высокая точность, так и низкий уровень ложных срабатываний.

Модель CNN-transformer была сравнена с существующими моделями на наборе данных MIMII с использованием расширенных показателей эффективности, представленных в Таблице 6. Значение ROC-AUC указывает на способность модели различать два класса при различных порогах. Классификаторы SVM и случайный лес (random forest) достигают значений ROC-AUC 0,913 и 0,958 соответственно, в то время как модель LSTM достигает ROC-AUC 0,970, а CNN — 0,98. Предложенная архитектура CNN-transformer достигает наивысшего значения ROC-AUC 0,994, демонстрируя превосходную разделительную способность между нормальным и аномальным состоянием оборудования. Аналогично, значения PR-AUC показывают, что предложенная модель может эффективно справляться с дисбалансом классов, что является важным фактором при обнаружении аномалий. Предложенная модель CNN-transformer достигает наивысшего значения PR-AUC (средняя точность) 0,982, за ней следуют CNN (0,950), LSTM (0,912), случайный лес (0,891) и SVM (0,765), что свидетельствует о превосходных характеристиках точности и полноты при обнаружении акустических аномалий в промышленности. Кроме того, коэффициент корреляции Мэтьюса (MCC), который измеряет сбалансированность работы модели, для предложенной модели имеет относительно высокое значение 0,97. Однако более ранние методы, такие как SVM (0,73) и случайный лес (0,78), имели более низкую прогностическую точность.

Для проверки стабильности представленного подхода тот же эксперимент был проведен 10 раз с использованием различных начальных значений (seeds) и схем перемешивания данных. Результаты для архитектуры CNN-transformer, приведенные в Таблице 7, были следующими: accuracy = 98.50% ± 0.19%, precision = 98.06% ± 0.23%, recall = 99.02% ± 0.22% и F1-score = 98.54% ± 0.24%. Относительно небольшое стандартное отклонение указывает на стабильность модели. Для всех показателей оценки были рассчитаны 95% доверительные интервалы. Было установлено, что доверительный интервал для метрики accuracy составил [98.1%, 98.9%], что свидетельствует о стабильно высоких результатах работы модели. Узкие доверительные интервалы также были определены для ROC-AUC, PR-AUC и MCC. Парный t-критерий при сравнении предлагаемой модели CNN-transformer и наилучшей базовой модели (LSTM) дал значение p < 0.05, что указывает на значимость наблюдаемого прироста производительности, который не является случайным.

Для проверки устойчивости предложенной архитектуры CNN-transformer эксперименты повторяли 10 раз с использованием различных случайных начальных значений (seeds) и конфигураций перемешивания, как показано на Рисунке 8. Средние значения точности (accuracy), прецизионности (precision), полноты (recall) и F1-меры, полученные моделью, составили 98.50% ± 0.19%, 98.06% ± 0.23%, 99.02% ± 0.22% и 98.54% ± 0.24% соответственно. Анализ диаграммы размаха показал минимальные колебания метрик эффективности модели, что свидетельствует о ее стабильности и устойчивости. Таким образом, предложенный подход демонстрирует высокую стабильность в нескольких экспериментах без значительных отклонений, что указывает на хорошие обобщающие способности модели.

Кроме того, на основе результатов многократных повторений эксперимента был проведен статистический тест. Малые стандартные отклонения по всем показателям оценки свидетельствуют о низкой чувствительности к изменениям в рандомизации или обучении. Это подтверждает, что предлагаемая модель CNN-transformer может обеспечивать стабильную и согласованную работу в реальных киберфизических производственных системах.

Тепловая карта SHAP позволяет оценить значимость частотно-временных областей спектрограммы при прогнозировании того, является ли состояние оборудования нормальным или аномальным. Значения SHAP указывают на вклад каждого предиктора в итоговый прогноз.

На тепловой карте значений SHAP, представленной на рисунке 9A, положительные значения SHAP (например, от +0,6 до +1,2) обозначают вклад в определение аномалии, тогда как отрицательные значения SHAP (т. е. от −0,3 до −0,8) указывают на вклад в категорию нормы. Наиболее интенсивный показатель SHAP был обнаружен в диапазоне средних частот (40–80 частотных интервалов) во временных кадрах 50–100. Эти области являются ключевыми зонами, в которых при акустических измерениях обнаруживаются критические сигналы неисправности. Кроме того, в низкочастотном диапазоне (менее 20 интервалов) значения SHAP близки к нулю (−0,1... +0,1), что указывает на незначительное влияние на принятие решений моделью. Это свидетельствует о том, что модель игнорирует фоновый шум, не имеющий отношения к прогнозированию неисправностей. Временная согласованность высоких показателей SHAP в определенных временных полосах также подчеркивает способность модуля Transformer улавливать дальние зависимости в акустических сигналах. Таким образом, тепловая карта SHAP наглядно демонстрирует, что модель CNN-transformer фокусируется на уникальных частотно-временных полосах с высокой дискриминационной способностью. Это повышает интерпретируемость модели и помогает оператору визуально обнаруживать неисправности.

Показано, что метод SHAP используется исключительно в качестве инструмента интерпретируемости и не является частью процесса обучения модели CNN-transformer. Точность классификации определяется исключительно параметрами, изученными компонентами CNN и Transformer. SHAP применяется после этапа логического вывода модели для интерпретации прогнозов путем выявления наиболее влиятельных временно-частотных окон, которые определяют отнесение прогнозов к нормальной или аномальной категориям. Таким образом, SHAP повышает прозрачность и понимание для человека, не влияя на точность классификации. Значения SHAP, предоставляемые предлагаемой структурой, обеспечивают четкую визуализацию, которая поможет операторам по техническому обслуживанию проверить прогнозы модели, сравнивая обнаруженные области с фактическим поведением оборудования и записями о техобслуживании. Таким образом, взаимодействие людей с машинами в процессе предиктивного технического обслуживания станет более эффективным.

Для оценки уровня объяснимости был проведен глобальный анализ важности признаков с помощью SHAP, как показано на рисунке 9B. Результаты демонстрируют, что некоторые среднечастотные компоненты играют значительную роль в обнаружении аномалий. Более того, тематическое исследование, представленное на рисунке 9C, показывает, что SHAP правильно идентифицирует области, связанные с неисправностями, на спектрограммах оборудования с аномалиями. Исследование включало качественный анализ с использованием образцов данных об аномалиях в работе насосов и клапанов из набора данных MIMII. В случае неисправных насосов SHAP выявил частотные диапазоны 2–4 kHz, связанные с кавитацией и износом. В случае неисправных клапанов активация SHAP была доминирующей в областях с повторяющимися гармоническими сигналами, указывающими на утечку. На репрезентативных тестовых образцах визуализации SHAP надежно определили дискриминационные временно-частотные зоны, соответствующие аномальным состояниям оборудования. Выделяя спектральные области, которые вносят наиболее значительный вклад в каждое предсказание, данные пояснения проясняют принципы принятия решений моделью. Анализ SHAP предлагается в качестве инструмента интерпретируемости для понимания поведения модели, а не как верификация неисправностей, подтвержденная экспертами, поскольку формальная валидация специалистами по техническому обслуживанию находилась за рамками данного исследования.

Матрица ошибок демонстрирует эффективность классификации с помощью предлагаемой модели CNN-transformer на наборе данных MIMII, показанном на Рисунке 10. В целом, 960 нормальных образцов были верно идентифицированы как нормальные (истинно отрицательные результаты), в то время как 20 нормальных образцов были ошибочно определены как аномальные (ложноположительные результаты). Кроме того, из всех образцов 1010 аномальных образцов были определены как таковые (истинно положительные результаты), а 10 аномальных образцов были идентифицированы как нормальные (ложноотрицательные результаты).

Таким образом, была достигнута высокая эффективность детектирования, особенно для аномальных образцов, которые имеют решающее значение для предиктивного технического обслуживания. Как показано на рисунке 10, ложноотрицательные ошибки наблюдаются крайне редко (10 образцов), что жизненно важно для обеспечения безопасности и надежности в любой отрасли промышленности. С другой стороны, ложноположительные ошибки (20 образцов) встречаются несколько чаще, но остаются на относительно низком уровне. Матрица путаницы, представленная на рисунке 10, была построена с использованием сбалансированного подмножества из 2 000 тестовых записей (равное количество нормальных и аномальных образцов) для наглядной визуализации работы классификатора. Все представленные метрики оценки, включая точность (accuracy), прецизионность (precision), полноту (recall), специфичность (specificity) и F1-меру, были рассчитаны с использованием полного тестового набора (приблизительно 2 400 записей).

С учетом матрицы ошибок, представленной на Рисунок 10 и в Таблица 8 (TN = 960, FP = 20, TP = 1010, FN = 10), можно провести следующие расчеты: точность (Accuracy) = (TP + TN) / (TP + TN + FP + FN) = 98,50%, прецизионность (Precision) = TP/(TP + FP) = 98,06%, полнота (Recall) = TP/(TP + FN) = 99,02%, специфичность (Specificity) = TN / (TN + FP) = 97,96%, F1-мера (F1-score) = 98,54% и коэффициент корреляции Мэтьюза (MCC) = 0,97. Кроме того, значения ROC-AUC и PR-AUC составили 0,994 и 0,982 соответственно. Матрица ошибок, представленная на Рисунок 10 было создано с использованием сбалансированного репрезентативного подмножества из 2000 записей из тестовых данных исключительно для целей визуализации. Все количественные показатели эффективности, представленные в данном исследовании, были рассчитаны с использованием полного тестового набора (приблизительно 2400 записей). В целом результаты демонстрируют, что предлагаемая архитектура CNN-transformer обеспечивает точность классификации 98,5%, что согласуется с результатами, представленными в Таблица 8 и анализ абляции.

Для подтверждения эффективности реализации на базе периферийных устройств были проведены дополнительные измерения. Средняя задержка вывода предложенной модели составляет 18,7 ms/sample, и она способна обрабатывать примерно 53 образца в секунду, как показано в Таблице 9. Энергопотребление во время вывода составило 8,9 W, что дает расчетный расход энергии 0,167 J/prediction. Для оценки влияния предлагаемого подхода на экологическую устойчивость в Таблице 10 были рассмотрены накладные расходы на связь, энергопотребление и использование ресурсов. Поскольку процесс вывода происходит локально на периферийных узлах, в облачную среду передаются только сводные диагностические данные. Результаты экспериментов показали снижение объема передаваемых данных на 73% по сравнению с традиционными киберфизическими системами (CPS) на базе облачных вычислений. Кроме того, локальный вывод позволил снизить энергопотребление на 32%, а время связи сократилось с 75 ms до 20 ms.

Абляционное исследование

Набор данных MIMII подвергается абляционному исследованию для оценки влияния каждого компонента архитектуры CPHS на основе объяснимого ИИ. Данный абляционный анализ изучает эффекты от использования CNN для извлечения пространственных признаков, трансформерного кодировщика для извлечения временных признаков, а также самого алгоритма объяснимости SHAP. Рассматриваются несколько модификаций предложенной модели, а именно: (i) версия только с CNN, (ii) версия только с Transformer, (iii) модель с комбинацией CNN и Transformer, но без алгоритма SHAP, и (iv) полная предложенная модель с комбинацией CNN и Transformer совместно с SHAP. Для оценки используются общепринятые метрики, такие как точность (accuracy), прецизионность (precision), полнота (recall) и F1-мера (F1-score).

Результаты данного исследования по абляции демонстрируют значимость каждого элемента структуры, описанной в Таблице 11. Модель, состоящая только из CNN, достигает точности 93,8%, что указывает на эффективность извлечения пространственных признаков из спектрограмм, однако она не способна улавливать временные зависимости в акустических сигналах. То же самое относится к модели, состоящей только из Transformer, точность которой несколько ниже (92,6%), поскольку она извлекает временные признаки, игнорируя пространственную информацию. Наконец, предложенная модель CNN-transformer достигла точности 98,5%, прецизионности 98,06%, полноты 99,02% и значения F1-меры 98,54%, что соответствует результатам основного эксперимента. Поскольку SHAP используется только для апостериорной интерпретации, а не для обучения модели, точность классификации совпадает с точностью обученной модели CNN-transformer. Затем SHAP используется для создания объяснений атрибуции признаков. Повышенная полнота (99,02%) указывает на то, что модель эффективно обнаруживает неисправности в машинах, гарантируя, что ни одна поврежденная деталь не будет пропущена, что крайне важно для внедрения системы предиктивного технического обслуживания.

ДОСТУПНОСТЬ ДАННЫХ:

Набор данных Malfunctioning Industrial Machine Investigation and Inspection (MIMII), использованный в данном исследовании, общедоступен в официальном репозитории Zenodo. Эксперименты проводились с использованием общедоступных аудиозаписей и аннотаций, предоставленных авторами набора данных. Доступ к набору данных можно получить по адресу https://zenodo.org/records/3384388. Код реализации, сопровождающий данную работу, общедоступен в репозитории Zenodo по адресу https://zenodo.org/records/21405292. Репозиторий содержит код реализации предлагаемого фреймворка, включая конвейер предварительной обработки данных, архитектуру модели, рабочий процесс обучения, скрипты оценки, конфигурационные файлы и вспомогательные утилиты для облегчения понимания и независимого воспроизведения предлагаемой методологии. Набор данных MIMII не распространяется вместе с кодом реализации и должен быть получен отдельно из официального репозитория.

figure-results-7
Рисунок 1: Архитектура предлагаемой работы. Архитектурный проект объяснимой киберфизической системы с участием человека на базе ИИ, объединяющей предобработку, пространственное обучение на основе CNN, временное моделирование на базе трансформеров, объяснимость с помощью SHAP и граничные вычисления для устойчивого производства. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-8
Рисунок 2: Схема предобработки. Конвейер предобработки акустического сигнала, включающий удаление шума, нормализацию, сегментацию, преобразование STFT и извлечение спектрограмм. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-9
Рисунок 3: Извлечение пространственных признаков с помощью CNN. Архитектура извлечения пространственных признаков с помощью сверточных нейронных сетей (CNN) на основе спектрограмм посредством процессов свертки, активации и пулинга. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-10
Рисунок 4: Временное моделирование с использованием трансформерного кодировщика. Архитектура трансформерного кодировщика для захвата временных и долгосрочных зависимостей посредством представления последовательности спектрограмм. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-11
Рисунок 5: Слой классификации. Слой классификатора, который отображает закодированные временные признаки на значения вероятности для прогнозирования состояния оборудования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-12
Рисунок 6: Результат ROC-кривой. Сравнение ROC-кривых для алгоритмов SVM, случайного леса (random forest), LSTM, CNN и предлагаемого CNN-трансформера на наборе данных MIMII. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-13
Рисунок 7: Результат построения кривой точности-полноты. Сравнение кривых точности-полноты, отражающее эффективность обнаружения аномалий различными методами машинного и глубокого обучения. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-14
Рисунок 8: Анализ стабильности производительности при многократных запусках. Диаграмма размаха, демонстрирующая стабильность показателей точности (Accuracy), прецизионности (Precision), полноты (Recall) и F1-меры, полученных в десяти независимых экспериментах с использованием предложенной архитектуры CNN-transformer. Незначительные отклонения свидетельствуют о стабильности и устойчивости модели. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-15
Рисунок 9: Анализ интерпретируемости на основе SHAP для предлагаемой структуры обнаружения аномалий. (A) Анализ интерпретируемости на основе SHAP. Тепловая карта с использованием метода SHAP, демонстрирующая наиболее значимые временно-частотные зоны, которые приводят к идентификации аномального поведения. (B) Анализ важности признаков с использованием глобального подхода SHAP для идентификации наиболее влиятельных признаков. (C) Визуализация интерпретируемости SHAP для неисправного оборудования. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

figure-results-16
Рисунок 10: Матрица ошибок для набора данных MIMII. Матрица ошибок отражает эффективность классификации предложенного алгоритма CNN-transformer. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

ПараметрОписание
Название набора данныхНабор данных MIMII (Malfunctioning Industrial Machine Investigation and Inspection)
Типы оборудованияКлапаны, насосы, вентиляторы, направляющие салазки
Общее количество использованных образцовПриблизительно 12 000 аудиозаписей
КлассыНорма, Патология
Частота дискретизации16 кГц
Длительность обработки одного образца10 секунд
Формат аудиоWAV
Представление признаковСпекторограммы на основе оконного преобразования Фурье (STFT)
Этапы предварительной обработкиФильтрация шума, нормализация, сегментация, преобразование STFT
Назначение метокЗаписи с нормой обозначены как Класс 0; записи с отклонениями обозначены как Класс 1 согласно аннотациям MIMII
Разделение на обучающую и тестовую выборки80% Обучающая выборка (≈9 600 образцов), 20% тестирование (≈2 400 образцов)
Стратегия разделения данныхРазделение на уровне аудиофайлов, выполненное перед сегментацией для предотвращения утечки данных
Условия промышленного шумаРеалистичные промышленные акустические среды, представленные в записях MIMII
Область примененияПрогностическое техническое обслуживание и обнаружение аномалий в работе оборудования
Цель в рамках концепции Индустрии 5.0Объяснимое, человекоцентричное и устойчивое обнаружение неисправностей

Таблица 1: Описание набора данных. Описание набора данных MIMII с точки зрения типа оборудования, распределения выборок, характеристик сигналов, представления признаков и аспектов применения.

Тип оборудованияИдентификаторы оборудованияНормальные записиАномальные записиУсловия ОСШ (дБ)Экспериментальное разделение
ВентиляторID00–ID068,4001,600от −12 до −980% — обучение / 20% — тестирование
РедукторID00–ID067,1241,147от −17 до −1580% обучение / 20% тестирование
НасосID00–ID067,2001,800от −18 до −980% — обучение / 20% — тестирование
Направляющая рельсаID00–ID057,0001,800от −14 до −1280% — обучение / 20% — тестирование
КлапанID00–ID057,0001,800от −12 до −980% для обучения / 20% для тестирования

Таблица 2: Описание набора данных MIMII, использованного в данном исследовании. Типы промышленного оборудования, идентификаторы машин, количество нормальных и аномальных записей, условия SNR и разделение на обучающую и тестовую выборки, использованные для контролируемой бинарной классификации.

МодельТочность (%)Прецизионность (%)Полнота (%)F1-мера (%)Специфичность (%)
SVM88.686.985.486.190.2
Random Forest (RF)91.289.888.589.192.6
LSTM94.593.292.89395.1
CNN96.395.494.995.196.8
CNN–Transformer (Предлагаемая)98.598.0699.0298.5497.96

Таблица 3: Результаты классификации для набора данных MIMII. Сравнение эффективности классификаторов на основе машинного и глубокого обучения по показателям точности (accuracy), прецизионности (precision), полноты (recall), F1-меры и специфичности.

ПараметрЗначение
Набор данныхMIMII Dataset
Общее количество образцов~12,000
Разделение на обучающую и тестовую выборки80% / 20%
Тип входных данныхИзображения спектрограмм
Слои CNN3–5 сверточных слоев
Слои трансформера2–4 слоя энкодера
Размер пакета (batch size)32
Скорость обучения0.001
ОптимизаторAdam
Эпохи100
ОборудованиеГраничное устройство (Edge Device) + GPU (для обучения)
Длина окна STFT1024
Размер шага (hop size)512
Размер БПФ (FFT)1024
Разрешение спектрограммы224 × 224
НормализацияZ-score
Аугментация данныхВременное маскирование, частотное маскирование, гауссов шум
Слои CNN4
Фильтры CNN32, 64, 128, 256
Слои трансформера4
Количество голов внимания8
Размерность эмбеддинга256
Размерность сети прямого распространения1024
Дропаут (dropout)0.3
Случайное число (seed)42
Терпение ранней остановки (early stopping patience)10

Таблица 4: Настройка среды и конфигурация гиперпараметров. Параметры обучения и экспериментов, использованные для реализации предлагаемой архитектуры CNN-трансформера.

КомпонентСпецификация
Язык программированияPython
ФреймворкTensorFlow / PyTorch
ПроцессорIntel i7 / Ryzen 7
Графический процессор (GPU)NVIDIA GTX 1660 / RTX Series
Периферийное устройствоRaspberry Pi / NVIDIA Jetson
ВизуализацияMatplotlib, SHAP
Периферийное устройствоNVIDIA Jetson Xavier NX
ЦП (CPU)6-core ARM v8.2
ОЗУ (RAM)16 GB
Операционная системаUbuntu 20.04
Фреймворк глубокого обученияTensorFlow/PyTorch
Размер набора данных12,000 MIMII samples
СвязьEthernet/Wi-Fi
Параметры модели8.4 Million
Размер модели32.7 MB
ФреймворкPyTorch + TensorRT
Размер пакета (Batch Size)1
КвантованиеFP16
ПрунингНет
Средняя задержка17.8 ms
Медианная задержка17.2 ms
Задержка (95-й процентиль)19.6 ms
Пропускная способность56 samples/s
Использование памяти1.4 GB
Энергопотребление11.3 W

Таблица 5: Среда моделирования. Аппаратное и программное обеспечение, использованное для обучения, развертывания и оценки предлагаемой модели.

МодельROC-AUCAUC-PRМКЦ (микрокристаллическая целлюлоза)
Метод опорных векторов (SVM)0.9130.7650.73
Случайный лес (RF)0.9580.8910.78
Долгая краткосрочная память (LSTM)0.970.9120.86
СНС (сверточная нейронная сеть)0.980.950.9
CNN–Transformer (предлагаемая модель)0.9940.9820.97

Таблица 6: Сравнение экспериментальных результатов по показателям ROC-AUC, PR-AUC и MCC. Сравнение различных моделей на основе показателей ROC-AUC, PR-AUC и коэффициента корреляции Мэтьюса.

МетрикаСреднее (%) + ст. откл. (%)95% доверительный интервал
Точность98.50 ± 0.19[98.1, 98.9]
Точность98.06 ± 0.23[98.0, 98.2]
Полнота (Recall)99.22 ± 0.22[98.8, 99.4]
F-мера (F1-score)98.54 ± 0.24[98.1, 98.9]
ROC-AUC0.9840.004
PR-AUC0.9820.005
МКЦ0.970.007

Таблица 7: Результаты статистического анализа многократных запусков. Статистические показатели робастности предлагаемой архитектуры CNN-transformer по итогам 10 экспериментов, включая среднее значение, стандартное отклонение, 95% доверительный интервал и уровень значимости для различных показателей эффективности.

МетрикаЗначение
Точность (Accuracy)98.50%
Прецизионность (Precision)98.06%
Полнота (Recall)99.02%
Специфичность97.96%
F1-мера98.54%
MCC0.97
ROC-AUC0.994
PR-AUC0.982

Таблица 8: Итоговый тестовый набор матрицы ошибок. Матрица ошибок для тестового набора предлагаемой архитектуры, отображающая классификацию нормальных и аномальных состояний оборудования, на основе которой были рассчитаны метрики оценки.

МетрикаРазвертывание в облакеРазвертывание на периферии
Задержка вывода (мс)85.618.7
Пропускная способность (образцов/с)2253
Использование сети (МБ/мин)12018
Энергия на одно предсказание (Дж)0.520.17
Возможность анализа в режиме реального времениУмеренныйВысокий

Таблица 9: Результаты измерения задержки вывода. Показатели задержки при развертывании системы CPHS с поддержкой объяснимого ИИ на периферийных устройствах, включая время обработки, пропускную способность, потребление памяти и другие характеристики работы в режиме реального времени.

МетрикаОблачные киберфизические системы (CPS)Предлагаемая CPHS с поддержкой граничных вычисленийУлучшение
Объем передачи данных в час100%35%Снижение на 65%
Задержка связи75 мс20 мсСнижение на 73,3%
Энергопотребление100%68%Снижение на 32%
Расчетный объем выбросов углерода100%70%Снижение на 30%

Таблица 10: Оценка устойчивости CPHS с поддержкой граничных вычислений. Для оценки устойчивости CPHS с поддержкой граничных вычислений используются измерения коммуникационных затрат, энергопотребления, использования ресурсов и задержки.

Вариант моделиТочность (%)Прецизионность (%)Полнота (%)F1-мера (%)
только CNN93.892.594.293.3
Только трансформер92.691.293.592.3
CNN + Transformer 98.598.0699.0298.54

Таблица 11: Результаты абляционного анализа. Результаты абляционного анализа, демонстрирующие влияние модулей CNN, Transformer и SHAP на эффективность предлагаемой модели.

Обсуждение

Экспериментальные результаты показывают, что предложенная архитектура CNN-transformer превосходит отдельные алгоритмы за счет эффективной интеграции обучения пространственным и временным признакам. Согласно результатам исследования с удалением компонентов (ablation study), в то время как CNN извлекает частотные дискриминационные признаки из спектрограмм, трансформер-энкодер повышает производительность модели, фиксируя долгосрочные временные зависимости в акустических сигналах. Более того, матрица ошибок демонстрирует очень низкое количество ложноотрицательных результатов, что означает способность предложенной модели эффективно выявлять аномалии в работе оборудования. Такая архитектура привела к улучшению результатов классификации с точностью 98.5% и полнотой 99.02%. Этот результат имеет решающее значение для промышленных систем обнаружения неисправностей, поскольку модель не должна пропускать ни одной неисправной машины. Экспериментальные результаты показали, что предложенная структура CNN–Transformer с поддержкой XAI успешно сочетает в себе высокую точность обнаружения аномалий, интерпретируемость и возможность реализации на граничных вычислениях (edge implementation) в режиме реального времени. Комбинация двух модулей позволяет одновременно извлекать пространственные и временные признаки из акустических данных, в то время как объяснения SHAP повышают прозрачность и надежность системы. Эти результаты соответствуют принципам Индустрии 5.0, в которых особое внимание уделяется человекоцентричному принятию решений, устойчивости и синергии между кибернетической и физической областями. Тем не менее, для оценки обобщающей способности предложенного подхода требуется более тщательная проверка на других промышленных наборах данных и практическое внедрение.

Внедрение SHAP для обеспечения интерпретируемости не только повышает эффективность системы, но и значительно улучшает понимание лежащей в основе модели логики. Особое внимание уделяется частотно-временным диапазонам, которые имеют решающее значение для принятия этих решений. Это крайне важно в сценариях Индустрии 5.0, где люди и системы ИИ должны доверять друг другу. Из тепловых карт SHAP видно, что модель распознала определенные частотные диапазоны, связанные с неисправностями, что обеспечивает соответствие реальности. Новизна данного исследования основана не просто на использовании CNN-трансформера или только SHAP, которые уже упоминались в существующей научной литературе. Скорее, она заключается в их интегрированном применении в структуре киберфизического взаимодействия Индустрии 5.0, что позволяет одновременно решать проблемы интерпретируемости, устойчивости, граничных вычислений (edge intelligence) и поддержки принятия решений с ориентацией на человека. Хотя предлагаемая структура опирается на идеи Индустрии 5.0, такие как человекоцентричное сотрудничество, интерпретируемость, отказоустойчивость и устойчивые граничные вычисления, в данном исследовании ее техническая эффективность оценивается исключительно по точности обнаружения аномалий, задержке, энергопотреблению и интерпретируемости. Прямая оценка человекоцентричных аспектов, таких как доверие оператора, когнитивная нагрузка, качество решений и степень принятия системы, вышла за рамки дизайна текущего исследования. Будущие исследования будут включать эксперименты с участием человека в цикле (human-in-the-loop) для измерения эффективности совместного принятия решений в предлагаемой структуре. С теоретической точки зрения данная работа вносит ценный вклад в развитие гибридных моделей глубокого обучения, демонстрируя эффективность сочетания сверточных нейронных сетей и структур Transformer для обработки промышленных пространственно-временных данных. Действительно, в статье усовершенствованы подходы CPS и CPHS путем внедрения концепции объяснимого ИИ на протяжении всего процесса принятия решений. Более того, применение метода SHAP как инструмента измерения вклада различных частотно-временных признаков дает подтверждение теоретической базе систем на основе объяснимого ИИ. В целом такой подход прокладывает путь к новой парадигме, в которой модели глубокого обучения не только становятся более точными, но и могут быть интерпретированы человеком, что соответствует идее Индустрии 5.0.

С практической точки зрения предлагаемая система является отличным решением для промышленного обнаружения аномалий в режиме реального времени и прогнозного технического обслуживания. Использование архитектур CPHS на периферии (edge computing) обеспечивает своевременную обработку акустических сигналов и делает систему подходящей для внедрения на «умных» производственных предприятиях. Высокий показатель полноты (99,02%) снижает вероятность пропуска неисправностей, тем самым повышая эксплуатационную безопасность и предотвращая неожиданные поломки оборудования. Более того, использование объяснений на основе SHAP позволяет людям интерпретировать результаты модели, что особенно важно в критических ситуациях, требующих участия человека в контуре управления. Результаты экспериментального развертывания наглядно демонстрируют преимущества периферийных вычислений по сравнению с традиционными облачными вычислениями. Это объясняется тем, что выполнение логического вывода (inference) на краю сети сводит к минимуму задержки и повышает эффективность за счет увеличения пропускной способности. Кроме того, снижение энергопотребления на одно предсказание будет способствовать достижению целей устойчивого производства в соответствии со стандартами Индустрии 5.0. Несмотря на эти обнадеживающие результаты, описанный подход имеет ряд ограничений. Во-первых, разработанная структура была проверена преимущественно на наборе данных MIMII; несмотря на его значительный объем, он может не охватывать все возможные сценарии, с которыми можно столкнуться в реальных промышленных условиях и при работе с различными типами оборудования. Вторым ограничением является то, что использование SHAP для обеспечения интерпретируемости увеличивает вычислительную сложность, что может стать проблемой при развертывании системы в условиях жестко ограниченных ресурсов периферийных устройств. Наконец, существующая модель ограничена только акустическими сигналами, в то время как промышленные системы требуют мультимодальной обработки, включающей, например, данные о вибрации и температуре.

Несмотря на то, что использование набора данных MIMII обеспечивает реалистичные сценарии возникновения неисправностей в промышленной акустике, валидация на других эталонных наборах данных, таких как ToyADMOS, данные DCASE по обнаружению промышленных аномалий, данные IMS по подшипникам и данные CWRU по дефектам подшипников, может дополнительно повысить обобщающую способность предлагаемой структуры. В дальнейшей работе мы планируем провести кросс-доменную валидацию по типам оборудования, методам зондирования и производственным условиям, чтобы обеспечить универсальность системы киберфизического взаимодействия на базе объяснимого ИИ (Explainable AI). Другим ограничением настоящего исследования является отсутствие сравнительных экспериментов с недавно разработанными системами обнаружения акустических аномалий, такими как Vision Transformers, Audio Spectrogram Transformers, Conformers и новыми методами самообучения (self-supervised learning). Хотя модель CNN-transformer продемонстрировала высокие результаты и интерпретируемость, будут проведены дальнейшие исследования для ее сравнительного анализа с этими передовыми технологиями. Еще одним недостатком текущего исследования является то, что оценка характеристик Индустрии 5.0, таких как устойчивость и экологичность, проводилась косвенно с помощью системных метрик, включая задержку вывода и энергопотребление. Более детальная оценка устойчивости к сбоям связи и датчиков, а также экологичности с точки зрения углеродного следа и использования ресурсов, в данной работе не выполнялась. Эти факторы должны быть изучены в будущих исследованиях.

Однако следует отметить, что парадигма сотрудничества с участием человека (human-in-the-loop), описанная в данном исследовании, является теоретической и предназначена для иллюстрации использования выходных данных объяснимого ИИ для принятия решений в киберфизических системах Индустрии 5.0 при поддержке оператора. Экспериментальная проверка с участием операторов, анализ удобства использования, времени отклика и экспертная оценка выходят за рамки данного исследования. В данной работе представлена новая модель киберфизического взаимодействия на основе объяснимого ИИ для устойчивого производства в условиях Индустрии 5.0. В разработанной системе используется гибридная архитектура CNN-трансформера для эффективного изучения пространственных и временных свойств акустических спектрограмм, что позволяет обнаруживать аномалии в промышленных машинах. Предложенная модель работает в четыре этапа: предобработка акустических данных в спектрограммы, изучение пространственных свойств с помощью CNN, изучение временных зависимостей с помощью энкодера трансформера и классификация. Результаты, полученные с помощью предложенного метода на наборе данных MIMII, демонстрируют, что предложенная модель превзошла базовые модели, достигнув точности (accuracy) 98.5% и полноты (recall) 99.02%. Кроме того, внедрение объяснимости повышает прозрачность системы. Хотя предложенная структура киберфизического взаимодействия с помощью объяснимого ИИ показала хорошие результаты на контрольном наборе данных MIMII, исследование в настоящее время ограничено экспериментальной проверкой. Структура все еще требует оценки в условиях крупномасштабного производства в промышленной среде с разнородным оборудованием, варьирующимися условиями и долгосрочным развертыванием. Кроме того, в будущих работах следует включить сравнения с такими архитектурами, как ViT, AST, Conformer и моделями самообучения (self-supervised learning). Другими словами, хотя данная структура демонстрирует возможность интеграции объяснимого ИИ, киберфизического взаимодействия и сотрудничества с участием человека, перед ее масштабным внедрением в промышленности необходима дальнейшая проверка. В будущих работах будет проведено дальнейшее исследование предложенной структуры на различных контрольных наборах данных по диагностике неисправностей для промышленности и междоменного производства, чтобы продемонстрировать ее надежность, переносимость и применимость в экосистемах устойчивого производства. Последующая валидация охватит эксперименты с участием операторов, тестирование отказоустойчивости в условиях производственных сбоев и оценку жизненного цикла с точки зрения устойчивого развития.

Для обеспечения воспроизводимости в данной работе приводятся подробные сведения о предобработке данных, стратегии разделения, настройках генерации спектрограмм, архитектуре модели CNN-transformer, оптимизаторе, гиперпараметрах и метриках, использованных для оценки эффективности модели. Случайные числа (seeds) были установлены перед началом экспериментов. Для обеспечения повторяемости эксперименты проводились на общедоступном наборе данных MIMII (Malfunctioning Industrial Machine Investigation and Inspection). Ссылка на набор данных: DOI: 10.5281/zenodo.3384388. Код реализации, сопровождающий данное исследование, был опубликован в открытом доступе в репозитории Zenodo: https://zenodo.org/records/21405292. Аудиосигналы были дискретизированы с частотой 16 kHz и преобразованы в логарифмические Mel-спектрограммы с помощью STFT с размером окна 1024, длиной шага (hop length) 512 и размером FFT 1024. Предложенная архитектура CNN-transformer включала четыре сверточных слоя (с 32, 64, 128 и 256 фильтрами), за которыми следовал трансформер-энкодер с четырьмя слоями, восемью головками внимания, размерностью эмбеддинга 256 и размерностью сети прямого распространения 1024. Процесс обучения включал оптимизацию Adam со скоростью обучения 0.0001, размером пакета (batch size) 32 и количеством эпох 100. В алгоритмах 1 и 2 описаны этап предобработки данных и процедура обеспечения интерпретируемости. Представлен полный алгоритм, включая детали реализации.

Раскрытие информации

Инструмент ИИ (ChatGPT) использовался исключительно для редактирования языка, улучшения грамматики, ясности и удобочитаемости текста. Инструменты ИИ не применялись для генерации научных данных, проведения экспериментов, анализа результатов, интерпретации полученных сведений или формулирования научных выводов. Все научное содержание, анализ данных, интерпретация и окончательная версия рукописи были независимо проверены, подтверждены и одобрены авторами, которые несут полную ответственность за точность и целостность работы. Авторы заявляют об отсутствии конфликта интересов.

Благодарности

ФИНАНСИРОВАНИЕ: Данная работа была поддержана в рамках Ключевого проекта по реформированию преподавания в высших учебных заведениях провинции Шэньси (проект № 23BG053), Фондом научных исследований для высококвалифицированных специалистов Политехнического университета Шэньси (проект № BSJ-2023-08), а также Научно-исследовательским проектом Политехнического университета Шэньси (проект № 2024YKYB-006). Авторы искренне благодарят Политехнический университет Шэньси (Сяньян, Китай) и Университет транспортного машиностроения Сиань (Сиань, Китай) за предоставление оборудования и институциональную поддержку, которые сделали возможным проведение данного исследования.

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Шкала социальной поддержкиОпубликованная академическая шкала; первоначально разработана Park, впоследствии пересмотрена и дополнена Kimверсия из 25 пунктов; 5-балльная шкала Лайкерта; без коммерческого каталожного номераОценка воспринимаемой социальной поддержки будущих педагогов дошкольного образования по четырем направлениям: эмоциональная поддержка, информационная поддержка, материальная поддержка и оценочная поддержка. Общий коэффициент альфа Кронбаха’s alpha = 0,96.
Шкала самоэффективности учителяОпубликованная академическая шкала; первоначально разработана Энокс и Риггсом; версия исследования, адаптированная для Китаяверсия из 25 пунктов; 5-балльная шкала Лайкерта; без номера в коммерческом каталогеОценивает эффективность педагогов в контексте подготовки будущих специалистов по дошкольному образованию в Китае по показателям общей педагогической самоэффективности и личностной педагогической самоэффективности. Общий коэффициент альфа Кронбаха’s alpha = 0,96.
Шкала взаимодействия учителя и ребенкаОпублизированная академическая шкала; разработана Ли и рецензирована экспертной группой исследования для использования в Китаевариант из 30 пунктов; 5-балльная шкала Лайкерта; без коммерческого каталожного номераОценивает самоотчет о компетенции взаимодействия учителя и ребенка, а не наблюдаемое качество взаимодействия в классе. Включает эмоциональное взаимодействие, вербальное взаимодействие и поведенческое взаимодействие; общий коэффициент Кронбаха’s альфа = 0,94.
Форма демографических данныхИсследовательская группа, сотрудничество Сычуаньского университета искусств и наук и Университета ТэгуРаздел индивидуального опросника исследования; без коммерческого каталожного номераБыли собраны характеристики участников, включая пол, уровень образования, профессиональную категорию, место прохождения стажировки, продолжительность стажировки, тип стажировки и тип детского сада.
Информационный листок участника и текст формы информированного согласияИсследовательская группа; одобрено Комитетом по этике исследований Университета ТэгуНомер этического одобрения: XXX; для подтверждения см. запись о местном одобренииИспользуется перед рассылкой опросника для разъяснения целей исследования и содержания опроса, а также для получения информированного согласия от участников — студентов педагогических специальностей, готовящихся к преподаванию в дошкольном образовании.
Пакет материалов опросника для пилотного исследованияИсследовательская группа и экспертная комиссияПилотная версия, использованная 1 июня–5, 2024; номер в коммерческом каталоге отсутствуетПроведена апробация ясности и уместности Шкалы профессионального восприятия, Шкалы социальной поддержки, Шкалы самоэффективности учителя, Шкалы взаимодействия учителя и ребенка, а также демографических показателей на группе из 50 будущих педагогов дошкольного образования.
Процедура экспертного рецензированияИсследовательская группа; экспертная панель в составе двух профессоров в области дошкольного образования, одного директора детского сада, трех руководителей стажировок и исследовательской группыРецензирование контента на основе консенсуса; без указания коммерческого номера моделиИспользуется для пересмотра пунктов шкалы на предмет двусмысленности, уместности, семантической ясности, соответствия уровню развития и культурной релевантности перед проведением официального опроса.
Распечатанные формы опросников для заполнения на местеИсследовательская группа; расходные материалы для проведения опроса на базе местного учрежденияБумажные формы опросов; без коммерческого каталожного номераИспользовалось для проведения опроса на месте. В итоговой выборке было получено 336 заполненных анкет, собранных на месте, которые затем были объединены с онлайн-анкетами.
WeChatTencentМобильное приложение WeChat; версию необходимо проверить в записях устройства/приложения, использовавшихся в июне–Июль 2024 г.Использовался в качестве канала онлайн-распространения для проведения анкетирования; с помощью онлайн-канала/WeChat было собрано 27 заполненных онлайн-анкет.
Процедура набора участников по телефону и при личной встречеИсследовательская группаСтандартизированная процедура набора; номер в коммерческом каталоге отсутствуетИспользуется для связи с учреждениями/участниками, разъяснения целей исследования и содержания опроса, а также для получения информированного согласия перед проведением анкетирования.
SPSS StatisticsIBMВерсия 27.0Используются для описательной статистики, расчета коэффициентов корреляции Пирсона, коэффициента Кронбаха’анализ надежности с помощью коэффициента альфа Кронбаха, проверка нормальности распределения с использованием показателей асимметрии и эксцесса, а также тест Хармана’однофакторный тест на систематическую ошибку общего метода.
SPSS AmosIBMВерсия 26.0Используется для подтверждающего факторного анализа, моделирования структурными уравнениями, проверки инвариантности измерений в нескольких группах, бутстреп-тестирования косвенных эффектов и сравнения альтернативных моделей.
Microsoft ExcelMicrosoftMicrosoft 365 Excel или локально установленная версия Excel; перед отправкой проверьте точный номер сборки локальной версииРекомендуется использовать в качестве рабочей среды для организации закодированных данных опроса, словаря данных, дополнительных таблиц и таблицы материалов JoVE. Авторам следует проверить точную локальную версию.
Критерии индексов соответствия в моделировании структурными уравнениямиОпубликованное методическое руководство; в рукописи приведены ссылки на работы Schreiber et al. и KlineКоммерческий номер каталога отсутствует; критерии, примененные в плане статистического анализаОпределяет и представляет индексы соответствия модели, включая критерий хи-квадрат, значение хи-квадрат, деленное на число степеней свободы, индекс Таккера-Льюиса, сравнительный индекс соответствия, скорректированный индекс согласия, индекс приращения соответствия, среднеквадратичную ошибку аппроксимации и стандартизированный среднеквадратичный остаток.
Процедура бутстреп-тестирования медиацииSPSS Amos / план статистического анализа исследовательской группы5000 бутстрэп-выборок; 95% доверительные интервалы с коррекцией смещенияИспользовалось для проверки косвенных связей через эффективность преподавателя. Косвенные эффекты считались значимыми, если 95%-ный доверительный интервал с поправкой на смещение не включал ноль.
Процедура проверки инвариантности измеренийSPSS Amos / план статистического анализа исследовательской группыМногогрупповой конфирматорный факторный анализ; ΔCFI &< .010 и ΔRMSEA (среднеквадратичная ошибка аппроксимации) &критерий < 0,015Использовалось для оценки конфигурационной, метрической и скалярной инвариантности по полу, типу программы, продолжительности стажировки и учебному заведению перед интерпретацией объединенных оценок модели структурных уравнений (SEM).

Ссылки

  1. Fraga-Lamas P, Barros D, Lopes SI, Fernández-Caramés TM. Mist and edge computing cyber-physical human-centered systems for Industry 5.0: A cost-effective IoT thermal imaging safety system. Sensors (Basel). 2022;22(21):8500.
  2. Breque M, De Nul L, Petridis A. Industry 5.0: Towards a sustainable, human-centric and resilient European industry. Brussels: European Commission; 2021:https://research-and-innovation.ec.europa.eu/knowledge-publications-tools-and-data/publications/all-publications/industry-50-towards-sustainable-human-centric-and-resilient-european-industry_en.
  3. Sariişik G, Demir S. Industry 5.0: A human-centric paradigm for sustainable and resilient industrial transformation. Journal of Social Perspective Studies. 2025;2(2):50–66.
  4. Liu X et al. Evaluating the interactions of multi-dimensional value for sustainable product-service systems with a grey DEMATEL-ANP approach. J Manuf Syst. 2021;60:449–458.
  5. Di Nardo M et al. The maintenance in Industry 4.0: Assistance and implementation [conference paper]. Presented at: 32nd European Safety and Reliability Conference; Dublin, Ireland; 2022. p. 2286–2292. https://hdl.handle.net/20.500.12607/48222.
  6. Kagermann H, Lukas WD, Wahlster W. Industrie 4.0: Mit dem Internet der Dinge auf dem Weg zur 4. industriellen Revolution. VDI Nachrichten. 2011;(13):2–3. https://www.dfki.de/fileadmin/user_upload/DFKI/Medien/News_Media/Presse/Presse-Highlights/vdinach2011a13-ind4.0-Internet-Dinge.pdf.
  7. Council for Science, Technology and Innovation. Report on the Fifth Science and Technology Basic Plan. Tokyo: Cabinet Office, Government of Japan; 2015:https://www8.cao.go.jp/cstp/kihonkeikaku/5basicplan_en.pdf.
  8. Nahavandi S. Industry 5.0—A human-centric solution. Sustainability (Basel). 2019;11(16):4371.
  9. Paschek D, Mocan A, Draghici A. Industry 5.0—The expected impact of the next industrial revolution [conference paper]. Presented at: MakeLearn and TIIM International Conference; Piran, Slovenia; 2019. p. 125–132. https://toknowpress.net/ISBN/978-961-6914-25-3/papers/ML19-017.pdf.
  10. Maddikunta PKR et al. Industry 5.0: A survey on enabling technologies and potential applications. J Ind Inf Integr. 2022;26:100257.
  11. Longo F, Padovano A, Umbrello S. Value-oriented and ethical technology engineering in Industry 5.0: A human-centric perspective for the design of the factory of the future. Appl Sci (Basel). 2020;10(12):4182.
  12. Gong Y, Chung YA, Glass J. AST: Audio Spectrogram Transformer [conference paper]. Presented at: Interspeech 2021; Brno, Czech Republic; 2021. p. 571–575. https://www.isca-archive.org/interspeech_2021/gong21b_interspeech.html.
  13. Purohit H et al. MIMII dataset: Sound dataset for malfunctioning industrial machine investigation and inspection [conference paper]. Presented at: 4th Workshop on Detection and Classification of Acoustic Scenes and Events; New York, NY; 2019. p. 209–213. https://dcase.community/documents/workshop2019/proceedings/DCASE2019Workshop_Purohit_21.pdf.
  14. Hallioui A et al. A review of sustainable total productive maintenance. Sustainability (Basel). 2023;15(16):12362.
  15. Vasić S et al. Identification of criteria for enabling the adoption of sustainable maintenance practice: An umbrella review. Sustainability (Basel). 2024;16(2):767.
  16. Barredo Arrieta A et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities, and challenges toward responsible AI. Inf Fusion. 2020;58:82–115.
  17. Lundberg SM, Lee SI. A unified approach to interpreting model predictions [conference paper]. Presented at: 31st International Conference on Neural Information Processing Systems; Long Beach, CA; 2017. p. 4765–4774. https://papers.nips.cc/paper/7062-a-unified-approach-to-interpreting-model-predictions.
  18. Du M, Liu N, Hu X. Techniques for interpretable machine learning. Commun ACM. 2020;63(1):68–77.
  19. Sarker IH. Machine learning: Algorithms, real-world applications and research directions. SN Comput Sci. 2021;2(3):160.
  20. Saxe A, Nelli S, Summerfield C. If deep learning is the answer, what is the question? Nat Rev Neurosci. 2021;22(1):55–67.
  21. Piccialli F et al. A survey on deep learning in medicine: Why, how and when? Inf Fusion. 2021;66:111–137.
  22. Li Z et al. A survey of convolutional neural networks: Analysis, applications, and prospects. IEEE Trans Neural Netw Learn Syst. 2022;33(12):6999–7019.
  23. Gil M, Albert M, Fons J, Pelechano V. Engineering human-in-the-loop interactions in cyber-physical systems. Inf Softw Technol. 2020;126:106349.
  24. Krugh M, Mears L. A complementary cyber-human systems framework for Industry 4.0 cyber-physical systems. Manuf Lett. 2018;15:89–92.
  25. Jasiulewicz-Kaczmarek M et al. Recent advances in smart and sustainable maintenance [invited-session proposal]. Presented at: 10th IFAC Conference on Manufacturing Modelling, Management and Control; Nantes, France; 2022. https://hub.imt-atlantique.fr/mim2022/wp-content/uploads/2021/12/7a519.pdf.
  26. Jasiulewicz-Kaczmarek M, Gola A. Maintenance 4.0 technologies for sustainable manufacturing—An overview. IFAC-PapersOnLine. 2019;52(10):91–96.
  27. Saihi A, Ben-Daya M, As’ad RA. Maintenance and sustainability: A systematic review of modeling-based literature. J Qual Maint Eng. 2023;29(1):155–187.
  28. Bastas A. Sustainable manufacturing technologies: A systematic review of the latest trends and themes. Sustainability (Basel). 2021;13(8):4271.
  29. Franciosi C, Iung B, Miranda S, Riemma S. Maintenance for sustainability in the Industry 4.0 context: A scoping literature review. IFAC-PapersOnLine. 2018;51(11):903–908.
  30. Franciosi C et al. Measuring maintenance impacts on the sustainability of manufacturing industries: From a systematic literature review to a framework proposal. J Clean Prod. 2020;260:121065.
  31. Vrignat P, Kratz F, Avila M. Sustainable manufacturing, maintenance policies, prognostics and health management: A literature review. Reliab Eng Syst Saf. 2022;218:108140.
  32. Durán O, Aguilar J, Capaldo A, Arata A. Fleet resilience: Evaluating maintenance strategies in critical equipment. Appl Sci (Basel). 2021;11(1):38.
  33. Ciccarelli M, Papetti A, Germani M. Exploring how new industrial paradigms affect the workforce: A literature review of Operator 4.0. J Manuf Syst. 2023;70:464–483.
  34. Madzik P et al. Human-centricity in Industry 5.0—Revealing hidden research topics by unsupervised topic modeling using latent Dirichlet allocation. Eur J Innov Manag. 2025;28(1):113–138.
  35. Farivar F, Klarin A, Kanani-Moghadam V. Industry 5.0: A socio-technical system perspective on human agency and institutional legitimacy. J Manag Organ. 2026;32(4):1168–1189.
  36. Karki BR, Porras J. Digitalization for sustainable maintenance services: A systematic literature review. Digit Bus. 2021;1(2):100011.
  37. Santiago RAdF et al. Data-driven models applied to predictive and prescriptive maintenance of wind turbines: A systematic review of approaches based on failure detection, diagnosis, and prognosis. Energies (Basel). 2024;17(5):1010.
  38. Carvalho JN, Silva FR, Nascimento EGS. Challenges of the biopharmaceutical industry in the application of prescriptive maintenance in the Industry 4.0 context: A comprehensive literature review. Sensors (Basel). 2024;24(22):7163.
  39. Santos ACdJ, Cavalcante CAV, Wu S. Maintenance policies and models: A bibliometric and literature review of strategies for reuse and remanufacturing. Reliab Eng Syst Saf. 2023;231:108983.
  40. Orošnjak M, Brkljač N, Ristić K. Fostering cleaner production through the adoption of sustainable maintenance: An umbrella review with a questionnaire-based survey analysis. Clean Prod Lett. 2025;8:100095.
  41. Ji Z, Zhou Y, Wang B, Zang J. Human–cyber–physical systems in the context of new-generation intelligent manufacturing. Engineering (Beijing). 2019;5(4):624–636.
  42. Wang B et al. Toward human-centric smart manufacturing: A human–cyber–physical systems perspective. J Manuf Syst. 2022;63:471–490.
  43. Jiao J, Zhou F, Gebraeel NZ, Duffy V. Towards augmenting cyber-physical-human collaborative cognition for human–automation interaction in complex manufacturing and operational environments. Int J Prod Res. 2020;58(16):5089–5111.
  44. Yilma BA, Panetto H, Naudet Y. Systemic formalisation of cyber-physical-social systems: A systematic literature review. Comput Ind. 2021;129:103458.
  45. Zhou Y, Yu FR, Chen J, Kuo YH. Cyber-physical-social systems: A state-of-the-art survey, challenges and opportunities. IEEE Commun Surv Tutor. 2020;22(1):3

Перепечатки и разрешения

Теги