Artículo de investigación

Colaboración ciberfísica apoyada por IA explicable para la fabricación sostenible en la Industria 5.0

1 vistas

DOI:

10.3791/72379

1 de septiembre de 2026

En este artículo

Resumen

Este estudio presenta un marco de colaboración ciberfísica para la Industria 5.0 habilitado por inteligencia artificial interpretable, que utiliza una red neuronal convolucional-transformer y SHAP para la detección acústica de anomalías industriales en el conjunto de datos MIMII. La integración de computación en el borde (edge-computing) respalda un mantenimiento predictivo interpretable y centrado en el ser humano.

Resumen

En este estudio, presentamos un enfoque innovador para la fabricación sostenible de piezas industriales mediante un sistema de colaboración ciberfísica basado en inteligencia artificial explicable (XAI) para la Industria 5.0. Se ha encontrado que los sistemas ciberfísicos humanos (CPHS) actuales integran la inteligencia artificial solo en cierta medida y, a menudo, carecen de explicabilidad. En consecuencia, existe la necesidad de mejorar su escalabilidad y flexibilidad, en línea con los principios de la Industria 5.0: resiliencia, viabilidad a largo plazo y enfoque centrado en el ser humano. Para abordar estas limitaciones, introducimos una arquitectura que integra el aprendizaje profundo y la inteligencia artificial explicable en el ecosistema del sistema ciberfísico (CPS) para permitir una toma de decisiones inteligente y explicable. Específicamente, utilizamos el conjunto de datos Malfunctioning Industrial Machine Investigation and Inspection (MIMII) para la detección de fallas en máquinas a partir de señales acústicas. Las señales de audio se someten a una transformación espectral para generar imágenes espectrograma, que luego son procesadas por una red neuronal convolucional (CNN) para la extracción de características espaciales y por un codificador transformador para las características temporales. Para mejorar la transparencia y facilitar la cooperación con el ser humano en el bucle, el enfoque basado en explicaciones aditivas de Shapley (SHAP) ayuda a los operadores a comprender el proceso de toma de decisiones del sistema resaltando las características de entrada que influyen en las predicciones del modelo. Además, el marco se aplica en un sistema ciberfísico basado en computación en el borde (edge computing) para lograr baja latencia y bajo consumo de energía, a la vez que proporciona respuestas oportunas, contribuyendo así a garantizar un entorno de producción sostenible. Los resultados experimentales muestran que la arquitectura propuesta CNN-Transformador alcanza una precisión del 98,5 % y supera a los sistemas CPHS existentes manteniendo baja latencia. El uso de inteligencia artificial explicable en este tipo de sistema de colaboración ciberfísica aumenta considerablemente la confianza del operador y posibilita una colaboración fluida entre humanos y máquinas.

Introducción

La transición desde la Industria 4.0, que enfatizaba la tecnología, la mecanización y la comunicación, hacia el nuevo modelo de Industria 5.0, que combina el avance tecnológico con la adaptabilidad, el desarrollo sostenible y el enfoque centrado en el ser humano, ha influido en la evolución dinámica de los sistemas industriales.1,2. La Comisión Europea define la Industria 5.0 como un paradigma centrado no solo en la productividad y la eficiencia, sino también en tres pilares: la orientación al ser humano, la sostenibilidad y la resiliencia. Es importante señalar que investigaciones recientes han destacado el papel de los sistemas de inteligencia artificial, la cooperación humano-máquina y la fabricación sostenible como los principales impulsores de los entornos de la Industria 5.03,4. Los métodos tradicionales de mantenimiento ya no son suficientes en este entorno industrial en evolución. Para posibilitar la resiliencia en contextos complejos e inestables, el mantenimiento debe evolucionar hacia una forma más adaptable y sistémica5Desde 2011, la Industria 4.0 ha sido el modelo dominante para la transformación industrial en Europa, fomentando la transformación digital de las empresas para mejorar sus operaciones y maximizar los recursos disponibles.4. Por lo tanto, es imperativo aumentar la eficiencia sin eliminar la mano de obra humana en la producción, al mismo tiempo que se protege la salud y la seguridad de los trabajadores. Debido a esto, las empresas y los académicos han comenzado a definir los principios del paradigma de la Industria 5.05,6,7, en parte motivado por la noción japonesa de Sociedad 5.08,9,10,11. A pesar del mayor énfasis reciente en el mantenimiento sostenible en la literatura, la mayoría de las evaluaciones sistemáticas existentes siguen siendo fragmentadas o específicas de un dominio, y carecen de un marco integral que integre resiliencia, sostenibilidad e inteligencia artificial. Por ejemplo, los autores examinan prácticas de mantenimiento sostenible para sistemas o estrategias específicas, incluyendo el mantenimiento productivo total sostenible (STPM), mientras que otros investigadores hablan de incorporar temas de sostenibilidad en las técnicas de mantenimiento12,13,14. Autor realizó una evaluación exhaustiva de los criterios de adopción de la sostenibilidad y destacó los factores tecnológicos que permiten a la fabricación tener un impacto sostenible positivo15. Sin embargo, dentro del paradigma de la Industria 5.0, la sostenibilidad, la resiliencia y la toma de decisiones basada en inteligencia artificial no están plenamente integradas en ninguno de estos trabajos. Como resultado, los métodos de mantenimiento suelen abordar la sostenibilidad de forma separada. SHAP destaca entre otras técnicas de inteligencia artificial explicable (XAI) debido a su método teóricamente sólido de atribución de características16,17,18.

La toma de decisiones basada en datos es posibilitada por la inteligencia artificial, pero los modelos precisos a menudo requieren grandes cantidades de datos. Las técnicas convencionales de aprendizaje automático (ML), como los árboles de decisión, la regresión logística y la regresión lineal, con frecuencia tienen un rendimiento deficiente en situaciones altamente no lineales porque suponen distribuciones de datos relativamente simples19. Al aprender representaciones complejas de características a partir de grandes conjuntos de datos, las redes neuronales profundas (DNN) superan estas limitaciones20. Según estudios, las redes más profundas suelen tener un mejor desempeño que las estructuras superficiales en tareas complejas de toma de decisiones21, pero su creciente profundidad y complejidad de parámetros hacen que el modelo sea menos interpretable22.

Un sistema ciberfísico (CPS) es una tecnología habilitadora crucial para la fabricación en la Industria 5.0 porque combina inteligencia distribuida, computadoras embebidas, procesos físicos y comunicación. Para permitir operaciones industriales flexibles, inteligentes y en tiempo real, los CPS modernos están integrando rápidamente computación de borde, inteligencia artificial de borde y el Internet de las cosas verde (G-IoT)23,24. La sostenibilidad y la resiliencia han sido destacadas en estudios recientes sobre Mantenimiento 4.0 y mantenimiento inteligente. Aunque trabajos anteriores han examinado la importancia de la tecnología del Mantenimiento 4.0 en la fabricación sostenible y han propuesto marcos de modelado para el mantenimiento sostenible, estudios bibliométricos y sistemáticos han evaluado tecnologías de mantenimiento inteligente25,26,27,28. Investigaciones adicionales han analizado la integración del mantenimiento sostenible en entornos de la Industria 4.0 y sistemas de producción orientados a la sostenibilidad29,30,31,32. El concepto del Operador 4.033, los marcos centrados en el ser humano para la Industria 5.034 y las perspectivas socioeconómicas35 han recibido una atención significativa en relación con el mantenimiento centrado en el ser humano. Además, avances en mantenimiento digital36, mantenimiento predictivo y prescriptivo37,38 y estrategias de mantenimiento sostenible39,40 han sido enfatizados en estudios recientes. A pesar de estos avances, la investigación sigue dispersa, y pocos estudios ofrecen un paradigma coherente que integre inteligencia artificial explicable, sostenibilidad, resiliencia y cooperación ciberfísica centrada en el ser humano. Los sistemas ciberfísicos (CPS) no han alcanzado autonomía completa a pesar de su creciente implementación, y el paradigma de la Industria 5.0 no la favorece. Por el contrario, la Industria 5.0 pone mayor énfasis en la supervisión, cooperación y toma de decisiones humanas. Al incorporar el pensamiento y la cooperación humanos en los procesos ciberfísicos, sistemas ciber-humanos como los sistemas ciberfísicos con participación humana (HiLCPS)41, los sistemas ciberfísicos centrados en el ser humano (HCPS)42,43 y los sistemas ciberfísicos humanos (CPHS)44 amplían los CPS tradicionales. Esta integración mejora la adaptabilidad, transparencia, seguridad y resiliencia al permitir la colaboración en tiempo real entre sistemas inteligentes y operadores humanos45,46.

La detección industrial de anomalías de audio se ha visto ampliamente mejorada gracias a nuevas arquitecturas, como el Transformador de Visión (ViT), el Transformador de Espectrograma de Audio (AST), el Conformer y el aprendizaje auto-supervisado; sin embargo, su integración con sistemas ciberfísicos explicables para la Industria 5.0 sigue siendo limitada. Sin integrar explicabilidad, despliegue en el borde (edge) y apoyo a la toma de decisiones con participación humana en un único marco, la investigación actual se centra principalmente en la precisión de clasificación o en la interpretabilidad basada en XAI a posteriori. Este estudio propone una arquitectura novedosa de colaboración ciberfísica habilitada por inteligencia artificial explicable (XAI) que combina redes neuronales convolucionales y transformadores, computación en el borde, modelado de dependencias temporales, explicabilidad basada en SHAP, aprendizaje de características espaciales y apoyo a decisiones centrado en el ser humano, con el fin de posibilitar una fabricación sostenible en la Industria 5.0 y superar estas limitaciones.

Por lo tanto, persiste un déficit sustancial de investigación. Las técnicas actuales de detección acústica de anomalías basadas en CNN/Transformador favorecen el rendimiento de clasificación, pero carecen de cooperación ciberfísica y explicabilidad. Si bien los marcos de la Industria 5.0 ofrecen modelos conceptuales centrados en el ser humano que no integran el aprendizaje profundo explicable, la inteligencia periférica y la toma de decisiones asistida por operadores en un solo sistema, las técnicas de mantenimiento predictivo basadas en XAI aumentan la transparencia, pero operan de forma independiente de las arquitecturas CPHS. Por consiguiente, aún falta un único sistema ciberfísico humano de la Industria 5.0 que integre la detección precisa de anomalías auditivas, la explicabilidad basada en SHAP, la implementación habilitada en el borde y la cooperación con el ser humano en el bucle.

Este artículo propone un nuevo paradigma colaborativo ciberfísico basado en inteligencia artificial explicable que combina CNN y Transformador para la Industria 5.0, con el fin de superar estas limitaciones. La arquitectura sugerida integra en un único marco CPHS la implementación en computación de borde, la extracción de características espaciales basada en CNN, el aprendizaje de dependencias temporales basado en Transformador, la explicabilidad basada en SHAP y el apoyo a la toma de decisiones con participación humana. A diferencia de los métodos actuales, que abordan estos elementos de forma independiente, el marco propuesto ofrece una solución integrada que mejora simultáneamente el rendimiento en la detección de anomalías, la transparencia del modelo, la eficiencia operativa y la colaboración centrada en el ser humano para la fabricación sostenible.

El objetivo principal de este estudio es crear un sistema ciberfísico humano habilitado para inteligencia artificial explicable (CPHS) para la fabricación sostenible de la Industria 5.0, combinando la explicabilidad basada en SHAP, computación en el borde y soporte de decisiones con participación humana, junto con un enfoque híbrido basado en CNN-Transformer para la detección acústica de anomalías. En particular, el marco propuesto tiene como finalidad mejorar la precisión en la detección de anomalías, proporcionar predicciones claras y comprensibles, facilitar una implementación eficiente en el borde y fomentar la toma de decisiones cooperativa entre sistemas inteligentes y operadores humanos. Al lograr simultáneamente un alto rendimiento en la detección, explicabilidad, operación con baja latencia y colaboración ciberfísica centrada en el ser humano, esta arquitectura integrada aborda las limitaciones de los actuales marcos de detección acústica de anomalías, mantenimiento predictivo basado en XAI y sistemas CPHS.

La arquitectura propuesta presenta un sistema ciberfísico humano unificado habilitado para inteligencia artificial explicable (CPHS) para la Industria 5.0, en contraste con las técnicas actuales de detección de anomalías acústicas, que se centran principalmente en la precisión de clasificación. Dentro de una única arquitectura, combina la extracción de características espaciales basada en CNN, modelado temporal basado en Transformadores, explicabilidad basada en SHAP, computación en el borde y soporte de decisión con participación humana. La arquitectura sugerida aborda problemas clave de transparencia, asistencia al operador y cooperación ciberfísica mediante la fusión de detección precisa de anomalías con toma de decisiones comprensible y despliegue en tiempo real en el borde. La principal contribución científica de este trabajo es la integración a nivel de sistema, que distingue al enfoque propuesto de investigaciones previas que se centran únicamente en la detección de anomalías, la inteligencia artificial explicable o los marcos de la Industria 5.0.

Protocolo

La metodología propuesta utiliza un enfoque basado en sistemas de un sistema ciberfísico humano (CPHS) de Industria 5.0 que combina aprendizaje profundo explicativo con un marco de colaboración ciberfísica habilitado por computación en el borde para apoyar procesos de fabricación sostenibles. En primer lugar, el problema se aborda reconociendo ciertas limitaciones de las soluciones actuales de CPHS, como la falta de inteligencia impulsada por IA, explicabilidad y colaboración centrada en el ser humano. Para abordar estos desafíos, la solución propuesta aprovecha el conjunto de datos MIMII para el monitoreo del estado de máquinas industriales mediante el procesamiento de señales acústicas.

El marco propuesto comienza alimentando los espectrogramas generados a un modelo de CNN que extrae características espaciales mediante el reconocimiento de patrones de frecuencia significativos asociados con diferentes condiciones de la máquina. Las características espaciales extraídas se convertirán en secuencias y se introducirán en un módulo codificador transformador para capturar dependencias temporales mediante la autoatención. La representación de características transformada se transmite posteriormente a un módulo clasificador completamente conectado para clasificar los estados de la máquina como normales o anormales. Además, para garantizar transparencia y facilitar la toma de decisiones centrada en el ser humano, se emplea el enfoque de explicabilidad SHAP para explicar las predicciones seleccionando regiones significativas en el dominio tiempo-frecuencia en la salida del modelo. El modelo diseñado se implementará en un entorno de CPS habilitado para edge computing, permitiendo inferencias en tiempo real con baja latencia computacional y bajo consumo energético. Asimismo, se integrará un esquema con participación humana para permitir que los operadores validen los resultados utilizando la explicabilidad. El rendimiento se valida mediante exactitud, precisión, exhaustividad y puntuación F1, así como otras métricas a nivel de sistema, como latencia y eficiencia energética.

El marco propuesto es un mecanismo de CPHS impulsado por XAI para la fabricación sostenible en el contexto de la Industria 5.0, y su flujo de trabajo se presenta como una canalización que va desde la adquisición de datos hasta la toma de decisiones inteligentes y la ejecución, como se muestra en la Figura 1. En la etapa inicial del procedimiento de adquisición de datos, se recopilan señales de sonido procedentes de máquinas industriales, como motores, bombas y rodamientos, utilizando conjuntos de datos como MIMII. Las señales de datos así obtenidas se envían a la siguiente etapa, denominada preprocesamiento de datos, donde se someten a filtrado, normalización y segmentación. Finalmente, las señales de datos segmentadas se convierten en un espectrograma mediante la transformada de Fourier de corta duración (STFT) en la capa de representación de características.

Luego, la capa del modelo de IA utiliza las imágenes del espectrograma para extraer características mediante el módulo CNN, identificando patrones espaciales y anomalías. A continuación, las características extraídas se reorganizan y se introducen en el codificador transformador, que aprende las dependencias temporales y las relaciones de largo alcance mediante mecanismos de autoatención. Los vectores de características resultantes se clasifican como normales o anormales utilizando la capa de clasificación. Para garantizar la transparencia en el proceso de predicción, la capa de explicabilidad utiliza SHAP para resaltar las regiones significativas en el dominio tiempo-frecuencia del espectrograma.

Además, existe un proceso con intervención humana en el que los operadores interpretan y proporcionan retroalimentación sobre los resultados del modelo. En la capa de implementación, el modelo se ejecuta en una infraestructura CPHS basada en el edge, lo que garantiza una inferencia rápida y un bajo consumo de energía, mientras que opcionalmente se puede interconectar con sistemas en la nube para requisitos de almacenamiento o análisis avanzados. En conjunto, el marco garantiza una detección precisa de fallas, explicabilidad y un funcionamiento eficiente en tiempo real, acorde con los requisitos de la Industria 5.0.

Definición del problema y análisis de requisitos

Los sistemas ciberfísicos humanos (CPHS) en entornos de Industria 5.0 prometen inteligencia, sostenibilidad y enfoque centrado en el ser humano. Sin embargo, los marcos contemporáneos para construir CPHS se ven obstaculizados por la falta de capacidades avanzadas habilitadas por inteligencia artificial, explicabilidad y un apoyo adecuado para la colaboración humano-máquina. De hecho, los CPHS convencionales se basan en modelos basados en reglas o modelos no interpretables, lo que dificulta la adaptación a condiciones industriales cambiantes y limita la confianza de los operadores en la automatización. Además, los CPHS convencionales no pueden analizar eficazmente datos altamente sofisticados, como las señales acústicas industriales que contienen componentes espaciales (es decir, frecuencia) y dependientes del tiempo, los cuales son importantes para el mantenimiento predictivo. Por lo tanto, es necesario crear un marco capaz de detectar anomalías en máquinas con alta precisión, proporcionar explicaciones y operar en el borde (edge), posibilitando así los sistemas ciberfísicos.

Aquí, x(t) es la señal acústica de entrada, S(f,t) es la representación del espectrograma de la señal, figure-protocol-1 es la etiqueta y θ es el conjunto de parámetros de la arquitectura CNN-Transformer. Los símbolos utilizados en las ecuaciones siguientes se introducen justo después de su primera aparición para preservar la corrección matemática.

Desde un punto de vista matemático, la tarea puede formalizarse como un problema de aprendizaje supervisado. Sea la señal acústica industrial representada por x(t). La STFT de x(t) se calcula según la fórmula:

figure-protocol-2   (1)

donde  ω(.) es la función de ventana y f es la frecuencia. El espectrograma generado figure-protocol-3 sirve como entrada para el algoritmo de aprendizaje profundo. El objetivo es entrenar la función de mapeo

figure-protocol-4    (2)

donde figure-protocol-5  es la etiqueta de clase (normal o anormal), y donde S es la entrada del espectrograma, y es la etiqueta de salida predicha y θ es el conjunto de parámetros aprendibles de la arquitectura CNN-Transformer. El problema de optimización se formula como la minimización de la pérdida de clasificación:

figure-protocol-6  (3)

sujeto a las restricciones de latencia mínima figure-protocol-7, eficiencia energética figure-protocol-8 y capacidad de interpretación, en la que la explicación ∅(SHAP) captura la importancia de las características en el proceso de predicción,

figure-protocol-9   (4)

donde figure-protocol-10  es la contribución de cada característica individual. De acuerdo con lo anterior, los requisitos de diseño incluyen los siguientes: (i) detección confiable de anomalías basada en aprendizaje profundo híbrido, (ii) salidas interpretables para la intervención humana, y (iii) implementación en un marco de CPS con capacidades mejoradas en el borde.

Adquisición y preprocesamiento del conjunto de datos

A este respecto, para evaluar el marco CPHS propuesto basado en IA explicable, se ha seleccionado el conjunto de datos MIMII13. Este conjunto de datos es un referente ampliamente utilizado para detectar anomalías en maquinaria industrial mediante señales acústicas. Esta base de datos contiene grabaciones sonoras de diversas máquinas, como rieles deslizantes, ventiladores, bombas y válvulas, en condiciones de funcionamiento tanto normales como defectuosas. Para cada máquina, las grabaciones varían según diferentes configuraciones y entornos de ruido. Esto lo hace adecuado para entrenar y evaluar modelos bajo condiciones industriales en tiempo real.

Aunque el conjunto de datos MIMII se utiliza ampliamente en estudios de detección de anomalías no supervisados que dependen únicamente de muestras normales durante el entrenamiento, incluye anotaciones explícitas tanto de estados normales como anómalos de las máquinas. El problema se plantea como una tarea supervisada de clasificación binaria para evaluar la capacidad de la arquitectura propuesta de CNN-Transformador basada en IA explicable para distinguir entre estados sanos y defectuosos de las máquinas. Específicamente, se utilizan las etiquetas oficiales de MIMII, asignando la etiqueta de clase 0 a las muestras normales y la etiqueta de clase 1 a las muestras anómalas.

Tabla 1 muestra los detalles de la descripción del conjunto de datos. Aproximadamente 12.000 grabaciones de señales acústicas se consideran en la presente investigación, incluyendo operaciones de maquinaria tanto normales como defectuosas. Según los requisitos, todas las grabaciones en este estudio se han capturado a 16 kHz y tienen una duración de 10 s. Aunque el conjunto de datos contiene aproximadamente 12.000 grabaciones, se seleccionó únicamente un subconjunto equilibrado por clases de 2.000 grabaciones para visualizar la matriz de confusión. Todas las métricas de rendimiento informadas se calcularon utilizando el conjunto de prueba completo (aproximadamente 2.400 grabaciones). Además, las muestras de entrenamiento y prueba se separan en una proporción de 80:20 para el entrenamiento del modelo. Esta base de datos es especialmente adecuada para aplicaciones de la Industria 5.0 porque incluye condiciones de ruido en tiempo real. La distribución de grabaciones utilizada en este estudio se proporciona en Tabla 2. A partir de este conjunto de datos, se seleccionaron aproximadamente 12.000 grabaciones que cubren todos los tipos de máquinas y condiciones de relación señal-ruido (SNR) para experimentos de clasificación binaria supervisada utilizando una división entrenamiento/prueba de 80:20, que muestra los tipos industriales de máquinas, los identificadores correspondientes de las máquinas, los números totales de grabaciones acústicas normales y anómalas, las condiciones de SNR y la partición entrenamiento/prueba empleada para la clasificación binaria supervisada.

El experimento se realizó utilizando el conjunto de datos MIMII (Malfunctioning Industrial Machine Investigation and Inspection) versión 1.0, que comprende cuatro tipos de máquinas industriales: ventiladores, bombas, válvulas y rieles deslizantes. Los datos se recopilaron de diferentes identificadores de máquinas (ID00-ID06, según el tipo de máquina) y condiciones. La base de datos MIMII comprende datos adquiridos con relaciones señal-ruido (SNR) de −6 dB, 0 dB y +6 dB. Los datos normales corresponden al estado saludable de la máquina industrial, mientras que los datos anómalos corresponden a un estado anómalo. Las clases se etiquetaron según la anotación de la base de datos, con los datos normales etiquetados como clase 0 y los datos anómalos etiquetados como clase 1.

Se requería un procedimiento de evaluación imparcial en el que la división entre conjuntos de entrenamiento y prueba se realizara a nivel de la grabación de audio original, antes de cualquier división, aumento o creación de espectrogramas. Como resultado, segmentos de audio de la misma grabación no podían aparecer tanto en el conjunto de entrenamiento como en el de prueba. Para el experimento de evaluación, se utilizaron grabaciones con diferentes relaciones señal-ruido (−6 dB, 0 dB y +6 dB), lo que permitió evaluar el marco propuesto bajo diversas condiciones industriales.

Para evitar fugas de datos, la división entre entrenamiento y prueba se realizó utilizando el archivo de audio original como base, antes de cualquier segmentación o generación de espectrogramas. Los segmentos provenientes de la misma grabación de audio de 10 s se asignaron exclusivamente al conjunto de entrenamiento o al conjunto de prueba, sin que ningún segmento estuviera presente en ambos conjuntos. Posteriormente, los espectrogramas se generaron y aumentaron por separado para cada conjunto de datos. De este modo, se evita el problema de la fuga de datos, evitando así una evaluación excesivamente optimista del rendimiento.

Preprocesamiento del conjunto de datos

Las señales acústicas no procesadas del conjunto de datos MIMII se procesan posteriormente para mejorar la calidad de la señal y permitir una extracción eficaz de características. La señal de entrada se denota mediante x(t), donde t es el tiempo. El primer proceso es el filtrado de ruido, mediante el cual se eliminan los ruidos de fondo utilizando una función de filtrado tal que:

figure-protocol-11   (5)

donde ∗ representa el proceso de convolución y h(t) es la respuesta al impulso del filtro. Este proceso mejora la claridad de la señal acústica y minimiza los efectos del ruido, que suele ser prevalente en entornos industriales. Se utiliza la normalización de la señal para asegurar que las amplitudes de todas las señales de audio sean comparables antes de introducirlas en el modelo de aprendizaje profundo. La señal normalizada, denotada como xn(t), se calcula mediante:

figure-protocol-12   (6)

donde  μ y  σ son el valor medio y la desviación estándar de la señal de entrada, respectivamente. Todos los señales de entrada tienen garantizados valores medios cero y varianzas unitarias gracias a este procedimiento. Finalmente, para su procesamiento, la señal de entrada normalizada se divide en múltiples fragmentos pequeños. Dado que la longitud de la señal completa es T, esta se descompone en N tramas solapadas, cada una con una longitud L, mediante una función de ventana deslizante:

figure-protocol-13   (7)

donde H es el tamaño del salto. El espectrograma puede definirse mediante la fórmula siguiente:

figure-protocol-14   (8)

Los espectrogramas obtenidos de esta manera se introducen en el marco basado en CNN-transformador para extraer características espaciales y temporales que permitan una detección exitosa de anomalías. Figura 2 muestra la canalización de preprocesamiento.

Figura 2 ilustra una tubería de preprocesamiento vertical que puede emplearse para datos acústicos adquiridos en la industria. En primer lugar, las señales de audio en bruto se extraen del conjunto de datos MIMII y se introducen en la etapa de eliminación de ruido para reducir el ruido. A continuación, se normaliza la señal para eliminar inconsistencias de amplitud, asegurando que la señal sea coherente. Posteriormente, la señal se divide en secciones más pequeñas y solapadas. Tras la segmentación, se aplicarán transformaciones STFT a los datos para convertir las señales en el dominio del tiempo en señales en el dominio tiempo-frecuencia. Luego, se calcula el espectro de potencia como parte de la generación del espectrograma de la señal. Los espectrogramas preprocesados serán así la salida generada en el proceso y se utilizarán en el modelo propuesto de CNN-transformador.

Generación del espectrograma

Después de la normalización y segmentación de los datos, las señales acústicas se convierten en una representación en el dominio tiempo-frecuencia mediante la Transformada de Fourier de Tiempo Corto (STFT). El espectrograma resultante proporciona una representación gráfica de los cambios en la composición de frecuencia a lo largo del período de análisis. En entornos industriales, las fallas de las máquinas suelen manifestarse como patrones de frecuencia, lo que hace que los espectrogramas sean más útiles para detectar anomalías en las máquinas.

Por lo tanto, los datos procesados resultantes se convierten en imágenes de espectrogramas para distinguir entre instancias normales y anormales dentro de las máquinas. Los datos de audio se convertirán en múltiples espectrogramas para permitir que el modelo de aprendizaje analice los componentes de frecuencia locales y los cambios temporales dentro del proceso de la máquina. Estas imágenes se utilizan como datos de entrada para el modelo CNN-transformador, donde la CNN maneja los patrones espaciales (de frecuencia) mientras que los Transformadores manejan las relaciones temporales.

Algoritmo 1: Generación de espectrogramas a partir de señales acústicas

Entrada: señal de audio cruda x(t)

Resultado: Espectrograma S(t, f)

Paso 1: Cargar la señal de audio  x(t)

Paso 2: Aplicar filtrado de ruidofigure-protocol-15

Paso 3: Normalizar la señal xn(t)

Paso 4: Segmentar la señal en tramas:

para k = 1 hasta N hacer

figure-protocol-16

fin para

Paso 5: Aplicar una función de ventana w(t) a cada segmento

Paso 6: Calcular la TFST:

figure-protocol-17  (9)

Paso 7: Calcular la magnitud:

figure-protocol-18   (10)

Paso 8: Almacenar el espectrograma S(t, f)

Paso 9: Devolver el conjunto de datos del espectrograma 

El proceso de generación de espectrogramas comienza con la adquisición de la señal de audio original, seguido de pasos de preprocesamiento como la reducción de ruido y la normalización de la señal para garantizar la integridad y calidad de la señal. A continuación, el audio normalizado se divide en múltiples ventanas solapadas para capturar las características temporales de períodos tanto largos como cortos. Para evitar fugas espectrales, cada segmento se multiplica por una función de ventana antes de pasar por la transformada de Fourier de corta duración. Posteriormente, la señal transformada se representa como una función de valores complejos en el dominio de la frecuencia, y sus magnitudes se elevan al cuadrado. De este modo, la energía de las frecuencias a lo largo del tiempo dado queda representada por los espectrogramas. Finalmente, estos se almacenan como datos similares a imágenes y se introducen en la red neuronal para su entrenamiento.

Extracción de características espaciales mediante CNN

Después del proceso de creación de espectrogramas, las imágenes de salida en el dominio tiempo-frecuencia se toman como entradas y se introducen en una red neuronal convolucional (CNN). Suponiendo que el espectrograma de entrada es figure-protocol-19, donde H es el dominio de frecuencia y W es el dominio de tiempo. El propósito de utilizar la CNN aquí es aprender características espaciales discriminativas a partir del espectrograma de entrada. Estas características espaciales discriminativas ayudarán a diferenciar entre el comportamiento normal y anormal de la máquina en un entorno industrial.

Una operación básica realizada por la red neuronal convolucional (CNN) es la convolución. La convolución con un filtro dado figure-protocol-20 se define como:

figure-protocol-21   (11)

La operación descrita anteriormente permite que la red neuronal identifique características espaciales locales, como bordes, frecuencias y contenido armónico, en el espectrograma. Esto se realiza mediante múltiples operaciones de filtrado que generan diversas representaciones de características, produciendo varios mapas de características. A la convolución le sigue una función de activación no lineal, como se muestra a continuación:

figure-protocol-22  (12)

Esta no linealidad permite a la red captar y representar relaciones complejas entre variables. La siguiente etapa en una red neuronal convolucional implica la aplicación de operaciones de agrupación. La técnica común de agrupación máxima se expresa matemáticamente como sigue:

figure-protocol-23   (13)

donde Ω se refiere a la ventana de agrupación. La agrupación ayuda a lograr invariancia ante traslaciones y conservar únicamente la información relevante, descartando la redundancia. Desde variables de bajo nivel, como frecuencias, hasta comportamientos complejos de máquinas, se pueden extraer características de alto nivel de forma jerárquica utilizando una red neuronal convolucional. En consecuencia, los mapas de características se pueden utilizar para representar la salida final de la red:

figure-protocol-24   (14)

donde representa los parámetros aprendibles de la CNN. Los mapas de características contienen información espacial rica y se transforman en secuencias para servir como entradas al codificador transformador en la siguiente fase. El proceso de extracción de características espaciales descrito anteriormente es crucial para permitir que el modelo detecte anomalías mínimas en señales acústicas industriales.

Figura 3 demuestra cómo se extraen horizontalmente características espaciales de la entrada del espectrograma utilizando un modelo CNN. Comienza con el espectrograma de entrada, que codifica las propiedades de frecuencia-temporal de la señal de audio en forma pictórica. El espectrograma de entrada luego pasa por una capa convolucional, en la cual varios tipos de filtros extraen características espaciales como bandas de frecuencia, bordes y texturas, produciendo así mapas de características. Posteriormente, los mapas de características extraídos pasan por una función de activación no lineal, la unidad lineal rectificada (ReLU), lo que permite a la red neuronal detectar dependencias en los datos de entrada. A continuación, los mapas de características pasan por una capa de agrupación (pooling), donde se reduce el tamaño del mapa conservando sus características más importantes. Este proceso de capas convolucionales, de activación y de agrupación se repite varias veces, creando una jerarquía de representación de características que comienza con características simples y evoluciona hacia otras más sofisticadas relacionadas con las operaciones de la máquina.

Modelado temporal mediante un codificador transformer

Una vez que se han extraído las características espaciales mediante la CNN, el siguiente paso consiste en derivar mapas de características de alto nivel que capturen los patrones basados en frecuencia aprendidos a partir del espectrograma. Los mapas de características resultantes se aplanan y reorganizan luego en secuencias para capturar la información temporal en la señal acústica. Suponiendo que los mapas de características están representados por figure-protocol-25, donde H', W', y C son la altura, el ancho y los canales, respectivamente, se deriva la siguiente secuencia:

figure-protocol-26    (15)

donde T representa la longitud de la secuencia, y d es la dimensión de la característica. El Transformer utiliza entonces la secuencia anterior para modelar dependencias a largo plazo mediante un mecanismo de autoatención. A diferencia de los modelos recurrentes convencionales, el modelo Transformer procesa cada elemento de la secuencia en paralelo y utiliza pesos de atención para determinar la relevancia relativa de cada parte. El funcionamiento del mecanismo de atención consiste en utilizar vectores de Consulta Q, Clave K y Valor V generados para cada entrada xt de acuerdo con:

figure-protocol-27   (16)

donde WQ, WK, WV son pesos entrenables. Las similitudes entre los elementos se determinan mediante:

figure-protocol-28   (17)

dk es la dimensión importante de los vectores. Este procedimiento facilita que el modelo aprenda dependencias de pasos temporales distantes en la señal y se enfoque únicamente en los segmentos temporales pertinentes. Para aumentar la capacidad de aprendizaje de la red, se utiliza la atención multi-cabeza, que se refiere al proceso mediante el cual varias cabezas de atención aprenden de la entrada en paralelo:

figure-protocol-29  (18)

Cada cabezal atiende a características distintas de la secuencia de entrada temporal. Esto va seguido de redes neuronales de alimentación directa y conexiones residuales:

figure-protocol-30   (19)

La secuencia codificada resultante captura tanto las características espaciales como temporales de la entrada. Esta secuencia se envía a la capa clasificadora para detectar anomalías.

Figura 4 muestra el proceso general de modelado temporal mediante un codificador transformer sobre características extraídas de la CNN. En primer lugar, se utilizan los mapas de características extraídos de la CNN, que contienen información espacial del espectrograma. Los mapas de características se aplanan en una secuencia, en la que cada elemento corresponde a una marca de tiempo. A continuación, la secuencia pasa por una transformación lineal que proyecta los datos en vectores de una dimensión específica. Dado que los modelos transformer carecen de la capacidad para capturar dependencias temporales, también se añade una codificación posicional a los vectores de incrustación para preservar la estructura temporal de la secuencia. Finalmente, la secuencia pasa a través de un codificador transformer, compuesto por una pila de múltiples capas, en el que se emplea un mecanismo de autoatención multi-cabeza para permitir que el modelo aprenda las conexiones entre las marcas de tiempo en la secuencia. La red neuronal de alimentación directa mejora aún más estas incrustaciones, mientras que las conexiones residuales garantizan una propagación eficiente de los gradientes. El proceso se repite a través de las capas del codificador transformer apiladas, las cuales capturan interacciones temporales progresivamente más complejas. Al final, las incrustaciones de la secuencia se combinan en una representación de longitud fija mediante agrupación (por ejemplo, agrupación promedio o el token de clasificación (CLS)), obteniendo así una representación global de características temporales.

Capa de clasificación

Después de la codificación temporal con el codificador transformador, las salidas serán una secuencia de vectores codificados, cada uno con características relacionadas tanto con los aspectos espaciales como temporales de la señal de entrada. El primer paso hacia la clasificación a partir de las salidas codificadas consiste en agrupar todas esas características en un único vector. Esto se logra aplicando agrupación promedio (mean pooling) a la secuencia de vectores de características o empleando el llamado «token de clasificación». Suponga que la salida del transformador es figure-protocol-31, donde cada figure-protocol-32. La característica agrupada h se calcula como:

figure-protocol-33   (20)

Luego, el vector de características agregado h representa la entrada de forma compacta y sirve como entrada del clasificador. La parte de clasificación comprende una o más capas densas, que transforman la representación aprendida al espacio de salida. Una capa densa implementa una transformación que se define de la siguiente manera:

figure-protocol-34   (21)

donde o es la salida (logits), b es el vector de sesgo y W es la matriz de pesos. Estos últimos son las puntuaciones de clase en una forma no normalizada. Para incorporar no linealidad en el modelo, a menudo se utilizan funciones de activación como ReLU. Finalmente, se aplica una función de activación softmax a los logits para obtener una probabilidad para cada clase:

figure-protocol-35   (22)

donde C representa el número de clases, (C = 2; normal y anormal). La predicción de clase se basará en el valor de probabilidad máximo. Durante el entrenamiento, los valores óptimos de los parámetros del modelo se obtienen minimizando la pérdida de entropía cruzada entre las etiquetas reales y las predichas, logrando así una clasificación precisa de los estados de la máquina. En resumen, la capa de clasificación cumple una función esencial al transformar las características temporales extraídas mediante la arquitectura Transformer en decisiones prácticas. A través de una adecuada discriminación entre estados de máquina sanos y defectuosos, la detección de anomalías y la toma inteligente de decisiones se vuelven posibles dentro del paradigma de la Industria 5.0.

Figura 5 muestra cómo funciona la capa de clasificación, que se encuentra después del codificador Transformer. El proceso comienza con la salida de la secuencia codificada, en la cual cada vector contiene información temporal aprendida a partir de la entrada. Estos vectores se combinan en un único vector, conocido como vector de características globales. El siguiente paso consiste en pasar el vector de características globales a través de varias capas densas de redes neuronales. En cada capa densa, se realizan operaciones de multiplicación matricial para crear combinaciones lineales de las entradas. Después, se puede aplicar una función de activación no lineal, como ReLU, para aumentar la flexibilidad en el aprendizaje de los límites de decisión. Al final de la última capa densa, existen puntuaciones logit para cada clase. Estas puntuaciones logit pueden utilizarse en la función Softmax para calcular puntuaciones de probabilidad para cada clase. Estas puntuaciones de probabilidad se emplean para determinar si la entrada pertenece a la Clase 0 (Normal) o a la Clase 1 (Anormal).

Explicabilidad mediante SHAP

Después de que el modelo clasifique las señales de entrada, se generan predicciones según si la máquina funciona normal o anormalmente. Sin embargo, dentro del entorno de la Industria 5.0, no es suficiente producir predicciones; el sistema también debe proporcionar transparencia e interpretabilidad para apoyar la toma de decisiones humanas. El siguiente marco utiliza SHAP, un modelo basado en la teoría de juegos que cuantifica la importancia de cada característica para determinar la predicción. Al hacerlo, SHAP asigna pesos a las características, lo que permite evaluar la importancia relativa de diferentes secciones de la entrada del espectrograma en la predicción general.

La formulación matemática de SHAP se basa en una descomposición del modelo f(x):

figure-protocol-36   (23)

donde ∅0 es el valor de referencia (salida media del modelo), ∅i es el efecto de la i-ésima característica, y M es el número de características de entrada. Para los fines de este estudio, las características son los intervalos de tiempo-frecuencia del espectrograma. Los valores SHAP son positivos si contribuyen a la probabilidad del estado anormal y negativos en caso contrario. Esta formulación garantiza una explicación única y localmente consistente para cada predicción. El método SHAP puede aplicarse a un modelo entrenado de CNN-transformador para proporcionar una explicación basada en la importancia de las características. La representación visual mostrará los intervalos de tiempo-frecuencia más importantes en el espectrograma que afectan el proceso de toma de decisiones. Por ejemplo, un comportamiento anormal del equipo puede resultar en ciertas bandas de frecuencia de alta energía que el marco SHAP identifica como contribuyentes importantes al proceso de decisión.

Además, SHAP puede fomentar la cooperación entre personas y máquinas en un entorno ciberfísico. Esto se debe a que las predicciones pueden explicarse mediante visualizaciones intuitivas, lo que permite a los operadores y a los sistemas de toma de decisiones verificar las predicciones, analizar el problema y tomar las medidas adecuadas. Esto no solo aumenta la confianza, sino que también hace que los procesos de fabricación basados en inteligencia artificial sean confiables y responsables. Al integrar algoritmos de aprendizaje profundo que cumplen con los estándares de rendimiento actuales con SHAP, que proporciona explicabilidad, la arquitectura propuesta cumple con los requisitos de la Industria 5.0.

Algoritmo 2: Explicabilidad basada en SHAP para la predicción del modelo

Entrada: modelo entrenado f(x), espectrograma de entrada S

Resultado: valores SHAP figure-protocol-37 y mapa de explicación

Paso 1: Introduzca el espectrograma S en un modelo entrenado

Paso 2: Calcular la predicción: y = f(S)

Paso 3: Inicializar un explicador SHAP orientado al aprendizaje profundo

Paso 4: Calcular los valores SHAP:
figure-protocol-38

Paso 5: Para cada característica i en S:

Calcular la contribución figure-protocol-39

Paso 6: Generar el mapa de explicación:

Resalte las regiones con alta figure-protocol-40

Paso 7: Visualizar la importancia de las características (mapa de calor)

Paso 8: Devolver los valores SHAP y el mapa de explicación

El algoritmo de explicabilidad basado en SHAP comienza obteniendo una imagen del espectrograma preprocesada como entrada y alimentándola en la arquitectura entrenada de CNN-transformador para realizar predicciones (por ejemplo, condición normal o anormal de la máquina). Después de realizar predicciones utilizando la arquitectura entrenada, se emplea el método SHAP para interpretar el modelo. En particular, se calculan los valores SHAP (ϕ) para cada característica de entrada con el fin de determinar qué componentes tiempo-frecuencia de la entrada contribuyen más a la predicción. Para calcular estos valores, deben compararse las salidas del modelo para entradas con y sin ciertas características.

Después de calcular los valores SHAP para cada característica, su influencia sobre la predicción puede evaluarse mediante el signo y la magnitud del valor SHAP. Por ejemplo, las características con valores SHAP más altos tienen mayor probabilidad de influir en el resultado, y un signo positivo o negativo indica que la característica impulsa la predicción hacia la clase normal/anormal, respectivamente. En función de los resultados, puede elaborarse un mapa de explicación en forma de mapa de calor.

Por último, el algoritmo genera tanto los valores SHAP como las visualizaciones, lo que proporciona una idea clara de cómo los humanos pueden analizar la decisión del modelo. La técnica hace que el proceso sea más transparente y permite a los humanos participar en la toma de decisiones, garantizando así tanto las predicciones del algoritmo como su fiabilidad en la industria impulsada por inteligencia artificial. Se seleccionaron muestras de prueba representativas de instancias anómalas diagnosticadas con precisión en diversos tipos de máquinas para mejorar la fiabilidad del análisis de explicabilidad. Mientras que el análisis global de importancia de características SHAP se realizó agrupando los valores SHAP a través del conjunto de datos de prueba para identificar ubicaciones en el dominio tiempo-frecuencia consistentemente influyentes, se generaron explicaciones SHAP locales para estos casos representativos. Sin necesidad de anotaciones expertas, este análisis integrado local y global ofrece una interpretación confiable de las predicciones del modelo.

Integración de CPS habilitada para edge

Esta solución propuesta se utiliza dentro de los CPS habilitados para el edge computing, que tiene como objetivo lograr eficiencia, sostenibilidad y operaciones industriales en tiempo real. Una vez que el modelo ha sido entrenado, la red CNN-transformer se implementará mediante un enfoque de edge computing. La capa de edge computing en cuestión está cerca de los dispositivos industriales de Internet de las Cosas (IIoT), incluyendo sensores y maquinaria. En lugar de transmitir todos los datos recopilados a la nube, el dispositivo perimetral realiza inferencias sobre la señal acústica entrante sin transferirla previamente. Por lo tanto, el sistema puede detectar anomalías en la maquinaria casi instantáneamente y tomar las medidas necesarias antes de que la situación empeore. Otra ventaja de este enfoque habilitado para el edge computing es una menor latencia y mayor eficiencia, ya que los datos se analizan cerca del punto de generación. En otras palabras, a diferencia del enfoque en la nube, donde el tiempo de inferencia Tinf

figure-protocol-41   (24)

La latencia, en general, se reducirá considerablemente mediante una disminución en Tcommunication. Otro beneficio es la reducción del consumo de ancho de banda y de la energía consumida al transmitir datos de forma continua. Por lo tanto, este sistema es escalable y sostenible para plantas industriales grandes con numerosos dispositivos conectados. Además, el CPS permite la interacción con la capa física (máquinas), la IA (capa computacional) y la capa humana.

Colaboración con participación humana

Un componente clave del CPS sugerido para la Industria 5.0, que incluye operadores humanos activamente involucrados en el proceso de toma de decisiones junto con modelos de inteligencia artificial, es la colaboración con el humano en el bucle. Específicamente, según el marco diseñado, el sistema no se convierte en una caja negra autónoma, sino que permite a los operadores interactuar con él y observar resultados de predicciones explicables en forma de explicaciones SHAP. Las predicciones en cuestión se refieren a los resultados (normales/anormales), acompañados de visualizaciones de partes de los espectrogramas utilizados para generarlas.

Dicha interacción ayuda a los operadores a comprender mejor cómo se forma la predicción y qué factores contribuyen a ella. La participación humana implica verificar los resultados del sistema y permite a los operadores anularlos cuando sea necesario, basándose en su criterio profesional. La colaboración con los operadores humanos hace que el sistema sea más confiable, eficiente, seguro y fiable, ayudando a prevenir errores.

Resultados

El sistema de colaboración ciberfísica integrado con inteligencia artificial explicable presentado fue probado experimentalmente con aproximadamente 12 000 grabaciones de audio del conjunto de datos MIMII, que contiene condiciones normales y anormales de máquinas. El conjunto de datos de entrenamiento consistió en unos 9 600 registros, mientras que el conjunto de datos de prueba incluyó aproximadamente 2 400 muestras de audio. Según los resultados, el modelo sugerido basado en CNN-transformador alcanzó una precisión de clasificación del 98,5 % en el conjunto de datos de prueba, entre 0,97 y 0,98. Esto se relaciona con los hallazgos de la Tabla 3, la matriz de confusión y el análisis de estabilidad estadística. La integración del codificador transformador mejora las capacidades del modelo para modelar aspectos temporales, mientras que la CNN extrae características espaciales discriminativas del espectrograma de entrada.

Además del rendimiento de clasificación, se evaluaron otras características relacionadas con el sistema. En primer lugar, la latencia de inferencia para una implementación basada en dispositivos periféricos no superó los 20 ms, lo que permite la detección en tiempo real de anomalías. En segundo lugar, el sistema presentado ayudó a mejorar la eficiencia energética al reducir los requisitos de comunicación. Por último, el marco de Inteligencia Artificial Explicable propuesto proporciona interpretabilidad mediante SHAP, facilitando el análisis del modelo desde la perspectiva de un experto en el dominio. Los datos de MIMII se convirtieron en espectrogramas mediante la Transformada de Fourier de Tiempo Corto (STFT), utilizando un tamaño de ventana de 1024, un tamaño de salto de 512 y un tamaño de Transformada Rápida de Fourier (FFT) de 1024. Los espectrogramas Mel logarítmicos resultantes se redimensionaron a 224 × 224 píxeles y luego se normalizaron mediante puntuación z. Se emplearon métodos de aumento de datos, incluyendo enmascaramiento temporal, enmascaramiento frecuencial y adición de ruido gaussiano, para aumentar la robustez del modelo entrenado. La arquitectura de la CNN constó de cuatro capas convolucionales con 32, 64, 128 y 256 filtros, respectivamente, e incluyó normalización por lotes, funciones ReLU y capas de agrupación máxima. Los mapas de características extraídos se transformaron en secuencias y se utilizaron como entradas para el codificador transformador, que constaba de cuatro capas codificadoras, ocho cabezales de atención, una incrustación de 256 dimensiones y una dimensión de alimentación directa de 1024 dimensiones. Se aplicó una probabilidad de abandono (dropout) de 0,3 para minimizar el sobreajuste. Se utilizó el optimizador Adam con una tasa de aprendizaje de 0,0001 y una disminución de peso de 1 x 10⁻5 para el entrenamiento. El número de épocas y el tamaño del lote durante el entrenamiento fueron 100 y 32, respectivamente. La semilla aleatoria se estableció en 42 para mantener la reproducibilidad del experimento. Para verificar la validez estadística de los resultados se utilizaron los siguientes métodos: todos los experimentos se realizaron de forma independiente 10 veces con diferentes semillas aleatorias y reordenamientos de datos. Se calcularon los valores promedio y las desviaciones estándar de la exactitud, precisión, exhaustividad (recall), puntuación F1, área bajo la curva característica de operación del receptor (ROC-AUC) y área bajo la curva precisión–exhaustividad (PR-AUC). Además, se calcularon intervalos de confianza del 95 % para estimar la incertidumbre del rendimiento. Finalmente, se realizó una prueba t pareada comparando los resultados de nuestro enfoque CNN-transformador con el modelo de referencia de mejor desempeño. Se aplicó el método de detención temprana utilizando 10 épocas como parámetro de paciencia. Tabla 4 presenta la configuración ambiental y la configuración de hiperparámetros, y Tabla 5 proporciona los detalles del entorno de simulación.

El experimento de evaluación del presente trabajo se realizó utilizando el conjunto de datos MIMII, que incluye diversas condiciones de funcionamiento de máquinas y escenarios acústicos de fallas. Aunque los resultados del marco propuesto validan el modelo, se requiere una validación adicional en diversos conjuntos de datos industriales y entornos de fabricación.

El marco propuesto se implementó en una plataforma de computación en el borde equipada con un procesador multinúcleo, 16 GB de memoria del sistema y un acelerador en el borde habilitado para unidad de procesamiento gráfico (GPU) para soportar inferencia y explicabilidad en tiempo real. Sensores acústicos industriales transmitieron flujos de audio al gateway en el borde a través de la capa de comunicación IIoT. Los nodos en el borde se utilizaron para realizar tareas como la creación de espectrogramas, inferencia de anomalías y generación de explicaciones SHAP, mientras que el servidor en la nube se utilizó para almacenar datos a largo plazo y actualizar el modelo. Esta configuración no solo reduce la cantidad de comunicación requerida, sino que también permite la interacción en tiempo real entre dispositivos de detección, módulos de inteligencia artificial y operadores humanos en sistemas ciberfísicos.

El enfoque CNN-transformador introducido anteriormente se compara con varios métodos existentes, incluyendo modelos convencionales de aprendizaje automático (ML) como máquina de vectores de soporte (SVM) y bosque aleatorio, modelos CNN sin el transformador y métodos basados en memoria a corto y largo plazo (LSTM). Si bien los modelos tradicionales de ML no logran resultados satisfactorios debido a la falta de capacidad para procesar correlaciones espaciales y temporales en los datos, los modelos CNN pueden manejar eficientemente las características espaciales, mientras que los modelos LSTM pueden abordar los aspectos temporales de las señales acústicas. No obstante, los primeros son inferiores a los últimos en términos de costo computacional y capacidad de procesamiento paralelo.

Para garantizar una comparación justa entre el modelo propuesto CNN-transformador y los modelos de referencia, este último se entrenó y evaluó utilizando la misma división del conjunto de datos MIMII (80 % para entrenamiento y 20 % para pruebas), los mismos pasos de preprocesamiento, el proceso de creación de espectrogramas y las mismas medidas de evaluación. En el método SVM, se utilizó un kernel de función de base radial (RBF), con C = 10 y γ = 0,01. El método de bosque aleatorio incluyó 200 árboles, con una profundidad máxima de árbol de 20. En cuanto a la CNN, esta tenía cuatro capas de convolución (32, 64, 128 y 256 filtros) seguidas por capas completamente conectadas sin un módulo Transformador. Por último, para el método LSTM, se utilizaron dos capas LSTM apiladas con 128 unidades ocultas y una tasa de abandono (dropout) de 0,3.

Por el contrario, el uso del marco CNN-transformador permite obtener los mejores resultados aprovechando eficientemente tanto las capacidades espaciales como temporales de las señales acústicas. Además, el uso de computación en el borde permite reducir los costos computacionales, mejorar la latencia y ahorrar energía. Asimismo, la explicabilidad de las predicciones implementada mediante SHAP puede considerarse otra ventaja que distingue al método propuesto de las técnicas existentes.

A pesar de los recientes avances en el desarrollo de nuevos modelos para la detección de anomalías acústicas, como el Transformador de Visión (ViT), el Transformador de Espectrograma de Audio (AST), Conformer y modelos basados en aprendizaje auto-supervisado, no se realizó en el presente estudio una comparación experimental de estas arquitecturas. En el futuro, se planea utilizar estos modelos como puntos de referencia para evaluar el marco propuesto.

Las métricas, incluyendo exactitud, precisión, recuperación y puntuación F1, se utilizan para evaluar el desempeño del modelo propuesto. Mientras que la precisión mide la proporción de verdaderos positivos respecto al número total de verdaderos positivos y falsos positivos, la exactitud evalúa la corrección general de las predicciones. La recuperación proporciona una estimación de la capacidad del modelo para predecir anomalías en un sistema determinado. Esto es crucial porque no prever un defecto podría provocar fallos del sistema. A continuación se indica cómo se calculan matemáticamente estas métricas:

figure-results-1   (25)

figure-results-2   (26)

figure-results-3   (27)

figure-results-4   (28)

Además de estas, se consideran métricas adicionales relacionadas con el rendimiento del sistema, como la latencia, la utilización de energía y la escalabilidad, al evaluar el rendimiento en el mundo real del modelo de CPS propuesto basado en computación en el borde.

Además de las técnicas estándar de medición del rendimiento, existen muchas otras medidas que pueden ayudar a evaluar la solución propuesta desde una perspectiva más integral, especialmente considerando su aplicabilidad a estudios de casos reales con datos desbalanceados y en flujo continuo. Por ejemplo, la capacidad del algoritmo para distinguir entre los dos grupos según diferentes umbrales se mide mediante el área bajo la curva de característica operativa del receptor (ROC-AUC). Dada su robustez y separabilidad, el valor de ROC-AUC debe ser alto. Además, la métrica área bajo la curva de precisión-recuperación (PR-AUC) es importante para el estudio de caso de detección de anomalías, ya que las clases anómalas son raras.

Una medida importante a considerar es el coeficiente de correlación de Matthews (MCC). Este considera los cuatro elementos de la matriz de confusión y proporciona una evaluación precisa, incluso en presencia de desequilibrio entre clases. Esta medida se calcula de la siguiente manera:

figure-results-5   (29)

Los valores de MCC varían de -1 a +1, donde +1 indica una predicción perfecta. La otra métrica que podría aplicarse es la Especificidad (Tasa de Verdaderos Negativos), que sería útil en una aplicación industrial para evaluar si existen predicciones falsas positivas:

figure-results-6    (30)

Para asegurarse de que no hubiera inconsistencia entre la matriz de confusión y las métricas de rendimiento, todos los criterios de evaluación se calcularon basándose en el conjunto de datos de prueba final. Las notaciones de verdadero positivo (TP), verdadero negativo (TN), falso positivo (FP) y falso negativo (FN) se utilizan en todas las ecuaciones siguientes. La exactitud, precisión, recuperación, especificidad, puntuación F1 y MCC se calcularon según las ecuaciones (25)–(30). Además, se calcularon ROC-AUC y PR-AUC a partir de las salidas de probabilidad del modelo CNN-transformer mediante evaluación independiente del umbral.

Las métricas clave a considerar a nivel del sistema incluyen latencia, rendimiento y costo computacional. La latencia es el tiempo necesario para realizar una predicción. El rendimiento es la cantidad de muestras de datos procesadas por segundo. El costo computacional, que representa la eficiencia energética, es importante para garantizar la eficiencia computacional. Además, también se podrían considerar métricas de explicabilidad, como la consistencia SHAP y la estabilidad de la importancia de las características, al evaluar el modelo.

Es evidente a partir de los resultados en la Tabla 3 para el conjunto de datos MIMII que el modelo propuesto de CNN-transformador supera a todos los demás métodos de aprendizaje automático y aprendizaje profundo. El desempeño de los modelos SVM y bosque aleatorio es aceptable, aunque limitado, con precisiones del 88,6 % y del 91,2 %, respectivamente. Esto podría explicarse por la incapacidad de estos modelos para extraer características temporales y espaciales complejas de las señales acústicas. Sin embargo, LSTM supera a SVM y al bosque aleatorio, alcanzando una precisión del 94,5 % al modelar datos de series temporales. No obstante, el enfoque sugerido de CNN-transformador demuestra el mejor desempeño, con una precisión mejorada (98,5 %), precisión (98,06 %), recuperación (99,02 %) y puntuación F1 (98,54 %). Por lo tanto, el algoritmo sugerido puede clasificar con precisión condiciones normales y anormales de maquinaria. La especificidad mejorada (97,96 %) demuestra la eficacia del enfoque para reducir los falsos positivos, lo cual es crucial para la industria. Cabe señalar que el desempeño de CNN-transformador puede explicarse por la combinación de CNN y Transformador, donde el primero extrae características discriminativas y el segundo captura relaciones temporales en secuencias largas.

La curva ROC en la Figura 6 muestra el rendimiento comparativo de los métodos SVM, bosque aleatorio, LSTM y el enfoque propuesto de CNN-transformador respecto a sus capacidades de clasificación con el conjunto de datos MIMII. Como se muestra en la Figura 6, el Área Bajo la Curva (AUC) más alta fue observada para la CNN-transformador sugerida, que alcanzó un valor de 0,994. Es evidente que el método propuesto ofrece un mejor desempeño discriminativo para distinguir entre categorías normales y anormales. Por otro lado, LSTM produce resultados ligeramente inferiores al enfoque sugerido de CNN-transformador; por lo tanto, su AUC es aproximadamente 0,97. Tanto el bosque aleatorio como SVM tienen AUC relativamente bajos, alrededor de 0,958 y 0,913, respectivamente. Esto se atribuye a la incapacidad de ambos enfoques para aprender patrones acústicos complejos a partir de los datos proporcionados.

En la detección de anomalías, donde las muestras anómalas son escasas, la curva precisión-exhaustividad (PR) proporciona un análisis más adecuado. En la curva PR, el modelo CNN-transformer alcanza la Precisión Media (AP) más alta, alrededor de 0,97–0,98, lo que sugiere una capacidad superior para detectar instancias anómalas con menos falsas alarmas, como se muestra en Figura 7. Por el contrario, el clasificador LSTM ocupa el segundo lugar, con una AP que varía entre 0,92 y 0,94. Por otro lado, los clasificadores bosque aleatorio y SVM ocupan el tercer y cuarto lugar, respectivamente, con APs de 0,88 y 0,84. El clasificador híbrido propuesto logra una mayor precisión en todos los niveles de exhaustividad, lo cual es importante para aplicaciones industriales prácticas, ya que requieren alta precisión y pocas falsas alarmas.

El modelo CNN-transformer se ha comparado con modelos existentes en el conjunto de datos MIMII utilizando las métricas avanzadas de rendimiento que se muestran en la Tabla 6. El valor ROC-AUC indica la capacidad discriminativa del modelo entre las dos clases a través de varios umbrales. Los clasificadores SVM y bosque aleatorio alcanzan valores de ROC-AUC de 0,913 y 0,958, respectivamente, mientras que el modelo LSTM obtiene un ROC-AUC de 0,970, y la CNN obtiene 0,98. El marco propuesto CNN-transformer logra el ROC-AUC más alto de 0,994, lo que demuestra una discriminación superior entre condiciones normales y anormales de la máquina. De manera similar, los valores PR-AUC indican que el modelo propuesto puede manejar eficazmente el desequilibrio de clases, un factor esencial en la detección de anomalías. El modelo CNN-transformer propuesto alcanza el PR-AUC (Precisión Media) más alto de 0,982, seguido por CNN (0,950), LSTM (0,912), bosque aleatorio (0,891) y SVM (0,765), lo que indica un rendimiento superior en precisión y recuperación para la detección acústica de anomalías industriales. Además, el Coeficiente de Correlación de Matthews (MCC), que mide el equilibrio del rendimiento del modelo, presenta un valor relativamente alto de 0,97 para el modelo propuesto. Sin embargo, métodos anteriores como SVM (0,73) y bosque aleatorio (0,78) tuvieron una precisión predictiva más baja.

Para evaluar la estabilidad del enfoque presentado, se realizó el mismo experimento 10 veces con diferentes semillas de inicialización y esquemas de mezcla de datos. Los resultados en la Tabla 7 para la arquitectura CNN-transformer fueron los siguientes: exactitud = 98,50 % ± 0,19 %, precisión = 98,06 % ± 0,23 %, recuperación = 99,02 % ± 0,22 % y puntuación F1 = 98,54 % ± 0,24 %. La desviación estándar relativamente pequeña indica la estabilidad del modelo. Se calcularon los intervalos de confianza del 95 % para todas las medidas de evaluación. Se determinó que el intervalo de confianza para la métrica de exactitud fue [98,1 %, 98,9 %], lo que indica que el modelo tiene un rendimiento consistentemente alto. También se obtuvieron intervalos de confianza estrechos para ROC-AUC, PR-AUC y MCC. La prueba t pareada que comparó el modelo propuesto CNN-transformer con el modelo de referencia de mejor desempeño (LSTM) arrojó un valor de p < 0,05, lo que indica que la mejora de rendimiento observada es significativa y no se debe al azar.

Para evaluar la robustez de la arquitectura propuesta de CNN-transformer, los experimentos se repitieron 10 veces con diferentes semillas de inicialización aleatoria y configuraciones de aleatorización, como se muestra en la Figura 8. La precisión, exactitud, recuperación y puntuación F1 promedio obtenidas por el modelo fueron 98,50 % ± 0,19 %, 98,06 % ± 0,23 %, 99,02 % ± 0,22 % y 98,54 % ± 0,24 %, respectivamente. A partir del análisis del diagrama de caja, existen variaciones mínimas en las métricas de rendimiento del modelo, lo que indica su estabilidad y robustez. Por lo tanto, el enfoque propuesto exhibe una alta estabilidad a través de múltiples experimentos, sin variaciones significativas, lo que indica las buenas capacidades de generalización del modelo.

Además, se realizó una prueba estadística basada en los resultados de múltiples ejecuciones del experimento. Las pequeñas desviaciones estándar en todas las medidas de evaluación sugieren una baja susceptibilidad a los cambios en el azar o en el entrenamiento. Esto confirma que el modelo propuesto de CNN-transformador puede ofrecer un rendimiento estable y consistente en sistemas de fabricación ciberfísicos del mundo real.

El mapa de calor SHAP da una idea de la importancia de las regiones tiempo-frecuencia en el espectrograma para predecir si la condición de la máquina es normal o anormal. Los valores SHAP indican la contribución de cada predictor a la predicción final.

En el mapa de calor de valores SHAP que se muestra en la Figura 9A, los valores SHAP positivos (por ejemplo, entre +0,6 y +1,2) representan una contribución hacia la anormalidad, mientras que los valores SHAP negativos (es decir, entre −0,3 y −0,8) representan una contribución hacia la categoría normal. La puntuación SHAP más intensa se encontró en el rango de frecuencias medias (40–80 intervalos de frecuencia) en los intervalos de tiempo 50–100. Estas regiones son las áreas clave donde se detectan las señales críticas de falla en las mediciones acústicas. Además, la banda de baja frecuencia (menos de 20 intervalos) muestra puntuaciones SHAP casi nulas (−0,1 a +0,1), lo que indica un impacto despreciable en la toma de decisiones del modelo. Esto indica que el modelo ignora el ruido de fondo irrelevante para la predicción de fallas. La consistencia temporal de las puntuaciones SHAP altas dentro de bandas de tiempo específicas también destaca la capacidad del módulo Transformer para captar dependencias de largo alcance en las señales acústicas. En resumen, el mapa de calor SHAP muestra claramente que el modelo CNN-Transformer se enfoca en bandas específicas de tiempo-frecuencia con alto poder discriminativo. Esto mejora la interpretabilidad del modelo y ayuda al operador humano a detectar visualmente las fallas.

Se muestra que el método SHAP se utiliza únicamente como una técnica de interpretabilidad y no forma parte del proceso de entrenamiento del modelo CNN-transformer. La precisión de clasificación está determinada exclusivamente por los parámetros aprendidos por los componentes CNN y Transformer. SHAP se utiliza después del paso de inferencia del modelo para interpretar las predicciones, identificando las ventanas tiempo-frecuencia más influyentes que orientan las predicciones hacia categorías normales o anormales. Por lo tanto, SHAP mejora la transparencia y comprensión humana sin afectar la precisión de clasificación. Los valores SHAP proporcionados por el marco propuesto permiten una visualización clara que ayudará a los operarios de mantenimiento a verificar las predicciones del modelo comparando las regiones detectadas con el comportamiento real de la máquina y los registros de mantenimiento. Así, será más fácil para las personas colaborar con las máquinas durante actividades de mantenimiento predictivo.

Para evaluar el nivel de explicabilidad, se realizó un análisis global de SHAP sobre la importancia de las características, como se ilustra en la Figura 9B. Los resultados muestran que algunos componentes de frecuencia media desempeñan un papel significativo en la detección de anomalías. Además, un estudio de caso ilustrado en la Figura 9C muestra que SHAP identifica correctamente las regiones relevantes para fallas en espectrogramas anormales de máquinas. El estudio incluyó un estudio de caso cualitativo que utilizó muestras de datos anormales de bombas y válvulas del conjunto de datos MIMII. En el caso de bombas defectuosas, SHAP identificó rangos de frecuencia de 2–4 kHz asociados con cavitación y desgaste. En el caso de válvulas defectuosas, la activación de SHAP fue dominante en áreas con señales armónicas repetidas, indicativas de fugas. En muestras de prueba representativas, las visualizaciones de SHAP identificaron de manera confiable zonas temporales y frecuenciales discriminativas asociadas con condiciones anómalas de las máquinas. Al resaltar las regiones espectrales que contribuyen más significativamente a cada predicción, estas explicaciones arrojan luz sobre cómo toma decisiones el modelo. El análisis de SHAP se ofrece como una herramienta de interpretabilidad para comprender el comportamiento del modelo, y no como una verificación de fallas validada por expertos, ya que la validación formal por profesionales de mantenimiento quedó fuera del alcance de este estudio.

La matriz de confusión destaca qué tan bien el modelo propuesto CNN-transformer realiza la clasificación en el conjunto de datos MIMII mostrado en la Figura 10. En general, se identificaron correctamente 960 muestras normales como normales (verdaderos negativos), mientras que 20 muestras normales se identificaron erróneamente como anormales (falsos positivos). Además, de todas las muestras, se detectaron 1010 muestras anormales como tales (verdaderos positivos), mientras que 10 muestras anormales se identificaron como normales (falsos negativos).

Por lo tanto, se logró un alto rendimiento de detección, especialmente para muestras anómalas, que son cruciales en el mantenimiento predictivo. Como se muestra en la Figura 10, un error Falso Negativo se observa muy rara vez (10 muestras), lo cual es vital para cualquier industria para garantizar su seguridad y fiabilidad. Por otro lado, el error Falso Positivo (20 muestras) ocurre ligeramente con mayor frecuencia, pero permanece en un nivel relativamente bajo. La matriz de confusión mostrada en la Figura 10 se generó utilizando un subconjunto equilibrado de 2.000 grabaciones de prueba (igual número de muestras normales y anómalas) para proporcionar una visualización clara del rendimiento del clasificador. Todas las métricas de evaluación reportadas, incluyendo exactitud, precisión, recuperación, especificidad y puntuación F1, se calcularon utilizando el conjunto completo de pruebas (aproximadamente 2.400 grabaciones).

Teniendo en cuenta la matriz de confusión mostrada en la Figura 10 y en la Tabla 8 (TN = 960, FP = 20, TP = 1010, FN = 10), se pueden realizar los siguientes cálculos: Exactitud = (TP + TN) / (TP + TN + FP + FN) = 98,50 %, Precisión = TP/(TP + FP) = 98,06 %, Exhaustividad = TP/(TP + FN) = 99,02 %, Especificidad = TN / (TN + FP) = 97,96 %, Puntaje F1 = 98,54 % y MCC = 0,97. Además, los valores de ROC-AUC y PR-AUC fueron 0,994 y 0,982, respectivamente. La matriz de confusión mostrada en la Figura 10 se generó utilizando un subconjunto equilibrado y representativo de 2.000 grabaciones de los datos de prueba, únicamente con fines de visualización. Todas las métricas cuantitativas de rendimiento informadas en este estudio se calcularon utilizando el conjunto completo de pruebas (aproximadamente 2.400 grabaciones). En general, los resultados demuestran que la arquitectura propuesta de CNN-transformador alcanza una exactitud de clasificación del 98,5 %, en línea con los resultados reportados en la Tabla 8 y con el análisis de ablación.

Para verificar la eficacia de la implementación basada en el borde, se realizaron mediciones adicionales. La latencia media de inferencia del modelo propuesto es de 18,7 ms/muestra y puede procesar aproximadamente 53 muestras por segundo, como se muestra en Tabla 9. El consumo de energía durante la inferencia fue de 8,9 W, lo que arroja un consumo energético estimado de 0,167 J/predicción. Para evaluar el impacto de sostenibilidad del enfoque propuesto en la Tabla 10, se han considerado la sobrecarga de comunicación, el consumo de energía y el uso de recursos. Dado que el proceso de inferencia ocurre localmente en nodos periféricos, solo se transmite al entorno en la nube datos diagnósticos resumidos. Los resultados experimentales indicaron una reducción del 73 % en la comunicación en comparación con los sistemas CPS tradicionales basados en la nube. Además, la inferencia local redujo el consumo de energía en un 32 %, mientras que el tiempo de comunicación disminuyó de 75 ms a 20 ms.

Estudio de ablación

El conjunto de datos MIMII se somete a una investigación de ablación para evaluar el impacto de cada componente de la arquitectura CPHS basada en IA explicable. Este estudio de ablación investiga los efectos del uso de una CNN para aprender características espaciales, un codificador transformador para aprender características temporales y del propio algoritmo de explicabilidad SHAP. Se consideran varias modificaciones del modelo propuesto, a saber: (i) una versión solo con CNN, (ii) una versión solo con Transformador, (iii) el modelo con CNN y Transformador combinados pero sin el algoritmo SHAP, y (iv) el modelo completo propuesto con CNN y Transformador combinados con SHAP. Para la evaluación, se emplean métricas comunes como precisión, exactitud, recuperación y puntuación F1.

Estos resultados del estudio de ablación demuestran la importancia de cada elemento en el marco descrito en la Tabla 11. El modelo basado únicamente en CNN alcanza una precisión del 93,8 %, lo que indica que la extracción de características espaciales a partir de espectrogramas es efectiva, aunque no puede capturar las dependencias temporales en las señales acústicas. Lo mismo ocurre con el modelo basado únicamente en Transformer, que alcanza una precisión ligeramente menor (92,6 %) porque extrae características temporales pero descuida la información espacial. Finalmente, el modelo propuesto CNN-Transformer obtuvo una precisión del 98,5 %, una exactitud del 98,06 %, una recuperación del 99,02 % y una puntuación F1 del 98,54 %, en concordancia con los resultados del experimento principal. Dado que SHAP se utiliza únicamente para la interpretación post hoc y no para el entrenamiento del modelo, la precisión en la clasificación es la misma que la del modelo CNN-Transformer entrenado. A continuación, se utiliza SHAP para generar explicaciones basadas en la atribución de características. El aumento en la recuperación (99,02 %) indica que el modelo es eficaz para detectar condiciones anómalas en las máquinas, asegurando que no se pasen por alto piezas defectuosas, lo cual es imprescindible para implementar un sistema de mantenimiento predictivo.

DISPONIBILIDAD DE LOS DATOS:

El conjunto de datos MIMII (Malfunctioning Industrial Machine Investigation and Inspection) utilizado en este estudio está disponible públicamente en el repositorio oficial de Zenodo. Los experimentos se realizaron utilizando las grabaciones de audio y anotaciones disponibles públicamente proporcionadas por los autores del conjunto de datos. El conjunto de datos puede accederse en https://zenodo.org/records/3384388. El código de implementación que acompaña a este estudio está disponible públicamente a través del repositorio de Zenodo en https://zenodo.org/records/21405292. El repositorio incluye el código de implementación del marco propuesto, incluyendo la canalización de preprocesamiento de datos, la arquitectura del modelo, el flujo de trabajo de entrenamiento, los scripts de evaluación, los archivos de configuración y las utilidades auxiliares para facilitar la comprensión y la reproducción independiente de la metodología propuesta. El conjunto de datos MIMII no se redistribuye junto con el código de implementación y debe obtenerse por separado de su repositorio oficial.

figure-results-7
Figura 1: Arquitectura del trabajo propuesto. Diseño arquitectónico de un sistema ciberfísico humano impulsado por inteligencia artificial interpretable que combina preprocesamiento, aprendizaje espacial basado en CNN, modelado temporal basado en transformadores, explicabilidad mediante SHAP y computación en el borde para la fabricación sostenible. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-8
Figura 2: Secuencia de preprocesamiento. Secuencia de preprocesamiento de señales acústicas que consiste en la eliminación de ruido, normalización, segmentación, transformación STFT y extracción del espectrograma. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-9
Figura 3: Extracción de características espaciales mediante CNN. Arquitectura para la extracción de características espaciales mediante redes neuronales convolucionales (CNN) utilizando espectrogramas a través del proceso de convolución, activación y agrupación. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-10
Figura 4: Modelado temporal mediante un codificador transformador. Arquitectura de codificador transformador para capturar dependencias temporales y dependencias de largo alcance a través de la representación de secuencias de espectrogramas. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-11
Figura 5: Capa de clasificación. Una capa clasificadora que asigna las características temporales codificadas a valores de probabilidad para predecir el estado de la máquina. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-12
Figura 6: Resultado de la curva ROC. Comparación de las curvas ROC para los algoritmos SVM, bosque aleatorio, LSTM, CNN y CNN-transformador propuesto en el conjunto de datos MIMII. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-13
Figura 7: Resultado de la curva precisión-exhaustividad. Comparación de curvas de precisión-exhaustividad que representa la eficiencia de detección de anomalías de diversos métodos de aprendizaje automático y aprendizaje profundo. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-14
Figura 8: Análisis de estabilidad del rendimiento en múltiples ejecuciones. Gráfico de caja que muestra la estabilidad en el rendimiento de los resultados de exactitud, precisión, recuperación y puntuación F1 obtenidos en diez experimentos independientes realizados con la arquitectura propuesta de CNN-transformador. Las pequeñas variaciones indican estabilidad y robustez del modelo. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-15
Figura 9: Análisis de explicabilidad basado en SHAP del marco propuesto para la detección de anomalías. (A) Análisis de explicabilidad basado en SHAP. Mapa de calor que utiliza el método SHAP para mostrar las zonas tiempo-frecuencia más relevantes que conducen a la identificación de comportamientos anómalos. (B) Análisis de la importancia de las características utilizando el enfoque global SHAP para la identificación de las características más influyentes. (C) Visualización de la explicabilidad SHAP para una máquina anormal. Haga clic aquí para ver una versión más grande de esta figura.

figure-results-16
Figura 10: Matriz de confusión para el conjunto de datos MIMII. La matriz de confusión representa el rendimiento de clasificación del algoritmo propuesto basado en CNN-transformador. Haga clic aquí para ver una versión más grande de esta figura.

ParámetroDescripción
Nombre del conjunto de datosConjunto de datos MIMII (Malfunctioning Industrial Machine Investigation and Inspection)
Tipos de máquinasVálvulas, Bombas, Ventiladores, Rieles deslizantes
Total de muestras utilizadasAproximadamente 12 000 grabaciones de audio
ClasesNormal, Anormal
Frecuencia de muestreo16 kHz
Duración por muestra10 segundos
Formato de audioWAV
Representación de característicasImágenes espectrograma basadas en STFT
Pasos de preprocesamientoFiltrado de ruido, Normalización, Segmentación, Transformación STFT
Asignación de etiquetasGrabaciones normales etiquetadas como Clase 0; grabaciones anormales etiquetadas como Clase 1 según las anotaciones de MIMII
División entre entrenamiento y prueba80 % para entrenamiento (≈9 600 muestras), 20 % para pruebas (≈2 400 muestras)
Estrategia de partición de datosDivisión a nivel de archivo de audio realizada antes de la segmentación para evitar fugas de datos
Condiciones de ruido industrialAmbientes acústicos industriales realistas incluidos en las grabaciones MIMII
Dominio de aplicaciónMantenimiento predictivo y detección de anomalías en máquinas
Objetivo industrial de la Industria 5.0Detección de fallos explicable, centrada en el ser humano y sostenible

Tabla 1: Descripción del conjunto de datos. Descripción del conjunto de datos MIMII con respecto al tipo de máquina, distribución de muestreo, características de la señal, representación de características y aspectos de aplicación.

Tipo de máquinaIdentificadores de máquinaGrabaciones normalesGrabaciones anómalasCondiciones de relación señal-ruido (dB)División experimental
VentiladorID00–ID068.4001.600−12 a −980 % entrenamiento / 20 % prueba
Caja de engranajesID00–ID067.1241.147−17 a −1580 % entrenamiento / 20 % prueba
BombaID00–ID067.2001.800−18 a −980 % entrenamiento / 20 % prueba
Carril deslizanteID00–ID057.0001.800−14 a −1280 % entrenamiento / 20 % prueba
VálvulaID00–ID057.0001.800−12 a −980 % entrenamiento / 20 % prueba

Tabla 2: Descripción del conjunto de datos MIMII utilizado en este estudio. Tipos de máquinas industriales, identificaciones de las máquinas, cantidades de grabaciones normales y anómalas, condiciones de relación señal-ruido (SNR) y la partición entrenamiento/prueba utilizada para la clasificación binaria supervisada.

ModeloPrecisión (%)Exactitud (%)Sensibilidad (%)Puntuación F1 (%)Especificidad (%)
SVM88.686.985.486.190.2
Bosque aleatorio (RF)91.289.888.589.192.6
LSTM94.593.292.89395.1
CNN96.395.494.995.196.8
CNN–Transformador (propuesto)98.598.0699.0298.5497.96

Tabla 3: Resultado de clasificación para el conjunto de datos MIMII. Comparación del rendimiento de los clasificadores de aprendizaje automático y aprendizaje profundo utilizando exactitud, precisión, recuperación, puntuación F1 y especificidad.

ParámetroValor
Conjunto de datosMIMII Dataset
Número total de muestras~12,000
División entre entrenamiento y prueba80% / 20%
Tipo de entradaImágenes de espectrogramas
Capas CNN3–5 capas de convolución
Capas Transformer2–4 capas codificadoras
Tamaño del lote32
Tasa de aprendizaje0.001
OptimizadorAdam
Épocas100
HardwareDispositivo perimetral + GPU (para entrenamiento)
Longitud de la ventana STFT1024
Tamaño del salto512
Tamaño de la FFT1024
Resolución del espectrograma224 × 224
NormalizaciónZ-score
Aumento de datosEnmascaramiento temporal, enmascaramiento frecuencial, ruido gaussiano
Capas CNN4
Filtros CNN32, 64, 128, 256
Capas Transformer4
Cabezas de atención8
Dimensión del embedding256
Dimensión de la red de alimentación directa1024
Dropout0.3
Semilla aleatoria42
Paciencia para detención temprana10

Tabla 4: Configuración ambiental y configuración de hiperparámetros. Parámetros de entrenamiento y experimentos utilizados para implementar la arquitectura propuesta de CNN-transformador.

ComponenteEspecificación
Lenguaje de programaciónPython
FrameworkTensorFlow / PyTorch
ProcesadorIntel i7 / Ryzen 7
GPUNVIDIA GTX 1660 / RTX Series
Dispositivo perimetralRaspberry Pi / NVIDIA Jetson
VisualizaciónMatplotlib, SHAP
Dispositivo perimetralNVIDIA Jetson Xavier NX
CPU6-core ARM v8.2
RAM16 GB
Sistema operativoUbuntu 20.04
Framework de aprendizaje profundoTensorFlow/PyTorch
Tamaño del conjunto de datos12,000 muestras MIMII
ConectividadEthernet/Wi-Fi
Parámetros del modelo8.4 millones
Tamaño del modelo32.7 MB
FrameworkPyTorch + TensorRT
Tamaño del lote1
CuantizaciónFP16
PodaNo
Latencia promedio17.8 ms
Latencia mediana17.2 ms
Latencia percentil 9519.6 ms
Rendimiento56 muestras/s
Uso de memoria1.4 GB
Consumo de energía11.3 W

Tabla 5: Ambiente de simulación. Se utilizaron hardware y software para entrenar, desplegar y evaluar el modelo propuesto.

ModeloROC-AUCPR-AUCMCC
SVM0.9130.7650.73
Bosque Aleatorio (RF)0.9580.8910.78
LSTM0.970.9120.86
CNN0.980.950.9
CNN–Transformador (Propuesto)0.9940.9820.97

Tabla 6: Comparación de los resultados experimentales para ROC-AUC, PR-AUC y MCC. Comparación entre varios modelos basada en las medidas de ROC-AUC, PR-AUC y coeficiente de correlación de Matthews.

MétricaMedia (%) + Desv. (%)Confianza del 95 %
Precisión98.50 ± 0.19[98.1, 98.9]
Exactitud98.06 ± 0.23[98.0, 98.2]
Sensibilidad99.22 ± 0.22[98.8, 99.4]
Puntuación F198.54 ± 0.24[98.1, 98.9]
ROC-AUC0.9840.004
PR-AUC0.9820.005
MCC0.970.007

Tabla 7: Resultado del análisis estadístico de múltiples ejecuciones. Estadísticas de robustez para la arquitectura propuesta de CNN-transformer en 10 experimentos, incluyendo la media, desviación estándar, intervalo de confianza del 95 % y significancia para diversas medidas de rendimiento.

MétricaValor
Precisión98,50%
Exactitud98,06%
Sensibilidad99,02%
Especificidad97,96%
Puntuación F198,54%
MCC0,97
ROC-AUC0,994
PR-AUC0,982

Tabla 8: Conjunto final de prueba de la matriz de confusión. La matriz de confusión del conjunto de prueba para la arquitectura propuesta, que muestra la clasificación de los estados normales y anormales de las máquinas a partir de la cual se derivaron las métricas de evaluación.

MétricaImplementación en la nubeImplementación en el borde
Latencia de inferencia (ms)85.618.7
Rendimiento (muestras/s)2253
Uso de red (MB/min)12018
Energía por predicción (J)0.520.17
Capacidad de tiempo realModeradaAlta

Tabla 9: Resultado de la latencia de inferencia. El rendimiento de latencia de la implementación en el borde del marco CPHS habilitado para IA explicable, que incluye el tiempo de procesamiento, el rendimiento, el consumo de memoria y otras características en tiempo real.

MétricaCPS basado en la nubeCPHS propuesto con capacidad de bordeMejora
Transmisión de datos por hora100%35%Reducción del 65%
Latencia de comunicación75 ms20 msReducción del 73,3%
Consumo de energía100%68%Reducción del 32%
Emisión estimada de carbono100%70%Reducción del 30%

Tabla 10: Evaluación de sostenibilidad del CPHS habilitado para edge. Se utilizan mediciones de sobrecarga de comunicación, consumo de energía, utilización de recursos y latencia para evaluar la sostenibilidad del CPHS habilitado para edge.

Variante del modeloPrecisión (%)Exactitud (%)Recuperación (%)Puntuación F1 (%)
Solo CNN93.892.594.293.3
Solo transformador92.691.293.592.3
CNN + Transformador 98.598.0699.0298.54

Tabla 11: Resultado del estudio de ablación. Resultado del estudio de ablación que resalta el efecto de los módulos CNN, Transformer y SHAP en el rendimiento del modelo propuesto.

Discusión

Los resultados experimentales demuestran que la arquitectura propuesta de CNN-transformador supera a los algoritmos individuales al integrar eficazmente el aprendizaje de características espaciales y temporales. Según el estudio de ablación, aunque la CNN extrae características discriminativas basadas en frecuencia de los espectrogramas, el codificador transformador mejora el rendimiento del modelo al capturar dependencias temporales de largo alcance en las señales acústicas. Además, la matriz de confusión muestra muy pocos falsos negativos, lo que indica que el modelo propuesto puede identificar eficazmente anomalías en máquinas. Dicha arquitectura ha permitido obtener mejores resultados de clasificación, con una precisión del 98,5 % y una tasa de recuperación del 99,02 %. Este resultado es crucial en los sistemas industriales de detección de fallos, ya que el modelo no debería pasar por alto ninguna máquina defectuosa. Los resultados experimentales han mostrado que el marco propuesto de CNN–Transformador habilitado para XAI combina con éxito una alta precisión en la detección de anomalías, interpretabilidad e implementación en tiempo real en el borde. La combinación de los dos módulos permite la extracción simultánea de características espaciales y temporales a partir de datos acústicos, mientras que las explicaciones SHAP mejoran la explicabilidad y la fiabilidad. Estos resultados están alineados con los principios de la Industria 5.0, que enfatizan la toma de decisiones centrada en el ser humano, la sostenibilidad y la sinergia entre los dominios cibernético y físico. Sin embargo, se requiere una evaluación más exhaustiva con otros conjuntos de datos industriales y una implementación práctica para estimar la generalización del enfoque propuesto.

La implementación de SHAP para la explicabilidad no solo mejora la eficiencia del sistema, sino que también aumenta significativamente la comprensión de la lógica subyacente del modelo. Se centra especialmente en las bandas de tiempo-frecuencia que son importantes para estas decisiones. Esto es crucial en escenarios de Industria 5.0 donde las personas y los sistemas de inteligencia artificial necesitan confiar mutuamente. Es evidente a partir de los mapas térmicos de SHAP que el modelo ha reconocido ciertas bandas de frecuencia asociadas con fallas, garantizando así la coherencia con la realidad. La novedad de este estudio no se basa únicamente en el uso de CNN-transformador o SHAP por separado, ambos ya mencionados en la literatura científica existente. Más bien, radica en su aplicación integrada dentro de la estructura de colaboración ciberfísica de la Industria 5.0, que simultáneamente resuelve problemas de explicabilidad, sostenibilidad, inteligencia de borde y apoyo a decisiones centradas en el ser humano. Aunque el marco propuesto se basa en ideas de la Industria 5.0, como la colaboración centrada en el ser humano, la explicabilidad, la resiliencia y la computación sostenible en el borde, la presente investigación evalúa su rendimiento técnico únicamente mediante la precisión en la detección de anomalías, latencia, consumo de energía e interpretabilidad. La evaluación directa de aspectos centrados en el ser humano, como la confianza del operador, la carga cognitiva, la calidad de las decisiones y la aceptación, quedó fuera del alcance del diseño actual de la investigación. Futuras investigaciones incluirán experimentos con humanos en el bucle para medir la eficacia de la toma de decisiones colaborativa en el marco propuesto. Desde un punto de vista teórico, esta investigación realiza una contribución valiosa a la expansión de modelos híbridos de aprendizaje profundo al demostrar la eficacia de combinar redes neuronales convolucionales y estructuras Transformer para procesar datos espaciotemporales industriales. De hecho, el artículo mejora los enfoques CPS y CPHS mediante la implementación del concepto de inteligencia artificial explicable en todo el proceso de toma de decisiones. Además, la implementación de la técnica SHAP como herramienta para medir las contribuciones de diversas características de tiempo-frecuencia aporta evidencia al fundamento teórico de los sistemas basados en inteligencia artificial explicable. En conjunto, este enfoque allana el camino hacia un nuevo paradigma en el que los modelos de aprendizaje profundo no solo se vuelven más precisos, sino que también pueden ser interpretados por los seres humanos, en consonancia con la idea de la Industria 5.0.

En términos prácticos, el sistema propuesto es una excelente solución para la detección en tiempo real de anomalías industriales y el mantenimiento predictivo. Al utilizar arquitecturas CPHS en el borde, el sistema permite un procesamiento oportuno de señales acústicas y es adecuado para su implementación en instalaciones de fabricación inteligente. La alta tasa de recuperación (99,02 %) reduce la probabilidad de fallas no detectadas, aumentando así la seguridad operativa y previniendo paradas inesperadas de maquinaria. Además, el uso de explicaciones basadas en SHAP permite a los humanos comprender los resultados del modelo, lo cual es especialmente importante en situaciones críticas donde se requiere la intervención humana en el bucle. Los hallazgos derivados de la implementación experimental demuestran claramente las ventajas del cómputo en el borde frente al cómputo en la nube tradicional. Esto se debe a que la inferencia realizada en el borde de la red minimiza los tiempos de latencia y mejora la eficiencia mediante un mayor rendimiento. Asimismo, reducir el consumo de energía por predicción ayudará a alcanzar los objetivos de fabricación sostenible acordes con los estándares de la Industria 5.0. Sin embargo, a pesar de estos resultados alentadores, el enfoque descrito presenta varias limitaciones. En primer lugar, el marco se ha validado principalmente con el conjunto de datos MIMII; aunque es bastante extenso, podría no abarcar todos los escenarios posibles que puedan encontrarse en un entorno industrial real y en diferentes tipos de máquinas. La segunda limitación es que el uso de SHAP para la explicabilidad incrementa la complejidad computacional, lo cual podría ser un problema al desplegar el marco en entornos de borde altamente restringidos. Por último, el modelo actual se limita únicamente a señales acústicas, mientras que los sistemas industriales requieren un procesamiento multimodal, que incluya, por ejemplo, vibraciones y temperatura.

Aunque el uso del conjunto de datos MIMII garantiza escenarios de fallas del mundo real en acústica industrial, la validación en otros conjuntos de datos de referencia, como ToyADMOS, los datos industriales de detección de anomalías de DCASE, los datos de rodamientos IMS y los datos de fallas de rodamientos CWRU, puede mejorar aún más la generalización del marco propuesto. En trabajos futuros, planeamos realizar validaciones cruzadas en tipos de máquinas, métodos de detección y entornos de fabricación para asegurar la generalización del marco de colaboración ciberfísica basado en inteligencia artificial explicable. Otra limitación de la investigación actual es la falta de experimentos comparativos en sistemas recientemente desarrollados de detección de anomalías acústicas, como los transformadores de visión, los transformadores de espectrograma de audio, los conformadores y nuevas técnicas de aprendizaje auto-supervisado. Aunque el modelo CNN-transformador ha demostrado resultados sólidos e interpretabilidad, se realizará más investigación para compararlo con estas tecnologías avanzadas. Otra desventaja de la investigación actual es que la evaluación de características de la Industria 5.0, como la resiliencia y la sostenibilidad, se realizó de forma indirecta mediante métricas a nivel del sistema, incluyendo la latencia de inferencia y el consumo de energía. No se realizó en la investigación actual una evaluación más exhaustiva de la resiliencia ante fallos de comunicación y sensores, ni de la sostenibilidad en términos de huella de carbono y utilización de recursos. Estos factores deben evaluarse en estudios futuros.

Sin embargo, debe tenerse en cuenta que el paradigma de colaboración con intervención humana descrito en esta investigación es teórico y tiene como finalidad ilustrar el uso de salidas de inteligencia artificial interpretable para la toma de decisiones en sistemas ciberfísicos de la Industria 5.0 asistidos por operadores. La validación experimental con operadores humanos, así como el análisis de usabilidad, tiempo de respuesta y evaluación por expertos, quedan fuera del alcance de esta investigación. En este trabajo se presenta un nuevo modelo de colaboración ciberfísica impulsado por inteligencia artificial interpretable para la fabricación sostenible en entornos de la Industria 5.0. En el sistema desarrollado, se utiliza una arquitectura híbrida CNN-transformador para aprender eficientemente las propiedades espaciales y temporales de los espectrogramas acústicos, permitiendo así la detección de anomalías en máquinas industriales. El modelo propuesto opera en cuatro pasos: preprocesamiento de datos acústicos en espectrogramas, aprendizaje de propiedades espaciales mediante una CNN, aprendizaje de dependencias temporales mediante un codificador transformador y clasificación. Los resultados obtenidos con el método propuesto en el conjunto de datos MIMII demuestran que el modelo sugerido superó a los modelos de referencia, alcanzando una precisión del 98,5 % y una tasa de recuperación del 99,02 %. Además, la incorporación de interpretabilidad mejora la claridad del sistema. Aunque el marco propuesto para la colaboración ciberfísica asistida por inteligencia artificial interpretable tuvo un buen desempeño en el conjunto de datos de referencia MIMII, actualmente la investigación se encuentra limitada a la validación experimental. Aún se requiere evaluar el marco mediante producción a gran escala en un entorno industrial donde las máquinas sean heterogéneas, las condiciones varíen y la implementación sea a largo plazo. Asimismo, en trabajos futuros deberían incluirse comparaciones con arquitecturas como ViT, AST, Conformer y modelos de aprendizaje auto-supervisado. En otras palabras, aunque el marco demuestra que es factible integrar la inteligencia artificial interpretable, la colaboración ciberfísica y la colaboración con intervención humana, se necesita una validación adicional antes de su implementación a gran escala en la industria. En trabajos futuros se investigará más a fondo el marco propuesto en diversos conjuntos de datos de referencia para el diagnóstico de fallas en la industria y la fabricación multi-dominio, demostrando su robustez, transferibilidad y aplicabilidad dentro de ecosistemas de fabricación sostenible. La validación futura incluirá experimentos centrados en el operador, evaluación de resiliencia bajo condiciones industriales disruptivas y evaluación del ciclo de vida relacionada con la sostenibilidad.

Para garantizar la reproducibilidad, este trabajo proporciona detalles sobre el preprocesamiento de los datos, la estrategia de división, la configuración para la generación de espectrogramas, la arquitectura del modelo CNN-transformador, el optimizador, los hiperparámetros y las métricas utilizadas para medir el rendimiento del modelo. Las semillas aleatorias se establecieron antes de los experimentos. Para asegurar la replicabilidad, los experimentos se realizaron con el conjunto de datos MIMII (Malfunctioning Industrial Machine Investigation and Inspection), disponible públicamente. El enlace al conjunto de datos es el siguiente: DOI: 10.5281/zenodo.3384388. El código de implementación asociado a este estudio ha sido puesto a disposición pública a través del repositorio Zenodo: https://zenodo.org/records/21405292. Las señales de audio se muestrearon a 16 kHz y se convirtieron en espectrogramas log-Mel mediante la STFT con un tamaño de ventana de 1024, una longitud de salto de 512 y un tamaño de FFT de 1024. La arquitectura CNN-transformador propuesta contaba con cuatro capas convolucionales (con 32, 64, 128 y 256 filtros), seguidas por un codificador transformador con cuatro capas, ocho cabezas de atención, una dimensión de incrustación de 256 y una dimensión de alimentación directa de 1024. El proceso de entrenamiento incluyó la optimización Adam con una tasa de aprendizaje de 0,0001 y un tamaño de lote de 32, durante 100 épocas. Los algoritmos 1 y 2 describen la etapa de preprocesamiento de datos y el procedimiento de explicabilidad. Se presenta el algoritmo completo, incluyendo los detalles de implementación.

Divulgaciones

Se utilizó una herramienta de inteligencia artificial (ChatGPT) únicamente para ayudar a editar el lenguaje y mejorar la gramática, claridad y legibilidad. Las herramientas de inteligencia artificial no se utilizaron para generar datos científicos, realizar experimentos, analizar resultados, interpretar hallazgos ni obtener conclusiones científicas. Todo el contenido científico, el análisis de datos, la interpretación y la versión final del manuscrito fueron revisados, verificados y aprobados independientemente por los autores, quienes asumen toda la responsabilidad sobre la exactitud e integridad del trabajo. Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

FINANCIAMIENTO: Este trabajo fue apoyado por el Proyecto Clave sobre la Reforma de la Enseñanza Universitaria en la Provincia de Shaanxi (Número de Proyecto 23BG053); el Fondo de Investigación Científica para Talentos de Alto Nivel de la Universidad Politécnica de Shaanxi (Número de Proyecto BSJ-2023-08); y el Proyecto de Investigación Científica de la Universidad Politécnica de Shaanxi (Número de Proyecto 2024YKYB-006). Los autores agradecen sinceramente a la Universidad Politécnica de Shaanxi, Xianyang, China, y a la Universidad de Ingeniería del Tráfico de Xi’an, Xi’an, China, por proporcionar las instalaciones y el apoyo institucional que permitieron esta investigación.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Escala de Apoyo SocialEscala académica publicada; originalmente desarrollada por Park y revisada/ampliada por Kimversión de 25 ítems; formato de respuesta tipo Likert de 5 puntos; sin número de catálogo comercialMide el apoyo social percibido entre docentes en formación de educación infantil en las dimensiones de Apoyo Emocional, Apoyo Informativo, Apoyo Material y Apoyo Evaluativo. Coeficiente general de Cronbach’s alfa = 0,96.
Escala de Autoeficacia del DocenteEscala académica publicada; desarrollada originalmente por Enochs y Riggs; versión adaptada al chino para estudiosversión de 25 ítems; formato de respuesta tipo Likert de 5 puntos; sin número de catálogo comercialEvalúa la eficacia docente en el contexto chino de la formación inicial en educación infantil, en las dimensiones de Eficacia Percibida como Docente en General y Eficacia Percibida como Docente Personal. Coeficiente general de Cronbach’s alfa = 0,96.
Escala de Interacción entre Maestro y NiñoEscala académica publicada; desarrollada por Lee y revisada por el panel de expertos del estudio para su uso en Chinaversión de 30 ítems; formato de respuesta tipo Likert de 5 puntos; sin número de catálogo comercialEvalúa la competencia autoreferida en la interacción entre docente y niño, en lugar de la calidad observada de la interacción en el aula. Incluye Interacción Emocional, Interacción Verbal e Interacción Conductual; alfa general de Cronbach’s alfa = 0.94.
Formulario de Información DemográficaEquipo de investigación, colaboración entre la Universidad de Artes y Ciencias de Sichuan y la Universidad de DaeguSección personalizada del cuestionario del estudio; sin número de catálogo comercialSe recopilaron las características de los participantes, incluyendo género, nivel educativo, categoría profesional, ubicación de la pasantía, duración de la pasantía, tipo de pasantía y tipo de jardín de infantes.
Información para el participante y guion del consentimiento informadoEquipo de investigación; aprobado por el Comité de Ética en Investigación de la Universidad de DaeguNúmero de aprobación ética: XXX; registro de aprobación local para verificarUtilizado antes de la distribución del cuestionario para explicar el propósito del estudio y el contenido de la encuesta, y obtener el consentimiento informado de los participantes, futuros docentes de educación infantil.
Paquete de cuestionario de encuesta pilotoEquipo de investigación y panel de expertosVersión piloto utilizada en junio–5, 2024; sin número de catálogo comercialPilotó la claridad y adecuación de la Escala de Percepciones Profesionales, la Escala de Apoyo Social, la Escala de Autoeficacia Docente, la Escala de Interacción Docente-Niño y los ítems demográficos en 50 estudiantes de pedagogía en educación infantil.
Procedimiento de Revisión por Panel de ExpertosEquipo de investigación; panel de expertos compuesto por dos profesores de educación infantil, un director de prejardín, tres supervisores de prácticas y el equipo de investigaciónRevisión de contenido basada en consenso; sin número de modelo comercialUtilizado para revisar los ítems de la escala en cuanto a ambigüedad, adecuación, claridad semántica, pertinencia evolutiva y relevancia cultural antes de la encuesta formal.
Formularios impresos de cuestionarios en el lugarEquipo de investigación; suministros para encuestas institucionales localesFormularios de encuesta en papel; sin número de catálogo comercialUtilizado para la administración del cuestionario en el lugar. En la muestra final, se obtuvieron 336 cuestionarios válidos en el lugar antes de combinarlos con los cuestionarios en línea.
WeChatTencentAplicación móvil WeChat; la versión debe verificarse a partir del registro del dispositivo/aplicación utilizado durante junio–julio de 2024Utilizado como canal de distribución en línea para la administración del cuestionario; se recopilaron 27 cuestionarios completados a través de la vía en línea/WeChat.
Procedimiento de reclutamiento por teléfono y en personaEquipo de investigaciónProcedimiento estandarizado de reclutamiento; sin número de catálogo comercialUtilizado para contactar a instituciones/participantes, explicar el objetivo del estudio y el contenido de la encuesta, y apoyar el consentimiento informado antes de la administración del cuestionario.
SPSS StatisticsIBMVersión 27.0Utilizado para estadísticas descriptivas, coeficientes de correlación de Pearson, alfa de Cronbach’análisis de fiabilidad alfa, comprobaciones de normalidad mediante asimetría y curtosis, y Harman’una prueba de un solo factor para el sesgo común por método
SPSS AmosIBMVersión 26.0Utilizado para el análisis factorial confirmatorio, la modelización de ecuaciones estructurales, la prueba de invariancia de medición en múltiples grupos, la prueba de bootstrap de efectos indirectos y la comparación de modelos alternativos.
Microsoft ExcelMicrosoftMicrosoft 365 Excel o versión de Excel instalada localmente; verifique la versión local exacta antes de la presentaciónRecomendado/utilizado como entorno de trabajo para organizar los datos codificados de la encuesta, el diccionario de datos, las tablas suplementarias y la Tabla de Materiales de JoVE. La versión local exacta debe ser verificada por los autores.
Criterios de índices de ajuste en el modelado de ecuaciones estructuralesGuía metodológica publicada; referencias de Schreiber et al. y Kline citadas en el manuscritoSin número de catálogo comercial; criterios aplicados en el plan de análisis estadísticoDefine e informa índices de ajuste del modelo, incluyendo el estadístico chi-cuadrado, chi-cuadrado dividido por los grados de libertad, Índice de Tucker-Lewis, Índice de Ajuste Comparativo, Índice Ajustado de Bondad de Ajuste, Índice de Ajuste Incremental, Raíz del Error Cuadrático Medio de Aproximación y Residuo Estándarizado de la Raíz del Cuadrado Medio.
Procedimiento de Prueba de Mediación con BootstrapSPSS Amos / plan de análisis estadístico del equipo de investigación5.000 muestras bootstrap; intervalos de confianza del 95 % corregidos para el sesgoUtilizado para evaluar asociaciones indirectas mediante la eficacia del docente. Los efectos indirectos se consideraron significativos cuando el intervalo de confianza corregido para el sesgo al 95% no incluía el cero.
Procedimiento de Prueba de Invariancia de MediciónSPSS Amos / plan de análisis estadístico del equipo de investigaciónAnálisis factorial confirmatorio multigrupo ΔCFI &< .010 y ΔRMSEA &< .015 criteriosUtilizado para evaluar la invariancia configuracional, métrica y escalar según el género, tipo de programa, duración de la pasantía e institución antes de interpretar las estimaciones del SEM combinado.

Referencias

  1. Fraga-Lamas P, Barros D, Lopes SI, Fernández-Caramés TM. Mist and edge computing cyber-physical human-centered systems for Industry 5.0: A cost-effective IoT thermal imaging safety system. Sensors (Basel). 2022;22(21):8500.
  2. Breque M, De Nul L, Petridis A. Industry 5.0: Towards a sustainable, human-centric and resilient European industry. Brussels: European Commission; 2021:https://research-and-innovation.ec.europa.eu/knowledge-publications-tools-and-data/publications/all-publications/industry-50-towards-sustainable-human-centric-and-resilient-european-industry_en.
  3. Sariişik G, Demir S. Industry 5.0: A human-centric paradigm for sustainable and resilient industrial transformation. Journal of Social Perspective Studies. 2025;2(2):50–66.
  4. Liu X et al. Evaluating the interactions of multi-dimensional value for sustainable product-service systems with a grey DEMATEL-ANP approach. J Manuf Syst. 2021;60:449–458.
  5. Di Nardo M et al. The maintenance in Industry 4.0: Assistance and implementation [conference paper]. Presented at: 32nd European Safety and Reliability Conference; Dublin, Ireland; 2022. p. 2286–2292. https://hdl.handle.net/20.500.12607/48222.
  6. Kagermann H, Lukas WD, Wahlster W. Industrie 4.0: Mit dem Internet der Dinge auf dem Weg zur 4. industriellen Revolution. VDI Nachrichten. 2011;(13):2–3. https://www.dfki.de/fileadmin/user_upload/DFKI/Medien/News_Media/Presse/Presse-Highlights/vdinach2011a13-ind4.0-Internet-Dinge.pdf.
  7. Council for Science, Technology and Innovation. Report on the Fifth Science and Technology Basic Plan. Tokyo: Cabinet Office, Government of Japan; 2015:https://www8.cao.go.jp/cstp/kihonkeikaku/5basicplan_en.pdf.
  8. Nahavandi S. Industry 5.0—A human-centric solution. Sustainability (Basel). 2019;11(16):4371.
  9. Paschek D, Mocan A, Draghici A. Industry 5.0—The expected impact of the next industrial revolution [conference paper]. Presented at: MakeLearn and TIIM International Conference; Piran, Slovenia; 2019. p. 125–132. https://toknowpress.net/ISBN/978-961-6914-25-3/papers/ML19-017.pdf.
  10. Maddikunta PKR et al. Industry 5.0: A survey on enabling technologies and potential applications. J Ind Inf Integr. 2022;26:100257.
  11. Longo F, Padovano A, Umbrello S. Value-oriented and ethical technology engineering in Industry 5.0: A human-centric perspective for the design of the factory of the future. Appl Sci (Basel). 2020;10(12):4182.
  12. Gong Y, Chung YA, Glass J. AST: Audio Spectrogram Transformer [conference paper]. Presented at: Interspeech 2021; Brno, Czech Republic; 2021. p. 571–575. https://www.isca-archive.org/interspeech_2021/gong21b_interspeech.html.
  13. Purohit H et al. MIMII dataset: Sound dataset for malfunctioning industrial machine investigation and inspection [conference paper]. Presented at: 4th Workshop on Detection and Classification of Acoustic Scenes and Events; New York, NY; 2019. p. 209–213. https://dcase.community/documents/workshop2019/proceedings/DCASE2019Workshop_Purohit_21.pdf.
  14. Hallioui A et al. A review of sustainable total productive maintenance. Sustainability (Basel). 2023;15(16):12362.
  15. Vasić S et al. Identification of criteria for enabling the adoption of sustainable maintenance practice: An umbrella review. Sustainability (Basel). 2024;16(2):767.
  16. Barredo Arrieta A et al. Explainable artificial intelligence: Concepts, taxonomies, opportunities, and challenges toward responsible AI. Inf Fusion. 2020;58:82–115.
  17. Lundberg SM, Lee SI. A unified approach to interpreting model predictions [conference paper]. Presented at: 31st International Conference on Neural Information Processing Systems; Long Beach, CA; 2017. p. 4765–4774. https://papers.nips.cc/paper/7062-a-unified-approach-to-interpreting-model-predictions.
  18. Du M, Liu N, Hu X. Techniques for interpretable machine learning. Commun ACM. 2020;63(1):68–77.
  19. Sarker IH. Machine learning: Algorithms, real-world applications and research directions. SN Comput Sci. 2021;2(3):160.
  20. Saxe A, Nelli S, Summerfield C. If deep learning is the answer, what is the question? Nat Rev Neurosci. 2021;22(1):55–67.
  21. Piccialli F et al. A survey on deep learning in medicine: Why, how and when? Inf Fusion. 2021;66:111–137.
  22. Li Z et al. A survey of convolutional neural networks: Analysis, applications, and prospects. IEEE Trans Neural Netw Learn Syst. 2022;33(12):6999–7019.
  23. Gil M, Albert M, Fons J, Pelechano V. Engineering human-in-the-loop interactions in cyber-physical systems. Inf Softw Technol. 2020;126:106349.
  24. Krugh M, Mears L. A complementary cyber-human systems framework for Industry 4.0 cyber-physical systems. Manuf Lett. 2018;15:89–92.
  25. Jasiulewicz-Kaczmarek M et al. Recent advances in smart and sustainable maintenance [invited-session proposal]. Presented at: 10th IFAC Conference on Manufacturing Modelling, Management and Control; Nantes, France; 2022. https://hub.imt-atlantique.fr/mim2022/wp-content/uploads/2021/12/7a519.pdf.
  26. Jasiulewicz-Kaczmarek M, Gola A. Maintenance 4.0 technologies for sustainable manufacturing—An overview. IFAC-PapersOnLine. 2019;52(10):91–96.
  27. Saihi A, Ben-Daya M, As’ad RA. Maintenance and sustainability: A systematic review of modeling-based literature. J Qual Maint Eng. 2023;29(1):155–187.
  28. Bastas A. Sustainable manufacturing technologies: A systematic review of the latest trends and themes. Sustainability (Basel). 2021;13(8):4271.
  29. Franciosi C, Iung B, Miranda S, Riemma S. Maintenance for sustainability in the Industry 4.0 context: A scoping literature review. IFAC-PapersOnLine. 2018;51(11):903–908.
  30. Franciosi C et al. Measuring maintenance impacts on the sustainability of manufacturing industries: From a systematic literature review to a framework proposal. J Clean Prod. 2020;260:121065.
  31. Vrignat P, Kratz F, Avila M. Sustainable manufacturing, maintenance policies, prognostics and health management: A literature review. Reliab Eng Syst Saf. 2022;218:108140.
  32. Durán O, Aguilar J, Capaldo A, Arata A. Fleet resilience: Evaluating maintenance strategies in critical equipment. Appl Sci (Basel). 2021;11(1):38.
  33. Ciccarelli M, Papetti A, Germani M. Exploring how new industrial paradigms affect the workforce: A literature review of Operator 4.0. J Manuf Syst. 2023;70:464–483.
  34. Madzik P et al. Human-centricity in Industry 5.0—Revealing hidden research topics by unsupervised topic modeling using latent Dirichlet allocation. Eur J Innov Manag. 2025;28(1):113–138.
  35. Farivar F, Klarin A, Kanani-Moghadam V. Industry 5.0: A socio-technical system perspective on human agency and institutional legitimacy. J Manag Organ. 2026;32(4):1168–1189.
  36. Karki BR, Porras J. Digitalization for sustainable maintenance services: A systematic literature review. Digit Bus. 2021;1(2):100011.
  37. Santiago RAdF et al. Data-driven models applied to predictive and prescriptive maintenance of wind turbines: A systematic review of approaches based on failure detection, diagnosis, and prognosis. Energies (Basel). 2024;17(5):1010.
  38. Carvalho JN, Silva FR, Nascimento EGS. Challenges of the biopharmaceutical industry in the application of prescriptive maintenance in the Industry 4.0 context: A comprehensive literature review. Sensors (Basel). 2024;24(22):7163.
  39. Santos ACdJ, Cavalcante CAV, Wu S. Maintenance policies and models: A bibliometric and literature review of strategies for reuse and remanufacturing. Reliab Eng Syst Saf. 2023;231:108983.
  40. Orošnjak M, Brkljač N, Ristić K. Fostering cleaner production through the adoption of sustainable maintenance: An umbrella review with a questionnaire-based survey analysis. Clean Prod Lett. 2025;8:100095.
  41. Ji Z, Zhou Y, Wang B, Zang J. Human–cyber–physical systems in the context of new-generation intelligent manufacturing. Engineering (Beijing). 2019;5(4):624–636.
  42. Wang B et al. Toward human-centric smart manufacturing: A human–cyber–physical systems perspective. J Manuf Syst. 2022;63:471–490.
  43. Jiao J, Zhou F, Gebraeel NZ, Duffy V. Towards augmenting cyber-physical-human collaborative cognition for human–automation interaction in complex manufacturing and operational environments. Int J Prod Res. 2020;58(16):5089–5111.
  44. Yilma BA, Panetto H, Naudet Y. Systemic formalisation of cyber-physical-social systems: A systematic literature review. Comput Ind. 2021;129:103458.
  45. Zhou Y, Yu FR, Chen J, Kuo YH. Cyber-physical-social systems: A state-of-the-art survey, challenges and opportunities. IEEE Commun Surv Tutor. 2020;22(1):3

Reimpresiones y permisos

Etiquetas

Aprendizaje profundodetecci n de fallos de maquinariaim genes de espectrogramasred neuronal convolucionalcodificador Transformercolaboraci n humano m quina