El sistema de colaboración ciberfísica integrado con inteligencia artificial explicable presentado fue probado experimentalmente con aproximadamente 12 000 grabaciones de audio del conjunto de datos MIMII, que contiene condiciones normales y anormales de máquinas. El conjunto de datos de entrenamiento consistió en unos 9 600 registros, mientras que el conjunto de datos de prueba incluyó aproximadamente 2 400 muestras de audio. Según los resultados, el modelo sugerido basado en CNN-transformador alcanzó una precisión de clasificación del 98,5 % en el conjunto de datos de prueba, entre 0,97 y 0,98. Esto se relaciona con los hallazgos de la Tabla 3, la matriz de confusión y el análisis de estabilidad estadística. La integración del codificador transformador mejora las capacidades del modelo para modelar aspectos temporales, mientras que la CNN extrae características espaciales discriminativas del espectrograma de entrada.
Además del rendimiento de clasificación, se evaluaron otras características relacionadas con el sistema. En primer lugar, la latencia de inferencia para una implementación basada en dispositivos periféricos no superó los 20 ms, lo que permite la detección en tiempo real de anomalías. En segundo lugar, el sistema presentado ayudó a mejorar la eficiencia energética al reducir los requisitos de comunicación. Por último, el marco de Inteligencia Artificial Explicable propuesto proporciona interpretabilidad mediante SHAP, facilitando el análisis del modelo desde la perspectiva de un experto en el dominio. Los datos de MIMII se convirtieron en espectrogramas mediante la Transformada de Fourier de Tiempo Corto (STFT), utilizando un tamaño de ventana de 1024, un tamaño de salto de 512 y un tamaño de Transformada Rápida de Fourier (FFT) de 1024. Los espectrogramas Mel logarítmicos resultantes se redimensionaron a 224 × 224 píxeles y luego se normalizaron mediante puntuación z. Se emplearon métodos de aumento de datos, incluyendo enmascaramiento temporal, enmascaramiento frecuencial y adición de ruido gaussiano, para aumentar la robustez del modelo entrenado. La arquitectura de la CNN constó de cuatro capas convolucionales con 32, 64, 128 y 256 filtros, respectivamente, e incluyó normalización por lotes, funciones ReLU y capas de agrupación máxima. Los mapas de características extraídos se transformaron en secuencias y se utilizaron como entradas para el codificador transformador, que constaba de cuatro capas codificadoras, ocho cabezales de atención, una incrustación de 256 dimensiones y una dimensión de alimentación directa de 1024 dimensiones. Se aplicó una probabilidad de abandono (dropout) de 0,3 para minimizar el sobreajuste. Se utilizó el optimizador Adam con una tasa de aprendizaje de 0,0001 y una disminución de peso de 1 x 10⁻5 para el entrenamiento. El número de épocas y el tamaño del lote durante el entrenamiento fueron 100 y 32, respectivamente. La semilla aleatoria se estableció en 42 para mantener la reproducibilidad del experimento. Para verificar la validez estadística de los resultados se utilizaron los siguientes métodos: todos los experimentos se realizaron de forma independiente 10 veces con diferentes semillas aleatorias y reordenamientos de datos. Se calcularon los valores promedio y las desviaciones estándar de la exactitud, precisión, exhaustividad (recall), puntuación F1, área bajo la curva característica de operación del receptor (ROC-AUC) y área bajo la curva precisión–exhaustividad (PR-AUC). Además, se calcularon intervalos de confianza del 95 % para estimar la incertidumbre del rendimiento. Finalmente, se realizó una prueba t pareada comparando los resultados de nuestro enfoque CNN-transformador con el modelo de referencia de mejor desempeño. Se aplicó el método de detención temprana utilizando 10 épocas como parámetro de paciencia. Tabla 4 presenta la configuración ambiental y la configuración de hiperparámetros, y Tabla 5 proporciona los detalles del entorno de simulación.
El experimento de evaluación del presente trabajo se realizó utilizando el conjunto de datos MIMII, que incluye diversas condiciones de funcionamiento de máquinas y escenarios acústicos de fallas. Aunque los resultados del marco propuesto validan el modelo, se requiere una validación adicional en diversos conjuntos de datos industriales y entornos de fabricación.
El marco propuesto se implementó en una plataforma de computación en el borde equipada con un procesador multinúcleo, 16 GB de memoria del sistema y un acelerador en el borde habilitado para unidad de procesamiento gráfico (GPU) para soportar inferencia y explicabilidad en tiempo real. Sensores acústicos industriales transmitieron flujos de audio al gateway en el borde a través de la capa de comunicación IIoT. Los nodos en el borde se utilizaron para realizar tareas como la creación de espectrogramas, inferencia de anomalías y generación de explicaciones SHAP, mientras que el servidor en la nube se utilizó para almacenar datos a largo plazo y actualizar el modelo. Esta configuración no solo reduce la cantidad de comunicación requerida, sino que también permite la interacción en tiempo real entre dispositivos de detección, módulos de inteligencia artificial y operadores humanos en sistemas ciberfísicos.
El enfoque CNN-transformador introducido anteriormente se compara con varios métodos existentes, incluyendo modelos convencionales de aprendizaje automático (ML) como máquina de vectores de soporte (SVM) y bosque aleatorio, modelos CNN sin el transformador y métodos basados en memoria a corto y largo plazo (LSTM). Si bien los modelos tradicionales de ML no logran resultados satisfactorios debido a la falta de capacidad para procesar correlaciones espaciales y temporales en los datos, los modelos CNN pueden manejar eficientemente las características espaciales, mientras que los modelos LSTM pueden abordar los aspectos temporales de las señales acústicas. No obstante, los primeros son inferiores a los últimos en términos de costo computacional y capacidad de procesamiento paralelo.
Para garantizar una comparación justa entre el modelo propuesto CNN-transformador y los modelos de referencia, este último se entrenó y evaluó utilizando la misma división del conjunto de datos MIMII (80 % para entrenamiento y 20 % para pruebas), los mismos pasos de preprocesamiento, el proceso de creación de espectrogramas y las mismas medidas de evaluación. En el método SVM, se utilizó un kernel de función de base radial (RBF), con C = 10 y γ = 0,01. El método de bosque aleatorio incluyó 200 árboles, con una profundidad máxima de árbol de 20. En cuanto a la CNN, esta tenía cuatro capas de convolución (32, 64, 128 y 256 filtros) seguidas por capas completamente conectadas sin un módulo Transformador. Por último, para el método LSTM, se utilizaron dos capas LSTM apiladas con 128 unidades ocultas y una tasa de abandono (dropout) de 0,3.
Por el contrario, el uso del marco CNN-transformador permite obtener los mejores resultados aprovechando eficientemente tanto las capacidades espaciales como temporales de las señales acústicas. Además, el uso de computación en el borde permite reducir los costos computacionales, mejorar la latencia y ahorrar energía. Asimismo, la explicabilidad de las predicciones implementada mediante SHAP puede considerarse otra ventaja que distingue al método propuesto de las técnicas existentes.
A pesar de los recientes avances en el desarrollo de nuevos modelos para la detección de anomalías acústicas, como el Transformador de Visión (ViT), el Transformador de Espectrograma de Audio (AST), Conformer y modelos basados en aprendizaje auto-supervisado, no se realizó en el presente estudio una comparación experimental de estas arquitecturas. En el futuro, se planea utilizar estos modelos como puntos de referencia para evaluar el marco propuesto.
Las métricas, incluyendo exactitud, precisión, recuperación y puntuación F1, se utilizan para evaluar el desempeño del modelo propuesto. Mientras que la precisión mide la proporción de verdaderos positivos respecto al número total de verdaderos positivos y falsos positivos, la exactitud evalúa la corrección general de las predicciones. La recuperación proporciona una estimación de la capacidad del modelo para predecir anomalías en un sistema determinado. Esto es crucial porque no prever un defecto podría provocar fallos del sistema. A continuación se indica cómo se calculan matemáticamente estas métricas:
(25)
(26)
(27)
(28)
Además de estas, se consideran métricas adicionales relacionadas con el rendimiento del sistema, como la latencia, la utilización de energía y la escalabilidad, al evaluar el rendimiento en el mundo real del modelo de CPS propuesto basado en computación en el borde.
Además de las técnicas estándar de medición del rendimiento, existen muchas otras medidas que pueden ayudar a evaluar la solución propuesta desde una perspectiva más integral, especialmente considerando su aplicabilidad a estudios de casos reales con datos desbalanceados y en flujo continuo. Por ejemplo, la capacidad del algoritmo para distinguir entre los dos grupos según diferentes umbrales se mide mediante el área bajo la curva de característica operativa del receptor (ROC-AUC). Dada su robustez y separabilidad, el valor de ROC-AUC debe ser alto. Además, la métrica área bajo la curva de precisión-recuperación (PR-AUC) es importante para el estudio de caso de detección de anomalías, ya que las clases anómalas son raras.
Una medida importante a considerar es el coeficiente de correlación de Matthews (MCC). Este considera los cuatro elementos de la matriz de confusión y proporciona una evaluación precisa, incluso en presencia de desequilibrio entre clases. Esta medida se calcula de la siguiente manera:
(29)
Los valores de MCC varían de -1 a +1, donde +1 indica una predicción perfecta. La otra métrica que podría aplicarse es la Especificidad (Tasa de Verdaderos Negativos), que sería útil en una aplicación industrial para evaluar si existen predicciones falsas positivas:
(30)
Para asegurarse de que no hubiera inconsistencia entre la matriz de confusión y las métricas de rendimiento, todos los criterios de evaluación se calcularon basándose en el conjunto de datos de prueba final. Las notaciones de verdadero positivo (TP), verdadero negativo (TN), falso positivo (FP) y falso negativo (FN) se utilizan en todas las ecuaciones siguientes. La exactitud, precisión, recuperación, especificidad, puntuación F1 y MCC se calcularon según las ecuaciones (25)–(30). Además, se calcularon ROC-AUC y PR-AUC a partir de las salidas de probabilidad del modelo CNN-transformer mediante evaluación independiente del umbral.
Las métricas clave a considerar a nivel del sistema incluyen latencia, rendimiento y costo computacional. La latencia es el tiempo necesario para realizar una predicción. El rendimiento es la cantidad de muestras de datos procesadas por segundo. El costo computacional, que representa la eficiencia energética, es importante para garantizar la eficiencia computacional. Además, también se podrían considerar métricas de explicabilidad, como la consistencia SHAP y la estabilidad de la importancia de las características, al evaluar el modelo.
Es evidente a partir de los resultados en la Tabla 3 para el conjunto de datos MIMII que el modelo propuesto de CNN-transformador supera a todos los demás métodos de aprendizaje automático y aprendizaje profundo. El desempeño de los modelos SVM y bosque aleatorio es aceptable, aunque limitado, con precisiones del 88,6 % y del 91,2 %, respectivamente. Esto podría explicarse por la incapacidad de estos modelos para extraer características temporales y espaciales complejas de las señales acústicas. Sin embargo, LSTM supera a SVM y al bosque aleatorio, alcanzando una precisión del 94,5 % al modelar datos de series temporales. No obstante, el enfoque sugerido de CNN-transformador demuestra el mejor desempeño, con una precisión mejorada (98,5 %), precisión (98,06 %), recuperación (99,02 %) y puntuación F1 (98,54 %). Por lo tanto, el algoritmo sugerido puede clasificar con precisión condiciones normales y anormales de maquinaria. La especificidad mejorada (97,96 %) demuestra la eficacia del enfoque para reducir los falsos positivos, lo cual es crucial para la industria. Cabe señalar que el desempeño de CNN-transformador puede explicarse por la combinación de CNN y Transformador, donde el primero extrae características discriminativas y el segundo captura relaciones temporales en secuencias largas.
La curva ROC en la Figura 6 muestra el rendimiento comparativo de los métodos SVM, bosque aleatorio, LSTM y el enfoque propuesto de CNN-transformador respecto a sus capacidades de clasificación con el conjunto de datos MIMII. Como se muestra en la Figura 6, el Área Bajo la Curva (AUC) más alta fue observada para la CNN-transformador sugerida, que alcanzó un valor de 0,994. Es evidente que el método propuesto ofrece un mejor desempeño discriminativo para distinguir entre categorías normales y anormales. Por otro lado, LSTM produce resultados ligeramente inferiores al enfoque sugerido de CNN-transformador; por lo tanto, su AUC es aproximadamente 0,97. Tanto el bosque aleatorio como SVM tienen AUC relativamente bajos, alrededor de 0,958 y 0,913, respectivamente. Esto se atribuye a la incapacidad de ambos enfoques para aprender patrones acústicos complejos a partir de los datos proporcionados.
En la detección de anomalías, donde las muestras anómalas son escasas, la curva precisión-exhaustividad (PR) proporciona un análisis más adecuado. En la curva PR, el modelo CNN-transformer alcanza la Precisión Media (AP) más alta, alrededor de 0,97–0,98, lo que sugiere una capacidad superior para detectar instancias anómalas con menos falsas alarmas, como se muestra en Figura 7. Por el contrario, el clasificador LSTM ocupa el segundo lugar, con una AP que varía entre 0,92 y 0,94. Por otro lado, los clasificadores bosque aleatorio y SVM ocupan el tercer y cuarto lugar, respectivamente, con APs de 0,88 y 0,84. El clasificador híbrido propuesto logra una mayor precisión en todos los niveles de exhaustividad, lo cual es importante para aplicaciones industriales prácticas, ya que requieren alta precisión y pocas falsas alarmas.
El modelo CNN-transformer se ha comparado con modelos existentes en el conjunto de datos MIMII utilizando las métricas avanzadas de rendimiento que se muestran en la Tabla 6. El valor ROC-AUC indica la capacidad discriminativa del modelo entre las dos clases a través de varios umbrales. Los clasificadores SVM y bosque aleatorio alcanzan valores de ROC-AUC de 0,913 y 0,958, respectivamente, mientras que el modelo LSTM obtiene un ROC-AUC de 0,970, y la CNN obtiene 0,98. El marco propuesto CNN-transformer logra el ROC-AUC más alto de 0,994, lo que demuestra una discriminación superior entre condiciones normales y anormales de la máquina. De manera similar, los valores PR-AUC indican que el modelo propuesto puede manejar eficazmente el desequilibrio de clases, un factor esencial en la detección de anomalías. El modelo CNN-transformer propuesto alcanza el PR-AUC (Precisión Media) más alto de 0,982, seguido por CNN (0,950), LSTM (0,912), bosque aleatorio (0,891) y SVM (0,765), lo que indica un rendimiento superior en precisión y recuperación para la detección acústica de anomalías industriales. Además, el Coeficiente de Correlación de Matthews (MCC), que mide el equilibrio del rendimiento del modelo, presenta un valor relativamente alto de 0,97 para el modelo propuesto. Sin embargo, métodos anteriores como SVM (0,73) y bosque aleatorio (0,78) tuvieron una precisión predictiva más baja.
Para evaluar la estabilidad del enfoque presentado, se realizó el mismo experimento 10 veces con diferentes semillas de inicialización y esquemas de mezcla de datos. Los resultados en la Tabla 7 para la arquitectura CNN-transformer fueron los siguientes: exactitud = 98,50 % ± 0,19 %, precisión = 98,06 % ± 0,23 %, recuperación = 99,02 % ± 0,22 % y puntuación F1 = 98,54 % ± 0,24 %. La desviación estándar relativamente pequeña indica la estabilidad del modelo. Se calcularon los intervalos de confianza del 95 % para todas las medidas de evaluación. Se determinó que el intervalo de confianza para la métrica de exactitud fue [98,1 %, 98,9 %], lo que indica que el modelo tiene un rendimiento consistentemente alto. También se obtuvieron intervalos de confianza estrechos para ROC-AUC, PR-AUC y MCC. La prueba t pareada que comparó el modelo propuesto CNN-transformer con el modelo de referencia de mejor desempeño (LSTM) arrojó un valor de p < 0,05, lo que indica que la mejora de rendimiento observada es significativa y no se debe al azar.
Para evaluar la robustez de la arquitectura propuesta de CNN-transformer, los experimentos se repitieron 10 veces con diferentes semillas de inicialización aleatoria y configuraciones de aleatorización, como se muestra en la Figura 8. La precisión, exactitud, recuperación y puntuación F1 promedio obtenidas por el modelo fueron 98,50 % ± 0,19 %, 98,06 % ± 0,23 %, 99,02 % ± 0,22 % y 98,54 % ± 0,24 %, respectivamente. A partir del análisis del diagrama de caja, existen variaciones mínimas en las métricas de rendimiento del modelo, lo que indica su estabilidad y robustez. Por lo tanto, el enfoque propuesto exhibe una alta estabilidad a través de múltiples experimentos, sin variaciones significativas, lo que indica las buenas capacidades de generalización del modelo.
Además, se realizó una prueba estadística basada en los resultados de múltiples ejecuciones del experimento. Las pequeñas desviaciones estándar en todas las medidas de evaluación sugieren una baja susceptibilidad a los cambios en el azar o en el entrenamiento. Esto confirma que el modelo propuesto de CNN-transformador puede ofrecer un rendimiento estable y consistente en sistemas de fabricación ciberfísicos del mundo real.
El mapa de calor SHAP da una idea de la importancia de las regiones tiempo-frecuencia en el espectrograma para predecir si la condición de la máquina es normal o anormal. Los valores SHAP indican la contribución de cada predictor a la predicción final.
En el mapa de calor de valores SHAP que se muestra en la Figura 9A, los valores SHAP positivos (por ejemplo, entre +0,6 y +1,2) representan una contribución hacia la anormalidad, mientras que los valores SHAP negativos (es decir, entre −0,3 y −0,8) representan una contribución hacia la categoría normal. La puntuación SHAP más intensa se encontró en el rango de frecuencias medias (40–80 intervalos de frecuencia) en los intervalos de tiempo 50–100. Estas regiones son las áreas clave donde se detectan las señales críticas de falla en las mediciones acústicas. Además, la banda de baja frecuencia (menos de 20 intervalos) muestra puntuaciones SHAP casi nulas (−0,1 a +0,1), lo que indica un impacto despreciable en la toma de decisiones del modelo. Esto indica que el modelo ignora el ruido de fondo irrelevante para la predicción de fallas. La consistencia temporal de las puntuaciones SHAP altas dentro de bandas de tiempo específicas también destaca la capacidad del módulo Transformer para captar dependencias de largo alcance en las señales acústicas. En resumen, el mapa de calor SHAP muestra claramente que el modelo CNN-Transformer se enfoca en bandas específicas de tiempo-frecuencia con alto poder discriminativo. Esto mejora la interpretabilidad del modelo y ayuda al operador humano a detectar visualmente las fallas.
Se muestra que el método SHAP se utiliza únicamente como una técnica de interpretabilidad y no forma parte del proceso de entrenamiento del modelo CNN-transformer. La precisión de clasificación está determinada exclusivamente por los parámetros aprendidos por los componentes CNN y Transformer. SHAP se utiliza después del paso de inferencia del modelo para interpretar las predicciones, identificando las ventanas tiempo-frecuencia más influyentes que orientan las predicciones hacia categorías normales o anormales. Por lo tanto, SHAP mejora la transparencia y comprensión humana sin afectar la precisión de clasificación. Los valores SHAP proporcionados por el marco propuesto permiten una visualización clara que ayudará a los operarios de mantenimiento a verificar las predicciones del modelo comparando las regiones detectadas con el comportamiento real de la máquina y los registros de mantenimiento. Así, será más fácil para las personas colaborar con las máquinas durante actividades de mantenimiento predictivo.
Para evaluar el nivel de explicabilidad, se realizó un análisis global de SHAP sobre la importancia de las características, como se ilustra en la Figura 9B. Los resultados muestran que algunos componentes de frecuencia media desempeñan un papel significativo en la detección de anomalías. Además, un estudio de caso ilustrado en la Figura 9C muestra que SHAP identifica correctamente las regiones relevantes para fallas en espectrogramas anormales de máquinas. El estudio incluyó un estudio de caso cualitativo que utilizó muestras de datos anormales de bombas y válvulas del conjunto de datos MIMII. En el caso de bombas defectuosas, SHAP identificó rangos de frecuencia de 2–4 kHz asociados con cavitación y desgaste. En el caso de válvulas defectuosas, la activación de SHAP fue dominante en áreas con señales armónicas repetidas, indicativas de fugas. En muestras de prueba representativas, las visualizaciones de SHAP identificaron de manera confiable zonas temporales y frecuenciales discriminativas asociadas con condiciones anómalas de las máquinas. Al resaltar las regiones espectrales que contribuyen más significativamente a cada predicción, estas explicaciones arrojan luz sobre cómo toma decisiones el modelo. El análisis de SHAP se ofrece como una herramienta de interpretabilidad para comprender el comportamiento del modelo, y no como una verificación de fallas validada por expertos, ya que la validación formal por profesionales de mantenimiento quedó fuera del alcance de este estudio.
La matriz de confusión destaca qué tan bien el modelo propuesto CNN-transformer realiza la clasificación en el conjunto de datos MIMII mostrado en la Figura 10. En general, se identificaron correctamente 960 muestras normales como normales (verdaderos negativos), mientras que 20 muestras normales se identificaron erróneamente como anormales (falsos positivos). Además, de todas las muestras, se detectaron 1010 muestras anormales como tales (verdaderos positivos), mientras que 10 muestras anormales se identificaron como normales (falsos negativos).
Por lo tanto, se logró un alto rendimiento de detección, especialmente para muestras anómalas, que son cruciales en el mantenimiento predictivo. Como se muestra en la Figura 10, un error Falso Negativo se observa muy rara vez (10 muestras), lo cual es vital para cualquier industria para garantizar su seguridad y fiabilidad. Por otro lado, el error Falso Positivo (20 muestras) ocurre ligeramente con mayor frecuencia, pero permanece en un nivel relativamente bajo. La matriz de confusión mostrada en la Figura 10 se generó utilizando un subconjunto equilibrado de 2.000 grabaciones de prueba (igual número de muestras normales y anómalas) para proporcionar una visualización clara del rendimiento del clasificador. Todas las métricas de evaluación reportadas, incluyendo exactitud, precisión, recuperación, especificidad y puntuación F1, se calcularon utilizando el conjunto completo de pruebas (aproximadamente 2.400 grabaciones).
Teniendo en cuenta la matriz de confusión mostrada en la Figura 10 y en la Tabla 8 (TN = 960, FP = 20, TP = 1010, FN = 10), se pueden realizar los siguientes cálculos: Exactitud = (TP + TN) / (TP + TN + FP + FN) = 98,50 %, Precisión = TP/(TP + FP) = 98,06 %, Exhaustividad = TP/(TP + FN) = 99,02 %, Especificidad = TN / (TN + FP) = 97,96 %, Puntaje F1 = 98,54 % y MCC = 0,97. Además, los valores de ROC-AUC y PR-AUC fueron 0,994 y 0,982, respectivamente. La matriz de confusión mostrada en la Figura 10 se generó utilizando un subconjunto equilibrado y representativo de 2.000 grabaciones de los datos de prueba, únicamente con fines de visualización. Todas las métricas cuantitativas de rendimiento informadas en este estudio se calcularon utilizando el conjunto completo de pruebas (aproximadamente 2.400 grabaciones). En general, los resultados demuestran que la arquitectura propuesta de CNN-transformador alcanza una exactitud de clasificación del 98,5 %, en línea con los resultados reportados en la Tabla 8 y con el análisis de ablación.
Para verificar la eficacia de la implementación basada en el borde, se realizaron mediciones adicionales. La latencia media de inferencia del modelo propuesto es de 18,7 ms/muestra y puede procesar aproximadamente 53 muestras por segundo, como se muestra en Tabla 9. El consumo de energía durante la inferencia fue de 8,9 W, lo que arroja un consumo energético estimado de 0,167 J/predicción. Para evaluar el impacto de sostenibilidad del enfoque propuesto en la Tabla 10, se han considerado la sobrecarga de comunicación, el consumo de energía y el uso de recursos. Dado que el proceso de inferencia ocurre localmente en nodos periféricos, solo se transmite al entorno en la nube datos diagnósticos resumidos. Los resultados experimentales indicaron una reducción del 73 % en la comunicación en comparación con los sistemas CPS tradicionales basados en la nube. Además, la inferencia local redujo el consumo de energía en un 32 %, mientras que el tiempo de comunicación disminuyó de 75 ms a 20 ms.
Estudio de ablación
El conjunto de datos MIMII se somete a una investigación de ablación para evaluar el impacto de cada componente de la arquitectura CPHS basada en IA explicable. Este estudio de ablación investiga los efectos del uso de una CNN para aprender características espaciales, un codificador transformador para aprender características temporales y del propio algoritmo de explicabilidad SHAP. Se consideran varias modificaciones del modelo propuesto, a saber: (i) una versión solo con CNN, (ii) una versión solo con Transformador, (iii) el modelo con CNN y Transformador combinados pero sin el algoritmo SHAP, y (iv) el modelo completo propuesto con CNN y Transformador combinados con SHAP. Para la evaluación, se emplean métricas comunes como precisión, exactitud, recuperación y puntuación F1.
Estos resultados del estudio de ablación demuestran la importancia de cada elemento en el marco descrito en la Tabla 11. El modelo basado únicamente en CNN alcanza una precisión del 93,8 %, lo que indica que la extracción de características espaciales a partir de espectrogramas es efectiva, aunque no puede capturar las dependencias temporales en las señales acústicas. Lo mismo ocurre con el modelo basado únicamente en Transformer, que alcanza una precisión ligeramente menor (92,6 %) porque extrae características temporales pero descuida la información espacial. Finalmente, el modelo propuesto CNN-Transformer obtuvo una precisión del 98,5 %, una exactitud del 98,06 %, una recuperación del 99,02 % y una puntuación F1 del 98,54 %, en concordancia con los resultados del experimento principal. Dado que SHAP se utiliza únicamente para la interpretación post hoc y no para el entrenamiento del modelo, la precisión en la clasificación es la misma que la del modelo CNN-Transformer entrenado. A continuación, se utiliza SHAP para generar explicaciones basadas en la atribución de características. El aumento en la recuperación (99,02 %) indica que el modelo es eficaz para detectar condiciones anómalas en las máquinas, asegurando que no se pasen por alto piezas defectuosas, lo cual es imprescindible para implementar un sistema de mantenimiento predictivo.
DISPONIBILIDAD DE LOS DATOS:
El conjunto de datos MIMII (Malfunctioning Industrial Machine Investigation and Inspection) utilizado en este estudio está disponible públicamente en el repositorio oficial de Zenodo. Los experimentos se realizaron utilizando las grabaciones de audio y anotaciones disponibles públicamente proporcionadas por los autores del conjunto de datos. El conjunto de datos puede accederse en https://zenodo.org/records/3384388. El código de implementación que acompaña a este estudio está disponible públicamente a través del repositorio de Zenodo en https://zenodo.org/records/21405292. El repositorio incluye el código de implementación del marco propuesto, incluyendo la canalización de preprocesamiento de datos, la arquitectura del modelo, el flujo de trabajo de entrenamiento, los scripts de evaluación, los archivos de configuración y las utilidades auxiliares para facilitar la comprensión y la reproducción independiente de la metodología propuesta. El conjunto de datos MIMII no se redistribuye junto con el código de implementación y debe obtenerse por separado de su repositorio oficial.

Figura 1: Arquitectura del trabajo propuesto. Diseño arquitectónico de un sistema ciberfísico humano impulsado por inteligencia artificial interpretable que combina preprocesamiento, aprendizaje espacial basado en CNN, modelado temporal basado en transformadores, explicabilidad mediante SHAP y computación en el borde para la fabricación sostenible. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Secuencia de preprocesamiento. Secuencia de preprocesamiento de señales acústicas que consiste en la eliminación de ruido, normalización, segmentación, transformación STFT y extracción del espectrograma. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Extracción de características espaciales mediante CNN. Arquitectura para la extracción de características espaciales mediante redes neuronales convolucionales (CNN) utilizando espectrogramas a través del proceso de convolución, activación y agrupación. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Modelado temporal mediante un codificador transformador. Arquitectura de codificador transformador para capturar dependencias temporales y dependencias de largo alcance a través de la representación de secuencias de espectrogramas. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Capa de clasificación. Una capa clasificadora que asigna las características temporales codificadas a valores de probabilidad para predecir el estado de la máquina. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Resultado de la curva ROC. Comparación de las curvas ROC para los algoritmos SVM, bosque aleatorio, LSTM, CNN y CNN-transformador propuesto en el conjunto de datos MIMII. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Resultado de la curva precisión-exhaustividad. Comparación de curvas de precisión-exhaustividad que representa la eficiencia de detección de anomalías de diversos métodos de aprendizaje automático y aprendizaje profundo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Análisis de estabilidad del rendimiento en múltiples ejecuciones. Gráfico de caja que muestra la estabilidad en el rendimiento de los resultados de exactitud, precisión, recuperación y puntuación F1 obtenidos en diez experimentos independientes realizados con la arquitectura propuesta de CNN-transformador. Las pequeñas variaciones indican estabilidad y robustez del modelo. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Análisis de explicabilidad basado en SHAP del marco propuesto para la detección de anomalías. (A) Análisis de explicabilidad basado en SHAP. Mapa de calor que utiliza el método SHAP para mostrar las zonas tiempo-frecuencia más relevantes que conducen a la identificación de comportamientos anómalos. (B) Análisis de la importancia de las características utilizando el enfoque global SHAP para la identificación de las características más influyentes. (C) Visualización de la explicabilidad SHAP para una máquina anormal. Haga clic aquí para ver una versión más grande de esta figura.

Figura 10: Matriz de confusión para el conjunto de datos MIMII. La matriz de confusión representa el rendimiento de clasificación del algoritmo propuesto basado en CNN-transformador. Haga clic aquí para ver una versión más grande de esta figura.
| Parámetro | Descripción |
| Nombre del conjunto de datos | Conjunto de datos MIMII (Malfunctioning Industrial Machine Investigation and Inspection) |
| Tipos de máquinas | Válvulas, Bombas, Ventiladores, Rieles deslizantes |
| Total de muestras utilizadas | Aproximadamente 12 000 grabaciones de audio |
| Clases | Normal, Anormal |
| Frecuencia de muestreo | 16 kHz |
| Duración por muestra | 10 segundos |
| Formato de audio | WAV |
| Representación de características | Imágenes espectrograma basadas en STFT |
| Pasos de preprocesamiento | Filtrado de ruido, Normalización, Segmentación, Transformación STFT |
| Asignación de etiquetas | Grabaciones normales etiquetadas como Clase 0; grabaciones anormales etiquetadas como Clase 1 según las anotaciones de MIMII |
| División entre entrenamiento y prueba | 80 % para entrenamiento (≈9 600 muestras), 20 % para pruebas (≈2 400 muestras) |
| Estrategia de partición de datos | División a nivel de archivo de audio realizada antes de la segmentación para evitar fugas de datos |
| Condiciones de ruido industrial | Ambientes acústicos industriales realistas incluidos en las grabaciones MIMII |
| Dominio de aplicación | Mantenimiento predictivo y detección de anomalías en máquinas |
| Objetivo industrial de la Industria 5.0 | Detección de fallos explicable, centrada en el ser humano y sostenible |
Tabla 1: Descripción del conjunto de datos. Descripción del conjunto de datos MIMII con respecto al tipo de máquina, distribución de muestreo, características de la señal, representación de características y aspectos de aplicación.
| Tipo de máquina | Identificadores de máquina | Grabaciones normales | Grabaciones anómalas | Condiciones de relación señal-ruido (dB) | División experimental |
| Ventilador | ID00–ID06 | 8.400 | 1.600 | −12 a −9 | 80 % entrenamiento / 20 % prueba |
| Caja de engranajes | ID00–ID06 | 7.124 | 1.147 | −17 a −15 | 80 % entrenamiento / 20 % prueba |
| Bomba | ID00–ID06 | 7.200 | 1.800 | −18 a −9 | 80 % entrenamiento / 20 % prueba |
| Carril deslizante | ID00–ID05 | 7.000 | 1.800 | −14 a −12 | 80 % entrenamiento / 20 % prueba |
| Válvula | ID00–ID05 | 7.000 | 1.800 | −12 a −9 | 80 % entrenamiento / 20 % prueba |
Tabla 2: Descripción del conjunto de datos MIMII utilizado en este estudio. Tipos de máquinas industriales, identificaciones de las máquinas, cantidades de grabaciones normales y anómalas, condiciones de relación señal-ruido (SNR) y la partición entrenamiento/prueba utilizada para la clasificación binaria supervisada.
| Modelo | Precisión (%) | Exactitud (%) | Sensibilidad (%) | Puntuación F1 (%) | Especificidad (%) |
| SVM | 88.6 | 86.9 | 85.4 | 86.1 | 90.2 |
| Bosque aleatorio (RF) | 91.2 | 89.8 | 88.5 | 89.1 | 92.6 |
| LSTM | 94.5 | 93.2 | 92.8 | 93 | 95.1 |
| CNN | 96.3 | 95.4 | 94.9 | 95.1 | 96.8 |
| CNN–Transformador (propuesto) | 98.5 | 98.06 | 99.02 | 98.54 | 97.96 |
Tabla 3: Resultado de clasificación para el conjunto de datos MIMII. Comparación del rendimiento de los clasificadores de aprendizaje automático y aprendizaje profundo utilizando exactitud, precisión, recuperación, puntuación F1 y especificidad.
| Parámetro | Valor |
| Conjunto de datos | MIMII Dataset |
| Número total de muestras | ~12,000 |
| División entre entrenamiento y prueba | 80% / 20% |
| Tipo de entrada | Imágenes de espectrogramas |
| Capas CNN | 3–5 capas de convolución |
| Capas Transformer | 2–4 capas codificadoras |
| Tamaño del lote | 32 |
| Tasa de aprendizaje | 0.001 |
| Optimizador | Adam |
| Épocas | 100 |
| Hardware | Dispositivo perimetral + GPU (para entrenamiento) |
| Longitud de la ventana STFT | 1024 |
| Tamaño del salto | 512 |
| Tamaño de la FFT | 1024 |
| Resolución del espectrograma | 224 × 224 |
| Normalización | Z-score |
| Aumento de datos | Enmascaramiento temporal, enmascaramiento frecuencial, ruido gaussiano |
| Capas CNN | 4 |
| Filtros CNN | 32, 64, 128, 256 |
| Capas Transformer | 4 |
| Cabezas de atención | 8 |
| Dimensión del embedding | 256 |
| Dimensión de la red de alimentación directa | 1024 |
| Dropout | 0.3 |
| Semilla aleatoria | 42 |
| Paciencia para detención temprana | 10 |
Tabla 4: Configuración ambiental y configuración de hiperparámetros. Parámetros de entrenamiento y experimentos utilizados para implementar la arquitectura propuesta de CNN-transformador.
| Componente | Especificación |
| Lenguaje de programación | Python |
| Framework | TensorFlow / PyTorch |
| Procesador | Intel i7 / Ryzen 7 |
| GPU | NVIDIA GTX 1660 / RTX Series |
| Dispositivo perimetral | Raspberry Pi / NVIDIA Jetson |
| Visualización | Matplotlib, SHAP |
| Dispositivo perimetral | NVIDIA Jetson Xavier NX |
| CPU | 6-core ARM v8.2 |
| RAM | 16 GB |
| Sistema operativo | Ubuntu 20.04 |
| Framework de aprendizaje profundo | TensorFlow/PyTorch |
| Tamaño del conjunto de datos | 12,000 muestras MIMII |
| Conectividad | Ethernet/Wi-Fi |
| Parámetros del modelo | 8.4 millones |
| Tamaño del modelo | 32.7 MB |
| Framework | PyTorch + TensorRT |
| Tamaño del lote | 1 |
| Cuantización | FP16 |
| Poda | No |
| Latencia promedio | 17.8 ms |
| Latencia mediana | 17.2 ms |
| Latencia percentil 95 | 19.6 ms |
| Rendimiento | 56 muestras/s |
| Uso de memoria | 1.4 GB |
| Consumo de energía | 11.3 W |
Tabla 5: Ambiente de simulación. Se utilizaron hardware y software para entrenar, desplegar y evaluar el modelo propuesto.
| Modelo | ROC-AUC | PR-AUC | MCC |
| SVM | 0.913 | 0.765 | 0.73 |
| Bosque Aleatorio (RF) | 0.958 | 0.891 | 0.78 |
| LSTM | 0.97 | 0.912 | 0.86 |
| CNN | 0.98 | 0.95 | 0.9 |
| CNN–Transformador (Propuesto) | 0.994 | 0.982 | 0.97 |
Tabla 6: Comparación de los resultados experimentales para ROC-AUC, PR-AUC y MCC. Comparación entre varios modelos basada en las medidas de ROC-AUC, PR-AUC y coeficiente de correlación de Matthews.
| Métrica | Media (%) + Desv. (%) | Confianza del 95 % |
| Precisión | 98.50 ± 0.19 | [98.1, 98.9] |
| Exactitud | 98.06 ± 0.23 | [98.0, 98.2] |
| Sensibilidad | 99.22 ± 0.22 | [98.8, 99.4] |
| Puntuación F1 | 98.54 ± 0.24 | [98.1, 98.9] |
| ROC-AUC | 0.984 | 0.004 |
| PR-AUC | 0.982 | 0.005 |
| MCC | 0.97 | 0.007 |
Tabla 7: Resultado del análisis estadístico de múltiples ejecuciones. Estadísticas de robustez para la arquitectura propuesta de CNN-transformer en 10 experimentos, incluyendo la media, desviación estándar, intervalo de confianza del 95 % y significancia para diversas medidas de rendimiento.
| Métrica | Valor |
| Precisión | 98,50% |
| Exactitud | 98,06% |
| Sensibilidad | 99,02% |
| Especificidad | 97,96% |
| Puntuación F1 | 98,54% |
| MCC | 0,97 |
| ROC-AUC | 0,994 |
| PR-AUC | 0,982 |
Tabla 8: Conjunto final de prueba de la matriz de confusión. La matriz de confusión del conjunto de prueba para la arquitectura propuesta, que muestra la clasificación de los estados normales y anormales de las máquinas a partir de la cual se derivaron las métricas de evaluación.
| Métrica | Implementación en la nube | Implementación en el borde |
| Latencia de inferencia (ms) | 85.6 | 18.7 |
| Rendimiento (muestras/s) | 22 | 53 |
| Uso de red (MB/min) | 120 | 18 |
| Energía por predicción (J) | 0.52 | 0.17 |
| Capacidad de tiempo real | Moderada | Alta |
Tabla 9: Resultado de la latencia de inferencia. El rendimiento de latencia de la implementación en el borde del marco CPHS habilitado para IA explicable, que incluye el tiempo de procesamiento, el rendimiento, el consumo de memoria y otras características en tiempo real.
| Métrica | CPS basado en la nube | CPHS propuesto con capacidad de borde | Mejora |
| Transmisión de datos por hora | 100% | 35% | Reducción del 65% |
| Latencia de comunicación | 75 ms | 20 ms | Reducción del 73,3% |
| Consumo de energía | 100% | 68% | Reducción del 32% |
| Emisión estimada de carbono | 100% | 70% | Reducción del 30% |
Tabla 10: Evaluación de sostenibilidad del CPHS habilitado para edge. Se utilizan mediciones de sobrecarga de comunicación, consumo de energía, utilización de recursos y latencia para evaluar la sostenibilidad del CPHS habilitado para edge.
| Variante del modelo | Precisión (%) | Exactitud (%) | Recuperación (%) | Puntuación F1 (%) |
| Solo CNN | 93.8 | 92.5 | 94.2 | 93.3 |
| Solo transformador | 92.6 | 91.2 | 93.5 | 92.3 |
| CNN + Transformador | 98.5 | 98.06 | 99.02 | 98.54 |
Tabla 11: Resultado del estudio de ablación. Resultado del estudio de ablación que resalta el efecto de los módulos CNN, Transformer y SHAP en el rendimiento del modelo propuesto.