En la producción industrial moderna, la seguridad es el pilar fundamental para garantizar la eficiencia productiva y el bienestar del personal. El entorno de la línea de producción suele incluir equipos mecánicos de alta velocidad, procesos tecnológicos complejos y operaciones colaborativas que implican múltiples tareas. Cualquier pequeño riesgo potencial de seguridad puede provocar accidentes graves en la producción, lo que resulta en pérdidas económicas significativas e incluso en fatalidades. Por lo tanto, es crucial establecer un sistema inteligente, eficiente y en tiempo real para la supervisión de la seguridad, con el fin de mejorar la seguridad en la producción industrial1,2.
Los métodos tradicionales de monitoreo de seguridad dependen principalmente de la vigilancia manual por video y diversos sensores (como sensores infrarrojos, de humo y de vibración)3. La supervisión manual no solo es ineficiente, sino que también está propensa a detecciones omitidas debido al cansancio del personal de vigilancia, y no puede ofrecer una cobertura continua e integral. Aunque los sensores pueden proporcionar cierta función de alerta temprana, su rango de detección es limitado y son sensibles a las interferencias ambientales, lo que provoca problemas destacados de falsas alarmas4. Los sistemas de monitoreo inteligentes se han convertido en un enfoque creciente de investigación. El análisis en tiempo real de una secuencia de video mediante un algoritmo de aprendizaje profundo puede identificar automáticamente eventos anómalos, comportamientos inseguros y peligros potenciales, mejorando así considerablemente la inteligencia del sistema de monitoreo4,5.
La detección de objetos es una tecnología fundamental en la vigilancia inteligente. Como representantes de detectores de objetos de una sola etapa, los algoritmos de la serie You Only Look Once (YOLO) muestran ventajas significativas. Desde YOLOv1 hasta YOLOv8, esta colección de algoritmos ha experimentado un desarrollo continuo, con mejoras en la arquitectura de red, la función de pérdida y la metodología de entrenamiento, entre otros aspectos6,7. YOLOv11, en particular, ha logrado una mayor precisión en la detección manteniendo un alto número de fotogramas por segundo, especialmente cuando se enfrenta a fondos complejos y objetivos densamente empaquetados8.
Sin embargo, a pesar de su excelente desempeño en tareas generales de detección de objetos, YOLOv11 aún enfrenta desafíos en escenarios específicos de monitoreo de seguridad en líneas de producción9. Por ejemplo, la precisión de detección de YOLOv11 puede disminuir cuando los trabajadores están parcialmente ocultos por equipos o cuando las señales de seguridad son pequeñas y se asemejan mucho al color del fondo. Esto exige que el modelo tenga capacidades más fuertes de extracción de características y comprensión semántica10.
Las redes neuronales convolucionales (CNN) tienen capacidades potentes en la extracción de características de imágenes11. Al diseñar arquitecturas de redes más profundas y complejas, las CNN pueden aprender características de imagen más ricas y abstractas. Combinar una CNN con YOLOv11 aprovecha las capacidades de detección rápida de YOLOv11 y la extracción profunda de características de la CNN, construyendo así un sistema de monitoreo de seguridad más robusto e inteligente.
Con base en esto, en este artículo se propone un sistema de monitoreo de seguridad en líneas de producción que utiliza YOLOv11 y una CNN. Los aspectos innovadores de este estudio incluyen: (1) proponer una arquitectura de fusión profunda de YOLOv11 y una CNN mejorada; (2) introducir la fusión de características multi-escala y un mecanismo de atención compuesto para mejorar el reconocimiento de características clave de seguridad; y (3) verificar las ventajas de desempeño del modelo en un conjunto de datos de escenas complejas construido por nosotros mismos.
Desarrollo de los algoritmos de la serie YOLO
Desde su primera presentación por Redmon et al. en 201512, el algoritmo You Only Look Once (YOLO) ha suscitado un gran interés. A diferencia de los detectores de dos etapas que dependen de propuestas de regiones, YOLO trata la detección de objetos como una tarea de regresión. Al predecir directamente las clases y posiciones de los objetos en una imagen, YOLO aumenta notablemente la velocidad de detección, lo que la hace adecuada para uso en tiempo real13.
Como trabajo pionero en esta serie, YOLOv1 logra por primera vez la detección de objetivos de extremo a extremo14. YOLOv1 implica dividir la imagen de entrada en una estructura de cuadrícula, donde cada celda de la cuadrícula, dispuesta típicamente en un formato S × S, tiene la tarea de detectar objetos que se encuentran dentro de sus límites.
Específicamente, la salida de YOLOv1 es un tensor. Dentro del S × S × (B × 5 + C), la predicción de cada cuadro delimitador contiene 5 elementos: coordenada del punto central (x,y), ancho w, alto h y confianza c. El proceso de cálculo se ilustra en la Ecuación (1):
(1)
Entre ellos, Pr(Object) representa la probabilidad de que haya un objetivo en la cuadrícula, e IOU representa la razón de la intersección sobre la unión entre el cuadro delimitador predicho y el cuadro real. Cada cuadrícula también predice un conjunto de probabilidades de clase, donde Pr representa la probabilidad de que el objetivo pertenezca a la clase i-ésima cuando existe un objetivo. La función de pérdida de YOLOv1 se compone de tres componentes principales: la pérdida para la predicción de coordenadas, la pérdida para la estimación de confianza y la pérdida para la predicción de categorías15.
YOLOv2 introduce la normalización por lotes, un clasificador de alta resolución y una estrategia de entrenamiento multi-escala, lo que mejora la estabilidad y la precisión16. YOLOv3 utiliza Darknet-53 como red troncal y se inspira en el concepto de la Red de Pirámide de Características (FPN) para mejorar la detección de objetivos17.
YOLOv4 ha realizado numerosas optimizaciones basadas en YOLOv3, introduciendo tecnologías como la Cross Stage Partial Network (CSPNet)18, la Path Aggregation Network (PANet)19 y el aumento de datos Mosaic para mejorar aún más el rendimiento del modelo. YOLOv5 ha realizado contribuciones significativas en ingeniería, ofreciendo una implementación más fácil de usar y más eficiente20.
En los últimos años, la serie YOLO ha seguido evolucionando, con el lanzamiento sucesivo de versiones como YOLOv6, YOLOv7 y YOLOv8. Al introducir la estructura Extended Efficient Layer Aggregation Network (E-ELAN) y técnicas de reparametrización del modelo, YOLOv7 logra nuevos avances tanto en velocidad como en precisión. Estas mejoras no solo aumentan la eficiencia del aprendizaje de características, sino que también optimizan el rendimiento de inferencia de la red, permitiendo que YOLOv7 supere a versiones anteriores y a muchos detectores convencionales en diversas tareas de detección en tiempo real. YOLOv8 continúa optimizando la estructura de la red, adopta un diseño libre de anclas, simplifica el modelo y mejora su capacidad de generalización21.
Aprovechando las ventajas de versiones anteriores, YOLOv11, utilizado en este estudio, ha sido optimizado para escenarios industriales complejos. Sus mejoras principales incluyen una red de extracción de características, un módulo de fusión de características más eficiente y un diseño de función de pérdida más robusto. Estas mejoras permiten a YOLOv11 desempeñarse mejor al manejar oclusiones, objetivos pequeños y fondos complejos en entornos de producción. YOLOv11 es una versión de la serie YOLO lanzada por Ultralytics. En comparación con YOLOv8, mejora el módulo C3K2 y la ruta de fusión de características, e introduce una estrategia adaptativa de cajas ancla, proporcionando así una mayor robustez en la detección en escenarios industriales.
Base y progreso de la red neuronal convolucional (CNN)
La red neuronal convolucional (CNN) es un modelo fundamental que ha influido profundamente en el éxito del aprendizaje profundo dentro de la visión por computadora. Funciona extrayendo características locales de la imagen mediante operaciones de convolución y posteriormente reduciendo la dimensionalidad de las características mediante operaciones de agrupación, logrando así una abstracción jerárquica de la imagen22.
Una CNN típica se compone de múltiples capas convolucionales, de agrupación y completamente conectadas. La capa convolucional escanea la imagen de entrada con un kernel de convolución, calcula productos escalares sobre regiones locales y produce un mapa de características. El proceso de cálculo se muestra en la Ecuación (2):
(2)
Donde x es la imagen de entrada, wk y bk son los pesos y el sesgo del núcleo de convolución, respectivamente, y
son los valores del mapa de características de salida en la posición (i,j). La capa de agrupamiento comúnmente utiliza Max Pooling o Average Pooling. La capa completamente conectada se encarga de extraer características y predecir probabilidades de clasificación.
Con base en esto, en este artículo se diseña un módulo de realce de características CNN para YOLOv11, que consta de dos ramas paralelas: una rama de convolución multiescala que utiliza núcleos de convolución de 3 × 3 y 5 × 5 para extraer características multiescala; y una rama de atención que conecta secuencialmente los módulos de atención de canal (Squeeze-and-Excitation) y de atención espacial para potenciar las características discriminativas de los objetivos clave. Las salidas de las dos ramas se fusionan mediante suma elemento a elemento, y la función de pérdida correspondiente para el realce de características se muestra en la fórmula (3):
(3)
Lcoord es la pérdida por regresión de coordenadas del cuadro delimitador; Lconf es la pérdida de confianza del objetivo; Lcls es la pérdida de clasificación por categoría; Lfeat es la pérdida de mejora de características, utilizada para restringir las características discriminativas de objetivos pequeños y objetivos ocluidos extraídas por el módulo de mejora de la CNN; λcoord, λconf, λcls, λfeat son los coeficientes de peso de los términos de pérdida correspondientes. Para esta tarea, se establece λfeat = 0.05, y los pesos restantes se equilibran de acuerdo con los requisitos de la tarea de detección.
Las estructuras clásicas de CNN, como VGGNet23 y ResNet24, han logrado un gran éxito en tareas de clasificación de imágenes. Entre estas arquitecturas, ResNet mitiga eficazmente el problema del gradiente que desaparece durante el entrenamiento de redes profundas, facilitando así la construcción de estructuras de redes más profundas y complejas.
En tareas de detección de objetos, la CNN suele utilizarse como extractor de características (estructura básica). Por ejemplo, Darknet, Darknet parcial por etapas cruzadas (CSPDarknet), etc., en la serie de algoritmos YOLO, están todos basados en CNN25. Para mejorar las capacidades de extracción de características, los investigadores han propuesto numerosas estructuras mejoradas de CNN. Por ejemplo, el módulo Inception extrae características en paralelo mediante núcleos de convolución de múltiples escalas. DenseNet potencia el reutilización de características mediante conexiones densas. La red Squeeze-and-Excitation ajusta adaptativamente la importancia de los canales de características mediante mecanismos de atención26.
En este estudio, diseñamos un módulo CNN mejorado para potenciar las capacidades de extracción de características de YOLOv11. Este módulo combina la fusión de características multiescala con un mecanismo de atención para capturar de manera más eficaz la información clave de seguridad en escenarios de línea de producción.
Estado de aplicación del aprendizaje profundo en la vigilancia de la seguridad industrial
El aprendizaje profundo ha ganado una gran relevancia en la vigilancia de la seguridad industrial. Los algoritmos basados en CNN se emplean para determinar si los trabajadores llevan correctamente puestos los cascos de seguridad, detectar intrusiones no autorizadas en zonas peligrosas y monitorear el estado de equipos con fallos.27
En cuanto al reconocimiento de comportamiento, se utilizan redes neuronales convolucionales 3D y redes neuronales recurrentes para analizar el comportamiento operativo de los trabajadores e identificar acciones potencialmente inseguras. Por ejemplo, al analizar las secuencias de postura de los trabajadores, se puede determinar si están violando los procedimientos operativos de seguridad28.
YOLO y Faster R-CNN se utilizan ampliamente para la detección de personal y equipos en videos de vigilancia en tiempo real. Por ejemplo, se ha propuesto en la literatura un sistema de detección de cascos en tiempo real basado en YOLOv5, que mejora eficazmente la inteligencia en la gestión de la seguridad en sitios de construcción29.
Aunque se ha avanzado algo en la investigación existente, aún persisten varios desafíos. En primer lugar, las escenas industriales suelen presentar iluminación compleja, oclusión e interferencia de fondo, lo que impone requisitos rigurosos sobre la robustez del algoritmo. En segundo lugar, el rendimiento en tiempo real es un requisito clave, y el algoritmo debe lograr una inferencia de alta velocidad manteniendo la precisión. Por último, la investigación existente se centra principalmente en la detección de una sola tarea y carece de exploración sobre la fusión de información multisensorial y el análisis integral30.
En este estudio, el modelo de fusión propuesto YOLOv11 y CNN tiene como objetivo abordar los desafíos mencionados y lograr un monitoreo integral y en tiempo real de los riesgos de seguridad en la línea de producción, mejorando las capacidades de extracción y fusión de características.