Artículo de método

Monitoreo de seguridad de líneas de producción en tiempo real mediante detección de objetos basada en aprendizaje profundo y mejora de características

36 visualizaciones

DOI:

10.3791/70968

21 de agosto de 2026

En este artículo

Resumen

Este artículo propone un método de monitoreo de seguridad en líneas de producción que integra You Only Look Once versión 11 (YOLOv11) con redes neuronales convolucionales. El método alcanzó una precisión media promedio a un umbral de intersección sobre unión de 0,5 (mAP@0,5) de 0,91, un mAP@0,5:0,95 de 0,82 y 120 cuadros por segundo en una unidad de procesamiento gráfico, superando a los modelos de referencia evaluados.

Resumen

Con la profundización de la Industria 4.0, los niveles de automatización e inteligencia de las líneas de producción han mejorado significativamente, lo que plantea mayores exigencias sobre el rendimiento en tiempo real, la precisión y la seguridad del monitoreo. Los sistemas tradicionales de monitoreo, que dependen de inspecciones manuales o decisiones basadas en umbrales simples, generalmente presentan tiempos de respuesta lentos, altas tasas de falsas alarmas y una inteligencia limitada. Por lo tanto, este artículo propone un sistema de monitoreo de seguridad para líneas de producción que integra You Only Look Once versión 11 (YOLOv11) con una red neuronal convolucional (CNN). Primero, las imágenes adquiridas fueron preprocesadas. Luego, se utilizó YOLOv11 para identificar trabajadores, equipos y posibles peligros en tiempo real. A continuación, se introdujo una red CNN mejorada con fusión de características multiescala y mecanismos de atención para potenciar las capacidades de extracción de características de objetivos pequeños y parcialmente ocultos. Finalmente, los resultados de detección se fusionaron con las características mejoradas por la CNN para evaluar el estado de seguridad. Se realizaron experimentos utilizando un conjunto de datos de seguridad en líneas de producción construido por nosotros, empleando el optimizador de descenso de gradiente estocástico (SGD) con momento 0.9, una tasa de aprendizaje inicial de 0.01, decaimiento del peso de 0.0005, ajuste de tasa de aprendizaje con enfriamiento cosenoidal, un tamaño de lote de 32 y entrenamiento durante 200 épocas. Se utilizaron mAP@0.5 y la velocidad de detección en cuadros por segundo (FPS) como métricas de evaluación para comparar con los algoritmos de referencia evaluados. Los resultados muestran que el sistema propuesto alcanzó un mAP@0.5 de 0.91 y una velocidad de detección de 120 FPS. Además, demostró un rendimiento robusto bajo condiciones complejas, como sombreado e iluminación variable, lo que respalda su eficacia y potencial de aplicación práctica en el monitoreo de seguridad de líneas de producción.

Introducción

En la producción industrial moderna, la seguridad es el pilar fundamental para garantizar la eficiencia productiva y el bienestar del personal. El entorno de la línea de producción suele incluir equipos mecánicos de alta velocidad, procesos tecnológicos complejos y operaciones colaborativas que implican múltiples tareas. Cualquier pequeño riesgo potencial de seguridad puede provocar accidentes graves en la producción, lo que resulta en pérdidas económicas significativas e incluso en fatalidades. Por lo tanto, es crucial establecer un sistema inteligente, eficiente y en tiempo real para la supervisión de la seguridad, con el fin de mejorar la seguridad en la producción industrial1,2.

Los métodos tradicionales de monitoreo de seguridad dependen principalmente de la vigilancia manual por video y diversos sensores (como sensores infrarrojos, de humo y de vibración)3. La supervisión manual no solo es ineficiente, sino que también está propensa a detecciones omitidas debido al cansancio del personal de vigilancia, y no puede ofrecer una cobertura continua e integral. Aunque los sensores pueden proporcionar cierta función de alerta temprana, su rango de detección es limitado y son sensibles a las interferencias ambientales, lo que provoca problemas destacados de falsas alarmas4. Los sistemas de monitoreo inteligentes se han convertido en un enfoque creciente de investigación. El análisis en tiempo real de una secuencia de video mediante un algoritmo de aprendizaje profundo puede identificar automáticamente eventos anómalos, comportamientos inseguros y peligros potenciales, mejorando así considerablemente la inteligencia del sistema de monitoreo4,5.

La detección de objetos es una tecnología fundamental en la vigilancia inteligente. Como representantes de detectores de objetos de una sola etapa, los algoritmos de la serie You Only Look Once (YOLO) muestran ventajas significativas. Desde YOLOv1 hasta YOLOv8, esta colección de algoritmos ha experimentado un desarrollo continuo, con mejoras en la arquitectura de red, la función de pérdida y la metodología de entrenamiento, entre otros aspectos6,7. YOLOv11, en particular, ha logrado una mayor precisión en la detección manteniendo un alto número de fotogramas por segundo, especialmente cuando se enfrenta a fondos complejos y objetivos densamente empaquetados8.

Sin embargo, a pesar de su excelente desempeño en tareas generales de detección de objetos, YOLOv11 aún enfrenta desafíos en escenarios específicos de monitoreo de seguridad en líneas de producción9. Por ejemplo, la precisión de detección de YOLOv11 puede disminuir cuando los trabajadores están parcialmente ocultos por equipos o cuando las señales de seguridad son pequeñas y se asemejan mucho al color del fondo. Esto exige que el modelo tenga capacidades más fuertes de extracción de características y comprensión semántica10.

Las redes neuronales convolucionales (CNN) tienen capacidades potentes en la extracción de características de imágenes11. Al diseñar arquitecturas de redes más profundas y complejas, las CNN pueden aprender características de imagen más ricas y abstractas. Combinar una CNN con YOLOv11 aprovecha las capacidades de detección rápida de YOLOv11 y la extracción profunda de características de la CNN, construyendo así un sistema de monitoreo de seguridad más robusto e inteligente.

Con base en esto, en este artículo se propone un sistema de monitoreo de seguridad en líneas de producción que utiliza YOLOv11 y una CNN. Los aspectos innovadores de este estudio incluyen: (1) proponer una arquitectura de fusión profunda de YOLOv11 y una CNN mejorada; (2) introducir la fusión de características multi-escala y un mecanismo de atención compuesto para mejorar el reconocimiento de características clave de seguridad; y (3) verificar las ventajas de desempeño del modelo en un conjunto de datos de escenas complejas construido por nosotros mismos.

Desarrollo de los algoritmos de la serie YOLO
Desde su primera presentación por Redmon et al. en 201512, el algoritmo You Only Look Once (YOLO) ha suscitado un gran interés. A diferencia de los detectores de dos etapas que dependen de propuestas de regiones, YOLO trata la detección de objetos como una tarea de regresión. Al predecir directamente las clases y posiciones de los objetos en una imagen, YOLO aumenta notablemente la velocidad de detección, lo que la hace adecuada para uso en tiempo real13.

Como trabajo pionero en esta serie, YOLOv1 logra por primera vez la detección de objetivos de extremo a extremo14. YOLOv1 implica dividir la imagen de entrada en una estructura de cuadrícula, donde cada celda de la cuadrícula, dispuesta típicamente en un formato S × S, tiene la tarea de detectar objetos que se encuentran dentro de sus límites.

Específicamente, la salida de YOLOv1 es un tensor. Dentro del S × S × (B × 5 + C), la predicción de cada cuadro delimitador contiene 5 elementos: coordenada del punto central (x,y), ancho w, alto h y confianza c. El proceso de cálculo se ilustra en la Ecuación (1):
Fórmula de probabilidad y la intersección sobre la unión (IoU) para el análisis de detección de objetos.   (1)

Entre ellos, Pr(Object) representa la probabilidad de que haya un objetivo en la cuadrícula, e IOU representa la razón de la intersección sobre la unión entre el cuadro delimitador predicho y el cuadro real. Cada cuadrícula también predice un conjunto de probabilidades de clase, donde Pr representa la probabilidad de que el objetivo pertenezca a la clase i-ésima cuando existe un objetivo. La función de pérdida de YOLOv1 se compone de tres componentes principales: la pérdida para la predicción de coordenadas, la pérdida para la estimación de confianza y la pérdida para la predicción de categorías15.

YOLOv2 introduce la normalización por lotes, un clasificador de alta resolución y una estrategia de entrenamiento multi-escala, lo que mejora la estabilidad y la precisión16. YOLOv3 utiliza Darknet-53 como red troncal y se inspira en el concepto de la Red de Pirámide de Características (FPN) para mejorar la detección de objetivos17.

YOLOv4 ha realizado numerosas optimizaciones basadas en YOLOv3, introduciendo tecnologías como la Cross Stage Partial Network (CSPNet)18, la Path Aggregation Network (PANet)19 y el aumento de datos Mosaic para mejorar aún más el rendimiento del modelo. YOLOv5 ha realizado contribuciones significativas en ingeniería, ofreciendo una implementación más fácil de usar y más eficiente20.

En los últimos años, la serie YOLO ha seguido evolucionando, con el lanzamiento sucesivo de versiones como YOLOv6, YOLOv7 y YOLOv8. Al introducir la estructura Extended Efficient Layer Aggregation Network (E-ELAN) y técnicas de reparametrización del modelo, YOLOv7 logra nuevos avances tanto en velocidad como en precisión. Estas mejoras no solo aumentan la eficiencia del aprendizaje de características, sino que también optimizan el rendimiento de inferencia de la red, permitiendo que YOLOv7 supere a versiones anteriores y a muchos detectores convencionales en diversas tareas de detección en tiempo real. YOLOv8 continúa optimizando la estructura de la red, adopta un diseño libre de anclas, simplifica el modelo y mejora su capacidad de generalización21.

Aprovechando las ventajas de versiones anteriores, YOLOv11, utilizado en este estudio, ha sido optimizado para escenarios industriales complejos. Sus mejoras principales incluyen una red de extracción de características, un módulo de fusión de características más eficiente y un diseño de función de pérdida más robusto. Estas mejoras permiten a YOLOv11 desempeñarse mejor al manejar oclusiones, objetivos pequeños y fondos complejos en entornos de producción. YOLOv11 es una versión de la serie YOLO lanzada por Ultralytics. En comparación con YOLOv8, mejora el módulo C3K2 y la ruta de fusión de características, e introduce una estrategia adaptativa de cajas ancla, proporcionando así una mayor robustez en la detección en escenarios industriales.

Base y progreso de la red neuronal convolucional (CNN)
La red neuronal convolucional (CNN) es un modelo fundamental que ha influido profundamente en el éxito del aprendizaje profundo dentro de la visión por computadora. Funciona extrayendo características locales de la imagen mediante operaciones de convolución y posteriormente reduciendo la dimensionalidad de las características mediante operaciones de agrupación, logrando así una abstracción jerárquica de la imagen22.

Una CNN típica se compone de múltiples capas convolucionales, de agrupación y completamente conectadas. La capa convolucional escanea la imagen de entrada con un kernel de convolución, calcula productos escalares sobre regiones locales y produce un mapa de características. El proceso de cálculo se muestra en la Ecuación (2):

Diagrama de la operación de convolución; notación matemática para modelos de aprendizaje automático.   (2)

Donde x es la imagen de entrada, wk y bk son los pesos y el sesgo del núcleo de convolución, respectivamente, y Expresión matemática y_ij^k, posiblemente relacionada con operaciones matriciales o tensoriales utilizadas en algoritmos. son los valores del mapa de características de salida en la posición (i,j). La capa de agrupamiento comúnmente utiliza Max Pooling o Average Pooling. La capa completamente conectada se encarga de extraer características y predecir probabilidades de clasificación.

Con base en esto, en este artículo se diseña un módulo de realce de características CNN para YOLOv11, que consta de dos ramas paralelas: una rama de convolución multiescala que utiliza núcleos de convolución de 3 × 3 y 5 × 5 para extraer características multiescala; y una rama de atención que conecta secuencialmente los módulos de atención de canal (Squeeze-and-Excitation) y de atención espacial para potenciar las características discriminativas de los objetivos clave. Las salidas de las dos ramas se fusionan mediante suma elemento a elemento, y la función de pérdida correspondiente para el realce de características se muestra en la fórmula (3):

 Fórmula matemática para la coordinación de la función de pérdida L=λcoordLcoord+λconfLconf+λclsLcls+λfeatLfeat (3)

Lcoord es la pérdida por regresión de coordenadas del cuadro delimitador; Lconf es la pérdida de confianza del objetivo; Lcls es la pérdida de clasificación por categoría; Lfeat es la pérdida de mejora de características, utilizada para restringir las características discriminativas de objetivos pequeños y objetivos ocluidos extraídas por el módulo de mejora de la CNN; λcoord, λconf, λcls, λfeat son los coeficientes de peso de los términos de pérdida correspondientes. Para esta tarea, se establece λfeat = 0.05, y los pesos restantes se equilibran de acuerdo con los requisitos de la tarea de detección.

Las estructuras clásicas de CNN, como VGGNet23 y ResNet24, han logrado un gran éxito en tareas de clasificación de imágenes. Entre estas arquitecturas, ResNet mitiga eficazmente el problema del gradiente que desaparece durante el entrenamiento de redes profundas, facilitando así la construcción de estructuras de redes más profundas y complejas.

En tareas de detección de objetos, la CNN suele utilizarse como extractor de características (estructura básica). Por ejemplo, Darknet, Darknet parcial por etapas cruzadas (CSPDarknet), etc., en la serie de algoritmos YOLO, están todos basados en CNN25. Para mejorar las capacidades de extracción de características, los investigadores han propuesto numerosas estructuras mejoradas de CNN. Por ejemplo, el módulo Inception extrae características en paralelo mediante núcleos de convolución de múltiples escalas. DenseNet potencia el reutilización de características mediante conexiones densas. La red Squeeze-and-Excitation ajusta adaptativamente la importancia de los canales de características mediante mecanismos de atención26.

En este estudio, diseñamos un módulo CNN mejorado para potenciar las capacidades de extracción de características de YOLOv11. Este módulo combina la fusión de características multiescala con un mecanismo de atención para capturar de manera más eficaz la información clave de seguridad en escenarios de línea de producción.

Estado de aplicación del aprendizaje profundo en la vigilancia de la seguridad industrial
El aprendizaje profundo ha ganado una gran relevancia en la vigilancia de la seguridad industrial. Los algoritmos basados en CNN se emplean para determinar si los trabajadores llevan correctamente puestos los cascos de seguridad, detectar intrusiones no autorizadas en zonas peligrosas y monitorear el estado de equipos con fallos.27

En cuanto al reconocimiento de comportamiento, se utilizan redes neuronales convolucionales 3D y redes neuronales recurrentes para analizar el comportamiento operativo de los trabajadores e identificar acciones potencialmente inseguras. Por ejemplo, al analizar las secuencias de postura de los trabajadores, se puede determinar si están violando los procedimientos operativos de seguridad28.

YOLO y Faster R-CNN se utilizan ampliamente para la detección de personal y equipos en videos de vigilancia en tiempo real. Por ejemplo, se ha propuesto en la literatura un sistema de detección de cascos en tiempo real basado en YOLOv5, que mejora eficazmente la inteligencia en la gestión de la seguridad en sitios de construcción29.

Aunque se ha avanzado algo en la investigación existente, aún persisten varios desafíos. En primer lugar, las escenas industriales suelen presentar iluminación compleja, oclusión e interferencia de fondo, lo que impone requisitos rigurosos sobre la robustez del algoritmo. En segundo lugar, el rendimiento en tiempo real es un requisito clave, y el algoritmo debe lograr una inferencia de alta velocidad manteniendo la precisión. Por último, la investigación existente se centra principalmente en la detección de una sola tarea y carece de exploración sobre la fusión de información multisensorial y el análisis integral30.

En este estudio, el modelo de fusión propuesto YOLOv11 y CNN tiene como objetivo abordar los desafíos mencionados y lograr un monitoreo integral y en tiempo real de los riesgos de seguridad en la línea de producción, mejorando las capacidades de extracción y fusión de características.

Protocolo

Algoritmo YOLOv11 y CNN

Arquitectura general del sistema
El sistema de monitoreo de seguridad para líneas de producción propuesto en este artículo adopta una arquitectura híbrida que combina YOLOv11 con una CNN mejorada para lograr un monitoreo de seguridad en tiempo real con alta precisión y velocidad. Como se muestra en Figura 1, el sistema consta principalmente de un módulo de preprocesamiento de entrada, un módulo de detección de objetos YOLOv11, un módulo de mejora de características CNN y un módulo de decisión por fusión. La imagen de entrada se normaliza primero y se aumenta mediante el módulo de preprocesamiento para mejorar la capacidad de generalización del modelo. Posteriormente, las características se extraen mediante el armazón CSPDarknet, y el campo receptivo se amplía mediante el módulo de agrupación piramidal espacial rápida (SPPF). Las características multiescala se fusionan tras el muestreo ascendente, y se aplican secuencialmente la atención de canal y la atención espacial a las características fusionadas para mejorar aún más la representación discriminativa de los objetivos clave. El módulo de mejora de características CNN se inserta tras las salidas de las capas C3, C4 y C5 de la red troncal YOLOv11, recibiendo mapas de características multiescala de tamaños 80 × 80 × 256, 40 × 40 × 512 y 20 × 20 × 1,024, respectivamente. El módulo de mejora de características CNN potencia aún más la extracción de características para objetivos pequeños y ocluidos. Finalmente, el módulo de decisión por fusión combina los resultados de detección de YOLOv11 con las características mejoradas por CNN y los optimiza conjuntamente mediante una función de pérdida diseñada para generar la ubicación precisa, la categoría y la puntuación de confianza del objetivo.

Marco de detección YOLOv11
YOLOv11 ha introducido varias mejoras fundamentales que aprovechan las fortalezas del marco de detección de una sola etapa de la serie YOLO. Su arquitectura se divide en tres componentes principales: una red troncal, una red de fusión de características y una cabecera de detección. La red troncal utiliza una estructura CSPDarknet mejorada. La red de fusión de características incorpora conexiones locales entre etapas y convoluciones separables por profundidad, inspirándose en redes piramidales de características y redes de agregación de rutas para fusionar eficazmente características de múltiples escalas.

Módulo de mejora de características
El módulo de mejora de características tiene como objetivo aumentar la sensibilidad del modelo ante características clave de seguridad. Procesa los mapas de características generados por cada capa de la red troncal YOLOv11, fusionando información a diferentes escalas mediante operaciones de sobremuestreo y submuestreo. Específicamente, la rama multiescala captura la diversidad espacial de escala, mientras que la rama de atención mejora dinámicamente los canales clave y las respuestas posicionales. Estas dos ramas no actúan de forma independiente, sino que son complementarias y se fusionan mediante conexiones residuales y recalibración de características. El mapa de características procesado por el módulo de mejora en cada escala se ajusta para que coincida con el número de canales del mapa de características original mediante una convolución 1 × 1, y luego se fusiona con el mapa de características original de YOLOv11 mediante suma elemento a elemento. El mapa de características fusionado se introduce posteriormente en la Red de Pirámide de Características (FPN) para la fusión multiescala, formando así una representación jerárquica de características de seguridad. Para garantizar una integración perfecta entre los módulos, se adopta una estrategia de entrenamiento conjunto de extremo a extremo, cuya función de pérdida combina la pérdida de detección de YOLOv11 y la pérdida de mejora de características del módulo CNN.

Diagrama de red neuronal convolucional; incluye módulos Conv, ELAN y SPPF para el proceso de detección de imágenes.
Figura 1. Algoritmo YOLOv11-CNN. El módulo de mejora de características tiene como objetivo amplificar la sensibilidad del modelo ante características críticas de seguridad. Procesa mapas de características provenientes de distintas capas del armazón de YOLOv11, fusionando características de diferentes escalas mediante operaciones de sobre-muestreo y sub-muestreo. Además, incorpora mecanismos de atención espacial y por canales. Para garantizar una integración perfecta entre los módulos YOLOv11 y CNN, se emplea una estrategia de entrenamiento conjunto. Durante el entrenamiento, los parámetros de ambos módulos se optimizan de extremo a extremo. La función de pérdida combina la pérdida de detección de YOLOv11 con la pérdida de mejora de características del módulo CNN. Haga clic aquí para ver una versión más grande de esta figura.

Resultados

Para verificar la eficacia del modelo propuesto de fusión YOLOv11 y CNN en la supervisión de seguridad en líneas de producción, se construyó un conjunto de datos que abarca diversos escenarios de riesgos de seguridad. Este conjunto contiene 12 000 imágenes de escenas de líneas de producción, divididas en conjuntos de entrenamiento, validación y prueba en una proporción de 7:1,5:1,5, con una semilla aleatoria fija de 42. Cubre diversas condiciones de trabajo, incluyendo iluminación estándar, baja iluminación, oclusión parcial, oclusión severa, desenfoque por movimiento y fondos complejos. El umbral de confianza para la inferencia se estableció en 0,5 y el umbral de supresión no máxima (NMS) en 0,45. Todos los experimentos se repitieron tres veces, y los resultados se presentan como media ± desviación estándar. Las categorías de anotación son trabajadores, cascos de seguridad, brazos robóticos, zonas peligrosas, herramientas y vehículos, utilizando el formato PASCAL Visual Object Classes (VOC). El umbral de intersección sobre unión (IoU) se establece en 0,5, y la consistencia de las anotaciones se verifica mediante validación cruzada entre dos personas. Las imágenes de entrada se redimensionaron uniformemente a 640 × 640 y se aumentaron con datos Mosaic. El entrenamiento se realizó utilizando el optimizador SGD con una tasa de aprendizaje inicial de 0,01, momento de 0,9, decaimiento del peso de 0,0005 y un tamaño de lote de 32. El entrenamiento se ejecutó durante 200 épocas, y se utilizó recocido coseno para ajustar la tasa de aprendizaje.

Para evaluar minuciosamente la eficacia del modelo, se utilizaron diversas métricas de evaluación: precisión media promedio (mAP), cuadros por segundo (FPS) para medir la velocidad de procesamiento de los cuadros de imagen, precisión para evaluar la exactitud de las predicciones positivas, recuperación para medir la capacidad del modelo para detectar verdaderos positivos, y área bajo la curva (AUC) para indicar el área bajo la curva de característica operativa del receptor (ROC), reflejando así la capacidad general de clasificación del modelo. Las fórmulas de cálculo se muestran en las Ecuaciones (4), (5), (6), (7), (8), (9), (10), (11):

fórmula de cálculo de mAP, mAP@0.5=1/NΣ(Ni=1)APi, métrica, precisión, análisis de datos.  (4)
fórmula de cálculo de precisión media (mAP); ecuación Σ para análisis de evaluación de datos.  (5)
fórmula de precisión, TP/(TP+FP), ecuación para análisis de resultados de aprendizaje automático, métrica concisa.  (6)
Recuperación fórmula de precisión, TP/(TP+FN), ecuación, análisis estadístico, evaluación de aprendizaje automático. (7)
ecuación de equilibrio estático FPS=F/T que muestra el cálculo de fuerza por tiempo en física.  (8)
fórmula de tasa de verdaderos positivos, TPR=TP/(TP+FN), ecuación de análisis estadístico.  (9)
fórmula de tasa de falsos positivos, FPR=FP/(FP+TN), análisis estadístico, uso educativo.  (10)
fórmula de AUC AUC=∫₀¹TPR(x)dx; diagrama matemático para interpretación de análisis de datos.  (11)

Métricas de precisión-recuperación; mAP@0.5, mAP@[0.5:0.95], VP, FP, FN, precisión, recuperación; análisis de datos.  Aquí, mAP@0.5 indica la precisión media promedio a un umbral de IoU de 0.5; N es el número de categorías; APi es la precisión promedio de la categoría i-ésima; y mAP@[0.5:0.95] es el mAP promedio calculado a través de umbrales de IoU desde 0.5 hasta 0.95. TP, FP, FN y TN representan los números de verdaderos positivos, falsos positivos, falsos negativos y verdaderos negativos, respectivamente. F es el número total de fotogramas procesados, T es el tiempo total de procesamiento, TPR es la tasa de verdaderos positivos y FPR es la tasa de falsos positivos.
Para el componente de detección YOLOv11, la función de pérdida se muestra en la Ecuación (12):

Fórmula de la función de pérdida: \( \text{LOSS} = \lambda_{\text{coord}} \cdot L_{\text{coord}} + \lambda_{\text{conf}} \cdot L_{\text{conf}} + \lambda_{\text{class}} \cdot L_{\text{class}} \).     (12)

Diagrama de la ecuación de equilibrio estático: L_coord, L_conf, L_class; λ_coord, λ_conf, λ_class.  Donde Lcoord denota la desviación entre el marco predicho y el marco real, Lconf mide el error de confianza del marco predicho, Lclass mide el error de predicción de categoría, y λcoord, λconf y λclass son los coeficientes de peso utilizados para equilibrar las pérdidas correspondientes.

El análisis de los datos en la Tabla 1 muestra que el método propuesto alcanza un mAP@0.5 de 0,91 y un mAP@0.5:0.95 de 0,82, lo que representa mejoras de 0,04 y 0,04, respectivamente, en comparación con YOLOv5. Su puntuación F1 es de 0,935, que también es más alta que la de los modelos de comparación. La velocidad de detección es de 120 FPS, cuatro veces mayor que la de Faster R-CNN, aunque ligeramente inferior a la de YOLOv10 y YOLOv11. El número de parámetros es de 6,7 M, solo 1,5 M más que YOLOv11, con una mejora de 0,03 en el mAP@0.5. En comparación con EfficientDet, que tiene un costo computacional similar, la precisión es 0,06 mayor, mientras que el número de parámetros es un 56 % menor. Los datos demuestran que la fusión multiescala y el mecanismo de atención introducidos mejoran eficazmente la precisión en la detección de objetivos pequeños, logrando un buen equilibrio entre velocidad y precisión. En resumen, nuestro método propuesto alcanza un equilibrio entre precisión y velocidad de detección. El mAP@0.5 es 0,02 más alto que el del segundo mejor modelo, la puntuación F1 alcanza 0,935 y los 6,7 M de parámetros son suficientes para su implementación práctica. El mecanismo de fusión multiescala y atención mejora el reconocimiento de objetivos pequeños y ocluidos en escenas complejas. El modelo equilibra precisión y eficiencia, lo que lo hace adecuado para escenarios en tiempo real, como la supervisión de seguridad industrial. Cabe destacar que todos los modelos de comparación utilizan pesos preentrenados oficiales, con una resolución de entrada uniforme de 640 × 640, umbral de NMS de 0,45 y umbral de confianza de 0,5.

MétodomAP@0.5mAP@0.5:0.95Puntuación F1FPSParámetros (M)
YOLOv50.870.780.891307.1
EfficientDet0.850.730.885015.3
RetinaNet0.820.680.854537.6
Faster R-CNN0.840.70.873045.2
YOLOv100.890.770.881355.3
YOLOv110.880.750.8951405.2
NUESTRO0.910.820.9351206.7

Tabla 1: Tabla comparativa exhaustiva del rendimiento de los modelos. El análisis de los datos muestra que el método propuesto alcanza un mAP@0.5 de 0.91 y un mAP@0.5:0.95 de 0.82, lo que representa mejoras de 0.04 y 0.04, respectivamente, frente a YOLOv5. Su puntuación F1 es de 0.935, también superior a la de los modelos comparados. La velocidad de detección es de 120 FPS, cuatro veces más que Faster R-CNN, aunque ligeramente inferior a YOLOv10 y YOLOv11. El número de parámetros es de 6,7 M, solo 1,5 M más que YOLOv11, con una mejora de 0,03 en mAP@0.5. En comparación con EfficientDet, que tiene un costo computacional similar, la precisión es 0,06 mayor, mientras que el número de parámetros es un 56 % menor. Los datos demuestran que la fusión multiescala y el mecanismo de atención introducidos mejoran eficazmente la precisión en la detección de objetivos pequeños, logrando un buen equilibrio entre velocidad y precisión. En resumen, nuestro método propuesto alcanza un equilibrio entre precisión y velocidad de detección. El mAP@0.5 es 0,02 más alto que el del segundo mejor modelo, la puntuación F1 alcanza 0,935, y los 6,7 M de parámetros son suficientes para su implementación práctica. La fusión multiescala y el mecanismo de atención mejoran el reconocimiento de objetivos pequeños y parcialmente ocultos en escenas complejas. El modelo equilibra precisión y eficiencia, lo que lo hace adecuado para escenarios en tiempo real como el monitoreo de seguridad industrial. Cabe señalar que todos los modelos comparativos utilizan pesos preentrenados oficiales, con una resolución de entrada uniforme de 640 × 640, un umbral uniforme de NMS de 0,45 y un umbral de confianza uniforme de 0,5.

Figura 2 proporciona un análisis detallado de los tipos de detecciones falsas del modelo. YOLOv11 + CNN presenta la tasa más baja de detecciones falsas de fondo (85 veces/10.000 fotogramas), con la mayoría de las detecciones erróneas ocurriendo en objetos similares (62 veces) y escenas parcialmente ocluidas (48 veces). El análisis de la curva ROC indica que la TPR del modelo alcanzó 0,9 (AUC = 0,98) con una FPR de 0,1, y el espaciado más estrecho entre las curvas respalda la alta fiabilidad de la confianza en la detección. Estos resultados del análisis no solo respaldan el rendimiento del modelo, sino que también proporcionan una hoja de ruta técnica clara para la optimización posterior de las detecciones falsas, particularmente mediante el fortalecimiento de su capacidad para distinguir objetos similares.

Curva ROC y gráfico de barras que comparan modelos de detección de objetos: AUC, análisis de falsas alarmas por tipo.
Figura 2. Análisis de errores. Análisis de los tipos de detecciones falsas del modelo. YOLOv11 + CNN presenta la tasa más baja de detecciones falsas de fondo (85 veces/10.000 fotogramas), con la mayoría de las detecciones falsas concentradas en objetos similares (62 veces) y escenas parcialmente ocluidas (48 veces). El análisis de la curva ROC indica que la tasa de verdaderos positivos (TPR) del modelo alcanzó 0,9 (AUC = 0,98) con una tasa de falsos positivos (FPR) de 0,1, y el espaciado más estrecho entre las curvas respalda la fiabilidad de la confianza en la detección. Estos resultados del análisis no solo respaldan el rendimiento del modelo, sino que también proporcionan una hoja de ruta técnica clara para la optimización posterior de las falsas detecciones, particularmente mediante el fortalecimiento de su capacidad para distinguir objetos similares. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3 compara el rendimiento del modelo en diversas plataformas de hardware. YOLOv11 + CNN alcanza una latencia ultra baja de 18 ms en la unidad de procesamiento tensorial de borde (TPU), con una fluctuación de solo ±2 ms, y el consumo de energía se mantiene en 15 W. Las pruebas de rendimiento demuestran que el modelo alcanza una velocidad de procesamiento de 70 FPS en dispositivos de computación de borde Jetson Xavier, con la latencia del percentil 99 controlada dentro de los 50 ms. Estos indicadores de rendimiento en la implementación permiten que se adapte a las necesidades de despliegue en diversas plataformas de computación en entornos industriales. El análisis de errores muestra además que el modelo puede mantener un rendimiento estable en entornos con recursos limitados, demostrando su aplicabilidad en ingeniería.

Gráficos de comparación de rendimiento y latencia para modelos YOLO en diferentes dispositivos; análisis del rendimiento de los dispositivos.
Figura 3. Rendimiento en la implementación. Comparación del rendimiento del modelo en diversas plataformas de hardware. YOLOv11 + CNN alcanza una latencia ultra baja de 18 ms en el Edge TPU (con una fluctuación de solo ±2 ms), y el consumo de energía se mantiene en 15 W. Las pruebas de rendimiento muestran que el modelo alcanza una velocidad de procesamiento de 70 FPS en dispositivos de computación periférica Jetson Xavier, con la latencia del percentil 99 controlada dentro de los 50 ms. Estos indicadores de rendimiento en la implementación indican que el modelo puede adaptarse a las necesidades de despliegue en diversas plataformas de cómputo en entornos industriales. El análisis de errores muestra además que el modelo puede mantener un rendimiento estable en entornos con recursos limitados, demostrando así su aplicabilidad en ingeniería. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 4 compara las diferencias en el rendimiento de detección de cada modelo en seis categorías objetivo. YOLOv11 + CNN alcanzó una precisión de 0,96 en la tarea de reconocimiento del casco de seguridad, superando al modelo de referencia en 4 puntos porcentuales. El gráfico de puntos indica que el modelo presenta fluctuaciones mínimas en el rendimiento entre categorías (±0,05), lo que refleja sus capacidades de generalización. La matriz de confusión, presentada como un mapa de calor, revela una detección falsa mutua del 15 % entre el área peligrosa y el brazo robótico. Este hallazgo proporciona una dirección clara para la optimización posterior del modelo.

Matriz de confusión y gráfico de rendimiento por categorías; análisis de precisión, recuperación y puntuación F1, modelo de seguridad.
Figura 4. Análisis de detección por categorías. Comparación de las diferencias en el rendimiento de detección de cada modelo en seis categorías objetivo. YOLOv11 + CNN alcanzó una precisión de 0,96 en la tarea de reconocimiento de cascos de seguridad, superando al modelo de referencia en 4 puntos porcentuales. El gráfico de puntos discontinuos indica que el modelo presenta fluctuaciones mínimas en el rendimiento entre categorías (±0,05), lo que refleja sus capacidades de generalización. La matriz de confusión, presentada como un mapa de calor, revela una detección falsa mutua del 15 % entre el área peligrosa y el brazo robótico. Este hallazgo proporciona una orientación clara para la optimización posterior del modelo. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 5 proporciona un registro completo del proceso de entrenamiento para cada modelo. YOLOv11 + CNN presenta la tasa de convergencia más rápida, con una pérdida que disminuye a 0,1 dentro de las primeras 30 épocas, y la diferencia entre su curva de mAP en el conjunto de validación y el conjunto de entrenamiento es consistentemente menor al 1 %. El análisis del gráfico de banda de error muestra que el mAP@0,5 final del modelo en validación es estable en 0,94 ± 0,01, y su rango de fluctuación de rendimiento es solo un tercio del de RetinaNet. Estos resultados respaldan la eficacia del protocolo de entrenamiento conjunto. El modelo muestra ventajas de rendimiento en las etapas iniciales del entrenamiento, lo que indica que su diseño arquitectónico le permite aprender características rápidamente.

Gráfico de caja y gráfico de violín que comparan el mAP de validación y la pérdida de entrenamiento de modelos de aprendizaje automático.
Figura 5. Análisis del proceso de entrenamiento. Registro del proceso de entrenamiento para cada modelo. YOLOv11 + CNN presenta la tasa de convergencia más rápida (la pérdida disminuye a 0,1 dentro de 30 épocas), y la diferencia entre su curva de mAP del conjunto de validación y el conjunto de entrenamiento siempre es menor al 1 %. El análisis del gráfico de banda de error muestra que el mAP@0,5 final de validación del modelo es estable en 0,94 ± 0,01, y el rango de fluctuación del rendimiento es solo un tercio del de RetinaNet. Estos resultados respaldan la eficacia del protocolo de entrenamiento conjunto. El modelo muestra ventajas de rendimiento en las etapas iniciales del entrenamiento, lo que indica que su diseño arquitectónico le permite aprender características rápidamente. Haga clic aquí para ver una versión más grande de esta figura.

Tabla 2 presenta los resultados cuantitativos de rendimiento para diferentes modelos de detección en entornos complejos. Los datos de prueba en condiciones estándar de iluminación y diversos escenarios extremos muestran que YOLOv11 + CNN mantiene un rendimiento óptimo bajo todas las condiciones. En condiciones estándar de iluminación, el mAP@0.5 de este modelo alcanzó 0.91, significativamente mejor que YOLOv5 (0.87) y Faster R-CNN (0.84). A medida que las condiciones ambientales empeoran, el rendimiento de cada modelo disminuye en distintos grados, pero YOLOv11 + CNN muestra la mayor robustez ambiental: en condiciones de poca luz (< 50 lux), su rendimiento solo disminuye un 3% (hasta 0.88), lo cual es mejor que la reducción del 5% observada en los modelos comparativos; en escenarios con alta oclusión (> 50%), su mAP aún puede mantenerse en 0.78, y la degradación del rendimiento (13%) es significativamente menor que la de YOLOv5 (15%) y Faster R-CNN (16%). Estos resultados demuestran que YOLOv11 + CNN mejora la adaptabilidad del modelo ante factores complejos, como cambios en la iluminación y oclusiones, mediante mecanismos mejorados de fusión de características y atención, apoyando así aplicaciones prácticas en escenarios industriales.

Condición de pruebaYOLOv11 + CNNYOLOv5Faster R-CNNFluctuación del rendimiento
Iluminación estándar0.910.870.840.01
Baja luminosidad (< 50 lux)0.88 (-3%)0.82 (-5%)0.79 (-5%)0.02
Oclusión parcial (30%–50%)0.85 (-6%)0.80 (-7%)0.76 (-8%)0.03
Oclusión severa (> 50%)0.78 (-13%)0.72 (-15%)0.68 (-16%)0.04
Desenfoque por movimiento0.83 (-8%)0.77 (-10%)0.73 (-11%)0.05

Tabla 2: Tabla de análisis cuantitativo de adaptabilidad ambiental. Rendimiento de diferentes modelos de detección en entornos complejos mediante análisis cuantitativo. Los datos de prueba, desde condiciones de iluminación estándar hasta diversos escenarios extremos, muestran que YOLOv11 + CNN mantiene el rendimiento más alto en todas las condiciones de prueba. Bajo condiciones de iluminación estándar, el mAP@0.5 de este modelo alcanzó 0.91, significativamente mejor que YOLOv5 (0.87) y Faster R-CNN (0.84). Con el deterioro de las condiciones ambientales, el rendimiento de cada modelo disminuye en distintos grados, pero YOLOv11 + CNN muestra la mayor robustez ambiental entre los modelos evaluados: en condiciones de poca luz (< 50 lux), su rendimiento solo disminuye un 3% (hasta 0.88), lo cual es mejor que la reducción del 5% del modelo comparativo; en escenarios con alta occlusión (> 50%), su mAP aún puede mantenerse en 0.78, y la degradación del rendimiento (13%) es significativamente menor que la de YOLOv5 (15%) y Faster R-CNN (16%). Estos resultados demuestran que YOLOv11 + CNN mejora la adaptabilidad del modelo a factores complejos, como cambios en la iluminación e interferencias por occlusión, mediante un mecanismo de fusión de características y un diseño de atención mejorados, lo que respalda su aplicación práctica en escenarios industriales.

Tabla 3 muestra que se utilizó el optimizador SGD en este experimento, con un momento de 0,9 para acelerar la convergencia y suprimir las oscilaciones. Se empleó una tasa de aprendizaje inicial de 0,01 con recocido cosenoidal, que disminuyó gradualmente durante el entrenamiento para perfeccionar la optimización. Se introdujo una reducción del peso de 0,0005 para aplicar regularización L2 y reducir el sobreajuste. Un tamaño de lote de 32 equilibró la eficiencia computacional con la estabilidad de la estimación del gradiente. Las 200 épocas de entrenamiento garantizaron una convergencia suficiente. Los parámetros se adaptaron a la tarea de detección de una sola etapa, equilibrando la velocidad y precisión del entrenamiento.

ParámetroValor
OptimizadorSGD
Tasa de aprendizaje inicial0.01
Momento0.9
Decaimiento del peso0.0005
Tamaño del lote32
Épocas de entrenamiento200
Programación de la tasa de aprendizajeRecocido cosenoidal

Tabla 3: Tabla de hiperparámetros de entrenamiento. Se utilizó el optimizador SGD en este experimento, con un momento de 0,9 para acelerar la convergencia y suprimir las oscilaciones. Se empleó una tasa de aprendizaje inicial de 0,01 con recocido coseno, que disminuyó gradualmente durante el entrenamiento para perfeccionar la optimización. Se introdujo una reducción del peso de 0,0005 para aplicar regularización L2 y reducir el sobreajuste. Un tamaño de lote de 32 equilibró la eficiencia computacional con la estabilidad de la estimación del gradiente. Las 200 épocas de entrenamiento garantizaron una convergencia suficiente. Los parámetros se adaptaron a la tarea de detección de una sola etapa, equilibrando la velocidad y precisión del entrenamiento.

Tabla 4 muestra que, utilizando YOLOv11 como referencia, el mAP@0.5 es 0,89. La introducción de la fusión multi-escala por sí sola reduce la precisión a 0,88. Al añadir secuencialmente la atención de canal y la atención espacial, la precisión mejora a 0,90 y 0,89, respectivamente. La precisión combinada de todos los módulos alcanza 0,91, lo que representa una mejora de 0,02 respecto a la referencia. Los datos indican que la atención de canal mejora directamente la precisión, y el rendimiento combinado de la multi-escala y la atención es óptimo.

ConfiguraciónmAP@0.5
YOLOv11 (línea base)0.89
+ Fusión multi-escala0.88
+ Multi-escala + atención de canal0.9
+ Multi-escala + atención espacial0.89
Módulo completo (YOLOv11 + CNN)0.91

Tabla 4: Tabla de prueba de ablación. Utilizando YOLOv11 como referencia, el mAP@0.5 es 0,89. Introducir únicamente la fusión multi-escala reduce la precisión a 0,88. Añadir atención de canal o atención espacial después de la fusión multi-escala mejora la precisión a 0,90 y 0,89, respectivamente. La precisión combinada de todos los módulos alcanza 0,91, un incremento de 0,02 respecto a la referencia. Los datos muestran que la atención de canal produce mayores mejoras que la atención espacial en este contexto, y que el rendimiento combinado de la fusión multi-escala y la atención es óptimo.

Figura 6 evalúa sistemáticamente el rendimiento del modelo en entornos extremos. El mAP de YOLOv11 + CNN disminuyó solo un 6 % (hasta 0,88) en condiciones de poca luz y aún mantuvo un mAP de 0,78 (8 % por encima del valor de referencia) en escenas altamente ocluidas. Estos resultados demuestran que el modelo exhibe adaptabilidad ambiental, abordando eficazmente los cambios comunes de iluminación y los problemas de oclusión parcial en la producción industrial, lo que favorece el funcionamiento estable del sistema de detección.

Gráficos de rendimiento del modelo de detección de objetos; análisis del impacto de la iluminación y la oclusión; métricas mAP@0.5.
Figura 6. Adaptabilidad ambiental. Una evaluación sistemática del rendimiento del modelo en entornos extremos. La mAP de YOLOv11 + CNN disminuyó solo un 6 % (hasta 0,88) en condiciones de poca luz, y aún mantuvo una mAP de 0,78 (8 % por encima del valor de referencia) en escenas con oclusión severa. Estos resultados demuestran que el modelo exhibe adaptabilidad ambiental, abordando eficazmente los cambios comunes en la iluminación y los problemas de oclusión parcial en la producción industrial, lo que permite el funcionamiento estable del sistema de detección. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7 compara las diferencias en la distribución de características entre YOLOv11 y YOLOv11 + CNN en seis tipos de objetivos industriales mediante la reducción de dimensionalidad t-SNE. La figura izquierda muestra que las características del modelo básico YOLOv11 presentan una dispersión intraclase significativa (distancia intraclase 2,34 ± 0,15), particularmente en la "Zona de Peligro" (rojo) y el "Vehículo" (púrpura), donde existe una superposición considerable, lo cual es consistente con la tasa de detección falsa del 15 % en el grupo experimental 3. La figura derecha muestra que el modelo mejorado YOLOv11 + CNN mejora significativamente la compacidad intraclase mediante el módulo de realce de características, aumentando la distancia promedio entre los centros de agrupamiento dentro de cada categoría en 1,8 veces.

Gráfico de agrupamiento de características de YOLOv11 frente a YOLOv11+CNN, análisis de distancia intraclase, visualización de datos.
Figura 7. Comparación de la distribución de características mediante t-SNE. Una comparación de las diferencias en la distribución de características entre YOLOv11 y YOLOv11 + CNN en seis tipos de objetivos industriales mediante la reducción de dimensionalidad t-SNE. La figura izquierda muestra que las características del modelo básico YOLOv11 presentan una dispersión intraclase significativa (distancia intraclase 2,34 ± 0,15), particularmente en la "Zona de Peligro" (rojo) y "Vehículo" (púrpura), donde existe una superposición considerable, lo cual es consistente con la tasa de detección errónea del 15 % en el grupo experimental 3. La figura derecha muestra que el modelo mejorado YOLOv11 + CNN mejora significativamente la compacidad intraclase mediante el módulo de realce de características, y la distancia promedio entre los centros de los grupos se incrementa en 1,8 veces. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8 verifica la contribución de cada módulo mediante experimentos sistemáticos de ablación. Los resultados de ablación muestran que agregar atención de canal después de la fusión multi-escala aumenta el mAP@0.5 a 0,90, mientras que agregar atención espacial aumenta el mAP@0.5 a 0,89. El módulo completo alcanza el mAP@0.5 más alto de 0,91. La visualización mediante mapa de calor muestra que el mecanismo de atención compuesta puede mejorar simultáneamente la respuesta de detección en el centro del área peligrosa (valor de activación: +0,15) y en objetivos pequeños ubicados en el borde (+0,08). Los datos experimentales demuestran que la fusión de características multi-escala y los mecanismos de atención tienen un efecto acumulativo, permitiendo que el modelo cumpla con los requisitos de detección de objetivos a diferentes escalas.

Gráfico del estudio de ablación de la mejora de características en los marcos YOLO con mapas de atención; análisis de rendimiento.
Figura 8. Experimento modular de ablación. Verificación de la contribución de cada módulo mediante experimentos sistemáticos de ablación. Los resultados de ablación muestran que agregar atención de canal después de la fusión multi-escala aumenta el mAP@0.5 a 0,90, mientras que agregar atención espacial aumenta el mAP@0.5 a 0,89. El módulo completo alcanza el mAP@0.5 más alto de 0,91. La visualización mediante mapa de calor muestra que el mecanismo de atención compuesta puede realzar simultáneamente la respuesta de detección en el centro de la zona peligrosa (valor de activación: +0,15) y en objetivos pequeños en el borde (+0,08). Los datos experimentales demuestran que la fusión de características multi-escala y los mecanismos de atención tienen un efecto acumulativo, permitiendo que el modelo cumpla con los requisitos de detección de objetivos en diferentes escalas. Haga clic aquí para ver una versión más grande de esta figura.

DISPONIBILIDAD DE LOS DATOS:
Las imágenes y flujos de video completos y en bruto de la línea de producción están sujetos a restricciones de confidencialidad industrial y no se publican públicamente. Una Descripción del Conjunto de Datos Suplementario (Archivo Suplementario 1) proporciona detalles sobre la adquisición de datos, distribuciones de categorías y escenarios, especificaciones de anotación, procedimientos de control de calidad, divisiones de los datos, preprocesamiento y procedimientos de aumento de datos. Un Pseudocódigo y Marco para la Reproducibilidad (Archivo Suplementario 2) ofrece un flujo de trabajo a nivel de pseudocódigo, descripciones de configuraciones y orientaciones para la reproducción. Un subconjunto anonimizado y materiales de apoyo adicionales pueden solicitarse al autor correspondiente para investigación académica sin fines comerciales, sujeto a restricciones institucionales y de confidencialidad.

Archivo complementario 1. Descripción del conjunto de datos complementario. Este archivo describe el protocolo de adquisición del conjunto de datos, la cobertura de escenarios, la distribución de clases, las especificaciones de anotación, los procedimientos de control de calidad, la partición entre entrenamiento/validación/prueba, el preprocesamiento y los procedimientos de aumento de datos. Haga clic aquí para descargar este archivo.

Archivo complementario 2. Pseudocódigo y marco de reproducibilidad. Este archivo proporciona detalles a nivel de pseudocódigo sobre el flujo de trabajo y la configuración para el preprocesamiento, entrenamiento, evaluación e implementación, y describe las restricciones sobre las grabaciones industriales en bruto y el acceso a los materiales de apoyo. Haga clic aquí para descargar este archivo.

Discusión

Los resultados experimentales muestran que el modelo de fusión propuesto YOLOv11–CNN mejora la precisión de detección y el rendimiento en tiempo real para la supervisión de seguridad en líneas de producción. Aprovechando la detección eficiente en una sola etapa de YOLOv11 y la mejora de características del módulo CNN, el sistema identificó trabajadores, equipos y zonas peligrosas bajo condiciones complejas de iluminación y oclusión. La fusión de características multi-escala y los mecanismos de atención mejoraron la capacidad de enfocarse en elementos clave de seguridad, proporcionando evidencia visual interpretable para alertas tempranas.

El sistema tiene valor práctico para líneas de producción en entornos como la fabricación de automóviles y el ensamblaje electrónico, donde la supervisión en tiempo real puede reducir la dependencia de la inspección manual y acortar los tiempos de respuesta ante posibles riesgos de seguridad. Para objetivos pequeños, como tornillos y herramientas, y para objetivos de trabajadores parcialmente ocultos por brazos robóticos u otro equipo, la fusión de características multiescala y los mecanismos de atención mejoran la capacidad del modelo para extraer y resaltar características relacionadas con la seguridad. Estas mejoras son relevantes en entornos de producción en los que los objetivos varían en tamaño y visibilidad.

Sin embargo, este estudio aún tiene limitaciones evidentes. Bajo oclusión severa o iluminación muy baja, el rendimiento del modelo puede disminuir porque la información de las características del objetivo se vuelve incompleta, y las características convolucionales existentes pueden ser insuficientes. El nuevo módulo de realce de características CNN añade 1,5 millones de parámetros adicionales, lo que podría aumentar la carga computacional en dispositivos periféricos de bajo costo y limitar la implementación en entornos con recursos restringidos. Este estudio utiliza datos de imágenes en luz visible y no integra información de sensores multimodales, como imágenes térmicas infrarrojas o radar de ondas milimétricas; por lo tanto, el rendimiento podría verse limitado en escenas industriales extremas, como en completa oscuridad o en presencia de humo.

La investigación futura se centrará en las siguientes direcciones: ligereza del modelo basada en poda estructurada y destilación del conocimiento para reducir la carga de parámetros manteniendo el rendimiento de detección; construcción de un marco de detección por fusión multimodal visible-infrarrojo para mejorar la capacidad de detección en entornos con iluminación extrema y humo; introducción de un módulo Transformer ligero para reemplazar parte de las capas convolucionales y potenciar la extracción de características contextuales a larga distancia; y desarrollo de un subsistema de reconocimiento de comportamientos anómalos de extremo a extremo para apoyar todo el flujo de trabajo, desde la detección de objetivos hasta la alerta temprana de comportamientos.

En conclusión, este estudio se centra en un sistema de monitoreo de seguridad en líneas de producción que combina los algoritmos YOLOv11 y CNN para permitir la detección en tiempo real y la alerta temprana de posibles riesgos de seguridad en entornos industriales complejos. Mediante verificación experimental, el modelo de fusión mostró ventajas de rendimiento en precisión de detección de objetos y velocidad de inferencia. Gracias a su arquitectura eficiente de detección en una sola etapa y a la extracción de características optimizada, YOLOv11 tuvo un buen desempeño al identificar rápidamente trabajadores, equipos y zonas peligrosas, y capturó con precisión los elementos clave de seguridad en escenarios de líneas de producción. Al mismo tiempo, la introducción del módulo CNN mejorado potenció aún más la captura de características y la detección de objetivos ocluidos. En el monitoreo de seguridad de líneas de producción, el modelo se enfoca automáticamente en las áreas clave de seguridad en la imagen mediante análisis visual, proporcionando una base interpretable para las alertas de seguridad. El modelo de fusión demostró una fuerte adaptabilidad y estabilidad en diversos escenarios de líneas de producción, incluyendo mecanizado, ensamblaje y almacenamiento. El trabajo principal de este artículo es el siguiente:

(1) Se diseñó una arquitectura de fusión profunda de YOLOv11 y CNN para equilibrar la velocidad y precisión de detección.
(2) Se implementó un mecanismo de fusión de características multiescala y optimización de atención para mejorar la capacidad de enfocarse en elementos clave de seguridad en escenarios complejos.
(3) Los experimentos en el conjunto de datos de seguridad de línea de producción construido internamente mostraron que el modelo alcanzó un mAP@0.5 de 0.91 y una velocidad de detección de 120 FPS. En pruebas cruzadas de escenarios, el modelo mostró un rendimiento estable.

Los estudios de casos típicos mostraron que, bajo condiciones estándar de iluminación, un casco de seguridad con solo un 40 % de exposición fue detectado con precisión mediante la fusión multiescala y la atención de canal (confianza 0,93), mientras que el modelo de referencia lo identificó erróneamente como fondo. En escenarios con poca luz, cuando un trabajador ingresó a una zona peligrosa, la atención espacial delimitó correctamente el objetivo con líneas direccionales, mientras que el método comparativo no logró detectarlo. Los errores incluyeron una llave inglesa que fue detectada erróneamente como una herramienta debido a la similitud de textura con el fondo bajo oclusión severa, y un casco de seguridad que no fue detectado debido a una baja relación señal-ruido a distancia en condiciones de poca luz, lo que revela limitaciones en la representación de características bajo condiciones extremas. Estos resultados indican que el modelo es robusto en escenarios normales y moderadamente complejos, pero aún necesita mejoras en condiciones extremas.

Divulgaciones

Los autores no tienen conflictos de intereses que declarar.

Agradecimientos

Este trabajo fue patrocinado en parte por la Fundación Científica de la Universidad de Taizhou para Talentos Avanzados «Investigación sobre tecnologías clave de detección de precisión para la fabricación inteligente» (TZXY2020QDJJ006).

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
COCO API   N/AHerramienta de evaluación utilizada para la evaluación de la precisión en la detección de objetivos y análisis estadístico.
CUDA 11.4NVIDIAN/APlataforma de computación paralela utilizada junto con el entorno PyTorch 1.12.
Edge TPU   N/APlataforma de implementación utilizada para pruebas de latencia y consumo de energía; la latencia reportada fue de 18 ms y el consumo de energía fue de 15 W.
Dispositivo de computación en el borde Jetson XavierNVIDIA   Dispositivo de computación en el borde utilizado para pruebas de rendimiento; la velocidad de procesamiento reportada fue de 70 FPS con latencia del percentil 99 dentro de los 50 ms.
GPU NVIDIA Tesla V100NVIDIA   GPU utilizada en el servidor de entrenamiento/evaluación.
PyTorch 1.12   N/AEntorno de aprendizaje profundo utilizado para el entrenamiento y evaluación del modelo.
scikit-learn    N/AHerramienta de evaluación y análisis estadístico utilizada para la evaluación del modelo.
Conjunto de datos de seguridad en línea de producción construido internamenteN/AN/AConjunto de datos de 12 000 imágenes de escenas de líneas de producción en formato VOC, que incluye condiciones de iluminación estándar, baja iluminación, oclusión parcial, oclusión severa, desenfoque por movimiento y fondos complejos; seis categorías de anotación: trabajadores, cascos de seguridad, brazos robóticos, zonas peligrosas, herramientas y vehículos.
Servidor de entrenamiento       Servidor equipado con una GPU NVIDIA Tesla V100 y sistema operativo Ubuntu 20.04.
Sistema operativo Ubuntu 20.04     N/ASistema operativo utilizado en el servidor de entrenamiento/evaluación.
Formato de anotación VOCN/AN/AFormato de anotación utilizado para el conjunto de datos de seguridad en línea de producción construido internamente.
Modelo de detección de objetos YOLOv11UltralyticsN/AModelo de detección de objetos utilizado para detectar trabajadores, equipos y posibles peligros en tiempo real.

Referencias

  1. Ramadan MNA, Ali MAH, Jaber H, Alkhedher M. Blockchain-secured IoT-federated learning for industrial air pollution monitoring: a mechanistic approach to exposure prediction and environmental safety. Ecotoxicol Environ Saf. 2025;300:118442.
  2. Ahn J, et al. SafeFac: video-based smart safety monitoring for preventing industrial work accidents. Expert Syst Appl. 2023;215:119397.
  3. Natha S, et al. A scalable and generalized deep ensemble model for road anomaly detection in surveillance videos. Comput Mater Contin. 2024;81(3):3707-3729.
  4. Diallo AR, Homri L, Dantan JY. Reducing false alarms in fault detection: a comparative analysis between conformal prediction and classical methods applied to PCA and autoencoders. J Process Control. 2025;152:103495.
  5. Cheng X, Han Y, Zhang W. Development of intelligent monitoring system for soil erosion in pipeline engineering based on deep learning. Comput Electr Eng. 2025;126:110432.
  6. Yan H, et al. A global feature fusion and adaptive optimization method to enhance detection accuracy and computational efficiency based on YOLOv8. Alexandria Eng J. 2025;129:538-552.
  7. Samma H, Al-Azani S, El-Ferik S. UAV-based real-time face detection using YOLOv7. Transp Res Procedia. 2025;84:331-338.
  8. Gong X, Yu J, Zhang H, Dong X. AED-YOLO11: a small object detection model based on YOLO11. Digit Signal Process. 2025;166:105411.
  9. Li R, Xiao K, Lin S, Wu Z. Enhancing aquatic ecosystem monitoring through fish jumping behavior analysis and YOLOv5: applications in freshwater fish identification. J Environ Manage. 2025;391:126413.
  10. Zhang D, Gao Q, Chen Z, Lin Z. Semantic feature refinement of YOLO for human mask detection in dense crowded. J Vis Commun Image Represent. 2025;107:104399.
  11. Choi MJ, Ku DG, Lee SJ. Integrated YOLO and CNN algorithms for evaluating degree of walkway breakage. KSCE J Civ Eng. 2022;26(8):3570-3577.
  12. Li Y, et al. Underwater acoustic intelligent spectrum sensing with multimodal data fusion: an Mul-YOLO approach. Future Gener Comput Syst. 2025;173:107880.
  13. Jiang D, et al. Real-time tracker of chicken for poultry based on attention mechanism-enhanced YOLO-Chicken algorithm. Comput Electron Agric. 2025;237:110640.
  14. Yang X, et al. Automated concrete bridge damage detection using an efficient Vision Transformer-enhanced anchor-free YOLO. Engineering. 2025;51:311-326.
  15. Fuertes D, et al. People detection with omnidirectional cameras using a spatial grid of deep learning foveatic classifiers. Digit Signal Process. 2022;126:103473.
  16. Deepak GD, Bhat SK. Maximizing YOLOv2 efficiency: a study on multiclass detection of indoor objects. Results Eng. 2025;26:105405.
  17. Zhang C, et al. Personnel target detection in infrared environment based on YOLOv3-tinier network and its FPGA implementation. Infrared Phys Technol. 2025;150:106015.
  18. Zhou Y. A YOLO-NL object detector for real-time detection. Expert Syst Appl. 2024;238:122256.
  19. Asadollahpour E, Rahmannejad R, Asghari A, Abdollahipour A. Back analysis of closure parameters of Panet equation and Burger's model of Babolak water tunnel conveyance. Int J Rock Mech Min Sci. 2014;68:159-166.
  20. Anguchamy KK, Palanisamy V. Real-time object detection using improvised YOLOv4 and feature mapping technique for autonomous driving. Expert Syst Appl. 2025;280:127452.
  21. Khan AT, Jensen SM, Khan AR. Advancing precision agriculture: a comparative analysis of YOLOv8 for multi-class weed detection in cotton cultivation. Artif Intell Agric. 2025;15(2):182-191.
  22. Raushan R, Singhal V, Jha RK. Damage detection in concrete structures with multi-feature backgrounds using the YOLO network family. Autom Constr. 2025;170:105887.
  23. Zarboubi M, Bellout A, Chabaa S, Dliou A. CustomBottleneck-VGGNet: advanced tomato leaf disease identification for sustainable agriculture. Comput Electron Agric. 2025;232:110066.
  24. Xie F, et al. Wine variety traceability by data fusion of near-infrared spectroscopy and mid-infrared spectroscopy combined with GAF and ResNet. Chemom Intell Lab Syst. 2025;264:105468.
  25. Huang J, et al. Estimation of the orientation of potatoes and detection bud eye position using potato orientation detection you only look once with fast and accurate features for the movement strategy of intelligent cutting robots. Eng Appl Artif Intell. 2025;142:109923.
  26. Huang Y, et al. Human intrusion detection with distributed fiber optic data based on Squeeze-Excitation and hierarchical connection enhancement network. Opt Fiber Technol. 2025;94:104297.
  27. Qi R, et al. Mechanical fault diagnosis of on-load tap changers using time-frequency vibration analysis and a lightweight YOLO model. Measurement. 2025;256:118441.
  28. Yan J, Wang Z. YOLO V3+VGG16-based automatic operations monitoring and analysis in a manufacturing workshop under Industry 4.0. J Manuf Syst. 2022;63:134-142.
  29. Nazli NANM, et al. A real-time system for detecting personal protective equipment compliance using deep learning model YOLOv5. Procedia Comput Sci. 2024;245:647-656.
  30. Xiao Y, et al. The prediction of kiwi quality attributes based on multi-source data fusion comprehensive analysis model using HSI and FHSI. J Food Compos Anal. 2025;144:107645.

Reimpresiones y permisos

Etiquetas

Monitoreo en Tiempo RealDetecci n mediante Aprendizaje ProfundoYOLOv11Red Neuronal ConvolucionalFusi n de Caracter sticas MultiescalaMecanismo de Atenci nAutomatizaci n Industrial