Para verificar la eficacia del modelo propuesto de fusión YOLOv11 y CNN en la supervisión de seguridad en líneas de producción, se construyó un conjunto de datos que abarca diversos escenarios de riesgos de seguridad. Este conjunto contiene 12 000 imágenes de escenas de líneas de producción, divididas en conjuntos de entrenamiento, validación y prueba en una proporción de 7:1,5:1,5, con una semilla aleatoria fija de 42. Cubre diversas condiciones de trabajo, incluyendo iluminación estándar, baja iluminación, oclusión parcial, oclusión severa, desenfoque por movimiento y fondos complejos. El umbral de confianza para la inferencia se estableció en 0,5 y el umbral de supresión no máxima (NMS) en 0,45. Todos los experimentos se repitieron tres veces, y los resultados se presentan como media ± desviación estándar. Las categorías de anotación son trabajadores, cascos de seguridad, brazos robóticos, zonas peligrosas, herramientas y vehículos, utilizando el formato PASCAL Visual Object Classes (VOC). El umbral de intersección sobre unión (IoU) se establece en 0,5, y la consistencia de las anotaciones se verifica mediante validación cruzada entre dos personas. Las imágenes de entrada se redimensionaron uniformemente a 640 × 640 y se aumentaron con datos Mosaic. El entrenamiento se realizó utilizando el optimizador SGD con una tasa de aprendizaje inicial de 0,01, momento de 0,9, decaimiento del peso de 0,0005 y un tamaño de lote de 32. El entrenamiento se ejecutó durante 200 épocas, y se utilizó recocido coseno para ajustar la tasa de aprendizaje.
Para evaluar minuciosamente la eficacia del modelo, se utilizaron diversas métricas de evaluación: precisión media promedio (mAP), cuadros por segundo (FPS) para medir la velocidad de procesamiento de los cuadros de imagen, precisión para evaluar la exactitud de las predicciones positivas, recuperación para medir la capacidad del modelo para detectar verdaderos positivos, y área bajo la curva (AUC) para indicar el área bajo la curva de característica operativa del receptor (ROC), reflejando así la capacidad general de clasificación del modelo. Las fórmulas de cálculo se muestran en las Ecuaciones (4), (5), (6), (7), (8), (9), (10), (11):
(4)
(5)
(6)
Recuperación
(7)
(8)
(9)
(10)
(11)
Aquí, mAP@0.5 indica la precisión media promedio a un umbral de IoU de 0.5; N es el número de categorías; APi es la precisión promedio de la categoría i-ésima; y mAP@[0.5:0.95] es el mAP promedio calculado a través de umbrales de IoU desde 0.5 hasta 0.95. TP, FP, FN y TN representan los números de verdaderos positivos, falsos positivos, falsos negativos y verdaderos negativos, respectivamente. F es el número total de fotogramas procesados, T es el tiempo total de procesamiento, TPR es la tasa de verdaderos positivos y FPR es la tasa de falsos positivos.
Para el componente de detección YOLOv11, la función de pérdida se muestra en la Ecuación (12):
(12)
Donde Lcoord denota la desviación entre el marco predicho y el marco real, Lconf mide el error de confianza del marco predicho, Lclass mide el error de predicción de categoría, y λcoord, λconf y λclass son los coeficientes de peso utilizados para equilibrar las pérdidas correspondientes.
El análisis de los datos en la Tabla 1 muestra que el método propuesto alcanza un mAP@0.5 de 0,91 y un mAP@0.5:0.95 de 0,82, lo que representa mejoras de 0,04 y 0,04, respectivamente, en comparación con YOLOv5. Su puntuación F1 es de 0,935, que también es más alta que la de los modelos de comparación. La velocidad de detección es de 120 FPS, cuatro veces mayor que la de Faster R-CNN, aunque ligeramente inferior a la de YOLOv10 y YOLOv11. El número de parámetros es de 6,7 M, solo 1,5 M más que YOLOv11, con una mejora de 0,03 en el mAP@0.5. En comparación con EfficientDet, que tiene un costo computacional similar, la precisión es 0,06 mayor, mientras que el número de parámetros es un 56 % menor. Los datos demuestran que la fusión multiescala y el mecanismo de atención introducidos mejoran eficazmente la precisión en la detección de objetivos pequeños, logrando un buen equilibrio entre velocidad y precisión. En resumen, nuestro método propuesto alcanza un equilibrio entre precisión y velocidad de detección. El mAP@0.5 es 0,02 más alto que el del segundo mejor modelo, la puntuación F1 alcanza 0,935 y los 6,7 M de parámetros son suficientes para su implementación práctica. El mecanismo de fusión multiescala y atención mejora el reconocimiento de objetivos pequeños y ocluidos en escenas complejas. El modelo equilibra precisión y eficiencia, lo que lo hace adecuado para escenarios en tiempo real, como la supervisión de seguridad industrial. Cabe destacar que todos los modelos de comparación utilizan pesos preentrenados oficiales, con una resolución de entrada uniforme de 640 × 640, umbral de NMS de 0,45 y umbral de confianza de 0,5.
| Método | mAP@0.5 | mAP@0.5:0.95 | Puntuación F1 | FPS | Parámetros (M) |
| YOLOv5 | 0.87 | 0.78 | 0.89 | 130 | 7.1 |
| EfficientDet | 0.85 | 0.73 | 0.88 | 50 | 15.3 |
| RetinaNet | 0.82 | 0.68 | 0.85 | 45 | 37.6 |
| Faster R-CNN | 0.84 | 0.7 | 0.87 | 30 | 45.2 |
| YOLOv10 | 0.89 | 0.77 | 0.88 | 135 | 5.3 |
| YOLOv11 | 0.88 | 0.75 | 0.895 | 140 | 5.2 |
| NUESTRO | 0.91 | 0.82 | 0.935 | 120 | 6.7 |
Tabla 1: Tabla comparativa exhaustiva del rendimiento de los modelos. El análisis de los datos muestra que el método propuesto alcanza un mAP@0.5 de 0.91 y un mAP@0.5:0.95 de 0.82, lo que representa mejoras de 0.04 y 0.04, respectivamente, frente a YOLOv5. Su puntuación F1 es de 0.935, también superior a la de los modelos comparados. La velocidad de detección es de 120 FPS, cuatro veces más que Faster R-CNN, aunque ligeramente inferior a YOLOv10 y YOLOv11. El número de parámetros es de 6,7 M, solo 1,5 M más que YOLOv11, con una mejora de 0,03 en mAP@0.5. En comparación con EfficientDet, que tiene un costo computacional similar, la precisión es 0,06 mayor, mientras que el número de parámetros es un 56 % menor. Los datos demuestran que la fusión multiescala y el mecanismo de atención introducidos mejoran eficazmente la precisión en la detección de objetivos pequeños, logrando un buen equilibrio entre velocidad y precisión. En resumen, nuestro método propuesto alcanza un equilibrio entre precisión y velocidad de detección. El mAP@0.5 es 0,02 más alto que el del segundo mejor modelo, la puntuación F1 alcanza 0,935, y los 6,7 M de parámetros son suficientes para su implementación práctica. La fusión multiescala y el mecanismo de atención mejoran el reconocimiento de objetivos pequeños y parcialmente ocultos en escenas complejas. El modelo equilibra precisión y eficiencia, lo que lo hace adecuado para escenarios en tiempo real como el monitoreo de seguridad industrial. Cabe señalar que todos los modelos comparativos utilizan pesos preentrenados oficiales, con una resolución de entrada uniforme de 640 × 640, un umbral uniforme de NMS de 0,45 y un umbral de confianza uniforme de 0,5.
Figura 2 proporciona un análisis detallado de los tipos de detecciones falsas del modelo. YOLOv11 + CNN presenta la tasa más baja de detecciones falsas de fondo (85 veces/10.000 fotogramas), con la mayoría de las detecciones erróneas ocurriendo en objetos similares (62 veces) y escenas parcialmente ocluidas (48 veces). El análisis de la curva ROC indica que la TPR del modelo alcanzó 0,9 (AUC = 0,98) con una FPR de 0,1, y el espaciado más estrecho entre las curvas respalda la alta fiabilidad de la confianza en la detección. Estos resultados del análisis no solo respaldan el rendimiento del modelo, sino que también proporcionan una hoja de ruta técnica clara para la optimización posterior de las detecciones falsas, particularmente mediante el fortalecimiento de su capacidad para distinguir objetos similares.

Figura 2. Análisis de errores. Análisis de los tipos de detecciones falsas del modelo. YOLOv11 + CNN presenta la tasa más baja de detecciones falsas de fondo (85 veces/10.000 fotogramas), con la mayoría de las detecciones falsas concentradas en objetos similares (62 veces) y escenas parcialmente ocluidas (48 veces). El análisis de la curva ROC indica que la tasa de verdaderos positivos (TPR) del modelo alcanzó 0,9 (AUC = 0,98) con una tasa de falsos positivos (FPR) de 0,1, y el espaciado más estrecho entre las curvas respalda la fiabilidad de la confianza en la detección. Estos resultados del análisis no solo respaldan el rendimiento del modelo, sino que también proporcionan una hoja de ruta técnica clara para la optimización posterior de las falsas detecciones, particularmente mediante el fortalecimiento de su capacidad para distinguir objetos similares. Haga clic aquí para ver una versión más grande de esta figura.
Figura 3 compara el rendimiento del modelo en diversas plataformas de hardware. YOLOv11 + CNN alcanza una latencia ultra baja de 18 ms en la unidad de procesamiento tensorial de borde (TPU), con una fluctuación de solo ±2 ms, y el consumo de energía se mantiene en 15 W. Las pruebas de rendimiento demuestran que el modelo alcanza una velocidad de procesamiento de 70 FPS en dispositivos de computación de borde Jetson Xavier, con la latencia del percentil 99 controlada dentro de los 50 ms. Estos indicadores de rendimiento en la implementación permiten que se adapte a las necesidades de despliegue en diversas plataformas de computación en entornos industriales. El análisis de errores muestra además que el modelo puede mantener un rendimiento estable en entornos con recursos limitados, demostrando su aplicabilidad en ingeniería.

Figura 3. Rendimiento en la implementación. Comparación del rendimiento del modelo en diversas plataformas de hardware. YOLOv11 + CNN alcanza una latencia ultra baja de 18 ms en el Edge TPU (con una fluctuación de solo ±2 ms), y el consumo de energía se mantiene en 15 W. Las pruebas de rendimiento muestran que el modelo alcanza una velocidad de procesamiento de 70 FPS en dispositivos de computación periférica Jetson Xavier, con la latencia del percentil 99 controlada dentro de los 50 ms. Estos indicadores de rendimiento en la implementación indican que el modelo puede adaptarse a las necesidades de despliegue en diversas plataformas de cómputo en entornos industriales. El análisis de errores muestra además que el modelo puede mantener un rendimiento estable en entornos con recursos limitados, demostrando así su aplicabilidad en ingeniería. Haga clic aquí para ver una versión ampliada de esta figura.
Figura 4 compara las diferencias en el rendimiento de detección de cada modelo en seis categorías objetivo. YOLOv11 + CNN alcanzó una precisión de 0,96 en la tarea de reconocimiento del casco de seguridad, superando al modelo de referencia en 4 puntos porcentuales. El gráfico de puntos indica que el modelo presenta fluctuaciones mínimas en el rendimiento entre categorías (±0,05), lo que refleja sus capacidades de generalización. La matriz de confusión, presentada como un mapa de calor, revela una detección falsa mutua del 15 % entre el área peligrosa y el brazo robótico. Este hallazgo proporciona una dirección clara para la optimización posterior del modelo.

Figura 4. Análisis de detección por categorías. Comparación de las diferencias en el rendimiento de detección de cada modelo en seis categorías objetivo. YOLOv11 + CNN alcanzó una precisión de 0,96 en la tarea de reconocimiento de cascos de seguridad, superando al modelo de referencia en 4 puntos porcentuales. El gráfico de puntos discontinuos indica que el modelo presenta fluctuaciones mínimas en el rendimiento entre categorías (±0,05), lo que refleja sus capacidades de generalización. La matriz de confusión, presentada como un mapa de calor, revela una detección falsa mutua del 15 % entre el área peligrosa y el brazo robótico. Este hallazgo proporciona una orientación clara para la optimización posterior del modelo. Haga clic aquí para ver una versión ampliada de esta figura.
Figura 5 proporciona un registro completo del proceso de entrenamiento para cada modelo. YOLOv11 + CNN presenta la tasa de convergencia más rápida, con una pérdida que disminuye a 0,1 dentro de las primeras 30 épocas, y la diferencia entre su curva de mAP en el conjunto de validación y el conjunto de entrenamiento es consistentemente menor al 1 %. El análisis del gráfico de banda de error muestra que el mAP@0,5 final del modelo en validación es estable en 0,94 ± 0,01, y su rango de fluctuación de rendimiento es solo un tercio del de RetinaNet. Estos resultados respaldan la eficacia del protocolo de entrenamiento conjunto. El modelo muestra ventajas de rendimiento en las etapas iniciales del entrenamiento, lo que indica que su diseño arquitectónico le permite aprender características rápidamente.

Figura 5. Análisis del proceso de entrenamiento. Registro del proceso de entrenamiento para cada modelo. YOLOv11 + CNN presenta la tasa de convergencia más rápida (la pérdida disminuye a 0,1 dentro de 30 épocas), y la diferencia entre su curva de mAP del conjunto de validación y el conjunto de entrenamiento siempre es menor al 1 %. El análisis del gráfico de banda de error muestra que el mAP@0,5 final de validación del modelo es estable en 0,94 ± 0,01, y el rango de fluctuación del rendimiento es solo un tercio del de RetinaNet. Estos resultados respaldan la eficacia del protocolo de entrenamiento conjunto. El modelo muestra ventajas de rendimiento en las etapas iniciales del entrenamiento, lo que indica que su diseño arquitectónico le permite aprender características rápidamente. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 2 presenta los resultados cuantitativos de rendimiento para diferentes modelos de detección en entornos complejos. Los datos de prueba en condiciones estándar de iluminación y diversos escenarios extremos muestran que YOLOv11 + CNN mantiene un rendimiento óptimo bajo todas las condiciones. En condiciones estándar de iluminación, el mAP@0.5 de este modelo alcanzó 0.91, significativamente mejor que YOLOv5 (0.87) y Faster R-CNN (0.84). A medida que las condiciones ambientales empeoran, el rendimiento de cada modelo disminuye en distintos grados, pero YOLOv11 + CNN muestra la mayor robustez ambiental: en condiciones de poca luz (< 50 lux), su rendimiento solo disminuye un 3% (hasta 0.88), lo cual es mejor que la reducción del 5% observada en los modelos comparativos; en escenarios con alta oclusión (> 50%), su mAP aún puede mantenerse en 0.78, y la degradación del rendimiento (13%) es significativamente menor que la de YOLOv5 (15%) y Faster R-CNN (16%). Estos resultados demuestran que YOLOv11 + CNN mejora la adaptabilidad del modelo ante factores complejos, como cambios en la iluminación y oclusiones, mediante mecanismos mejorados de fusión de características y atención, apoyando así aplicaciones prácticas en escenarios industriales.
| Condición de prueba | YOLOv11 + CNN | YOLOv5 | Faster R-CNN | Fluctuación del rendimiento |
| Iluminación estándar | 0.91 | 0.87 | 0.84 | 0.01 |
| Baja luminosidad (< 50 lux) | 0.88 (-3%) | 0.82 (-5%) | 0.79 (-5%) | 0.02 |
| Oclusión parcial (30%–50%) | 0.85 (-6%) | 0.80 (-7%) | 0.76 (-8%) | 0.03 |
| Oclusión severa (> 50%) | 0.78 (-13%) | 0.72 (-15%) | 0.68 (-16%) | 0.04 |
| Desenfoque por movimiento | 0.83 (-8%) | 0.77 (-10%) | 0.73 (-11%) | 0.05 |
Tabla 2: Tabla de análisis cuantitativo de adaptabilidad ambiental. Rendimiento de diferentes modelos de detección en entornos complejos mediante análisis cuantitativo. Los datos de prueba, desde condiciones de iluminación estándar hasta diversos escenarios extremos, muestran que YOLOv11 + CNN mantiene el rendimiento más alto en todas las condiciones de prueba. Bajo condiciones de iluminación estándar, el mAP@0.5 de este modelo alcanzó 0.91, significativamente mejor que YOLOv5 (0.87) y Faster R-CNN (0.84). Con el deterioro de las condiciones ambientales, el rendimiento de cada modelo disminuye en distintos grados, pero YOLOv11 + CNN muestra la mayor robustez ambiental entre los modelos evaluados: en condiciones de poca luz (< 50 lux), su rendimiento solo disminuye un 3% (hasta 0.88), lo cual es mejor que la reducción del 5% del modelo comparativo; en escenarios con alta occlusión (> 50%), su mAP aún puede mantenerse en 0.78, y la degradación del rendimiento (13%) es significativamente menor que la de YOLOv5 (15%) y Faster R-CNN (16%). Estos resultados demuestran que YOLOv11 + CNN mejora la adaptabilidad del modelo a factores complejos, como cambios en la iluminación e interferencias por occlusión, mediante un mecanismo de fusión de características y un diseño de atención mejorados, lo que respalda su aplicación práctica en escenarios industriales.
Tabla 3 muestra que se utilizó el optimizador SGD en este experimento, con un momento de 0,9 para acelerar la convergencia y suprimir las oscilaciones. Se empleó una tasa de aprendizaje inicial de 0,01 con recocido cosenoidal, que disminuyó gradualmente durante el entrenamiento para perfeccionar la optimización. Se introdujo una reducción del peso de 0,0005 para aplicar regularización L2 y reducir el sobreajuste. Un tamaño de lote de 32 equilibró la eficiencia computacional con la estabilidad de la estimación del gradiente. Las 200 épocas de entrenamiento garantizaron una convergencia suficiente. Los parámetros se adaptaron a la tarea de detección de una sola etapa, equilibrando la velocidad y precisión del entrenamiento.
| Parámetro | Valor |
| Optimizador | SGD |
| Tasa de aprendizaje inicial | 0.01 |
| Momento | 0.9 |
| Decaimiento del peso | 0.0005 |
| Tamaño del lote | 32 |
| Épocas de entrenamiento | 200 |
| Programación de la tasa de aprendizaje | Recocido cosenoidal |
Tabla 3: Tabla de hiperparámetros de entrenamiento. Se utilizó el optimizador SGD en este experimento, con un momento de 0,9 para acelerar la convergencia y suprimir las oscilaciones. Se empleó una tasa de aprendizaje inicial de 0,01 con recocido coseno, que disminuyó gradualmente durante el entrenamiento para perfeccionar la optimización. Se introdujo una reducción del peso de 0,0005 para aplicar regularización L2 y reducir el sobreajuste. Un tamaño de lote de 32 equilibró la eficiencia computacional con la estabilidad de la estimación del gradiente. Las 200 épocas de entrenamiento garantizaron una convergencia suficiente. Los parámetros se adaptaron a la tarea de detección de una sola etapa, equilibrando la velocidad y precisión del entrenamiento.
Tabla 4 muestra que, utilizando YOLOv11 como referencia, el mAP@0.5 es 0,89. La introducción de la fusión multi-escala por sí sola reduce la precisión a 0,88. Al añadir secuencialmente la atención de canal y la atención espacial, la precisión mejora a 0,90 y 0,89, respectivamente. La precisión combinada de todos los módulos alcanza 0,91, lo que representa una mejora de 0,02 respecto a la referencia. Los datos indican que la atención de canal mejora directamente la precisión, y el rendimiento combinado de la multi-escala y la atención es óptimo.
| Configuración | mAP@0.5 |
| YOLOv11 (línea base) | 0.89 |
| + Fusión multi-escala | 0.88 |
| + Multi-escala + atención de canal | 0.9 |
| + Multi-escala + atención espacial | 0.89 |
| Módulo completo (YOLOv11 + CNN) | 0.91 |
Tabla 4: Tabla de prueba de ablación. Utilizando YOLOv11 como referencia, el mAP@0.5 es 0,89. Introducir únicamente la fusión multi-escala reduce la precisión a 0,88. Añadir atención de canal o atención espacial después de la fusión multi-escala mejora la precisión a 0,90 y 0,89, respectivamente. La precisión combinada de todos los módulos alcanza 0,91, un incremento de 0,02 respecto a la referencia. Los datos muestran que la atención de canal produce mayores mejoras que la atención espacial en este contexto, y que el rendimiento combinado de la fusión multi-escala y la atención es óptimo.
Figura 6 evalúa sistemáticamente el rendimiento del modelo en entornos extremos. El mAP de YOLOv11 + CNN disminuyó solo un 6 % (hasta 0,88) en condiciones de poca luz y aún mantuvo un mAP de 0,78 (8 % por encima del valor de referencia) en escenas altamente ocluidas. Estos resultados demuestran que el modelo exhibe adaptabilidad ambiental, abordando eficazmente los cambios comunes de iluminación y los problemas de oclusión parcial en la producción industrial, lo que favorece el funcionamiento estable del sistema de detección.

Figura 6. Adaptabilidad ambiental. Una evaluación sistemática del rendimiento del modelo en entornos extremos. La mAP de YOLOv11 + CNN disminuyó solo un 6 % (hasta 0,88) en condiciones de poca luz, y aún mantuvo una mAP de 0,78 (8 % por encima del valor de referencia) en escenas con oclusión severa. Estos resultados demuestran que el modelo exhibe adaptabilidad ambiental, abordando eficazmente los cambios comunes en la iluminación y los problemas de oclusión parcial en la producción industrial, lo que permite el funcionamiento estable del sistema de detección. Haga clic aquí para ver una versión más grande de esta figura.
Figura 7 compara las diferencias en la distribución de características entre YOLOv11 y YOLOv11 + CNN en seis tipos de objetivos industriales mediante la reducción de dimensionalidad t-SNE. La figura izquierda muestra que las características del modelo básico YOLOv11 presentan una dispersión intraclase significativa (distancia intraclase 2,34 ± 0,15), particularmente en la "Zona de Peligro" (rojo) y el "Vehículo" (púrpura), donde existe una superposición considerable, lo cual es consistente con la tasa de detección falsa del 15 % en el grupo experimental 3. La figura derecha muestra que el modelo mejorado YOLOv11 + CNN mejora significativamente la compacidad intraclase mediante el módulo de realce de características, aumentando la distancia promedio entre los centros de agrupamiento dentro de cada categoría en 1,8 veces.

Figura 7. Comparación de la distribución de características mediante t-SNE. Una comparación de las diferencias en la distribución de características entre YOLOv11 y YOLOv11 + CNN en seis tipos de objetivos industriales mediante la reducción de dimensionalidad t-SNE. La figura izquierda muestra que las características del modelo básico YOLOv11 presentan una dispersión intraclase significativa (distancia intraclase 2,34 ± 0,15), particularmente en la "Zona de Peligro" (rojo) y "Vehículo" (púrpura), donde existe una superposición considerable, lo cual es consistente con la tasa de detección errónea del 15 % en el grupo experimental 3. La figura derecha muestra que el modelo mejorado YOLOv11 + CNN mejora significativamente la compacidad intraclase mediante el módulo de realce de características, y la distancia promedio entre los centros de los grupos se incrementa en 1,8 veces. Haga clic aquí para ver una versión más grande de esta figura.
Figura 8 verifica la contribución de cada módulo mediante experimentos sistemáticos de ablación. Los resultados de ablación muestran que agregar atención de canal después de la fusión multi-escala aumenta el mAP@0.5 a 0,90, mientras que agregar atención espacial aumenta el mAP@0.5 a 0,89. El módulo completo alcanza el mAP@0.5 más alto de 0,91. La visualización mediante mapa de calor muestra que el mecanismo de atención compuesta puede mejorar simultáneamente la respuesta de detección en el centro del área peligrosa (valor de activación: +0,15) y en objetivos pequeños ubicados en el borde (+0,08). Los datos experimentales demuestran que la fusión de características multi-escala y los mecanismos de atención tienen un efecto acumulativo, permitiendo que el modelo cumpla con los requisitos de detección de objetivos a diferentes escalas.

Figura 8. Experimento modular de ablación. Verificación de la contribución de cada módulo mediante experimentos sistemáticos de ablación. Los resultados de ablación muestran que agregar atención de canal después de la fusión multi-escala aumenta el mAP@0.5 a 0,90, mientras que agregar atención espacial aumenta el mAP@0.5 a 0,89. El módulo completo alcanza el mAP@0.5 más alto de 0,91. La visualización mediante mapa de calor muestra que el mecanismo de atención compuesta puede realzar simultáneamente la respuesta de detección en el centro de la zona peligrosa (valor de activación: +0,15) y en objetivos pequeños en el borde (+0,08). Los datos experimentales demuestran que la fusión de características multi-escala y los mecanismos de atención tienen un efecto acumulativo, permitiendo que el modelo cumpla con los requisitos de detección de objetivos en diferentes escalas. Haga clic aquí para ver una versión más grande de esta figura.
DISPONIBILIDAD DE LOS DATOS:
Las imágenes y flujos de video completos y en bruto de la línea de producción están sujetos a restricciones de confidencialidad industrial y no se publican públicamente. Una Descripción del Conjunto de Datos Suplementario (Archivo Suplementario 1) proporciona detalles sobre la adquisición de datos, distribuciones de categorías y escenarios, especificaciones de anotación, procedimientos de control de calidad, divisiones de los datos, preprocesamiento y procedimientos de aumento de datos. Un Pseudocódigo y Marco para la Reproducibilidad (Archivo Suplementario 2) ofrece un flujo de trabajo a nivel de pseudocódigo, descripciones de configuraciones y orientaciones para la reproducción. Un subconjunto anonimizado y materiales de apoyo adicionales pueden solicitarse al autor correspondiente para investigación académica sin fines comerciales, sujeto a restricciones institucionales y de confidencialidad.
Archivo complementario 1. Descripción del conjunto de datos complementario. Este archivo describe el protocolo de adquisición del conjunto de datos, la cobertura de escenarios, la distribución de clases, las especificaciones de anotación, los procedimientos de control de calidad, la partición entre entrenamiento/validación/prueba, el preprocesamiento y los procedimientos de aumento de datos. Haga clic aquí para descargar este archivo.
Archivo complementario 2. Pseudocódigo y marco de reproducibilidad. Este archivo proporciona detalles a nivel de pseudocódigo sobre el flujo de trabajo y la configuración para el preprocesamiento, entrenamiento, evaluación e implementación, y describe las restricciones sobre las grabaciones industriales en bruto y el acceso a los materiales de apoyo. Haga clic aquí para descargar este archivo.