Se requiere una suscripción a JoVE para ver este contenido. Inicie sesión o comience su prueba gratuita.

Artículo de investigación

Investigación sobre el algoritmo de detección de equipos de protección personal de líneas de transmisión basado en YOLOv11 mejorado

360 vistas

DOI:

10.3791/69489

30 de diciembre de 2025

En este artículo

Resumen

El objetivo de este protocolo es proporcionar una guía paso a paso para desarrollar un modelo mejorado basado en YOLOv11n para la detección de EPP. Detalla modificaciones arquitectónicas y de entrenamiento que resultan en un detector ligero en tiempo real con una precisión de última generación del 90,1% de mAP y una interpretabilidad inherente.

Resumen

En la inspección inteligente de líneas de transmisión, los dispositivos de computación en el borde se enfrentan al desafío crítico de equilibrar el rendimiento en tiempo real con la precisión de detección para el reconocimiento de equipos de protección personal en escenarios operativos complejos. Este estudio propone WTLS-YOLOv11n, un algoritmo de detección ligero e inherentemente interpretable. La metodología integra tres innovaciones sinérgicas en la arquitectura YOLOv11n. Un módulo C3K2-WTConv que emplea una transformación discreta de wavelet descompone características en componentes de frecuencia físicamente significativos, permitiendo una extracción robusta de características multiescala con interpretabilidad inherente. Un cabezal de detección compuesta compartida y ligero logra una reducción sustancial de parámetros mediante el compartición estratégica de peso, preservando al mismo tiempo las capacidades de fusión multiescala. La función de pérdida MPDIoU mejora la precisión de localización para objetivos pequeños y de formas irregulares. La validación experimental demuestra que el modelo propuesto logra una precisión superior en la detección con parámetros significativamente reducidos y complejidad computacional en comparación con la línea base, manteniendo al mismo tiempo un rendimiento de inferencia en tiempo real en plataformas de hardware en el borde. El análisis cuantitativo de interpretabilidad revela que las decisiones de detección están predominantemente impulsadas por características estructurales de baja frecuencia más que por detalles texturales de alta frecuencia, proporcionando una visión transparente del proceso de razonamiento del modelo. Los experimentos comparativos con modelos de detección convencionales validan la superior relación entre precisión y eficiencia del enfoque propuesto. Este trabajo establece una solución transparente, eficiente y fiable para la supervisión automatizada de la seguridad en las operaciones eléctricas, con una aplicabilidad más amplia a tareas críticas de detección que requieren despliegue en el borde y toma de decisiones interpretable.

Introducción

El aprendizaje profundo ha transformado los protocolos de seguridad industrial e introducido nuevos enfoques para la gestión de riesgos laborales. Esta transformación es especialmente evidente en sectores de alto riesgo como la ingeniería de sistemas eléctricos. Los sistemas inteligentes de supervisión basados en visión ahora aprovechan la arquitectura YOLO (Solo miras una vez)1 para permitir la detección automática de Equipos de Protección Personal (EPP)2,3 en tiempo real. Estos sistemas se han convertido en una tecnología crítica para la monitorización de la seguridad en el lugar de trabajo, ofreciendo mejoras significativas en la precisión de detección y la velocidad de respuesta en comparación con los métodos tradicionales.

Estos sistemas monitorizan continuamente el cumplimiento de las normas de seguridad, reduciendo errores humanos y mejorando la supervisión en complejos sitios de operación eléctrica. Sin embargo, las redes neuronales profundas que subyacen a estos sistemas presentan un desafío importante: sus procesos de toma de decisiones siguen siendo opacos. Esta falta de interpretabilidad representa el principal obstáculo para la adopción más amplia de la industria, especialmente en aplicaciones críticas para la seguridad, donde comprender el razonamiento sistémico es esencial para generar confianza y garantizar la rendición de cuentas.

Cuando un modelo genera un juicio incorrecto, pasa por alto a un trabajador incumplidor o desencadena paradas operativas innecesarias, el opaco proceso de toma de decisiones no proporciona información accionable para los responsables de seguridad. Sin la capacidad de diagnosticar errores, comprender el razonamiento del sistema o verificar decisiones, estos sistemas no pueden cumplir con los estándares de fiabilidad requeridos en entornos donde la seguridad humana está en juego. Esta brecha ha impulsado una creciente demanda de enfoques de Inteligencia Artificial Explicable (XAI)4,5,6 que ofrezcan tanto precisión como transparencia. El objetivo es desarrollar sistemas que el personal de seguridad pueda comprender, validar y confiar en contextos operativos críticos.

La transparencia sigue siendo esencial, pero debe basarse en modelos que funcionen de forma fiable en condiciones operativas desafiantes. Los sitios de operación de energía presentan demandas técnicas específicas que requieren capacidades de detección robustas. Estos entornos experimentan variaciones extremas de iluminación que van desde la intensa luz del día hasta la oscuridad total. La maquinaria compleja frecuentemente obstruye el campo visual, creando desafíos de oclusión que los modelos de detección estándar tienen dificultades para abordar. Las condiciones meteorológicas añaden mayor variabilidad, afectando a la visibilidad y calidad de imagen en diferentes escenarios operativos. Afrontar estos desafíos requiere modelos que mantengan un rendimiento consistente a pesar de la complejidad ambiental.

Los investigadores han explorado múltiples enfoques para optimizar el rendimiento de YOLO en aplicaciones de sitios de poder. Las modificaciones arquitectónicas representan una dirección de investigación significativa. Varios estudios han mejorado la red YOLOv57 incorporando cabezas de detección adicionales dentro de la estructura del cuello. Esta modificación aborda un desafío persistente en la detección de EPP: la dificultad de identificar objetos pequeños a distancia o en campos visuales saturados. Las capas adicionales de detección permiten al modelo capturar detalles espaciales más finos que las arquitecturas estándar pueden pasar por alto.

Una segunda gran dirección de investigación se centra en la optimización de modelos para entornos de despliegue. Los sitios de operación de energía suelen requerir sistemas de detección para operar en dispositivos de borde con recursos computacionales limitados. Esta limitación ha impulsado los esfuerzos en la compresión del modelo y mejoras de eficiencia. Los investigadores han desarrollado técnicas para reducir el tamaño del modelo y el tiempo de inferencia mientras se preserva la precisión de la detección, permitiendo un rendimiento en tiempo real en hardware con capacidades de procesamientolimitadas 8,9.

Los esfuerzos recientes de optimización han introducido varias técnicas prometedoras para reducir la complejidad del modelo. Los investigadores han integrado redes troncales eficientes comoMobileNetv3 10 en arquitecturas como YOLO-M11. Otros han aplicado poda modelo y destilación de conocimiento para desarrollar variantes compactas, incluyendo Light-YOLOv412. Estos enfoques han demostrado mejoras medibles en la eficiencia computacional y la viabilidad del despliegue.

Sin embargo, estos métodos de optimización se enfrentan a una restricción fundamental inherente a las arquitecturas convolucionales convencionales. Las operaciones de convolución estándar requieren capas de red cada vez más profundas o tamaños de núcleomayores 13 para expandir el campo receptivo, lo cual es esencial para capturar información contextual a lo largo de la imagen. Este requisito arquitectónico crea un compromiso inevitable. A medida que los modelos adquieren la capacidad de extraer características más ricas y comprender un contexto espacial más amplio, sus conteos de parámetros y demandas computacionales aumentan sustancialmente. Los modelos resultantes suelen superar las capacidades de procesamiento de los dispositivos de borde, limitando su despliegue práctico en entornos operativos en tiempo real.

Esta tensión entre la capacidad de extracción de características y la eficiencia computacional representa un desafío metodológico significativo que los enfoques actuales no han resuelto completamente. El campo requiere un enfoque fundamentalmente diferente para la extracción de características que pueda capturar características jerárquicas multiescala sin el aumento proporcional de parámetros que imponen los métodos convencionales. Un enfoque así permitiría a los modelos mantener tanto el rendimiento de detección requerido para aplicaciones críticas para la seguridad como la eficiencia necesaria para el despliegue en el borde. Abordar esta brecha representa una prioridad crítica de investigación para avanzar en sistemas prácticos de detección de EPI en entornos de operación eléctrica.

Los métodos actuales de explicabilidad para la detección de objetos utilizan predominantemente enfoques de análisispost-hoc 14 , como Grad-CAM. Aunque estos métodos proporcionan visualizaciones útiles, operan de forma independiente del proceso de aprendizaje del modelo. Un enfoque alternativo es diseñar componentes arquitectónicos que ofrezcan transparencia a través de sus mecanismos operativos. Nuestra extracción de características basada en wavelets proporciona una forma sencilla de entender qué componentes de frecuencia contribuyen a la detección, aunque se necesita más investigación para cuantificar completamente esta interpretabilidad.

Esta investigación aborda tres desafíos interconectados en los sistemas de detección de EPP: la precisión de la detección, la eficiencia computacional y la interpretabilidad del modelo. La obra modifica la arquitectura YOLOv11n15 mediante tres cambios de diseño específicos.

La primera modificación introduce el módulo C3K2-WTConv, que sustituye la convolución estándar por un proceso de extracción de características inspirado en wavelets. Este enfoque separa la información visual en componentes de frecuencia: las señales de baja frecuencia contienen información de forma y contorno, mientras que las de alta frecuencia codifican detalles de textura y bordes. Esta separación mejora la calidad de las características y hace que el proceso de extracción sea más transparente que las operaciones convencionales de convolución.

La segunda modificación implementa una Cabeza de Detección Compartida Ligera (LSCD) para reducir los requisitos computacionales. Este componente utiliza el intercambio de parámetros a través de escalas de detección, disminuyendo el tamaño del modelo mientras mantiene capacidades de detección multiescala. Este diseño apunta a las limitaciones de recursos típicas de los dispositivos de borde usados en sitios de operación eléctrica.

La tercera modificación reemplaza la función de pérdida estándar por la pérdida MPDIoU16 para mejorar la precisión de la caja delimitadora. Este cambio aborda los desafíos de localización asociados con artículos de EPI pequeños y de formas variables, proporcionando una mejor estabilidad de gradiente durante el entrenamiento.

Las pruebas muestran que el modelo modificado logra una Precisión Media Media un 3,8% superior a la línea base, utilizando un 11,5% menos de parámetros. Estos resultados indican que el enfoque cumple con los requisitos prácticos para el despliegue en el borde mientras mejora el rendimiento de detección. El trabajo proporciona una solución funcional para el monitoreo de seguridad en operaciones de energía, aunque sigue siendo necesaria una validación adicional en diversas condiciones operativas para evaluar completamente la fiabilidad del sistema.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Protocolo

Los datos de imagen para este estudio se recogieron de entornos de operación eléctrica con los permisos necesarios. Todas las imágenes fueron anonimizadas sin que se conservara información personal identificable. Este estudio se centra en detectar equipos de protección individual más que en identificar a las personas. Como la investigación solo implica el desarrollo de algoritmos utilizando datos anonimizados, no se requería aprobación ética.

El siguiente protocolo detalla un procedimiento completo para diseñar, entrenar y evaluar un modelo de detección de objetos ligero, de alto rendimiento e inherentemente interpretable, denominado WTLS-YOLOv11n, para la detección de Equipos de Protección Personal (EPP). El software utilizado en este estudio está listado en la Tabla de Materiales.

Marco arquitectónico general

El modelo propuesto WTLS-YOLOv11n se basa en la línea base YOLOv11n. La metodología central consiste en reemplazar o mejorar sistemáticamente módulos clave en la columna vertebral y la cabeza para mejorar el rendimiento, la eficiencia y la interpretabilidad.

El modelo propuesto WTLS-YOLOv11n se basa en la línea base YOLOv11n. La metodología central consiste en reemplazar o mejorar sistemáticamente módulos clave en la columna vertebral y la cabeza para mejorar el rendimiento, la eficiencia y la interpretabilidad. El paradigma arquitectónico general de YOLOv11n, que consiste en una columna vertebral, un cuello y una cabeza, se mantuvo en el modelo propuesto. En la columna vertebral, módulos específicos C3K2 fueron reemplazados por los propuestos módulos C3K2-WTConv para mejorar la extracción de características. En la cabeza, la cabeza de detección original fue reemplazada por la propuesta cabeza compuesta de detección compartida ligera (LSCD) para reducir la complejidad del modelo. La arquitectura completa del modelo propuesto WTLS-YOLOv11n, en contraste con la línea base, se ilustra en la Figura 1.

Diseño de módulos C3K2-WTConv

Este módulo está diseñado para reemplazar los módulos convolucionales estándar dentro de la columna vertebral YOLOv11n. Su diseño se guía por dos objetivos principales: (a) ampliar de forma eficiente el campo receptivo del modelo para capturar información contextual a múltiples escalas sin aumentar significativamente el número de parámetros o la complejidad computacional, y (b) aprender representaciones de características más robustas e inherentemente interpretables descomponiendo explícitamente mapas de características en el dominio de la frecuencia.

Diseño de la capa Core WTConv

La capa fundamental WTConv (Convolución de Transformada de Wavelet) está diseñada para implementar la Transformada de Wavelet de Haar Discreta 2D. Este proceso se realiza mediante un conjunto de núcleos de wavelet específicos:

Núcleos de ondas: La transformada se implementa mediante cuatro núcleos de convolución en profundidad fijos y no entrenógenes (F_LL, F_LH, F_HL, F_HH), que corresponden a las funciones base de wavelet de Haar. Estos núcleos son responsables de descomponer el mapa de características de entrada en sus componentes de baja y alta frecuencia.

Descomposición y muestreo descendente: Estos núcleos se aplican al mapa de características de entrada (X) con un paso de 2. Esta única operación realiza eficientemente tanto la descomposición de características como el muestreo espacial descendente, separando la entrada en cuatro subbandas distintas.

Interpretación física de los componentes de salida

Las cuatro subbandas características generadas por la descomposición en wavelet poseen una interpretación física clara. Como se ilustra en la Figura 2, la capa WTConv descompone recursivamente la entrada en los siguientes componentes:

Componente de baja frecuencia (LL): Este componente preserva la estructura general, el contorno y otra información global del objetivo a la mitad de la resolución espacial. Sirve como base para que el modelo entienda la "forma" del objetivo.

Componentes de alta frecuencia (LH, HL, HH): Estos tres componentes capturan detalles de grano fino como bordes y texturas horizontales, verticales y diagonales, respectivamente. Permiten que el modelo se centre en los "detalles" del objetivo.

Integración en la estructura del módulo C3K2

La capa diseñada WTConv está integrada sin problemas en la estructura de cuello de botella C3K2 de YOLOv11n.

Estrategia de reemplazo: Dentro del módulo original C3K2, la capa convolucional estándar 3x3 se reemplaza por la capa WTConv. Este enfoque preserva el mecanismo eficiente de reutilización de características de la arquitectura C3K2 mientras introduce las ventajas de la transformada wavelet, dando lugar al módulo final C3K2-WTConv (estructura detallada mostrada en la Figura 3).

Expansión de campo receptivo en cascada: El proceso WTConv puede aplicarse recursivamente a la salida de baja frecuencia (LL) de la etapa anterior. Este mecanismo de descomposición en cascada permite al modelo analizar características sobre un campo receptivo que aumenta exponencialmente con una sobrecarga computacional mínima, creando así una vía eficiente de descomposición en frecuencia a múltiples escalas.

Diseño de cabeza compartida ligera de detección compartida (LSCD)

Este módulo está diseñado para reemplazar la cabeza de detección original YOLOv11n, con el objetivo principal de reducir drásticamente la complejidad del modelo y la sobrecarga computacional para un despliegue eficiente en dispositivos de borde con recursos limitados. El diseño aborda la significativa redundancia de parámetros que se encuentra en los cabezales de detección estándar de múltiples escalas (estructura detallada mostrada en la Figura 4).

Justificación y objetivos de diseño

Las ramas de predicción independientes para cada escala de características (P3-P5) en la cabeza original de YOLOv11 conducen a un alto número de parámetros. El LSCD introduce una estrategia híbrida de compartición de parámetros para lograr una eficiencia superior de parámetros mientras preserva capacidades críticas de fusión de características a múltiples escalas.

Compartición de parámetros y mecanismo de fusión de características

El núcleo del LSCD reside en su pipeline de procesamiento de características en dos etapas:

Preprocesamiento específico de escala: Para cada mapa de características de entrada desde el mástil (P3, P4, P5), se aplica una convolución 1x1 no compartida seguida de una capa de Normalización de Grupo (GN). Este primer paso permite a la red aprender transformaciones de canal específicas por escala, asegurando que las características únicas de cada nivel de característica se preserven antes de la fusión.

Fusión eficiente a escala cruzada: Tras el preprocesado, se emplean una serie de módulos compartidos 3x3 Convolution-GN para realizar la fusión de características principales a diferentes escalas. Al compartir pesos, estos módulos aprenden un patrón generalizado de fusión de características, que es la principal fuente de reducción de parámetros. Este diseño obliga al modelo a aprender representaciones de fusión más robustas y universales.

Adaptación dinámica de escalas y optimización de ramas

Para compensar cualquier posible pérdida de información por compartir peso y perfeccionar la precisión de las predicciones, se introducen dos mecanismos adicionales:

Capa de Escala Aprendible: Se añade una capa de Escala Aprendible para cada escala de detección. Esta capa introduce un escalar aprendible por escala que repondera dinámicamente las características fusionadas, permitiendo al modelo enfatizar o suprimir de forma adaptativa las características según el tamaño de los objetos objetivo prevalentes a esa escala.

Rama de clasificación optimizada: La rama de clasificación se mejora utilizando la función de activación Softmax para la distribución de probabilidades e incorporando una capa de Normalización de Grupo (GN). Esto estabiliza el entrenamiento de la tarea de clasificación y mejora la robustez de las predicciones de confianza, una técnica demostrada eficaz en arquitecturas como FCOS.

Diseño mejorado de la función de pérdida (MPDIoU)

La función de pérdida se rediseña para abordar específicamente los desafíos de la regresión precisa de la caja delimitadora para objetivos pequeños, saturados y de formas irregulares, que son comunes en escenarios de detección de EPP.

Motivación y limitaciones de la pérdida tradicional de IoU

Las pérdidas basadas en el IoU estándar sufren varios inconvenientes críticos en este contexto:

Gradientes nulos: Cuando las cajas predichas y las de verdad no se solapan, el IoU es cero y el gradiente de pérdida desaparece, frenando el proceso de aprendizaje.

Insensibilidad a la alineación: Varias configuraciones de caja delimitadora pueden obtener la misma puntuación de IoU, haciendo que la función de pérdida sea insensible a la calidad de la alineación (por ejemplo, desviación del punto central frente a la desadaptación de forma).

Bajo rendimiento en objetos pequeños: Para objetivos pequeños, incluso pequeñas desviaciones de píxeles pueden ser significativas, pero a menudo resultan en cambios insignificantes en el valor de IoU, lo que conduce a una localización imprecisa.

Adoptando la pérdida de Distancia Mínima de Puntos IoU (MPDIoU)

Para superar las limitaciones mencionadas, el protocolo sustituye la pérdida estándar por la pérdida IO por Distancia Mínima de Puntos (MPDIoU). MPDIoU mejora la métrica estándar de IoU incorporando un término de penalización que penaliza directamente la distancia entre las cajas predicha y la de verdad real, incluso cuando no se solapan.

Mecanismo central: El término de penalización se deriva de la distancia euclidiana entre los puntos de esquina correspondientes de la caja predicha (pred) y la caja de la verdad fundamental (gt). Específicamente, se calculan las distancias al cuadrado de las esquinas Ecuación 1superior izquierda ) y las esquinas inferiores derechas (Ecuación 2) siguientes:

Ecuación 3(1)
Ecuación 4(2)

Para asegurar que la penalización sea invariante a la escala, esta distancia se normaliza por las dimensiones de la caja más pequeña que encierra y cubre tanto la caja predicha como la de la verdad fundamental. Sea w y h el ancho y la altura de esta caja que encierra, respectivamente. La métrica MPDIoU se formula entonces como:

Ecuación 7(3)

Finalmente, la función de pérdida MPDIoU (LMPDIoU) se define como:

LMPDIoU = 1 - MPDIoU (4)

Ventajas clave: Este término de penalización geométrica aborda directamente los problemas mencionados a: i) proporcionar un gradiente significativo y distinto de cero incluso cuando las cajas no se solapan, evitando así que el gradiente se anule y asegurando una optimización continua del modelo, ii) ofreciendo una mayor sensibilidad a desviaciones de posición, tamaño y relación de aspecto, lo cual es fundamental para la localización precisa de elementos pequeños y diversos de EPI, iii) proporcionar señales de gradiente más estables y consistentes durante todo el entrenamiento, lo que promueve una convergencia más rápida y resulta en una precisión de localización superior.

Conjuntos de datos y configuración experimental

Conjunto de datos de detección de EPI autoconstruido

Establecimos un conjunto de datos de detección de EPI que contenía 5.000 imágenes de alta resolución procedentes de operaciones de líneas de transmisión eléctrica, anotadas con LabelImg y convertidas al formato YOLO TXT. El conjunto de datos incluye cinco categorías: cascos de seguridad (1.245 ocasiones), arneses de seguridad (1.128 casos), brazaletes (892 ocasiones), estado de trabajo en altura (1.056 ocasiones) y estado a nivel del suelo (1.124 ocasiones). Los datos se dividen en conjuntos de entrenamiento (4.000 imágenes), validación (500 imágenes) y de prueba (500 imágenes). Las imágenes presentan condiciones desafiantes, incluyendo iluminación extrema, oclusión intensa (23% con cobertura >50%) y fondos industriales complejos. Durante el entrenamiento se aplicaron técnicas estándar de aumento (volteo aleatorio, rotación, jitter de color, mosaico).

Conjunto de datos PASCAL de COV para pruebas de generalización

Para evaluar la capacidad de generalización del modelo más allá de los escenarios de operación de potencia, utilizamos el conjunto de datos PASCAL VOC, que combina VOC2007 y VOC2012 para un total de 21.503 imágenes. Siguiendo la práctica estándar, utilizamos 11.540 imágenes de VOC2012 para entrenamiento y validación, y 9.963 imágenes de VOC2007 para pruebas. El conjunto de datos de COV contiene 20 categorías de objetos en diversos escenarios reales. Aunque los objetos específicos difieren de nuestras categorías de EPI, los desafíos de detección (variación de escala, oclusión, fondos complejos) son similares, lo que lo hace adecuado para evaluar las capacidades generales de detección y la transferibilidad del modelo.

Detalles de implementación

Este protocolo describe el procedimiento para entrenar y evaluar el modelo. Se asume que el usuario tiene acceso al código fuente, a un entorno Python adecuado y a los conjuntos de datos preparados.

Preparación de sistemas y entorno

Se utilizaba una estación de trabajo equipada con una GPU NVIDIA con al menos 24 GB de VRAM para asegurar suficiente memoria para el entrenamiento (por ejemplo, NVIDIA GeForce RTX 4090). El framework de aprendizaje profundo PyTorch (versión 1.12.0 o superior) junto con su correspondiente kit de herramientas CUDA se instaló en la estación de trabajo. La instalación se verificó abriendo un terminal y ejecutando el comando "python -c 'import torch; print(torch.cuda.is_available())'", que se esperaba que devolviera "True". Los paquetes Python requeridos se instalaban navegando hasta el directorio raíz del proyecto y ejecutando el comando "pip install -r requirements.txt". Este comando instalaba automáticamente dependencias como numpy, opencv-python, pyyaml, tensorboard y torchvision. Se verificó la preparación del conjunto de datos para asegurar que las imágenes de entrenamiento estuvieran localizadas en /data/train/images/ y que los archivos de anotación estuvieran en /data/train/labels/ en formato YOLO (ancho de clase x_center y_center altura). El mismo proceso de verificación se aplicó a los conjuntos de datos de validación (/datos/val/) y prueba (/datos/test/).

Configuración de entrenamiento

El archivo de configuración config/wtls_yolov11n.yaml se abría usando un editor de texto para configurar los parámetros de entrenamiento. Las rutas de datos se configuraban localizando el parámetro 'path' y configurándolo en el directorio raíz del conjunto de datos, mientras que los parámetros 'train', 'val' y 'test' se verificaban para apuntar a los subdirectorios correctos. Se confirmó que el parámetro 'nc' (número de clases) coincidía con el conjunto de datos, que se estableció en 5 para la detección de EPI. Los hiperparámetros de entrenamiento se configuraron con el número de épocas en 300 para el entrenamiento completo y el tamaño del lote en 16, con la comprensión de que este valor podía ajustarse según la disponibilidad de memoria de la GPU y reducirse a 8 si se producían errores de falta de memoria. El tamaño de la imagen de entrada (imgsz) se estableció en 640, y se confirmó que el optimizador era SGD con una tasa de aprendizaje inicial (lr0) de 0,01. Se verificó que la caída del peso era de 0,0005 y el momento se fijó en 0,937. Las técnicas de aumento de datos estaban habilitadas usando los ajustes configurados por defecto, que incluían aumento de mosaico (mosaico: 1.0), giro horizontal aleatorio con probabilidad del 50% y jitter de color con parámetros hsvh: 0.015, hsvs: 0.7 y hsvv : 0.4. Los parámetros de utilización de hardware se configuraron con el número de trabajadores en 8 para los hilos de CPU usados en la carga de datos, y el parámetro del dispositivo en 0 para usar la primera GPU, con la opción de ponerlo en "0,1" para entrenamiento multi-GPU si era necesario.

Ejecución del entrenamiento del modelo

El entrenamiento de modelos se inicializaba desde la línea de comandos ejecutando el comando "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml", donde el parámetro --cfg especificaba el archivo de configuración del modelo, el parámetro --weights se establecía en una cadena vacía para entrenar desde cero (alternativamente, yolov11n.pt podía usarse para aprendizaje por transferencia), y el parámetro --data especificaba la configuración del conjunto de datos. Durante el entrenamiento se observaron indicadores de convergencia para seguir el rendimiento del modelo. En las primeras 50 épocas, se observó una rápida disminución de la pérdida, con box_loss descendiendo de aproximadamente 1,5 a 0,8. Entre las épocas 50 y 150, se observó una mejora constante al box_loss disminuir de aproximadamente 0,8 a 0,5. Durante las épocas 150 a 300, se produjo la fase de ajuste fino con box_loss estabilizándose alrededor de 0,4 a 0,5. Se esperaba que la métrica de validación mAP@0,5 alcanzara más del 85% para la época 200. Se verificó el guardado de puntos de control para asegurar que el entrenamiento guardara automáticamente los puntos de control cada 10 épocas en las corridas de directorio/entrenamiento/experiencia/pesos/. Se confirmó la presencia de last.pt (punto de control más reciente) y best.pt (punto de control más alto de mAP), con la expectativa de que cada archivo de punto de control tenga aproximadamente entre 5 y 6 MB de tamaño. El progreso del entrenamiento podía ser monitorizado opcionalmente usando TensorBoard abriendo un nuevo terminal y ejecutando el comando "tensorboard --logdir runs/train", luego navegando por un navegador hasta http://localhost:6006 para ver gráficos en tiempo real de curvas de pérdida, horario de tasas de aprendizaje y tendencias de los mAP. Los problemas comunes se abordaron mediante procedimientos de resolución de problemas, donde los errores de CUDA fuera de memoria se resolvieron reduciendo el tamaño del lote a 8 o 4, los valores de pérdida de NaN se abordaron reduciendo la tasa de aprendizaje a 0,005, y los estancamientos de mAP por debajo del 80% se investigaron verificando la corrección de las anotaciones y aumentando las épocas de entrenamiento a 400.

Protocolo de evaluación de modelos

Se realizó un procedimiento de evaluación multifacético para validar de forma exhaustiva la eficacia, eficiencia e interpretabilidad del modelo propuesto.

Evaluación cuantitativa del rendimiento

Métricas de rendimiento

Evalúa la precisión del modelo usando la Precisión Media Media (mAP) en un umbral de IoU de 0,5 (mAP@0,5), Precisión y Recordo. Evalúa la eficiencia del modelo midiendo el número total de Parámetros (M) y Operaciones en coma flotante (FLOPs, G). Mide la velocidad de inferencia en Frames Por Segundo (FPS) tanto en una GPU de nivel servidor como en un dispositivo edge. Para pruebas de dispositivos en el borde, configura el modo de potencia en máximo rendimiento y calienta el modelo con 100 inferencias ficticias antes de registrar FPS por encima de 500 imágenes de prueba.

Comparación con modelos de última generación: Compara el modelo propuesto WTLS-YOLOv11n con su línea base directa (YOLOv11n) y una amplia gama de detectores, incluyendo modelos YOLO basados en CNN convencionales (YOLOv5n, YOLOv8n, YOLOv9s), un detector de dos etapas (Faster R-CNN) y un detector basado en transformadores (RT-DETR). Entrena todos los modelos durante 300 épocas usando sus hiperparámetros predeterminados recomendados. Registra todas las métricas definidas en la sección de métricas de rendimiento para cada modelo tanto en el conjunto de datos de EPI autoconstruido como en el conjunto de datos PASCAL VOC. Para la evaluación de COV, entrena en los conjuntos combinados VOC2012 trainval y VOC2007 trainval, y luego prueba en VOC2007 conjunto de pruebas siguiendo el protocolo estándar.

Estudios de ablación: Realizar un estudio sistemático de ablación para diseccionar las contribuciones individuales de los componentes propuestos.

Análisis de Efectividad de Componentes: Partiendo del modelo base YOLOv11n, integra incrementalmente el módulo C3K2-WTConv, la cabeza LSCD y la pérdida MPDIoU. Para cada configuración, reentrenar el modelo para 300 épocas usando hiperparámetros idénticos (tamaño de lote 16, tasa de aprendizaje 0,01, optimizador SGD). Registra los cambios en mAP, precisión, recuerdo, parámetros, FLOPs y FPS para verificar la eficacia de cada componente. Calcula mejoras porcentuales en relación con la línea base para cada métrica.

Análisis de colocación: Para determinar la colocación óptima del módulo C3K2-WTConv, intégralo en diferentes partes de la arquitectura de la red. Prueba tres configuraciones: (i) integración solo de columna vertebral, (ii) integración solo de cuello y (iii) integración completa tanto en columna como en cuello. Entrenar cada configuración durante 300 épocas y comparar las puntuaciones resultantes de mAP@0,5 para identificar la estrategia de integración más eficaz. Selecciona la configuración óptima para todos los experimentos posteriores.

Evaluación cualitativa del rendimiento

Visualización de resultados de detección: Selecciona entre 12 y 15 imágenes representativas del conjunto de pruebas que presenten escenarios reales desafiantes, incluyendo contraluz fuerte, oclusión de objetos pesados, fondos complejos y ángulos de cámara poco convencionales. Para cada modelo de comparación (línea base, YOLOv5n, YOLOv8n, YOLOv9s y WTLS-YOLOv11n), se ejecuta inferencia sobre estas imágenes usando un umbral de confianza de 0,25 y un umbral de IoU de 0,45. Genera y renderiza las salidas de detección (cajas delimitadoras con etiquetas de clase y puntuaciones de confianza) en estas imágenes. Organizar las visualizaciones en formato de cuadrícula donde las filas representen diferentes escenarios y las columnas distintos modelos.

Análisis de robustez: Compara visualmente los resultados de detección renderizados de diferentes modelos. Evalúa la robustez y superioridad del modelo propuesto contando y marcando casos de falsos negativos (objetos pasados por alto), falsos positivos (detecciones incorrectas) y detecciones duplicadas (múltiples casillas para un solo objeto con IoU > 0,7 entre predicciones). Utiliza círculos rojos para resaltar detecciones problemáticas en la figura de visualización. Calcular tasas de falsos negativos por modelo y conteos de falsos positivos a través de las imágenes seleccionadas de prueba. Extraer y comparar las puntuaciones medias de confianza para las detecciones verdaderamente positivas entre modelos.

Análisis de interpretabilidad

Para validar la interpretabilidad inherente otorgada por el módulo C3K2-WTConv, se realizó un procedimiento de visualización sobre imágenes de entrada seleccionadas. El modelo entrenado WTLS-YOLOv11n se cargó y se registró un gancho delantero en el módulo C3K2-WTConv en la cuarta capa de la columna vertebral. Se realizaba la propagación hacia adelante sobre la imagen de entrada y se capturaba el tensor de características de salida. A partir del tensor de forma de la característica capturado [lote, canales, altura, ancho], se separaban los canales correspondientes a diferentes componentes de frecuencia. El primer 25% de los canales se designó como componente de baja frecuencia (LL) y el 75% restante como componentes de alta frecuencia (LH, HL, HH). Para cada tipo de componente de frecuencia, se calculó la media entre todos los canales dentro de ese componente para crear mapas de activación de un solo canal. La norma L2 se aplicó a través de dimensiones espaciales cuando fue necesario para enfatizar activaciones fuertes. Los mapas de activación se normalizaron a rango [0, 1] y se aplicó un mapa de colores (por ejemplo, 'jet'). Los mapas de calor se redimensionaron para coincidir con la resolución original de la imagen de entrada usando interpolación bilineal. El mapa de calor de baja frecuencia y el mapa de calor de alta frecuencia se superpusieron a la imagen original con un 40% de transparencia para crear visualizaciones interpretables que mostraran dónde se centra el modelo en características estructurales frente a texturas.

Para validar rigurosamente que las decisiones de detección dependen de características en el dominio de la frecuencia, se realizó un análisis cuantitativo. Se seleccionó un subconjunto de 200 a 300 imágenes del conjunto de pruebas que contenía detecciones exitosas (puntuación de confianza superior a 0,5). Este subconjunto se aseguró para representar escenarios diversos y evitar el sesgo de muestreo. Para cada imagen del subconjunto se realizó la propagación hacia adelante y se extrajo la salida del módulo C3K2-WTConv en la cuarta capa de columna central. El tensor de características se dividió en componentes de baja frecuencia (LL, el primer 25% de los canales) y de alta frecuencia (HF, el 75% restante de los canales). Para cada imagen, se calculó la fuerza absoluta media de activación a lo largo de las dimensiones espaciales (altura y ancho) para ambos componentes de frecuencia. La intensidad de la LL se calculó como la media del valor absoluto de las características de LL en todas las posiciones espaciales, y la intensidad de la HF se calculó como la media del valor absoluto de las características de la HF en todas las posiciones espaciales. Estos valores se registraban junto con la puntuación máxima de confianza en detección para esa imagen. Utilizando los datos recogidos (LL_strength, HF_strength, confidence_score) en todas las imágenes, se calcularon los coeficientes de correlación de Pearson. Se calculó la correlación entre la fuerza del LL y la puntuación de confianza, así como la correlación entre la fuerza del HF y la puntuación de confianza. Se utilizó software estadístico o la función scipy.stats.pearsonr de Python para obtener tanto coeficientes de correlación (r) como valores p. La significación estadística se evaluó utilizando un umbral de valor p de 0,05, donde un valor p menor a 0,05 indicaba que la correlación era estadísticamente significativa. Se comparó la magnitud de los coeficientes de correlación para determinar qué componente de frecuencia tenía mayor asociación con la confianza en la detección. Las siguientes métricas se registraron en un formato estructurado: coeficiente de correlación LL (rLL) y valor p (pLL), coeficiente de correlación HF (rHF) y valor p (pHF), fortalezas medias de activación (mediaLL, mediaHF) y tamaño de muestra (número de imágenes analizadas). Los resultados esperados fueron que las características de baja frecuencia mostrarían una correlación positiva más fuerte con las puntuaciones de confianza (rLL mayor a 0,60, p menor que 0,001) en comparación con las características de alta frecuencia (rHF aproximadamente de 0,40 a 0,50, p menor que 0,01), lo que indica que las decisiones de detección estaban predominantemente impulsadas por la información estructural capturada en el componente LL.

Este análisis cuantitativo estableció la interpretabilidad más allá de las limitaciones de la visualización cualitativa. La combinación de análisis de correlación (demostrando asociación estadística) y visualización en el dominio de la frecuencia (mostrando la atención espacial) proporcionó pruebas empíricas rigurosas de que la toma de decisiones del modelo se basaba genuinamente en características estructurales de baja frecuencia, tal como se pretendía por diseño.

Resultados esperados: Las características de baja frecuencia deberían mostrar una correlación positiva más fuerte con las puntuaciones de confianza (rLL > 0,60, p < 0,001) en comparación con las características de alta frecuencia (rHF≈ 0,40-0,50, p < 0,01), lo que indica que las decisiones de detección están predominantemente impulsadas por la información estructural capturada en el componente LL.

Este análisis cuantitativo establece una interpretabilidad más allá de la visualización cualitativa. La combinación del análisis de correlación (que demuestra la asociación estadística) y la visualización en el dominio de la frecuencia (mostrando la atención espacial) proporciona pruebas empíricas rigurosas de que la toma de decisiones del modelo se basa genuinamente en características estructurales de baja frecuencia tal y como está previsto por el diseño.

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Resultados

Para evaluar el rendimiento del modelo propuesto WTLS-YOLOv11n, realizamos experimentos con nuestro conjunto de datos de PPE autoconstruido y el conjunto de datos PASCAL VOC 2007+2012. Todas las métricas se reportan en los respectivos conjuntos de prueba, salvo que se indique lo contrario.

Comparación con modelos de última generación

Comparamos WTLS-YOLOv11n frente a detectores de objetos convencionales en tres paradigmas arquitectónicos: modelos Y...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Discusión

Los resultados experimentales demuestran que WTLS-YOLOv11n alcanza un 90,1% de mAP mientras reduce los parámetros en un 11,5% en comparación con la línea base de YOLOv11n. Esta mejora tanto en precisión como en eficiencia se debe a la integración sinérgica de tres componentes: extracción de características basada en wavelets, diseño ligero de cabezas de detección y mejora de la pérdida de localización.

El estudio de ablación revela que el módulo C3K2-WTConv pr...

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Divulgaciones

Los autores no declaran conflictos de interés.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Kit de herramientas CUDANVIDIA CorporationCUDA Toolkit Versión 11.7
Marco de Aprendizaje ProfundoFundación PyTorchPyTorch Versión 1.12.0
Unidad de procesamiento gráficoNVIDIA CorporationGeForce RTX 4090
NumPyDesarrolladores NumPyNumPy
OpenCVEquipo OpenCVOpenCV-Python
Sistema operativoCanonical Ltd.Ubuntu 22.04 LTS (o especifica tu sistema operativo)
PythonFundación de Software PythonPython Versión 3.8 o superior
TensorBoardAutores de TensorFlowTensorBoard
TorchvisionFundación PyTorchTorchvision

Referencias

  1. You only look once: Unified, real-time object detection. Redmon, J., Divvala, S., Girshick, R., Farhadi, A. Proc IEEE Conf Comput Vis Pattern Recognit, , (2016).
  2. Liu, M., Li, Z., Li, Y., Liu, Y. A fast and accurate method of power line intelligent inspection based on edge computing. IEEE Trans Instrum Meas. 71, 1-12 (2022).
  3. Gallo, G., Di Rienzo, F., Garzelli, F., Ducange, P., Vallati, C. A smart system for personal protective equipment detection in industrial environments based on deep learning at the edge. IEEE Access. 10, 110862-111110 (2022).
  4. Selvaraju, R. R., et al. Grad-CAM: Visual explanations from deep networks via gradient-based localization. Int J Comput Vis. 128, 336-359 (2020).
  5. Grad-CAM++: Generalized gradient-based visual explanations for deep convolutional networks. Chattopadhay, A., Sarkar, A., Howlader, P., Balasubramanian, V. N. Proc. IEEE Winter Conf Appl Comput Vis (WACV, , (2018).
  6. Axiom-based grad-CAM: Towards accurate visualization and explanation of CNNs. Fu, R., et al. Proc Brit Mach Vis Conf, , (2020).
  7. Yipeng, L., Junwu, W. Personal protective equipment detection for construction workers: A novel dataset and enhanced YOLOv5 approach. IEEE Access. 12, 47338-47358 (2024).
  8. BN, R., Guru, R. Small object detection for indoor assistance to the blind using YOLO NAS small and super gradients. arXiv preprint. , (2024).
  9. Yolov9: Learning what you want to learn using programmable gradient information. Wang, C. Y., Yeh, I. H., Liao, H. Y. M. Eur Conf Comput Vis, , Springer Nature. Switzerland, Cham. (2024).
  10. Searching for mobilenetv3. Howard, A., et al. Proc. IEEE/CVF Int Conf Comput Vis, , https://ieeexplore.ieee.org/document/9008835 (2019).
  11. Liu, B., et al. YOLO-M: An efficient YOLO variant with MobileOne backbone for real-time license plate detection. Proc Int Semin Artif Intell Netw Inf Technol (AINIT). , IEEE. (2024).
  12. Ma, X., et al. Light-YOLOv4: An edge-device oriented target detection method for remote sensing images. IEEE J Sel Top Appl Earth Obs Remote Sens. 14, 10808-10820 (2021).
  13. Scaling up your kernels to 31x31: Revisiting large kernel design in CNNs. Ding, X., Zhang, X., Han, J., Ding, G. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2022/papers/Ding_Scaling_Up_Your_Kernels_to_31x31_Revisiting_Large_Kernel_Design_CVPR_2022_paper.pdf (2022).
  14. Black-box explanation of object detectors via saliency maps. Petsiuk, V., Jain, R., Manjunatha, V. Proc. IEEE/CVF Conf. Comput. Vis. Pattern Recognit, , (2020).
  15. He, L., et al. Research and application of YOLOv11-based object segmentation in intelligent recognition at construction sites. Buildings. 14 (12), 3777(2024).
  16. Liu, Q., Lv, J., Zhang, C. MAE-YOLOv8-based small object detection of green crisp plum in real complex orchard environments. Comput Electron Agric. 226, 109458(2024).
  17. Fast r-cnn. Girshick, R. Proc IEEE Int Conf Comput Vis, , https://www.cv-foundation.org/openaccess/content_iccv_2015/papers/Girshick_Fast_R-CNN_ICCV_2015_paper.pdf (2015).
  18. Detrs beat yolos on real-time object detection. Zhao, Y., et al. Proc IEEE/CVF Conf Comput Vis. Pattern Recognit, , https://openaccess.thecvf.com/content/CVPR2024/papers/Zhao_DETRs_Beat_YOLOs_on_Real-time_Object_Detection_CVPR_2024_paper.pdf (2024).

Acceso restringido. Inicie sesión o comience una prueba gratuita para ver este contenido.

Reimpresiones y permisos

Etiquetas

Inspecci n de l neas de transmisi nAlgoritmo YOLOv11Computaci n en el bordeDetecci n de objetosTransformada de ndulaExtracci n de caracter sticas multiescalaPrecisi n de detecci nModelo ligeroInterpretabilidad del modelo