Los datos de imagen para este estudio se recogieron de entornos de operación eléctrica con los permisos necesarios. Todas las imágenes fueron anonimizadas sin que se conservara información personal identificable. Este estudio se centra en detectar equipos de protección individual más que en identificar a las personas. Como la investigación solo implica el desarrollo de algoritmos utilizando datos anonimizados, no se requería aprobación ética.
El siguiente protocolo detalla un procedimiento completo para diseñar, entrenar y evaluar un modelo de detección de objetos ligero, de alto rendimiento e inherentemente interpretable, denominado WTLS-YOLOv11n, para la detección de Equipos de Protección Personal (EPP). El software utilizado en este estudio está listado en la Tabla de Materiales.
Marco arquitectónico general
El modelo propuesto WTLS-YOLOv11n se basa en la línea base YOLOv11n. La metodología central consiste en reemplazar o mejorar sistemáticamente módulos clave en la columna vertebral y la cabeza para mejorar el rendimiento, la eficiencia y la interpretabilidad.
El modelo propuesto WTLS-YOLOv11n se basa en la línea base YOLOv11n. La metodología central consiste en reemplazar o mejorar sistemáticamente módulos clave en la columna vertebral y la cabeza para mejorar el rendimiento, la eficiencia y la interpretabilidad. El paradigma arquitectónico general de YOLOv11n, que consiste en una columna vertebral, un cuello y una cabeza, se mantuvo en el modelo propuesto. En la columna vertebral, módulos específicos C3K2 fueron reemplazados por los propuestos módulos C3K2-WTConv para mejorar la extracción de características. En la cabeza, la cabeza de detección original fue reemplazada por la propuesta cabeza compuesta de detección compartida ligera (LSCD) para reducir la complejidad del modelo. La arquitectura completa del modelo propuesto WTLS-YOLOv11n, en contraste con la línea base, se ilustra en la Figura 1.
Diseño de módulos C3K2-WTConv
Este módulo está diseñado para reemplazar los módulos convolucionales estándar dentro de la columna vertebral YOLOv11n. Su diseño se guía por dos objetivos principales: (a) ampliar de forma eficiente el campo receptivo del modelo para capturar información contextual a múltiples escalas sin aumentar significativamente el número de parámetros o la complejidad computacional, y (b) aprender representaciones de características más robustas e inherentemente interpretables descomponiendo explícitamente mapas de características en el dominio de la frecuencia.
Diseño de la capa Core WTConv
La capa fundamental WTConv (Convolución de Transformada de Wavelet) está diseñada para implementar la Transformada de Wavelet de Haar Discreta 2D. Este proceso se realiza mediante un conjunto de núcleos de wavelet específicos:
Núcleos de ondas: La transformada se implementa mediante cuatro núcleos de convolución en profundidad fijos y no entrenógenes (F_LL, F_LH, F_HL, F_HH), que corresponden a las funciones base de wavelet de Haar. Estos núcleos son responsables de descomponer el mapa de características de entrada en sus componentes de baja y alta frecuencia.
Descomposición y muestreo descendente: Estos núcleos se aplican al mapa de características de entrada (X) con un paso de 2. Esta única operación realiza eficientemente tanto la descomposición de características como el muestreo espacial descendente, separando la entrada en cuatro subbandas distintas.
Interpretación física de los componentes de salida
Las cuatro subbandas características generadas por la descomposición en wavelet poseen una interpretación física clara. Como se ilustra en la Figura 2, la capa WTConv descompone recursivamente la entrada en los siguientes componentes:
Componente de baja frecuencia (LL): Este componente preserva la estructura general, el contorno y otra información global del objetivo a la mitad de la resolución espacial. Sirve como base para que el modelo entienda la "forma" del objetivo.
Componentes de alta frecuencia (LH, HL, HH): Estos tres componentes capturan detalles de grano fino como bordes y texturas horizontales, verticales y diagonales, respectivamente. Permiten que el modelo se centre en los "detalles" del objetivo.
Integración en la estructura del módulo C3K2
La capa diseñada WTConv está integrada sin problemas en la estructura de cuello de botella C3K2 de YOLOv11n.
Estrategia de reemplazo: Dentro del módulo original C3K2, la capa convolucional estándar 3x3 se reemplaza por la capa WTConv. Este enfoque preserva el mecanismo eficiente de reutilización de características de la arquitectura C3K2 mientras introduce las ventajas de la transformada wavelet, dando lugar al módulo final C3K2-WTConv (estructura detallada mostrada en la Figura 3).
Expansión de campo receptivo en cascada: El proceso WTConv puede aplicarse recursivamente a la salida de baja frecuencia (LL) de la etapa anterior. Este mecanismo de descomposición en cascada permite al modelo analizar características sobre un campo receptivo que aumenta exponencialmente con una sobrecarga computacional mínima, creando así una vía eficiente de descomposición en frecuencia a múltiples escalas.
Diseño de cabeza compartida ligera de detección compartida (LSCD)
Este módulo está diseñado para reemplazar la cabeza de detección original YOLOv11n, con el objetivo principal de reducir drásticamente la complejidad del modelo y la sobrecarga computacional para un despliegue eficiente en dispositivos de borde con recursos limitados. El diseño aborda la significativa redundancia de parámetros que se encuentra en los cabezales de detección estándar de múltiples escalas (estructura detallada mostrada en la Figura 4).
Justificación y objetivos de diseño
Las ramas de predicción independientes para cada escala de características (P3-P5) en la cabeza original de YOLOv11 conducen a un alto número de parámetros. El LSCD introduce una estrategia híbrida de compartición de parámetros para lograr una eficiencia superior de parámetros mientras preserva capacidades críticas de fusión de características a múltiples escalas.
Compartición de parámetros y mecanismo de fusión de características
El núcleo del LSCD reside en su pipeline de procesamiento de características en dos etapas:
Preprocesamiento específico de escala: Para cada mapa de características de entrada desde el mástil (P3, P4, P5), se aplica una convolución 1x1 no compartida seguida de una capa de Normalización de Grupo (GN). Este primer paso permite a la red aprender transformaciones de canal específicas por escala, asegurando que las características únicas de cada nivel de característica se preserven antes de la fusión.
Fusión eficiente a escala cruzada: Tras el preprocesado, se emplean una serie de módulos compartidos 3x3 Convolution-GN para realizar la fusión de características principales a diferentes escalas. Al compartir pesos, estos módulos aprenden un patrón generalizado de fusión de características, que es la principal fuente de reducción de parámetros. Este diseño obliga al modelo a aprender representaciones de fusión más robustas y universales.
Adaptación dinámica de escalas y optimización de ramas
Para compensar cualquier posible pérdida de información por compartir peso y perfeccionar la precisión de las predicciones, se introducen dos mecanismos adicionales:
Capa de Escala Aprendible: Se añade una capa de Escala Aprendible para cada escala de detección. Esta capa introduce un escalar aprendible por escala que repondera dinámicamente las características fusionadas, permitiendo al modelo enfatizar o suprimir de forma adaptativa las características según el tamaño de los objetos objetivo prevalentes a esa escala.
Rama de clasificación optimizada: La rama de clasificación se mejora utilizando la función de activación Softmax para la distribución de probabilidades e incorporando una capa de Normalización de Grupo (GN). Esto estabiliza el entrenamiento de la tarea de clasificación y mejora la robustez de las predicciones de confianza, una técnica demostrada eficaz en arquitecturas como FCOS.
Diseño mejorado de la función de pérdida (MPDIoU)
La función de pérdida se rediseña para abordar específicamente los desafíos de la regresión precisa de la caja delimitadora para objetivos pequeños, saturados y de formas irregulares, que son comunes en escenarios de detección de EPP.
Motivación y limitaciones de la pérdida tradicional de IoU
Las pérdidas basadas en el IoU estándar sufren varios inconvenientes críticos en este contexto:
Gradientes nulos: Cuando las cajas predichas y las de verdad no se solapan, el IoU es cero y el gradiente de pérdida desaparece, frenando el proceso de aprendizaje.
Insensibilidad a la alineación: Varias configuraciones de caja delimitadora pueden obtener la misma puntuación de IoU, haciendo que la función de pérdida sea insensible a la calidad de la alineación (por ejemplo, desviación del punto central frente a la desadaptación de forma).
Bajo rendimiento en objetos pequeños: Para objetivos pequeños, incluso pequeñas desviaciones de píxeles pueden ser significativas, pero a menudo resultan en cambios insignificantes en el valor de IoU, lo que conduce a una localización imprecisa.
Adoptando la pérdida de Distancia Mínima de Puntos IoU (MPDIoU)
Para superar las limitaciones mencionadas, el protocolo sustituye la pérdida estándar por la pérdida IO por Distancia Mínima de Puntos (MPDIoU). MPDIoU mejora la métrica estándar de IoU incorporando un término de penalización que penaliza directamente la distancia entre las cajas predicha y la de verdad real, incluso cuando no se solapan.
Mecanismo central: El término de penalización se deriva de la distancia euclidiana entre los puntos de esquina correspondientes de la caja predicha (pred) y la caja de la verdad fundamental (gt). Específicamente, se calculan las distancias al cuadrado de las esquinas
superior izquierda ) y las esquinas inferiores derechas (
) siguientes:
(1)
(2)
Para asegurar que la penalización sea invariante a la escala, esta distancia se normaliza por las dimensiones de la caja más pequeña que encierra y cubre tanto la caja predicha como la de la verdad fundamental. Sea w y h el ancho y la altura de esta caja que encierra, respectivamente. La métrica MPDIoU se formula entonces como:
(3)
Finalmente, la función de pérdida MPDIoU (LMPDIoU) se define como:
LMPDIoU = 1 - MPDIoU (4)
Ventajas clave: Este término de penalización geométrica aborda directamente los problemas mencionados a: i) proporcionar un gradiente significativo y distinto de cero incluso cuando las cajas no se solapan, evitando así que el gradiente se anule y asegurando una optimización continua del modelo, ii) ofreciendo una mayor sensibilidad a desviaciones de posición, tamaño y relación de aspecto, lo cual es fundamental para la localización precisa de elementos pequeños y diversos de EPI, iii) proporcionar señales de gradiente más estables y consistentes durante todo el entrenamiento, lo que promueve una convergencia más rápida y resulta en una precisión de localización superior.
Conjuntos de datos y configuración experimental
Conjunto de datos de detección de EPI autoconstruido
Establecimos un conjunto de datos de detección de EPI que contenía 5.000 imágenes de alta resolución procedentes de operaciones de líneas de transmisión eléctrica, anotadas con LabelImg y convertidas al formato YOLO TXT. El conjunto de datos incluye cinco categorías: cascos de seguridad (1.245 ocasiones), arneses de seguridad (1.128 casos), brazaletes (892 ocasiones), estado de trabajo en altura (1.056 ocasiones) y estado a nivel del suelo (1.124 ocasiones). Los datos se dividen en conjuntos de entrenamiento (4.000 imágenes), validación (500 imágenes) y de prueba (500 imágenes). Las imágenes presentan condiciones desafiantes, incluyendo iluminación extrema, oclusión intensa (23% con cobertura >50%) y fondos industriales complejos. Durante el entrenamiento se aplicaron técnicas estándar de aumento (volteo aleatorio, rotación, jitter de color, mosaico).
Conjunto de datos PASCAL de COV para pruebas de generalización
Para evaluar la capacidad de generalización del modelo más allá de los escenarios de operación de potencia, utilizamos el conjunto de datos PASCAL VOC, que combina VOC2007 y VOC2012 para un total de 21.503 imágenes. Siguiendo la práctica estándar, utilizamos 11.540 imágenes de VOC2012 para entrenamiento y validación, y 9.963 imágenes de VOC2007 para pruebas. El conjunto de datos de COV contiene 20 categorías de objetos en diversos escenarios reales. Aunque los objetos específicos difieren de nuestras categorías de EPI, los desafíos de detección (variación de escala, oclusión, fondos complejos) son similares, lo que lo hace adecuado para evaluar las capacidades generales de detección y la transferibilidad del modelo.
Detalles de implementación
Este protocolo describe el procedimiento para entrenar y evaluar el modelo. Se asume que el usuario tiene acceso al código fuente, a un entorno Python adecuado y a los conjuntos de datos preparados.
Preparación de sistemas y entorno
Se utilizaba una estación de trabajo equipada con una GPU NVIDIA con al menos 24 GB de VRAM para asegurar suficiente memoria para el entrenamiento (por ejemplo, NVIDIA GeForce RTX 4090). El framework de aprendizaje profundo PyTorch (versión 1.12.0 o superior) junto con su correspondiente kit de herramientas CUDA se instaló en la estación de trabajo. La instalación se verificó abriendo un terminal y ejecutando el comando "python -c 'import torch; print(torch.cuda.is_available())'", que se esperaba que devolviera "True". Los paquetes Python requeridos se instalaban navegando hasta el directorio raíz del proyecto y ejecutando el comando "pip install -r requirements.txt". Este comando instalaba automáticamente dependencias como numpy, opencv-python, pyyaml, tensorboard y torchvision. Se verificó la preparación del conjunto de datos para asegurar que las imágenes de entrenamiento estuvieran localizadas en /data/train/images/ y que los archivos de anotación estuvieran en /data/train/labels/ en formato YOLO (ancho de clase x_center y_center altura). El mismo proceso de verificación se aplicó a los conjuntos de datos de validación (/datos/val/) y prueba (/datos/test/).
Configuración de entrenamiento
El archivo de configuración config/wtls_yolov11n.yaml se abría usando un editor de texto para configurar los parámetros de entrenamiento. Las rutas de datos se configuraban localizando el parámetro 'path' y configurándolo en el directorio raíz del conjunto de datos, mientras que los parámetros 'train', 'val' y 'test' se verificaban para apuntar a los subdirectorios correctos. Se confirmó que el parámetro 'nc' (número de clases) coincidía con el conjunto de datos, que se estableció en 5 para la detección de EPI. Los hiperparámetros de entrenamiento se configuraron con el número de épocas en 300 para el entrenamiento completo y el tamaño del lote en 16, con la comprensión de que este valor podía ajustarse según la disponibilidad de memoria de la GPU y reducirse a 8 si se producían errores de falta de memoria. El tamaño de la imagen de entrada (imgsz) se estableció en 640, y se confirmó que el optimizador era SGD con una tasa de aprendizaje inicial (lr0) de 0,01. Se verificó que la caída del peso era de 0,0005 y el momento se fijó en 0,937. Las técnicas de aumento de datos estaban habilitadas usando los ajustes configurados por defecto, que incluían aumento de mosaico (mosaico: 1.0), giro horizontal aleatorio con probabilidad del 50% y jitter de color con parámetros hsvh: 0.015, hsvs: 0.7 y hsvv : 0.4. Los parámetros de utilización de hardware se configuraron con el número de trabajadores en 8 para los hilos de CPU usados en la carga de datos, y el parámetro del dispositivo en 0 para usar la primera GPU, con la opción de ponerlo en "0,1" para entrenamiento multi-GPU si era necesario.
Ejecución del entrenamiento del modelo
El entrenamiento de modelos se inicializaba desde la línea de comandos ejecutando el comando "python train.py --cfg config/wtls_yolov11n.yaml --weights ''--data data.yaml", donde el parámetro --cfg especificaba el archivo de configuración del modelo, el parámetro --weights se establecía en una cadena vacía para entrenar desde cero (alternativamente, yolov11n.pt podía usarse para aprendizaje por transferencia), y el parámetro --data especificaba la configuración del conjunto de datos. Durante el entrenamiento se observaron indicadores de convergencia para seguir el rendimiento del modelo. En las primeras 50 épocas, se observó una rápida disminución de la pérdida, con box_loss descendiendo de aproximadamente 1,5 a 0,8. Entre las épocas 50 y 150, se observó una mejora constante al box_loss disminuir de aproximadamente 0,8 a 0,5. Durante las épocas 150 a 300, se produjo la fase de ajuste fino con box_loss estabilizándose alrededor de 0,4 a 0,5. Se esperaba que la métrica de validación mAP@0,5 alcanzara más del 85% para la época 200. Se verificó el guardado de puntos de control para asegurar que el entrenamiento guardara automáticamente los puntos de control cada 10 épocas en las corridas de directorio/entrenamiento/experiencia/pesos/. Se confirmó la presencia de last.pt (punto de control más reciente) y best.pt (punto de control más alto de mAP), con la expectativa de que cada archivo de punto de control tenga aproximadamente entre 5 y 6 MB de tamaño. El progreso del entrenamiento podía ser monitorizado opcionalmente usando TensorBoard abriendo un nuevo terminal y ejecutando el comando "tensorboard --logdir runs/train", luego navegando por un navegador hasta http://localhost:6006 para ver gráficos en tiempo real de curvas de pérdida, horario de tasas de aprendizaje y tendencias de los mAP. Los problemas comunes se abordaron mediante procedimientos de resolución de problemas, donde los errores de CUDA fuera de memoria se resolvieron reduciendo el tamaño del lote a 8 o 4, los valores de pérdida de NaN se abordaron reduciendo la tasa de aprendizaje a 0,005, y los estancamientos de mAP por debajo del 80% se investigaron verificando la corrección de las anotaciones y aumentando las épocas de entrenamiento a 400.
Protocolo de evaluación de modelos
Se realizó un procedimiento de evaluación multifacético para validar de forma exhaustiva la eficacia, eficiencia e interpretabilidad del modelo propuesto.
Evaluación cuantitativa del rendimiento
Métricas de rendimiento
Evalúa la precisión del modelo usando la Precisión Media Media (mAP) en un umbral de IoU de 0,5 (mAP@0,5), Precisión y Recordo. Evalúa la eficiencia del modelo midiendo el número total de Parámetros (M) y Operaciones en coma flotante (FLOPs, G). Mide la velocidad de inferencia en Frames Por Segundo (FPS) tanto en una GPU de nivel servidor como en un dispositivo edge. Para pruebas de dispositivos en el borde, configura el modo de potencia en máximo rendimiento y calienta el modelo con 100 inferencias ficticias antes de registrar FPS por encima de 500 imágenes de prueba.
Comparación con modelos de última generación: Compara el modelo propuesto WTLS-YOLOv11n con su línea base directa (YOLOv11n) y una amplia gama de detectores, incluyendo modelos YOLO basados en CNN convencionales (YOLOv5n, YOLOv8n, YOLOv9s), un detector de dos etapas (Faster R-CNN) y un detector basado en transformadores (RT-DETR). Entrena todos los modelos durante 300 épocas usando sus hiperparámetros predeterminados recomendados. Registra todas las métricas definidas en la sección de métricas de rendimiento para cada modelo tanto en el conjunto de datos de EPI autoconstruido como en el conjunto de datos PASCAL VOC. Para la evaluación de COV, entrena en los conjuntos combinados VOC2012 trainval y VOC2007 trainval, y luego prueba en VOC2007 conjunto de pruebas siguiendo el protocolo estándar.
Estudios de ablación: Realizar un estudio sistemático de ablación para diseccionar las contribuciones individuales de los componentes propuestos.
Análisis de Efectividad de Componentes: Partiendo del modelo base YOLOv11n, integra incrementalmente el módulo C3K2-WTConv, la cabeza LSCD y la pérdida MPDIoU. Para cada configuración, reentrenar el modelo para 300 épocas usando hiperparámetros idénticos (tamaño de lote 16, tasa de aprendizaje 0,01, optimizador SGD). Registra los cambios en mAP, precisión, recuerdo, parámetros, FLOPs y FPS para verificar la eficacia de cada componente. Calcula mejoras porcentuales en relación con la línea base para cada métrica.
Análisis de colocación: Para determinar la colocación óptima del módulo C3K2-WTConv, intégralo en diferentes partes de la arquitectura de la red. Prueba tres configuraciones: (i) integración solo de columna vertebral, (ii) integración solo de cuello y (iii) integración completa tanto en columna como en cuello. Entrenar cada configuración durante 300 épocas y comparar las puntuaciones resultantes de mAP@0,5 para identificar la estrategia de integración más eficaz. Selecciona la configuración óptima para todos los experimentos posteriores.
Evaluación cualitativa del rendimiento
Visualización de resultados de detección: Selecciona entre 12 y 15 imágenes representativas del conjunto de pruebas que presenten escenarios reales desafiantes, incluyendo contraluz fuerte, oclusión de objetos pesados, fondos complejos y ángulos de cámara poco convencionales. Para cada modelo de comparación (línea base, YOLOv5n, YOLOv8n, YOLOv9s y WTLS-YOLOv11n), se ejecuta inferencia sobre estas imágenes usando un umbral de confianza de 0,25 y un umbral de IoU de 0,45. Genera y renderiza las salidas de detección (cajas delimitadoras con etiquetas de clase y puntuaciones de confianza) en estas imágenes. Organizar las visualizaciones en formato de cuadrícula donde las filas representen diferentes escenarios y las columnas distintos modelos.
Análisis de robustez: Compara visualmente los resultados de detección renderizados de diferentes modelos. Evalúa la robustez y superioridad del modelo propuesto contando y marcando casos de falsos negativos (objetos pasados por alto), falsos positivos (detecciones incorrectas) y detecciones duplicadas (múltiples casillas para un solo objeto con IoU > 0,7 entre predicciones). Utiliza círculos rojos para resaltar detecciones problemáticas en la figura de visualización. Calcular tasas de falsos negativos por modelo y conteos de falsos positivos a través de las imágenes seleccionadas de prueba. Extraer y comparar las puntuaciones medias de confianza para las detecciones verdaderamente positivas entre modelos.
Análisis de interpretabilidad
Para validar la interpretabilidad inherente otorgada por el módulo C3K2-WTConv, se realizó un procedimiento de visualización sobre imágenes de entrada seleccionadas. El modelo entrenado WTLS-YOLOv11n se cargó y se registró un gancho delantero en el módulo C3K2-WTConv en la cuarta capa de la columna vertebral. Se realizaba la propagación hacia adelante sobre la imagen de entrada y se capturaba el tensor de características de salida. A partir del tensor de forma de la característica capturado [lote, canales, altura, ancho], se separaban los canales correspondientes a diferentes componentes de frecuencia. El primer 25% de los canales se designó como componente de baja frecuencia (LL) y el 75% restante como componentes de alta frecuencia (LH, HL, HH). Para cada tipo de componente de frecuencia, se calculó la media entre todos los canales dentro de ese componente para crear mapas de activación de un solo canal. La norma L2 se aplicó a través de dimensiones espaciales cuando fue necesario para enfatizar activaciones fuertes. Los mapas de activación se normalizaron a rango [0, 1] y se aplicó un mapa de colores (por ejemplo, 'jet'). Los mapas de calor se redimensionaron para coincidir con la resolución original de la imagen de entrada usando interpolación bilineal. El mapa de calor de baja frecuencia y el mapa de calor de alta frecuencia se superpusieron a la imagen original con un 40% de transparencia para crear visualizaciones interpretables que mostraran dónde se centra el modelo en características estructurales frente a texturas.
Para validar rigurosamente que las decisiones de detección dependen de características en el dominio de la frecuencia, se realizó un análisis cuantitativo. Se seleccionó un subconjunto de 200 a 300 imágenes del conjunto de pruebas que contenía detecciones exitosas (puntuación de confianza superior a 0,5). Este subconjunto se aseguró para representar escenarios diversos y evitar el sesgo de muestreo. Para cada imagen del subconjunto se realizó la propagación hacia adelante y se extrajo la salida del módulo C3K2-WTConv en la cuarta capa de columna central. El tensor de características se dividió en componentes de baja frecuencia (LL, el primer 25% de los canales) y de alta frecuencia (HF, el 75% restante de los canales). Para cada imagen, se calculó la fuerza absoluta media de activación a lo largo de las dimensiones espaciales (altura y ancho) para ambos componentes de frecuencia. La intensidad de la LL se calculó como la media del valor absoluto de las características de LL en todas las posiciones espaciales, y la intensidad de la HF se calculó como la media del valor absoluto de las características de la HF en todas las posiciones espaciales. Estos valores se registraban junto con la puntuación máxima de confianza en detección para esa imagen. Utilizando los datos recogidos (LL_strength, HF_strength, confidence_score) en todas las imágenes, se calcularon los coeficientes de correlación de Pearson. Se calculó la correlación entre la fuerza del LL y la puntuación de confianza, así como la correlación entre la fuerza del HF y la puntuación de confianza. Se utilizó software estadístico o la función scipy.stats.pearsonr de Python para obtener tanto coeficientes de correlación (r) como valores p. La significación estadística se evaluó utilizando un umbral de valor p de 0,05, donde un valor p menor a 0,05 indicaba que la correlación era estadísticamente significativa. Se comparó la magnitud de los coeficientes de correlación para determinar qué componente de frecuencia tenía mayor asociación con la confianza en la detección. Las siguientes métricas se registraron en un formato estructurado: coeficiente de correlación LL (rLL) y valor p (pLL), coeficiente de correlación HF (rHF) y valor p (pHF), fortalezas medias de activación (mediaLL, mediaHF) y tamaño de muestra (número de imágenes analizadas). Los resultados esperados fueron que las características de baja frecuencia mostrarían una correlación positiva más fuerte con las puntuaciones de confianza (rLL mayor a 0,60, p menor que 0,001) en comparación con las características de alta frecuencia (rHF aproximadamente de 0,40 a 0,50, p menor que 0,01), lo que indica que las decisiones de detección estaban predominantemente impulsadas por la información estructural capturada en el componente LL.
Este análisis cuantitativo estableció la interpretabilidad más allá de las limitaciones de la visualización cualitativa. La combinación de análisis de correlación (demostrando asociación estadística) y visualización en el dominio de la frecuencia (mostrando la atención espacial) proporcionó pruebas empíricas rigurosas de que la toma de decisiones del modelo se basaba genuinamente en características estructurales de baja frecuencia, tal como se pretendía por diseño.
Resultados esperados: Las características de baja frecuencia deberían mostrar una correlación positiva más fuerte con las puntuaciones de confianza (rLL > 0,60, p < 0,001) en comparación con las características de alta frecuencia (rHF≈ 0,40-0,50, p < 0,01), lo que indica que las decisiones de detección están predominantemente impulsadas por la información estructural capturada en el componente LL.
Este análisis cuantitativo establece una interpretabilidad más allá de la visualización cualitativa. La combinación del análisis de correlación (que demuestra la asociación estadística) y la visualización en el dominio de la frecuencia (mostrando la atención espacial) proporciona pruebas empíricas rigurosas de que la toma de decisiones del modelo se basa genuinamente en características estructurales de baja frecuencia tal y como está previsto por el diseño.