Todos los experimentos descritos se realizaron utilizando el entorno de hardware y software documentado en la Tabla 2 y en la Tabla de Materiales. Se utilizaron las mismas versiones del controlador gráfico, CUDA, cuDNN, Python, NumPy, PyTorch y torchvision durante todo el preprocesamiento, entrenamiento, inferencia y evaluación. El entorno completo de hardware y software se resume en la Tabla 2 y en la Tabla de Materiales. La Tabla 1 resume los conjuntos de datos procesados de entrenamiento, validación y prueba junto con las estadísticas de topología a nivel de imagen. La Tabla 2 resume la configuración común utilizada para todos los métodos de comparación.
Resultados de la evaluación comparativa
La evaluación comparativa siguió las particiones comunes de datos, operaciones de preprocesamiento, controles de entrenamiento y definiciones de métricas especificadas en las secciones 7 a 9 del protocolo. Tabla 3 compara codificadores visuales generales, modelos alineados por partes, representaciones de prendas basadas en grafos, redes de recuperación cruzada de moda, métodos de fusión de topología y apariencia, y métodos de recuperación visual para comercio electrónico, todos evaluados utilizando el mismo protocolo de consulta por imagen. Los métodos específicos del dominio incluyen el Histograma de Características de Topología con Fusión de Color y Textura (TFH-CT), la Red en Cascada Guiada por Atención (AGC-Net), la Red de Aprendizaje de Características Multiescala y Multigranular (MMFL-Net) y la Recuperación de Moda mediante Red Residual con Optimización por Enjambre de Garcetas (FARE-RNET). Todas las métricas de evaluación en la Tabla 3 se reportan como la media y la desviación estándar muestral obtenidas en cinco ejecuciones independientes utilizando las mismas semillas aleatorias, manifiesto de entrenamiento, manifiesto de validación, manifiesto de prueba, asignación de consulta-galería e implementación de métricas. Los valores p- apareados se calcularon por separado para SCI, SDI, Recall@5, mAP y coeficiente de silueta, comparando cada método con el método propuesto bajo condiciones de semillas aleatorias emparejadas. Estos resultados proporcionan la base cuantitativa para los análisis estructurales, de visualización, recuperación, agrupamiento y orientados al diseño que siguen.
Resultados representativos del protocolo e interpretación
La ejecución exitosa del protocolo se indica cuando el grafo del componente a nivel de imagen, reconstruido a partir de los archivos guardados de análisis y grafos, coloca cada nodo activo dentro de su región correspondiente de la prenda y conserva los tipos de relación registrados en la matriz de adyacencia tipificada, como se muestra en Figura 5C. La respuesta sensible a la estructura debe permanecer concentrada en el primer plano de la prenda, como se muestra en Figura 5D. Figura 6E presenta un resultado esperado de recuperación en el que el método propuesto reduce la influencia del fondo rojo y recupera prendas de la parte superior del cuerpo en lugar de objetos rojos no relacionados. Figura 6B–G también demuestra que el ordenamiento en la recuperación está respaldado por las relaciones entre componentes a nivel de imagen y la correspondencia de componentes tras la fusión. Este resultado refleja la recuperación de la categoría general de la prenda, aunque la longitud de las mangas y la topología local aún varíen entre las muestras recuperadas.
Los casos comunes de fallo incluyen la activación dominada por textura en la Figura 5B, la recuperación guiada por el color de fondo en la fila superior de la Figura 6 y la activación residual del fondo en la Figura 7. La Figura 7 debe interpretarse como una localización parcial porque la respuesta dominante sigue el contorno ampliado del cuerpo inferior y el límite derecho de la prenda, mientras que persiste una activación residual en regiones adyacentes del fondo. La localización solo se considera respaldada estructuralmente cuando la matriz de diferencia topológica, la matriz de diferencia de relaciones geométricas, el grafo de diferencia de componentes tras la fusión y la respuesta espacial identifican regiones de la prenda consistentes. Un punto caliente espacial sin cambios correspondientes en la matriz o componentes indica interferencia visual y no evidencia estructural.
Una ejecución de protocolo se considera válida cuando cada imagen aceptada produce un mapa de probabilidad semántica normalizado, una matriz de relaciones con K filas y K columnas, matrices de características de apariencia y estructurales con K filas y 512 columnas, y un vector de características fusionadas finito asociado al identificador de imagen correcto. La inspección visual debe confirmar que la topología siga los componentes de la prenda, que la respuesta del primer plano supere a la del fondo, y que los resultados de recuperación se guíen por la categoría y estructura de la prenda y no por el color del fondo. Los mapas de probabilidad fragmentados, los nodos de componentes ausentes, las matrices no numéricas, las respuestas difusas del fondo o la recuperación dominada por el color indican una ejecución fallida y requieren inspección del análisis, construcción del grafo, fusión de características o carga del punto de control.
Análisis visual de las respuestas de los componentes de la prenda a nivel de imagen
Figura 5 compara la línea base ResNet-50 con el modelo sensible a componentes utilizando la misma imagen de prenda. Figura 5B muestra el mapa de activación de clase para la línea base de apariencia. Figura 5C presenta el grafo de componentes de prenda a nivel de imagen reconstruido a partir del mapa de probabilidad restringido al primer plano, la matriz de centros de componentes, la matriz de adyacencia tipificada, la máscara de nodos inactivos y la asignación de etiquetas de componentes generados en las secciones 3 y 4 del protocolo. Figura 5D presenta la respuesta de activación de la representación fusionada. No se utiliza ningún estimador de postura humana ni anotación de articulaciones humanas para generar la Figura 5C.
La respuesta basal se concentró en regiones de textura locales de la prenda inferior y no siguió de forma consistente el contorno completo de la prenda, como se muestra en Figura 5B. En la Figura 5C, cada nodo corresponde al centro de una región activa de componente de prenda, mientras que cada arista representa un límite común en primer plano o una relación de orden vertical predefinida. El grafo refleja la organización de las regiones de la prenda y no representa articulaciones anatómicas humanas. La respuesta sensible a la estructura cubrió el primer plano principal de la prenda manteniendo una activación menor en la mayoría de las áreas de fondo, como se muestra en la Figura 5D. Estos resultados indican que el grafo de componentes y el módulo de fusión de características redujeron la activación dominada por la textura en la imagen evaluada.
Análisis de similitud estructural de prendas y resultados de referencia para el diseño
Figura 6 presenta la clasificación de recuperación junto con la evidencia estructural utilizada para interpretarla. El grafo del componente de consulta en la Figura 6B registra las regiones activas de la prenda y sus relaciones tipificadas, mientras que la matriz en la Figura 6C muestra el patrón de relaciones proporcionado a la propagación del grafo. Los resultados de referencia en la Figura 6D siguen dominados por pistas visuales rojas. Los resultados sensibles a la estructura en la Figura 6E conservan la categoría de prenda de la parte superior del cuerpo a través de diferentes colores y fondos. El grafo de componentes del resultado mejor clasificado en la Figura 6F permite una comparación directa con el grafo de consulta, y la matriz de correspondencia en la Figura 6G revela si los componentes que comparten los mismos identificadores permanecen alineados tras la fusión guiada por estructura. La correspondencia diagonal debe interpretarse conjuntamente con los nodos ausentes y las relaciones del grafo modificadas. Una alta similitud visual sin acuerdo en el grafo no constituye una recuperación estructural exitosa.
Las prendas recuperadas conservan la categoría general, pero las diferencias en la configuración de las mangas y en las relaciones de componentes locales indican una correspondencia incompleta a nivel fino. El método propuesto alcanzó un Recall@5 de 89,2 % y un mAP de 86,4 %, como se informa en Tabla 3. Estos valores cuantitativos describen el rendimiento de clasificación, mientras que Figura 6B–G proporciona evidencia estructural intermedia que respalda la interpretación. Por lo tanto, la conclusión del proceso de recuperación se limita a una mayor resistencia a la interferencia del color de fondo y una organización más fuerte de componentes a nivel de imagen bajo la consulta evaluada.
Respuesta de diferencia estructural y apoyo para el análisis de diseño
El mapa térmico de respuesta de diferencia pura en la Figura 7H muestra que la respuesta dominante se concentra en la silueta ampliada del cuerpo inferior y en el límite derecho de la prenda de la imagen objetivo. La superposición en la Figura 7I muestra que la respuesta más intensa permanece alineada con el primer plano principal de la prenda, mientras que la activación más débil en las regiones adyacentes de la cortina y la pared persiste como interferencia residual de fondo. La respuesta espacial debe interpretarse junto con la evidencia de gráficos de componentes y matrices presentada en las Figuras 7C–G. Una respuesta se considera una diferencia estructural válida solo cuando la región de alta respuesta de la prenda es consistente con el cambio de adyacencia, el cambio de relación geométrica y el patrón de distancia entre componentes tras la fusión.
Se acepta una diferencia estructural solo cuando el cambio en la adyacencia tipificada en Figura 7E o el cambio en la relación geométrica en Figura 7F van acompañados de un aumento en la distancia de los componentes en Figura 7G y una respuesta espacial alineada con el primer plano en Figura 7H,I. La región inferior ampliada del cuerpo y el límite derecho de la prenda cumplen este criterio transversal. La activación sobre la cortina y la pared no corresponde a cambios en los nodos de componentes, patrones de relación ni distancias de componentes fusionados, y por lo tanto se rechaza como interferencia residual no estructural. El resultado respalda la localización de diferencias a nivel de imagen, pero no establece variaciones en los patrones de costura ni en los parámetros de construcción.
Análisis de distribución espacial de características y agrupamiento estructural
El análisis de la distribución del espacio latente de características revela la capacidad del modelo para discriminar la semántica estructural de la ropa. Este análisis examina si el modelo previo estructural organiza prendas con diferentes configuraciones topológicas en variedades de características distintas. Se seleccionaron cinco categorías estructurales representativas del conjunto de prueba: prendas de manga corta, pantalones, faldas, abrigos largos y vestidos. Los vectores de características de alta dimensión se proyectaron sobre un plano bidimensional mediante el método de incrustación estocástica de vecinos distribuidos en forma t (t-SNE). Se evaluó la cohesión de muestras similares y la separación de muestras disímiles para caracterizar la organización de la semántica estructural en el espacio de características. La distribución t-SNE del espacio de características sensible a la estructura se muestra en Figura 8.
La proyección t-SNE formó cinco regiones principales de características con un solapamiento limitado entre categorías vecinas, como se muestra en Figura 8A. En Figura 8B se presentan muestras representativas correspondientes a las cinco regiones de categoría. El SCI de 0,81 refleja la compacidad de las muestras que comparten la misma etiqueta estructural, y el SDI de 0,71 refleja la separación entre muestras con etiquetas estructurales diferentes, como se informa en Tabla 3 y se visualiza en Figura 8. Estos índices deben interpretarse como medidas de distribución en el espacio de características y no establecen directamente una tasa de falsa alarma. Las prendas de manga corta y las faldas ocuparon regiones principales diferentes en el espacio de características proyectado, mientras que un pequeño número de muestras permaneció cerca de los límites de categorías vecinas, como se muestra en Figura 8A. Los pantalones y los vestidos también mostraron una clara separación de las categorías vecinas. Esta distribución indica que la distribución previa del grafo contribuyó a la organización estructural a nivel de categoría sin producir una separación completa de los grupos. La evaluación separa la calidad de la representación de la eficacia de recuperación. El SCI evalúa si las prendas que comparten la misma etiqueta estructural permanecen compactas en el espacio de características aprendido, mientras que el SDI evalúa si las prendas con etiquetas estructurales diferentes permanecen separadas. Estas métricas corresponden al objetivo de representación estructural del protocolo. Recall@5 mide si una prenda estructuralmente relevante aparece dentro de los primeros cinco resultados recuperados, mientras que el mAP mide la calidad del ordenamiento en todas las muestras relevantes del conjunto de referencia. Estas métricas corresponden al objetivo de recuperación diseño-referencia. El coeficiente de silueta se utilizó únicamente para evaluar el rendimiento del agrupamiento, ya que el SCI y el SDI ya caracterizan la organización en el espacio de características.
Figura 9 muestra los resultados brutos de cinco ejecuciones para cuatro métodos representativos sin normalización entre métodos. Figura 9A presenta SCI y SDI en su escala original, mientras que Figura 9B presenta Recall@5 y mAP como porcentajes. Los marcadores de ejecuciones individuales y las líneas de error de desviación estándar muestran la variación asociada al entrenamiento del modelo, y no solo el ordenamiento agregado. La línea base basada en apariencia alcanzó un SCI de 0,62, mientras que el método propuesto alcanzó un SCI de 0,81 y un SDI de 0,71 (Tabla 3 y Figura 9A). Los resultados de SCI y SDI indican una mayor compacidad dentro de las etiquetas y una mejor separación entre etiquetas en la configuración evaluada. El método propuesto alcanzó un Recall@5 del 89,2 % y un mAP del 86,4 % (Tabla 3 y Figura 9B). Estas métricas de recuperación evalúan propiedades diferentes del ordenamiento y se interpretan por separado de SCI y SDI. El orden consistente de los métodos en las cuatro métricas indica acuerdo entre la calidad de la representación y el rendimiento en recuperación, pero no implica que la mejora relativa sea idéntica en las cuatro dimensiones de evaluación.
Análisis de experimentos de ablación y efectividad de los módulos estructurales
El experimento de ablación compara el modelo completo con variantes en las que se elimina el prior estructural o el módulo de fusión. Las tres configuraciones utilizan las mismas imágenes de referencia y objetivo, lo que permite una comparación directa de la respuesta del fondo y la concentración de la localización. La variante sin el prior estructural elimina el grafo del componente de prenda a nivel de imagen y sus restricciones de relación, dependiendo únicamente del armazón convolucional para extraer características de apariencia; la variante sin fusión conserva la inferencia del grafo pero elimina la pirámide de características, utilizando únicamente características semánticas de alto nivel. Los mapas de calor de diferencia visualizados revelan los roles específicos de cada módulo en la supresión de ruido y la definición de bordes; en Figura 10 se muestra una comparación cualitativa de las respuestas de diferencia estructural bajo distintas configuraciones de módulos.
Los mapas de respuesta en Figura 10C–E se representaron utilizando una escala de respuesta compartida y configuraciones de superposición idénticas. La variante sin el modelo estructural previo produjo una activación intensa en el fondo izquierdo y alrededor de regiones ambientales no relacionadas, como se muestra en la Figura 10C. La variante sin el módulo de fusión redujo parte de esa respuesta fuera de la prenda, pero aún conservó una difusión más amplia sobre la prenda inferior y la región circundante del lado derecho, como se muestra en la Figura 10D. El modelo completo contrajo aún más la respuesta dominante hacia el primer plano principal de la prenda, como se muestra en la Figura 10E. La Figura 10F visualiza directamente la diferencia en las respuestas restringidas al primer plano entre la variante sin fusión y el modelo completo, mostrando que el modelo completo suprime la dispersión lateral residual mientras conserva la respuesta principal alineada con la prenda. Estos resultados indican que el modelo estructural previo redujo principalmente el ruido ambiental y que el módulo de fusión mejoró adicionalmente la concentración de la respuesta y el alineamiento estructural. La Figura 10E representa una mejora relativa, no una eliminación completa de la activación del fondo.
Tabla 4 informa el SCI, el SDI y el Recall@5 para las variantes sin el modelo estructural previo, sin el módulo de fusión y con el modelo completo. La eliminación del modelo estructural previo redujo el SCI de 0,81 a 0,65 y redujo el Recall@5 de 89,2 % a 74,5 %. La eliminación del módulo de fusión redujo el SDI de 0,71 a 0,64 y redujo el Recall@5 de 89,2 % a 85,1 %, una disminución de 4,1 puntos porcentuales. Estos resultados indican que el modelo estructural previo tuvo un efecto mayor sobre la coherencia estructural y la recuperación, mientras que la fusión de características mejoró la alineación entre la apariencia y la información estructural.
El análisis de eficiencia compara el costo computacional del modelo completo con la línea base ResNet-50. La línea base ResNet-50 requirió 25,6 millones de parámetros y 4.100 millones de operaciones de punto flotante. El modelo completo con estructura integrada requirió 29,3 millones de parámetros y 5.400 millones de operaciones de punto flotante. El tiempo promedio de inferencia fue de 15 milisegundos por imagen para la línea base y de 22 milisegundos por imagen para el modelo completo, un aumento de 7 milisegundos. Este resultado indica un costo computacional medible que debe considerarse al implementar el protocolo en flujos de trabajo sensibles al tiempo.Tabla 5). El peso de la restricción estructural se determinó a partir de la división de validación antes de la evaluación final en la prueba. Se examinó la recuperación (Recall@5) en la validación con pesos de restricción estructural de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 y 2,0. Se fijó un peso de 1,0 para cada entrenamiento posterior y ejecución de prueba. Figura 11 documenta la selección basada en validación de un peso de restricción estructural de 1,0.

Figura 1: Flujo general del protocolo de aprendizaje de características de imágenes de prendas con conciencia de estructura. La imagen de entrada de la prenda se procesa mediante una rama de características de apariencia y una rama de características estructurales que utiliza análisis semántico y modelado de grafos espaciales. Las dos representaciones se procesan mediante el módulo de fusión guiado por estructura para generar la característica final con conciencia de estructura. La pérdida de consistencia estructural, la pérdida de discriminación estructural y la pérdida de relación estructural restringen conjuntamente el espacio de características. La figura muestra cómo se integran la apariencia de la prenda y la topología de sus componentes a lo largo del aprendizaje de características. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Construcción de una topología previa de componentes de prenda a nivel de imagen. (A) La imagen de entrada de la prenda I. (B) El mapa de componentes visuales restringido al primer plano P, en el que siete colores indican regiones de la prenda a nivel de imagen. Todos los píxeles del fondo se excluyen de los canales de componentes. (C) El grafo de relación de componentes a nivel de imagen G. Los nodos representan regiones visibles de la prenda, las aristas sólidas representan límites comunes en el primer plano y las relaciones punteadas representan un orden vertical predefinido. El mapa y el grafo permiten la recuperación de imágenes y la comparación de estructuras visuales. No representan piezas de patrón de costura, geometría de costuras, estructuras de pinzas, parámetros de escalado ni instrucciones de corte. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Módulo de fusión de características guiado por estructura. La característica estructural se transforma mediante la aplicación lineal y la función de activación Ψ para generar un peso estructural. El peso estructural modula la característica de apariencia mediante multiplicación elemento a elemento. La característica de apariencia modulada y la característica estructural se concatenan y proyectan mediante Wc, tras lo cual se añade la característica estructural residual para generar la característica final del componente. La figura muestra que la información estructural regula el ponderado de la característica de apariencia antes de la fusión final. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Optimización del espacio de características bajo restricciones de consistencia estructural. (A) Las muestras que pertenecen a la misma clase estructural se acercan más mediante la pérdida de consistencia estructural, mientras que sus relaciones internas entre componentes se conservan por la pérdida de relación estructural. (B) Las muestras de diferentes clases estructurales se separan mediante la pérdida de discriminación estructural. La figura muestra cómo los tres objetivos estructurales aumentan conjuntamente la compacidad dentro de las clases y la separación entre clases. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Respuestas representativas de características de prendas y visualización del grafo de componentes. (A) La imagen de entrada de la prenda. (B) La respuesta de activación por clase de la línea base de apariencia ResNet-50. (C) El grafo de componentes a nivel de imagen se reconstruyó a partir del mapa de componentes restringido al primer plano, la matriz de centros de componentes, la matriz de adyacencia tipificada, la máscara de nodos inactivos y la asignación de etiquetas de componentes, que se guardaron durante las secciones 3 y 4 del Protocolo. Los nodos indican regiones activas de la prenda, las aristas sólidas indican límites comunes en el primer plano y las aristas punteadas indican relaciones verticales predefinidas. (D) La respuesta de activación de la representación combinada con reconocimiento de componentes. La comparación muestra la diferencia entre la activación dominada por textura y la activación guiada por regiones de la prenda. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Resultados de recuperación y evidencia estructural intermedia bajo interferencia de fondo rojo. (A) La imagen de consulta. (B) El grafo de componentes de consulta se genera a partir de los centros de componentes guardados y la matriz de adyacencia tipificada. (C) La matriz de adyacencia tipificada de la consulta, donde los valores de la matriz distinguen relaciones inactivas, límites comunes de primer plano y relaciones de orden vertical predefinidas. (D) Los tres mejores resultados de recuperación fueron producidos por la línea base de apariencia. (E) Los tres mejores resultados fueron producidos por la representación sensible a la estructura. (F) El grafo de componentes del resultado con mayor clasificación según la representación sensible a la estructura. (G) La matriz de correspondencia de componentes tras la fusión entre la consulta y el resultado mejor clasificado. Una alta correspondencia diagonal indica acuerdo entre componentes con los mismos identificadores, mientras que respuestas débiles o desplazadas indican organización de componentes ausentes o mal emparejados. Los resultados de recuperación conservan la categoría general de la parte superior del cuerpo, pero no establecen un acuerdo completo en la configuración de las mangas y la topología local. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 7: Rastreo de la diferencia estructural desde la topología de la prenda a nivel de imagen hasta la respuesta espacial. (A) La imagen de referencia. (B) La imagen objetivo. (C) El grafo de componentes de referencia. (D) El grafo de componentes objetivo. Ambos grafos se reconstruyen a partir de los centros de componentes guardados y de matrices de adyacencia tipificadas. (E) La matriz de diferencia de adyacencia tipificada. (F) La diferencia en la relación geométrica se deriva del desplazamiento entre los centros de los componentes, la dispersión espacial y los cambios en el peso de la relación. (G) El grafo de diferencia de componentes tras la fusión, donde la intensidad del nodo representa la distancia normalizada entre los vectores de componentes fusionados correspondientes y el ancho del borde representa el cambio en el peso de la relación. (H) El mapa de calor de respuesta de diferencia puramente espacial se generó utilizando la misma escala fija de respuesta que en la superposición. (I) La respuesta superpuesta sobre la imagen objetivo. Se acepta una diferencia estructural solo cuando el cambio en la adyacencia, el cambio en la relación geométrica, el cambio en la distancia entre componentes y la respuesta de calor alineada con el primer plano permanecen consistentes. La activación del fondo sin evidencia correspondiente de componentes o relaciones se considera una interferencia residual y no una diferencia válida en la estructura de la prenda. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Agrupamiento en el espacio de características con conocimiento de la estructura. (A) La proyección t-SNE de prendas de manga corta, pantalones, faldas, abrigos largos y vestidos. Las cinco categorías forman regiones principales de características con superposición limitada cerca de los límites entre ellas. (B) Imágenes de prueba representativas asignadas a las cinco categorías de prendas, con el color del borde correspondiente al color de la categoría en (A). La figura muestra una organización estructural a nivel de categoría, manteniendo un pequeño número de muestras cerca de las regiones de categorías adyacentes. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Comparación de rendimiento bruto entre la estructura del espacio de características y los objetivos de clasificación por recuperación. (A) SCI y SDI para la línea base basada en apariencia, el modelo de estructura débil, el modelo de estructura explícita y el método propuesto. (B) Recall@5 y mAP para los mismos cuatro métodos. Los marcadores grandes indican la media aritmética de cinco ejecuciones independientes, las barras de error indican la desviación estándar muestral y los marcadores pequeños indican los resultados por ejecución. SCI y SDI se muestran en una escala fija de cero a uno, mientras que Recall@5 y mAP se muestran en una escala de porcentaje fija de cero a cien. No se aplicó normalización min-max ni reescalado entre métodos. Haga clic aquí para ver una versión ampliada de esta figura.

Figura 10: Respuestas de diferencia estructural bajo diferentes configuraciones del módulo. (A) La imagen de referencia. (B) La imagen objetivo. (C) La respuesta de la variante sin la información previa de estructura. (D) La respuesta de la variante sin el módulo de fusión. (E) La respuesta del modelo completo. (C–E) se representan utilizando la misma escala de respuesta normalizada, mapa de colores y configuraciones de superposición. (F) La diferencia absoluta de respuesta restringida al primer plano entre la variante sin fusión y el modelo completo. El modelo completo conserva la respuesta principal alineada con la prenda, mientras reduce la dispersión residual fuera de la región estructural principal. La comparación muestra que la información previa de estructura reduce la interferencia fuera de la prenda y que el módulo de fusión refina aún más la respuesta estructural. Haga clic aquí para ver una versión más grande de esta figura.

Figura 11: Selección basada en validación del peso de la restricción estructural. Se informa el Recall@5 de validación para pesos de restricción estructural de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 y 2,0. Cada punto representa la media aritmética de cinco ejecuciones de validación, y cada barra de error indica la desviación estándar muestral. El peso se fijó en 1,0 antes de la evaluación final de prueba. Esta figura documenta el procedimiento de selección de parámetros y no constituye una contribución arquitectónica independiente. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 1: Asignación del conjunto de datos y estadísticas de topología a nivel de imagen en los subconjuntos de prendas S1 a S5. La tabla informa los recuentos de imágenes de entrenamiento, validación, prueba y totales, junto con el número promedio de componentes semánticos, el recuento de nodos activos, el recuento de aristas tipificadas y el recuento de puntos de referencia anotados en el plano de imagen para cada nivel estructural. Todos los valores se generaron a partir de los manifiestos de datos procesados. Los recuentos de imágenes de entrenamiento, validación y prueba se obtuvieron de los manifiestos finales de subconjuntos tras la revisión estructural, el control de grupos duplicados y la inspección de fugas, mientras que las estadísticas de topología se calcularon a partir de los registros finales de grafos utilizando el mismo orden de componentes y definiciones de relaciones aplicadas durante la evaluación del modelo. Haga clic aquí para descargar este archivo.
Tabla 2: Entorno computacional, configuración de entrada, aumentación, representación, optimización, función de pérdida y configuraciones de reproducibilidad utilizadas a lo largo del protocolo. La tabla informa el sistema operativo exacto, procesador, memoria instalada, unidad de procesamiento gráfico, memoria gráfica, controlador gráfico, CUDA, cuDNN, versiones de Python, NumPy, PyTorch y torchvision, junto con el tamaño de la imagen, construcción del lote, optimizador, programa de tasa de aprendizaje, número de épocas, semillas aleatorias, dimensiones de representación y pesos objetivos estructurales. Cada valor está vinculado al archivo software_versions.txt, configs/protocol.yaml o al registro de entrenamiento correspondiente. Haga clic aquí para descargar este archivo.
Tabla 3: Comparación cuantitativa de modelos generales de representación visual, modelos de prendas basados en grafos y métodos específicos del dominio para la recuperación de moda. La tabla presenta el enfoque de recuperación, la modalidad de consulta, SCI, SDI, Recall@5, mAP y el coeficiente de silueta para once métodos bajo las mismas particiones de datos y protocolo de evaluación. Cada métrica se reporta como la media y la desviación estándar muestral obtenidas a partir de cinco ejecuciones independientes. Los valores de p reportados se obtuvieron mediante pruebas t pareadas de dos colas que comparan cada método de comparación con el método propuesto, utilizando resultados generados con las mismas cinco semillas aleatorias. El método propuesto se considera la fila de referencia. Haga clic aquí para descargar este archivo.
Tabla 4: Resultados de ablación para el modelo estructural previo y el módulo de fusión de características. La tabla muestra el SCI, el SDI y el Recall@5 para la variante sin el modelo estructural previo, la variante sin el módulo de fusión y el modelo completo. La eliminación del modelo estructural previo produce una reducción mayor en el SCI y el Recall@5, mientras que la eliminación del módulo de fusión reduce el SDI y la alineación de la respuesta. El modelo completo registra el valor más alto en las tres métricas. Haga clic aquí para descargar este archivo.
Tabla 5: Eficiencia computacional de la línea base ResNet-50 y del modelo completo con estructura incorporada. La tabla muestra los parámetros entrenables, las operaciones de punto flotante por imagen y el tiempo promedio de inferencia por imagen en el entorno exacto de hardware y software documentado en la Tabla 2 y en la Tabla de Materiales. Ambos modelos utilizan la misma resolución de imagen, configuración de lote para inferencia, operaciones de preprocesamiento y procedimiento de medición de tiempo. El modelo completo añade 3,7 millones de parámetros, 1,3 mil millones de operaciones de punto flotante y 7 milisegundos de tiempo de inferencia por imagen en comparación con la línea base. Haga clic aquí para descargar este archivo.