Todos los experimentos descritos se realizaron utilizando el entorno de hardware y software documentado en la Tabla 2 y en la Tabla de Materiales. Se utilizaron las mismas versiones del controlador gráfico, CUDA, cuDNN, Python, NumPy, PyTorch y torchvision durante todo el preprocesamiento, entrenamiento, inferencia y evaluación. El entorno completo de hardware y software se resume en la Tabla 2 y en la Tabla de Materiales. La Tabla 1 resume los conjuntos de datos procesados de entrenamiento, validación y prueba junto con las estadísticas de topología a nivel de imagen. La Tabla 2 resume la configuración común utilizada para todos los métodos de comparación.
Resultados de la evaluación comparativa
La evaluación comparativa siguió las particiones comunes de datos, operaciones de preprocesamiento, controles de entrenamiento y definiciones de métricas especificadas en las secciones 7–9 del protocolo. Tabla 3 compara codificadores visuales generales, modelos alineados por partes, representaciones de prendas basadas en grafos, redes de recuperación cruzada de moda, métodos de fusión de topología y apariencia, y métodos de recuperación visual para comercio electrónico, todos evaluados utilizando el mismo protocolo de consulta por imagen. Los métodos específicos del dominio incluyen el Histograma de Características de Topología con Fusión de Color y Textura (TFH-CT), la Red en Cascada Guiada por Atención (AGC-Net), la Red de Aprendizaje de Características Multiescala y Multigranular (MMFL-Net) y la Recuperación de Moda mediante Red Residual con Optimización por Enjambre de Garcetas (FARE-RNET). Todas las métricas de evaluación en la Tabla 3 se reportan como la media y la desviación estándar muestral obtenidas en cinco ejecuciones independientes utilizando las mismas semillas aleatorias, manifiesto de entrenamiento, manifiesto de validación, manifiesto de prueba, asignación consulta-galería e implementación de métricas. Los valores p- apareados se calcularon por separado para SCI, SDI, Recall@5, mAP y coeficiente de silueta, comparando cada método con el método propuesto bajo condiciones de semillas aleatorias emparejadas. Estos resultados proporcionan la base cuantitativa para las posteriores visualizaciones estructurales, análisis de recuperación, agrupamiento y análisis orientados al diseño.
Resultados representativos del protocolo e interpretación
La ejecución exitosa del protocolo se indica cuando el grafo del componente a nivel de imagen, reconstruido a partir de los archivos guardados de análisis y grafos, coloca cada nodo activo dentro de su región correspondiente de la prenda y conserva los tipos de relación registrados en la matriz de adyacencia tipificada, como se muestra en Figura 5C. La respuesta sensible a la estructura debe permanecer concentrada en el primer plano de la prenda, como se muestra en Figura 5D. Figura 6E presenta un resultado de recuperación esperado en el que el método propuesto reduce la influencia del fondo rojo y recupera prendas de la parte superior del cuerpo en lugar de objetos rojos no relacionados. Figura 6B–G también demuestra que el ordenamiento en la recuperación está respaldado por las relaciones entre componentes a nivel de imagen y la correspondencia de componentes tras la fusión. Este resultado refleja la recuperación de la categoría general de la prenda, aunque la longitud de las mangas y la topología local aún varíen entre las muestras recuperadas.
Los casos comunes de fallo incluyen la activación dominada por textura en Figura 5B, la recuperación guiada por el color de fondo en la fila superior de Figura 6, y la activación residual del fondo en Figura 7. La Figura 7 debe interpretarse como una localización parcial porque la respuesta dominante sigue el contorno ampliado del cuerpo inferior y el límite derecho de la prenda, mientras que persiste una activación residual en regiones adyacentes del fondo. La localización solo se considera respaldada estructuralmente cuando la matriz de diferencia topológica, la matriz de diferencia de relaciones geométricas, el grafo de diferencia de componentes tras la fusión y la respuesta espacial identifican regiones de la prenda consistentes. Un punto caliente espacial sin cambios correspondientes en la matriz o componentes indica interferencia visual más que evidencia estructural.
Se considera válida una ejecución del protocolo cuando cada imagen aceptada produce un mapa de probabilidad semántica normalizado, una matriz de relaciones con K filas y K columnas, matrices de características de apariencia y estructurales con K filas y 512 columnas, y un vector de características fusionadas finito vinculado al identificador de imagen correcto. La inspección visual debe confirmar que la topología siga los componentes de la prenda, que la respuesta del primer plano supere a la del fondo, y que los resultados de recuperación estén guiados por la categoría y la estructura de la prenda, y no por el color del fondo. Los mapas de probabilidad fragmentados, los nodos de componentes ausentes, las matrices no numéricas, las respuestas difusas del fondo o la recuperación dominada por el color indican una ejecución fallida y requieren inspeccionar el análisis sintáctico, la construcción del grafo, la fusión de características o la carga de puntos de control.
Análisis visual de las respuestas de los componentes de la prenda a nivel de imagen
Figura 5 compara la línea base ResNet-50 con el modelo sensible a componentes utilizando la misma imagen de prenda. Figura 5B muestra el mapa de activación de clase para la línea base de apariencia. Figura 5C presenta el grafo de componentes de prenda a nivel de imagen reconstruido a partir del mapa de probabilidad restringido al primer plano, la matriz de centros de componentes, la matriz de adyacencia tipificada, la máscara de nodos inactivos y la asignación de etiquetas de componentes generados en las secciones 3 y 4 del protocolo. Figura 5D presenta la respuesta de activación de la representación fusionada. No se utiliza ningún estimador de postura humana ni anotación de articulaciones humanas para generar la Figura 5C.
La respuesta basal se concentró en regiones de textura local en la prenda inferior y no siguió de forma consistente el contorno completo de la prenda, como se muestra en la Figura 5B. En la Figura 5C, cada nodo corresponde al centro de una región activa del componente de la prenda, mientras que cada arista representa un límite común en primer plano o una relación de orden vertical predefinida. El grafo refleja la organización de las regiones de la prenda y no representa articulaciones anatómicas humanas. La respuesta sensible a la estructura cubrió el primer plano principal de la prenda manteniendo una activación menor en la mayoría de las áreas de fondo, como se muestra en la Figura 5D. Estos resultados indican que el grafo de componentes y el módulo de fusión de características redujeron la activación dominada por la textura en la imagen evaluada.
Análisis de similitud estructural de prendas y resultados de referencia para el diseño
Figura 6 presenta la clasificación de recuperación junto con la evidencia estructural utilizada para interpretarla. El grafo del componente de consulta en la Figura 6B registra las regiones activas de la prenda y sus relaciones tipificadas, mientras que la matriz en la Figura 6C muestra el patrón de relaciones proporcionado a la propagación del grafo. Los resultados de referencia en la Figura 6D siguen dominados por señales visuales rojas. Los resultados sensibles a la estructura en la Figura 6E conservan la categoría de prenda de la parte superior del cuerpo a través de diferentes colores y fondos. El grafo de componentes del resultado mejor clasificado en la Figura 6F permite una comparación directa con el grafo de consulta, y la matriz de correspondencia en la Figura 6G revela si los componentes que comparten los mismos identificadores permanecen alineados tras la fusión guiada por estructura. La correspondencia diagonal debe interpretarse conjuntamente con los nodos ausentes y las relaciones del grafo modificadas. Una alta similitud visual sin acuerdo en el grafo no constituye una recuperación estructural exitosa.
Las prendas recuperadas conservan la categoría general, pero las diferencias en la configuración de las mangas y en las relaciones de componentes locales indican una correspondencia incompleta a nivel fino. El método propuesto alcanzó un Recall@5 del 89,2 % y un mAP del 86,4 %, como se informa en Tabla 3. Estos valores cuantitativos describen el rendimiento de clasificación, mientras que Figura 6B–G proporciona evidencia estructural intermedia que respalda la interpretación. Por lo tanto, la conclusión de la recuperación se limita a una mayor resistencia a la interferencia del color de fondo y una organización más fuerte de los componentes a nivel de imagen bajo la consulta probada.
Apoyo para el análisis de respuesta a diferencias estructurales y diseño
El mapa de calor de diferencia-respuesta pura en la Figura 7H muestra que la respuesta dominante se concentra en la silueta ampliada del cuerpo inferior y en el límite derecho de la prenda de la imagen objetivo. La superposición en la Figura 7I muestra que la respuesta más intensa permanece alineada con el primer plano principal de la prenda, mientras que la activación más débil en las regiones adyacentes de la cortina y la pared persiste como interferencia residual de fondo. La respuesta espacial debe interpretarse junto con la evidencia de los gráficos de componentes y matrices presentada en las Figuras 7C–G. Una respuesta se considera una diferencia estructural válida solo cuando la región de alta respuesta de la prenda es coherente con el cambio de adyacencia, el cambio de relación geométrica y el patrón de distancia entre componentes tras la fusión.
Se acepta una diferencia estructural solo cuando el cambio en la adyacencia tipificada en Figura 7E o el cambio en la relación geométrica en Figura 7F van acompañados de un aumento en la distancia de los componentes en Figura 7G y de una respuesta espacial alineada con el primer plano en Figura 7H,I. La región ampliada del cuerpo inferior y el límite derecho de la prenda cumplen este criterio transversal. La activación sobre la cortina y la pared no corresponde a cambios en los nodos de componentes, patrones de relación ni distancias de componentes fusionados, por lo que se rechaza como interferencia residual no estructural. El resultado respalda la localización de diferencias a nivel de imagen, pero no establece variación en los patrones de costura ni en los parámetros de construcción.
Análisis de distribución espacial de características y agrupamiento estructural
El análisis de la distribución del espacio de características latentes revela la capacidad del modelo para discriminar la semántica estructural de la ropa. Este análisis examina si la información previa estructural organiza prendas con diferentes configuraciones topológicas en variedades de características distintas. Se seleccionaron cinco categorías estructurales representativas del conjunto de prueba: prendas superiores de manga corta, pantalones, faldas, abrigos largos y vestidos. Los vectores de características de alta dimensión se proyectaron sobre un plano bidimensional mediante el método de incrustación estocástica de vecinos distribuidos en forma t (t-SNE). Se evaluó la cohesión de muestras similares y la separación de muestras disímiles para caracterizar la organización de la semántica estructural en el espacio de características. La distribución t-SNE del espacio de características sensible a la estructura se muestra en la Figura 8.
La proyección t-SNE formó cinco regiones principales de características con una superposición limitada entre categorías vecinas, como se muestra en la Figura 8A. En la Figura 8B se presentan muestras representativas correspondientes a las cinco regiones de categoría. El SCI de 0.81 refleja la compacidad de las muestras que comparten la misma etiqueta estructural, y el SDI de 0.71 refleja la separación entre muestras con etiquetas estructurales diferentes, como se informa en la Tabla 3 y se visualiza en la Figura 8. Estos índices deben interpretarse como medidas de distribución en el espacio de características y no establecen directamente una tasa de falsa alarma. Las prendas de manga corta y las faldas ocuparon regiones principales diferentes en el espacio de características proyectado, mientras que un pequeño número de muestras permaneció cerca de los límites de categorías vecinas, como se muestra en la Figura 8A. Los pantalones y los vestidos también mostraron una clara separación de las categorías vecinas. Esta distribución indica que la distribución previa en el grafo contribuyó a la organización estructural a nivel de categoría sin producir una separación completa de los grupos. La evaluación separa la calidad de la representación de la eficacia de recuperación. El SCI evalúa si las prendas que comparten la misma etiqueta estructural permanecen compactas en el espacio de características aprendido, mientras que el SDI evalúa si las prendas con etiquetas estructurales diferentes permanecen separadas. Estas métricas corresponden al objetivo de representación estructural del protocolo. Recall@5 mide si una prenda estructuralmente relevante aparece dentro de los primeros cinco resultados recuperados, mientras que el mAP mide la calidad del ordenamiento en todas las muestras relevantes de la galería. Estas métricas corresponden al objetivo de recuperación de diseño de referencia. El coeficiente de silueta se utilizó únicamente para evaluar el rendimiento del agrupamiento, ya que el SCI y el SDI ya caracterizan la organización en el espacio de características.
Figura 9 muestra los resultados brutos de cinco ejecuciones para cuatro métodos representativos sin normalización entre métodos. Figura 9A presenta SCI y SDI en su escala original, mientras que Figura 9B presenta Recall@5 y mAP como porcentajes. Los marcadores de ejecuciones individuales y las líneas de error de desviación estándar muestran la variación asociada al entrenamiento del modelo, y no solo el ordenamiento agregado. La línea base basada en apariencia alcanzó un SCI de 0,62, mientras que el método propuesto alcanzó un SCI de 0,81 y un SDI de 0,71 (Tabla 3 y Figura 9A). Los resultados de SCI y SDI indican una mayor compacidad dentro de las etiquetas y una mejor separación entre etiquetas en el entorno evaluado. El método propuesto alcanzó un Recall@5 del 89,2 % y un mAP del 86,4 % (Tabla 3 y Figura 9B). Estas métricas de recuperación evalúan propiedades diferentes del ordenamiento y se interpretan por separado de SCI y SDI. El orden consistente de los métodos en las cuatro métricas indica acuerdo entre la calidad de la representación y el rendimiento en recuperación, pero no implica que la mejora relativa sea idéntica en las cuatro dimensiones de evaluación.
Análisis de experimentos de ablación y efectividad de los módulos estructurales
El experimento de ablación compara el modelo completo con variantes en las que se elimina la información estructural previa o el módulo de fusión. Las tres configuraciones utilizan las mismas imágenes de referencia y objetivo, lo que permite una comparación directa de la respuesta del fondo y la concentración de la localización. La variante sin la información estructural previa elimina el grafo del componente de la prenda a nivel de imagen y sus restricciones de relación, dependiendo únicamente del armazón convolucional para extraer características de apariencia; la variante sin fusión conserva la inferencia del grafo pero elimina la pirámide de características, utilizando únicamente características semánticas de alto nivel. Los mapas de calor de diferencia visualizados revelan los roles específicos de cada módulo en la supresión de ruido y la definición de los límites; en Figura 10 se muestra una comparación cualitativa de las respuestas de diferencia estructural bajo distintas configuraciones de módulos.
Los mapas de respuesta en la Figura 10C–E se generaron utilizando una escala de respuesta compartida y configuraciones de superposición idénticas. La variante sin el modelo estructural previo produjo una activación intensa en el fondo izquierdo y alrededor de regiones ambientales no relacionadas, como se muestra en la Figura 10C. La variante sin el módulo de fusión redujo parte de esa respuesta fuera de la prenda, pero aún conservó una dispersión más amplia sobre la prenda inferior y la región circundante del lado derecho, como se muestra en la Figura 10D. El modelo completo contrajo aún más la respuesta dominante hacia el primer plano principal de la prenda, como se muestra en la Figura 10E. La Figura 10F visualiza directamente la diferencia en las respuestas restringidas al primer plano entre la variante sin fusión y el modelo completo, mostrando que el modelo completo suprime la dispersión lateral residual mientras conserva la respuesta principal alineada con la prenda. Estos resultados indican que el modelo estructural previo redujo principalmente el ruido ambiental y que el módulo de fusión mejoró adicionalmente la concentración de la respuesta y la alineación estructural. La Figura 10E representa una mejora relativa, no una eliminación completa de la activación del fondo.
Tabla 4 muestra el SCI, el SDI y el Recall@5 para las variantes sin el modelo estructural previo, sin el módulo de fusión y con el modelo completo. La eliminación del modelo estructural previo redujo el SCI de 0,81 a 0,65 y disminuyó el Recall@5 del 89,2 % al 74,5 %. La eliminación del módulo de fusión redujo el SDI de 0,71 a 0,64 y disminuyó el Recall@5 del 89,2 % al 85,1 %, una reducción de 4,1 puntos porcentuales. Estos resultados indican que el modelo estructural previo tuvo un efecto mayor sobre la coherencia estructural y la recuperación, mientras que la fusión de características mejoró el alineamiento entre la apariencia y la información estructural.
El análisis de eficiencia compara el costo computacional del modelo completo con la línea base ResNet-50. La línea base ResNet-50 requirió 25,6 millones de parámetros y 4,1 mil millones de operaciones de punto flotante. El modelo completo con conciencia de estructura requirió 29,3 millones de parámetros y 5,4 mil millones de operaciones de punto flotante. El tiempo promedio de inferencia fue de 15 milisegundos por imagen para la línea base y de 22 milisegundos por imagen para el modelo completo, un aumento de 7 milisegundos. Este resultado indica un costo computacional medible que debe considerarse al implementar el protocolo en flujos de trabajo sensibles al tiempo (Tabla 5). El peso de la restricción estructural se determinó a partir de la división de validación antes de la evaluación final en la prueba. Se examinó el Recall@5 en validación con pesos de restricción estructural de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 y 2,0. Se fijó un peso de 1,0 para cada entrenamiento posterior y ejecución de prueba. Figura 11 documenta la selección basada en validación de un peso de restricción estructural de 1,0.

Figura 1: Flujo general del protocolo de aprendizaje de características de imágenes de prendas consciente de la estructura. La imagen de entrada de la prenda se procesa mediante una rama de características de apariencia y una rama de características estructurales que utiliza análisis semántico y modelado de grafos espaciales. Las dos representaciones se procesan mediante el módulo de fusión guiado por estructura para generar la característica final consciente de la estructura. La pérdida de consistencia estructural, la pérdida de discriminación estructural y la pérdida de relación estructural restringen conjuntamente el espacio de características. La figura muestra cómo se integran la apariencia de la prenda y la topología de sus componentes a lo largo del aprendizaje de características. Haga clic aquí para ver una versión más grande de esta figura.

Figura 2: Construcción de una topología previa de componentes de prenda a nivel de imagen. (A) La imagen de entrada de la prenda I. (B) El mapa de componentes visuales restringido al primer plano P, en el cual siete colores indican regiones de prenda a nivel de imagen. Todos los píxeles del fondo se excluyen de los canales de componentes. (C) El grafo de relación de componentes a nivel de imagen G. Los nodos representan regiones visibles de la prenda, las aristas sólidas representan límites compartidos en primer plano y las relaciones punteadas representan un orden vertical predefinido. El mapa y el grafo permiten la recuperación de imágenes y la comparación de estructuras visuales. No representan piezas de patrones de costura, geometría de costuras, estructuras de pinzas, parámetros de escalado ni instrucciones de corte. Haga clic aquí para ver una versión más grande de esta figura.

Figura 3: Módulo de fusión de características guiado por estructura. La característica estructural se transforma mediante el mapeo lineal y la función de activación Ψ para generar un peso estructural. El peso estructural modula la característica de apariencia mediante multiplicación elemento a elemento. La característica de apariencia modulada y la característica estructural se concatenan y proyectan mediante Wc, tras lo cual se suma la característica estructural residual para generar la característica final del componente. La figura muestra que la información estructural regula el ponderado de la característica de apariencia antes de la fusión final. Haga clic aquí para ver una versión más grande de esta figura.

Figura 4: Optimización en el espacio de características bajo restricciones de consistencia estructural. (A) Las muestras que pertenecen a la misma clase estructural se acercan mediante la pérdida de consistencia estructural, mientras que sus relaciones internas entre componentes se conservan mediante la pérdida de relación estructural. (B) Las muestras de diferentes clases estructurales se separan mediante la pérdida de discriminación estructural. La figura muestra cómo los tres objetivos estructurales aumentan conjuntamente la compacidad dentro de las clases y la separación entre clases. Haga clic aquí para ver una versión más grande de esta figura.

Figura 5: Respuestas representativas de las características de la prenda y visualización mediante grafo de componentes. (A) La imagen de entrada de la prenda. (B) La respuesta de activación por clase de la línea base de apariencia ResNet-50. (C) El grafo de componentes a nivel de imagen se reconstruyó a partir del mapa de componentes restringido al primer plano, la matriz de centros de componentes, la matriz de adyacencia tipificada, la máscara de nodos inactivos y la asignación de etiquetas de componentes, que se guardaron durante las secciones 3 y 4 del protocolo. Los nodos indican regiones activas de la prenda, las aristas continuas indican límites comunes en primer plano y las aristas discontinuas indican relaciones de orden vertical predefinidas. (D) La respuesta de activación de la representación fusionada consciente de componentes. La comparación muestra la diferencia entre la activación dominada por textura y la activación guiada por regiones de la prenda. Haga clic aquí para ver una versión más grande de esta figura.

Figura 6: Resultados de recuperación y evidencia estructural intermedia bajo interferencia de fondo rojo. (A) La imagen de consulta. (B) El grafo de componentes de la consulta se genera a partir de los centros de componentes guardados y la matriz de adyacencia tipificada. (C) La matriz de adyacencia tipificada de la consulta, donde los valores de la matriz distinguen relaciones inactivas, límites comunes de primer plano y relaciones de orden vertical predefinidas. (D) Los tres primeros resultados de recuperación fueron producidos por la línea base de apariencia. (E) Los tres primeros resultados fueron producidos por la representación sensible a la estructura. (F) El grafo de componentes del resultado con mayor clasificación según el método sensible a la estructura. (G) La matriz de correspondencia de componentes tras la fusión entre la consulta y el resultado mejor clasificado. Una alta correspondencia diagonal indica concordancia entre componentes con los mismos identificadores, mientras que respuestas débiles o desplazadas indican organización de componentes ausentes o no coincidentes. Los resultados de recuperación conservan la categoría general de la parte superior del cuerpo, pero no establecen una concordancia completa en la configuración de las mangas y la topología local. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7: Seguimiento de diferencias estructurales desde la topología de prenda a nivel de imagen hasta la respuesta espacial. (A) La imagen de referencia. (B) La imagen objetivo. (C) El gráfico de componentes de referencia. (D) El gráfico de componentes objetivo. Ambos gráficos se reconstruyen a partir de los centros de componentes guardados y de matrices de adyacencia tipificadas. (E) La matriz de diferencia de adyacencia tipificada. (F) La diferencia en la relación geométrica se deriva del desplazamiento de los centros de los componentes, la dispersión espacial y los cambios en el peso de la relación. (G) El gráfico de diferencia de componentes tras la fusión, donde la intensidad del nodo representa la distancia normalizada entre los vectores de componentes fusionados correspondientes y el ancho del borde representa el cambio en el peso de la relación. (H) El mapa de calor de respuesta de diferencia puramente espacial se generó utilizando la misma escala de respuesta fija que la superposición. (I) La respuesta superpuesta sobre la imagen objetivo. Se acepta una diferencia estructural solo cuando el cambio en la adyacencia, el cambio en la relación geométrica, el cambio en la distancia de los componentes y la respuesta de calor alineada con el primer plano permanecen consistentes. La activación del fondo sin evidencia correspondiente de componentes o relaciones se considera interferencia residual y no una diferencia válida en la estructura de la prenda. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8: Agrupamiento en el espacio de características con conocimiento de la estructura. (A) La proyección t-SNE de prendas de manga corta, pantalones, faldas, abrigos largos y vestidos. Las cinco categorías forman regiones principales de características con superposición limitada cerca de los límites entre ellas. (B) Imágenes de prueba representativas asignadas a las cinco categorías de prendas, con el color del borde correspondiente al color de la categoría en (A). La figura muestra una organización estructural a nivel de categoría, manteniendo al mismo tiempo un número reducido de muestras cerca de las regiones de categorías adyacentes. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9: Comparación del rendimiento bruto entre la estructura del espacio de características y los objetivos de clasificación por recuperación. (A) SCI y SDI para la línea base basada en apariencia, el modelo de estructura débil, el modelo de estructura explícita y el método propuesto. (B) Recall@5 y mAP para los mismos cuatro métodos. Los marcadores grandes indican la media aritmética de cinco ejecuciones independientes, las líneas de error indican la desviación estándar muestral y los marcadores pequeños indican los resultados por ejecución. SCI y SDI se muestran en una escala fija de cero a uno, mientras que Recall@5 y mAP se muestran en una escala porcentual fija de cero a cien. No se aplica ninguna normalización min-máx ni reescalado entre métodos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 10: Respuestas de diferencia estructural bajo distintas configuraciones de módulos. (A) La imagen de referencia. (B) La imagen objetivo. (C) La respuesta de la variante sin la información previa de estructura. (D) La respuesta de la variante sin el módulo de fusión. (E) La respuesta del modelo completo. (C–E) se representan utilizando la misma escala normalizada de respuesta, mapa de colores y configuraciones de superposición. (F) La diferencia absoluta de respuesta restringida al primer plano entre la variante sin fusión y el modelo completo. El modelo completo conserva la respuesta principal alineada con la prenda, mientras reduce la dispersión residual fuera de la región estructural principal. La comparación muestra que la información previa de estructura reduce la interferencia fuera de la prenda y que el módulo de fusión refina aún más la respuesta estructural. Haga clic aquí para ver una versión más grande de esta figura.

Figura 11: Selección basada en validación del peso de la restricción estructural. Se informa la recuperación en validación@5 para pesos de restricción estructural de 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 y 2.0. Cada punto indica la media aritmética de cinco ejecuciones de validación, y cada barra de error representa la desviación estándar muestral. El peso se fijó en 1.0 antes de la evaluación final en la prueba. Esta figura documenta el procedimiento de selección de parámetros y no constituye una contribución arquitectónica independiente. Haga clic aquí para ver una versión más grande de esta figura.
Tabla 1: Asignación del conjunto de datos y estadísticas de topología a nivel de imagen en los subconjuntos de prendas S1 a S5. La tabla informa los recuentos de imágenes de entrenamiento, validación, prueba y totales, junto con el número medio de componentes semánticos, el recuento de nodos activos, el recuento de aristas tipificadas y el recuento de puntos de referencia anotados en el plano de la imagen para cada nivel estructural. Todos los valores se generaron a partir de los manifiestos de datos procesados. Los recuentos de imágenes de entrenamiento, validación y prueba se obtuvieron de los manifiestos finales de subconjuntos tras la revisión estructural, el control de grupos duplicados y la inspección de fugas, mientras que las estadísticas de topología se calcularon a partir de los registros finales de grafos utilizando el mismo orden de componentes y definiciones de relaciones que los aplicados durante la evaluación del modelo. Haga clic aquí para descargar este archivo.
Tabla 2: Entorno computacional, configuración de entrada, aumentación, representación, optimización, función de pérdida y ajustes de reproducibilidad utilizados a lo largo del protocolo. La tabla informa las versiones exactas del sistema operativo, procesador, memoria instalada, unidad de procesamiento gráfico, memoria gráfica, controlador gráfico, CUDA, cuDNN, Python, NumPy, PyTorch y torchvision, junto con el tamaño de la imagen, construcción del lote, optimizador, programa de tasa de aprendizaje, número de épocas, semillas aleatorias, dimensiones de la representación y pesos objetivos estructurales. Cada valor está vinculado al archivo software_versions.txt, configs/protocol.yaml o al registro de entrenamiento correspondiente. Haga clic aquí para descargar este archivo.
Tabla 3: Comparación cuantitativa de modelos generales de representación visual, modelos de prendas basados en grafos y métodos específicos del dominio para la recuperación de moda. La tabla presenta el enfoque de recuperación, la modalidad de consulta, SCI, SDI, Recall@5, mAP y el coeficiente de silueta para once métodos bajo las mismas particiones de datos y protocolo de evaluación. Cada métrica se reporta como la media y la desviación estándar muestral obtenidas a partir de cinco ejecuciones independientes. Los valores de p reportados se obtuvieron mediante pruebas t pareadas de dos colas que comparan cada método de comparación con el método propuesto, utilizando resultados generados con las mismas cinco semillas aleatorias. El método propuesto se considera la fila de referencia. Haga clic aquí para descargar este archivo.
Tabla 4: Resultados de ablación para el modelo estructural previo y el módulo de fusión de características. La tabla muestra el SCI, el SDI y el Recall@5 para la variante sin el modelo estructural previo, la variante sin el módulo de fusión y el modelo completo. La eliminación del modelo estructural previo produce una reducción mayor en el SCI y el Recall@5, mientras que la eliminación del módulo de fusión reduce el SDI y la alineación de la respuesta. El modelo completo registra el valor más alto en las tres métricas. Haga clic aquí para descargar este archivo.
Tabla 5: Eficiencia computacional del modelo de referencia ResNet-50 y del modelo completo con estructura consciente. La tabla muestra los parámetros entrenables, las operaciones de punto flotante por imagen y el tiempo promedio de inferencia por imagen en el mismo entorno de hardware y software descrito en la Tabla 2 y en la Tabla de Materiales. Ambos modelos utilizan la misma resolución de imagen, configuración de lote de inferencia, operaciones de preprocesamiento y procedimiento de temporización. El modelo completo añade 3,7 millones de parámetros, 1,3 mil millones de operaciones de punto flotante y 7 milisegundos de tiempo de inferencia por imagen en comparación con el modelo de referencia. Haga clic aquí para descargar este archivo.