Toutes les expériences rapportées ont été réalisées à l'aide de l'environnement matériel et logiciel documenté dans le Tableau 2 et le Tableau des Matériaux. La même version du pilote graphique, de CUDA, de cuDNN, de Python, de NumPy, de PyTorch et de torchvision a été utilisée tout au long du prétraitement, de l'entraînement, de l'inférence et de l'évaluation. L'environnement matériel et logiciel complet est résumé dans le Tableau 2 et le Tableau des Matériaux. Le Tableau 1 résume les ensembles de données d'entraînement, de validation et de test traités, ainsi que les statistiques topologiques au niveau des images. Le Tableau 2 résume la configuration commune utilisée pour toutes les méthodes de comparaison.
Résultats de l'évaluation comparative
L'évaluation comparative a suivi les partitions de données communes, les opérations de prétraitement, les contrôles d'apprentissage et les définitions de métriques spécifiées dans les sections 7 à 9 du protocole. Tableau 3 compare des encodeurs visuels généraux, des modèles alignés par parties, des représentations de vêtements basées sur des graphes, des réseaux de recherche de mode cross-domaine, des méthodes de fusion topologie-apparence et des méthodes de recherche visuelle en commerce électronique, tous évalués à l'aide du même protocole de requête d'image. Les méthodes spécifiques au domaine comprennent l'histogramme de caractéristiques de topologie avec fusion de couleur et de texture (TFH-CT), le réseau en cascade guidé par l'attention (AGC-Net), le réseau d'apprentissage de caractéristiques multi-échelle et multi-granularité (MMFL-Net) et la recherche de mode utilisant un réseau résiduel avec optimisation par essaim d'egret (FARE-RNET). Toutes les métriques d'évaluation du Tableau 3 sont indiquées sous forme de moyenne et d'écart-type échantillonnal sur cinq exécutions indépendantes utilisant les mêmes graines aléatoires, le même manifeste d'entraînement, le même manifeste de validation, le même manifeste de test, la même attribution requête-galerie et la même implémentation de métrique. Les valeurs de p- appariées ont été calculées séparément pour l'indice SCI, l'indice SDI, le rappel@5, la mAP et le coefficient de silhouette en comparant chaque méthode à la méthode proposée dans des conditions de graines aléatoires appariées. Ces résultats fournissent la base quantitative pour les analyses ultérieures de visualisation structurelle, de recherche, de regroupement et d'orientation conception.
Résultats représentatifs du protocole et interprétation
Une exécution réussie du protocole est indiquée lorsque le graphe de composants au niveau de l'image, reconstruit à partir des fichiers d'analyse syntaxique et de graphe enregistrés, place chaque nœud actif à l'intérieur de la région correspondante du vêtement et préserve les types de relations enregistrés dans la matrice d'adjacence typée, comme illustré dans la Figure 5C. La réponse tenant compte de la structure doit rester concentrée sur le premier plan du vêtement, comme montré dans la Figure 5D. La Figure 6E présente un résultat de recherche attendu dans lequel la méthode proposée réduit l'influence du fond rouge et retrouve des vêtements du haut du corps plutôt que des objets rouges non pertinents. Les Figures 6B–G démontrent également que le classement des résultats de recherche est soutenu par les relations entre composants au niveau de l'image et par la correspondance des composants après fusion. Ce résultat reflète la récupération de la catégorie grossière du vêtement, bien que la longueur des manches et la topologie locale varient encore parmi les échantillons retrouvés.
Les cas d'échec courants incluent l'activation dominée par la texture dans la Figure 5B, la récupération guidée par la couleur de fond dans la rangée supérieure de la Figure 6, et l'activation résiduelle de fond dans la Figure 7. La Figure 7 doit être interprétée comme une localisation partielle, car la réponse dominante suit la silhouette élargie du bas du corps et la limite du vêtement droit, tandis que l'activation résiduelle persiste dans les régions adjacentes de l'arrière-plan. La localisation est considérée comme soutenue structurellement uniquement lorsque la matrice de différence topologique, la matrice de différence de relation géométrique, le graphe de différence des composants après fusion et la réponse spatiale identifient des régions de vêtement cohérentes. Un point chaud spatial sans changements correspondants dans la matrice ou les composants indique une interférence visuelle plutôt qu'une preuve structurelle.
Un protocole exécuté est considéré comme valide lorsque chaque image acceptée produit une carte de probabilité sémantique normalisée, une matrice de relations composée de K lignes et K colonnes, des matrices de caractéristiques d'apparence et de structure comportant K lignes et 512 colonnes, ainsi qu'un vecteur de caractéristiques fusionnées fini associé à l'identifiant correct de l'image. Un examen visuel doit confirmer que la topologie suit les composants du vêtement, que la réponse au premier plan dépasse celle de l'arrière-plan, et que les résultats de recherche sont guidés par la catégorie et la structure du vêtement plutôt que par la couleur de l'arrière-plan. Des cartes de probabilité fragmentées, des nœuds de composants manquants, des matrices non numériques, des réponses diffuses de l'arrière-plan ou une recherche dominée par la couleur indiquent un échec de l'exécution et nécessitent un examen du traitement, de la construction du graphe, de la fusion des caractéristiques ou du chargement du point de contrôle.
Analyse visuelle des réponses des composants du vêtement au niveau des images
Figure 5 compare la ligne de base ResNet-50 avec le modèle tenant compte des composants, en utilisant la même image de vêtement. Figure 5B montre la carte d'activation de classe pour la ligne de base d'apparence. Figure 5C présente le graphe des composants du vêtement au niveau de l'image, reconstruit à partir de la carte de probabilité restreinte au premier plan, de la matrice des centres des composants, de la matrice d'adjacence typée, du masque des nœuds inactifs et de la correspondance des étiquettes de composants générés dans les sections 3 et 4 du protocole. Figure 5D présente la réponse d'activation de la représentation fusionnée. Aucun estimateur de posture humaine ni annotation des articulations humaines n'est utilisé pour générer la Figure 5C.
La réponse de base était concentrée sur les régions de texture locales de la partie inférieure du vêtement et ne suivait pas systématiquement la limite complète du vêtement, comme illustré dans la Figure 5B. Dans la Figure 5C, chaque nœud correspond au centre d'une région composante active du vêtement, tandis que chaque arête représente une limite commune au premier plan ou une relation d'ordre vertical prédéfinie. Le graphe reflète l'organisation des régions du vêtement et ne représente pas les articulations anatomiques humaines. La réponse sensible à la structure couvrait le premier plan principal du vêtement tout en maintenant une activation moindre dans la plupart des zones d'arrière-plan, comme indiqué dans la Figure 5D. Ces résultats indiquent que le graphe des composants et le module de fusion de caractéristiques ont réduit l'activation dominée par la texture dans l'image évaluée.
Analyse de la similarité structurelle des vêtements et résultats de référence pour la conception
Figure 6 présente le classement de récupération ainsi que les preuves structurelles utilisées pour l'interpréter. Le graphe de composants de la requête dans la Figure 6B enregistre les régions actives du vêtement et leurs relations typées, tandis que la matrice de la Figure 6C met en évidence le motif de relations fourni à la propagation du graphe. Les résultats de base dans la Figure 6D restent dominés par des indices d'apparence rouge. Les résultats prenant en compte la structure dans la Figure 6E conservent la catégorie du vêtement du haut du corps à travers différentes couleurs et arrière-plans. Le graphe de composants du résultat classé en tête dans la Figure 6F permet une comparaison directe avec le graphe de requête, et la matrice de correspondance dans la Figure 6G révèle si les composants partageant les mêmes identifiants restent alignés après la fusion guidée par la structure. La correspondance diagonale doit être interprétée conjointement avec les nœuds manquants et les relations de graphe modifiées. Une forte similarité d'apparence sans accord au niveau du graphe ne constitue pas une récupération structurelle réussie.
Les vêtements récupérés conservent la catégorie grossière, mais les différences dans la configuration des manches et les relations entre composants locaux indiquent une correspondance incomplète au niveau fin. La méthode proposée a atteint un Rappel@5 de 89,2 % et un mAP de 86,4 %, comme indiqué dans Tableau 3. Ces valeurs quantitatives décrivent la performance de classement, tandis que Figure 6B–G fournit des preuves structurelles intermédiaires appuyant l'interprétation. La conclusion relative à la récupération se limite donc à une meilleure résistance aux interférences de la couleur de fond et à une organisation plus forte des composants au niveau de l'image dans le cadre de la requête testée.
Support pour l'analyse de la réponse aux différences structurelles et la conception
La carte thermique de la différence pure de réponse dans la Figure 7H montre que la réponse dominante est concentrée sur la silhouette élargie du bas du corps et sur la limite droite du vêtement de l'image cible. La superposition dans la Figure 7I indique que la réponse la plus forte reste alignée avec le premier plan principal du vêtement, tandis qu'une activation plus faible dans les régions adjacentes du rideau et du mur persiste comme interférence résiduelle de fond. La réponse spatiale doit être interprétée conjointement avec les données graphiques et matricielles présentées dans les Figures 7C–G. Une réponse est considérée comme une différence structurelle valide uniquement lorsque la région du vêtement à forte réponse est cohérente avec le changement d'adjacence, le changement de relation géométrique et le motif de distance des composants après fusion.
Une différence structurelle n'est acceptée que lorsque le changement d'adjacence typé dans Figure 7E ou le changement de relation géométrique dans Figure 7F s'accompagne d'une augmentation de la distance entre composants dans Figure 7G et d'une réponse spatiale alignée sur le premier plan dans Figure 7H,I. La région élargie du bas du corps et la limite droite du vêtement satisfont à ce critère transversal. L'activation au niveau du rideau et du mur ne correspond pas à des changements dans les nœuds composants, les motifs de relation ou les distances de composants fusionnés, et est donc rejetée comme une interférence résiduelle non structurelle. Le résultat soutient la localisation des différences au niveau de l'image, mais n'établit pas de variation dans les patrons de couture ou les paramètres de construction.
Répartition spatiale des caractéristiques et analyse de regroupement structurel
L'analyse de la distribution de l'espace latent de caractéristiques révèle la capacité du modèle à discriminer les sémantiques structurelles des vêtements. Cette analyse examine si la contrainte structurelle organise les vêtements présentant des configurations topologiques différentes en variétés distinctes de caractéristiques. Cinq catégories structurelles représentatives de l'ensemble de test — hauts à manches courtes, pantalons, jupes, manteaux longs et robes — ont été sélectionnées. Les vecteurs de caractéristiques en haute dimension ont été projetés sur un plan bidimensionnel à l'aide de l'embedding stochastique de voisins en t-distribution (t-SNE). La cohésion des échantillons similaires et la séparation des échantillons dissemblables ont été évaluées afin de caractériser l'organisation des sémantiques structurelles dans l'espace des caractéristiques. La distribution t-SNE de l'espace de caractéristiques sensible à la structure est présentée dans Figure 8.
La projection t-SNE a formé cinq régions principales de caractéristiques avec un chevauchement limité entre les catégories voisines, comme illustré dans la Figure 8A. Des échantillons représentatifs correspondant aux cinq régions de catégorie sont présentés dans la Figure 8B. L'ICI de 0,81 reflète la compacité des échantillons partageant la même étiquette structurelle, et l'IDS de 0,71 reflète la séparation entre les échantillons portant des étiquettes structurelles différentes, comme indiqué dans le Tableau 3 et visualisé dans la Figure 8. Ces indices doivent être interprétés comme des mesures de la distribution dans l'espace des caractéristiques et n'établissent pas directement un taux de fausse alarme. Les hauts à manches courtes et les jupes occupaient des régions principales distinctes dans l'espace des caractéristiques projeté, tandis qu'un petit nombre d'échantillons restaient proches des frontières des catégories voisines, comme montré dans la Figure 8A. Les pantalons et les robes présentaient également une séparation nette par rapport aux catégories voisines. Cette distribution indique que l'a priori de graphe a contribué à l'organisation structurelle au niveau des catégories sans produire une séparation complète des groupes. L'évaluation distingue la qualité de la représentation de l'efficacité de la récupération. L'ICI évalue si les vêtements partageant la même étiquette structurelle restent compacts dans l'espace des caractéristiques appris, tandis que l'IDS évalue si les vêtements portant des étiquettes structurelles différentes restent séparés. Ces métriques correspondent à l'objectif de représentation structurelle du protocole. Le rappel@5 mesure si un vêtement structurellement pertinent apparaît parmi les cinq premiers résultats récupérés, tandis que le mAP évalue la qualité du classement sur l'ensemble des échantillons de la galerie pertinents. Ces métriques correspondent à l'objectif de récupération de référence de conception. Le coefficient de silhouette a été utilisé uniquement pour évaluer la performance du regroupement, car l'ICI et l'IDS caractérisent déjà l'organisation dans l'espace des caractéristiques.
Figure 9 présente les résultats bruts sur cinq exécutions pour quatre méthodes représentatives, sans normalisation croisée entre méthodes. Figure 9A affiche l'indice SCI et l'indice SDI à leur échelle d'origine, tandis que Figure 9B affiche le Rappel@5 et le mAP en pourcentage. Les marqueurs des exécutions individuelles et les barres d'erreur correspondant à l'écart type illustrent la variabilité liée à l'entraînement du modèle, et non uniquement le classement agrégé. La méthode de base fondée sur l'apparence a obtenu un SCI de 0,62, tandis que la méthode proposée atteint un SCI de 0,81 et un SDI de 0,71 (Tableau 3 et Figure 9A). Les résultats obtenus pour l'indice SCI et l'indice SDI indiquent une compacité accrue au sein des étiquettes et une meilleure séparation entre les étiquettes dans le cadre du paramétrage évalué. La méthode proposée atteint un Rappel@5 de 89,2 % et un mAP de 86,4 % (Tableau 3 et Figure 9B). Ces métriques de recherche évaluent des propriétés différentes du classement et doivent être interprétées indépendamment des indices SCI et SDI. L'ordre cohérent des méthodes à travers les quatre métriques indique un accord entre la qualité de la représentation et les performances en matière de recherche, mais cela n'implique pas que l'amélioration relative soit identique sur les quatre dimensions d'évaluation.
Analyses des expériences d'ablation et de l'efficacité des modules structurels
L'expérience d'ablation compare le modèle complet à des variantes dans lesquelles le modèle structurel ou le module de fusion est supprimé. Les trois configurations utilisent les mêmes images de référence et cible, permettant une comparaison directe de la réponse du fond et de la concentration de la localisation. La variante sans modèle structurel supprime le graphe des composants du vêtement au niveau de l'image ainsi que les contraintes de relation, s'appuyant uniquement sur le réseau convolutionnel pour extraire les caractéristiques d'apparence ; la variante sans fusion conserve l'inférence du graphe mais supprime la pyramide de caractéristiques, utilisant uniquement des caractéristiques sémantiques de haut niveau. Les cartes thermiques des différences visualisées révèlent les rôles spécifiques de chaque module dans la suppression du bruit et la définition des limites ; une comparaison qualitative des réponses aux différences structurelles selon différentes configurations de modules est présentée dans Figure 10.
Les cartes de réponse dans la figure 10C–E ont été obtenues à l’aide d’une échelle de réponse partagée et de paramètres de superposition identiques. La variante sans la contrainte structurelle a produit une activation forte dans l’arrière-plan gauche et autour de régions environnementales non apparentées, comme illustré dans la figure 10C. La variante sans le module de fusion a réduit une partie de cette activation hors du vêtement, mais conservait encore une diffusion plus large sur le vêtement inférieur et la région environnante du côté droit, comme montré dans la figure 10D. Le modèle complet a davantage concentré la réponse dominante vers le premier plan principal du vêtement, comme indiqué dans la figure 10E. La figure 10F visualise directement la différence des réponses limitées au premier plan entre la variante sans fusion et le modèle complet, montrant que le modèle complet supprime la diffusion latérale résiduelle tout en préservant la réponse principale alignée sur le vêtement. Ces résultats indiquent que la contrainte structurelle a principalement réduit le bruit environnemental et que le module de fusion a amélioré davantage la concentration de la réponse et son alignement structurel. La figure 10E représente une amélioration relative plutôt qu’une élimination complète de l’activation de l’arrière-plan.
Tableau 4 indique les valeurs de SCI, SDI et Rappel@5 pour les variantes sans la contrainte de structure, sans le module de fusion et avec le modèle complet. La suppression de la contrainte de structure a fait baisser le SCI de 0,81 à 0,65 et a réduit le Rappel@5 de 89,2 % à 74,5 %. La suppression du module de fusion a fait chuter le SDI de 0,71 à 0,64 et a réduit le Rappel@5 de 89,2 % à 85,1 %, soit une diminution de 4,1 points de pourcentage. Ces résultats indiquent que la contrainte de structure a eu un effet plus marqué sur la cohérence structurelle et la récupération, tandis que la fusion de caractéristiques a amélioré l'alignement entre l'apparence et les informations structurelles.
L'analyse de l'efficacité compare le coût computationnel du modèle complet au modèle de référence ResNet-50. Le modèle de référence ResNet-50 nécessitait 25,6 millions de paramètres et 4,1 milliards d'opérations à virgule flottante. La structure complète du modèle nécessitait 29,3 millions de paramètres et 5,4 milliards d'opérations à virgule flottante. Le temps moyen d'inférence était de 15 millisecondes par image pour le modèle de référence et de 22 millisecondes par image pour le modèle complet, soit une augmentation de 7 millisecondes. Ce résultat indique un coût computationnel mesurable qui devrait être pris en compte lors du déploiement du protocole dans des flux de travail sensibles au temps.Tableau 5)Le poids de la contrainte structurelle a été déterminé à partir de la partition de validation avant l'évaluation finale sur le test. Le rappel@5 sur la validation a été examiné pour des poids de contrainte structurelle de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 et 2,0. Un poids de 1,0 a été fixé pour tous les entraînements et tests ultérieurs. Figure 11 documente la sélection, basée sur la validation, d'un poids de contrainte structurale de 1,0.

Figure 1: Flux global du protocole d'apprentissage de caractéristiques d'images de vêtements tenant compte de la structure. L'image d'entrée du vêtement est traitée par une branche d'extraction de caractéristiques d'apparence et une branche de caractéristiques structurelles utilisant l'analyse sémantique et la modélisation de graphes spatiaux. Les deux représentations sont ensuite traitées par un module de fusion guidé par la structure afin de produire la caractéristique finale intégrant la structure. La perte de cohérence structurelle, la perte de discrimination structurelle et la perte de relation structurelle contraint conjointement l'espace des caractéristiques. La figure illustre comment l'apparence du vêtement et la topologie de ses composants sont intégrées tout au long de l'apprentissage des caractéristiques. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 2 : Construction d'une topologie préalable des composants du vêtement au niveau de l'image. (A) L'image du vêtement en entrée I. (B) La carte des composants visuels restreinte au premier plan P, dans laquelle sept couleurs indiquent les régions du vêtement au niveau de l'image. Tous les pixels d'arrière-plan sont exclus des canaux de composants. (C) Le graphe de relation des composants au niveau de l'image G. Les nœuds représentent les régions visibles du vêtement, les arêtes pleines représentent des frontières communes au premier plan, et les relations en pointillés représentent un ordre vertical prédéfini. La carte et le graphe permettent la recherche d'images et la comparaison de structures visuelles. Ils ne représentent pas les pièces de patron de couture, la géométrie des coutures, les structures de pinces, les paramètres de gradation ou les instructions de découpe. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 3 : Module de fusion de caractéristiques guidée par la structure. La caractéristique structurelle est transformée par le mappage linéaire et la fonction d'activation Ψ afin de générer un poids structurel. Ce poids structurel module la caractéristique d'apparence par multiplication élément par élément. La caractéristique d'apparence modulée et la caractéristique structurelle sont concaténées puis projetées par Wc, après quoi la caractéristique structurelle résiduelle est ajoutée pour produire la caractéristique finale du composant. La figure montre que l'information structurelle régule le pondération de la caractéristique d'apparence avant la fusion finale. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 4 : Optimisation de l'espace des caractéristiques sous contraintes de cohérence structurelle. (A) Les échantillons appartenant à la même classe structurelle sont rapprochés grâce à la perte de cohérence structurelle, tandis que leurs relations internes entre composants sont préservées par la perte de relation structurelle. (B) Les échantillons provenant de classes structurelles différentes sont éloignés par la perte de discrimination structurelle. La figure montre comment les trois objectifs structurels augmentent conjointement la compacité intra-classe et la séparation inter-classes. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 5 : Réponses représentatives des caractéristiques du vêtement et visualisation sous forme de graphe de composants. (A) L'image d'entrée du vêtement. (B) La réponse d'activation de classe de la référence d'apparence ResNet-50. (C) Le graphe de composants au niveau de l'image a été reconstruit à partir de la carte de composants restreinte au premier plan, de la matrice des centres de composants, de la matrice d'adjacence typée, du masque des nœuds inactifs et de la correspondance des étiquettes de composants, qui ont été enregistrés lors des sections 3 et 4 du protocole. Les nœuds représentent les régions actives du vêtement, les arêtes pleines indiquent des frontières communes au premier plan, et les arêtes en pointillés indiquent des relations d'ordre vertical prédéfinies. (D) La réponse d'activation de la représentation fusionnée tenant compte des composants. La comparaison montre la différence entre une activation dominée par la texture et une activation guidée par les régions du vêtement. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 6 : Résultats de recherche et preuves structurelles intermédiaires en présence d'interférences avec fond rouge. (A) L'image requête. (B) Le graphe de composants de la requête est généré à partir des centres de composants sauvegardés et de la matrice d'adjacence typée. (C) La matrice d'adjacence typée de la requête, dont les valeurs distinguent les relations inactives, les frontières communes au premier plan et les relations d'ordre vertical prédéfinies. (D) Les trois meilleurs résultats de recherche ont été produits par la méthode de référence basée sur l'apparence. (E) Les trois meilleurs résultats ont été produits par la représentation tenant compte de la structure. (F) Le graphe de composants du résultat ayant obtenu le classement le plus élevé avec la méthode tenant compte de la structure. (G) La matrice de correspondance des composants après fusion entre la requête et le résultat le mieux classé. Une forte correspondance diagonale indique un accord entre les composants ayant les mêmes identifiants, tandis que des réponses faibles ou décalées indiquent une absence ou une inadéquation dans l'organisation des composants. Les résultats de recherche préservent la catégorie globale du haut du corps, mais n'établissent pas un accord complet quant à la configuration des manches et à la topologie locale. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 : Suivi des différences structurelles, de la topologie du vêtement au niveau de l'image à la réponse spatiale. (A) L'image de référence. (B) L'image cible. (C) Le graphe de composants de référence. (D) Le graphe de composants cible. Les deux graphes sont reconstruits à partir des centres de composants sauvegardés et des matrices d'adjacence typées. (E) La matrice de différence d'adjacence typée. (F) La différence de relation géométrique est dérivée du déplacement des centres de composants, de la dispersion spatiale et des changements de poids de relation. (G) Le graphe de différence de composants après fusion, où l'intensité des nœuds représente la distance normalisée entre les vecteurs de composants fusionnés correspondants et l'épaisseur des arêtes représente le changement de poids de relation. (H) La carte thermique de réponse purement spatiale a été générée en utilisant la même échelle de réponse fixe que celle de la superposition. (I) La réponse superposée sur l'image cible. Une différence structurelle est acceptée uniquement lorsque le changement d'adjacence, le changement de relation géométrique, le changement de distance entre composants et la réponse thermique alignée sur le premier plan restent cohérents. L'activation du fond sans preuve correspondante de composants ou de relations est considérée comme une interférence résiduelle plutôt qu'une différence valide de structure du vêtement. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 8 : Regroupement dans l'espace des caractéristiques tenant compte de la structure. (A) Projection t-SNE des hauts à manches courtes, des pantalons, des jupes, des manteaux longs et des robes. Les cinq catégories forment des régions principales de caractéristiques avec un chevauchement limité près des frontières entre elles. (B) Images-test représentatives attribuées aux cinq catégories de vêtements, la couleur de la bordure correspondant à la couleur de catégorie dans (A). La figure montre une organisation structurelle au niveau des catégories tout en conservant un petit nombre d'échantillons près des régions des catégories adjacentes. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 9 : Comparaison des performances brutes selon la structure de l'espace des caractéristiques et les objectifs de classement lors de la récupération. (A) SCI et SDI pour la méthode de référence basée sur l'apparence, le modèle à structure faible, le modèle à structure explicite et la méthode proposée. (B) Rappel@5 et mAP pour les quatre mêmes méthodes. Les grands marqueurs indiquent la moyenne arithmétique sur cinq exécutions indépendantes, les barres d'erreur représentent l'écart-type échantillonnal, et les petits marqueurs indiquent les résultats au niveau de chaque exécution. Le SCI et le SDI sont affichés sur une échelle fixe allant de zéro à un, tandis que le Rappel@5 et le mAP sont affichés sur une échelle de pourcentage fixe allant de zéro à cent. Aucune normalisation min-max ni remise à l'échelle croisée entre méthodes n'est appliquée. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 10 : Réponses aux différences structurelles selon différentes configurations de modules. (A) L'image de référence. (B) L'image cible. (C) La réponse de la variante sans l'a priori de structure. (D) La réponse de la variante sans le module de fusion. (E) La réponse du modèle complet. (C–E) sont représentées à l'aide de la même échelle normalisée de réponse, de la même carte de couleurs et des mêmes paramètres de superposition. (F) La différence absolue de réponse restreinte au premier plan entre la variante sans fusion et le modèle complet. Le modèle complet préserve la réponse principale alignée sur le vêtement tout en réduisant la dispersion résiduelle en dehors de la région structurelle principale. La comparaison montre que l'a priori de structure réduit les interférences en dehors du vêtement et que le module de fusion affine davantage la réponse structurelle. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 11 : Sélection du poids de la contrainte structurelle basée sur la validation. Le Rappel@5 de validation est indiqué pour des poids de contrainte structurelle de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 et 2,0. Chaque point représente la moyenne arithmétique obtenue sur cinq exécutions de validation, et chaque barre d'erreur indique l'écart-type empirique. Le poids a été fixé à 1,0 avant l'évaluation finale sur le jeu de test. Cette figure illustre la procédure de sélection des paramètres et ne constitue pas une contribution architecturale indépendante. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.
Tableau 1 : Répartition des ensembles de données et statistiques topologiques au niveau des images pour les sous-ensembles de vêtements S1 à S5. Ce tableau indique les nombres d'images d'entraînement, de validation, de test et le nombre total d'images, ainsi que les moyennes du nombre de composants sémantiques, du nombre de nœuds actifs, du nombre d'arêtes typées et du nombre de points de repère annotés dans le plan de l'image pour chaque niveau structural. Toutes les valeurs sont générées à partir des fichiers manifestes de données traitées. Les nombres d'images d'entraînement, de validation et de test ont été obtenus à partir des manifestes finaux des sous-ensembles après examen structural, contrôle des groupes de doublons et vérification des fuites, tandis que les statistiques topologiques ont été calculées à partir des enregistrements finaux des graphes en utilisant le même ordre des composants et les mêmes définitions de relations que celles appliquées lors de l'évaluation du modèle. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 2 : Paramètres environnementaux de calcul, configuration d'entrée, augmentation, représentation, optimisation, fonction de perte et reproductibilité utilisés tout au long du protocole. Le tableau indique précisément les versions du système d'exploitation, du processeur, de la mémoire installée, de l'unité de traitement graphique, de la mémoire graphique, du pilote graphique, de CUDA, de cuDNN, de Python, de NumPy, de PyTorch et de torchvision, ainsi que la taille des images, la construction des lots, l'optimiseur, le planning du taux d'apprentissage, le nombre d'époques, les graines aléatoires, les dimensions de la représentation et les poids des objectifs structurels. Chaque valeur est liée au fichier software_versions.txt, au fichier configs/protocol.yaml ou à l'enregistrement d'entraînement correspondant. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 3 : Comparaison quantitative de modèles généraux de représentation visuelle, de modèles de vêtements basés sur des graphes et de méthodes spécifiques au domaine de la recherche de mode. Le tableau indique le type de recherche, la modalité de requête, l'indice SCI, l'indice SDI, le Rappel@5, la mAP et le coefficient de silhouette pour onze méthodes, évaluées selon les mêmes partitions de données et le même protocole d'évaluation. Chaque métrique est indiquée sous forme de moyenne et d'écart-type échantillonnal calculés à partir de cinq exécutions indépendantes. Les p-valeurs indiquées ont été obtenues à l’aide de tests t appariés bilatéraux comparant chaque méthode de référence à la méthode proposée, à partir des résultats obtenus avec les mêmes cinq graines aléatoires. La méthode proposée est utilisée comme ligne de référence. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 4 : Résultats d'ablation pour la contrainte structurelle et le module de fusion de caractéristiques. Le tableau indique les valeurs de SCI, SDI et Recall@5 pour la variante sans contrainte structurelle, la variante sans module de fusion et le modèle complet. La suppression de la contrainte structurelle entraîne une réduction plus importante de SCI et de Recall@5, tandis que la suppression du module de fusion diminue SDI et l'alignement des réponses. Le modèle complet obtient la valeur la plus élevée pour les trois métriques. Veuillez cliquer ici pour télécharger ce fichier.
Tableau 5 : Efficacité informatique du modèle de référence ResNet-50 et du modèle complet prenant en compte la structure. Le tableau indique le nombre de paramètres entraînables, le nombre d'opérations à virgule flottante par image, ainsi que le temps d'inférence moyen par image, dans l'environnement matériel et logiciel exactement décrit dans le tableau 2 et dans le tableau des matériaux. Les deux modèles utilisent la même résolution d'image, le même paramètre de lot d'inférence, les mêmes opérations de prétraitement et la même procédure de mesure du temps. Par rapport au modèle de référence, le modèle complet ajoute 3,7 millions de paramètres, 1,3 milliard d'opérations à virgule flottante et 7 millisecondes de temps d'inférence par image. Veuillez cliquer ici pour télécharger ce fichier.