Alle beschriebenen Experimente wurden mithilfe der in Tabelle 2 und der Materialtabelle dokumentierten Hardware- und Softwareumgebung durchgeführt. Derselbe Grafiktreiber sowie dieselben Versionen von CUDA, cuDNN, Python, NumPy, PyTorch und torchvision wurden während der gesamten Vorverarbeitung, des Trainings, der Inferenz und der Auswertung verwendet. Die vollständige Hardware- und Softwareumgebung ist in Tabelle 2 und der Materialtabelle zusammengefasst. Tabelle 1 fasst die verarbeiteten Trainings-, Validierungs- und Testdatensätze zusammen, ergänzt um statistische Angaben zur Bild-Topologie. Tabelle 2 fasst die gemeinsame Konfiguration zusammen, die für alle Vergleichsmethoden verwendet wurde.
Ergebnisse der vergleichenden Bewertung
Die vergleichende Bewertung folgte den gemeinsamen Datenaufteilungen, Vorverarbeitungsschritten, Trainingskontrollen und Metrikdefinitionen, die in den Protokollabschnitten 7–9 festgelegt sind. Tabelle 3 vergleicht allgemeine visuelle Encoder, teilweise ausgerichtete Modelle, graphenbasierte Bekleidungsdarstellungen, cross-domänen Modeabrufnetzwerke, Methoden zur Fusion von Topologie und Erscheinungsbild sowie Methoden für den visuellen Abruf im E-Commerce, alle bewertet mit demselben Bildabfrageprotokoll. Die domänenspezifischen Methoden umfassen das Topology Feature Histogram mit Color and Texture Fusion (TFH-CT), das Attention-Guided Cascade Network (AGC-Net), das Multi-scale and Multi-granularity Feature Learning Network (MMFL-Net) und Fashion Retrieval using Residual Network with Egret Swarm Optimization (FARE-RNET). Alle Bewertungsmetriken in Tabelle 3 werden als Mittelwert und Stichprobenstandardabweichung über fünf unabhängige Durchläufe hinweg angegeben, wobei dieselben Zufallsseeds, Trainingsmanifeste, Validierungsmanifeste, Testmanifeste, Query-Gallery-Zuordnungen und Metrikimplementierungen verwendet wurden. Die gepaarten p-Werte wurden separat für SCI, SDI, Recall@5, mAP und den Silhouettenkoeffizienten berechnet, indem jede Methode unter identischen Bedingungen bezüglich der Zufallsseeds mit der vorgeschlagenen Methode verglichen wurde. Diese Ergebnisse liefern die quantitative Grundlage für die anschließenden strukturellen Visualisierungen, Abrufe, Clusteranalysen und designorientierten Untersuchungen.
Vertretende Protokollergebnisse und deren Interpretation
Ein erfolgreicher Protokollablauf zeigt sich darin, dass der aus den gespeicherten Parsing- und Graph-Dateien rekonstruierte komponentenbasierte Abbildungsgraph jeden aktiven Knoten innerhalb des entsprechenden Bekleidungsbereichs positioniert und die in der typisierten Adjazenzmatrix erfassten Relationstypen beibehält, wie in Abbildung 5C dargestellt. Die strukturbewusste Antwort sollte weiterhin auf den Vordergrund der Bekleidung konzentriert bleiben, wie in Abbildung 5D gezeigt. Abbildung 6E zeigt ein erwartetes Retrieval-Ergebnis, bei dem die vorgeschlagene Methode den Einfluss des roten Hintergrunds reduziert und Oberkörperbekleidung statt nicht verwandter roter Objekte findet. Abbildung 6B–G verdeutlicht zudem, dass die Retrieval-Rangfolge durch komponentenbasierte Abbildungsrelationen und die Korrespondenz der Komponenten nach der Fusion unterstützt wird. Dieses Ergebnis spiegelt die Wiederherstellung der groben Bekleidungskategorie wider, obwohl die Ärmellänge und die lokale Topologie unter den abgerufenen Beispielen weiterhin variieren.
Zu den häufigen Fehlerfällen gehören die texturbasierte Aktivierung in Abbildung 5B, die durch die Hintergrundfarbe verursachte Abrufung in der oberen Zeile von Abbildung 6 sowie die verbleibende Hintergrundaktivierung in Abbildung 7. Abbildung 7 ist als teilweise Lokalisierung zu interpretieren, da die dominante Reaktion der vergrößerten Silhouette des Unterkörpers und der rechten Kleidungsgrenze folgt, während eine Restaktivierung in benachbarten Hintergrundbereichen verbleibt. Die Lokalisierung wird nur dann als strukturell gestützt angesehen, wenn die Topologie-Differenz-Matrix, die geometrische-Beziehung-Differenz-Matrix, der Post-Fusion-Komponenten-Differenz-Graph und die räumliche Reaktion konsistente Kleidungsbereiche identifizieren. Ein räumlicher Hotspot ohne entsprechende Änderungen in der Matrix oder den Komponenten weist auf visuelle Störungen statt auf strukturelle Belege hin.
Ein Protokolllauf gilt als gültig, wenn jedes akzeptierte Bild eine normalisierte semantische Wahrscheinlichkeitskarte, eine Relationsmatrix mit K Zeilen und K Spalten, Erscheinungs- und Strukturmerkmal-Matrizen mit K Zeilen und 512 Spalten sowie einen endlichen fusionierten Merkmalsvektor erzeugt, der mit der korrekten Bildkennung verknüpft ist. Die visuelle Überprüfung sollte bestätigen, dass die Topologie den Kleidungsstückkomponenten folgt, dass die Antwort im Vordergrund die Antwort im Hintergrund übersteigt und dass die Abrufergebnisse durch die Kategorie und Struktur des Kleidungsstücks und nicht durch die Hintergrundfarbe gesteuert werden. Fragmentierte Wahrscheinlichkeitskarten, fehlende Komponentenknoten, nicht-numerische Matrizen, diffuse Hintergrundantworten oder farbdominierte Abrufe deuten auf eine fehlgeschlagene Ausführung hin und erfordern eine Überprüfung der Segmentierung, Graphkonstruktion, Merkmalsfusion oder des Ladens des Kontrollpunkts.
Visuelle Analyse der Reaktionen von Kleidungsstückkomponenten auf Bildebene
Abbildung 5 vergleicht die ResNet-50-Basislinie mit dem komponentenbewussten Modell unter Verwendung desselben Kleidungsstückbildes. Abbildung 5B zeigt die Klassenaktivierungskarte für die Erscheinungsbasislinie. Abbildung 5C zeigt den auf Bildniveau rekonstruierten Kleidungsstückkomponentengraphen, der aus der vordergrundbeschränkten Wahrscheinlichkeitskarte, der Komponentenmittelpunktmatrix, der typisierten Adjazenzmatrix, der Maske inaktiver Knoten und der Komponentenlabelzuordnung stammt, die in den Protokollabschnitten 3 und 4 generiert wurden. Abbildung 5D zeigt die Aktivierungsantwort der fusionierten Darstellung. Zur Erzeugung von Abbildung 5C wird kein Schätzer der menschlichen Körperhaltung oder Annotation der menschlichen Gelenke verwendet.
Die Basisantwort konzentrierte sich auf lokale Texturbereiche im unteren Kleidungsstück und folgte nicht konsistent der vollständigen Kleidungsgrenze, wie in Abbildung 5B gezeigt. In Abbildung 5C entspricht jeder Knoten dem Zentrum eines aktiven Kleidungskomponentenbereichs, während jede Kante eine gemeinsame Vordergrundgrenze oder eine vordefinierte vertikale Reihenfolgebeziehung darstellt. Der Graph spiegelt die Organisation der Kleidungsbereiche wider und stellt keine menschlichen anatomischen Gelenke dar. Die strukturbewusste Antwort erfasste den Hauptvordergrund des Kleidungsstücks, wobei die Aktivierung in den meisten Hintergrundbereichen niedriger blieb, wie in Abbildung 5D dargestellt. Diese Ergebnisse deuten darauf hin, dass der Komponentengraph und das Merkmalsfusion-Modul die texturbasierte Aktivierung im ausgewerteten Bild verringert haben.
Analysen der strukturellen Ähnlichkeit von Bekleidung und Ergebnisse als Designreferenz
Abbildung 6 zeigt die Abrangliste zusammen mit den strukturellen Belegen, die zur Interpretation herangezogen wurden. Der Abfragekomponentengraph in Abbildung 6B erfasst aktive Bekleidungsbereiche und ihre typisierten Beziehungen, während die Matrix in Abbildung 6C das Beziehungsmuster offenlegt, das der Graphweiterleitung bereitgestellt wird. Die Ergebnisse des Baseline-Verfahrens in Abbildung 6D werden weiterhin von roten Erscheinungsbildmerkmalen dominiert. Die strukturbewussten Ergebnisse in Abbildung 6E bewahren die Oberbekleidungskategorie über verschiedene Farben und Hintergründe hinweg. Der Komponentengraph des am höchsten eingestuften Ergebnisses in Abbildung 6F ermöglicht einen direkten Vergleich mit dem Abfragegraphen, und die Korrespondenzmatrix in Abbildung 6G zeigt auf, ob Komponenten mit denselben Kennungen nach der strukturgesteuerten Fusion weiterhin ausgerichtet bleiben. Die diagonale Korrespondenz sollte gemeinsam mit fehlenden Knoten und veränderten Graphbeziehungen interpretiert werden. Starke Ähnlichkeit im Erscheinungsbild ohne Übereinstimmung der Graphstruktur stellt keine erfolgreiche strukturelle Rückgewinnung dar.
Die abgerufenen Kleidungsstücke behalten die grobe Kategorie bei, doch Unterschiede in der Ärmelkonfiguration und in den lokalen Komponentenbeziehungen deuten auf eine unvollständige feingranulare Übereinstimmung hin. Die vorgeschlagene Methode erreichte einen Recall@5 von 89,2 % und einen mAP-Wert von 86,4 %, wie in Tabelle 3 berichtet. Diese quantitativen Werte beschreiben die Rangfolgeleistung, während Abbildung 6B–G intermediate strukturelle Belege liefert, die die Interpretation unterstützen. Die Schlussfolgerung bezüglich des Abrufs beschränkt sich somit auf eine verbesserte Widerstandsfähigkeit gegenüber Hintergrundfarbinterferenzen und eine stärkere organisationsebene Komponentenstruktur auf Ebene des Bildes unter der getesteten Abfrage.
Unterstützung bei der Analyse struktureller Unterschiedsreaktionen und der Entwurfsanalyse
Die reine Differenz-Antwort-Heatmap in Abbildung 7H zeigt, dass die dominante Antwort auf der vergrößerten unteren Körpersilhouette und der rechten Bekleidungsgrenze des Zielsbildes konzentriert ist. Die Überlagerung in Abbildung 7I zeigt, dass die stärkste Antwort weiterhin mit dem Hauptvordergrund der Bekleidung übereinstimmt, während eine schwächere Aktivierung in den benachbarten Vorhang- und Wandbereichen als residuelle Hintergrundinterferenz verbleibt. Die räumliche Antwort sollte gemeinsam mit den in Abbildungen 7C–G dargestellten Komponentengraphen und Matrixbefunden interpretiert werden. Eine Antwort wird nur dann als gültiger struktureller Unterschied betrachtet, wenn der Bereich mit hoher Antwort mit der Nachbarschaftsänderung, der Änderung der geometrischen Beziehung und dem Komponentenabstandsmuster nach der Fusion übereinstimmt.
Ein struktureller Unterschied wird nur akzeptiert, wenn die geänderte Nachbarschaftsbeziehung in Abbildung 7E oder die geänderte geometrische Relation in Abbildung 7F von einem vergrößerten Abstand der Komponenten in Abbildung 7G und einer vordergrundausgerichteten räumlichen Antwort in Abbildung 7H,I begleitet wird. Der vergrößerte untere Körperteil und die rechte Kleidungsrandlinie erfüllen dieses kriteriumsübergreifende Kriterium. Die Aktivierung über Vorhang und Wand entspricht nicht Änderungen in Komponenten-Knoten, Relationsmustern oder fusionierten Komponentenabständen und wird daher als nicht-strukturelle Restinterferenz abgelehnt. Das Ergebnis unterstützt die Lokalisierung von Unterschieden auf Bildebene, belegt jedoch keine Variation in Nähtechniken oder Konstruktionsparametern.
Räumliche Verteilung der Merkmale und strukturelle Clusteranalyse
Die Analyse der Verteilung des latenten Merkmalsraums zeigt die Fähigkeit des Modells auf, die strukturelle Semantik von Kleidungsstücken zu unterscheiden. Diese Analyse prüft, ob die strukturelle Vorinformation Kleidungsstücke mit unterschiedlichen topologischen Konfigurationen in getrennte Merkmalsmannigfaltigkeiten ordnet. Fünf repräsentative strukturelle Kategorien aus dem Testdatensatz – Oberteile mit kurzen Ärmeln, Hosen, Röcke, lange Mäntel und Kleider – wurden ausgewählt. Die hochdimensionalen Merkmalsvektoren wurden mithilfe der t-verteilten stochastischen Nachbarn-Einbettung (t-SNE) auf eine zweidimensionale Ebene projiziert. Die Kohäsion ähnlicher Stichproben und die Trennung unähnlicher Stichproben wurden bewertet, um die Organisation der strukturellen Semantik im Merkmalsraum zu charakterisieren. Die t-SNE-Verteilung des strukturwissenden Merkmalsraums ist in Abbildung 8 dargestellt.
Die t-SNE-Projektion bildete fünf Hauptmerkmalsbereiche mit begrenzter Überlappung zwischen benachbarten Kategorien, wie in Abbildung 8A dargestellt. Repräsentative Beispiele, die den fünf Kategoriebereichen entsprechen, sind in Abbildung 8B gezeigt. Der SCI von 0,81 spiegelt die Kompaktheit von Proben mit demselben strukturellen Label wider, und der SDI von 0,71 spiegelt die Trennung zwischen Proben mit unterschiedlichen strukturellen Labels wider, wie in Tabelle 3 berichtet und in Abbildung 8 veranschaulicht. Diese Indizes sollten als Maße für die Verteilung im Merkmalsraum interpretiert werden und stellen nicht direkt eine Falschalarmrate fest. Oberteile mit kurzen Ärmeln und Röcke nahmen unterschiedliche Hauptbereiche im projizierten Merkmalsraum ein, während eine geringe Anzahl von Proben in der Nähe benachbarter Kategoriegrenzen verblieb, wie in Abbildung 8A gezeigt. Hosen und Kleider zeigten ebenfalls eine klare Trennung von benachbarten Kategorien. Diese Verteilung weist darauf hin, dass die Graph-Vorgabe zur strukturellen Organisation auf Kategorieebene beigetragen hat, ohne eine vollständige Cluster-Trennung hervorzurufen. Die Bewertung trennt die Qualität der Repräsentation von der Effektivität des Abrufs. SCI bewertet, ob Bekleidungsstücke mit demselben strukturellen Label im gelernten Merkmalsraum kompakt bleiben, während SDI bewertet, ob Bekleidungsstücke mit unterschiedlichen strukturellen Labels getrennt bleiben. Diese Metriken entsprechen dem strukturellen Repräsentationsziel des Protokolls. Recall@5 misst, ob ein strukturell relevantes Bekleidungsstück unter den ersten fünf abgerufenen Ergebnissen erscheint, während mAP die Rangfolgequalität über alle relevanten Galerieproben hinweg bewertet. Diese Metriken entsprechen dem Abrufziel für Designreferenzen. Der Silhouettenkoeffizient wurde nur zur Bewertung der Clusterleistung verwendet, da SCI und SDI bereits die Organisation im Merkmalsraum charakterisieren.
Abbildung 9 zeigt die Rohdaten aus fünf Durchläufen für vier repräsentative Methoden ohne übergeordnete Normalisierung zwischen den Methoden. Abbildung 9A zeigt SCI und SDI in ihrem ursprünglichen Maßstab, während Abbildung 9B Recall@5 und mAP in Prozent angibt. Die Markierungen für einzelne Durchläufe sowie die Fehlerbalken für die Standardabweichung verdeutlichen die Variabilität aufgrund des Modelltrainings und nicht nur die aggregierte Rangfolge. Der auf Erscheinungsbild basierende Ansatz erreichte einen SCI-Wert von 0,62, während die vorgeschlagene Methode einen SCI von 0,81 und einen SDI von 0,71 erreichte (Tabelle 3 und Abbildung 9A). Die SCI- und SDI-Ergebnisse deuten auf eine stärkere Kompaktheit innerhalb der Klassen und eine bessere Trennung zwischen den Klassen unter den untersuchten Bedingungen hin. Die vorgeschlagene Methode erreichte einen Recall@5 von 89,2 % und einen mAP-Wert von 86,4 % (Tabelle 3 und Abbildung 9B). Diese Abrufmetriken bewerten unterschiedliche Eigenschaften der Rangfolge und werden separat von SCI und SDI interpretiert. Die konsistente Reihenfolge der Methoden über alle vier Metriken hinweg weist auf eine Übereinstimmung zwischen der Qualität der Repräsentation und der Abrufleistung hin, impliziert jedoch nicht, dass die relative Verbesserung über alle vier Evaluationsdimensionen hinweg identisch ist.
Ablationsversuche und Analyse der Wirksamkeit struktureller Module
Das Ablationsexperiment vergleicht das vollständige Modell mit Varianten, bei denen die strukturelle Vorgabe oder das Fusionmodul entfernt wurden. Alle drei Konfigurationen verwenden dieselben Referenz- und Zielbilder, wodurch ein direkter Vergleich der Hintergrundreaktion und der Lokalisierungskonzentration ermöglicht wird. Die Variante ohne strukturelle Vorgabe entfernt den bildbasierten Bekleidungskomponentengraphen und seine Relationsbeschränkungen und stützt sich ausschließlich auf den konvolutionalen Backbone, um Erscheinungsmerkmale zu extrahieren; die Nicht-Fusionsvariante behält die Graphinferenz bei, entfernt jedoch die Merkmalspyramide und nutzt lediglich hochwertige semantische Merkmale. Visualisierte Differenz-Heatmaps zeigen die spezifischen Rollen jedes Moduls bei der Rauschunterdrückung und der Grenzflächendefinition; ein qualitativer Vergleich der strukturellen Differenzreaktionen unter verschiedenen Modulkonfigurationen ist in Abbildung 10 dargestellt.
Die Reaktionskarten in Abbildung 10C–E wurden mit einer gemeinsamen Antwortskala und identischen Überlagerungseinstellungen dargestellt. Die Variante ohne Struktur-Vorgabe zeigte eine starke Aktivierung im linken Hintergrund und um nicht verwandte Umgebungsregionen, wie in Abbildung 10C dargestellt. Die Variante ohne das Fusionmodul reduzierte einen Teil dieser außerhalb des Kleidungsstücks liegenden Reaktion, behielt jedoch eine breitere Ausbreitung über dem unteren Kleidungsstück und der rechtsseitigen Umgebung bei, wie in Abbildung 10D gezeigt. Das vollständige Modell konzentrierte die dominante Reaktion weiter auf den Vordergrund des Hauptkleidungsstücks, wie in Abbildung 10E ersichtlich. Abbildung 10F veranschaulicht direkt den Unterschied in den auf den Vordergrund beschränkten Reaktionen zwischen der Variante ohne Fusion und dem vollständigen Modell und zeigt, dass das vollständige Modell die verbleibende seitliche Ausbreitung unterdrückt, während die primäre, am Kleidungsstück ausgerichtete Reaktion erhalten bleibt. Diese Ergebnisse deuten darauf hin, dass die Struktur-Vorgabe hauptsächlich Umgebungsrauschen reduzierte und dass das Fusionmodul die Reaktionskonzentration sowie die strukturelle Ausrichtung weiter verbesserte. Abbildung 10E stellt eine relative Verbesserung dar, keine vollständige Beseitigung der Hintergrundaktivierung.
Tabelle 4 zeigt SCI, SDI und Recall@5 für die Varianten ohne Struktur-Präferenz, ohne das Fusion-Modul und mit dem vollständigen Modell. Das Entfernen der Struktur-Präferenz verringerte den SCI von 0,81 auf 0,65 und reduzierte Recall@5 von 89,2 % auf 74,5 %. Das Weglassen des Fusion-Moduls senkte den SDI von 0,71 auf 0,64 und verringerte Recall@5 von 89,2 % auf 85,1 %, was einem Rückgang von 4,1 Prozentpunkten entspricht. Diese Ergebnisse zeigen, dass die Struktur-Präferenz einen stärkeren Einfluss auf strukturelle Konsistenz und Rückgewinnung hatte, während die Merkmalsfusion die Übereinstimmung zwischen Erscheinungsbild und strukturellen Informationen verbesserte.
Die Effizienzanalyse vergleicht die Rechenkosten des vollständigen Modells mit der ResNet-50-Baseline. Die ResNet-50-Baseline erforderte 25,6 Millionen Parameter und 4,1 Milliarden Gleitkommaoperationen. Das vollständige strukturbasierte Modell erforderte 29,3 Millionen Parameter und 5,4 Milliarden Gleitkommaoperationen. Die durchschnittliche Inferenzzeit betrug 15 Millisekunden pro Bild für die Baseline und 22 Millisekunden pro Bild für das vollständige Modell, eine Zunahme um 7 Millisekunden. Dieses Ergebnis weist auf messbare Rechenkosten hin, die bei der Anwendung des Protokolls in zeitkritischen Workflows berücksichtigt werden sollten (Tabelle 5). Das Gewicht der strukturellen Nebenbedingung wurde anhand des Validierungsdatensatzes vor der endgültigen Testauswertung bestimmt. Der Validierungs-Recall@5 wurde bei strukturellen Nebenbedingungsgewichten von 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 und 2,0 untersucht. Ein Gewicht von 1,0 wurde für alle nachfolgenden Trainings- und Testdurchläufe festgelegt. Abbildung 11 dokumentiert die auf Validierungsdaten basierende Auswahl eines strukturellen Nebenbedingungsgewichts von 1,0.

Abbildung 1: Gesamtablauf des Protokolls zum lernbasierten Erwerb strukturbewusster Merkmale aus Bekleidungsbildern. Das Eingangsbild des Bekleidungsstücks wird durch einen Zweig zur Erfassung von Erscheinungsmerkmalen und einen Zweig zur Erfassung struktureller Merkmale verarbeitet, wobei semantische Segmentierung und räumliche Graphmodellierung zum Einsatz kommen. Die beiden Darstellungen werden anschließend durch ein strukturgeleitetes Fusionmodul verarbeitet, um das endgültige strukturbewusste Merkmal zu erzeugen. Verlustfunktionen für strukturelle Konsistenz, strukturelle Diskriminierung und strukturelle Beziehungen beschränken gemeinsam den Merkmalsraum. Die Abbildung veranschaulicht, wie Erscheinungsbild und Komponententopologie des Bekleidungsstücks während des gesamten Lernprozesses integriert werden. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 2: Konstruktion einer topologischen Vorlage auf Ebene von Kleidungsbestandteilen. (A) Das Eingabebild des Kleidungsstücks I. (B) Die auf den Vordergrund beschränkte Karte visueller Komponenten P, bei der sieben Farben die Bereiche des Kleidungsstücks auf Bildebene bezeichnen. Alle Hintergrundpixel sind von den Komponentenkanälen ausgeschlossen. (C) Der Relationsgraph der Komponenten auf Bildebene G. Die Knoten repräsentieren sichtbare Bereiche des Kleidungsstücks, durchgezogene Kanten stehen für gemeinsame Vordergrundgrenzen, und gestrichelte Verbindungen zeigen eine vordefinierte vertikale Reihenfolge an. Die Karte und der Graph unterstützen die Bildsuche und den Vergleich visueller Strukturen. Sie stellen keine Nähschnittteile, Nähtengeometrie, Taillierungselemente, Größenstaffelungsparameter oder Zuschnittanweisungen dar. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 3: Strukturgeleitetes Modul zur Merkmalsfusion. Das strukturelle Merkmal wird durch die lineare Abbildung und die Aktivierungsfunktion Ψ transformiert, um ein Struktur-Gewicht zu erzeugen. Dieses Struktur-Gewicht moduliert das Erscheinungsbild-Merkmal durch elementweise Multiplikation. Das modulierte Erscheinungsbild-Merkmal und das strukturelle Merkmal werden verkettet und mittels Wc projiziert, woraufhin das residuale strukturelle Merkmal addiert wird, um das endgültige Komponentenmerkmal zu erzeugen. Die Abbildung zeigt, dass strukturelle Informationen die Gewichtung des Erscheinungsbild-Merkmals vor der endgültigen Fusion steuern. Klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 4: Optimierung des Merkmalsraums unter strukturellen Konsistenzbedingungen. (A) Proben, die derselben strukturellen Klasse angehören, werden durch den Strukturkonsistenzverlust näher zueinander gezogen, während ihre internen Komponentenbeziehungen durch den Strukturbeziehungsverlust erhalten bleiben. (B) Proben aus unterschiedlichen strukturellen Klassen werden durch den Strukturdiskriminierungsverlust voneinander weggedrängt. Die Abbildung zeigt, wie die drei strukturellen Zielvorgaben gemeinsam die Kompaktheit innerhalb der Klasse und die Trennung zwischen den Klassen erhöhen. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 5: Repräsentative Merkmalsantworten des Bekleidungsstücks und Visualisierung als Komponentengraph. (A) Das Eingabebild des Bekleidungsstücks. (B) Die Klassenaktivierungsantwort der ResNet-50-Appearance-Basislinie. (C) Der komponentenbasierte Graph auf Bildniveau wurde aus der auf den Vordergrund beschränkten Komponentenkarte, der Komponentenmittelpunktmatrix, der typisierten Adjazenzmatrix, der Maske inaktiver Knoten und der Zuordnung der Komponentenlabels rekonstruiert, die während der Protokollabschnitte 3 und 4 gespeichert wurden. Knoten bezeichnen aktive Bereiche des Bekleidungsstücks, durchgezogene Kanten zeigen gemeinsame Vordergrundgrenzen an, und gestrichelte Kanten zeigen vordefinierte vertikale Ordnungsbeziehungen an. (D) Die Aktivierungsantwort der fusionierten, komponentenbezogenen Repräsentation. Der Vergleich zeigt den Unterschied zwischen texturbetonter Aktivierung und aktivierungsleitender Orientierung anhand der Bekleidungsbereiche. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 6: Rückgewinnungsergebnisse und strukturelle Zwischenergebnisse unter Interferenz mit rotem Hintergrund. (A) Das Abfragebild. (B) Der Abfrage-Komponentengraph wird aus den gespeicherten Komponentenzentren und der typisierten Adjazenzmatrix generiert. (C) Die typisierte Adjazenzmatrix der Abfrage, wobei die Matrixwerte inaktive Beziehungen, gemeinsame Vordergrundgrenzen und vordefinierte vertikale Ordnungsbeziehungen unterscheiden. (D) Die drei besten Rückgewinnungsergebnisse, erzeugt durch die Erscheinungsbasislinie. (E) Die drei besten Ergebnisse, erzeugt durch die strukturbewusste Repräsentation. (F) Der Komponentengraph des am höchsten bewerteten Ergebnisses der strukturbewussten Methode. (G) Die nach der Fusion ermittelte Komponentenzuordnungsmatrix zwischen der Abfrage und dem am höchsten bewerteten Ergebnis. Eine hohe diagonale Übereinstimmung weist auf Übereinstimmung zwischen Komponenten mit denselben Kennungen hin, während schwache oder verschobene Antworten auf fehlende oder falsch zugeordnete Komponentenorganisation hindeuten. Die Rückgewinnungsergebnisse bewahren die grobe Oberkörperkategorie bei, stellen jedoch keine vollständige Übereinstimmung in der Ärmelkonfiguration und lokalen Topologie her. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 7: Nachverfolgung struktureller Unterschiede von der garment-Topologie auf Bildniveau bis zur räumlichen Reaktion. (A) Das Referenzbild. (B) Das Zielbild. (C) Der Referenzkomponentengraph. (D) Der Zielkomponentengraph. Beide Graphen wurden aus den gespeicherten Komponentenzentren und typisierten Adjazenzmatrizen rekonstruiert. (E) Die typisierte Adjazenzdifferenzmatrix. (F) Die Differenz der geometrischen Relation ergibt sich aus der Verschiebung der Komponentenzentren, räumlicher Streuung und Änderungen im Relationsgewicht. (G) Der postfusionale Differenzgraph der Komponenten, wobei die Knotenintensität den normalisierten Abstand zwischen den entsprechenden fusionierten Komponentenvektoren darstellt und die Kantendicke die Änderung des Relationsgewichts repräsentiert. (H) Die reine räumliche Differenz-Reaktions-Heatmap wurde mit derselben festen Reaktionsskala wie das Overlay dargestellt. (I) Die Reaktion überlagert auf dem Zielbild. Ein struktureller Unterschied wird nur akzeptiert, wenn die Änderung der Adjazenz, die Änderung der geometrischen Relation, die Änderung des Komponentenabstands und die vordergrundausgerichtete Heat-Response konsistent bleiben. Hintergrundaktivierung ohne entsprechende Hinweise auf Komponenten oder Relationen wird als residuale Interferenz und nicht als gültiger garment-struktureller Unterschied betrachtet. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 8: Strukturberücksichtigende Clusterung im Merkmalsraum. (A) Die t-SNE-Projektion von kurzärmligen Oberteilen, Hosen, Röcken, langen Mänteln und Kleidern. Die fünf Kategorien bilden Hauptmerkmalsbereiche mit begrenzter Überlappung in den Grenzbereichen zueinander. (B) Repräsentative Testbilder, die den fünf Bekleidungskategorien zugeordnet wurden, wobei die Rahmenfarbe der Kategoriefarbe in (A) entspricht. Die Abbildung zeigt die strukturelle Organisation auf Kategorieebene, wobei eine geringe Anzahl von Proben in der Nähe benachbarter Kategorienbereiche erhalten bleibt. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 9: Direkter Vergleich der Rohleistung hinsichtlich Struktur des Merkmalsraums und Ziele der Abrangierung. (A) SCI und SDI für die auf Erscheinungsbild basierende Referenzmethode, das Modell mit schwacher Struktur, das Modell mit expliziter Struktur und die vorgeschlagene Methode. (B) Recall@5 und mAP für dieselben vier Methoden. Große Markierungen zeigen den arithmetischen Mittelwert aus fünf unabhängigen Durchläufen an, Fehlerbalken zeigen die Stichproben-Standardabweichung, und kleine Markierungen zeigen die Ergebnisse auf Durchlauf-Ebene. SCI und SDI sind auf einer festen Skala von null bis eins dargestellt, während Recall@5 und mAP auf einer festen prozentualen Skala von null bis einhundert abgebildet sind. Es wurde keine Min-Max-Normalisierung oder umverfahrensübergreifende Umrechnung vorgenommen. Bitte klicken Sie hier, um eine vergrößerte Version dieser Abbildung anzusehen.

Abbildung 10: Strukturelle Unterschiedsantworten unter verschiedenen Modulkonfigurationen. (A) Das Referenzbild. (B) Das Zielbild. (C) Die Antwort der Variante ohne Struktur-Vorgabe. (D) Die Antwort der Variante ohne das Fusionmodul. (E) Die Antwort des vollständigen Modells. (C–E) werden mit derselben normalisierten Antwortskala, Farbkarte und Überlagerungseinstellungen dargestellt. (F) Die auf den Vordergrund beschränkte absolute Antwortdifferenz zwischen der Nicht-Fusionsvariante und dem vollständigen Modell. Das vollständige Modell erhält die hauptsächlich entlang der Kleidung ausgerichtete Antwort bei gleichzeitiger Verringerung der Streuung außerhalb des Hauptstrukturbereichs. Der Vergleich zeigt, dass die Struktur-Vorgabe Störungen außerhalb der Kleidung reduziert und das Fusionmodul die strukturelle Antwort weiter schärft. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.

Abbildung 11: Validierungsbasierte Auswahl des Gewichts der strukturellen Nebenbedingung. Der Validierungs-Rückstellungsgrad bei 5 (Recall@5) ist für die Gewichte der strukturellen Nebenbedingung 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 und 2,0 dargestellt. Jeder Datenpunkt zeigt den arithmetischen Mittelwert aus fünf Validierungsdurchläufen an, und jede Fehlerbalken repräsentiert die empirische Standardabweichung. Das Gewicht wurde vor der endgültigen Testauswertung auf 1,0 festgelegt. Diese Abbildung dokumentiert das Verfahren zur Parameterauswahl und stellt keinen eigenständigen Beitrag zur Architektur dar. Bitte klicken Sie hier, um eine größere Version dieser Abbildung anzusehen.
Tabelle 1: Datensatzzuordnung und Bild-Ebenen-Topologie-Statistiken über die Kleidungsstück-Teilmengen S1 bis S5. Die Tabelle gibt die Anzahlen der Trainings-, Validierungs-, Test- und Gesamtbilder sowie die durchschnittliche Anzahl semantischer Komponenten, aktiver Knoten, typisierter Kanten und annotierter Bild-Ebenen-Landmarken für jede strukturelle Ebene an. Alle Werte wurden aus den verarbeiteten Datenmanifesten generiert. Die Anzahlen der Trainings-, Validierungs- und Testbilder wurden aus den endgültigen Teilmenge-Manifesten nach struktureller Überprüfung, Kontrolle von Duplikatgruppen und Prüfung auf Datenlecks gewonnen, während die Topologie-Statistiken aus den endgültigen Graph-Aufzeichnungen berechnet wurden, wobei dieselbe Komponentenreihenfolge und Relationsdefinitionen verwendet wurden wie bei der Modellbewertung. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 2: Berechnungsumgebung, Eingabekonfiguration, Datenaugmentierung, Repräsentation, Optimierung, Verlustfunktion und Einstellungen zur Reproduzierbarkeit, die im gesamten Protokoll verwendet wurden. Die Tabelle gibt die genauen Versionen des Betriebssystems, Prozessors, installierten Speichers, Grafikprozessors, Grafikspeichers, Grafiktreibers, CUDA, cuDNN, Python, NumPy, PyTorch und torchvision sowie die Bildgröße, Batch-Zusammenstellung, den Optimierer, den Lernratenplan, die Anzahl der Epochen, Zufalls-Startwerte (random seeds), die Dimensionen der Repräsentation und die Gewichte der strukturellen Zielgrößen an. Jeder Wert ist verknüpft mit software_versions.txt, configs/protocol.yaml oder dem entsprechenden Trainingsprotokoll. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 3: Quantitativer Vergleich allgemeiner Modelle zur visuellen Repräsentation, graphenbasierter Bekleidungsmodelle und domänenspezifischer Mode-Retrieval-Methoden. In der Tabelle werden Fokus und Abfragemodalität der Retrievalaufgabe sowie SCI, SDI, Recall@5, mAP und der Silhouettenkoeffizient für elf Methoden unter identischen Datenaufteilungen und Evaluierungsprotokollen angegeben. Jede Metrik wird als Mittelwert und Stichprobenstandardabweichung über fünf unabhängige Durchläufe berichtet. Die angegebenen p-Werte wurden mittels zweiseitiger gepaarter t-Tests ermittelt, bei denen jede Vergleichsmethode mit der vorgeschlagenen Methode unter Verwendung der Ergebnisse aus denselben fünf Zufalls-Saatwerten verglichen wurde. Die vorgeschlagene Methode gilt als Referenzzeile. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 4: Ablationsresultate für die Struktur-Prior und das Feature-Fusion-Modul. Die Tabelle zeigt SCI, SDI und Recall@5 für die Variante ohne strukturelle Prior, die Variante ohne das Fusionmodul sowie das vollständige Modell. Der Wegfall der strukturellen Prior führt zu einer stärkeren Abnahme von SCI und Recall@5, während das Entfernen des Fusionmoduls SDI und die Übereinstimmung der Antworten verringert. Das vollständige Modell weist bei allen drei Metriken die höchsten Werte auf. Bitte klicken Sie hier, um diese Datei herunterzuladen.
Tabelle 5: Berechnungseffizienz des ResNet-50-Basismodells und des vollständigen strukturbasierten Modells. In der Tabelle werden die anpassbaren Parameter, die Gleitkommaoperationen pro Bild sowie die durchschnittliche Inferenzzeit pro Bild unter exakt denselben Hardware- und Softwarebedingungen angegeben, die in Tabelle 2 und in der Materialtabelle dokumentiert sind. Beide Modelle verwenden dieselbe Bildauflösung, denselben Batch-Modus für die Inferenz, dieselben Vorverarbeitungsschritte und dieselbe Zeitmessmethode. Im Vergleich zum Basismodell fügt das vollständige Modell 3,7 Millionen Parameter, 1,3 Milliarden Gleitkommaoperationen und 7 Millisekunden Inferenzzeit pro Bild hinzu. Bitte klicken Sie hier, um diese Datei herunterzuladen.