Alle gerapporteerde experimenten werden uitgevoerd met de hardware- en softwareomgeving zoals gedocumenteerd in Tabel 2 en de Tabel met Materialen. Gedurende de preprocessie, training, inferentie en evaluatie werden dezelfde versies van de graphicsdriver, CUDA, cuDNN, Python, NumPy, PyTorch en torchvision gebruikt. De volledige hardware- en softwareomgeving is samengevat in Tabel 2 en de Tabel met Materialen. Tabel 1 geeft een overzicht van de verwerkte trainings-, validatie- en testdatasets samen met de topologiestatistieken op beeldniveau. Tabel 2 vat de gemeenschappelijke configuratie samen die is gebruikt voor alle vergelijkingsmethoden.
Resultaten van de vergelijkende evaluatie
De vergelijkende evaluatie volgde de gangbare datapartities, preprocessing-operaties, trainingscontroles en metriekdefinities zoals gespecificeerd in secties 7–9 van het protocol. Tabel 3 vergelijkt algemene visuele encoders, part-aligned modellen, grafiekgebaseerde kledingrepresentaties, cross-domein fashion retrieval-netwerken, topology-and-appearance fusiemethoden en e-commerce visuele retrieval-methoden, alle geëvalueerd met hetzelfde image-query protocol. De domeinspecifieke methoden omvatten Topology Feature Histogram with Color and Texture Fusion (TFH-CT), Attention-Guided Cascade Network (AGC-Net), Multi-scale and Multi-granularity Feature Learning Network (MMFL-Net) en Fashion Retrieval using Residual Network with Egret Swarm Optimization (FARE-RNET). Alle evaluatiemetrieken in Tabel 3 worden gerapporteerd als het gemiddelde en de steekproefstandaarddeviatie over vijf onafhankelijke runs met gebruik van dezelfde random seeds, trainingsmanifest, validatiemanifest, testmanifest, query-gallery toewijzing en metriekimplementatie. De gepaarde p-waarden werden afzonderlijk berekend voor SCI, SDI, Recall@5, mAP en de silhouette-coëfficiënt door elke methode te vergelijken met de voorgestelde methode onder overeenkomstige random-seed condities. Deze resultaten vormen de kwantitatieve basis voor de daaropvolgende structurele visualisatie, retrieval, clustering en ontwerpgeoriënteerde analyses.
Representatieve protocolresultaten en interpretatie
Een succesvolle uitvoering van het protocol is herkenbaar wanneer de op beeldniveau gereconstrueerde componentgraaf, opgesteld uit de opgeslagen parsing- en graafbestanden, elke actieve node binnen de overeenkomstige kledingregio plaatst en de relatietypen bewaart die zijn vastgelegd in de getypeerde adjacentiematrix, zoals weergegeven in Figuur 5C. De structuurbewuste respons moet geconcentreerd blijven op de voorgrond van het kledingstuk, zoals te zien is in Figuur 5D. Figuur 6E toont een verwacht retrieval-resultaat waarbij de voorgestelde methode de invloed van de rode achtergrond vermindert en kledingstukken voor het bovenlichaam terugvindt in plaats van niet-gerelateerde rode objecten. Figuur 6B–G demonstreert tevens dat de retrieval-ranking wordt ondersteund door componentrelaties op beeldniveau en componentcorrespondentie na fusie. Dit resultaat weerspiegelt het herstel van de grove kledingcategorie, hoewel de mouwlengte en lokale topologie nog steeds variëren tussen de teruggevonden monsters.
Veelvoorkomende foutgevallen omvatten de door textuur gedomineerde activatie in Figuur 5B, de door achtergrondkleur gestuurde retrieval in de bovenste rij van Figuur 6, en de residuele achtergrondactivatie in Figuur 7. Figuur 7 moet worden geïnterpreteerd als gedeeltelijke lokalisatie, omdat de dominante respons het vergrote silhouet van het onderlichaam en de rechter kledingrand volgt, terwijl residuele activatie aanwezig blijft in aangrenzende achtergrondregio's. De lokalisatie wordt slechts als structureel ondersteund beschouwd wanneer de topologie-verschilmatrix, de geometrische-relatie-verschilmatrix, de post-fusie component-verschilgraaf en de ruimtelijke respons consistente kledingregio's identificeren. Een ruimtelijk hotspot zonder overeenkomstige wijzigingen in de matrix of componenten duidt op visuele interferentie in plaats van structureel bewijs.
Een protocolrun wordt als geldig beschouwd wanneer elke geaccepteerde afbeelding een genormaliseerde semantische waarschijnlijkheidskaart produceert, een relatiematrix met K rijen en K kolommen, uiterlijke en structurele kenmerkenmatrices met K rijen en 512 kolommen, en een eindige gefuseerde kenmerkenvector die gekoppeld is aan de juiste afbeeldingsidentificator. Visuele inspectie moet bevestigen dat de topologie de kledingcomponenten volgt, dat de foreground-respons de background-respons overtreft en dat retrieval-resultaten worden gestuurd door de kledingcategorie en -structuur in plaats van door de achtergrondkleur. Gefragmenteerde waarschijnlijkheidskaarten, ontbrekende componentknopen, niet-numerieke matrices, diffuse background-responsen of door kleur gedomineerde retrieval duiden op een mislukte uitvoering en vereisen inspectie van het parsen, de graafconstructie, de feature-fusie of het laden van checkpoints.
Visuele analyse van responsen van kledingcomponenten op beeldniveau
Figuur 5 vergelijkt de ResNet-50 baseline met het component-bewuste model met gebruikmaking van dezelfde kledingafbeelding. Figuur 5B toont de class activation map voor de appearance baseline. Figuur 5C presenteert de graaf van kledingcomponenten op beeldniveau, gereconstrueerd vanuit de foreground-restricted probability map, de component center matrix, de typed adjacency matrix, het inactive-node mask en de component label mapping die zijn gegenereerd in protocolsecties 3 en 4. Figuur 5D presenteert de activatierespons van de gefuseerde representatie. Er is geen menselijke pose-estimator of annotatie van menselijke gewrichten gebruikt om Figuur 5C te genereren.
De basisrespons was geconcentreerd op lokale textuurregio's in het onderkledingstuk en volgde niet consistent de volledige rand van het kledingstuk, zoals weergegeven in Figuur 5B. In Figuur 5C komt elke knoop overeen met het centrum van een actieve regio van een kledingcomponent, terwijl elke rand een gedeelde voorgrondrand of een vooraf gedefinieerde verticale volgorde-relatie vertegenwoordigt. De graaf weerspiegelt de organisatie van de kledingregio's en stelt geen menselijke anatomische gewrichten voor. De structuurbewuste respons besloeg de belangrijkste voorgrond van het kledingstuk, terwijl in de meeste achtergrondgebieden een lagere activatie behouden bleef, zoals weergegeven in Figuur 5D. Deze resultaten geven aan dat de componentgraaf en de feature-fusiemodule de textuurgedomineerde activatie in de geëvalueerde afbeelding hebben verminderd.
Analyse van structurele gelijkenis van kleding en resultaten van het ontwerpnaslagwerk
Figuur 6 presenteert de retrieval-rangschikking samen met het structurele bewijs dat is gebruikt voor de interpretatie ervan. De query-componentgraaf in Figuur 6B registreert actieve kledingstukregio's en hun getypeerde relaties, terwijl de matrix in Figuur 6C het relatiepatroon blootlegt dat aan de graafpropagatie is geleverd. De basislijnresultaten in Figuur 6D blijven gedomineerd worden door rode uiterlijkkenmerken. De structuurbewuste resultaten in Figuur 6E behouden de categorie kledingstukken voor het bovenlichaam over verschillende kleuren en achtergronden heen. De componentgraaf van het hoogst gerangschikte resultaat in Figuur 6F maakt een directe vergelijking met de query-graaf mogelijk, en de correspondentiematrix in Figuur 6G onthult of componenten met dezelfde identificatoren uitgelijnd blijven na structuurgestuurde fusie. De diagonale correspondentie dient gezamenlijk te worden geïnterpreteerd met ontbrekende knopen en gewijzigde graafrelaties. Sterke gelijkenis in uiterlijk zonder overeenstemming in de graaf vormt geen succesvolle structurele retrieval.
De opgehaalde kledingstukken behouden de grove categorie, maar verschillen in mouwconfiguratie en lokale componentrelaties wijzen op een onvolledige fijnmazige correspondentie. De voorgestelde methode behaalde een Recall@5 van 89,2% en een mAP van 86,4%, zoals vermeld in Tabel 3. Deze kwantitatieve waarden beschrijven de rankingprestaties, terwijl Figuur 6B–G tussenliggend structureel bewijs levert ter ondersteuning van de interpretatie. De conclusie van het ophaalproces is daarom beperkt tot een verbeterde resistentie tegen interferentie van achtergrondkleuren en een sterkere organisatie van componenten op beeldniveau onder de geteste query.
Respons op structurele verschillen en ondersteuning bij ontwerpanalyse
de zuivere verschil-respons-heatmap in Figuur 7H laat zien dat de dominante respons geconcentreerd is op het vergrote silhouet van het onderlichaam en de rechter kledingrand van de doelafbeelding. De overlay in Figuur 7I laat zien dat de sterkste respons gealigneerd blijft met de voorgrond van het hoofdကledingstuk, terwijl zwakkere activatie in de aangrenzende gordijn- en wandregio's aanwezig blijft als residuele achtergrondinterferentie. De ruimtelijke respons dient te worden geïnterpreteerd in samenhang met de componentgrafiek en het matrixbewijs gepresenteerd in Figuren 7C–GEen respons wordt alleen als een geldig structureel verschil beschouwd wanneer de regio van het kledingstuk met de hoge respons consistent is met de wijziging in nabijheid, de wijziging in geometrische relatie en het patroon van de componentafstand na fusie.
Een structureel verschil wordt alleen geaccepteerd wanneer de getypeerde wijziging in nabijheid in Figuur 7E of de wijziging in de geometrische relatie in Figuur 7F gepaard gaat met een toegenomen componentafstand in Figuur 7G en een op de voorgrond uitgelijnde ruimtelijke respons in Figuur 7H,I. De vergrote regio van het onderlichaam en de rand van het kledingstuk aan de rechterkant voldoen aan dit cross-stage criterium. Activering over het gordijn en de muur komt niet overeen met wijzigingen in componentknopen, relatiepatronen of gefuseerde componentafstanden, en wordt daarom verworpen als niet-structurele residuele interferentie. Het resultaat ondersteunt lokalisatie van verschillen op beeldniveau, maar stelt geen variatie in stikpatronen of constructieparameters vast.
Analyse van de ruimtelijke distributie van kenmerken en structurele clusteranalyse
Analyse van de distributie van de latente kenmerkruimte onthult het vermogen van het model om de structurele semantiek van kleding te onderscheiden. Deze analyse onderzoekt of de structurele prior kledingstukken met verschillende topologische configuraties organiseert in afzonderlijke kenmerkmanifolds. Er werden vijf representatieve structurele categorieën uit de testset geselecteerd: shirts met korte mouwen, broeken, rokken, lange jassen en jurken. De hoogdimensionale kenmerkvectoren werden geprojecteerd op een tweedimensionaal vlak met behulp van t-distributed stochastic neighbor embedding (t-SNE). De cohesie van vergelijkbare monsters en de scheiding van onvergelijkbare monsters werden beoordeeld om de organisatie van de structurele semantiek in de kenmerkruimte te karakteriseren. De t-SNE-distributie van de structuurbewuste kenmerkruimte wordt weergegeven in Figuur 8.
De t-SNE-projectie vormde vijf hoofdkenmerkregio's met beperkte overlap tussen naburige categorieën, zoals weergegeven in Figuur 8ARepresentatieve monsters die overeenkomen met de vijf categorieregio's worden getoond in Figuur 8BDe SCI van 0,81 weerspiegelt de compactheid van monsters met hetzelfde structurele label, en de SDI van 0,71 weerspiegelt de scheiding tussen monsters met verschillende structurele labels, zoals gerapporteerd in Tabel 3 en gevisualiseerd in Figuur 8Deze indices moeten worden geïnterpreteerd als maten voor de distributie in de kenmerkruimte en stellen geen vals-positieve ratio direct vast. Tops met korte mouwen en rokken bevonden zich in verschillende hoofdregio's in de geprojecteerde kenmerkruimte, terwijl een klein aantal monsters nabij aangrenzende categoriegrenzen bleef, zoals weergegeven in Figuur 8ABroeken en jurken vertoonden ook een duidelijke scheiding van naburige categorieën. Deze distributie geeft aan dat de graph prior bijdroeg aan de structurele organisatie op categorieniveau zonder volledige clusterscheiding te produceren. De evaluatie scheidt de representatiekwaliteit van de effectiviteit van de retrieval. SCI beoordeelt of kledingstukken met hetzelfde structurele label compact blijven in de geleerde kenmerkruimte, terwijl SDI beoordeelt of kledingstukken met verschillende structurele labels gescheiden blijven. Deze metrieken komen overeen met het doel voor structurele representatie van het protocol. Recall@5 meet of een structureel relevant kledingstuk verschijnt binnen de eerste vijf opgehaalde resultaten, terwijl mAP de rankingkwaliteit meet over alle relevante gallery-samples. Deze metrieken komen overeen met het doel voor design-reference retrieval. De silhouette-coëfficiënt werd uitsluitend gebruikt om de clusteringprestaties te evalueren, aangezien SCI en SDI de organisatie van de kenmerkruimte reeds karakteriseren.
Figuur 9 rapporteert de ruwe resultaten van vijf runs voor vier representatieve methoden zonder cross-methode normalisatie. Figuur 9A presenteert SCI en SDI op hun oorspronkelijke schaal, terwijl Figuur 9B Recall@5 en mAP als percentages presenteert. De markeringen van de individuele runs en de foutlijnen van de standaarddeviatie tonen de variatie die gepaard gaat met de modeltraining, in plaats van enkel de geaggregeerde rangschikking. De baseline op basis van uiterlijke kenmerken behaalde een SCI van 0,62, terwijl de voorgestelde methode een SCI van 0,81 en een SDI van 0,71 behaalde (Tabel 3 en Figuur 9A). De SCI- en SDI-resultaten duiden op een sterkere compactheid binnen labels en een betere scheiding tussen labels onder de geëvalueerde setting. De voorgestelde methode behaalde een Recall@5 van 89,2% en een mAP van 86,4% (Tabel 3 en Figuur 9B). Deze retrieval-metrieken beoordelen verschillende rangschikkingseigenschappen en worden apart geïnterpreteerd van SCI en SDI. De consistente volgorde van methoden over de vier metrieken geeft overeenstemming aan tussen de representatiekwaliteit en de retrieval-prestaties, maar dit impliceert niet dat de relatieve verbetering identiek is over de vier evaluatiedimensies.
Ablatie-experimenten en analyse van de effectiviteit van structurele modules
Het ablatie-experiment vergelijkt het volledige model met varianten waarin de structurele prior of de fusiemodule is verwijderd. Alle drie de configuraties maken gebruik van dezelfde referentie- en doelafbeeldingen, waardoor een directe vergelijking van de achtergrondrespons en de lokalisatieconcentratie mogelijk is. De variant zonder de structurele prior verwijdert de grafiek van het kledingstukcomponent op beeldniveau en de bijbehorende relatiebeperkingen, en vertrouwt uitsluitend op de convolutionele backbone voor het extraheren van uiterlijkkenmerken; de variant zonder fusie behoudt de grafiekinferentie maar verwijdert de kenmerkpiramide, waarbij alleen hoogwaardige semantische kenmerken worden gebruikt. Gevisualiseerde verschil-heatmaps onthullen de specifieke rollen van elke module bij ruisonderdrukking en randdefinitie; een kwalitatieve vergelijking van de structurele verschilresponsen onder verschillende moduleconfiguraties wordt getoond in Figuur 10.
De responskaarten in Figuur 10C–E zijn weergegeven met een gedeelde responsschaal en identieke overlay-instellingen. De variant zonder de structure prior produceerde een sterke activatie in de linkerachtergrond en rond niet-gerelateerde omgevingsregio's, zoals te zien is in Figuur 10C. De variant zonder de fusiemodule verminderde een deel van die respons buiten het kledingstuk, maar behield nog steeds een bredere spreiding over het onderste kledingstuk en de omliggende regio aan de rechterzijde, zoals te zien is in Figuur 10D. Het volledige model zorgde voor een verdere contractie van de dominante respons richting de voorgrond van het hoofd kledingstuk, zoals te zien is in Figuur 10E. Figuur 10F visualiseert direct het verschil in foreground-beperkte responsen tussen de non-fusievariant en het volledige model, wat aantoont dat het volledige model residuele laterale spreiding onderdrukt terwijl de belangrijkste kledingstuk-uitgelijnde respons behouden blijft. Deze resultaten geven aan dat de structure prior voornamelijk omgevingsruis verminderde en dat de fusiemodule de responsconcentratie en structurele uitlijning verder verbeterde. Figuur 10E vertegenwoordigt een relatieve verbetering in plaats van een volledige verwijdering van de achtergrondactivatie.
Tabel 4 rapporteert SCI, SDI en Recall@5 voor de varianten zonder de structurele prior, zonder de fusiemodule en met het volledige model. Het verwijderen van de structurele prior verminderde de SCI van 0,81 naar 0,65 en verlaagde de Recall@5 van 89,2% naar 74,5%. Het verwijderen van de fusiemodule verminderde de SDI van 0,71 naar 0,64 en verlaagde de Recall@5 van 89,2% naar 85,1%, een afname van 4,1 procentpunt. Deze resultaten geven aan dat de structurele prior een grotere invloed had op de structurele consistentie en het ophalen, terwijl feature-fusie de uitlijning tussen uiterlijk en structurele informatie verbeterde.
De efficiëntieanalyse vergelijkt de computationele kosten van het volledige model met de ResNet-50 baseline. De ResNet-50 baseline vereiste 25,6 miljoen parameters en 4,1 miljard floating-point operaties. Het volledige structuurbewuste model vereiste 29,3 miljoen parameters en 5,4 miljard floating-point operaties. De gemiddelde inferentietijd was 15 milliseconden per afbeelding voor de baseline en 22 milliseconden per afbeelding voor het volledige model, een toename van 7 milliseconden. Dit resultaat wijst op een meetbare computationele kost die in overweging moet worden gebracht bij de implementatie van het protocol in tijdgevoelige workflows (Tabel 5). Het gewicht van de structurele beperking werd bepaald op basis van de validatieset voorafgaand aan de uiteindelijke testevaluatie. De validatie Recall@5 werd onderzocht bij gewichten voor de structurele beperking van 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 en 2,0. Voor elke volgende trainings- en testrun werd een gewicht van 1,0 vastgesteld. Figuur 11 documenteert de op validatie gebaseerde selectie van een gewicht van 1,0 voor de structurele beperking.

Figuur 1: Algemene workflow van het structuurbewuste protocol voor het leren van kenmerken van kledingafbeeldingen. De invoerafbeelding van het kledingstuk wordt verwerkt door een tak voor uiterlijke kenmerken en een tak voor structurele kenmerken die gebruikmaakt van semantische parsing en ruimtelijke graafmodellering. De twee representaties worden verwerkt door de structuurgestuurde fusiemodule om het uiteindelijke structuurbewuste kenmerk te genereren. Structureel consistentieverlies, structureel discriminatieverlies en structureel relatieverlies beperken gezamenlijk de kenmerkruimte. De figuur laat zien hoe het uiterlijk van het kledingstuk en de componenttopologie worden geïntegreerd gedurende het leren van kenmerken. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 2: Constructie van een prior voor de topologie van kledingcomponenten op beeldniveau. (A) De invoerafbeelding van het kledingstuk I. (B) De op de voorgrond beperkte visuele componentenkaart P, waarin zeven kleuren kledingregio's op beeldniveau aanduiden. Alle achtergrondpixels zijn uitgesloten van de componentkanalen. (C) De relatiegrafiek van componenten op beeldniveau G. Knooppunten representeren zichtbare kledingregio's, doorgetrokken lijnen representeren gedeelde grenzen op de voorgrond, en gestreepte relaties representeren een vooraf gedefinieerde verticale volgorde. De kaart en grafiek ondersteunen beeldopvraging en vergelijking van visuele structuren. Ze representeren geen patronen, naadgeometrie, coupenaden, graderingsparameters of snijinstructies. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 3: Structuurgeleide feature-fusiemodule. De structurele feature wordt getransformeerd door de lineaire mapping en activatiefunctie Ψ om een structureel gewicht te genereren. Het structurele gewicht moduleert de uiterlijke feature via elementgewijze vermenigvuldiging. De gemoduleerde uiterlijke feature en de structurele feature worden geconcateneerd en geprojecteerd door Wc, waarna de residuele structurele feature wordt toegevoegd om de uiteindelijke component-feature te genereren. De figuur laat zien dat structurele informatie de weging van de uiterlijke feature reguleert vóór de uiteindelijke fusie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 4: Optimalisatie van de kenmerkruimte onder structurele consistentiebeperkingen. (A) Monsters die tot dezelfde structurele klasse behoren, worden dichter bij elkaar getrokken door het structurele consistentieverlies, terwijl hun interne componentrelaties behouden blijven door het structurele relatieverlies. (B) Monsters uit verschillende structurele klassen worden uit elkaar geduwd door het structurele discriminatieverlies. De figuur laat zien hoe de drie structurele doelstellingen gezamenlijk de compactheid binnen de klasse en de scheiding tussen klassen vergroten. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 5: Representatieve responsen van kledingkenmerken en visualisatie van de component-graaf. (A) De inputafbeelding van het kledingstuk. (B) De klasse-activatierespons van de ResNet-50 appearance-baseline. (C) De component-graaf van het kledingstuk op beeldniveau is gereconstrueerd op basis van de foreground-restricted componentmap, de componentcentrummatrix, de getypeerde adjacentiematrix, het inactieve-knooppuntmasker en de componentlabelmapping, die zijn opgeslagen tijdens Protocolsecties 3 en 4. Knooppunten duiden actieve kledingregio's aan, doorgetrokken randen duiden gedeelde voorgrondgrenzen aan en gestreepte randen duiden vooraf gedefinieerde verticale-ordereleaties aan. (D) De activatierespons van de gefuseerde component-bewuste representatie. De vergelijking toont het verschil tussen textuurgedomineerde activatie en door kledingregio's geleide activatie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 6Ophaalresultaten en intermediair structureel bewijs onder interferentie van een rode achtergrond. (A) De query-afbeelding. (B) De query-componentengrafiek wordt gegenereerd op basis van de opgeslagen componentencentra en de getypeerde adjacentiematrix. (C) De ingevoerde query-adjacentiematrix, waarbij de matrixwaarden onderscheid maken tussen inactieve relaties, gedeelde voorgrondgrenzen en vooraf gedefinieerde verticale-volgorde-relaties. (D) De drie beste retrievalresultaten werden gegenereerd door de baseline voor uiterlijk. (E) De drie beste resultaten werden behaald met de structuurbewuste representatie. (F) De componentengrafiek van het hoogst gerangschikte structuurbewuste resultaat. (G) De correspondentiematrix van componenten na fusie tussen de query en het hoogst gerangschikte resultaat. Een sterke diagonale correspondentie duidt op overeenstemming tussen componenten met dezelfde identificatoren, terwijl zwakke of verschoven responsen duiden op ontbrekende of foutief gematchte componentorganisatie. De opvraagresultaten behouden de grove categorie van het bovenlichaam, maar vestigen geen volledige overeenstemming in mouwconfiguratie en lokale topologie. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 7: Traceren van structurele verschillen van kledingtopologie op afbeeldingsniveau naar ruimtelijke respons. (A) De referentieafbeelding. (B) De doelafbeelding. (C) De referentiegraaf van componenten. (D) De doelgraaf van componenten. Beide grafieken zijn gereconstrueerd op basis van de opgeslagen componentcentra en getypeerde adjacentiematrices. (E) De getypeerde adjacentieverschildenmatrix. (F) Het geometrische relatieverschil is afgeleid van de verplaatsing van het componentcentrum, ruimtelijke dispersie en veranderingen in het relatiegewicht. (G) De graaf van componentverschillen na fusie, waarbij de knoopintensiteit de genormaliseerde afstand tussen overeenkomstige gefuseerde componentvectoren vertegenwoordigt en de lijndikte de verandering in relatiegewicht vertegenwoordigt. (H) De zuivere heatmap van de ruimtelijke verschilrespons is gerenderd met dezelfde vaste responsschaal als de overlay. (I) De respons als overlay op de doelafbeelding. Een structureel verschil wordt alleen geaccepteerd wanneer de verandering in adjacentie, de verandering in geometrische relatie, de verandering in componentafstand en de op de voorgrond afgestemde hitte-respons consistent blijven. Achtergrondactivatie zonder overeenkomend bewijs van componenten of relaties wordt beschouwd als residuele interferentie in plaats van een geldig verschil in kledingstructuur. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 8: Structuurbewuste clustering in de kenmerkruimte. (A) De t-SNE-projectie van korte mouw tops, broeken, rokken, lange jassen en jurken. De vijf categorieën vormen hoofdkenmerkregio's met beperkte overlap nabij de grenzen daartussen. (B) Representatieve testafbeeldingen toegewezen aan de vijf kledingcategorieën, waarbij de randkleur overeenkomt met de categoriekleur in (A). De figuur toont de structurele organisatie op categorieniveau, terwijl een klein aantal monsters nabij aangrenzende categorieregio's behouden blijft. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 9: Ruwe prestatievergelijking over kenmerkruimte-structuur en retrieval-ranking-doelstellingen. (A) SCI en SDI voor de op uiterlijk gebaseerde baseline, het model met zwakke structuur, het model met expliciete structuur en de voorgestelde methode. (B) Recall@5 en mAP voor dezelfde vier methoden. Grote markeringen geven het rekenkundig gemiddelde over vijf onafhankelijke runs aan, foutlijnen geven de steekproefstandaarddeviatie aan en kleine markeringen geven de resultaten op run-niveau aan. SCI en SDI worden weergegeven op een vaste schaal van nul tot één, terwijl Recall@5 en mAP worden weergegeven op een vaste percentageschaal van nul tot honderd. Er is geen min-max-normalisatie of cross-method herschaling toegepast. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 10: Structurele verschilresponsen onder verschillende moduleconfiguraties. (A) De referentieafbeelding. (B) De doelafbeelding. (C) De respons van de variant zonder de structurele prior. (D) De respons van de variant zonder de fusiemodule. (E) De respons van het volledige model. (C–E) zijn weergegeven met dezelfde genormaliseerde responsschaal, kleurkaart en overlay-instellingen. (F) Het op de voorgrond beperkte absolute responsverschil tussen de non-fusievariant en het volledige model. Het volledige model behoudt de belangrijkste kleding-uitgelijnde respons, terwijl de residuele verspreiding buiten de belangrijkste structurele regio wordt verminderd. De vergelijking laat zien dat de structurele prior interferentie buiten de kleding vermindert en dat de fusiemodule de structurele respons verder verscherpt. Klik hier om een grotere versie van deze figuur te bekijken.

Figuur 11: Validatiegebaseerde selectie van het structurele beperkingsgewicht. De Validation Recall@5 wordt gerapporteerd bij structurele beperkingsgewichten van 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 en 2,0. Elk punt geeft het rekenkundig gemiddelde over vijf validatieruns aan, en elke foutenbalk geeft de steekproefstandaarddeviatie aan. Het gewicht werd vastgesteld op 1,0 vóór de uiteindelijke testevaluatie. Deze figuur documenteert de parameterselectieprocedure en vormt geen onafhankelijke architecturale bijdrage. Klik hier om een grotere versie van deze figuur te bekijken.
Tabel 1: Toewijzing van de dataset en topologiestatistieken op beeldniveau over de kledingstuk-subsets S1 tot S5. De tabel rapporteert de aantallen beelden voor training, validatie, test en het totaal, samen met het gemiddelde aantal semantische componenten, het aantal actieve knopen, het aantal getypeerde randen en het aantal geannoteerde referentiepunten op het beeldvlak voor elk structureel niveau. Alle waarden zijn gegenereerd vanuit de verwerkte datamanifesten. De aantallen beelden voor training, validatie en test zijn verkregen uit de definitieve subset-manifesten na structurele revisie, controle op duplicaatgroepen en inspectie op datalekken, terwijl de topologiestatistieken zijn berekend uit de definitieve graafrecords met gebruik van dezelfde componentvolgorde en relatiedefinities als die zijn toegepast tijdens de modelevaluatie. Klik hier om dit bestand te downloaden.
Tabel 2: Instellingen voor de computationele omgeving, inputconfiguratie, augmentatie, representatie, optimalisatie, verlies en reproduceerbaarheid die gedurende het protocol zijn gebruikt. De tabel vermeldt de exacte versies van het besturingssysteem, de processor, het geïnstalleerde geheugen, de grafische verwerkingseenheid, het grafisch geheugen, de grafische driver, CUDA, cuDNN, Python, NumPy, PyTorch en torchvision, samen met de afbeeldinggrootte, batchconstructie, optimizer, learning-rate schema, aantal epochs, random seeds, representatiedimensies en structurele doelgewichten. Elke waarde is gekoppeld aan software_versions.txt, configs/protocol.yaml of het overeenkomstige trainingsverslag. Klik hier om dit bestand te downloaden.
Tabel 3: Kwantitatieve vergelijking van algemene visuele representatiemodellen, graafgebaseerde kledingmodellen en domeinspecifieke moderecuparatiemethoden. De tabel rapporteert de recuperatiefocus, query-modaliteit, SCI, SDI, Recall@5, mAP en silhouetcoëfficiënt voor elf methoden onder dezelfde datapartities en evaluatieprotocollen. Elke metriek wordt gerapporteerd als het gemiddelde en de steekproefstandaarddeviatie over vijf onafhankelijke runs. De gerapporteerde p-waarden zijn verkregen uit tweezijdige gepaarde t-toetsen waarbij elke vergelijkingsmethode werd vergeleken met de voorgestelde methode, gebruikmakend van resultaten die zijn geproduceerd onder dezelfde vijf willekeurige seeds. De voorgestelde methode dient als referentierij. Klik hier om dit bestand te downloaden.
Tabel 4: Ablatieresultaten voor de structuur-prior en de feature-fusiemodule. De tabel rapporteert SCI, SDI en Recall@5 voor de variant zonder de structurele prior, de variant zonder de fusiemodule en het volledige model. Het verwijderen van de structuur-prior leidt tot een grotere afname in SCI en Recall@5, terwijl het verwijderen van de fusiemodule de SDI en de respons-uitlijning vermindert. Het volledige model behaalt de hoogste waarde voor alle drie de metrieken. Klik hier om dit bestand te downloaden.
Tabel 5: Computationele efficiëntie van de ResNet-50 baseline en het volledige structuurbewuste model. De tabel vermeldt de trainbare parameters, floating-point bewerkingen per afbeelding en de gemiddelde inferentietijd per afbeelding onder de exacte hardware- en softwareomgeving zoals gedocumenteerd in Tabel 2 en de Materialenlijst. Beide modellen gebruiken dezelfde beeldresolutie, inferentie-batchinstellingen, voorbewerkingstappen en timingsprocedure. Het volledige model voegt 3,7 miljoen parameters, 1,3 miljard floating-point bewerkingen en 7 milliseconden inferentietijd per afbeelding toe ten opzichte van de baseline. Klik hier om dit bestand te downloaden.