Wszystkie opisane eksperymenty zostały przeprowadzone z wykorzystaniem środowiska sprzętowego i programowego udokumentowanego w Tabeli 2 oraz w Tabeli Materiałów. Przez cały proces wstępnego przetwarzania, uczenia, wnioskowania i ewaluacji stosowano te same wersje sterownika graficznego, CUDA, cuDNN, Python, NumPy, PyTorch oraz torchvision. Kompletne środowisko sprzętowe i programowe zostało zestawione w Tabeli 2 oraz w Tabeli Materiałów. Tabela 1 zawiera podsumowanie przetworzonych zbiorów treningowych, walidacyjnych i testowych wraz ze statystykami topologii na poziomie obrazu. Tabela 2 przedstawia wspólną konfigurację zastosowaną we wszystkich metodach porównawczych.
Wyniki oceny porównawczej
Ocena porównawcza została przeprowadzona zgodnie z powszechnie stosowanymi podziałami danych, operacjami preprocessingu, kontrolami treningu oraz definicjami metryk określonymi w sekcjach 7–9 protokołu. Tabela 3 porównuje ogólne koder wizualne, modele wyrównane do części obiektu, grafowe reprezentacje odzieży, sieci wyszukiwania mody międzydomenowej, metody fuzji topologii i wyglądu oraz metody wizualnego wyszukiwania w e-commerce, przy czym wszystkie zostały ocenione przy użyciu tego samego protokołu zapytań obrazowych. Metody specyficzne dla danej domeny obejmują Topology Feature Histogram with Color and Texture Fusion (TFH-CT), Attention-Guided Cascade Network (AGC-Net), Multi-scale and Multi-granularity Feature Learning Network (MMFL-Net) oraz Fashion Retrieval using Residual Network with Egret Swarm Optimization (FARE-RNET). Wszystkie metryki oceny w Tabeli 3 są przedstawione jako średnia i odchylenie standardowe próby z pięciu niezależnych uruchomień przy użyciu tych samych ziarn losowości (random seeds), manifestu treningowego, manifestu walidacyjnego, manifestu testowego, przypisania zapytanie-galeria oraz implementacji metryk. Sparowane wartości p- zostały obliczone oddzielnie dla SCI, SDI, Recall@5, mAP i współczynnika sylwetki poprzez porównanie każdej metody z metodą proponowaną w dopasowanych warunkach ziarn losowości. Wyniki te stanowią podstawę ilościową dla późniejszych analiz w zakresie wizualizacji strukturalnej, wyszukiwania, klastrowania i projektowania.
Reprezentatywne wyniki protokołu i ich interpretacja
O pomyślnym wykonaniu protokołu świadczy fakt, że graf komponentów na poziomie obrazu, zrekonstruowany z zapisanych plików analizy i grafu, umieszcza każdy aktywny węzeł w odpowiadającym mu regionie odzieży i zachowuje typy relacji zapisane w typowanej macierzy sąsiedztwa, co przedstawiono na Rysunku 5C. Odpowiedź uwzględniająca strukturę powinna pozostać skoncentrowana na pierwszym planie odzieży, jak pokazano na Rysunku 5D. Rysunek 6E przedstawia oczekiwany wynik wyszukiwania, w którym proponowana metoda redukuje wpływ czerwonego tła i wyszukuje odzież górną zamiast niepowiązanych czerwonych obiektów. Rysunek 6B–G wykazuje również, że ranking wyszukiwania jest wspierany przez relacje komponentów na poziomie obrazu oraz korespondencję komponentów po fuzji. Wynik ten odzwierciedla odtworzenie ogólnej kategorii odzieży, mimo że długość rękawów i lokalna topologia nadal różnią się w wyszukanych próbkach.
Typowe przypadki błędów obejmują aktywację zdominowaną przez teksturę na Rysunku 5B, wyszukiwanie sterowane kolorem tła w górnym rzędzie Rysunku 6 oraz resztkową aktywację tła na Rysunku 7. Rysunek 7 należy interpretować jako lokalizację częściową, ponieważ dominująca odpowiedź podąża za powiększoną sylwetką dolnej części ciała i prawą krawędzią ubrania, podczas gdy resztkowa aktywacja pozostaje w sąsiednich obszarach tła. Lokalizację uznaje się za wspartą strukturalnie tylko wtedy, gdy macierz różnic topologicznych, macierz różnic relacji geometrycznych, graf różnic komponentów po fuzji oraz odpowiedź przestrzenna identyfikują spójne obszary ubrania. Przestrzenny punkt zapalny (hotspot) bez odpowiadających mu zmian w macierzy lub komponentach wskazuje na zakłócenia wizualne, a nie na dowody strukturalne.
Uruchomienie protokołu uznaje się za prawidłowe, gdy każdy zaakceptowany obraz generuje znormalizowaną semantyczną mapę prawdopodobieństwa, macierz relacji o wymiarach K wierszy i K kolumn, macierze cech wyglądu i struktury o wymiarach K wierszy i 512 kolumn oraz skończony zunifikowany wektor cech powiązany z prawidłowym identyfikatorem obrazu. Inspekcja wizualna powinna potwierdzić, że topologia odpowiada komponentom odzieży, że odpowiedź tła jest niższa niż odpowiedź pierwszego planu, a wyniki wyszukiwania są determinowane przez kategorię i strukturę odzieży, a nie przez kolor tła. Fragmentaryczne mapy prawdopodobieństwa, brakujące węzły komponentów, macierze nienumeryczne, rozproszone odpowiedzi tła lub wyszukiwanie zdominowane przez kolor wskazują na niepowodzenie wykonania i wymagają weryfikacji parsowania, konstrukcji grafu, fuzji cech lub ładowania punktów kontrolnych.
Analiza wizualna odpowiedzi komponentów odzieży na poziomie obrazu
Rycina 5 porównuje bazowy model ResNet-50 z modelem uwzględniającym komponenty przy użyciu tego samego obrazu odzieży. Rycina 5B przedstawia mapę aktywacji klas dla bazowego modelu wyglądu. Rycina 5C prezentuje graf komponentów odzieży na poziomie obrazu, zrekonstruowany z mapy prawdopodobieństwa ograniczonej do pierwszego planu, macierzy centrów komponentów, typowanej macierzy sąsiedztwa, maski węzłów nieaktywnych oraz mapowania etykiet komponentów wygenerowanych w sekcjach 3 i 4 protokołu. Rycina 5D prezentuje odpowiedź aktywacyjną reprezentacji połączonej. Do wygenerowania Ryciny 5C nie użyto żadnego estymatora pozy człowieka ani adnotacji stawów ludzkich.
Odpowiedź bazowa koncentrowała się na lokalnych obszarach tekstury w dolnej części odzieży i nie podążała konsekwentnie za pełną granicą ubrania, co przedstawiono na ryc. 5B. Na ryc. 5C każdy węzeł odpowiada środkowi aktywnego obszaru komponentu odzieży, natomiast każda krawędź reprezentuje wspólną granicę pierwszego planu lub zdefiniowaną relację porządku pionowego. Graf odzwierciedla organizację obszarów odzieży i nie reprezentuje ludzkich stawów anatomicznych. Odpowiedź uwzględniająca strukturę obejmowała główny pierwszy plan odzieży, zachowując jednocześnie niższą aktywację w większości obszarów tła, co pokazano na ryc. 5D. Wyniki te wskazują, że graf komponentów oraz moduł fuzji cech zredukowały aktywację zdominowaną przez teksturę w analizowanym obrazie.
Analiza podobieństwa strukturalnego odzieży i wyniki referencyjne projektu
Rysunek 6 przedstawia ranking wyników wyszukiwania wraz z dowodami strukturalnymi wykorzystanymi do jego interpretacji. Graf komponentów zapytania na Rysunku 6B rejestruje aktywne regiony odzieży oraz ich typowane relacje, natomiast macierz na Rysunku 6C obnaża wzorzec relacji dostarczony do propagacji grafu. Wyniki bazowe na Rysunku 6D są nadal zdominowane przez czerwone wskazówki dotyczące wyglądu. Wyniki uwzględniające strukturę na Rysunku 6E zachowują kategorię odzieży górnej dla różnych kolorów i tła. Graf komponentów najwyżej ocenionego wyniku na Rysunku 6F umożliwia bezpośrednie porównanie z grafem zapytania, a macierz odpowiedniości na Rysunku 6G ujawnia, czy komponenty współdzielące te same identyfikatory pozostają wyrównane po fuzji sterowanej strukturą. Odpowiedniość diagonalną należy interpretować łącznie z brakującymi węzłami i zmienionymi relacjami grafu. Silne podobieństwo wyglądu bez zgodności grafów nie stanowi sukcesu w zakresie wyszukiwania strukturalnego.
Odzyskane elementy garderoby zachowują kategorię ogólną, jednak różnice w konfiguracji rękawów i lokalnych relacjach między komponentami wskazują na niepełną odpowiedniość w skali szczegółowej. Zaproponowana metoda osiągnęła wskaźnik Recall@5 na poziomie 89,2% oraz mAP wynoszący 86,4%, co przedstawiono w Tabeli 3. Wartości ilościowe te opisują wydajność rankingu, natomiast Rysunek 6B–G dostarcza pośrednich dowodów strukturalnych wspierających tę interpretację. Wniosek dotyczący wyszukiwania ogranicza się zatem do poprawy odporności na zakłócenia wywołane kolorem tła oraz silniejszej organizacji komponentów na poziomie obrazu w ramach przetestowanego zapytania.
Odpowiedź na różnice strukturalne i wsparcie analizy projektowej
Mapa ciepła czystej odpowiedzi różnicowej na Rysunku 7H pokazuje, że dominująca odpowiedź jest skoncentrowana na powiększonej sylwetce dolnej części ciała oraz prawej krawędzi odzieży na obrazie docelowym. Nałożenie obrazów na Rysunku 7I wykazuje, że najsilniejsza odpowiedź pozostaje zgodna z głównym planem pierwszego planu odzieży, podczas gdy słabsza aktywacja w przyległych obszarach zasłon i ścian pozostaje jako resztkowa interferencja tła. Odpowiedź przestrzenną należy interpretować wspólnie z wykresem komponentów i dowodami macierzowymi przedstawionymi na Rysunkach 7C–G. Odpowiedź jest traktowana jako prawidłowa różnica strukturalna tylko wtedy, gdy obszar odzieży o wysokiej odpowiedzi jest zgodny ze zmianą sąsiedztwa, zmianą relacji geometrycznej oraz wzorcem odległości komponentów po fuzji.
Różnicę strukturalną uznaje się tylko wtedy, gdy zmiana typowej sąsiedniości na Rysunku 7E lub zmiana relacji geometrycznej na Rysunku 7F współwystępuje ze zwiększoną odległością komponentów na Rysunku 7G oraz odpowiedzią przestrzenną wyrównaną do pierwszego planu na Rysunku 7H,I. Powiększony obszar dolnej części ciała oraz prawa granica odzieży spełniają to kryterium międzyetapowe. Aktywacja nad zasłoną i ścianą nie odpowiada zmianom w węzłach komponentów, wzorcach relacji ani zintegrowanym odległościom komponentów, w związku z czym zostaje odrzucona jako niestrukturalna interferencja szczątkowa. Wynik ten wspiera lokalizację różnic na poziomie obrazu, lecz nie stwierdza wariacji w wzorach krawieckich ani parametrach konstrukcyjnych.
Analiza rozkładu przestrzennego i klastrów strukturalnych cech
Analiza rozkładu utajonej przestrzeni cech ujawnia zdolność modelu do rozróżniania semantyki strukturalnej odzieży. Analiza ta sprawdza, czy rozkład a priori struktur organizuje ubrania o różnych konfiguracjach topologicznych w odrębne rozmaitości cech. Wybrano pięć reprezentatywnych kategorii strukturalnych ze zbioru testowego: bluzki z krótkim rękawem, spodnie, spódnice, długie płaszcze oraz sukienki. Wielowymiarowe wektory cech zostały rzutowane na płaszczyznę dwuwymiarową przy użyciu stochastycznego osadzania sąsiadów z rozkładem t (t-SNE). Oceniono spójność podobnych próbek oraz separację próbek niepodobnych, aby scharakteryzować organizację semantyki strukturalnej w przestrzeni cech. Rozkład t-SNE przestrzeni cech uwzględniającej strukturę przedstawiono na Rysunku 8.
Projekcja t-SNE utworzyła pięć głównych regionów cech z ograniczonym nakładaniem się sąsiednich kategorii, co przedstawiono na Rysunku 8A. Reprezentatywne próbki odpowiadające pięciu regionom kategorii pokazano na Rysunku 8B. Wartość SCI wynosząca 0,81 odzwierciedla zwartość próbek współdzielących tę samą etykietę strukturalną, a wartość SDI wynosząca 0,71 odzwierciedla separację między próbkami o różnych etykietach strukturalnych, zgodnie z danymi w Tabeli 3 i wizualizacją na Rysunku 8. Wskaźniki te należy interpretować jako miary rozkładu w przestrzeni cech i nie określają one bezpośrednio współczynnika fałszywych alarmów. Topy z krótkim rękawem i spódnice zajmowały różne główne regiony w rzutowanej przestrzeni cech, podczas gdy niewielka liczba próbek pozostała w pobliżu granic sąsiednich kategorii, jak pokazano na Rysunku 8A. Spodnie i sukienki również wykazały wyraźną separację od kategorii sąsiednich. Taki rozkład wskazuje, że a priori grafu przyczyniło się do organizacji strukturalnej na poziomie kategorii bez powodowania całkowitej separacji klastrów. Ewaluacja oddziela jakość reprezentacji od skuteczności wyszukiwania. SCI ocenia, czy odzież o tej samej etykiecie strukturalnej pozostaje zwarta w wyuczonej przestrzeni cech, natomiast SDI ocenia, czy odzież o różnych etykietach strukturalnych pozostaje odseparowana. Metryki te odpowiadają celowi reprezentacji strukturalnej protokołu. Recall@5 mierzy, czy strukturalnie istotny element garderoby pojawia się w pierwszych pięciu wynikach wyszukiwania, podczas gdy mAP mierzy jakość rankingu we wszystkich istotnych próbkach z galerii. Metryki te odpowiadają celowi wyszukiwania referencji projektowych. Współczynnik sylwetkowy został użyty wyłącznie do oceny wydajności klastrowania, ponieważ SCI i SDI charakteryzują już organizację przestrzeni cech.
Rycina 9 przedstawia surowe wyniki z pięciu uruchomień dla czterech reprezentatywnych metod bez normalizacji między metodami. Rycina 9A prezentuje SCI i SDI w ich oryginalnej skali, natomiast Rycina 9B przedstawia Recall@5 i mAP jako wartości procentowe. Markery poszczególnych uruchomień oraz linie błędu odchylenia standardowego pokazują zmienność związaną z trenowaniem modelu, a nie tylko zagregowany ranking. Baseline oparty na wyglądzie osiągnął SCI na poziomie 0,62, podczas gdy proponowana metoda osiągnęła SCI wynoszące 0,81 oraz SDI wynoszące 0,71 (Tabela 3 i Rycina 9A). Wyniki SCI i SDI wskazują na silniejszą zwartość wewnątrz etykiet oraz lepszą separację między etykietami w ocenianych warunkach. Proponowana metoda osiągnęła Recall@5 na poziomie 89,2% oraz mAP na poziomie 86,4% (Tabela 3 i Rycina 9B). Te metryki wyszukiwania oceniają różne właściwości rankingu i są interpretowane oddzielnie od SCI i SDI. Spójna kolejność metod w czterech metrykach wskazuje na zgodność między jakością reprezentacji a wydajnością wyszukiwania, ale nie oznacza to, że względna poprawa jest identyczna we wszystkich czterech wymiarach oceny.
Eksperymenty ablacyjne i analiza skuteczności modułów strukturalnych
Eksperyment ablacyjny porównuje pełny model z wariantami, w których usunięto a priori strukturę lub moduł fuzji. Wszystkie trzy konfiguracje wykorzystują te same obrazy referencyjne i docelowe, co umożliwia bezpośrednie porównanie odpowiedzi tła oraz koncentracji lokalizacji. Wariant bez a priori struktury usuwa graf komponentów odzieży na poziomie obrazu oraz powiązane z nim ograniczenia relacji, polegając wyłącznie na konwolucyjnym szkielecie w celu ekstrakcji cech wyglądu; wariant bez fuzji zachowuje inferencję grafu, ale usuwa piramidę cech, wykorzystując jedynie semantyczne cechy wysokiego poziomu. Wizualizowane mapy ciepła różnic ujawniają specyficzne role każdego modułu w tłumieniu szumów i definiowaniu granic; jakościowe porównanie odpowiedzi różnic strukturalnych w różnych konfiguracjach modułów przedstawiono na Ryc. 10.
Mapy odpowiedzi na Rysunku 10C–E zostały wygenerowane przy użyciu wspólnej skali odpowiedzi i identycznych ustawień nałożenia. Wariant bez struktury a priori (structure prior) wykazał silną aktywację w lewym tle oraz wokół niezwiązanych obszarów otoczenia, co przedstawiono na Rysunku 10C. Wariant bez modułu fuzji zredukował część tej odpowiedzi poza obszarem odzieży, lecz nadal wykazywał szersze rozproszenie na dolnej części odzieży i w otaczającym obszarze po prawej stronie, jak pokazano na Rysunku 10D. Pełny model dodatkowo skoncentrował dominującą odpowiedź w stronę głównego pierwszego planu odzieży, co przedstawiono na Rysunku 10E. Rysunek 10F bezpośrednio wizualizuje różnicę w odpowiedziach ograniczonych do pierwszego planu pomiędzy wariantem bez fuzji a pełnym modelem, wykazując, że pełny model tłumi resztkowe rozproszenie boczne, zachowując jednocześnie główną odpowiedź zgodną z kształtem odzieży. Wyniki te wskazują, że struktura a priori głównie zredukowała szum otoczenia, a moduł fuzji dodatkowo poprawił koncentrację odpowiedzi i dopasowanie strukturalne. Rysunek 10E reprezentuje relatywną poprawę, a nie całkowite usunięcie aktywacji tła.
Tabela 4 przedstawia wartości SCI, SDI oraz Recall@5 dla wariantów bez priorytetu strukturalnego, bez modułu fuzji oraz dla pełnego modelu. Usunięcie priorytetu strukturalnego obniżyło SCI z 0,81 do 0,65 oraz Recall@5 z 89,2% do 74,5%. Usunięcie modułu fuzji obniżyło SDI z 0,71 do 0,64 oraz Recall@5 z 89,2% do 85,1%, co stanowi spadek o 4,1 punktu procentowego. Wyniki te wskazują, że priorytet strukturalny miał większy wpływ na spójność strukturalną i wyszukiwanie, podczas gdy fuzja cech poprawiła dopasowanie między informacjami o wyglądzie a informacjami strukturalnymi.
Analiza wydajności porównuje koszt obliczeniowy pełnego modelu z bazowym modelem ResNet-50. Bazowy model ResNet-50 wymagał 25,6 miliona parametrów i 4,1 miliarda operacji zmiennoprzecinkowych. Pełny model uwzględniający strukturę wymagał 29,3 miliona parametrów i 5,4 miliarda operacji zmiennoprzecinkowych. Średni czas inferencji wynosił 15 milisekund na obraz dla modelu bazowego i 22 milisekundy na obraz dla pełnego modelu, co stanowi wzrost o 7 milisekund. Wynik ten wskazuje na mierzalny koszt obliczeniowy, który należy wziąć pod uwagę podczas wdrażania protokołu w procesach pracy wrażliwych na czas (Tabela 5)). Waga ograniczenia strukturalnego została określona na podstawie zbioru walidacyjnego przed końcową ewaluacją testową. Wskaźnik Validation Recall@5 badano dla wag ograniczenia strukturalnego wynoszących 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 oraz 2,0. Wagę 1,0 ustalono na stałe dla każdego kolejnego procesu trenowania i testowania. Rysunek 11 dokumentuje wybór wagi ograniczenia strukturalnego 1,0 na podstawie walidacji.

Rycina 1: Ogólny schemat protokołu uczenia cech obrazów odzieży z uwzględnieniem struktury. Wejściowy obraz odzieży jest przetwarzany przez gałąź cech wyglądu oraz gałąź cech strukturalnych, która wykorzystuje analizę semantyczną i modelowanie grafów przestrzennych. Obie reprezentacje są przetwarzane przez moduł fuzji sterowany strukturą w celu wygenerowania końcowej cechy uwzględniającej strukturę. Strata spójności strukturalnej, strata dyskryminacji strukturalnej oraz strata relacji strukturalnych wspólnie ograniczają przestrzeń cech. Rycina pokazuje, w jaki sposób wygląd odzieży i topologia komponentów są integrowane podczas uczenia cech. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 2: Konstrukcja topologii komponentów odzieży na poziomie obrazu. (A) Wejściowy obraz odzieży I. (B) Mapa komponentów wizualnych ograniczona do pierwszego planu P, w której siedem kolorów oznacza regiony odzieży na poziomie obrazu. Wszystkie piksele tła są wykluczone z kanałów komponentów. (C) Graf relacji komponentów na poziomie obrazu G. Węzły reprezentują widoczne regiony odzieży, krawędzie ciągłe reprezentują wspólne granice pierwszego planu, a relacje przerywane reprezentują zdefiniowaną kolejność pionową. Mapa i graf wspierają wyszukiwanie obrazów i porównywanie struktur wizualnych. Nie reprezentują one elementów wykrojów, geometrii szwów, struktur zaszewek, parametrów stopniowania ani instrukcji krojenia. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 3: Moduł fuzji cech kierowanej strukturą. Cecha strukturalna jest przekształcana przez mapowanie liniowe i funkcję aktywacji Ψ w celu wygenerowania wagi struktury. Waga struktury moduluje cechę wyglądu poprzez mnożenie element po elemencie. Zmodulowana cecha wyglądu oraz cecha strukturalna są łączone (konkatenowane) i rzutowane przez Wc, po czym dodawana jest rezydualna cecha strukturalna w celu wygenerowania końcowej cechy komponentu. Rysunek pokazuje, że informacje strukturalne regulują ważenie cech wyglądu przed końcową fuzją. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 4: Optymalizacja przestrzeni cech pod kątem ograniczeń spójności strukturalnej. (A) Próbki należące do tej samej klasy strukturalnej są przybliżane do siebie poprzez stratę spójności struktury (structure consistency loss), podczas gdy relacje między ich wewnętrznymi komponentami są zachowane dzięki stracie relacji strukturalnej (structure relationship loss). (B) Próbki z różnych klas strukturalnych są od siebie oddalane za pomocą straty dyskryminacji struktury (structure discrimination loss). Rycina pokazuje, w jaki sposób trzy cele strukturalne wspólnie zwiększają zwartość wewnątrzklasową oraz separację międzyklasową. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rycina 5: Reprezentatywne odpowiedzi cech odzieży i wizualizacja grafu komponentów. (A) Wejściowy obraz odzieży. (B) Odpowiedź aktywacji klas dla bazowego modelu wyglądu ResNet-50. (C) Graf komponentów odzieży na poziomie obrazu został zrekonstruowany z mapy komponentów ograniczonej do pierwszego planu, macierzy centrów komponentów, typowanej macierzy sąsiedztwa, maski węzłów nieaktywnych oraz mapowania etykiet komponentów, które zostały zapisane podczas sekcji 3 i 4 protokołu. Węzły oznaczają aktywne obszary odzieży, krawędzie ciągłe oznaczają wspólne granice pierwszego planu, a krawędzie przerywane oznaczają zdefiniowane relacje porządku pionowego. (D) Odpowiedź aktywacji zintegrowanej reprezentacji uwzględniającej komponenty. Porównanie pokazuje różnicę między aktywacją zdominowaną przez teksturę a aktywacją kierowaną przez obszary odzieży. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.

Rysunek 6: Wyniki wyszukiwania i pośrednie dowody strukturalne przy zakłóceniach w postaci czerwonego tła. (A) Obraz zapytania. (B) Graf komponentów zapytania wygenerowany z zapisanych środków komponentów i typowanej macierzy sąsiedztwa. (C) Typowana macierz sąsiedztwa zapytania, w której wartości macierzy rozróżniają relacje nieaktywne, wspólne granice pierwszego planu oraz predefiniowane relacje porządku pionowego. (D) Trzy najlepsze wyniki wyszukiwania uzyskane za pomocą bazowej metody wyglądu. (E) Trzy najlepsze wyniki uzyskane za pomocą reprezentacji uwzględniającej strukturę. (F) Graf komponentów najwyżej ocenionego wyniku uwzględniającego strukturę. (G) Macierz korespondencji komponentów po fuzji między zapytaniem a najwyżej ocenionym wynikiem. Wysoka korespondencja na przekątnej wskazuje na zgodność między komponentami o tych samych identyfikatorach, natomiast słabe lub przesunięte odpowiedzi wskazują na brak lub niezgodność organizacji komponentów. Wyniki wyszukiwania zachowują ogólną kategorię górnej części ciała, ale nie wykazują pełnej zgodności w konfiguracji rękawów i topologii lokalnej. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 7: Śledzenie różnic strukturalnych od topologii odzieży na poziomie obrazu do odpowiedzi przestrzennej. (A) Obraz referencyjny. (B) Obraz docelowy. (C) Graf komponentów referencyjny. (D) Graf komponentów docelowy. Oba grafy zostały zrekonstruowane z zapisanych środków komponentów i typowanych macierzy sąsiedztwa. (E) Typowana macierz różnic sąsiedztwa. (F) Różnica relacji geometrycznych jest wyprowadzona z przesunięcia środków komponentów, dyspersji przestrzennej i zmian wag relacji. (G) Graf różnic komponentów po fuzji, gdzie intensywność węzła reprezentuje znormalizowaną odległość między odpowiadającymi sobie zfuzjowanymi wektorami komponentów, a szerokość krawędzi reprezentuje zmianę wagi relacji. (H) Mapa ciepła czystej odpowiedzi na różnice przestrzenne została wyrenderowana przy użyciu tej samej stałej skali odpowiedzi co nakładka. (I) Odpowiedź nałożona na obraz docelowy. Różnica strukturalna jest akceptowana tylko wtedy, gdy zmiana sąsiedztwa, zmiana relacji geometrycznych, zmiana odległości komponentów i odpowiedź cieplna wyrównana do pierwszego planu pozostają spójne. Aktywacja tła bez odpowiadających jej dowodów na istnienie komponentów lub relacji jest traktowana jako interferencja szczątkowa, a nie jako rzeczywista różnica w strukturze odzieży. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Rysunek 8: Klastrowanie w przestrzeni cech z uwzględnieniem struktury. (A) Projekcja t-SNE dla bluzek z krótkim rękawem, spodni, spódnic, długich płaszczy i sukienek. Pięć kategorii tworzy główne obszary cech z ograniczonym nakładaniem się w pobliżu granic między nimi. (B) Reprezentatywne obrazy testowe przypisane do pięciu kategorii odzieży, gdzie kolor obramowania odpowiada kolorowi kategorii w części (A). Rysunek przedstawia organizację strukturalną na poziomie kategorii, zachowując niewielką liczbę próbek w pobliżu sąsiadujących obszarów kategorii. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 9: Porównanie surowej wydajności w odniesieniu do struktury przestrzeni cech i celów rankingu wyszukiwania. (A) SCI i SDI dla modelu bazowego opartego na wyglądzie, modelu o słabej strukturze, modelu o jawnej strukturze oraz proponowanej metody. (B) Recall@5 i mAP dla tych samych czterech metod. Duże znaczniki oznaczają średnią arytmetyczną z pięciu niezależnych uruchomień, linie błędów oznaczają odchylenie standardowe próbki, a małe znaczniki oznaczają wyniki poszczególnych uruchomień. SCI i SDI są przedstawione w stałej skali od zera do jednego, natomiast Recall@5 i mAP są przedstawione w stałej skali procentowej od zera do stu. Nie zastosowano normalizacji min-max ani przeskalowania między metodami. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rysunek 10: Odpowiedzi dotyczące różnic strukturalnych przy różnych konfiguracjach modułów. (A) Obraz referencyjny. (B) Obraz docelowy. (C) Odpowiedź wariantu bez priorytetu strukturalnego. (D) Odpowiedź wariantu bez modułu fuzji. (E) Odpowiedź pełnego modelu. (C–E) zostały wyrenderowane przy użyciu tej samej znormalizowanej skali odpowiedzi, mapy kolorów i ustawień nakładki. (F) Absolutna różnica odpowiedzi ograniczona do pierwszego planu pomiędzy wariantem bez fuzji a pełnym modelem. Pełny model zachowuje główną odpowiedź wyrównaną do garderoby, redukując jednocześnie rozproszenie resztkowe poza głównym obszarem strukturalnym. Porównanie pokazuje, że priorytet strukturalny redukuje zakłócenia poza obszarem garderoby, a moduł fuzji dodatkowo wyostrza odpowiedź strukturalną. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 11: Wybór wagi ograniczenia strukturalnego w oparciu o walidację. Wartość Validation Recall@5 przedstawiono dla wag ograniczenia strukturalnego wynoszących 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 oraz 2.0. Każdy punkt oznacza średnią arytmetyczną z pięciu cykli walidacji, a każda linia błędu oznacza odchylenie standardowe próbki. Przed końcową ewaluacją testową wagę ustalono na poziomie 1.0. Rycina ta dokumentuje procedurę wyboru parametrów i nie stanowi niezależnego wkładu architektonicznego. Kliknij tutaj, aby wyświetlić większą wersję tej ryciny.
Tabela 1: Alokacja zbioru danych i statystyki topologii na poziomie obrazu dla podzbiorów odzieży od S1 do S5. Tabela przedstawia liczbę obrazów treningowych, walidacyjnych, testowych oraz całkowitą, wraz ze średnią liczbą komponentów semantycznych, liczbą aktywnych węzłów, liczbą krawędzi typowanych oraz liczbą adnotowanych punktów charakterystycznych w płaszczyźnie obrazu dla każdego poziomu strukturalnego. Wszystkie wartości zostały wygenerowane z przetworzonych manifestów danych. Liczba obrazów treningowych, walidacyjnych i testowych została uzyskana z końcowych manifestów podzbiorów po przeglądzie strukturalnym, kontroli grup duplikatów i inspekcji wycieku danych, natomiast statystyki topologii obliczono z końcowych rekordów grafów, stosując ten sam porządek komponentów i definicje relacji, co podczas oceny modelu. Kliknij tutaj, aby pobrać ten plik.
Tabela 2: Środowisko obliczeniowe, konfiguracja wejściowa, augmentacja, reprezentacja, optymalizacja, strata oraz ustawienia odtwarzalności stosowane w całym protokole. Tabela zawiera dokładne wersje systemu operacyjnego, procesora, zainstalowanej pamięci, jednostki przetwarzania graficznego, pamięci graficznej, sterownika graficznego, CUDA, cuDNN, Pythona, NumPy, PyTorch i torchvision wraz z rozmiarem obrazu, konstrukcją partii (batch), optymalizatorem, harmonogramem tempa uczenia, liczbą epok, ziarnami liczb losowych, wymiarami reprezentacji oraz wagami celów strukturalnych. Każda wartość jest powiązana z plikiem software_versions.txt, configs/protocol.yaml lub odpowiednim zapisem treningowym. Prosimy kliknąć tutaj, aby pobrać ten plik.
Tabela 3: Ilościowe porównanie ogólnych modeli reprezentacji wizualnej, modeli odzieży opartych na grafach oraz specyficznych dla domeny metod wyszukiwania mody. Tabela przedstawia koncentrację wyszukiwania, modalność zapytania, SCI, SDI, Recall@5, mAP oraz współczynnik sylwetki dla jedenastu metod przy tych samych partycjach danych i protokole ewaluacji. Każda metryka jest raportowana jako średnia i odchylenie standardowe próbki z pięciu niezależnych uruchomień. Raportowane wartości p uzyskano z dwustronnych sparowanych testów t-Studenta, porównując każdą metodę porównawczą z metodą proponowaną przy użyciu wyników uzyskanych dla tych samych pięciu losowych ziarn (seeds). Metoda proponowana traktowana jest jako wiersz referencyjny. Kliknij tutaj, aby pobrać ten plik.
Tabela 4: Wyniki ablacji dla modułu struktury a priori i fuzji cech.W tabeli przedstawiono wskaźniki SCI, SDI oraz Recall@5 dla wariantu bez struktury a priori, wariantu bez modułu fuzji oraz pełnego modelu. Usunięcie struktury a priori powoduje większy spadek SCI i Recall@5, natomiast usunięcie modułu fuzji obniża SDI i dopasowanie odpowiedzi. Pełny model osiąga najwyższe wartości dla wszystkich trzech metryk. Kliknij tutaj, aby pobrać ten plik.
Tabela 5: Wydajność obliczeniowa modelu bazowego ResNet-50 oraz kompletnego modelu uwzględniającego strukturę. Tabela przedstawia liczbę trenowalnych parametrów, liczbę operacji zmiennoprzecinkowych na obraz oraz średni czas wnioskowania na obraz w identycznym środowisku sprzętowym i programowym, opisanym w Tabeli 2 oraz w Tabeli Materiałów. Oba modele wykorzystują tę samą rozdzielczość obrazu, ustawienia partii wnioskowania, operacje preprocessingu oraz procedurę pomiaru czasu. Model kompletny dodaje 3,7 miliona parametrów, 1,3 miliarda operacji zmiennoprzecinkowych oraz 7 milisekund czasu wnioskowania na obraz w stosunku do modelu bazowego. Kliknij tutaj, aby pobrać ten plik.