Tutti gli esperimenti riportati sono stati eseguiti utilizzando l'ambiente hardware e software documentato nella Tabella 2 e nella Tabella dei Materiali. Durante il preelaborazione, l'addestramento, l'inferenza e la valutazione sono state utilizzate le stesse versioni del driver grafico, CUDA, cuDNN, Python, NumPy, PyTorch e torchvision. L'ambiente hardware e software completo è riassunto nella Tabella 2 e nella Tabella dei Materiali. La Tabella 1 riassume i dataset di addestramento, validazione e test elaborati insieme alle statistiche topologiche a livello di immagine. La Tabella 2 riassume la configurazione comune utilizzata per tutti i metodi di confronto.
Risultati della valutazione comparativa
La valutazione comparativa ha seguito le comuni partizioni dei dati, le operazioni di preelaborazione, i controlli di addestramento e le definizioni delle metriche specificate nelle sezioni 7–9 del protocollo. Tabella 3 confronta encoder visivi generali, modelli allineati per parti, rappresentazioni di capi d'abbigliamento basate su grafi, reti per il recupero di moda cross-domain, metodi di fusione tra topologia e aspetto e metodi di recupero visivo per e-commerce, tutti valutati utilizzando lo stesso protocollo basato su query immagine. I metodi specifici per dominio comprendono l'Istogramma delle Caratteristiche Topologiche con Fusione di Colore e Trama (TFH-CT), la Rete a Cascata Guidata dall'Attenzione (AGC-Net), la Rete per l'Apprendimento di Caratteristiche Multi-scala e Multi-granularità (MMFL-Net) e il Recupero di Moda mediante Rete Residua con Ottimizzazione tramite Sciame di Egretta (FARE-RNET). Tutte le metriche di valutazione riportate in Tabella 3 sono espresse come media e deviazione standard campionaria ottenute da cinque esecuzioni indipendenti effettuate con gli stessi semi casuali, manifesto di addestramento, manifesto di validazione, manifesto di test, assegnazione query-galleria e implementazione della metrica. I valori p- accoppiati sono stati calcolati separatamente per SCI, SDI, Recall@5, mAP e coefficiente di siluetta, confrontando ciascun metodo con il metodo proposto nelle medesime condizioni di semi casuali abbinati. Questi risultati forniscono la base quantitativa per le successive analisi strutturali di visualizzazione, recupero, clustering e orientate alla progettazione.
Risultati rappresentativi del protocollo e loro interpretazione
L'esecuzione corretta del protocollo è confermata quando il grafo dei componenti a livello di immagine, ricostruito a partire dai file di analisi e dai file grafici salvati, posiziona ogni nodo attivo all'interno della corrispondente regione del capo di abbigliamento e preserva i tipi di relazione registrati nella matrice di adiacenza tipizzata, come mostrato in Figura 5C. La risposta sensibile alla struttura dovrebbe rimanere concentrata sul primo piano del capo di abbigliamento, come illustrato in Figura 5D. Figura 6E mostra un risultato di recupero atteso in cui il metodo proposto riduce l'influenza dello sfondo rosso e recupera capi di abbigliamento per il busto superiore anziché oggetti rossi non correlati. Figura 6B–G dimostra inoltre che il ranking di recupero è supportato dalle relazioni tra componenti a livello di immagine e dalla corrispondenza dei componenti dopo la fusione. Questo risultato riflette il recupero della categoria generale del capo di abbigliamento, anche se la lunghezza delle maniche e la topologia locale variano ancora tra i campioni recuperati.
I casi comuni di fallimento includono l'attivazione dominata dalla texture in Figura 5B, il recupero guidato dal colore di sfondo nella riga superiore di Figura 6 e l'attivazione residua di sfondo in Figura 7. La Figura 7 deve essere interpretata come localizzazione parziale poiché la risposta dominante segue la sagoma ingrandita del corpo inferiore e il bordo del capo di abbigliamento destro, mentre persiste un'attivazione residua nelle regioni adiacenti di sfondo. La localizzazione è considerata supportata strutturalmente solo quando la matrice delle differenze topologiche, la matrice delle differenze nelle relazioni geometriche, il grafo delle differenze dei componenti post-fusione e la risposta spaziale identificano regioni del capo di abbigliamento coerenti. Un hotspot spaziale senza cambiamenti corrispondenti nella matrice o nei componenti indica un'interferenza visiva piuttosto che una prova strutturale.
Un'esecuzione del protocollo è considerata valida quando ogni immagine accettata produce una mappa di probabilità semantica normalizzata, una matrice di relazione con K righe e K colonne, matrici di caratteristiche di aspetto e strutturali con K righe e 512 colonne, e un vettore di caratteristiche fuse finito associato all'identificatore dell'immagine corretto. Un'ispezione visiva deve confermare che la topologia segua i componenti del capo d'abbigliamento, che la risposta in primo piano superi quella dello sfondo e che i risultati del recupero siano guidati dalla categoria e dalla struttura del capo piuttosto che dal colore dello sfondo. Mappe di probabilità frammentate, nodi dei componenti mancanti, matrici non numeriche, risposte diffuse dello sfondo o recupero dominato dal colore indicano un'esecuzione non riuscita e richiedono un controllo dell'analisi sintattica, della costruzione del grafo, della fusione delle caratteristiche o del caricamento dei punti di controllo.
Analisi visiva delle risposte dei componenti del capo a livello di immagine
Figura 5 confronta il modello di base ResNet-50 con il modello consapevole dei componenti utilizzando la stessa immagine di capo d'abbigliamento. Figura 5B mostra la mappa di attivazione della classe per il modello di base relativo all'aspetto. Figura 5C presenta il grafo dei componenti del capo a livello di immagine ricostruito a partire dalla mappa di probabilità ristretta al primo piano, dalla matrice dei centri dei componenti, dalla matrice di adiacenza tipizzata, dalla maschera dei nodi inattivi e dalla mappatura delle etichette dei componenti generate nelle sezioni 3 e 4 del protocollo. Figura 5D mostra la risposta di attivazione della rappresentazione fusa. Per generare la Figura 5C non viene utilizzato alcun estimatore della posa umana né annotazione dei giunti corporei.
La risposta di base era concentrata su regioni di tessitura locali nell'indumento inferiore e non seguiva in modo costante il contorno completo dell'indumento, come mostrato in Figura 5B. In Figura 5C, ogni nodo corrisponde al centro di una regione attiva di un componente dell'indumento, mentre ogni arco rappresenta un confine in primo piano condiviso o una relazione d'ordine verticale predefinita. Il grafo riflette l'organizzazione delle regioni dell'indumento e non rappresenta articolazioni anatomiche umane. La risposta sensibile alla struttura ha coperto il primo piano principale dell'indumento mantenendo un'attivazione inferiore nella maggior parte delle aree di sfondo, come mostrato in Figura 5D. Questi risultati indicano che il grafo dei componenti e il modulo di fusione delle caratteristiche hanno ridotto l'attivazione dominata dalla tessitura nell'immagine valutata.
Analisi della similarità strutturale degli abiti e risultati di riferimento per la progettazione
Figura 6 presenta il ranking di recupero insieme alle evidenze strutturali utilizzate per interpretarlo. Il grafo del componente della query in Figura 6B registra le regioni attive del capo d'abbigliamento e le loro relazioni tipizzate, mentre la matrice in Figura 6C mostra il modello di relazione fornito alla propagazione del grafo. I risultati della linea di base in Figura 6D sono ancora dominati da indizi cromatici rossi. I risultati sensibili alla struttura in Figura 6E mantengono la categoria del capo d'abbigliamento del busto superiore attraverso diversi colori e sfondi. Il grafo dei componenti del risultato con il punteggio più alto in Figura 6F permette un confronto diretto con il grafo della query, e la matrice di corrispondenza in Figura 6G rivela se i componenti che condividono gli stessi identificatori rimangono allineati dopo la fusione guidata dalla struttura. La corrispondenza diagonale deve essere interpretata congiuntamente con i nodi mancanti e le relazioni del grafo modificate. Una forte somiglianza nell'aspetto, in assenza di accordo tra i grafi, non costituisce un recupero strutturale di successo.
Gli indumenti recuperati mantengono la categoria generale, ma le differenze nella configurazione delle maniche e nelle relazioni tra componenti locali indicano una corrispondenza incompleta a livello fine. Il metodo proposto ha raggiunto un Recall@5 del 89,2% e un mAP dell'86,4%, come riportato nella Tabella 3. Questi valori quantitativi descrivono le prestazioni nel posizionamento in classifica, mentre la Figura 6B–G fornisce evidenze strutturali intermedie a sostegno dell'interpretazione. La conclusione relativa al recupero è quindi limitata a una maggiore resistenza alle interferenze del colore di sfondo e a un'organizzazione più solida dei componenti a livello di immagine nel contesto della query testata.
Supporto per la risposta alla differenza strutturale e l'analisi della progettazione
La mappa termica della pura differenza di risposta in Figura 7H mostra che la risposta dominante è concentrata sulla sagoma ingrandita della parte inferiore del corpo e sul bordo destro dell'indumento nell'immagine bersaglio. La sovrapposizione in Figura 7I mostra che la risposta più intensa rimane allineata con la parte principale in primo piano dell'indumento, mentre un'attivazione più debole nelle regioni adiacenti della tenda e del muro persiste come interferenza residua di fondo. La risposta spaziale deve essere interpretata insieme alle evidenze fornite dal grafico dei componenti e dalla matrice presentate in Figure 7C–G. Una risposta è considerata una differenza strutturale valida solo quando la regione dell'indumento con risposta elevata è coerente con il cambiamento di adiacenza, il cambiamento di relazione geometrica e il modello di distanza tra i componenti dopo la fusione.
Una differenza strutturale è accettata solo quando il cambiamento nell'adiacenza tipizzata in Figura 7E o il cambiamento nella relazione geometrica in Figura 7F è accompagnato da un aumento della distanza tra componenti in Figura 7G e da una risposta spaziale allineata al primo piano in Figura 7H,I. La regione ingrandita del corpo inferiore e il bordo destro dell'indumento soddisfano questo criterio interscenario. L'attivazione sulla tenda e sul muro non corrisponde a cambiamenti nei nodi dei componenti, nei modelli di relazione o nelle distanze dei componenti fusi, e pertanto viene scartata come interferenza residua non strutturale. Il risultato supporta la localizzazione delle differenze a livello di immagine, ma non stabilisce una variazione nei modelli di cucitura o nei parametri di costruzione.
Analisi della distribuzione spaziale delle caratteristiche e analisi dei cluster strutturali
L'analisi della distribuzione dello spazio delle caratteristiche latenti rivela la capacità del modello di discriminare la semantica strutturale degli indumenti. Questa analisi verifica se il vincolo strutturale organizza capi con diverse configurazioni topologiche in varietà di caratteristiche distinte. Sono state selezionate cinque categorie strutturali rappresentative dal set di test: capi a maniche corte, pantaloni, gonne, cappotti lunghi e abiti. I vettori caratteristici ad alta dimensione sono stati proiettati su un piano bidimensionale mediante l'incorporamento stocastico di vicini distribuiti in modo t (t-SNE). La coesione dei campioni simili e la separazione dei campioni dissimili sono state valutate per caratterizzare l'organizzazione della semantica strutturale nello spazio delle caratteristiche. La distribuzione t-SNE dello spazio delle caratteristiche sensibile alla struttura è mostrata in Figura 8.
La proiezione t-SNE ha formato cinque principali regioni caratteristiche con un limitato sovrapposizione tra categorie adiacenti, come mostrato in Figura 8A. Campioni rappresentativi corrispondenti alle cinque regioni di categoria sono mostrati in Figura 8B. L'SCI di 0.81 riflette la compattezza dei campioni che condividono la stessa etichetta strutturale, e l'SDI di 0.71 riflette la separazione tra campioni con diverse etichette strutturali, come riportato in Tabella 3 e visualizzato in Figura 8. Questi indici devono essere interpretati come misure della distribuzione nello spazio delle caratteristiche e non stabiliscono direttamente un tasso di falso allarme. I capi di abbigliamento a maniche corte e le gonne occupavano diverse regioni principali nello spazio delle caratteristiche proiettato, mentre un piccolo numero di campioni è rimasto vicino ai confini delle categorie adiacenti, come mostrato in Figura 8A. Pantaloni e abiti mostravano anch'essi una chiara separazione dalle categorie adiacenti. Questa distribuzione indica che l'a priori basata sul grafo ha contribuito all'organizzazione strutturale a livello di categoria senza produrre una separazione completa dei cluster. La valutazione distingue la qualità della rappresentazione dall'efficacia del recupero. L'SCI valuta se i capi che condividono la stessa etichetta strutturale rimangono compatti nello spazio delle caratteristiche appreso, mentre l'SDI valuta se i capi con diverse etichette strutturali rimangono separati. Queste metriche corrispondono all'obiettivo di rappresentazione strutturale del protocollo. Il Recall@5 misura se un capo strutturalmente rilevante appare tra i primi cinque risultati recuperati, mentre l'mAP misura la qualità del ranking su tutti i campioni della galleria rilevanti. Queste metriche corrispondono all'obiettivo di recupero basato sul design di riferimento. Il coefficiente di siluetta è stato utilizzato soltanto per valutare le prestazioni del clustering poiché l'SCI e l'SDI descrivono già l'organizzazione nello spazio delle caratteristiche.
Figura 9 riporta i risultati grezzi di cinque esecuzioni per quattro metodi rappresentativi, senza normalizzazione tra metodi. Figura 9A mostra SCI e SDI nella loro scala originale, mentre Figura 9B mostra Recall@5 e mAP come percentuali. I marcatori delle singole esecuzioni e le barre di errore della deviazione standard mostrano la variabilità associata all'addestramento del modello, piuttosto che soltanto il ranking aggregato. Il metodo basato sull'aspetto ha ottenuto un valore SCI di 0,62, mentre il metodo proposto ha raggiunto un valore SCI di 0,81 e un valore SDI di 0,71 (Tabella 3 e Figura 9A). I risultati SCI e SDI indicano una maggiore compattezza all'interno delle etichette e una migliore separazione tra etichette nella configurazione valutata. Il metodo proposto ha ottenuto una Recall@5 dell'89,2% e un mAP dell'86,4% (Tabella 3 e Figura 9B). Queste metriche di recupero valutano proprietà diverse del ranking e vanno interpretate separatamente rispetto a SCI e SDI. L'ordine coerente dei metodi attraverso le quattro metriche indica un accordo tra qualità della rappresentazione e prestazioni nel recupero, ma non implica che il miglioramento relativo sia identico in tutte e quattro le dimensioni di valutazione.
Analisi degli esperimenti di ablazione e dell'efficacia del modulo strutturale
L'esperimento di ablazione confronta il modello completo con varianti in cui il prior strutturale o il modulo di fusione vengono rimossi. Tutte e tre le configurazioni utilizzano le stesse immagini di riferimento e target, consentendo un confronto diretto della risposta di sfondo e della concentrazione della localizzazione. La variante senza il prior strutturale elimina il grafo del componente del capo a livello di immagine e i relativi vincoli relazionali, affidandosi esclusivamente al backbone convoluzionale per estrarre le caratteristiche di aspetto; la variante senza fusione mantiene l'inferenza del grafo ma rimuove la piramide di caratteristiche, utilizzando solo caratteristiche semantiche di alto livello. Le mappe termiche delle differenze visualizzate rivelano i ruoli specifici di ciascun modulo nella soppressione del rumore e nella definizione dei contorni; un confronto qualitativo delle risposte alle differenze strutturali in diverse configurazioni dei moduli è mostrato in Figura 10.
Le mappe di risposta in Figura 10C–E sono state realizzate utilizzando una scala di risposta condivisa e impostazioni di sovrapposizione identiche. La variante senza il modello strutturale ha prodotto un'attivazione intensa nell'area di sfondo sinistra e intorno a regioni ambientali non correlate, come mostrato in Figura 10C. La variante senza il modulo di fusione ha ridotto in parte questa risposta al di fuori dell'indumento, ma ha comunque mantenuto una diffusione più ampia sull'indumento inferiore e sulla regione circostante del lato destro, come mostrato in Figura 10D. Il modello completo ha ulteriormente concentrato la risposta dominante verso il primo piano principale dell'indumento, come mostrato in Figura 10E. Figura 10F visualizza direttamente la differenza nelle risposte limitate al primo piano tra la variante senza fusione e il modello completo, mostrando che il modello completo sopprime la diffusione laterale residua mantenendo al contempo la risposta principale allineata all'indumento. Questi risultati indicano che il modello strutturale ha principalmente ridotto il rumore ambientale e che il modulo di fusione ha ulteriormente migliorato la concentrazione della risposta e l'allineamento strutturale. Figura 10E rappresenta un miglioramento relativo piuttosto che un'eliminazione completa dell'attivazione di sfondo.
Tabella 4 riporta SCI, SDI e Recall@5 per le varianti senza prior sulla struttura, senza il modulo di fusione e con il modello completo. Rimuovere la prior sulla struttura ha ridotto l'SCI da 0,81 a 0,65 e ha diminuito il Recall@5 dall'89,2% al 74,5%. Rimuovere il modulo di fusione ha ridotto l'SDI da 0,71 a 0,64 e ha diminuito il Recall@5 dall'89,2% all'85,1%, una riduzione di 4,1 punti percentuali. Questi risultati indicano che la prior sulla struttura ha avuto un effetto maggiore sulla coerenza strutturale e sul recupero, mentre la fusione delle caratteristiche ha migliorato l'allineamento tra informazioni sull'aspetto e informazioni strutturali.
L'analisi dell'efficienza confronta il costo computazionale del modello completo con il modello di riferimento ResNet-50. Il modello di riferimento ResNet-50 richiedeva 25,6 milioni di parametri e 4,1 miliardi di operazioni in virgola mobile. Il modello completo con struttura integrata richiedeva 29,3 milioni di parametri e 5,4 miliardi di operazioni in virgola mobile. Il tempo medio di inferenza era di 15 millisecondi per immagine per il modello di riferimento e di 22 millisecondi per immagine per il modello completo, con un incremento di 7 millisecondi. Questo risultato indica un costo computazionale misurabile che dovrebbe essere considerato durante l'implementazione del protocollo in flussi di lavoro sensibili al tempo.Tabella 5)Il peso del vincolo strutturale è stato determinato a partire dal campione di validazione prima della valutazione finale sul test. Il Recall@5 della validazione è stato esaminato con pesi del vincolo strutturale pari a 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 e 2,0. Un peso pari a 1,0 è stato mantenuto fisso per tutti i successivi cicli di addestramento e di test. Figura 11 documenta la selezione, basata sulla validazione, di un peso del vincolo strutturale pari a 1,0.

Figura 1: Flusso di lavoro complessivo del protocollo di apprendimento delle caratteristiche delle immagini di capi d'abbigliamento consapevole della struttura. L'immagine del capo d'abbigliamento in ingresso viene elaborata da un ramo delle caratteristiche di aspetto e da un ramo delle caratteristiche strutturali che utilizza l'analisi semantica e la modellazione grafica spaziale. Le due rappresentazioni vengono elaborate dal modulo di fusione guidato dalla struttura per generare la caratteristica finale consapevole della struttura. La perdita di coerenza strutturale, la perdita di discriminazione strutturale e la perdita di relazione strutturale vincolano congiuntamente lo spazio delle caratteristiche. La figura mostra come l'aspetto del capo d'abbigliamento e la topologia dei componenti vengano integrate durante l'apprendimento delle caratteristiche. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 2: Costruzione di una topologia a priori dei componenti dell'indumento a livello di immagine. (A) L'immagine dell'indumento in ingresso I. (B) La mappa dei componenti visivi con primo piano limitato P, in cui sette colori indicano le regioni dell'indumento a livello di immagine. Tutti i pixel dello sfondo sono esclusi dai canali dei componenti. (C) Il grafo delle relazioni tra componenti a livello di immagine G. I nodi rappresentano le regioni visibili dell'indumento, gli archi continui rappresentano i confini in comune nel primo piano e le relazioni tratteggiate rappresentano un ordine verticale predefinito. La mappa e il grafo supportano il recupero delle immagini e il confronto della struttura visiva. Non rappresentano pezzi di modelli sartoriali, geometria delle cuciture, strutture delle pince, parametri di gradazione o istruzioni di taglio. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 3: Modulo di fusione delle caratteristiche guidato dalla struttura. La caratteristica strutturale viene trasformata mediante mappatura lineare e funzione di attivazione Ψ per generare un peso strutturale. Il peso strutturale modula la caratteristica di aspetto attraverso una moltiplicazione elemento per elemento. La caratteristica di aspetto modulata e la caratteristica strutturale vengono concatenate e proiettate tramite Wc, dopodiché viene aggiunta la caratteristica strutturale residua per generare la caratteristica finale del componente. La figura mostra che l'informazione strutturale regola la ponderazione della caratteristica di aspetto prima della fusione finale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 4: Ottimizzazione nello spazio delle caratteristiche sotto vincoli di coerenza strutturale. (A) I campioni appartenenti alla stessa classe strutturale vengono avvicinati tramite la perdita di coerenza strutturale, mentre le loro relazioni interne tra componenti sono preservate dalla perdita di relazione strutturale. (B) I campioni provenienti da classi strutturali diverse vengono allontanati dalla perdita di discriminazione strutturale. La figura mostra come i tre obiettivi strutturali agiscano congiuntamente per aumentare la compattezza all'interno delle classi e la separazione tra le classi. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 5: Risposte rappresentative delle caratteristiche del capo d'abbigliamento e visualizzazione mediante grafo dei componenti. (A) L'immagine del capo d'abbigliamento in ingresso. (B) La risposta di attivazione della classe relativa al modello base ResNet-50 per l'aspetto. (C) Il grafo dei componenti a livello di immagine è stato ricostruito a partire dalla mappa dei componenti limitata al primo piano, dalla matrice dei centri dei componenti, dalla matrice di adiacenza tipizzata, dalla maschera dei nodi inattivi e dalla corrispondenza delle etichette dei componenti, salvati durante le sezioni 3 e 4 del protocollo. I nodi indicano le regioni attive del capo d'abbigliamento, gli archi continui indicano confini comuni nel primo piano e gli archi tratteggiati indicano relazioni predefinite di ordine verticale. (D) La risposta di attivazione della rappresentazione fusa consapevole dei componenti. Il confronto mostra la differenza tra un'attivazione dominata dalla texture e un'attivazione guidata dalle regioni del capo d'abbigliamento. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 6: Risultati del recupero e prove strutturali intermedie in presenza di interferenza con sfondo rosso. (A) L'immagine di query. (B) Il grafo dei componenti della query viene generato a partire dai centri dei componenti salvati e dalla matrice di adiacenza tipizzata. (C) La matrice di adiacenza tipizzata della query, in cui i valori della matrice distinguono relazioni inattive, confini comuni del primo piano e relazioni d'ordine verticale predefinite. (D) I primi tre risultati di recupero prodotti dalla baseline basata sull'aspetto. (E) I primi tre risultati prodotti dalla rappresentazione sensibile alla struttura. (F) Il grafo dei componenti del risultato con il punteggio più alto ottenuto con il metodo sensibile alla struttura. (G) La matrice di corrispondenza dei componenti dopo la fusione tra la query e il risultato con il punteggio più alto. Un'elevata corrispondenza diagonale indica accordo tra componenti con lo stesso identificatore, mentre risposte deboli o spostate indicano un'organizzazione dei componenti mancante o non corrispondente. I risultati del recupero preservano la categoria generale della parte superiore del corpo, ma non mostrano un accordo completo nella configurazione delle maniche e nella topologia locale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7: Tracciamento delle differenze strutturali dalla topologia del capo a livello di immagine alla risposta spaziale. (A) L'immagine di riferimento. (B) L'immagine target. (C) Il grafo dei componenti di riferimento. (D) Il grafo dei componenti target. Entrambi i grafi sono ricostruiti a partire dai centri dei componenti salvati e dalle matrici di adiacenza tipizzate. (E) La matrice di differenza delle adiacenze tipizzate. (F) La differenza nelle relazioni geometriche deriva dallo spostamento dei centri dei componenti, dalla dispersione spaziale e dai cambiamenti nel peso delle relazioni. (G) Il grafo delle differenze tra componenti dopo la fusione, in cui l'intensità dei nodi rappresenta la distanza normalizzata tra i corrispondenti vettori dei componenti fusi e la larghezza degli archi rappresenta la variazione del peso delle relazioni. (H) La mappa termica della risposta puramente spaziale è stata generata utilizzando la stessa scala fissa di risposta dell'immagine sovrapposta. (I) La risposta sovrapposta all'immagine target. Una differenza strutturale è accettata soltanto quando il cambiamento di adiacenza, il cambiamento nella relazione geometrica, il cambiamento nella distanza tra componenti e la risposta termica allineata al primo piano risultano coerenti. L'attivazione dello sfondo in assenza di evidenze corrispondenti di componenti o relazioni è considerata un'interferenza residua e non una differenza valida nella struttura del capo. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8: Raggruppamento nello spazio delle caratteristiche consapevole della struttura. (A) La proiezione t-SNE di capi a manica corta, pantaloni, gonne, cappotti lunghi e abiti. Le cinque categorie formano regioni principali di caratteristiche con un sovrapposizione limitata nelle zone di confine tra di esse. (B) Immagini di test rappresentative assegnate alle cinque categorie di capi d'abbigliamento, con il colore del bordo corrispondente al colore della categoria in (A). La figura mostra un'organizzazione strutturale a livello di categoria, mantenendo tuttavia un numero ridotto di campioni vicino alle regioni delle categorie adiacenti. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 9: Confronto delle prestazioni grezze tra diverse strutture dello spazio delle caratteristiche e obiettivi di classificazione nei risultati di recupero. (A) SCI e SDI per il modello di base basato sull'aspetto, il modello a struttura debole, il modello a struttura esplicita e il metodo proposto. (B) Recall@5 e mAP per gli stessi quattro metodi. I marcatori grandi indicano la media aritmetica su cinque esecuzioni indipendenti, le barre di errore indicano la deviazione standard campionaria e i marcatori piccoli indicano i risultati a livello di singola esecuzione. SCI e SDI sono visualizzati su una scala fissa da zero a uno, mentre Recall@5 e mAP sono visualizzati su una scala percentuale fissa da zero a cento. Non è stata applicata alcuna normalizzazione min-max né alcuna ridimensionatura incrociata tra metodi. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 10: Risposte relative alle differenze strutturali in diverse configurazioni del modulo. (A) L'immagine di riferimento. (B) L'immagine target. (C) La risposta della variante senza il modello strutturale a priori. (D) La risposta della variante senza il modulo di fusione. (E) La risposta del modello completo. (C–E) sono rappresentate utilizzando la stessa scala normalizzata di risposta, la stessa mappa cromatica e le stesse impostazioni di sovrapposizione. (F) La differenza assoluta di risposta limitata alla regione in primo piano tra la variante senza fusione e il modello completo. Il modello completo mantiene la risposta principale allineata al capo d'abbigliamento, riducendo al contempo la dispersione residua al di fuori della regione strutturale principale. Il confronto mostra che il modello strutturale a priori riduce le interferenze esterne al capo d'abbigliamento e che il modulo di fusione affina ulteriormente la risposta strutturale. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 11: Selezione del peso del vincolo strutturale basata sulla validazione. Il valore di Recall@5 nella fase di validazione è riportato per pesi del vincolo strutturale pari a 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 e 2,0. Ogni punto indica la media aritmetica ottenuta in cinque esecuzioni di validazione, e ogni barra di errore rappresenta la deviazione standard campionaria. Il peso è stato fissato a 1,0 prima della valutazione finale sul test set. Questa figura illustra la procedura di selezione dei parametri e non costituisce un contributo architetturale indipendente. Cliccare qui per visualizzare una versione ingrandita di questa figura.
Tabella 1: Assegnazione del dataset e statistiche topologiche a livello di immagine nei sottoinsiemi di capi S1-S5. La tabella riporta i conteggi di immagini per il training, la validazione, il test e il totale, insieme al numero medio di componenti semantici, al conteggio di nodi attivi, al conteggio di archi tipizzati e al conteggio di punti di riferimento annotati nel piano dell'immagine per ciascun livello strutturale. Tutti i valori sono generati dai manifesti dei dati elaborati. I conteggi di immagini per training, validazione e test sono stati ottenuti dai manifesti finali dei sottoinsiemi dopo revisione strutturale, controllo dei gruppi di duplicati e verifica di eventuali sovrapposizioni, mentre le statistiche topologiche sono state calcolate dai record finali dei grafi utilizzando lo stesso ordine di componenti e le stesse definizioni di relazione adottate durante la valutazione del modello. Cliccare qui per scaricare il file.
Tabella 2: Impostazioni ambientali computazionali, configurazione di input, aumento dati, rappresentazione, ottimizzazione, funzione di perdita e riproducibilità utilizzate nell'intero protocollo. La tabella riporta le versioni esatte del sistema operativo, processore, memoria installata, unità di elaborazione grafica, memoria grafica, driver grafico, CUDA, cuDNN, Python, NumPy, PyTorch e torchvision, insieme alle dimensioni dell'immagine, alla costruzione del batch, all'ottimizzatore, alla pianificazione del tasso di apprendimento, al numero di epoche, ai semi casuali, alle dimensioni della rappresentazione e ai pesi degli obiettivi strutturali. Ogni valore è collegato al file software_versions.txt, al file configs/protocol.yaml o al corrispondente record di addestramento. Cliccare qui per scaricare il file.
Tabella 3: Confronto quantitativo tra modelli generali di rappresentazione visiva, modelli di capi d'abbigliamento basati su grafi e metodi specifici del dominio per il recupero di moda. La tabella riporta il focus del recupero, la modalità della query, SCI, SDI, Recall@5, mAP e coefficiente di siluetta per undici metodi, utilizzando le stesse partizioni dei dati e lo stesso protocollo di valutazione. Ogni metrica è riportata come media e deviazione standard campionaria ottenute da cinque esecuzioni indipendenti. I valori di p riportati sono stati ottenuti da test t appaiati a due code che confrontano ciascun metodo di confronto con il metodo proposto, utilizzando risultati generati con gli stessi cinque semi casuali. Il metodo proposto è considerato come riga di riferimento. Cliccare qui per scaricare questo file.
Tabella 4: Risultati dell'analisi di ablazione per il prior strutturale e il modulo di fusione delle caratteristiche. La tabella riporta SCI, SDI e Recall@5 per la variante senza il prior strutturale, la variante senza il modulo di fusione e il modello completo. La rimozione del prior strutturale determina una riduzione maggiore di SCI e Recall@5, mentre l'eliminazione del modulo di fusione riduce SDI e l'allineamento delle risposte. Il modello completo registra il valore più alto per tutte e tre le metriche. Cliccare qui per scaricare il file.
Tabella 5: Efficienza computazionale del modello di base ResNet-50 e del modello completo con struttura integrata. La tabella riporta i parametri addestrabili, le operazioni in virgola mobile per immagine e il tempo medio di inferenza per immagine nello stesso ambiente hardware e software documentato nella Tabella 2 e nella Tabella dei Materiali. Entrambi i modelli utilizzano la stessa risoluzione delle immagini, la stessa configurazione del batch di inferenza, le stesse operazioni di preelaborazione e lo stesso procedimento di misurazione dei tempi. Il modello completo aggiunge 3,7 milioni di parametri, 1,3 miliardi di operazioni in virgola mobile e 7 millisecondi di tempo di inferenza per immagine rispetto al modello di base. Cliccare qui per scaricare questo file.