Todos os experimentos relatados foram realizados utilizando o ambiente de hardware e software documentado na Tabela 2 e na Tabela de Materiais. As mesmas versões do driver gráfico, CUDA, cuDNN, Python, NumPy, PyTorch e torchvision foram utilizadas em todas as etapas de pré-processamento, treinamento, inferência e avaliação. O ambiente completo de hardware e software é resumido na Tabela 2 e na Tabela de Materiais. Tabela 1 resume os conjuntos de dados de treinamento, validação e teste processados, juntamente com as estatísticas de topologia em nível de imagem. Tabela 2 resume a configuração comum utilizada em todos os métodos de comparação.
Resultados da avaliação comparativa
A avaliação comparativa seguiu as partições comuns de dados, operações de pré-processamento, controles de treinamento e definições de métricas especificadas nas seções 7–9 do Protocolo. Tabela 3 compara codificadores visuais gerais, modelos alinhados por partes, representações de roupas baseadas em grafos, redes de recuperação cruzada de moda, métodos de fusão de topologia e aparência e métodos de recuperação visual em comércio eletrônico, todos avaliados usando o mesmo protocolo de consulta por imagem. Os métodos específicos do domínio incluem o Histograma de Características de Topologia com Fusão de Cor e Textura (TFH-CT), Rede em Cascata Orientada por Atenção (AGC-Net), Rede de Aprendizado de Características Multiescala e Multigranularidade (MMFL-Net) e Recuperação de Moda usando Rede Residual com Otimização por Enxame de Garças (FARE-RNET). Todas as métricas de avaliação na Tabela 3 são apresentadas como média e desvio padrão amostral calculados a partir de cinco execuções independentes usando as mesmas sementes aleatórias, manifesto de treinamento, manifesto de validação, manifesto de teste, atribuição consulta-galeria e implementação da métrica. Os valores de p-pareado foram calculados separadamente para SCI, SDI, Recall@5, mAP e coeficiente de silhueta, comparando cada método com o método proposto sob condições de sementes aleatórias emparelhadas. Esses resultados fornecem a base quantitativa para as análises estruturais subsequentes de visualização, recuperação, agrupamento e orientadas ao design.
Resultados representativos do protocolo e interpretação
A execução bem-sucedida do protocolo é indicada quando o grafo do componente no nível da imagem, reconstruído a partir dos arquivos salvos de análise e grafo, posiciona cada nó ativo dentro da região correspondente da peça de roupa e preserva os tipos de relação registrados na matriz de adjacência tipificada, conforme mostrado na Figura 5C. A resposta com consciência estrutural deve permanecer concentrada no primeiro plano da peça de roupa, como mostrado na Figura 5D. A Figura 6E apresenta um resultado esperado de recuperação no qual o método proposto reduz a influência do fundo vermelho e recupera peças de roupa do tronco superior em vez de objetos vermelhos não relacionados. As Figuras 6B–G também demonstram que a classificação na recuperação é apoiada pelas relações entre componentes no nível da imagem e pela correspondência de componentes após a fusão. Esse resultado reflete a recuperação da categoria geral da peça de roupa, embora o comprimento das mangas e a topologia local ainda variem entre as amostras recuperadas.
Casos comuns de falha incluem a ativação dominada por textura em Figura 5B, a recuperação guiada pela cor de fundo na linha superior da Figura 6 e a ativação residual de fundo na Figura 7. A Figura 7 deve ser interpretada como uma localização parcial, pois a resposta dominante acompanha o contorno alargado da parte inferior do corpo e o limite da peça de vestuário à direita, enquanto persiste uma ativação residual em regiões adjacentes do fundo. A localização é considerada estruturalmente suportada apenas quando a matriz de diferença de topologia, a matriz de diferença de relação geométrica, o grafo de diferença de componente pós-fusão e a resposta espacial identificam regiões consistentes da peça de vestuário. Um ponto quente espacial sem alterações correspondentes na matriz ou nos componentes indica interferência visual, e não evidência estrutural.
Um protocolo executado é considerado válido quando cada imagem aceita produzir um mapa de probabilidade semântica normalizado, uma matriz de relações com K linhas e K colunas, matrizes de características de aparência e estruturais com K linhas e 512 colunas, e um vetor de características fundido finito associado ao identificador correto da imagem. A inspeção visual deve confirmar que a topologia segue os componentes da peça de vestuário, que a resposta do primeiro plano excede a resposta do plano de fundo e que os resultados de recuperação são guiados pela categoria e estrutura da peça de vestuário, e não pela cor do plano de fundo. Mapas de probabilidade fragmentados, nós de componentes ausentes, matrizes não numéricas, respostas difusas do plano de fundo ou recuperação dominada por cor indicam execução mal-sucedida e exigem inspeção da análise, construção do grafo, fusão de características ou carregamento do ponto de verificação.
Análise visual das respostas dos componentes do vestuário no nível da imagem
Figura 5 compara a linha de base ResNet-50 com o modelo sensível a componentes usando a mesma imagem de peça de vestuário. Figura 5B mostra o mapa de ativação de classe para a linha de base de aparência. Figura 5C apresenta o grafo de componentes da peça de vestuário em nível de imagem, reconstruído a partir do mapa de probabilidade restrito ao primeiro plano, matriz de centros de componentes, matriz de adjacência tipada, máscara de nós inativos e mapeamento de rótulos de componentes gerados nas seções 3 e 4 do Protocolo. Figura 5D apresenta a resposta de ativação da representação fundida. Nenhum estimador de postura humana ou anotação de articulações humanas é utilizado para gerar a Figura 5C.
A resposta de referência concentrou-se em regiões de textura locais na peça inferior e não seguiu consistentemente o contorno completo da peça, conforme mostrado na Figura 5B. Na Figura 5C, cada nó corresponde ao centro de uma região ativa do componente da peça, enquanto cada aresta representa um contorno comum em primeiro plano ou uma relação de ordem vertical predefinida. O grafo reflete a organização das regiões da peça e não representa articulações anatômicas humanas. A resposta com consciência estrutural cobriu o primeiro plano principal da peça, mantendo ativação reduzida na maioria das áreas de fundo, conforme mostrado na Figura 5D. Esses resultados indicam que o grafo de componentes e o módulo de fusão de características reduziram a ativação dominada pela textura na imagem avaliada.
Análise de similaridade estrutural de roupas e resultados de referência para design
Figura 6 apresenta a classificação de recuperação juntamente com as evidências estruturais utilizadas para interpretá-la. O grafo do componente da consulta na Figura 6B registra regiões ativas da vestimenta e suas relações tipadas, enquanto a matriz na Figura 6C revela o padrão de relações fornecido à propagação do grafo. Os resultados da linha de base na Figura 6D permanecem dominados por pistas de aparência vermelha. Os resultados com consciência estrutural na Figura 6E mantêm a categoria da vestimenta do tronco superior em diferentes cores e fundos. O grafo de componentes do resultado com classificação mais alta na Figura 6F permite comparação direta com o grafo da consulta, e a matriz de correspondência na Figura 6G revela se componentes que compartilham os mesmos identificadores permanecem alinhados após a fusão orientada por estrutura. A correspondência diagonal deve ser interpretada conjuntamente com nós ausentes e relações do grafo alteradas. Alta similaridade de aparência sem concordância do grafo não constitui uma recuperação estrutural bem-sucedida.
As peças recuperadas mantêm a categoria geral, mas as diferenças na configuração das mangas e nas relações locais entre componentes indicam uma correspondência incompleta em nível fino. O método proposto alcançou uma Revocação@5 de 89,2% e um mAP de 86,4%, conforme relatado na Tabela 3. Esses valores quantitativos descrevem o desempenho na ordenação, enquanto Figura 6B–G fornece evidências estruturais intermediárias que apoiam a interpretação. Assim, a conclusão da recuperação é limitada a uma maior resistência à interferência da cor de fundo e a uma organização mais forte dos componentes no nível da imagem sob a consulta testada.
Suporte à análise de resposta de diferença estrutural e design
O mapa de calor da diferença-resposta pura em Figura 7H mostra que a resposta dominante está concentrada na silhueta ampliada da parte inferior do corpo e no limite direito da peça de vestuário da imagem-alvo. A sobreposição na Figura 7I mostra que a resposta mais intensa permanece alinhada com o primeiro plano principal da peça de vestuário, enquanto a ativação mais fraca nas regiões adjacentes da cortina e da parede permanece como interferência residual de fundo. A resposta espacial deve ser interpretada em conjunto com o gráfico de componentes e as evidências matriciais apresentadas nas Figuras 7C–G. Uma resposta é considerada uma diferença estrutural válida apenas quando a região de alta resposta da peça de vestuário é consistente com a mudança de adjacência, a mudança na relação geométrica e o padrão de distância entre componentes após fusão.
Uma diferença estrutural é aceita somente quando a mudança de adjacência tipificada em Figura 7E ou a mudança na relação geométrica em Figura 7F for acompanhada por um aumento na distância dos componentes em Figura 7G e por uma resposta espacial alinhada ao primeiro plano em Figura 7H,I. A região ampliada da parte inferior do corpo e o limite direito da peça de vestuário satisfazem esse critério cruzado entre estágios. A ativação sobre a cortina e a parede não corresponde a mudanças nos nós dos componentes, nos padrões de relação ou nas distâncias dos componentes fundidos, sendo portanto rejeitada como interferência residual não estrutural. O resultado apoia a localização de diferenças no nível da imagem, mas não estabelece variação nos padrões de costura ou nos parâmetros de construção.
Distribuição espacial de características e análise de agrupamento estrutural
A análise da distribuição do espaço de características latentes revela a capacidade do modelo de discriminar a semântica estrutural das roupas. Esta análise verifica se a priori estrutural organiza peças com diferentes configurações topológicas em variedades de características distintas. Foram selecionadas cinco categorias estruturais representativas do conjunto de teste — blusas de manga curta, calças, saias, casacos longos e vestidos. Os vetores de características de alta dimensão foram projetados em um plano bidimensional utilizando a técnica de incorporação estocástica de vizinhos com distribuição t (t-SNE). A coesão de amostras semelhantes e a separação de amostras diferentes foram avaliadas para caracterizar a organização da semântica estrutural no espaço de características. A distribuição t-SNE do espaço de características sensível à estrutura é apresentada na Figura 8.
A projeção t-SNE formou cinco regiões principais de características com sobreposição limitada entre categorias vizinhas, conforme mostrado na Figura 8A. Amostras representativas correspondentes às cinco regiões de categoria são apresentadas na Figura 8B. O ISC de 0,81 reflete a compacidade das amostras que compartilham o mesmo rótulo estrutural, e o ISD de 0,71 reflete a separação entre amostras com rótulos estruturais diferentes, conforme relatado na Tabela 3 e visualizado na Figura 8. Esses índices devem ser interpretados como medidas da distribuição no espaço de características e não estabelecem diretamente uma taxa de falsa detecção. Partes superiores de mangas curtas e saias ocuparam regiões principais distintas no espaço de características projetado, enquanto um pequeno número de amostras permaneceu próximas aos limites das categorias vizinhas, conforme mostrado na Figura 8A. Calças e vestidos também apresentaram clara separação das categorias vizinhas. Essa distribuição indica que a priorização baseada em grafos contribuiu para a organização estrutural em nível de categoria, sem produzir separação completa dos agrupamentos. A avaliação separa a qualidade da representação da eficácia na recuperação. O ISC avalia se peças de roupa que compartilham o mesmo rótulo estrutural permanecem compactas no espaço de características aprendido, enquanto o ISD avalia se peças com rótulos estruturais diferentes permanecem separadas. Essas métricas correspondem ao objetivo de representação estrutural do protocolo. O Recall@5 mede se uma peça de roupa estruturalmente relevante aparece entre os cinco primeiros resultados recuperados, enquanto o mAP mede a qualidade do ordenamento em todos os exemplos relevantes da galeria. Essas métricas correspondem ao objetivo de recuperação de referência de design. O coeficiente de silhueta foi utilizado apenas para avaliar o desempenho do agrupamento, pois o ISC e o ISD já caracterizam a organização no espaço de características.
Figura 9 apresenta os resultados brutos de cinco execuções para quatro métodos representativos, sem normalização entre métodos. Figura 9A mostra SCI e SDI em suas escalas originais, enquanto Figura 9B apresenta Recall@5 e mAP como porcentagens. Os marcadores das execuções individuais e as barras de erro de desvio padrão mostram a variação associada ao treinamento do modelo, e não apenas a classificação agregada. A linha de base baseada na aparência obteve um SCI de 0,62, enquanto o método proposto alcançou um SCI de 0,81 e um SDI de 0,71 (Tabela 3 e Figura 9A). Os resultados de SCI e SDI indicam maior compacidade intra-classe e separação entre classes na configuração avaliada. O método proposto obteve um Recall@5 de 89,2% e um mAP de 86,4% (Tabela 3 e Figura 9B). Essas métricas de recuperação avaliam propriedades diferentes de ordenação e devem ser interpretadas separadamente de SCI e SDI. A ordem consistente dos métodos nas quatro métricas indica concordância entre qualidade da representação e desempenho na recuperação, mas não implica que a melhoria relativa seja idêntica nas quatro dimensões de avaliação.
Experimentos de ablação e análise da eficácia do módulo estrutural
O experimento de ablação compara o modelo completo com variantes nas quais o prior estrutural ou o módulo de fusão é removido. As três configurações utilizam as mesmas imagens de referência e alvo, permitindo a comparação direta da resposta de fundo e da concentração de localização. A variante sem o prior estrutural remove o grafo do componente de vestuário no nível da imagem e suas restrições de relação, dependendo apenas do arcabouço convolucional para extrair características de aparência; a variante sem fusão mantém a inferência de grafo, mas remove a pirâmide de características, utilizando apenas características semânticas de alto nível. Mapas de calor de diferença visualizados revelam os papéis específicos de cada módulo na supressão de ruído e na definição de contornos; uma comparação qualitativa das respostas de diferença estrutural sob diferentes configurações de módulos é apresentada na Figura 10.
Os mapas de resposta em Figura 10C–E foram gerados utilizando uma escala de resposta compartilhada e configurações idênticas de sobreposição. A variante sem o modelo estrutural produziu forte ativação na região de fundo esquerda e ao redor de áreas ambientais não relacionadas, conforme mostrado na Figura 10C. A variante sem o módulo de fusão reduziu parte dessa resposta fora da peça de vestuário, mas ainda manteve uma distribuição mais ampla sobre a peça inferior e a região ao lado direito, conforme mostrado na Figura 10D. O modelo completo contraiu ainda mais a resposta dominante em direção ao primeiro plano da peça principal, conforme mostrado na Figura 10E. A Figura 10F visualiza diretamente a diferença nas respostas restritas ao primeiro plano entre a variante sem fusão e o modelo completo, mostrando que o modelo completo suprime a dispersão lateral residual enquanto preserva a resposta principal alinhada à peça. Esses resultados indicam que o modelo estrutural reduziu principalmente o ruído ambiental e que o módulo de fusão melhorou ainda mais a concentração da resposta e o alinhamento estrutural. A Figura 10E representa uma melhoria relativa, e não a remoção completa da ativação de fundo.
Tabela 4 apresenta SCI, SDI e Recall@5 para as variantes sem a priori de estrutura, sem o módulo de fusão e com o modelo completo. A remoção da priori de estrutura reduziu o SCI de 0,81 para 0,65 e diminuiu o Recall@5 de 89,2% para 74,5%. A remoção do módulo de fusão reduziu o SDI de 0,71 para 0,64 e diminuiu o Recall@5 de 89,2% para 85,1%, uma redução de 4,1 pontos percentuais. Esses resultados indicam que a priori de estrutura teve um efeito maior na consistência estrutural e na recuperação, enquanto a fusão de características melhorou o alinhamento entre informações de aparência e estruturais.
A análise de eficiência compara o custo computacional do modelo completo com a linha de base ResNet-50. A linha de base ResNet-50 exigiu 25,6 milhões de parâmetros e 4,1 bilhões de operações de ponto flutuante. O modelo completo com estrutura definida exigiu 29,3 milhões de parâmetros e 5,4 bilhões de operações de ponto flutuante. O tempo médio de inferência foi de 15 milissegundos por imagem para a linha de base e de 22 milissegundos por imagem para o modelo completo, um aumento de 7 milissegundos. Esse resultado indica um custo computacional mensurável que deve ser considerado ao implantar o protocolo em fluxos de trabalho sensíveis ao tempo (Tabela 5). O peso da restrição estrutural foi determinado a partir da divisão de validação antes da avaliação final de teste. O Recall@5 na validação foi examinado em pesos de restrição estrutural de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 e 2,0. Um peso de 1,0 foi fixado para todos os treinamentos e execuções de teste subsequentes. Figura 11 documenta a seleção baseada na validação de um peso de restrição estrutural igual a 1,0.

Figura 1: Fluxo geral do protocolo de aprendizagem de características em imagens de roupas com reconhecimento de estrutura. A imagem de entrada da peça de vestuário é processada por um ramo de características de aparência e um ramo de características estruturais que utiliza segmentação semântica e modelagem de grafos espaciais. As duas representações são processadas pelo módulo de fusão orientado por estrutura para gerar a característica final com reconhecimento de estrutura. A perda de consistência estrutural, a perda de discriminação estrutural e a perda de relação estrutural restringem conjuntamente o espaço de características. A figura mostra como a aparência da peça de vestuário e a topologia dos componentes são integradas ao longo da aprendizagem de características. Clique aqui para visualizar uma versão maior desta figura.

Figura 2: Construção de uma topologia prévia de componentes de vestuário em nível de imagem. (A) A imagem de entrada do vestuário I. (B) O mapa de componentes visuais restrito ao primeiro plano P, no qual sete cores indicam regiões de vestuário em nível de imagem. Todos os pixels de fundo são excluídos dos canais de componentes. (C) O grafo de relação de componentes em nível de imagem G. Os nós representam regiões visíveis do vestuário, as arestas sólidas representam fronteiras compartilhadas no primeiro plano e as relações tracejadas representam uma ordem vertical predefinida. O mapa e o grafo auxiliam na recuperação de imagens e na comparação de estruturas visuais. Eles não representam peças de moldes de costura, geometria de costuras, estruturas de pences, parâmetros de graduação ou instruções de corte. Clique aqui para visualizar uma versão maior desta figura.

Figura 3: Módulo de fusão de características orientado por estrutura. A característica estrutural é transformada pelo mapeamento linear e pela função de ativação Ψ para gerar um peso estrutural. O peso estrutural modula a característica de aparência por meio de multiplicação elemento a elemento. A característica de aparência modulada e a característica estrutural são concatenadas e projetadas por Wc, após o que a característica estrutural residual é adicionada para gerar a característica final do componente. A figura mostra que a informação estrutural regula o ponderamento da característica de aparência antes da fusão final. Clique aqui para visualizar uma versão maior desta figura.

Figura 4: Otimização no espaço de características sob restrições de consistência estrutural. (A) Amostras pertencentes à mesma classe estrutural são aproximadas por meio da perda de consistência estrutural, enquanto suas relações internas entre componentes são preservadas pela perda de relação estrutural. (B) Amostras de diferentes classes estruturais são afastadas pela perda de discriminação estrutural. A figura mostra como os três objetivos estruturais atuam em conjunto para aumentar a compactação intraclasse e a separação interclasses. Clique aqui para visualizar uma versão maior desta figura.

Figura 5: Respostas representativas de características da peça de vestuário e visualização em grafo de componentes. (A) A imagem de entrada da peça de vestuário. (B) A resposta de ativação de classe da linha de base de aparência ResNet-50. (C) O grafo de componentes da peça de vestuário no nível da imagem foi reconstruído a partir do mapa de componentes restrito ao primeiro plano, matriz de centros de componentes, matriz de adjacência tipificada, máscara de nós inativos e mapeamento de rótulos de componentes, que foram salvos durante as seções 3 e 4 do Protocolo. Os nós indicam regiões ativas da peça de vestuário, as arestas sólidas indicam fronteiras comuns no primeiro plano e as arestas tracejadas indicam relações de ordem vertical predefinidas. (D) A resposta de ativação da representação fundida com reconhecimento de componentes. A comparação mostra a diferença entre ativação dominada por textura e ativação guiada por regiões da peça de vestuário. Clique aqui para visualizar uma versão maior desta figura.

Figura 6: Resultados de recuperação e evidências estruturais intermediárias sob interferência de fundo vermelho. (A) A imagem de consulta. (B) O grafo de componentes da consulta é gerado a partir dos centros de componentes salvos e da matriz de adjacência tipificada. (C) A matriz de adjacência tipificada da consulta, na qual os valores da matriz distinguem relações inativas, fronteiras comuns de primeiro plano e relações de ordem vertical predefinidas. (D) Os três primeiros resultados de recuperação foram produzidos pela linha de base de aparência. (E) Os três primeiros resultados foram produzidos pela representação sensível à estrutura. (F) O grafo de componentes do resultado com maior classificação segundo o método sensível à estrutura. (G) A matriz de correspondência de componentes pós-fusão entre a consulta e o resultado com maior classificação. Uma alta correspondência diagonal indica concordância entre componentes com os mesmos identificadores, enquanto respostas fracas ou deslocadas indicam ausência ou desacordo na organização dos componentes. Os resultados de recuperação preservam a categoria geral da parte superior do corpo, mas não estabelecem concordância completa na configuração das mangas e na topologia local. Clique aqui para visualizar uma versão maior desta figura.

Figura 7: Rastreamento de diferença estrutural da topologia de vestuário em nível de imagem até a resposta espacial. (A) A imagem de referência. (B) A imagem-alvo. (C) O gráfico de componentes de referência. (D) O gráfico de componentes-alvo. Ambos os gráficos são reconstruídos a partir dos centros de componentes salvos e das matrizes de adjacência tipificadas. (E) A matriz de diferença de adjacência tipificada. (F) A diferença na relação geométrica é derivada do deslocamento dos centros dos componentes, da dispersão espacial e das mudanças no peso da relação. (G) O gráfico de diferença de componentes pós-fusão, em que a intensidade do nó representa a distância normalizada entre os vetores de componentes fundidos correspondentes e a largura da aresta representa a mudança no peso da relação. (H) O mapa de calor de resposta de diferença puramente espacial foi gerado utilizando a mesma escala de resposta fixa do sobreposição. (I) A resposta sobreposta à imagem-alvo. Uma diferença estrutural é aceita somente quando a mudança na adjacência, a mudança na relação geométrica, a mudança na distância dos componentes e a resposta de calor alinhada ao primeiro plano permanecem consistentes. A ativação do plano de fundo sem evidência correspondente de componentes ou relações é tratada como interferência residual e não como uma diferença válida na estrutura do vestuário. Clique aqui para visualizar uma versão maior desta figura.

Figura 8: Agrupamento no espaço de características com base na estrutura. (A) A projeção t-SNE de blusas de manga curta, calças, saias, casacos longos e vestidos. As cinco categorias formam regiões principais de características com sobreposição limitada nas fronteiras entre elas. (B) Imagens de teste representativas atribuídas às cinco categorias de roupas, com a cor da borda correspondendo à cor da categoria em (A). A figura mostra a organização estrutural em nível de categoria, mantendo um pequeno número de amostras próximas às regiões de categorias adjacentes. Clique aqui para visualizar uma versão maior desta figura.

Figura 9: Comparação do desempenho bruto entre estrutura do espaço de características e objetivos de classificação por recuperação. (A) SCI e SDI para a linha de base baseada na aparência, modelo de estrutura fraca, modelo de estrutura explícita e método proposto. (B) Recall@5 e mAP para os mesmos quatro métodos. Marcadores grandes indicam a média aritmética de cinco execuções independentes, linhas de erro indicam o desvio padrão amostral e marcadores pequenos indicam os resultados por execução. SCI e SDI são exibidos em uma escala fixa de zero a um, enquanto Recall@5 e mAP são exibidos em uma escala percentual fixa de zero a cem. Nenhuma normalização min-max ou reescala entre métodos é aplicada. Clique aqui para visualizar uma versão maior desta figura.

Figura 10: Respostas de diferença estrutural sob diferentes configurações de módulo. (A) A imagem de referência. (B) A imagem-alvo. (C) A resposta da variante sem a priorização de estrutura. (D) A resposta da variante sem o módulo de fusão. (E) A resposta do modelo completo. (C–E) são renderizadas usando a mesma escala normalizada de resposta, mapa de cores e configurações de sobreposição. (F) A diferença absoluta de resposta restrita ao primeiro plano entre a variante sem fusão e o modelo completo. O modelo completo preserva a resposta principal alinhada à vestimenta, ao mesmo tempo que reduz a dispersão residual fora da região estrutural principal. A comparação mostra que a priorização de estrutura reduz interferências fora da vestimenta e que o módulo de fusão aprimora ainda mais a resposta estrutural. Clique aqui para visualizar uma versão maior desta figura.

Figura 11: Seleção baseada em validação do peso da restrição estrutural. O Recall@5 na validação é apresentado para pesos de restrição estrutural de 0,1, 0,3, 0,5, 0,8, 1,0, 1,2, 1,5 e 2,0. Cada ponto indica a média aritmética de cinco execuções de validação, e cada barra de erro representa o desvio padrão amostral. O peso foi fixado em 1,0 antes da avaliação final no conjunto de testes. Esta figura documenta o procedimento de seleção de parâmetros e não constitui uma contribuição arquitetural independente. Clique aqui para visualizar uma versão maior desta figura.
Tabela 1: Alocação do conjunto de dados e estatísticas de topologia em nível de imagem nos subconjuntos de roupas S1 a S5. A tabela apresenta as contagens de imagens de treinamento, validação, teste e total, juntamente com as médias dos números de componentes semânticos, de nós ativos, de arestas tipadas e de marcos anotados no plano da imagem para cada nível estrutural. Todos os valores são gerados a partir dos manifestos de dados processados. As contagens de imagens de treinamento, validação e teste foram obtidas a partir dos manifestos finais dos subconjuntos após revisão estrutural, controle de grupos duplicados e inspeção de vazamento, enquanto as estatísticas de topologia foram calculadas a partir dos registros finais de grafos utilizando a mesma ordem de componentes e definições de relações aplicadas durante a avaliação do modelo. Clique aqui para baixar este arquivo.
Tabela 2: Ambiente computacional, configuração de entrada, aumento de dados, representação, otimização, função de perda e configurações de reprodutibilidade utilizadas ao longo do protocolo. A tabela informa o sistema operacional exato, processador, memória instalada, unidade de processamento gráfico, memória gráfica, driver gráfico, CUDA, cuDNN, versões do Python, NumPy, PyTorch e torchvision, juntamente com o tamanho da imagem, construção do lote, otimizador, cronograma de taxa de aprendizado, número de épocas, sementes aleatórias, dimensões da representação e pesos objetivos estruturais. Cada valor está vinculado ao arquivo software_versions.txt, configs/protocol.yaml ou ao registro de treinamento correspondente. Clique aqui para baixar este arquivo.
Tabela 3: Comparação quantitativa de modelos gerais de representação visual, modelos de vestuário baseados em grafos e métodos específicos de domínio para recuperação de moda. A tabela apresenta o foco de recuperação, modalidade da consulta, SCI, SDI, Recall@5, mAP e coeficiente de silhueta para onze métodos sob as mesmas partições de dados e protocolo de avaliação. Cada métrica é apresentada como média e desvio padrão amostral calculados a partir de cinco execuções independentes. Os p-valores relatados foram obtidos a partir de testes t pareados bilaterais comparando cada método de comparação com o método proposto, utilizando resultados gerados com as mesmas cinco sementes aleatórias. O método proposto é tratado como a linha de referência. Clique aqui para baixar este arquivo.
Tabela 4: Resultados de ablação para a priorização estrutural e o módulo de fusão de características. A tabela apresenta SCI, SDI e Recall@5 para a variante sem a priorização estrutural, a variante sem o módulo de fusão e o modelo completo. A remoção da priorização estrutural resulta em uma redução maior em SCI e Recall@5, enquanto a remoção do módulo de fusão reduz SDI e o alinhamento das respostas. O modelo completo registra o valor mais alto nas três métricas. Clique aqui para baixar este arquivo.
Tabela 5: Eficiência computacional da linha de base ResNet-50 e do modelo completo com estrutura sensível. A tabela apresenta os parâmetros treináveis, as operações de ponto flutuante por imagem e o tempo médio de inferência por imagem no mesmo ambiente de hardware e software descrito na Tabela 2 e na Tabela de Materiais. Ambos os modelos utilizam a mesma resolução de imagem, configuração de lote de inferência, operações de pré-processamento e procedimento de temporização. O modelo completo acrescenta 3,7 milhões de parâmetros, 1,3 bilhão de operações de ponto flutuante e 7 milissegundos de tempo de inferência por imagem em relação à linha de base. Clique aqui para baixar este arquivo.