Все описанные эксперименты были выполнены с использованием аппаратного и программного обеспечения, указанных в Таблице 2 и в Таблице материалов. На этапах предварительной обработки, обучения, вывода и оценки использовались одни и те же версии графического драйвера, CUDA, cuDNN, Python, NumPy, PyTorch и torchvision. Полный перечень аппаратного и программного обеспечения приведен в Таблице 2 и Таблице материалов. В Таблице 1 представлены обработанные обучающая, валидационная и тестовая выборки, а также статистика топологии на уровне изображений. В Таблице 2 приведена общая конфигурация, использованная для всех сравниваемых методов.
Результаты сравнительной оценки
Сравнительная оценка проводилась с использованием общих разделений данных, операций предобработки, контролей обучения и определений метрик, указанных в разделах 7–9 протокола. В таблице 3 приведено сравнение общих визуальных кодировщиков, моделей с выравниванием по частям, графовых представлений одежды, сетей для кросс-доменного поиска модных изделий, методов слияния топологии и внешнего вида, а также методов визуального поиска для электронной коммерции; все они оценивались с использованием одного и того же протокола запросов по изображениям. Специфические для данной области методы включают гистограмму топологических признаков с слиянием цвета и текстуры (TFH-CT), каскадную сеть с управлением вниманием (AGC-Net), сеть обучения признакам с многомасштабностью и многозернистостью (MMFL-Net) и систему поиска модных изделий с использованием остаточной сети и оптимизации роем цапель (FARE-RNET). Все метрики оценки в таблице 3 представлены в виде среднего значения и выборочного стандартного отклонения по пяти независимым запускам с использованием одних и тех же случайных чисел (seeds), манифеста обучения, манифеста валидации, манифеста тестирования, назначения запрос-галерея и реализации метрик. Парные значения p- были рассчитаны отдельно для SCI, SDI, Recall@5, mAP и коэффициента силуэта путем сравнения каждого метода с предлагаемым методом при совпадающих условиях случайных чисел. Эти результаты обеспечивают количественную основу для последующего структурного визуализирования, анализа поиска, кластеризации и анализа, ориентированного на дизайн.
Репрезентативные результаты протокола и их интерпретация
Об успешном выполнении протокола свидетельствует тот факт, что граф компонентов на уровне изображения, реконструированный из сохраненных файлов парсинга и графа, помещает каждый активный узел в соответствующую область одежды и сохраняет типы связей, записанные в типизированной матрице смежности, как показано на рисунке 5C. Ответ с учетом структуры должен оставаться сконцентрированным на переднем плане одежды, как показано на рисунке 5D. На рисунке 6E представлен ожидаемый результат поиска, при котором предлагаемый метод снижает влияние красного фона и находит одежду для верхней части тела, а не несвязанные красные объекты. Рисунки 6B–G также демонстрируют, что ранжирование при поиске поддерживается связями компонентов на уровне изображения и соответствием компонентов после слияния. Этот результат отражает восстановление общей категории одежды, хотя длина рукавов и локальная топология все еще различаются среди найденных образцов.
Типичные случаи ошибок включают активацию, определяемую текстурой, на Рисунке 5B, поиск, обусловленный цветом фона, в верхнем ряду Рисунка 6, и остаточную активацию фона на Рисунке 7. Рисунок 7 следует интерпретировать как частичную локализацию, поскольку доминирующий отклик соответствует увеличенному силуэту нижней части тела и правой границе одежды, в то время как остаточная активация сохраняется в прилегающих областях фона. Локализация считается структурно подтвержденной только в том случае, если матрица разности топологий, матрица разности геометрических отношений, граф разности компонентов после слияния и пространственный отклик определяют согласованные области одежды. Пространственный «горячий узел» без соответствующих изменений в матрице или компонентах указывает на визуальные помехи, а не на структурные доказательства.
Запуск протокола считается успешным, если для каждого принятого изображения созданы нормализованная семантическая карта вероятностей, матрица отношений размером K строк на K столбцов, матрицы признаков внешнего вида и структуры размером K строк на 512 столбцов, а также конечный объединенный вектор признаков, связанный с соответствующим идентификатором изображения. Визуальный осмотр должен подтвердить, что топология соответствует компонентам одежды, отклик переднего плана превышает отклик фона, а результаты поиска определяются категорией и структурой одежды, а не цветом фона. Фрагментированные карты вероятностей, отсутствие узлов компонентов, нечисловые матрицы, диффузный отклик фона или поиск, основанный преимущественно на цвете, свидетельствуют о неудачном выполнении и требуют проверки этапов парсинга, построения графа, объединения признаков или загрузки контрольных точек.
Визуальный анализ откликов компонентов одежды на уровне изображений
Рисунок 5 сравнивает базовую модель ResNet-50 с моделью, учитывающей компоненты, при использовании одного и того же изображения одежды. На Рисунке 5B показана карта активации классов для базовой модели внешнего вида. На Рисунке 5C представлен граф компонентов одежды на уровне изображения, реконструированный на основе карты вероятностей с ограничением по переднему плану, матрицы центров компонентов, типизированной матрицы смежности, маски неактивных узлов и сопоставления меток компонентов, созданных в разделах 3 и 4 протокола. На Рисунке 5D представлен активационный отклик объединенного представления. Для создания Рисунка 5C не использовались инструменты оценки позы человека или аннотации суставов человека.
Базовый отклик был сосредоточен на локальных текстурных областях нижней части одежды и последовательно не следовал всему контуру изделия, как показано на рисунке 5B. На рисунке 5C каждый узел соответствует центру активной области компонента одежды, а каждое ребро представляет общую границу переднего плана или предопределенное отношение вертикального порядка. Граф отражает организацию областей одежды и не представляет анатомические суставы человека. Отклик с учетом структуры охватывал основной передний план одежды, сохраняя при этом более низкую активацию в большинстве фоновых областей, как показано на рисунке 5D. Эти результаты указывают на то, что граф компонентов и модуль слияния признаков снизили доминирующую активацию текстур на анализируемом изображении.
Результаты анализа структурного сходства одежды и эталонные показатели проектирования
Рисунок 6 демонстрирует ранжирование результатов поиска вместе со структурными доказательствами, использованными для его интерпретации. Граф компонентов запроса на рисунке 6B фиксирует активные области одежды и их типизированные связи, в то время как матрица на рисунке 6C отображает паттерн связей, поданный на вход распространению по графу. В базовых результатах на рисунке 6D по-прежнему доминируют признаки красного цвета. Результаты с учетом структуры на рисунке 6E сохраняют категорию одежды для верхней части тела при различных цветах и фонах. Граф компонентов результата с наивысшим рангом на рисунке 6F позволяет провести прямое сравнение с графом запроса, а матрица соответствия на рисунке 6G показывает, остаются ли выровненными компоненты с одинаковыми идентификаторами после слияния с учетом структуры. Диагональное соответствие следует интерпретировать совместно с отсутствующими узлами и измененными связями графа. Сильное сходство по внешним признакам при отсутствии согласованности графов не является успешным структурным поиском.
Извлеченные предметы одежды сохраняют общую категорию, однако различия в конфигурации рукавов и локальных связях компонентов указывают на неполное детальное соответствие. Предложенный метод обеспечил показатель Recall@5 89,2% и mAP 86,4%, как указано в Таблице 3. Эти количественные значения характеризуют эффективность ранжирования, в то время как на Рисунке 6B–G представлены промежуточные структурные доказательства, подтверждающие данную интерпретацию. Таким образом, вывод о результатах поиска ограничивается повышенной устойчивостью к помехам от цвета фона и более строгой организацией компонентов на уровне изображения при использовании протестированного запроса.
Анализ отклика на структурные различия и поддержка проектирования
Теплокарта чистого дифференциального отклика в Рисунок 7H показывает, что доминирующий отклик сосредоточен на увеличенном силуэте нижней части тела и правой границе одежды на целевом изображении. Наложение в Рисунок 7I показывает, что наиболее сильный отклик остается согласованным с основным передним планом одежды, в то время как более слабая активация в прилегающих областях штор и стены сохраняется в виде остаточного фонового шума. Пространственный отклик следует интерпретировать совместно с графиком компонентов и матричными данными, представленными в Рисунки 7C–GОтвет считается значимым структурным различием только в том случае, если область одежды с высоким уровнем отклика соответствует изменению смежности, изменению геометрического соотношения и паттерну расстояния между компонентами после слияния.
Структурное различие признается только в том случае, если изменение типизированного соседства на Рисунке 7E или изменение геометрического отношения на Рисунке 7F сопровождается увеличением расстояния между компонентами на Рисунке 7G и пространственным откликом, выровненным по переднему плану, на Рисунке 7H,I. Увеличенная область нижней части тела и правая граница одежды удовлетворяют этому межэтапному критерию. Активация над шторой и стеной не соответствует изменениям в узлах компонентов, паттернах отношений или объединенных расстояниях между компонентами и поэтому отклоняется как неструктурная остаточная помеха. Результат подтверждает локализацию различий на уровне изображения, но не устанавливает вариации в выкройках или параметрах конструкции.
Анализ пространственного распределения признаков и структурный кластерный анализ
Анализ распределения скрытого пространства признаков позволяет оценить способность модели различать структурную семантику одежды. В данном анализе изучается, организует ли структурный априорный признак предметы одежды с различными топологическими конфигурациями в отдельные многообразия признаков. Были выбраны пять репрезентативных структурных категорий из тестового набора: топы с коротким рукавом, брюки, юбки, длинные пальто и платья. Многомерные векторы признаков были спроецированы на двумерную плоскость с помощью стохастического вложения соседей с t-распределением (t-SNE). Для характеристики организации структурной семантики в пространстве признаков оценивали сплоченность схожих образцов и разделение несхожих. Распределение t-SNE в структурно-зависимом пространстве признаков показано на рисунке 8.
Проекция t-SNE сформировала пять основных областей признаков с ограниченным перекрытием между соседними категориями, как показано на Рисунке 8A. Репрезентативные образцы, соответствующие пяти областям категорий, представлены на Рисунке 8B. Значение SCI 0,81 отражает компактность образцов с одинаковой структурной меткой, а значение SDI 0,71 отражает разделение образцов с разными структурными метками, как указано в Таблице 3 и визуализировано на Рисунке 8. Эти индексы следует интерпретировать как меры распределения в пространстве признаков; они не определяют напрямую уровень ложных срабатываний. Топы с коротким рукавом и юбки занимали разные основные области в спроецированном пространстве признаков, при этом небольшое количество образцов оставалось вблизи границ соседних категорий, как показано на Рисунке 8A. Брюки и платья также продемонстрировали четкое отделение от соседних категорий. Такое распределение указывает на то, что графовое априорное знание способствовало структурной организации на уровне категорий, не приводя при этом к полному разделению кластеров. Оценка разделяет качество представления и эффективность поиска. SCI оценивает, остаются ли предметы одежды с одной и той же структурной меткой компактными в изученном пространстве признаков, тогда как SDI оценивает, остаются ли разделенными предметы одежды с разными структурными метками. Эти метрики соответствуют цели структурного представления протокола. Recall@5 определяет, появляется ли структурно релевантный предмет одежды в пределах первых пяти результатов поиска, в то время как mAP измеряет качество ранжирования по всем релевантным образцам в галерее. Эти метрики соответствуют цели поиска по эталонному дизайну. Коэффициент силуэта использовался только для оценки качества кластеризации, так как SCI и SDI уже характеризуют организацию пространства признаков.
Рисунок 9 содержит необработанные результаты четырех репрезентативных методов по итогам пяти прогонов без межметодической нормализации. На рисунке 9A представлены SCI и SDI в их исходном масштабе, а на рисунке 9B — Recall@5 и mAP в процентах. Маркеры отдельных прогонов и линии стандартного отклонения демонстрируют вариативность, связанную с обучением модели, а не только агрегированный рейтинг. Базовый метод, основанный на внешнем виде, достиг SCI 0,62, в то время как предлагаемый метод достиг SCI 0,81 и SDI 0,71 (таблица 3 и рисунок 9A). Результаты SCI и SDI указывают на более высокую компактность внутри меток и более четкое разделение между метками в оцениваемых условиях. Предлагаемый метод достиг Recall@5 89,2% и mAP 86,4% (таблица 3 и рисунок 9B). Эти метрики поиска оценивают различные свойства ранжирования и интерпретируются отдельно от SCI и SDI. Согласованная последовательность методов по четырем метрикам указывает на соответствие между качеством представления и эффективностью поиска, но это не означает, что относительное улучшение идентично во всех четырех измерениях оценки.
Эксперименты по абляции и анализ эффективности структурных модулей
В эксперименте по абляции проводится сравнение полной модели с вариантами, в которых удален структурный априор или модуль слияния. Во всех трех конфигурациях используются одни и те же эталонные и целевые изображения, что позволяет напрямую сравнить фоновый отклик и концентрацию локализации. В варианте без структурного априора удален граф компонентов одежды на уровне изображения и соответствующие ограничения связей, при этом извлечение признаков внешнего вида осуществляется только с помощью сверточной основы; вариант без слияния сохраняет вывод графа, но исключает пирамиду признаков, используя только семантические признаки высокого уровня. Визуализированные тепловые карты разности раскрывают конкретную роль каждого модуля в подавлении шума и определении границ; качественное сравнение откликов структурной разности при различных конфигурациях модулей представлено на рисунке 10.
Карты отклика на рисунке 10C–E были построены с использованием общей шкалы отклика и идентичных настроек наложения. Вариант без структурного априорного знания (structure prior) вызвал сильную активацию в левой части фона и вокруг несвязанных областей окружающей среды, как показано на рисунке 10C. Вариант без модуля слияния (fusion module) уменьшил часть этого отклика вне области одежды, но все еще сохранял более широкое распределение по нижней части одежды и прилегающей области с правой стороны, как показано на рисунке 10D. Полная модель еще больше сузила доминирующий отклик в сторону основного переднего плана одежды, как показано на рисунке 10E. На рисунке 10F напрямую визуализирована разница в откликах, ограниченных передним планом, между вариантом без слияния и полной моделью, что демонстрирует способность полной модели подавлять остаточное боковое распространение, сохраняя при этом основной отклик, соответствующий контурам одежды. Эти результаты указывают на то, что структурное априорное знание в основном уменьшало шум окружающей среды, а модуль слияния дополнительно улучшал концентрацию отклика и структурное выравнивание. Рисунок 10E представляет собой относительное улучшение, а не полное удаление фоновой активации.
В таблице 4 приведены значения SCI, SDI и Recall@5 для вариантов без структурного априорного распределения, без модуля слияния и для полной модели. Удаление структурного априорного распределения привело к снижению SCI с 0,81 до 0,65 и Recall@5 с 89,2% до 74,5%. Удаление модуля слияния привело к снижению SDI с 0,71 до 0,64 и Recall@5 с 89,2% до 85,1%, что составляет снижение на 4,1 процентных пункта. Эти результаты указывают на то, что структурное априорное распределение оказывало большее влияние на структурную согласованность и поиск, в то время как слияние признаков улучшало согласование между информацией о внешнем виде и структурной информацией.
Анализ эффективности сравнивает вычислительные затраты полной модели с базовой моделью ResNet-50. Для базовой модели ResNet-50 потребовалось 25.6 million параметров и 4.1 billion операций с плавающей запятой. Для полной модели с учетом структуры потребовалось 29.3 million параметров и 5.4 billion операций с плавающей запятой. Среднее время вывода составило 15 milliseconds на одно изображение для базовой модели и 22 milliseconds на одно изображение для полной модели, что означает увеличение на 7 milliseconds. Этот результат указывает на заметные вычислительные затраты, которые следует учитывать при внедрении протокола в рабочие процессы, чувствительные к времени (Таблица 5)). Вес структурного ограничения был определен на основе валидационной выборки перед финальной тестовой оценкой. Показатель Validation Recall@5 изучался при весах структурного ограничения 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 и 2.0. Для всех последующих циклов обучения и тестирования был зафиксирован вес 1.0. На Рисунке 11 показан процесс выбора веса структурного ограничения 1.0 на основе валидации.

Рисунок 1: Общий рабочий процесс протокола извлечения признаков изображений одежды с учетом структуры. Исходное изображение одежды обрабатывается ветвью признаков внешнего вида и ветвью структурных признаков, которая использует семантический парсинг и пространственное графовое моделирование. Два представления обрабатываются модулем слияния под руководством структуры для генерации итогового признака с учетом структуры. Потери структурной согласованности, потери структурной дискриминации и потери структурных отношений совместно ограничивают пространство признаков. На рисунке показано, как внешний вид одежды и топология ее компонентов интегрируются на протяжении всего процесса обучения признакам. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Построение априорной топологии компонентов одежды на уровне изображения. (A) Входное изображение одежды I. (B) Карта визуальных компонентов P, ограниченная передним планом, в которой семь цветов обозначают области одежды на уровне изображения. Все пиксели фона исключены из каналов компонентов. (C) Граф отношений компонентов на уровне изображения G. Узлы представляют видимые области одежды, сплошные ребра — общие границы переднего плана, а пунктирные связи — предопределенный вертикальный порядок. Карта и граф обеспечивают поиск изображений и сравнение визуальных структур. Они не представляют собой детали выкройки, геометрию швов, структуру вытачек, параметры градуировки или инструкции по раскрою. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Модуль слияния признаков под управлением структуры. Структурный признак преобразуется с помощью линейного отображения и функции активации Ψ для генерации структурного веса. Структурный вес модулирует признак внешнего вида посредством поэлементного умножения. Модулированный признак внешнего вида и структурный признак объединяются и проецируются с помощью Wc, после чего добавляется остаточный структурный признак для генерации окончательного признака компонента. На рисунке показано, что структурная информация регулирует взвешивание признаков внешнего вида перед окончательным слиянием. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Оптимизация пространства признаков при ограничениях структурной согласованности. (A) Образцы, принадлежащие к одному структурному классу, сближаются за счет функции потерь структурной согласованности, при этом взаимосвязи их внутренних компонентов сохраняются за счет функции потерь структурных отношений. (B) Образцы из разных структурных классов отдаляются друг от друга за счет функции потерь структурной дискриминации. На рисунке показано, как три структурных целевых показателя совместно увеличивают компактность внутри классов и разделимость между классами. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 5: Примеры ответов признаков одежды и визуализация графа компонентов. (A) Исходное изображение одежды. (B) Ответ активации классов базовой модели внешнего вида ResNet-50. (C) Граф компонентов одежды на уровне изображения был реконструирован на основе карты компонентов, ограниченной передним планом, матрицы центров компонентов, типизированной матрицы смежности, маски неактивных узлов и сопоставления меток компонентов, которые были сохранены в ходе выполнения разделов 3 и 4 протокола. Узлы обозначают активные области одежды, сплошные ребра обозначают общие границы переднего плана, а пунктирные ребра — предопределенные отношения вертикального порядка. (D) Ответ активации объединенного представления с учетом компонентов. Сравнение демонстрирует разницу между активацией, определяемой текстурой, и активацией, направляемой областями одежды. Нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Результаты поиска и промежуточные структурные данные при наличии помех в виде красного фона. (A) Запрос-изображение. (B) Граф компонентов запроса, созданный на основе сохраненных центров компонентов и типизированной матрицы смежности. (C) Типизированная матрица смежности запроса, в которой значения матрицы разграничивают неактивные связи, общие границы переднего плана и предопределенные отношения вертикального порядка. (D) Три лучших результата поиска, полученных с помощью базового метода на основе внешнего вида. (E) Три лучших результата, полученных с помощью представления с учетом структуры. (F) Граф компонентов результата с наивысшим рангом при поиске с учетом структуры. (G) Матрица соответствия компонентов между запросом и результатом с наивысшим рангом после слияния. Высокое соответствие по диагонали указывает на согласованность компонентов с одинаковыми идентификаторами, в то время как слабые или смещенные отклики указывают на отсутствие или несоответствие организации компонентов. Результаты поиска сохраняют общую категорию верхней части тела, но не обеспечивают полного согласия в конфигурации рукавов и локальной топологии. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Отслеживание структурных различий от топологии одежды на уровне изображения до пространственного отклика. (A) Исходное (референсное) изображение. (B) Целевое изображение. (C) Граф компонентов исходного изображения. (D) Граф компонентов целевого изображения. Оба графа реконструированы на основе сохраненных центров компонентов и типизированных матриц смежности. (E) Типизированная матрица разности смежности. (F) Разность геометрических отношений выведена из смещения центров компонентов, пространственного рассеяния и изменений веса отношений. (G) Граф разности компонентов после слияния, где интенсивность узла представляет нормализованное расстояние между соответствующими векторами слитых компонентов, а ширина ребра — изменение веса отношения. (H) Тепловая карта чистого пространственного разностного отклика, созданная с использованием той же фиксированной шкалы отклика, что и для наложения. (I) Отклик, наложенный на целевое изображение. Структурное различие признается достоверным только в том случае, если изменение смежности, изменение геометрических отношений, изменение расстояния между компонентами и согласованный с передним планом тепловой отклик остаются согласованными. Активация фона без соответствующих доказательств наличия компонентов или отношений рассматривается как остаточная помеха, а не как достоверное различие в структуре одежды. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Кластеризация в пространстве признаков с учетом структуры. (A) Проекция t-SNE для топов с короткими рукавами, брюк, юбок, длинных пальто и платьев. Пять категорий образуют основные области признаков с ограниченным перекрытием вблизи границ между ними. (B) Репрезентативные тестовые изображения, отнесенные к пяти категориям одежды; цвет рамки соответствует цвету категории на панели (A). На рисунке показана структурная организация на уровне категорий при сохранении небольшого количества образцов вблизи областей соседних категорий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9: Сравнение необработанных показателей эффективности по структуре пространства признаков и целям ранжирования при поиске. (A) SCI и SDI для базовой модели, ориентированной на внешний вид, модели со слабой структурой, модели с явной структурой и предлагаемого метода. (B) Recall@5 и mAP для тех же четырех методов. Крупные маркеры обозначают среднее арифметическое по пяти независимым запускам, линии погрешности обозначают выборочное стандартное отклонение, а мелкие маркеры обозначают результаты отдельных запусков. SCI и SDI отображены в фиксированном масштабе от нуля до одного, в то время как Recall@5 и mAP отображены в фиксированном процентном масштабе от нуля до ста. Min-max нормализация или перемасштабирование между методами не применялись. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 10: Ответы на структурные различия при различных конфигурациях модулей. (A) Эталонное изображение. (B) Целевое изображение. (C) Ответ варианта без структурного априорного знания. (D) Ответ варианта без модуля слияния. (E) Ответ полной модели. (C–E) визуализированы с использованием одной и той же нормализованной шкалы отклика, цветовой карты и настроек наложения. (F) Абсолютная разность откликов, ограниченная передним планом, между вариантом без слияния и полной моделью. Полная модель сохраняет основной отклик, выровненный по одежде, одновременно уменьшая остаточное распространение за пределами основной структурной области. Сравнение показывает, что структурное априорное знание снижает помехи вне области одежды, а модуль слияния дополнительно повышает четкость структурного отклика. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 11: Выбор веса структурного ограничения на основе валидации. Представлено значение Validation Recall@5 при весах структурного ограничения 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 и 2.0. Каждая точка обозначает среднее арифметическое по пяти валидационным запускам, а каждая линия погрешности — выборочное стандартное отклонение. Перед финальной тестовой оценкой вес был зафиксирован на уровне 1.0. Данный рисунок документирует процедуру выбора параметров и не является независимым архитектурным вкладом. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.
Таблица 1: Распределение наборов данных и статистика топологии на уровне изображений для подмножеств одежды от S1 до S5. В таблице указано количество изображений для обучения, валидации, тестирования и общее количество, а также среднее количество семантических компонентов, активных узлов, типизированных ребер и аннотированных ориентиров в плоскости изображения для каждого структурного уровня. Все значения сгенерированы на основе обработанных манифестов данных. Количество изображений для обучения, валидации и тестирования было получено из окончательных манифестов подмножеств после структурного анализа, контроля групп дубликатов и проверки на утечку данных, в то время как статистика топологии была рассчитана на основе окончательных записей графов с использованием того же порядка компонентов и определений отношений, которые применялись при оценке модели. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 2: Параметры вычислительной среды, конфигурации входных данных, аугментации, представления, оптимизации, функции потерь и воспроизводимости, использованные в данном протоколе. В таблице указаны точные версии операционной системы, процессора, объем установленной памяти, графический процессор, объем видеопамяти, драйвер графического процессора, CUDA, cuDNN, Python, NumPy, PyTorch и torchvision, а также размер изображения, способ формирования пакетов, оптимизатор, график скорости обучения, количество эпох, случайные значения (seeds), размерность представления и веса структурной целевой функции. Каждое значение связано с файлами software_versions.txt, configs/protocol.yaml или соответствующим записью об обучении. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 3: Количественное сравнение общих моделей визуального представления, моделей одежды на основе графов и специализированных методов поиска в области моды. В таблице приведены фокус поиска, модальность запроса, SCI, SDI, Recall@5, mAP и коэффициент силуэта для одиннадцати методов при одинаковом разбиении данных и протоколе оценки. Каждый показатель представлен в виде среднего значения и выборочного стандартного отклонения по пяти независимым запускам. Приведенные значения p были получены с помощью двусторонних парных t-критериев при сравнении каждого метода сравнения с предлагаемым методом с использованием результатов, полученных при пяти одинаковых случайных значениях (seeds). Предлагаемый метод принят за эталонную строку. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 4: Результаты абляционного анализа для модуля структурного априорного знания и модуля слияния признаков. В таблице приведены значения SCI, SDI и Recall@5 для варианта без структурного априорного знания, варианта без модуля слияния и полной модели. Удаление структурного априорного знания приводит к более значительному снижению SCI и Recall@5, в то время как удаление модуля слияния снижает SDI и согласованность ответов. Полная модель демонстрирует самые высокие значения по всем трем метрикам. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 5: Вычислительная эффективность базовой модели ResNet-50 и полной модели с учетом структуры. В таблице указаны количество обучаемых параметров, количество операций с плавающей запятой на изображение и среднее время вывода на одно изображение при использовании аппаратного и программного обеспечения, задокументированного в Таблице 2 и Таблице материалов. Для обеих моделей используются одинаковое разрешение изображений, настройки размера пакета при выводе, операции предобработки и процедура измерения времени. По сравнению с базовой моделью, полная модель добавляет 3,7 миллиона параметров, 1,3 миллиарда операций с плавающей запятой и 7 миллисекунд времени вывода на одно изображение. Пожалуйста, нажмите здесь, чтобы скачать этот файл.