Все описанные эксперименты были выполнены с использованием аппаратного и программного обеспечения, указанного в Таблице 2 и в Таблице материалов. На всех этапах предобработки, обучения, логического вывода и оценки использовались одни и те же версии графического драйвера, CUDA, cuDNN, Python, NumPy, PyTorch и torchvision. Полный перечень аппаратного и программного обеспечения приведен в Таблице 2 и Таблице материалов. В Таблице 1 представлены сведения об обработанных обучающих, валидационных и тестовых наборах данных, а также статистика топологии на уровне изображений. В Таблице 2 приведена общая конфигурация, использованная для всех методов сравнения.
Результаты сравнительной оценки
Сравнительная оценка проводилась с использованием общих разделений данных, операций предварительной обработки, контролей обучения и определений метрик, указанных в разделах 7–9 Протокола. В Таблице 3 приведено сравнение общих визуальных кодировщиков, моделей с выравниванием по частям, графовых представлений одежды, сетей для кросс-доменного поиска модных изделий, методов слияния топологии и внешнего вида, а также методов визуального поиска для электронной коммерции; все они оценивались с использованием одного и того же протокола запросов по изображениям. Доменно-специфичные методы включают Topology Feature Histogram with Color and Texture Fusion (TFH-CT), Attention-Guided Cascade Network (AGC-Net), Multi-scale and Multi-granularity Feature Learning Network (MMFL-Net) и Fashion Retrieval using Residual Network with Egret Swarm Optimization (FARE-RNET). Все метрики оценки в Таблице 3 представлены в виде среднего значения и выборочного стандартного отклонения по пяти независимым запускам с использованием одних и тех же случайных чисел (seeds), манифеста обучения, манифеста валидации, манифеста тестирования, назначения запрос-галерея и реализации метрик. Парные p-значения были рассчитаны отдельно для SCI, SDI, Recall@5, mAP и коэффициента силуэта путем сравнения каждого метода с предлагаемым методом при соответствующих условиях случайных чисел. Эти результаты обеспечивают количественную основу для последующей структурной визуализации, анализа поиска, кластеризации и анализа с точки зрения дизайна.
Репрезентативные результаты протокола и их интерпретация
Успешное выполнение протокола подтверждается тем, что граф компонентов на уровне изображения, реконструированный из сохраненных файлов парсинга и графа, располагает каждый активный узел внутри соответствующей области одежды и сохраняет типы связей, зафиксированные в типизированной матрице смежности, как показано на рисунке 5C. Ответ с учетом структуры должен оставаться сконцентрированным на переднем плане одежды, как показано на рисунке 5D. На рисунке 6E представлен ожидаемый результат поиска, при котором предлагаемый метод снижает влияние красного фона и находит одежду для верхней части тела, а не несвязанные красные объекты. Рисунки 6B–G также демонстрируют, что ранжирование при поиске опирается на связи компонентов на уровне изображения и соответствие компонентов после слияния. Этот результат отражает восстановление общей категории одежды, хотя длина рукавов и локальная топология все еще варьируются среди найденных образцов.
Типовые случаи сбоев включают активацию, определяемую текстурой, на рисунке 5B, поиск, обусловленный цветом фона, в верхнем ряду рисунка 6, и остаточную активацию фона на рисунке 7. Рисунок 7 следует интерпретировать как частичную локализацию, поскольку доминирующий отклик соответствует увеличенному силуэту нижней части тела и правой границе одежды, в то время как остаточная активация сохраняется в прилегающих областях фона. Локализация считается структурно обоснованной только в том случае, если матрица разности топологий, матрица разности геометрических отношений, граф разности компонентов после слияния и пространственный отклик определяют согласованные области одежды. Пространственный «хотспот» без соответствующих изменений в матрице или компонентах указывает на визуальные помехи, а не на структурные доказательства.
Запуск протокола считается успешным, если для каждого принятого изображения формируются нормализованная семантическая карта вероятностей, матрица отношений размером K строк на K столбцов, матрицы признаков внешнего вида и структуры размером K строк на 512 столбцов, а также конечный объединенный вектор признаков, связанный с соответствующим идентификатором изображения. Визуальный контроль должен подтвердить, что топология соответствует компонентам одежды, отклик переднего плана превышает отклик фона, а результаты поиска определяются категорией и структурой одежды, а не цветом фона. Фрагментированные карты вероятностей, отсутствие узлов компонентов, нечисловые матрицы, диффузный отклик фона или преобладание цвета при поиске указывают на неудачное выполнение и требуют проверки этапов парсинга, построения графа, объединения признаков или загрузки контрольных точек.
Визуальный анализ отклика компонентов одежды на уровне изображений
Рисунок 5 сравнивает базовую модель ResNet-50 с моделью с учетом компонентов на одном и том же изображении одежды. На Рисунке 5B показана карта активации классов для базовой модели внешнего вида. На Рисунке 5C представлен граф компонентов одежды на уровне изображения, реконструированный на основе карты вероятностей с ограничением по переднему плану, матрицы центров компонентов, типизированной матрицы смежности, маски неактивных узлов и отображения меток компонентов, созданных в разделах 3 и 4 Протокола. На Рисунке 5D представлен отклик активации объединенного представления. Для создания Рисунка 5C не использовались ни определитель позы человека, ни аннотации суставов человека.
Базовый отклик был сосредоточен на локальных текстурных областях нижней части одежды и не последовательно повторял полный контур одежды, как показано на рисунке 5B. На рисунке 5C каждый узел соответствует центру активной области компонента одежды, а каждое ребро представляет собой общую границу переднего плана или предопределенное отношение вертикального порядка. Граф отражает организацию областей одежды и не представляет собой анатомические суставы человека. Отклик с учетом структуры охватил основной передний план одежды, сохраняя при этом более низкую активацию в большинстве фоновых областей, как показано на рисунке 5D. Эти результаты указывают на то, что граф компонентов и модуль слияния признаков снизили доминирующую активацию текстур в оцениваемом изображении.
Результаты анализа структурного сходства одежды и эталоны дизайна
Рисунок 6 демонстрирует ранжирование результатов поиска вместе со структурными доказательствами, использованными для его интерпретации. Граф компонентов запроса на рисунке 6B фиксирует активные области одежды и их типизированные связи, в то время как матрица на рисунке 6C отображает паттерн связей, подаваемый на вход графового распространения. В базовых результатах на рисунке 6D по-прежнему преобладают признаки красного цвета. Результаты с учетом структуры на рисунке 6E сохраняют категорию одежды для верхней части тела при различных цветах и фонах. Граф компонентов наиболее высоко ранжированного результата на рисунке 6F позволяет провести прямое сравнение с графом запроса, а матрица соответствия на рисунке 6G показывает, остаются ли выровненными компоненты с одинаковыми идентификаторами после слияния с учетом структуры. Диагональное соответствие следует интерпретировать совместно с отсутствующими узлами и измененными связями графа. Сильное сходство внешнего вида при отсутствии согласованности графов не является признаком успешного структурного поиска.
Извлеченные предметы одежды сохраняют общую категорию, однако различия в конфигурации рукавов и отношениях между локальными компонентами указывают на неполное детальное соответствие. Предложенный метод достиг Recall@5 89.2% и mAP 86.4%, как указано в Таблице 3. Эти количественные показатели характеризуют эффективность ранжирования, в то время как на Рисунке 6B–G представлены промежуточные структурные данные, подтверждающие данную интерпретацию. Таким образом, вывод по результатам поиска ограничен повышенной устойчивостью к помехам от цвета фона и более строгой организацией компонентов на уровне изображения при тестируемом запросе.
Анализ отклика на структурные различия и поддержка проектирования
тепловая карта чистого разностного ответа в Рисунок 7H показывает, что доминирующий отклик сосредоточен на увеличенном силуэте нижней части тела и правой границе одежды на целевом изображении. Наложение в Рисунок 7I показывает, что наиболее сильный отклик остается согласованным с основным передним планом одежды, в то время как более слабая активация в прилегающих областях занавеса и стены сохраняется в виде остаточных фоновых помех. Пространственный отклик следует интерпретировать совместно с данными графа компонентов и матрицы, представленными в Рисунки 7C–GОтвет рассматривается как значимое структурное различие только в том случае, если область одежды с высоким уровнем отклика согласуется с изменением смежности, изменением геометрических соотношений и паттерном расстояний между компонентами после слияния.
Структурное различие признается только в том случае, если изменение типизированного смежного отношения на рисунке 7E или изменение геометрической связи на рисунке 7F сопровождается увеличением расстояния между компонентами на рисунке 7G и пространственным откликом, выровненным по переднему плану, на рисунках 7H,I. Увеличенная область нижней части тела и правая граница одежды удовлетворяют этому межэтапному критерию. Активация над занавеской и стеной не соответствует изменениям в узлах компонентов, паттернах связей или объединенном расстоянии между компонентами и, следовательно, отклоняется как неструктурная остаточная помеха. Результат подтверждает локализацию различий на уровне изображения, но не устанавливает вариации в выкройках или параметрах конструкции.
Анализ пространственного распределения признаков и структурный кластерный анализ
Анализ распределения латентного пространства признаков позволяет оценить способность модели различать структурную семантику одежды. В данном анализе проверяется, организует ли структурный априорный подход одежду с различными топологическими конфигурациями в отдельные многообразия признаков. Из тестового набора были выбраны пять репрезентативных структурных категорий: топы с коротким рукавом, брюки, юбки, длинные пальто и платья. Высокоразмерные векторы признаков были спроецированы на двумерную плоскость с помощью метода t-распределенного стохастического вложения соседей (t-SNE). Для характеристики организации структурной семантики в пространстве признаков оценивались сплоченность похожих образцов и разделение непохожих образцов. Распределение t-SNE пространства признаков, учитывающего структуру, показано на рисунке 8.
Проекция t-SNE образовала пять основных областей признаков с ограниченным перекрытием между соседними категориями, как показано на Рисунок 8AРепрезентативные образцы, соответствующие пяти категориям регионов, представлены на Рисунок 8BПоказатель SCI, равный 0,81, отражает компактность образцов с одинаковой структурной меткой, а показатель SDI, равный 0,71, отражает степень разделения образцов с разными структурными метками, как сообщается в Таблица 3 и визуализированы в Рисунок 8Данные индексы следует интерпретировать как показатели распределения в пространстве признаков; они не определяют напрямую частоту ложных срабатываний. Топы с коротким рукавом и юбки занимали разные основные области в спроецированном пространстве признаков, в то время как небольшое количество образцов оставалось вблизи границ соседних категорий, как показано на Рисунок 8AБрюки и платья также продемонстрировали четкое отделение от соседних категорий. Такое распределение указывает на то, что априорные данные графа способствовали структурной организации на уровне категорий, не приводя при этом к полному разделению кластеров. Оценка разделяет качество представления и эффективность поиска. SCI определяет, остаются ли изделия одежды с одинаковыми структурными метками компактно сгруппированными в изученном пространстве признаков, в то время как SDI определяет, остаются ли разделенными изделия одежды с разными структурными метками. Эти метрики соответствуют цели структурного представления в рамках протокола. Recall@5 измеряет, входит ли структурно релевантное изделие одежды в первые пять результатов поиска, а mAP оценивает качество ранжирования по всем релевантным образцам из галереи. Эти метрики соответствуют цели поиска по эталонному дизайну. Коэффициент силуэта использовался только для оценки качества кластеризации, поскольку SCI и SDI уже характеризуют организацию пространства признаков.
Рисунок 9 представляет необработанные результаты четырех репрезентативных методов за пять прогонов без кросс-методной нормализации. На Рисунке 9A приведены SCI и SDI в их исходном масштабе, а на Рисунке 9B — Recall@5 и mAP в процентах. Маркеры отдельных прогонов и линии стандартного отклонения демонстрируют вариативность, связанную с обучением модели, а не только совокупный рейтинг. Базовый метод, основанный на внешнем виде, достиг SCI 0,62, в то время как предложенный метод достиг SCI 0,81 и SDI 0,71 (Таблица 3 и Рисунок 9A). Результаты SCI и SDI указывают на более высокую компактность внутри меток и более выраженное разделение между метками в оцениваемых условиях. Предложенный метод достиг Recall@5 89,2% и mAP 86,4% (Таблица 3 и Рисунок 9B). Эти метрики поиска оценивают различные свойства ранжирования и интерпретируются отдельно от SCI и SDI. Стабильный порядок методов по четырем метрикам указывает на соответствие между качеством представления и эффективностью поиска, однако это не означает, что относительное улучшение идентично для всех четырех измерений оценки.
Эксперименты по абляции и анализ эффективности структурных модулей
В ходе эксперимента по абляции проводится сравнение полной модели с вариантами, в которых удален структурный априор или модуль слияния. Во всех трех конфигурациях используются одни и те же эталонные и целевые изображения, что позволяет напрямую сравнить фоновый отклик и концентрацию локализации. Вариант без структурного априора исключает граф компонентов одежды на уровне изображения и соответствующие ограничения связей, полагаясь только на сверточную основу для извлечения признаков внешнего вида; вариант без слияния сохраняет вывод графа, но удаляет пирамиду признаков, используя только семантические признаки высокого уровня. Визуализированные тепловые карты разностей раскрывают конкретную роль каждого модуля в подавлении шума и определении границ; качественное сравнение откликов структурных различий при разных конфигурациях модулей показано на Рисунке 10.
Карты отклика на рисунке 10C–E были построены с использованием общей шкалы отклика и идентичных настроек наложения. Вариант без структурного априорного знания (structure prior) демонстрировал сильную активацию в левой части фона и вокруг несвязанных областей окружающей среды, как показано на рисунке 10C. Вариант без модуля слияния (fusion module) уменьшил часть этого отклика вне области одежды, но все еще сохранял более широкое распределение по нижней части одежды и прилегающей области с правой стороны, как показано на рисунке 10D. Полная модель еще больше сосредоточила доминирующий отклик на основном переднем плане одежды, как показано на рисунке 10E. На рисунке 10F непосредственно визуализирована разница в откликах, ограниченных передним планом, между вариантом без слияния и полной моделью; видно, что полная модель подавляет остаточное боковое распространение, сохраняя при этом основной отклик, выровненный по одежде. Эти результаты указывают на то, что структурное априорное знание в основном уменьшило шум окружающей среды, а модуль слияния дополнительно улучшил концентрацию отклика и структурное выравнивание. Рисунок 10E представляет собой относительное улучшение, а не полное удаление фоновой активации.
В таблице 4 представлены значения SCI, SDI и Recall@5 для вариантов без структурного априорного знания, без модуля слияния и для полной модели. Удаление структурного априорного знания привело к снижению SCI с 0,81 до 0,65 и Recall@5 с 89,2% до 74,5%. Удаление модуля слияния привело к снижению SDI с 0,71 до 0,64 и Recall@5 с 89,2% до 85,1%, что составляет снижение на 4,1 процентных пункта. Эти результаты указывают на то, что структурное априорное знание оказывало большее влияние на структурную согласованность и поиск, в то время как слияние признаков улучшало согласование между информацией о внешнем виде и структурной информацией.
Анализ эффективности сравнивает вычислительные затраты полной модели с базовой моделью ResNet-50. Для базовой модели ResNet-50 потребовалось 25.6 миллионов параметров и 4.1 миллиарда операций с плавающей запятой. Для полной модели с учетом структурных особенностей потребовалось 29.3 миллиона параметров и 5.4 миллиарда операций с плавающей запятой. Среднее время вывода составило 15 миллисекунд на изображение для базовой модели и 22 миллисекунды на изображение для полной модели, что означает увеличение на 7 миллисекунд. Этот результат указывает на заметные вычислительные затраты, которые следует учитывать при внедрении протокола в рабочие процессы, чувствительные к времени (Таблица 5)). Вес структурного ограничения был определен на основе валидационной выборки перед окончательной тестовой оценкой. Показатель Validation Recall@5 изучался при значениях веса структурного ограничения 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 и 2.0. Для всех последующих циклов обучения и тестирования был зафиксирован вес 1.0. На Рисунке 11 показан процесс выбора веса структурного ограничения 1.0 на основе валидации.

Рисунок 1: Общий рабочий процесс протокола обучения признакам изображений одежды с учетом структуры. Входное изображение одежды обрабатывается ветвью признаков внешнего вида и ветвью структурных признаков, в которой используются семантический парсинг и пространственное графовое моделирование. Эти два представления обрабатываются модулем слияния под руководством структуры для генерации итогового признака с учетом структуры. Потери структурной согласованности, потери структурной дискриминации и потери структурных отношений совместно ограничивают пространство признаков. На рисунке показано, как внешний вид одежды и топология компонентов интегрируются в процессе обучения признакам. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 2: Построение априорной топологии компонентов одежды на уровне изображения. (A) Исходное изображение одежды I. (B) Карта визуальных компонентов P, ограниченная передним планом, в которой семь цветов обозначают области одежды на уровне изображения. Все пиксели фона исключены из каналов компонентов. (C) Граф отношений компонентов на уровне изображения G. Узлы представляют видимые области одежды, сплошные ребра обозначают общие границы переднего плана, а пунктирные связи — предопределенный вертикальный порядок. Карта и граф используются для поиска изображений и сравнения визуальных структур. Они не представляют собой детали выкройки, геометрию швов, структуру вытачек, параметры градации или инструкции по раскрою. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 3: Модуль объединения признаков под управлением структуры. Структурный признак преобразуется с помощью линейного отображения и функции активации Ψ для генерации веса структуры. Вес структуры модулирует признак внешнего вида посредством поэлементного умножения. Модулированный признак внешнего вида и структурный признак объединяются (конкатенируются) и проецируются с помощью Wc, после чего добавляется остаточный структурный признак для формирования итогового признака компонента. На рисунке показано, что структурная информация регулирует взвешивание признаков внешнего вида перед окончательным объединением. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 4: Оптимизация пространства признаков при ограничениях структурной согласованности. (A) Образцы, принадлежащие к одному структурному классу, сближаются за счет функции потерь структурной согласованности, в то время как взаимосвязи их внутренних компонентов сохраняются за счет функции потерь структурных отношений. (B) Образцы из разных структурных классов раздвигаются за счет функции потерь структурной дискриминации. На рисунке показано, как три структурные цели совместно увеличивают компактность внутри классов и разделение между классами. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в более крупном размере.

Рисунок 5: Репрезентативные ответы признаков одежды и визуализация графа компонентов. (A) Исходное изображение одежды. (B) Ответ активации классов базовой модели внешнего вида ResNet-50. (C) Граф компонентов одежды на уровне изображения был реконструирован на основе карты компонентов с ограничением по переднему плану, матрицы центров компонентов, типизированной матрицы смежности, маски неактивных узлов и отображения меток компонентов, которые были сохранены в ходе выполнения разделов 3 и 4 Протокола. Узлы обозначают активные области одежды, сплошные ребра — общие границы переднего плана, а пунктирные ребра — предопределенные отношения вертикального порядка. (D) Ответ активации объединенного представления с учетом компонентов. Сравнение демонстрирует различие между активацией, определяемой текстурой, и активацией, направляемой областями одежды. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 6: Результаты поиска и промежуточные структурные данные при наличии помех в виде красного фона. (A) Поисковое изображение. (B) Граф компонентов поискового запроса, созданный на основе сохраненных центров компонентов и типизированной матрицы смежности. (C) Типизированная матрица смежности поискового запроса, где значения матрицы разграничивают неактивные связи, общие границы переднего плана и предопределенные отношения вертикального порядка. (D) Три лучших результата поиска, полученные с помощью базового метода анализа внешнего вида. (E) Три лучших результата, полученные с помощью представления с учетом структуры. (F) Граф компонентов наилучшего результата с учетом структуры. (G) Матрица соответствия компонентов между поисковым запросом и наилучшим результатом после слияния. Высокое соответствие по диагонали указывает на согласованность компонентов с одинаковыми идентификаторами, тогда как слабые или смещенные отклики указывают на отсутствие или несоответствие организации компонентов. Результаты поиска сохраняют общую категорию верхней части тела, но не обеспечивают полного совпадения конфигурации рукавов и локальной топологии. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7: Отслеживание структурных различий от топологии одежды на уровне изображения до пространственного отклика. (A) Эталонное изображение. (B) Целевое изображение. (C) Эталонный граф компонентов. (D) Целевой граф компонентов. Оба графа реконструированы на основе сохраненных центров компонентов и типизированных матриц смежности. (E) Типизированная матрица различий смежности. (F) Различие геометрических отношений выведено из смещения центров компонентов, пространственной дисперсии и изменений веса отношений. (G) Граф различий компонентов после слияния, где интенсивность узла представляет нормализованное расстояние между соответствующими векторами слитых компонентов, а ширина ребра — изменение веса отношений. (H) Тепловая карта чистого пространственного разностного отклика, построенная с использованием той же фиксированной шкалы отклика, что и наложение. (I) Отклик, наложенный на целевое изображение. Структурное различие признается только тогда, когда изменение смежности, изменение геометрических отношений, изменение расстояния между компонентами и тепловой отклик, выровненный по переднему плану, остаются согласованными. Активация фона без соответствующих доказательств наличия компонентов или отношений рассматривается как остаточная помеха, а не как значимое различие в структуре одежды. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 8: Кластеризация в пространстве признаков с учетом структуры. (A) Проекция t-SNE для топов с коротким рукавом, брюк, юбок, длинных пальто и платьев. Пять категорий образуют основные области признаков с ограниченным перекрытием вблизи границ между ними. (B) Репрезентативные тестовые изображения, отнесенные к пяти категориям одежды, где цвет рамки соответствует цвету категории на панели (A). На рисунке показана структурная организация на уровне категорий при сохранении небольшого количества образцов вблизи областей смежных категорий. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9: Сравнение фактической производительности в зависимости от структуры пространства признаков и целей ранжирования при поиске. (A) SCI и SDI для базовой модели, основанной на внешнем виде, модели со слабой структурой, модели с явной структурой и предлагаемого метода. (B) Recall@5 и mAP для тех же четырех методов. Большие маркеры обозначают среднее арифметическое по пяти независимым запускам, линии погрешности обозначают выборочное стандартное отклонение, а малые маркеры обозначают результаты отдельных запусков. SCI и SDI отображены в фиксированном масштабе от нуля до одного, в то время как Recall@5 и mAP отображены в фиксированном процентном масштабе от нуля до ста. Нормализация min-max или перемасштабирование между методами не применялись. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 10: Ответы структурных различий при различных конфигурациях модулей. (A) Исходное изображение. (B) Целевое изображение. (C) Ответ варианта без структурного априорного знания. (D) Ответ варианта без модуля слияния. (E) Ответ полной модели. (C–E) визуализированы с использованием одной и той же нормализованной шкалы отклика, цветовой карты и настроек наложения. (F) Абсолютная разность отклика, ограниченная передним планом, между вариантом без слияния и полной моделью. Полная модель сохраняет основной отклик, выровненный по одежде, сокращая при этом остаточное рассеивание за пределами основной структурной области. Сравнение показывает, что структурное априорное знание снижает помехи вне области одежды, а модуль слияния дополнительно повышает четкость структурного отклика. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 11: Подбор веса структурного ограничения на основе валидации. Приведены значения Validation Recall@5 при весах структурного ограничения 0.1, 0.3, 0.5, 0.8, 1.0, 1.2, 1.5 и 2.0. Каждая точка обозначает среднее арифметическое по пяти запускам валидации, а каждая линия погрешности — выборочное стандартное отклонение. Перед финальной тестовой оценкой вес был зафиксирован на уровне 1.0. Данный рисунок документирует процедуру подбора параметров и не является самостоятельным архитектурным вкладом. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Таблица 1: Распределение наборов данных и статистика топологии на уровне изображений для подмножеств одежды от S1 до S5. В таблице представлены количество обучающих, валидационных, тестовых и общее количество изображений, а также среднее количество семантических компонентов, активных узлов, типизированных ребер и аннотированных ориентиров в плоскости изображения для каждого структурного уровня. Все значения сформированы на основе обработанных манифестов данных. Количество обучающих, валидационных и тестовых изображений было получено из окончательных манифестов подмножеств после структурного анализа, контроля групп дубликатов и проверки на утечку данных, в то время как статистика топологии была рассчитана по окончательным записям графов с использованием того же порядка компонентов и определений связей, которые применялись при оценке модели. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 2: Настройки вычислительной среды, конфигурации входных данных, аугментации, представления, оптимизации, функций потерь и воспроизводимости, использованные в данном протоколе. В таблице указаны точные версии операционной системы, процессора, объем установленной памяти, графического процессора, видеопамяти, графического драйвера, CUDA, cuDNN, Python, NumPy, PyTorch и torchvision, а также размер изображения, метод формирования батчей, оптимизатор, график изменения скорости обучения, количество эпох, случайные числа (seeds), размерности представления и веса структурной целевой функции. Каждое значение связано с файлами software_versions.txt, configs/protocol.yaml или соответствующей записью об обучении. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 3: Количественное сравнение моделей общего визуального представления, графовых моделей одежды и специализированных методов поиска модных изделий. В таблице представлены фокус поиска, модальность запроса, SCI, SDI, Recall@5, mAP и коэффициент силуэта для одиннадцати методов при одинаковых разбиениях данных и протоколе оценки. Каждый показатель представлен в виде среднего значения и стандартного отклонения выборки по пяти независимым запускам. Указанные значения p были получены с помощью двухсторонних парных t-критериев при сравнении каждого метода сравнения с предлагаемым методом с использованием результатов, полученных при одинаковых пяти случайных значениях seed. Предлагаемый метод принят в качестве эталонной строки. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 4: Результаты абляционного анализа для модуля структурного априорного знания и модуля слияния признаков.В таблице приведены значения SCI, SDI и Recall@5 для варианта без структурного априорного знания, варианта без модуля слияния и полной модели. Удаление структурного априорного знания приводит к более значительному снижению SCI и Recall@5, в то время как удаление модуля слияния снижает SDI и согласованность ответов. Полная модель демонстрирует самые высокие значения по всем трем метрикам. Пожалуйста, нажмите здесь, чтобы скачать этот файл.
Таблица 5: Вычислительная эффективность базовой модели ResNet-50 и полной модели с учетом структуры. В таблице указаны количество обучаемых параметров, количество операций с плавающей запятой на одно изображение и среднее время вывода на одно изображение при использовании того же аппаратного и программного обеспечения, которое задокументировано в Таблице 2 и Таблице материалов. Обе модели используют одинаковое разрешение изображений, настройки размера пакета для вывода, операции предварительной обработки и процедуру измерения времени. Полная модель добавляет 3,7 млн параметров, 1,3 млрд операций с плавающей запятой и 7 миллисекунд времени вывода на одно изображение по сравнению с базовой моделью. Пожалуйста, нажмите здесь, чтобы скачать этот файл.