Предложенная архитектура SegCycle-SPADE предназначена для реконструкции и улучшения традиционных узоров культурного наследия с помощью семантической сегментации, усиления признаков с использованием механизмов внимания, генеративной реконструкции и синтеза художественного стиля. В данном исследовании использовались общедоступные наборы данных изображений произведений искусства и культурного наследия, включая датасет Miao Batik и датасет WikiArt. В исследовании не принимали участия люди, не использовались данные пациентов, персональная информация, животные или клинические записи; следовательно, одобрение институционального комитета по этике и информированное согласие не требовались. Для начала оценки используются датасет культурных мотивов Miao Batik и датасет WikiArt. Датасет Miao Batik был описан в работе Quan et al. (2024)32 и содержит 15 148 аннотированных изображений традиционных мотивов батика мяо. Существующие аннотации, предоставленные создателями датасета, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Затем выполняется предварительная обработка изображений, включающая изменение размера, нормализацию, шумоподавление и создание маски сегментации. Точные параметры предварительной обработки описаны в подразделе «Предварительная обработка данных». В предложенной архитектуре для семантической сегментации данных используется модель на основе трансформера под названием SegFormer-B2. Этот метод разработан для обнаружения ключевых областей культурных мотивов и изучения их структур. Затем сегментированные признаки усиливаются с помощью механизма внимания, при котором важная информация, относящаяся к культурным мотивам, выделяется, а иррелевантная информация отсеивается. Конфигурация механизма внимания описана в подразделе «CAFFM». После этого усиленные признаки передаются в CycleGAN, где поврежденные структуры реконструируются посредством циклического обучения. В процессе обучения образцы неполных мотивов создавались искусственно путем применения операций случайного маскирования и частичного перекрытия к оригинальным изображениям Miao Batik. Эти процедуры деградации имитировали отсутствие областей мотивов и структурные повреждения, часто наблюдаемые в ветхих артефактах культурного наследия. Полученные неполные изображения использовались в качестве входных данных для модуля реконструкции CycleGAN, а соответствующие оригинальные изображения служили целями реконструкции. Реконструированные узоры культурного наследия затем улучшаются с помощью SPADE, где художественное усиление выполняется на основе сгенерированных карт сегментации. Эффективность предложенной архитектуры оценивается с помощью количественных метрик сегментации и качества изображений, в то время как визуальная аутентичность реконструированных культурных мотивов оценивается качественно. Визуальная аутентичность оценивалась путем визуального осмотра сгенерированных культурных узоров и не использовалась в качестве независимой количественной метрики. Оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных особенностях, структурной когерентности и художественном виде относительно соответствующих эталонных культурных мотивов. Количественная оценка производительности модели проводилась с использованием таких показателей, как точность сегментации (Segmentation Accuracy), IoU, коэффициент Дайса (Dice Coefficient), индекс структурного сходства (SSIM), пиковое отношение сигнала к шуму (PSNR) и расстояние Фреше (FID). На рисунке 2 представлена общая схема рабочего процесса предложенной архитектуры SegCycle-SPADE и обобщены метрики оценки, использованные в данном исследовании.

Рисунок 2. Общая архитектура рабочего процесса предлагаемого фреймворка SegCycle-SPADE. Обзор полного рабочего процесса SegCycle-SPADE. Изображения из наборов данных Miao Batik и WikiArt проходят предварительную обработку, после чего подвергаются семантической сегментации с помощью SegFormer-B2, усилению признаков с помощью CAFFM, реконструкции паттернов с помощью CycleGAN и генерации художественного стиля с помощью SPADE. Эффективность модели оценивается по показателям точности сегментации (Segmentation Accuracy), пересечения над объединением (IoU), коэффициента Дайса (Dice Coefficient), индекса структурного сходства (SSIM), PSNR и расстояния Фреше (FID), в то время как визуальная достоверность оценивается качественно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Фреймворк SegCycle-SPADE для реконструкции паттернов культурного наследия разработан для интеграции нескольких компонентов глубокого обучения (DL) с целью точной сегментации, реконструкции и художественного улучшения мотивов, как показано на Рисунке 2. Для обеспечения разнообразия культурных паттернов и художественных стилей используются изображения из набора данных культурных мотивов Miao Batik и набора данных WikiArt. Первоначально изображения обрабатываются с помощью модуля семантической сегментации на базе SegFormer для идентификации и выделения культурных мотивов из фона. Общая архитектура состоит из четырех основных этапов. Во-первых, модель SegFormer извлекает карты семантической сегментации из изображений культурных паттернов. Во-вторых, CAFFM объединяет признаки сегментации с генеративными представлениями для улучшения обучения признаков. В-третьих, модуль CycleGAN реконструирует культурные паттерны, используя объединенные представления признаков. Наконец, модуль SPADE генерирует художественно улучшенные результаты, сохраняя структурную целостность за счет синтеза под управлением сегментации. Уточненные карты признаков впоследствии обрабатываются модулем реконструкции CycleGAN, который обучается восстанавливать неполные культурные мотивы путем сопоставления деградировавших паттернов с их соответствующими полными формами. Образцы неполных мотивов были созданы путем применения операций случайного маскирования и частичного перекрытия к оригинальным изображениям Miao Batik, имитируя тем самым отсутствующие области паттернов и структурную деградацию, часто наблюдаемую в поврежденных культурных артефактах. Каждое деградировавшее изображение было сопоставлено с соответствующим оригинальным изображением, которое служило целью реконструкции в процессе обучения. Эта стратегия позволила модулю CycleGAN освоить восстановление отсутствующих структур мотивов при сохранении семантической согласованности и культурно значимых характеристик. Наконец, генератор SPADE создает визуально улучшенные художественные результаты, обуславливая синтез изображений сгенерированными картами сегментации, тем самым поддерживая структурную целостность культурных мотивов на протяжении всего процесса художественного улучшения.
Предлагаемая структура SegCycle-SPADE включает в себя следующие этапы.
Шаг 1: Сбор наборов данных
Для достижения целей по изучению культурных паттернов и генерации художественных стилей использовались два набора данных. Набор данных культурных мотивов мяо-батика (Miao Batik Cultural Motif Dataset) использовался для получения информации о традиционных культурных паттернах. Данный набор данных общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658) и содержит 15 148 аннотированных изображений традиционных мотивов мяо-батика. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Набор данных WikiArt использовался для получения разнообразной информации о художественных стилях для генерации художественного стиля и был получен из общедоступного репозитория WikiArt (https://www.wikiart.org/).
Шаг 2: Предобработка данных
Все изображения прошли предобработку, включающую изменение размера, нормализацию и шумоподавление. Для поддержки этапа семантической сегментации использовались имеющиеся аннотации культурных мотивов, полученные из первоначальных источников набора данных. В рамках данного исследования дополнительные процедуры аннотирования или перемаркировки не проводились.
Шаг 3: Семантическая сегментация паттернов с помощью SegFormer
Для сегментации культурных мотивов использовалась модель SegFormer. Точные характеристики архитектуры (backbone) и стратегия инициализации SegFormer описаны в подразделе Семантическая сегментация паттернов с помощью SegFormer. В частности, для семантической сегментации мотивов применялась архитектура SegFormer-B2 с базовой моделью MIT-B2, предобученной на ImageNet. Данная модель эффективно фиксирует глобальную контекстную информацию, сохраняя при этом сложные структурные детали традиционных культурных паттернов.
Шаг 4: CAFFM
CAFFM объединяет признаки семантической сегментации с генеративными представлениями, что позволяет архитектуре изучать как характеристики структурных мотивов, так и информацию о художественном стиле. Подробности интеграции CAFFM приведены в подразделе CAFFM. Данный модуль расположен между этапом семантической сегментации на базе SegFormer и этапом генеративной реконструкции; в нем происходит слияние структурных признаков, полученных в результате сегментации, с признаками реконструкции посредством многоголового перекрестного внимания (multi-head cross-attention). Этот процесс улучшает сохранность культурных мотивов и повышает реалистичность реконструированных результатов.
Шаг 5: Реконструкция паттернов (CycleGAN)
Объединенные признаки затем обрабатываются модулем CycleGAN для реконструкции структур культурных паттернов. Архитектура CycleGAN и конфигурация обучения описаны в подразделе Реконструкция паттернов с помощью CycleGAN. Модуль реконструкции состоит из двух генераторов и двух дискриминаторов, использует архитектуру генератора на базе остаточной сети с девятью остаточными блоками, применяет дискриминатор PatchGAN и обучается с использованием состязательных потерь и потерь циклической согласованности. Такая конфигурация обеспечивает двунаправленное отображение доменов и способствует реконструкции неполных структур культурных паттернов.
Шаг 6: Генерация художественного стиля (SPADE)
Затем реконструированные паттерны обрабатываются модулем SPADE для синтеза художественного стиля с использованием сегментации. Конфигурация генератора SPADE описана в подразделе Artistic Style Generation Using SPADE. В модуле используются остаточные блоки SPADE, слои пространственно-адаптивной нормализации и семантическое обусловливание, полученное из карт сегментации SegFormer и функциональных представлений CAFFM. Благодаря обусловливанию генерации изображений на основе карт сегментации, синтезированные результаты сохраняют структурное соответствие оригинальным культурным мотивам, при этом включая характеристики художественного стиля.
Шаг 7: Оценка эффективности
Предложенная структура была оценена с помощью нескольких метрик сегментации и оценки качества изображений, включая точность сегментации (Segmentation Accuracy), IoU, коэффициент сходства Дайса (Dice), SSIM, PSNR и FID. Для оценки воспроизводимости экспериментов все опыты повторяли пять раз с использованием различных случайных значений seed, результаты представлены как среднее значение ± стандартное отклонение. Статистическая значимость оценивалась с помощью парного t-критерия с порогом значимости p < 0.05.
Сбор наборов данных
В предлагаемой структуре SegCycle-SPADE для понимания культурных паттернов и обучения стилям используются два набора данных. Первым набором данных, применяемым в предлагаемой структуре, является набор данных культурных мотивов батика народа мяо. Этот набор содержит культурные мотивы батика мяо, которые представляют собой изображения традиционного батика мяо с такими элементами, как животные, растения и геометрические фигуры, используемые в искусстве этнической группы мяо. Данный набор содержит изображения с богатой текстурной информацией, что в целом важно для сохранения культурного наследия. Вторым набором данных, используемым в предлагаемой структуре SegCycle-SPADE, является набор данных WikiArt. Этот набор содержит огромное количество произведений искусства, выполненных в различных стилях. Он применяется для обучения сложным стилям, что обычно полезно для улучшения художественных произведений. Данный набор состоит из 80 000 произведений искусства в высоком разрешении (HD) с 27 различными вариантами дизайна, что делает его более эффективным для задач генерации или трансформации стиля на основе глубокого обучения (DL).
Набор данных Miao Batik:
Набор данных Miao Batik (https://doi.org/10.5281/zenodo.20807658) включает 15 148 изображений узоров батика с культурно значимыми мотивами. Изображения содержат разнообразные традиционные дизайны, такие как анималистические мотивы (например, бабочки и рыбы), растительные орнаменты и геометрические мотивы, несущие культурный символизм. Данный набор данных является важным компонентом предлагаемой структуры, поскольку он предоставляет аутентичные культурные структуры, которые позволяют модулю сегментации точно определять и сохранять границы мотивов в процессе реконструкции узора (Таблица 1). В данном исследовании под культурно значимыми мотивами понимаются символические визуальные элементы, часто описываемые в литературе по культурному наследию народа мяо и представленные в аннотациях набора данных, включая птиц, бабочек, цветочные узоры и тотемы предков. Эти мотивы были выбраны на основании их документально подтвержденной культурной значимости и частого присутствия в традиционном батике и вышивке мяо, а не только исходя из частоты их появления или пространственной композиции. Аннотации мотивов и метки сегментации, созданные под руководством экспертов, были получены из исходного источника набора данных Miao Batik и использовались в данном исследовании напрямую. Авторы не проводили дополнительного ручного аннотирования, перемаркировки или процедур аннотирования под руководством экспертов. Существующие аннотации, предоставленные создателями набора данных, использовались для обучения и оценки семантической сегментации.
| Параметр | Описание |
| Название набора данных | Набор данных культурных узоров батика народа мяо |
| Источник набора данных | Репозиторий Zenodo (DOI: 10.5281/zenodo.20807658) |
| Область | Нематериальное культурное наследие (НКН) / Анализ текстильных орнаментов |
| Общее количество изображений | 15 148 изображений |
| Тип изображения | Цифровые изображения традиционных узоров текстиля батик народа мяо |
| Категории паттернов | Зооморфные мотивы, растительные мотивы и геометрические мотивы |
| Культурное происхождение | культура этнической группы мяо, провинция Гуйчжоу, Китай |
| Разрешение исходного изображения | Изображения высокого разрешения (обычно ≥ 1000 пикселей по короткой стороне), полученные в виде необработанных сканов или фотографий до проведения предварительной обработки |
| Разрешающая способность обучения | Изображения масштабированы до 256 × 256 пикселей в процессе предварительной обработки |
| Доступность аннотаций | Существующие аннотации сегментации, предоставленные создателями набора данных, использовались для обучения и оценки без изменений. В данном исследовании не проводилось дополнительное ручное аннотирование, перемаркировка или процедуры экспертного подтверждения. |
| Применение в данном исследовании | Сегментация культурных мотивов, извлечение признаков, сохранение мотивов и реконструкция паттернов |
Таблица 1: Характеристики набора данных культурных узоров батика народа мяо. Сводные данные набора культурных мотивов батика мяо, использованного для семантической сегментации, анализа культурных узоров и реконструкции мотивов. В таблице описаны источник набора данных, характеристики изображений, категории мотивов, культурное происхождение, разрешение изображений и роль набора данных в предлагаемой структуре SegCycle-SPADE.
Набор данных WikiArt:
Набор данных WikiArt [https://www.wikiart.org/] представляет собой популярный крупномасштабный цифровой репозиторий произведений искусства, который включает более 80 000 изображений, относящихся к 27 различным художественным стилям в Таблица 2Стили включают искусство Ренессанса, импрессионизм, кубизм и сюрреализм. Данный набор данных играет важную роль в предлагаемой структуре, так как он предоставляет знания, которые позволяют модулю SPADE создавать культурно обогащенные паттерны при сохранении структурной информации, полученной в процессе сегментации. Набор данных состоит из 56 000 изображений для обучения и 12 000 изображений для валидации и тестирования. Изображения в этом наборе данных способствуют эффективному обучению модели глубокого обучения.
| Параметр | Описание |
| Название набора данных | Набор данных WikiArt |
| Источник набора данных | Репозиторий WikiArt (https://www.wikiart.org/) |
| Область применения | Цифровое искусство и живопись |
| Общее количество изображений | Приблизительно 80 000 произведений искусства |
| Обучающие изображения | 56,000 |
| Валидационные изображения | 12,000 |
| Тестовые изображения | 12,000 |
| Художественные стили | 27 художественных стилей, включая Ренессанс, импрессионизм, кубизм, сюрреализм, экспрессионизм, реализм и абстрактное искусство |
| Разрешение исходного изображения | Исходное разрешение изображений варьируется в зависимости от произведений искусства и источников. В ходе предобработки изображения были приведены к единому разрешению 256 × 256 пикселей. |
| Разрешающая способность обучения | В процессе предварительной обработки перед обучением художественному стилю и синтезом изображений с использованием сегментации изображения были изменены до размера 256 × 256 пикселей. |
| Разбиение набора данных | Стратифицированное случайное разделение (70% — обучающая, 15% — валидационная и 15% — тестовая выборки) с использованием фиксированного случайного числа (seed) 42 |
| Стратегия семплирования стилей | Для сохранения распределения 27 художественных стилей в обучающей, валидационной и тестовой подвыборках использовался метод стратифицированного пропорционального отбора. |
| Применение в данном исследовании | Обучение художественному стилю, представление стиля и художественный синтез с использованием сегментации |
Таблица 2: Характеристики набора данных WikiArt. Сводка по набору данных WikiArt, использованному для обучения художественному стилю и синтеза изображений с учетом стиля. В таблице описаны источник набора данных, распределение изображений, охват художественных стилей, разделение набора данных, разрешение изображений и его применение в рамках предлагаемой структуры SegCycle-SPADE.
Набор данных Miao Batik содержит 15 148 изображений, представляющих традиционные культурные мотивы народа мяо.32 Набор данных общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658). Перед обучением модели все изображения прошли визуальный осмотр, были приведены к размеру 256 × 256 пикселей, нормализованы и проверены на наличие поврежденных или дублирующих образцов. В результате контроля качества ни одно изображение не было исключено; таким образом, все 15 148 изображений были сохранены для последующего анализа. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) подвыборки с использованием фиксированного случайного числа (seed) 42 для обеспечения воспроизводимости разделения данных. Набор данных WikiArt был получен из официального репозитория WikiArt (https://www.wikiart.org/) и содержит более 80 000 произведений искусства, охватывающих 27 художественных стилей. Для экспериментов по изучению стилей 56 000 изображений использовались для обучения, 12 000 — для валидации и 12 000 — для тестирования.
Предобработка данных
Перед обучением предлагаемой структуры SegCycle-SPADE набор данных культурных мотивов Мяо Батик и набор данных WikiArt прошли несколько этапов предобработки для обеспечения единообразного качества изображений и точного представления признаков. К обоим наборам данных был применен один и тот же базовый конвейер предобработки, включающий гауссово шумоподавление, нормализацию, изменение размера до согласованного входного разрешения и проверку качества изображений. Однако наборы данных выполняли разные роли в рамках структуры. Набор данных WikiArt использовался для изучения и синтеза художественного стиля, тогда как набор данных Мяо Батик использовался преимущественно для сегментации и реконструкции культурных мотивов. Помимо этих специфических задач, никаких изменений в предобработке для конкретных наборов данных не вносилось. Для обеспечения согласованности обработки моделью DL изображения сначала были приведены к фиксированному разрешению. Этот шаг был необходим, так как изображения в обоих наборах данных имели разное разрешение в зависимости от источника. Изменение размера повысило вычислительную эффективность и предотвратило влияние размерных несоответствий на процесс обучения. Вторым этапом предобработки была нормализация, при которой значения пикселей были масштабированы до стандартного диапазона для стабилизации обновления градиентов во время обучения. Затем изображения обрабатывались с помощью фильтра Гаусса для уменьшения шума, который мог бы исказить структуры культурных мотивов. Для набора данных Мяо Батик существующие маски сегментации культурных мотивов, полученные непосредственно из исходного источника набора данных, использовались без изменений для обучения и оценки семантической сегментации. Новые маски сегментации специально для данного исследования не создавались.
Если не указано иное, уравнения, описывающие общепринятые методы, были адаптированы из предыдущих исследований и соответствующим образом процитированы. Уравнения, описывающие предлагаемый метод CAFFM и комбинированную структуру оптимизации SegCycle-SPADE, были разработаны авторами специально для данного исследования.
Пусть входное изображение из набора данных будет представлено в виде Уравнения 1:
(1)
Здесь H, W и C обозначают высоту, ширину изображения и количество цветовых каналов соответственно. Все изображения масштабируются до фиксированного размера H′ × W′, как показано в Уравнении 2:

Здесь Ir — это изображение с измененным размером. Нормализованные значения пикселей вычисляются в соответствии с Уравнением 3:
(3)
Это способствует стабилизации процедуры обучения. Фильтрация шума выполняется с использованием фильтра Гаусса, как показано в уравнении 4:

Здесь G(σ) — гауссовский фильтр, а * обозначает операцию свертки. Использовался гауссовский фильтр с ядром 5 × 5 и стандартным отклонением σ = 1.0. Для уменьшения краевых артефактов к граничным пикселям применялось зеркальное дополнение (reflective padding). Процесс шумоподавления выполнялся сразу после загрузки изображений, до их масштабирования и нормализации. Для обеспечения единообразия предварительной обработки во всем исследовании одна и та же конфигурация фильтра применялась к каждому изображению в наборах данных Miao Batik и WikiArt. Для набора данных Miao Batik маски сегментации создаются в соответствии с Уравнением 5:

Здесь M — это маска сегментации, используемая для управления моделью SegFormer.
Конвейер предварительной обработки начинается со сбора изображений из набора данных Miao Batik и набора данных WikiArt, как показано на Рисунке 3. Во время обучения методы аугментации данных не применялись. После предварительной обработки, которая включала изменение размера, нормализацию, гауссово шумоподавление и подготовку масок сегментации, изображения использовались напрямую для обучения, валидации и тестирования предложенной архитектуры SegCycle-SPADE. Первым этапом конвейера предварительной обработки является изменение размера изображений до фиксированного значения, что позволяет модели DL обрабатывать изображения более эффективно. Вторым этапом является нормализация, которая преобразует значения пикселей в стандартизированный числовой диапазон и способствует сходимости модели. Третий этап включает удаление шума, при котором изображения очищаются от нежелательных помех для улучшения распознавания образов. Кроме того, для набора данных Miao Batik аннотируются области культурных мотивов, что позволяет генерировать маски, используемые в модуле сегментации предложенной модели для обеспечения сохранности культурных мотивов в процессе генерации. Конечным результатом этого этапа является чистый набор данных, готовый для обучения модулей сегментации и генерации предложенной модели.

Рисунок 3. Конвейер предварительной обработки изображений объектов культурного наследия. Схема, иллюстрирующая процедуры предварительной обработки изображений, применяемые перед обучением модели. Конвейер включает сбор набора данных, изменение размера изображений, нормализацию, гауссово шумоподавление, аннотирование существующих культурных мотивов и подготовку масок сегментации. Полученные обработанные изображения и маски используются в качестве входных данных для семантической сегментации и реконструкции паттернов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Перед обучением модели каждое изображение прошло процесс контроля качества. Набор данных Miao Batik содержал 15 148 изображений. Поврежденные, дублированные и низкокачественные образцы были предварительно обработаны создателями исходного набора данных, поэтому в ходе данного исследования при проверке качества дополнительные изображения не исключались. Следовательно, для анализа были сохранены все 15 148 изображений. На этапе предобработки изображения загружались в формате RGB и масштабировались до 256 × 256 пикселей с использованием билинейной интерполяции. Значения пикселей были масштабированы из диапазона [0, 255] в диапазон [0, 1] путем деления на 255. Затем была выполнена поканальная нормализация с использованием средних значений [0.485, 0.456, 0.406] и значений стандартного отклонения [0.229, 0.224, 0.225] для красного, зеленого и синего каналов соответственно. Конвейер предобработки включал загрузку изображений, преобразование в RGB, изменение размера, масштабирование значений пикселей, нормализацию и преобразование в тензоры. При необходимости изображения в градациях серого преобразовывались в трехканальный формат RGB для обеспечения совместимости с моделями глубокого обучения (DL). После предобработки изображения были разделены на обучающую, валидационную и тестовую выборки. На всех этапах работы фреймворка SegCycle-SPADE, включая семантическую сегментацию, слияние признаков, реконструкцию мотивов и художественный синтез на основе SPADE, использовалось единое входное разрешение 256 × 256 пикселей.
Семантическая сегментация паттернов с использованием SegFormer
После этого этапа предварительной обработки очищенные и нормализованные изображения из набора данных культурных мотивов Мяо Батик и набора данных WikiArt подаются в модуль семантической сегментации, основанный на предлагаемой архитектуре SegFormer-B2. Целью данного этапа является правильная идентификация и разделение культурных мотивов, присутствующих в традиционных паттернах. Предложенная архитектура SegFormer базируется на трансформерной архитектуре, которая включает иерархический энкодер-трансформер и легковесный MLP-декодер для точного захвата как глобальной контекстуальной информации, так и детальной структурной информации сложных традиционных паттернов. Сначала модель извлекает представления признаков на нескольких масштабах из входного изображения, после чего эти представления объединяются с помощью декодера для генерации точных сегментированных паттернов. Это обеспечивает правильную сегментацию паттернов на традиционном изображении по таким мотивам, как геометрические, растительные и символические узоры, отделяя их от фона при сохранении их структурной целостности. Полученная структурная информация впоследствии используется на более поздних этапах генерации паттернов в рамках архитектуры SegCycle-SPADE.
Пусть предварительно обработанное входное изображение будет представлено как Уравнение 6:
(6)
Энкодер SegFormer разделяет изображение на патчи и извлекает иерархические признаки с помощью слоев трансформера, как показано в Уравнении 71:

Здесь F обозначает многомасштабные карты признаков, полученные из трансформерного кодировщика. Эти признаки кодируют как локальные текстурные паттерны, так и глобальные контекстуальные связи между областями мотивов. Модель SegFormer извлекает карты признаков в разных масштабах, как определено в Уравнении 8:

Использование многомасштабных представлений облегчает обнаружение паттернов различных размеров в культурных мотивах. Наконец, признаки объединяются с помощью MLP-декодера, как показано в Уравнении 91:

Здесь S обозначает итоговую прогнозируемую карту сегментации.
Базовая сеть SegFormer-B2 была инициализирована с использованием весов, предварительно обученных на ImageNet, и впоследствии дообучена на наборе данных Miao Batik для сегментации культурных мотивов. Контрольная точка предобученной модели была получена из официальной реализации SegFormer. В частности, для инициализации базовой сети SegFormer-B2 перед дообучением использовалась контрольная точка MIT-B2 (mit_b2.pth), предобученная на ImageNet-1K и предоставленная официальным репозиторием SegFormer. Предобученные веса соответствуют базовой сети MIT-B2, выпущенной авторами SegFormer, и служили моделью инициализации для обучения семантической сегментации. Остальные слои, специфичные для конкретной задачи, перед началом обучения были инициализированы с использованием стандартных процедур инициализации весов PyTorch.
В архитектуре используется четырехстадийный иерархический кодировщик Transformer с перекрывающимися эмбеддингами патчей. На начальном этапе размер патча был установлен на 7 × 7 с шагом 4. Для каждой из четырех стадий кодировщика размерности эмбеддингов составляли 64, 128, 320 и 512. На этих четырех стадиях использовалось 1, 2, 5 и 8 голов многоголового самовнимания (multihead self-attention), а соответствующая глубина кодировщика составляла 3, 4, 6 и 3 слоя. Многомасштабные признаки, полученные из кодировщика, объединялись с помощью легковесного декодера на базе MLP. Перед созданием итоговой карты сегментации декодер проецировал признаки с каждой стадии кодировщика в единое пространство эмбеддингов. Во всех блоках Transformer использовалась функция активации GELU (Gaussian Error Linear Unit). Для улучшения обобщающей способности и снижения переобучения в процессе обучения использовалась вероятность дропаута (dropout rate) 0.1.
На этапе обучения платформа SegFormer получает предварительно обработанные изображения из обоих наборов данных. Изображения из набора данных Miao Batik содержат области мотивов, которые служат метками для контролируемого обучения модели сегментации. Трансформерный энкодер обрабатывает всё изображение и фиксирует дальние связи между его компонентами, что особенно важно для традиционных узоров батика с пространственно распределенными мотивами. Механизм иерархического извлечения признаков одновременно фиксирует локальные структуры, такие как повторяющиеся геометрические текстуры. MLP-декодер обрабатывает эти извлеченные признаки и формирует маску сегментации, выделяющую области мотивов. Карты сегментации, созданные на этом этапе, впоследствии используются в качестве структурных входных данных для модуля внимания и этапа реконструкции паттернов, что способствует сохранению аутентичности генерируемых узоров.
Культурные мотивы были разделены на различные классы для семантической сегментации в соответствии с их визуальными и культурными характеристиками. Таксономия сегментации включала анималистические мотивы (например, бабочек, рыб, птиц и другую символическую фауну), растительные мотивы (например, цветы, листья, лозы и ботанические узоры), геометрические мотивы (например, повторяющиеся фигуры, бордюры и абстрактные геометрические структуры), а также области фона, представляющие зоны без мотивов. Маски сегментации на уровне пикселей использовались для присвоения каждому пикселю одного из предопределенных классов. Целочисленные метки были закодированы следующим образом: Метка 0 = фон, Метка 1 = анималистические мотивы, Метка 2 = растительные мотивы и Метка 3 = геометрические мотивы. Аннотации сегментации и метки мотивов были получены непосредственно из первоначального источника набора данных Miao Batik. В данном исследовании не проводилось дополнительного ручного аннотирования, перемаркировки, проверки границ или процедур экспертного подтверждения. Существующие аннотации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки.
Модель SegFormer для сегментации культурных мотивов обрабатывает предварительно обработанные изображения из наборов данных Miao Batik и WikiArt, используя механизм на основе трансформера для точного обнаружения областей с культурными узорами, как показано на рисунке 4. Сначала в модель SegFormer подается входное изображение, содержащее традиционные культурные мотивы. Энкодер Transformer извлекает из фрагментов изображения как глобальную контекстную информацию, так и локальные структурные признаки. Полученные многомасштабные признаки передаются в декодер сегментации, который использует смешанную сеть прямого распространения (Mix Feed-Forward Network) для уточнения представлений признаков и улучшения обнаружения мотивов. Результатом работы модели SegFormer является маска сегментации, которая выделяет пиксели, соответствующие культурным узорам, подавляя при этом нерелевантную информацию фона. Выделенные культурные узоры затем служат структурным руководством для последующих этапов работы архитектуры SegCycle-SPADE.

Рисунок 4. Семантическая сегментация культурных мотивов на основе SegFormer-B2. Архитектура модуля семантической сегментации SegFormer-B2, используемого для извлечения культурных мотивов и обученного исключительно на наборе данных Miao Batik. Структура состоит из кодировщика на базе Transformer для многомасштабного извлечения признаков и облегченного декодера сегментации для генерации масок мотивов. Модель предсказывает четыре семантических класса — животные, растения, геометрические фигуры и фон, при этом результирующие маски сегментации определяют области культурно значимых мотивов, подавляя иррелевантную информацию о фоне. Результаты этой сегментации служат структурным руководством для последующих этапов слияния признаков, реконструкции и художественного синтеза в предлагаемой структуре SegCycle-SPADE. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
В предлагаемой структуре нет необходимости создавать новые аннотации сегментации. Набор данных Miao Batik был получен из уже существующего открытого источника, а модель обучалась с использованием соответствующей информации о мотивах, предоставленной создателями набора данных. В процессе обучения модель SegFormer генерировала карты семантической сегментации. В результате в данном исследовании не потребовалось использование дополнительного программного обеспечения для ручной аннотации, разработка руководств по аннотированию или внедрение процедур контроля качества аннотаций.
CAFFM
Для улучшения взаимодействия между признаками семантической сегментации и представлениями генеративной реконструкции в исследовании также был предложен модуль CAFFM. Энкодер SegFormer-B2 передает семантические карты признаков в модуль CAFFM, в то время как этап реконструкции CycleGAN обеспечивает генеративные карты признаков. Сначала используются слои линейной проекции для отображения обоих потоков признаков в общее пространство вложений. Для вычисления перекрестного внимания (cross-attention) с использованием сгенерированных тензоров признаков создаются представления запроса (Q), ключа (K) и значения (V). Затем с помощью многоголового перекрестного внимания моделируются взаимосвязи между информацией о структурных мотивах и элементами художественного стиля. После этого к объединенным представлениям признаков применяются нормализация слоя, остаточные связи и полносвязные слои с активацией GELU. Этап синтеза на базе SPADE получает выходные данные модуля CAFFM, что позволяет сохранить культурно значимые темы без ущерба для художественной целостности.
Для обеспечения совместимости признаков входные признаки сначала проецируются с помощью слоев линейной проекции в общее пространство эмбеддингов с размерностью эмбеддинга 256. Взаимосвязи между семантической структурной информацией и репрезентациями генеративного стиля затем моделируются с помощью механизма MultiHead Cross-Attention с восемью головками внимания. Вычисление перекрестного внимания (cross-attention) использует векторы запроса (Query, Q), ключа (Key, K) и значения (Value, V), которые создаются специальными слоями линейного преобразования. Для повышения стабильности обучения и сохранения целостности признаков используются остаточные связи (residual connections) и нормализация слоев (Layer Normalization) для дальнейшего улучшения объединенных репрезентаций признаков. Нелинейное обучение признаков затем совершенствуется путем применения сети прямого распространения с функцией активации GELU (Gaussian Error Linear Unit). Модуль генерирует выходную репрезентацию признаков размерности 256, которая передается на другие этапы для творческого синтеза. CAFFM успешно объединяет данные о художественном стиле со структурами культурных мотивов, используя метод слияния на основе перекрестного внимания, что улучшает сохранность мотивов и визуальную целостность реконструированных узоров культурного наследия.
В предлагаемой системе структурные признаки извлекаются из набора данных Miao Batik, в то время как стилистические признаки изучаются на основе набора данных WikiArt. Пусть карта признаков, полученная с помощью сети сегментации SegFormer с использованием изображений из набора данных Miao Batik, будет обозначена как Fs, а карта признаков, полученная из ветви извлечения стилистических признаков с использованием изображений WikiArt, — как Fa. Предложенный модуль CAFFM объединяет два домена признаков с помощью механизма перекрестного внимания (cross-attention) для изучения как структурных, так и стилистических зависимостей культурных узоров. В Таблице 3 приведены все архитектурные характеристики, включая размерности эмбеддингов, слои нормализации, функции активации и конфигурацию голов внимания. Для входного изображения размером 256 × 256 пикселей энкодер SegFormer-B2 генерировал семантические карты признаков размером 64 × 64 × 128, а ветвь извлечения стилистических признаков — карты признаков размером 64 × 64 × 128. Обе карты признаков проецировались через обучаемые линейные слои в общее пространство эмбеддингов размерностью 256 перед слиянием посредством перекрестного внимания.
| Параметр | Конфигурация |
| Предлагаемая концепция | SegCycle-SPADE |
| Модель семантической сегментации | SegFormer-B2 |
| Стадии энкодера SegFormer | 4 |
| Инициализация весов | Предобученная на ImageNet-1K модель SegFormer-B2 (опорная сеть MIT-B2) |
| Источник контрольной точки | Официальный репозиторий NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); контрольная точка: segformer.b2.512x512.ade.160k |
| Стратегия тонкой настройки | Сквозная тонкая настройка на наборе данных Miao Batik |
| Размер эмбеддинга патча | 7 × 7 |
| Шаг патча | 4 |
| Размерности эмбеддингов | 64, 128, 320 и 512 |
| Глубина кодировщика | 3, 4, 6 и 3 |
| Головы внимания | 1, 2, 5 и 8 |
| Тип декодера | Декодер на базе MLP |
| Функция активации | GELU (линейный единичный модуль с ошибкой Гаусса) |
| Доля выбывших | 0.1 |
| Модуль улучшения признаков | Модуль слияния культурных признаков на основе перекрестного внимания (CAFFM) |
| Размерность вложения CAFFM | 256 |
| Механизмы внимания CAFFM | 8 |
| Шкалы слияния CAFFM | 4 |
| Модель реконструкции | CycleGAN |
| Модель генерации стиля | SPADE |
| Культурный набор данных | Набор данных батика народа мяо |
| Набор данных по стилям | Набор данных WikiArt |
| Изображения батика народа мяо | 15,148 |
| Изображения WikiArt | Приблизительно 80 000 |
| Разрешение входного изображения | 256 × 256 пикселей |
| Формат цвета | RGB |
| Метод интерполяции | Билинейная интерполяция |
| Метод шумоподавления | Гауссова фильтрация |
| Размер ядра Гаусса | 5 × 5 |
| Сигма (σ) распределения Гаусса | 1 |
| Диапазон нормализации | [0, 1] |
| Размер серии | 16 |
| Количество эпох | 100 |
| Оптимизатор | Адам |
| Скорость обучения | 0.0002 |
| Параметры Adam | β₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, weight decay = 0 |
| Функции потерь | функция потерь при сегментации, адверсариальная функция потерь, функция потерь циклической согласованности, функция потерь при реконструкции, функция потерь при сохранении мотивов и функция потерь при согласованности стиля |
| Стратегия разделения набора данных | Обучение / Валидация / Тестирование |
| Обучающая выборка | 70% |
| Валидационный набор | 15% |
| Тестовый набор | 15% |
| Случайное число (Seed) | 42 |
| Метрики оценки | Точность сегментации, IoU, коэффициент Дайса, SSIM, PSNR и FID |
| Язык программирования | Python 3.8.10 |
| Фреймворк глубокого обучения | PyTorch 1.10.0 |
| Аппаратная платформа | ГП NVIDIA RTX 3090 (24 ГБ видеопамяти), Intel Core i7 (11-го поколения), 32 ГБ оперативной памяти |
| Рабочая среда | Ubuntu 20.04 LTS |
Таблица 3: Экспериментальная установка и конфигурация модели. Сводка архитектурных компонентов, конфигурации обучения, настроек предобработки, наборов данных, параметров оптимизации, метрик оценки и вычислительной среды, использованных для реализации и оценки предлагаемой структуры SegCycle-SPADE.
Модуль внимания сначала отображает карту признаков в представления запроса, ключа и значения с помощью Уравнения 10:

Здесь Втq, Wки Wv представляют собой обучаемые матрицы весов. Веса внимания рассчитываются на основе сходства между вектором запроса и вектором ключа с помощью Уравнение 1117:

Здесь, дк является размерностью вектора ключей. Улучшенное представление признаков вычисляется путем перемножения весов внимания с матрицей значений с помощью Уравнение 12:

Здесь Fa представляет собой улучшенное представление признаков карты признаков. Улучшенное представление признаков вычисляется путем объединения исходных признаков сегментации с улучшенными признаками, полученными с помощью механизма внимания согласно Уравнению 13:
Здесь Fe — это улучшенная карта признаков, используемая для реконструкции паттерна. CAFFM расширен многомасштабным механизмом перекрестного внимания для извлечения признаков культурных мотивов в разных масштабах. Пусть Fsi обозначает признаки сегментации в масштабе i, а Faj — признаки художественного стиля в том же масштабе. Итоговое представление признаков определяется с помощью Уравнения 14:

Здесь Qi, Ki и Vi представляют собой матрицы запросов (query), ключей (key) и значений (value) на масштабе i соответственно, а N обозначает количество масштабов признаков. В данном исследовании N = 4, что соответствует картам признаков, извлеченным при пространственных разрешениях 1/4, 1/8, 1/16 и 1/32 от размера входного изображения. Эти многомасштабные представления признаков объединялись с использованием обучаемых весов внимания перед реконструкцией и художественным синтезом. Приведенное выше расширение позволяет методу извлекать глобальные культурные мотивы и текстуры для реконструкции культурных узоров. Модуль CAFFM расположен между этапом сегментации на базе SegFormer и этапом креативного синтеза на базе SPADE в предлагаемой системе SegCycle-SPADE. Сначала, в то время как CycleGAN одновременно создает признаки реконструкции со стилистической и паттерн-зависимой информацией, SegFormer-B2 восстанавливает семантические карты признаков, описывающие структурные свойства культурных мотивов. Модуль CAFFM принимает эти два потока признаков и использует слияние на основе перекрестного внимания (cross-attention) для выявления взаимосвязей между структурными и художественными представлениями. Затем полученные объединенные карты признаков направляются в модуль SPADE для креативного синтеза под управлением сегментации, чтобы создать культурно аутентичные узоры при сохранении семантической согласованности и структурных особенностей.
Реконструкция узоров с помощью CycleGAN
После завершения этапа усиления признаков на основе механизма внимания карты признаков будут содержать усиленные структуры культурных мотивов. Однако на картах признаков все еще могут присутствовать неполные или поврежденные области узоров. Следовательно, для решения проблемы реконструкции узоров в предлагаемой архитектуре будет использоваться модель CycleGAN. В данной архитектуре двумя доменами будут являться оригинальные узоры культурных мотивов и реконструированные узоры культурных мотивов. Используя усиленные признаки с предыдущих этапов, модель CycleGAN восстановит культурные узоры, сохраняя при этом структурную целостность. Это гарантирует сохранение пространственного расположения таких элементов, как геометрические, цветочные и символические узоры. Оригинальные изображения батика народа мяо подвергались операциям случайного маскирования и частичного перекрытия для создания неполных или поврежденных культурных мотивов. Эти процедуры деградации имитировали отсутствие фрагментов узора и структурные повреждения, часто наблюдаемые в изношенных объектах культурного наследия. Деградированные изображения использовались в качестве входных данных для модуля реконструкции, а соответствующие оригинальные изображения служили эталонами для оценки эффективности и качества реконструкции. Такая стратегия позволила модели изучить восстановление недостающих структур мотивов при сохранении семантической согласованности и культурных особенностей.
Пусть X будет областью неполных культурных паттернов, а Y — областью реконструированных культурных паттернов. Два генератора обучаются выполнять двунаправленное отображение с использованием Уравнения 15:

Здесь GE используется для реконструкции структур мотивов, а FM — для отображения паттернов обратно на исходный домен. Состязательная функция потерь используется для того, чтобы реконструированные паттерны были реалистичными (Уравнение 16)30

Здесь DY — это дискриминатор, используемый для разграничения реальных и реконструированных паттернов, а GE(x) обозначает сгенерированный реконструированный паттерн. CycleGAN также обеспечивает циклическую согласованность для сохранения структурного расположения культурных мотивов (Уравнение 17)30.

Итоговая функция потерь определяется с помощью Уравнение 1830:

Здесь λi обозначает весовой коэффициент функции потерь циклической согласованности (cycle-consistency loss); в ходе обучения он был установлен на уровне 10, что соответствует оригинальной формулировке CycleGAN. Данное значение было выбрано для обеспечения баланса между состязательным обучением и согласованностью реконструкции между исходным и целевым доменами.
Модуль реконструкции CycleGAN состоит из двух генераторов и двух дискриминаторов для двунаправленного преобразования изображений. Каждый генератор построен на архитектуре остаточной сети (residual network), включающей начальный сверточный слой 7 × 7, за которым следуют два сверточных слоя понижения размерности (downsampling), девять остаточных блоков и два слоя повышения размерности (upsampling). Во всех операциях свертки используется размер ядра 3 × 3, за исключением входного слоя, где для улучшенного извлечения признаков применяется ядро 7 × 7. После каждого сверточного слоя применяется нормализация экземпляров (Instance Normalization) для повышения стабильности обучения, а во всей сети генератора используется функция активации ReLU. В выходном слое применяется функция активации Tanh для генерации нормализованных выходных изображений. Дискриминатор построен на архитектуре PatchGAN 70 × 70, состоящей из серии сверточных слоев с размером ядра 4 × 4 и прогрессивно увеличивающимся количеством каналов признаков. В дискриминаторе используются нормализация экземпляров и активация LeakyReLU (отрицательный наклон = 0.2) для улучшения дискриминации признаков и состязательного обучения. Модуль CycleGAN получает на вход предварительно обработанные изображения культурных мотивов и генерирует реконструированные представления паттернов, которые затем передаются в CAFFM для интеграции с признаками сегментации. Обучение CycleGAN проводилось с использованием оптимизатора Adam (β₁ = 0.5, β₂ = 0.999) с начальной скоростью обучения 0.0002. Скорость обучения поддерживалась постоянной в течение первых 100 эпох, после чего линейно снижалась до нуля на протяжении оставшегося периода обучения. Для стабилизации обучения дискриминатора использовался буфер воспроизведения (replay buffer), содержащий 50 ранее сгенерированных изображений. Обновление генераторов и дискриминаторов происходило с соотношением 1:1, при этом в каждой итерации обучения за одним обновлением генератора следовало одно обновление дискриминатора.
Процесс реконструкции в CycleGAN основан на улучшенных картах признаков, полученных с помощью механизма CAFFM, представленного на Рисунке 5. Карты признаков содержат усиленные культурные мотивы, полученные на предыдущих этапах сегментации и CAFFM. Эти карты признаков используются в качестве входных данных для первого генератора GE. Первый генератор GE изучает отображение, необходимое для реконструкции культурных паттернов. Затем выходные данные подаются на дискриминатор DY для разграничения реальных культурных паттернов и реконструированных. Дискриминатор DY помогает генератору GE создавать реалистичные результаты. Чтобы культурные паттерны не искажались в процессе реконструкции, второй генератор FM выполняет циклическое согласованное отображение (cycle-consistency mapping). Второй генератор FM отображает выходные данные обратно в исходную область. Затем результаты оцениваются дискриминатором для проверки их реалистичности. Итоговые выходные данные впоследствии передаются в модуль SPADE для генерации художественного стиля на следующем этапе предлагаемой структуры SegCycle-SPADE.

Рисунок 5. Схема реконструкции узоров на базе CycleGAN. Рабочий процесс модуля реконструкции CycleGAN. В качестве входных данных в сеть генератора подаются представления признаков с усиленным вниманием для реконструкции неполных культурных мотивов. Дискриминатор оценивает реконструированные результаты по отношению к эталонным узорам, в то время как отображение с циклической согласованностью сохраняет структурную целостность при двунаправленном преобразовании изображений. Реконструированные мотивы затем направляются в модуль SPADE для синтеза художественного стиля. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Генерация художественного стиля с использованием SPADE
Впоследствии реконструированные культурные мотивы подвергаются обработке модулем SPADE для генерации художественного стиля. Основная цель модуля SPADE заключается в добавлении более визуально насыщенных текстур художественного стиля к реконструированным культурным мотивам без ущерба для их структурного расположения. Модуль SPADE представляет собой метод условной генерации изображений, использующий концепцию сегментации изображений для создания новых изображений. Многоканальные семантические карты, соответствующие заранее определенным классам мотивов, были закодированы на основе масок семантической сегментации, полученных с помощью SegFormer-B2. Генератор SPADE получал эти закодированные карты в качестве условий. Параметры пространственно-адаптивного масштабирования (γ) и смещения (β) формировались путем обработки семантических карт через сверточные слои внутри каждого слоя SPADE. Таким образом, генератор мог сохранять границы мотивов, структурное расположение и семантическую информацию в процессе художественного синтеза, применяя эти параметры к нормализованным активациям признаков. Семантическое руководство могло влиять как на высокоуровневую структурную реконструкцию, так и на низкоуровневый синтез текстур, поскольку процесс кондиционирования осуществлялся на нескольких слоях генератора SPADE. В результате созданные художественные паттерны объединили в себе стилистические черты, полученные из набора данных WikiArt, при сохранении структур культурных мотивов, выявленных на этапе сегментации.
Набор данных WikiArt, включающий работы из 27 различных художественных категорий, таких как Ренессанс, импрессионизм, кубизм, экспрессионизм, сюрреализм, реализм и абстрактное искусство, использовался в качестве основного ресурса для анализа художественных стилей. Для ознакомления модели с разнообразными творческими особенностями и улучшения обобщения стиля в процессе обучения изображения стилей выбирались случайным образом из различных категорий. Чтобы уменьшить смещение в сторону определенных стилей, набор данных был разделен на обучающую, валидационную и тестовую подвыборки с сбалансированным представлением художественных категорий. Для обеспечения равного представительства всех 27 художественных категорий использовался стратифицированный отбор. Образцы из каждой категории пропорционально распределялись по обучающей, валидационной и тестовой подвыборкам с сохранением исходного распределения классов. Модуль CAFFM применялся для объединения стилистических аспектов, извлеченных из изображений WikiArt, с признаками реконструкции, созданными CycleGAN. Чтобы сеть синтеза могла переносить художественные качества, сохраняя при этом семантическую структуру и границы культурных мотивов, полученные из карт сегментации, итоговые объединенные представления подавались в качестве обуславливающей информации в генератор SPADE. Благодаря этому методу обуславливания стиля предложенная архитектура смогла создавать культурно аутентичные художественные паттерны с согласованными структурными и стилистическими представлениями.
SPADE также вводит пространственно-адаптивные параметры, которые зависят от карты сегментации. Параметры могут быть определены следующим образом, как показано в Уравнении 191:

Здесь γ(S) представляет собой пространственно-изменяющийся параметр масштаба, а β(S) — пространственно-изменяющийся параметр смещения. Эти параметры помогают генератору создавать различные текстуры и стили в зависимости от семантической области на изображениях. Итоговое произведение культурного искусства может быть определено следующим образом, как показано в Уравнении 20:

Здесь GE — генератор SPADE, XrP — реконструированный паттерн, а SM — карта сегментации. Конечная работа сохраняет структурную целостность культурных мотивов, одновременно улучшая художественный вид. Для оптимизации предлагаемой архитектуры SegCycle-SPADE была использована комбинированная функция потерь, которая балансирует точность семантической сегментации, сохранение культурных мотивов, качество реконструкции паттерна и согласованность художественного стиля. Общая цель обучения была установлена с помощью взвешенной смеси потерь сегментации (Lseg), состязательных потерь (Ladv), потерь циклической согласованности (Lcycle), потерь реконструкции (Lrecon), потерь сохранения мотивов (Lmotif) и потерь согласованности стиля (Lstyle). Общая функция потерь определена в уравнении 21:
(21)
Для обеспечения структурного соответствия между входными и реконструированными культурными мотивами коэффициент функции потерь циклической согласованности был установлен на уровне 10. Для сохранения детализированных признаков мотивов и повышения визуальной точности коэффициент потерь при реконструкции был установлен на уровне 5. Чтобы подчеркнуть сохранение культурно значимых структурных паттернов в процессе художественного синтеза, для функции потерь сохранения мотивов был использован коэффициент 2. В целях содействия переносу художественного стиля без чрезмерного искажения семантических структур мотивов коэффициент потерь согласованности стиля был скорректирован до 1. Для поддержания сбалансированного вклада между созданием реалистичного изображения и точной сегментацией мотивов функциям потерь при сегментации и состязательным потерям были присвоены равные веса. Для расчета потерь согласованности стиля использовались стилевые представления на основе признаков из набора данных WikiArt. В частности, характеристики художественного стиля фиксировались с помощью корреляций матриц Грама, полученных из карт глубоких признаков. Разность норм Фробениуса между матрицами Грама целевого стилевого изображения и сгенерированного изображения использовалась для расчета потерь стиля, как показано в уравнении 22:

Здесь, Gл вычисляется ли матрица Грама на основе лth слой объектов, Iген обозначает сгенерированное художественное изображение, Iстиль обозначает целевое изображение стиля из набора данных WikiArt, и F обозначает норму Фробениуса. Такая формулировка позволяет предложенной архитектуре сохранять художественные особенности, поддерживая при этом структурную и семантическую целостность культурных мотивов.
Объединенные представления признаков, полученные модулем CAFFM, используются в качестве обусловливающих входных данных для модуля SPADE, который выполняет функцию компонента художественного синтеза в предлагаемой архитектуре. Генератор SPADE состоит из семи остаточных блоков SPADE с размерностью латентных признаков 256 каналов и генерирует выходные изображения с разрешением 256 × 256 пикселей. Карты семантической сегментации, полученные с помощью модуля SegFormer–CAFFM, используются в качестве обусловливающих входных данных на всех остаточных слоях SPADE. Слои SPADE применяются перед функциями активации внутри каждого остаточного блока, что обеспечивает семантическое обусловливание под управлением сегментации. Посредством последовательных операций повышения дискретизации (апсэмплинга) и свертки латентное представление признаков постепенно уточняется для создания художественных паттернов высокого разрешения при сохранении семантической согласованности и структуры мотивов. В генераторе повсеместно используются функции активации LeakyReLU, а на выходном слое применяется функция активации Tanh для получения нормализованных изображений.
Алгоритм и рабочий процесс
Фреймворк SegCycle-SPADE интегрирует семантическую сегментацию, слияние признаков, реконструкцию паттернов и синтез художественного стиля в рамках единого конвейера обучения. Рабочий процесс начинается со сбора и предобработки набора данных, включая изменение размера изображений, нормализацию, шумоподавление и подготовку масок сегментации. Предобработанные изображения затем обрабатываются с помощью сети сегментации SegFormer-B2 для извлечения семантических представлений мотивов. Полученные признаки сегментации объединяются с признаками реконструкции через CAFFM, что обеспечивает взаимодействие между структурной информацией о мотивах и представлениями художественных признаков. Объединенные карты признаков затем подаются в модуль реконструкции CycleGAN, который восстанавливает неполные структуры культурных мотивов, сохраняя при этом семантическую согласованность. Реконструированные паттерны впоследствии передаются генератору SPADE для направленного сегментацией художественного синтеза, что позволяет улучшить стилистику при сохранении границ мотивов и структурной аутентичности. В процессе обучения параметры модели оптимизируются с помощью комбинированной функции потерь, описанной в уравнениях 21 и 22, которая балансирует точность сегментации, сохранность мотивов, качество реконструкции и согласованность художественного стиля. Подробный пошаговый процесс реализации, включая загрузку набора данных, предобработку, инициализацию модели, итерации обучения, процедуры валидации, выбор контрольных точек и окончательную оценку, представлен в дополнительном файле 1 (Алгоритм 1). Полный алгоритмический процесс был реализован с размером пакета 16, скоростью обучения 0.0002 и 100 эпохами обучения. Для разделения набора данных, инициализации модели и всех экспериментов по обучению использовалось фиксированное случайное число (seed) 42. Это число последовательно применялось в генераторах случайных чисел Python, NumPy и PyTorch для обеспечения воспроизводимости. Оптимизатор Adam был настроен с параметрами β₁ = 0.5, β₂ = 0.999 и без затухания весов (weight decay = 0). Контрольные точки модели выбирались на основе самого высокого показателя IoU, достигнутого на валидационном наборе данных.
Оптимизация функции потерь
Для сохранения структур культурных мотивов в процессе реконструкции и художественного синтеза в предлагаемой архитектуре используется комбинированная цель оптимизации, объединяющая потери сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля. Полная математическая формулировка, весовые коэффициенты и определение потерь стиля приведены в Уравнениях 21 и 22 в подразделе Artistic Style Generation using SPADE. Компонент сохранения мотивов штрафует структурные отклонения между предсказанными областями мотивов и соответствующими масками сегментации эталонных данных, тем самым способствуя сохранению культурно значимых структур паттернов на протяжении всего процесса реконструкции.