$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Предложенная архитектура SegCycle-SPADE разработана для реконструкции и улучшения традиционных орнаментов культурного наследия посредством семантической сегментации, усиления признаков с помощью механизмов внимания, генеративной реконструкции и синтеза художественного стиля. В данном исследовании использовались общедоступные наборы данных изображений культурного наследия и произведений искусства, включая набор данных Miao Batik и набор данных WikiArt. В исследовании не принимали участия люди, не использовались данные пациентов, личная информация, животные или клинические записи; следовательно, одобрение институционального комитета по этике и информированное согласие не требовались. Для начала оценки используются набор данных культурных мотивов Miao Batik и набор данных WikiArt. Набор данных Miao Batik был описан в работе Quan et al. (2024)32 и содержит 15 148 аннотированных изображений традиционных мотивов батика народа мяо. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Затем выполняется предобработка изображений, включающая изменение размера, нормализацию, шумоподавление и создание маски сегментации. Точные параметры предобработки описаны в подразделе «Предобработка данных». В предлагаемой архитектуре для семантической сегментации данных используется модель на основе трансформера под названием SegFormer-B2. Этот метод предназначен для обнаружения ключевых областей культурных мотивов и изучения их структур. Затем сегментированные признаки усиливаются с помощью механизма внимания, при котором важная информация, связанная с культурными мотивами, выделяется, а нерелевантная информация отсеивается. Конфигурация механизма внимания описана в подразделе CAFFM. Затем усиленные признаки передаются в CycleGAN, где поврежденные структуры реконструируются посредством циклического обучения. В процессе обучения образцы неполных мотивов создавались искусственно путем применения операций случайного маскирования и частичного перекрытия к оригинальным изображениям Miao Batik. Эти процедуры деградации имитировали отсутствие фрагментов мотивов и структурные повреждения, часто наблюдаемые в ветхих артефактах культурного наследия. Полученные неполные изображения использовались в качестве входных данных для модуля реконструкции CycleGAN, в то время как соответствующие оригинальные изображения служили целями реконструкции. Затем реконструированные орнаменты культурного наследия улучшаются с помощью SPADE, где художественное усиление выполняется на основе сгенерированных карт сегментации. Эффективность предлагаемой архитектуры оценивается с использованием количественных метрик сегментации и качества изображений, в то время как визуальная аутентичность реконструированных культурных мотивов оценивается качественно. Визуальная аутентичность оценивалась путем визуального осмотра сгенерированных культурных орнаментов и не использовалась в качестве независимой количественной метрики. Оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных особенностях, структурной целостности и художественном виде относительно соответствующих эталонных культурных мотивов. Количественная оценка производительности модели проводилась с использованием таких показателей, как точность сегментации (Segmentation Accuracy), IoU, коэффициент Дайса (Dice Coefficient), индекс структурного сходства (SSIM), пиковое отношение сигнала к шуму (PSNR) и расстояние Фреше-Инсепшн (FID). На рисунке 2 представлена общая схема рабочего процесса предлагаемой архитектуры SegCycle-SPADE и обобщены метрики оценки, использованные в данном исследовании.

Рисунок 2. Общая архитектура рабочего процесса предлагаемого фреймворка SegCycle-SPADE. Обзор полного рабочего процесса SegCycle-SPADE. Изображения из наборов данных Miao Batik и WikiArt проходят предварительную обработку, после чего подвергаются семантической сегментации с помощью SegFormer-B2, усилению признаков с помощью CAFFM, реконструкции паттернов с помощью CycleGAN и генерации художественного стиля с помощью SPADE. Эффективность модели оценивается с использованием показателей точности сегментации (Segmentation Accuracy), пересечения над объединением (Intersection over Union, IoU), коэффициента Дайса (Dice Coefficient), индекса структурного сходства (Structural Similarity Index Measure, SSIM), PSNR, расстояния Фреше-Инцепции (Fréchet Inception Distance, FID), в то время как визуальная достоверность оценивается качественно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Система SegCycle-SPADE для реконструкции паттернов культурного наследия разработана для интеграции нескольких компонентов глубокого обучения (DL) с целью точной сегментации, реконструкции и художественного улучшения мотивов, как показано на Рисунке 2. Для обеспечения разнообразия культурных паттернов и художественных стилей используются изображения из набора данных культурных мотивов Miao Batik и набора данных WikiArt. На начальном этапе изображения обрабатываются модулем семантической сегментации на базе SegFormer для идентификации и выделения культурных мотивов из фона. Общая архитектура состоит из четырех основных этапов. Во-первых, модель SegFormer извлекает карты семантической сегментации из изображений культурных паттернов. Во-вторых, CAFFM объединяет признаки сегментации с генеративными представлениями для улучшения обучения признакам. В-третьих, модуль CycleGAN реконструирует культурные паттерны, используя объединенные представления признаков. Наконец, модуль SPADE создает художественно улучшенные результаты, сохраняя структурную согласованность посредством синтеза под руководством сегментации. Уточненные карты признаков впоследствии обрабатываются модулем реконструкции CycleGAN, который обучается восстанавливать неполные культурные мотивы путем сопоставления деградированных паттернов с их соответствующими полными формами. Образцы неполных мотивов были созданы путем применения операций случайного маскирования и частичного перекрытия к исходным изображениям Miao Batik, что позволило имитировать отсутствующие области паттерна и структурную деградацию, часто наблюдаемую в поврежденных культурных артефактах. Каждое деградированное изображение было сопоставлено с соответствующим исходным изображением, которое служило целью реконструкции во время обучения. Эта стратегия позволила модулю CycleGAN изучить восстановление отсутствующих структур мотивов при сохранении семантической согласованности и культурно значимых характеристик. В завершение генератор SPADE создает визуально улучшенные художественные результаты, обуславливая синтез изображений сгенерированными картами сегментации, тем самым поддерживая структурную целостность культурных мотивов на протяжении всего процесса художественного улучшения.
Предлагаемая структура SegCycle-SPADE включает в себя следующие этапы.
Шаг 1: Сбор наборов данных
Для достижения целей изучения культурных паттернов и генерации художественных стилей использовались два набора данных. Набор данных культурных мотивов мяо-батика (Miao Batik Cultural Motif Dataset) использовался для получения информации о традиционных культурных паттернах. Данный набор данных находится в открытом доступе через Zenodo (https://doi.org/10.5281/zenodo.20807658) и содержит 15 148 аннотированных изображений традиционных мотивов мяо-батика. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Набор данных WikiArt использовался для получения разнообразной информации о художественных стилях для генерации стиля и был получен из общедоступного репозитория WikiArt (https://www.wikiart.org/).
Шаг 2: Предобработка данных
Все изображения прошли предобработку, включавшую изменение размера, нормализацию и шумоподавление. Для поддержки этапа семантической сегментации использовались существующие аннотации культурных мотивов, полученные из первоначальных источников набора данных. В рамках данного исследования дополнительные процедуры аннотирования или перемаркировки не проводились.
Шаг 3: Семантическая сегментация паттернов с помощью SegFormer
Для сегментации культурных мотивов использовалась модель SegFormer. Точный базовый уровень (backbone) SegFormer и стратегия инициализации описаны в подразделе Семантическая сегментация паттернов с помощью SegFormer. В частности, для семантической сегментации мотивов применялась архитектура SegFormer-B2 с базовым уровнем MIT-B2, предварительно обученным на ImageNet. Эта модель эффективно улавливает глобальную контекстную информацию, сохраняя при этом сложные структурные детали традиционных культурных паттернов.
Шаг 4: CAFFM
CAFFM объединяет признаки семантической сегментации с генеративными представлениями, что позволяет системе изучать как характеристики структурных мотивов, так и информацию о художественном стиле. Подробности интеграции CAFFM приведены в подразделе CAFFM. Модуль расположен между этапом семантической сегментации на базе SegFormer и этапом генеративной реконструкции; здесь он объединяет структурные признаки, полученные в результате сегментации, с признаками реконструкции с помощью многоголового перекрестного внимания (multi-head cross-attention). Этот процесс улучшает сохранение культурных мотивов и повышает реалистичность реконструированных результатов.
Шаг 5: Реконструкция паттерна (CycleGAN)
Затем объединенные признаки обрабатываются модулем CycleGAN для реконструкции структур культурных паттернов. Архитектура CycleGAN и конфигурация обучения описаны в подразделе Реконструкция паттернов с использованием CycleGAN. Модуль реконструкции состоит из двух генераторов и двух дискриминаторов, использует архитектуру генератора на основе остаточных сетей с девятью остаточными блоками, применяет дискриминатор PatchGAN и обучается с использованием состязательных потерь и потерь циклической согласованности. Такая конфигурация обеспечивает двунаправленное отображение доменов и способствует реконструкции неполных структур культурных паттернов.
Шаг 6: Генерация художественного стиля (SPADE)
Затем реконструированные паттерны обрабатываются модулем SPADE для выполнения синтеза художественного стиля с использованием сегментации. Конфигурация генератора SPADE описана в подразделе Artistic Style Generation Using SPADE. Модуль использует остаточные блоки SPADE, слои пространственно-адаптивной нормализации и семантическое кондиционирование, полученное из карт сегментации SegFormer и признаковых представлений CAFFM. Благодаря кондиционированию генерации изображения по картам сегментации, синтезированные результаты сохраняют структурное соответствие исходным культурным мотивам, при этом включая характеристики художественного стиля.
Шаг 7: Оценка эффективности
Предложенная архитектура была оценена с использованием нескольких метрик сегментации и оценки качества изображений, включая точность сегментации (Segmentation Accuracy), IoU, коэффициент сходства Дайса (Dice), SSIM, PSNR и FID. Для проверки воспроизводимости результатов все эксперименты повторяли пять раз с использованием различных случайных значений (random seeds); результаты представлены в виде среднего значения ± стандартного отклонения. Статистическая значимость оценивалась с помощью парного t-критерия с порогом значимости p < 0.05.
Сбор наборов данных
В предлагаемой структуре SegCycle-SPADE для понимания культурных паттернов и изучения стилей используются два набора данных. Первый набор данных, применяемый в предлагаемой структуре, — это набор данных культурных мотивов батика мяо. Этот набор данных содержит культурные мотивы батика мяо, которые в основном представляют собой изображения традиционного батика мяо с такими мотивами, как животные, растения и геометрические фигуры, используемые в искусстве этнической группы мяо. Данный набор содержит изображения с богатой текстурной информацией, что в целом важно для сохранения культурного наследия. Вторым набором данных, используемым в предлагаемой структуре SegCycle-SPADE, является набор данных WikiArt. Этот набор содержит огромное количество произведений искусства, относящихся к различным стилям. Он применяется для изучения сложных стилей, что обычно полезно для улучшения художественных работ. Этот набор данных включает 80 000 произведений искусства в формате HD с 27 различными вариантами оформления, что делает его более эффективным для задач генерации или трансформации стилей на основе глубокого обучения (DL).
Набор данных Miao Batik:
Набор данных Miao Batik (https://doi.org/10.5281/zenodo.20807658) состоит из 15 148 изображений узоров батика, изображающих культурно значимые мотивы. Изображения включают разнообразные традиционные дизайны, такие как анималистические мотивы (например, бабочки и рыбы), растительные орнаменты и геометрические мотивы, несущие культурный символизм. Данный набор данных является важным компонентом предлагаемой структуры, поскольку он предоставляет аутентичные культурные структуры, которые позволяют модулю сегментации точно определять и сохранять границы мотивов при реконструкции узора (Таблица 1). В данном исследовании под культурно значимыми мотивами понимаются символические визуальные элементы, часто описываемые в литературе по культурному наследию народа мяо и представленные в аннотациях набора данных, включая птиц, бабочек, цветочные узоры и родовые тотемы. Эти мотивы были выбраны на основании их задокументированной культурной значимости и повторяющегося присутствия в традиционном батике и вышивке мяо, а не только на основании частоты их появления или пространственной композиции. Аннотации мотивов и метки сегментации, подготовленные под руководством экспертов, были получены из первоначального источника набора данных Miao Batik и использовались в данном исследовании напрямую. Авторами не проводилось дополнительное ручное аннотирование, перемаркировка или процедуры аннотирования под руководством экспертов. Существующие аннотации, предоставленные создателями набора данных, использовались для обучения и оценки семантической сегментации.
| Параметр | Описание |
| Название набора данных | Miao Batik Cultural Pattern Dataset |
| Источник набора данных | Репозиторий Zenodo (DOI: 10.5281/zenodo.20807658) |
| Область применения | Нематериальное культурное наследие (НКН) / анализ текстильных орнаментов |
| Общее количество изображений | 15,148 изображений |
| Тип изображений | Цифровые изображения традиционных текстильных орнаментов батика народа мяо |
| Категории орнаментов | Зооморфные, флоральные и геометрические мотивы |
| Культурное происхождение | Этническая культура мяо, провинция Гуйчжоу, Китай |
| Исходное разрешение изображений | Изображения высокого разрешения (обычно ≥ 1,000 пикселей по короткой стороне), полученные в виде необработанных сканов или фотографий до предварительной обработки |
| Разрешение для обучения | Изображения, масштабированные до 256 × 256 пикселей в процессе предварительной обработки |
| Наличие аннотаций | Существующие аннотации сегментации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки. В данном исследовании дополнительные процедуры ручной аннотации, перемаркировки или экспертного подтверждения не проводились. |
| Применение в данном исследовании | Сегментация культурных мотивов, извлечение признаков, сохранение мотивов и реконструкция орнаментов |
Таблица 1: Характеристики набора данных культурных узоров мяо-батик. Обзор набора данных культурных мотивов мяо-батик, использованного для семантической сегментации, анализа культурных узоров и реконструкции мотивов. В таблице описаны источник набора данных, характеристики изображений, категории мотивов, культурное происхождение, разрешение изображений и роль набора данных в рамках предложенной структуры SegCycle-SPADE.
Набор данных WikiArt:
Набор данных WikiArt [https://www.wikiart.org/] представляет собой популярный крупномасштабный цифровой репозиторий произведений искусства, который включает более 80 000 изображений, относящихся к 27 различным художественным стилям, представленным в Таблице 2. Эти стили включают искусство Ренессанса, импрессионизм, кубизм и сюрреализм. Данный набор данных имеет большое значение для предлагаемой архитектуры, поскольку он предоставляет знания, которые позволяют модулю SPADE создавать культурно обогащенные паттерны, сохраняя при этом структурную информацию, полученную в процессе сегментации. Набор данных состоит из 56 000 изображений для обучения и 12 000 изображений для валидации и тестирования. Изображения из этого набора данных способствуют эффективному обучению модели глубокого обучения (DL).
| Параметр | Описание |
| Название набора данных | Набор данных WikiArt |
| Источник набора данных | Репозиторий WikiArt (https://www.wikiart.org/) |
| Область | Цифровое искусство и живопись |
| Общее количество изображений | Приблизительно 80 000 произведений искусства |
| Обучающие изображения | 56,000 |
| Валидационные изображения | 12,000 |
| Тестовые изображения | 12,000 |
| Художественные стили | 27 художественных стилей, включая Ренессанс, импрессионизм, кубизм, сюрреализм, экспрессионизм, реализм и абстрактное искусство |
| Разрешение исходного изображения | Разрешение исходных изображений варьировалось в зависимости от произведений искусства и источников. Изображения были приведены к единому разрешению 256. × 256 пикселей в процессе предварительной обработки. |
| Разрешение обучения | Изображения изменены до размера 256 × 256 пикселей в ходе предварительной обработки перед обучением художественному стилю и синтезом изображений с использованием сегментационного руководства. |
| Разбиение набора данных | Стратифицированное случайное разбиение (70% — обучающая, 15% — валидационная и 15% — тестовая выборки) с использованием фиксированного значения seed 42 для генератора случайных чисел |
| Стратегия выборки стилей | Для сохранения распределения 27 художественных стилей в обучающей, валидационной и тестовой подвыборках использовался метод стратифицированного пропорционального отбора. |
| Применение в данном исследовании | Изучение художественного стиля, представление стиля и художественный синтез с использованием сегментации |
Таблица 2: Характеристики набора данных WikiArt. Сводные данные о наборе данных WikiArt, использованном для изучения художественного стиля и синтеза изображений с заданным стилем. В таблице описаны источник набора данных, распределение изображений, охват художественных стилей, разделение данных, разрешение изображений и применение набора данных в рамках предлагаемой архитектуры SegCycle-SPADE.
Набор данных Miao Batik содержит 15 148 изображений, представляющих традиционные культурные мотивы народа мяо.32 Набор данных общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658). Перед обучением модели все изображения прошли визуальный осмотр, были приведены к размеру 256 × 256 пикселей, нормализованы и проверены на наличие поврежденных или дублирующих образцов. Скрининг контроля качества не привел к исключению каких-либо изображений; таким образом, все 15 148 изображений были сохранены для последующего анализа. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) подвыборки с использованием фиксированного случайного зерна 42 для обеспечения воспроизводимости разделения данных. Набор данных WikiArt был получен из официального репозитория WikiArt (https://www.wikiart.org/) и содержит более 80 000 произведений искусства, охватывающих 27 художественных стилей. Для экспериментов по изучению стиля 56 000 изображений использовались для обучения, 12 000 — для валидации и 12 000 — для тестирования.
Предобработка данных
Перед обучением предлагаемого фреймворка SegCycle-SPADE набор данных культурных мотивов мяо-батика и набор данных WikiArt прошли несколько этапов предобработки для обеспечения однообразного качества изображений и точного представления признаков. К обоим наборам данных был применен один и тот же базовый конвейер предобработки, включающий гауссово шумоподавление, нормализацию, изменение размера до единого входного разрешения и проверку качества изображений. При этом наборы данных выполняли разные функции в рамках фреймворка. Набор данных WikiArt использовался для изучения и синтеза художественного стиля, тогда как набор данных мяо-батика применялся преимущественно для сегментации и реконструкции культурных мотивов. Помимо этих ролей, специфичных для конкретных задач, никаких дополнительных изменений в предобработке наборов данных не вносилось. Чтобы обеспечить единообразную обработку моделью глубокого обучения (DL), изображения сначала были приведены к фиксированному разрешению. Этот шаг был необходим, так как изображения в обоих наборах данных имели разное разрешение в зависимости от источника. Изменение размера повысило вычислительную эффективность и предотвратило влияние размерных несоответствий на процесс обучения. Вторым этапом предобработки была нормализация, при которой значения пикселей были масштабированы до стандартного диапазона для стабилизации обновления градиентов во время обучения. Затем изображения обрабатывались с помощью гауссовой фильтрации для уменьшения шума, который мог исказить структуру культурных мотивов. Для набора данных мяо-батика существующие маски сегментации культурных мотивов, полученные непосредственно из оригинального источника набора данных, использовались без изменений для обучения и оценки семантической сегментации. Специально для данного исследования новые маски сегментации не создавались.
Если не указано иное, уравнения, описывающие общепринятые методы, были адаптированы из предыдущих исследований и процитированы соответствующим образом. Уравнения, описывающие предлагаемый метод CAFFM и комплексную оптимизационную структуру SegCycle-SPADE, были разработаны авторами специально для данного исследования.
Пусть входное изображение из набора данных будет представлено в виде Уравнения 1:
(1)
Здесь H, W и C обозначают высоту, ширину изображения и количество цветовых каналов соответственно. Все изображения масштабируются до фиксированного размера H′ × W′, как показано в Уравнении 2:

Здесь Ir — изображение с измененным размером. Нормализованные значения пикселей вычисляются согласно уравнению 3:
(3)
Это способствует стабилизации процедуры обучения. Фильтрация шума выполняется с использованием фильтра Гаусса, как показано в уравнении 4:

Здесь G(σ) — фильтр Гаусса, а * обозначает операцию свертки. Был использован гауссово ядро размером 5 × 5 со стандартным отклонением σ = 1.0. Для уменьшения краевых артефактов к граничным пикселям применялось зеркальное дополнение (reflective padding). Процесс шумоподавления выполнялся сразу после загрузки изображений, до масштабирования и нормализации. Для обеспечения единообразия предварительной обработки во всем исследовании одна и та же конфигурация фильтра применялась к каждому изображению в наборах данных Miao Batik и WikiArt. Для набора данных Miao Batik маски сегментации создаются в соответствии с Уравнением 5:

Здесь M — это маска сегментации, используемая для управления моделью SegFormer.
Конвейер предварительной обработки начинается со сбора изображений из набора данных Miao Batik и набора данных WikiArt, как показано на рисунке 3. В процессе обучения методы аугментации данных не применялись. После предварительной обработки, которая включала изменение размера, нормализацию, гауссово шумоподавление и подготовку масок сегментации, изображения непосредственно использовались для обучения, валидации и тестирования предлагаемой структуры SegCycle-SPADE. Начальный этап конвейера предварительной обработки включает изменение размера изображений до фиксированного значения, что позволяет модели глубокого обучения обрабатывать изображения более эффективно. Вторым этапом является нормализация, которая преобразует значения пикселей в стандартизированный числовой диапазон и способствует сходимости модели. Третий этап включает удаление шума, в ходе которого изображения очищаются от нежелательных помех для улучшения распознавания паттернов. Кроме того, для набора данных Miao Batik аннотируются области с культурными мотивами, что позволяет генерировать маски, используемые в модуле сегментации предлагаемой модели для обеспечения сохранности культурных мотивов в процессе генерации. Конечным результатом этого этапа является очищенный набор данных, готовый для обучения модулей сегментации и генерации предлагаемой модели.

Рисунок 3. Конвейер предварительной обработки данных для изображений культурного наследия. Схема рабочих процессов, иллюстрирующая процедуры предварительной обработки изображений, применяемые перед обучением модели. Конвейер включает сбор набора данных, изменение размера изображений, нормализацию, гауссово шумоподавление, использование существующих аннотаций культурных мотивов и подготовку масок сегментации. Полученные обработанные изображения и маски используются в качестве входных данных для семантической сегментации и реконструкции паттернов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Перед обучением модели каждое изображение прошло процесс контроля качества. Датасет Miao Batik содержал 15 148 изображений. Поврежденные, дублирующие и низкокачественные образцы были удалены создателями исходного датасета; поэтому в ходе данного исследования в процессе контроля качества дополнительные изображения не исключались. Следовательно, для анализа были сохранены все 15 148 изображений. На этапе предобработки изображения загружались в формате RGB и масштабировались до размера 256 × 256 пикселей с помощью билинейной интерполяции. Значения пикселей были масштабированы из диапазона [0, 255] в диапазон [0, 1] путем деления на 255. Затем была выполнена поканальная нормализация с использованием средних значений [0.485, 0.456, 0.406] и значений стандартного отклонения [0.229, 0.224, 0.225] для красного, зеленого и синего каналов соответственно. Конвейер предобработки включал загрузку изображений, преобразование в RGB, изменение размера, масштабирование значений пикселей, нормализацию и преобразование в тензор. При необходимости изображения в градациях серого преобразовывались в трехканальный формат RGB для обеспечения совместимости с моделями DL. После предобработки изображения были разделены на обучающую, валидационную и тестовую выборки. На всех этапах работы архитектуры SegCycle-SPADE — включая семантическую сегментацию, слияние признаков, реконструкцию мотивов и художественный синтез на основе SPADE — использовалось единое входное разрешение 256 × 256 пикселей.
Семантическая сегментация паттернов с использованием SegFormer
После этого этапа предварительной обработки очищенные и нормализованные изображения из набора данных культурных мотивов Мяо-Батик и набора данных WikiArt подаются в модуль семантической сегментации, основанный на предложенной архитектуре SegFormer-B2. Целью этого этапа является правильная идентификация и разделение культурных мотивов, присутствующих в традиционных паттернах. Предложенная архитектура SegFormer основана на трансформерной архитектуре, которая включает иерархический кодировщик Transformer и легковесный декодировщик MLP для точного захвата как глобальной контекстной информации, так и детальной структурной информации из сложных традиционных паттернов. Сначала модель извлекает представления признаков на нескольких масштабах из входного изображения, после чего эти представления объединяются с помощью декодировщика для генерации точных сегментированных паттернов. Это обеспечивает правильную сегментацию паттернов на традиционном изображении на такие мотивы, как геометрические, растительные и символические узоры, отделяя их от фона при сохранении структурной целостности. Данная структурная информация впоследствии используется на более поздних этапах генерации паттернов в рамках архитектуры SegCycle-SPADE.
Пусть предварительно обработанное входное изображение будет представлено в виде уравнения 6:
(6)
Энкодер SegFormer разделяет изображение на патчи и извлекает иерархические признаки с помощью трансформерных слоев, как показано в Уравнении 71:

Здесь F обозначает многомасштабные карты признаков, полученные из трансформерного энкодера. Эти признаки кодируют как локальные текстурные паттерны, так и глобальные контекстуальные связи между областями мотивов. Модель SegFormer извлекает карты признаков в разных масштабах, как определено в Уравнении 8:

Использование многомасштабных представлений облегчает обнаружение паттернов различных размеров в культурных мотивах. Наконец, признаки объединяются с помощью декодера MLP, как показано в Уравнении 91:

Здесь S обозначает итоговую прогнозируемую карту сегментации.
Остов SegFormer-B2 был инициализирован с использованием весов, предобученных на ImageNet, и впоследствии дообучен на наборе данных Miao Batik для сегментации культурных мотивов. Предобученный контрольный блок был получен из официальной реализации SegFormer. В частности, для инициализации остова SegFormer-B2 перед дообучением использовался предобученный на ImageNet-1K контрольный блок MIT-B2 (mit_b2.pth), предоставленный официальным репозиторием SegFormer. Предобученные веса соответствуют остову MIT-B2, выпущенному авторами SegFormer, и служили моделью инициализации для обучения семантической сегментации. Остальные слои, специфичные для данной задачи, перед началом обучения были инициализированы с использованием стандартных процедур инициализации весов PyTorch.
В архитектуре используется четырехэтапный иерархический кодировщик Transformer с перекрывающимися эмбеддингами патчей. На начальном этапе размер патча был установлен на уровне 7 × 7 с шагом 4. Для каждого из четырех этапов кодировщика размерности эмбеддингов составляли 64, 128, 320 и 512. На этих четырех этапах использовалось 1, 2, 5 и 8 многоголовых механизмов внутреннего внимания (multihead self-attention), а соответствующая глубина кодировщика составляла 3, 4, 6 и 3 слоя. Многомасштабные признаки, полученные от кодировщика, агрегировались с помощью легковесного декодера на базе MLP. Перед созданием итоговой карты сегментации декодер проецировал признаки с каждого этапа кодировщика в единое пространство эмбеддингов. Во всех блоках Transformer использовалась функция активации Gaussian Error Linear Unit (GELU). Для улучшения обобщающей способности и снижения переобучения при обучении применялся коэффициент дропаута 0.1.
На этапе обучения фреймворк SegFormer получает предварительно обработанные изображения из обоих наборов данных. Изображения из набора данных Miao Batik содержат области мотивов, которые служат метками для контролируемого обучения модели сегментации. Энкодер Transformer обрабатывает изображение целиком и фиксирует дальние связи между компонентами изображения, что особенно важно для традиционных узоров батика, содержащих пространственно распределенные мотивы. Иерархический механизм извлечения признаков одновременно фиксирует локальные структуры, такие как повторяющиеся геометрические текстуры. Декодер MLP обрабатывает эти извлеченные признаки и формирует маску сегментации, выделяющую области мотивов. Карты сегментации, созданные на этом этапе, в дальнейшем используются в качестве структурных входных данных для модуля внимания и этапа реконструкции узора, что способствует сохранению аутентичности генерируемых паттернов.
Культурные мотивы были разделены на различные классы для семантической сегментации в соответствии с их визуальными и культурными характеристиками. Таксономия сегментации включала анималистические мотивы (например, бабочек, рыб, птиц и другую символическую фауну), растительные мотивы (например, цветы, листья, лозы и ботанические узоры), геометрические мотивы (например, повторяющиеся фигуры, бордюры и абстрактные геометрические структуры), а также фоновые области, представляющие зоны без мотивов. Маски сегментации на уровне пикселей использовались для присвоения каждому пикселю одного из предопределенных классов. Целочисленные метки были закодированы следующим образом: Метка 0 = фон, Метка 1 = анималистические мотивы, Метка 2 = растительные мотивы и Метка 3 = геометрические мотивы. Аннотации сегментации и метки мотивов были получены непосредственно из первоначального источника набора данных Miao Batik. В данном исследовании не проводилось дополнительное ручное аннотирование, перемаркировка, проверка границ или процедуры экспертного подтверждения. Существующие аннотации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки.
Модель SegFormer для сегментации культурных мотивов обрабатывает предварительно обработанные изображения из набора данных Miao Batik и набора данных WikiArt, используя механизм на основе трансформера для точного обнаружения областей с культурными узорами, как показано на Рисунке 4. Сначала в модель SegFormer подается входное изображение, содержащее традиционные культурные мотивы. Кодировщик Transformer извлекает как глобальную контекстную информацию, так и локальные структурные признаки из патчей изображения. Полученные многомасштабные признаки передаются в декодер сегментации, который использует смешанную сеть прямого распространения (Mix Feed-Forward Network) для уточнения представления признаков и улучшения обнаружения мотивов. Результатом работы модели SegFormer является маска сегментации, которая выделяет пиксели, соответствующие культурным узорам, подавляя при этом нерелевантную информацию фона. Изолированные культурные узоры затем служат структурным руководством для последующих этапов фреймворка SegCycle-SPADE.

Рисунок 4. Семантическая сегментация культурных мотивов на основе SegFormer-B2. Архитектура модуля семантической сегментации SegFormer-B2, используемого для извлечения культурных мотивов и обученного исключительно на наборе данных Miao Batik. Структура состоит из энкодера на базе Transformer для многомасштабного извлечения признаков и легковесного декодера сегментации для генерации масок мотивов. Модель предсказывает четыре семантических класса — животное, растение, геометрический элемент и фон, при этом полученные маски сегментации определяют культурно значимые области мотивов, подавляя иррелевантную информацию фона. Результаты этой сегментации служат структурным ориентиром для последующих этапов слияния признаков, реконструкции и художественного синтеза в предлагаемой структуре SegCycle-SPADE. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
В предлагаемой структуре нет необходимости создавать новые аннотации сегментации. Набор данных Miao Batik был получен из уже существующего открытого источника, а модель была обучена с использованием соответствующей информации о мотивах, предоставленной создателями набора данных. В процессе обучения модель SegFormer генерировала карты семантической сегментации. В результате в данном исследовании не потребовалось использование дополнительного программного обеспечения для ручной аннотации, руководств по аннотированию или процедур контроля качества аннотаций.
CAFFM
Для улучшения взаимодействия между признаками семантической сегментации и представлениями генеративной реконструкции в исследовании также был предложен модуль CAFFM. Энкодер SegFormer-B2 передает семантические карты признаков в модуль CAFFM, в то время как этап реконструкции CycleGAN предоставляет генеративные карты признаков. Сначала используются слои линейной проекции для отображения обоих потоков признаков в общее пространство вложений. Для вычисления перекрестного внимания (cross-attention) с использованием сгенерированных тензоров признаков создаются представления запроса (Q), ключа (K) и значения (V). Затем с помощью многоголового перекрестного внимания моделируются взаимосвязи между информацией о структурных мотивах и элементами художественного стиля. К объединенным представлениям признаков затем применяются нормализация слоя, остаточные связи и сети прямого распространения с активацией GELU. Этап синтеза на основе SPADE получает выходные данные модуля CAFFM, что позволяет сохранить культурно значимые темы без ущерба для художественной целостности.
Для обеспечения совместимости признаков входные признаки сначала проецируются с помощью слоев линейной проекции в общее пространство вложений с размерностью вложения 256. Взаимосвязи между семантической структурной информацией и представлениями генеративного стиля затем моделируются с использованием механизма многоголового перекрестного внимания (MultiHead Cross-Attention) с восемью головами внимания. Вычисление перекрестного внимания использует векторы запроса (Query, Q), ключа (Key, K) и значения (Value, V), которые создаются специальными слоями линейного преобразования. Для повышения стабильности обучения и сохранения целостности признаков применяются остаточные связи (residual connections) и послойная нормализация (Layer Normalization) для дальнейшего улучшения объединенных представлений признаков. Нелинейное обучение признаков затем совершенствуется путем применения сети прямого распространения с функцией активации Gaussian Error Linear Unit (GELU). Модуль генерирует выходное представление признаков размерностью 256, которое передается на другие этапы для творческого синтеза. CAFFM успешно объединяет данные художественного стиля со структурами культурных мотивов, используя метод слияния на основе перекрестного внимания, что улучшает сохранение мотивов и визуальную согласованность реконструированных узоров культурного наследия.
В предлагаемой системе структурные признаки извлекаются из набора данных Miao Batik, в то время как стилистические признаки изучаются на основе набора данных WikiArt. Обозначим карту признаков, полученную с помощью сети сегментации SegFormer с использованием изображений из набора данных Miao Batik, как Fs, а карту признаков, полученную из ветви извлечения стилистических признаков с использованием изображений WikiArt, — как Fa. Предлагаемый CAFFM объединяет два домена признаков с помощью механизма перекрестного внимания для изучения как структурных, так и стилистических зависимостей культурных узоров. В таблице 3 приведены все архитектурные характеристики, включая размерности эмбеддингов, слои нормализации, функции активации и конфигурацию голов внимания. При размере входного изображения 256 × 256 пикселей энкодер SegFormer-B2 генерировал семантические карты признаков размером 64 × 64 × 128, а ветвь извлечения стилистических признаков — карты признаков размером 64 × 64 × 128. Обе карты признаков проецировались через обучаемые линейные слои в общее пространство эмбеддингов размерности 256 перед слиянием с помощью перекрестного внимания.
| Параметр | Конфигурация |
| Предложенная архитектура | SegCycle-SPADE |
| Модель семантической сегментации | SegFormer-B2 |
| Стадии энкодера SegFormer | 4 |
| Инициализация весов | SegFormer-B2 с предобучением на ImageNet-1K (магистральная сеть MIT-B2) |
| Источник контрольной точки | Официальный репозиторий NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); контрольная точка: segformer.b2.512x512.ade.160k |
| Стратегия дообучения | Сквозное дообучение (end-to-end) на наборе данных Miao Batik |
| Размер патча эмбеддинга | 7 × 7 |
| Шаг патча | 4 |
| Размерности эмбеддингов | 64, 128, 320 и 512 |
| Глубина энкодера | 3, 4, 6 и 3 |
| Количество голов внимания | 1, 2, 5 и 8 |
| Тип декодера | All-MLP декодер |
| Функция активации | GELU |
| Коэффициент Dropout | 0.1 |
| Модуль улучшения признаков | Модуль слияния культурных признаков на основе перекрестного внимания (CAFFM) |
| Размерность эмбеддинга CAFFM | 256 |
| Количество голов внимания CAFFM | 8 |
| Масштабы слияния CAFFM | 4 |
| Модель реконструкции | CycleGAN |
| Модель генерации стиля | SPADE |
| Культурный набор данных | Набор данных Miao Batik |
| Набор данных стилей | Набор данных WikiArt |
| Изображения Miao Batik | 15 148 |
| Изображения WikiArt | Приблизительно 80 000 |
| Разрешение входных изображений | 256 × 256 пикселей |
| Цветовой формат | RGB |
| Метод интерполяции | Билинейная интерполяция |
| Метод шумоподавления | Гауссова фильтрация |
| Размер ядра Гаусса | 5 × 5 |
| Сигма Гаусса (σ) | 1 |
| Диапазон нормализации | [0, 1] |
| Размер пакета (Batch Size) | 16 |
| Количество эпох | 100 |
| Оптимизатор | Adam |
| Скорость обучения | 0.0002 |
| Параметры Adam | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0 |
| Функции потерь | Потери сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля |
| Стратегия разделения данных | Обучение / Валидация / Тестирование |
| Обучающая выборка | 70% |
| Валидационная выборка | 15% |
| Тестовая выборка | 15% |
| Случайное число (Random Seed) | 42 |
| Метрики оценки | Точность сегментации, IoU, коэффициент Дайса, SSIM, PSNR и FID |
| Язык программирования | Python 3.8.10 |
| Фреймворк глубокого обучения | PyTorch 1.10.0 |
| Аппаратная платформа | GPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11-е поколение), 32 GB RAM |
| Операционная среда | Ubuntu 20.04 LTS |
Таблица 3: Экспериментальная установка и конфигурация модели. Сводка архитектурных компонентов, конфигурации обучения, настроек предобработки, наборов данных, параметров оптимизации, метрик оценки и вычислительной среды, использованных для реализации и оценки предлагаемого фреймворка SegCycle-SPADE.
Модуль внимания сначала отображает карту признаков в представления запроса (query), ключа (key) и значения (value) с помощью Уравнения 10:

Здесь, Wq, Вки Втв представляют собой обучаемые весовые матрицы. Веса внимания рассчитываются на основе сходства между вектором запроса и вектором ключа с использованием Уравнение 1117:

Здесь dk — размерность вектора ключа. Улучшенное представление признаков вычисляется путем умножения весов внимания на матрицу значений с использованием уравнения 12:

Здесь Fa — это улучшенное представление признаков карты признаков. Улучшенное представление признаков вычисляется путем объединения исходных признаков сегментации с улучшенными признаками, полученными с помощью механизма внимания, согласно Уравнению 13:
Здесь Fe представляет собой улучшенную карту признаков, используемую для реконструкции паттерна. CAFFM расширен многомасштабным механизмом перекрестного внимания для извлечения признаков культурных мотивов в различных масштабах. Пусть Fsi обозначает признаки сегментации в масштабе i, а Faj — признаки художественного стиля в том же масштабе. Итоговое представление признаков определяется с помощью уравнения 14:

Здесь Qi, Ki и Vi соответственно представляют собой матрицы запроса (query), ключа (key) и значения (value) на масштабе i, а N обозначает количество масштабов признаков. В данном исследовании N = 4, что соответствует картам признаков, извлеченным при пространственных разрешениях 1/4, 1/8, 1/16 и 1/32 от размера исходного изображения. Эти многомасштабные представления признаков были объединены с использованием обучаемых весов внимания перед реконструкцией и художественным синтезом. Приведенное расширение позволяет методу извлекать глобальные культурные мотивы и текстуры для реконструкции культурных узоров. CAFFM расположен между этапом сегментации на базе SegFormer и этапом творческого синтеза на базе SPADE в предлагаемой системе SegCycle-SPADE. Сначала, пока CycleGAN параллельно создает признаки реконструкции со стилистической и паттерн-зависимой информацией, SegFormer-B2 восстанавливает семантические карты признаков, которые описывают структурные свойства культурных мотивов. Модуль CAFFM принимает эти два потока признаков и использует слияние на основе перекрестного внимания (cross-attention) для выявления взаимосвязей между структурными и художественными представлениями. Затем полученные объединенные карты признаков направляются в модуль SPADE для творческого синтеза под управлением сегментации, чтобы создать культурно достоверные узоры при сохранении семантической согласованности и структурных особенностей.
Реконструкция паттернов с использованием CycleGAN
После завершения этапа улучшения признаков на основе механизма внимания карты признаков будут содержать усиленные структуры культурных мотивов. Однако карты признаков все еще могут содержать неполные или поврежденные области паттернов. Следовательно, для решения проблемы реконструкции паттернов в предлагаемой архитектуре будет использоваться модель CycleGAN. В рамках данной архитектуры двумя доменами будут являться исходные паттерны культурных мотивов и реконструированные паттерны культурных мотивов. Используя улучшенные признаки с предыдущих этапов, модель CycleGAN реконструирует культурные паттерны, сохраняя при этом структурную целостность. Это обеспечит сохранение пространственного расположения таких культурных паттернов, как геометрические, растительные и символические узоры. Исходные изображения батика народа мяо подвергались операциям случайного маскирования и частичного перекрытия для создания неполных или поврежденных культурных мотивов. Эти процедуры деградации имитировали отсутствие фрагментов паттернов и структурные повреждения, которые часто наблюдаются в изношенных объектах культурного наследия. Деградированные изображения использовались в качестве входных данных для модуля реконструкции, а соответствующие исходные изображения служили эталонами для оценки эффективности и качества реконструкции. Такая стратегия позволила модели изучить восстановление недостающих структур мотивов при сохранении семантической согласованности и культурных особенностей.
Пусть X будет областью неполных культурных паттернов, а Y — областью реконструированных культурных паттернов. Два генератора обучаются выполнять двунаправленное отображение с использованием Уравнения 15:

Здесь GE используется для реконструкции структур мотивов, а FM — для сопоставления паттернов с исходным доменом. Адверсативная функция потерь используется для обеспечения реалистичности реконструированных паттернов (Уравнение 16)30

Здесь DY — это дискриминатор, используемый для разграничения реальных и реконструированных паттернов, а GE(x) обозначает сгенерированный реконструированный паттерн. CycleGAN также обеспечивает циклическую согласованность для сохранения структурного расположения культурных мотивов (Уравнение 17)30.

Итоговая функция потерь определяется с помощью уравнения 1830:

Здесь λi обозначает весовой коэффициент функции потерь циклической согласованности; в процессе обучения он был установлен равным 10, что соответствует исходной формулировке CycleGAN. Данное значение было выбрано для обеспечения баланса между состязательным обучением и согласованностью реконструкции между исходным и целевым доменами.
Модуль реконструкции CycleGAN состоит из двух генераторов и двух дискриминаторов для двунаправленного преобразования изображений. Каждый генератор построен на архитектуре остаточной сети (residual network), включающей начальный сверточный слой 7 × 7, за которым следуют два сверточных слоя понижения дискретизации (downsampling), девять остаточных блоков и два слоя повышения дискретизации (upsampling). Во всех операциях свертки используется размер ядра 3 × 3, за исключением входного слоя, где для улучшенного извлечения признаков применяется ядро 7 × 7. После каждого сверточного слоя применяется инстанс-нормализация (Instance Normalization) для повышения стабильности обучения, а во всей сети генератора используется функция активации ReLU. Выходной слой использует функцию активации Tanh для генерации нормализованных выходных изображений. Дискриминатор построен на архитектуре PatchGAN 70 × 70, состоящей из серии сверточных слоев с размером ядра 4 × 4 и постепенно увеличивающимся количеством каналов признаков. В дискриминаторе используются инстанс-нормализация и активация LeakyReLU (отрицательный наклон = 0,2) для улучшения дискриминации признаков и состязательного обучения. Модуль CycleGAN получает на вход предварительно обработанные изображения культурных мотивов и генерирует реконструированные представления паттернов, которые затем передаются в CAFFM для интеграции с признаками сегментации. Обучение CycleGAN проводилось с использованием оптимизатора Adam (β₁ = 0,5, β₂ = 0,999) с начальной скоростью обучения 0,0002. Скорость обучения поддерживалась неизменной в течение первых 100 эпох, а затем линейно снижалась до нуля на протяжении оставшегося периода обучения. Для стабилизации обучения дискриминатора использовался буфер воспроизведения (replay buffer), содержащий 50 ранее сгенерированных изображений. Обновление генераторов и дискриминаторов выполнялось в соотношении 1:1: одно обновление генератора следовало за одним обновлением дискриминатора в каждой итерации обучения.
Процесс реконструкции CycleGAN основан на улучшенных картах признаков, полученных с помощью механизма CAFFM, представленного на рисунке 5. Карты признаков содержат усиленные культурные мотивы, полученные на предыдущих этапах сегментации и CAFFM. Эти карты признаков используются в качестве входных данных для первого генератора GE. Первый генератор GE изучает отображение, необходимое для реконструкции культурных паттернов. Затем выходные данные подаются на дискриминатор DY для разграничения реальных культурных паттернов и реконструированных. Дискриминатор DY помогает генератору GE создавать реалистичные результаты. Чтобы культурные паттерны не искажались в процессе реконструкции, второй генератор FM выполняет отображение с соблюдением циклической согласованности (cycle-consistency mapping). Второй генератор FM переносит выходные данные обратно в исходный домен. Затем результаты оцениваются дискриминатором для проверки их реалистичности. Конечные результаты впоследствии передаются в модуль SPADE для генерации художественного стиля на следующем этапе предлагаемого фреймворка SegCycle-SPADE.

Рисунок 5. Схема реконструкции паттернов на основе CycleGAN. Схема работы модуля реконструкции CycleGAN. В качестве входных данных для сети-генератора используются представления признаков с усиленным вниманием (attention-enhanced feature representations) для реконструкции незавершенных культурных мотивов. Дискриминатор оценивает реконструированные результаты в сравнении с эталонными паттернами, в то время как циклическое согласованное отображение (cycle-consistency mapping) обеспечивает сохранение структурной целостности при двунаправленном переводе изображений. Затем реконструированные мотивы передаются в модуль SPADE для синтеза художественного стиля. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.
Генерация художественного стиля с помощью SPADE
Впоследствии реконструированные культурные мотивы подвергаются обработке модулем SPADE для генерации художественного стиля. Основная цель модуля SPADE заключается в добавлении более визуально насыщенных текстур художественного стиля к реконструированным культурным мотивам без нарушения их структурного расположения. Модуль SPADE представляет собой метод условной генерации изображений, использующий концепцию сегментации изображений для создания новых визуальных образов. Многоканальные семантические карты, соответствующие заранее определенным классам мотивов, были закодированы на основе масок семантической сегментации, полученных с помощью SegFormer-B2. Генератор SPADE получал эти закодированные карты в качестве условных входных данных. Параметры пространственно-адаптивного масштабирования (γ) и смещения (β) формировались путем обработки семантических карт через сверточные слои внутри каждого слоя SPADE. Таким образом, генератор мог сохранять границы мотивов, их структурное расположение и семантическую информацию в процессе художественного синтеза, применяя эти параметры к нормализованным активациям признаков. Семантическое управление могло влиять как на высокоуровневую структурную реконструкцию, так и на низкоуровневый синтез текстур, поскольку процесс кондиционирования осуществлялся на нескольких слоях генератора SPADE. В результате созданные художественные паттерны объединили в себе стилистические черты, заимствованные из набора данных WikiArt, при сохранении структур культурных мотивов, выявленных на этапе сегментации.
Набор данных WikiArt, включающий работы из 27 различных художественных категорий, таких как Ренессанс, Импрессионизм, Кубизм, Экспрессионизм, Сюрреализм, Реализм и Абстрактное искусство, был использован в качестве основного ресурса для изучения художественных стилей. Для ознакомления модели с разнообразными творческими особенностями и улучшения обобщения стилей в процессе обучения из различных категорий случайным образом выбирались изображения стилей. Набор данных был разделен на обучающую, валидационную и тестовую подвыборки со сбалансированным представлением художественных категорий для уменьшения стилистического смещения. Для обеспечения сбалансированного представительства всех 27 художественных категорий использовался стратифицированный отбор. Образцы из каждой категории пропорционально распределялись между обучающей, валидационной и тестовой подвыборками с сохранением исходного распределения классов. Модуль CAFFM использовался для объединения стилистических аспектов, полученных из изображений WikiArt, с признаками реконструкции, созданными CycleGAN. Для того чтобы сеть синтеза могла переносить художественные качества, сохраняя при этом семантическую структуру и границы культурных мотивов, полученные из карт сегментации, результирующие объединенные представления подавались в качестве кондиционирующей информации в генератор SPADE. Благодаря этой технике кондиционирования стиля предлагаемая архитектура позволила создавать культурно аутентичные художественные паттерны с согласованными структурными и стилистическими представлениями.
SPADE также вводит пространственно-адаптивные параметры, которые зависят от карты сегментации. Параметры могут быть определены, как показано в Уравнении 191:

Здесь γ(S) — пространственно-варьируемый параметр масштаба, а β(S) — пространственно-варьируемый параметр смещения. Эти параметры позволяют генератору создавать различные текстуры и стили в зависимости от семантической области на изображениях. Итоговое произведение культурного искусства может быть определено следующим образом, как показано в Уравнении 20:

Здесь GE — это генератор SPADE, XrP — реконструированный узор, а SM — карта сегментации. Итоговое изображение сохраняет структурную целостность культурных мотивов, при этом улучшая художественный вид. Для оптимизации предложенной архитектуры SegCycle-SPADE использовалась комбинированная функция потерь, балансирующая точность семантической сегментации, сохранение культурных мотивов, качество реконструкции узора и согласованность художественного стиля. Общая цель обучения была определена как взвешенная смесь потерь сегментации (Lseg), состязательных потерь (Ladv), потерь циклической согласованности (Lcycle), потерь реконструкции (Lrecon), потерь сохранения мотивов (Lmotif) и потерь согласованности стиля (Lstyle). Общая функция потерь определена в Уравнении 21:
(21)
Для обеспечения структурного соответствия между входными и реконструированными культурными мотивами коэффициент потерь циклической согласованности был установлен равным 10. Чтобы сохранить детализированные признаки мотивов и повысить визуальную точность, коэффициент потерь реконструкции был установлен на уровне 5. Для акцентирования внимания на сохранении культурно значимых структурных паттернов в процессе художественного синтеза для потерь по сохранению мотивов был использован коэффициент 2. Чтобы способствовать переносу художественного стиля без излишнего искажения семантических структур мотивов, коэффициент потерь стилевой согласованности был скорректирован до 1. Для поддержания сбалансированного вклада между созданием реалистичного изображения и точной сегментацией мотивов сегментационным потерям и состязательным потерям были присвоены равные веса. Для расчета потерь стилевой согласованности использовались представления стиля на основе признаков из набора данных WikiArt. В частности, характеристики художественного стиля фиксировались с помощью корреляций матриц Грама, полученных из карт глубоких признаков. Для расчета стилевых потерь использовалась разность норм Фробениуса между матрицами Грама целевого изображения стиля и сгенерированного изображения, как показано в Уравнении 22:

Здесь, Gл вычисляется ли матрица Грама на основе лth слой объектов, IГен обозначает сгенерированное художественное изображение, Iстиль обозначает целевое изображение стиля из набора данных WikiArt, и F обозначает норму Фробениуса. Такая формулировка позволяет предложенной структуре сохранять художественные характеристики, поддерживая при этом структурную и семантическую целостность культурных мотивов.
Объединенные представления признаков, создаваемые модулем CAFFM, используются в качестве обуславливающих входных данных для модуля SPADE, который служит компонентом художественного синтеза в предлагаемой архитектуре. Генератор SPADE состоит из семи остаточных блоков SPADE с размерностью латентных признаков 256 каналов и генерирует выходные изображения с разрешением 256 × 256 пикселей. Карты семантической сегментации, полученные из модуля SegFormer–CAFFM, используются в качестве обуславливающих входных данных во всех остаточных слоях SPADE. Слои SPADE применяются перед функциями активации внутри каждого остаточного блока, что обеспечивает семантическое обуславливание под руководством сегментации. Посредством последовательных операций повышения дискретизации (upsampling) и свертки латентное представление признаков постепенно уточняется для создания художественных паттернов высокого разрешения при сохранении семантической согласованности и структуры мотивов. Во всем генераторе используются функции активации LeakyReLU, а на выходном слое применяется функция активации Tanh для получения нормализованных изображений.
Алгоритм и рабочий процесс
Фреймворк SegCycle-SPADE объединяет семантическую сегментацию, слияние признаков, реконструкцию паттернов и синтез художественного стиля в рамках единого конвейера обучения. Рабочий процесс начинается со сбора и предобработки набора данных, включая изменение размера изображений, нормализацию, шумоподавление и подготовку масок сегментации. Предобработанные изображения затем обрабатываются с помощью сети сегментации SegFormer-B2 для извлечения семантических представлений мотивов. Полученные признаки сегментации объединяются с признаками реконструкции посредством CAFFM, что обеспечивает взаимодействие между информацией о структурных мотивах и художественными представлениями признаков. Объединенные карты признаков затем передаются в модуль реконструкции CycleGAN, который восстанавливает неполные структуры культурных мотивов, сохраняя семантическую согласованность. Реконструированные паттерны впоследствии поступают в генератор SPADE для художественного синтеза под управлением сегментации, что позволяет улучшить стилистику при сохранении границ мотивов и структурной достоверности. В процессе обучения параметры модели оптимизируются с помощью составной функции потерь, описанной в уравнениях 21 и 22, которая балансирует точность сегментации, сохранение мотивов, качество реконструкции и согласованность художественного стиля. Подробный пошаговый рабочий процесс реализации, включая загрузку набора данных, предобработку, инициализацию модели, итерации обучения, процедуры валидации, выбор контрольных точек и окончательную оценку, представлен в дополнительном файле 1 (Алгоритм 1). Полный алгоритмический рабочий процесс был реализован с размером пакета 16, скоростью обучения 0.0002 и 100 эпохами обучения. Для разделения набора данных, инициализации модели и всех экспериментов по обучению использовался фиксированный случайный seed 42. Этот seed последовательно применялся в генераторах случайных чисел Python, NumPy и PyTorch для обеспечения воспроизводимости. Оптимизатор Adam был настроен с параметрами β₁ = 0.5, β₂ = 0.999 и без затухания весов (weight decay = 0). Контрольные точки модели выбирались на основе наивысшего показателя IoU на валидационном наборе данных.
Оптимизация функции потерь
Для сохранения структур культурных мотивов в процессе реконструкции и художественного синтеза в предлагаемой архитектуре используется комбинированная целевая функция оптимизации, которая объединяет потери при сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля. Полная математическая формулировка, весовые коэффициенты и определение потерь стиля приведены в уравнениях 21 и 22 в подразделе Artistic Style Generation using SPADE. Компонент сохранения мотивов штрафует структурные отклонения между прогнозируемыми областями мотивов и соответствующими масками сегментации истинных значений (ground-truth), тем самым способствуя сохранению культурно значимых структур узора на протяжении всего процесса реконструкции.