Исследовательская статья

Реконструкция с использованием семантической сегментации и синтез художественного стиля паттернов нематериального культурного наследия на основе системы глубокого обучения

DOI:

10.3791/71577

14 августа 2026 г.

В этой статье

Краткое содержание

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

В данном протоколе описывается рабочий процесс глубокого обучения для семантической сегментации, реконструкции и синтеза художественного стиля узоров нематериального культурного наследия с использованием извлечения признаков на основе трансформеров, состязательной реконструкции и пространственно-адаптивной генерации изображений для поддержки цифрового сохранения и творческого применения объектов наследия.

Аннотация

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Цифровое сохранение и реконструкция узоров нематериального культурного наследия (НКН) привлекают все больше внимания по мере развития методов синтеза изображений на основе глубокого обучения. Существующие подходы на базе SegCycle-SPADE продемонстрировали потенциал для структурной сегментации и художественной реконструкции традиционных ремесленных узоров; однако сохраняются определенные ограничения, включая недостаточное разнообразие наборов данных, недостаточный учет культурной семантики и неадекватное сохранение структурных особенностей узоров при реконструкции. Для решения этих проблем в данной работе предлагается усовершенствованный фреймворк SegCycle-SPADE для семантической сегментации и художественной реконструкции типов узоров НКН. Модель сегментации SegFormer на базе архитектуры Transformer используется для точного определения границ мотивов и областей узора. Кроме того, введен модуль слияния культурных признаков на основе перекрестного внимания (Cross-Attention Cultural Feature Fusion Module) для усиления значимых культурных мотивов и улучшения представления признаков. Трансляция и реконструкция узоров выполняются с помощью CycleGAN, а пространственно-адаптивная денормализация (SPADE) используется для синтеза художественного стиля с целью поддержания семантической согласованности между картами сегментации и генерируемыми изображениями. Для улучшения обобщающей способности модели и художественного разнообразия фреймворк обучается с использованием набора данных культурных мотивов батика народа мяо и набора данных WikiArt. Результаты экспериментов показывают, что предлагаемый фреймворк SegCycle-SPADE с механизмом внимания повышает точность сегментации и эффективность реконструкции традиционных узоров по сравнению с существующими методами реконструкции на основе генеративно-состязательных сетей (GAN). Предложенный фреймворк представляет собой масштабируемое решение для документирования культурного наследия с помощью искусственного интеллекта, реконструкции и художественного возрождения традиционных дизайнерских узоров.

Введение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Культурное наследие, которое включает как нематериальные элементы, такие как обычаи, языки и верования, так и материальные элементы, такие как произведения искусства, здания и письменные памятники, является фундаментальным проявлением человеческой истории, творчества и идентичности1. Сохранение наследия направлено на то, чтобы дать сообществам возможность восстановить связь со своими истоками и позволить будущим поколениям пользоваться их коллективной культурной памятью. Оно также способствует межкультурному взаимопониманию, признанию разнообразия традиций и обычаев, а также различных исторических повествований. Эти культурные ценности помогают нам понять ценности, взгляды и опыт предыдущих поколений и способствуют формированию современных социальных идентичностей и культурной преемственности. Основные принципы сохранения культурного наследия проиллюстрированы на Рисунке 1.

figure-introduction-1
Рисунок 1. Концептуальный обзор реконструкции узоров культурного наследия с использованием архитектуры SegCycle-SPADE. Схематическая иллюстрация предлагаемого подхода для реконструкции и улучшения узоров нематериального культурного наследия. Рабочий процесс включает сбор наборов данных из баз Miao Batik и WikiArt, предварительную обработку изображений, семантическую сегментацию с помощью SegFormer-B2, слияние признаков с помощью модуля слияния культурных признаков на основе перекрестного внимания (CAFFM), реконструкцию узоров с помощью CycleGAN, синтез художественного стиля с помощью SPADE и финальную оценку с использованием метрик сегментации и реконструкции. Стрелки указывают направление потоков данных и представлений признаков внутри архитектуры. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Коллективная память и культурное наследие человеческого общества воплощены в нематериальном культурном наследии (НКН), которое служит важным средством художественного выражения и культурной идентичности. Однако НКН сталкивается с серьезными проблемами из-за процессов глобализации и цифровизации2,3,4. Многие исчезающие практики НКН требуют новых подходов к сохранению и развитию в связи с сокращением числа квалифицированных мастеров и ограниченной адаптивностью к современным рынкам5,6. Будучи важной областью исследований НКН, устойчивый дизайн делает акцент на комплексном развитии культуры, общества и окружающей среды и предлагает практический путь для дальнейшего сохранения НКН. Благодаря подходам устойчивого дизайна НКН может быть возрождено при одновременной адаптации к потребностям современного общества7,8.

В данном исследовании термин «паттерны нематериального культурного наследия» относится к визуальным репрезентациям мотивов, которые передают и сохраняют лежащие в их основе нематериальные культурные ценности. Следовательно, предлагаемая концепция направлена на сохранение и документирование культурной информации, связанной с этими мотивами, при одновременном восстановлении их визуальных форм.

Вышивка и батик народа мяо представляют собой значимые формы нематериального культурного наследия Китая, отражающие историю, верования и традиции общины мяо через символические мотивы, такие как птицы, бабочки и родовые тотемы9. Эти мотивы глубоко интегрированы в ритуальную одежду и праздничные обряды, а также способствуют местному культурному и экономическому развитию10,11. Достижения в области цифровых технологий, в частности искусственного интеллекта (ИИ) и глубокого обучения (ГО), открыли новые возможности для сохранения, анализа, реконструкции и документирования культурного наследия. Батик мяо из провинции Гуйчжоу, являющийся одной из наиболее сохранившихся традиций батика в Китае, служит важным средством передачи культурных знаний, верований, обычаев и ритуалов народа мяо12,13,14,15,16.

Недавние исследования продемонстрировали потенциал глубокого обучения (DL) для сохранения культурного наследия и реконструкции узоров, позволив достичь более высокой точности сегментации (pixel accuracy = 88.6%, mean intersection over union [IoU]= 78.1%) и качества реконструкции по сравнению с U-Net и DeepLabV3+1. Однако ряд проблем остается нерешенным. Существующие подходы на основе генеративно-состязательных сетей (GAN) часто не позволяют сохранить мелкие структурные детали в сложных узорах17, а ограниченное разнообразие наборов данных препятствует обобщающей способности моделей применительно к различным культурным областям18. Кроме того, модели перевода изображений, такие как CycleGAN, могут не обеспечивать семантическую согласованность между картами сегментации и сгенерированными изображениями19, а отсутствие механизмов внимания может привести к потере важных с культурной точки зрения деталей мотивов в процессе реконструкции20. Таким образом, для эффективной реконструкции узоров нематериального культурного наследия (ICH) необходима усовершенствованная платформа, объединяющая сегментацию на основе трансформеров, обучение признакам с использованием механизмов внимания и обучение на нескольких наборах данных.

Цифровизация вышивки народа мяо и стремительное развитие генеративного ИИ открыли новые возможности для сохранения культурного наследия. Диффузионные модели, представляющие собой новый класс глубоких генеративных моделей, продемонстрировали выдающиеся результаты в задачах компьютерного зрения благодаря своим мощным возможностям генерации контента21,22,23,24,25. В процессе обратной диффузии модель постепенно учится восстанавливать исходные входные данные из зашумленных представлений26,27,28. В предыдущих исследованиях также изучалось применение технологий трехмерной реконструкции и автоматизированного проектирования (CAD) для сохранения и распространения культурного наследия.

Несмотря на то что сверточные нейронные сети (CNN) и GAN хорошо справляются с генерацией изображений и сохранением признаков, они все еще сталкиваются с проблемами, связанными с ограниченными рецептивными полями, коллапсом моды и нестабильностью обучения29. Архитектуры на базе трансформеров, такие как SegFormer и Segmenter, превосходно улавливают глобальный контекст и семантические связи, однако они требуют значительных вычислительных ресурсов и могут испытывать трудности с передачей мелких деталей. Хотя диффузионные модели, такие как Stable Diffusion, демонстрируют высокие возможности генерации изображений, им часто не хватает точного контроля над структурными и художественными характеристиками создаваемых дизайнов. Более того, большинство существующих подходов используют стратегии независимого обучения, которые ограничивают эффективный обмен информацией и совместную оптимизацию между компонентами сегментации и генерации, что приводит к компромиссу между структурной точностью и художественной достоверностью30.

Современные диффузионные модели, такие как латентная диффузия и Stable Diffusion, обеспечивают высококачественный синтез изображений, но требуют итерационного шумоподавления, что приводит к увеличению вычислительных затрат и времени вывода. Кроме того, сохранение тонких культурных мотивов и структурной целостности остается сложной задачей без специализированных механизмов кондиционирования. Генеративные модели на основе трансформеров эффективно улавливают глобальные контекстуальные связи, но часто требуют крупномасштабных наборов данных и значительных вычислительных ресурсов. В отличие от них, предлагаемая архитектура SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) сочетает в себе сегментацию на базе SegFormer, слияние признаков через перекрестное внимание (cross-attention), реконструкцию с помощью CycleGAN и синтез под управлением SPADE для обеспечения явного структурного руководства, что улучшает сохранность мотивов, семантическую согласованность и контролируемую реконструкцию узоров культурного наследия.

Большинство современных методов семантической сегментации основаны на полностью сверточных нейронных сетях (FCNN) с U-образной архитектурой31. На этапе кодирования глубокие признаки с большими рецептивными полями извлекаются с помощью серии операций свертки и понижения дискретизации (downsampling). На этапе декодирования пространственное разрешение постепенно восстанавливается путем повышения дискретизации (upsampling), что в конечном итоге позволяет осуществлять семантическое прогнозирование на уровне пикселей. Компенсируя потерю пространственной информации при понижении дискретизации и повышая эффективность сегментации в широком спектре приложений, перекрестные связи (skip connections) позволяют напрямую интегрировать информацию высокого разрешения с разных уровней кодировщика в декодировщик32.

Хотя современные методы на основе GAN, CNN и диффузионных моделей демонстрируют многообещающие результаты в генерации изображений и реставрации культурного наследия, они часто с трудом поддерживают семантическую согласованность, сохраняют тонкие структурные мотивы и обеспечивают воспроизводимую реконструкцию различных культурных паттернов. Большинство существующих подходов рассматривают сегментацию, реконструкцию и синтез стиля как отдельные процессы, что может привести к потере культурно значимых элементов и противоречивым результатам. Чтобы восполнить этот методологический пробел, в данном исследовании предлагается единая архитектура SegCycle-SPADE, которая объединяет семантическую сегментацию на базе SegFormer, новый модуль слияния культурных признаков с перекрестным вниманием (CAFFM), реконструкцию на базе CycleGAN и синтез стиля под управлением SPADE. Благодаря явной интеграции информации о структурной сегментации с генеративным обучением признаков, предлагаемая архитектура обеспечивает более надежную, семантически согласованную и воспроизводимую реконструкцию мотивов нематериального культурного наследия, сохраняя при этом как культурную аутентичность, так и художественное качество.

В данном исследовании определены три основных ограничения современных подходов к реконструкции культурного наследия: (i) недостаточное сохранение мелких структурных мотивов в методах реконструкции на основе GAN; (ii) ограниченная обобщающая способность, возникающая вследствие обучения на малых или узкоспециализированных наборах данных; и (iii) недостаточная семантическая согласованность между результатами сегментации и сгенерированными изображениями в структурах перевода из изображения в изображение. Кроме того, сегментация, реконструкция и синтез стиля обычно рассматриваются как отдельные процессы, что приводит к потере культурно значимых элементов в ходе реконструкции. Путем объединения семантической сегментации на основе трансформеров, слияния признаков с перекрестным вниманием, реконструкции CycleGAN и художественного синтеза под управлением SPADE в единой архитектуре, предлагаемый фреймворк SegCycle-SPADE устраняет эти ограничения и улучшает сохранение мотивов, семантическую согласованность и художественную аутентичность при реконструкции паттернов НКП (нематериального культурного наследия).

Основной целью данного исследования является разработка усовершенствованной архитектуры SegCycle-SPADE для художественной реконструкции паттернов нематериального культурного наследия (НКН) с использованием семантической сегментации. Данная архитектура объединяет SegFormer для точной сегментации культурных мотивов, CycleGAN для реконструкции паттернов и SPADE для стилистически согласованного художественного синтеза. Для улучшения представления признаков и сохранения мелких структурных деталей введен модуль CAFFM, способствующий эффективному взаимодействию между признаками сегментации и генеративными признаками. Обученная на наборах данных Miao Batik и WikiArt, предложенная архитектура повышает достоверность реконструкции, стилистическую согласованность и степень сохранения культурно значимых мотивов.

Объединяя семантическую сегментацию, направленное вниманием слияние признаков, реконструкцию паттернов и синтез стиля в рамках единой архитектуры, в данном исследовании представлена новая платформа SegCycle-SPADE для художественной реконструкции паттернов нематериального культурного наследия (НКН). Основной вклад данной работы заключается в следующем. Во-первых, разработан новый фреймворк реконструкции под управлением семантической сегментации путем интеграции SegFormer, что позволяет точно извлекать и сохранять сложные культурные мотивы и структурные элементы. Во-вторых, представлен новый модуль CAFFM для эффективного слияния признаков сегментации с генеративными представлениями, что позволяет модели улавливать дальние зависимости между культурными мотивами и паттернами художественного стиля. В-третьих, предлагаемый CAFFM улучшает сохранение культурно значимых элементов, одновременно повышая визуальный реализм и структурную целостность реконструированных традиционных паттернов. В-четвертых, благодаря интеграции CycleGAN для реконструкции культурных паттернов и SPADE для управляемого сегментацией художественного синтеза, платформа обеспечивает как семантическую точность, так и стилистическую аутентичность генерируемых результатов. В-пятых, для повышения обобщающей способности и художественного разнообразия модель была обучена с использованием набора данных культурных мотивов батика народа мяо для изучения культурных паттернов и набора данных WikiArt для представления художественного стиля. WikiArt служит вспомогательным набором данных для оценки способности платформы к обобщению, устойчивости обучения признакам и эффективности управления стилем в различных визуальных контекстах, а не в качестве целевого стиля для прямого применения в продуктах культурного наследия мяо. Наконец, по сравнению с существующими методами реконструкции культурного наследия на базе GAN, экспериментальные результаты демонстрируют, что предлагаемая платформа SegCycle-SPADE обеспечивает более высокую точность сегментации, качество реконструкции и стилистическую согласованность.

Протокол

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предложенная архитектура SegCycle-SPADE разработана для реконструкции и улучшения традиционных орнаментов культурного наследия посредством семантической сегментации, усиления признаков с помощью механизмов внимания, генеративной реконструкции и синтеза художественного стиля. В данном исследовании использовались общедоступные наборы данных изображений культурного наследия и произведений искусства, включая набор данных Miao Batik и набор данных WikiArt. В исследовании не принимали участия люди, не использовались данные пациентов, личная информация, животные или клинические записи; следовательно, одобрение институционального комитета по этике и информированное согласие не требовались. Для начала оценки используются набор данных культурных мотивов Miao Batik и набор данных WikiArt. Набор данных Miao Batik был описан в работе Quan et al. (2024)32 и содержит 15 148 аннотированных изображений традиционных мотивов батика народа мяо. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Затем выполняется предобработка изображений, включающая изменение размера, нормализацию, шумоподавление и создание маски сегментации. Точные параметры предобработки описаны в подразделе «Предобработка данных». В предлагаемой архитектуре для семантической сегментации данных используется модель на основе трансформера под названием SegFormer-B2. Этот метод предназначен для обнаружения ключевых областей культурных мотивов и изучения их структур. Затем сегментированные признаки усиливаются с помощью механизма внимания, при котором важная информация, связанная с культурными мотивами, выделяется, а нерелевантная информация отсеивается. Конфигурация механизма внимания описана в подразделе CAFFM. Затем усиленные признаки передаются в CycleGAN, где поврежденные структуры реконструируются посредством циклического обучения. В процессе обучения образцы неполных мотивов создавались искусственно путем применения операций случайного маскирования и частичного перекрытия к оригинальным изображениям Miao Batik. Эти процедуры деградации имитировали отсутствие фрагментов мотивов и структурные повреждения, часто наблюдаемые в ветхих артефактах культурного наследия. Полученные неполные изображения использовались в качестве входных данных для модуля реконструкции CycleGAN, в то время как соответствующие оригинальные изображения служили целями реконструкции. Затем реконструированные орнаменты культурного наследия улучшаются с помощью SPADE, где художественное усиление выполняется на основе сгенерированных карт сегментации. Эффективность предлагаемой архитектуры оценивается с использованием количественных метрик сегментации и качества изображений, в то время как визуальная аутентичность реконструированных культурных мотивов оценивается качественно. Визуальная аутентичность оценивалась путем визуального осмотра сгенерированных культурных орнаментов и не использовалась в качестве независимой количественной метрики. Оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных особенностях, структурной целостности и художественном виде относительно соответствующих эталонных культурных мотивов. Количественная оценка производительности модели проводилась с использованием таких показателей, как точность сегментации (Segmentation Accuracy), IoU, коэффициент Дайса (Dice Coefficient), индекс структурного сходства (SSIM), пиковое отношение сигнала к шуму (PSNR) и расстояние Фреше-Инсепшн (FID). На рисунке 2 представлена общая схема рабочего процесса предлагаемой архитектуры SegCycle-SPADE и обобщены метрики оценки, использованные в данном исследовании.

figure-protocol-1
Рисунок 2. Общая архитектура рабочего процесса предлагаемого фреймворка SegCycle-SPADE. Обзор полного рабочего процесса SegCycle-SPADE. Изображения из наборов данных Miao Batik и WikiArt проходят предварительную обработку, после чего подвергаются семантической сегментации с помощью SegFormer-B2, усилению признаков с помощью CAFFM, реконструкции паттернов с помощью CycleGAN и генерации художественного стиля с помощью SPADE. Эффективность модели оценивается с использованием показателей точности сегментации (Segmentation Accuracy), пересечения над объединением (Intersection over Union, IoU), коэффициента Дайса (Dice Coefficient), индекса структурного сходства (Structural Similarity Index Measure, SSIM), PSNR, расстояния Фреше-Инцепции (Fréchet Inception Distance, FID), в то время как визуальная достоверность оценивается качественно. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Система SegCycle-SPADE для реконструкции паттернов культурного наследия разработана для интеграции нескольких компонентов глубокого обучения (DL) с целью точной сегментации, реконструкции и художественного улучшения мотивов, как показано на Рисунке 2. Для обеспечения разнообразия культурных паттернов и художественных стилей используются изображения из набора данных культурных мотивов Miao Batik и набора данных WikiArt. На начальном этапе изображения обрабатываются модулем семантической сегментации на базе SegFormer для идентификации и выделения культурных мотивов из фона. Общая архитектура состоит из четырех основных этапов. Во-первых, модель SegFormer извлекает карты семантической сегментации из изображений культурных паттернов. Во-вторых, CAFFM объединяет признаки сегментации с генеративными представлениями для улучшения обучения признакам. В-третьих, модуль CycleGAN реконструирует культурные паттерны, используя объединенные представления признаков. Наконец, модуль SPADE создает художественно улучшенные результаты, сохраняя структурную согласованность посредством синтеза под руководством сегментации. Уточненные карты признаков впоследствии обрабатываются модулем реконструкции CycleGAN, который обучается восстанавливать неполные культурные мотивы путем сопоставления деградированных паттернов с их соответствующими полными формами. Образцы неполных мотивов были созданы путем применения операций случайного маскирования и частичного перекрытия к исходным изображениям Miao Batik, что позволило имитировать отсутствующие области паттерна и структурную деградацию, часто наблюдаемую в поврежденных культурных артефактах. Каждое деградированное изображение было сопоставлено с соответствующим исходным изображением, которое служило целью реконструкции во время обучения. Эта стратегия позволила модулю CycleGAN изучить восстановление отсутствующих структур мотивов при сохранении семантической согласованности и культурно значимых характеристик. В завершение генератор SPADE создает визуально улучшенные художественные результаты, обуславливая синтез изображений сгенерированными картами сегментации, тем самым поддерживая структурную целостность культурных мотивов на протяжении всего процесса художественного улучшения.

Предлагаемая структура SegCycle-SPADE включает в себя следующие этапы.

Шаг 1: Сбор наборов данных
Для достижения целей изучения культурных паттернов и генерации художественных стилей использовались два набора данных. Набор данных культурных мотивов мяо-батика (Miao Batik Cultural Motif Dataset) использовался для получения информации о традиционных культурных паттернах. Данный набор данных находится в открытом доступе через Zenodo (https://doi.org/10.5281/zenodo.20807658) и содержит 15 148 аннотированных изображений традиционных мотивов мяо-батика. Существующие аннотации, предоставленные создателями набора данных, использовались напрямую; в данном исследовании дополнительные ручные аннотации не создавались. Набор данных WikiArt использовался для получения разнообразной информации о художественных стилях для генерации стиля и был получен из общедоступного репозитория WikiArt (https://www.wikiart.org/).

Шаг 2: Предобработка данных
Все изображения прошли предобработку, включавшую изменение размера, нормализацию и шумоподавление. Для поддержки этапа семантической сегментации использовались существующие аннотации культурных мотивов, полученные из первоначальных источников набора данных. В рамках данного исследования дополнительные процедуры аннотирования или перемаркировки не проводились.

Шаг 3: Семантическая сегментация паттернов с помощью SegFormer
Для сегментации культурных мотивов использовалась модель SegFormer. Точный базовый уровень (backbone) SegFormer и стратегия инициализации описаны в подразделе Семантическая сегментация паттернов с помощью SegFormer. В частности, для семантической сегментации мотивов применялась архитектура SegFormer-B2 с базовым уровнем MIT-B2, предварительно обученным на ImageNet. Эта модель эффективно улавливает глобальную контекстную информацию, сохраняя при этом сложные структурные детали традиционных культурных паттернов.

Шаг 4: CAFFM
CAFFM объединяет признаки семантической сегментации с генеративными представлениями, что позволяет системе изучать как характеристики структурных мотивов, так и информацию о художественном стиле. Подробности интеграции CAFFM приведены в подразделе CAFFM. Модуль расположен между этапом семантической сегментации на базе SegFormer и этапом генеративной реконструкции; здесь он объединяет структурные признаки, полученные в результате сегментации, с признаками реконструкции с помощью многоголового перекрестного внимания (multi-head cross-attention). Этот процесс улучшает сохранение культурных мотивов и повышает реалистичность реконструированных результатов.

Шаг 5: Реконструкция паттерна (CycleGAN)
Затем объединенные признаки обрабатываются модулем CycleGAN для реконструкции структур культурных паттернов. Архитектура CycleGAN и конфигурация обучения описаны в подразделе Реконструкция паттернов с использованием CycleGAN. Модуль реконструкции состоит из двух генераторов и двух дискриминаторов, использует архитектуру генератора на основе остаточных сетей с девятью остаточными блоками, применяет дискриминатор PatchGAN и обучается с использованием состязательных потерь и потерь циклической согласованности. Такая конфигурация обеспечивает двунаправленное отображение доменов и способствует реконструкции неполных структур культурных паттернов.

Шаг 6: Генерация художественного стиля (SPADE)
Затем реконструированные паттерны обрабатываются модулем SPADE для выполнения синтеза художественного стиля с использованием сегментации. Конфигурация генератора SPADE описана в подразделе Artistic Style Generation Using SPADE. Модуль использует остаточные блоки SPADE, слои пространственно-адаптивной нормализации и семантическое кондиционирование, полученное из карт сегментации SegFormer и признаковых представлений CAFFM. Благодаря кондиционированию генерации изображения по картам сегментации, синтезированные результаты сохраняют структурное соответствие исходным культурным мотивам, при этом включая характеристики художественного стиля.

Шаг 7: Оценка эффективности
Предложенная архитектура была оценена с использованием нескольких метрик сегментации и оценки качества изображений, включая точность сегментации (Segmentation Accuracy), IoU, коэффициент сходства Дайса (Dice), SSIM, PSNR и FID. Для проверки воспроизводимости результатов все эксперименты повторяли пять раз с использованием различных случайных значений (random seeds); результаты представлены в виде среднего значения ± стандартного отклонения. Статистическая значимость оценивалась с помощью парного t-критерия с порогом значимости p < 0.05.

Сбор наборов данных
В предлагаемой структуре SegCycle-SPADE для понимания культурных паттернов и изучения стилей используются два набора данных. Первый набор данных, применяемый в предлагаемой структуре, — это набор данных культурных мотивов батика мяо. Этот набор данных содержит культурные мотивы батика мяо, которые в основном представляют собой изображения традиционного батика мяо с такими мотивами, как животные, растения и геометрические фигуры, используемые в искусстве этнической группы мяо. Данный набор содержит изображения с богатой текстурной информацией, что в целом важно для сохранения культурного наследия. Вторым набором данных, используемым в предлагаемой структуре SegCycle-SPADE, является набор данных WikiArt. Этот набор содержит огромное количество произведений искусства, относящихся к различным стилям. Он применяется для изучения сложных стилей, что обычно полезно для улучшения художественных работ. Этот набор данных включает 80 000 произведений искусства в формате HD с 27 различными вариантами оформления, что делает его более эффективным для задач генерации или трансформации стилей на основе глубокого обучения (DL).

Набор данных Miao Batik:
Набор данных Miao Batik (https://doi.org/10.5281/zenodo.20807658) состоит из 15 148 изображений узоров батика, изображающих культурно значимые мотивы. Изображения включают разнообразные традиционные дизайны, такие как анималистические мотивы (например, бабочки и рыбы), растительные орнаменты и геометрические мотивы, несущие культурный символизм. Данный набор данных является важным компонентом предлагаемой структуры, поскольку он предоставляет аутентичные культурные структуры, которые позволяют модулю сегментации точно определять и сохранять границы мотивов при реконструкции узора (Таблица 1). В данном исследовании под культурно значимыми мотивами понимаются символические визуальные элементы, часто описываемые в литературе по культурному наследию народа мяо и представленные в аннотациях набора данных, включая птиц, бабочек, цветочные узоры и родовые тотемы. Эти мотивы были выбраны на основании их задокументированной культурной значимости и повторяющегося присутствия в традиционном батике и вышивке мяо, а не только на основании частоты их появления или пространственной композиции. Аннотации мотивов и метки сегментации, подготовленные под руководством экспертов, были получены из первоначального источника набора данных Miao Batik и использовались в данном исследовании напрямую. Авторами не проводилось дополнительное ручное аннотирование, перемаркировка или процедуры аннотирования под руководством экспертов. Существующие аннотации, предоставленные создателями набора данных, использовались для обучения и оценки семантической сегментации.

ПараметрОписание
Название набора данныхMiao Batik Cultural Pattern Dataset
Источник набора данныхРепозиторий Zenodo (DOI: 10.5281/zenodo.20807658)
Область примененияНематериальное культурное наследие (НКН) / анализ текстильных орнаментов
Общее количество изображений15,148 изображений
Тип изображенийЦифровые изображения традиционных текстильных орнаментов батика народа мяо
Категории орнаментовЗооморфные, флоральные и геометрические мотивы
Культурное происхождениеЭтническая культура мяо, провинция Гуйчжоу, Китай
Исходное разрешение изображенийИзображения высокого разрешения (обычно ≥ 1,000 пикселей по короткой стороне), полученные в виде необработанных сканов или фотографий до предварительной обработки
Разрешение для обученияИзображения, масштабированные до 256 × 256 пикселей в процессе предварительной обработки
Наличие аннотацийСуществующие аннотации сегментации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки. В данном исследовании дополнительные процедуры ручной аннотации, перемаркировки или экспертного подтверждения не проводились.
Применение в данном исследованииСегментация культурных мотивов, извлечение признаков, сохранение мотивов и реконструкция орнаментов

Таблица 1: Характеристики набора данных культурных узоров мяо-батик. Обзор набора данных культурных мотивов мяо-батик, использованного для семантической сегментации, анализа культурных узоров и реконструкции мотивов. В таблице описаны источник набора данных, характеристики изображений, категории мотивов, культурное происхождение, разрешение изображений и роль набора данных в рамках предложенной структуры SegCycle-SPADE.

Набор данных WikiArt:
Набор данных WikiArt [https://www.wikiart.org/] представляет собой популярный крупномасштабный цифровой репозиторий произведений искусства, который включает более 80 000 изображений, относящихся к 27 различным художественным стилям, представленным в Таблице 2. Эти стили включают искусство Ренессанса, импрессионизм, кубизм и сюрреализм. Данный набор данных имеет большое значение для предлагаемой архитектуры, поскольку он предоставляет знания, которые позволяют модулю SPADE создавать культурно обогащенные паттерны, сохраняя при этом структурную информацию, полученную в процессе сегментации. Набор данных состоит из 56 000 изображений для обучения и 12 000 изображений для валидации и тестирования. Изображения из этого набора данных способствуют эффективному обучению модели глубокого обучения (DL).

ПараметрОписание
Название набора данныхНабор данных WikiArt
Источник набора данныхРепозиторий WikiArt (https://www.wikiart.org/)
ОбластьЦифровое искусство и живопись
Общее количество изображенийПриблизительно 80 000 произведений искусства
Обучающие изображения56,000
Валидационные изображения12,000
Тестовые изображения12,000
Художественные стили27 художественных стилей, включая Ренессанс, импрессионизм, кубизм, сюрреализм, экспрессионизм, реализм и абстрактное искусство
Разрешение исходного изображенияРазрешение исходных изображений варьировалось в зависимости от произведений искусства и источников. Изображения были приведены к единому разрешению 256. × 256 пикселей в процессе предварительной обработки.
Разрешение обученияИзображения изменены до размера 256 × 256 пикселей в ходе предварительной обработки перед обучением художественному стилю и синтезом изображений с использованием сегментационного руководства.
Разбиение набора данныхСтратифицированное случайное разбиение (70% — обучающая, 15% — валидационная и 15% — тестовая выборки) с использованием фиксированного значения seed 42 для генератора случайных чисел
Стратегия выборки стилейДля сохранения распределения 27 художественных стилей в обучающей, валидационной и тестовой подвыборках использовался метод стратифицированного пропорционального отбора.
Применение в данном исследованииИзучение художественного стиля, представление стиля и художественный синтез с использованием сегментации

Таблица 2: Характеристики набора данных WikiArt. Сводные данные о наборе данных WikiArt, использованном для изучения художественного стиля и синтеза изображений с заданным стилем. В таблице описаны источник набора данных, распределение изображений, охват художественных стилей, разделение данных, разрешение изображений и применение набора данных в рамках предлагаемой архитектуры SegCycle-SPADE.

Набор данных Miao Batik содержит 15 148 изображений, представляющих традиционные культурные мотивы народа мяо.32 Набор данных общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658). Перед обучением модели все изображения прошли визуальный осмотр, были приведены к размеру 256 × 256 пикселей, нормализованы и проверены на наличие поврежденных или дублирующих образцов. Скрининг контроля качества не привел к исключению каких-либо изображений; таким образом, все 15 148 изображений были сохранены для последующего анализа. Набор данных был случайным образом разделен на обучающую (70%), валидационную (15%) и тестовую (15%) подвыборки с использованием фиксированного случайного зерна 42 для обеспечения воспроизводимости разделения данных. Набор данных WikiArt был получен из официального репозитория WikiArt (https://www.wikiart.org/) и содержит более 80 000 произведений искусства, охватывающих 27 художественных стилей. Для экспериментов по изучению стиля 56 000 изображений использовались для обучения, 12 000 — для валидации и 12 000 — для тестирования.

Предобработка данных
Перед обучением предлагаемого фреймворка SegCycle-SPADE набор данных культурных мотивов мяо-батика и набор данных WikiArt прошли несколько этапов предобработки для обеспечения однообразного качества изображений и точного представления признаков. К обоим наборам данных был применен один и тот же базовый конвейер предобработки, включающий гауссово шумоподавление, нормализацию, изменение размера до единого входного разрешения и проверку качества изображений. При этом наборы данных выполняли разные функции в рамках фреймворка. Набор данных WikiArt использовался для изучения и синтеза художественного стиля, тогда как набор данных мяо-батика применялся преимущественно для сегментации и реконструкции культурных мотивов. Помимо этих ролей, специфичных для конкретных задач, никаких дополнительных изменений в предобработке наборов данных не вносилось. Чтобы обеспечить единообразную обработку моделью глубокого обучения (DL), изображения сначала были приведены к фиксированному разрешению. Этот шаг был необходим, так как изображения в обоих наборах данных имели разное разрешение в зависимости от источника. Изменение размера повысило вычислительную эффективность и предотвратило влияние размерных несоответствий на процесс обучения. Вторым этапом предобработки была нормализация, при которой значения пикселей были масштабированы до стандартного диапазона для стабилизации обновления градиентов во время обучения. Затем изображения обрабатывались с помощью гауссовой фильтрации для уменьшения шума, который мог исказить структуру культурных мотивов. Для набора данных мяо-батика существующие маски сегментации культурных мотивов, полученные непосредственно из оригинального источника набора данных, использовались без изменений для обучения и оценки семантической сегментации. Специально для данного исследования новые маски сегментации не создавались.

Если не указано иное, уравнения, описывающие общепринятые методы, были адаптированы из предыдущих исследований и процитированы соответствующим образом. Уравнения, описывающие предлагаемый метод CAFFM и комплексную оптимизационную структуру SegCycle-SPADE, были разработаны авторами специально для данного исследования.

Пусть входное изображение из набора данных будет представлено в виде Уравнения 1:

figure-protocol-2  (1)

Здесь H, W и C обозначают высоту, ширину изображения и количество цветовых каналов соответственно. Все изображения масштабируются до фиксированного размера H′ × W′, как показано в Уравнении 2:

figure-protocol-3

Здесь Ir — изображение с измененным размером. Нормализованные значения пикселей вычисляются согласно уравнению 3:

figure-protocol-4   (3)

Это способствует стабилизации процедуры обучения. Фильтрация шума выполняется с использованием фильтра Гаусса, как показано в уравнении 4:

figure-protocol-5

Здесь G(σ) — фильтр Гаусса, а * обозначает операцию свертки. Был использован гауссово ядро размером 5 × 5 со стандартным отклонением σ = 1.0. Для уменьшения краевых артефактов к граничным пикселям применялось зеркальное дополнение (reflective padding). Процесс шумоподавления выполнялся сразу после загрузки изображений, до масштабирования и нормализации. Для обеспечения единообразия предварительной обработки во всем исследовании одна и та же конфигурация фильтра применялась к каждому изображению в наборах данных Miao Batik и WikiArt. Для набора данных Miao Batik маски сегментации создаются в соответствии с Уравнением 5:

figure-protocol-6

Здесь M — это маска сегментации, используемая для управления моделью SegFormer.

Конвейер предварительной обработки начинается со сбора изображений из набора данных Miao Batik и набора данных WikiArt, как показано на рисунке 3. В процессе обучения методы аугментации данных не применялись. После предварительной обработки, которая включала изменение размера, нормализацию, гауссово шумоподавление и подготовку масок сегментации, изображения непосредственно использовались для обучения, валидации и тестирования предлагаемой структуры SegCycle-SPADE. Начальный этап конвейера предварительной обработки включает изменение размера изображений до фиксированного значения, что позволяет модели глубокого обучения обрабатывать изображения более эффективно. Вторым этапом является нормализация, которая преобразует значения пикселей в стандартизированный числовой диапазон и способствует сходимости модели. Третий этап включает удаление шума, в ходе которого изображения очищаются от нежелательных помех для улучшения распознавания паттернов. Кроме того, для набора данных Miao Batik аннотируются области с культурными мотивами, что позволяет генерировать маски, используемые в модуле сегментации предлагаемой модели для обеспечения сохранности культурных мотивов в процессе генерации. Конечным результатом этого этапа является очищенный набор данных, готовый для обучения модулей сегментации и генерации предлагаемой модели.

figure-protocol-7
Рисунок 3. Конвейер предварительной обработки данных для изображений культурного наследия. Схема рабочих процессов, иллюстрирующая процедуры предварительной обработки изображений, применяемые перед обучением модели. Конвейер включает сбор набора данных, изменение размера изображений, нормализацию, гауссово шумоподавление, использование существующих аннотаций культурных мотивов и подготовку масок сегментации. Полученные обработанные изображения и маски используются в качестве входных данных для семантической сегментации и реконструкции паттернов. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Перед обучением модели каждое изображение прошло процесс контроля качества. Датасет Miao Batik содержал 15 148 изображений. Поврежденные, дублирующие и низкокачественные образцы были удалены создателями исходного датасета; поэтому в ходе данного исследования в процессе контроля качества дополнительные изображения не исключались. Следовательно, для анализа были сохранены все 15 148 изображений. На этапе предобработки изображения загружались в формате RGB и масштабировались до размера 256 × 256 пикселей с помощью билинейной интерполяции. Значения пикселей были масштабированы из диапазона [0, 255] в диапазон [0, 1] путем деления на 255. Затем была выполнена поканальная нормализация с использованием средних значений [0.485, 0.456, 0.406] и значений стандартного отклонения [0.229, 0.224, 0.225] для красного, зеленого и синего каналов соответственно. Конвейер предобработки включал загрузку изображений, преобразование в RGB, изменение размера, масштабирование значений пикселей, нормализацию и преобразование в тензор. При необходимости изображения в градациях серого преобразовывались в трехканальный формат RGB для обеспечения совместимости с моделями DL. После предобработки изображения были разделены на обучающую, валидационную и тестовую выборки. На всех этапах работы архитектуры SegCycle-SPADE — включая семантическую сегментацию, слияние признаков, реконструкцию мотивов и художественный синтез на основе SPADE — использовалось единое входное разрешение 256 × 256 пикселей.

Семантическая сегментация паттернов с использованием SegFormer
После этого этапа предварительной обработки очищенные и нормализованные изображения из набора данных культурных мотивов Мяо-Батик и набора данных WikiArt подаются в модуль семантической сегментации, основанный на предложенной архитектуре SegFormer-B2. Целью этого этапа является правильная идентификация и разделение культурных мотивов, присутствующих в традиционных паттернах. Предложенная архитектура SegFormer основана на трансформерной архитектуре, которая включает иерархический кодировщик Transformer и легковесный декодировщик MLP для точного захвата как глобальной контекстной информации, так и детальной структурной информации из сложных традиционных паттернов. Сначала модель извлекает представления признаков на нескольких масштабах из входного изображения, после чего эти представления объединяются с помощью декодировщика для генерации точных сегментированных паттернов. Это обеспечивает правильную сегментацию паттернов на традиционном изображении на такие мотивы, как геометрические, растительные и символические узоры, отделяя их от фона при сохранении структурной целостности. Данная структурная информация впоследствии используется на более поздних этапах генерации паттернов в рамках архитектуры SegCycle-SPADE.

Пусть предварительно обработанное входное изображение будет представлено в виде уравнения 6:

figure-protocol-8    (6)

Энкодер SegFormer разделяет изображение на патчи и извлекает иерархические признаки с помощью трансформерных слоев, как показано в Уравнении 71:

figure-protocol-9

Здесь F обозначает многомасштабные карты признаков, полученные из трансформерного энкодера. Эти признаки кодируют как локальные текстурные паттерны, так и глобальные контекстуальные связи между областями мотивов. Модель SegFormer извлекает карты признаков в разных масштабах, как определено в Уравнении 8:

figure-protocol-10

Использование многомасштабных представлений облегчает обнаружение паттернов различных размеров в культурных мотивах. Наконец, признаки объединяются с помощью декодера MLP, как показано в Уравнении 91:
 figure-protocol-11

Здесь S обозначает итоговую прогнозируемую карту сегментации.

Остов SegFormer-B2 был инициализирован с использованием весов, предобученных на ImageNet, и впоследствии дообучен на наборе данных Miao Batik для сегментации культурных мотивов. Предобученный контрольный блок был получен из официальной реализации SegFormer. В частности, для инициализации остова SegFormer-B2 перед дообучением использовался предобученный на ImageNet-1K контрольный блок MIT-B2 (mit_b2.pth), предоставленный официальным репозиторием SegFormer. Предобученные веса соответствуют остову MIT-B2, выпущенному авторами SegFormer, и служили моделью инициализации для обучения семантической сегментации. Остальные слои, специфичные для данной задачи, перед началом обучения были инициализированы с использованием стандартных процедур инициализации весов PyTorch.

В архитектуре используется четырехэтапный иерархический кодировщик Transformer с перекрывающимися эмбеддингами патчей. На начальном этапе размер патча был установлен на уровне 7 × 7 с шагом 4. Для каждого из четырех этапов кодировщика размерности эмбеддингов составляли 64, 128, 320 и 512. На этих четырех этапах использовалось 1, 2, 5 и 8 многоголовых механизмов внутреннего внимания (multihead self-attention), а соответствующая глубина кодировщика составляла 3, 4, 6 и 3 слоя. Многомасштабные признаки, полученные от кодировщика, агрегировались с помощью легковесного декодера на базе MLP. Перед созданием итоговой карты сегментации декодер проецировал признаки с каждого этапа кодировщика в единое пространство эмбеддингов. Во всех блоках Transformer использовалась функция активации Gaussian Error Linear Unit (GELU). Для улучшения обобщающей способности и снижения переобучения при обучении применялся коэффициент дропаута 0.1.

На этапе обучения фреймворк SegFormer получает предварительно обработанные изображения из обоих наборов данных. Изображения из набора данных Miao Batik содержат области мотивов, которые служат метками для контролируемого обучения модели сегментации. Энкодер Transformer обрабатывает изображение целиком и фиксирует дальние связи между компонентами изображения, что особенно важно для традиционных узоров батика, содержащих пространственно распределенные мотивы. Иерархический механизм извлечения признаков одновременно фиксирует локальные структуры, такие как повторяющиеся геометрические текстуры. Декодер MLP обрабатывает эти извлеченные признаки и формирует маску сегментации, выделяющую области мотивов. Карты сегментации, созданные на этом этапе, в дальнейшем используются в качестве структурных входных данных для модуля внимания и этапа реконструкции узора, что способствует сохранению аутентичности генерируемых паттернов.

Культурные мотивы были разделены на различные классы для семантической сегментации в соответствии с их визуальными и культурными характеристиками. Таксономия сегментации включала анималистические мотивы (например, бабочек, рыб, птиц и другую символическую фауну), растительные мотивы (например, цветы, листья, лозы и ботанические узоры), геометрические мотивы (например, повторяющиеся фигуры, бордюры и абстрактные геометрические структуры), а также фоновые области, представляющие зоны без мотивов. Маски сегментации на уровне пикселей использовались для присвоения каждому пикселю одного из предопределенных классов. Целочисленные метки были закодированы следующим образом: Метка 0 = фон, Метка 1 = анималистические мотивы, Метка 2 = растительные мотивы и Метка 3 = геометрические мотивы. Аннотации сегментации и метки мотивов были получены непосредственно из первоначального источника набора данных Miao Batik. В данном исследовании не проводилось дополнительное ручное аннотирование, перемаркировка, проверка границ или процедуры экспертного подтверждения. Существующие аннотации, предоставленные создателями набора данных, использовались без изменений для обучения и оценки.

Модель SegFormer для сегментации культурных мотивов обрабатывает предварительно обработанные изображения из набора данных Miao Batik и набора данных WikiArt, используя механизм на основе трансформера для точного обнаружения областей с культурными узорами, как показано на Рисунке 4. Сначала в модель SegFormer подается входное изображение, содержащее традиционные культурные мотивы. Кодировщик Transformer извлекает как глобальную контекстную информацию, так и локальные структурные признаки из патчей изображения. Полученные многомасштабные признаки передаются в декодер сегментации, который использует смешанную сеть прямого распространения (Mix Feed-Forward Network) для уточнения представления признаков и улучшения обнаружения мотивов. Результатом работы модели SegFormer является маска сегментации, которая выделяет пиксели, соответствующие культурным узорам, подавляя при этом нерелевантную информацию фона. Изолированные культурные узоры затем служат структурным руководством для последующих этапов фреймворка SegCycle-SPADE.

figure-protocol-12
Рисунок 4. Семантическая сегментация культурных мотивов на основе SegFormer-B2. Архитектура модуля семантической сегментации SegFormer-B2, используемого для извлечения культурных мотивов и обученного исключительно на наборе данных Miao Batik. Структура состоит из энкодера на базе Transformer для многомасштабного извлечения признаков и легковесного декодера сегментации для генерации масок мотивов. Модель предсказывает четыре семантических класса — животное, растение, геометрический элемент и фон, при этом полученные маски сегментации определяют культурно значимые области мотивов, подавляя иррелевантную информацию фона. Результаты этой сегментации служат структурным ориентиром для последующих этапов слияния признаков, реконструкции и художественного синтеза в предлагаемой структуре SegCycle-SPADE. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

В предлагаемой структуре нет необходимости создавать новые аннотации сегментации. Набор данных Miao Batik был получен из уже существующего открытого источника, а модель была обучена с использованием соответствующей информации о мотивах, предоставленной создателями набора данных. В процессе обучения модель SegFormer генерировала карты семантической сегментации. В результате в данном исследовании не потребовалось использование дополнительного программного обеспечения для ручной аннотации, руководств по аннотированию или процедур контроля качества аннотаций.

CAFFM
Для улучшения взаимодействия между признаками семантической сегментации и представлениями генеративной реконструкции в исследовании также был предложен модуль CAFFM. Энкодер SegFormer-B2 передает семантические карты признаков в модуль CAFFM, в то время как этап реконструкции CycleGAN предоставляет генеративные карты признаков. Сначала используются слои линейной проекции для отображения обоих потоков признаков в общее пространство вложений. Для вычисления перекрестного внимания (cross-attention) с использованием сгенерированных тензоров признаков создаются представления запроса (Q), ключа (K) и значения (V). Затем с помощью многоголового перекрестного внимания моделируются взаимосвязи между информацией о структурных мотивах и элементами художественного стиля. К объединенным представлениям признаков затем применяются нормализация слоя, остаточные связи и сети прямого распространения с активацией GELU. Этап синтеза на основе SPADE получает выходные данные модуля CAFFM, что позволяет сохранить культурно значимые темы без ущерба для художественной целостности.

Для обеспечения совместимости признаков входные признаки сначала проецируются с помощью слоев линейной проекции в общее пространство вложений с размерностью вложения 256. Взаимосвязи между семантической структурной информацией и представлениями генеративного стиля затем моделируются с использованием механизма многоголового перекрестного внимания (MultiHead Cross-Attention) с восемью головами внимания. Вычисление перекрестного внимания использует векторы запроса (Query, Q), ключа (Key, K) и значения (Value, V), которые создаются специальными слоями линейного преобразования. Для повышения стабильности обучения и сохранения целостности признаков применяются остаточные связи (residual connections) и послойная нормализация (Layer Normalization) для дальнейшего улучшения объединенных представлений признаков. Нелинейное обучение признаков затем совершенствуется путем применения сети прямого распространения с функцией активации Gaussian Error Linear Unit (GELU). Модуль генерирует выходное представление признаков размерностью 256, которое передается на другие этапы для творческого синтеза. CAFFM успешно объединяет данные художественного стиля со структурами культурных мотивов, используя метод слияния на основе перекрестного внимания, что улучшает сохранение мотивов и визуальную согласованность реконструированных узоров культурного наследия.

В предлагаемой системе структурные признаки извлекаются из набора данных Miao Batik, в то время как стилистические признаки изучаются на основе набора данных WikiArt. Обозначим карту признаков, полученную с помощью сети сегментации SegFormer с использованием изображений из набора данных Miao Batik, как Fs, а карту признаков, полученную из ветви извлечения стилистических признаков с использованием изображений WikiArt, — как Fa. Предлагаемый CAFFM объединяет два домена признаков с помощью механизма перекрестного внимания для изучения как структурных, так и стилистических зависимостей культурных узоров. В таблице 3 приведены все архитектурные характеристики, включая размерности эмбеддингов, слои нормализации, функции активации и конфигурацию голов внимания. При размере входного изображения 256 × 256 пикселей энкодер SegFormer-B2 генерировал семантические карты признаков размером 64 × 64 × 128, а ветвь извлечения стилистических признаков — карты признаков размером 64 × 64 × 128. Обе карты признаков проецировались через обучаемые линейные слои в общее пространство эмбеддингов размерности 256 перед слиянием с помощью перекрестного внимания.

ПараметрКонфигурация
Предложенная архитектураSegCycle-SPADE
Модель семантической сегментацииSegFormer-B2
Стадии энкодера SegFormer4
Инициализация весовSegFormer-B2 с предобучением на ImageNet-1K (магистральная сеть MIT-B2)
Источник контрольной точкиОфициальный репозиторий NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); контрольная точка: segformer.b2.512x512.ade.160k
Стратегия дообученияСквозное дообучение (end-to-end) на наборе данных Miao Batik
Размер патча эмбеддинга7 × 7
Шаг патча4
Размерности эмбеддингов64, 128, 320 и 512
Глубина энкодера3, 4, 6 и 3
Количество голов внимания1, 2, 5 и 8
Тип декодераAll-MLP декодер
Функция активацииGELU
Коэффициент Dropout0.1
Модуль улучшения признаковМодуль слияния культурных признаков на основе перекрестного внимания (CAFFM)
Размерность эмбеддинга CAFFM256
Количество голов внимания CAFFM8
Масштабы слияния CAFFM4
Модель реконструкцииCycleGAN
Модель генерации стиляSPADE
Культурный набор данныхНабор данных Miao Batik
Набор данных стилейНабор данных WikiArt
Изображения Miao Batik15 148
Изображения WikiArtПриблизительно 80 000
Разрешение входных изображений256 × 256 пикселей
Цветовой форматRGB
Метод интерполяцииБилинейная интерполяция
Метод шумоподавленияГауссова фильтрация
Размер ядра Гаусса5 × 5
Сигма Гаусса (σ)1
Диапазон нормализации[0, 1]
Размер пакета (Batch Size)16
Количество эпох100
ОптимизаторAdam
Скорость обучения0.0002
Параметры Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0
Функции потерьПотери сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля
Стратегия разделения данныхОбучение / Валидация / Тестирование
Обучающая выборка70%
Валидационная выборка15%
Тестовая выборка15%
Случайное число (Random Seed)42
Метрики оценкиТочность сегментации, IoU, коэффициент Дайса, SSIM, PSNR и FID
Язык программированияPython 3.8.10
Фреймворк глубокого обученияPyTorch 1.10.0
Аппаратная платформаGPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11-е поколение), 32 GB RAM
Операционная средаUbuntu 20.04 LTS

Таблица 3: Экспериментальная установка и конфигурация модели. Сводка архитектурных компонентов, конфигурации обучения, настроек предобработки, наборов данных, параметров оптимизации, метрик оценки и вычислительной среды, использованных для реализации и оценки предлагаемого фреймворка SegCycle-SPADE.

Модуль внимания сначала отображает карту признаков в представления запроса (query), ключа (key) и значения (value) с помощью Уравнения 10:

figure-protocol-13

Здесь, Wq, Вки Втв представляют собой обучаемые весовые матрицы. Веса внимания рассчитываются на основе сходства между вектором запроса и вектором ключа с использованием Уравнение 1117

figure-protocol-14

Здесь dk — размерность вектора ключа. Улучшенное представление признаков вычисляется путем умножения весов внимания на матрицу значений с использованием уравнения 12:

figure-protocol-15

Здесь Fa — это улучшенное представление признаков карты признаков. Улучшенное представление признаков вычисляется путем объединения исходных признаков сегментации с улучшенными признаками, полученными с помощью механизма внимания, согласно Уравнению 13:

figure-protocol-16                                

Здесь Fe представляет собой улучшенную карту признаков, используемую для реконструкции паттерна. CAFFM расширен многомасштабным механизмом перекрестного внимания для извлечения признаков культурных мотивов в различных масштабах. Пусть Fsi обозначает признаки сегментации в масштабе i, а Faj — признаки художественного стиля в том же масштабе. Итоговое представление признаков определяется с помощью уравнения 14:

  figure-protocol-17

Здесь Qi, Ki и Vi соответственно представляют собой матрицы запроса (query), ключа (key) и значения (value) на масштабе i, а N обозначает количество масштабов признаков. В данном исследовании N = 4, что соответствует картам признаков, извлеченным при пространственных разрешениях 1/4, 1/8, 1/16 и 1/32 от размера исходного изображения. Эти многомасштабные представления признаков были объединены с использованием обучаемых весов внимания перед реконструкцией и художественным синтезом. Приведенное расширение позволяет методу извлекать глобальные культурные мотивы и текстуры для реконструкции культурных узоров. CAFFM расположен между этапом сегментации на базе SegFormer и этапом творческого синтеза на базе SPADE в предлагаемой системе SegCycle-SPADE. Сначала, пока CycleGAN параллельно создает признаки реконструкции со стилистической и паттерн-зависимой информацией, SegFormer-B2 восстанавливает семантические карты признаков, которые описывают структурные свойства культурных мотивов. Модуль CAFFM принимает эти два потока признаков и использует слияние на основе перекрестного внимания (cross-attention) для выявления взаимосвязей между структурными и художественными представлениями. Затем полученные объединенные карты признаков направляются в модуль SPADE для творческого синтеза под управлением сегментации, чтобы создать культурно достоверные узоры при сохранении семантической согласованности и структурных особенностей.

Реконструкция паттернов с использованием CycleGAN
После завершения этапа улучшения признаков на основе механизма внимания карты признаков будут содержать усиленные структуры культурных мотивов. Однако карты признаков все еще могут содержать неполные или поврежденные области паттернов. Следовательно, для решения проблемы реконструкции паттернов в предлагаемой архитектуре будет использоваться модель CycleGAN. В рамках данной архитектуры двумя доменами будут являться исходные паттерны культурных мотивов и реконструированные паттерны культурных мотивов. Используя улучшенные признаки с предыдущих этапов, модель CycleGAN реконструирует культурные паттерны, сохраняя при этом структурную целостность. Это обеспечит сохранение пространственного расположения таких культурных паттернов, как геометрические, растительные и символические узоры. Исходные изображения батика народа мяо подвергались операциям случайного маскирования и частичного перекрытия для создания неполных или поврежденных культурных мотивов. Эти процедуры деградации имитировали отсутствие фрагментов паттернов и структурные повреждения, которые часто наблюдаются в изношенных объектах культурного наследия. Деградированные изображения использовались в качестве входных данных для модуля реконструкции, а соответствующие исходные изображения служили эталонами для оценки эффективности и качества реконструкции. Такая стратегия позволила модели изучить восстановление недостающих структур мотивов при сохранении семантической согласованности и культурных особенностей.

Пусть X будет областью неполных культурных паттернов, а Y — областью реконструированных культурных паттернов. Два генератора обучаются выполнять двунаправленное отображение с использованием Уравнения 15:

 figure-protocol-18

Здесь GE используется для реконструкции структур мотивов, а FM — для сопоставления паттернов с исходным доменом. Адверсативная функция потерь используется для обеспечения реалистичности реконструированных паттернов (Уравнение 16)30

figure-protocol-19

Здесь DY — это дискриминатор, используемый для разграничения реальных и реконструированных паттернов, а GE(x) обозначает сгенерированный реконструированный паттерн. CycleGAN также обеспечивает циклическую согласованность для сохранения структурного расположения культурных мотивов (Уравнение 17)30.

figure-protocol-20

Итоговая функция потерь определяется с помощью уравнения 1830:

figure-protocol-21

Здесь λi обозначает весовой коэффициент функции потерь циклической согласованности; в процессе обучения он был установлен равным 10, что соответствует исходной формулировке CycleGAN. Данное значение было выбрано для обеспечения баланса между состязательным обучением и согласованностью реконструкции между исходным и целевым доменами.

Модуль реконструкции CycleGAN состоит из двух генераторов и двух дискриминаторов для двунаправленного преобразования изображений. Каждый генератор построен на архитектуре остаточной сети (residual network), включающей начальный сверточный слой 7 × 7, за которым следуют два сверточных слоя понижения дискретизации (downsampling), девять остаточных блоков и два слоя повышения дискретизации (upsampling). Во всех операциях свертки используется размер ядра 3 × 3, за исключением входного слоя, где для улучшенного извлечения признаков применяется ядро 7 × 7. После каждого сверточного слоя применяется инстанс-нормализация (Instance Normalization) для повышения стабильности обучения, а во всей сети генератора используется функция активации ReLU. Выходной слой использует функцию активации Tanh для генерации нормализованных выходных изображений. Дискриминатор построен на архитектуре PatchGAN 70 × 70, состоящей из серии сверточных слоев с размером ядра 4 × 4 и постепенно увеличивающимся количеством каналов признаков. В дискриминаторе используются инстанс-нормализация и активация LeakyReLU (отрицательный наклон = 0,2) для улучшения дискриминации признаков и состязательного обучения. Модуль CycleGAN получает на вход предварительно обработанные изображения культурных мотивов и генерирует реконструированные представления паттернов, которые затем передаются в CAFFM для интеграции с признаками сегментации. Обучение CycleGAN проводилось с использованием оптимизатора Adam (β₁ = 0,5, β₂ = 0,999) с начальной скоростью обучения 0,0002. Скорость обучения поддерживалась неизменной в течение первых 100 эпох, а затем линейно снижалась до нуля на протяжении оставшегося периода обучения. Для стабилизации обучения дискриминатора использовался буфер воспроизведения (replay buffer), содержащий 50 ранее сгенерированных изображений. Обновление генераторов и дискриминаторов выполнялось в соотношении 1:1: одно обновление генератора следовало за одним обновлением дискриминатора в каждой итерации обучения.

Процесс реконструкции CycleGAN основан на улучшенных картах признаков, полученных с помощью механизма CAFFM, представленного на рисунке 5. Карты признаков содержат усиленные культурные мотивы, полученные на предыдущих этапах сегментации и CAFFM. Эти карты признаков используются в качестве входных данных для первого генератора GE. Первый генератор GE изучает отображение, необходимое для реконструкции культурных паттернов. Затем выходные данные подаются на дискриминатор DY для разграничения реальных культурных паттернов и реконструированных. Дискриминатор DY помогает генератору GE создавать реалистичные результаты. Чтобы культурные паттерны не искажались в процессе реконструкции, второй генератор FM выполняет отображение с соблюдением циклической согласованности (cycle-consistency mapping). Второй генератор FM переносит выходные данные обратно в исходный домен. Затем результаты оцениваются дискриминатором для проверки их реалистичности. Конечные результаты впоследствии передаются в модуль SPADE для генерации художественного стиля на следующем этапе предлагаемого фреймворка SegCycle-SPADE.

figure-protocol-22
Рисунок 5. Схема реконструкции паттернов на основе CycleGAN. Схема работы модуля реконструкции CycleGAN. В качестве входных данных для сети-генератора используются представления признаков с усиленным вниманием (attention-enhanced feature representations) для реконструкции незавершенных культурных мотивов. Дискриминатор оценивает реконструированные результаты в сравнении с эталонными паттернами, в то время как циклическое согласованное отображение (cycle-consistency mapping) обеспечивает сохранение структурной целостности при двунаправленном переводе изображений. Затем реконструированные мотивы передаются в модуль SPADE для синтеза художественного стиля. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Генерация художественного стиля с помощью SPADE
Впоследствии реконструированные культурные мотивы подвергаются обработке модулем SPADE для генерации художественного стиля. Основная цель модуля SPADE заключается в добавлении более визуально насыщенных текстур художественного стиля к реконструированным культурным мотивам без нарушения их структурного расположения. Модуль SPADE представляет собой метод условной генерации изображений, использующий концепцию сегментации изображений для создания новых визуальных образов. Многоканальные семантические карты, соответствующие заранее определенным классам мотивов, были закодированы на основе масок семантической сегментации, полученных с помощью SegFormer-B2. Генератор SPADE получал эти закодированные карты в качестве условных входных данных. Параметры пространственно-адаптивного масштабирования (γ) и смещения (β) формировались путем обработки семантических карт через сверточные слои внутри каждого слоя SPADE. Таким образом, генератор мог сохранять границы мотивов, их структурное расположение и семантическую информацию в процессе художественного синтеза, применяя эти параметры к нормализованным активациям признаков. Семантическое управление могло влиять как на высокоуровневую структурную реконструкцию, так и на низкоуровневый синтез текстур, поскольку процесс кондиционирования осуществлялся на нескольких слоях генератора SPADE. В результате созданные художественные паттерны объединили в себе стилистические черты, заимствованные из набора данных WikiArt, при сохранении структур культурных мотивов, выявленных на этапе сегментации.

Набор данных WikiArt, включающий работы из 27 различных художественных категорий, таких как Ренессанс, Импрессионизм, Кубизм, Экспрессионизм, Сюрреализм, Реализм и Абстрактное искусство, был использован в качестве основного ресурса для изучения художественных стилей. Для ознакомления модели с разнообразными творческими особенностями и улучшения обобщения стилей в процессе обучения из различных категорий случайным образом выбирались изображения стилей. Набор данных был разделен на обучающую, валидационную и тестовую подвыборки со сбалансированным представлением художественных категорий для уменьшения стилистического смещения. Для обеспечения сбалансированного представительства всех 27 художественных категорий использовался стратифицированный отбор. Образцы из каждой категории пропорционально распределялись между обучающей, валидационной и тестовой подвыборками с сохранением исходного распределения классов. Модуль CAFFM использовался для объединения стилистических аспектов, полученных из изображений WikiArt, с признаками реконструкции, созданными CycleGAN. Для того чтобы сеть синтеза могла переносить художественные качества, сохраняя при этом семантическую структуру и границы культурных мотивов, полученные из карт сегментации, результирующие объединенные представления подавались в качестве кондиционирующей информации в генератор SPADE. Благодаря этой технике кондиционирования стиля предлагаемая архитектура позволила создавать культурно аутентичные художественные паттерны с согласованными структурными и стилистическими представлениями.

SPADE также вводит пространственно-адаптивные параметры, которые зависят от карты сегментации. Параметры могут быть определены, как показано в Уравнении 191:

figure-protocol-23

Здесь γ(S) — пространственно-варьируемый параметр масштаба, а β(S) — пространственно-варьируемый параметр смещения. Эти параметры позволяют генератору создавать различные текстуры и стили в зависимости от семантической области на изображениях. Итоговое произведение культурного искусства может быть определено следующим образом, как показано в Уравнении 20:

 figure-protocol-24

Здесь GE — это генератор SPADE, XrP — реконструированный узор, а SM — карта сегментации. Итоговое изображение сохраняет структурную целостность культурных мотивов, при этом улучшая художественный вид. Для оптимизации предложенной архитектуры SegCycle-SPADE использовалась комбинированная функция потерь, балансирующая точность семантической сегментации, сохранение культурных мотивов, качество реконструкции узора и согласованность художественного стиля. Общая цель обучения была определена как взвешенная смесь потерь сегментации (Lseg), состязательных потерь (Ladv), потерь циклической согласованности (Lcycle), потерь реконструкции (Lrecon), потерь сохранения мотивов (Lmotif) и потерь согласованности стиля (Lstyle). Общая функция потерь определена в Уравнении 21:

figure-protocol-25  (21)

Для обеспечения структурного соответствия между входными и реконструированными культурными мотивами коэффициент потерь циклической согласованности был установлен равным 10. Чтобы сохранить детализированные признаки мотивов и повысить визуальную точность, коэффициент потерь реконструкции был установлен на уровне 5. Для акцентирования внимания на сохранении культурно значимых структурных паттернов в процессе художественного синтеза для потерь по сохранению мотивов был использован коэффициент 2. Чтобы способствовать переносу художественного стиля без излишнего искажения семантических структур мотивов, коэффициент потерь стилевой согласованности был скорректирован до 1. Для поддержания сбалансированного вклада между созданием реалистичного изображения и точной сегментацией мотивов сегментационным потерям и состязательным потерям были присвоены равные веса. Для расчета потерь стилевой согласованности использовались представления стиля на основе признаков из набора данных WikiArt. В частности, характеристики художественного стиля фиксировались с помощью корреляций матриц Грама, полученных из карт глубоких признаков. Для расчета стилевых потерь использовалась разность норм Фробениуса между матрицами Грама целевого изображения стиля и сгенерированного изображения, как показано в Уравнении 22:

figure-protocol-26

Здесь, Gл вычисляется ли матрица Грама на основе лth слой объектов, IГен обозначает сгенерированное художественное изображение, Iстиль обозначает целевое изображение стиля из набора данных WikiArt, и F обозначает норму Фробениуса. Такая формулировка позволяет предложенной структуре сохранять художественные характеристики, поддерживая при этом структурную и семантическую целостность культурных мотивов.

Объединенные представления признаков, создаваемые модулем CAFFM, используются в качестве обуславливающих входных данных для модуля SPADE, который служит компонентом художественного синтеза в предлагаемой архитектуре. Генератор SPADE состоит из семи остаточных блоков SPADE с размерностью латентных признаков 256 каналов и генерирует выходные изображения с разрешением 256 × 256 пикселей. Карты семантической сегментации, полученные из модуля SegFormer–CAFFM, используются в качестве обуславливающих входных данных во всех остаточных слоях SPADE. Слои SPADE применяются перед функциями активации внутри каждого остаточного блока, что обеспечивает семантическое обуславливание под руководством сегментации. Посредством последовательных операций повышения дискретизации (upsampling) и свертки латентное представление признаков постепенно уточняется для создания художественных паттернов высокого разрешения при сохранении семантической согласованности и структуры мотивов. Во всем генераторе используются функции активации LeakyReLU, а на выходном слое применяется функция активации Tanh для получения нормализованных изображений.

Алгоритм и рабочий процесс
Фреймворк SegCycle-SPADE объединяет семантическую сегментацию, слияние признаков, реконструкцию паттернов и синтез художественного стиля в рамках единого конвейера обучения. Рабочий процесс начинается со сбора и предобработки набора данных, включая изменение размера изображений, нормализацию, шумоподавление и подготовку масок сегментации. Предобработанные изображения затем обрабатываются с помощью сети сегментации SegFormer-B2 для извлечения семантических представлений мотивов. Полученные признаки сегментации объединяются с признаками реконструкции посредством CAFFM, что обеспечивает взаимодействие между информацией о структурных мотивах и художественными представлениями признаков. Объединенные карты признаков затем передаются в модуль реконструкции CycleGAN, который восстанавливает неполные структуры культурных мотивов, сохраняя семантическую согласованность. Реконструированные паттерны впоследствии поступают в генератор SPADE для художественного синтеза под управлением сегментации, что позволяет улучшить стилистику при сохранении границ мотивов и структурной достоверности. В процессе обучения параметры модели оптимизируются с помощью составной функции потерь, описанной в уравнениях 21 и 22, которая балансирует точность сегментации, сохранение мотивов, качество реконструкции и согласованность художественного стиля. Подробный пошаговый рабочий процесс реализации, включая загрузку набора данных, предобработку, инициализацию модели, итерации обучения, процедуры валидации, выбор контрольных точек и окончательную оценку, представлен в дополнительном файле 1 (Алгоритм 1). Полный алгоритмический рабочий процесс был реализован с размером пакета 16, скоростью обучения 0.0002 и 100 эпохами обучения. Для разделения набора данных, инициализации модели и всех экспериментов по обучению использовался фиксированный случайный seed 42. Этот seed последовательно применялся в генераторах случайных чисел Python, NumPy и PyTorch для обеспечения воспроизводимости. Оптимизатор Adam был настроен с параметрами β₁ = 0.5, β₂ = 0.999 и без затухания весов (weight decay = 0). Контрольные точки модели выбирались на основе наивысшего показателя IoU на валидационном наборе данных.

Оптимизация функции потерь
Для сохранения структур культурных мотивов в процессе реконструкции и художественного синтеза в предлагаемой архитектуре используется комбинированная целевая функция оптимизации, которая объединяет потери при сегментации, состязательные потери, потери циклической согласованности, потери реконструкции, потери сохранения мотивов и потери согласованности стиля. Полная математическая формулировка, весовые коэффициенты и определение потерь стиля приведены в уравнениях 21 и 22 в подразделе Artistic Style Generation using SPADE. Компонент сохранения мотивов штрафует структурные отклонения между прогнозируемыми областями мотивов и соответствующими масками сегментации истинных значений (ground-truth), тем самым способствуя сохранению культурно значимых структур узора на протяжении всего процесса реконструкции.

Результаты

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Предложенная платформа SegCycle-SPADE была протестирована с использованием двух наборов данных: набора данных культурных мотивов мяо-батик и набора данных WikiArt. Набор данных мяо-батик содержит изображения традиционного культурного наследия и использовался преимущественно для задач семантической сегментации и структурной реконструкции, в то время как набор данных WikiArt содержит разнообразные художественные стили и применялся для изучения и генерации художественных стилей. Изображения из обоих наборов данных обрабатывались через полный конвейер SegCycle-SPADE, включающий семантическую сегментацию, CAFFM, реконструкцию паттернов и генерацию художественного стиля на основе SPADE. Интеграция информации о культурных мотивах и представлений о художественном стиле позволила платформе создавать культурно значимые и визуально согласованные результаты.

Все эксперименты проводились на рабочей станции с поддержкой GPU, оснащенной процессором Intel Core i7 и графическим процессором NVIDIA. В частности, эксперименты выполнялись на рабочей станции с процессором Intel Core i7 (11-го поколения), графическим процессором NVIDIA RTX 3090 с 24 GB VRAM и 32 GB системной памяти. Модели были реализованы с использованием Python 3.8 и PyTorch 1.10 с ускорением CUDA. Обучение проводилось на одной GPU без использования распределенного обучения. Во всех экспериментах использовалась стандартная точность FP32; обучение со смешанной точностью не применялось. Для оптимизации использовался алгоритм Adam с размером пакета 16 в течение 100 эпох обучения. В Таблице 3 обобщены параметры реализации и вычислительная среда, использованные в данном исследовании.

Предлагаемая архитектура состоит из четырех основных компонентов: SegFormer-B2 для семантической сегментации, CAFFM для слияния признаков, CycleGAN для реконструкции мотивов и SPADE для синтеза художественного стиля. Перед началом обучения изображения из обоих наборов данных были приведены к размеру 256 × 256 пикселей. Такое стандартизированное разрешение обеспечило вычислительную эффективность при сохранении важных деталей мотивов, а также способствовало стабильному состязательному обучению модулей CycleGAN и SPADE.

Эффективность предлагаемой структуры оценивали с помощью метрик сегментации и показателей качества изображений, включая точность сегментации (Segmentation Accuracy), IoU, коэффициент сходства Дайса (Dice), SSIM, PSNR и FID. Визуальная достоверность оценивалась качественно путем визуального осмотра сгенерированных культурных паттернов. Качественная оценка была сосредоточена на сохранении мотивов, семантической согласованности, культурных особенностях и художественном виде по сравнению с эталонными культурными мотивами. Визуальная достоверность не использовалась в качестве независимой количественной метрики оценки.

Количественная оценка предлагаемой структуры была проведена с использованием следующих метрик.

Точность сегментации была вычислена с помощью Уравнения 23:

figure-results-1

Здесь TP, TN, FP и FN обозначают истинно положительные, истинно отрицательные, ложноположительные и ложноотрицательные результаты соответственно.

IoU рассчитывали по формуле 24:

 figure-results-2

Коэффициент сходства Дайса (Dice) был рассчитан с использованием формулы 25:

figure-results-3

Для оценки перцептивного сходства изображений использовался индекс SSIM, который определяется согласно уравнению 2633:

figure-results-4  (26)

Здесь μ обозначает среднюю интенсивность, σ — дисперсию, σxy — ковариацию между изображениями, а C1 и C2 являются стабилизирующими константами.

PSNR представляет собой метрику, обычно используемую для оценки качества сгенерированных изображений, и определяется в Уравнении 2733:

figure-results-5

Здесь MaxI обозначает максимально возможное значение пикселя изображения, а MSE — среднеквадратичную ошибку между оригинальным и реконструированным изображениями.

FID можно рассчитать с использованием средних значений и ковариационных матриц, как показано в уравнении 2833:

figure-results-6   (28)

Здесь μr — это среднее значение реального изображения, μg — среднее значение сгенерированного изображения, а Σr и Σg — ковариационные матрицы реальных и сгенерированных изображений соответственно.

Для сравнения эффективности предложенная платформа была оценена в сопоставлении с репрезентативными методами, обычно используемыми для семантической сегментации, реконструкции изображений и художественной генерации изображений. В качестве базовых методов сегментации были выбраны U-Net и DeepLabV3+, а в качестве базовых методов реконструкции — Pix2Pix и CycleGAN. В качестве репрезентативных методов художественной генерации изображений использовались StyleGAN и AttentionGAN. Данные сравнения проводились для оценки эффективности SegCycle-SPADE в сохранении информации о структурных мотивах при одновременном повышении художественного качества.

Каждый эксперимент повторяли пять раз для оценки стабильности и воспроизводимости результатов. Для разделения набора данных использовали фиксированный случайный seed 42, чтобы обеспечить единообразие обучающей, валидационной и тестовой выборок во всех экспериментах. Результаты представлены в виде среднего значения ± стандартного отклонения. Низкие значения стандартного отклонения, наблюдаемые для Accuracy, IoU, Dice, SSIM, PSNR и FID, указывают на то, что предложенная архитектура обеспечила стабильную производительность при повторных экспериментальных запусках. Статистическая значимость оценивалась с помощью парного t-критерия; различия считались статистически значимыми при p < 0.05. Поскольку все модели оценивались на одних и тех же разделах набора данных, были получены парные показатели производительности для повторных запусков, что обосновывает использование парного t-критерия. Для контроля семейной ошибки, связанной с множественными попарными сравнениями, применялась поправка Бонферрони, а статистическая значимость определялась с использованием скорректированного порога α/n, где n — количество попарных сравнений.

Экспериментальные результаты убедительно подтверждают эффективность предложенного фреймворка SegCycle-SPADE. Превосходное качество сегментации, достигнутое с помощью SegFormer-B2, демонстрирует его способность точно определять и сохранять границы культурно значимых мотивов. Повышение показателей IoU и коэффициентов Dice дополнительно указывает на эффективное сохранение семантических структур мотивов на протяжении всего конвейера обработки. Интеграция CycleGAN и SPADE позволила успешно реконструировать неполные структуры мотивов при сохранении детальных визуальных элементов, что отражено в улучшении значений SSIM и PSNR. Кроме того, более низкие значения FID свидетельствуют о том, что сгенерированные художественные паттерны обладают большим сходством с подлинными культурными и художественными изображениями, что говорит о повышенной стилистической согласованности и визуальном реализме.

Модуль CAFFM внес значительный вклад в эти улучшения, обеспечив эффективное взаимодействие между структурной информацией, полученной в результате сегментации, и генеративными представлениями стиля. Благодаря слиянию признаков на основе перекрестного внимания (cross-attention), CAFFM повысил как структурную точность, так и художественную достоверность, сохранив при этом дальние связи между культурными мотивами.

Рисунок 6 демонстрирует сравнение точности сегментации предлагаемой структуры SegCycle-SPADE и существующих методов на наборах данных Miao Batik и WikiArt. Традиционные подходы к сегментации, такие как U-Net и DeepLabV3+, показали конкурентоспособные результаты благодаря их способности изучать пространственные представления. Однако Pix2Pix и CycleGAN продемонстрировали более низкую точность сегментации, поскольку они не были специально разработаны для задач сегментации. Предложенная структура SegCycle-SPADE достигла наивысшей точности сегментации на обоих наборах данных благодаря интеграции SegFormer-B2 и улучшения признаков на основе CAFFM.

figure-results-7
Рисунок 6. Сравнение точности сегментации при использовании различных методов. Сравнение точности сегментации, полученной с помощью U-Net, DeepLabV3+, Pix2Pix, CycleGAN и предложенного фреймворка SegCycle-SPADE на наборах данных Miao Batik и WikiArt. Результаты представлены в виде среднего значения ± стандартного отклонения (SD) по пяти независимым запускам (n = 5). Планки погрешностей соответствуют одному стандартному отклонению. Более высокие значения указывают на улучшение качества сегментации. Предложенный фреймворк SegCycle-SPADE продемонстрировал самую высокую точность сегментации на обоих наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 7 представляет сравнение IoU между оцениваемыми методами. U-Net и DeepLabV3+ продемонстрировали высокие показатели перекрытия благодаря своим архитектурам, ориентированным на сегментацию. Напротив, Pix2Pix и CycleGAN показали более низкие значения IoU, поскольку их основной целью является преобразование изображений, а не семантическая сегментация. Предложенная архитектура SegCycle-SPADE достигла самых высоких значений IoU на обоих наборах данных, что указывает на улучшенную локализацию и сохранение областей с культурными мотивами.

figure-results-8
Рисунок 7. Сравнение показателей пересечения над объединением (IoU) для сегментации культурных мотивов. Сравнение эффективности IoU различных методов сегментации на наборах данных Miao Batik и WikiArt. Результаты представлены в виде среднего значения ± стандартного отклонения (SD) по пяти независимым запускам (n = 5). Планки погрешностей соответствуют одному стандартному отклонению. Более высокие значения IoU указывают на большее перекрытие между предсказанными и эталонными областями мотивов и лучшую сохранность границ мотивов. Предложенная архитектура SegCycle-SPADE достигла самых высоких показателей IoU на обоих наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Рисунок 8 представляет сравнение коэффициента сходства Дайса. Коэффициент Дайса измеряет степень перекрытия между предсказанными масками сегментации и истинными областями мотивов. Традиционные подходы к сегментации достигли относительно высоких значений коэффициента Дайса благодаря их эффективности в изучении пространственных структур. Однако предложенная архитектура SegCycle-SPADE продемонстрировала самые высокие показатели Дайса на обоих наборах данных, что свидетельствует о повышенной согласованности сегментации и лучшем сохранении мотивов.

figure-results-9
Рисунок 8. Сравнение коэффициента Дайса для сегментации культурных мотивов. Сравнение значений коэффициента Дайса, полученных с использованием различных подходов к сегментации на наборах данных Miao Batik и WikiArt. Коэффициент Дайса оценивает степень перекрытия между предсказанными масками сегментации и эталонными масками, при этом более высокие значения указывают на более высокую эффективность сегментации и идентификации областей мотивов. Предложенная архитектура SegCycle-SPADE достигла самых высоких значений коэффициента Дайса для обоих наборов данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Рисунок 9 представляет сравнение SSIM между реконструированными культурными паттернами. Методы на основе GAN, такие как Pix2Pix, CycleGAN и StyleGAN, достигли более высоких значений SSIM, чем традиционные методы сегментации, так как они были разработаны для генерации изображений. Тем не менее, предложенная архитектура SegCycle-SPADE достигла самых высоких значений SSIM на обоих наборах данных, что указывает на превосходное сохранение структурных деталей и художественную целостность.figure-results-10

Рисунок 9. Сравнение индекса структурного сходства (SSIM). Сравнение значений индекса структурного сходства (SSIM), полученных с использованием различных методов реконструкции на наборах данных Miao Batik и WikiArt. Результаты представлены как среднее значение ± стандартное отклонение (SD) по пяти независимым запускам (n = 5). Планки погрешностей указывают одно стандартное отклонение. Более высокие значения SSIM свидетельствуют о большем структурном сходстве между реконструированными и эталонными паттернами. Предложенная архитектура SegCycle-SPADE достигла самых высоких показателей SSIM для обоих наборов данных. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Для оценки реалистичности и сходства распределения сгенерированных художественных паттернов использовали FID. Расчет FID выполняли с помощью предобученной сети Inception-v3, извлекая векторы признаков из слоя pool3, что позволило получить 2048-мерные представления признаков. Перед извлечением признаков сгенерированные и эталонные изображения приводили к размеру 299 × 299 пикселей с помощью билинейной интерполяции и нормализовали в соответствии со стандартным протоколом предобработки Inception-v3. FID рассчитывали на основе распределений признаков, извлеченных из независимого тестового набора данных. Среднее значение и ковариационная статистика оценивались по эмбеддингам признаков и использовались в стандартной формуле FID.

Как показано в Таблице 4, традиционные подходы к генерации изображений, такие как Pix2Pix и CycleGAN, продемонстрировали относительно высокие значения FID из-за отсутствия явного структурного руководства. StyleGAN и AttentionGAN достигли более низких значений FID благодаря улучшенным возможностям обучения признакам. Однако предложенный фреймворк SegCycle-SPADE показал самые низкие значения FID на обоих наборах данных, продемонстрировав превосходный реализм изображений, стилистическую согласованность и сохранение культурных мотивов.

МетодНабор данных батика народа мяо (FID)Набор данных WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (предлагаемый метод)28.531.2

Таблица 4: Результаты расчета расстояния Фреше — Инцепции (FID) для реконструкции культурных узоров. Сравнение показателей расстояния Фреше — Инцепции (FID), полученных с помощью предлагаемого фреймворка SegCycle-SPADE и базовых генеративных моделей на наборах данных Miao Batik и WikiArt. Более низкие значения FID указывают на большее сходство между распределениями признаков сгенерированных и реальных изображений и, следовательно, отражают повышенный визуальный реализм реконструированных культурных узоров.

Рисунок 10 демонстрирует сравнение качества реконструкции, достигнутого различными методами. Качество реконструкции (%) рассчитывалось путем перевода показателя SSIM между реконструированным изображением и соответствующим эталонным изображением в процентную шкалу (SSIM × 100). Более высокие значения в процентах указывают на более высокую структурную точность и визуальное сходство с оригинальным культурным мотивом. Традиционные генеративные модели, такие как Pix2Pix и CycleGAN, показали умеренные результаты реконструкции. Более совершенные архитектуры, включая StyleGAN и AttentionGAN, обеспечили улучшенное качество реконструкции благодаря расширенным возможностям изучения признаков. Тем не менее, предложенная платформа SegCycle-SPADE достигла наивысшего качества реконструкции за счет интеграции семантической сегментации, объединения признаков с использованием перекрестного внимания (cross-attention), обучения реконструкции и художественного синтеза.

figure-results-11
Рисунок 10. Сравнение качества реконструкции паттернов. Сравнение качества реконструкции, достигнутого с использованием Pix2Pix, CycleGAN, StyleGAN, AttentionGAN и предлагаемой архитектуры SegCycle-SPADE на наборах данных Miao Batik и WikiArt. Результаты представлены как среднее значение ± стандартное отклонение (SD) по пяти независимым запускам (n = 5). Планки погрешностей соответствуют одному стандартному отклонению. Более высокие значения указывают на улучшенное сохранение структурных деталей, семантическую согласованность и визуальную точность. Предлагаемая архитектура SegCycle-SPADE достигла наивысших показателей качества реконструкции на обоих наборах данных. Пожалуйста, нажмите здесь, чтобы просмотреть этот рисунок в большем размере.

Для оценки точности реконструкции использовался показатель PSNR, который измеряет сходство на уровне пикселей между реконструированными и соответствующими эталонными изображениями. PSNR рассчитывался для каждого реконструированного изображения относительно исходного изображения батика народа мяо, использовавшегося в качестве эталонного значения (ground-truth). Более высокие значения PSNR указывают на меньшую ошибку реконструкции. Как показано в Таблице 5, модели Pix2Pix и CycleGAN достигли умеренных значений PSNR, так как они реконструировали узоры без явного структурного руководства. StyleGAN и AttentionGAN продемонстрировали более высокие значения PSNR благодаря более глубокому изучению признаков. Предложенная платформа SegCycle-SPADE достигла самых высоких значений PSNR на обоих наборах данных, что свидетельствует о превосходной точности реконструкции и сохранении структур культурных мотивов.

МетодНабор данных Miao Batik
(PSNR, dB)
Набор данных WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (предложенный)32.431.2

Таблица 5: Результаты пикового отношения сигнал/шум (PSNR) для реконструкции культурных паттернов. Сравнение значений пикового отношения сигнал/шум (PSNR), полученных с помощью предлагаемой структуры SegCycle-SPADE и базовых методов на наборах данных Miao Batik и WikiArt. Более высокие значения PSNR указывают на улучшенную точность реконструкции и снижение искажений относительно соответствующих эталонных изображений.

Рисунок 11 иллюстрирует сходимость предлагаемой архитектуры SegCycle-SPADE в процессе обучения. Кривые потерь представляют собой средние значения потерь при обучении, усредненные по пяти независимым циклам обучения. Чтобы уменьшить стохастическую вариативность и обеспечить более надежное представление сходимости обучения, значения потерь на каждой эпохе усреднялись по всем циклам. В течение начальных эпох обучения значения потерь были относительно высокими, так как модель все еще изучала представления признаков из входных данных. По мере продвижения обучения все компоненты потерь постепенно снижались и стабилизировались, что свидетельствует об успешной оптимизации целей сегментации, реконструкции и художественного синтеза. Наблюдаемый характер сходимости демонстрирует эффективность, стабильность и воспроизводимость предлагаемой архитектуры в процессе обучения.

figure-results-12
Рисунок 11. Сходимость обучения предлагаемой архитектуры SegCycle-SPADE. Кривые потерь при обучении предлагаемой архитектуры SegCycle-SPADE в течение 100 эпох обучения, усредненные по пяти независимым запускам (n = 5). На рисунке показана динамика общей функции потерь (LTotal), потерь сегментации (LSeg), потерь генератора (LG) и потерь дискриминатора (LD) в процессе обучения. Постепенное снижение и последующая стабилизация всех компонентов функции потерь свидетельствуют об успешной сходимости и стабильной оптимизации предлагаемой архитектуры. Пожалуйста, нажмите здесь, чтобы просмотреть увеличенную версию этого рисунка.

Абляционное исследование
Для оценки вклада каждого компонента в предлагаемую структуру SegCycle-SPADE было проведено абляционное исследование с использованием нескольких контролируемых конфигураций модели. Результаты обобщены в таблицах 6 и 7.

Конфигурация моделиТочность сегментации (%)IoU (пересечение над объединением)SSIM (индекс структурного сходства)
Только SegFormer87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (предлагаемый метод)93.80.860.93

Таблица 6: Абляционное исследование компонентов SegCycle-SPADE. Сравнение производительности последовательно улучшаемых конфигураций модели для оценки вклада отдельных компонентов системы. В исследовании изучается влияние семантической сегментации, модуля слияния культурных признаков на основе перекрестного внимания (CAFFM), реконструкции на базе CycleGAN и художественного синтеза на базе SPADE на точность сегментации, пересечение над объединением (IoU) и индекс структурного сходства (SSIM). Более высокие значения указывают на улучшенную сегментацию мотивов, качество реконструкции и сохранность структуры.

ВариантIoU (%)Коэффициент Дайса (%)SSIM (индекс структурного сходства)PSNR (дБ)ПИД (пламенно-ионизационный детектор) ↓
Только SegFormer84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (полная модель)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

Таблица 7: Анализ вклада компонентов предлагаемой архитектуры SegCycle-SPADE. Сравнение производительности отдельных вариантов архитектуры, использованных для оценки вклада CAFFM, CycleGAN, SPADE и полной архитектуры SegCycle-SPADE. Результаты представлены с использованием показателей пересечения над объединением (IoU), коэффициента Дайса, индекса структурного сходства (SSIM), пикового отношения сигнала к шуму (PSNR) и расстояния Фреше (FID). Более высокие значения IoU, Dice, SSIM и PSNR указывают на улучшение качества сегментации и реконструкции, тогда как более низкие значения FID свидетельствуют о большей визуальной реалистичности сгенерированных культурных паттернов.

Таблица 6 оценивает совокупный вклад основных компонентов структуры с использованием четырех конфигураций: (i) только SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN и (iv) SegFormer + CAFFM + CycleGAN + SPADE (предлагаемая структура). Базовая модель SegFormer достигла точности сегментации 87.3%, показателя IoU 0.76 и значения SSIM 0.82. Внедрение модуля CAFFM улучшило показатели по всем метрикам оценки, повысив точность сегментации до 89.6%, IoU до 0.79 и SSIM до 0.86. Добавление CycleGAN дополнительно расширило возможности структурной реконструкции, что привело к значению IoU 0.82 и SSIM 0.89. Полная структура SegCycle-SPADE продемонстрировала наилучшие общие результаты: точность сегментации 93.8%, IoU 0.86 и значение SSIM 0.93. Эти результаты показывают, что каждый компонент вносит постепенный вклад в повышение точности сегментации, сохранение структуры и качество реконструкции изображений.

Таблица 7 содержит более детальный анализ вклада отдельных компонентов структуры с использованием пяти вариантов модели: (i) только SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM и (v) полная модель, включающая SegFormer, CAFFM, CycleGAN, SPADE и функцию потерь для сохранения мотивов (motif-preservation loss). Эффективность оценивалась с помощью метрик IoU, коэффициента Dice, SSIM, PSNR и FID.

Базовая конфигурация, использующая только SegFormer, обеспечила IoU 84,2%, коэффициент Dice 88,5%, значение SSIM 0,82, PSNR 24,8 dB и показатель FID 31,8. Добавление CycleGAN улучшило качество реконструкции и снизило показатель FID до 27,5, что свидетельствует о повышении реалистичности изображений. Внедрение SPADE дополнительно улучшило структурное сходство и качество изображений, в результате чего значение SSIM составило 0,88, а показатель FID — 23,4. Использование предложенного модуля CAFFM привело к значительному росту всех показателей: IoU увеличился до 90,0%, коэффициент Dice до 93,1%, SSIM до 0,90, а PSNR до 29,6 dB при снижении показателя FID до 20,3. Полная модель, в которой дополнительно учитывается функция потерь для сохранения мотивов (motif-preservation loss), продемонстрировала наилучшие общие результаты с IoU 93,0%, коэффициентом Dice 95,4%, значением SSIM 0,92, PSNR 31,2 dB и показателем FID 17,6.

В таблице 8 представлен сравнительный обзор репрезентативных подходов глубокого обучения (DL), используемых для реконструкции и сохранения узоров объектов культурного наследия. Традиционные методы на основе CNN обеспечивают эффективное обучение локальным признакам и высокую производительность сегментации, однако зачастую с трудом сохраняют сложные структуры мотивов из-за ограниченного моделирования дальних зависимостей. Подходы на основе GAN улучшают возможности синтеза изображений и переноса стиля, однако они могут быть подвержены семантической несогласованности и потере мелких структурных деталей. Методы на основе трансформеров улучшают понимание глобального контекста, но обычно лишены возможностей генеративной реконструкции, в то время как методы на основе диффузии обеспечивают высокую визуальную реалистичность ценой повышенной вычислительной сложности. Гибридные подходы Transformer-GAN частично решают эти проблемы, объединяя механизмы извлечения признаков и генерации изображений. В отличие от них, предлагаемый фреймворк SegCycle-SPADE интегрирует сегментацию на основе трансформеров, слияние признаков с перекрестным вниманием (cross-attention), генеративную реконструкцию и управляемый сегментацией художественный синтез в единой архитектуре, что повышает структурную точность, семантическую согласованность и сохранность культурных мотивов. Сравнение обобщено в таблице 8.

ПодходОсновная методологияПреимуществаОграниченияЗначимость для культурного наследия
Методы на основе CNN (например, U-Net, DeepLabV3+)Сверточное извлечение признаков и семантическая сегментацияЭффективное обучение локальным признакам и точная сегментацияОграниченное моделирование дальних зависимостей; трудности с сохранением сложных структур мотивовПодходят для сегментации мотивов, но менее эффективны для художественной реконструкции
Методы на основе GAN (например, Pix2Pix, CycleGAN)Состязательная генерация изображений и преобразование изображения в изображениеВысокое качество синтеза изображений и переноса стиляНестабильность обучения; семантическая несогласованность; возможная потеря мелких структурных деталейПолезны для восстановления узоров, но могут неточно сохранять культурные мотивы
Методы на основе трансформеровМеханизм self-attention и моделирование глобального контекстаУлавливают дальние зависимости и сложные визуальные связиВысокая вычислительная стоимость; потребность в больших обучающих наборах данныхЭффективны для анализа сложных узоров, но имеют ограниченные генеративные возможности при использовании в одиночку
Методы на основе диффузииГенерация изображений на основе итеративного шумоподавленияВысокий визуальный реализм и разнообразие изображенийНизкая скорость инференса; высокие требования к вычислительным ресурсам; ограниченный структурный контрольПерспективны для генерации изображений объектов наследия, но ресурсозатратны
Гибридные методы Transformer-GANСочетание извлечения признаков на основе трансформеров и генерации на основе GANУлучшенное представление глобальных признаков и качество изображенийЧасто отсутствует явное семантическое руководство для сохранения мотивовПовышают качество генерации, но не разработаны специально для мотивов культурного наследия
Предложенный SegCycle-SPADESegFormer + CAFFM + CycleGAN + SPADEСегментация на основе трансформеров, слияние признаков под управлением внимания, семантическая согласованность, сохранение мотивов и контролируемая художественная реконструкцияБолее высокая вычислительная сложность по сравнению с отдельными подходами на основе CNNСпециально разработан для реконструкции и сохранения узоров культурного наследия с улучшенной структурной точностью и семантической согласованностью

Таблица 8: Сравнение репрезентативных подходов глубокого обучения для реконструкции и сохранения узоров культурного наследия. Качественное сравнение репрезентативных подходов глубокого обучения, используемых для сегментации изображений, реконструкции узоров, генерации стиля и сохранения культурного наследия. В таблице обобщены основная методология, преимущества, ограничения и применимость каждого подхода, а также показано, как предлагаемый фреймворк SegCycle-SPADE объединяет семантическую сегментацию, слияние признаков, реконструкцию и синтез стиля для решения проблем, связанных с сохранением структуры и семантической согласованностью узоров культурного наследия.

Наблюдаемые улучшения демонстрируют, что модуль CAFFM эффективно усиливает взаимодействие между структурными признаками, полученными в результате сегментации, и представлениями художественного стиля посредством слияния признаков на основе перекрестного внимания (cross-attention). Кроме того, функция потерь сохранения мотивов способствует поддержанию культурно значимых структур мотивов при реконструкции и художественном синтезе, что приводит к повышению согласованности сегментации, структурной точности и визуального реализма. В совокупности результаты абляционного анализа подтверждают, что интеграция SegFormer-B2, CAFFM, CycleGAN, SPADE и функции потерь сохранения мотивов обеспечивает превосходную производительность предлагаемой архитектуры SegCycle-SPADE.

Доступность данных:
Набор данных WikiArt, использованный для обучения художественному стилю, находится в открытом доступе в репозитории Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). Набор данных Miao Batik, использованный в данном исследовании, общедоступен через Zenodo (https://doi.org/10.5281/zenodo.20807658). Обработанные наборы данных, маски сегментации, веса предобученной модели, сгенерированные результаты и файлы реализации на языке Python, относящиеся к предложенному фреймворку SegCycle-SPADE, также доступны в том же репозитории Zenodo.

ДОПОЛНИТЕЛЬНЫЙ ФАЙЛ:
Дополнительный файл 1. Алгоритм 1: Рабочий процесс реализации предлагаемой структуры SegCycle-SPADE. Пошаговый псевдокод, описывающий полный конвейер реализации предлагаемой структуры SegCycle-SPADE, включая загрузку набора данных, предварительную обработку, семантическую сегментацию с использованием SegFormer-B2, слияние признаков с помощью модуля слияния культурных признаков на основе перекрестного внимания (CAFFM), реконструкцию культурных мотивов с использованием CycleGAN, синтез художественного стиля с использованием SPADE, обучение модели, валидацию, выбор контрольной точки и итоговую оценку производительности. Пожалуйста, нажмите здесь, чтобы скачать этот файл.

Обсуждение

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Сохранение и цифровая реконструкция узоров нематериального культурного наследия (НКН) в последние годы привлекают все больше внимания в связи с постепенным исчезновением традиционных ремесел. В предыдущих исследованиях предпринимались попытки решить проблему утраты культурного наследия с помощью методов обработки изображений на базе глубокого обучения (DL). Например, Quan и др.32 предложили систему сохранения культурного наследия для культуры батика народа мяо в провинции Гуйчжоу, основанную на графах знаний и DL. Хотя данное исследование было сосредоточено на цифровой реконструкции культурных узоров, его методология в основном опиралась на представления в виде графов знаний. Аналогично, Fu и Razmjooy16 предложили архитектуру на основе сети пирамид признаков (FPN) для улучшения и восстановления изображений культурного наследия. Несмотря на то, что этот метод обеспечил эффективное извлечение признаков для улучшения изображений, в нем не были задействованы механизмы сегментации изображений или генеративной реконструкции для неполных культурных узоров. В отличие от них, предлагаемая архитектура SegCycle-SPADE объединяет несколько компонентов DL для преодоления этих проблем. Во-первых, для точной идентификации областей мотивов в узорах культурного наследия используется семантическая сегментация с помощью модели SegFormer. Затем модуль улучшения признаков на базе CAFFM совершенствует представления признаков для мелкозернистых структур мотивов. После этого модуль реконструкции CycleGAN используется для восстановления недостающих или неполных областей в культурных узорах посредством состязательного обучения. Наконец, модуль SPADE выполняет стилистическое улучшение, сохраняя при этом структурное соответствие картам сегментации. Существующие методы на базе CNN, GAN, трансформеров и диффузионных моделей17,19,20,21,22,23,24,25,30,34 обладают уникальными преимуществами, однако они также имеют ограничения в сохранении семантической согласованности, поддержании структурных особенностей или достижении вычислительной эффективности, как обобщено в Таблице 8. Предложенная архитектура SegCycle-SPADE сочетает в себе сильные стороны сегментации на базе SegFormer, слияния признаков с перекрестным вниманием, реконструкции CycleGAN и синтеза под управлением SPADE, устраняя при этом указанные недостатки. В результате данная архитектура обеспечивает более высокое качество реконструкции и улучшенное сохранение культурно значимых мотивов.

Несмотря на многообещающие результаты, предлагаемая архитектура SegCycle-SPADE все еще имеет ряд ограничений. Во-первых, оценка проводилась с использованием только наборов данных Miao Batik и WikiArt, что может ограничить обобщающую способность системы для других областей культурного наследия. Во-вторых, развертывание на платформах с ограниченными ресурсами может быть затруднительным, так как интеграция SegFormer, CAFFM, CycleGAN и SPADE увеличивает вычислительную сложность и требования к памяти. В-третьих, эффективность сегментации сильно зависит от качества и согласованности аннотаций мотивов, а систематическая ошибка аннотирования может повлиять на сохранность культурно значимых структур. Наконец, поскольку архитектура оценивалась всего на двух наборах данных, для обеспечения применимости к различным коллекциям культурного наследия могут потребоваться дополнительные обучающие данные и адаптации под конкретные области. Таким образом, в будущих исследованиях следует изучить более надежные стратегии обучения, облегченные архитектуры, улучшенные процедуры аннотирования и провести кросс-доменную оценку с использованием дополнительных наборов данных культурного наследия.

Основным направлением будущих исследований станет масштабируемость платформы SegCycle-SPADE для работы с более крупными и разнообразными наборами данных культурного наследия. Для улучшения обобщающей способности и культурной адаптивности модели будет проведена кросс-культурная оценка мотивов наследия из разных регионов и художественных традиций. Кроме того, мультимодальные расширения, включающие текстовые описания, исторические записи и культурные метаданные, могут обеспечить более точное семантическое руководство в процессе реконструкции. Платформа также может быть расширена для поддержки трехмерной реконструкции культурного наследия путем интеграции реконструкции на основе изображений с методами 3D-моделирования. В дополнение к этому будет изучена возможность внедрения системы в цифровые архивы, музеи, виртуальные выставки и платформы по сохранению культурного наследия для содействия практическому применению ИИ в консервации и документировании наследия. Для дальнейшего повышения интерпретируемости и культурной достоверности в будущих работах будет исследована интеграция графов культурных знаний, этнографической документации, исторических метаданных и курируемых экспертами баз знаний, что позволит проводить анализ и реконструкцию мотивов с учетом культурного контекста32.

При внедрении предлагаемой платформы SegCycle-SPADE следует учитывать несколько практических аспектов. В процессе обучения CycleGAN может возникнуть нестабильная адверсальная сходимость, если потери генератора и дискриминатора станут сильно несбалансированными. В таких ситуациях для повышения стабильности обучения может помочь снижение скорости обучения, увеличение веса потерь циклической согласованности или мониторинг доминирования дискриминатора. Коллапс моды может произойти, если генератор неоднократно создает визуально схожие результаты; эту проблему можно смягчить с помощью сбалансированного адверсального обучения, использования буфера воспроизведения (replay-buffer) и тщательного мониторинга тенденций потерь генератора и дискриминатора. Ошибки сегментации также могут возникнуть, если культурные мотивы имеют сложную текстуру, низкий контраст или неоднозначные границы. Чтобы решить эту проблему, перед обучением следует проверить качество изображений, а маски сегментации должны быть визуально проинспектированы для обеспечения согласованности аннотаций. Для достижения надежной производительности SegFormer также важно поддерживать рекомендуемое входное разрешение и настройки нормализации. Нестабильность обучения может дополнительно возникнуть из-за неправильных настроек скорости обучения, недостаточного объема обучающих данных или численных вариаций, связанных с оборудованием. Для повышения воспроизводимости следует использовать фиксированные случайные зерна (seeds) для NumPy, PyTorch, CUDA и операций перемешивания наборов данных. Кроме того, во всех экспериментальных запусках должны быть сохранены один и тот же конвейер предобработки, разделение наборов данных, гиперпараметры модели и программная среда. Также рекомендуется периодическое сохранение контрольных точек и мониторинг потерь на валидации, чтобы предотвратить снижение производительности и облегчить восстановление после прерванных сеансов обучения.

Предлагаемая работа вносит вклад в теоретическое развитие систем реконструкции культурного наследия на базе ИИ. Традиционные подходы к восстановлению изображений обычно рассматривают сегментацию изображения, реконструкцию и генерацию стиля как независимые процессы17,19,20,30. В отличие от них, в данном исследовании предлагается система, объединяющая эти процессы посредством стратегии генеративной реконструкции с использованием сегментации. Таким образом, работа способствует теоретическому развитию реконструкции культурного наследия с помощью ИИ, демонстрируя возможность объединения сегментации, реконструкции и генерации стиля в рамках единой системы. Такая интеграция особенно важна применительно к культурному наследию, где критически важным является сохранение структуры мотивов и семантического значения. С практической точки зрения предложенная система представляет собой эффективное решение для цифрового сохранения, реставрации и художественного улучшения традиционных культурных орнаментов. Институты культурного наследия, музеи и дизайнеры могут использовать SegCycle-SPADE для автоматического определения областей мотивов, реконструкции поврежденных или неполных узоров, а также для создания визуально улучшенных художественных репрезентаций традиционных дизайнов. Эта возможность особенно ценна для исчезающих ремесленных традиций, включая текстильные узоры батика народа мяо, где исторические артефакты могут быть частично повреждены или неполны. Кроме того, благодаря внедрению генеративного синтеза стиля, система может поддерживать современные приложения в области культурного дизайна, такие как дизайн текстиля, цифровое художественное творчество и образование в сфере наследия. Таким образом, предложенная система устраняет разрыв между сохранением культурного наследия и современными приложениями в области культурного дизайна.

Тем не менее, несмотря на многообещающие результаты, достигнутые с помощью предложенного фреймворка SegCycle-SPADE, ряд ограничений сохраняется. Во-первых, оценка проводилась с использованием только наборов данных Miao Batik и WikiArt, что может повлиять на обобщающую способность фреймворка при реконструкции других форм узоров культурного наследия. Во-вторых, поскольку процесс реконструкции опирается на модели на базе GAN, сгенерированные результаты могут время от времени содержать артефакты или неестественные текстуры при работе с высокосложными структурами мотивов. В-третьих, в настоящее время фреймворк ориентирован на реконструкцию двухмерных узоров, в то время как некоторые артефакты культурного наследия имеют изначально трехмерные структуры. В целом, результаты экспериментов демонстрируют эффективность предложенного фреймворка SegCycle-SPADE для художественной реконструкции узоров НМК. Интеграция семантической сегментации на базе SegFormer, CAFFM, реконструкции мотивов на базе CycleGAN и художественного синтеза на базе SPADE последовательно улучшила показатели сегментации, реконструкции и качества изображений. Исследования с использованием метода абляции дополнительно подтвердили вклад каждого компонента фреймворка, показав, что CAFFM и функция потерь сохранения мотивов существенно повысили структурную точность и визуальную аутентичность. Эти результаты подтверждают основную гипотезу о том, что реконструкция под руководством семантической сегментации в сочетании с объединением признаков с перекрестным вниманием может эффективно сохранять культурно значимые мотивы, создавая при этом художественно насыщенные результаты. Таким образом, предложенный фреймворк представляет собой надежный и воспроизводимый вычислительный подход для цифрового сохранения, реставрации и творстного возрождения узоров НМК.

Раскрытие информации

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Конфликт интересов:
Авторы заявляют об отсутствии конфликтов интересов.

Благодарности

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Авторы выражают благодарность за академическую и институциональную поддержку, оказанную Гуандунским инженерным политехническим институтом и Южно-Китайским нормальным университетом в ходе проведения данного исследования. Данная работа была поддержана общим проектом Национального фонда социальных наук на 2023 год (№ 23BH161) под названием «Музей цифровой регенерации: исследование по активизации и популяризации культурных реликвий классической китайской каллиграфии и живописи».

Материалы

Список материалов, использованных в этой статье
ИмяКомпанияКаталожный номерКомментарии
Оптимизатор AdamБиблиотека оптимизаторов PyTorchAdamАлгоритм оптимизации, используемый при обучении модели.
CUDA ToolkitNVIDIA CorporationCUDA 11.3GPU-ускорение для вычислений глубокого обучения.
cuDNNNVIDIA CorporationcuDNN 8.2Библиотека ускорения глубоких нейронных сетей, используемая для ускорения обучения и инференса.
CycleGANКалифорнийский университет в Беркли / Open SourceОфициальная реализация на PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Генеративно-состязательная сеть, используемая для реконструкции культурных мотивов.
Предобученные веса ImageNetImageNet / Open Sourcemit_b2.pth (предобученный чекпоинт ImageNet-1K)Используются для инициализации основы SegFormer-B2 перед тонкой настройкой на наборе данных Miao Batik.
Процессор IntelIntel CorporationIntel Core i7 (11-е поколение)ЦП, используемый для предобработки изображений, поддержки обучения модели и инференса.
MatplotlibКоманда разработки MatplotlibMatplotlib 3.5.1Визуализация кривых обучения и результатов оценки.
Набор данных Miao BatikРепозиторий ZenodoDOI: 10.5281/zenodo.20807658Набор данных культурных мотивов, содержащий 15 148 изображений, используемых для семантической сегментации и реконструкции паттернов.
NumPyРазработчики NumPyNumPy 1.21.5Численные вычисления и обработка наборов данных.
GPU NVIDIANVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)Аппаратная платформа, используемая для обучения модели и инференса.
OpenCVOpenCV FoundationOpenCV 4.5.5Предобработка изображений, изменение размера, интерполяция и гауссово шумоподавление.
Операционная системаCanonical Ltd.Ubuntu 20.04 LTSСреда выполнения экспериментов.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0Загрузка и манипулирование изображениями.
PythonPython Software FoundationPython 3.8.10Язык программирования, используемый для реализации и проведения экспериментов.
PyTorchMeta AIPyTorch 1.10.0Фреймворк глубокого обучения, используемый для обучения модели и инференса.
Случайное число (Seed)Настройка эксперимента42Фиксированное значение, используемое для разделения набора данных, инициализации модели и воспроизводимости экспериментов.
Scikit-learnРазработчики Scikit-learnScikit-learn 1.0.2Разделение набора данных, статистический анализ и метрики оценки.
SeabornСообщество Open SourceSeaborn 0.11.2Статистическая визуализация данных.
SegFormer-B2NVIDIA Research / Open SourceSegFormer-B2 (основа MIT-B2)Модель семантической сегментации на базе Transformer, используемая для сегментации культурных мотивов.
Маски сегментации / аннотацииНабор данных Miao BatikВключены в набор данныхМетки семантической сегментации на уровне пикселей, используемые для классификации мотивов и обучения.
SPADENVIDIA Research / Open SourceОфициальная реализация на PyTorch (https://github.com/NVlabs/SPADE)Модель синтеза изображений с управлением сегментацией, используемая для генерации художественных паттернов.
TorchVisionMeta AITorchVision 0.11.1Средства обработки изображений и преобразования наборов данных, используемые с PyTorch.
Набор данных WikiArtWikiArthttps://www.wikiart.org/Набор данных художественных стилей, содержащий более 80 000 произведений искусства в 27 художественных стилях, используемый для изучения и синтеза стилей.

Ссылки

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Перепечатки и разрешения

Запросить разрешение на повторное использование текста или иллюстраций этой статьи JoVE

Запросить разрешение

Теги

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Похожие статьи