Artykuł badawczy

Rekonstrukcja sterowana segmentacją semantyczną i synteza stylu artystycznego wzorów niematerialnego dziedzictwa kulturowego z wykorzystaniem frameworku głębokiego uczenia

DOI:

10.3791/71577

14 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy protokół opisuje przepływ pracy oparty na głębokim uczeniu w celu segmentacji semantycznej, rekonstrukcji i syntezy artystycznego stylu wzorów niematerialnego dziedzictwa kulturowego, wykorzystując ekstrakcję cech opartą na transformatorach, rekonstrukcję przeciwstawną oraz przestrzennie adaptacyjne generowanie obrazów, aby wesprzeć cyfrową konserwację i kreatywne zastosowania w obszarze dziedzictwa.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Cyfrowa konserwacja i rekonstrukcja wzorów niematerialnego dziedzictwa kulturowego (ICH) zyskały na znaczeniu wraz z rozwojem technik syntezy obrazu opartych na głębokim uczeniu. Istniejące podejścia oparte na SegCycle-SPADE wykazały potencjał w zakresie segmentacji strukturalnej i artystycznej rekonstrukcji tradycyjnych wzorów rzemieślniczych; jednak nadal istnieją ograniczenia, w tym ograniczona różnorodność zbiorów danych, niewystarczające uwzględnienie semantyki kulturowej oraz nieodpowiednia konserwacja cech strukturalnych wzorów podczas rekonstrukcji. Aby sprostać tym wyzwaniom, w niniejszym badaniu zaproponowano ulepszony framework SegCycle-SPADE do segmentacji semantycznej i artystycznej rekonstrukcji typów wzorów ICH. Do dokładnej identyfikacji granic motywów i obszarów wzorów wykorzystano model segmentacji oparty na Transformerach, SegFormer. Ponadto wprowadzono moduł Cross-Attention Cultural Feature Fusion, aby wzmocnić motywy o znaczeniu kulturowym i poprawić reprezentację cech. Translacja i rekonstrukcja wzorów są realizowane za pomocą CycleGAN, natomiast do syntezy stylu artystycznego wykorzystano Spatial-Adaptive Denormalization (SPADE), aby zachować spójność semantyczną między mapami segmentacji a generowanymi obrazami. W celu poprawy generalizacji modelu i różnorodności artystycznej, framework został przeszkolony z wykorzystaniem zarówno zbioru danych motywów kulturowych Miao Batik, jak i zbioru danych WikiArt. Wyniki eksperymentalne wykazują, że zaproponowany framework SegCycle-SPADE z mechanizmem uwagi poprawia dokładność segmentacji oraz wydajność rekonstrukcji wzorów dziedzictwa w porównaniu z istniejącymi metodami rekonstrukcji opartymi na generatywnych sieciach przeciwstawnych (GAN). Zaproponowany framework stanowi skalowalne rozwiązanie dla dokumentacji dziedzictwa kulturowego wspomaganej sztuczną inteligencją, rekonstrukcji oraz artystycznej rewitalizacji tradycyjnych projektów wzorów.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Dziedzictwo kulturowe, obejmujące zarówno elementy niematerialne, takie jak zwyczaje, języki i wierzenia, jak i elementy materialne, takie jak dzieła sztuki, budynki i zapisy pisemne, jest fundamentalną manifestacją ludzkiej historii, kreatywności i tożsamości1. Konserwacja dziedzictwa dąży do umożliwienia społecznościom ponownego nawiązania więzi z ich korzeniami i pozwala przyszłym pokoleniom czerpać korzyści z ich zbiorowej pamięci kulturowej. Promuje ona również zrozumienie międzykulturowe, docenianie różnorodnych tradycji i zwyczajów oraz uznanie odmiennych narracji historycznych. Te zasoby kulturowe pomagają nam zrozumieć wartości, perspektywy i doświadczenia poprzednich pokoleń oraz przyczyniają się do kształtowania współczesnych tożsamości społecznych i ciągłości kulturowej. Podstawowe zasady ochrony dziedzictwa kulturowego zostały przedstawione na Rysunku 1.

figure-introduction-1
Rysunek 1. Koncepcyjny przegląd rekonstrukcji wzorów dziedzictwa kulturowego z wykorzystaniem frameworku SegCycle-SPADE. Schematyczny rysunek proponowanego podejścia do rekonstrukcji i ulepszania wzorów niematerialnego dziedzictwa kulturowego. Przepływ pracy obejmuje gromadzenie danych z zestawów danych Miao Batik oraz WikiArt, wstępne przetwarzanie obrazów, segmentację semantyczną z wykorzystaniem SegFormer-B2, fuzję cech przy użyciu modułu fuzji cech kulturowych z mechanizmem uwagi krzyżowej (Cross-Attention Cultural Feature Fusion Module – CAFFM), rekonstrukcję wzorów za pomocą CycleGAN, syntezę stylu artystycznego za pomocą SPADE oraz końcową ewaluację z wykorzystaniem metryk segmentacji i rekonstrukcji. Strzałki wskazują przepływ danych i reprezentacji cech w obrębie frameworku. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Zbiorowa pamięć i dziedzictwo kulturowe społeczeństwa ludzkiego są ucieleśnione w niematerialnym dziedzictwie kulturowym (ICH), które stanowi istotne medium ekspresji artystycznej i tożsamości kulturowej. Niemniej jednak ICH stoi przed znacznymi wyzwaniami wynikającymi ze skutków globalizacji i cyfryzacji2,3,4. Wiele zagrożonych praktyk ICH wymaga nowych podejść do konserwacji i rozwoju ze względu na malejącą liczbę wykwalifikowanych rzemieślników oraz ograniczoną zdolność adaptacji do współczesnych rynków5,6. Jako ważny obszar badań nad ICH, zrównoważone projektowanie kładzie nacisk na zintegrowany rozwój kultury, społeczeństwa i środowiska, zapewniając praktyczną drogę do dalszego zachowania ICH. Dzięki podejściom opartym na zrównoważonym projektowaniu, ICH może zostać rewitalizowane przy jednoczesnym dostosowaniu do potrzeb współczesnego społeczeństwa7,8.

W niniejszym badaniu termin „wzorce niematerialnego dziedzictwa kulturowego” odnosi się do wizualnych reprezentacji motywów, które przekazują i utrwalają immanentne niematerialne wartości kulturowe. W związku z tym proponowane ramy mają na celu zachowanie i udokumentowanie informacji kulturowych związanych z tymi motywami przy jednoczesnej rekonstrukcji ich form wizualnych.

Haft i batik ludu Miao są istotnymi formami niematerialnego dziedzictwa kulturowego (ICH) Chin, odzwierciedlającymi historię, wierzenia i tradycje społeczności Miao poprzez symboliczne motywy, takie jak ptaki, motyle i totemy przodków9. Motywy te są głęboko zakorzenione w strojach rytualnych i praktykach festiwalowych oraz przyczyniają się do lokalnego rozwoju kulturowego i gospodarczego10,11. Postępy w technologiach cyfrowych, w szczególności w dziedzinie sztucznej inteligencji (AI) i głębokiego uczenia (DL), stworzyły nowe możliwości dla ochrony, analizy, rekonstrukcji i dokumentacji dziedzictwa kulturowego. Batik Miao z prowincji Guizhou, będący jedną z najlepiej zachowanych tradycji batikowych w Chinach, służy jako ważne medium przekazu wiedzy kulturowej, wierzeń, zwyczajów i rytuałów ludu Miao12,13,14,15,16.

Niedawne badania wykazały potencjał DL w zakresie ochrony dziedzictwa kulturowego i rekonstrukcji wzorów, osiągając lepszą dokładność segmentacji (dokładność pikselowa = 88,6%, średni współczynnik IoU [intersection over union] = 78,1%) oraz wydajność rekonstrukcji w porównaniu z U-Net i DeepLabV3+1. Pozostaje jednak kilka wyzwań. Istniejące podejścia oparte na generatywnych sieciach przeciwstawnych (GAN) często mają trudności z zachowaniem drobnych szczegółów strukturalnych w złożonych wzorach17, natomiast ograniczona różnorodność zbiorów danych ogranicza generalizację modelu w różnych domenach kulturowych18. Ponadto modele translacji obraz-obraz, takie jak CycleGAN, mogą nie zapewniać spójności semantycznej między mapami segmentacji a wygenerowanymi obrazami19, a brak mechanizmów uwagi może prowadzić do utraty kulturowo istotnych szczegółów motywów podczas rekonstrukcji20. W związku z tym, w celu skutecznej rekonstrukcji wzorów ICH, niezbędny jest ulepszony system integrujący segmentację opartą na transformerach, uczenie cech kierowane uwagą oraz trenowanie na wielu zbiorach danych.

Nowe możliwości ochrony dziedzictwa kulturowego pojawiły się dzięki digitalizacji haftów ludu Miao oraz szybkiemu rozwojowi generatywnej sztucznej inteligencji (AI). Modele dyfuzyjne, będące nową klasą głębokich modeli generatywnych, wykazały wyjątkową skuteczność w zadaniach z zakresu komputerowego rozpoznawania obrazu dzięki swoim potężnym możliwościom generowania treści21,22,23,24,25. Podczas procesu odwróconej dyfuzji model stopniowo uczy się rekonstruować oryginalne dane wejściowe z reprezentacji zaszumionych26,27,28. W poprzednich badaniach analizowano również zastosowanie technologii rekonstrukcji trójwymiarowej oraz projektowania wspomaganego komputerowo (CAD) w celu ochrony i upowszechniania dziedzictwa kulturowego.

Mimo że konwolucyjne sieci neuronowe (CNN) i sieci GAN radzą sobie dobrze z generowaniem obrazów i zachowywaniem cech, wciąż borykają się z wyzwaniami związanymi z ograniczonymi polami recepcyjnymi, zapadaniem trybów (mode collapse) oraz niestabilnością treningu29. Architektury oparte na transformerach, takie jak SegFormer i Segmenter, doskonale radzą sobie z przechwytywaniem globalnego kontekstu i relacji semantycznych; są one jednak kosztowne obliczeniowo i mogą mieć trudności z odwzorowaniem drobnych szczegółów. Chociaż modele dyfuzyjne, takie jak Stable Diffusion, wykazują silne możliwości generowania obrazów, często brakuje im precyzyjnej kontroli nad cechami strukturalnymi i artystycznymi generowanych projektów. Ponadto większość istniejących podejść wykorzystuje niezależne strategie treningowe, co ogranicza efektywną wymianę informacji i wspólną optymalizację między komponentami segmentacji i generowania, prowadząc do kompromisu między dokładnością strukturalną a autentycznością artystyczną30.

Współczesne modele oparte na dyfuzji, takie jak dyfuzja latentna i Stable Diffusion, pozwalają na syntezę obrazów wysokiej jakości, jednak wymagają one iteracyjnego odszumiania, co prowadzi do zwiększenia kosztów obliczeniowych i czasu wnioskowania. Ponadto zachowanie precyzyjnych motywów kulturowych i spójności strukturalnej pozostaje wyzwaniem bez specjalistycznych mechanizmów warunkowania. Generatywne modele oparte na transformatorach skutecznie oddają globalne relacje kontekstowe, lecz często wymagają zestawów danych o dużej skali oraz znacznych zasobów obliczeniowych. W przeciwieństwie do nich, proponowany framework SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) łączy segmentację opartą na SegFormer, fuzję cech poprzez mechanizm cross-attention, rekonstrukcję CycleGAN oraz syntezę sterowaną przez SPADE, aby zapewnić jawne prowadzenie strukturalne, co poprawia zachowanie motywów, spójność semantyczną oraz sterowalną rekonstrukcję wzorów dziedzictwa kulturowego.

Większość najnowocześniejszych technik segmentacji semantycznej opiera się na w pełni splotowych sieciach neuronowych (FCNNs) o architekturach w kształcie litery U31. Podczas etapu kodowania, za pomocą serii operacji splotu i downsamplingu, ekstrahowane są głębokie cechy o dużych polach recepcyjnych. Etap dekodowania stopniowo przywraca rozdzielczość przestrzenną poprzez upsampling, co w ostateczności umożliwia semantyczną predykcję na poziomie pikseli. Połączenia pomijające (skip connections) pozwalają na bezpośrednią integrację informacji o wysokiej rozdzielczości z różnych poziomów kodera w dekoderze32, co kompensuje utratę informacji przestrzennych podczas downsamplingu i poprawia wydajność segmentacji w szerokim zakresie zastosowań.

Choć niedawne metody oparte na sieciach GAN, CNN oraz modelach dyfuzyjnych wykazały obiecujące wyniki w generowaniu obrazów i restauracji dziedzictwa kulturowego, często mają one trudności z zachowaniem spójności semantycznej, ochroną drobnych motywów strukturalnych oraz zapewnieniem powtarzalnej rekonstrukcji w obrębie zróżnicowanych wzorów kulturowych. Większość istniejących podejść traktuje segmentację, rekonstrukcję i syntezę stylu jako osobne procesy, co może prowadzić do utraty istotnych kulturowo elementów i niespójnych wyników. Aby wypełnić tę lukę metodologiczną, w niniejszym badaniu zaproponowano jednolity framework SegCycle-SPADE, który integruje segmentację semantyczną opartą na SegFormer, nowatorski moduł fuzji cech kulturowych z mechanizmem Cross-Attention (CAFFM), rekonstrukcję opartą na CycleGAN oraz syntezę stylu sterowaną przez SPADE. Poprzez wyraźną integrację informacji o segmentacji strukturalnej z generatywną nauką cech, proponowany framework umożliwia bardziej niezawodną, semantycznie spójną i powtarzalną rekonstrukcję motywów ICH, zachowując jednocześnie autentyczność kulturową i jakość artystyczną.

W niniejszym badaniu zidentyfikowano trzy główne ograniczenia obecnych podejść do rekonstrukcji dziedzictwa kulturowego: (i) niewystarczające zachowanie drobnych motywów strukturalnych w metodach rekonstrukcji opartych na GAN; (ii) ograniczona generalizacja wynikająca z trenowania na małych lub specyficznych dla danej dziedziny zbiorach danych oraz (iii) niewystarczająca spójność semantyczna między wynikami segmentacji a generowanymi obrazami w ramach translacji obraz-obraz. Ponadto segmentacja, rekonstrukcja i synteza stylu są zazwyczaj traktowane jako oddzielne procesy, co prowadzi do utraty elementów o znaczeniu kulturowym podczas rekonstrukcji. Dzięki połączeniu semantycznej segmentacji opartej na transformerach, fuzji cech cross-attention, rekonstrukcji CycleGAN oraz syntezy artystycznej sterowanej przez SPADE w ramach jednej zunifikowanej architektury, proponowany framework SegCycle-SPADE rozwiązuje te ograniczenia i poprawia zachowanie motywów, spójność semantyczną oraz autentyczność artystyczną w rekonstrukcji wzorów niematerialnego dziedzictwa kulturowego (ICH).

Głównym celem niniejszego badania jest opracowanie ulepszonego frameworka SegCycle-SPADE do artystycznej rekonstrukcji wzorów niematerialnego dziedzictwa kulturowego (ICH) z wykorzystaniem segmentacji semantycznej. Framework integruje model SegFormer dla dokładnej segmentacji motywów kulturowych, CycleGAN do rekonstrukcji wzorów oraz SPADE dla spójnej stylistycznie syntezy artystycznej. W celu poprawy reprezentacji cech i zachowania drobnych szczegółów strukturalnych wprowadzono moduł CAFFM, który ułatwia efektywną interakcję między cechami segmentacji a cechami generatywnymi. Framework, wytrenowany na zbiorach danych Miao Batik oraz WikiArt, zwiększa autentyczność rekonstrukcji, spójność stylu oraz stopień zachowania istotnych kulturowo motywów.

Poprzez połączenie segmentacji semantycznej, fuzji cech sterowanej uwagą, rekonstrukcji wzorców oraz syntezy stylu w ramach jednolitej architektury, niniejsza praca przedstawia nowatorski framework SegCycle-SPADE do artystycznej rekonstrukcji wzorców niematerialnego dziedzictwa kulturowego (ICH). Główne wkład naukowy tej pracy są następujące. Po pierwsze, opracowano nowatorski framework rekonstrukcji sterowanej segmentacją semantyczną poprzez integrację modelu SegFormer, co umożliwia dokładną ekstrakcję i zachowanie złożonych motywów kulturowych oraz elementów strukturalnych. Po drugie, wprowadzono nowy moduł CAFFM w celu efektywnej fuzji cech segmentacji z reprezentacjami generatywnymi, co pozwala modelowi uchwycić dalekosiężne relacje między motywami kulturowymi a wzorcami stylu artystycznego. Po trzecie, zaproponowany CAFFM zwiększa stopień zachowania elementów o znaczeniu kulturowym, jednocześnie poprawiając realizm wizualny i spójność strukturalną zrekonstruowanych wzorców dziedzictwa. Po czwarte, dzięki integracji CycleGAN do rekonstrukcji wzorców kulturowych oraz SPADE do sterowanej segmentacją syntezy artystycznej, framework zapewnia zarówno dokładność semantyczną, jak i autentyczność stylistyczną wygenerowanych wyników. Po piąte, w celu poprawy generalizacji i różnorodności artystycznej, model został przeszkolony z wykorzystaniem zbioru danych motywów kulturowych Miao Batik do nauki wzorców kulturowych oraz zbioru danych WikiArt do reprezentacji stylu artystycznego. WikiArt służy jako pomocniczy zbiór danych do oceny zdolności generalizacji frameworku, odporności uczenia cech oraz skuteczności kontroli stylu w różnych kontekstach wizualnych, a nie jako styl docelowy do bezpośredniego zastosowania w produktach dziedzictwa kulturowego ludu Miao. Wreszcie, w porównaniu z istniejącymi metodami rekonstrukcji dziedzictwa kulturowego opartymi na sieciach GAN, wyniki eksperymentalne wykazują, że zaproponowany framework SegCycle-SPADE osiąga lepszą dokładność segmentacji, wyższą jakość rekonstrukcji oraz większą spójność stylistyczną.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zaproponowany schemat SegCycle-SPADE został opracowany w celu rekonstrukcji i ulepszenia tradycyjnych wzorów dziedzictwa kulturowego poprzez segmentację semantyczną, wzmacnianie cech z wykorzystaniem mechanizmu uwagi, rekonstrukcję generatywną oraz syntezę stylu artystycznego. W badaniu wykorzystano publicznie dostępne zbiory obrazów dziedzictwa kulturowego i artystycznych, w tym zbiór danych Miao Batik oraz zbiór danych WikiArt. W badaniach nie brali udziału uczestnicy będący ludźmi, nie wykorzystano danych pacjentów, informacji osobistych, zwierząt ani dokumentacji klinicznej; w związku z tym nie wymagano zgody instytucjonalnej komisji etycznej ani świadomej zgody. W pierwszej kolejności do ewaluacji wykorzystano zbiór motywów kulturowych Miao Batik oraz zbiór danych WikiArt. Zbiór danych Miao Batik został opisany w pracy Quan et al. (2024)32 i zawiera 15 148 adnotowanych obrazów tradycyjnych motywów batiku Miao. Istniejące adnotacje dostarczone przez twórców zbioru danych zostały wykorzystane bezpośrednio, a w niniejszym badaniu nie generowano dodatkowych adnotacji manualnych. Następnie przeprowadzono wstępne przetwarzanie obrazów poprzez zmianę rozmiaru, normalizację, odszumianie i tworzenie maski segmentacji. Dokładne parametry wstępnego przetwarzania zostały opisane w podrozdziale Data Preprocessing. Zaproponowany schemat wykorzystuje model oparty na transformerze o nazwie SegFormer-B2 do segmentacji semantycznej danych. Metoda ta została zaprojektowana w celu wykrywania kluczowych obszarów motywów kulturowych i uczenia się ich struktur. Segmentowane cechy są następnie wzmacniane poprzez mechanizm uwagi, w którym podkreślane są istotne informacje związane z motywami kulturowymi, a informacje nieistotne są odrzucane. Konfiguracja mechanizmu uwagi została opisana w podrozdziale CAFFM. Wzmocnione cechy są następnie przekazywane do CycleGAN, gdzie uszkodzone struktury są rekonstruowane poprzez uczenie cykliczne. Podczas trenowania sztucznie tworzono niekompletne próbki motywów, stosując operacje losowego maskowania i częściowego przysłaniania oryginalnych obrazów batiku Miao. Procedury degradacji te symulowały brakujące obszary motywów i uszkodzenia strukturalne powszechnie obserwowane w zniszczonych artefaktach dziedzictwa kulturowego. Powstałe niekompletne obrazy posłużyły jako wejścia do modułu rekonstrukcji CycleGAN, natomiast odpowiadające im obrazy oryginalne stanowiły cele rekonstrukcji. Zrekonstruowane wzory dziedzictwa kulturowego są następnie ulepszane za pomocą SPADE, gdzie wzmocnienie artystyczne jest realizowane na podstawie wygenerowanych map segmentacji. Wydajność zaproponowanego schematu oceniono za pomocą ilościowych metryk segmentacji i jakości obrazu, natomiast autentyczność wizualną zrekonstruowanych motywów kulturowych oceniono jakościowo. Autentyczność wizualną oceniano poprzez inspekcję wzrokową wygenerowanych wzorów kulturowych i nie była ona wykorzystywana jako niezależna metryka ilościowa. Ocena koncentrowała się na zachowaniu motywu, spójności semantycznej, charakterystyce kulturowej, koherencji strukturalnej i wyglądzie artystycznym w odniesieniu do odpowiadających im referencyjnych motywów kulturowych. Ilościowa ocena wydajności modelu została przeprowadzona z wykorzystaniem wskaźników Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) oraz Fréchet Inception Distance (FID). Rysunek 2 ilustruje ogólny przebieg pracy zaproponowanego schematu SegCycle-SPADE i podsumowuje metryki ewaluacyjne użyte w niniejszym badaniu.

figure-protocol-1
Rycina 2. Ogólny schemat przepływu architektury proponowanego frameworka SegCycle-SPADE. Przegląd pełnego procesu SegCycle-SPADE. Obrazy z zestawów danych Miao Batik i WikiArt przechodzą wstępne przetwarzanie, a następnie są poddawane segmentacji semantycznej przy użyciu SegFormer-B2, wzmocnieniu cech za pomocą CAFFM, rekonstrukcji wzorów przy użyciu CycleGAN oraz generowaniu stylu artystycznego przy użyciu SPADE. Wydajność modelu jest oceniana za pomocą wskaźników Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR oraz Fréchet Inception Distance (FID), natomiast autentyczność wizualna jest oceniana jakościowo. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Struktura SegCycle-SPADE do rekonstrukcji wzorów dziedzictwa kulturowego została zaprojektowana w celu integracji wielu komponentów DL dla dokładnej segmentacji, rekonstrukcji i artystycznego ulepszenia motywów, co zilustrowano na Rysunku 2. Obrazy z zestawu danych motywów kulturowych Miao Batik oraz zestawu danych WikiArt są wykorzystywane w celu zapewnienia różnorodnych wzorów kulturowych i stylów artystycznych. Początkowo obrazy są przetwarzane za pomocą modułu segmentacji semantycznej opartego na SegFormer, aby zidentyfikować i wyodrębnić motywy kulturowe z tła. Całość architektury składa się z czterech głównych etapów. Po pierwsze, model SegFormer wyodrębnia mapy segmentacji semantycznej z obrazów wzorów kulturowych. Po drugie, moduł CAFFM integruje cechy segmentacji z reprezentacjami generatywnymi w celu usprawnienia uczenia cech. Po trzecie, moduł CycleGAN rekonstruuje wzory kulturowe przy użyciu połączonych reprezentacji cech. Na koniec moduł SPADE generuje ulepszone stylistycznie wyniki, zachowując jednocześnie spójność strukturalną dzięki syntezie sterowanej segmentacją. Udoskonalone mapy cech są następnie przetwarzane przez moduł rekonstrukcji CycleGAN, który uczy się przywracać niekompletne motywy kulturowe poprzez mapowanie zdegradowanych wzorów na ich odpowiadające im formy kompletne. Próbki niekompletnych motywów zostały wygenerowane poprzez zastosowanie operacji losowego maskowania i częściowego przesłaniania do oryginalnych obrazów Miao Batik, symulując w ten sposób brakujące obszary wzorów i degradację strukturalną powszechnie obserwowaną w uszkodzonych artefaktach kulturowych. Każdy zdegradowany obraz został sparowany z odpowiadającym mu obrazem oryginalnym, który służył jako cel rekonstrukcji podczas treningu. Strategia ta umożliwiła modułowi CycleGAN naukę przywracania brakujących struktur motywów przy jednoczesnym zachowaniu spójności semantycznej i istotnych cech kulturowych. Ostatecznie generator SPADE tworzy wizualnie ulepszone wyniki artystyczne poprzez warunkowanie syntezy obrazu na wygenerowanych mapach segmentacji, utrzymując tym samym integralność strukturalną motywów kulturowych w całym procesie ulepszania artystycznego.

Poniższe kroki są elementem proponowanego schematu SegCycle-SPADE.

Krok 1: Gromadzenie zbiorów danych
W celu realizacji celów związanych z uczeniem się wzorców kulturowych i generowaniem stylów artystycznych wykorzystano dwa zbiory danych. Zbiór motywów kulturowych Miao Batik posłużył do dostarczenia informacji o tradycyjnych wzorach kulturowych. Zbiór ten jest publicznie dostępny za pośrednictwem Zenodo (https://doi.org/10.5281/zenodo.20807658) i zawiera 15 148 opisanych obrazów tradycyjnych motywów batikowych ludu Miao. Bezpośrednio wykorzystano istniejące adnotacje dostarczone przez twórców zbioru; w niniejszym badaniu nie tworzono dodatkowych adnotacji ręcznych. Zbiór danych WikiArt posłużył do dostarczenia zróżnicowanych informacji o stylach artystycznych na potrzeby generowania stylu i został pobrany z publicznie dostępnego repozytorium WikiArt (https://www.wikiart.org/).

Krok 2: Wstępne przetwarzanie danych
Wszystkie obrazy zostały poddane wstępnemu przetwarzaniu poprzez zmianę rozmiaru, normalizację oraz redukcję szumów. W celu wsparcia etapu segmentacji semantycznej wykorzystano istniejące adnotacje motywów kulturowych uzyskane z oryginalnych źródeł zbioru danych. W ramach niniejszego badania nie przeprowadzono żadnych dodatkowych procedur adnotacji ani ponownego etykietowania.

Krok 3: Segmentacja wzorców semantycznych z wykorzystaniem modelu SegFormer
Do segmentacji motywów kulturowych wykorzystano model SegFormer. Dokładny opis architektury szkieletowej SegFormer oraz strategii inicjalizacji znajduje się w podrozdziale Semantic Pattern Segmentation Using SegFormer. W szczególności do semantycznej segmentacji motywów zastosowano architekturę SegFormer-B2 z szkieletem MIT-B2 wstępnie wytrenowanym na zbiorze ImageNet. Model ten skutecznie przechwytuje globalne informacje kontekstowe, zachowując jednocześnie złożone szczegóły strukturalne tradycyjnych wzorów kulturowych.

Krok 4: CAFFM
CAFFM łączy cechy segmentacji semantycznej z reprezentacjami generatywnymi, umożliwiając strukturze naukę zarówno charakterystyk motywów strukturalnych, jak i informacji o stylu artystycznym. Szczegóły integracji CAFFM znajdują się w podrozdziale CAFFM. Moduł ten jest umieszczony pomiędzy etapem segmentacji semantycznej opartej na SegFormer a etapem rekonstrukcji generatywnej, gdzie łączy on cechy strukturalne pochodzące z segmentacji z cechami rekonstrukcji za pomocą wielogłowicowego mechanizmu uwagi krzyżowej (multi-head cross-attention). Proces ten poprawia zachowanie motywów kulturowych i zwiększa realizm zrekonstruowanych wyników.

Krok 5: Rekonstrukcja wzorców (CycleGAN)
Połączone cechy są następnie przetwarzane przez moduł CycleGAN w celu rekonstrukcji struktur wzorców kulturowych. Architektura CycleGAN oraz konfiguracja treningowa są opisane w podrozdziale Rekonstrukcja wzorców za pomocą CycleGAN. Moduł rekonstrukcji składa się z dwóch generatorów i dwóch dyskryminatorów, wykorzystuje architekturę generatora opartą na sieciach rezdualnych z dziewięcioma blokami rezdualnymi, stosuje dyskryminator PatchGAN i jest trenowany z wykorzystaniem strat adwersarialnych oraz strat spójności cyklicznej. Taka konfiguracja umożliwia dwukierunkowe mapowanie domen i ułatwia rekonstrukcję niekompletnych struktur wzorców kulturowych.

Krok 6: Generowanie stylu artystycznego (SPADE)
Zrekonstruowane wzory są następnie przetwarzane przez moduł SPADE w celu przeprowadzenia syntezy stylu artystycznego sterowanej segmentacją. Konfiguracja generatora SPADE została opisana w podrozdziale Generowanie stylu artystycznego przy użyciu SPADE. Moduł wykorzystuje bloki rezydualne SPADE, warstwy normalizacji adaptacyjnej przestrzennie oraz warunkowanie semantyczne pochodzące z map segmentacji SegFormer i reprezentacji cech CAFFM. Dzięki warunkowaniu generowania obrazów na podstawie map segmentacji, zsyntetyzowane wyniki zachowują spójność strukturalną z oryginalnymi motywami kulturowymi, jednocześnie uwzględniając charakterystykę stylu artystycznego.

Krok 7: Szacowanie wydajności
Zaproponowany model został oceniony przy użyciu wielu metryk segmentacji i oceny jakości obrazu, w tym dokładności segmentacji (Segmentation Accuracy), IoU, współczynnika podobieństwa Dice'a (Dice), SSIM, PSNR oraz FID. Aby ocenić spójność eksperymentalną, wszystkie doświadczenia powtórzono pięć razy z użyciem różnych ziarn losowych, a wyniki przedstawiono jako średnią ± odchylenie standardowe. Istotność statystyczną oceniono za pomocą testów t-studenta dla prób zależnych, przyjmując próg istotności p < 0,05.

Gromadzenie zbiorów danych
W zaproponowanej strukturze SegCycle-SPADE wykorzystano dwa zbiory danych w celu zrozumienia wzorców kulturowych i nauki stylu. Pierwszym zbiorem danych zastosowanym w proponowanej strukturze jest zbiór motywów kulturowych batików ludu Miao. Zbiór ten zawiera motywy kulturowe batików Miao, które zazwyczaj są obrazami tradycyjnych batików Miao zawierających motywy takie jak zwierzęta, rośliny i kształty geometryczne, wykorzystywane w sztuce etnicznej ludu Miao. Zbiór ten obejmuje obrazy z bogatymi informacjami o teksturze, co jest zazwyczaj istotne dla zachowania dziedzictwa kulturowego. Drugim zbiorem danych wykorzystanym w proponowanej strukturze SegCycle-SPADE jest zbiór WikiArt. Zbiór ten zawiera ogromną liczbę dzieł sztuki, zazwyczaj w różnych stylach. Jest on wykorzystywany do złożonej nauki stylu, co zazwyczaj okazuje się przydatne przy ulepszaniu dzieł sztuki. Zbiór ten posiada 80 000 dzieł sztuki w jakości HD w 27 różnych wersjach, co czyni go bardziej użytecznym w zadaniach generowania lub transformacji stylu opartych na DL.

Zbiór danych Miao Batik:
Zbiór danych Miao Batik (https://doi.org/10.5281/zenodo.20807658) obejmuje 15 148 obrazów wzorów batikowych przedstawiających motywy o znaczeniu kulturowym. Obrazy zawierają różnorodne tradycyjne projekty, takie jak motywy zwierzęce (np. motyle i ryby), wzory roślinne oraz motywy geometryczne niosące symbolikę kulturową. Zbiór ten stanowi istotny element proponowanego modelu, ponieważ dostarcza autentycznych struktur kulturowych, które pozwalają modułowi segmentacji na dokładną identyfikację i zachowanie granic motywów podczas rekonstrukcji wzoru (Tabela 1). W niniejszym badaniu motywy ważne kulturowo odnoszą się do symbolicznych elementów wizualnych powszechnie dokumentowanych w literaturze dotyczącej dziedzictwa kulturowego ludu Miao i reprezentowanych w adnotacjach zbioru danych, w tym ptaków, motyli, wzorów kwiatowych i totemów przodków. Motywy te wybrano na podstawie ich udokumentowanego znaczenia kulturowego oraz powtarzalnej obecności w tradycyjnych projektach batiku i haftów Miao, a nie wyłącznie na podstawie częstotliwości ich występowania lub kompozycji przestrzennej. Adnotacje motywów oraz etykiety segmentacji opracowane pod kierunkiem ekspertów pobrano z oryginalnego źródła zbioru danych Miao Batik i wykorzystano bezpośrednio w niniejszej pracy. Autorzy nie przeprowadzali żadnych dodatkowych manualnych adnotacji, ponownego etykietowania ani procedur adnotacji pod kierunkiem ekspertów. Istniejące adnotacje dostarczone przez twórców zbioru danych wykorzystano do trenowania i ewaluacji segmentacji semantycznej.

ParametrOpis
Nazwa zbioru danychZbiór danych wzorów kulturowych batików ludu Miao
Źródło zbioru danychRepozytorium Zenodo (DOI: 10.5281/zenodo.20807658)
DziedzinaNiematerialne Dziedzictwo Kulturowe (ICH) / Analiza wzorów tekstylnych
Całkowita liczba obrazów15 148 obrazów
Typ obrazuCyfrowe obrazy tradycyjnych wzorów tkanin batikowych ludu Miao
Kategorie wzorcówMotywy zwierzęce, motywy roślinne i motywy geometryczne
Pochodzenie kulturowekultura etniczna Miao, prowincja Guizhou, Chiny
Oryginalna rozdzielczość obrazuObrazy o wysokiej rozdzielczości (zazwyczaj ≥ 1000 pikseli na krótszym boku), zarejestrowane jako skany surowe lub fotografie przed etapem przetwarzania wstępnego
Rozdzielczość szkoleniaObrazy zmienione na rozmiar 256 × 256 pikseli podczas przetwarzania wstępnego
Dostępność adnotacjiIstniejące adnotacje segmentacyjne dostarczone przez twórców zbioru danych zostały wykorzystane bez modyfikacji do celów uczenia i ewaluacji. W niniejszym badaniu nie przeprowadzono dodatkowego ręcznego adnotowania, ponownego etykietowania ani procedur potwierdzania przez ekspertów.
Zastosowanie w niniejszym badaniuSegmentacja motywów kulturowych, ekstrakcja cech, zachowanie motywów i rekonstrukcja wzorów

Tabela 1: Charakterystyka zbioru danych wzorów kulturowych batiku ludu Miao. Podsumowanie zbioru danych motywów kulturowych batiku ludu Miao wykorzystanego do segmentacji semantycznej, analizy wzorów kulturowych i rekonstrukcji motywów. Tabela opisuje źródło zbioru danych, charakterystykę obrazów, kategorie motywów, pochodzenie kulturowe, rozdzielczość obrazów oraz rolę zbioru w proponowanej strukturze SegCycle-SPADE.

Zbiór danych WikiArt:
Zbiór danych WikiArt [https://www.wikiart.org/] to popularne, wielkoskalowe cyfrowe repozytorium sztuki, które obejmuje ponad 80 000 obrazów reprezentujących 27 różnych stylów artystycznych przedstawionych w Tabeli 2. Style te obejmują m.in. sztukę renesansu, impresjonizm, kubizm i surrealizm. Zbiór ten jest bardzo istotny w proponowanym modelu, ponieważ dostarcza wiedzy umożliwiającej modułowi SPADE tworzenie kulturowo wzbogaconych wzorów przy jednoczesnym zachowaniu informacji strukturalnych uzyskanych w procesie segmentacji. Zbiór danych składa się z 56 000 obrazów do uczenia oraz 12 000 obrazów do walidacji i testowania. Obrazy zawarte w zbiorze pomagają w efektywnym trenowaniu modelu DL.

ParametrOpis
Nazwa zestawu danychZbiór danych WikiArt
Źródło zbioru danychRepozytorium WikiArt (https://www.wikiart.org/)
DziedzinaSztuka cyfrowa i malarstwo
Łączna liczba obrazówOkoło 80 000 dzieł sztuki
Obrazy treningowe56,000
Obrazy walidacyjne12,000
Obrazy testowe12,000
Style artystyczne27 stylów artystycznych, w tym renesans, impresjonizm, kubizm, surrealizm, ekspresjonizm, realizm i sztuka abstrakcyjna
Oryginalna rozdzielczość obrazuOryginalne rozdzielczości obrazów różnią się w zależności od dzieł i źródeł. Obrazy zostały przeskalowane do jednolitej rozdzielczości 256. × 256 pikseli podczas przetwarzania wstępnego.
Rozdzielczość szkoleniaObrazy zmienione na rozmiar 256 × 256 pikseli podczas wstępnego przetwarzania przed nauką stylu artystycznego i syntezą obrazu sterowaną segmentacją.
Podział zbioru danychStratyfikowany podział losowy (70% zbiór treningowy, 15% zbiór walidacyjny i 15% zbiór testowy) z wykorzystaniem stałego ziarna losowości 42
Strategia próbkowania styluZastosowano stratyfikowane próbkowanie proporcjonalne, aby zachować rozkład 27 stylów artystycznych w podzbiorach treningowym, walidacyjnym i testowym.
Zastosowanie w niniejszym badaniuUczenie stylu artystycznego, reprezentacja stylu oraz artystyczna synteza kierowana segmentacją

Tabela 2: Charakterystyka zbioru danych WikiArt. Podsumowanie zbioru danych WikiArt wykorzystanego do uczenia stylów artystycznych oraz syntezy obrazów sterowanej stylem. Tabela opisuje źródło zbioru danych, rozkład obrazów, zakres stylów artystycznych, partycjonowanie zbioru, rozdzielczość obrazów oraz jego zastosowanie w proponowanym modelu SegCycle-SPADE.

Zbiór danych Miao Batik zawiera 15 148 obrazów przedstawiających tradycyjne motywy kulturowe ludu Miao.32 Zbiór ten jest publicznie dostępny za pośrednictwem serwisu Zenodo (https://doi.org/10.5281/zenodo.20807658). Przed trenowaniem modelu wszystkie obrazy zostały poddane inspekcji wizualnej, przeskalowane do rozmiaru 256 × 256 pikseli, znormalizowane oraz sprawdzone pod kątem uszkodzonych lub zduplikowanych próbek. Przesiewowa kontrola jakości nie doprowadziła do wykluczenia żadnych obrazów; w związku z tym wszystkie 15 148 obrazów zachowano do dalszej analizy. Zbiór danych został losowo podzielony na podzbiory treningowy (70%), walidacyjny (15%) i testowy (15%) przy użyciu stałego ziarna losowości (random seed) wynoszącego 42, aby zapewnić powtarzalność podziału zbioru. Dostęp do zbioru danych WikiArt uzyskano poprzez oficjalne repozytorium WikiArt (https://www.wikiart.org/), który zawiera ponad 80 000 dzieł sztuki reprezentujących 27 stylów artystycznych. W eksperymentach dotyczących uczenia stylu wykorzystano 56 000 obrazów do trenowania, 12 000 do walidacji i 12 000 do testowania.

Przetwarzanie wstępne danych
Przed rozpoczęciem trenowania proponowanego frameworku SegCycle-SPADE, zestaw danych motywów kulturowych Miao Batik oraz zestaw danych WikiArt poddano kilku etapom przetwarzania wstępnego, aby zapewnić spójną jakość obrazów i dokładną reprezentację cech. Do obu zbiorów danych zastosowano ten sam podstawowy schemat przetwarzania, obejmujący odszumianie gaussowskie, normalizację, zmianę rozmiaru do spójnej rozdzielczości wejściowej oraz weryfikację jakości obrazu. Jednak oba zest danych pełniły w ramach frameworku odmienne role. Zestaw WikiArt służył do nauki i syntezy stylu artystycznego, natomiast zestaw Miao Batik był wykorzystywany głównie do segmentacji i rekonstrukcji motywów kulturowych. Poza tymi specyficznymi dla zadań rolami nie wprowadzono żadnych zmian w przetwarzaniu wstępnym zależnych od zestawu danych. Aby zapewnić spójne przetwarzanie przez model DL, obrazy najpierw zmieniono do stałej rozdzielczości. Krok ten był niezbędny, ponieważ obrazy w obu zbiorach różniły się rozdzielczością w zależności od źródła. Zmiana rozmiaru zwiększyła wydajność obliczeniową i zapobiegła wpływowi niespójności wymiarowych na proces trenowania. Drugim etapem przetwarzania wstępnego była normalizacja, w której wartości pikseli przeskalowano do znormalizowanego zakresu, aby ustabilizować aktualizacje gradientu podczas trenowania. Następnie obrazy przetworzono za pomocą filtrowania gaussowskiego w celu redukcji szumu, który mógłby zakłócić strukturę motywów kulturowych. W przypadku zestawu Miao Batik, do trenowania i ewaluacji segmentacji semantycznej wykorzystano bez modyfikacji istniejące maski segmentacji motywów kulturowych, pozyskane bezpośrednio z oryginalnego źródła zestawu danych. Na potrzeby niniejszego badania nie generowano nowych masek segmentacji.

O ile nie wskazano inaczej, równania opisujące uznane metody zostały zaadaptowane z wcześniejszych badań i są odpowiednio cytowane. Równania opisujące proponowany CAFFM oraz zintegrowany system optymalizacji SegCycle-SPADE zostały opracowane przez autorów na potrzeby niniejszego badania.

Przyjmijmy, że obraz wejściowy z zestawu danych jest reprezentowany przez Równanie 1:

figure-protocol-2  (1)

Tutaj H, W i C oznaczają odpowiednio wysokość obrazu, szerokość oraz liczbę kanałów kolorystycznych. Wszystkie obrazy są zmieniane na stały rozmiar H′ × W′, zgodnie z Równaniem 2:

figure-protocol-3

Tutaj Ir oznacza obraz po zmianie rozmiaru. Znormalizowane wartości pikseli oblicza się zgodnie z Równaniem 3:

figure-protocol-4   (3)

Pomaga to ustabilizować procedurę uczenia. Filtrowanie szumów jest wykonywane przy użyciu filtra Gaussa, zgodnie z Równaniem 4:

figure-protocol-5

Tutaj G(σ) oznacza filtr Gaussa, a * oznacza splot. Zastosowano filtr Gaussa o jądrze 5 × 5 i odchyleniu standardowym σ = 1.0. W celu zredukowania artefaktów krawędziowych zastosowano dopełnienie lustrzane (reflective padding) dla pikseli brzegowych. Proces odszumiania przeprowadzono bezpośrednio po załadowaniu obrazu, przed skalowaniem i normalizacją. Aby zapewnić jednolity preprocessing w całym badaniu, tę samą konfigurację filtra zastosowano do każdego obrazu w zbiorach danych Miao Batik oraz WikiArt. Dla zbioru danych Miao Batik maski segmentacji są tworzone zgodnie z Równaniem 5:

figure-protocol-6

Tutaj M to maska segmentacji służąca do kierowania modelem SegFormer.

Potok przetwarzania wstępnego rozpoczyna się od pozyskania obrazów z zestawu danych Miao Batik oraz zestawu danych WikiArt, co przedstawiono na Ryc. 3. Podczas uczenia nie zastosowano technik augmentacji danych. Po wstępnym przetwarzaniu, które obejmowało zmianę rozmiaru, normalizację, odszumianie Gaussa oraz przygotowanie masek segmentacyjnych, obrazy zostały bezpośrednio wykorzystane do uczenia, walidacji i testowania proponowanego frameworka SegCycle-SPADE. Pierwszym krokiem potoku przetwarzania wstępnego jest zmiana rozmiaru obrazów do stałej wielkości, co pozwala modelowi DL na bardziej efektywne przetwarzanie danych. Drugi krok obejmuje normalizację, która przekształca wartości pikseli na zestandaryzowany zakres numeryczny i ułatwia zbieżność modelu. Trzeci krok polega na usuwaniu szumów, dzięki czemu obrazy są oczyszczane z niepożądanych zakłóceń w celu poprawy rozpoznawania wzorców. Ponadto, w przypadku zestawu danych Miao Batik, adnotowano obszary motywów kulturowych, co umożliwiło wygenerowanie masek wykorzystywanych w module segmentacji proponowanego modelu, zapewniając zachowanie motywów kulturowych podczas generowania. Wynikiem końcowym tego etapu jest oczyszzczony zestaw danych, gotowy do uczenia modułów segmentacji i generowania proponowanego modelu.

figure-protocol-7
Rysunek 3. Potok wstępnego przetwarzania danych dla obrazów dziedzictwa kulturowego. Schemat blokowy ilustrujący procedury wstępnego przetwarzania obrazów stosowane przed trenowaniem modelu. Potok obejmuje pozyskiwanie zbioru danych, zmianę rozmiaru obrazów, normalizację, odszumianie Gaussa, istniejące adnotacje motywów kulturowych oraz przygotowanie masek segmentacyjnych. Przetworzone obrazy i maski stanowią dane wejściowe dla segmentacji semantycznej i rekonstrukcji wzorów. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Każdy obraz został poddany procesowi kontroli jakości przed trenowaniem modelu. Zbiór danych Miao Batik zawierał 15 148 obrazów. Próbki uszkodzone, zdublowane i niskiej jakości zostały już usunięte przez twórców oryginalnego zbioru danych; w związku z tym w niniejszym badaniu podczas przesiewowej kontroli jakości nie wykluczono żadnych dodatkowych obrazów. W konsekwencji do analizy zachowano wszystkie 15 148 obrazów. Podczas przetwarzania wstępnego obrazy wczytywano w formacie RGB i zmieniano ich rozmiar do 256 × 256 pikseli przy użyciu interpolacji bilinearnej. Wartości pikseli przeskalowano z zakresu [0, 255] do [0, 1] poprzez podzielenie ich przez 255. Następnie zastosowano normalizację kanałową, używając wartości średnich [0.485, 0.456, 0.406] oraz wartości odchylenia standardowego [0.229, 0.224, 0.225] odpowiednio dla kanałów czerwonego, zielonego i niebieskiego. Potok przetwarzania wstępnego obejmował wczytywanie obrazów, konwersję do RGB, zmianę rozmiaru, skalowanie wartości pikseli, normalizację oraz konwersję na tensory. W razie potrzeby obrazy w skali szarości konwertowano na trójkanałowy format RGB, aby zachować kompatybilność z modelami DL. Po przetwarzaniu wstępnym obrazy podzielono na podzbiory treningowe, walidacyjne i testowe. Wszystkie etapy struktury SegCycle-SPADE — w tym segmentacja semantyczna, fuzja cech, rekonstrukcja motywów oraz synteza artystyczna oparta na SPADE — wykorzystywały spójną rozdzielczość wejściową 256 × 256 pikseli.

Segmentacja wzorców semantycznych z wykorzystaniem SegFormer
Po tym etapie wstępnego przetwarzania, oczyszczone i znormalizowane obrazy z zestawu danych motywów kulturowych Miao Batik oraz zestawu danych WikiArt są wprowadzane do modułu segmentacji semantycznej opartego na zaproponowanym modelu SegFormer-B2. Celem tego kroku jest prawidłowa identyfikacja i wyodrębnienie motywów kulturowych występujących we wzorach dziedzictwa. Zaproponowana architektura SegFormer opiera się na strukturze transformera, która zawiera hierarchiczny koder Transformer oraz lekki dekoder MLP, aby precyzyjnie przechwytywać globalne informacje kontekstowe, a także szczegółowe informacje strukturalne ze złożonych wzorów dziedzictwa. Model najpierw ekstrahuje reprezentacje cech w wielu skalach z obrazu wejściowego, a następnie dokonuje fuzji tych reprezentacji poprzez dekoder w celu wygenerowania dokładnych segmentacji wzorów. Zapewnia to prawidłową segmentację wzorów na obrazie dziedzictwa na takie motywy jak wzory geometryczne, kwiatowe i symboliczne, oddzielając je tym samym od tła przy jednoczesnym zachowaniu ich integralności strukturalnej. Informacje strukturalne te są następnie wykorzystywane w późniejszych etapach generowania wzorów w ramach struktury SegCycle-SPADE.

Niech przetworzony obraz wejściowy będzie reprezentowany jako Równanie 6:

figure-protocol-8    (6)

Koder SegFormer dzieli obraz na fragmenty i wyodrębnia cechy hierarchiczne za pomocą warstw transformera, co przedstawiono w Równaniu 71:

figure-protocol-9

Tutaj F oznacza wieloskalowe mapy cech uzyskane z kodera transformera. Cechy te kodują zarówno lokalne wzorce tekstury, jak i globalne zależności kontekstowe między regionami motywów. Model SegFormer ekstrahuje mapy cech w różnych skalach, zgodnie z definicją w Równaniu 8:

figure-protocol-10

Zastosowanie reprezentacji wielkoskalowych ułatwia wykrywanie wzorców o różnych rozmiarach w obrębie motywów kulturowych. Ostatecznie cechy są łączone przy użyciu dekodera MLP, jak pokazano w Równaniu 91:
 figure-protocol-11

Tutaj S oznacza końcową przewidzianą mapę segmentacji.

Szkielet SegFormer-B2 został zainicjalizowany przy użyciu wag wytrenowanych na zbiorze ImageNet, a następnie dostrojony na zbiorze danych Miao Batik w celu segmentacji motywów kulturowych. Punkt kontrolny pretreningu pozyskano z oficjalnej implementacji SegFormer. W szczególności do inicjalizacji szkieletu SegFormer-B2 przed dostrajaniem wykorzystano punkt kontrolny MIT-B2 wytrenowany na ImageNet-1K (mit_b2.pth), udostępniony w oficjalnym repozytorium SegFormer. Wagi pretreningowe odpowiadają szkieletowi MIT-B2 wydanemu przez autorów SegFormer i posłużyły jako model inicjalizujący dla treningu segmentacji semantycznej. Pozostałe warstwy specyficzne dla zadania zostały zainicjalizowane przy użyciu domyślnych procedur inicjalizacji wag PyTorch przed rozpoczęciem treningu.

W architekturze zastosowano czterostopniowy hierarchiczny enkoder Transformer z nakładającymi się osadzeniami patchy (patch embeddings). Na etapie początkowym rozmiar patcha ustawiono na 7 × 7 z krokiem 4. Dla każdego z czterech etapów enkodera wymiary osadzeń wynosiły odpowiednio 64, 128, 320 i 512. W ramach czterech etapów zastosowano odpowiednio 1, 2, 5 i 8 głowic wielogłowicowej samoatencji (multihead self-attention), a odpowiadające im głębokości enkodera wynosiły 3, 4, 6 i 3 warstwy. Cechy wieloskalowe pobrane z enkodera zostały zagregowane za pomocą lekkiego dekodera opartego wyłącznie na MLP (all-MLP decoder). Przed utworzeniem końcowej mapy segmentacji dekoder rzutował cechy z każdego etapu enkodera do jednej wspólnej przestrzeni osadzeń. Wszystkie bloki Transformera wykorzystywały funkcję aktywacji Gaussian Error Linear Unit (GELU). Podczas trenowania zastosowano współczynnik dropout wynoszący 0.1 w celu poprawy generalizacji i ograniczenia przeuczenia.

Podczas fazy uczenia framework SegFormer otrzymuje wstępnie przetworzone obrazy z obu zbiorów danych. Obrazy ze zbioru danych Miao Batik zawierają obszary motywów, które służą jako etykiety dla nadzorowanego uczenia modelu segmentacji. Koder Transformer przetwarza cały obraz i rejestruje dalekosiężne zależności między komponentami obrazu, co jest szczególnie istotne w przypadku tradycyjnych wzorów batik zawierających motywy rozproszone przestrzennie. Hierarchiczny mechanizm ekstrakcji cech jednocześnie rejestruje struktury lokalne, takie jak powtarzające się tekstury geometryczne. Dekoder MLP przetwarza te wyekstrahowane cechy i generuje maskę segmentacji wyróżniającą obszary motywów. Mapy segmentacji wygenerowane na tym etapie są następnie wykorzystywane jako wejścia strukturalne dla modułu uwagi oraz etapu rekonstrukcji wzorów, co pomaga zachować autentyczność generowanych wzorów.

Motywy kulturowe podzielono na różne klasy do segmentacji semantycznej zgodnie z ich cechami wizualnymi i kulturowymi. Taksonomia segmentacji obejmowała motywy zwierzęce (np. motyle, ryby, ptaki i inną symboliczną faunę), motywy roślinne (np. kwiaty, liście, pnącza i wzory botaniczne), motywy geometryczne (np. powtarzające się kształty, obramowania i abstrakcyjne struktury geometryczne) oraz obszary tła reprezentujące strefy bez motywów. Maski segmentacji na poziomie pikseli wykorzystano do przypisania każdego piksela do jednej z predefined klas. Etykiety całkowitoliczbowe zakodowano w następujący sposób: Etykieta 0 = tło, Etykieta 1 = motywy zwierzęce, Etykieta 2 = motywy roślinne i Etykieta 3 = motywy geometryczne. Adnotacje segmentacyjne i etykiety motywów pobrano bezpośrednio z oryginalnego źródła zbioru danych Miao Batik. W niniejszym badaniu nie przeprowadzono żadnych dodatkowych ręcznych adnotacji, ponownego etykietowania, weryfikacji granic ani procedur potwierdzenia przez ekspertów. Istniejące adnotacje dostarczone przez twórców zbioru danych wykorzystano bez modyfikacji do trenowania i ewaluacji.

Model SegFormer do segmentacji motywów kulturowych przetwarza wstępnie przygotowane obrazy z zestawu danych Miao Batik oraz zestawu danych WikiArt, wykorzystując mechanizm oparty na transformerze do dokładnego wykrywania obszarów wzorów kulturowych, jak pokazano na Rysunku 4. Najpierw obraz wejściowy zawierający tradycyjne motywy kulturowe jest dostarczany do modelu SegFormer. Koder Transformera wyodrębnia zarówno globalne informacje kontekstowe, jak i lokalne cechy strukturalne z fragmentów obrazu. Wynikowe cechy wieloskalowe są przekazywane do dekodera segmentacji, który wykorzystuje sieć Mix Feed-Forward do doprecyzowania reprezentacji cech i poprawy wykrywania motywów. Wynikiem modelu SegFormer jest maska segmentacyjna, która wyróżnia piksele odpowiadające wzorom kulturowym, jednocześnie tłumiąc nieistotne informacje tła. Wyizolowane wzory kulturowe służą następnie jako prowadzenie strukturalne dla kolejnych etapów architektury SegCycle-SPADE.

figure-protocol-12
Rysunek 4. Segmentacja semantyczna motywów kulturowych oparta na modelu SegFormer-B2. Architektura modułu segmentacji semantycznej SegFormer-B2 wykorzystanego do ekstrakcji motywów kulturowych i wytrenowanego wyłącznie na zbiorze danych Miao Batik. Struktura składa się z kodera opartego na Transformerze do wieloskalowej ekstrakcji cech oraz lekkiego dekodera segmentacji do generowania masek motywów. Model przewiduje cztery klasy semantyczne — zwierzęta, rośliny, formy geometryczne i tło — gdzie wynikowe maski segmentacji identyfikują istotne kulturowo obszary motywów, jednocześnie tłumiąc nieistotne informacje tła. Wyniki segmentacji te zapewniają wskazówki strukturalne dla następnych etapów fuzji cech, rekonstrukcji i syntezy artystycznej w proponowanym frameworku SegCycle-SPADE. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

W sugerowanych ramach nie ma potrzeby tworzenia nowych adnotacji segmentacyjnych. Zbiór danych Miao Batik pozyskano z istniejącego publicznego źródła, a model został wytrenowany przy użyciu powiązanych informacji o motywach dostarczonych przez twórców zbioru danych. W procesie uczenia model SegFormer generował mapy segmentacji semantycznej. W związku z tym obecne badanie nie wymagało zastosowania dodatkowego oprogramowania do adnotacji manualnych, wytycznych dotyczących adnotacji ani procedur kontroli jakości adnotacji.

CAFFM
Aby poprawić interakcję między cechami segmentacji semantycznej a reprezentacjami rekonstrukcji generatywnej, w badaniu zaproponowano również moduł CAFFM. Koder SegFormer-B2 dostarcza mapy cech semantycznych do modułu CAFFM, natomiast etap rekonstrukcji CycleGAN dostarcza mapy cech generatywnych. W pierwszej kolejności zastosowano warstwy projekcji liniowej w celu rzutowania obu strumieni cech do wspólnej przestrzeni zanurzeń. Do obliczeń cross-attention stworzono reprezentacje zapytania (Q), klucza (K) oraz wartości (V) przy użyciu wygenerowanych tensorów cech. Następnie relacje między informacjami o motywach strukturalnych a elementami stylu artystycznego zostały zamodelowane za pomocą wielogłowicowego mechanizmu cross-attention. Do połączonych reprezentacji cech zastosowano następnie normalizację warstwową, połączenia rezdualne oraz warstwy feed-forward z aktywacją GELU. Etap syntezy oparty na SPADE otrzymuje wynik z modułu CAFFM, co pozwala na zachowanie istotnych kulturowo motywów bez utraty spójności artystycznej.

Aby zagwarantować kompatybilność cech, cechy wejściowe są najpierw rzutowane za pomocą liniowych warstw projekcyjnych na wspólną przestrzeń osadzeń o wymiarze osadzenia wynoszącym 256. Powiązania między semantycznymi informacjami strukturalnymi a generatywnymi reprezentacjami stylu są następnie modelowane przy użyciu mechanizmu MultiHead Cross-Attention z ośmioma głowicami uwagi. Obliczenia uwagi krzyżowej wykorzystują wektory zapytania (Query, Q), klucza (Key, K) i wartości (Value, V), które są generowane przez specyficzne liniowe warstwy transformacji. W celu zwiększenia stabilności treningu i zachowania integralności cech, zastosowano połączenia rezydualne oraz normalizację warstwową (Layer Normalization), aby dodatkowo ulepszyć scalone reprezentacje cech. Nieliniowe uczenie cech jest następnie usprawniane poprzez zastosowanie sieci typu feed-forward z funkcją aktywacji Gaussian Error Linear Unit (GELU). Moduł generuje reprezentację cech wyjściowych o wymiarze 256, która jest przekazywana do kolejnych etapów w celu syntezy kreatywnej. CAFFM skutecznie łączy dane o stylu artystycznym ze strukturami motywów kulturowych, wykorzystując technikę fuzji opartą na uwadze krzyżowej, co poprawia zachowanie motywów oraz spójność wizualną w zrekonstruowanych wzorach dziedzictwa kulturowego.

W proponowanym systemie cechy strukturalne są pochodne z zestawu danych Miao Batik, natomiast cechy stylistyczne są uczone na podstawie zestawu danych WikiArt. Przyjmijmy, że mapa cech pochodząca z sieci segmentacyjnej SegFormer z wykorzystaniem obrazów z zestawu danych Miao Batik jest oznaczana jako Fs, natomiast mapa cech pochodząca z gałęzi ekstrakcji cech stylu z obrazów WikiArt jest oznaczana jako Fa. Proponowany moduł CAFFM łączy dwie domeny cech za pomocą mechanizmu cross-attention, aby nauczyć się zależności strukturalnych i stylistycznych wzorów kulturowych. Tabela 3 przedstawia wszystkie charakterystyki architektoniczne, w tym wymiary osadzeń, warstwy normalizacji, funkcje aktywacji oraz konfigurację głowic uwagi. Dla rozmiaru obrazu wejściowego 256 × 256 pikseli, koder SegFormer-B2 generował semantyczne mapy cech o rozmiarze 64 × 64 × 128, podczas gdy gałąź ekstrakcji cech stylu generowała mapy cech o rozmiarze 64 × 64 × 128. Obie mapy cech zostały rzutowane za pomocą wyuczalnych warstw liniowych do wspólnej przestrzeni osadzeń o wymiarze 256 przed fuzją za pomocą cross-attention.

ParametrKonfiguracja
Proponowany schematSegCycle-SPADE
Model segmentacji semantycznejSegFormer-B2
Etapy kodera SegFormer4
Inicjalizacja wagWstępnie wytrenowany model SegFormer-B2 (szkielet MIT-B2) na zbiorze ImageNet-1K
Źródło punktu kontrolnegoOficjalne repozytorium NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); punkt kontrolny: segformer.b2.512x512.ade.160k
Strategia dostrajaniaPełne dostrajanie (end-to-end fine-tuning) na zbiorze danych Miao Batik
Rozmiar osadzania patchy7 × 7
Krok patcha4
Wymiary osadzeń64, 128, 320 i 512
Głębokości koderów3, 4, 6 i 3
Głowice uwagi1, 2, 5 i 8
Typ dekoderaDekoder oparty wyłącznie na MLP
Funkcja aktywacjiGELU
Współczynnik rezygnacji0.1
Moduł ulepszania cechModuł fuzji cech kulturowych z mechanizmem wzajemnej uwagi (Cross-Attention Cultural Feature Fusion Module, CAFFM)
Wymiar zanurzenia CAFFM256
Głowice uwagi CAFFM8
Skale fuzji CAFFM4
Model rekonstrukcyjnyCycleGAN
Model generowania styluSPADE
Zbiór danych kulturowychZbiór danych Miao Batik
Zbiór danych styluZbiór danych WikiArt
Obrazy batikowe ludu Miao15,148
Obrazy z WikiArtOkoło 80 000
Rozdzielczość obrazu wejściowego256 × 256 pikseli
Format koloruRGB
Metoda interpolacjiInterpolacja biliniarna
Metoda odszumianiaFiltrowanie gaussowskie
Rozmiar jądra Gaussa5 × 5
Sigma Gaussa (σ)1
Zakres normalizacji[0, 1]
Wielkość serii16
Liczba epok100
OptymalizatorAdam
Szybkość uczenia0.0002
Parametry Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, zanikanie wag = 0
Funkcje stratystrata segmentacji, strata adwersarialna, strata spójności cyklicznej, strata rekonstrukcji, strata zachowania motywu oraz strata spójności stylu
Strategia podziału zbioru danychTrenowanie / Walidacja / Testowanie
Zbiór treningowy70%
Zbiór walidacyjny15%
Zbiór testowy15%
Ziarno losowości42
Metryki ocenyDokładność segmentacji, IoU, współczynnik Dice'a, SSIM, PSNR i FID
Język programowaniaPython 3.8.10
Środowisko uczenia głębokiegoPyTorch 1.10.0
Platforma sprzętowaGPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11. generacja), 32 GB RAM
Środowisko operacyjneUbuntu 20.04 LTS

Tabela 3: Konfiguracja eksperymentalna i modelu. Podsumowanie komponentów architektonicznych, konfiguracji treningu, ustawień przetwarzania wstępnego, zbiorów danych, parametrów optymalizacji, metryk ewaluacji oraz środowiska obliczeniowego wykorzystanego do implementacji i oceny proponowanego frameworka SegCycle-SPADE.

Moduł uwagi najpierw odwzorowuje mapę cech na reprezentacje zapytania (query), klucza (key) i wartości (value) zgodnie z Równaniem 10:

figure-protocol-13

W tym przypadku Wq, Wk oraz Wv są uczeniacymi się macierzami wag. Wagi uwagi są obliczane na podstawie podobieństwa między wektorem zapytania a wektorem klucza zgodnie z Równaniem 1117

figure-protocol-14

Tutaj dk to wymiar wektora klucza. Ulepszoną reprezentację cech oblicza się poprzez pomnożenie wag uwagi przez macierz wartości zgodnie z Równaniem 12:

figure-protocol-15

W tym przypadku Fa jest ulepszoną reprezentacją cech mapy cech. Ulepszona reprezentacja cech jest obliczana poprzez połączenie oryginalnych cech segmentacji z cechami ulepszonymi, uzyskanymi za pomocą mechanizmu uwagi zgodnie z Równaniem 13:

figure-protocol-16                                

Tutaj Fe to ulepszona mapa cech wykorzystywana do rekonstrukcji wzorca. Moduł CAFFM został rozszerzony o wieloskalowy mechanizm wzajemnej uwagi (cross-attention), aby wyodrębnić cechy motywów kulturowych w różnych skalach. Niech Fsi oznacza cechy segmentacji w skali i, natomiast Faj oznacza cechy stylu artystycznego w tej samej skali. Końcowa reprezentacja cech została zdefiniowana za pomocą Równania 14:

  figure-protocol-17

Tutaj Qi, Ki oraz Vi reprezentują odpowiednio macierze zapytania (query), klucza (key) i wartości (value) w skali i, a N oznacza liczbę skal cech. W niniejszym badaniu N = 4, co odpowiada mapom cech wyodrębnionym przy rozdzielczościach przestrzennych wynoszących 1/4, 1/8, 1/16 i 1/32 rozmiaru obrazu wejściowego. Te wieloskalowe reprezentacje cech zostały połączone przy użyciu nauczalnych wag uwagi przed rekonstrukcją i syntezą artystyczną. Powyższe rozszerzenie umożliwia metodzie wyodrębnienie globalnych motywów kulturowych i tekstur w celu rekonstrukcji wzorów kulturowych. CAFFM znajduje się pomiędzy etapem segmentacji opartym na SegFormer a etapem syntezy kreatywnej opartym na SPADE w zaproponowanym systemie SegCycle-SPADE. Najpierw, podczas gdy CycleGAN jednocześnie tworzy cechy rekonstrukcji z informacjami stylistycznymi i wzorcowymi, SegFormer-B2 odzyskuje semantyczne mapy cech opisujące właściwości strukturalne motywów kulturowych. Moduł CAFFM przyjmuje te dwa strumienie cech i wykorzystuje fuzję opartą na mechanizmie cross-attention do identyfikacji zależności między reprezentacjami strukturalnymi a artystycznymi. Aby stworzyć kulturowo autentyczne wzory przy zachowaniu spójności semantycznej i cech strukturalnych, wynikowe połączone mapy cech są następnie przesyłane do modułu SPADE w celu kreatywnej syntezy sterowanej segmentacją.

Rekonstrukcja wzorów z wykorzystaniem CycleGAN
Po zakończeniu etapu wzmacniania cech opartego na mechanizmie uwagi, mapy cech będą zawierać wzmocnione struktury motywów kulturowych. Mapy cech mogą jednak nadal zawierać niekompletne lub uszkodzone obszary wzorów. W związku z tym, aby rozwiązać problem rekonstrukcji wzorów, proponowana struktura wykorzysta model CycleGAN. W proponowanej strukturze dwiema domenami będą oryginalne wzory motywów kulturowych oraz zrekonstruowane wzory motywów kulturowych. Wykorzystując cechy wzmocnione na poprzednich etapach, model CycleGAN zrekonstruuje wzory kulturowe, zachowując spójność strukturalną. Zapewni to, że wzory kulturowe, takie jak wzory geometryczne, roślinne i symboliczne, zachowają swój układ przestrzenny. Oryginalne obrazy batiku ludu Miao zostały poddane operacjom losowego maskowania i częściowego przesłaniania w celu wygenerowania niekompletnych lub uszkodzonych motywów kulturowych. Procedury degradacji te symulowały brakujące obszary wzorów i uszkodzenia strukturalne powszechnie obserwowane w zdegradowanych artefaktach dziedzictwa kulturowego. Zdegradowane obrazy posłużyły jako dane wejściowe do modułu rekonstrukcji, natomiast odpowiadające im obrazy oryginalne służyły jako obrazy referencyjne do oceny wydajności i jakości rekonstrukcji. Strategia ta umożliwiła modelowi naukę przywracania brakujących struktur motywów przy jednoczesnym zachowaniu spójności semantycznej i cech kulturowych.

Przyjmijmy, że X jest domeną niepełnych wzorców kulturowych, a Y domeną zrekonstruowanych wzorców kulturowych. Dwa generatory uczą się wykonywać mapowanie dwukierunkowe zgodnie z Równaniem 15:

 figure-protocol-18

Tutaj GE jest wykorzystywane do rekonstrukcji struktur motywów, a FM do mapowania wzorców z powrotem na oryginalną domenę. Strata przeciwstawna jest stosowana w celu zapewnienia, że zrekonstruowane wzorce są realistyczne (Równanie 16)30

figure-protocol-19

W tym przypadku DY jest dyskryminatorem służącym do rozróżniania wzorów rzeczywistych i zrekonstruowanych, a GE(x) oznacza wygenerowany wzór zrekonstruowany. CycleGAN wymusza również spójność cyklu w celu zachowania układu strukturalnego motywów kulturowych (Równanie 17)30.

figure-protocol-20

Ostateczna funkcja straty została zdefiniowana w Równaniu 1830:

figure-protocol-21

Tutaj λi oznacza współczynnik wagowy dla straty spójności cyklicznej, który podczas treningu ustawiono na 10, zgodnie z oryginalną sformułowaniem CycleGAN. Wartość ta została wybrana w celu zrównoważenia uczenia przeciwstawnego i spójności rekonstrukcji pomiędzy domenami źródłową a docelową.

Moduł rekonstrukcji CycleGAN składa się z dwóch generatorów i dwóch dyskryminatorów służących do dwukierunkowej translacji obrazów. Każdy generator opiera się na architekturze sieci rezdualnej, składającej się z początkowej warstwy konwolucyjnej 7 × 7, po której następują dwie warstwy konwolucyjne zmniejszające próbkowanie (downsampling), dziewięć bloków rezdualnych oraz dwie warstwy zwiększające próbkowanie (upsampling). Wszystkie operacje konwolucyjne wykorzystują jądro o rozmiarze 3 × 3, z wyjątkiem warstwy wejściowej, która wykorzystuje jądro 7 × 7 w celu usprawnionej ekstrakcji cech. Po każdej warstwie konwolucyjnej zastosowano normalizację instancji (Instance Normalization) dla poprawy stabilności treningu, natomiast w całej sieci generatora wykorzystano aktywację ReLU. Warstwa wyjściowa stosuje funkcję aktywacji Tanh do generowania znormalizowanych obrazów wyjściowych. Dyskryminator opiera się na architekturze PatchGAN 70 × 70, składającej się z serii warstw konwolucyjnych z jądrami o rozmiarze 4 × 4 i progresywnie zwiększającą się liczbą kanałów cech. W dyskryminatorze zastosowano normalizację instancji oraz aktywację LeakyReLU (nachylenie ujemne = 0,2) w celu poprawy dyskryminacji cech i uczenia przeciwstawnego (adversarial learning). Moduł CycleGAN przyjmuje jako wejście wstępnie przetworzone obrazy motywów kulturowych i generuje zrekonstruowane reprezentacje wzorów, które są następnie przekazywane do CAFFM w celu integracji z cechami segmentacji. Trening CycleGAN przeprowadzono przy użyciu optymalizatora Adam (β₁ = 0,5, β₂ = 0,999) z początkową szybkością uczenia 0,0002. Szybkość uczenia była utrzymywana przez pierwsze 100 epok, a następnie liniowo zmniejszana do zera w pozostałym czasie treningu. W celu stabilizacji treningu dyskryminatora zastosowano bufor powtórek (replay buffer) zawierający 50 wcześniej wygenerowanych obrazów. Generatory i dyskryminatory były aktualizowane w stosunku 1:1, gdzie jednej aktualizacji generatora towarzyszyła jedna aktualizacja dyskryminatora podczas każdej iteracji treningu.

Proces rekonstrukcji w sieci CycleGAN opiera się na ulepszonych mapach cech uzyskanych za pomocą mechanizmu CAFFM przedstawionego na Ryc. 5. Mapy cech zawierają ulepszone motywy kulturowe otrzymane w poprzednich etapach segmentacji i CAFFM. Mapy cech służą jako dane wejściowe dla pierwszego generatora GE. Pierwszy generator GE uczy się odwzorowania niezbędnego do rekonstrukcji wzorów kulturowych. Wyniki są następnie przekazywane do dyskryminatora DY, aby odróżnić rzeczywiste wzory kulturowe od wzorów zrekonstruowanych. Dyskryminator DY pomaga generatorowi GE generować realistyczne wyniki. Aby zapewnić, że wzory kulturowe nie zostaną zniekształcone podczas rekonstrukcji, drugi generator FM wykonuje odwzorowanie spójności cyklu (cycle-consistency mapping). Drugi generator FM odwzorowuje wyniki z powrotem do domeny oryginalnej. Wyniki są następnie oceniane przez dyskryminator w celu zapewnienia realizmu. Ostateczne wyniki są następnie przesyłane do modułu SPADE w celu generowania stylu artystycznego w kolejnym etapie proponowanego frameworka SegCycle-SPADE.

figure-protocol-22
Rycina 5. Schemat rekonstrukcji wzorów oparty na CycleGAN. Schemat działania modułu rekonstrukcji CycleGAN. Reprezentacje cech wzmocnione mechanizmem uwagi są dostarczane jako dane wejściowe do sieci generatora w celu rekonstrukcji niepełnych motywów kulturowych. Dyskryminator ocenia zrekonstruowane wyniki w odniesieniu do wzorów referencyjnych, podczas gdy mapowanie spójności cyklu (cycle-consistency mapping) zachowuje integralność strukturalną podczas dwukierunkowej translacji obrazów. Zrekonstruowane motywy są następnie przekazywane do modułu SPADE w celu syntezy stylu artystycznego. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Generowanie stylu artystycznego przy użyciu SPADE
Następnie zrekonstruowane motywy kulturowe są poddawane działaniu modułu SPADE w celu wygenerowania stylu artystycznego. Głównym celem modułu SPADE jest dodanie bogatszych wizualnie tekstur stylu artystycznego do zrekonstruowanych motywów kulturowych, bez naruszania ich układu strukturalnego. Moduł SPADE to technika warunkowego generowania obrazów, która wykorzystuje koncepcję segmentacji obrazu do tworzenia grafik. Wielokanałowe mapy semantyczne odpowiadające uprzednio określonym klasom motywów zostały zakodowane z masek segmentacji semantycznej wygenerowanych przez SegFormer-B2. Generator SPADE otrzymał te zakodowane mapy jako wejścia warunkujące. Przestrzennie adaptacyjne parametry skalowania (γ) i przesunięcia (β) były generowane poprzez przetwarzanie map semantycznych w warstwach splotowych w obrębie każdej warstwy SPADE. Dzięki zastosowaniu tych parametrów do znormalizowanych aktywacji cech, generator był w stanie zachować granice motywów, układy strukturalne oraz informacje semantyczne podczas syntezy artystycznej. Naprowadzanie semantyczne mogło wpływać zarówno na wysokopoziomową rekonstrukcję strukturalną, jak i niskopoziomową syntezę tekstur, ponieważ proces warunkowania odbywał się na kilku warstwach generatora SPADE. W rezultacie utworzone wzory artystyczne zawierały cechy stylistyczne pozyskane z zestawu danych WikiArt, przy jednoczesnym zachowaniu struktur motywów kulturowych zidentyfikowanych na etapie segmentacji.

Zbiór danych WikiArt, obejmujący dzieła z 27 różnych kategorii artystycznych — takich jak renesans, impresjonizm, kubizm, ekspresjonizm, surrealizm, realizm i sztuka abstrakcyjna — został wykorzystany jako główny zasób do zrozumienia stylów artystycznych. Aby wystawić model na działanie różnorodnych cech twórczych i poprawić generalizację stylu, podczas trenowania z różnych kategorii losowo wybierano obrazy stylistyczne. Zbiór danych podzielono na podzbiory treningowe, walidacyjne i testowe z zrównoważoną reprezentacją kategorii artystycznych w celu zmniejszenia stronniczości stylistycznej. Aby zapewnić równomierną reprezentację wszystkich 27 kategorii artystycznych, zastosowano próbkowanie warstwowe. Próbki z każdej kategorii zostały proporcjonalnie przydzielone do podzbiorów treningowego, walidacyjnego i testowego, przy zachowaniu oryginalnego rozkładu klas. Moduł CAFFM został użyty do połączenia aspektów stylu pochodzących z obrazów WikiArt z cechami rekonstrukcji wygenerowanymi przez CycleGAN. Aby umożliwić sieci syntezy transfer cech artystycznych przy jednoczesnym zachowaniu struktury semantycznej i granic motywów kulturowych pochodzących z map segmentacji, wynikowe reprezentacje zlane zostały dostarczone jako informacje warunkujące do generatora SPADE. Dzięki tej technice warunkowania stylu zaproponowany schemat był w stanie generować kulturowo autentyczne wzory artystyczne o spójnych reprezentacjach strukturalnych i stylistycznych.

SPADE wprowadza również parametry adaptacyjne przestrzennie, które zależą od mapy segmentacji. Parametry te można zdefiniować zgodnie z Równaniem 191:

figure-protocol-23

W tym przypadku γ(S) jest przestrzennie zmiennym parametrem skali, a β(S) jest przestrzennie zmiennym parametrem przesunięcia. Parametry te mogą pomóc generatorowi w tworzeniu różnych tekstur i stylów w zależności od regionu semantycznego na obrazach. Końcowe dzieło kultury można zdefiniować zgodnie z Równaniem 20:

 figure-protocol-24

Tutaj GE oznacza generator SPADE, XrP jest zrekonstruowanym wzorem, a SM to mapa segmentacji. Końcowe dzieło zachowuje integralność strukturalną motywów kulturowych, jednocześnie poprawiając walory artystyczne. W celu optymalizacji zaproponowanej architektury SegCycle-SPADE zastosowano złożoną funkcję straty, która równoważy dokładność segmentacji semantycznej, zachowanie motywów kulturowych, jakość rekonstrukcji wzoru oraz spójność stylu artystycznego. Całościowy cel uczenia określono jako ważoną mieszaninę straty segmentacji (Lseg), straty adwersarialnej (Ladv), straty spójności cyklicznej (Lcycle), straty rekonstrukcji (Lrecon), straty zachowania motywu (Lmotif) oraz straty spójności stylu (Lstyle). Całkowita funkcja straty została zdefiniowana w Równaniu 21:

figure-protocol-25  (21)

Aby zagwarantować spójność strukturalną między motywami kulturowymi wejściowymi a zrekonstruowanymi, współczynnik straty spójności cyklu ustawiono na 10. W celu zachowania szczegółowych cech motywów i zwiększenia dokładności wizualnej, współczynnik straty rekonstrukcji ustawiono na 5. Aby podkreślić zachowanie kluczowych dla kultury wzorców strukturalnych podczas syntezy artystycznej, dla straty zachowania motywu zastosowano współczynnik 2. W celu promowania transferu stylu artystycznego bez nadmiernego zniekształcania semantycznych struktur motywu, współczynnik straty spójności stylu dostosowano do 1. Aby utrzymać zrównoważony wkład między generowaniem realistycznych obrazów a precyzyjną segmentacją motywów, nadano równe wagi stracie segmentacji i stracie adwersarialnej. Do obliczenia straty spójności stylu wykorzystano reprezentacje stylu oparte na cechach z zestawu danych WikiArt. W szczególności cechy stylu artystycznego uchwycono za pomocą korelacji macierzy Grama wyodrębnionych z głębokich map cech. Do obliczenia straty stylu wykorzystano różnicę normy Frobeniusa między macierzami Grama obrazu stylu docelowego a obrazem wygenerowanym, zgodnie z Równaniem 22:

figure-protocol-26

Tutaj Gl to macierz Grama obliczona z ltej warstwy cech, Igen oznacza wygenerowany obraz artystyczny, Istyle oznacza docelowy obraz stylu z zestawu danych WikiArt, a F oznacza normę Frobeniusa. Taka formuła umożliwia zaproponowanemu frameworkowi zachowanie cech artystycznych przy jednoczesnym utrzymaniu integralności strukturalnej i semantycznej motywów kulturowych.

Połączone reprezentacje cech generowane przez moduł CAFFM są wykorzystywane jako wejścia warunkujące dla modułu SPADE, który pełni funkcję komponentu syntezy artystycznej w proponowanej strukturze. Generator SPADE składa się z siedmiu rezdualnych bloków SPADE o wymiarze cech ukrytych wynoszącym 256 kanałów i generuje obrazy wyjściowe w rozdzielczości 256 × 256 pikseli. Mapy segmentacji semantycznej uzyskane z modułu SegFormer–CAFFM służą jako wejścia warunkujące w poszczególnych rezdualnych warstwach SPADE. Warstwy SPADE są stosowane przed funkcjami aktywacji w każdym bloku rezdualnym, co umożliwia semantyczne warunkowanie sterowane segmentacją. Poprzez kolejne operacje nadpróbkowania i splotu, reprezentacja cech ukrytych jest stopniowo dopracowywana w celu wygenerowania artystycznych wzorów o wysokiej rozdzielczości, przy jednoczesnym zachowaniu spójności semantycznej i struktury motywu. W całym generatorze stosowane są funkcje aktywacji LeakyReLU, natomiast w warstwie wyjściowej zastosowano funkcję aktywacji Tanh w celu uzyskania znormalizowanych obrazów.

Algorytm i przebieg prac
Struktura SegCycle-SPADE integruje segmentację semantyczną, fuzję cech, rekonstrukcję wzorów oraz syntezę stylu artystycznego w ramach jednolitym potoku treningowego. Przebieg prac rozpoczyna się od pozyskania i przetwarzania wstępnego zbioru danych, obejmującego zmianę rozmiaru obrazów, normalizację, odszumianie oraz przygotowanie masek segmentacji. Obrazy po przetwarzaniu wstępnym są następnie przetwarzane przy użyciu sieci segmentacyjnej SegFormer-B2 w celu wyodrębnienia reprezentacji semantycznych motywów. Uzyskane cechy segmentacji są łączone z cechami rekonstrukcji za pomocą modułu CAFFM, co umożliwia interakcję między informacjami o motywach strukturalnych a reprezentacjami cech artystycznych. Zfuzowane mapy cech są następnie przekazywane do modułu rekonstrukcji CycleGAN, który odtwarza niekompletne struktury motywów kulturowych, zachowując spójność semantyczną. Zrekonstruowane wzory są następnie dostarczane do generatora SPADE w celu sterowanej segmentacją syntezy artystycznej, co pozwala na wzmocnienie stylistyczne przy jednoczesnym zachowaniu granic motywów i autentyczności strukturalnej. Podczas treningu parametry modelu są optymalizowane za pomocą złożonej funkcji straty opisanej w Równaniach 21 i 22, która równoważy dokładność segmentacji, zachowanie motywów, jakość rekonstrukcji oraz spójność stylu artystycznego. Szczegółowy, krok po kroku opis przebiegu implementacji, obejmujący ładowanie zbioru danych, przetwarzanie wstępne, inicjalizację modelu, iteracje treningowe, procedury walidacji, wybór punktów kontrolnych oraz końcową ewaluację, znajduje się w Pliku uzupełniającym 1 (Algorytm 1). Kompletny przebieg algorytmiczny zaimplementowano przy użyciu wielkości partii (batch size) wynoszącej 16, współczynnika uczenia (learning rate) 0.0002 oraz 100 epok treningowych. Do podziału zbioru danych, inicjalizacji modelu i wszystkich eksperymentów treningowych zastosowano stałe ziarno losowości (random seed) o wartości 42. Ziarno to było stosowane spójnie w generatorach liczb losowych Python, NumPy i PyTorch w celu zapewnienia powtarzalności. Optymalizator Adam skonfigurowano z parametrami β₁ = 0.5, β₂ = 0.999 i bez zaniku wag (weight decay = 0). Punkty kontrolne modelu wybrano na podstawie najwyższego wyniku IoU na zbiorze walidacyjnym.

Optymalizacja funkcji straty
Aby zachować struktury motywów kulturowych podczas rekonstrukcji i syntezy artystycznej, proponowany model wykorzystuje złożony cel optymalizacji, który łączy straty segmentacji, adversarialne, spójności cyklu, rekonstrukcji, zachowania motywu oraz spójności stylu. Pełny opis matematyczny, współczynniki wagowe oraz definicja straty stylu zostały przedstawione w Równaniach 21 i 22 w podrozdziale Artistic Style Generation using SPADE. Komponent zachowania motywu penalizuje odchylenia strukturalne między przewidywanymi obszarami motywów a odpowiadającymi im maskami segmentacji prawdy podstawowej (ground-truth), co sprzyja zachowaniu kulturowo istotnych struktur wzorów w całym procesie rekonstrukcji.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Zaproponowany framework SegCycle-SPADE został oceniony z wykorzystaniem dwóch zbiorów danych: zbioru motywów kulturowych Miao Batik oraz zbioru WikiArt. Zbiór Miao Batik zawiera obrazy tradycyjnego dziedzictwa kulturowego i był wykorzystywany głównie do zadań segmentacji semantycznej oraz rekonstrukcji strukturalnej, natomiast zbiór WikiArt zawiera zróżnicowane style artystyczne i służył do uczenia oraz generowania stylów artystycznych. Obrazy z obu zbiorów danych zostały przetworzone przez pełny potok SegCycle-SPADE, obejmujący segmentację semantyczną, moduł CAFFM, rekonstrukcję wzorów oraz generowanie stylu artystycznego w oparciu o SPADE. Integracja informacji o motywach kulturowych z reprezentacjami stylu artystycznego pozwoliła frameworkowi na generowanie wyników istotnych kulturowo i spójnych wizualnie.

Wszystkie eksperymenty przeprowadzono na stacji roboczej z obsługą GPU, wyposażonej w procesor Intel Core i7 oraz kartę graficzną NVIDIA GPU. W szczególności eksperymenty wykonano na stacji roboczej z procesorem Intel Core i7 (11. generacji), kartą graficzną NVIDIA RTX 3090 z 24 GB VRAM oraz 32 GB pamięci systemowej. Modele zaimplementowano przy użyciu języka Python 3.8 i biblioteki PyTorch 1.10 z akceleracją CUDA. Trening przeprowadzono w konfiguracji z jednym GPU, bez zastosowania treningu rozproszonego. We wszystkich eksperymentach stosowano standardową precyzję FP32; nie wykorzystano treningu mieszanej precyzji. Użyto optymalizatora Adam z rozmiarem paczki (batch size) wynoszącym 16 przez 100 epok treningowych. Tabela 3 podsumowuje parametry implementacji oraz środowisko obliczeniowe wykorzystane w niniejszym badaniu.

Zaproponowana architektura składa się z czterech głównych komponentów: SegFormer-B2 do segmentacji semantycznej, CAFFM do fuzji cech, CycleGAN do rekonstrukcji motywów oraz SPADE do syntezy stylu artystycznego. Przed rozpoczęciem uczenia obrazy z obu zbiorów danych zostały przeskalowane do rozmiaru 256 × 256 pikseli. Taka standaryzowana rozdzielczość zapewniła wydajność obliczeniową przy jednoczesnym zachowaniu istotnych szczegółów motywów oraz przyczyniła się do stabilnego uczenia przeciwstawnego modułów CycleGAN i SPADE.

Wydajność proponowanego modelu została oceniona przy użyciu metryk segmentacji i oceny jakości obrazu, w tym dokładności segmentacji (Segmentation Accuracy), IoU, współczynnika podobieństwa Dice (Dice), SSIM, PSNR oraz FID. Autentyczność wizualną oceniono jakościowo poprzez inspekcję wizualną wygenerowanych wzorów kulturowych. Ocena jakościowa koncentrowała się na zachowaniu motywów, spójności semantycznej, charakterystyce kulturowej oraz wyglądzie artystycznym w odniesieniu do referencyjnych motywów kulturowych. Autentyczność wizualna nie była wykorzystywana jako niezależna ilościowa metryka oceny.

Ilościowa ocena zaproponowanego schematu została przeprowadzona przy użyciu następujących parametrów.

Dokładność segmentacji obliczono przy użyciu Równania 23:

figure-results-1

W tym przypadku TP, TN, FP i FN oznaczają odpowiednio wyniki prawdziwie dodatnie, prawdziwie ujemne, fałszywie dodatnie oraz fałszywie ujemne.

Wartość IoU obliczono zgodnie z Równaniem 24:

 figure-results-2

Współczynnik podobieństwa Dice'a (Dice) obliczono za pomocą Równania 25:

figure-results-3

Do oceny percepcyjnego podobieństwa obrazów wykorzystano wskaźnik SSIM, który definiuje Równanie 2633:

figure-results-4  (26)

W tym przypadku μ oznacza średnią intensywność, σ oznacza wariancję, σxy oznacza kowariancję między obrazami, a C1 i C2 są stałymi stabilizującymi.

PSNR jest metryką powszechnie stosowaną do oceny jakości wygenerowanych obrazów i jest ona zdefiniowana w Równaniu 2733:

figure-results-5

W tym przypadku MaxI oznacza maksymalną możliwą wartość piksela obrazu, a MSE to średniokwadratowy błąd między obrazem oryginalnym a zrekonstruowanym.

Wartość FID można obliczyć, wykorzystując średnie i macierze kowariancji, zgodnie z Równaniem 2833:

figure-results-6   (28)

W tym przypadku μr jest średnią wartością obrazu rzeczywistego, μg jest średnią wartością obrazu wygenerowanego, a Σr i Σg to odpowiednio macierze kowariancji obrazów rzeczywistych i wygenerowanych.

W celu porównania wydajności zaproponowaną strukturę oceniono w zestawieniu z reprezentatywnymi metodami powszechnie stosowanymi w segmentacji semantycznej, rekonstrukcji obrazu oraz artystycznego generowania obrazów. Jako bazy dla segmentacji uwzględniono U-Net oraz DeepLabV3+, natomiast jako bazy dla rekonstrukcji – Pix2Pix i CycleGAN. StyleGAN oraz AttentionGAN posłużyły jako reprezentatywne metody artystycznego generowania obrazów. Porównania te przeprowadzono, aby ocenić skuteczność SegCycle-SPADE w zachowywaniu informacji o motywach strukturalnych przy jednoczesnej poprawie jakości artystycznej.

Każdy eksperyment powtórzono pięciokrotnie w celu oceny stabilności i powtarzalności wyników. Do podziału zbioru danych zastosowano stałe ziarno losowe (random seed) o wartości 42, aby zapewnić spójność podzbiorów treningowych, walidacyjnych i testowych we wszystkich eksperymentach. Wyniki przedstawiono jako średnią ± odchylenie standardowe. Niskie wartości odchylenia standardowego zaobserwowane dla Accuracy, IoU, Dice, SSIM, PSNR oraz FID wskazują, że proponowany model osiągnął stabilną wydajność w powtórzonych seriach eksperymentalnych. Istotność statystyczną oceniono za pomocą testów t-Studenta dla prób zależnych, a różnice uznano za statystycznie istotne, gdy p < 0,05. Ponieważ wszystkie modele oceniano na tych samych partycjach zbioru danych, uzyskano sparowane pomiary wydajności w powtórzonych seriach, co uzasadniało zastosowanie testów t-Studenta dla prób zależnych. Aby kontrolować rodzinny błąd typu I (family-wise error rate) związany z wielokrotnymi porównaniami parowymi, zastosowano korektę Bonferroniego, a istotność statystyczną określono przy użyciu skorygowanego progu α/n, gdzie n oznacza liczbę porównań parowych.

Wyniki eksperymentalne silnie potwierdzają skuteczność proponowanego frameworka SegCycle-SPADE. Wyższa wydajność segmentacji osiągnięta przez SegFormer-B2 wykazuje jego zdolność do dokładnej identyfikacji i zachowania granic istotnych kulturowo motywów. Poprawa wyników IoU oraz Dice dodatkowo wskazuje na skuteczne zachowanie semantycznych struktur motywów w całym procesie przetwarzania. Integracja CycleGAN i SPADE pozwoliła na skuteczną rekonstrukcję niekompletnych struktur motywów przy jednoczesnym zachowaniu drobnych szczegółów wizualnych, co odzwierciedlają poprawione wartości SSIM i PSNR. Ponadto niższe wartości FID wskazują, że wygenerowane wzory artystyczne wykazują większe podobieństwo do autentycznych obrazów kulturalnych i artystycznych, co sugeruje poprawioną spójność stylistyczną oraz realizm wizualny.

Moduł CAFFM znacząco przyczynił się do tych ulepszeń, ułatwiając efektywną interakcję między informacjami strukturalnymi pochodzącymi z segmentacji a generatywnymi reprezentacjami stylu. Dzięki fuzji cech opartej na mechanizmie cross-attention, CAFFM zwiększył zarówno wierność strukturalną, jak i autentyczność artystyczną, zachowując jednocześnie dalekosiężne relacje między motywami kulturowymi.

Rycina 6 przedstawia porównanie dokładności segmentacji między proponowanym frameworkiem SegCycle-SPADE a istniejącymi metodami na zbiorach danych Miao Batik oraz WikiArt. Tradycyjne podejścia do segmentacji, takie jak U-Net i DeepLabV3+, osiągnęły konkurencyjne wyniki dzięki zdolności do uczenia się reprezentacji przestrzennych. Jednakże Pix2Pix i CycleGAN wykazały niższą dokładność segmentacji, ponieważ nie zostały zaprojektowane specjalnie do zadań segmentacyjnych. Proponowany framework SegCycle-SPADE osiągnął najwyższą dokładność segmentacji na obu zbiorach danych dzięki integracji modelu SegFormer-B2 i wzmocnienia cech opartego na CAFFM.

figure-results-7
Rysunek 6. Porównanie dokładności segmentacji w różnych metodach. Porównanie dokładności segmentacji uzyskanej przy użyciu U-Net, DeepLabV3+, Pix2Pix, CycleGAN oraz proponowanego frameworka SegCycle-SPADE na zbiorach danych Miao Batik i WikiArt. Wyniki przedstawiono jako średnią ± odchylenie standardowe (SD) z pięciu niezależnych uruchomień (n = 5). Słupki błędów reprezentują jedno odchylenie standardowe. Wyższe wartości wskazują na lepszą wydajność segmentacji. Proponowany framework SegCycle-SPADE osiągnął najwyższą dokładność segmentacji w obu zbiorach danych. Kliknij tutaj, aby wyświetlić większą wersję tego rysunku.

Rycina 7 przedstawia porównanie wskaźnika IoU pomiędzy ocenianymi metodami. U-Net oraz DeepLabV3+ osiągnęły wysoką wydajność w zakresie pokrycia dzięki swojej architekturze zorientowanej na segmentację. W przeciwieństwie do nich, Pix2Pix i CycleGAN wykazały niższe wartości IoU, ponieważ ich głównym celem jest translacja obrazu, a nie segmentacja semantyczna. Zaproponowany framework SegCycle-SPADE osiągnął najwyższe wartości IoU w obu zbiorach danych, co wskazuje na lepszą lokalizację i zachowanie obszarów motywów kulturowych.

figure-results-8
Rysunek 7. Porównanie wyników wskaźnika Intersection over Union (IoU) dla segmentacji motywów kulturowych. Porównanie wydajności IoU pomiędzy metodami segmentacji na zbiorach danych Miao Batik oraz WikiArt. Wyniki przedstawiono jako średnią ± odchylenie standardowe (SD) z pięciu niezależnych uruchomień (n = 5). Słupki błędów wskazują jedno odchylenie standardowe. Wyższe wartości IoU oznaczają większe pokrycie między przewidywanymi a referencyjnymi obszarami motywów oraz lepsze zachowanie granic motywów. Zaproponowany framework SegCycle-SPADE osiągnął najwyższe wyniki IoU w obu zbiorach danych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rysunek 8 przedstawia porównanie współczynnika podobieństwa Dice. Współczynnik Dice mierzy stopień pokrycia między przewidywanymi maskami segmentacji a regionami motywu stanowiącymi prawdę obiektywną (ground-truth). Konwencjonalne podejścia do segmentacji osiągnęły stosunkowo wysokie wyniki Dice dzięki ich skuteczności w uczeniu struktur przestrzennych. Jednakże zaproponowany framework SegCycle-SPADE osiągnął najwyższe wyniki Dice w obu zbiorach danych, wykazując poprawioną spójność segmentacji oraz lepszą konserwację motywów.

figure-results-9
Rysunek 8. Porównanie współczynnika Dice dla segmentacji motywów kulturowych. Porównanie wartości współczynnika Dice uzyskanych przy zastosowaniu różnych podejść do segmentacji w zbiorach danych Miao Batik i WikiArt. Współczynnik Dice ocenia nakładanie się przewidzianych masek segmentacji i masek referencyjnych, przy czym wyższe wartości wskazują na lepszą wydajność segmentacji i identyfikację regionów motywów. Zaproponowany framework SegCycle-SPADE osiągnął najwyższe wartości współczynnika Dice w obu zbiorach danych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Rycina 9 przedstawia porównanie SSIM zrekonstruowanych wzorów kulturowych. Metody oparte na GAN, takie jak Pix2Pix, CycleGAN i StyleGAN, osiągnęły wyższe wartości SSIM niż tradycyjne metody segmentacji, ponieważ zostały zaprojektowane do generowania obrazów. Niemniej jednak, zaproponowany framework SegCycle-SPADE uzyskał najwyższe wartości SSIM w obu zbiorach danych, co wskazuje na lepsze zachowanie szczegółów strukturalnych i spójność artystyczną.figure-results-10

Rysunek 9. Porównanie wskaźnika podobieństwa strukturalnego (SSIM). Porównanie wartości wskaźnika podobieństwa strukturalnego (SSIM) uzyskanych przy użyciu różnych metod rekonstrukcji dla zestawów danych Miao Batik i WikiArt. Wyniki przedstawiono jako średnią ± odchylenie standardowe (SD) z pięciu niezależnych uruchomień (n = 5). Słupki błędów wskazują jedno odchylenie standardowe. Wyższe wartości SSIM wskazują na większe podobieństwo strukturalne między wzorami zrekonstruowanymi a wzorami referencyjnymi. Zaproponowany framework SegCycle-SPADE osiągnął najwyższe wyniki SSIM dla obu zestawów danych. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

Do oceny realizmu i podobieństwa rozkładu wygenerowanych wzorów artystycznych wykorzystano wskaźnik FID. Obliczenia FID przeprowadzono przy użyciu wstępnie wytrenowanej sieci Inception-v3, wyodrębniając wektory cech z warstwy pool3, co pozwoliło uzyskać 2048-wymiarowe reprezentacje cech. Przed ekstrakcją cech obrazy wygenerowane i referencyjne zostały przeskalowane do rozmiaru 299 × 299 pikseli za pomocą interpolacji bilinearnej i znormalizowane zgodnie ze standardowym protokołem wstępnego przetwarzania sieci Inception-v3. FID obliczono na podstawie rozkładów cech wyekstrahowanych z niezależnego zbioru testowego. Średnią oraz statystyki kowariancji oszacowano z osadzeń cech (feature embeddings) i wykorzystano je w standardowym wzorze FID.

Jak pokazano w Tabeli 4, konwencjonalne podejścia do generowania obrazów, takie jak Pix2Pix i CycleGAN, odnotowały stosunkowo wysokie wartości FID ze względu na brak wyraźnych wytycznych strukturalnych. StyleGAN i AttentionGAN osiągnęły niższe wartości FID dzięki ulepszonym możliwościom uczenia cech. Jednak zaproponowana struktura SegCycle-SPADE uzyskała najniższe wartości FID dla obu zbiorów danych, wykazując najwyższy realizm obrazu, spójność stylistyczną oraz zachowanie motywów kulturowych.

MetodaZbiór danych Miao Batik (FID)Zbiór danych WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (proponowana)28.531.2

Tabela 4: Wyniki odległości Frecheta-Inception (FID) dla rekonstrukcji wzorów kulturowych.Porównanie wyników odległości Frecheta-Inception (FID) uzyskanych przez proponowany framework SegCycle-SPADE oraz bazowe modele generatywne na zbiorach danych Miao Batik i WikiArt. Niższe wartości FID wskazują na większe podobieństwo między rozkładami cech obrazów generowanych a rzeczywistymi, a tym samym odzwierciedlają lepszy realizm wizualny zrekonstruowanych wzorów kulturowych.

Rycina 10 porównuje jakość rekonstrukcji uzyskaną za pomocą różnych metod. Jakość Rekonstrukcji (%) obliczono, przeliczając wskaźnik SSIM pomiędzy obrazem zrekonstruowanym a odpowiadającym mu obrazem referencyjnym na skalę procentową (SSIM × 100). Wyższe wartości procentowe wskazują na większą wierność strukturalną i podobieństwo wizualne do oryginalnego motywu kulturowego. Konwencjonalne modele generatywne, takie jak Pix2Pix i CycleGAN, osiągnęły umiarkowaną wydajność rekonstrukcji. Bardziej zaawansowane architektury, w tym StyleGAN i AttentionGAN, pozwoliły na uzyskanie lepszej jakości rekonstrukcji dzięki ich rozszerzonym możliwościom uczenia cech. Jednakże zaproponowany framework SegCycle-SPADE osiągnął najwyższą jakość rekonstrukcji dzięki integracji prowadzenia segmentacją semantyczną, fuzji cech z mechanizmem cross-attention, uczeniu rekonstrukcji oraz syntezie artystycznej.

figure-results-11
Rysunek 10. Porównanie jakości rekonstrukcji wzorów. Porównanie jakości rekonstrukcji uzyskanej przy użyciu Pix2Pix, CycleGAN, StyleGAN, AttentionGAN oraz proponowanego frameworku SegCycle-SPADE na zbiorach danych Miao Batik i WikiArt. Wyniki przedstawiono jako średnią ± odchylenie standardowe (SD) z pięciu niezależnych uruchomień (n = 5). Słupki błędów wskazują jedno odchylenie standardowe. Wyższe wartości wskazują na lepsze zachowanie szczegółów strukturalnych, spójność semantyczną i wierność wizualną. Proponowany framework SegCycle-SPADE osiągnął najwyższe wyniki jakości rekonstrukcji na obu zbiorach danych. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Wskaźnik PSNR został wykorzystany do oceny wierności rekonstrukcji poprzez pomiar podobieństwa na poziomie pikseli pomiędzy obrazami zrekonstruowanymi a odpowiadającymi im obrazami referencyjnymi. PSNR obliczano dla każdego zrekonstruowanego obrazu oraz odpowiadającego mu oryginalnego obrazu tkaniny Miao Batik, który służył jako referencyjna prawda terenowa (ground-truth). Wyższe wartości PSNR wskazują na niższy błąd rekonstrukcji. Jak pokazano w Tabeli 5, modele Pix2Pix i CycleGAN osiągnęły umiarkowane wartości PSNR, ponieważ rekonstruowały wzory bez wyraźnych wytycznych strukturalnych. StyleGAN i AttentionGAN uzyskały wyższe wartości PSNR dzięki głębszemu uczeniu cech. Zaproponowany framework SegCycle-SPADE osiągnął najwyższe wartości PSNR w obu zbiorach danych, wykazując najwyższą wierność rekonstrukcji oraz stopień zachowania struktur motywów kulturowych.

MetodaZbiór danych Miao Batik
(PSNR, dB)
Zbiór danych WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (proponowany)32.431.2

Tabela 5: Wyniki szczytowego stosunku sygnału do szumu (PSNR) dla rekonstrukcji wzorów kulturowych. Porównanie wartości szczytowego stosunku sygnału do szumu (PSNR) uzyskanych za pomocą proponowanego modelu SegCycle-SPADE oraz metod bazowych na zbiorach danych Miao Batik i WikiArt. Wyższe wartości PSNR wskazują na lepszą wierność rekonstrukcji i mniejsze zniekształcenia w stosunku do odpowiadających im obrazów referencyjnych.

Rysunek 11 przedstawia zachowanie zbieżności proponowanego frameworku SegCycle-SPADE podczas uczenia. Krzywe strat reprezentują średnie straty treningowe uśrednione z pięciu niezależnych uruchomień procesu uczenia. Aby zmniejszyć zmienność stochastyczną i zapewnić bardziej wiarygodną reprezentację zbieżności uczenia, wartości strat były uśredniane w każdej epoce dla wszystkich uruchomień. W początkowych epokach uczenia wartości strat były stosunkowo wysokie, ponieważ model wciąż uczył się reprezentacji cech z danych wejściowych. W miarę postępu uczenia wszystkie składowe strat stopniowo malały i stabilizowały się, co wskazuje na skuteczną optymalizację celów segmentacji, rekonstrukcji oraz syntezy artystycznej. Obserwowane zachowanie zbieżności demonstruje efektywność, stabilność i powtarzalność proponowanego frameworku podczas uczenia.

figure-results-12
Rycina 11. Zbieżność uczenia proponowanego modelu SegCycle-SPADE. Krzywe straty podczas uczenia proponowanego modelu SegCycle-SPADE w ciągu 100 epok treningowych, uśrednione z pięciu niezależnych przebiegów uczenia (n = 5). Rycina przedstawia ewolucję całkowitej straty (LTotal), straty segmentacji (LSeg), straty generatora (LG) oraz straty dyskryminatora (LD) w trakcie uczenia. Stopniowa redukcja i późniejsza stabilizacja wszystkich komponentów straty wskazują na pomyślną zbieżność i stabilną optymalizację proponowanego modelu. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.

Badanie ablacyjne
Aby ocenić wkład każdego komponentu w proponowanej strukturze SegCycle-SPADE, przeprowadzono badanie ablacyjne z wykorzystaniem wielu kontrolowanych konfiguracji modelu. Wyniki podsumowano w tabelach 6 i 7.

Konfiguracja modeluDokładność segmentacji (%)IoU (Intersection over Union)SSIM (wskaźnik podobieństwa strukturalnego)
Wyłącznie SegFormer87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (proponowane rozwiązanie)93.80.860.93

Tabela 6: Analiza ablacyjna komponentów SegCycle-SPADE. Porównanie wydajności sukcesywnie ulepszanych konfiguracji modelu w celu oceny wkładu poszczególnych komponentów struktury. Badanie analizuje wpływ segmentacji semantycznej, modułu fuzji cech kulturowych z mechanizmem Cross-Attention (CAFFM), rekonstrukcji opartej na CycleGAN oraz syntezy artystycznej opartej na SPADE na dokładność segmentacji, wskaźnik Intersection over Union (IoU) oraz wskaźnik podobieństwa strukturalnego (SSIM). Wyższe wartości wskazują na lepszą segmentację motywów, wyższą jakość rekonstrukcji oraz lepsze zachowanie struktur.

WariantIoU (%)Współczynnik Dice'a (%)SSIM (wskaźnik podobieństwa strukturalnego)PSNR (dB)FID ↓
Wyłącznie SegFormer84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (pełny model)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

Tabela 7: Analiza wkładu poszczególnych komponentów proponowanego frameworka SegCycle-SPADE. Porównanie wydajności poszczególnych wariantów frameworka użytych do oceny wkładu CAFFM, CycleGAN, SPADE oraz pełnej architektury SegCycle-SPADE. Wyniki przedstawiono z użyciem wskaźnika Intersection over Union (IoU), współczynnika Dice, indeksu podobieństwa strukturalnego (SSIM), szczytowego stosunku sygnału do szumu (PSNR) oraz odległości Frecheta Inception Distance (FID). Wyższe wartości IoU, Dice, SSIM i PSNR wskazują na lepszą jakość segmentacji i rekonstrukcji, natomiast niższe wartości FID wskazują na większy realizm wizualny generowanych wzorów kulturowych.

Tabela 6 ocenia skumulowany wkład głównych komponentów struktury przy użyciu czterech konfiguracji: (i) sam SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN oraz (iv) SegFormer + CAFFM + CycleGAN + SPADE (proponowana struktura). Bazowy model SegFormer osiągnął dokładność segmentacji na poziomie 87,3%, wynik IoU wynoszący 0,76 oraz wartość SSIM równą 0,82. Włączenie modułu CAFFM poprawiło wyniki we wszystkich metrykach oceny, zwiększając dokładność segmentacji do 89,6%, IoU do 0,79 oraz SSIM do 0,86. Dodanie CycleGAN dalej zwiększyło zdolność do rekonstrukcji strukturalnej, co zaowocowało IoU na poziomie 0,82 i wartością SSIM wynoszącą 0,89. Kompletna struktura SegCycle-SPADE osiągnęła najlepszą ogólną wydajność, z dokładnością segmentacji 93,8%, IoU wynoszącym 0,86 oraz wartością SSIM równą 0,93. Wyniki te dowodzą, że każdy komponent stopniowo przyczynia się do poprawy dokładności segmentacji, zachowania struktury oraz jakości rekonstrukcji obrazu.

Tabela 7 dodatkowo bada wkład poszczególnych komponentów struktury przy użyciu pięciu wariantów modelu: (i) sam SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM oraz (v) pełny model obejmujący SegFormer, CAFFM, CycleGAN, SPADE i funkcję straty zachowania motywu (motif-preservation loss). Wydajność oceniono za pomocą metryk IoU, współczynnika Dice, SSIM, PSNR oraz FID.

Podstawowa konfiguracja oparta wyłącznie na SegFormer osiągnęła IoU na poziomie 84,2%, współczynnik Dice wynoszący 88,5%, wartość SSIM 0,82, PSNR 24,8 dB oraz wynik FID równy 31,8. Dodanie CycleGAN poprawiło jakość rekonstrukcji i obniżyło wynik FID do 27,5, co wskazuje na zwiększony realizm obrazu. Wprowadzenie SPADE dodatkowo poprawiło podobieństwo strukturalne oraz jakość obrazu, co zaowocowało wartością SSIM 0,88 i wynikiem FID 23,4. Zastosowanie proponowanego modułu CAFFM przyniosło znaczące zyski we wszystkich parametrach, zwiększając IoU do 90,0%, współczynnik Dice do 93,1%, SSIM do 0,90 i PSNR do 29,6 dB, przy jednoczesnym obniżeniu wyniku FID do 20,3. Pełny model, który dodatkowo uwzględnia funkcję straty zachowania motywu (motif-preservation loss), osiągnął najlepsze wyniki ogólne z IoU na poziomie 93,0%, współczynnikiem Dice 95,4%, wartością SSIM 0,92, PSNR 31,2 dB oraz wynikiem FID 17,6.

Tabela 8 przedstawia porównawczy przegląd reprezentatywnych podejść DL stosowanych w rekonstrukcji i zachowaniu wzorów dziedzictwa kulturowego. Konwencjonalne metody oparte na CNN zapewniają efektywną naukę cech lokalnych i wydajność segmentacji, lecz często mają trudności z zachowaniem złożonych struktur motywów ze względu na ograniczone modelowanie zależności długodystansowych. Podejścia oparte na GAN poprawiają możliwości syntezy obrazu i transferu stylu; mogą one jednak cierpieć na niespójności semantyczne i utratę drobnych szczegółów strukturalnych. Metody oparte na Transformerach zwiększają globalne rozumienie kontekstu, ale zazwyczaj brakuje im możliwości generatywnej rekonstrukcji, podczas gdy metody oparte na dyfuzji oferują wysoką realistyczność wizualną kosztem zwiększonej złożoności obliczeniowej. Hybrydowe podejścia Transformer-GAN częściowo rozwiązują te ograniczenia poprzez łączenie mechanizmów ekstrakcji cech i generowania obrazów. W przeciwieństwie do nich, proponowany framework SegCycle-SPADE integruje segmentację opartą na transformerach, fuzję cech z wykorzystaniem cross-attention, rekonstrukcję generatywną oraz syntezę artystyczną sterowaną segmentacją w ramach jednolitej architektury, co poprawia wierność strukturalną, spójność semantyczną i zachowanie motywów kulturowych. Porównanie to zostało podsumowane w Tabeli 8.

PodejściePodstawowa metodologiaZaletyOgraniczeniaZnaczenie dla dziedzictwa kulturowego
Metody oparte na CNN (np. U-Net, DeepLabV3+)Splotowa ekstrakcja cech i segmentacja semantycznaSkuteczna nauka cech lokalnych i precyzyjna segmentacjaOgraniczone modelowanie zależności dalekosiężnych; trudność w zachowaniu złożonych struktur motywówOdpowiednie do segmentacji motywów, ale mniej skuteczne w rekonstrukcji artystycznej
Metody oparte na GAN (np. Pix2Pix, CycleGAN)Adwersarialna generacja obrazów i translacja obraz-obrazWysoka jakość syntezy obrazu i transfer styluNiestabilność treningu; niespójność semantyczna; potencjalna utrata drobnych detali strukturalnychPrzydatne do renowacji wzorów, lecz mogą nie zachować dokładnie motywów kulturowych
Metody oparte na TransformerachSamo-uwaga i modelowanie kontekstu globalnegoPrzechwytywanie zależności dalekosiężnych i złożonych relacji wizualnychWysoki koszt obliczeniowy; wymagają dużych zbiorów danych treningowychSkuteczne w analizie złożonych wzorów, ale o ograniczonej zdolności generatywnej przy samodzielnym zastosowaniu
Metody oparte na dyfuzjiIteracyjna generacja obrazów oparta na odszumianiuWysoki realizm wizualny i różnorodność obrazówPowolna prędkość inferencji; wysokie wymagania obliczeniowe; ograniczona kontrola strukturalnaObiecujące w generowaniu obrazów dziedzictwa, lecz wymagające obliczeniowo
Hybrydowe metody Transformer-GANPołączenie ekstrakcji cech opartej na transformerach z generacją opartą na GANPoprawiona reprezentacja cech globalnych i jakość obrazuCzęsto brak wyraźnego prowadzenia semantycznego w celu zachowania motywówPoprawia jakość generowania, ale nie jest zaprojektowane specjalnie dla motywów dziedzictwa kulturowego
Proponowany SegCycle-SPADESegFormer + CAFFM + CycleGAN + SPADESegmentacja oparta na transformerach, fuzja cech sterowana uwagą, spójność semantyczna, zachowanie motywów i kontrolowana rekonstrukcja artystycznaWyższa złożoność obliczeniowa niż w przypadku samodzielnych podejść opartych na CNNZaprojektowany specjalnie do rekonstrukcji i zachowania wzorów dziedzictwa kulturowego z poprawioną wiernością strukturalną i spójnością semantyczną

Tabela 8: Porównanie reprezentatywnych podejść głębokiego uczenia do rekonstrukcji i konserwacji wzorów dziedzictwa kulturowego.Jakościowe porównanie reprezentatywnych podejść głębokiego uczenia wykorzystywanych do segmentacji obrazu, rekonstrukcji wzorów, generowania stylu oraz konserwacji dziedzictwa kulturowego. Tabela podsumowuje główną metodologię, mocne strony, ograniczenia i zastosowanie każdego podejścia oraz podkreśla, w jaki sposób proponowany framework SegCycle-SPADE łączy segmentację semantyczną, fuzję cech, rekonstrukcję i syntezę stylu, aby rozwiązać problemy związane z zachowaniem struktury i spójnością semantyczną we wzorach dziedzictwa kulturowego.

Zaobserwowane ulepszenia wykazują, że moduł CAFFM skutecznie wzmacnia interakcję między cechami strukturalnymi pochodzącymi z segmentacji a reprezentacjami stylu artystycznego poprzez fuzję cech opartą na mechanizmie cross-attention. Ponadto strata zachowania motywu (motif-preservation loss) przyczynia się do utrzymania kulturowo znaczących struktur motywów podczas rekonstrukcji i syntezy artystycznej, co skutkuje poprawą spójności segmentacji, wierności strukturalnej i realizmu wizualnego. Wspólnie wyniki ablacji potwierdzają, że integracja SegFormer-B2, CAFFM, CycleGAN, SPADE oraz straty zachowania motywu odpowiada za wysoką wydajność proponowanego frameworka SegCycle-SPADE.

Dostępność danych:
Zbiór danych WikiArt wykorzystany do nauki stylu artystycznego jest publicznie dostępny za pośrednictwem repozytorium Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). Zbiór danych Miao Batik wykorzystany w niniejszym badaniu jest publicznie dostępny za pośrednictwem Zenodo (https://doi.org/10.5281/zenodo.20807658). Przetworzone zbiory danych, maski segmentacji, wagi wstępnie wytrenowanego modelu, wygenerowane wyniki oraz pliki implementacji w języku Python powiązane z proponowaną strukturą SegCycle-SPADE są również dostępne w tym samym repozytorium Zenodo.

PLIK UZUPEŁNIAJĄCY:
Plik uzupełniający 1. Algorytm 1: Przepływ implementacji proponowanego frameworka SegCycle-SPADE. Pseudokod krok po kroku opisujący kompletny potok implementacji proponowanego frameworka SegCycle-SPADE, obejmujący ładowanie zbioru danych, przetwarzanie wstępne, segmentację semantyczną z użyciem SegFormer-B2, fuzję cech z wykorzystaniem modułu Cross-Attention Cultural Feature Fusion Module (CAFFM), rekonstrukcję motywów kulturowych za pomocą CycleGAN, syntezę stylu artystycznego z użyciem SPADE, trenowanie modelu, walidację, wybór punktów kontrolnych oraz końcową ocenę wydajności. Kliknij tutaj, aby pobrać ten plik.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ochrona i cyfrowa rekonstrukcja wzorów niematerialnego dziedzictwa kulturowego (ICH) zyskały w ostatnich latach coraz większą uwagę ze względu na stopniowe zanikanie tradycyjnego rzemiosła. Poprzednie badania próbowały przeciwdziałać utracie dziedzictwa kulturowego za pomocą technik przetwarzania obrazu opartych na głębokim uczeniu (DL). Na przykład Quan i wsp.32 zaproponowali strukturę ochrony dziedzictwa kulturowego opartą na grafach wiedzy i DL dla kultury batików ludu Miao z prowincji Guizhou. Choć badanie to koncentrowało się na cyfrowej rekonstrukcji wzorów kulturowych, jego metodologia opierała się przede wszystkim na reprezentacjach grafów wiedzy. Podobnie Fu i Razmjooy16 zaproponowali strukturę opartą na sieci piramidy cech (FPN) w celu ulepszenia i renowacji obrazów dziedzictwa kulturowego. Chociaż metoda ta zapewniła skuteczną ekstrakcję cech dla ulepszenia obrazu, nie zawierała ona wskazówek dotyczących segmentacji obrazu ani mechanizmów generatywnej rekonstrukcji dla niekompletnych wzorów kulturowych. W przeciwieństwie do nich, proponowana struktura SegCycle-SPADE łączy wiele komponentów DL, aby pokonać te wyzwania. Po pierwsze, zastosowano segmentację semantyczną z użyciem modelu SegFormer w celu dokładnej identyfikacji obszarów motywów we wzorach dziedzictwa kulturowego. Następnie moduł ulepszania cech oparty na CAFFM poprawia reprezentacje cech dla drobnych struktur motywów. Następnie moduł rekonstrukcyjny CycleGAN jest wykorzystywany do rekonstrukcji brakujących lub niekompletnych obszarów we wzorach kulturowych poprzez uczenie przeciwstawne. Na koniec moduł SPADE wykonuje ulepszenie stylistyczne, zachowując jednocześnie dopasowanie strukturalne z mapami segmentacji. Istniejące metody oparte na CNN, GAN, transformatorach i dyfuzji17,19,20,21,22,23,24,25,30,34 oferują każda unikalne zalety; wykazują one jednak również ograniczenia w zakresie zachowania spójności semantycznej, utrzymania cech strukturalnych lub osiągnięcia wydajności obliczeniowej, co podsumowano w Tabeli 8. Proponowana architektura SegCycle-SPADE łączy zalety segmentacji opartej na SegFormer, fuzji cech cross-attention, rekonstrukcji CycleGAN oraz syntezy sterowanej przez SPADE, rozwiązując jednocześnie te ograniczenia. W rezultacie struktura ta pozwala osiągnąć lepszą jakość rekonstrukcji i lepszą ochronę motywów o znaczeniu kulturowym.

Mimo obiecujących wyników, zaproponowany framework SegCycle-SPADE nadal wykazuje pewne ograniczenia. Po pierwsze, ocena została przeprowadzona wyłącznie z wykorzystaniem zbiorów danych Miao Batik oraz WikiArt, co może ograniczać możliwość generalizacji frameworku na inne dziedziny dziedzictwa kulturowego. Po drugie, wdrożenie na platformach o ograniczonych zasobach może być problematyczne, ponieważ integracja SegFormer, CAFFM, CycleGAN i SPADE zwiększa złożoność obliczeniową oraz wymagania dotyczące pamięci. Po trzecie, wydajność segmentacji w dużym stopniu zależy od jakości i spójności adnotacji motywów, a błąd adnotacji może wpłynąć na zachowanie istotnych struktur kulturowych. Wreszcie, ponieważ framework został oceniony na podstawie zaledwie dwóch zbiorów danych, do zapewnienia jego stosowalności w przypadku różnorodnych kolekcji dziedzictwa kulturowego mogą być niezbędne dodatkowe dane treningowe oraz adaptacje specyficzne dla danej dziedziny. Przyszłe badania powinny zatem skupić się na eksploracji bardziej odpornych strategii treningowych, lekkich architektur, ulepszonych procedur adnotacji oraz ewaluacji międzydomenowych z wykorzystaniem dodatkowych zbiorów danych dotyczących dziedzictwa kulturowego.

Skalowalność frameworku SegCycle-SPADE w odniesieniu do większych i bardziej zróżnicowanych zbiorów danych dotyczących dziedzictwa kulturowego będzie głównym punktem ciężkości przyszłych badań. Przeprowadzona zostanie międzykulturowa ocena motywów dziedzictwa z różnych regionów i tradycji artystycznych w celu poprawy generalizacji modelu oraz jego adaptacyjności kulturowej. Ponadto, rozszerzenia multimodalne obejmujące opisy tekstowe, zapisy historyczne oraz metadane kulturowe mogą zapewnić silniejsze prowadzenie semantyczne podczas rekonstrukcji. Framework może zostać również rozszerzony o wsparcie dla trójwymiarowej rekonstrukcji dziedzictwa kulturowego poprzez zintegrowanie rekonstrukcji opartej na obrazach z technikami modelowania 3D. Dodatkowo, badane będzie wdrożenie w cyfrowych archiwach, muzeach, wirtualnych wystawach oraz na platformach ochrony dziedzictwa kulturowego, aby ułatwić praktyczne zastosowania wspomaganej przez AI konserwacji i dokumentacji dziedzictwa. W celu dalszej poprawy interpretowalności i autentyczności kulturowej, przyszłe prace skupią się na integracji grafów wiedzy kulturowej, dokumentacji etnograficznej, metadanych historycznych oraz baz wiedzy kuratorowanych przez ekspertów, aby umożliwić analizę i rekonstrukcję motywów w oparciu o wiedzę kulturową32.

Podczas wdrażania proponowanego frameworka SegCycle-SPADE należy wziąć pod uwagę kilka praktycznych kwestii. W trakcie trenowania CycleGAN może dojść do niestabilnej zbieżności adversarianej, jeśli straty generatora i dyskryminatora staną się silnie niezrównoważone. W takich sytuacjach stabilność procesu uczenia można poprawić poprzez zmniejszenie tempa uczenia, zwiększenie wagi straty spójności cyklu (cycle-consistency loss) lub monitorowanie dominacji dyskryminatora. Zjawisko zapadania się trybów (mode collapse) może wystąpić, gdy generator wielokrotnie generuje wizualnie podobne wyniki; problem ten można złagodzić poprzez zbalansowany trening adversariany, wykorzystanie bufora powtórek (replay-buffer) oraz uważne monitorowanie trendów strat generatora i dyskryminatora. Błędy segmentacji mogą również pojawić się w przypadku motywów kulturowych o złożonych teksturach, niskim kontraście lub niejednoznacznych granicach. Aby rozwiązać ten problem, przed rozpoczęciem trenowania należy zweryfikować jakość obrazów, a maski segmentacyjne powinny zostać poddane wizualnej inspekcji w celu zapewnienia spójności adnotacji. Dla uzyskania niezawodnej wydajności modelu SegFormer istotne jest również zachowanie zalecanej rozdzielczości wejściowej oraz ustawień normalizacji. Niestabilność trenowania może dodatkowo wynikać z niewłaściwych ustawień tempa uczenia, niewystarczającej ilości danych treningowych lub wariacji numerycznych związanych z sprzętem. W celu poprawy powtarzalności należy stosować stałe ziarna losowe (random seeds) dla NumPy, PyTorch, CUDA oraz operacji przetasowania zbioru danych. Ponadto, we wszystkich uruchomieniach eksperymentalnych należy zachować ten sam potok przetwarzania wstępnego, podziały zbioru danych, hiperparametry modelu oraz środowisko programowe. Zaleca się również okresowe zapisywanie punktów kontrolnych (checkpoints) oraz monitorowanie straty walidacyjnej, aby zapobiec degradacji wydajności i ułatwić odzyskiwanie danych po przerwanych sesjach trenowania.

Proponowana praca przyczynia się do teoretycznego rozwoju ram rekonstrukcji dziedzictwa kulturowego opartych na sztucznej inteligencji. Konwencjonalne podejścia do renowacji obrazów zazwyczaj traktują segmentację obrazu, rekonstrukcję i generowanie stylu jako niezależne procesy17,19,20,30. W przeciwieństwie do nich, niniejsze badanie proponuje strukturę, która integruje te procesy poprzez strategię rekonstrukcji generatywnej sterowanej segmentacją. W konsekwencji badanie to przyczynia się do teoretycznego rozwoju rekonstrukcji dziedzictwa kulturowego wspomaganej przez AI, wykazując, w jaki sposób segmentacja, rekonstrukcja i generowanie stylu mogą zostać zjednoczone w ramach jednej struktury. Taka integracja jest szczególnie istotna w zastosowaniach dotyczących dziedzictwa kulturowego, gdzie kluczowe jest zachowanie struktury motywów i znaczenia semantycznego. Z praktycznego punktu widzenia proponowana struktura oferuje skuteczne rozwiązanie dla cyfrowej konserwacji, renowacji i artystycznego ulepszania tradycyjnych wzorów kulturowych. Instytucje dziedzictwa kulturowego, muzea i projektanci mogą wykorzystywać SegCycle-SPADE do automatycznej identyfikacji obszarów motywów, rekonstrukcji uszkodzonych lub niekompletnych wzorów oraz generowania wizualnie ulepszonych artystycznych reprezentacji tradycyjnych projektów. Możliwość ta jest szczególnie cenna w przypadku zagrożonych tradycji rzemieślniczych, w tym wzorów tkanin batikowych ludu Miao, gdzie artefakty historyczne mogą być częściowo uszkodzone lub niepełne. Ponadto, dzięki włączeniu generatywnej syntezy stylu, struktura ta może wspierać nowoczesne zastosowania w projektowaniu kulturowym, takie jak projektowanie tkanin, cyfrowa twórczość artystyczna i edukacja w zakresie dziedzictwa. W ten sposób proponowana struktura wypełnia lukę między ochroną dziedzictwa kulturowego a współczesnymi zastosowaniami w projektowaniu kulturowym.

Niemniej jednak, pomimo obiecujących wyników osiągniętych przez proponowany framework SegCycle-SPADE, pozostaje kilka ograniczeń. Po pierwsze, ewaluację przeprowadzono wyłącznie na zbiorach danych Miao Batik oraz WikiArt, co może wpływać na zdolność uogólniania frameworku w zakresie rekonstrukcji innych form wzorów dziedzictwa kulturowego. Po drugie, ponieważ proces rekonstrukcji opiera się na modelach GAN, generowane wyniki mogą sporadycznie zawierać artefakty lub nienaturalne tekstury w przypadku bardzo złożonych struktur motywów. Po trzecie, framework koncentruje się obecnie na rekonstrukcji wzorów dwuwymiarowych, podczas gdy niektóre artefakty dziedzictwa kulturowego obejmują struktury immanentnie trójwymiarowe. Ogólnie rzecz biorąc, wyniki eksperymentalne wykazują skuteczność proponowanego frameworku SegCycle-SPADE w artystycznej rekonstrukcji wzorów ICH. Integracja segmentacji semantycznej opartej na SegFormer, CAFFM, rekonstrukcji motywów opartej na CycleGAN oraz syntezy artystycznej opartej na SPADE konsekwentnie poprawiła wskaźniki wydajności w zakresie segmentacji, rekonstrukcji oraz jakości obrazu. Badania ablacyjne dodatkowo potwierdziły wkład każdego komponentu frameworku, wykazując, że CAFFM oraz strata zachowania motywów (motif-preservation loss) znacząco zwiększyły wierność strukturalną i autentyczność wizualną. Wyniki te wspierają główną hipotezę, zgodnie z którą rekonstrukcja sterowana segmentacją semantyczną w połączeniu z fuzją cech cross-attention może skutecznie zachować motywy o znaczeniu kulturowym, generując jednocześnie bogate artystycznie rezultaty. Zatem proponowany framework stanowi niezawodne i powtarzalne podejście obliczeniowe do cyfrowej konserwacji, renowacji oraz kreatywnego rewitalizowania wzorów ICH.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Konflikt interesów:
Autorzy nie deklarują żadnych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy pragną podziękować za wsparcie akademickie i instytucjonalne udzielone przez Guangdong Engineering Polytechnic oraz South China Normal University podczas realizacji niniejszych badań. Badania te zostały sfinansowane w ramach projektu ogólnego Narodowego Funduszu Nauk Społecznych z 2023 roku (nr 23BH161) pt. „Digital Regeneration Museum: Research on the Activation and Communication of Chinese Classic Calligraphy and Painting Cultural Relics”.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
Optymalizator AdamBiblioteka optymalizatorów PyTorchAdamAlgorytm optymalizacji stosowany podczas trenowania modelu.
Zestaw narzędzi CUDANVIDIA CorporationCUDA 11.3Akceleracja GPU dla obliczeń głębokiego uczenia.
cuDNNNVIDIA CorporationcuDNN 8.2Biblioteka akceleracji głębokich sieci neuronowych stosowana do przyspieszenia trenowania i wnioskowania.
CycleGANUniversity of California, Berkeley / Open SourceOficjalna implementacja PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Generatywna sieć przeciwstawna stosowana do rekonstrukcji motywów kulturowych.
Wagi wstępnie wytrenowane na ImageNetImageNet / Open Sourcemit_b2.pth (Wstępnie wytrenowany punkt kontrolny ImageNet-1K)Stosowane do inicjalizacji szkieletu SegFormer-B2 przed dostrajaniem na zbiorze danych Miao Batik.
Procesor IntelIntel CorporationIntel Core i7 (11. generacja)CPU stosowany do wstępnego przetwarzania obrazów, wsparcia trenowania modelu i wnioskowania.
MatplotlibZespół programistów MatplotlibMatplotlib 3.5.1Wizualizacja krzywych uczenia i wyników ewaluacji.
Zbiór danych Miao BatikRepozytorium ZenodoDOI: 10.5281/zenodo.20807658Zbiór danych motywów kulturowych zawierający 15 148 obrazów, stosowany do segmentacji semantycznej i rekonstrukcji wzorów.
NumPyProgramiści NumPyNumPy 1.21.5Obliczenia numeryczne i przetwarzanie zbiorów danych.
GPU NVIDIANVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)Platforma sprzętowa stosowana do trenowania modelu i wnioskowania.
OpenCVOpenCV FoundationOpenCV 4.5.5Wstępne przetwarzanie obrazów, zmiana rozmiaru, interpolacja i odszumianie gaussowskie.
System operacyjnyCanonical Ltd.Ubuntu 20.04 LTSŚrodowisko wykonawcze eksperymentów.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0Ładowanie i manipulacja obrazami.
PythonPython Software FoundationPython 3.8.10Język programowania stosowany do implementacji i eksperymentów.
PyTorchMeta AIPyTorch 1.10.0Framework głębokiego uczenia stosowany do trenowania modelu i wnioskowania.
Ziarno losowościUstawienia eksperymentalne42Stałe ziarno stosowane do partycjonowania zbioru danych, inicjalizacji modelu i powtarzalności eksperymentów.
Scikit-learnProgramiści Scikit-learnScikit-learn 1.0.2Partycjonowanie zbioru danych, analiza statystyczna i metryki ewaluacji.
SeabornSpołeczność Open SourceSeaborn 0.11.2Statystyczna wizualizacja danych.
SegFormer-B2NVIDIA Research / Open SourceSegFormer-B2 (Szkielet MIT-B2)Model segmentacji semantycznej oparty na transformerach, stosowany do segmentacji motywów kulturowych.
Maski segmentacji / AdnotacjeZbiór danych Miao BatikDołączone do zbioru danychEtykiety segmentacji semantycznej na poziomie pikseli, stosowane do klasyfikacji motywów i trenowania.
SPADENVIDIA Research / Open SourceOficjalna implementacja PyTorch (https://github.com/NVlabs/SPADE)Model syntezy obrazu sterowany segmentacją, stosowany do generowania wzorów artystycznych.
TorchVisionMeta AITorchVision 0.11.1Narzędzia do przetwarzania obrazów i transformacje zbiorów danych stosowane z PyTorch.
Zbiór danych WikiArtWikiArthttps://www.wikiart.org/Zbiór danych stylów artystycznych zawierający ponad 80 000 dzieł sztuki w 27 stylach artystycznych, stosowany do nauki i syntezy stylu.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Powiązane artykuły