$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
Zaproponowany schemat SegCycle-SPADE został opracowany w celu rekonstrukcji i ulepszenia tradycyjnych wzorów dziedzictwa kulturowego poprzez segmentację semantyczną, wzmacnianie cech z wykorzystaniem mechanizmu uwagi, rekonstrukcję generatywną oraz syntezę stylu artystycznego. W badaniu wykorzystano publicznie dostępne zbiory obrazów dziedzictwa kulturowego i artystycznych, w tym zbiór danych Miao Batik oraz zbiór danych WikiArt. W badaniach nie brali udziału uczestnicy będący ludźmi, nie wykorzystano danych pacjentów, informacji osobistych, zwierząt ani dokumentacji klinicznej; w związku z tym nie wymagano zgody instytucjonalnej komisji etycznej ani świadomej zgody. W pierwszej kolejności do ewaluacji wykorzystano zbiór motywów kulturowych Miao Batik oraz zbiór danych WikiArt. Zbiór danych Miao Batik został opisany w pracy Quan et al. (2024)32 i zawiera 15 148 adnotowanych obrazów tradycyjnych motywów batiku Miao. Istniejące adnotacje dostarczone przez twórców zbioru danych zostały wykorzystane bezpośrednio, a w niniejszym badaniu nie generowano dodatkowych adnotacji manualnych. Następnie przeprowadzono wstępne przetwarzanie obrazów poprzez zmianę rozmiaru, normalizację, odszumianie i tworzenie maski segmentacji. Dokładne parametry wstępnego przetwarzania zostały opisane w podrozdziale Data Preprocessing. Zaproponowany schemat wykorzystuje model oparty na transformerze o nazwie SegFormer-B2 do segmentacji semantycznej danych. Metoda ta została zaprojektowana w celu wykrywania kluczowych obszarów motywów kulturowych i uczenia się ich struktur. Segmentowane cechy są następnie wzmacniane poprzez mechanizm uwagi, w którym podkreślane są istotne informacje związane z motywami kulturowymi, a informacje nieistotne są odrzucane. Konfiguracja mechanizmu uwagi została opisana w podrozdziale CAFFM. Wzmocnione cechy są następnie przekazywane do CycleGAN, gdzie uszkodzone struktury są rekonstruowane poprzez uczenie cykliczne. Podczas trenowania sztucznie tworzono niekompletne próbki motywów, stosując operacje losowego maskowania i częściowego przysłaniania oryginalnych obrazów batiku Miao. Procedury degradacji te symulowały brakujące obszary motywów i uszkodzenia strukturalne powszechnie obserwowane w zniszczonych artefaktach dziedzictwa kulturowego. Powstałe niekompletne obrazy posłużyły jako wejścia do modułu rekonstrukcji CycleGAN, natomiast odpowiadające im obrazy oryginalne stanowiły cele rekonstrukcji. Zrekonstruowane wzory dziedzictwa kulturowego są następnie ulepszane za pomocą SPADE, gdzie wzmocnienie artystyczne jest realizowane na podstawie wygenerowanych map segmentacji. Wydajność zaproponowanego schematu oceniono za pomocą ilościowych metryk segmentacji i jakości obrazu, natomiast autentyczność wizualną zrekonstruowanych motywów kulturowych oceniono jakościowo. Autentyczność wizualną oceniano poprzez inspekcję wzrokową wygenerowanych wzorów kulturowych i nie była ona wykorzystywana jako niezależna metryka ilościowa. Ocena koncentrowała się na zachowaniu motywu, spójności semantycznej, charakterystyce kulturowej, koherencji strukturalnej i wyglądzie artystycznym w odniesieniu do odpowiadających im referencyjnych motywów kulturowych. Ilościowa ocena wydajności modelu została przeprowadzona z wykorzystaniem wskaźników Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) oraz Fréchet Inception Distance (FID). Rysunek 2 ilustruje ogólny przebieg pracy zaproponowanego schematu SegCycle-SPADE i podsumowuje metryki ewaluacyjne użyte w niniejszym badaniu.

Rycina 2. Ogólny schemat przepływu architektury proponowanego frameworka SegCycle-SPADE. Przegląd pełnego procesu SegCycle-SPADE. Obrazy z zestawów danych Miao Batik i WikiArt przechodzą wstępne przetwarzanie, a następnie są poddawane segmentacji semantycznej przy użyciu SegFormer-B2, wzmocnieniu cech za pomocą CAFFM, rekonstrukcji wzorów przy użyciu CycleGAN oraz generowaniu stylu artystycznego przy użyciu SPADE. Wydajność modelu jest oceniana za pomocą wskaźników Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR oraz Fréchet Inception Distance (FID), natomiast autentyczność wizualna jest oceniana jakościowo. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Struktura SegCycle-SPADE do rekonstrukcji wzorów dziedzictwa kulturowego została zaprojektowana w celu integracji wielu komponentów DL dla dokładnej segmentacji, rekonstrukcji i artystycznego ulepszenia motywów, co zilustrowano na Rysunku 2. Obrazy z zestawu danych motywów kulturowych Miao Batik oraz zestawu danych WikiArt są wykorzystywane w celu zapewnienia różnorodnych wzorów kulturowych i stylów artystycznych. Początkowo obrazy są przetwarzane za pomocą modułu segmentacji semantycznej opartego na SegFormer, aby zidentyfikować i wyodrębnić motywy kulturowe z tła. Całość architektury składa się z czterech głównych etapów. Po pierwsze, model SegFormer wyodrębnia mapy segmentacji semantycznej z obrazów wzorów kulturowych. Po drugie, moduł CAFFM integruje cechy segmentacji z reprezentacjami generatywnymi w celu usprawnienia uczenia cech. Po trzecie, moduł CycleGAN rekonstruuje wzory kulturowe przy użyciu połączonych reprezentacji cech. Na koniec moduł SPADE generuje ulepszone stylistycznie wyniki, zachowując jednocześnie spójność strukturalną dzięki syntezie sterowanej segmentacją. Udoskonalone mapy cech są następnie przetwarzane przez moduł rekonstrukcji CycleGAN, który uczy się przywracać niekompletne motywy kulturowe poprzez mapowanie zdegradowanych wzorów na ich odpowiadające im formy kompletne. Próbki niekompletnych motywów zostały wygenerowane poprzez zastosowanie operacji losowego maskowania i częściowego przesłaniania do oryginalnych obrazów Miao Batik, symulując w ten sposób brakujące obszary wzorów i degradację strukturalną powszechnie obserwowaną w uszkodzonych artefaktach kulturowych. Każdy zdegradowany obraz został sparowany z odpowiadającym mu obrazem oryginalnym, który służył jako cel rekonstrukcji podczas treningu. Strategia ta umożliwiła modułowi CycleGAN naukę przywracania brakujących struktur motywów przy jednoczesnym zachowaniu spójności semantycznej i istotnych cech kulturowych. Ostatecznie generator SPADE tworzy wizualnie ulepszone wyniki artystyczne poprzez warunkowanie syntezy obrazu na wygenerowanych mapach segmentacji, utrzymując tym samym integralność strukturalną motywów kulturowych w całym procesie ulepszania artystycznego.
Poniższe kroki są elementem proponowanego schematu SegCycle-SPADE.
Krok 1: Gromadzenie zbiorów danych
W celu realizacji celów związanych z uczeniem się wzorców kulturowych i generowaniem stylów artystycznych wykorzystano dwa zbiory danych. Zbiór motywów kulturowych Miao Batik posłużył do dostarczenia informacji o tradycyjnych wzorach kulturowych. Zbiór ten jest publicznie dostępny za pośrednictwem Zenodo (https://doi.org/10.5281/zenodo.20807658) i zawiera 15 148 opisanych obrazów tradycyjnych motywów batikowych ludu Miao. Bezpośrednio wykorzystano istniejące adnotacje dostarczone przez twórców zbioru; w niniejszym badaniu nie tworzono dodatkowych adnotacji ręcznych. Zbiór danych WikiArt posłużył do dostarczenia zróżnicowanych informacji o stylach artystycznych na potrzeby generowania stylu i został pobrany z publicznie dostępnego repozytorium WikiArt (https://www.wikiart.org/).
Krok 2: Wstępne przetwarzanie danych
Wszystkie obrazy zostały poddane wstępnemu przetwarzaniu poprzez zmianę rozmiaru, normalizację oraz redukcję szumów. W celu wsparcia etapu segmentacji semantycznej wykorzystano istniejące adnotacje motywów kulturowych uzyskane z oryginalnych źródeł zbioru danych. W ramach niniejszego badania nie przeprowadzono żadnych dodatkowych procedur adnotacji ani ponownego etykietowania.
Krok 3: Segmentacja wzorców semantycznych z wykorzystaniem modelu SegFormer
Do segmentacji motywów kulturowych wykorzystano model SegFormer. Dokładny opis architektury szkieletowej SegFormer oraz strategii inicjalizacji znajduje się w podrozdziale Semantic Pattern Segmentation Using SegFormer. W szczególności do semantycznej segmentacji motywów zastosowano architekturę SegFormer-B2 z szkieletem MIT-B2 wstępnie wytrenowanym na zbiorze ImageNet. Model ten skutecznie przechwytuje globalne informacje kontekstowe, zachowując jednocześnie złożone szczegóły strukturalne tradycyjnych wzorów kulturowych.
Krok 4: CAFFM
CAFFM łączy cechy segmentacji semantycznej z reprezentacjami generatywnymi, umożliwiając strukturze naukę zarówno charakterystyk motywów strukturalnych, jak i informacji o stylu artystycznym. Szczegóły integracji CAFFM znajdują się w podrozdziale CAFFM. Moduł ten jest umieszczony pomiędzy etapem segmentacji semantycznej opartej na SegFormer a etapem rekonstrukcji generatywnej, gdzie łączy on cechy strukturalne pochodzące z segmentacji z cechami rekonstrukcji za pomocą wielogłowicowego mechanizmu uwagi krzyżowej (multi-head cross-attention). Proces ten poprawia zachowanie motywów kulturowych i zwiększa realizm zrekonstruowanych wyników.
Krok 5: Rekonstrukcja wzorców (CycleGAN)
Połączone cechy są następnie przetwarzane przez moduł CycleGAN w celu rekonstrukcji struktur wzorców kulturowych. Architektura CycleGAN oraz konfiguracja treningowa są opisane w podrozdziale Rekonstrukcja wzorców za pomocą CycleGAN. Moduł rekonstrukcji składa się z dwóch generatorów i dwóch dyskryminatorów, wykorzystuje architekturę generatora opartą na sieciach rezdualnych z dziewięcioma blokami rezdualnymi, stosuje dyskryminator PatchGAN i jest trenowany z wykorzystaniem strat adwersarialnych oraz strat spójności cyklicznej. Taka konfiguracja umożliwia dwukierunkowe mapowanie domen i ułatwia rekonstrukcję niekompletnych struktur wzorców kulturowych.
Krok 6: Generowanie stylu artystycznego (SPADE)
Zrekonstruowane wzory są następnie przetwarzane przez moduł SPADE w celu przeprowadzenia syntezy stylu artystycznego sterowanej segmentacją. Konfiguracja generatora SPADE została opisana w podrozdziale Generowanie stylu artystycznego przy użyciu SPADE. Moduł wykorzystuje bloki rezydualne SPADE, warstwy normalizacji adaptacyjnej przestrzennie oraz warunkowanie semantyczne pochodzące z map segmentacji SegFormer i reprezentacji cech CAFFM. Dzięki warunkowaniu generowania obrazów na podstawie map segmentacji, zsyntetyzowane wyniki zachowują spójność strukturalną z oryginalnymi motywami kulturowymi, jednocześnie uwzględniając charakterystykę stylu artystycznego.
Krok 7: Szacowanie wydajności
Zaproponowany model został oceniony przy użyciu wielu metryk segmentacji i oceny jakości obrazu, w tym dokładności segmentacji (Segmentation Accuracy), IoU, współczynnika podobieństwa Dice'a (Dice), SSIM, PSNR oraz FID. Aby ocenić spójność eksperymentalną, wszystkie doświadczenia powtórzono pięć razy z użyciem różnych ziarn losowych, a wyniki przedstawiono jako średnią ± odchylenie standardowe. Istotność statystyczną oceniono za pomocą testów t-studenta dla prób zależnych, przyjmując próg istotności p < 0,05.
Gromadzenie zbiorów danych
W zaproponowanej strukturze SegCycle-SPADE wykorzystano dwa zbiory danych w celu zrozumienia wzorców kulturowych i nauki stylu. Pierwszym zbiorem danych zastosowanym w proponowanej strukturze jest zbiór motywów kulturowych batików ludu Miao. Zbiór ten zawiera motywy kulturowe batików Miao, które zazwyczaj są obrazami tradycyjnych batików Miao zawierających motywy takie jak zwierzęta, rośliny i kształty geometryczne, wykorzystywane w sztuce etnicznej ludu Miao. Zbiór ten obejmuje obrazy z bogatymi informacjami o teksturze, co jest zazwyczaj istotne dla zachowania dziedzictwa kulturowego. Drugim zbiorem danych wykorzystanym w proponowanej strukturze SegCycle-SPADE jest zbiór WikiArt. Zbiór ten zawiera ogromną liczbę dzieł sztuki, zazwyczaj w różnych stylach. Jest on wykorzystywany do złożonej nauki stylu, co zazwyczaj okazuje się przydatne przy ulepszaniu dzieł sztuki. Zbiór ten posiada 80 000 dzieł sztuki w jakości HD w 27 różnych wersjach, co czyni go bardziej użytecznym w zadaniach generowania lub transformacji stylu opartych na DL.
Zbiór danych Miao Batik:
Zbiór danych Miao Batik (https://doi.org/10.5281/zenodo.20807658) obejmuje 15 148 obrazów wzorów batikowych przedstawiających motywy o znaczeniu kulturowym. Obrazy zawierają różnorodne tradycyjne projekty, takie jak motywy zwierzęce (np. motyle i ryby), wzory roślinne oraz motywy geometryczne niosące symbolikę kulturową. Zbiór ten stanowi istotny element proponowanego modelu, ponieważ dostarcza autentycznych struktur kulturowych, które pozwalają modułowi segmentacji na dokładną identyfikację i zachowanie granic motywów podczas rekonstrukcji wzoru (Tabela 1). W niniejszym badaniu motywy ważne kulturowo odnoszą się do symbolicznych elementów wizualnych powszechnie dokumentowanych w literaturze dotyczącej dziedzictwa kulturowego ludu Miao i reprezentowanych w adnotacjach zbioru danych, w tym ptaków, motyli, wzorów kwiatowych i totemów przodków. Motywy te wybrano na podstawie ich udokumentowanego znaczenia kulturowego oraz powtarzalnej obecności w tradycyjnych projektach batiku i haftów Miao, a nie wyłącznie na podstawie częstotliwości ich występowania lub kompozycji przestrzennej. Adnotacje motywów oraz etykiety segmentacji opracowane pod kierunkiem ekspertów pobrano z oryginalnego źródła zbioru danych Miao Batik i wykorzystano bezpośrednio w niniejszej pracy. Autorzy nie przeprowadzali żadnych dodatkowych manualnych adnotacji, ponownego etykietowania ani procedur adnotacji pod kierunkiem ekspertów. Istniejące adnotacje dostarczone przez twórców zbioru danych wykorzystano do trenowania i ewaluacji segmentacji semantycznej.
| Parametr | Opis |
| Nazwa zbioru danych | Zbiór danych wzorów kulturowych batików ludu Miao |
| Źródło zbioru danych | Repozytorium Zenodo (DOI: 10.5281/zenodo.20807658) |
| Dziedzina | Niematerialne Dziedzictwo Kulturowe (ICH) / Analiza wzorów tekstylnych |
| Całkowita liczba obrazów | 15 148 obrazów |
| Typ obrazu | Cyfrowe obrazy tradycyjnych wzorów tkanin batikowych ludu Miao |
| Kategorie wzorców | Motywy zwierzęce, motywy roślinne i motywy geometryczne |
| Pochodzenie kulturowe | kultura etniczna Miao, prowincja Guizhou, Chiny |
| Oryginalna rozdzielczość obrazu | Obrazy o wysokiej rozdzielczości (zazwyczaj ≥ 1000 pikseli na krótszym boku), zarejestrowane jako skany surowe lub fotografie przed etapem przetwarzania wstępnego |
| Rozdzielczość szkolenia | Obrazy zmienione na rozmiar 256 × 256 pikseli podczas przetwarzania wstępnego |
| Dostępność adnotacji | Istniejące adnotacje segmentacyjne dostarczone przez twórców zbioru danych zostały wykorzystane bez modyfikacji do celów uczenia i ewaluacji. W niniejszym badaniu nie przeprowadzono dodatkowego ręcznego adnotowania, ponownego etykietowania ani procedur potwierdzania przez ekspertów. |
| Zastosowanie w niniejszym badaniu | Segmentacja motywów kulturowych, ekstrakcja cech, zachowanie motywów i rekonstrukcja wzorów |
Tabela 1: Charakterystyka zbioru danych wzorów kulturowych batiku ludu Miao. Podsumowanie zbioru danych motywów kulturowych batiku ludu Miao wykorzystanego do segmentacji semantycznej, analizy wzorów kulturowych i rekonstrukcji motywów. Tabela opisuje źródło zbioru danych, charakterystykę obrazów, kategorie motywów, pochodzenie kulturowe, rozdzielczość obrazów oraz rolę zbioru w proponowanej strukturze SegCycle-SPADE.
Zbiór danych WikiArt:
Zbiór danych WikiArt [https://www.wikiart.org/] to popularne, wielkoskalowe cyfrowe repozytorium sztuki, które obejmuje ponad 80 000 obrazów reprezentujących 27 różnych stylów artystycznych przedstawionych w Tabeli 2. Style te obejmują m.in. sztukę renesansu, impresjonizm, kubizm i surrealizm. Zbiór ten jest bardzo istotny w proponowanym modelu, ponieważ dostarcza wiedzy umożliwiającej modułowi SPADE tworzenie kulturowo wzbogaconych wzorów przy jednoczesnym zachowaniu informacji strukturalnych uzyskanych w procesie segmentacji. Zbiór danych składa się z 56 000 obrazów do uczenia oraz 12 000 obrazów do walidacji i testowania. Obrazy zawarte w zbiorze pomagają w efektywnym trenowaniu modelu DL.
| Parametr | Opis |
| Nazwa zestawu danych | Zbiór danych WikiArt |
| Źródło zbioru danych | Repozytorium WikiArt (https://www.wikiart.org/) |
| Dziedzina | Sztuka cyfrowa i malarstwo |
| Łączna liczba obrazów | Około 80 000 dzieł sztuki |
| Obrazy treningowe | 56,000 |
| Obrazy walidacyjne | 12,000 |
| Obrazy testowe | 12,000 |
| Style artystyczne | 27 stylów artystycznych, w tym renesans, impresjonizm, kubizm, surrealizm, ekspresjonizm, realizm i sztuka abstrakcyjna |
| Oryginalna rozdzielczość obrazu | Oryginalne rozdzielczości obrazów różnią się w zależności od dzieł i źródeł. Obrazy zostały przeskalowane do jednolitej rozdzielczości 256. × 256 pikseli podczas przetwarzania wstępnego. |
| Rozdzielczość szkolenia | Obrazy zmienione na rozmiar 256 × 256 pikseli podczas wstępnego przetwarzania przed nauką stylu artystycznego i syntezą obrazu sterowaną segmentacją. |
| Podział zbioru danych | Stratyfikowany podział losowy (70% zbiór treningowy, 15% zbiór walidacyjny i 15% zbiór testowy) z wykorzystaniem stałego ziarna losowości 42 |
| Strategia próbkowania stylu | Zastosowano stratyfikowane próbkowanie proporcjonalne, aby zachować rozkład 27 stylów artystycznych w podzbiorach treningowym, walidacyjnym i testowym. |
| Zastosowanie w niniejszym badaniu | Uczenie stylu artystycznego, reprezentacja stylu oraz artystyczna synteza kierowana segmentacją |
Tabela 2: Charakterystyka zbioru danych WikiArt. Podsumowanie zbioru danych WikiArt wykorzystanego do uczenia stylów artystycznych oraz syntezy obrazów sterowanej stylem. Tabela opisuje źródło zbioru danych, rozkład obrazów, zakres stylów artystycznych, partycjonowanie zbioru, rozdzielczość obrazów oraz jego zastosowanie w proponowanym modelu SegCycle-SPADE.
Zbiór danych Miao Batik zawiera 15 148 obrazów przedstawiających tradycyjne motywy kulturowe ludu Miao.32 Zbiór ten jest publicznie dostępny za pośrednictwem serwisu Zenodo (https://doi.org/10.5281/zenodo.20807658). Przed trenowaniem modelu wszystkie obrazy zostały poddane inspekcji wizualnej, przeskalowane do rozmiaru 256 × 256 pikseli, znormalizowane oraz sprawdzone pod kątem uszkodzonych lub zduplikowanych próbek. Przesiewowa kontrola jakości nie doprowadziła do wykluczenia żadnych obrazów; w związku z tym wszystkie 15 148 obrazów zachowano do dalszej analizy. Zbiór danych został losowo podzielony na podzbiory treningowy (70%), walidacyjny (15%) i testowy (15%) przy użyciu stałego ziarna losowości (random seed) wynoszącego 42, aby zapewnić powtarzalność podziału zbioru. Dostęp do zbioru danych WikiArt uzyskano poprzez oficjalne repozytorium WikiArt (https://www.wikiart.org/), który zawiera ponad 80 000 dzieł sztuki reprezentujących 27 stylów artystycznych. W eksperymentach dotyczących uczenia stylu wykorzystano 56 000 obrazów do trenowania, 12 000 do walidacji i 12 000 do testowania.
Przetwarzanie wstępne danych
Przed rozpoczęciem trenowania proponowanego frameworku SegCycle-SPADE, zestaw danych motywów kulturowych Miao Batik oraz zestaw danych WikiArt poddano kilku etapom przetwarzania wstępnego, aby zapewnić spójną jakość obrazów i dokładną reprezentację cech. Do obu zbiorów danych zastosowano ten sam podstawowy schemat przetwarzania, obejmujący odszumianie gaussowskie, normalizację, zmianę rozmiaru do spójnej rozdzielczości wejściowej oraz weryfikację jakości obrazu. Jednak oba zest danych pełniły w ramach frameworku odmienne role. Zestaw WikiArt służył do nauki i syntezy stylu artystycznego, natomiast zestaw Miao Batik był wykorzystywany głównie do segmentacji i rekonstrukcji motywów kulturowych. Poza tymi specyficznymi dla zadań rolami nie wprowadzono żadnych zmian w przetwarzaniu wstępnym zależnych od zestawu danych. Aby zapewnić spójne przetwarzanie przez model DL, obrazy najpierw zmieniono do stałej rozdzielczości. Krok ten był niezbędny, ponieważ obrazy w obu zbiorach różniły się rozdzielczością w zależności od źródła. Zmiana rozmiaru zwiększyła wydajność obliczeniową i zapobiegła wpływowi niespójności wymiarowych na proces trenowania. Drugim etapem przetwarzania wstępnego była normalizacja, w której wartości pikseli przeskalowano do znormalizowanego zakresu, aby ustabilizować aktualizacje gradientu podczas trenowania. Następnie obrazy przetworzono za pomocą filtrowania gaussowskiego w celu redukcji szumu, który mógłby zakłócić strukturę motywów kulturowych. W przypadku zestawu Miao Batik, do trenowania i ewaluacji segmentacji semantycznej wykorzystano bez modyfikacji istniejące maski segmentacji motywów kulturowych, pozyskane bezpośrednio z oryginalnego źródła zestawu danych. Na potrzeby niniejszego badania nie generowano nowych masek segmentacji.
O ile nie wskazano inaczej, równania opisujące uznane metody zostały zaadaptowane z wcześniejszych badań i są odpowiednio cytowane. Równania opisujące proponowany CAFFM oraz zintegrowany system optymalizacji SegCycle-SPADE zostały opracowane przez autorów na potrzeby niniejszego badania.
Przyjmijmy, że obraz wejściowy z zestawu danych jest reprezentowany przez Równanie 1:
(1)
Tutaj H, W i C oznaczają odpowiednio wysokość obrazu, szerokość oraz liczbę kanałów kolorystycznych. Wszystkie obrazy są zmieniane na stały rozmiar H′ × W′, zgodnie z Równaniem 2:

Tutaj Ir oznacza obraz po zmianie rozmiaru. Znormalizowane wartości pikseli oblicza się zgodnie z Równaniem 3:
(3)
Pomaga to ustabilizować procedurę uczenia. Filtrowanie szumów jest wykonywane przy użyciu filtra Gaussa, zgodnie z Równaniem 4:

Tutaj G(σ) oznacza filtr Gaussa, a * oznacza splot. Zastosowano filtr Gaussa o jądrze 5 × 5 i odchyleniu standardowym σ = 1.0. W celu zredukowania artefaktów krawędziowych zastosowano dopełnienie lustrzane (reflective padding) dla pikseli brzegowych. Proces odszumiania przeprowadzono bezpośrednio po załadowaniu obrazu, przed skalowaniem i normalizacją. Aby zapewnić jednolity preprocessing w całym badaniu, tę samą konfigurację filtra zastosowano do każdego obrazu w zbiorach danych Miao Batik oraz WikiArt. Dla zbioru danych Miao Batik maski segmentacji są tworzone zgodnie z Równaniem 5:

Tutaj M to maska segmentacji służąca do kierowania modelem SegFormer.
Potok przetwarzania wstępnego rozpoczyna się od pozyskania obrazów z zestawu danych Miao Batik oraz zestawu danych WikiArt, co przedstawiono na Ryc. 3. Podczas uczenia nie zastosowano technik augmentacji danych. Po wstępnym przetwarzaniu, które obejmowało zmianę rozmiaru, normalizację, odszumianie Gaussa oraz przygotowanie masek segmentacyjnych, obrazy zostały bezpośrednio wykorzystane do uczenia, walidacji i testowania proponowanego frameworka SegCycle-SPADE. Pierwszym krokiem potoku przetwarzania wstępnego jest zmiana rozmiaru obrazów do stałej wielkości, co pozwala modelowi DL na bardziej efektywne przetwarzanie danych. Drugi krok obejmuje normalizację, która przekształca wartości pikseli na zestandaryzowany zakres numeryczny i ułatwia zbieżność modelu. Trzeci krok polega na usuwaniu szumów, dzięki czemu obrazy są oczyszczane z niepożądanych zakłóceń w celu poprawy rozpoznawania wzorców. Ponadto, w przypadku zestawu danych Miao Batik, adnotowano obszary motywów kulturowych, co umożliwiło wygenerowanie masek wykorzystywanych w module segmentacji proponowanego modelu, zapewniając zachowanie motywów kulturowych podczas generowania. Wynikiem końcowym tego etapu jest oczyszzczony zestaw danych, gotowy do uczenia modułów segmentacji i generowania proponowanego modelu.

Rysunek 3. Potok wstępnego przetwarzania danych dla obrazów dziedzictwa kulturowego. Schemat blokowy ilustrujący procedury wstępnego przetwarzania obrazów stosowane przed trenowaniem modelu. Potok obejmuje pozyskiwanie zbioru danych, zmianę rozmiaru obrazów, normalizację, odszumianie Gaussa, istniejące adnotacje motywów kulturowych oraz przygotowanie masek segmentacyjnych. Przetworzone obrazy i maski stanowią dane wejściowe dla segmentacji semantycznej i rekonstrukcji wzorów. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Każdy obraz został poddany procesowi kontroli jakości przed trenowaniem modelu. Zbiór danych Miao Batik zawierał 15 148 obrazów. Próbki uszkodzone, zdublowane i niskiej jakości zostały już usunięte przez twórców oryginalnego zbioru danych; w związku z tym w niniejszym badaniu podczas przesiewowej kontroli jakości nie wykluczono żadnych dodatkowych obrazów. W konsekwencji do analizy zachowano wszystkie 15 148 obrazów. Podczas przetwarzania wstępnego obrazy wczytywano w formacie RGB i zmieniano ich rozmiar do 256 × 256 pikseli przy użyciu interpolacji bilinearnej. Wartości pikseli przeskalowano z zakresu [0, 255] do [0, 1] poprzez podzielenie ich przez 255. Następnie zastosowano normalizację kanałową, używając wartości średnich [0.485, 0.456, 0.406] oraz wartości odchylenia standardowego [0.229, 0.224, 0.225] odpowiednio dla kanałów czerwonego, zielonego i niebieskiego. Potok przetwarzania wstępnego obejmował wczytywanie obrazów, konwersję do RGB, zmianę rozmiaru, skalowanie wartości pikseli, normalizację oraz konwersję na tensory. W razie potrzeby obrazy w skali szarości konwertowano na trójkanałowy format RGB, aby zachować kompatybilność z modelami DL. Po przetwarzaniu wstępnym obrazy podzielono na podzbiory treningowe, walidacyjne i testowe. Wszystkie etapy struktury SegCycle-SPADE — w tym segmentacja semantyczna, fuzja cech, rekonstrukcja motywów oraz synteza artystyczna oparta na SPADE — wykorzystywały spójną rozdzielczość wejściową 256 × 256 pikseli.
Segmentacja wzorców semantycznych z wykorzystaniem SegFormer
Po tym etapie wstępnego przetwarzania, oczyszczone i znormalizowane obrazy z zestawu danych motywów kulturowych Miao Batik oraz zestawu danych WikiArt są wprowadzane do modułu segmentacji semantycznej opartego na zaproponowanym modelu SegFormer-B2. Celem tego kroku jest prawidłowa identyfikacja i wyodrębnienie motywów kulturowych występujących we wzorach dziedzictwa. Zaproponowana architektura SegFormer opiera się na strukturze transformera, która zawiera hierarchiczny koder Transformer oraz lekki dekoder MLP, aby precyzyjnie przechwytywać globalne informacje kontekstowe, a także szczegółowe informacje strukturalne ze złożonych wzorów dziedzictwa. Model najpierw ekstrahuje reprezentacje cech w wielu skalach z obrazu wejściowego, a następnie dokonuje fuzji tych reprezentacji poprzez dekoder w celu wygenerowania dokładnych segmentacji wzorów. Zapewnia to prawidłową segmentację wzorów na obrazie dziedzictwa na takie motywy jak wzory geometryczne, kwiatowe i symboliczne, oddzielając je tym samym od tła przy jednoczesnym zachowaniu ich integralności strukturalnej. Informacje strukturalne te są następnie wykorzystywane w późniejszych etapach generowania wzorów w ramach struktury SegCycle-SPADE.
Niech przetworzony obraz wejściowy będzie reprezentowany jako Równanie 6:
(6)
Koder SegFormer dzieli obraz na fragmenty i wyodrębnia cechy hierarchiczne za pomocą warstw transformera, co przedstawiono w Równaniu 71:

Tutaj F oznacza wieloskalowe mapy cech uzyskane z kodera transformera. Cechy te kodują zarówno lokalne wzorce tekstury, jak i globalne zależności kontekstowe między regionami motywów. Model SegFormer ekstrahuje mapy cech w różnych skalach, zgodnie z definicją w Równaniu 8:

Zastosowanie reprezentacji wielkoskalowych ułatwia wykrywanie wzorców o różnych rozmiarach w obrębie motywów kulturowych. Ostatecznie cechy są łączone przy użyciu dekodera MLP, jak pokazano w Równaniu 91:

Tutaj S oznacza końcową przewidzianą mapę segmentacji.
Szkielet SegFormer-B2 został zainicjalizowany przy użyciu wag wytrenowanych na zbiorze ImageNet, a następnie dostrojony na zbiorze danych Miao Batik w celu segmentacji motywów kulturowych. Punkt kontrolny pretreningu pozyskano z oficjalnej implementacji SegFormer. W szczególności do inicjalizacji szkieletu SegFormer-B2 przed dostrajaniem wykorzystano punkt kontrolny MIT-B2 wytrenowany na ImageNet-1K (mit_b2.pth), udostępniony w oficjalnym repozytorium SegFormer. Wagi pretreningowe odpowiadają szkieletowi MIT-B2 wydanemu przez autorów SegFormer i posłużyły jako model inicjalizujący dla treningu segmentacji semantycznej. Pozostałe warstwy specyficzne dla zadania zostały zainicjalizowane przy użyciu domyślnych procedur inicjalizacji wag PyTorch przed rozpoczęciem treningu.
W architekturze zastosowano czterostopniowy hierarchiczny enkoder Transformer z nakładającymi się osadzeniami patchy (patch embeddings). Na etapie początkowym rozmiar patcha ustawiono na 7 × 7 z krokiem 4. Dla każdego z czterech etapów enkodera wymiary osadzeń wynosiły odpowiednio 64, 128, 320 i 512. W ramach czterech etapów zastosowano odpowiednio 1, 2, 5 i 8 głowic wielogłowicowej samoatencji (multihead self-attention), a odpowiadające im głębokości enkodera wynosiły 3, 4, 6 i 3 warstwy. Cechy wieloskalowe pobrane z enkodera zostały zagregowane za pomocą lekkiego dekodera opartego wyłącznie na MLP (all-MLP decoder). Przed utworzeniem końcowej mapy segmentacji dekoder rzutował cechy z każdego etapu enkodera do jednej wspólnej przestrzeni osadzeń. Wszystkie bloki Transformera wykorzystywały funkcję aktywacji Gaussian Error Linear Unit (GELU). Podczas trenowania zastosowano współczynnik dropout wynoszący 0.1 w celu poprawy generalizacji i ograniczenia przeuczenia.
Podczas fazy uczenia framework SegFormer otrzymuje wstępnie przetworzone obrazy z obu zbiorów danych. Obrazy ze zbioru danych Miao Batik zawierają obszary motywów, które służą jako etykiety dla nadzorowanego uczenia modelu segmentacji. Koder Transformer przetwarza cały obraz i rejestruje dalekosiężne zależności między komponentami obrazu, co jest szczególnie istotne w przypadku tradycyjnych wzorów batik zawierających motywy rozproszone przestrzennie. Hierarchiczny mechanizm ekstrakcji cech jednocześnie rejestruje struktury lokalne, takie jak powtarzające się tekstury geometryczne. Dekoder MLP przetwarza te wyekstrahowane cechy i generuje maskę segmentacji wyróżniającą obszary motywów. Mapy segmentacji wygenerowane na tym etapie są następnie wykorzystywane jako wejścia strukturalne dla modułu uwagi oraz etapu rekonstrukcji wzorów, co pomaga zachować autentyczność generowanych wzorów.
Motywy kulturowe podzielono na różne klasy do segmentacji semantycznej zgodnie z ich cechami wizualnymi i kulturowymi. Taksonomia segmentacji obejmowała motywy zwierzęce (np. motyle, ryby, ptaki i inną symboliczną faunę), motywy roślinne (np. kwiaty, liście, pnącza i wzory botaniczne), motywy geometryczne (np. powtarzające się kształty, obramowania i abstrakcyjne struktury geometryczne) oraz obszary tła reprezentujące strefy bez motywów. Maski segmentacji na poziomie pikseli wykorzystano do przypisania każdego piksela do jednej z predefined klas. Etykiety całkowitoliczbowe zakodowano w następujący sposób: Etykieta 0 = tło, Etykieta 1 = motywy zwierzęce, Etykieta 2 = motywy roślinne i Etykieta 3 = motywy geometryczne. Adnotacje segmentacyjne i etykiety motywów pobrano bezpośrednio z oryginalnego źródła zbioru danych Miao Batik. W niniejszym badaniu nie przeprowadzono żadnych dodatkowych ręcznych adnotacji, ponownego etykietowania, weryfikacji granic ani procedur potwierdzenia przez ekspertów. Istniejące adnotacje dostarczone przez twórców zbioru danych wykorzystano bez modyfikacji do trenowania i ewaluacji.
Model SegFormer do segmentacji motywów kulturowych przetwarza wstępnie przygotowane obrazy z zestawu danych Miao Batik oraz zestawu danych WikiArt, wykorzystując mechanizm oparty na transformerze do dokładnego wykrywania obszarów wzorów kulturowych, jak pokazano na Rysunku 4. Najpierw obraz wejściowy zawierający tradycyjne motywy kulturowe jest dostarczany do modelu SegFormer. Koder Transformera wyodrębnia zarówno globalne informacje kontekstowe, jak i lokalne cechy strukturalne z fragmentów obrazu. Wynikowe cechy wieloskalowe są przekazywane do dekodera segmentacji, który wykorzystuje sieć Mix Feed-Forward do doprecyzowania reprezentacji cech i poprawy wykrywania motywów. Wynikiem modelu SegFormer jest maska segmentacyjna, która wyróżnia piksele odpowiadające wzorom kulturowym, jednocześnie tłumiąc nieistotne informacje tła. Wyizolowane wzory kulturowe służą następnie jako prowadzenie strukturalne dla kolejnych etapów architektury SegCycle-SPADE.

Rysunek 4. Segmentacja semantyczna motywów kulturowych oparta na modelu SegFormer-B2. Architektura modułu segmentacji semantycznej SegFormer-B2 wykorzystanego do ekstrakcji motywów kulturowych i wytrenowanego wyłącznie na zbiorze danych Miao Batik. Struktura składa się z kodera opartego na Transformerze do wieloskalowej ekstrakcji cech oraz lekkiego dekodera segmentacji do generowania masek motywów. Model przewiduje cztery klasy semantyczne — zwierzęta, rośliny, formy geometryczne i tło — gdzie wynikowe maski segmentacji identyfikują istotne kulturowo obszary motywów, jednocześnie tłumiąc nieistotne informacje tła. Wyniki segmentacji te zapewniają wskazówki strukturalne dla następnych etapów fuzji cech, rekonstrukcji i syntezy artystycznej w proponowanym frameworku SegCycle-SPADE. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
W sugerowanych ramach nie ma potrzeby tworzenia nowych adnotacji segmentacyjnych. Zbiór danych Miao Batik pozyskano z istniejącego publicznego źródła, a model został wytrenowany przy użyciu powiązanych informacji o motywach dostarczonych przez twórców zbioru danych. W procesie uczenia model SegFormer generował mapy segmentacji semantycznej. W związku z tym obecne badanie nie wymagało zastosowania dodatkowego oprogramowania do adnotacji manualnych, wytycznych dotyczących adnotacji ani procedur kontroli jakości adnotacji.
CAFFM
Aby poprawić interakcję między cechami segmentacji semantycznej a reprezentacjami rekonstrukcji generatywnej, w badaniu zaproponowano również moduł CAFFM. Koder SegFormer-B2 dostarcza mapy cech semantycznych do modułu CAFFM, natomiast etap rekonstrukcji CycleGAN dostarcza mapy cech generatywnych. W pierwszej kolejności zastosowano warstwy projekcji liniowej w celu rzutowania obu strumieni cech do wspólnej przestrzeni zanurzeń. Do obliczeń cross-attention stworzono reprezentacje zapytania (Q), klucza (K) oraz wartości (V) przy użyciu wygenerowanych tensorów cech. Następnie relacje między informacjami o motywach strukturalnych a elementami stylu artystycznego zostały zamodelowane za pomocą wielogłowicowego mechanizmu cross-attention. Do połączonych reprezentacji cech zastosowano następnie normalizację warstwową, połączenia rezdualne oraz warstwy feed-forward z aktywacją GELU. Etap syntezy oparty na SPADE otrzymuje wynik z modułu CAFFM, co pozwala na zachowanie istotnych kulturowo motywów bez utraty spójności artystycznej.
Aby zagwarantować kompatybilność cech, cechy wejściowe są najpierw rzutowane za pomocą liniowych warstw projekcyjnych na wspólną przestrzeń osadzeń o wymiarze osadzenia wynoszącym 256. Powiązania między semantycznymi informacjami strukturalnymi a generatywnymi reprezentacjami stylu są następnie modelowane przy użyciu mechanizmu MultiHead Cross-Attention z ośmioma głowicami uwagi. Obliczenia uwagi krzyżowej wykorzystują wektory zapytania (Query, Q), klucza (Key, K) i wartości (Value, V), które są generowane przez specyficzne liniowe warstwy transformacji. W celu zwiększenia stabilności treningu i zachowania integralności cech, zastosowano połączenia rezydualne oraz normalizację warstwową (Layer Normalization), aby dodatkowo ulepszyć scalone reprezentacje cech. Nieliniowe uczenie cech jest następnie usprawniane poprzez zastosowanie sieci typu feed-forward z funkcją aktywacji Gaussian Error Linear Unit (GELU). Moduł generuje reprezentację cech wyjściowych o wymiarze 256, która jest przekazywana do kolejnych etapów w celu syntezy kreatywnej. CAFFM skutecznie łączy dane o stylu artystycznym ze strukturami motywów kulturowych, wykorzystując technikę fuzji opartą na uwadze krzyżowej, co poprawia zachowanie motywów oraz spójność wizualną w zrekonstruowanych wzorach dziedzictwa kulturowego.
W proponowanym systemie cechy strukturalne są pochodne z zestawu danych Miao Batik, natomiast cechy stylistyczne są uczone na podstawie zestawu danych WikiArt. Przyjmijmy, że mapa cech pochodząca z sieci segmentacyjnej SegFormer z wykorzystaniem obrazów z zestawu danych Miao Batik jest oznaczana jako Fs, natomiast mapa cech pochodząca z gałęzi ekstrakcji cech stylu z obrazów WikiArt jest oznaczana jako Fa. Proponowany moduł CAFFM łączy dwie domeny cech za pomocą mechanizmu cross-attention, aby nauczyć się zależności strukturalnych i stylistycznych wzorów kulturowych. Tabela 3 przedstawia wszystkie charakterystyki architektoniczne, w tym wymiary osadzeń, warstwy normalizacji, funkcje aktywacji oraz konfigurację głowic uwagi. Dla rozmiaru obrazu wejściowego 256 × 256 pikseli, koder SegFormer-B2 generował semantyczne mapy cech o rozmiarze 64 × 64 × 128, podczas gdy gałąź ekstrakcji cech stylu generowała mapy cech o rozmiarze 64 × 64 × 128. Obie mapy cech zostały rzutowane za pomocą wyuczalnych warstw liniowych do wspólnej przestrzeni osadzeń o wymiarze 256 przed fuzją za pomocą cross-attention.
| Parametr | Konfiguracja |
| Proponowany schemat | SegCycle-SPADE |
| Model segmentacji semantycznej | SegFormer-B2 |
| Etapy kodera SegFormer | 4 |
| Inicjalizacja wag | Wstępnie wytrenowany model SegFormer-B2 (szkielet MIT-B2) na zbiorze ImageNet-1K |
| Źródło punktu kontrolnego | Oficjalne repozytorium NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); punkt kontrolny: segformer.b2.512x512.ade.160k |
| Strategia dostrajania | Pełne dostrajanie (end-to-end fine-tuning) na zbiorze danych Miao Batik |
| Rozmiar osadzania patchy | 7 × 7 |
| Krok patcha | 4 |
| Wymiary osadzeń | 64, 128, 320 i 512 |
| Głębokości koderów | 3, 4, 6 i 3 |
| Głowice uwagi | 1, 2, 5 i 8 |
| Typ dekodera | Dekoder oparty wyłącznie na MLP |
| Funkcja aktywacji | GELU |
| Współczynnik rezygnacji | 0.1 |
| Moduł ulepszania cech | Moduł fuzji cech kulturowych z mechanizmem wzajemnej uwagi (Cross-Attention Cultural Feature Fusion Module, CAFFM) |
| Wymiar zanurzenia CAFFM | 256 |
| Głowice uwagi CAFFM | 8 |
| Skale fuzji CAFFM | 4 |
| Model rekonstrukcyjny | CycleGAN |
| Model generowania stylu | SPADE |
| Zbiór danych kulturowych | Zbiór danych Miao Batik |
| Zbiór danych stylu | Zbiór danych WikiArt |
| Obrazy batikowe ludu Miao | 15,148 |
| Obrazy z WikiArt | Około 80 000 |
| Rozdzielczość obrazu wejściowego | 256 × 256 pikseli |
| Format koloru | RGB |
| Metoda interpolacji | Interpolacja biliniarna |
| Metoda odszumiania | Filtrowanie gaussowskie |
| Rozmiar jądra Gaussa | 5 × 5 |
| Sigma Gaussa (σ) | 1 |
| Zakres normalizacji | [0, 1] |
| Wielkość serii | 16 |
| Liczba epok | 100 |
| Optymalizator | Adam |
| Szybkość uczenia | 0.0002 |
| Parametry Adam | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, zanikanie wag = 0 |
| Funkcje straty | strata segmentacji, strata adwersarialna, strata spójności cyklicznej, strata rekonstrukcji, strata zachowania motywu oraz strata spójności stylu |
| Strategia podziału zbioru danych | Trenowanie / Walidacja / Testowanie |
| Zbiór treningowy | 70% |
| Zbiór walidacyjny | 15% |
| Zbiór testowy | 15% |
| Ziarno losowości | 42 |
| Metryki oceny | Dokładność segmentacji, IoU, współczynnik Dice'a, SSIM, PSNR i FID |
| Język programowania | Python 3.8.10 |
| Środowisko uczenia głębokiego | PyTorch 1.10.0 |
| Platforma sprzętowa | GPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11. generacja), 32 GB RAM |
| Środowisko operacyjne | Ubuntu 20.04 LTS |
Tabela 3: Konfiguracja eksperymentalna i modelu. Podsumowanie komponentów architektonicznych, konfiguracji treningu, ustawień przetwarzania wstępnego, zbiorów danych, parametrów optymalizacji, metryk ewaluacji oraz środowiska obliczeniowego wykorzystanego do implementacji i oceny proponowanego frameworka SegCycle-SPADE.
Moduł uwagi najpierw odwzorowuje mapę cech na reprezentacje zapytania (query), klucza (key) i wartości (value) zgodnie z Równaniem 10:

W tym przypadku Wq, Wk oraz Wv są uczeniacymi się macierzami wag. Wagi uwagi są obliczane na podstawie podobieństwa między wektorem zapytania a wektorem klucza zgodnie z Równaniem 1117:

Tutaj dk to wymiar wektora klucza. Ulepszoną reprezentację cech oblicza się poprzez pomnożenie wag uwagi przez macierz wartości zgodnie z Równaniem 12:

W tym przypadku Fa jest ulepszoną reprezentacją cech mapy cech. Ulepszona reprezentacja cech jest obliczana poprzez połączenie oryginalnych cech segmentacji z cechami ulepszonymi, uzyskanymi za pomocą mechanizmu uwagi zgodnie z Równaniem 13:
Tutaj Fe to ulepszona mapa cech wykorzystywana do rekonstrukcji wzorca. Moduł CAFFM został rozszerzony o wieloskalowy mechanizm wzajemnej uwagi (cross-attention), aby wyodrębnić cechy motywów kulturowych w różnych skalach. Niech Fsi oznacza cechy segmentacji w skali i, natomiast Faj oznacza cechy stylu artystycznego w tej samej skali. Końcowa reprezentacja cech została zdefiniowana za pomocą Równania 14:

Tutaj Qi, Ki oraz Vi reprezentują odpowiednio macierze zapytania (query), klucza (key) i wartości (value) w skali i, a N oznacza liczbę skal cech. W niniejszym badaniu N = 4, co odpowiada mapom cech wyodrębnionym przy rozdzielczościach przestrzennych wynoszących 1/4, 1/8, 1/16 i 1/32 rozmiaru obrazu wejściowego. Te wieloskalowe reprezentacje cech zostały połączone przy użyciu nauczalnych wag uwagi przed rekonstrukcją i syntezą artystyczną. Powyższe rozszerzenie umożliwia metodzie wyodrębnienie globalnych motywów kulturowych i tekstur w celu rekonstrukcji wzorów kulturowych. CAFFM znajduje się pomiędzy etapem segmentacji opartym na SegFormer a etapem syntezy kreatywnej opartym na SPADE w zaproponowanym systemie SegCycle-SPADE. Najpierw, podczas gdy CycleGAN jednocześnie tworzy cechy rekonstrukcji z informacjami stylistycznymi i wzorcowymi, SegFormer-B2 odzyskuje semantyczne mapy cech opisujące właściwości strukturalne motywów kulturowych. Moduł CAFFM przyjmuje te dwa strumienie cech i wykorzystuje fuzję opartą na mechanizmie cross-attention do identyfikacji zależności między reprezentacjami strukturalnymi a artystycznymi. Aby stworzyć kulturowo autentyczne wzory przy zachowaniu spójności semantycznej i cech strukturalnych, wynikowe połączone mapy cech są następnie przesyłane do modułu SPADE w celu kreatywnej syntezy sterowanej segmentacją.
Rekonstrukcja wzorów z wykorzystaniem CycleGAN
Po zakończeniu etapu wzmacniania cech opartego na mechanizmie uwagi, mapy cech będą zawierać wzmocnione struktury motywów kulturowych. Mapy cech mogą jednak nadal zawierać niekompletne lub uszkodzone obszary wzorów. W związku z tym, aby rozwiązać problem rekonstrukcji wzorów, proponowana struktura wykorzysta model CycleGAN. W proponowanej strukturze dwiema domenami będą oryginalne wzory motywów kulturowych oraz zrekonstruowane wzory motywów kulturowych. Wykorzystując cechy wzmocnione na poprzednich etapach, model CycleGAN zrekonstruuje wzory kulturowe, zachowując spójność strukturalną. Zapewni to, że wzory kulturowe, takie jak wzory geometryczne, roślinne i symboliczne, zachowają swój układ przestrzenny. Oryginalne obrazy batiku ludu Miao zostały poddane operacjom losowego maskowania i częściowego przesłaniania w celu wygenerowania niekompletnych lub uszkodzonych motywów kulturowych. Procedury degradacji te symulowały brakujące obszary wzorów i uszkodzenia strukturalne powszechnie obserwowane w zdegradowanych artefaktach dziedzictwa kulturowego. Zdegradowane obrazy posłużyły jako dane wejściowe do modułu rekonstrukcji, natomiast odpowiadające im obrazy oryginalne służyły jako obrazy referencyjne do oceny wydajności i jakości rekonstrukcji. Strategia ta umożliwiła modelowi naukę przywracania brakujących struktur motywów przy jednoczesnym zachowaniu spójności semantycznej i cech kulturowych.
Przyjmijmy, że X jest domeną niepełnych wzorców kulturowych, a Y domeną zrekonstruowanych wzorców kulturowych. Dwa generatory uczą się wykonywać mapowanie dwukierunkowe zgodnie z Równaniem 15:

Tutaj GE jest wykorzystywane do rekonstrukcji struktur motywów, a FM do mapowania wzorców z powrotem na oryginalną domenę. Strata przeciwstawna jest stosowana w celu zapewnienia, że zrekonstruowane wzorce są realistyczne (Równanie 16)30

W tym przypadku DY jest dyskryminatorem służącym do rozróżniania wzorów rzeczywistych i zrekonstruowanych, a GE(x) oznacza wygenerowany wzór zrekonstruowany. CycleGAN wymusza również spójność cyklu w celu zachowania układu strukturalnego motywów kulturowych (Równanie 17)30.

Ostateczna funkcja straty została zdefiniowana w Równaniu 1830:

Tutaj λi oznacza współczynnik wagowy dla straty spójności cyklicznej, który podczas treningu ustawiono na 10, zgodnie z oryginalną sformułowaniem CycleGAN. Wartość ta została wybrana w celu zrównoważenia uczenia przeciwstawnego i spójności rekonstrukcji pomiędzy domenami źródłową a docelową.
Moduł rekonstrukcji CycleGAN składa się z dwóch generatorów i dwóch dyskryminatorów służących do dwukierunkowej translacji obrazów. Każdy generator opiera się na architekturze sieci rezdualnej, składającej się z początkowej warstwy konwolucyjnej 7 × 7, po której następują dwie warstwy konwolucyjne zmniejszające próbkowanie (downsampling), dziewięć bloków rezdualnych oraz dwie warstwy zwiększające próbkowanie (upsampling). Wszystkie operacje konwolucyjne wykorzystują jądro o rozmiarze 3 × 3, z wyjątkiem warstwy wejściowej, która wykorzystuje jądro 7 × 7 w celu usprawnionej ekstrakcji cech. Po każdej warstwie konwolucyjnej zastosowano normalizację instancji (Instance Normalization) dla poprawy stabilności treningu, natomiast w całej sieci generatora wykorzystano aktywację ReLU. Warstwa wyjściowa stosuje funkcję aktywacji Tanh do generowania znormalizowanych obrazów wyjściowych. Dyskryminator opiera się na architekturze PatchGAN 70 × 70, składającej się z serii warstw konwolucyjnych z jądrami o rozmiarze 4 × 4 i progresywnie zwiększającą się liczbą kanałów cech. W dyskryminatorze zastosowano normalizację instancji oraz aktywację LeakyReLU (nachylenie ujemne = 0,2) w celu poprawy dyskryminacji cech i uczenia przeciwstawnego (adversarial learning). Moduł CycleGAN przyjmuje jako wejście wstępnie przetworzone obrazy motywów kulturowych i generuje zrekonstruowane reprezentacje wzorów, które są następnie przekazywane do CAFFM w celu integracji z cechami segmentacji. Trening CycleGAN przeprowadzono przy użyciu optymalizatora Adam (β₁ = 0,5, β₂ = 0,999) z początkową szybkością uczenia 0,0002. Szybkość uczenia była utrzymywana przez pierwsze 100 epok, a następnie liniowo zmniejszana do zera w pozostałym czasie treningu. W celu stabilizacji treningu dyskryminatora zastosowano bufor powtórek (replay buffer) zawierający 50 wcześniej wygenerowanych obrazów. Generatory i dyskryminatory były aktualizowane w stosunku 1:1, gdzie jednej aktualizacji generatora towarzyszyła jedna aktualizacja dyskryminatora podczas każdej iteracji treningu.
Proces rekonstrukcji w sieci CycleGAN opiera się na ulepszonych mapach cech uzyskanych za pomocą mechanizmu CAFFM przedstawionego na Ryc. 5. Mapy cech zawierają ulepszone motywy kulturowe otrzymane w poprzednich etapach segmentacji i CAFFM. Mapy cech służą jako dane wejściowe dla pierwszego generatora GE. Pierwszy generator GE uczy się odwzorowania niezbędnego do rekonstrukcji wzorów kulturowych. Wyniki są następnie przekazywane do dyskryminatora DY, aby odróżnić rzeczywiste wzory kulturowe od wzorów zrekonstruowanych. Dyskryminator DY pomaga generatorowi GE generować realistyczne wyniki. Aby zapewnić, że wzory kulturowe nie zostaną zniekształcone podczas rekonstrukcji, drugi generator FM wykonuje odwzorowanie spójności cyklu (cycle-consistency mapping). Drugi generator FM odwzorowuje wyniki z powrotem do domeny oryginalnej. Wyniki są następnie oceniane przez dyskryminator w celu zapewnienia realizmu. Ostateczne wyniki są następnie przesyłane do modułu SPADE w celu generowania stylu artystycznego w kolejnym etapie proponowanego frameworka SegCycle-SPADE.

Rycina 5. Schemat rekonstrukcji wzorów oparty na CycleGAN. Schemat działania modułu rekonstrukcji CycleGAN. Reprezentacje cech wzmocnione mechanizmem uwagi są dostarczane jako dane wejściowe do sieci generatora w celu rekonstrukcji niepełnych motywów kulturowych. Dyskryminator ocenia zrekonstruowane wyniki w odniesieniu do wzorów referencyjnych, podczas gdy mapowanie spójności cyklu (cycle-consistency mapping) zachowuje integralność strukturalną podczas dwukierunkowej translacji obrazów. Zrekonstruowane motywy są następnie przekazywane do modułu SPADE w celu syntezy stylu artystycznego. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Generowanie stylu artystycznego przy użyciu SPADE
Następnie zrekonstruowane motywy kulturowe są poddawane działaniu modułu SPADE w celu wygenerowania stylu artystycznego. Głównym celem modułu SPADE jest dodanie bogatszych wizualnie tekstur stylu artystycznego do zrekonstruowanych motywów kulturowych, bez naruszania ich układu strukturalnego. Moduł SPADE to technika warunkowego generowania obrazów, która wykorzystuje koncepcję segmentacji obrazu do tworzenia grafik. Wielokanałowe mapy semantyczne odpowiadające uprzednio określonym klasom motywów zostały zakodowane z masek segmentacji semantycznej wygenerowanych przez SegFormer-B2. Generator SPADE otrzymał te zakodowane mapy jako wejścia warunkujące. Przestrzennie adaptacyjne parametry skalowania (γ) i przesunięcia (β) były generowane poprzez przetwarzanie map semantycznych w warstwach splotowych w obrębie każdej warstwy SPADE. Dzięki zastosowaniu tych parametrów do znormalizowanych aktywacji cech, generator był w stanie zachować granice motywów, układy strukturalne oraz informacje semantyczne podczas syntezy artystycznej. Naprowadzanie semantyczne mogło wpływać zarówno na wysokopoziomową rekonstrukcję strukturalną, jak i niskopoziomową syntezę tekstur, ponieważ proces warunkowania odbywał się na kilku warstwach generatora SPADE. W rezultacie utworzone wzory artystyczne zawierały cechy stylistyczne pozyskane z zestawu danych WikiArt, przy jednoczesnym zachowaniu struktur motywów kulturowych zidentyfikowanych na etapie segmentacji.
Zbiór danych WikiArt, obejmujący dzieła z 27 różnych kategorii artystycznych — takich jak renesans, impresjonizm, kubizm, ekspresjonizm, surrealizm, realizm i sztuka abstrakcyjna — został wykorzystany jako główny zasób do zrozumienia stylów artystycznych. Aby wystawić model na działanie różnorodnych cech twórczych i poprawić generalizację stylu, podczas trenowania z różnych kategorii losowo wybierano obrazy stylistyczne. Zbiór danych podzielono na podzbiory treningowe, walidacyjne i testowe z zrównoważoną reprezentacją kategorii artystycznych w celu zmniejszenia stronniczości stylistycznej. Aby zapewnić równomierną reprezentację wszystkich 27 kategorii artystycznych, zastosowano próbkowanie warstwowe. Próbki z każdej kategorii zostały proporcjonalnie przydzielone do podzbiorów treningowego, walidacyjnego i testowego, przy zachowaniu oryginalnego rozkładu klas. Moduł CAFFM został użyty do połączenia aspektów stylu pochodzących z obrazów WikiArt z cechami rekonstrukcji wygenerowanymi przez CycleGAN. Aby umożliwić sieci syntezy transfer cech artystycznych przy jednoczesnym zachowaniu struktury semantycznej i granic motywów kulturowych pochodzących z map segmentacji, wynikowe reprezentacje zlane zostały dostarczone jako informacje warunkujące do generatora SPADE. Dzięki tej technice warunkowania stylu zaproponowany schemat był w stanie generować kulturowo autentyczne wzory artystyczne o spójnych reprezentacjach strukturalnych i stylistycznych.
SPADE wprowadza również parametry adaptacyjne przestrzennie, które zależą od mapy segmentacji. Parametry te można zdefiniować zgodnie z Równaniem 191:

W tym przypadku γ(S) jest przestrzennie zmiennym parametrem skali, a β(S) jest przestrzennie zmiennym parametrem przesunięcia. Parametry te mogą pomóc generatorowi w tworzeniu różnych tekstur i stylów w zależności od regionu semantycznego na obrazach. Końcowe dzieło kultury można zdefiniować zgodnie z Równaniem 20:

Tutaj GE oznacza generator SPADE, XrP jest zrekonstruowanym wzorem, a SM to mapa segmentacji. Końcowe dzieło zachowuje integralność strukturalną motywów kulturowych, jednocześnie poprawiając walory artystyczne. W celu optymalizacji zaproponowanej architektury SegCycle-SPADE zastosowano złożoną funkcję straty, która równoważy dokładność segmentacji semantycznej, zachowanie motywów kulturowych, jakość rekonstrukcji wzoru oraz spójność stylu artystycznego. Całościowy cel uczenia określono jako ważoną mieszaninę straty segmentacji (Lseg), straty adwersarialnej (Ladv), straty spójności cyklicznej (Lcycle), straty rekonstrukcji (Lrecon), straty zachowania motywu (Lmotif) oraz straty spójności stylu (Lstyle). Całkowita funkcja straty została zdefiniowana w Równaniu 21:
(21)
Aby zagwarantować spójność strukturalną między motywami kulturowymi wejściowymi a zrekonstruowanymi, współczynnik straty spójności cyklu ustawiono na 10. W celu zachowania szczegółowych cech motywów i zwiększenia dokładności wizualnej, współczynnik straty rekonstrukcji ustawiono na 5. Aby podkreślić zachowanie kluczowych dla kultury wzorców strukturalnych podczas syntezy artystycznej, dla straty zachowania motywu zastosowano współczynnik 2. W celu promowania transferu stylu artystycznego bez nadmiernego zniekształcania semantycznych struktur motywu, współczynnik straty spójności stylu dostosowano do 1. Aby utrzymać zrównoważony wkład między generowaniem realistycznych obrazów a precyzyjną segmentacją motywów, nadano równe wagi stracie segmentacji i stracie adwersarialnej. Do obliczenia straty spójności stylu wykorzystano reprezentacje stylu oparte na cechach z zestawu danych WikiArt. W szczególności cechy stylu artystycznego uchwycono za pomocą korelacji macierzy Grama wyodrębnionych z głębokich map cech. Do obliczenia straty stylu wykorzystano różnicę normy Frobeniusa między macierzami Grama obrazu stylu docelowego a obrazem wygenerowanym, zgodnie z Równaniem 22:

Tutaj Gl to macierz Grama obliczona z ltej warstwy cech, Igen oznacza wygenerowany obraz artystyczny, Istyle oznacza docelowy obraz stylu z zestawu danych WikiArt, a F oznacza normę Frobeniusa. Taka formuła umożliwia zaproponowanemu frameworkowi zachowanie cech artystycznych przy jednoczesnym utrzymaniu integralności strukturalnej i semantycznej motywów kulturowych.
Połączone reprezentacje cech generowane przez moduł CAFFM są wykorzystywane jako wejścia warunkujące dla modułu SPADE, który pełni funkcję komponentu syntezy artystycznej w proponowanej strukturze. Generator SPADE składa się z siedmiu rezdualnych bloków SPADE o wymiarze cech ukrytych wynoszącym 256 kanałów i generuje obrazy wyjściowe w rozdzielczości 256 × 256 pikseli. Mapy segmentacji semantycznej uzyskane z modułu SegFormer–CAFFM służą jako wejścia warunkujące w poszczególnych rezdualnych warstwach SPADE. Warstwy SPADE są stosowane przed funkcjami aktywacji w każdym bloku rezdualnym, co umożliwia semantyczne warunkowanie sterowane segmentacją. Poprzez kolejne operacje nadpróbkowania i splotu, reprezentacja cech ukrytych jest stopniowo dopracowywana w celu wygenerowania artystycznych wzorów o wysokiej rozdzielczości, przy jednoczesnym zachowaniu spójności semantycznej i struktury motywu. W całym generatorze stosowane są funkcje aktywacji LeakyReLU, natomiast w warstwie wyjściowej zastosowano funkcję aktywacji Tanh w celu uzyskania znormalizowanych obrazów.
Algorytm i przebieg prac
Struktura SegCycle-SPADE integruje segmentację semantyczną, fuzję cech, rekonstrukcję wzorów oraz syntezę stylu artystycznego w ramach jednolitym potoku treningowego. Przebieg prac rozpoczyna się od pozyskania i przetwarzania wstępnego zbioru danych, obejmującego zmianę rozmiaru obrazów, normalizację, odszumianie oraz przygotowanie masek segmentacji. Obrazy po przetwarzaniu wstępnym są następnie przetwarzane przy użyciu sieci segmentacyjnej SegFormer-B2 w celu wyodrębnienia reprezentacji semantycznych motywów. Uzyskane cechy segmentacji są łączone z cechami rekonstrukcji za pomocą modułu CAFFM, co umożliwia interakcję między informacjami o motywach strukturalnych a reprezentacjami cech artystycznych. Zfuzowane mapy cech są następnie przekazywane do modułu rekonstrukcji CycleGAN, który odtwarza niekompletne struktury motywów kulturowych, zachowując spójność semantyczną. Zrekonstruowane wzory są następnie dostarczane do generatora SPADE w celu sterowanej segmentacją syntezy artystycznej, co pozwala na wzmocnienie stylistyczne przy jednoczesnym zachowaniu granic motywów i autentyczności strukturalnej. Podczas treningu parametry modelu są optymalizowane za pomocą złożonej funkcji straty opisanej w Równaniach 21 i 22, która równoważy dokładność segmentacji, zachowanie motywów, jakość rekonstrukcji oraz spójność stylu artystycznego. Szczegółowy, krok po kroku opis przebiegu implementacji, obejmujący ładowanie zbioru danych, przetwarzanie wstępne, inicjalizację modelu, iteracje treningowe, procedury walidacji, wybór punktów kontrolnych oraz końcową ewaluację, znajduje się w Pliku uzupełniającym 1 (Algorytm 1). Kompletny przebieg algorytmiczny zaimplementowano przy użyciu wielkości partii (batch size) wynoszącej 16, współczynnika uczenia (learning rate) 0.0002 oraz 100 epok treningowych. Do podziału zbioru danych, inicjalizacji modelu i wszystkich eksperymentów treningowych zastosowano stałe ziarno losowości (random seed) o wartości 42. Ziarno to było stosowane spójnie w generatorach liczb losowych Python, NumPy i PyTorch w celu zapewnienia powtarzalności. Optymalizator Adam skonfigurowano z parametrami β₁ = 0.5, β₂ = 0.999 i bez zaniku wag (weight decay = 0). Punkty kontrolne modelu wybrano na podstawie najwyższego wyniku IoU na zbiorze walidacyjnym.
Optymalizacja funkcji straty
Aby zachować struktury motywów kulturowych podczas rekonstrukcji i syntezy artystycznej, proponowany model wykorzystuje złożony cel optymalizacji, który łączy straty segmentacji, adversarialne, spójności cyklu, rekonstrukcji, zachowania motywu oraz spójności stylu. Pełny opis matematyczny, współczynniki wagowe oraz definicja straty stylu zostały przedstawione w Równaniach 21 i 22 w podrozdziale Artistic Style Generation using SPADE. Komponent zachowania motywu penalizuje odchylenia strukturalne między przewidywanymi obszarami motywów a odpowiadającymi im maskami segmentacji prawdy podstawowej (ground-truth), co sprzyja zachowaniu kulturowo istotnych struktur wzorów w całym procesie rekonstrukcji.