Zaproponowany model SegCycle-SPADE został opracowany w celu rekonstrukcji i ulepszenia tradycyjnych wzorów dziedzictwa kulturowego poprzez segmentację semantyczną, wzmacnianie cech z wykorzystaniem mechanizmu uwagi, rekonstrukcję generatywną oraz syntezę stylu artystycznego. W badaniu wykorzystano publicznie dostępne zbiory obrazów dziedzictwa kulturowego i artystycznego, w tym zbiór danych Miao Batik oraz zbiór danych WikiArt. W badaniach nie uczestniczyli ludzie, nie wykorzystano danych pacjentów, informacji osobowych, zwierząt ani dokumentacji klinicznej; w związku z tym nie wymagano zgody instytucjonalnej komisji etyki ani świadomej zgody. Na początek do ewaluacji wykorzystano zbiór motywów kulturowych Miao Batik oraz zbiór WikiArt. Zbiór danych Miao Batik został opisany w pracy Quan et al. (2024)32 i zawiera 15 148 adnotowanych obrazów tradycyjnych motywów batikowych ludu Miao. Istniejące adnotacje dostarczone przez twórców zbioru zostały wykorzystane bezpośrednio i w niniejszym badaniu nie generowano dodatkowych adnotacji manualnych. Następnie przeprowadzono wstępne przetwarzanie obrazów poprzez zmianę rozmiaru, normalizację, odszumianie oraz tworzenie maski segmentacji. Dokładne parametry wstępnego przetwarzania opisano w podrozdziale Data Preprocessing. Zaproponowany model wykorzystuje model oparty na transformerze o nazwie SegFormer-B2 do segmentacji semantycznej danych. Metoda ta została zaprojektowana w celu wykrywania kluczowych obszarów motywów kulturowych i uczenia się ich struktur. Segmentowane cechy są następnie wzmacniane za pomocą mechanizmu uwagi, w którym podkreślane są istotne informacje związane z motywami kulturowymi, a informacje nieistotne są odrzucane. Konfigurację mechanizmu uwagi opisano w podrozdziale CAFFM. Wzmocnione cechy są następnie przekazywane do CycleGAN, gdzie uszkodzone struktury są rekonstruowane poprzez uczenie cykliczne. Podczas uczenia sztucznie tworzono niekompletne próbki motywów, stosując operacje losowego maskowania i częściowego przesłaniania do oryginalnych obrazów Miao Batik. Procedury degradacji te symulowały brakujące regiony motywów i uszkodzenia strukturalne powszechnie obserwowane w zdegradowanych artefaktach dziedzictwa kulturowego. Powstałe niekompletne obrazy posłużyły jako wejścia do modułu rekonstrukcji CycleGAN, natomiast odpowiadające im obrazy oryginalne stanowiły cele rekonstrukcji. Zrekonstruowane wzory dziedzictwa kulturowego są następnie ulepszane za pomocą SPADE, gdzie wzmocnienie artystyczne jest realizowane na podstawie wygenerowanych map segmentacji. Wydajność zaproponowanego modelu oceniano przy użyciu ilościowych metryk segmentacji i jakości obrazu, natomiast autentyczność wizualną zrekonstruowanych motywów kulturowych oceniano jakościowo. Autentyczność wizualną oceniano poprzez inspekcję wizualną wygenerowanych wzorów kulturowych i nie była ona używana jako niezależna metryka ilościowa. Ocena koncentrowała się na zachowaniu motywu, spójności semantycznej, cechach kulturowych, koherencji strukturalnej i wyglądzie artystycznym w odniesieniu do odpowiadających im referencyjnych motywów kulturowych. Ilościowa ocena wydajności modelu została przeprowadzona z wykorzystaniem Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) oraz Fréchet Inception Distance (FID). Rysunek 2 ilustruje ogólny przebieg pracy zaproponowanego modelu SegCycle-SPADE i podsumowuje metryki ewaluacyjne użyte w niniejszym badaniu.

Rysunek 2. Ogólny schemat architektury proponowanego frameworka SegCycle-SPADE. Przegląd kompletnego przepływu pracy SegCycle-SPADE. Obrazy z zbiorów danych Miao Batik i WikiArt podlegają wstępnemu przetwarzaniu, a następnie są przetwarzane poprzez segmentację semantyczną z wykorzystaniem SegFormer-B2, wzmocnienie cech za pomocą CAFFM, rekonstrukcję wzorów za pomocą CycleGAN oraz generowanie stylu artystycznego z użyciem SPADE. Wydajność modelu jest oceniana za pomocą wskaźników takich jak Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR, Fréchet Inception Distance (FID), natomiast autentyczność wizualna jest oceniana jakościowo. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Struktura SegCycle-SPADE do rekonstrukcji wzorów dziedzictwa kulturowego została zaprojektowana w celu integracji wielu komponentów DL dla dokładnej segmentacji motywów, ich rekonstrukcji oraz artystycznego ulepszenia, co zilustrowano na Rysunku 2. Obrazy z zestawu danych motywów kulturowych Miao Batik oraz zestawu danych WikiArt są wykorzystywane w celu zapewnienia różnorodnych wzorów kulturowych i stylów artystycznych. Początkowo obrazy są przetwarzane przy użyciu modułu segmentacji semantycznej opartego na SegFormer w celu identyfikacji i wyodrębnienia motywów kulturowych z tła. Ogólna architektura składa się z czterech głównych etapów. Po pierwsze, model SegFormer wyodrębnia mapy segmentacji semantycznej z obrazów wzorów kulturowych. Po drugie, CAFFM integruje cechy segmentacji z reprezentacjami generatywnymi, aby usprawnić uczenie cech. Po trzecie, moduł CycleGAN rekonstruuje wzory kulturowe przy użyciu scalonych reprezentacji cech. Na koniec moduł SPADE generuje ulepszone stylistycznie wyniki, zachowując spójność strukturalną poprzez syntezę kierowaną segmentacją. Udoskonalone mapy cech są następnie przetwarzane przez moduł rekonstrukcji CycleGAN, który uczy się przywracać niekompletne motywy kulturowe poprzez mapowanie zdegradowanych wzorów na ich odpowiadające im pełne formy. Próbki niekompletnych motywów zostały wygenerowane poprzez zastosowanie operacji losowego maskowania i częściowego przesłonięcia do oryginalnych obrazów Miao Batik, symulując tym samym brakujące obszary wzoru i degradację strukturalną powszechnie obserwowaną w uszkodzonych artefaktach kulturowych. Każdy zdegradowany obraz został sparowany z odpowiadającym mu obrazem oryginalnym, który służył jako cel rekonstrukcji podczas uczenia. Strategia ta umożliwiła modułowi CycleGAN naukę przywracania brakujących struktur motywów przy jednoczesnym zachowaniu spójności semantycznej i istotnych cech kulturowych. Ostatecznie generator SPADE tworzy wizualnie ulepszone wyniki artystyczne poprzez warunkowanie syntezy obrazu na wygenerowanych mapach segmentacji, utrzymując tym samym integralność strukturalną motywów kulturowych w całym procesie ulepszania artystycznego.
Proponowana struktura SegCycle-SPADE obejmuje następujące etapy.
Krok 1: Gromadzenie zbiorów danych
W celu realizacji celów związanych z nauką wzorców kulturowych i generowaniem stylu artystycznego wykorzystano dwa zbiory danych. Zbiór danych motywów kulturowych Miao Batik posłużył do dostarczenia informacji o tradycyjnych wzorach kulturowych. Zbiór ten jest publicznie dostępny poprzez Zenodo (https://doi.org/10.5281/zenodo.20807658) i zawiera 15 148 opisanych obrazów tradycyjnych motywów batikowych ludu Miao. Wykorzystano bezpośrednio istniejące adnotacje dostarczone przez twórców zbioru; w niniejszym badaniu nie tworzono dodatkowych adnotacji ręcznych. Zbiór danych WikiArt został wykorzystany w celu dostarczenia zróżnicowanych informacji o stylach artystycznych do generowania stylu artystycznego i został pobrany z publicznie dostępnego repozytorium WikiArt (https://www.wikiart.org/).
Krok 2: Przetwarzanie wstępne danych
Wszystkie obrazy zostały poddane przetwarzaniu wstępnemu poprzez zmianę rozmiaru, normalizację i redukcję szumu. Do wsparcia etapu segmentacji semantycznej wykorzystano istniejące adnotacje motywów kulturowych pochodzące z oryginalnych źródeł zbioru danych. W ramach niniejszego badania nie przeprowadzono żadnych dodatkowych procedur adnotacji ani ponownego etykietowania.
Krok 3: Segmentacja wzorców semantycznych przy użyciu SegFormer
Do segmentacji motywów kulturowych wykorzystano model SegFormer. Dokładny opis szkieletu (backbone) i strategii inicjalizacji modelu SegFormer znajduje się w podrozdziale Semantic Pattern Segmentation Using SegFormer. W szczególności do semantycznej segmentacji motywów zastosowano architekturę SegFormer-B2 ze szkieletem MIT-B2 wstępnie wytrenowanym na zbiorze ImageNet. Model ten skutecznie przechwytuje globalne informacje kontekstowe, zachowując jednocześnie złożone szczegóły strukturalne tradycyjnych wzorców kulturowych.
Krok 4: CAFFM
Moduł CAFFM łączy cechy segmentacji semantycznej z reprezentacjami generatywnymi, co pozwala frameworkowi na naukę zarówno charakterystyki motywów strukturalnych, jak i informacji o stylu artystycznym. Szczegóły dotyczące integracji CAFFM zostały przedstawione w podrozdziale CAFFM. Moduł ten znajduje się pomiędzy etapem segmentacji semantycznej opartej na SegFormer a etapem rekonstrukcji generatywnej, gdzie łączy cechy strukturalne pochodzące z segmentacji z cechami rekonstrukcji za pomocą wielogłowicowej uwagi krzyżowej (multi-head cross-attention). Proces ten poprawia zachowanie motywów kulturowych i zwiększa realizm zrekonstruowanych wyników.
Krok 5: Rekonstrukcja wzorca (CycleGAN)
Połączone cechy są następnie przetwarzane przez moduł CycleGAN w celu rekonstrukcji struktur wzorców kulturowych. Architektura i konfiguracja szkolenia CycleGAN zostały opisane w podrozdziale Rekonstrukcja wzorców przy użyciu CycleGAN. Moduł rekonstrukcyjny składa się z dwóch generatorów i dwóch dyskryminatorów, wykorzystuje architekturę generatora opartą na sieciach rezdualnych z dziewięcioma blokami rezdualnymi, stosuje dyskryminator PatchGAN i jest szkolony przy użyciu funkcji strat przeciwnych oraz spójności cyklicznej. Taka konfiguracja umożliwia dwukierunkowe mapowanie domen i ułatwia rekonstrukcję niepełnych struktur wzorców kulturowych.
Krok 6: Generowanie stylu artystycznego (SPADE)
Zrekonstruowane wzory są następnie przetwarzane przez moduł SPADE w celu przeprowadzenia syntezy stylu artystycznego sterowanej segmentacją. Konfiguracja generatora SPADE została opisana w podrozdziale Artistic Style Generation Using SPADE. Moduł wykorzystuje bloki rezydualne SPADE, warstwy normalizacji adaptacyjnej przestrzennie oraz warunkowanie semantyczne pochodzące z map segmentacji SegFormer i reprezentacji cech CAFFM. Dzięki warunkowaniu generowania obrazów na podstawie map segmentacji, syntetyczne wyniki zachowują zgodność strukturalną z oryginalnymi motywami kulturowymi, jednocześnie włączając cechy stylu artystycznego.
Krok 7: Szacowanie wydajności
Zaproponowany schemat został oceniony przy użyciu wielu metryk segmentacji i oceny jakości obrazu, w tym dokładności segmentacji, IoU, współczynnika podobieństwa Dice (Dice), SSIM, PSNR oraz FID. Aby ocenić spójność eksperymentalną, wszystkie doświadczenia powtórzono pięciokrotnie, stosując różne ziarna losowe, a wyniki przedstawiono jako średnia ± odchylenie standardowe. Istotność statystyczną oceniono za pomocą sparowanych testów t z progiem istotności p < 0,05.
Kolekcja zbiorów danych
W proponowanej strukturze SegCycle-SPADE wykorzystano dwa zbiory danych w celu zrozumienia wzorców kulturowych i uczenia stylów. Pierwszym zbiorem danych zastosowanym w proponowanej strukturze jest zbiór motywów kulturowych batików ludu Miao. Zbiór ten zawiera motywy kulturowe batików Miao, które zazwyczaj stanowią obrazy tradycyjnych batików Miao z motywami takimi jak zwierzęta, rośliny i kształty geometryczne, wykorzystywane w sztuce grupy etnicznej Miao. Zbiór ten zawiera obrazy z bogatymi informacjami o teksturze, co ma zazwyczaj kluczowe znaczenie dla zachowania dziedzictwa kulturowego. Drugim zbiorem danych wykorzystanym w proponowanej strukturze SegCycle-SPADE jest zbiór danych WikiArt. Zbiór ten zawiera ogromną liczbę dzieł sztuki, pochodzących zazwyczaj z różnych nurtów stylistycznych. Jest on wykorzystywany do złożonego uczenia stylów, co zazwyczaj służy ulepszaniu dzieł sztuki. Zbiór ten posiada 80 000 dzieł w wysokiej rozdzielczości (HD) z 27 różnymi wzorami, co czyni go bardziej użytecznym w zadaniach generowania lub transformacji stylów opartych na głębokim uczeniu (DL).
Zbiór danych Miao Batik:
Zbiór danych Miao Batik (https://doi.org/10.5281/zenodo.20807658) obejmuje 15 148 obrazów wzorów batikowych przedstawiających motywy o znaczeniu kulturowym. Obrazy zawierają różnorodne tradycyjne wzory, takie jak motywy zwierzęce (np. motyle i ryby), wzory roślinne oraz motywy geometryczne niosące symbolikę kulturową. Zbiór ten stanowi istotny element proponowanej architektury, ponieważ dostarcza autentycznych struktur kulturowych, które umożliwiają modułowi segmentacji dokładną identyfikację i zachowanie granic motywów podczas rekonstrukcji wzorca (Tabela 1). W niniejszym badaniu motywy o znaczeniu kulturowym odnoszą się do symbolicznych elementów wizualnych powszechnie dokumentowanych w literaturze dotyczącej dziedzictwa kulturowego ludu Miao i reprezentowanych w adnotacjach zbioru danych, w tym ptaków, motyli, wzorów kwiatowych oraz totemów przodków. Motywy te wybrano na podstawie ich udokumentowanego znaczenia kulturowego i powtarzającego się występowania w tradycyjnych projektach batików i haftów Miao, a nie wyłącznie na podstawie częstotliwości ich występowania lub kompozycji przestrzennej. Eksperckie adnotacje motywów oraz etykiety segmentacji pobrano z oryginalnego źródła zbioru danych Miao Batik i wykorzystano bezpośrednio w niniejszym badaniu. Autorzy nie przeprowadzali żadnych dodatkowych procedur ręcznego adnotowania, ponownego etykietowania ani adnotacji pod kierunkiem eksperta. Istniejące adnotacje dostarczone przez twórców zbioru danych wykorzystano do trenowania i ewaluacji segmentacji semantycznej.
| Parametr | Opis |
| Nazwa zbioru danych | Zbiór danych wzorów kulturowych batik ludu Miao |
| Źródło zbioru danych | Repozytorium Zenodo (DOI: 10.5281/zenodo.20807658) |
| Dziedzina | Niematerialne Dziedzictwo Kulturowe (NDK) / Analiza wzorów tekstylnych |
| Całkowita liczba obrazów | 15 148 obrazów |
| Typ obrazu | Cyfrowe obrazy tradycyjnych wzorów tkanin batikowych ludu Miao |
| Kategorie wzorców | Motywy zwierzęce, motywy roślinne i motywy geometryczne |
| Pochodzenie kulturowe | kultura etniczna Miao, prowincja Guizhou, Chiny |
| Oryginalna rozdzielczość obrazu | Obrazy o wysokiej rozdzielczości (zazwyczaj ≥ 1000 pikseli na krótszym boku) zarejestrowane jako skany surowe lub fotografie przed wstępnym przetwarzaniem |
| Rozdzielczość szkolenia | Obrazy przeskalowane do rozmiaru 256 × 256 pikseli podczas wstępnego przetwarzania |
| Dostępność adnotacji | W celu trenowania i ewaluacji wykorzystano bez zmian istniejące adnotacje segmentacyjne dostarczone przez twórców zbioru danych. W niniejszym badaniu nie przeprowadzono dodatkowej adnotacji manualnej, zmiany etykiet ani procedur potwierdzania przez ekspertów. |
| Zastosowanie w niniejszym badaniu | Segmentacja motywów kulturowych, ekstrakcja cech, zachowanie motywów i rekonstrukcja wzorców |
Tabela 1: Charakterystyka zbioru danych wzorów kulturowych batiku ludu Miao.Podsumowanie zbioru danych motywów kulturowych batiku ludu Miao wykorzystanego do segmentacji semantycznej, analizy wzorów kulturowych i rekonstrukcji motywów. Tabela opisuje źródło zbioru danych, charakterystykę obrazów, kategorie motywów, pochodzenie kulturowe, rozdzielczość obrazów oraz rolę zbioru w ramach proponowanego modelu SegCycle-SPADE.
Zbiór danych WikiArt:
Zbiór danych WikiArt [https://www.wikiart.org/] to popularne, wielkoskalowe cyfrowe repozytorium sztuki, które obejmuje ponad 80 000 obrazów reprezentujących 27 różnych stylów artystycznych, wymienionych w Tabeli 2. Style te obejmują m.in. renesans, impresjonizm, kubizm i surrealizm. Zbiór ten jest kluczowy w proponowanym modelu, ponieważ dostarcza wiedzy umożliwiającej modułowi SPADE tworzenie wzorów wzbogaconych kulturowo, przy jednoczesnym zachowaniu informacji strukturalnych uzyskanych w procesie segmentacji. Zbiór danych składa się z 56 000 obrazów do uczenia oraz 12 000 obrazów do walidacji i testowania. Obrazy zawarte w zbiorze pomagają w efektywnym trenowaniu modelu DL.
| Parametr | Opis |
| Nazwa zbioru danych | Zbiór danych WikiArt |
| Źródło zbioru danych | Repozytorium WikiArt (https://www.wikiart.org/) |
| Domena | Sztuka cyfrowa i malarstwo |
| Suma obrazów | Około 80 000 dzieł sztuki |
| Obrazy treningowe | 56,000 |
| Obrazy walidacyjne | 12,000 |
| Obrazy testowe | 12,000 |
| Style artystyczne | 27 stylów artystycznych, w tym renesansu, impresjonizmu, kubizmu, surrealizmu, ekspresjonizmu, realizmu i sztuki abstrakcyjnej |
| Oryginalna rozdzielczość obrazu | Oryginalne rozdzielczości obrazów różniły się w zależności od dzieł i źródeł. Podczas wstępnego przetwarzania obrazy zostały przeskalowane do jednolitej rozdzielczości 256 × 256 pikseli. |
| Rozdzielczość szkolenia | Obrazy zostały przeskalowane do rozmiaru 256 × 256 pikseli podczas przetwarzania wstępnego przed uczeniem stylu artystycznego oraz syntezą obrazu sterowaną segmentacją. |
| Partycjonowanie zbioru danych | Stratyfikowany podział losowy (70% zbiór treningowy, 15% zbiór walidacyjny i 15% zbiór testowy) przy użyciu stałego ziarna losowości 42 |
| Strategia próbkowania stylu | Zastosowano warstwowy dobór proporcjonalny, aby zachować rozkład 27 stylów artystycznych w podzbiorach treningowym, walidacyjnym i testowym. |
| Zastosowanie w niniejszym badaniu | Uczenie stylu artystycznego, reprezentacja stylu i synteza artystyczna sterowana segmentacją |
Tabela 2: Charakterystyka zbioru danych WikiArt. Podsumowanie zbioru danych WikiArt wykorzystanego do nauki stylu artystycznego i syntezy obrazów sterowanej stylem. Tabela opisuje źródło zbioru danych, rozkład obrazów, zakres stylów artystycznych, podział zbioru danych, rozdzielczość obrazów oraz jego zastosowanie w proponowanej strukturze SegCycle-SPADE.
Zbiór danych Miao Batik zawiera 15 148 obrazów przedstawiających tradycyjne motywy kulturowe ludu Miao.32 Zbiór danych jest publicznie dostępny za pośrednictwem Zenodo (https://doi.org/10.5281/zenodo.20807658). Przed trenowaniem modelu wszystkie obrazy zostały poddane inspekcji wizualnej, zmieniono ich rozmiar do 256 × 256 pikseli, znormalizowano oraz sprawdzono pod kątem uszkodzonych lub powielonych próbek. Przesiewowa kontrola jakości nie doprowadziła do wykluczenia żadnego z obrazów; w związku z tym wszystkie 15 148 obrazów zachowano do dalszych analiz. Zbiór danych został losowo podzielony na podzbiory treningowy (70%), walidacyjny (15%) i testowy (15%) przy użyciu stałego ziarna losowości (seed) wynoszącego 42, aby zapewnić powtarzalność podziału zbioru danych. Dostęp do zbioru danych WikiArt uzyskano poprzez oficjalne repozytorium WikiArt (https://www.wikiart.org/), które zawiera ponad 80 000 dzieł sztuki obejmujących 27 stylów artystycznych. W eksperymentach dotyczących uczenia stylu wykorzystano 56 000 obrazów do trenowania, 12 000 do walidacji i 12 000 do testowania.
Przetwarzanie wstępne danych
Przed trenowaniem proponowanego frameworka SegCycle-SPADE, zbiór motywów kulturowych Miao Batik oraz zbiór WikiArt poddano kilku etapom przetwarzania wstępnego w celu zapewnienia spójnej jakości obrazów i dokładnej reprezentacji cech. Do obu zbiorów zastosowano ten sam podstawowy proces przetwarzania wstępnego, obejmujący odszumianie gaussowskie, normalizację, zmianę rozmiaru do spójnej rozdzielczości wejściowej oraz weryfikację jakości obrazu. Zbiory danych pełniły jednak odmienne role w ramach frameworka. Zbiór WikiArt został wykorzystany do nauki i syntezy stylu artystycznego, natomiast zbiór Miao Batik służył głównie do segmentacji i rekonstrukcji motywów kulturowych. Poza tymi specyficznymi rolami nie wprowadzono żadnych zmian w przetwarzaniu wstępnym dla poszczególnych zbiorów. Aby zapewnić spójne przetwarzanie przez model DL, obrazy najpierw zmieniono do stałej rozdzielczości. Krok ten był niezbędny, ponieważ obrazy w obu zbiorach różniły się rozdzielczością w zależności od źródła. Zmiana rozmiaru poprawiła wydajność obliczeniową i zapobiegła wpływowi niespójności wymiarowych na proces trenowania. Drugim etapem przetwarzania wstępnego była normalizacja, w której wartości pikseli przeskalowano do ustandaryzowanego zakresu, aby ustabilizować aktualizacje gradientów podczas trenowania. Następnie obrazy przetworzono za pomocą filtrowania gaussowskiego w celu redukcji szumów, które mogłyby zakłócać struktury motywów kulturowych. W przypadku zbioru Miao Batik do trenowania i ewaluacji segmentacji semantycznej wykorzystano bez modyfikacji istniejące maski segmentacji motywów kulturowych, pozyskane bezpośrednio z oryginalnego źródła zbioru danych. Na potrzeby niniejszego badania nie generowano nowych masek segmentacji.
O ile nie wskazano inaczej, równania opisujące uznane metody zostały zaadaptowane z wcześniejszych badań i są odpowiednio cytowane. Równania opisujące proponowaną metodę CAFFM oraz kompozytowy system optymalizacji SegCycle-SPADE zostały opracowane przez autorów na potrzeby niniejszego badania.
Niech obraz wejściowy z zestawu danych będzie reprezentowany przez Równanie 1:
(1)
Tutaj H, W i C oznaczają odpowiednio wysokość obrazu, szerokość oraz liczbę kanałów kolorów. Wszystkie obrazy są zmieniane na stały wymiar H′ × W′, zgodnie z Równaniem 2:

W tym przypadku Ir oznacza obraz po zmianie rozmiaru. Znormalizowane wartości pikseli oblicza się zgodnie z Równaniem 3:
(3)
Pomaga to ustabilizować procedurę uczenia. Filtrowanie szumów jest wykonywane przy użyciu filtru Gaussa, zgodnie z Równaniem 4:

Tutaj G(σ) oznacza filtr Gaussa, a * symbolizuje splot. Zastosowano filtr Gaussa o jądrze 5 × 5 i odchyleniu standardowym σ = 1.0. W celu zredukowania artefaktów krawędziowych zastosowano dopełnienie lustrzane (reflective padding) dla pikseli brzegowych. Proces odszumiania przeprowadzono bezpośrednio po załadowaniu obrazu, przed skalowaniem i normalizacją. Aby zapewnić jednolity preprocessing w całym badaniu, tę samą konfigurację filtra zastosowano do każdego obrazu w zbiorach danych Miao Batik oraz WikiArt. Dla zbioru danych Miao Batik maski segmentacji są tworzone zgodnie z Równaniem 5:

Tutaj M jest maską segmentacji używaną do naprowadzania modelu SegFormer.
Potok przetwarzania wstępnego rozpoczyna się od pozyskania obrazów z zestawu danych Miao Batik oraz zestawu danych WikiArt, co przedstawiono na Rysunku 3. Podczas trenowania nie zastosowano technik augmentacji danych. Po przetwarzaniu wstępnym, które obejmowało zmianę rozmiaru, normalizację, odszumianie gaussowskie oraz przygotowanie masek segmentacyjnych, obrazy zostały bezpośrednio wykorzystane do trenowania, walidacji i testowania proponowanego frameworka SegCycle-SPADE. Pierwszy krok potoku przetwarzania wstępnego polega na zmianie rozmiaru obrazów do stałej wielkości, co pozwala modelowi DL na bardziej efektywne przetwarzanie danych. Drugi krok obejmuje normalizację, która konwertuje wartości pikseli do zestandaryzowanego zakresu numerycznego i ułatwia zbieżność modelu. Trzeci krok polega na usuwaniu szumu, w wyniku czego obrazy są oczyszczane z niepożądanych zakłóceń w celu poprawy rozpoznawania wzorców. Dodatkowo, w przypadku zestawu danych Miao Batik, adnotowane są obszary motywów kulturowych, co umożliwia generowanie masek wykorzystywanych w module segmentacji proponowanego modelu, zapewniając zachowanie motywów kulturowych podczas generowania. Końcowym wynikiem tego etapu jest czysty zestaw danych, gotowy do trenowania modułów segmentacji i generowania proponowanego modelu.

Rycina 3Potok wstępnego przetwarzania danych dla obrazów dziedzictwa kulturowego. Schemat przedstawiający procedury wstępnego przetwarzania obrazów zastosowane przed trenowaniem modelu. Potok obejmuje pozyskiwanie zbioru danych, zmianę rozmiaru obrazów, normalizację, odszumianie gaussowskie, istniejące adnotacje motywów kulturowych oraz przygotowanie masek segmentacyjnych. Powstałe przetworzone obrazy i maski służą jako dane wejściowe do segmentacji semantycznej i rekonstrukcji wzorców. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Każdy obraz został poddany procesowi kontroli jakości przed trenowaniem modelu. Zbiór danych Miao Batik zawierał 15 148 obrazów. Uszkodzone, powielone i niskiej jakości próbki zostały już usunięte przez pierwotnych twórców zbioru danych; w związku z tym podczas kontroli jakości w niniejszym badaniu nie wykluczono żadnych dodatkowych obrazów. CoConsequently, wszystkie 15 148 obrazy zostały zachowane do analizy. Podczas wstępnego przetwarzania obrazy ładowano w formacie RGB i zmieniano ich rozmiar do 256 × 256 pikseli przy użyciu interpolacji bilinearnej. Wartości pikseli przeskalowano z zakresu [0, 255] do [0, 1] poprzez podzielenie przez 255. Następnie zastosowano normalizację kanałową, używając wartości średnich [0.485, 0.456, 0.406] oraz wartości odchylenia standardowego [0.229, 0.224, 0.225] odpowiednio dla kanałów czerwonego, zielonego i niebieskiego. Potok wstępnego przetwarzania obejmował ładowanie obrazów, konwersję do RGB, zmianę rozmiaru, skalowanie wartości pikseli, normalizację oraz konwersję do tensorów. W razie potrzeby obrazy w skali szarości konwertowano do trójkanałowego formatu RGB, aby zachować kompatybilność z modelami DL. Po wstępnym przetwarzaniu obrazy podzielono na podzbiory treningowy, walidacyjny i testowy. Wszystkie etapy architektury SegCycle-SPADE — w tym segmentacja semantyczna, fuzja cech, rekonstrukcja motywów oraz synteza artystyczna oparta na SPADE — wykorzystywały spójną rozdzielczość wejściową 256 × 256 pikseli.
Segmentacja wzorców semantycznych przy użyciu SegFormer
Po tym etapie wstępnego przetwarzania, oczyszczone i znormalizowane obrazy z zestawu danych motywów kulturowych Miao Batik oraz zestawu danych WikiArt są przesyłane do modułu segmentacji semantycznej opartego na proponowanej strukturze SegFormer-B2. Celem tego kroku jest prawidłowa identyfikacja i oddzielenie motywów kulturowych obecnych w tradycyjnych wzorach. Proponowana struktura SegFormer opiera się na architekturze transformera, która zawiera hierarchiczny enkoder Transformer oraz lekki dekoder MLP, aby precyzyjnie przechwytywać zarówno globalne informacje kontekstowe, jak i szczegółowe informacje strukturalne ze złożonych wzorów dziedzictwa. Model najpierw ekstrahuje reprezentacje cech w wielu skalach z obrazu wejściowego, a następnie dokonuje fuzji tych reprezentacji za pomocą dekodera w celu wygenerowania dokładnych segmentowanych wzorów. Zapewnia to, że wzory na obrazach dziedzictwa są prawidłowo segmentowane na motywy takie jak wzory geometryczne, roślinne i symboliczne, oddzielając je tym samym od tła przy zachowaniu ich spójności strukturalnej. Informacje strukturalne te są następnie wykorzystywane na późniejszych etapach generowania wzorów w ramach struktury SegCycle-SPADE.
Przyjmijmy, że wstępnie przetworzony obraz wejściowy jest reprezentowany przez Równanie 6:
(6)
Koder SegFormer dzieli obraz na fragmenty (patche) i ekstrahuje cechy hierarchiczne przy użyciu warstw transformera, co przedstawiono w równaniu 71:

W tym przypadku F oznacza wieloskalowe mapy cech uzyskane z koderów transformera. Cechy te kodują zarówno lokalne wzorce tekstury, jak i globalne zależności kontekstowe między regionami motywów. Model SegFormer wyodrębnia mapy cech w różnych skalach, zgodnie z definicją w Równaniu 8:

Zastosowanie reprezentacji wieloskalowych ułatwia wykrywanie wzorców o różnych rozmiarach w obrębie motywów kulturowych. Ostatecznie cechy są łączone przy użyciu dekodera MLP, zgodnie z Równaniem 91:

Tutaj S oznacza końcową przewidzianą mapę segmentacji.
Szkielet SegFormer-B2 został zainicjowany z wykorzystaniem wag wstępnie wytrenowanych na zbiorze ImageNet, a następnie dostrojony (fine-tuned) na zbiorze danych Miao Batik w celu segmentacji motywów kulturowych. Punkt kontrolny (checkpoint) modelu wstępnie wytrenowanego pobrano z oficjalnej implementacji SegFormer. Konkretnie, do inicjalizacji szkieletu SegFormer-B2 przed dostrojeniem wykorzystano punkt kontrolny MIT-B2 wstępnie wytrenowany na ImageNet-1K (mit_b2.pth), udostępniony w oficjalnym repozytorium SegFormer. Wagi wstępnie wytrenowane odpowiadają szkieletowi MIT-B2 opublikowanemu przez autorów SegFormer i posłużyły jako model inicjalny do treningu segmentacji semantycznej. Pozostałe warstwy specyficzne dla zadania zostały zainicjowane przy użyciu domyślnych procedur inicjalizacji wag PyTorch przed rozpoczęciem treningu.
W architekturze zastosowano czterostopniowy hierarchiczny koder Transformer z nakładającymi się osadzeniami łatek (patch embeddings). Na etapie początkowym rozmiar łatki ustawiono na 7 × 7 z krokiem 4. Dla każdego z czterech etapów kodera wymiary osadzeń wynosiły odpowiednio 64, 128, 320 i 512. W czterech etapach zastosowano kolejno 1, 2, 5 i 8 wielogłowicowych mechanizmów self-attention, a odpowiadające im głębokości kodera wynosiły 3, 4, 6 i 3 warstwy. Cechy wieloskalowe pobrane z kodera zostały zagregowane przy użyciu lekkiego dekodera opartego w całości na MLP. Przed utworzeniem końcowej mapy segmentacji dekoder rzutował cechy z każdego etapu kodera do jednej wspólnej przestrzeni osadzeń. Wszystkie bloki Transformera wykorzystywały funkcję aktywacji Gaussian Error Linear Unit (GELU). Podczas trenowania zastosowano współczynnik dropout wynoszący 0,1 w celu poprawy generalizacji i ograniczenia przeuczenia.
Podczas fazy uczenia framework SegFormer otrzymuje wstępnie przetworzone obrazy z obu zbiorów danych. Obrazy z zestawu danych Miao Batik zawierają obszary motywów, które służą jako etykiety do nadzorowanego uczenia modelu segmentacji. Koder Transformera przetwarza cały obraz i wychwytuje dalekosiężne zależności między komponentami obrazu, co jest szczególnie istotne w przypadku tradycyjnych wzorów batik zawierających motywy rozproszone przestrzennie. Hierarchiczny mechanizm ekstrakcji cech jednocześnie rejestruje struktury lokalne, takie jak powtarzalne tekstury geometryczne. Dekoder MLP przetwarza te wyekstrahowane cechy i generuje maskę segmentacji wyróżniającą obszary motywów. Mapy segmentacji wygenerowane na tym etapie są następnie wykorzystywane jako wejścia strukturalne dla modułu uwagi oraz etapu rekonstrukcji wzoru, co pomaga w zachowaniu autentyczności generowanych wzorów.
Motywy kulturowe podzielono na różne klasy w celu segmentacji semantycznej, zgodnie z ich cechami wizualnymi i kulturowymi. Taksonomia segmentacji obejmowała motywy zwierzęce (np. motyle, ryby, ptaki i inną symboliczną faunę), motywy roślinne (np. kwiaty, liście, pnącza i wzory botaniczne), motywy geometryczne (np. powtarzające się kształty, obramowania i abstrakcyjne struktury geometryczne) oraz obszary tła reprezentujące strefy bez motywów. Do przypisania każdego piksela do jednej z predefined klas wykorzystano maski segmentacji na poziomie piksela. Etykiety całkowitoliczbowe zakodowano w następujący sposób: Etykieta 0 = tło, Etykieta 1 = motywy zwierzęce, Etykieta 2 = motywy roślinne i Etykieta 3 = motywy geometryczne. Adnotacje segmentacyjne oraz etykiety motywów pobrano bezpośrednio z oryginalnego źródła zbioru danych Miao Batik. W niniejszym badaniu nie przeprowadzono dodatkowych procedur manualnej adnotacji, ponownego etykietowania, weryfikacji granic ani potwierdzania przez ekspertów. Istniejące adnotacje dostarczone przez twórców zbioru danych zostały wykorzystane bez modyfikacji do celów uczenia i ewaluacji.
Model SegFormer do segmentacji motywów kulturowych przetwarza wstępnie przetworzone obrazy z zestawu danych Miao Batik oraz zestawu danych WikiArt, wykorzystując mechanizm oparty na transformatorze do dokładnego wykrywania obszarów wzorów kulturowych, co przedstawiono na Rysunku 4. Najpierw obraz wejściowy zawierający tradycyjne motywy kulturowe jest dostarczany do modelu SegFormer. Koder transformatora wyodrębnia zarówno globalne informacje kontekstowe, jak i lokalne cechy strukturalne z fragmentów obrazu. Wynikowe cechy wieloskalowe są przekazywane do dekodera segmentacji, który wykorzystuje sieć Mix Feed-Forward Network w celu doprecyzowania reprezentacji cech i poprawy wykrywania motywów. Wynikiem modelu SegFormer jest maska segmentacji, która wyróżnia piksele odpowiadające wzorom kulturowym, jednocześnie tłumiąc nieistotne informacje w tle. Wyizolowane wzory kulturowe służą następnie jako wskazówki strukturalne dla kolejnych etapów frameworka SegCycle-SPADE.

Rysunek 4Segmentacja semantyczna motywów kulturowych w oparciu o model SegFormer-B2. Architektura modułu segmentacji semantycznej SegFormer-B2 wykorzystywanego do ekstrakcji motywów kulturowych, wytrenowanego wyłącznie na zbiorze danych Miao Batik. Struktura składa się z enkodera opartego na transformatorze do wieloskalowej ekstrakcji cech oraz lekkiego dekodera segmentacyjnego służącego do generowania masek motywów. Model przewiduje cztery klasy semantyczne — zwierzęta, rośliny, geometryczne i tło — gdzie wynikowe maski segmentacyjne identyfikują regiony motywów o znaczeniu kulturowym, jednocześnie tłumiąc nieistotne informacje tła. Te wyniki segmentacji stanowią wytyczne strukturalne dla kolejnych etapów fuzji cech, rekonstrukcji i syntezy artystycznej w proponowanej strukturze SegCycle-SPADE. Kliknij tutaj, aby wyświetlić powiększoną wersję tej figury.
W sugerowanym schemacie nie ma potrzeby tworzenia nowych adnotacji segmentacji. Zbiór danych Miao Batik został pobrany z istniejącego publicznego źródła, a model został wytrenowany przy użyciu powiązanych informacji o motywach dostarczonych przez twórców zbioru danych. Podczas procesu uczenia model SegFormer generował mapy segmentacji semantycznej. W rezultacie niniejsze badanie nie wymagało zastosowania dodatkowego oprogramowania do adnotacji manualnych, wytycznych dotyczących adnotacji ani procedur kontroli jakości adnotacji.
CAFFM
Aby poprawić interakcję między cechami segmentacji semantycznej a reprezentacjami rekonstrukcji generatywnej, w badaniu zaproponowano również moduł CAFFM. Koder SegFormer-B2 dostarcza mapy cech semantycznych do modułu CAFFM, natomiast etap rekonstrukcji CycleGAN dostarcza mapy cech generatywnych. W pierwszej kolejności warstwy projekcji liniowej są wykorzystywane do rzutowania obu strumieni cech do wspólnej przestrzeni osadzeń. Do obliczeń cross-attention tworzone są reprezentacje zapytania (Q), klucza (K) i wartości (V) przy użyciu wygenerowanych tensorów cech. Następnie relacje między informacjami o motywach strukturalnych a elementami stylu artystycznego są modelowane za pomocą wielogłowicowego mechanizmu cross-attention. Do połączonych reprezentacji cech stosuje się następnie normalizację warstwową, połączenia rezydualne oraz warstwy feed-forward z aktywacją GELU. Etap syntezy oparty na SPADE otrzymuje wyjście z modułu CAFFM, co pozwala na zachowanie istotnych kulturowo motywów bez utraty spójności artystycznej.
Aby zapewnić kompatybilność cech, cechy wejściowe są najpierw rzutowane za pomocą liniowych warstw projekcji na wspólną przestrzeń osadzeń o wymiarze osadzenia wynoszącym 256. Połączenia między semantycznymi informacjami strukturalnymi a reprezentacjami stylu generatywnego są następnie modelowane przy użyciu mechanizmu MultiHead Cross-Attention z ośmioma głowicami uwagi. Obliczenia uwagi krzyżowej wykorzystują wektory Zapytania (Q), Klucza (K) i Wartości (V), które są generowane przez specyficzne warstwy transformacji liniowej. W celu zwiększenia stabilności treningu i zachowania integralności cech, zastosowano połączenia rezydualne oraz normalizację warstwową (Layer Normalization), aby dodatkowo ulepszyć połączone reprezentacje cech. Nieliniowe uczenie cech jest następnie usprawniane poprzez zastosowanie sieci jednokierunkowej z funkcją aktywacji Gaussian Error Linear Unit (GELU). Moduł generuje reprezentację cech wyjściowych o wymiarze 256, która jest przekazywana do kolejnych etapów syntezy kreatywnej. CAFFM skutecznie łączy dane stylu artystycznego ze strukturami motywów kulturowych, wykorzystując technikę fuzji opartą na uwadze krzyżowej, co poprawia zachowanie motywów i spójność wizualną w zrekonstruowanych wzorach dziedzictwa kulturowego.
W proponowanym systemie cechy strukturalne są pochodne z zestawu danych Miao Batik, natomiast cechy stylistyczne są uczone na podstawie zestawu danych WikiArt. Niech mapa cech pochodna z sieci segmentacyjnej SegFormer z wykorzystaniem obrazów z zestawu danych Miao Batik będzie oznaczona jako Fs, natomiast mapa cech pochodna z gałęzi ekstrakcji cech stylistycznych z wykorzystaniem obrazów WikiArt będzie oznaczona jako Fa. Zaproponowany moduł CAFFM łączy obie domeny cech za pomocą mechanizmu uwagi krzyżowej (cross-attention), aby nauczyć się zależności strukturalnych i stylistycznych wzorów kulturowych. Tabela 3 przedstawia wszystkie charakterystyki architektury, w tym wymiary osadzeń (embedding dimensions), warstwy normalizacji, funkcje aktywacji oraz konfigurację głowic uwagi. Dla obrazu wejściowego o rozmiarze 256 × 256 pikseli, koder SegFormer-B2 wygenerował semantyczne mapy cech o rozmiarze 64 × 64 × 128, podczas gdy gałąź ekstrakcji cech stylistycznych wygenerowała mapy cech o rozmiarze 64 × 64 × 128. Obie mapy cech zostały rzutowane poprzez uczalne warstwy liniowe do wspólnej przestrzeni osadzeń o wymiarze 256 przed fuzją za pomocą uwagi krzyżowej.
| Parametr | Konfiguracja |
| Proponowany framework | SegCycle-SPADE |
| Model segmentacji semantycznej | SegFormer-B2 |
| Etapy enkodera SegFormer | 4 |
| Inicjalizacja wag | Wstępnie wytrenowany SegFormer-B2 na zbiorze ImageNet-1K (szkielet MIT-B2) |
| Źródło punktu kontrolnego | Oficjalne repozytorium NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); punkt kontrolny: segformer.b2.512x512.ade.160k |
| Strategia dostrajania (fine-tuning) | Dostrajanie end-to-end na zbiorze danych Miao Batik |
| Rozmiar embeddingu patcha | 7 × 7 |
| Krok patcha | 4 |
| Wymiary embeddingów | 64, 128, 320 i 512 |
| Głębokości enkodera | 3, 4, 6 i 3 |
| Głowice uwagi (attention heads) | 1, 2, 5 i 8 |
| Typ dekodera | Dekoder All-MLP |
| Funkcja aktywacji | GELU |
| Współczynnik dropout | 0.1 |
| Moduł wzmacniania cech | Moduł fuzji cech kulturowych z krzyżową uwagą (CAFFM) |
| Wymiar embeddingu CAFFM | 256 |
| Głowice uwagi CAFFM | 8 |
| Skale fuzji CAFFM | 4 |
| Model rekonstrukcji | CycleGAN |
| Model generowania stylu | SPADE |
| Kulturowy zbiór danych | Zbiór danych Miao Batik |
| Zbiór danych stylów | Zbiór danych WikiArt |
| Obrazy Miao Batik | 15 148 |
| Obrazy WikiArt | Około 80 000 |
| Rozdzielczość obrazu wejściowego | 256 × 256 pikseli |
| Format koloru | RGB |
| Metoda interpolacji | Interpolacja liniowa |
| Metoda odszumiania | Filtrowanie gaussowskie |
| Rozmiar jądra Gaussa | 5 × 5 |
| Sigma Gaussa (σ) | 1 |
| Zakres normalizacji | [0, 1] |
| Wielkość partii (batch size) | 16 |
| Liczba epok | 100 |
| Optymalizator | Adam |
| Szybkość uczenia | 0.0002 |
| Parametry Adam | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0 |
| Funkcje straty | Strata segmentacji, strata adwersarialna, strata spójności cyklu, strata rekonstrukcji, strata zachowania motywu oraz strata spójności stylu |
| Strategia podziału zbioru danych | Treningowy / Walidacyjny / Testowy |
| Zbiór treningowy | 70% |
| Zbiór walidacyjny | 15% |
| Zbiór testowy | 15% |
| Losowy seed | 42 |
| Metryki ewaluacji | Dokładność segmentacji, IoU, współczynnik Dice'a, SSIM, PSNR i FID |
| Język programowania | Python 3.8.10 |
| Framework głębokiego uczenia | PyTorch 1.10.0 |
| Platforma sprzętowa | NVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (11. generacja), 32 GB RAM |
| Środowisko operacyjne | Ubuntu 20.04 LTS |
Tabela 3: Układ eksperymentalny i konfiguracja modelu. Podsumowanie komponentów architektonicznych, konfiguracji treningowej, ustawień przetwarzania wstępnego, zbiorów danych, parametrów optymalizacji, metryk ewaluacji oraz środowiska obliczeniowego wykorzystanego do implementacji i oceny proponowanego frameworka SegCycle-SPADE.
Moduł uwagi najpierw mapuje mapę cech na reprezentacje zapytania (query), klucza (key) i wartości (value) zgodnie z Równaniem 10:

Tutaj Wq, Wk oraz Wv są wyuczalnymi macierzami wag. Wagi uwagi są obliczane na podstawie podobieństwa między wektorem zapytania a wektorem klucza zgodnie z Równaniem 1117:

Tutaj dk to wymiar wektora klucza. Ulepszona reprezentacja cech jest obliczana poprzez pomnożenie wag uwagi przez macierz wartości zgodnie z Równaniem 12:

Tutaj Fa jest ulepszoną reprezentacją cech mapy cech. Ulepszona reprezentacja cech jest obliczana poprzez połączenie oryginalnych cech segmentacji z cechami ulepszonymi, uzyskanymi za pomocą mechanizmu uwagi zgodnie z Równaniem 13:
Tutaj Fe oznacza ulepszoną mapę cech wykorzystywaną do rekonstrukcji wzorca. Moduł CAFFM został rozszerzony o wieloskalowy mechanizm wzajemnej uwagi (cross-attention), aby wyodrębnić cechy motywów kulturowych w różnych skalach. Niech Fsi oznacza cechy segmentacji w skali i, natomiast Faj oznacza cechy stylu artystycznego w tej samej skali. Końcowa reprezentacja cech jest zdefiniowana zgodnie z Równaniem 14:

Tutaj Qi, Ki i Vi reprezentują odpowiednio macierze zapytań (query), kluczy (key) i wartości (value) w skali i, a N oznacza liczbę skal cech. W niniejszym badaniu N = 4, co odpowiada mapom cech wyekstrahowanym przy rozdzielczościach przestrzennych wynoszących odpowiednio 1/4, 1/8, 1/16 i 1/32 rozmiaru obrazu wejściowego. Te wieloskalowe reprezentacje cech zostały połączone przy użyciu nauczalnych wag uwagi przed rekonstrukcją i syntezą artystyczną. Powyższe rozszerzenie umożliwia metodzie ekstrakcję globalnych motywów i tekstur kulturowych w celu rekonstrukcji wzorów kulturowych. Moduł CAFFM znajduje się pomiędzy etapem segmentacji opartym na SegFormer a etapem kreatywnej syntezy opartym na SPADE w proponowanym systemie SegCycle-SPADE. Najpierw, podczas gdy CycleGAN jednocześnie tworzy cechy rekonstrukcyjne z informacjami stylistycznymi i wzorniczymi, SegFormer-B2 odzyskuje semantyczne mapy cech opisujące właściwości strukturalne motywów kulturowych. Moduł CAFFM przyjmuje te dwa strumienie cech i wykorzystuje fuzję opartą na mechanizmie cross-attention, aby zidentyfikować relacje między reprezentacjami strukturalnymi a artystycznymi. Aby stworzyć autentyczne kulturowo wzory przy zachowaniu spójności semantycznej i cech strukturalnych, powstałe połączone mapy cech są następnie przesyłane do modułu SPADE w celu kreatywnej syntezy sterowanej segmentacją.
Rekonstrukcja wzorów przy użyciu CycleGAN
Po zakończeniu etapu wzmacniania cech w oparciu o mechanizm uwagi, mapy cech będą zawierać wzmocnione struktury motywów kulturowych. Mapy cech mogą jednak nadal zawierać niekompletne lub uszkodzone obszary wzorów. Dlatego, aby rozwiązać problem rekonstrukcji wzorów, w proponowanym schemacie zostanie wykorzystany model CycleGAN. W proponowanym schemacie dwiema domenami będą oryginalne wzory motywów kulturowych oraz zrekonstruowane wzory motywów kulturowych. Wykorzystując wzmocnione cechy z poprzednich etapów, model CycleGAN zrekonstruuje wzory kulturowe, zachowując jednocześnie spójność strukturalną. Zapewni to, że wzory kulturowe, takie jak motywy geometryczne, roślinne i symboliczne, zachowają swoje rozmieszczenie przestrzenne. Oryginalne obrazy batiku ludu Miao zostały poddane operacjom losowego maskowania i częściowego przesłonięcia w celu wygenerowania niekompletnych lub uszkodzonych motywów kulturowych. Procedury degradacji te symulowały brakujące obszary wzorów oraz uszkodzenia strukturalne powszechnie obserwowane w zniszczonych artefaktach dziedzictwa kulturowego. Zdegradowane obrazy posłużyły jako dane wejściowe do modułu rekonstrukcji, natomiast odpowiadające im obrazy oryginalne służyły jako obrazy referencyjne do oceny wydajności i jakości rekonstrukcji. Strategia ta umożliwiła modelowi naukę przywracania brakujących struktur motywów przy jednoczesnym zachowaniu spójności semantycznej i cech kulturowych.
Przyjmijmy, że X jest domeną niekompletnych wzorców kulturowych, a Y domeną zrekonstruowanych wzorców kulturowych. Dwa generatory uczą się wykonywać odwzorowanie dwukierunkowe zgodnie z Równaniem 15:

Tutaj GE jest wykorzystywane do rekonstrukcji struktur motywów, a FM służy do mapowania wzorców z powrotem na oryginalną domenę. Stratę adwersarialną stosuje się w celu zapewnienia, że zrekonstruowane wzorce są realistyczne (Równanie 16)30

Tutaj DY jest dyskryminatorem służącym do rozróżniania wzorów rzeczywistych i zrekonstruowanych, a GE(x) oznacza wygenerowany wzór zrekonstruowany. CycleGAN wymusza również spójność cyklu, aby zachować układ strukturalny motywów kulturowych (Równanie 17)30.

Końcowa funkcja straty została zdefiniowana za pomocą Równania 1830:

Tutaj λi oznacza współczynnik wagowy dla straty spójności cyklu (cycle-consistency loss), który podczas trenowania ustawiono na 10, zgodnie z oryginalną formulacją CycleGAN. Wartość ta została dobrana w celu zrównoważenia uczenia przeciwstawnego oraz spójności rekonstrukcji pomiędzy domeną źródłową a docelową.
Moduł rekonstrukcji CycleGAN składa się z dwóch generatorów i dwóch dyskryminatorów służących do dwukierunkowej translacji obrazów. Każdy generator opiera się na architekturze sieci rezdualnej (residual network), obejmującej początkową warstwę splotową 7 × 7, po której następują dwie warstwy splotowe downsamplingu, dziewięć bloków rezdualnych oraz dwie warstwy upsamplingu. Wszystkie operacje splotowe wykorzystują jądro o rozmiarze 3 × 3, z wyjątkiem warstwy wejściowej, w której zastosowano jądro 7 × 7 w celu poprawy ekstrakcji cech. Po każdej warstwie splotowej stosowana jest normalizacja instancji (Instance Normalization) w celu zwiększenia stabilności uczenia, natomiast w całej sieci generatora wykorzystywana jest funkcja aktywacji ReLU. Warstwa wyjściowa wykorzystuje funkcję aktywacji Tanh do generowania znormalizowanych obrazów wyjściowych. Dyskryminator opiera się na architekturze PatchGAN 70 × 70, składającej się z serii warstw splotowych z jądrami o rozmiarze 4 × 4 i progresywnie zwiększającą się liczbą kanałów cech. W dyskryminatorze zastosowano normalizację instancji oraz aktywację LeakyReLU (nachylenie ujemne = 0.2), aby poprawić dyskryminację cech i uczenie kontradyktoryjne. Moduł CycleGAN przyjmuje jako dane wejściowe wstępnie przetworzone obrazy motywów kulturowych i generuje zrekonstruowane reprezentacje wzorów, które są następnie przekazywane do CAFFM w celu integracji z cechami segmentacji. Trenowanie CycleGAN przeprowadzono przy użyciu optymalizatora Adam (β₁ = 0.5, β₂ = 0.999) z początkową prędkością uczenia 0.0002. Prędkość uczenia utrzymywano przez pierwsze 100 epok, a następnie liniowo zmniejszano do zera w pozostałym czasie trenowania. W celu stabilizacji uczenia dyskryminatora zastosowano bufor odtwarzania (replay buffer) zawierający 50 wcześniej wygenerowanych obrazów. Aktualizację generatorów i dyskryminatorów przeprowadzano w stosunku 1:1, gdzie jednej aktualizacji generatora towarzyszyła jedna aktualizacja dyskryminatora w każdej iteracji treningowej.
Proces rekonstrukcji w CycleGAN opiera się na ulepszonych mapach cech uzyskanych za pomocą mechanizmu CAFFM przedstawionego na Rysunku 5. Mapy cech zawierają ulepszone motywy kulturowe otrzymane w poprzednich etapach segmentacji i CAFFM. Mapy cech służą jako wejście do pierwszego generatora GE. Pierwszy generator GE uczy się odwzorowania niezbędnego do rekonstrukcji wzorów kulturowych. Wyniki są następnie przekazywane do dyskryminatora DY w celu odróżnienia rzeczywistych wzorów kulturowych od wzorów zrekonstruowanych. Dyskryminator DY pomaga generatorowi GE generować realistyczne wyniki. Aby zapewnić, że wzory kulturowe nie zostaną zniekształcone podczas rekonstrukcji, drugi generator FM wykonuje odwzorowanie spójności cyklu (cycle-consistency mapping). Drugi generator FM odwzorowuje wyniki z powrotem do oryginalnej domeny. Wyniki są następnie oceniane przez dyskryminator w celu zapewnienia realizmu. Ostateczne wyniki są następnie przekazywane do modułu SPADE w celu generowania stylu artystycznego w kolejnym etapie proponowanego frameworka SegCycle-SPADE.

Rycina 5. Schemat rekonstrukcji wzorów oparty na CycleGAN. Przebieg pracy modułu rekonstrukcyjnego CycleGAN. Reprezentacje cech wzmocnione mechanizmem uwagi służą jako wejścia dla sieci generatora w celu rekonstrukcji niekompletnych motywów kulturowych. Dyskryminator ocenia zrekonstruowane wyniki w odniesieniu do wzorców referencyjnych, podczas gdy mapowanie spójności cyklu zachowuje integralność strukturalną podczas dwukierunkowej translacji obrazów. Zrekonstruowane motywy są następnie przekazywane do modułu SPADE w celu syntezy stylu artystycznego. Kliknij tutaj, aby wyświetlić powiększoną wersję tej ryciny.
Generowanie stylu artystycznego za pomocą SPADE
Następnie zrekonstruowane motywy kulturowe są poddawane działaniu modułu SPADE w celu wygenerowania stylu artystycznego. Głównym celem modułu SPADE jest dodanie bogatszych wizualnie tekstur stylu artystycznego do zrekonstruowanych motywów kulturowych, bez naruszania ich układu strukturalnego. Moduł SPADE jest techniką warunkowego generowania obrazów, która wykorzystuje koncepcję segmentacji obrazu do tworzenia grafik. Wielokanałowe mapy semantyczne, odpowiadające wcześniej określonym klasom motywów, zostały zakodowane na podstawie masek segmentacji semantycznej wygenerowanych przez SegFormer-B2. Generator SPADE otrzymał te zakodowane mapy jako wejścia warunkujące. Parametry przestrzennie adaptacyjnego skalowania (γ) i przesunięcia (β) były generowane poprzez przetwarzanie map semantycznych w warstwach splotowych w obrębie każdej warstwy SPADE. Dzięki zastosowaniu tych parametrów do znormalizowanych aktywacji cech, generator był w stanie zachować granice motywów, układy strukturalne oraz informacje semantyczne podczas syntezy artystycznej. Kierowanie semantyczne mogło wpływać zarówno na wysokopoziomową rekonstrukcję strukturalną, jak i na niskopoziomową syntezę tekstury, ponieważ proces warunkowania był przeprowadzany na kilku warstwach generatora SPADE. W rezultacie stworzone wzory artystyczne włączyły cechy stylistyczne pozyskane z zestawu danych WikiArt, zachowując jednocześnie struktury motywów kulturowych zidentyfikowane na etapie segmentacji.
Zbiór danych WikiArt, obejmujący dzieła z 27 różnych kategorii artystycznych — takich jak renesans, impresjonizm, kubizm, ekspresjonizm, surrealizm, realizm i sztuka abstrakcyjna — został wykorzystany jako główny zasób do zrozumienia stylów artystycznych. Aby zapoznać model z różnorodnymi cechami twórczymi i poprawić generalizację stylu, podczas treningu losowo wybierano obrazy stylowe z różnych kategorii. Zbiór danych został podzielony na podzbiory treningowy, walidacyjny i testowy z zrównoważoną reprezentacją kategorii artystycznych, aby zminimalizować stronniczość stylu. W celu zapewnienia zrównoważonej reprezentacji wszystkich 27 kategorii artystycznych zastosowano próbkowanie warstwowe. Próbki z każdej kategorii zostały proporcjonalnie przypisane do podzbiorów treningowego, walidacyjnego i testowego, przy zachowaniu pierwotnego rozkładu klas. Moduł CAFFM został użyty do połączenia aspektów stylu pochodzących z obrazów WikiArt z cechami rekonstrukcji wygenerowanymi przez CycleGAN. Aby umożliwić sieci syntezującej przenoszenie cech artystycznych przy jednoczesnym zachowaniu struktury semantycznej i granic motywów kulturowych wywiedzionych z map segmentacji, otrzymane połączone reprezentacje dostarczono jako informacje warunkujące do generatora SPADE. Dzięki tej technice warunkowania stylu zaproponowana architektura była w stanie generować kulturowo autentyczne wzory artystyczne z spójnymi reprezentacjami strukturalnymi i stylowymi.
SPADE wprowadza również przestrzennie adaptacyjne parametry, które zależą od mapy segmentacji. Parametry te można zdefiniować zgodnie z Równaniem 191:

Tutaj γ(S) jest przestrzennie zmiennym parametrem skali, a β(S) jest przestrzennie zmiennym parametrem przesunięcia. Parametry te mogą pomóc generatorowi w tworzeniu różnych tekstur i stylów w zależności od regionu semantycznego na obrazach. Końcowe dzieło kultury można zdefiniować zgodnie z Równaniem 20:

Tutaj GE to generator SPADE, XrP to zrekonstruowany wzór, a SM to mapa segmentacji. Końcowe dzieło zachowuje integralność strukturalną motywów kulturowych, jednocześnie poprawiając walory artystyczne. W celu optymalizacji sugerowanej architektury SegCycle-SPADE zastosowano złożoną funkcję straty, która równoważy dokładność segmentacji semantycznej, zachowanie motywów kulturowych, jakość rekonstrukcji wzoru oraz spójność stylu artystycznego. Ogólny cel szkolenia ustalono za pomocą ważonej mieszaniny straty segmentacji (Lseg), straty przeciwnika (Ladv), straty spójności cyklu (Lcycle), straty rekonstrukcji (Lrecon), straty zachowania motywu (Lmotif) oraz straty spójności stylu (Lstyle). Całkowita funkcja straty jest zdefiniowana w Równaniu 21:
(21)
Aby zagwarantować spójność strukturalną pomiędzy wejściowymi a zrekonstruowanymi motywami kulturowymi, współczynnik straty spójności cyklicznej ustawiono na 10. W celu zachowania szczegółowych cech motywów i zwiększenia dokładności wizualnej, współczynnik straty rekonstrukcji ustawiono na 5. Aby podkreślić zachowanie kluczowych dla kultury wzorców strukturalnych podczas syntezy artystycznej, dla straty zachowania motywów zastosowano współczynnik 2. W celu promowania transferu stylu artystycznego bez nadmiernego zniekształcania semantycznych struktur motywów, współczynnik straty spójności stylu dostosowano do wartości 1. Aby utrzymać zrównoważony wkład pomiędzy generowaniem realistycznych obrazów a precyzyjną segmentacją motywów, przypisano równe wagi stracie segmentacji oraz stracie przeciwstawnej. Do obliczenia straty spójności stylu wykorzystano reprezentacje stylu oparte na cechach ze zbioru danych WikiArt. W szczególności cechy stylu artystycznego uchwycono za pomocą korelacji macierzy Grama, wyznaczonych z głębokich map cech. Różnicę normy Frobeniusa pomiędzy macierzami Grama obrazu stylu docelowego a obrazu wygenerowanego wykorzystano do obliczenia straty stylu, zgodnie z Równaniem 22:

W tym zapisie Gl to macierz Grama obliczona z l-tej warstwy cech, Igen oznacza wygenerowany obraz artystyczny, Istyle oznacza docelowy obraz stylu z zestawu danych WikiArt, a F oznacza normę Frobeniusa. Taka formuła umożliwia zaproponowanemu modelowi zachowanie cech artystycznych przy jednoczesnym utrzymaniu integralności strukturalnej i semantycznej motywów kulturowych.
Połączone reprezentacje cech wygenerowane przez moduł CAFFM są wykorzystywane jako wejścia warunkujące dla modułu SPADE, który pełni funkcję komponentu syntezy artystycznej w proponowanym modelu. Generator SPADE składa się z siedmiu rezydualnych bloków SPADE o wymiarze cech ukrytych wynoszącym 256 kanałów i generuje obrazy wyjściowe w rozdzielczości 256 × 256 pikseli. Mapy segmentacji semantycznej otrzymane z modułu SegFormer–CAFFM służą jako wejścia warunkujące w wszystkich rezydualnych warstwach SPADE. Warstwy SPADE są stosowane przed funkcjami aktywacji w każdym bloku rezydualnym, co umożliwia semantyczne warunkowanie sterowane segmentacją. Poprzez kolejne operacje upsamplingu i splotu, reprezentacja cech ukrytych jest stopniowo doprecyzowana w celu wygenerowania artystycznych wzorów o wysokiej rozdzielczości przy jednoczesnym zachowaniu spójności semantycznej i struktury motywu. W całym generatorze stosowane są funkcje aktywacji LeakyReLU, a w warstwie wyjściowej zastosowano funkcję aktywacji Tanh w celu uzyskania znormalizowanych obrazów.
Algorytm i schemat pracy
Struktura SegCycle-SPADE integruje segmentację semantyczną, fuzję cech, rekonstrukcję wzorów oraz syntezę stylu artystycznego w ramach ujednoliconego potoku treningowego. Schemat pracy rozpoczyna się od pozyskania i wstępnego przetwarzania zbioru danych, obejmującego zmianę rozmiaru obrazów, normalizację, odszumianie oraz przygotowanie masek segmentacyjnych. Przetworzone obrazy są następnie analizowane przez sieć segmentacyjną SegFormer-B2 w celu wyodrębnienia semantycznych reprezentacji motywów. Uzyskane cechy segmentacji są łączone z cechami rekonstrukcji za pomocą modułu CAFFM, co umożliwia interakcję między informacjami o strukturze motywu a artystycznymi reprezentacjami cech. Połączone mapy cech są następnie przekazywane do modułu rekonstrukcji CycleGAN, który odtwarza niekompletne struktury motywów kulturowych przy zachowaniu spójności semantycznej. Zrekonstruowane wzory są następnie dostarczane do generatora SPADE w celu syntezy artystycznej sterowanej segmentacją, co pozwala na ulepszenie stylistyczne przy jednoczesnym zachowaniu granic motywów i autentyczności strukturalnej. Podczas trenowania parametry modelu są optymalizowane przy użyciu złożonej funkcji straty opisanej w Równaniach 21 i 22, która równoważy dokładność segmentacji, zachowanie motywów, jakość rekonstrukcji oraz spójność stylu artystycznego. Szczegółowy, krok po kroku opis implementacji, obejmujący ładowanie zbioru danych, wstępne przetwarzanie, inicjalizację modelu, iteracje treningowe, procedury walidacji, wybór punktów kontrolnych oraz końcową ewaluację, znajduje się w Pliku uzupełniającym 1 (Algorytm 1). Cały schemat algorytmiczny został zaimplementowany przy rozmiarze partii (batch size) wynoszącym 16, tempie uczenia (learning rate) 0.0002 oraz 100 epok treningowych. Do podziału zbioru danych, inicjalizacji modelu i wszystkich eksperymentów treningowych wykorzystano stały ziarno losowości (seed) o wartości 42. Ziarno to zastosowano spójnie w generatorach liczb pseudolosowych bibliotek Python, NumPy i PyTorch, aby zapewnić powtarzalność wyników. Optymalizator Adam skonfigurowano z parametrami β₁ = 0.5, β₂ = 0.999 oraz bez zaniku wag (weight decay = 0). Punkty kontrolne modelu wybierano na podstawie najwyższego wyniku IoU osiągniętego na zbiorze walidacyjnym.
Optymalizacja funkcji straty
Aby zachować struktury motywów kulturowych podczas rekonstrukcji i syntezy artystycznej, proponowany schemat wykorzystuje złożony cel optymalizacji, który łączy straty z segmentacji, adversarijalne, spójności cyklicznej, rekonstrukcji, zachowania motywu oraz spójności stylu. Pełny zapis matematyczny, współczynniki wagowe i definicja straty stylu zostały przedstawione w Równaniach 21 i 22 w podrozdziale Artistic Style Generation using SPADE. Komponent zachowania motywu penalizuje odchylenia strukturalne pomiędzy przewidywanymi obszarami motywu a odpowiadającymi im maskami segmentacji prawdy podstawowej (ground-truth), co sprzyja zachowaniu kulturowo istotnych struktur wzorów w całym procesie rekonstrukcji.