Articolo di ricerca

Ricostruzione guidata dalla segmentazione semantica e sintesi di stile artistico di pattern del patrimonio culturale immateriale tramite un framework di deep learning

DOI:

10.3791/71577

14 agosto 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo descrive un flusso di lavoro basato sull'apprendimento profondo per la segmentazione semantica, la ricostruzione e la sintesi stilistica artistica di motivi del patrimonio culturale immateriale, utilizzando l'estrazione di caratteristiche basata su trasformatori, la ricostruzione avversaria e la generazione adattativa spaziale delle immagini, al fine di supportare la conservazione digitale e applicazioni creative nel campo del patrimonio culturale.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La conservazione digitale e la ricostruzione dei modelli del patrimonio culturale immateriale (ICH) hanno attirato un'attenzione crescente con il progresso delle tecniche di sintesi delle immagini basate sull'apprendimento profondo. Gli approcci esistenti basati su SegCycle-SPADE hanno dimostrato un potenziale per la segmentazione strutturale e la ricostruzione artistica dei modelli artigianali tradizionali; tuttavia, permangono alcune limitazioni, tra cui la scarsa diversità dei dataset, l'insufficiente integrazione delle semantica culturale e la preservazione inadeguata delle caratteristiche strutturali dei modelli durante la ricostruzione. Per affrontare queste sfide, questo studio propone un framework SegCycle-SPADE migliorato per la segmentazione semantica e la ricostruzione artistica dei tipi di modelli ICH. Viene impiegato un modello di segmentazione basato su Transformer, SegFormer, per identificare con precisione i confini dei motivi e le regioni del modello. Inoltre, viene introdotto un modulo di fusione delle caratteristiche culturali basato sull'attenzione incrociata (Cross-Attention Cultural Feature Fusion Module) per potenziare i motivi culturalmente significativi e migliorare la rappresentazione delle caratteristiche. La traduzione e la ricostruzione del modello vengono eseguite utilizzando CycleGAN, mentre la denormalizzazione spazialmente adattativa (SPADE) viene utilizzata per la sintesi dello stile artistico al fine di mantenere la coerenza semantica tra le mappe di segmentazione e le immagini generate. Per migliorare la generalizzazione del modello e la diversità artistica, il framework viene addestrato utilizzando sia il dataset dei motivi culturali Miao Batik sia il dataset WikiArt. I risultati sperimentali dimostrano che il framework SegCycle-SPADE proposto, guidato dall'attenzione, migliora l'accuratezza della segmentazione e le prestazioni di ricostruzione dei modelli del patrimonio rispetto ai metodi esistenti di ricostruzione basati su reti avversarie generative (GAN). Il framework proposto fornisce una soluzione scalabile per la documentazione assistita dall'intelligenza artificiale, la ricostruzione e la rivitalizzazione artistica dei disegni tradizionali dei modelli.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il patrimonio culturale, che comprende elementi immateriali come usanze, lingue e credenze, e elementi materiali come opere d'arte, edifici e documenti scritti, è una manifestazione fondamentale della storia, della creatività e dell'identità umana1. La conservazione del patrimonio mira a permettere alle comunità di riconnettersi con le proprie origini e consente alle generazioni future di trarre beneficio dalla memoria culturale collettiva. Promuove inoltre la comprensione interculturale, l'apprezzamento di tradizioni e usanze diverse e il riconoscimento di differenti narrazioni storiche. Questi beni culturali ci aiutano a comprendere i valori, i punti di vista e le esperienze delle generazioni passate e contribuiscono alla formazione delle identità sociali contemporanee e alla continuità culturale. I principi fondamentali della conservazione del patrimonio culturale sono illustrati nella Figura 1.

figure-introduction-1
Figura 1. Panoramica Concettuale della Ricostruzione di Pattern del Patrimonio Culturale mediante il Framework SegCycle-SPADE. Rappresentazione schematica dell'approccio proposto per la ricostruzione e il miglioramento di pattern del patrimonio culturale immateriale. Il flusso di lavoro comprende la raccolta del dataset dai dataset Miao Batik e WikiArt, la pre-elaborazione delle immagini, la segmentazione semantica tramite SegFormer-B2, la fusione di caratteristiche tramite il Modulo di Fusione di Caratteristiche Culturali con Attenzione Incrociata (CAFFM), la ricostruzione dei pattern tramite CycleGAN, la sintesi dello stile artistico tramite SPADE e la valutazione finale mediante metriche di segmentazione e ricostruzione. Le frecce indicano il flusso dei dati e delle rappresentazioni delle caratteristiche all'interno del framework. Cliccare qui per visualizzare una versione ingrandita di questa figura.

La memoria collettiva e l'eredità culturale della società umana sono incarnate nel patrimonio culturale immateriale (ICH), che svolge un ruolo importante come mezzo di espressione artistica e identità culturale. Tuttavia, l'ICH affronta sfide significative a causa degli effetti della globalizzazione e della digitalizzazione2,3,4. Molte pratiche ICH a rischio richiedono nuovi approcci alla conservazione e allo sviluppo a causa della diminuzione del numero di artigiani qualificati e della limitata adattabilità ai mercati moderni5,6. Come settore importante della ricerca sull'ICH, il design sostenibile enfatizza lo sviluppo integrato di cultura, società e ambiente e fornisce una via pratica per la conservazione continua dell'ICH. Attraverso approcci di design sostenibile, l'ICH può essere rivitalizzato adattandosi alle esigenze della società contemporanea7,8.

In questo studio, il termine «modelli di patrimonio culturale immateriale» si riferisce a rappresentazioni di motivi visivi che comunicano e preservano valori culturali immateriali sottostanti. Di conseguenza, il framework proposto mira a preservare e documentare le informazioni culturali associate a questi motivi, ricostruendone al contempo le forme visive.

Il ricamo Miao e il batik sono forme significative del patrimonio culturale immateriale cinese, che riflettono la storia, le credenze e le tradizioni della comunità Miao attraverso motivi simbolici come uccelli, farfalle e totem ancestrali9. Questi motivi sono profondamente radicati negli abiti rituali e nelle pratiche festive e contribuiscono allo sviluppo culturale ed economico locale10,11. I progressi nelle tecnologie digitali, in particolare nell'intelligenza artificiale (AI) e nell'apprendimento profondo (DL), hanno creato nuove opportunità per la conservazione, l'analisi, la ricostruzione e la documentazione del patrimonio culturale. Il batik Miao del Guizhou, una delle tradizioni di batik meglio conservate in Cina, rappresenta un mezzo importante per trasmettere il sapere culturale, le credenze, le usanze e i rituali del popolo Miao12,13,14,15,16.

Studi recenti hanno dimostrato il potenziale del deep learning (DL) nella conservazione del patrimonio culturale e nella ricostruzione di motivi, ottenendo un'accuratezza di segmentazione migliore (accuratezza a livello di pixel = 88,6%, media dell'intersezione rispetto all'unione [IoU] = 78,1%) e prestazioni di ricostruzione superiori rispetto a U-Net e DeepLabV3+. Tuttavia, permangono diverse sfide. Gli attuali approcci basati su reti avversarie generative (GAN) spesso incontrano difficoltà nel preservare i dettagli strutturali fini nei motivi complessi.17, mentre la limitata diversità del dataset limita la generalizzazione del modello attraverso domini culturali18Inoltre, modelli di traduzione da immagine a immagine come CycleGAN possono non mantenere la coerenza semantica tra le mappe di segmentazione e le immagini generate19e l'assenza di meccanismi attentivi può provocare la perdita di dettagli di motivi culturalmente significativi durante la ricostruzione20Pertanto, è necessario un framework avanzato che integri la segmentazione basata su trasformatori, l'apprendimento delle caratteristiche guidato dall'attenzione e l'addestramento su multipli dataset per una ricostruzione efficace dei pattern di emorragia cerebrale (ICH).

Nuove opportunità per la conservazione del patrimonio culturale sono emerse grazie alla digitalizzazione del ricamo Miao e al rapido sviluppo dell'intelligenza artificiale generativa. I modelli di diffusione, una classe emergente di modelli generativi profondi, hanno dimostrato prestazioni notevoli nei compiti di visione artificiale grazie alle loro potenti capacità di generazione dei contenuti21,22,23,24,25. Durante il processo inverso di diffusione, il modello impara gradualmente a ricostruire i dati originali a partire da rappresentazioni rumorose26,27,28. Studi precedenti hanno inoltre esplorato l'applicazione delle tecnologie di ricostruzione tridimensionale e di progettazione assistita da computer (CAD) per la conservazione e la diffusione del patrimonio culturale.

Anche se le reti neurali convoluzionali (CNN) e i GAN offrono prestazioni elevate nella generazione di immagini e nel mantenimento delle caratteristiche, presentano ancora sfide legate a campi recettivi limitati, al collasso delle modalità e all'instabilità durante l'addestramento29. Le architetture basate sui trasformatori, come SegFormer e Segmenter, eccellono nel catturare il contesto globale e le relazioni semantiche; tuttavia, richiedono un'elevata potenza computazionale e possono avere difficoltà a gestire dettagli fini. Sebbene i modelli di diffusione come Stable Diffusion dimostrino solide capacità di generazione di immagini, spesso mancano di un controllo preciso sulle caratteristiche strutturali e artistiche dei disegni generati. Inoltre, la maggior parte degli approcci esistenti impiega strategie di addestramento indipendenti che limitano la condivisione efficace delle informazioni e l'ottimizzazione collaborativa tra i componenti di segmentazione e generazione, portando a un compromesso tra accuratezza strutturale e autenticità artistica30.

I recenti modelli basati sulla diffusione, come la diffusione latente e la Stable Diffusion, raggiungono una sintesi di immagini di alta qualità ma richiedono un denoising iterativo, il che comporta un aumento del costo computazionale e del tempo di inferenza. Inoltre, mantenere motivi culturali fini e una coerenza strutturale rimane una sfida senza meccanismi di condizionamento specializzati. I modelli generativi basati su Transformer catturano efficacemente le relazioni contestuali globali ma spesso richiedono dataset su larga scala e risorse computazionali sostanziali. Al contrario, il framework proposto SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) combina la segmentazione basata su SegFormer, la fusione di caratteristiche con attenzione incrociata, la ricostruzione mediante CycleGAN e la sintesi guidata da SPADE per fornire un orientamento strutturale esplicito, migliorando così il mantenimento dei motivi, la coerenza semantica e la ricostruzione controllabile dei pattern del patrimonio culturale.

La maggior parte delle moderne tecniche di segmentazione semantica si basa su reti neurali convoluzionali completamente connesse (FCNN) con architetture a forma di U31. Durante la fase di codifica, vengono estratte caratteristiche profonde con ampi campi recettivi attraverso una serie di operazioni di convoluzione e sottocampionamento. Nella fase di decodifica, la risoluzione spaziale viene ripristinata progressivamente mediante sovracampionamento, consentendo infine una previsione semantica a livello di pixel. Le connessioni di salto permettono di compensare la perdita di informazioni spaziali durante il sottocampionamento e migliorano le prestazioni di segmentazione in un'ampia gamma di applicazioni, integrando direttamente informazioni ad alta risoluzione provenienti da diversi livelli dell'encoder nel decoder32.

Sebbene i recenti metodi basati su GAN, CNN e diffusione abbiano mostrato risultati promettenti nella generazione di immagini e nel restauro del patrimonio culturale, spesso incontrano difficoltà nel mantenere la coerenza semantica, preservare i dettagli strutturali fini e garantire una ricostruzione riproducibile attraverso diversi modelli culturali. La maggior parte degli approcci esistenti tratta segmentazione, ricostruzione e sintesi dello stile come processi separati, il che può portare alla perdita di elementi culturalmente significativi e a risultati incoerenti. Per affrontare questa lacuna metodologica, questo studio propone un framework unificato SegCycle-SPADE che integra la segmentazione semantica basata su SegFormer, un nuovo Modulo di Fusione delle Caratteristiche Culturali con Cross-Attenzione (CAFFM), la ricostruzione basata su CycleGAN e la sintesi dello stile guidata da SPADE. Integrando esplicitamente le informazioni di segmentazione strutturale con l'apprendimento delle caratteristiche generative, il framework proposto consente una ricostruzione più affidabile, semanticamente coerente e riproducibile dei motivi del patrimonio culturale immateriale, preservando al contempo l'autenticità culturale e la qualità artistica.

In questo studio vengono identificate tre limitazioni principali degli attuali approcci alla ricostruzione del patrimonio culturale: (i) insufficiente preservazione dei motivi strutturali fini nei metodi di ricostruzione basati su GAN; (ii) generalizzazione limitata derivante dall'addestramento su dataset ridotti o specifici per dominio; e (iii) inadeguata coerenza semantica tra gli output della segmentazione e le immagini generate nei framework di traduzione da immagine a immagine. Inoltre, segmentazione, ricostruzione e sintesi dello stile sono comunemente trattate come processi separati, portando alla perdita di elementi culturalmente importanti durante la ricostruzione. Combinando segmentazione semantica basata su transformer, fusione di caratteristiche con cross-attenzione, ricostruzione CycleGAN e sintesi artistica guidata da SPADE all'interno di un'architettura unificata, il framework proposto SegCycle-SPADE affronta queste limitazioni e migliora la preservazione dei motivi, la coerenza semantica e l'autenticità artistica nella ricostruzione di pattern del patrimonio culturale immateriale (ICH).

L'obiettivo principale di questo studio è sviluppare un framework SegCycle-SPADE migliorato per la ricostruzione artistica guidata dalla segmentazione semantica di schemi ICH. Il framework integra SegFormer per una segmentazione precisa dei motivi culturali, CycleGAN per la ricostruzione degli schemi e SPADE per una sintesi artistica coerente nello stile. Per migliorare la rappresentazione delle caratteristiche e preservare i dettagli strutturali fini, viene introdotto un CAFFM per facilitare un'efficace interazione tra le caratteristiche di segmentazione e quelle generative. Addestrato sui dataset Miao Batik e WikiArt, il framework proposto migliora l'autenticità della ricostruzione, la coerenza stilistica e la preservazione dei motivi culturalmente significativi.

Combinando segmentazione semantica, fusione guidata dall'attenzione delle caratteristiche, ricostruzione di pattern e sintesi stilistica all'interno di un'architettura unificata, questo studio presenta un nuovo framework SegCycle-SPADE per la ricostruzione artistica di pattern ICH. I principali contributi di questo lavoro sono i seguenti. Primo, viene sviluppato un nuovo framework di ricostruzione guidato dalla segmentazione semantica mediante l'integrazione di SegFormer, che consente l'estrazione accurata e la preservazione di motivi culturali complessi ed elementi strutturali. Secondo, viene introdotto un nuovo CAFFM per fondere efficacemente le caratteristiche di segmentazione con rappresentazioni generative, consentendo al modello di catturare relazioni a lungo raggio tra motivi culturali e pattern stilistici artistici. Terzo, il CAFFM proposto migliora la preservazione di elementi culturalmente significativi, aumentando al contempo il realismo visivo e la coerenza strutturale dei pattern del patrimonio ricostruiti. Quarto, integrando CycleGAN per la ricostruzione di pattern culturali e SPADE per la sintesi artistica guidata dalla segmentazione, il framework garantisce sia accuratezza semantica sia autenticità stilistica nelle uscite generate. Quinto, al fine di migliorare la generalizzazione e la diversità artistica, il modello viene addestrato utilizzando il dataset di motivi culturali del Batik Miao per l'apprendimento dei pattern culturali e il dataset WikiArt per la rappresentazione dello stile artistico. WikiArt funge da dataset ausiliario per valutare la capacità di generalizzazione del framework, la robustezza nell'apprendimento delle caratteristiche e l'efficacia del controllo stilistico in diversi contesti visivi, piuttosto che come stile bersaglio per un'applicazione diretta nei prodotti del patrimonio culturale Miao. Infine, rispetto ai metodi esistenti basati su GAN per la ricostruzione del patrimonio culturale, i risultati sperimentali dimostrano che il framework proposto SegCycle-SPADE raggiunge una maggiore accuratezza di segmentazione, qualità di ricostruzione e coerenza stilistica.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il framework proposto di SegCycle-SPADE è stato progettato per ricostruire e migliorare i motivi tradizionali del patrimonio culturale attraverso la segmentazione semantica, il potenziamento delle caratteristiche mediante meccanismi di attenzione, la ricostruzione generativa e la sintesi di stili artistici. Questo studio ha utilizzato dataset pubblici di immagini artistiche e del patrimonio culturale, inclusi il dataset Miao Batik e il dataset WikiArt. La ricerca non ha coinvolto partecipanti umani, dati di pazienti, informazioni personali, soggetti animali o cartelle cliniche; pertanto, non è stato richiesto l'approvazione del comitato etico istituzionale né il consenso informato. Inizialmente, il dataset dei motivi culturali Miao Batik e il dataset WikiArt sono stati utilizzati per la valutazione. Il dataset Miao Batik è stato descritto in Quan et al. (2024)32 e contiene 15.148 immagini annotate di motivi tradizionali di batik Miao. Le annotazioni esistenti fornite dagli autori del dataset sono state utilizzate direttamente, senza generare ulteriori annotazioni manuali in questo studio. Successivamente, è stato effettuato il preelaborazione delle immagini mediante ridimensionamento, normalizzazione, rimozione del rumore e creazione di una maschera di segmentazione. I parametri esatti di preelaborazione sono descritti nella sottosezione Preelaborazione dei dati. Il framework proposto utilizza un modello basato su trasformatori denominato SegFormer-B2 per la segmentazione semantica dei dati. Il metodo è progettato per rilevare le regioni chiave dei motivi culturali e apprenderne la struttura. Le caratteristiche segmentate vengono quindi potenziate mediante un meccanismo di attenzione, in cui le informazioni rilevanti relative ai motivi culturali sono enfatizzate e quelle irrilevanti vengono eliminate. La configurazione del meccanismo di attenzione è descritta nella sottosezione CAFFM. Le caratteristiche potenziate vengono quindi elaborate da CycleGAN, dove strutture danneggiate vengono ricostruite attraverso un apprendimento ciclico. Durante l'addestramento, campioni di motivi incompleti sono stati creati artificialmente applicando operazioni di mascheratura casuale e occlusione parziale alle immagini originali di Miao Batik. Queste procedure di degradazione hanno simulato la perdita di regioni di motivi e danni strutturali comunemente osservati in manufatti del patrimonio culturale deteriorati. Le immagini risultanti, incomplete, sono state utilizzate come input per il modulo di ricostruzione di CycleGAN, mentre le corrispondenti immagini originali sono state utilizzate come obiettivi di ricostruzione. I motivi del patrimonio culturale ricostruiti vengono quindi ulteriormente migliorati tramite SPADE, dove viene effettuato un potenziamento artistico basato sulle mappe di segmentazione generate. Le prestazioni del framework proposto sono state valutate mediante metriche quantitative di segmentazione e di qualità dell'immagine, mentre l'autenticità visiva dei motivi culturali ricostruiti è stata valutata qualitativamente. L'autenticità visiva è stata valutata mediante ispezione visiva dei motivi culturali generati e non è stata utilizzata come metrica quantitativa indipendente. La valutazione si è concentrata sulla conservazione del motivo, coerenza semantica, caratteristiche culturali, coerenza strutturale e aspetto artistico rispetto ai corrispondenti motivi culturali di riferimento. La valutazione quantitativa delle prestazioni del modello è stata effettuata utilizzando Accuratezza di Segmentazione, IoU, Coefficiente di Dice, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) e Fréchet Inception Distance (FID). Figura 2 illustra il flusso di lavoro complessivo del framework proposto SegCycle-SPADE e riassume le metriche di valutazione utilizzate in questo studio.

figure-protocol-1
Figura 2. Flusso di Lavoro dell'Architettura Generale del Framework Proposto SegCycle-SPADE. Panoramica dell'intero flusso di lavoro di SegCycle-SPADE. Le immagini provenienti dai dataset Miao Batik e WikiArt vengono preelaborate prima di essere sottoposte a segmentazione semantica mediante SegFormer-B2, potenziamento delle caratteristiche tramite CAFFM, ricostruzione del motivo mediante CycleGAN e generazione dello stile artistico tramite SPADE. Le prestazioni del modello vengono valutate utilizzando l'accuratezza di segmentazione, l'indice di sovrapposizione (Intersection over Union, IoU), il coefficiente di Dice, l'indice di similarità strutturale (Structural Similarity Index Measure, SSIM), il PSNR e la Fréchet Inception Distance (FID), mentre l'autenticità visiva viene valutata in modo qualitativo. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Il framework SegCycle-SPADE per la ricostruzione di motivi del patrimonio culturale è progettato per integrare più componenti di apprendimento profondo (DL) al fine di ottenere una segmentazione precisa dei motivi, una loro ricostruzione e un miglioramento artistico, come illustrato nella Figura 2. Vengono utilizzate immagini dal dataset dei motivi culturali del Batik Miao e dal dataset WikiArt per fornire una varietà di pattern culturali e stili artistici. Inizialmente, le immagini vengono elaborate mediante un modulo di segmentazione semantica basato su SegFormer, per identificare e delimitare i motivi culturali rispetto allo sfondo. L'architettura complessiva comprende quattro fasi principali. Primo, il modello SegFormer estrae mappe di segmentazione semantica dalle immagini dei pattern culturali. Secondo, il CAFFM integra le caratteristiche di segmentazione con rappresentazioni generative per potenziare l'apprendimento delle caratteristiche. Terzo, il modulo CycleGAN ricostruisce i pattern culturali utilizzando le rappresentazioni di caratteristiche fuse. Infine, il modulo SPADE genera output artisticamente migliorati preservando la coerenza strutturale attraverso una sintesi guidata dalla segmentazione. Le mappe di caratteristiche affinate vengono successivamente elaborate dal modulo di ricostruzione CycleGAN, che apprende a ripristinare i motivi culturali incompleti mappando i pattern degradati alle loro forme complete corrispondenti. Campioni di motivi incompleti sono stati generati applicando operazioni casuali di mascheramento e occlusione parziale alle immagini originali del Batik Miao, simulando così regioni di pattern mancanti e degrado strutturale comunemente osservati in manufatti culturali danneggiati. Ogni immagine degradata è stata abbinata alla rispettiva immagine originale, che ha funto da obiettivo di ricostruzione durante l'addestramento. Questa strategia ha permesso al modulo CycleGAN di apprendere il ripristino delle strutture dei motivi mancanti preservando coerenza semantica e caratteristiche culturalmente significative. Infine, il generatore SPADE produce output artistici visivamente migliorati condizionando la sintesi dell'immagine sulle mappe di segmentazione generate, mantenendo così l'integrità strutturale dei motivi culturali durante tutto il processo di miglioramento artistico.

I seguenti passaggi sono coinvolti nel framework proposto SegCycle-SPADE.

Passaggio 1: Raccolta del dataset
Sono stati utilizzati due dataset per raggiungere gli obiettivi di apprendimento dei modelli culturali e di generazione dello stile artistico. Il Miao Batik Cultural Motif Dataset è stato impiegato per fornire informazioni sui modelli culturali tradizionali. Il dataset è disponibile pubblicamente su Zenodo (https://doi.org/10.5281/zenodo.20807658) e contiene 15.148 immagini annotate di motivi tradizionali di batik Miao. Le annotazioni esistenti fornite dai creatori del dataset sono state utilizzate direttamente, e nessuna ulteriore annotazione manuale è stata prodotta in questo studio. Il dataset WikiArt è stato utilizzato per fornire informazioni diversificate sullo stile artistico finalizzate alla generazione dello stile artistico ed è stato ottenuto dal repository pubblico WikiArt (https://www.wikiart.org/).

Passaggio 2: Preelaborazione dei dati
Tutte le immagini sono state preelaborate mediante ridimensionamento, normalizzazione e riduzione del rumore. Le annotazioni esistenti dei motivi culturali ottenute dalle fonti originali del set di dati sono state utilizzate per supportare la fase di segmentazione semantica. Non sono state eseguite ulteriori procedure di annotazione o ri-etichettatura nell'ambito di questo studio.

Passaggio 3: Segmentazione dei Motivi Semantici mediante SegFormer
Il modello SegFormer è stato utilizzato per la segmentazione dei motivi culturali. Il backbone esatto di SegFormer e la strategia di inizializzazione sono descritti nel sottosezione Semantic Pattern Segmentation Using SegFormer. In particolare, è stata impiegata l'architettura SegFormer-B2 con un backbone MIT-B2 preaddestrato su ImageNet per la segmentazione semantica dei motivi. Questo modello cattura efficacemente informazioni contestuali globali preservando al contempo i dettagli strutturali complessi dei pattern culturali tradizionali.

Passaggio 4: CAFFM
Il CAFFM combina caratteristiche di segmentazione semantica con rappresentazioni generative, consentendo al framework di apprendere sia le caratteristiche dei motivi strutturali sia le informazioni relative allo stile artistico. I dettagli dell'integrazione del CAFFM sono forniti nel sottosezione CAFFM. Il modulo è posizionato tra la fase di segmentazione semantica basata su SegFormer e la fase di ricostruzione generativa, dove fonde le caratteristiche strutturali derivate dalla segmentazione con le caratteristiche di ricostruzione attraverso un'attenzione incrociata multi-testa. Questo processo migliora la preservazione dei motivi culturali e aumenta il realismo degli output ricostruiti.

Passaggio 5: Ricostruzione del modello (CycleGAN)
Le caratteristiche fuse vengono successivamente elaborate dal modulo CycleGAN per ricostruire le strutture dei modelli culturali. L'architettura CycleGAN e la configurazione di addestramento sono descritte nel sottosezione Ricostruzione del modello mediante CycleGAN. Il modulo di ricostruzione è costituito da due generatori e due discriminatori, utilizza un'architettura di rete residua con nove blocchi residui, impiega un discriminatore PatchGAN ed è addestrato mediante perdite avversarie e di coerenza ciclica. Questa configurazione consente una mappatura bidirezionale tra domini e facilita la ricostruzione di strutture di modelli culturali incomplete.

Passaggio 6: Generazione di Stile Artistico (SPADE)
I modelli ricostruiti vengono quindi elaborati tramite il modulo SPADE per eseguire la sintesi guidata da segmentazione dello stile artistico. La configurazione del generatore SPADE è descritta nel sottosezione Generazione di Stile Artistico Mediante SPADE. Il modulo utilizza blocchi residui SPADE, strati di normalizzazione adattiva spaziale e condizionamento semantico derivati dalle mappe di segmentazione di SegFormer e dalle rappresentazioni caratteristiche di CAFFM. Condizionando la generazione delle immagini sulle mappe di segmentazione, gli output sintetizzati mantengono un allineamento strutturale con i motivi culturali originali, incorporando al contempo caratteristiche stilistiche artistiche.

Passaggio 7: Valutazione delle Prestazioni
Il framework proposto è stato valutato mediante l'utilizzo di diverse metriche di segmentazione e di valutazione della qualità delle immagini, inclusi Accuratezza di Segmentazione, IoU, Coefficiente di Similarità di Dice (Dice), SSIM, PSNR e FID. Per valutare la coerenza sperimentale, tutti gli esperimenti sono stati ripetuti cinque volte utilizzando diversi semi casuali, e i risultati sono riportati come media ± deviazione standard. La significatività statistica è stata valutata mediante test t appaiati, con una soglia di significatività di p < 0,05.

Raccolta del dataset
Nel framework proposto di SegCycle-SPADE, vengono utilizzati due dataset per la comprensione dei modelli culturali e l'apprendimento dello stile. Il primo dataset impiegato nel framework proposto è il dataset dei motivi culturali del Batik Miao. Questo dataset contiene motivi culturali del Batik Miao, che in genere sono immagini tradizionali del Batik Miao contenenti elementi come animali, piante e forme geometriche, utilizzati nell'arte dell'etnia Miao. Il dataset comprende immagini con informazioni testurali ricche, generalmente importanti per la conservazione del patrimonio culturale. Il secondo dataset impiegato nel framework proposto di SegCycle-SPADE è il dataset WikiArt. Questo dataset contiene un elevato numero di opere d'arte, provenienti generalmente da stili diversi. Il dataset viene utilizzato per l'apprendimento di stili complessi, utile in generale per migliorare le opere artistiche. Il dataset comprende 80.000 opere d'arte in alta definizione, con 27 design differenti, risultando così particolarmente adatto per compiti di generazione o trasformazione dello stile basati su reti profonde (DL).

Dataset Miao Batik:
Il dataset Miao Batik (https://doi.org/10.5281/zenodo.20807658) comprende 15.148 immagini di motivi batik che raffigurano elementi culturalmente significativi. Le immagini includono una varietà di disegni tradizionali, come motivi animali (ad esempio farfalle e pesci), pattern a base vegetale e motivi geometrici portatori di simbolismo culturale. Questo dataset rappresenta un componente fondamentale del framework proposto poiché fornisce strutture culturali autentiche che consentono al modulo di segmentazione di identificare e preservare con precisione i confini dei motivi durante la ricostruzione del pattern (Tabella 1). In questo studio, i motivi culturalmente importanti si riferiscono a elementi visivi simbolici comunemente documentati nella letteratura sul patrimonio culturale Miao e rappresentati nelle annotazioni del dataset, inclusi uccelli, farfalle, motivi floreali e totem ancestrali. Tali motivi sono stati selezionati in base alla loro documentata rilevanza culturale e alla loro ricorrenza nei disegni tradizionali di batik e ricami Miao, piuttosto che esclusivamente sulla base della frequenza di occorrenza o della composizione spaziale. Le annotazioni dei motivi guidate da esperti e le etichette di segmentazione sono state ottenute dalla fonte originale del dataset Miao Batik e sono state utilizzate direttamente in questo studio. Gli autori non hanno effettuato ulteriori annotazioni manuali, ripetute etichettature o procedure di annotazione guidate da esperti. Le annotazioni esistenti fornite dai creatori del dataset sono state utilizzate per l'addestramento e la valutazione della segmentazione semantica.

ParametroDescrizione
Nome del datasetMiao Batik Cultural Pattern Dataset
Fonte del datasetZenodo Repository (DOI: 10.5281/zenodo.20807658)
DominioPatrimonio Culturale Immateriali (ICH) / Analisi dei Motivi Tessili
Numero totale di immagini15.148 immagini
Tipo di immagineImmagini digitali di motivi tradizionali tessili Miao batik
Categorie di motiviMotivi animali, motivi vegetali e motivi geometrici
Origine culturaleCultura etnica Miao, Provincia di Guizhou, Cina
Risoluzione originale delle immaginiImmagini ad alta risoluzione (tipicamente ≥ 1.000 pixel sul lato più corto) acquisite come scansioni o fotografie raw prima della pre-elaborazione
Risoluzione per l'addestramentoImmagini ridimensionate a 256 × 256 pixel durante la pre-elaborazione
Disponibilità di annotazioniLe annotazioni di segmentazione esistenti fornite dai creatori del dataset sono state utilizzate senza modifiche per l'addestramento e la valutazione. Nessuna ulteriore annotazione manuale, ri-etichettatura o procedura di verifica da esperti è stata eseguita in questo studio.
Applicazione in questo studioSegmentazione dei motivi culturali, estrazione delle caratteristiche, conservazione dei motivi e ricostruzione dei pattern

Tabella 1: Caratteristiche del Dataset dei Motivi Culturali del Batik Miao. Riepilogo del dataset di motivi culturali del batik Miao utilizzato per la segmentazione semantica, l'analisi dei pattern culturali e la ricostruzione dei motivi. La tabella descrive la provenienza del dataset, le caratteristiche delle immagini, le categorie di motivi, l'origine culturale, la risoluzione delle immagini e il ruolo all'interno del framework proposto SegCycle-SPADE.

Dataset WikiArt:
Il dataset WikiArt [https://www.wikiart.org/] è un ampio archivio digitale di opere d'arte molto utilizzato, composto da oltre 80.000 immagini appartenenti a 27 stili artistici diversi riportati nella Tabella 2. Gli stili includono l'arte rinascimentale, l'impressionismo, il cubismo e il surrealismo. Il dataset è molto importante nel contesto del framework proposto poiché fornisce conoscenze che permettono al modulo SPADE di generare motivi arricchiti culturalmente mantenendo al contempo le informazioni strutturali ottenute dal processo di segmentazione. Il dataset comprende 56.000 immagini per l'addestramento e 12.000 immagini destinate sia alla validazione che al test. Le immagini presenti nel dataset contribuiscono in modo efficace all'addestramento del modello di apprendimento profondo (DL).

ParametroDescrizione
Nome del datasetDataset WikiArt
Fonte del datasetArchivio WikiArt (https://www.wikiart.org/)
DominioArte digitale e dipinti
Numero totale di immaginiCirca 80.000 opere d'arte
Immagini di addestramento56.000
Immagini di validazione12.000
Immagini di test12.000
Stili artistici27 stili artistici, tra cui Rinascimento, Impressionismo, Cubismo, Surrealismo, Espressionismo, Realismo e Arte astratta
Risoluzione originale delle immaginiLe risoluzioni originali delle immagini variano a seconda delle opere e delle fonti. Le immagini sono state ridimensionate a una risoluzione uniforme di 256 × 256 pixel durante la fase di pre-elaborazione.
Risoluzione di addestramentoLe immagini sono state ridimensionate a 256 × 256 pixel durante la pre-elaborazione, prima dell'apprendimento degli stili artistici e della sintesi guidata dalla segmentazione.
Partizionamento del datasetPartizionamento casuale stratificato (70% addestramento, 15% validazione e 15% test) utilizzando un seme casuale fisso pari a 42
Strategia di campionamento degli stiliÈ stato adottato un campionamento proporzionale stratificato per preservare la distribuzione dei 27 stili artistici nei sottoinsiemi di addestramento, validazione e test
Applicazione in questo studioApprendimento degli stili artistici, rappresentazione degli stili e sintesi artistica guidata dalla segmentazione

Tabella 2: Caratteristiche del Dataset WikiArt. Riepilogo del dataset WikiArt utilizzato per l'apprendimento dello stile artistico e la sintesi di immagini guidata dallo stile. La tabella descrive la provenienza del dataset, la distribuzione delle immagini, la copertura degli stili artistici, la suddivisione del dataset, la risoluzione delle immagini e la sua applicazione all'interno del framework proposto SegCycle-SPADE.

Il dataset Miao Batik contiene 15.148 immagini rappresentative di motivi culturali tradizionali Miao.32 Il dataset è disponibile pubblicamente tramite Zenodo (https://doi.org/10.5281/zenodo.20807658). Prima dell'addestramento del modello, tutte le immagini sono state ispezionate visivamente e ridimensionate a 256 × 256 pixel, normalizzate e sottoposte a screening per individuare campioni corrotti o duplicati. Lo screening di controllo qualità non ha portato all'esclusione di alcuna immagine; pertanto, tutte le 15.148 immagini sono state mantenute per le analisi successive. Il dataset è stato suddiviso casualmente in sottoinsiemi di training (70%), validazione (15%) e test (15%) utilizzando un seme casuale fisso pari a 42 per garantire la riproducibilità delle suddivisioni del dataset. Il dataset WikiArt è stato ottenuto tramite il repository ufficiale WikiArt (https://www.wikiart.org/) e contiene oltre 80.000 opere d'arte appartenenti a 27 stili artistici differenti. Per gli esperimenti di apprendimento degli stili, sono state utilizzate 56.000 immagini per l'addestramento, 12.000 per la validazione e 12.000 per il test.

Preelaborazione dei dati
Prima di addestrare il framework proposto SegCycle-SPADE, il dataset dei motivi culturali del Batik Miao e il dataset WikiArt sono stati sottoposti a diverse fasi di preelaborazione per garantire una qualità dell'immagine coerente e una rappresentazione precisa delle caratteristiche. La stessa pipeline fondamentale di preelaborazione, inclusa la riduzione del rumore mediante filtro gaussiano, la normalizzazione, il ridimensionamento a una risoluzione di ingresso uniforme e la verifica della qualità delle immagini, è stata applicata a entrambi i dataset. Tuttavia, i dataset hanno svolto ruoli distinti all'interno del framework. Il dataset WikiArt è stato utilizzato per l'apprendimento e la sintesi dello stile artistico, mentre il dataset Batik Miao è stato impiegato principalmente per la segmentazione e la ricostruzione dei motivi culturali. Non sono state apportate modifiche specifiche ai dataset al di là di questi ruoli legati al compito. Per garantire un'elaborazione coerente da parte del modello di apprendimento profondo (DL), le immagini sono state innanzitutto ridimensionate a una risoluzione fissa. Questo passaggio era necessario poiché le immagini nei due dataset presentavano risoluzioni variabili a seconda della fonte. Il ridimensionamento ha migliorato l'efficienza computazionale e ha evitato inconsistenze dimensionali che avrebbero potuto influire sull'addestramento. Il secondo passaggio di preelaborazione è stato quello della normalizzazione, in cui i valori dei pixel sono stati scalati a un intervallo standardizzato per stabilizzare gli aggiornamenti del gradiente durante l'addestramento. Successivamente, le immagini sono state elaborate mediante filtraggio gaussiano per ridurre il rumore che avrebbe potuto interferire con le strutture dei motivi culturali. Per il dataset Batik Miao, le maschere di segmentazione esistenti dei motivi culturali, ottenute direttamente dalla fonte originale del dataset, sono state utilizzate senza modifiche per l'addestramento e la valutazione della segmentazione semantica. Non sono state generate nuove maschere di segmentazione specificamente per questo studio.

Salvo diversa indicazione, le equazioni che descrivono metodi consolidati sono state adattate da studi precedenti e citate di conseguenza. Le equazioni che descrivono il CAFFM proposto e il framework composito di ottimizzazione SegCycle-SPADE sono state sviluppate dagli autori per questo studio.

Si consideri un'immagine di input del dataset rappresentata come Equazione 1:

figure-protocol-2  (1)

Qui, H, W e C indicano rispettivamente l'altezza dell'immagine, la larghezza e il numero di canali colore. Tutte le immagini vengono ridimensionate a una dimensione fissa H′ × W′, come mostrato nella Equazione 2:

figure-protocol-3

Qui, Ir è l'immagine ridimensionata. I valori normalizzati dei pixel sono calcolati secondo la Equazione 3:

figure-protocol-4   (3)

Ciò contribuisce a stabilizzare la procedura di addestramento. La filtrazione del rumore viene eseguita utilizzando un filtro gaussiano, come mostrato nella Equazione 4:

figure-protocol-5

Qui, G(σ) è un filtro gaussiano e * rappresenta la convoluzione. È stato utilizzato un filtro gaussiano con kernel 5 × 5 e deviazione standard σ = 1.0. È stato applicato un padding riflettente ai pixel dei bordi al fine di ridurre gli artefatti ai margini. Prima della riduzione di scala e della normalizzazione, il processo di denoising è stato eseguito immediatamente dopo il caricamento dell'immagine. Per garantire una preelaborazione uniforme durante tutto lo studio, la stessa configurazione del filtro è stata applicata a ogni immagine nei dataset Miao Batik e WikiArt. Per il dataset Miao Batik, le maschere di segmentazione sono create secondo l'Equazione 5:

figure-protocol-6

In questo caso, M è una maschera di segmentazione utilizzata per guidare il modello SegFormer.

La pipeline di preelaborazione inizia con l'acquisizione di immagini dal dataset Miao Batik e dal dataset WikiArt, come mostrato in Figura 3. Durante l'addestramento non sono state impiegate tecniche di aumento dei dati. Dopo il preelaborazione, che includeva il ridimensionamento, la normalizzazione, la denoising gaussiana e la preparazione delle maschere di segmentazione, le immagini sono state utilizzate direttamente per l'addestramento, la validazione e il testing del framework proposto SegCycle-SPADE. Il primo passo della pipeline di preelaborazione consiste nel ridimensionare le immagini a una dimensione fissa, consentendo al modello di apprendimento profondo (DL) di elaborarle in modo più efficiente. Il secondo passo prevede la normalizzazione, che converte i valori dei pixel in un intervallo numerico standardizzato e facilita la convergenza del modello. Il terzo passo riguarda la rimozione del rumore, mediante il quale le immagini vengono ripulite da rumori indesiderati per migliorare il riconoscimento dei pattern. Inoltre, per il dataset Miao Batik, le regioni dei motivi culturali vengono annotate, consentendo la generazione di maschere utilizzate nel modulo di segmentazione del modello proposto, garantendo così che i motivi culturali siano preservati durante la generazione. L'output finale di questa fase è un dataset pulito, pronto per l'addestramento dei moduli di segmentazione e generazione del modello proposto.

figure-protocol-7
Figura 3. Pipeline di Pre-elaborazione dei Dati per Immagini del Patrimonio Culturale. Flusso di lavoro che illustra le procedure di pre-elaborazione delle immagini applicate prima dell'addestramento del modello. Il pipeline comprende l'acquisizione del dataset, il ridimensionamento delle immagini, la normalizzazione, la riduzione del rumore mediante filtro gaussiano, le annotazioni esistenti dei motivi culturali e la preparazione delle maschere di segmentazione. Le immagini e le maschere risultanti vengono utilizzate come input per la segmentazione semantica e la ricostruzione dei pattern. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Ogni immagine è stata sottoposta a un processo di controllo qualità prima dell'addestramento del modello. Il dataset Miao Batik conteneva 15.148 immagini. Campioni corrotti, duplicati e di bassa qualità erano già stati gestiti dai creatori originali del dataset; pertanto, nessuna ulteriore immagine è stata esclusa durante il controllo qualità in questo studio. Di conseguenza, tutte le 15.148 immagini sono state mantenute per l'analisi. Le immagini sono state caricate in formato RGB durante la pre-elaborazione e ridimensionate a 256 × 256 pixel utilizzando l'interpolazione bilineare. I valori dei pixel sono stati scalati dall'intervallo [0, 255] a [0, 1] dividendo per 255. Successivamente è stata applicata la normalizzazione per canale utilizzando valori medi di [0,485, 0,456, 0,406] e valori di deviazione standard di [0,229, 0,224, 0,225] per i canali rosso, verde e blu, rispettivamente. La pipeline di pre-elaborazione includeva il caricamento delle immagini, la conversione in RGB, il ridimensionamento, la scalatura dei valori dei pixel, la normalizzazione e la conversione in tensori. Quando necessario, le immagini in scala di grigi sono state convertite in formato RGB a tre canali per mantenere la compatibilità con i modelli di apprendimento profondo (DL). Dopo la pre-elaborazione, le immagini sono state suddivise in sottoinsiemi di training, validazione e test. Tutte le fasi del framework SegCycle-SPADE — inclusi segmentazione semantica, fusione di caratteristiche, ricostruzione del motivo e sintesi artistica basata su SPADE — hanno utilizzato una risoluzione di ingresso costante di 256 × 256 pixel.

Segmentazione Semantica basata su Pattern utilizzando SegFormer
Dopo questo passaggio di preelaborazione, le immagini pulite e normalizzate del dataset dei motivi culturali del Batik Miao e del dataset WikiArt vengono inserite nel modulo di segmentazione semantica basato sul framework proposto di SegFormer-B2. Lo scopo di questo passaggio è identificare correttamente e separare i motivi culturali presenti nei pattern del patrimonio artistico. Il framework proposto di SegFormer si basa su un'architettura transformer che incorpora un encoder Transformer gerarchico e un decoder MLP leggero, al fine di catturare con precisione informazioni contestuali globali e dettagliate informazioni strutturali provenienti da complessi pattern del patrimonio artistico. Il modello estrae innanzitutto rappresentazioni delle caratteristiche a più scale dall'immagine in ingresso, seguite da una fusione di queste rappresentazioni attraverso il decoder per generare pattern segmentati con accuratezza. Ciò garantisce che i pattern presenti nell'immagine del patrimonio siano segmentati correttamente in motivi come pattern geometrici, floreali e simbolici, separandoli così dallo sfondo e mantenendone al contempo l'integrità strutturale. Queste informazioni strutturali verranno successivamente utilizzate nelle fasi successive di generazione dei pattern all'interno del framework SegCycle-SPADE.

Si rappresenti l'immagine di input preelaborata come Equation 6:

figure-protocol-8    (6)

L'encoder SegFormer suddivide l'immagine in porzioni e estrae caratteristiche gerarchiche utilizzando strati transformer, come mostrato nella Equazione 71:

figure-protocol-9

In questo caso, F indica le mappe di caratteristiche multiscala ottenute dall'encoder transformer. Queste caratteristiche codificano sia i pattern locali di texture sia le relazioni contestuali globali tra le regioni del motivo. Il modello SegFormer estrae le mappe di caratteristiche a diverse scale come definito nella Equazione 8:

figure-protocol-10

L'utilizzo di rappresentazioni multiscala facilita il rilevamento di schemi di dimensioni diverse all'interno dei motivi culturali. Infine, le caratteristiche vengono combinate utilizzando il decodificatore MLP come mostrato nella Equazione 91:
 figure-protocol-11

In questo caso, S indica la mappa finale di segmentazione predetta.

Il backbone SegFormer-B2 è stato inizializzato utilizzando pesi preaddestrati su ImageNet e successivamente affinato sul dataset Miao Batik per la segmentazione dei motivi culturali. Il checkpoint preaddestrato è stato ottenuto dall'implementazione ufficiale di SegFormer. In particolare, il checkpoint MIT-B2 preaddestrato su ImageNet-1K (mit_b2.pth) fornito dal repository ufficiale di SegFormer è stato utilizzato per inizializzare il backbone SegFormer-B2 prima dell'affinamento. I pesi preaddestrati corrispondono al backbone MIT-B2 rilasciato dagli autori di SegFormer e sono serviti come modello iniziale per l'addestramento della segmentazione semantica. I restanti strati specifici per il compito sono stati inizializzati utilizzando le procedure di inizializzazione dei pesi predefinite di PyTorch prima dell'addestramento.

Viene utilizzato un codificatore Transformer gerarchico a quattro stadi con incorporamenti di patch sovrapposti. Nella fase iniziale, la dimensione della patch è stata impostata a 7 × 7 con uno stride di 4. Per ciascuno dei quattro stadi del codificatore, le dimensioni degli embedding erano rispettivamente 64, 128, 320 e 512. Nei quattro stadi erano presenti 1, 2, 5 e 8 testine di attenzione multi-testa, e le profondità corrispondenti del codificatore erano rispettivamente 3, 4, 6 e 3 livelli. Le caratteristiche multiscala recuperate dal codificatore sono state aggregate utilizzando un decoder leggero completamente basato su MLP. Prima di creare la mappa finale di segmentazione, il decoder ha proiettato le caratteristiche di ogni stadio del codificatore in un singolo spazio di embedding. Tutti i blocchi Transformer hanno utilizzato la funzione di attivazione Gaussian Error Linear Unit (GELU). È stato applicato un tasso di dropout pari a 0,1 durante l'addestramento per migliorare la capacità di generalizzazione e ridurre l'overfitting.

Durante la fase di addestramento, il framework SegFormer riceve le immagini preelaborate da entrambi i dataset. Le immagini del dataset Miao Batik contengono regioni di motivi che fungono da etichette per l'apprendimento supervisionato del modello di segmentazione. L'encoder Transformer elabora l'intera immagine e cattura le relazioni a lungo raggio tra i componenti dell'immagine, aspetto particolarmente importante per i motivi tradizionali del batik che presentano elementi distribuiti spazialmente. Il meccanismo gerarchico di estrazione delle caratteristiche cattura contemporaneamente strutture locali, come texture geometriche ripetute. Il decoder MLP elabora queste caratteristiche estratte e produce una maschera di segmentazione che evidenzia le regioni dei motivi. Le mappe di segmentazione generate in questa fase vengono successivamente utilizzate come input strutturali per il modulo di attenzione e per la fase di ricostruzione del motivo, contribuendo così a preservare l'autenticità dei motivi generati.

I motivi culturali sono stati suddivisi in diverse classi per la segmentazione semantica in base alle loro caratteristiche visive e culturali. La tassonomia di segmentazione comprendeva motivi animali (ad esempio, farfalle, pesci, uccelli e altre fauna simboliche), motivi vegetali (ad esempio, fiori, foglie, rampicanti e motivi botanici), motivi geometrici (ad esempio, forme ripetute, bordi e strutture geometriche astratte) e aree di sfondo che rappresentano zone prive di motivi. Maschere di segmentazione a livello di pixel sono state utilizzate per assegnare ogni pixel a una delle classi predefinite. Le etichette intere sono state codificate nel seguente modo: Etichetta 0 = sfondo, Etichetta 1 = motivi animali, Etichetta 2 = motivi vegetali ed Etichetta 3 = motivi geometrici. Le annotazioni di segmentazione e le etichette dei motivi sono state ottenute direttamente dalla fonte originale del dataset Miao Batik. In questo studio non sono state eseguite ulteriori annotazioni manuali, operazioni di rietichettatura, verifiche dei contorni o procedure di conferma da esperti. Le annotazioni esistenti fornite dai creatori del dataset sono state utilizzate senza modifiche per l'addestramento e la valutazione.

Il modello SegFormer per la segmentazione di motivi culturali elabora le immagini preelaborate del dataset Miao Batik e del dataset WikiArt utilizzando un meccanismo basato su trasformatori per una rilevazione accurata delle regioni di motivi culturali, come mostrato in Figura 4. In primo luogo, l'immagine in ingresso contenente motivi culturali tradizionali viene fornita al modello SegFormer. L'encoder Transformer estrae sia informazioni contestuali globali sia caratteristiche strutturali locali da porzioni dell'immagine. Le caratteristiche risultanti multiscala vengono fornite al decoder di segmentazione, che utilizza una rete feed-forward ibrida per affinare le rappresentazioni delle caratteristiche e migliorare il rilevamento dei motivi. L'uscita del modello SegFormer è una maschera di segmentazione che evidenzia i pixel corrispondenti ai motivi culturali, sopprimendo al contempo le informazioni di sfondo irrilevanti. I motivi culturali isolati fungono quindi da guida strutturale per le fasi successive del framework SegCycle-SPADE.

figure-protocol-12
Figura 4. Segmentazione Semantica Basata su SegFormer-B2 di Motivi Culturali. Architettura del modulo di segmentazione semantica SegFormer-B2 utilizzato per l'estrazione di motivi culturali, addestrato esclusivamente sul dataset Miao Batik. Il framework comprende un encoder basato su Transformer per l'estrazione di caratteristiche multiscala e un decoder di segmentazione leggero per la generazione di maschere dei motivi. Il modello predice quattro classi semantiche—animale, vegetale, geometrico e sfondo—dove le maschere di segmentazione risultanti identificano regioni di motivi culturalmente significative sopprimendo le informazioni di sfondo irrilevanti. Questi output di segmentazione forniscono un orientamento strutturale per le fasi successive di fusione delle caratteristiche, ricostruzione e sintesi artistica del framework proposto SegCycle-SPADE. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Non è necessario creare nuove annotazioni per la segmentazione nel framework proposto. Il dataset Miao Batik è stato ottenuto da una fonte pubblica già esistente e il modello è stato addestrato utilizzando le informazioni sui motivi fornite dagli autori del dataset. Durante il processo di apprendimento, il modello SegFormer ha prodotto mappe di segmentazione semantica. Di conseguenza, lo studio attuale non ha richiesto alcun software aggiuntivo per l'annotazione manuale, linee guida per l'annotazione o procedure di controllo della qualità delle annotazioni.

CAFFM
Per migliorare l'interazione tra le caratteristiche della segmentazione semantica e le rappresentazioni della ricostruzione generativa, lo studio ha inoltre proposto un CAFFM. L'encoder SegFormer-B2 fornisce mappe di caratteristiche semantiche al modulo CAFFM, mentre il passaggio di ricostruzione CycleGAN fornisce mappe di caratteristiche generative. In primo luogo, vengono utilizzati strati di proiezione lineare per proiettare entrambi i flussi di caratteristiche in uno spazio di incorporamento comune. Per il calcolo dell'attenzione incrociata, vengono create rappresentazioni di query (Q), chiave (K) e valore (V) utilizzando i tensori di caratteristiche generati. Le relazioni tra le informazioni sui motivi strutturali e gli elementi di stile artistico sono quindi modellate mediante un'attenzione incrociata multi-testa. Successivamente, vengono applicate normalizzazione a livello di strato, connessioni residue e strati feed-forward con attivazione GELU alle rappresentazioni di caratteristiche fuse. Il risultato del modulo CAFFM viene inviato alla fase di sintesi basata su SPADE, consentendo così di preservare temi culturalmente significativi senza compromettere la coerenza artistica.

Per garantire la compatibilità delle caratteristiche, le caratteristiche di ingresso vengono inizialmente proiettate, mediante strati di proiezione lineare, in uno spazio di incorporamento condiviso con una dimensione di incorporamento pari a 256. Le interconnessioni tra le informazioni strutturali semantiche e le rappresentazioni stilistiche generative vengono quindi modellate utilizzando un meccanismo di attenzione incrociata MultiHead con otto testine di attenzione. Il calcolo dell'attenzione incrociata utilizza i vettori Query (Q), Key (K) e Value (V), prodotti da specifici strati di trasformazione lineare. Per aumentare la stabilità dell'addestramento e mantenere l'integrità delle caratteristiche, vengono impiegate connessioni residue e la normalizzazione del livello (Layer Normalization) al fine di potenziare ulteriormente le rappresentazioni delle caratteristiche fuse. L'apprendimento non lineare delle caratteristiche viene quindi migliorato applicando una rete feed-forward con la funzione di attivazione Gaussian Error Linear Unit (GELU). Il modulo genera una rappresentazione delle caratteristiche in uscita di dimensione 256, che viene inviata ad altre fasi per la sintesi creativa. Il CAFFM combina con successo i dati dello stile artistico con le strutture dei motivi culturali mediante una tecnica di fusione basata sull'attenzione incrociata, migliorando così la preservazione dei motivi e la coerenza visiva nei modelli del patrimonio culturale ricostruiti.

Nel sistema proposto, le caratteristiche strutturali sono derivate dal dataset Miao Batik, mentre le caratteristiche stilistiche sono apprese dal dataset WikiArt. Sia la mappa delle caratteristiche ottenuta dalla rete di segmentazione SegFormer utilizzando immagini del dataset Miao Batik indicata con Fs, mentre la mappa delle caratteristiche derivata dal ramo di estrazione delle caratteristiche stilistiche utilizzando immagini di WikiArt è indicata con Fa. Il CAFFM proposto combina i due domini delle caratteristiche mediante un meccanismo di cross-attenzione per apprendere sia le dipendenze strutturali che quelle stilistiche dei motivi culturali. Tabella 3 riporta tutte le caratteristiche architetturali, inclusi le dimensioni degli embedding, i livelli di normalizzazione, le funzioni di attivazione e la configurazione delle teste di attenzione. Per una dimensione dell'immagine in ingresso di 256 × 256 pixel, l'encoder SegFormer-B2 ha prodotto mappe delle caratteristiche semantiche di dimensione 64 × 64 × 128, mentre il ramo di estrazione delle caratteristiche stilistiche ha prodotto mappe delle caratteristiche di dimensione 64 × 64 × 128. Entrambe le mappe delle caratteristiche sono state proiettate attraverso layer lineari apprendibili in uno spazio di embedding condiviso di dimensione 256 prima della fusione mediante cross-attenzione.

ParametroConfigurazione
Framework propostoSegCycle-SPADE
Modello di segmentazione semanticaSegFormer-B2
Stadi dell'encoder SegFormer4
Inizializzazione dei pesiSegFormer-B2 preaddestrato su ImageNet-1K (backbone MIT-B2)
Origine del checkpointRepository ufficiale NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); checkpoint: segformer.b2.512x512.ade.160k
Strategia di fine-tuningFinetuning end-to-end sul dataset Miao Batik
Dimensione dell'embedding delle patch7 × 7
Passo delle patch4
Dimensioni dell'embedding64, 128, 320 e 512
Profondità dell'encoder3, 4, 6 e 3
Teste di attenzione1, 2, 5 e 8
Tipo di decoderDecoder completamente MLP
Funzione di attivazioneGELU
Tasso di dropout0,1
Modulo di potenziamento delle caratteristicheModulo di fusione delle caratteristiche culturali con attenzione incrociata (CAFFM)
Dimensione dell'embedding CAFFM256
Teste di attenzione CAFFM8
Scale di fusione CAFFM4
Modello di ricostruzioneCycleGAN
Modello di generazione dello stileSPADE
Dataset culturaleDataset Miao Batik
Dataset dello stileDataset WikiArt
Immagini Miao Batik15.148
Immagini WikiArtCirca 80.000
Risoluzione dell'immagine in ingresso256 × 256 pixel
Formato coloreRGB
Metodo di interpolazioneInterpolazione bilineare
Metodo di denoisingFiltraggio gaussiano
Dimensione del kernel gaussiano5 × 5
Deviazione standard gaussiana (σ)1
Intervallo di normalizzazione[0, 1]
Dimensione del batch16
Numero di epoche100
OttimizzatoreAdam
Tasso di apprendimento0,0002
Parametri di Adamβ₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, weight decay = 0
Funzioni di perditaPerdita di segmentazione, perdita avversaria, perdita di coerenza ciclica, perdita di ricostruzione, perdita di preservazione del motivo e perdita di coerenza stilistica
Strategia di suddivisione del datasetTraining / Validazione / Test
Set di training70%
Set di validazione15%
Set di test15%
Seed casuale42
Metriche di valutazioneAccuratezza di segmentazione, IoU, coefficiente di Dice, SSIM, PSNR e FID
Linguaggio di programmazionePython 3.8.10
Framework di deep learningPyTorch 1.10.0
Piattaforma hardwareGPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11ª generazione), 32 GB RAM
Ambiente operativoUbuntu 20.04 LTS

Tabella 3: Impostazione Sperimentale e Configurazione del Modello. Riepilogo dei componenti architetturali, della configurazione di addestramento, delle impostazioni di preelaborazione, dei set di dati, dei parametri di ottimizzazione, delle metriche di valutazione e dell'ambiente computazionale utilizzati per l'implementazione e la valutazione del framework proposto SegCycle-SPADE.

Il modulo di attenzione mappa innanzitutto la mappa delle caratteristiche in rappresentazioni di query, chiave e valore utilizzando Equazione 10:

figure-protocol-13

Qui, Wq, Wk e Wv sono matrici di pesi apprendibili. I pesi dell'attenzione vengono calcolati in base alla similarità tra il vettore di query e il vettore chiave utilizzando l'equazione 1117

figure-protocol-14

Qui, dk è la dimensione del vettore chiave. La rappresentazione delle caratteristiche migliorata viene calcolata moltiplicando i pesi dell'attenzione con la matrice dei valori utilizzando l'Equazione 12:

figure-protocol-15

Qui, Fa è la rappresentazione migliorata della mappa delle caratteristiche. La rappresentazione migliorata delle caratteristiche viene calcolata combinando le caratteristiche originali di segmentazione con le caratteristiche migliorate ottenute mediante il meccanismo di attenzione utilizzando l'Equazione 13:

figure-protocol-16                                

Qui, Fe è la mappa delle caratteristiche potenziata utilizzata per la ricostruzione del pattern. Il CAFFM viene esteso con un meccanismo di attenzione incrociata multiscala per estrarre caratteristiche relative a motivi culturali a diverse scale. Sia Fsi a indicare le caratteristiche di segmentazione alla scala i, mentre Faj indica le caratteristiche dello stile artistico alla stessa scala. La rappresentazione finale delle caratteristiche è definita mediante la Equazione 14:

  figure-protocol-17

Qui, Qi, Ki e Vi rappresentano rispettivamente le matrici di query, chiave e valore alla scala i, mentre N indica il numero di scale delle caratteristiche. In questo studio, N = 4, corrispondente alle mappe delle caratteristiche estratte a risoluzioni spaziali pari a 1/4, 1/8, 1/16 e 1/32 della dimensione dell'immagine iniziale. Queste rappresentazioni delle caratteristiche multiscala sono state fuse utilizzando pesi di attenzione apprendibili prima della ricostruzione e della sintesi artistica. Questa estensione consente al metodo di estrarre motivi culturali e texture globali per ricostruire modelli culturali. CAFFM è posizionato tra la fase di segmentazione basata su SegFormer e la fase di sintesi creativa basata su SPADE nel sistema proposto SegCycle-SPADE. Innanzitutto, mentre CycleGAN genera contemporaneamente caratteristiche di ricostruzione contenenti informazioni stilistiche e relative ai modelli, SegFormer-B2 recupera mappe delle caratteristiche semantiche che descrivono le proprietà strutturali dei motivi culturali. Il modulo CAFFM riceve questi due flussi di caratteristiche e utilizza una fusione basata sull'attenzione incrociata per identificare le relazioni tra le rappresentazioni strutturali e artistiche. Al fine di creare modelli culturalmente autentici mantenendo coerenza semantica e caratteristiche strutturali, le mappe delle caratteristiche fuse risultanti vengono quindi inviate al modulo SPADE per la sintesi creativa guidata dalla segmentazione.

Ricostruzione del Modello mediante CycleGAN
Una volta completata la fase di potenziamento delle caratteristiche basata sull'attenzione, le mappe delle caratteristiche conterranno le strutture dei motivi culturali potenziate. Tuttavia, le mappe delle caratteristiche potrebbero ancora presentare regioni di modelli incomplete o danneggiate. Pertanto, per affrontare il problema della ricostruzione dei modelli, il framework proposto utilizzerà il modello CycleGAN. Nel framework proposto, i due domini saranno i modelli originali dei motivi culturali e i modelli ricostruiti dei motivi culturali. Utilizzando le caratteristiche potenziate provenienti dalle fasi precedenti, il modello CycleGAN ricostruirà i modelli culturali mantenendo la coerenza strutturale. Ciò garantirà che i modelli culturali, come quelli geometrici, floreali e simbolici, conservino la loro disposizione spaziale. Le immagini originali di Miao Batik sono state sottoposte a operazioni di mascheramento casuale e di occlusione parziale per generare motivi culturali incompleti o danneggiati. Queste procedure di degradazione hanno simulato regioni di modelli mancanti e danni strutturali comunemente osservati in manufatti del patrimonio culturale deteriorati. Le immagini degradate sono state utilizzate come ingressi per il modulo di ricostruzione, mentre le corrispondenti immagini originali sono state impiegate come immagini di riferimento per la valutazione delle prestazioni e per la valutazione della qualità della ricostruzione. Questa strategia ha permesso al modello di apprendere il ripristino delle strutture dei motivi mancanti preservando al contempo la coerenza semantica e le caratteristiche culturali.

Sia X il dominio dei modelli culturali incompleti e Y il dominio dei modelli culturali ricostruiti. I due generatori apprendono a eseguire una mappatura bidirezionale utilizzando Equazione 15:

 figure-protocol-18

In questo caso, GE viene utilizzato per ricostruire le strutture dei motivi e FM per mappare nuovamente i modelli nel dominio originale. La perdita avversaria viene utilizzata per garantire che i modelli ricostruiti siano realistici (Equazione 16)30

figure-protocol-19

In questo caso, DY è il discriminatore utilizzato per distinguere tra pattern reali e ricostruiti, e GE(x) indica il pattern ricostruito generato. Il CycleGAN impone inoltre la coerenza ciclica per preservare la disposizione strutturale dei motivi culturali (Equazione 17)30.

figure-protocol-20

La funzione di perdita finale è definita utilizzando Equazione 1830:

figure-protocol-21

Qui, λi indica il coefficiente di ponderazione per la perdita di coerenza ciclica ed è stato impostato a 10 durante l'addestramento, in linea con la formulazione originale di CycleGAN. Questo valore è stato scelto per bilanciare l'apprendimento avversario e la coerenza di ricostruzione tra i domini di origine e di destinazione.

Il modulo di ricostruzione CycleGAN è composto da due generatori e due discriminatori per la traduzione bidirezionale delle immagini. Ogni generatore segue un'architettura a rete residua, costituita da un livello iniziale di convoluzione 7 × 7, seguito da due livelli convoluzionali di downsampling, nove blocchi residui e due livelli di upsampling. Tutte le operazioni di convoluzione utilizzano una dimensione del kernel pari a 3 × 3, fatta eccezione per il livello di ingresso, che impiega un kernel 7 × 7 per un'estrazione delle caratteristiche migliorata. Dopo ogni livello convoluzionale viene applicata la Normalizzazione per Istanza per migliorare la stabilità dell'addestramento, mentre l'attivazione ReLU viene utilizzata in tutta la rete del generatore. Il livello di uscita impiega una funzione di attivazione Tanh per generare uscite di immagini normalizzate. Il discriminatore segue un'architettura PatchGAN 70 × 70, costituita da una serie di livelli convoluzionali con dimensioni del kernel pari a 4 × 4 e canali delle caratteristiche progressivamente crescenti. Nel discriminatore vengono impiegate la Normalizzazione per Istanza e l'attivazione LeakyReLU (pendenza negativa = 0,2) per migliorare la discriminazione delle caratteristiche e l'apprendimento avversario. Il modulo CycleGAN riceve in ingresso immagini preelaborate di motivi culturali e genera rappresentazioni di pattern ricostruiti, che vengono successivamente inviate al CAFFM per l'integrazione con le caratteristiche di segmentazione. L'addestramento del CycleGAN è stato effettuato utilizzando l'ottimizzatore Adam (β₁ = 0,5, β₂ = 0,999) con un tasso di apprendimento iniziale pari a 0,0002. Il tasso di apprendimento è stato mantenuto costante per i primi 100 epoche e successivamente ridotto linearmente a zero nel corso del periodo rimanente di addestramento. È stato impiegato un buffer di replay contenente 50 immagini precedentemente generate per stabilizzare l'addestramento del discriminatore. I generatori e i discriminatori sono stati aggiornati con un rapporto di aggiornamento 1:1, con un aggiornamento del generatore seguito da un aggiornamento del discriminatore ad ogni iterazione di addestramento.

Il processo di ricostruzione del CycleGAN si basa sulle mappe delle caratteristiche migliorate ottenute utilizzando il meccanismo CAFFM mostrato in Figura 5. Le mappe delle caratteristiche contengono motivi culturali potenziati ottenuti dalle fasi precedenti di segmentazione e CAFFM. Tali mappe vengono utilizzate come ingresso per il primo generatore GE. Il primo generatore GE apprende la mappatura necessaria per ricostruire i modelli culturali. Gli output vengono quindi inviati al discriminatore DY per distinguere tra modelli culturali reali e modelli ricostruiti. Il discriminatore DY aiuta il generatore GE a produrre output realistici. Per garantire che i modelli culturali non vengano distorti durante la ricostruzione, il secondo generatore FM esegue una mappatura con coerenza ciclica. Il secondo generatore FM riporta gli output al dominio originale. Gli output vengono quindi valutati dal discriminatore per verificarne il realismo. Gli output finali vengono successivamente inviati al modulo SPADE per la generazione dello stile artistico nella fase successiva del framework proposto SegCycle-SPADE.

figure-protocol-22
Figura 5. Flusso di Lavoro per la Ricostruzione di Pattern Basato su CycleGAN. Flusso di lavoro del modulo di ricostruzione CycleGAN. Rappresentazioni delle caratteristiche potenziate dall'attenzione vengono fornite come ingressi alla rete generatrice per ricostruire motivi culturali incompleti. Il discriminatore valuta le uscite ricostruite rispetto ai pattern di riferimento, mentre il mapping di coerenza ciclica preserva l'integrità strutturale durante la traduzione bidirezionale delle immagini. I motivi ricostruiti vengono successivamente inviati al modulo SPADE per la sintesi dello stile artistico. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Generazione di stili artistici utilizzando SPADE
Successivamente, i motivi culturali ricostruiti vengono sottoposti al modulo SPADE per la generazione di uno stile artistico. L'obiettivo principale del modulo SPADE è aggiungere texture artistiche visivamente più ricche ai motivi culturali ricostruiti, senza compromettere la disposizione strutturale dei motivi stessi. Il modulo SPADE è una tecnica di generazione condizionata di immagini che sfrutta il concetto di segmentazione dell'immagine per produrre immagini. Mappe semantiche multicanale corrispondenti alle classi di motivi predeterminate sono state codificate a partire dalle maschere di segmentazione semantica prodotte da SegFormer-B2. Queste mappe codificate sono state fornite al generatore SPADE come input condizionanti. I parametri di scala spazialmente adattativa (γ) e di bias (β) sono stati generati elaborando le mappe semantiche attraverso strati convoluzionali all'interno di ciascuno strato SPADE. In questo modo, il generatore è stato in grado di mantenere i contorni dei motivi, le disposizioni strutturali e le informazioni semantiche durante la sintesi artistica, applicando tali parametri alle attivazioni delle caratteristiche normalizzate. La guida semantica ha potuto influenzare sia la ricostruzione strutturale a livello alto sia la sintesi delle texture a livello basso, poiché il processo di condizionamento è stato eseguito in diversi strati del generatore SPADE. Di conseguenza, i motivi artistici generati incorporano tratti stilistici derivati dal dataset WikiArt, mantenendo al contempo le strutture dei motivi culturali identificate durante la fase di segmentazione.

Il set di dati WikiArt, che comprende opere appartenenti a 27 diverse categorie artistiche — come Rinascimento, Impressionismo, Cubismo, Espressionismo, Surrealismo, Realismo e Arte Astratta — è stato utilizzato come risorsa principale per comprendere gli stili artistici. Per esporre il modello a una varietà di tratti creativi e migliorare la generalizzazione dello stile, durante l'addestramento sono state selezionate casualmente immagini di stile dalle diverse categorie. Il set di dati è stato suddiviso in sottoinsiemi di addestramento, convalida e test, con una rappresentazione equilibrata delle categorie artistiche, al fine di ridurre il bias di stile. Per garantire una rappresentazione bilanciata di tutte e 27 le categorie artistiche, è stato impiegato un campionamento stratificato. I campioni di ciascuna categoria sono stati assegnati proporzionalmente ai sottoinsiemi di addestramento, convalida e test, preservando la distribuzione originale delle classi. Il modulo CAFFM è stato utilizzato per fondere gli aspetti stilistici derivati dalle immagini WikiArt con le caratteristiche di ricostruzione prodotte da CycleGAN. Per consentire alla rete di sintesi di trasferire qualità artistiche mantenendo al contempo i confini della struttura semantica e dei motivi culturali derivati dalle mappe di segmentazione, le rappresentazioni fuse risultanti sono state fornite come informazione condizionante al generatore SPADE. Grazie a questa tecnica di condizionamento stilistico, il framework proposto è stato in grado di produrre pattern artistici culturalmente autentici con rappresentazioni strutturali e stilistiche coerenti.

SPADE introduce anche parametri adattivi spazialmente che dipendono dalla mappa di segmentazione. I parametri possono essere definiti come mostrato nella Equazione 191:

figure-protocol-23

Qui, γ(S) è il parametro di scala variabile nello spazio e β(S) è il parametro di bias variabile nello spazio. I parametri possono aiutare il generatore a creare diverse texture e stili in base alla regione semantica nelle immagini. L'opera d'arte culturale finale può essere definita come mostrato nella Equazione 20:

 figure-protocol-24

Qui, GE è il generatore SPADE, XrP è il modello ricostruito e SM è la mappa di segmentazione. L'opera finale mantiene l'integrità strutturale dei motivi culturali migliorando al contempo l'aspetto artistico. Per ottimizzare l'architettura proposta SegCycle-SPADE, è stata utilizzata una funzione di perdita composita che bilancia accuratezza della segmentazione semantica, preservazione dei motivi culturali, qualità della ricostruzione del modello e coerenza dello stile artistico. Per definire l'obiettivo complessivo di addestramento, è stata impiegata una combinazione pesata di perdita di segmentazione (Lseg), perdita avversaria (Ladv), perdita di coerenza ciclica (Lcycle), perdita di ricostruzione (Lrecon), perdita di preservazione del motivo (Lmotif) e perdita di coerenza stilistica (Lstyle). La funzione di perdita totale è definita nella Equazione 21:

figure-protocol-25  (21)

Per garantire la coerenza strutturale tra i motivi culturali in ingresso e quelli ricostruiti, il coefficiente della perdita di coerenza ciclica è stato impostato a 10. Per mantenere caratteristiche dettagliate dei motivi e migliorare l'accuratezza visiva, il coefficiente della perdita di ricostruzione è stato fissato a 5. Per evidenziare la preservazione di pattern strutturali culturalmente essenziali durante la sintesi artistica, è stato utilizzato un coefficiente pari a 2 per la perdita di preservazione del motivo. Al fine di favorire il trasferimento dello stile artistico senza distorcere eccessivamente le strutture semantiche del motivo, il coefficiente della perdita di coerenza stilistica è stato regolato a 1. Per mantenere un contributo bilanciato tra la generazione di immagini realistiche e una segmentazione precisa dei motivi, sono stati assegnati pesi uguali alle perdite di segmentazione e avversaria. Le rappresentazioni stilistiche basate sulle caratteristiche del dataset WikiArt sono state utilizzate per calcolare la perdita di coerenza stilistica. In particolare, le caratteristiche dello stile artistico sono state catturate mediante correlazioni della matrice di Gram ottenute da mappe di caratteristiche profonde. La differenza in norma di Frobenius tra le matrici di Gram dell'immagine stilistica target e dell'immagine generata è stata utilizzata per calcolare la perdita di stile, come mostrato in Equation 22:

figure-protocol-26

Qui, Gl è la matrice di Gram calcolata a partire dal lesimo livello delle caratteristiche, Igen indica l'immagine artistica generata, Istyle indica l'immagine dello stile target proveniente dal dataset WikiArt e F indica la norma di Frobenius. Questa formulazione consente al framework proposto di preservare le caratteristiche artistiche mantenendo al contempo l'integrità strutturale e semantica dei motivi culturali.

Le rappresentazioni delle caratteristiche fuse prodotte dal modulo CAFFM vengono utilizzate come ingressi condizionanti per il modulo SPADE, che funge da componente di sintesi artistica del framework proposto. Il generatore SPADE comprende sette blocchi residui SPADE con una dimensione delle caratteristiche latenti di 256 canali e genera immagini in uscita con una risoluzione di 256 × 256 pixel. Le mappe di segmentazione semantica ottenute dal modulo SegFormer–CAFFM vengono utilizzate come ingressi condizionanti in tutti i livelli residui SPADE. I livelli SPADE vengono applicati prima delle funzioni di attivazione all'interno di ciascun blocco residuo, consentendo una condizionatura semantica guidata dalla segmentazione. Mediante operazioni successive di upsampling e convoluzionali, la rappresentazione latente delle caratteristiche viene affinata progressivamente per generare pattern artistici ad alta risoluzione, preservando al contempo la coerenza semantica e la struttura dei motivi. Vengono utilizzate funzioni di attivazione LeakyReLU in tutto il generatore, mentre una funzione di attivazione Tanh viene applicata nel livello di uscita per produrre immagini normalizzate.

Algoritmo e Flusso di Lavoro
Il framework SegCycle-SPADE integra segmentazione semantica, fusione di caratteristiche, ricostruzione di pattern e sintesi di stile artistico all'interno di una pipeline di addestramento unificata. Il flusso di lavoro inizia con l'acquisizione e la pre-elaborazione del dataset, inclusi ridimensionamento delle immagini, normalizzazione, rimozione del rumore e preparazione delle maschere di segmentazione. Le immagini pre-elaborate vengono successivamente elaborate mediante la rete di segmentazione SegFormer-B2 per estrarre rappresentazioni semantiche dei motivi. Le caratteristiche di segmentazione risultanti vengono fuse con le caratteristiche di ricostruzione attraverso il modulo CAFFM, consentendo l'interazione tra informazioni strutturali sui motivi e rappresentazioni delle caratteristiche artistiche. Le mappe di caratteristiche fuse vengono quindi fornite al modulo di ricostruzione CycleGAN, che ripristina le strutture incomplete dei motivi culturali mantenendo la coerenza semantica. I pattern ricostruiti vengono successivamente inviati al generatore SPADE per la sintesi artistica guidata dalla segmentazione, consentendo un miglioramento stilistico pur preservando i contorni dei motivi e l'autenticità strutturale. Durante l'addestramento, i parametri del modello vengono ottimizzati utilizzando la funzione di perdita composita descritta nelle Equazioni 21 e 22, che bilancia accuratezza della segmentazione, preservazione dei motivi, qualità della ricostruzione e coerenza dello stile artistico. Un flusso di implementazione dettagliato passo dopo passo, compreso caricamento del dataset, pre-elaborazione, inizializzazione del modello, iterazioni di addestramento, procedure di validazione, selezione dei checkpoint ed valutazione finale, è fornito nel File Supplementare 1 (Algoritmo 1). L'intero flusso di lavoro algoritmico è stato implementato con una dimensione del batch pari a 16, una velocità di apprendimento di 0,0002 e 100 epoche di addestramento. È stato utilizzato un seme casuale fisso pari a 42 per la suddivisione del dataset, l'inizializzazione del modello e tutti gli esperimenti di addestramento. Il seme è stato applicato in modo coerente ai generatori di numeri casuali di Python, NumPy e PyTorch per garantire la riproducibilità. L'ottimizzatore Adam è stato configurato con β₁ = 0,5, β₂ = 0,999 e senza decadimento del peso (weight decay = 0). I checkpoint del modello sono stati selezionati in base al punteggio IoU di validazione più alto ottenuto sul dataset di validazione.

Ottimizzazione della Funzione di Perdita
Per preservare le strutture dei motivi culturali durante la ricostruzione e la sintesi artistica, il framework proposto utilizza un obiettivo di ottimizzazione composito che combina perdite di segmentazione, avversarie, di coerenza ciclica, di ricostruzione, di preservazione dei motivi e di coerenza stilistica. La formulazione matematica completa, i coefficienti di pesatura e la definizione della perdita stilistica sono riportati nelle Equazioni 21 e 22 all'interno del sottosezione Generazione di Stile Artistico mediante SPADE. Il componente di preservazione dei motivi penalizza le deviazioni strutturali tra le regioni dei motivi previste e le corrispondenti maschere di segmentazione reale, favorendo così la conservazione delle strutture di pattern culturalmente significative durante l'intero processo di ricostruzione.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il framework proposto SegCycle-SPADE è stato valutato utilizzando due dataset: il dataset dei motivi culturali del batik Miao e il dataset WikiArt. Il dataset del batik Miao contiene immagini del patrimonio culturale tradizionale ed è stato utilizzato principalmente per compiti di segmentazione semantica e ricostruzione strutturale, mentre il dataset WikiArt contiene stili artistici diversificati ed è stato impiegato per l'apprendimento e la generazione di stili artistici. Le immagini provenienti da entrambi i dataset sono state elaborate attraverso l'intero pipeline di SegCycle-SPADE, inclusi segmentazione semantica, CAFFM, ricostruzione del motivo e generazione dello stile artistico basata su SPADE. L'integrazione delle informazioni sui motivi culturali e delle rappresentazioni dello stile artistico ha permesso al framework di generare output culturalmente significativi e visivamente coerenti.

Tutti gli esperimenti sono stati condotti su una workstation abilitata per GPU, dotata di un processore Intel Core i7 e una GPU NVIDIA. In particolare, gli esperimenti sono stati eseguiti su una workstation equipaggiata con una CPU Intel Core i7 (11ª generazione), una GPU NVIDIA RTX 3090 con 24 GB di memoria VRAM e 32 GB di memoria di sistema. I modelli sono stati implementati utilizzando Python 3.8 e PyTorch 1.10 con accelerazione CUDA. L'addestramento è stato effettuato mediante un'architettura a singola GPU, senza ricorrere ad addestramento distribuito. È stata utilizzata precisione standard FP32 in tutti gli esperimenti, mentre l'addestramento in precisione mista non è stato impiegato. È stato usato l'ottimizzatore Adam con una dimensione del batch di 16 per 100 epoche di addestramento. Tabella 3 riassume i parametri di implementazione e l'ambiente computazionale utilizzati in questo studio.

L'architettura proposta comprende quattro componenti principali: SegFormer-B2 per la segmentazione semantica, CAFFM per la fusione delle caratteristiche, CycleGAN per la ricostruzione del motivo e SPADE per la sintesi dello stile artistico. Le immagini provenienti da entrambi i dataset sono state ridimensionate a 256 × 256 pixel prima dell'addestramento. Questa risoluzione standardizzata ha garantito un'efficienza computazionale, preservando al contempo dettagli importanti del motivo e contribuendo a un addestramento avversario stabile dei moduli CycleGAN e SPADE.

Le prestazioni del framework proposto sono state valutate utilizzando metriche di segmentazione e di valutazione della qualità dell'immagine, tra cui Accuratezza di Segmentazione, IoU, Coefficiente di Similarità di Dice (Dice), SSIM, PSNR e FID. L'autenticità visiva è stata valutata qualitativamente mediante ispezione visiva dei modelli culturali generati. La valutazione qualitativa si è concentrata sulla conservazione dei motivi, sulla coerenza semantica, sulle caratteristiche culturali e sull'aspetto artistico rispetto ai motivi culturali di riferimento. L'autenticità visiva non è stata utilizzata come metrica di valutazione quantitativa indipendente.

La valutazione quantitativa del framework proposto è stata eseguita utilizzando le seguenti metriche.

L'accuratezza della segmentazione è stata calcolata utilizzando Equazione 23:

figure-results-1

In questo contesto, TP, TN, FP e FN indicano rispettivamente i veri positivi, i veri negativi, i falsi positivi e i falsi negativi.

L'indice di sovrapposizione (IoU) è stato calcolato utilizzando la Equazione 24:

 figure-results-2

Il coefficiente di similarità di Dice (Dice) è stato calcolato utilizzando l'equazione 25:

figure-results-3

L'SSIM è stato utilizzato per valutare la similarità percettiva delle immagini ed è definito mediante Equazione 2633:

figure-results-4  (26)

In questo caso, μ indica l'intensità media, σ indica la varianza, σxy indica la covarianza tra le immagini e C1 e C2 sono costanti di stabilizzazione.

PSNR è una metrica comunemente utilizzata per valutare la qualità delle immagini generate ed è definita nella Equazione 2733:

figure-results-5

Qui, MaxI indica il valore massimo possibile del pixel dell'immagine e MSE è l'errore quadratico medio tra l'immagine originale e quella ricostruita.

FID può essere calcolato utilizzando le medie e le matrici di covarianza come nell'Equazione 2833:

figure-results-6   (28)

Qui, μr è il valore medio dell'immagine reale, μg è il valore medio dell'immagine generata, e Σr e Σg sono rispettivamente la matrice di covarianza delle immagini reali e di quelle generate.

Per il confronto delle prestazioni, il framework proposto è stato valutato rispetto a metodi rappresentativi comunemente utilizzati per la segmentazione semantica, la ricostruzione di immagini e la generazione artistica di immagini. U-Net e DeepLabV3+ sono stati inclusi come basi di riferimento per la segmentazione, mentre Pix2Pix e CycleGAN sono stati inclusi come basi di riferimento per la ricostruzione. StyleGAN e AttentionGAN sono stati utilizzati come metodi rappresentativi per la generazione artistica di immagini. Questi confronti sono stati effettuati per valutare l'efficacia di SegCycle-SPADE nel preservare le informazioni sui motivi strutturali, migliorando al contempo la qualità artistica.

Ogni esperimento è stato ripetuto cinque volte per valutare la stabilità e la riproducibilità delle prestazioni. È stato utilizzato un seme casuale fisso pari a 42 per la suddivisione del dataset, al fine di garantire sottoinsiemi coerenti per l'addestramento, la validazione e i test in tutti gli esperimenti. I risultati sono riportati come media ± deviazione standard. I bassi valori di deviazione standard osservati per Accuratezza, IoU, Dice, SSIM, PSNR e FID indicano che il framework proposto ha raggiunto prestazioni stabili nelle ripetute esecuzioni sperimentali. La significatività statistica è stata valutata mediante test t appaiati, e le differenze sono state considerate statisticamente significative quando p < 0,05. Poiché tutti i modelli sono stati valutati sugli stessi sottoinsiemi del dataset, sono state ottenute misurazioni appaiate delle prestazioni nelle ripetizioni, giustificando l'uso del test t appaiato. Per controllare il tasso di errore familiare associato ai multipli confronti a coppie, è stata applicata la correzione di Bonferroni, e la significatività statistica è stata determinata utilizzando una soglia aggiustata pari a α/n, dove n indica il numero di confronti a coppie.

I risultati sperimentali supportano fortemente l'efficacia del framework proposto SegCycle-SPADE. Le prestazioni superiori nella segmentazione ottenute da SegFormer-B2 dimostrano la sua capacità di identificare con precisione e preservare i confini dei motivi culturalmente significativi. I miglioramenti nei punteggi IoU e Dice indicano ulteriormente una preservazione efficace delle strutture semantiche dei motivi lungo tutta la pipeline di elaborazione. L'integrazione di CycleGAN e SPADE ha ricostruito con successo le strutture dei motivi incomplete mantenendo dettagli visivi finemente definiti, come evidenziato dai valori migliorati di SSIM e PSNR. Inoltre, punteggi FID più bassi indicano che gli schemi artistici generati mostrano una maggiore somiglianza con immagini culturali e artistiche autentiche, suggerendo una coerenza stilistica e un realismo visivo migliorati.

Il CAFFM ha contribuito in modo significativo a questi miglioramenti facilitando un'efficace interazione tra le informazioni strutturali derivate dalla segmentazione e le rappresentazioni stilistiche generative. Attraverso la fusione di caratteristiche basata sull'attenzione incrociata, il CAFFM ha migliorato sia la fedeltà strutturale che l'autenticità artistica, preservando al contempo le relazioni a lungo raggio tra i motivi culturali.

Figura 6 mostra il confronto tra l'accuratezza di segmentazione del framework proposto SegCycle-SPADE e dei metodi esistenti sui dataset Miao Batik e WikiArt. Gli approcci tradizionali di segmentazione come U-Net e DeepLabV3+ hanno ottenuto prestazioni competitive grazie alla loro capacità di apprendere rappresentazioni spaziali. Tuttavia, Pix2Pix e CycleGAN hanno mostrato un'accuratezza di segmentazione inferiore poiché non sono stati progettati specificamente per compiti di segmentazione. Il framework proposto SegCycle-SPADE ha ottenuto l'accuratezza di segmentazione più elevata su entrambi i dataset, grazie all'integrazione di SegFormer-B2 e al potenziamento delle caratteristiche basato su CAFFM.

figure-results-7
Figura 6. Confronto dell'accuratezza di segmentazione tra diversi metodi. Confronto dell'accuratezza di segmentazione ottenuta utilizzando U-Net, DeepLabV3+, Pix2Pix, CycleGAN e il framework proposto SegCycle-SPADE sui dataset Miao Batik e WikiArt. I risultati sono presentati come media ± deviazione standard (DS) ottenuta da cinque esecuzioni indipendenti (n = 5). Le barre di errore rappresentano una deviazione standard. Valori più elevati indicano prestazioni migliori nella segmentazione. Il framework proposto SegCycle-SPADE ha ottenuto l'accuratezza di segmentazione più elevata su entrambi i dataset. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 7 mostra il confronto dell'IoU tra i metodi valutati. U-Net e DeepLabV3+ hanno ottenuto prestazioni di sovrapposizione elevate grazie alle loro architetture orientate alla segmentazione. Al contrario, Pix2Pix e CycleGAN hanno prodotto valori di IoU più bassi poiché il loro obiettivo principale è la traduzione dell'immagine piuttosto che la segmentazione semantica. Il framework proposto SegCycle-SPADE ha ottenuto i valori di IoU più alti su entrambi i dataset, indicando un miglioramento nella localizzazione e nel mantenimento delle regioni dei motivi culturali.

figure-results-8
Figura 7. Confronto dei punteggi Intersection over Union (IoU) per la segmentazione dei motivi culturali. Confronto delle prestazioni in termini di IoU tra diversi metodi di segmentazione sui dataset Miao Batik e WikiArt. I risultati sono espressi come media ± deviazione standard (DS) ottenuta da cinque esecuzioni indipendenti (n = 5). Le barre di errore indicano una deviazione standard. Valori più elevati di IoU indicano un migliore sovrapposizione tra le regioni del motivo previste e quelle di riferimento, nonché una più accurata conservazione dei contorni del motivo. Il framework proposto SegCycle-SPADE ha ottenuto i punteggi IoU più alti su entrambi i dataset. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 8 mostra il confronto del coefficiente di similarità di Dice. L'indice di Dice misura l'overlap tra le maschere di segmentazione predette e le regioni reali dei motivi. Gli approcci convenzionali di segmentazione hanno ottenuto punteggi di Dice relativamente alti grazie all'efficacia nell'apprendimento delle strutture spaziali. Tuttavia, il framework proposto SegCycle-SPADE ha ottenuto i punteggi di Dice più elevati su entrambi i dataset, dimostrando una maggiore coerenza nella segmentazione e un migliore mantenimento dei motivi.

figure-results-9
Figura 8. Confronto del coefficiente di Dice per la segmentazione dei motivi culturali. Confronto dei valori del coefficiente di Dice ottenuti utilizzando diversi approcci di segmentazione sui dataset Miao Batik e WikiArt. Il coefficiente di Dice valuta l'overlap tra le maschere di segmentazione predette e le maschere di riferimento, con valori più elevati che indicano una migliore prestazione nella segmentazione e nell'identificazione delle regioni dei motivi. Il framework proposto SegCycle-SPADE ha ottenuto i valori più alti del coefficiente di Dice su entrambi i dataset. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Figura 9 mostra il confronto SSIM tra i pattern culturali ricostruiti. I metodi basati su GAN come Pix2Pix, CycleGAN e StyleGAN hanno ottenuto valori SSIM più elevati rispetto ai metodi tradizionali di segmentazione, poiché sono stati progettati per la generazione di immagini. Tuttavia, il framework proposto SegCycle-SPADE ha ottenuto i valori SSIM più alti su entrambi i dataset, indicando una migliore preservazione dei dettagli strutturali e della coerenza artistica.figure-results-10

Figura 9. Confronto dell'indice di similarità strutturale (SSIM). Confronto dei valori dell'indice di similarità strutturale (SSIM) ottenuti utilizzando diversi metodi di ricostruzione sui dataset Miao Batik e WikiArt. I risultati sono presentati come media ± deviazione standard (DS) di cinque ripetizioni indipendenti (n = 5). Le barre di errore indicano una deviazione standard. Valori più elevati di SSIM indicano una maggiore similarità strutturale tra i pattern ricostruiti e quelli di riferimento. Il framework proposto SegCycle-SPADE ha ottenuto i punteggi SSIM più alti su entrambi i dataset. Cliccare qui per visualizzare una versione ingrandita di questa figura.

L'FID è stato utilizzato per valutare il realismo e la similarità distribuzionale dei modelli artistici generati. Il calcolo dell'FID è stato eseguito utilizzando una rete Inception-v3 preaddestrata, con vettori di caratteristiche estratti dal livello pool3, ottenendo rappresentazioni caratteristiche di 2048 dimensioni. Prima dell'estrazione delle caratteristiche, le immagini generate e quelle di riferimento sono state ridimensionate a 299 × 299 pixel mediante interpolazione bilineare e normalizzate secondo il protocollo di preelaborazione standard per Inception-v3. L'FID è stato calcolato utilizzando le distribuzioni delle caratteristiche estratte dal dataset di test indipendente. Le statistiche della media e della covarianza sono state stimate dagli embedding delle caratteristiche e utilizzate all'interno della formulazione standard dell'FID.

Come mostrato nella Tabella 4, gli approcci convenzionali di generazione di immagini come Pix2Pix e CycleGAN hanno prodotto punteggi FID relativamente elevati poiché mancavano di un orientamento strutturale esplicito. StyleGAN e AttentionGAN hanno ottenuto punteggi FID più bassi grazie a migliori capacità di apprendimento delle caratteristiche. Tuttavia, il framework proposto SegCycle-SPADE ha ottenuto i punteggi FID più bassi su entrambi i dataset, dimostrando una maggiore realismo delle immagini, coerenza stilistica e preservazione dei motivi culturali.

MetodoDataset Miao Batik (FID)Dataset WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (Proposto)28.531.2

Tabella 4: Risultati della Frechet Inception Distance (FID) per la Ricostruzione di Motivi Culturali. Confronto dei punteggi di Frechet Inception Distance (FID) ottenuti dal framework proposto SegCycle-SPADE e dai modelli generativi di riferimento sui dataset Miao Batik e WikiArt. Valori di FID più bassi indicano una maggiore somiglianza tra le distribuzioni delle caratteristiche delle immagini generate e quelle reali, riflettendo quindi una maggiore realismo visivo nella ricostruzione dei motivi culturali.

Figura 10 confronta la qualità della ricostruzione ottenuta con diversi metodi. La Qualità della Ricostruzione (%) è stata calcolata convertendo l'SSIM tra l'immagine ricostruita e l'immagine di riferimento corrispondente in una scala percentuale (SSIM × 100). Percentuali più elevate indicano una maggiore fedeltà strutturale e somiglianza visiva rispetto al motivo culturale originale. I modelli generativi convenzionali come Pix2Pix e CycleGAN hanno ottenuto prestazioni di ricostruzione moderate. Architetture più avanzate, tra cui StyleGAN e AttentionGAN, hanno raggiunto una qualità di ricostruzione migliore grazie alle loro capacità potenziate di apprendimento delle caratteristiche. Tuttavia, il framework proposto SegCycle-SPADE ha ottenuto la qualità di ricostruzione più elevata grazie all'integrazione della guida della segmentazione semantica, della fusione delle caratteristiche con attenzione incrociata, dell'apprendimento della ricostruzione e della sintesi artistica.

figure-results-11
Figura 10. Confronto della qualità della ricostruzione del pattern. Confronto della qualità della ricostruzione ottenuta utilizzando Pix2Pix, CycleGAN, StyleGAN, AttentionGAN e il framework proposto SegCycle-SPADE sui dataset Miao Batik e WikiArt. I risultati sono presentati come media ± deviazione standard (DS) ottenuta da cinque esecuzioni indipendenti (n = 5). I barretti di errore indicano una deviazione standard. Valori più elevati indicano una migliore preservazione dei dettagli strutturali, della coerenza semantica e della fedeltà visiva. Il framework proposto SegCycle-SPADE ha ottenuto i punteggi più alti per la qualità della ricostruzione su entrambi i dataset. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Il PSNR è stato utilizzato per valutare la fedeltà della ricostruzione misurando la similarità a livello di pixel tra le immagini ricostruite e le immagini di riferimento corrispondenti. Il PSNR è stato calcolato tra ogni immagine ricostruita e l'immagine originale di Miao Batik corrispondente, utilizzata come riferimento reale. Valori più elevati di PSNR indicano un errore di ricostruzione minore. Come mostrato nella Tabella 5, Pix2Pix e CycleGAN hanno ottenuto valori di PSNR moderati poiché hanno ricostruito i motivi senza un orientamento strutturale esplicito. StyleGAN e AttentionGAN hanno ottenuto valori di PSNR più elevati grazie a un apprendimento più profondo delle caratteristiche. Il framework proposto SegCycle-SPADE ha ottenuto i valori di PSNR più alti su entrambi i dataset, dimostrando una maggiore fedeltà nella ricostruzione e una migliore preservazione delle strutture dei motivi culturali.

MetodoDati Miao Batik
(PSNR, dB)
Dati WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (Proposto)32.431.2

Tabella 5:  Risultati del rapporto segnale-rumore di picco (PSNR) per la ricostruzione di motivi culturali. Confronto dei valori del rapporto segnale-rumore di picco (PSNR) ottenuti dal framework proposto SegCycle-SPADE e dai metodi di base sui dataset Miao Batik e WikiArt. Valori PSNR più elevati indicano una migliore fedeltà di ricostruzione e una minore distorsione rispetto alle immagini di riferimento corrispondenti.

Figura 11 illustra il comportamento di convergenza del framework proposto SegCycle-SPADE durante l'addestramento. Le curve di perdita rappresentano le perdite medie di addestramento calcolate come media di cinque esecuzioni indipendenti di addestramento. Per ridurre la variabilità stocastica e fornire una rappresentazione più robusta della convergenza durante l'addestramento, i valori di perdita sono stati mediati in ogni epoca attraverso tutte le esecuzioni. Nelle epoche iniziali di addestramento, i valori di perdita erano relativamente elevati poiché il modello stava ancora apprendendo le rappresentazioni delle caratteristiche dai dati in ingresso. Procedendo con l'addestramento, tutti i componenti della perdita sono gradualmente diminuiti e si sono stabilizzati, indicando un'ottimizzazione efficace degli obiettivi di segmentazione, ricostruzione e sintesi artistica. Il comportamento di convergenza osservato dimostra l'efficacia, la stabilità e la riproducibilità del framework proposto durante l'addestramento.

figure-results-12
Figura 11. Convergenza dell'addestramento del framework proposto SegCycle-SPADE. Curve di perdita durante l'addestramento del framework proposto SegCycle-SPADE su 100 epoche di addestramento, mediate su cinque esecuzioni indipendenti (n = 5). La figura illustra l'evoluzione della perdita totale (LTotal), della perdita di segmentazione (LSeg), della perdita del generatore (LG) e della perdita del discriminatore (LD) durante l'addestramento. La riduzione graduale e la successiva stabilizzazione di tutti i componenti della perdita indicano una convergenza riuscita e un'ottimizzazione stabile del framework proposto. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Studio di ablazione
Per valutare il contributo di ciascun componente all'interno del framework proposto SegCycle-SPADE, è stato condotto uno studio di ablazione utilizzando diverse configurazioni controllate del modello. I risultati sono riassunti nelle Tabelle 6 e 7.

Configurazione del modelloAccuratezza della segmentazione (%)IoUSSIM
Solo SegFormer87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (proposto)93.80.860.93

Tabella 6: Studio di ablazione dei componenti di SegCycle-SPADE. Confronto delle prestazioni di configurazioni del modello progressivamente migliorate al fine di valutare il contributo dei singoli componenti del framework. Lo studio esamina gli effetti della segmentazione semantica, del modulo di fusione delle caratteristiche culturali con attenzione incrociata (CAFFM), della ricostruzione basata su CycleGAN e della sintesi artistica basata su SPADE sull'accuratezza della segmentazione, sull'Indice di Intersezione rispetto all'Unione (IoU) e sull'Indice di Similarità Strutturale (SSIM). Valori più elevati indicano una migliore segmentazione del motivo, qualità della ricostruzione e conservazione della struttura.

VarianteIoU (%)Dice (%)SSIMPSNR (dB)FID ↓
Solo SegFormer84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (Modello Completo)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

Tabella 7: Analisi del Contributo dei Componenti del Framework Proposto SegCycle-SPADE. Confronto delle prestazioni delle singole varianti del framework utilizzate per valutare il contributo di CAFFM, CycleGAN, SPADE e dell'architettura completa SegCycle-SPADE. I risultati sono riportati in termini di Intersection over Union (IoU), coefficiente di Dice, Structural Similarity Index (SSIM), Peak Signal-to-Noise Ratio (PSNR) e Frechet Inception Distance (FID). Valori più elevati di IoU, Dice, SSIM e PSNR indicano una migliore qualità di segmentazione e ricostruzione, mentre valori più bassi di FID indicano una maggiore realismo visivo dei pattern culturali generati.

Tabella 6 valuta il contributo cumulativo dei principali componenti del framework utilizzando quattro configurazioni: (i) solo SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN e (iv) SegFormer + CAFFM + CycleGAN + SPADE (framework proposto). Il modello SegFormer di base ha raggiunto un'accuratezza di segmentazione del 87,3%, un punteggio IoU di 0,76 e un valore SSIM di 0,82. L'integrazione del modulo CAFFM ha migliorato le prestazioni in tutte le metriche di valutazione, aumentando l'accuratezza di segmentazione al 89,6%, l'IoU a 0,79 e l'SSIM a 0,86. L'aggiunta di CycleGAN ha ulteriormente potenziato la capacità di ricostruzione strutturale, portando l'IoU a 0,82 e l'SSIM a 0,89. L'intero framework SegCycle-SPADE ha ottenuto le migliori prestazioni complessive, con un'accuratezza di segmentazione del 93,8%, un IoU di 0,86 e un valore SSIM di 0,93. Questi risultati dimostrano che ciascun componente contribuisce in modo incrementale al miglioramento dell'accuratezza di segmentazione, della preservazione strutturale e della qualità di ricostruzione dell'immagine.

Tabella 7 analizza ulteriormente il contributo dei singoli componenti del framework utilizzando cinque varianti del modello: (i) solo SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM e (v) il modello completo che incorpora SegFormer, CAFFM, CycleGAN, SPADE e la perdita per la conservazione del motivo. Le prestazioni sono state valutate mediante metriche IoU, coefficiente di Dice, SSIM, PSNR e FID.

La configurazione di base basata esclusivamente su SegFormer ha raggiunto un IoU del 84,2%, un coefficiente Dice dell'88,5%, un valore SSIM di 0,82, un PSNR di 24,8 dB e un punteggio FID di 31,8. L'aggiunta di CycleGAN ha migliorato la qualità della ricostruzione e ridotto il punteggio FID a 27,5, indicando una maggiore realismo delle immagini. L'integrazione di SPADE ha ulteriormente migliorato la similarità strutturale e la qualità delle immagini, portando il valore SSIM a 0,88 e il punteggio FID a 23,4. L'inclusione del modulo proposto CAFFM ha determinato notevoli miglioramenti in tutte le metriche, aumentando l'IoU al 90,0%, il coefficiente Dice al 93,1%, l'SSIM a 0,90 e il PSNR a 29,6 dB, riducendo al contempo il punteggio FID a 20,3. Il modello completo, che include inoltre la funzione di perdita per la conservazione del motivo, ha ottenuto le prestazioni complessive migliori con un IoU del 93,0%, un coefficiente Dice del 95,4%, un valore SSIM di 0,92, un PSNR di 31,2 dB e un punteggio FID di 17,6.

Tabella 8 presenta una panoramica comparativa di approcci rappresentativi di apprendimento profondo (DL) utilizzati per la ricostruzione e la conservazione di motivi del patrimonio culturale. I metodi convenzionali basati su CNN forniscono un'apprendimento efficace delle caratteristiche locali e prestazioni di segmentazione, ma spesso incontrano difficoltà nel preservare strutture di motivi complesse a causa della modellazione limitata delle dipendenze a lungo raggio. Gli approcci basati su GAN migliorano le capacità di sintesi delle immagini e di trasferimento dello stile; tuttavia, possono presentare inconsistenze semantiche e perdita di dettagli strutturali fini. I metodi basati su Transformer potenziano la comprensione contestuale globale ma in genere mancano di capacità di ricostruzione generativa, mentre i metodi basati su diffusione offrono un'elevata realismo visivo a scapito di una maggiore complessità computazionale. Gli approcci ibridi Transformer-GAN affrontano parzialmente tali limitazioni combinando meccanismi di estrazione delle caratteristiche e di generazione delle immagini. Al contrario, il framework proposto SegCycle-SPADE integra segmentazione basata su Transformer, fusione di caratteristiche con cross-attenzione, ricostruzione generativa e sintesi artistica guidata da segmentazione all'interno di un'architettura unificata, migliorando così la fedeltà strutturale, la coerenza semantica e la preservazione dei motivi culturali. Il confronto è riassunto nella Tabella 8.

ApproccioMetodologia PrincipalePunti di forzaLimitazioniRilevanza per il Patrimonio Culturale
Metodi basati su CNN (es. U-Net, DeepLabV3+)Estrazione di caratteristiche convoluzionali e segmentazione semanticaApprendimento efficace delle caratteristiche locali e segmentazione accurataModellazione limitata delle dipendenze a lungo raggio; difficoltà nel preservare strutture di motivi complessiAdatti alla segmentazione dei motivi, ma meno efficaci per la ricostruzione artistica
Metodi basati su GAN (es. Pix2Pix, CycleGAN)Generazione avversaria di immagini e traduzione da immagine a immagineSintesi di immagini di alta qualità e trasferimento di stileInstabilità durante l'addestramento; incoerenza semantica; possibile perdita di dettagli strutturali finiUtili per il ripristino di pattern, ma potrebbero non preservare con precisione i motivi culturali
Metodi basati su TransformerAutoattenzione e modellazione del contesto globaleCatturano dipendenze a lungo raggio e relazioni visive complesseAlto costo computazionale; richiedono grandi dataset di addestramentoEfficaci per l'analisi di pattern complessi, ma capacità generativa limitata quando utilizzati singolarmente
Metodi basati su DiffusioneGenerazione di immagini basata su denoising iterativoAlta realismo visivo e diversità delle immaginiVelocità di inferenza lenta; elevati requisiti computazionali; controllo strutturale limitatoPromettenti per la generazione di immagini del patrimonio, ma intensivi dal punto di vista computazionale
Metodi Ibridi Transformer-GANCombinazione di estrazione di caratteristiche basata su Transformer e generazione basata su GANMiglioramento della rappresentazione delle caratteristiche globali e della qualità delle immaginiSpesso manca una guida semantica esplicita per la preservazione dei motiviMigliorano la qualità della generazione, ma non sono specificamente progettati per i motivi del patrimonio culturale
SegCycle-SPADE propostoSegFormer + CAFFM + CycleGAN + SPADESegmentazione basata su Transformer, fusione guidata dall'attenzione, coerenza semantica, preservazione dei motivi e ricostruzione artistica controllabileComplessità computazionale maggiore rispetto agli approcci basati su CNN autonomiProgettato specificamente per la ricostruzione e la preservazione di pattern del patrimonio culturale, con maggiore fedeltà strutturale e coerenza semantica

Tabella 8: Confronto tra approcci rappresentativi di apprendimento profondo per la ricostruzione e la conservazione di motivi del patrimonio culturale. Confronto qualitativo tra approcci rappresentativi di apprendimento profondo utilizzati per la segmentazione delle immagini, la ricostruzione di motivi, la generazione di stili e la conservazione del patrimonio culturale. La tabella riassume la metodologia principale, i punti di forza, i limiti e l'applicabilità di ciascun approccio, evidenziando come il framework proposto SegCycle-SPADE combini segmentazione semantica, fusione di caratteristiche, ricostruzione e sintesi dello stile per affrontare le sfide legate alla conservazione strutturale e alla coerenza semantica nei motivi del patrimonio culturale.

I miglioramenti osservati dimostrano che il modulo CAFFM potenzia efficacemente l'interazione tra le caratteristiche strutturali derivate dalla segmentazione e le rappresentazioni dello stile artistico attraverso la fusione di caratteristiche basata sull'attenzione incrociata. Inoltre, la funzione di perdita per la conservazione del motivo contribuisce a mantenere le strutture dei motivi culturalmente significativi durante la ricostruzione e la sintesi artistica, portando a una maggiore coerenza nella segmentazione, fedeltà strutturale e realismo visivo. Nel complesso, i risultati dell'analisi di ablazione confermano che l'integrazione di SegFormer-B2, CAFFM, CycleGAN, SPADE e della funzione di perdita per la conservazione del motivo è responsabile delle prestazioni superiori del framework proposto SegCycle-SPADE.

Disponibilità dei dati:
Il dataset WikiArt utilizzato per l'apprendimento dello stile artistico è disponibile pubblicamente tramite il repository Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). Il dataset Miao Batik utilizzato in questo studio è disponibile pubblicamente tramite Zenodo (https://doi.org/10.5281/zenodo.20807658). I dataset processati, le maschere di segmentazione, i pesi del modello preaddestrato, gli output generati e i file di implementazione in Python associati al framework proposto SegCycle-SPADE sono disponibili anche attraverso lo stesso repository Zenodo.

FILE SUPPLEMENTARE:
File Supplementare 1. Algoritmo 1: Flusso di Implementazione del Framework Proposto SegCycle-SPADE. Codice pseudocodice passo dopo passo che descrive l'intera pipeline di implementazione del framework proposto SegCycle-SPADE, inclusi il caricamento del dataset, la pre-elaborazione, la segmentazione semantica mediante SegFormer-B2, la fusione delle caratteristiche tramite il Modulo di Fusione delle Caratteristiche Culturali con Attenzione Incrociata (CAFFM), la ricostruzione del motivo culturale mediante CycleGAN, la sintesi dello stile artistico mediante SPADE, l'addestramento del modello, la validazione, la selezione dei checkpoint e la valutazione finale delle prestazioni. Cliccare qui per scaricare questo file.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La conservazione e la ricostruzione digitale dei modelli del patrimonio culturale immateriale (ICH) hanno ricevuto un'attenzione crescente negli ultimi anni a causa della progressiva scomparsa delle arti tradizionali. Studi precedenti hanno cercato di affrontare la perdita del patrimonio culturale attraverso tecniche di elaborazione delle immagini basate sul DL. Ad esempio, Quan et al.32 hanno proposto un framework per la conservazione del patrimonio culturale basato su grafi della conoscenza e DL, relativo alla cultura del batik dei Miao del Guizhou. Sebbene lo studio si sia concentrato sulla ricostruzione digitale dei modelli culturali, la sua metodologia si basava principalmente su rappresentazioni mediante grafi della conoscenza. Analogamente, Fu e Razmjooy16 hanno proposto un framework basato sulla rete a piramide di caratteristiche (FPN) per il miglioramento e il restauro delle immagini del patrimonio culturale. Sebbene questo metodo abbia fornito un'estrazione efficace delle caratteristiche per il miglioramento delle immagini, non includeva indicazioni di segmentazione delle immagini né meccanismi di ricostruzione generativa per modelli culturali incompleti. Al contrario, il framework proposto SegCycle-SPADE combina diversi componenti DL per superare queste limitazioni. In primo luogo, la segmentazione semantica mediante il modello SegFormer viene impiegata per l'identificazione accurata delle regioni dei motivi all'interno dei modelli del patrimonio culturale. Successivamente, un modulo di miglioramento delle caratteristiche basato su CAFFM migliora le rappresentazioni delle caratteristiche per strutture di motivi finemente dettagliate. Un modulo di ricostruzione CycleGAN viene quindi utilizzato per ricostruire regioni mancanti o incomplete all'interno dei modelli culturali attraverso l'apprendimento avversario. Infine, un modulo SPADE esegue un miglioramento stilistico mantenendo l'allineamento strutturale con le mappe di segmentazione. I metodi esistenti basati su CNN, GAN, trasformatori e diffusione17,19,20,21,22,23,24,25,30,34 offrono ciascuno vantaggi unici; tuttavia, presentano anche limitazioni nel preservare la coerenza semantica, mantenere le caratteristiche strutturali o raggiungere un'efficienza computazionale, come riassunto in Tabella 8. L'architettura proposta SegCycle-SPADE combina i punti di forza della segmentazione basata su SegFormer, della fusione incrociata delle caratteristiche mediante attenzione, della ricostruzione CycleGAN e della sintesi guidata da SPADE, affrontando al contempo tali limitazioni. Di conseguenza, il framework raggiunge una qualità di ricostruzione migliorata e una conservazione potenziata dei motivi culturalmente significativi.

Nonostante le promettenti prestazioni, il framework proposto SegCycle-SPADE presenta ancora diverse limitazioni. In primo luogo, la valutazione è stata condotta utilizzando soltanto i dataset Miao Batik e WikiArt, il che potrebbe limitare la generalizzabilità del framework ad altri domini del patrimonio culturale. In secondo luogo, il deployment su piattaforme con risorse limitate potrebbe risultare difficoltoso poiché l'integrazione di SegFormer, CAFFM, CycleGAN e SPADE aumenta la complessità computazionale e i requisiti di memoria. In terzo luogo, le prestazioni della segmentazione dipendono fortemente dalla qualità e coerenza delle annotazioni dei motivi, e un bias nelle annotazioni potrebbe influire sulla preservazione di strutture culturalmente significative. Infine, poiché il framework è stato valutato utilizzando soltanto due dataset, potrebbero essere necessari ulteriori dati di addestramento e adattamenti specifici per dominio al fine di garantirne l'applicabilità su collezioni diverse di patrimonio culturale. Pertanto, studi futuri dovrebbero esplorare strategie di addestramento più robuste, architetture leggere, procedure di annotazione migliorate e valutazioni cross-domain mediante l'utilizzo di ulteriori dataset di patrimonio culturale.

La scalabilità del framework SegCycle-SPADE a dataset più ampi e diversificati nel campo del patrimonio culturale rappresenterà un obiettivo principale delle future ricerche. Sarà condotta un'analisi comparativa di motivi del patrimonio provenienti da diverse regioni e tradizioni artistiche al fine di migliorare la generalizzazione del modello e la sua adattabilità culturale. Inoltre, estensioni multimodali che integrino descrizioni testuali, documenti storici e metadati culturali potrebbero fornire un orientamento semantico più solido durante la ricostruzione. Il framework potrebbe inoltre essere esteso per supportare la ricostruzione tridimensionale del patrimonio culturale integrando tecniche di ricostruzione basate su immagini con metodi di modellazione 3D. Sarà inoltre esplorata la sua implementazione in archivi digitali, musei, mostre virtuali e piattaforme di conservazione del patrimonio culturale, al fine di facilitare applicazioni pratiche della conservazione e documentazione del patrimonio assistite dall'intelligenza artificiale. Per migliorare ulteriormente l'interpretabilità e l'autenticità culturale, le future ricerche valuteranno l'integrazione di grafi della conoscenza culturale, documentazione etnografica, metadati storici e basi di conoscenza curate da esperti, al fine di consentire un'analisi e una ricostruzione dei motivi culturalmente informate32.

Diversi aspetti pratici devono essere presi in considerazione durante l'implementazione del framework proposto SegCycle-SPADE. Durante l'addestramento di CycleGAN, può verificarsi una convergenza avversaria instabile se le perdite del generatore e del discriminatore diventano fortemente sbilanciate. In tali situazioni, la riduzione del tasso di apprendimento, l'aumento del peso della perdita di coerenza ciclica o il monitoraggio del dominio del discriminatore possono migliorare la stabilità dell'addestramento. Il collasso di modalità può verificarsi quando il generatore produce ripetutamente output visivamente simili; questo problema può essere attenuato mediante un addestramento avversario bilanciato, l'utilizzo di un buffer di riproduzione e un attento monitoraggio delle tendenze delle perdite di generatore e discriminatore. Possono inoltre verificarsi errori di segmentazione quando i motivi culturali presentano trame complesse, basso contrasto o contorni ambigui. Per affrontare questo problema, la qualità delle immagini deve essere verificata prima dell'addestramento e le maschere di segmentazione devono essere ispezionate visivamente per garantire la coerenza delle annotazioni. È inoltre importante mantenere la risoluzione in ingresso e le impostazioni di normalizzazione raccomandate per ottenere prestazioni affidabili di SegFormer. L'instabilità durante l'addestramento può derivare ulteriormente da impostazioni inadeguate del tasso di apprendimento, da dati di addestramento insufficienti o da variazioni numeriche legate all'hardware. Per migliorare la riproducibilità, si dovrebbero utilizzare semi casuali fissi per le operazioni di NumPy, PyTorch, CUDA e di mescolamento del dataset. Inoltre, devono essere mantenuti costanti in tutti i cicli sperimentali la stessa pipeline di pre-elaborazione, le partizioni del dataset, gli iperparametri del modello e l'ambiente software. Si raccomanda inoltre il salvataggio periodico dei checkpoint e il monitoraggio della perdita di validazione per prevenire il degrado delle prestazioni e facilitare il recupero da sessioni di addestramento interrotte.

Il lavoro proposto contribuisce al progresso teorico dei framework basati sull'intelligenza artificiale per la ricostruzione del patrimonio culturale. Gli approcci convenzionali di ripristino delle immagini trattano generalmente segmentazione, ricostruzione e generazione dello stile come processi indipendenti17,19,20,30. Al contrario, questo studio propone un framework che integra questi processi attraverso una strategia di ricostruzione generativa guidata dalla segmentazione. Di conseguenza, lo studio contribuisce allo sviluppo teorico della ricostruzione del patrimonio culturale assistita da intelligenza artificiale, dimostrando come segmentazione, ricostruzione e generazione dello stile possano essere unificati all'interno di un unico framework. Tale integrazione è particolarmente importante nelle applicazioni relative al patrimonio culturale, dove la conservazione della struttura dei motivi e del significato semantico è fondamentale. Da un punto di vista pratico, il framework proposto offre una soluzione efficace per la conservazione digitale, il restauro e il miglioramento artistico dei modelli culturali tradizionali. Istituzioni del patrimonio culturale, musei e designer possono utilizzare SegCycle-SPADE per identificare automaticamente le regioni dei motivi, ricostruire modelli danneggiati o incompleti e generare rappresentazioni artistiche visivamente migliorate di disegni tradizionali. Questa capacità è particolarmente preziosa per le tradizioni artigianali a rischio, tra cui i modelli tessili del batik Miao, in cui gli artefatti storici possono essere parzialmente danneggiati o incompleti. Inoltre, grazie all'integrazione della sintesi generativa dello stile, il framework può supportare applicazioni moderne di design culturale, come il design tessile, la creazione artistica digitale e l'educazione al patrimonio. In questo modo, il framework proposto colma il divario tra la conservazione del patrimonio culturale e le applicazioni contemporanee di design culturale.

Tuttavia, nonostante i risultati promettenti ottenuti dal framework proposto SegCycle-SPADE, permangono diverse limitazioni. In primo luogo, la valutazione è stata condotta utilizzando esclusivamente i dataset Miao Batik e WikiArt, il che potrebbe influire sulla capacità di generalizzazione del framework nella ricostruzione di altre forme di motivi del patrimonio culturale. In secondo luogo, poiché il processo di ricostruzione si basa su modelli GAN, gli output generati possono occasionalmente presentare artefatti o texture innaturali quando si trattano strutture di motivi altamente complesse. In terzo luogo, il framework si concentra attualmente sulla ricostruzione di pattern bidimensionali, mentre alcuni manufatti del patrimonio culturale presentano strutture intrinsecamente tridimensionali. Nel complesso, i risultati sperimentali dimostrano l'efficacia del framework proposto SegCycle-SPADE nella ricostruzione artistica di motivi del patrimonio culturale immateriale (ICH). L'integrazione della segmentazione semantica basata su SegFormer, del CAFFM, della ricostruzione dei motivi basata su CycleGAN e della sintesi artistica basata su SPADE ha migliorato in modo costante le metriche di prestazione relative a segmentazione, ricostruzione e qualità dell'immagine. Gli studi di ablazione hanno ulteriormente validato il contributo di ciascun componente del framework, mostrando che il CAFFM e la loss di preservazione del motivo hanno notevolmente aumentato la fedeltà strutturale e l'autenticità visiva. Questi risultati sostengono l'ipotesi centrale secondo cui la ricostruzione guidata dalla segmentazione semantica, combinata con la fusione di caratteristiche a cross-attenzione, può preservare efficacemente i motivi culturalmente significativi generando output artisticamente ricchi. Pertanto, il framework proposto fornisce un approccio computazionale affidabile e riproducibile per la preservazione digitale, il restauro e la rivitalizzazione creativa dei motivi del patrimonio culturale immateriale.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Conflitto di interessi:
Gli autori dichiarano di non avere interessi concorrenti.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori ringraziano il supporto accademico e istituzionale fornito dal Guangdong Engineering Polytechnic e dalla South China Normal University durante lo svolgimento di questa ricerca. Questa ricerca è stata sostenuta dal Progetto Generale del Fondo Nazionale per le Scienze Sociali 2023 (n. 23BH161), intitolato “Museo di Rigenerazione Digitale: Ricerca sull’Attivazione e sulla Comunicazione dei Reperti Culturali Classici Cinesi di Calligrafia e Pittura”.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
Adam OptimizerPyTorch Optimizer LibraryAdamAlgoritmo di ottimizzazione utilizzato durante l'addestramento del modello.
CUDA ToolkitNVIDIA CorporationCUDA 11.3Accelerazione GPU per i calcoli di deep learning.
cuDNNNVIDIA CorporationcuDNN 8.2Libreria di accelerazione per reti neurali profonde utilizzata per velocizzare l'addestramento e l'inferenza.
CycleGANUniversity of California, Berkeley / Open SourceImplementazione ufficiale PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Rete avversaria generativa utilizzata per la ricostruzione di motivi culturali.
Pesi Pre-addestrati su ImageNetImageNet / Open Sourcemit_b2.pth (Punto di controllo pre-addestrato su ImageNet-1K)Utilizzati per inizializzare il backbone SegFormer-B2 prima del fine-tuning sul dataset Miao Batik.
Processore IntelIntel CorporationIntel Core i7 (11ª generazione)CPU utilizzata per la pre-elaborazione delle immagini, il supporto all'addestramento del modello e l'inferenza.
MatplotlibMatplotlib Development TeamMatplotlib 3.5.1Visualizzazione delle curve di addestramento e dei risultati di valutazione.
Dataset Miao BatikZenodo RepositoryDOI: 10.5281/zenodo.20807658Dataset di motivi culturali contenente 15.148 immagini, utilizzato per la segmentazione semantica e la ricostruzione di pattern.
NumPyNumPy DevelopersNumPy 1.21.5Calcolo numerico ed elaborazione del dataset.
GPU NVIDIANVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)Piattaforma hardware utilizzata per l'addestramento e l'inferenza del modello.
OpenCVOpenCV FoundationOpenCV 4.5.5Pre-elaborazione delle immagini, ridimensionamento, interpolazione e denoising gaussiano.
Sistema OperativoCanonical Ltd.Ubuntu 20.04 LTSAmbiente sperimentale di esecuzione.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0Caricamento e manipolazione delle immagini.
PythonPython Software FoundationPython 3.8.10Linguaggio di programmazione utilizzato per l'implementazione e gli esperimenti.
PyTorchMeta AIPyTorch 1.10.0Framework di deep learning utilizzato per l'addestramento e l'inferenza del modello.
Random SeedExperimental Setting42Seed fisso utilizzato per la partizione del dataset, l'inizializzazione del modello e la riproducibilità sperimentale.
Scikit-learnScikit-learn DevelopersScikit-learn 1.0.2Partizione del dataset, analisi statistica e metriche di valutazione.
SeabornOpen Source CommunitySeaborn 0.11.2Visualizzazione statistica dei dati.
SegFormer-B2NVIDIA Research / Open SourceSegFormer-B2 (Backbone MIT-B2)Modello di segmentazione semantica basato su Transformer utilizzato per la segmentazione di motivi culturali.
Maschere di Segmentazione / AnnotazioniMiao Batik DatasetIncluso con il DatasetEtichette di segmentazione semantica a livello di pixel utilizzate per la classificazione dei motivi e l'addestramento.
SPADENVIDIA Research / Open SourceImplementazione ufficiale PyTorch (https://github.com/NVlabs/SPADE)Modello di sintesi guidata da segmentazione utilizzato per la generazione artistica di pattern.
TorchVisionMeta AITorchVision 0.11.1Utilità per l'elaborazione delle immagini e trasformazioni del dataset utilizzate con PyTorch.
Dataset WikiArtWikiArthttps://www.wikiart.org/Dataset di stili artistici contenente oltre 80.000 opere d'arte appartenenti a 27 stili artistici, utilizzato per l'apprendimento e la sintesi dello stile.

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Articoli correlati