Article de recherche

Reconstruction guidée par segmentation sémantique et synthèse de style artistique de motifs du patrimoine culturel immatériel à l'aide d'un cadre d'apprentissage profond

DOI :

10.3791/71577

14 août 2026

Dans cet article

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Ce protocole décrit un flux de travail d'apprentissage profond pour la segmentation sémantique, la reconstruction et la synthèse de style artistique de motifs du patrimoine culturel immatériel, en utilisant l'extraction de caractéristiques basée sur des transformeurs, la reconstruction antagoniste et la génération d'images spatialement adaptative afin de soutenir la préservation numérique et les applications créatives liées au patrimoine.

Résumé

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La préservation numérique et la reconstruction de motifs du patrimoine culturel immatériel (PCI) attirent une attention croissante avec les progrès des techniques de synthèse d'images fondées sur l'apprentissage profond. Les approches existantes basées sur SegCycle-SPADE ont montré un potentiel pour la segmentation structurelle et la reconstruction artistique de motifs artisanaux traditionnels ; toutefois, des limites persistent, notamment une diversité insuffisante des ensembles de données, une intégration inadéquate des sémantiques culturelles et une préservation insuffisante des caractéristiques structurelles des motifs durant la reconstruction. Pour surmonter ces défis, cette étude propose un cadre SegCycle-SPADE amélioré destiné à la segmentation sémantique et à la reconstruction artistique de types de motifs de PCI. Un modèle de segmentation basé sur les Transformers, SegFormer, est utilisé afin d'identifier précisément les limites des motifs et les régions de motifs. En outre, un module de fusion de caractéristiques culturelles à attention croisée est introduit pour renforcer les motifs culturellement significatifs et améliorer la représentation des caractéristiques. La traduction et la reconstruction des motifs sont réalisées à l'aide de CycleGAN, tandis que la dénormalisation spatialement adaptative (SPADE) est utilisée pour la synthèse du style artistique afin de maintenir la cohérence sémantique entre les cartes de segmentation et les images générées. Afin d'améliorer la généralisation du modèle et la diversité artistique, le cadre est entraîné à l'aide à la fois du jeu de données de motifs culturels Miao Batik et du jeu de données WikiArt. Les résultats expérimentaux démontrent que le cadre SegCycle-SPADE guidé par l'attention proposé améliore la précision de segmentation et les performances de reconstruction des motifs patrimoniaux par rapport aux méthodes existantes de reconstruction basées sur des réseaux antagonistes génératifs (GAN). Le cadre proposé offre une solution évolutible pour la documentation assistée par intelligence artificielle, la reconstruction et la revitalisation artistique de conceptions traditionnelles de motifs.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le patrimoine culturel, qui englobe des éléments intangibles tels que les coutumes, les langues et les croyances, ainsi que des éléments tangibles comme les œuvres d'art, les bâtiments et les documents écrits, constitue une manifestation fondamentale de l'histoire humaine, de la créativité et de l'identité1. La conservation du patrimoine vise à permettre aux communautés de renouer avec leurs origines et d'offrir aux générations futures les bénéfices de leur mémoire culturelle collective. Elle favorise également la compréhension interculturelle, l'appréciation des traditions et coutumes diverses, ainsi que la reconnaissance de récits historiques variés. Ces biens culturels nous aident à comprendre les valeurs, les points de vue et les expériences des générations passées et contribuent à la formation des identités sociales contemporaines et à la continuité culturelle. Les principes fondamentaux de la préservation du patrimoine culturel sont illustrés dans Figure 1.

figure-introduction-1
Figure 1. Aperçu conceptuel de la reconstruction de motifs du patrimoine culturel à l’aide du cadre SegCycle-SPADE. Illustration schématique de l'approche proposée pour la reconstruction et l'amélioration de motifs du patrimoine culturel immatériel. Le flux de travail comprend la collecte de données à partir des ensembles de données Miao Batik et WikiArt, le prétraitement des images, la segmentation sémantique à l’aide de SegFormer-B2, la fusion de caractéristiques à l’aide du module de fusion de caractéristiques culturelles par attention croisée (CAFFM), la reconstruction de motifs à l’aide de CycleGAN, la synthèse de style artistique à l’aide de SPADE, et l’évaluation finale à l’aide de métriques de segmentation et de reconstruction. Les flèches indiquent le flux des données et des représentations de caractéristiques à travers l’ensemble du cadre. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

La mémoire collective et l'héritage culturel de la société humaine sont incarnés dans le patrimoine culturel immatériel (PCI), qui constitue un moyen important d'expression artistique et d'identité culturelle. Toutefois, le PCI fait face à des défis importants en raison des effets de la mondialisation et de la numérisation2,3,4. De nombreuses pratiques de PCI en voie de disparition nécessitent de nouvelles approches en matière de préservation et de développement, en raison de la diminution du nombre d'artisans qualifiés et d'une adaptabilité limitée aux marchés modernes5,6. En tant que domaine important de la recherche sur le PCI, le design durable met l'accent sur le développement intégré de la culture, de la société et de l'environnement, offrant ainsi une voie pratique pour la préservation continue du PCI. Grâce à des approches de design durable, le PCI peut être revitalisé tout en s'adaptant aux besoins de la société contemporaine7,8.

Dans cette étude, le terme « motifs du patrimoine culturel immatériel » désigne des représentations de motifs visuels qui transmettent et préservent des valeurs culturelles immatérielles sous-jacentes. Par conséquent, le cadre proposé vise à préserver et documenter l'information culturelle associée à ces motifs tout en reconstituant leurs formes visuelles.

La broderie Miao et le batik sont des formes importantes du PCI chinois, reflétant l'histoire, les croyances et les traditions de la communauté Miao à travers des motifs symboliques tels que les oiseaux, les papillons et les totems ancestraux9. Ces motifs sont profondément intégrés aux vêtements rituels et aux pratiques festives, et contribuent au développement culturel et économique local10,11. Les progrès des technologies numériques, en particulier de l'intelligence artificielle (IA) et de l'apprentissage profond (DL), ont créé de nouvelles opportunités pour la préservation, l'analyse, la reconstruction et la documentation du patrimoine culturel. Le batik Miao du Guizhou, l'une des traditions de batik les mieux préservées en Chine, constitue un support important pour transmettre les savoirs culturels, les croyances, les coutumes et les rituels du peuple Miao12,13,14,15,16.

De récentes études ont démontré le potentiel du deep learning (apprentissage profond) pour la préservation du patrimoine culturel et la reconstruction de motifs, avec une précision de segmentation améliorée (précision au niveau des pixels = 88,6 %, moyenne de l'intersection sur l'union [IoU] = 78,1 %) et de meilleures performances de reconstruction par rapport à U-Net et DeepLabV3+. Toutefois, plusieurs défis persistent. Les approches existantes fondées sur des réseaux antagonistes génératifs (GAN) éprouvent souvent des difficultés à préserver les détails structurels fins dans les motifs complexes.17, tandis qu'une diversité limitée des ensembles de données restreint la généralisation du modèle à travers les domaines culturels18De plus, les modèles de traduction d'image à image, tels que CycleGAN, peuvent ne pas préserver la cohérence sémantique entre les cartes de segmentation et les images générées.19, et l'absence de mécanismes d'attention peut entraîner la perte de détails des motifs culturellement significatifs lors de la reconstruction20Par conséquent, un cadre amélioré intégrant une segmentation basée sur les transformeurs, un apprentissage des caractéristiques guidé par l'attention et un entraînement sur plusieurs jeux de données est nécessaire pour une reconstruction efficace des motifs d'hémorragie cérébrale intraparenchymateuse (ICH).

De nouvelles opportunités pour la préservation du patrimoine culturel sont apparues grâce à la numérisation de la broderie Miao et aux progrès rapides de l'intelligence artificielle générative. Les modèles de diffusion, une catégorie émergente de modèles génératifs profonds, ont démontré des performances remarquables dans les tâches de vision par ordinateur en raison de leurs capacités puissantes de génération de contenu21,22,23,24,25. Lors du processus de diffusion inverse, le modèle apprend progressivement à reconstruire les données d'origine à partir de représentations bruitées26,27,28. Des études antérieures ont également exploré l'application de technologies de reconstruction tridimensionnelle et de conception assistée par ordinateur (CAO) pour la préservation et la diffusion du patrimoine culturel.

Même si les réseaux neuronaux convolutifs (CNN) et les GAN offrent de bonnes performances en génération d'images et en préservation des caractéristiques, ils font toujours face à des défis liés à des champs réceptifs limités, à l'effondrement de modes et à une instabilité lors de l'apprentissage29. Les architectures basées sur les transformeurs, telles que SegFormer et Segmenter, excellent à capturer le contexte global et les relations sémantiques ; toutefois, elles sont exigeantes en puissance de calcul et peuvent éprouver des difficultés avec les détails fins. Bien que les modèles de diffusion comme Stable Diffusion démontrent de solides capacités de génération d'images, ils manquent souvent d'un contrôle précis sur les caractéristiques structurelles et artistiques des designs générés. De plus, la plupart des approches existantes utilisent des stratégies d'entraînement indépendantes qui limitent le partage efficace d'informations et l'optimisation collaborative entre les composants de segmentation et de génération, entraînant un compromis entre précision structurelle et authenticité artistique30.

Les modèles récents basés sur la diffusion, tels que la diffusion latente et Stable Diffusion, permettent une synthèse d'images de haute qualité, mais nécessitent un débruitage itératif, ce qui augmente le coût computationnel et le temps d'inférence. De plus, la préservation de motifs culturels fins et la cohérence structurelle restent difficiles à atteindre en l'absence de mécanismes de conditionnement spécialisés. Les modèles génératifs basés sur les Transformers capturent efficacement les relations contextuelles globales, mais exigent souvent des ensembles de données à grande échelle et des ressources computationnelles importantes. En revanche, le cadre proposé SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) combine la segmentation basée sur SegFormer, la fusion de caractéristiques par attention croisée, la reconstruction par CycleGAN et la synthèse guidée par SPADE afin de fournir une orientation structurelle explicite, améliorant ainsi la préservation des motifs, la cohérence sémantique et la reconstruction contrôlable des motifs du patrimoine culturel.

La majorité des techniques de pointe de segmentation sémantique reposent sur des réseaux de neurones convolutionnels entièrement convolutifs (FCNN) dotés d'architectures en forme de U31. Pendant la phase d'encodage, des caractéristiques profondes ayant de grands champs réceptifs sont extraites au moyen d'une série d'opérations de convolution et de sous-échantillonnage. La phase de décodage restaure progressivement la résolution spatiale par suréchantillonnage, permettant finalement une prédiction sémantique au niveau des pixels. En compensant la perte d'information spatiale pendant le sous-échantillonnage et en améliorant les performances de segmentation dans un large éventail d'applications, les connexions de saut permettent d'intégrer directement dans le décodeur des informations à haute résolution provenant de différents niveaux de l'encodeur32.

Bien que les méthodes récentes basées sur des GAN, des CNN ou des modèles de diffusion aient donné des résultats prometteurs en matière de génération d'images et de restauration du patrimoine culturel, elles peinent souvent à maintenir une cohérence sémantique, à préserver les motifs structurels fins et à assurer une reconstruction reproductible à travers des motifs culturels variés. La plupart des approches existantes traitent la segmentation, la reconstruction et la synthèse de style comme des processus distincts, ce qui peut entraîner la perte d'éléments culturellement significatifs et des résultats incohérents. Pour combler cette lacune méthodologique, cette étude propose un cadre unifié SegCycle-SPADE qui intègre une segmentation sémantique basée sur SegFormer, un nouveau module de fusion de caractéristiques culturelles par attention croisée (CAFFM), une reconstruction basée sur CycleGAN et une synthèse de style guidée par SPADE. En intégrant explicitement l'information de segmentation structurelle à l'apprentissage génératif de caractéristiques, le cadre proposé permet une reconstruction plus fiable, sémantiquement cohérente et reproductible des motifs du patrimoine culturel immatériel (ICH), tout en préservant l'authenticité culturelle et la qualité artistique.

Trois principales limites des approches actuelles de reconstruction du patrimoine culturel sont identifiées dans cette étude : (i) une préservation insuffisante des motifs structurels fins dans les méthodes de reconstruction basées sur des GAN ; (ii) une généralisation limitée résultant d’un entraînement sur des ensembles de données restreints ou spécifiques à un domaine ; et (iii) une cohérence sémantique insuffisante entre les sorties de segmentation et les images générées dans les cadres de traduction image-à-image. De plus, la segmentation, la reconstruction et la synthèse de style sont généralement traitées comme des processus distincts, ce qui entraîne la perte d’éléments culturellement importants durant la reconstruction. En combinant une segmentation sémantique basée sur les transformeurs, une fusion de caractéristiques par attention croisée, une reconstruction CycleGAN et une synthèse artistique guidée par SPADE au sein d’une architecture unifiée, le cadre proposé SegCycle-SPADE remédie à ces limites et améliore la préservation des motifs, la cohérence sémantique et l’authenticité artistique dans la reconstruction des motifs du PCI.

L'objectif principal de cette étude est de développer un cadre SegCycle-SPADE amélioré pour la reconstruction artistique guidée par segmentation sémantique des motifs d'hématome intracérébral (ICH). Ce cadre intègre SegFormer pour une segmentation précise des motifs culturels, CycleGAN pour la reconstruction des motifs et SPADE pour une synthèse artistique cohérente sur le plan du style. Afin d'améliorer la représentation des caractéristiques et de préserver les détails structurels fins, un module CAFFM est introduit pour faciliter une interaction efficace entre les caractéristiques de segmentation et celles de génération. Entraîné sur les ensembles de données Miao Batik et WikiArt, le cadre proposé améliore l'authenticité de la reconstruction, la cohérence stylistique et la préservation des motifs culturellement significatifs.

En combinant la segmentation sémantique, la fusion de caractéristiques guidée par l'attention, la reconstruction de motifs et la synthèse de style au sein d'une architecture unifiée, cette étude présente un nouveau cadre SegCycle-SPADE pour la reconstruction artistique de motifs ICH. Les principales contributions de ce travail sont les suivantes. Premièrement, un nouveau cadre de reconstruction guidé par segmentation sémantique est développé grâce à l'intégration de SegFormer, permettant l'extraction précise et la préservation de motifs culturels complexes et d'éléments structurels. Deuxièmement, un nouveau module CAFFM est introduit afin de fusionner efficacement les caractéristiques de segmentation avec des représentations génératives, permettant au modèle de capturer les relations à longue portée entre les motifs culturels et les schémas de style artistique. Troisièmement, le CAFFM proposé améliore la préservation des éléments culturellement significatifs tout en renforçant le réalisme visuel et la cohérence structurelle des motifs patrimoniaux reconstruits. Quatrièmement, en intégrant CycleGAN pour la reconstruction de motifs culturels et SPADE pour la synthèse artistique guidée par segmentation, le cadre garantit à la fois une précision sémantique et une authenticité stylistique dans les sorties générées. Cinquièmement, afin d'améliorer la généralisation et la diversité artistique, le modèle est entraîné à l'aide du jeu de données des motifs culturels du batik Miao pour l'apprentissage des motifs culturels et du jeu de données WikiArt pour la représentation des styles artistiques. WikiArt sert de jeu de données auxiliaire pour évaluer la capacité de généralisation du cadre, la robustesse de l'apprentissage des caractéristiques et l'efficacité du contrôle du style dans divers contextes visuels, plutôt que comme style cible pour une application directe dans les produits du patrimoine culturel Miao. Enfin, par rapport aux méthodes existantes de reconstruction du patrimoine culturel basées sur des GAN, les résultats expérimentaux montrent que le cadre SegCycle-SPADE proposé atteint une meilleure précision de segmentation, une qualité de reconstruction accrue et une cohérence stylistique améliorée.

Protocole

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cadre proposé de SegCycle-SPADE a été conçu pour reconstruire et améliorer les motifs traditionnels du patrimoine culturel grâce à la segmentation sémantique, au renforcement des caractéristiques à l’aide de mécanismes d’attention, à la reconstruction générative et à la synthèse de styles artistiques. Cette étude a utilisé des ensembles de données publics d’images patrimoniales et artistiques, notamment le jeu de données Miao Batik et le jeu de données WikiArt. Aucun participant humain, donnée de patient, information personnelle, sujet animal ou dossier clinique n’a été impliqué dans la recherche ; par conséquent, aucune approbation par un comité d’éthique institutionnel ni consentement éclairé n’était requis. Dans un premier temps, le jeu de données des motifs culturels Miao Batik et le jeu de données WikiArt ont été utilisés pour l’évaluation. Le jeu de données Miao Batik a été décrit par Quan et al. (2024)32 et contient 15 148 images annotées de motifs traditionnels de batik Miao. Les annotations existantes fournies par les créateurs du jeu de données ont été utilisées directement, et aucune annotation manuelle supplémentaire n’a été générée dans cette étude. Ensuite, un prétraitement des images est effectué par redimensionnement, normalisation, suppression du bruit et création d’une carte de segmentation. Les paramètres exacts de prétraitement sont décrits dans la sous-section Prétraitement des données. Le cadre proposé utilise un modèle basé sur les transformeurs, nommé SegFormer-B2, pour la segmentation sémantique des données. La méthode est conçue pour détecter les régions clés des motifs culturels et en apprendre les structures. Les caractéristiques segmentées sont ensuite renforcées par un mécanisme d’attention, dans lequel les informations importantes liées aux motifs culturels sont mises en évidence tandis que les informations non pertinentes sont éliminées. La configuration du mécanisme d’attention est décrite dans la sous-section CAFFM. Les caractéristiques améliorées sont ensuite transmises à CycleGAN, où les structures endommagées sont reconstruites par apprentissage cyclique. Pendant l’entraînement, des échantillons de motifs incomplets ont été artificiellement créés en appliquant des opérations de masquage aléatoire et d’occlusion partielle aux images originales de batik Miao. Ces procédures de dégradation simulaient des régions manquantes et des dommages structurels fréquemment observés dans les artefacts du patrimoine culturel dégradés. Les images incomplètes ainsi obtenues ont été utilisées comme entrées du module de reconstruction CycleGAN, tandis que les images originales correspondantes servaient de cibles de reconstruction. Les motifs du patrimoine culturel reconstruits sont ensuite améliorés par SPADE, où un enrichissement artistique est réalisé à partir des cartes de segmentation générées. Les performances du cadre proposé sont évaluées à l’aide de métriques quantitatives de segmentation et de qualité d’image, tandis que l’authenticité visuelle des motifs culturels reconstruits est évaluée de manière qualitative. L’authenticité visuelle a été évaluée par inspection visuelle des motifs culturels générés et n’a pas été utilisée comme métrique quantitative indépendante. L’évaluation s’est concentrée sur la préservation des motifs, la cohérence sémantique, les caractéristiques culturelles, la cohérence structurelle et l’apparence artistique par rapport aux motifs culturels de référence correspondants. L’évaluation quantitative des performances du modèle a été réalisée à l’aide de l’exactitude de segmentation, de l’indice d’intersection sur union (IoU), du coefficient de Dice, de la mesure d’indice de similarité structurelle (SSIM), du rapport signal sur bruit de crête (PSNR) et de la distance d’Inception de Fréchet (FID). Figure 2 illustre l'ensemble du flux de travail du cadre SegCycle-SPADE proposé et résume les métriques d'évaluation utilisées dans cette étude.

figure-protocol-1
Figure 2. Architecture générale du flux de travail du cadre SegCycle-SPADE proposé. Aperçu du flux de travail complet de SegCycle-SPADE. Les images provenant des ensembles de données Miao Batik et WikiArt subissent un prétraitement avant d'être traitées par segmentation sémantique à l'aide de SegFormer-B2, amélioration des caractéristiques à l'aide du CAFFM, reconstruction des motifs à l'aide de CycleGAN et génération de style artistique à l'aide de SPADE. Les performances du modèle sont évaluées à l'aide de la précision de segmentation, de l'intersection sur l'union (IoU), du coefficient de Dice, de la mesure d'indice de similarité structurale (SSIM), du PSNR et de la distance d'Inception de Fréchet (FID), tandis que l'authenticité visuelle est évaluée de manière qualitative. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Le cadre SegCycle-SPADE pour la reconstruction de motifs patrimoniaux est conçu pour intégrer plusieurs composants d'apprentissage profond afin d'assurer une segmentation, une reconstruction et une amélioration artistique précises des motifs, comme illustré dans la Figure 2. Des images provenant du jeu de données sur les motifs culturels du batik Miao et du jeu de données WikiArt sont utilisées afin de fournir une diversité de motifs culturels et de styles artistiques. Dans un premier temps, les images sont traitées à l'aide d'un module de segmentation sémantique basé sur SegFormer afin d'identifier et de délimiter les motifs culturels par rapport à l'arrière-plan. L'architecture globale comprend quatre étapes principales. Premièrement, le modèle SegFormer extrait des cartes de segmentation sémantique à partir des images de motifs culturels. Deuxièmement, le CAFFM intègre les caractéristiques de segmentation avec des représentations génératives afin d'améliorer l'apprentissage des caractéristiques. Troisièmement, le module CycleGAN reconstruit les motifs culturels en utilisant les représentations de caractéristiques fusionnées. Enfin, le module SPADE génère des sorties améliorées sur le plan stylistique tout en préservant la cohérence structurelle grâce à une synthèse guidée par la segmentation. Les cartes de caractéristiques affinées sont ensuite traitées par le module de reconstruction CycleGAN, qui apprend à restaurer les motifs culturels incomplets en associant les motifs dégradés à leurs formes complètes correspondantes. Des échantillons de motifs incomplets ont été générés en appliquant des opérations aléatoires de masquage et d'occultation partielle aux images originales de batik Miao, simulant ainsi des régions manquantes et une dégradation structurelle couramment observées sur les artefacts culturels endommagés. Chaque image dégradée a été appariée avec son image originale correspondante, qui a servi de cible de reconstruction durant l'entraînement. Cette stratégie a permis au module CycleGAN d'apprendre à restaurer les structures de motifs manquants tout en préservant la cohérence sémantique et les caractéristiques culturellement significatives. Enfin, le générateur SPADE produit des sorties artistiques visuellement améliorées en conditionnant la synthèse d'images aux cartes de segmentation générées, préservant ainsi l'intégrité structurelle des motifs culturels tout au long du processus d'amélioration artistique.

Les étapes suivantes sont incluses dans le cadre proposé du SegCycle-SPADE.

Étape 1 : Collecte du jeu de données
Deux jeux de données ont été utilisés afin d'atteindre les objectifs d'apprentissage des motifs culturels et de génération de styles artistiques. Le jeu de données des motifs culturels du batik Miao a été utilisé pour fournir des informations sur les motifs culturels traditionnels. Ce jeu de données est accessible publiquement via Zenodo (https://doi.org/10.5281/zenodo.20807658) et contient 15 148 images annotées de motifs traditionnels de batik Miao. Les annotations existantes fournies par les créateurs du jeu de données ont été utilisées directement, et aucune annotation manuelle supplémentaire n'a été générée dans cette étude. Le jeu de données WikiArt a été utilisé pour fournir des informations variées sur les styles artistiques en vue de la génération de styles artistiques, et a été obtenu à partir du référentiel WikiArt accessible publiquement (https://www.wikiart.org/).

Étape 2 : Prétraitement des données
Toutes les images ont été prétraitées par redimensionnement, normalisation et réduction du bruit. Les annotations existantes de motifs culturels, obtenues à partir des sources du jeu de données d'origine, ont été utilisées pour soutenir l'étape de segmentation sémantique. Aucune annotation supplémentaire ni aucune procédure de reclassement n'a été effectuée dans le cadre de cette étude.

Étape 3 : Segmentation sémantique par motifs à l'aide de SegFormer
Le modèle SegFormer a été utilisé pour la segmentation des motifs culturels. Le choix précis du squelette du modèle et la stratégie d'initialisation sont décrits dans la sous-section Semantic Pattern Segmentation Using SegFormer. Plus précisément, l'architecture SegFormer-B2, dotée d'un squelette MIT-B2 pré-entraîné sur ImageNet, a été utilisée pour la segmentation sémantique des motifs. Ce modèle capture efficacement les informations contextuelles globales tout en préservant les détails structurels complexes des motifs culturels traditionnels.

Étape 4 : CAFFM
Le CAFFM combine des caractéristiques de segmentation sémantique avec des représentations génératives, permettant au cadre d'apprendre à la fois les caractéristiques des motifs structurels et les informations stylistiques artistiques. Les détails d'intégration du CAFFM sont fournis dans la sous-section CAFFM. Le module est positionné entre l'étape de segmentation sémantique basée sur SegFormer et l'étape de reconstruction générative, où il fusionne les caractéristiques structurelles issues de la segmentation avec les caractéristiques de reconstruction au moyen d'une attention croisée multi-têtes. Ce processus améliore la préservation des motifs culturels et renforce le réalisme des sorties reconstruites.

Étape 5 : Reconstruction du motif (CycleGAN)
Les caractéristiques fusionnées sont ensuite traitées par le module CycleGAN afin de reconstruire les structures de motifs culturels. L'architecture CycleGAN et la configuration d'apprentissage sont décrites dans la sous-section Reconstruction du motif à l'aide de CycleGAN. Le module de reconstruction comprend deux générateurs et deux discriminateurs, utilise une architecture de générateur de type réseau résiduel comportant neuf blocs résiduels, emploie un discriminateur PatchGAN, et est entraîné à l'aide de pertes adversariales et de pertes de cohérence cyclique. Cette configuration permet un mappage bidirectionnel entre les domaines et facilite la reconstruction de structures de motifs culturels incomplètes.

Étape 6 : Génération de style artistique (SPADE)
Les motifs reconstruits sont ensuite traités par le module SPADE afin d'effectuer une synthèse de style artistique guidée par segmentation. La configuration du générateur SPADE est décrite dans la sous-section Artistic Style Generation Using SPADE. Le module utilise des blocs résiduels SPADE, des couches de normalisation adaptative spatiale et une conditionnelle sémantique dérivée des cartes de segmentation de SegFormer et des représentations de caractéristiques CAFFM. En conditionnant la génération d'images sur des cartes de segmentation, les sorties synthétisées conservent un alignement structurel avec les motifs culturels d'origine tout en intégrant des caractéristiques stylistiques artistiques.

Étape 7 : Estimation des performances
Le cadre proposé a été évalué à l’aide de plusieurs métriques d’évaluation de la segmentation et de la qualité d’image, notamment la précision de la segmentation, l’indice d’intersection sur union (IoU), le coefficient de similarité de Dice (Dice), le SSIM, le PSNR et le FID. Afin d’évaluer la cohérence expérimentale, toutes les expériences ont été répétées cinq fois en utilisant différentes graines aléatoires, et les résultats sont indiqués sous la forme moyenne ± écart-type. La signification statistique a été évaluée à l’aide de tests t appariés, avec un seuil de significativité de p < 0,05.

Collecte des ensembles de données
Dans le cadre proposé de SegCycle-SPADE, deux ensembles de données sont utilisés pour la compréhension des motifs culturels et l'apprentissage de style. Le premier ensemble de données utilisé dans ce cadre est l'ensemble de données des motifs culturels du batik Miao. Cet ensemble contient des motifs culturels du batik Miao, généralement des images traditionnelles de batik Miao incluant des motifs tels que des animaux, des plantes et des formes géométriques, utilisés dans l'art de l'ethnie Miao. Cet ensemble comprend des images riches en informations texturales, généralement importantes pour la préservation du patrimoine culturel. Le second ensemble de données utilisé dans le cadre proposé de SegCycle-SPADE est l'ensemble de données WikiArt. Cet ensemble contient un grand nombre d'œuvres d'art provenant généralement de styles variés. Il est utilisé pour l'apprentissage de styles complexes, ce qui est généralement utile pour améliorer les œuvres artistiques. Cet ensemble comprend 80 000 œuvres d'art en haute définition, regroupées en 27 styles différents, ce qui le rend particulièrement adapté aux tâches de génération ou de transformation de style basées sur l'apprentissage profond (DL).

Jeu de données Miao Batik :
Le jeu de données Miao Batik (https://doi.org/10.5281/zenodo.20807658) comprend 15 148 images de motifs de batik représentant des symboles culturellement significatifs. Les images incluent une variété de dessins traditionnels, tels que des motifs animaux (par exemple, papillons et poissons), des motifs végétaux et des formes géométriques portant une symbolique culturelle. Ce jeu de données constitue un élément essentiel du cadre proposé, car il fournit des structures culturelles authentiques permettant au module de segmentation d'identifier et de préserver avec précision les limites des motifs lors de la reconstruction des motifs (Tableau 1). Dans cette étude, les motifs culturellement importants désignent des éléments visuels symboliques couramment répertoriés dans la littérature relative au patrimoine culturel Miao et représentés dans les annotations du jeu de données, notamment des oiseaux, des papillons, des motifs floraux et des totems ancestraux. Ces motifs ont été sélectionnés en fonction de leur importance culturelle documentée et de leur présence récurrente dans les dessins traditionnels de batik et de broderie Miao, et non uniquement en fonction de leur fréquence d'apparition ou de leur composition spatiale. Les annotations de motifs guidées par des experts et les étiquettes de segmentation proviennent de la source d'origine du jeu de données Miao Batik et ont été utilisées directement dans cette étude. Aucune annotation manuelle supplémentaire, aucun reclassement ni aucune procédure d'annotation guidée par des experts n'ont été effectués par les auteurs. Les annotations existantes fournies par les créateurs du jeu de données ont été utilisées pour l'entraînement et l'évaluation de la segmentation sémantique.

ParamètreDescription
Nom du jeu de donnéesMiao Batik Cultural Pattern Dataset
Source du jeu de donnéesRéférentiel Zenodo (DOI : 10.5281/zenodo.20807658)
DomainePatrimoine culturel immatériel (PCI) / Analyse de motifs textiles
Nombre total d'images15 148 images
Type d'imageImages numériques de motifs traditionnels textiles de batik Miao
Catégories de motifsMotifs animaux, motifs végétaux et motifs géométriques
Origine culturelleCulture ethnique Miao, province de Guizhou, Chine
Résolution initiale des imagesImages haute résolution (généralement ≥ 1 000 pixels sur le côté le plus court) capturées sous forme de scans bruts ou de photographies avant le prétraitement
Résolution d'entraînementImages redimensionnées à 256 × 256 pixels lors du prétraitement
Disponibilité des annotationsLes annotations de segmentation existantes fournies par les créateurs du jeu de données ont été utilisées sans modification pour l'entraînement et l'évaluation. Aucune annotation manuelle supplémentaire, aucun reclassement ni aucune procédure de confirmation par un expert n'ont été effectués dans cette étude.
Application dans cette étudeSegmentation de motifs culturels, extraction de caractéristiques, préservation de motifs et reconstruction de motifs

Tableau 1 : Caractéristiques du jeu de données des motifs culturels du batik Miao. Résumé du jeu de données des motifs culturels du batik Miao utilisé pour la segmentation sémantique, l'analyse des motifs culturels et la reconstruction des motifs. Le tableau décrit la source du jeu de données, les caractéristiques des images, les catégories de motifs, l'origine culturelle, la résolution des images et le rôle de ce jeu de données dans le cadre proposé SegCycle-SPADE.

Jeu de données WikiArt :
Le jeu de données WikiArt [https://www.wikiart.org/] est un référentiel numérique d'art à grande échelle très utilisé, comprenant plus de 80 000 images issues de 27 styles artistiques différents présentés dans le tableau 2. Ces styles incluent l'art de la Renaissance, l'impressionnisme, le cubisme et le surréalisme. Ce jeu de données est très important dans le cadre proposé, car il fournit des connaissances permettant au module SPADE de créer des motifs enrichis culturellement tout en préservant les informations structurelles obtenues à partir du processus de segmentation. Le jeu de données comprend 56 000 images pour l'apprentissage et 12 000 images destinées à la validation et aux tests. Les images de ce jeu de données contribuent efficacement à l'entraînement du modèle d'apprentissage profond.

ParamètreDescription
Nom du jeu de donnéesWikiArt Dataset
Source du jeu de donnéesRéférentiel WikiArt (https://www.wikiart.org/)
DomaineArt numérique et peintures
Nombre total d'imagesEnviron 80 000 œuvres
Images d'entraînement56 000
Images de validation12 000
Images de test12 000
Styles artistiques27 styles artistiques, incluant la Renaissance, l'Impressionnisme, le Cubisme, le Surréalisme, l'Expressionnisme, le Réalisme et l'Art abstrait
Résolution initiale des imagesLes résolutions initiales des images varient selon les œuvres et les sources. Les images ont été redimensionnées à une résolution uniforme de 256 × 256 pixels lors du prétraitement.
Résolution d'entraînementLes images ont été redimensionnées à 256 × 256 pixels lors du prétraitement, avant l'apprentissage du style artistique et la synthèse d'images guidée par segmentation.
Partitionnement du jeu de donnéesPartitionnement aléatoire stratifié (70 % entraînement, 15 % validation, 15 % test) utilisant une graine aléatoire fixe de 42
Stratégie d'échantillonnage des stylesUn échantillonnage proportionnel stratifié a été utilisé afin de préserver la distribution des 27 styles artistiques dans les sous-ensembles d'entraînement, de validation et de test.
Application dans cette étudeApprentissage du style artistique, représentation du style et synthèse artistique guidée par segmentation

Tableau 2 : Caractéristiques du jeu de données WikiArt. Résumé du jeu de données WikiArt utilisé pour l'apprentissage du style artistique et la synthèse d'images guidée par le style. Le tableau décrit la source du jeu de données, la répartition des images, la couverture des styles artistiques, la partition du jeu de données, la résolution des images, ainsi que son application dans le cadre proposé SegCycle-SPADE.

Le jeu de données Miao Batik contient 15 148 images représentant des motifs culturels traditionnels Miao. Ce jeu de données est accessible publiquement via Zenodo (https://doi.org/10.5281/zenodo.20807658). Avant l'entraînement du modèle, toutes les images ont été inspectées visuellement et redimensionnées à 256 × 256 pixels, normalisées et examinées pour détecter les échantillons corrompus ou en double. Le contrôle qualité n’a conduit à l’exclusion d’aucune image ; par conséquent, l’ensemble des 15 148 images a été conservé pour les analyses ultérieures. Le jeu de données a été divisé aléatoirement en sous-ensembles d’apprentissage (70 %), de validation (15 %) et de test (15 %), en utilisant une graine aléatoire fixe de 42 afin d’assurer la reproductibilité des partitions. Le jeu de données WikiArt a été consulté via le dépôt officiel WikiArt (https://www.wikiart.org/) et contient plus de 80 000 œuvres d’art couvrant 27 styles artistiques. Pour les expériences d’apprentissage des styles, 56 000 images ont été utilisées pour l’entraînement, 12 000 pour la validation et 12 000 pour les tests.

Prétraitement des données
Avant l'entraînement du cadre proposé SegCycle-SPADE, le jeu de données des motifs culturels du tissu batik Miao et le jeu de données WikiArt ont subi plusieurs étapes de prétraitement afin d'assurer une qualité d'image cohérente et une représentation précise des caractéristiques. Le même pipeline de prétraitement fondamental, comprenant la suppression du bruit par filtrage gaussien, la normalisation, le redimensionnement à une résolution d'entrée uniforme et la vérification de la qualité des images, a été appliqué aux deux jeux de données. Toutefois, les jeux de données ont joué des rôles distincts au sein du cadre. Le jeu de données WikiArt a été utilisé pour l'apprentissage et la synthèse de styles artistiques, tandis que le jeu de données Miao Batik a été principalement utilisé pour la segmentation et la reconstruction des motifs culturels. Aucune modification spécifique aux jeux de données n'a été apportée au-delà de ces rôles liés aux tâches. Pour garantir un traitement cohérent par le modèle d'apprentissage profond (DL), les images ont d'abord été redimensionnées à une résolution fixe. Cette étape était nécessaire car les images des deux jeux de données présentaient des résolutions variables selon leur source. Le redimensionnement a amélioré l'efficacité computationnelle et a empêché les incohérences dimensionnelles d'affecter l'entraînement. La deuxième étape de prétraitement a été la normalisation, au cours de laquelle les valeurs des pixels ont été ramenées à une plage standardisée afin de stabiliser les mises à jour de gradient pendant l'entraînement. Les images ont ensuite été traitées à l'aide d'un filtrage gaussien pour réduire le bruit susceptible d'interférer avec les structures des motifs culturels. Pour le jeu de données Miao Batik, les masques existants de segmentation des motifs culturels, obtenus directement à partir de la source d'origine du jeu de données, ont été utilisés sans modification pour l'entraînement et l'évaluation de la segmentation sémantique. Aucun nouveau masque de segmentation n'a été généré spécifiquement pour cette étude.

Sauf indication contraire, les équations décrivant les méthodes établies ont été adaptées d'études antérieures et sont citées en conséquence. Les équations décrivant le CAFFM proposé et le cadre d'optimisation composite SegCycle-SPADE ont été élaborées par les auteurs pour cette étude.

Soit une image d'entrée provenant du jeu de données représentée par Équation 1 :

figure-protocol-2  (1)

Ici, H, W et C désignent respectivement la hauteur, la largeur et le nombre de canaux de couleur de l'image. Toutes les images sont redimensionnées à une dimension fixe H′ × W′, comme indiqué dans l'Équation 2 :

figure-protocol-3

Ici, Ir est l'image redimensionnée. Les valeurs normalisées des pixels sont calculées selon l'équation 3 :

figure-protocol-4   (3)

Cela permet de stabiliser la procédure d'apprentissage. Le filtrage du bruit est effectué à l'aide d'un filtre gaussien, comme indiqué dans l'équation 4 :

figure-protocol-5

Ici, G(σ) est un filtre gaussien et * représente une convolution. Un filtre gaussien à noyau 5 × 5 avec un écart type de σ = 1.0 a été utilisé. Un remplissage réfléchi a été appliqué aux pixels des bords afin de réduire les artefacts de bord. Avant la mise à l'échelle et la normalisation, le processus de suppression du bruit a été effectué immédiatement après le chargement de l'image. Afin de garantir un prétraitement uniforme tout au long de l'étude, la même configuration de filtre a été appliquée à chaque image des ensembles de données Miao Batik et WikiArt. Pour l'ensemble de données Miao Batik, les masques de segmentation sont créés selon l'équation 5 :

figure-protocol-6

Ici, M est un masque de segmentation utilisé pour guider le modèle SegFormer.

Le pipeline de prétraitement commence par l'acquisition d'images à partir des ensembles de données Miao Batik et WikiArt, comme illustré dans la Figure 3. Aucune technique d'augmentation des données n'a été utilisée pendant l'apprentissage. Après le prétraitement, qui comprenait le redimensionnement, la normalisation, le débruitage gaussien et la préparation des masques de segmentation, les images ont été directement utilisées pour l'entraînement, la validation et les tests du cadre SegCycle-SPADE proposé. La première étape du pipeline de prétraitement consiste à redimensionner les images à une taille fixe, permettant au modèle d'apprentissage profond de traiter les images plus efficacement. La deuxième étape concerne la normalisation, qui convertit les valeurs des pixels en une plage numérique standardisée et facilite la convergence du modèle. La troisième étape implique la suppression du bruit, par laquelle les images sont débarrassées des perturbations indésirables afin d'améliorer la reconnaissance des motifs. En outre, pour l'ensemble de données Miao Batik, les régions des motifs culturels sont annotées, permettant la génération de masques utilisés dans le module de segmentation du modèle proposé, garantissant ainsi que les motifs culturels soient préservés durant la génération. Le résultat final de cette étape est un ensemble de données nettoyé, prêt à être utilisé pour l'entraînement des modules de segmentation et de génération du modèle proposé.

figure-protocol-7
Figure 3. Pipeline de prétraitement des données pour les images du patrimoine culturel. Flux de travail illustrant les procédures de prétraitement des images appliquées avant l'entraînement du modèle. Le pipeline comprend l'acquisition du jeu de données, le redimensionnement des images, la normalisation, le débruitage gaussien, les annotations existantes de motifs culturels et la préparation des masques de segmentation. Les images et masques traités résultants sont utilisés comme entrées pour la segmentation sémantique et la reconstruction de motifs. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Chaque image a fait l'objet d'un processus de contrôle de qualité avant l'entraînement du modèle. Le jeu de données Miao Batik contenait 15 148 images. Les échantillons corrompus, en double et de faible qualité avaient déjà été traités par les créateurs du jeu de données d'origine ; par conséquent, aucune image supplémentaire n'a été exclue lors du contrôle de qualité dans cette étude. En conséquence, les 15 148 images ont été conservées pour l'analyse. Les images ont été chargées au format RVB lors du prétraitement et redimensionnées à 256 × 256 pixels à l'aide d'une interpolation bilinéaire. Les valeurs des pixels ont été mises à l'échelle depuis l'intervalle [0, 255] vers [0, 1] en divisant par 255. Une normalisation par canal a ensuite été appliquée en utilisant des valeurs moyennes de [0,485, 0,456, 0,406] et des écarts types de [0,229, 0,224, 0,225] respectivement pour les canaux rouge, vert et bleu. Le pipeline de prétraitement comprenait le chargement des images, la conversion en RVB, le redimensionnement, la mise à l'échelle des valeurs des pixels, la normalisation et la conversion en tenseur. Lorsque cela était nécessaire, les images en niveaux de gris étaient converties au format RVB à trois canaux afin de maintenir la compatibilité avec les modèles d'apprentissage profond. Après le prétraitement, les images ont été réparties en sous-ensembles d'entraînement, de validation et de test. Toutes les étapes du cadre SegCycle-SPADE — y compris la segmentation sémantique, la fusion de caractéristiques, la reconstruction de motifs et la synthèse artistique basée sur SPADE — ont utilisé une résolution d'entrée constante de 256 × 256 pixels.

Segmentation par motifs sémantiques à l'aide de SegFormer
Après cette étape de prétraitement, les images nettoyées et normalisées du jeu de données des motifs culturels du tissu Batik Miao et du jeu de données WikiArt sont intégrées au module de segmentation sémantique basé sur l'architecture proposée de SegFormer-B2. L'objectif de cette étape est d'identifier correctement et de séparer les motifs culturels présents dans les motifs patrimoniaux. L'architecture proposée de SegFormer repose sur une architecture de type transformeur qui intègre un encodeur transformeur hiérarchique et un décodeur léger à base de perceptron multicouche (MLP) afin de capturer précisément l'information contextuelle globale ainsi que les détails structurels des motifs patrimoniaux complexes. Le modèle extrait d'abord des représentations de caractéristiques à plusieurs échelles à partir de l'image d'entrée, puis fusionne ces représentations via le décodeur afin de produire des motifs segmentés précis. Cela garantit que les motifs présents dans l'image patrimoniale sont correctement segmentés en éléments tels que des motifs géométriques, floraux ou symboliques, en les séparant ainsi du fond tout en préservant leur intégrité structurelle. Ces informations structurelles sont ensuite utilisées lors des étapes ultérieures de génération de motifs dans le cadre de SegCycle-SPADE.

Soit l'image d'entrée prétraitée représentée par Équation 6 :

figure-protocol-8    (6)

L'encodeur SegFormer divise l'image en fragments et extrait des caractéristiques hiérarchiques à l'aide de couches de transformation, comme indiqué dans l'équation 71 :

figure-protocol-9

Ici, F désigne les cartes de caractéristiques multi-échelles obtenues à partir de l'encodeur de transformeur. Ces caractéristiques codent à la fois les motifs de texture locaux et les relations contextuelles globales entre les régions de motifs. Le modèle SegFormer extrait des cartes de caractéristiques à différentes échelles, tel que défini dans l'équation 8 :

figure-protocol-10

L'utilisation de représentations multiscales facilite la détection de motifs de différentes tailles au sein des motifs culturels. Enfin, les caractéristiques sont combinées à l'aide du décodeur MLP comme indiqué dans l'équation 91 :
 figure-protocol-11

Ici, S désigne la carte de segmentation prédite finale.

Le squelette SegFormer-B2 a été initialisé à l'aide de poids préentraînés sur ImageNet, puis affiné sur le jeu de données Miao Batik pour la segmentation de motifs culturels. Le point de contrôle préentraîné a été obtenu à partir de l'implémentation officielle de SegFormer. Plus précisément, le point de contrôle MIT-B2 préentraîné sur ImageNet-1K (mit_b2.pth), fourni par le dépôt officiel de SegFormer, a été utilisé pour initialiser le squelette SegFormer-B2 avant l'affinage. Les poids préentraînés correspondent au squelette MIT-B2 publié par les auteurs de SegFormer et ont servi de modèle d'initialisation pour l'entraînement à la segmentation sémantique. Les couches restantes spécifiques à la tâche ont été initialisées à l'aide des procédures d'initialisation des poids par défaut de PyTorch avant l'entraînement.

Un encodeur Transformer hiérarchique à quatre étapes utilisant des incorporations de fragments superposés est employé dans l'architecture. À la première étape, la taille des fragments a été fixée à 7 × 7 avec un pas de 4. Pour chacune des quatre étapes de l'encodeur, les dimensions d'incorporation étaient respectivement de 64, 128, 320 et 512. Sur l'ensemble des quatre étapes, on comptait 1, 2, 5 et 8 têtes d'auto-attention multi-têtes, et les profondeurs correspondantes de l'encodeur étaient respectivement de 3, 4, 6 et 3 couches. Les caractéristiques multi-échelles extraites par l'encodeur ont été agrégées à l'aide d'un décodeur entièrement basé sur des perceptrons multicouches (MLP) léger. Avant de produire la carte de segmentation finale, le décodeur a projeté les caractéristiques issues de chaque étape de l'encodeur vers un espace d'incorporation unique. Tous les blocs Transformer ont utilisé la fonction d'activation appelée unité linéaire d'erreur gaussienne (GELU). Un taux de dropout de 0,1 a été appliqué lors de l'apprentissage afin d'améliorer la généralisation et de réduire le surapprentissage.

Durant la phase d'apprentissage, le cadre SegFormer reçoit les images prétraitées provenant des deux jeux de données. Les images du jeu de données Miao Batik contiennent des régions de motifs qui servent d'étiquettes pour l'apprentissage supervisé du modèle de segmentation. L'encodeur Transformer traite l'image entière et capture les relations à longue portée entre les composants de l'image, ce qui est particulièrement important pour les motifs traditionnels de batik comportant des motifs répartis spatialement. Le mécanisme d'extraction hiérarchique des caractéristiques capture simultanément les structures locales telles que les textures géométriques répétées. Le décodeur MLP traite ces caractéristiques extraites et produit un masque de segmentation mettant en évidence les régions de motifs. Les cartes de segmentation générées à cette étape sont ensuite utilisées comme entrées structurelles pour le module d'attention et l'étape de reconstruction du motif, contribuant ainsi à préserver l'authenticité des motifs générés.

Les motifs culturels ont été divisés en différentes classes pour la segmentation sémantique en fonction de leurs caractéristiques visuelles et culturelles. La taxonomie de segmentation comprenait des motifs animaux (par exemple, papillons, poissons, oiseaux et autres faunes symboliques), des motifs végétaux (par exemple, fleurs, feuilles, vignes et motifs botaniques), des motifs géométriques (par exemple, formes répétées, bordures et structures géométriques abstraites), ainsi que des régions d'arrière-plan représentant les zones sans motif. Des masques de segmentation au niveau des pixels ont été utilisés pour attribuer chaque pixel à l'une des classes prédéfinies. Les étiquettes entières ont été codées comme suit : Étiquette 0 = arrière-plan, Étiquette 1 = motifs animaux, Étiquette 2 = motifs végétaux, et Étiquette 3 = motifs géométriques. Les annotations de segmentation et les étiquettes de motifs ont été obtenues directement à partir de la source du jeu de données original Miao Batik. Aucune annotation manuelle supplémentaire, aucun reclassement, aucune vérification des limites ni aucune procédure de confirmation par un expert n'ont été effectués dans cette étude. Les annotations existantes fournies par les créateurs du jeu de données ont été utilisées sans modification pour l'entraînement et l'évaluation.

Le modèle SegFormer pour la segmentation de motifs culturels traite les images prétraitées des ensembles de données Miao Batik et WikiArt à l'aide d'un mécanisme basé sur les transformeurs afin de détecter précisément les régions de motifs culturels, comme illustré dans la Figure 4. Tout d'abord, l'image d'entrée contenant des motifs culturels traditionnels est fournie au modèle SegFormer. L'encodeur de transformeur extrait à la fois des informations contextuelles globales et des caractéristiques structurelles locales à partir de fragments d'image. Les caractéristiques multi-échelles résultantes sont transmises au décodeur de segmentation, qui utilise un réseau d'alimentation mixte (Mix Feed-Forward Network) pour affiner les représentations des caractéristiques et améliorer la détection des motifs. La sortie du modèle SegFormer est une carte de segmentation qui met en évidence les pixels correspondant aux motifs culturels tout en supprimant les informations de fond non pertinentes. Les motifs culturels isolés servent ensuite de guide structurel pour les étapes suivantes du cadre SegCycle-SPADE.

figure-protocol-12
Figure 4. Segmentation sémantique basée sur SegFormer-B2 de motifs culturels. Architecture du module de segmentation sémantique SegFormer-B2 utilisé pour l'extraction de motifs culturels et entraîné exclusivement sur le jeu de données Miao Batik. Le cadre comprend un encodeur basé sur un transformeur pour l'extraction de caractéristiques multi-échelles et un décodeur de segmentation léger permettant de générer des masques de motifs. Le modèle prédit quatre classes sémantiques — animal, végétal, géométrique et fond — où les masques de segmentation obtenus identifient des régions de motifs significatives sur le plan culturel tout en supprimant les informations de fond non pertinentes. Ces sorties de segmentation fournissent une orientation structurelle pour les étapes ultérieures de fusion de caractéristiques, de reconstruction et de synthèse artistique du cadre proposé SegCycle-SPADE. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Il n'est pas nécessaire de créer de nouvelles annotations de segmentation dans le cadre proposé. Le jeu de données Miao Batik a été obtenu à partir d'une source publique déjà existante, et le modèle a été entraîné à l'aide des informations sur les motifs associés fournies par les créateurs du jeu de données. Au cours du processus d'apprentissage, le modèle SegFormer a produit des cartes de segmentation sémantique. Par conséquent, la présente étude n'a pas nécessité de logiciel d'annotation manuelle supplémentaire, ni de directives d'annotation, ni de procédures de contrôle qualité des annotations.

CAFFM
Afin d'améliorer l'interaction entre les caractéristiques de la segmentation sémantique et les représentations de la reconstruction générative, l'étude a également proposé un module CAFFM. L'encodeur SegFormer-B2 fournit des cartes de caractéristiques sémantiques au module CAFFM, tandis que l'étape de reconstruction CycleGAN fournit des cartes de caractéristiques génératives. Tout d'abord, des couches de projection linéaire sont utilisées pour projeter les deux flux de caractéristiques dans un espace d'incorporation commun. Pour le calcul de l'attention croisée, des représentations de requête (Q), de clé (K) et de valeur (V) sont créées à partir des tenseurs de caractéristiques générés. Les relations entre les informations des motifs structurels et les éléments de style artistique sont ensuite modélisées à l'aide d'une attention croisée multi-têtes. Une normalisation de couche, des connexions résiduelles et des couches entièrement connectées avec une activation GELU sont ensuite appliquées aux représentations de caractéristiques fusionnées. L'étape de synthèse basée sur SPADE reçoit la sortie du module CAFFM, permettant ainsi de préserver des thèmes culturellement significatifs sans nuire à la cohérence artistique.

Pour garantir la compatibilité des caractéristiques, les caractéristiques d'entrée sont d'abord projetées à l'aide de couches de projection linéaire vers un espace d'incorporation partagé dont la dimension est de 256. Les interconnexions entre les informations structurelles sémantiques et les représentations stylistiques génératives sont ensuite modélisées à l'aide d'un mécanisme de MultiHead Cross-Attention comportant huit têtes d'attention. Le calcul de l'attention croisée utilise les vecteurs Requête (Q), Clé (K) et Valeur (V), qui sont produits par des couches spécifiques de transformation linéaire. Afin d'améliorer la stabilité de l'apprentissage et de préserver l'intégrité des caractéristiques, des connexions résiduelles et une normalisation par couche (Layer Normalization) sont utilisées pour renforcer davantage les représentations de caractéristiques fusionnées. L'apprentissage non linéaire des caractéristiques est ensuite amélioré par l'application d'un réseau feed-forward utilisant la fonction d'activation Gaussian Error Linear Unit (GELU). Une représentation de caractéristique de sortie de dimension 256 est générée par le module et transmise à d'autres étapes pour la synthèse créative. Le CAFFM combine avec succès les données de style artistique et les structures de motifs culturels grâce à une technique de fusion basée sur l'attention croisée, ce qui améliore la préservation des motifs et la cohérence visuelle dans les motifs patrimoniaux reconstruits.

Dans le système proposé, les caractéristiques structurelles sont extraites du jeu de données Miao Batik, tandis que les caractéristiques stylistiques sont apprises à partir du jeu de données WikiArt. Soit Fs la carte de caractéristiques obtenue à partir du réseau de segmentation SegFormer en utilisant des images du jeu de données Miao Batik, et Fa la carte de caractéristiques issue de la branche d'extraction des caractéristiques stylistiques utilisant des images WikiArt. Le CAFFM proposé combine les deux domaines de caractéristiques à l'aide d'un mécanisme d'attention croisée afin d'apprendre les dépendances structurelles et stylistiques des motifs culturels. Tableau 3 présente toutes les caractéristiques architecturales, notamment les dimensions des plongements, les couches de normalisation, les fonctions d'activation et la configuration des têtes d'attention. Pour une taille d'image d'entrée de 256 × 256 pixels, l'encodeur SegFormer-B2 a produit des cartes de caractéristiques sémantiques de taille 64 × 64 × 128, tandis que la branche d'extraction des caractéristiques stylistiques a produit des cartes de caractéristiques de taille 64 × 64 × 128. Les deux cartes de caractéristiques ont été projetées, via des couches linéaires apprenables, dans un espace de plongement commun de dimension 256 avant la fusion par attention croisée.

ParamètreConfiguration
Cadre proposéSegCycle-SPADE
Modèle de segmentation sémantiqueSegFormer-B2
Étapes de l'encodeur SegFormer4
Initialisation des poidsSegFormer-B2 pré-entraîné sur ImageNet-1K (architecture MIT-B2)
Source du point de contrôleDépôt officiel NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); point de contrôle : segformer.b2.512x512.ade.160k
Stratégie de réglage finRéglage fin de bout en bout sur le jeu de données Miao Batik
Taille de l'incrustation de la parcelle7 × 7
Pas de décalage de la parcelle4
Dimensions d'incrustation64, 128, 320 et 512
Profondeurs de l'encodeur3, 4, 6 et 3
Nombre de têtes d'attention1, 2, 5 et 8
Type de décodeurDécodeur entièrement basé sur des perceptrons multicouches (MLP)
Fonction d'activationGELU
Taux de dropout0,1
Module d'amélioration des caractéristiquesModule de fusion de caractéristiques culturelles par attention croisée (CAFFM)
Dimension d'incrustation du CAFFM256
Nombre de têtes d'attention du CAFFM8
Échelles de fusion du CAFFM4
Modèle de reconstructionCycleGAN
Modèle de génération de styleSPADE
Jeu de données culturelJeu de données Miao Batik
Jeu de données de styleJeu de données WikiArt
Images Miao Batik15 148
Images WikiArtEnviron 80 000
Résolution d'image d'entrée256 × 256 pixels
Format de couleurRVB
Méthode d'interpolationInterpolation bilinéaire
Méthode de débruitageFiltrage gaussien
Taille du noyau gaussien5 × 5
Écart-type gaussien (σ)1
Plage de normalisation[0, 1]
Taille du lot16
Nombre d'époques100
OptimiseurAdam
Taux d'apprentissage0,0002
Paramètres d'Adamβ₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, décroissance du poids = 0
Fonctions de pertePerte de segmentation, perte antagoniste, perte de cohérence cyclique, perte de reconstruction, perte de préservation des motifs et perte de cohérence de style
Stratégie de division du jeu de donnéesEntraînement / Validation / Test
Jeu d'entraînement70 %
Jeu de validation15 %
Jeu de test15 %
Graine aléatoire42
Métriques d'évaluationPrécision de segmentation, IoU, coefficient de Dice, SSIM, PSNR et FID
Langage de programmationPython 3.8.10
Framework d'apprentissage profondPyTorch 1.10.0
Plateforme matérielleGPU NVIDIA RTX 3090 (24 Go de mémoire vidéo), processeur Intel Core i7 (11e génération), 32 Go de RAM
Environnement opérationnelUbuntu 20.04 LTS

Tableau 3 : Dispositif expérimental et configuration du modèle. Résumé des composants architecturaux, de la configuration d'apprentissage, des paramètres de prétraitement, des ensembles de données, des paramètres d'optimisation, des métriques d'évaluation et de l'environnement informatique utilisés pour la mise en œuvre et l'évaluation du cadre SegCycle-SPADE proposé.

Le module d'attention mappe d'abord la carte de caractéristiques en représentations de requête, de clé et de valeur à l'aide de l'équation 10 :

figure-protocol-13

Ici, Wq, Wk, et Wv sont des matrices de poids apprenables. Les poids d'attention sont calculés en fonction de la similarité entre le vecteur requête et le vecteur clé en utilisant Équation 1117

figure-protocol-14

Ici, dk est la dimension du vecteur de clé. La représentation améliorée des caractéristiques est calculée en multipliant les poids d'attention par la matrice des valeurs à l'aide de l'équation 12 :

figure-protocol-15

Ici, Fa est la représentation améliorée de la carte de caractéristiques. La représentation améliorée de caractéristiques est calculée en combinant les caractéristiques de segmentation d'origine avec les caractéristiques améliorées obtenues à l'aide du mécanisme d'attention en utilisant l'équation 13 :

figure-protocol-16                                

Ici, Fe est la carte de caractéristiques améliorée utilisée pour la reconstruction du motif. Le CAFFM est étendu par un mécanisme d'attention croisée multi-échelle afin d'extraire des caractéristiques pour les motifs culturels à différentes échelles. Soit Fsi désignant les caractéristiques de segmentation à l'échelle i, tandis que Faj désigne les caractéristiques de style artistique à la même échelle. La représentation finale des caractéristiques est définie à l'aide de l'équation 14 :

  figure-protocol-17

Ici, Qi, Ki et Vi représentent respectivement les matrices de requête, de clé et de valeur à l'échelle i, et N désigne le nombre d'échelles de caractéristiques. Dans cette étude, N = 4, ce qui correspond aux cartes de caractéristiques extraites à des résolutions spatiales de 1/4, 1/8, 1/16 et 1/32 de la taille de l'image d'entrée. Ces représentations de caractéristiques multiscales ont été fusionnées à l'aide de poids d'attention apprenables avant la reconstruction et la synthèse artistique. Cette extension permet à la méthode d'extraire des motifs culturels globaux et des textures afin de reconstruire des motifs culturels. CAFFM est placé entre l'étape de segmentation basée sur SegFormer et l'étape de synthèse créative basée sur SPADE dans le système SegCycle-SPADE proposé. Premièrement, tandis que CycleGAN crée simultanément des caractéristiques de reconstruction contenant des informations stylistiques et liées aux motifs, SegFormer-B2 récupère des cartes de caractéristiques sémantiques décrivant les propriétés structurelles des motifs culturels. Le module CAFFM reçoit ces deux flux de caractéristiques et utilise une fusion basée sur l'attention croisée pour identifier les relations entre les représentations structurelles et artistiques. Afin de créer des motifs culturellement authentiques tout en préservant la cohérence sémantique et les caractéristiques structurelles, les cartes de caractéristiques fusionnées résultantes sont ensuite transmises au module SPADE pour une synthèse créative guidée par la segmentation.

Reconstruction de motifs à l'aide de CycleGAN
Une fois l'étape d'amélioration des caractéristiques basée sur l'attention terminée, les cartes de caractéristiques contiendront les structures de motifs culturels améliorées. Toutefois, ces cartes peuvent encore présenter des régions de motifs incomplets ou endommagés. Ainsi, afin de résoudre le problème de la reconstruction des motifs, le cadre proposé utilisera le modèle CycleGAN. Dans ce cadre, les deux domaines seront les motifs culturels d'origine et les motifs culturels reconstruits. À partir des caractéristiques améliorées obtenues aux étapes précédentes, le modèle CycleGAN reconstruira les motifs culturels tout en préservant la cohérence structurelle. Ceci garantira que les motifs culturels, tels que les motifs géométriques, floraux et symboliques, conservent leur disposition spatiale. Les images originales de batik Miao ont subi des opérations aléatoires de masquage et d'occultation partielle afin de générer des motifs culturels incomplets ou endommagés. Ces procédés de dégradation simulent des régions de motifs manquantes et des dommages structurels fréquemment observés sur les artefacts du patrimoine culturel dégradés. Les images dégradées ont été utilisées comme entrées du module de reconstruction, tandis que les images originales correspondantes ont servi d'images de référence pour l'évaluation des performances et l'analyse de la qualité de reconstruction. Cette stratégie a permis au modèle d'apprendre à restaurer les structures de motifs manquants tout en préservant la cohérence sémantique et les caractéristiques culturelles.

Soit X le domaine des motifs culturels incomplets et Y le domaine des motifs culturels reconstruits. Les deux générateurs apprennent à effectuer une correspondance bidirectionnelle à l'aide de l'équation 15 :

 figure-protocol-18

Ici, GE est utilisé pour reconstruire les structures de motifs et FM sert à replacer les motifs dans le domaine d'origine. La perte antagoniste est utilisée afin de garantir que les motifs reconstruits soient réalistes (Équation 16)30

figure-protocol-19

Ici, DY est le discriminateur utilisé pour distinguer les motifs réels des motifs reconstruits, et GE(x) désigne le motif reconstruit généré. CycleGAN impose également une cohérence cyclique afin de préserver la disposition structurelle des motifs culturels (Équation 17)30.

figure-protocol-20

La fonction de perte finale est définie à l'aide de l'équation 1830 :

figure-protocol-21

Ici, λi désigne le coefficient de pondération pour la perte de cohérence cyclique et a été fixé à 10 pendant l'apprentissage, conformément à la formulation initiale de CycleGAN. Cette valeur a été choisie afin d'équilibrer l'apprentissage antagoniste et la cohérence de reconstruction entre les domaines source et cible.

Le module de reconstruction CycleGAN comprend deux générateurs et deux discriminateurs pour la traduction bidirectionnelle d'images. Chaque générateur suit une architecture de réseau résiduel composée d'une couche de convolution initiale 7 × 7, suivie de deux couches de convolution de sous-échantillonnage, de neuf blocs résiduels et de deux couches de sur-échantillonnage. Toutes les opérations de convolution utilisent une taille de noyau de 3 × 3, à l'exception de la couche d'entrée, qui utilise un noyau 7 × 7 pour une extraction améliorée des caractéristiques. Une normalisation d'instance est appliquée après chaque couche de convolution afin d'améliorer la stabilité de l'apprentissage, tandis qu'une activation ReLU est utilisée dans tout le réseau du générateur. La couche de sortie utilise une fonction d'activation Tanh pour produire des sorties d'images normalisées. Le discriminateur suit une architecture PatchGAN 70 × 70 composée d'une série de couches convolutives avec des tailles de noyau de 4 × 4 et des canaux de caractéristiques croissants progressivement. La normalisation d'instance et l'activation LeakyReLU (pente négative = 0,2) sont utilisées dans le discriminateur afin d'améliorer la discrimination des caractéristiques et l'apprentissage antagoniste. Le module CycleGAN reçoit en entrée des images de motifs culturels prétraitées et génère des représentations de motifs reconstruits, qui sont ensuite transmises au CAFFM pour intégration avec les caractéristiques de segmentation. L'entraînement du CycleGAN a été effectué à l'aide de l'optimiseur Adam (β₁ = 0,5, β₂ = 0,999) avec un taux d'apprentissage initial de 0,0002. Le taux d'apprentissage a été maintenu constant pendant les 100 premières époques, puis décroît linéairement jusqu'à zéro au cours de la période restante de l'entraînement. Un tampon de relecture contenant 50 images précédemment générées a été utilisé pour stabiliser l'entraînement du discriminateur. Les générateurs et les discriminateurs ont été mis à jour selon un rapport de 1:1, une mise à jour du générateur étant suivie d'une mise à jour du discriminateur à chaque itération d'entraînement.

Le processus de reconstruction du CycleGAN repose sur les cartes de caractéristiques améliorées obtenues à l'aide du mécanisme CAFFM illustré dans la Figure 5. Les cartes de caractéristiques contiennent des motifs culturels renforcés issus des étapes précédentes de segmentation et de CAFFM. Ces cartes sont utilisées comme entrée pour le premier générateur GE. Le premier générateur GE apprend l'application nécessaire pour reconstruire les motifs culturels. Les sorties sont ensuite transmises au discriminateur DY afin de distinguer les motifs culturels réels des motifs reconstruits. Le discriminateur DY aide le générateur GE à produire des sorties réalistes. Afin de garantir que les motifs culturels ne soient pas déformés durant la reconstruction, le second générateur FM effectue une application de cycle-consistance. Le second générateur FM remappe les sorties vers le domaine d'origine. Les sorties sont ensuite évaluées par le discriminateur pour assurer leur réalisme. Les sorties finales sont ensuite transmises au module SPADE pour la génération de style artistique dans l'étape suivante du cadre SegCycle-SPADE proposé.

figure-protocol-22
Figure 5. Workflow de reconstruction de motifs basé sur CycleGAN. Workflow du module de reconstruction CycleGAN. Des représentations de caractéristiques améliorées par l'attention sont fournies en entrée du réseau générateur afin de reconstruire des motifs culturels incomplets. Le discriminateur évalue les sorties reconstruites par rapport à des motifs de référence, tandis que la correspondance de cohérence cyclique préserve l'intégrité structurelle lors de la traduction bidirectionnelle d'images. Les motifs reconstruits sont ensuite transmis au module SPADE pour la synthèse de style artistique. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Génération de style artistique à l'aide de SPADE
Par la suite, les motifs culturels reconstruits sont soumis au module SPADE pour la génération de style artistique. L'objectif principal du module SPADE est d'ajouter des textures visuellement riches de style artistique aux motifs culturels reconstruits sans compromettre la disposition structurelle des motifs. Le module SPADE est une technique de génération d'images conditionnelle qui utilise le concept de segmentation d'image pour la création d'images. Des cartes sémantiques multicanal correspondant aux classes de motifs prédéfinies ont été encodées à partir des masques de segmentation sémantique produits par SegFormer-B2. Le générateur SPADE a reçu ces cartes encodées comme entrées de conditionnement. Les paramètres d'échelle spatialement adaptative (γ) et de biais (β) ont été générés en traitant les cartes sémantiques à travers des couches de convolution dans chaque couche SPADE. Le générateur a ainsi pu préserver les limites des motifs, les structures spatiales et les informations sémantiques durant la synthèse artistique en appliquant ces paramètres aux activations normalisées des caractéristiques. Le guidage sémantique a pu influencer à la fois la reconstruction structurelle de haut niveau et la synthèse de textures de bas niveau, puisque le processus de conditionnement a été effectué à plusieurs couches du générateur SPADE. En conséquence, les motifs artistiques créés intègrent des traits stylistiques issus du jeu de données WikiArt tout en conservant les structures des motifs culturels identifiées lors de l'étape de segmentation.

L'ensemble de données WikiArt, qui comprend des œuvres provenant de 27 catégories artistiques différentes — telles que la Renaissance, l'impressionnisme, le cubisme, l'expressionnisme, le surréalisme, le réalisme et l'art abstrait — a été utilisé comme ressource principale pour comprendre les styles artistiques. Afin d'exposer le modèle à une variété de traits créatifs et d'améliorer la généralisation du style, des images de style ont été sélectionnées aléatoirement parmi les différentes catégories durant l'entraînement. L'ensemble de données a été divisé en sous-ensembles d'entraînement, de validation et de test, avec une représentation équilibrée des catégories artistiques afin de réduire les biais de style. Pour garantir une représentation équilibrée des 27 catégories artistiques, un échantillonnage stratifié a été utilisé. Les échantillons de chaque catégorie ont été répartis proportionnellement entre les sous-ensembles d'entraînement, de validation et de test, tout en préservant la distribution initiale des classes. Le module CAFFM a été utilisé pour fusionner les aspects de style extraits des images WikiArt avec les caractéristiques de reconstruction produites par CycleGAN. Afin de permettre au réseau de synthèse de transférer les qualités artistiques tout en conservant la structure sémantique et les limites des motifs culturels dérivées des cartes de segmentation, les représentations fusionnées résultantes ont été fournies comme information de conditionnement au générateur SPADE. Grâce à cette technique de conditionnement par le style, le cadre proposé a permis de produire des motifs artistiques culturellement authentiques, avec des représentations structurelles et stylistiques cohérentes.

SPADE introduit également des paramètres spatialement adaptatifs qui dépendent de la carte de segmentation. Les paramètres peuvent être définis comme indiqué dans l'équation 191 :

figure-protocol-23

Ici, γ(S) est le paramètre d'échelle variant spatialement et β(S) est le paramètre de biais variant spatialement. Ces paramètres peuvent aider le générateur à créer différentes textures et styles en fonction de la région sémantique dans les images. L'œuvre d'art culturelle finale peut être définie comme indiqué dans l'équation 20 :

 figure-protocol-24

Ici, GE est le générateur SPADE, XrP est le motif reconstruit, et SM est la carte de segmentation. L'œuvre finale préserve l'intégrité structurelle des motifs culturels tout en améliorant l'apparence artistique. Une fonction de perte composite, équilibrant la précision de la segmentation sémantique, la préservation des motifs culturels, la qualité de reconstruction des motifs et la cohérence du style artistique, a été utilisée pour optimiser l'architecture SegCycle-SPADE proposée. Un mélange pondéré des pertes de segmentation (Lseg), de perte antagoniste (Ladv), de perte de cohérence cyclique (Lcycle), de perte de reconstruction (Lrecon), de perte de préservation des motifs (Lmotif) et de perte de cohérence stylistique (Lstyle) a été utilisé pour définir l'objectif global d'apprentissage. La fonction de perte totale est définie dans l'équation 21 :

figure-protocol-25  (21)

Afin de garantir une cohérence structurelle entre les motifs culturels d'entrée et reconstruits, le coefficient de perte de cycle de cohérence a été fixé à 10. Pour préserver les caractéristiques fines des motifs et améliorer la précision visuelle, le coefficient de perte de reconstruction a été fixé à 5. Afin de mettre en évidence la préservation des structures de motifs structurellement essentielles durant la synthèse artistique, un coefficient de 2 a été utilisé pour la perte de préservation des motifs. Pour favoriser le transfert de style artistique sans déformer excessivement les structures sémantiques des motifs, le coefficient de perte de cohérence de style a été ajusté à 1. Afin de maintenir une contribution équilibrée entre la production d'images réalistes et la segmentation précise des motifs, des poids égaux ont été attribués aux pertes de segmentation et adversariale. Les représentations de style basées sur les caractéristiques du jeu de données WikiArt ont été utilisées pour calculer la perte de cohérence de style. En particulier, les traits de style artistique ont été capturés à l’aide de corrélations de matrices de Gram extraites de cartes de caractéristiques profondes. La différence de norme de Frobenius entre les matrices de Gram de l’image cible de style et de l’image générée a été utilisée pour calculer la perte de style, comme indiqué dans l’équation 22 :

figure-protocol-26

Ici, Gl est la matrice de Gram calculée à partir de la lème couche de caractéristiques, Igen désigne l'image artistique générée, Istyle désigne l'image de style cible issue du jeu de données WikiArt, et F désigne la norme de Frobenius. Cette formulation permet au cadre proposé de préserver les caractéristiques artistiques tout en maintenant l'intégrité structurelle et sémantique des motifs culturels.

Les représentations de caractéristiques fusionnées produites par le module CAFFM sont utilisées comme entrées de conditionnement pour le module SPADE, qui constitue le composant de synthèse artistique du cadre proposé. Le générateur SPADE comprend sept blocs résiduels SPADE avec une dimension de caractéristique latente de 256 canaux et génère des images de sortie avec une résolution de 256 × 256 pixels. Les cartes de segmentation sémantique obtenues à partir du module SegFormer–CAFFM sont utilisées comme entrées de conditionnement tout au long des couches résiduelles SPADE. Les couches SPADE sont appliquées avant les fonctions d'activation dans chaque bloc résiduel, permettant un conditionnement sémantique guidé par la segmentation. Grâce à des opérations successives de sur-échantillonnage et de convolution, la représentation latente des caractéristiques est progressivement affinée pour générer des motifs artistiques haute résolution tout en préservant la cohérence sémantique et la structure des motifs. Des fonctions d'activation LeakyReLU sont utilisées dans tout le générateur, et une fonction d'activation Tanh est appliquée à la couche de sortie pour produire des images normalisées.

Algorithme et flux de travail
Le cadre SegCycle-SPADE intègre la segmentation sémantique, la fusion de caractéristiques, la reconstruction de motifs et la synthèse de style artistique au sein d’un pipeline d’apprentissage unifié. Le flux de travail commence par l’acquisition et le prétraitement du jeu de données, incluant le redimensionnement des images, la normalisation, la suppression du bruit et la préparation des masques de segmentation. Les images prétraitées sont ensuite traitées à l’aide du réseau de segmentation SegFormer-B2 afin d’extraire des représentations sémantiques des motifs. Les caractéristiques de segmentation obtenues sont fusionnées avec les caractéristiques de reconstruction via le module CAFFM, permettant une interaction entre les informations structurelles des motifs et les représentations des caractéristiques artistiques. Les cartes de caractéristiques fusionnées sont ensuite transmises au module de reconstruction CycleGAN, qui restaure les structures de motifs culturels incomplètes tout en préservant la cohérence sémantique. Les motifs reconstruits sont ensuite fournis au générateur SPADE pour une synthèse artistique guidée par segmentation, permettant un enrichissement stylistique tout en conservant les limites des motifs et leur authenticité structurelle. Pendant l’apprentissage, les paramètres du modèle sont optimisés à l’aide de la fonction de perte composite décrite dans les équations 21 et 22, qui équilibre la précision de la segmentation, la préservation des motifs, la qualité de la reconstruction et la cohérence du style artistique. Un flux de mise en œuvre détaillé étape par étape, incluant le chargement du jeu de données, le prétraitement, l’initialisation du modèle, les itérations d’apprentissage, les procédures de validation, la sélection des points de contrôle et l’évaluation finale, est fourni dans le fichier supplémentaire 1 (algorithme 1). L’ensemble du flux de travail algorithmique a été implémenté avec une taille de lot de 16, un taux d’apprentissage de 0,0002 et 100 époques d’entraînement. Une graine aléatoire fixe de 42 a été utilisée pour la partition du jeu de données, l’initialisation du modèle et toutes les expériences d’apprentissage. Cette graine a été appliquée de manière cohérente aux générateurs de nombres aléatoires de Python, NumPy et PyTorch afin d’assurer la reproductibilité. L’optimiseur Adam a été configuré avec β₁ = 0,5, β₂ = 0,999, et sans décroissance du poids (weight decay = 0). Les points de contrôle du modèle ont été sélectionnés en fonction du score d’IoU de validation le plus élevé obtenu sur le jeu de données de validation.

Optimisation de la fonction de perte
Afin de préserver les structures des motifs culturels durant la reconstruction et la synthèse artistique, le cadre proposé utilise un objectif d'optimisation composite qui combine les pertes de segmentation, adversariale, de cohérence cyclique, de reconstruction, de préservation des motifs et de cohérence de style. La formulation mathématique complète, les coefficients de pondération et la définition de la perte de style sont fournies dans les équations 21 et 22 dans la sous-section Artistic Style Generation using SPADE. Le composant de préservation des motifs pénalise les écarts structurels entre les régions de motifs prédites et les masques de segmentation de référence correspondants, favorisant ainsi le maintien des structures de motifs culturellement significatives tout au long du processus de reconstruction.

Résultats

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Le cadre proposé SegCycle-SPADE a été évalué à l'aide de deux ensembles de données : l'ensemble de motifs culturels du batik Miao et l'ensemble de données WikiArt. L'ensemble de données du batik Miao contient des images du patrimoine culturel traditionnel et a été principalement utilisé pour des tâches de segmentation sémantique et de reconstruction structurelle, tandis que l'ensemble de données WikiArt contient des styles artistiques variés et a été utilisé pour l'apprentissage et la génération de styles artistiques. Les images provenant des deux ensembles de données ont été traitées selon le pipeline complet SegCycle-SPADE, incluant la segmentation sémantique, le CAFFM, la reconstruction de motifs et la génération de style artistique basée sur SPADE. L'intégration des informations sur les motifs culturels et des représentations de styles artistiques a permis au cadre de produire des sorties à la fois culturellement significatives et visuellement cohérentes.

Toutes les expériences ont été réalisées sur une station de travail dotée d'un GPU, équipée d'un processeur Intel Core i7 et d'un GPU NVIDIA. Plus précisément, les expériences ont été menées sur une station de travail munie d'un processeur Intel Core i7 (11e génération), d'un GPU NVIDIA RTX 3090 avec 24 Go de mémoire vidéo (VRAM) et de 32 Go de mémoire système. Les modèles ont été implémentés à l'aide de Python 3.8 et de PyTorch 1.10 avec accélération CUDA. L'entraînement a été effectué en configuration mono-GPU, sans entraînement distribué. Une précision standard en FP32 a été utilisée pour toutes les expériences, et l'entraînement en précision mixte n'a pas été employé. L'optimiseur Adam a été utilisé avec une taille de lot de 16 sur 100 époques d'entraînement. Tableau 3 résume les paramètres d'implémentation et l'environnement informatique utilisés dans cette étude.

L'architecture proposée comprend quatre composants principaux : SegFormer-B2 pour la segmentation sémantique, CAFFM pour la fusion de caractéristiques, CycleGAN pour la reconstruction des motifs et SPADE pour la synthèse de style artistique. Les images des deux jeux de données ont été redimensionnées à 256 × 256 pixels avant l'entraînement. Cette résolution normalisée a assuré une efficacité computationnelle tout en préservant les détails importants des motifs et a contribué à un entraînement antagoniste stable des modules CycleGAN et SPADE.

Les performances du cadre proposé ont été évaluées à l'aide de métriques d'évaluation de la segmentation et de la qualité d'image, notamment la précision de la segmentation, l'indice d'intersection sur union (IoU), le coefficient de similarité de Dice (Dice), le SSIM, le PSNR et le FID. L'authenticité visuelle a été évaluée de manière qualitative par inspection visuelle des motifs culturels générés. L'évaluation qualitative s'est concentrée sur la préservation des motifs, la cohérence sémantique, les caractéristiques culturelles et l'apparence artistique par rapport aux motifs culturels de référence. L'authenticité visuelle n'a pas été utilisée comme métrique d'évaluation quantitative indépendante.

Une évaluation quantitative du cadre proposé a été réalisée à l'aide des métriques suivantes.

La précision de la segmentation a été calculée à l'aide de l'équation 23 :

figure-results-1

Ici, TP, TN, FP et FN désignent respectivement les vrais positifs, les vrais négatifs, les faux positifs et les faux négatifs.

L'indice de recouvrement (IoU) a été calculé à l'aide de l'équation 24 :

 figure-results-2

Le coefficient de similarité de Dice (Dice) a été calculé à l'aide de l'équation 25 :

figure-results-3

L'indice SSIM a été utilisé pour évaluer la similarité perceptive des images et est défini à l'aide de l'équation 2633 :

figure-results-4  (26)

Ici, μ désigne l'intensité moyenne, σ désigne la variance, σxy désigne la covariance entre les images, et C1 et C2 sont des constantes de stabilisation.

Le PSNR est une métrique couramment utilisée pour évaluer la qualité des images générées et est définie dans l'équation 2733 :

figure-results-5

Ici, MaxI désigne la valeur maximale possible d'un pixel de l'image et MSE est l'erreur quadratique moyenne entre l'image d'origine et l'image reconstruite.

Le FID peut être calculé à l'aide des moyennes et des matrices de covariance comme indiqué dans l'équation 2833 :

figure-results-6   (28)

Ici, μr est la valeur moyenne de l'image réelle, μg est la valeur moyenne de l'image générée, et Σr et Σg sont respectivement la matrice de covariance des images réelles et générées.

Pour la comparaison des performances, le cadre proposé a été évalué par rapport à des méthodes représentatives couramment utilisées pour la segmentation sémantique, la reconstruction d'images et la génération d'images artistiques. U-Net et DeepLabV3+ ont été inclus comme références pour la segmentation, tandis que Pix2Pix et CycleGAN ont été inclus comme références pour la reconstruction. StyleGAN et AttentionGAN ont été utilisés comme méthodes représentatives de génération d'images artistiques. Ces comparaisons ont été menées afin d'évaluer l'efficacité de SegCycle-SPADE à préserver les informations des motifs structurels tout en améliorant simultanément la qualité artistique.

Chaque expérience a été répétée cinq fois afin d'évaluer la stabilité et la reproductibilité des performances. Une graine aléatoire fixe de 42 a été utilisée pour la partition du jeu de données afin d'assurer des sous-ensembles d'apprentissage, de validation et de test cohérents dans toutes les expériences. Les résultats sont exprimés sous la forme moyenne ± écart type. Les faibles valeurs d'écart type observées pour l'exactitude (Accuracy), l'indice de Jaccard (IoU), le coefficient de Dice, l'indice de similarité structurelle (SSIM), le rapport signal-sur-bruit de crête (PSNR) et la distance FID indiquent que le cadre proposé a atteint des performances stables au cours des répétitions expérimentales. La significativité statistique a été évaluée à l'aide de tests t appariés, et les différences ont été considérées statistiquement significatives lorsque p < 0,05. Étant donné que tous les modèles ont été évalués sur les mêmes partitions de jeu de données, des mesures appariées des performances ont été obtenues au cours des répétitions, ce qui justifie l'utilisation de tests t appariés. Afin de contrôler le taux d'erreur global associé aux multiples comparaisons par paires, une correction de Bonferroni a été appliquée, et la significativité statistique a été déterminée à l'aide d'un seuil ajusté de α/n, où n désigne le nombre de comparaisons par paires.

Les résultats expérimentaux soutiennent fortement l'efficacité du cadre proposé SegCycle-SPADE. Les performances supérieures de segmentation obtenues par SegFormer-B2 démontrent sa capacité à identifier et préserver avec précision les limites des motifs culturellement significatifs. Les améliorations des scores IoU et Dice indiquent davantage une préservation efficace des structures sémantiques des motifs tout au long du pipeline de traitement. L'intégration de CycleGAN et SPADE a permis de reconstruire avec succès les structures de motifs incomplètes tout en conservant les détails visuels fins, comme en témoignent les valeurs améliorées de SSIM et PSNR. De plus, les scores FID plus faibles indiquent que les motifs artistiques générés présentent une plus grande similarité avec des images culturelles et artistiques authentiques, suggérant ainsi une cohérence stylistique et un réalisme visuel améliorés.

Le CAFFM a contribué de manière significative à ces améliorations en facilitant une interaction efficace entre les informations structurelles issues de la segmentation et les représentations stylistiques génératives. Grâce à une fusion de caractéristiques basée sur l'attention croisée, le CAFFM a amélioré à la fois la fidélité structurelle et l'authenticité artistique, tout en préservant les relations à longue portée entre les motifs culturels.

Figure 6 présente la comparaison de la précision de segmentation entre le cadre proposé SegCycle-SPADE et les méthodes existantes sur les jeux de données Miao Batik et WikiArt. Les approches traditionnelles de segmentation telles que U-Net et DeepLabV3+ ont obtenu des performances compétitives en raison de leur capacité à apprendre des représentations spatiales. Cependant, Pix2Pix et CycleGAN ont montré une précision de segmentation inférieure, car elles n'ont pas été spécifiquement conçues pour des tâches de segmentation. Le cadre SegCycle-SPADE proposé a atteint la plus haute précision de segmentation sur les deux jeux de données grâce à l'intégration de SegFormer-B2 et du renforcement de caractéristiques basé sur CAFFM.

figure-results-7
Figure 6. Comparaison de la précision de segmentation entre différentes méthodes. Comparaison de la précision de segmentation obtenue à l’aide de U-Net, DeepLabV3+, Pix2Pix, CycleGAN et du cadre proposé SegCycle-SPADE sur les jeux de données Miao Batik et WikiArt. Les résultats sont présentés sous forme de moyenne ± écart-type (SD) à partir de cinq exécutions indépendantes (n = 5). Les barres d’erreur représentent un écart-type. Des valeurs plus élevées indiquent une performance de segmentation améliorée. Le cadre proposé SegCycle-SPADE a obtenu la plus haute précision de segmentation sur les deux jeux de données. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 7 présente la comparaison de l'indice de recouvrement (IoU) entre les méthodes évaluées. U-Net et DeepLabV3+ ont obtenu de bonnes performances en termes de superposition grâce à leurs architectures orientées segmentation. En revanche, Pix2Pix et CycleGAN ont produit des valeurs d'IoU plus faibles, car leur objectif principal est la traduction d'images plutôt que la segmentation sémantique. Le cadre proposé SegCycle-SPADE a atteint les valeurs d'IoU les plus élevées sur les deux jeux de données, indiquant une meilleure localisation et préservation des régions des motifs culturels.

figure-results-8
Figure 7. Comparaison des scores d'intersection sur union (IoU) pour la segmentation de motifs culturels. Comparaison des performances en termes d’IoU entre différentes méthodes de segmentation sur les jeux de données Miao Batik et WikiArt. Les résultats sont présentés sous forme de moyenne ± écart-type (SD) à partir de cinq exécutions indépendantes (n = 5). Les barres d'erreur représentent un écart-type. Des valeurs d’IoU plus élevées indiquent un meilleur recouvrement entre les régions de motifs prédites et de référence, ainsi qu'une préservation plus fidèle des limites des motifs. Le cadre proposé SegCycle-SPADE a obtenu les scores d’IoU les plus élevés sur les deux jeux de données. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

Figure 8 présente la comparaison du coefficient de similarité de Dice. Le score de Dice mesure le recouvrement entre les masques de segmentation prédits et les régions réelles des motifs. Les approches conventionnelles de segmentation ont obtenu des scores de Dice relativement élevés en raison de leur efficacité à apprendre les structures spatiales. Toutefois, le cadre proposé SegCycle-SPADE a obtenu les scores de Dice les plus élevés sur les deux jeux de données, démontrant une meilleure cohérence de segmentation et une préservation améliorée des motifs.

figure-results-9
Figure 8. Comparaison du coefficient de Dice pour la segmentation des motifs culturels. Comparaison des valeurs du coefficient de Dice obtenues à l’aide de différentes approches de segmentation sur les jeux de données Miao Batik et WikiArt. Le coefficient de Dice évalue le recouvrement entre les masques de segmentation prédits et les masques de référence, des valeurs plus élevées indiquant une meilleure performance de segmentation et une identification plus précise des régions de motifs. Le cadre proposé SegCycle-SPADE a obtenu les valeurs les plus élevées du coefficient de Dice sur les deux jeux de données. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Figure 9 présente la comparaison SSIM entre les motifs culturels reconstruits. Les méthodes basées sur les GAN, telles que Pix2Pix, CycleGAN et StyleGAN, ont obtenu des valeurs SSIM plus élevées que les méthodes traditionnelles de segmentation, car elles ont été conçues pour la génération d'images. Néanmoins, le cadre proposé SegCycle-SPADE a atteint les valeurs SSIM les plus élevées sur les deux jeux de données, indiquant une préservation supérieure des détails structurels et de la cohérence artistique.figure-results-10

Figure 9. Comparaison de l'indice de similarité structurelle (SSIM). Comparaison des valeurs de l'indice de similarité structurelle (SSIM) obtenues à l'aide de différentes méthodes de reconstruction sur les jeux de données Miao Batik et WikiArt. Les résultats sont présentés sous forme de moyenne ± écart-type (SD) à partir de cinq exécutions indépendantes (n = 5). Les barres d'erreur indiquent un écart-type. Des valeurs de SSIM plus élevées indiquent une plus grande similarité structurelle entre les motifs reconstruits et les motifs de référence. Le cadre proposé SegCycle-SPADE a obtenu les scores de SSIM les plus élevés sur les deux jeux de données. Veuillez cliquer ici pour visualiser une version agrandie de cette figure.

L'IDF a été utilisée pour évaluer le réalisme et la similarité distributionnelle des motifs artistiques générés. Le calcul de l'IDF a été effectué à l'aide d'un réseau Inception-v3 préentraîné, les vecteurs de caractéristiques étant extraits de la couche pool3, ce qui donne des représentations de caractéristiques de 2048 dimensions. Avant l'extraction des caractéristiques, les images générées et de référence ont été redimensionnées à 299 × 299 pixels à l'aide d'une interpolation bilinéaire et normalisées selon le protocole de prétraitement standard d'Inception-v3. L'IDF a été calculée à partir des distributions de caractéristiques extraites du jeu de données de test indépendant. Les statistiques de moyenne et de covariance ont été estimées à partir des intégrations de caractéristiques et utilisées dans la formulation standard de l'IDF.

Comme indiqué dans le Tableau 4, les approches classiques de génération d'images telles que Pix2Pix et CycleGAN ont produit des scores FID relativement élevés, car elles ne bénéficiaient pas d'un guidage structurel explicite. StyleGAN et AttentionGAN ont obtenu des scores FID plus faibles grâce à des capacités améliorées d'apprentissage des caractéristiques. Toutefois, le cadre proposé SegCycle-SPADE a atteint les scores FID les plus bas sur les deux jeux de données, démontrant une réalisme accru des images, une cohérence stylistique supérieure et une meilleure préservation des motifs culturels.

MéthodeJeu de données Miao Batik (FID)Jeu de données WikiArt (FID)
Pix2Pix48,652,3
CycleGAN42,846,5
StyleGAN39,743,1
AttentionGAN36,940,4
SegCycle-SPADE (proposé)28,531,2

Tableau 4 :  Résultats de la distance Frechet Inception (FID) pour la reconstruction de motifs culturels. Comparaison des scores de distance Frechet Inception (FID) obtenus par le cadre proposé SegCycle-SPADE et par les modèles génératifs de référence sur les jeux de données Miao Batik et WikiArt. Des valeurs de FID plus faibles indiquent une plus grande similarité entre les distributions de caractéristiques des images générées et réelles, reflétant ainsi un réalisme visuel amélioré des motifs culturels reconstruits.

Figure 10 compare la qualité de reconstruction obtenue par différentes méthodes. La qualité de reconstruction (%) a été calculée en convertissant l'indice SSIM entre l'image reconstruite et l'image de référence correspondante en une échelle de pourcentage (SSIM × 100). Des pourcentages plus élevés indiquent une fidélité structurelle et une similarité visuelle plus grandes par rapport au motif culturel d'origine. Les modèles génératifs classiques tels que Pix2Pix et CycleGAN ont obtenu des performances de reconstruction modérées. Des architectures plus avancées, notamment StyleGAN et AttentionGAN, ont permis d'améliorer la qualité de reconstruction grâce à leurs capacités accrues d'apprentissage de caractéristiques. Toutefois, le cadre proposé SegCycle-SPADE a atteint la qualité de reconstruction la plus élevée en raison de son intégration de l'orientation par segmentation sémantique, de la fusion de caractéristiques par attention croisée, de l'apprentissage par reconstruction et de la synthèse artistique.

figure-results-11
Figure 10. Comparaison de la qualité de reconstruction des motifs. Comparaison de la qualité de reconstruction obtenue à l’aide de Pix2Pix, CycleGAN, StyleGAN, AttentionGAN et du cadre proposé SegCycle-SPADE sur les jeux de données Miao Batik et WikiArt. Les résultats sont présentés sous forme de moyenne ± écart type (SD) à partir de cinq exécutions indépendantes (n = 5). Les barres d’erreur indiquent un écart type. Des valeurs plus élevées indiquent une meilleure préservation des détails structurels, de la cohérence sémantique et de la fidélité visuelle. Le cadre proposé SegCycle-SPADE a obtenu les scores de qualité de reconstruction les plus élevés sur les deux jeux de données. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Le PSNR a été utilisé pour évaluer la fidélité de la reconstruction en mesurant la similarité au niveau des pixels entre les images reconstruites et les images de référence correspondantes. Le PSNR a été calculé entre chaque image reconstruite et l'image originale Miao Batik correspondante utilisée comme référence de vérité terrain. Des valeurs plus élevées de PSNR indiquent une erreur de reconstruction plus faible. Comme indiqué dans Tableau 5, Pix2Pix et CycleGAN ont obtenu des valeurs modérées de PSNR car ils ont reconstruit les motifs sans orientation structurelle explicite. StyleGAN et AttentionGAN ont atteint des valeurs de PSNR plus élevées grâce à un apprentissage approfondi des caractéristiques. Le cadre proposé SegCycle-SPADE a obtenu les valeurs de PSNR les plus élevées sur les deux ensembles de données, démontrant une fidélité de reconstruction supérieure et une préservation optimale des structures des motifs culturels.

MéthodeJeu de données Miao Batik
(PSNR, dB)
Jeu de données WikiArt
(PSNR, dB)
Pix2Pix25,824,6
CycleGAN27,326,1
StyleGAN28,727,5
AttentionGAN29,928,6
SegCycle-SPADE (proposé)32,431,2

Tableau 5 :  Résultats du rapport signal-sur-bruit de crête (PSNR) pour la reconstruction de motifs culturels. Comparaison des valeurs de rapport signal-sur-bruit de crête (PSNR) obtenues par le cadre proposé SegCycle-SPADE et par les méthodes de référence sur les jeux de données Miao Batik et WikiArt. Des valeurs de PSNR plus élevées indiquent une fidélité de reconstruction améliorée et une distorsion réduite par rapport aux images de référence correspondantes.

Figure 11 illustre le comportement de convergence du cadre proposé SegCycle-SPADE pendant l'entraînement. Les courbes de perte représentent les pertes moyennes d'entraînement, moyennées sur cinq exécutions d'entraînement indépendantes. Afin de réduire la variabilité stochastique et d'obtenir une représentation plus robuste de la convergence de l'entraînement, les valeurs de perte ont été moyennées à chaque époque sur l'ensemble des exécutions. Pendant les premières époques d'entraînement, les valeurs de perte étaient relativement élevées car le modèle était encore en train d'apprendre les représentations de caractéristiques à partir des données d'entrée. Au fur et à mesure de l'avancement de l'entraînement, toutes les composantes de la perte ont progressivement diminué et se sont stabilisées, indiquant une optimisation réussie des objectifs de segmentation, de reconstruction et de synthèse artistique. Le comportement de convergence observé démontre l'efficacité, la stabilité et la reproductibilité du cadre proposé durant l'entraînement.

figure-results-12
Figure 11. Convergence de l'apprentissage du cadre SegCycle-SPADE proposé. Courbes de perte d'apprentissage du cadre SegCycle-SPADE proposé sur 100 époques d'entraînement, moyennées sur cinq exécutions d'entraînement indépendantes (n = 5). La figure illustre l'évolution de la perte totale (LTotal), de la perte de segmentation (LSeg), de la perte du générateur (LG) et de la perte du discriminateur (LD) au cours de l'apprentissage. La réduction progressive puis la stabilisation de toutes les composantes de la perte indiquent une convergence réussie et une optimisation stable du cadre proposé. Veuillez cliquer ici pour afficher une version agrandie de cette figure.

Étude d'ablation
Afin d'évaluer la contribution de chaque composant du cadre SegCycle-SPADE proposé, une étude d'ablation a été menée en utilisant plusieurs configurations contrôlées du modèle. Les résultats sont résumés dans les tableaux 6 et 7.

Configuration du modèlePrécision de la segmentation (%)IoUSSIM
SegFormer uniquement87,30,760,82
SegFormer + CAFFM89,60,790,86
SegFormer + CAFFM + CycleGAN91,40,820,89
SegFormer + CAFFM + CycleGAN + SPADE (proposé)93,80,860,93

Tableau 6 : Étude d'ablation des composants de SegCycle-SPADE. Comparaison des performances de configurations de modèles progressivement améliorées afin d'évaluer la contribution des différents composants du cadre. Cette étude examine les effets de la segmentation sémantique, du module de fusion de caractéristiques culturelles par attention croisée (CAFFM), de la reconstruction basée sur CycleGAN et de la synthèse artistique basée sur SPADE sur la précision de la segmentation, l'intersection sur l'union (IoU) et l'indice de similarité structurelle (SSIM). Des valeurs plus élevées indiquent une segmentation des motifs, une qualité de reconstruction et une préservation structurelle améliorées.

VariantIoU (%)Dice (%)SSIMPSNR (dB)FID ↓
SegFormer uniquement84,2 ± 0,488,5 ± 0,30,82 ± 0,0124,8 ± 0,231,8 ± 0,6
SegFormer + CycleGAN86,7 ± 0,390,2 ± 0,20,85 ± 0,0126,3 ± 0,227,5 ± 0,5
SegFormer + SPADE87,0 ± 0,390,5 ± 0,20,88 ± 0,0127,8 ± 0,223,4 ± 0,4
SegFormer + CAFFM90,0 ± 0,293,1 ± 0,20,90 ± 0,0129,6 ± 0,120,3 ± 0,3
SegCycle-SPADE (modèle complet)93,0 ± 0,295,4 ± 0,10,92 ± 0,0131,2 ± 0,117,6 ± 0,2

Tableau 7 :  Analyse de la contribution des composants du cadre SegCycle-SPADE proposé. Comparaison des performances des différentes variantes du cadre utilisées pour évaluer la contribution de CAFFM, CycleGAN, SPADE et de l'architecture complète SegCycle-SPADE. Les résultats sont exprimés en indice d'intersection sur union (IoU), coefficient de Dice, indice de similarité structurelle (SSIM), rapport signal sur bruit de crête (PSNR) et distance d'Inception de Fréchet (FID). Des valeurs plus élevées d’IoU, de Dice, de SSIM et de PSNR indiquent une qualité améliorée de la segmentation et de la reconstruction, tandis que des valeurs plus faibles de FID indiquent une réalisme visuel accru des motifs culturels générés.

Tableau 6 évalue la contribution cumulative des principaux composants du cadre à l’aide de quatre configurations : (i) SegFormer uniquement, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN, et (iv) SegFormer + CAFFM + CycleGAN + SPADE (cadre proposé). Le modèle de base SegFormer a atteint une précision de segmentation de 87,3 %, un score IoU de 0,76 et une valeur SSIM de 0,82. L’intégration du module CAFFM a amélioré les performances sur l’ensemble des métriques d’évaluation, portant la précision de segmentation à 89,6 %, l’IoU à 0,79 et le SSIM à 0,86. L’ajout de CycleGAN a encore renforcé la capacité de reconstruction structurelle, conduisant à un IoU de 0,82 et une valeur SSIM de 0,89. Le cadre complet SegCycle-SPADE a obtenu les meilleures performances globales, avec une précision de segmentation de 93,8 %, un IoU de 0,86 et une valeur SSIM de 0,93. Ces résultats montrent que chaque composant contribue de manière progressive à l’amélioration de la précision de segmentation, de la préservation structurelle et de la qualité de reconstruction d’image.

Tableau 7 examine plus en détail la contribution des composants individuels du cadre à l’aide de cinq variantes du modèle : (i) SegFormer uniquement, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM, et (v) le modèle complet intégrant SegFormer, CAFFM, CycleGAN, SPADE et la perte de préservation des motifs. Les performances ont été évaluées à l’aide des métriques IoU, coefficient de Dice, SSIM, PSNR et FID.

La configuration de base uniquement SegFormer a atteint un IoU de 84,2 %, un coefficient de Dice de 88,5 %, une valeur SSIM de 0,82, un PSNR de 24,8 dB et un score FID de 31,8. L'ajout de CycleGAN a amélioré la qualité de reconstruction et réduit le score FID à 27,5, indiquant une réalisme d'image accru. L'intégration de SPADE a davantage amélioré la similarité structurelle et la qualité d'image, conduisant à une valeur SSIM de 0,88 et un score FID de 23,4. L'inclusion du module CAFFM proposé a permis des gains substantiels sur toutes les métriques, augmentant l'IoU à 90,0 %, le coefficient de Dice à 93,1 %, le SSIM à 0,90 et le PSNR à 29,6 dB, tout en réduisant le score FID à 20,3. Le modèle complet, qui intègre en outre la perte de préservation des motifs, a atteint les meilleures performances globales avec un IoU de 93,0 %, un coefficient de Dice de 95,4 %, une valeur SSIM de 0,92, un PSNR de 31,2 dB et un score FID de 17,6.

Tableau 8 présente un aperçu comparatif des approches représentatives d'apprentissage profond utilisées pour la reconstruction et la préservation des motifs du patrimoine culturel. Les méthodes classiques basées sur les CNN offrent un apprentissage efficace des caractéristiques locales et de bonnes performances en segmentation, mais ont souvent du mal à préserver les structures complexes des motifs en raison d'une modélisation limitée des dépendances à longue portée. Les approches fondées sur les GAN améliorent la synthèse d'images et les capacités de transfert de style ; toutefois, elles peuvent souffrir d'incohérences sémantiques et de perte de détails structurels fins. Les méthodes basées sur les Transformers améliorent la compréhension contextuelle globale, mais manquent généralement de capacités de reconstruction générative, tandis que les méthodes basées sur la diffusion offrent un réalisme visuel élevé au prix d'une complexité computationnelle accrue. Les approches hybrides combinant Transformers et GAN atténuent partiellement ces limitations en intégrant des mécanismes d'extraction de caractéristiques et de génération d'images. En revanche, le cadre proposé SegCycle-SPADE intègre, au sein d'une architecture unifiée, la segmentation basée sur les Transformers, la fusion de caractéristiques par attention croisée, la reconstruction générative et une synthèse artistique guidée par la segmentation, améliorant ainsi la fidélité structurelle, la cohérence sémantique et la préservation des motifs culturels. La comparaison est résumée dans le Tableau 8.

ApprocheMéthodologie principaleAtoutsLimitesPertinence pour le patrimoine culturel
Méthodes basées sur les CNN (par exemple, U-Net, DeepLabV3+)Extraction de caractéristiques par convolution et segmentation sémantiqueApprentissage efficace des caractéristiques locales et segmentation préciseModélisation limitée des dépendances à longue portée ; difficulté à préserver les structures complexes des motifsAdaptée à la segmentation de motifs, mais moins efficace pour la reconstruction artistique
Méthodes basées sur les GAN (par exemple, Pix2Pix, CycleGAN)Génération d'images par adversarial learning et traduction d'image à imageSynthèse d'images de haute qualité et transfert de styleInstabilité lors de l'entraînement ; incohérence sémantique ; perte potentielle de détails structurels finsUtile pour la restauration de motifs, mais peut ne pas préserver fidèlement les motifs culturels
Méthodes basées sur les transformeursAuto-attention et modélisation du contexte globalCapture des dépendances à longue portée et des relations visuelles complexesCoût computationnel élevé ; nécessite de grands ensembles de données d'entraînementEfficace pour l'analyse de motifs complexes, mais capacité générative limitée lorsqu'utilisée seule
Méthodes basées sur la diffusionGénération d'images par débruitage itératifRéalisme visuel élevé et diversité des imagesVitesse d'inférence lente ; exigences computationnelles élevées ; contrôle structurel limitéPrometteuse pour la génération d'images patrimoniales, mais très exigeante en calcul
Méthodes hybrides transformeur-GANCombinaison de l'extraction de caractéristiques basée sur les transformeurs et de la génération basée sur les GANAmélioration de la représentation des caractéristiques globales et de la qualité des imagesManquent souvent d'un guidage sémantique explicite pour la préservation des motifsAméliore la qualité de génération, mais n'est pas spécifiquement conçue pour les motifs du patrimoine culturel
SegCycle-SPADE proposéSegFormer + CAFFM + CycleGAN + SPADESegmentation basée sur les transformeurs, fusion de caractéristiques guidée par l'attention, cohérence sémantique, préservation des motifs et reconstruction artistique contrôlableComplexité computationnelle plus élevée que les approches CNN autonomesConçu spécifiquement pour la reconstruction et la préservation des motifs du patrimoine culturel, avec une fidélité structurelle et une cohérence sémantique améliorées

Tableau 8 : Comparaison d'approches représentatives d'apprentissage profond pour la reconstruction et la préservation de motifs du patrimoine culturel. Comparaison qualitative d'approches représentatives d'apprentissage profond utilisées pour la segmentation d'images, la reconstruction de motifs, la génération de styles et la préservation du patrimoine culturel. Le tableau résume la méthodologie fondamentale, les forces, les limites et l'applicabilité de chaque approche, et met en évidence la manière dont le cadre proposé SegCycle-SPADE combine la segmentation sémantique, la fusion de caractéristiques, la reconstruction et la synthèse de style afin de relever les défis liés à la préservation structurelle et à la cohérence sémantique des motifs du patrimoine culturel.

Les améliorations observées démontrent que le module CAFFM renforce efficacement l'interaction entre les caractéristiques structurelles issues de la segmentation et les représentations de style artistique grâce à une fusion de caractéristiques basée sur l'attention croisée. De plus, la perte de préservation des motifs contribue à maintenir les structures de motifs culturellement significatives durant la reconstruction et la synthèse artistique, ce qui améliore la cohérence de la segmentation, la fidélité structurelle et le réalisme visuel. Dans leur ensemble, les résultats d'analyse par suppression confirment que l'intégration de SegFormer-B2, de CAFFM, de CycleGAN, de SPADE et de la perte de préservation des motifs est responsable des performances supérieures du cadre SegCycle-SPADE proposé.

Disponibilité des données :
Le jeu de données WikiArt utilisé pour l'apprentissage du style artistique est publiquement accessible via le référentiel Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). Le jeu de données Miao Batik utilisé dans cette étude est publiquement disponible sur Zenodo (https://doi.org/10.5281/zenodo.20807658). Les jeux de données traités, les masques de segmentation, les poids du modèle pré-entraîné, les sorties générées et les fichiers d'implémentation en Python associés au cadre proposé SegCycle-SPADE sont également accessibles via ce même dépôt Zenodo.

FICHIER SUPPLÉMENTAIRE :
Fichier supplémentaire 1. Algorithme 1 : Flux de mise en œuvre du cadre SegCycle-SPADE proposé. Code pseudocode étape par étape décrivant l'ensemble du pipeline de mise en œuvre du cadre SegCycle-SPADE proposé, incluant le chargement du jeu de données, le prétraitement, la segmentation sémantique à l'aide de SegFormer-B2, la fusion de caractéristiques via le module de fusion de caractéristiques culturelles par attention croisée (CAFFM), la reconstruction de motifs culturels à l'aide de CycleGAN, la synthèse de style artistique à l'aide de SPADE, l'entraînement du modèle, la validation, la sélection des points de contrôle et l'évaluation finale des performances. Veuillez cliquer ici pour télécharger ce fichier.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La préservation et la reconstruction numérique des motifs du patrimoine culturel immatériel (ICH) suscitent un intérêt croissant ces dernières années en raison de la disparition progressive des savoir-faire traditionnels. Des études antérieures ont tenté de répondre à la perte du patrimoine culturel à l’aide de techniques de traitement d’image fondées sur l’apprentissage profond (DL). Par exemple, Quan et al.32 ont proposé un cadre de préservation du patrimoine culturel basé sur des graphes de connaissances et sur l’apprentissage profond, appliqué à la culture batik Miao du Guizhou. Bien que cette étude se soit concentrée sur la reconstruction numérique de motifs culturels, sa méthodologie reposait principalement sur des représentations par graphes de connaissances. De même, Fu et Razmjooy16 ont proposé un cadre fondé sur un réseau en pyramide de caractéristiques (FPN) pour l’amélioration et la restauration d’images du patrimoine culturel. Bien que cette méthode ait permis une extraction efficace de caractéristiques pour l’amélioration d’images, elle n’intégrait ni un guidage par segmentation d’image ni un mécanisme de reconstruction générative pour les motifs culturels incomplets. En revanche, le cadre SegCycle-SPADE proposé combine plusieurs composants d’apprentissage profond afin de surmonter ces difficultés. Premièrement, une segmentation sémantique à l’aide du modèle SegFormer est utilisée pour identifier précisément les régions de motifs au sein des motifs du patrimoine culturel. Ensuite, un module d’amélioration de caractéristiques basé sur CAFFM améliore les représentations de caractéristiques pour des structures de motifs fines. Un module de reconstruction CycleGAN est ensuite utilisé pour reconstruire les régions manquantes ou incomplètes des motifs culturels par apprentissage antagoniste. Enfin, un module SPADE réalise une amélioration stylistique tout en conservant un alignement structurel avec les cartes de segmentation. Les méthodes existantes fondées sur les CNN, les GAN, les transformeurs et les modèles de diffusion17,19,20,21,22,23,24,25,30,34 offrent chacune des avantages spécifiques ; toutefois, elles présentent également des limites quant à la préservation de la cohérence sémantique, au maintien des caractéristiques structurelles ou à l’efficacité computationnelle, comme résumé dans Tableau 8. L’architecture SegCycle-SPADE proposée combine les forces de la segmentation basée sur SegFormer, de la fusion croisée d’attention, de la reconstruction CycleGAN et de la synthèse guidée par SPADE, tout en palliant ces limitations. Par conséquent, le cadre atteint une qualité de reconstruction améliorée et une meilleure préservation des motifs culturellement significatifs.

Malgré ses performances prometteuses, le cadre SegCycle-SPADE proposé présente encore plusieurs limites. Premièrement, l'évaluation a été réalisée uniquement à l'aide des ensembles de données Miao Batik et WikiArt, ce qui pourrait limiter la généralisation du cadre à d'autres domaines du patrimoine culturel. Deuxièmement, le déploiement sur des plateformes à ressources limitées pourrait s'avérer difficile, car l'intégration de SegFormer, CAFFM, CycleGAN et SPADE augmente la complexité computationnelle et les besoins en mémoire. Troisièmement, les performances de segmentation dépendent fortement de la qualité et de la cohérence des annotations des motifs, et un biais d'annotation pourrait affecter la préservation de structures culturellement significatives. Enfin, comme le cadre a été évalué à l'aide de seulement deux ensembles de données, des données d'entraînement supplémentaires et des adaptations spécifiques à chaque domaine pourraient être nécessaires afin d'assurer son applicabilité à diverses collections de patrimoine culturel. Les études futures devraient donc explorer des stratégies d'entraînement plus robustes, des architectures légères, des procédures d'annotation améliorées, ainsi que des évaluations inter-domaines utilisant d'autres ensembles de données de patrimoine culturel.

L'extensibilité du cadre SegCycle-SPADE à des ensembles de données patrimoniaux plus vastes et plus divers sera un axe majeur des recherches futures. Une évaluation interculturelle des motifs patrimoniaux provenant de différentes régions et traditions artistiques sera menée afin d'améliorer la généralisation du modèle et son adaptabilité culturelle. Par ailleurs, des extensions multimodales intégrant des descriptions textuelles, des documents historiques et des métadonnées culturelles pourraient fournir une orientation sémantique plus forte durant la reconstruction. Le cadre pourrait également être étendu pour prendre en charge la reconstruction du patrimoine culturel en trois dimensions, en combinant la reconstruction basée sur des images avec des techniques de modélisation 3D. En outre, son déploiement dans des archives numériques, des musées, des expositions virtuelles et des plateformes de préservation du patrimoine culturel sera exploré afin de faciliter les applications pratiques de la conservation et de la documentation du patrimoine assistées par l'intelligence artificielle. Pour améliorer encore l'interprétabilité et l'authenticité culturelle, les travaux futurs examineront l'intégration de graphes de connaissances culturelles, de documents ethnographiques, de métadonnées historiques et de bases de connaissances élaborées par des experts, afin de permettre une analyse et une reconstruction des motifs éclairées par le contexte culturel32.

Plusieurs considérations pratiques doivent être prises en compte lors de la mise en œuvre du cadre SegCycle-SPADE proposé. Pendant l'entraînement de CycleGAN, une convergence antagoniste instable peut survenir si les pertes du générateur et du discriminateur deviennent fortement déséquilibrées. Dans de telles situations, la réduction du taux d'apprentissage, l'augmentation du poids de la perte de cohérence cyclique ou la surveillance de la domination du discriminateur peuvent améliorer la stabilité de l'entraînement. Un effondrement de mode peut survenir lorsque le générateur produit à répétition des sorties visuellement similaires ; ce problème peut être atténué par un entraînement antagoniste équilibré, l'utilisation d'un tampon de relecture et une surveillance attentive des tendances des pertes du générateur et du discriminateur. Des échecs de segmentation peuvent également survenir lorsque les motifs culturels présentent des textures complexes, un faible contraste ou des limites ambiguës. Pour remédier à ce problème, la qualité des images doit être vérifiée avant l'entraînement, et les masques de segmentation doivent être inspectés visuellement afin d'assurer la cohérence des annotations. Il est également important de maintenir la résolution d'entrée recommandée ainsi que les paramètres de normalisation pour obtenir des performances fiables de SegFormer. Une instabilité de l'entraînement peut également résulter de réglages inappropriés du taux d'apprentissage, d'un jeu de données d'entraînement insuffisant ou de variations numériques liées au matériel. Pour améliorer la reproductibilité, des graines aléatoires fixes doivent être utilisées pour les opérations de NumPy, PyTorch, CUDA et de mélange du jeu de données. En outre, il convient de conserver identiques le pipeline de prétraitement, les partitions du jeu de données, les hyperparamètres du modèle et l'environnement logiciel lors de toutes les exécutions expérimentales. La sauvegarde périodique des points de contrôle et la surveillance de la perte de validation sont également recommandées afin d'éviter une dégradation des performances et de faciliter la reprise après des séances d'entraînement interrompues.

Les travaux proposés contribuent à l'avancement théorique des cadres de reconstruction du patrimoine culturel fondés sur l'intelligence artificielle. Les approches conventionnelles de restauration d'images traitent généralement la segmentation d'image, la reconstruction et la génération de style comme des processus indépendants17,19,20,30. En revanche, cette étude propose un cadre intégrant ces processus au moyen d'une stratégie de reconstruction générative guidée par la segmentation. Par conséquent, l'étude contribue au développement théorique de la reconstruction assistée par IA du patrimoine culturel en démontrant comment la segmentation, la reconstruction et la génération de style peuvent être unifiées au sein d'un même cadre. Une telle intégration revêt une importance particulière dans les applications liées au patrimoine culturel, où la préservation de la structure des motifs et de leur signification sémantique est essentielle. D'un point de vue pratique, le cadre proposé offre une solution efficace pour la préservation numérique, la restauration et l'enrichissement artistique des motifs culturels traditionnels. Les institutions du patrimoine culturel, les musées et les designers peuvent utiliser SegCycle-SPADE pour identifier automatiquement les régions de motifs, reconstruire des motifs endommagés ou incomplets, et générer des représentations artistiques visuellement améliorées de dessins traditionnels. Cette capacité est particulièrement précieuse pour les traditions artisanales menacées, notamment les motifs textiles de batik Miao, où les artefacts historiques peuvent être partiellement détériorés ou incomplets. De plus, grâce à l'intégration de la synthèse générative de style, le cadre peut soutenir des applications contemporaines de création culturelle telles que la conception textile, la création artistique numérique et l'éducation au patrimoine. Ainsi, le cadre proposé comble l'écart entre la préservation du patrimoine culturel et les applications contemporaines de conception culturelle.

Néanmoins, malgré les résultats prometteurs obtenus par le cadre proposé SegCycle-SPADE, plusieurs limites persistent. Premièrement, l'évaluation a été réalisée uniquement à l'aide des ensembles de données Miao Batik et WikiArt, ce qui pourrait affecter la capacité de généralisation du cadre pour la reconstruction d'autres formes de motifs du patrimoine culturel. Deuxièmement, comme le processus de reconstruction repose sur des modèles basés sur des GAN, les sorties générées peuvent occasionnellement contenir des artefacts ou des textures non naturelles lorsqu'elles traitent des structures de motifs très complexes. Troisièmement, le cadre se concentre actuellement sur la reconstruction de motifs bidimensionnels, alors que certains objets du patrimoine culturel impliquent des structures intrinsèquement tridimensionnelles. Dans l'ensemble, les résultats expérimentaux démontrent l'efficacité du cadre proposé SegCycle-SPADE pour la reconstruction artistique de motifs du PCI. L'intégration de la segmentation sémantique basée sur SegFormer, du CAFFM, de la reconstruction de motifs basée sur CycleGAN et de la synthèse artistique basée sur SPADE a systématiquement amélioré les métriques de performance en matière de segmentation, de reconstruction et de qualité d'image. Les études d'ablation ont en outre validé la contribution de chaque composant du cadre, montrant que le CAFFM et la perte de préservation des motifs améliorent considérablement la fidélité structurelle et l'authenticité visuelle. Ces résultats confirment l'hypothèse centrale selon laquelle une reconstruction guidée par la segmentation sémantique, combinée à une fusion de caractéristiques par attention croisée, peut préserver efficacement les motifs culturellement significatifs tout en générant des sorties artistiquement riches. Par conséquent, le cadre proposé offre une approche computationnelle fiable et reproductible pour la préservation numérique, la restauration et la revitalisation créative des motifs du PCI.

Déclarations de divulgation

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Conflit d'intérêts :
Les auteurs déclarent ne pas avoir d'intérêts concurrents.

Remerciements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Les auteurs reconnaissent le soutien académique et institutionnel fourni par le Guangdong Engineering Polytechnic et l'Université normale du Sud de la Chine pendant la réalisation de cette recherche. Cette recherche a été soutenue par le projet général du Fonds national des sciences sociales de 2023 (n° 23BH161), intitulé « Musée de régénération numérique : recherche sur la revitalisation et la communication des reliques culturelles chinoises classiques de calligraphie et de peinture ».

Matériaux

Liste des matériaux utilisés dans cet article
NomEntrepriseNuméro de catalogueCommentaires
Optimiseur AdamBibliothèque d'optimiseurs PyTorchAdamAlgorithme d'optimisation utilisé pendant l'entraînement du modèle.
Kit d'outils CUDASociété NVIDIACUDA 11.3Accélération GPU pour les calculs d'apprentissage profond.
cuDNNSociété NVIDIAcuDNN 8.2Bibliothèque d'accélération de réseaux neuronaux profonds utilisée pour accélérer l'entraînement et l'inférence.
CycleGANUniversité de Californie à Berkeley / Open SourceImplémentation officielle PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Réseau génératif antagoniste utilisé pour la reconstruction de motifs culturels.
Poids préentraînés ImageNetImageNet / Open Sourcemit_b2.pth (point de contrôle préentraîné sur ImageNet-1K)Utilisé pour initialiser le squelette SegFormer-B2 avant l'ajustement fin sur le jeu de données Miao Batik.
Processeur IntelSociété IntelIntel Core i7 (11e génération)Processeur utilisé pour le prétraitement des images, le soutien à l'entraînement du modèle et l'inférence.
MatplotlibÉquipe de développement de MatplotlibMatplotlib 3.5.1Visualisation des courbes d'apprentissage et des résultats d'évaluation.
Jeu de données Miao BatikRéférentiel ZenodoDOI : 10.5281/zenodo.20807658Jeu de données de motifs culturels contenant 15 148 images, utilisé pour la segmentation sémantique et la reconstruction de motifs.
NumPyDéveloppeurs de NumPyNumPy 1.21.5Calcul numérique et traitement des jeux de données.
GPU NVIDIASociété NVIDIANVIDIA RTX 3090 (24 Go de mémoire vidéo)Plateforme matérielle utilisée pour l'entraînement et l'inférence du modèle.
OpenCVFondation OpenCVOpenCV 4.5.5Prétraitement d'images, redimensionnement, interpolation et débruitage gaussien.
Système d'exploitationCanonical Ltd.Ubuntu 20.04 LTSEnvironnement d'exécution expérimental.
Pillow (PIL)Bibliothèque d'images PythonPillow 8.4.0Chargement et manipulation d'images.
PythonFondation PythonPython 3.8.10Langage de programmation utilisé pour l'implémentation et les expérimentations.
PyTorchMeta AIPyTorch 1.10.0Framework d'apprentissage profond utilisé pour l'entraînement et l'inférence du modèle.
Graine aléatoireParamètre expérimental42Graine fixe utilisée pour la partition du jeu de données, l'initialisation du modèle et la reproductibilité expérimentale.
Scikit-learnDéveloppeurs de Scikit-learnScikit-learn 1.0.2Partitionnement des jeux de données, analyse statistique et métriques d'évaluation.
SeabornCommunauté open sourceSeaborn 0.11.2Visualisation de données statistiques.
SegFormer-B2Recherche NVIDIA / Open SourceSegFormer-B2 (squelette MIT-B2)Modèle de segmentation sémantique basé sur les transformeurs, utilisé pour la segmentation de motifs culturels.
Masques / annotations de segmentationJeu de données Miao BatikInclus avec le jeu de donnéesÉtiquettes de segmentation sémantique au niveau des pixels, utilisées pour la classification des motifs et l'entraînement.
SPADERecherche NVIDIA / Open SourceImplémentation officielle PyTorch (https://github.com/NVlabs/SPADE)Modèle de synthèse d'images guidé par segmentation, utilisé pour la génération de motifs artistiques.
TorchVisionMeta AITorchVision 0.11.1Utilitaires de traitement d'images et transformations de jeux de données utilisés avec PyTorch.
Jeu de données WikiArtWikiArthttps://www.wikiart.org/Jeu de données de styles artistiques contenant plus de 80 000 œuvres réparties en 27 styles artistiques, utilisé pour l'apprentissage et la synthèse de styles.

Références

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Réimpressions et autorisations

Demander l’autorisation de réutiliser le texte ou les figures de cet article JoVE

Demander une autorisation

Mots-clés

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Articles connexes