Artigo de investigação

Reconstrução Guiada por Segmentação Semântica e Síntese de Estilo Artístico de Padrões de Patrimônio Cultural Imaterial Utilizando um Framework de Deep Learning

DOI:

10.3791/71577

14 de agosto de 2026

Neste artigo

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo descreve um fluxo de trabalho de aprendizado profundo para segmentação semântica, reconstrução e síntese de estilo artístico de padrões do patrimônio cultural imaterial, utilizando extração de características baseada em transformadores, reconstrução adversarial e geração espacialmente adaptativa de imagens para apoiar a preservação digital e aplicações criativas do patrimônio.

Resumo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A preservação digital e a reconstrução de padrões do patrimônio cultural imaterial (PCI) têm atraído atenção crescente com o avanço das técnicas de síntese de imagens baseadas em aprendizado profundo. Abordagens existentes baseadas em SegCycle-SPADE demonstraram potencial para a segmentação estrutural e reconstrução artística de padrões de artesanato tradicional; no entanto, ainda existem limitações, como diversidade limitada nos conjuntos de dados, incorporação insuficiente de semântica cultural e preservação inadequada das características estruturais dos padrões durante a reconstrução. Para enfrentar esses desafios, este estudo propõe um framework SegCycle-SPADE aprimorado para a segmentação semântica e reconstrução artística de tipos de padrões do PCI. Um modelo de segmentação baseado em Transformer, o SegFormer, é empregado para identificar com precisão os limites dos motivos e as regiões dos padrões. Além disso, é introduzido um Módulo de Fusão de Recursos Culturais com Atención Cruzada para realçar motivos culturalmente significativos e melhorar a representação de características. A tradução e reconstrução de padrões são realizadas usando CycleGAN, enquanto a Denormalização Espacialmente Adaptativa (SPADE) é utilizada para a síntese de estilo artístico, mantendo a consistência semântica entre mapas de segmentação e imagens geradas. Para melhorar a generalização do modelo e a diversidade artística, o framework é treinado utilizando tanto o conjunto de dados de motivos culturais Miao Batik quanto o conjunto de dados WikiArt. Os resultados experimentais demonstram que o framework SegCycle-SPADE guiado por atenção proposto melhora a precisão da segmentação e o desempenho na reconstrução de padrões do patrimônio em comparação com métodos existentes de reconstrução baseados em redes adversárias generativas (GAN). O framework proposto oferece uma solução escalável para a documentação, reconstrução e revitalização artística assistidas por inteligência artificial em desenhos tradicionais de padrões.

Introdução

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O patrimônio cultural, que inclui elementos intangíveis como costumes, línguas e crenças, e elementos tangíveis como obras de arte, edifícios e registros escritos, é uma manifestação fundamental da história, criatividade e identidade humanas1. A conservação do patrimônio busca permitir que comunidades se reconectem com suas origens e possibilita que gerações futuras se beneficiem de sua memória cultural coletiva. Também promove o entendimento intercultural, a apreciação de tradições e costumes diversos e o reconhecimento de diferentes narrativas históricas. Esses bens culturais nos ajudam a compreender os valores, perspectivas e experiências de gerações anteriores e contribuem para a formação das identidades sociais contemporâneas e da continuidade cultural. Os princípios básicos da preservação do patrimônio cultural são ilustrados na Figura 1.

figure-introduction-1
Figura 1. Visão Conceitual da Reconstrução de Padrões do Patrimônio Cultural Utilizando o Framework SegCycle-SPADE. Ilustração esquemática da abordagem proposta para reconstrução e aprimoramento de padrões do patrimônio cultural imaterial. O fluxo de trabalho inclui a coleta de conjuntos de dados dos repositórios Miao Batik e WikiArt, pré-processamento das imagens, segmentação semântica utilizando o SegFormer-B2, fusão de características com o Módulo de Fusão de Características Culturais com Atenção Cruzada (CAFFM), reconstrução de padrões com CycleGAN, síntese de estilo artístico com SPADE e avaliação final com métricas de segmentação e reconstrução. As setas indicam o fluxo de dados e representações de características ao longo do framework. Clique aqui para visualizar uma versão maior desta figura.

A memória coletiva e o legado cultural da sociedade humana estão incorporados ao patrimônio cultural imaterial (PCI), que atua como um importante meio de expressão artística e identidade cultural. No entanto, o PCI enfrenta desafios significativos devido aos efeitos da globalização e da digitalização2,3,4. Muitas práticas de PCI em perigo de extinção exigem novas abordagens para preservação e desenvolvimento, em razão da diminuição do número de artesãos qualificados e da limitada adaptabilidade aos mercados modernos5,6. Como uma área importante da pesquisa em PCI, o design sustentável enfatiza o desenvolvimento integrado de cultura, sociedade e meio ambiente, oferecendo um caminho prático para a preservação contínua do PCI. Por meio de abordagens de design sustentável, o PCI pode ser revitalizado enquanto se adapta às necessidades da sociedade contemporânea7,8.

Neste estudo, o termo “padrões do patrimônio cultural imaterial” refere-se a representações de motivos visuais que comunicam e preservam valores culturais imateriais subjacentes. Consequentemente, a estrutura proposta tem como objetivo preservar e documentar as informações culturais associadas a esses motivos, ao mesmo tempo em que reconstrói suas formas visuais.

A bordadura Miao e o tingimento resistente ao cera são formas significativas do patrimônio cultural imaterial chinês, refletindo a história, crenças e tradições da comunidade Miao por meio de motivos simbólicos como aves, borboletas e totens ancestrais9. Esses motivos estão profundamente enraizados nas vestimentas rituais e nas práticas festivas e contribuem para o desenvolvimento cultural e econômico local10,11. Os avanços nas tecnologias digitais, particularmente na inteligência artificial (IA) e na aprendizagem profunda (DL), criaram novas oportunidades para a preservação, análise, reconstrução e documentação do patrimônio cultural. O tingimento resistente ao cera Miao de Guizhou, uma das tradições de tingimento resistente ao cera melhor preservadas na China, serve como um meio importante para transmitir o conhecimento cultural, crenças, costumes e rituais do povo Miao12,13,14,15,16.

Estudos recentes demonstraram o potencial do aprendizado profundo (DL) para a preservação do patrimônio cultural e reconstrução de padrões, alcançando maior precisão na segmentação (precisão por pixel = 88,6%, média da interseção sobre união [IoU] = 78,1%) e desempenho na reconstrução em comparação com o U-Net e o DeepLabV3+. No entanto, permanecem diversos desafios. As abordagens existentes baseadas em redes adversariais generativas (GAN) frequentemente apresentam dificuldades em preservar detalhes estruturais finos em padrões complexos.17, enquanto a diversidade limitada dos conjuntos de dados restringe a generalização do modelo entre domínios culturais18Além disso, modelos de tradução de imagem para imagem, como o CycleGAN, podem falhar em manter a consistência semântica entre mapas de segmentação e imagens geradas19, e a ausência de mecanismos de atenção pode resultar na perda de detalhes de motivos culturalmente significativos durante a reconstrução20Portanto, é necessário um framework aprimorado que integre segmentação baseada em transformadores, aprendizado de características guiado por atenção e treinamento com múltiplos conjuntos de dados para a reconstrução eficaz de padrões de HIC.

Novas oportunidades para a preservação do patrimônio cultural surgiram por meio da digitalização do bordado Miao e do rápido avanço da inteligência artificial generativa. Modelos de difusão, uma classe emergente de modelos generativos profundos, demonstraram desempenho notável em tarefas de visão computacional devido às suas poderosas capacidades de geração de conteúdo21,22,23,24,25. Durante o processo de difusão reversa, o modelo aprende gradualmente a reconstruir os dados de entrada originais a partir de representações ruidosas26,27,28. Estudos anteriores também exploraram a aplicação de tecnologias de reconstrução tridimensional e de design auxiliado por computador (CAD) para a preservação e disseminação do patrimônio cultural.

Embora as redes neurais convolucionais (CNNs) e as GANs apresentem bom desempenho na geração de imagens e na preservação de características, ainda enfrentam desafios relacionados a campos receptivos limitados, colapso de modos e instabilidade no treinamento29. As arquiteturas baseadas em Transformers, como SegFormer e Segmenter, destacam-se na captura de contexto global e relações semânticas; no entanto, são computacionalmente intensivas e podem ter dificuldades com detalhes finos. Embora modelos de difusão, como o Stable Diffusion, demonstrem fortes capacidades de geração de imagens, muitas vezes carecem de controle preciso sobre as características estruturais e artísticas dos designs gerados. Além disso, a maioria das abordagens existentes utiliza estratégias de treinamento independentes, o que limita a troca eficaz de informações e a otimização colaborativa entre os componentes de segmentação e geração, resultando em um compromisso entre precisão estrutural e autenticidade artística30.

Modelos de difusão recentes, como a difusão latente e a difusão estável, alcançam síntese de imagens de alta qualidade, mas exigem denoising iterativo, o que aumenta o custo computacional e o tempo de inferência. Além disso, manter motivos culturais finos e consistência estrutural permanece desafiador sem mecanismos especializados de condicionamento. Modelos geradores baseados em Transformer capturam eficazmente relações contextuais globais, mas frequentemente requerem conjuntos de dados em larga escala e recursos computacionais substanciais. Em contraste, o framework proposto SegCycle-Normalização Adaptativa Espacial por Segmentação (SegCycle-SPADE) combina segmentação baseada em SegFormer, fusão de características com atenção cruzada, reconstrução com CycleGAN e síntese orientada por SPADE, fornecendo orientação estrutural explícita, melhorando assim a preservação de motivos, a consistência semântica e a reconstrução controlável de padrões do patrimônio cultural.

A maioria das técnicas modernas de segmentação semântica baseia-se em CNNs totalmente convolucionais (FCNNs) com arquiteturas em formato de U31. Durante a etapa de codificação, características profundas com grandes campos receptivos são extraídas por meio de uma série de operações de convolução e subamostragem. A etapa de decodificação restaura progressivamente a resolução espacial por meio da superamostragem, permitindo, em última instância, a predição semântica em nível de pixel. Ao compensar a perda de informações espaciais durante a subamostragem e melhorar o desempenho da segmentação em uma ampla gama de aplicações, as conexões de salto permitem que informações de alta resolução de diferentes níveis do codificador sejam diretamente integradas ao decodificador32.

Embora métodos recentes baseados em GAN, CNN e difusão tenham demonstrado resultados promissores na geração de imagens e na restauração do patrimônio cultural, muitas vezes enfrentam dificuldades para manter a consistência semântica, preservar motivos estruturais finos e garantir uma reconstrução reprodutível em diferentes padrões culturais. A maioria das abordagens existentes trata a segmentação, a reconstrução e a síntese de estilo como processos separados, o que pode resultar na perda de elementos culturalmente significativos e em saídas inconsistentes. Para preencher essa lacuna metodológica, este estudo propõe um framework unificado SegCycle-SPADE que integra segmentação semântica baseada em SegFormer, um novo Módulo de Fusão de Recursos Culturais com Atenção Cruzada (CAFFM), reconstrução baseada em CycleGAN e síntese de estilo orientada por SPADE. Ao integrar explicitamente informações de segmentação estrutural com aprendizado gerativo de características, o framework proposto permite uma reconstrução mais confiável, semanticamente consistente e reprodutível de motivos do patrimônio cultural imaterial (ICH), preservando ao mesmo tempo a autenticidade cultural e a qualidade artística.

Três limitações principais das abordagens atuais de reconstrução do patrimônio cultural são identificadas neste estudo: (i) preservação insuficiente de motivos estruturais finos em métodos de reconstrução baseados em GAN; (ii) generalização limitada resultante do treinamento com conjuntos de dados pequenos ou específicos de domínio; e (iii) consistência semântica inadequada entre as saídas de segmentação e as imagens geradas em estruturas de tradução imagem-a-imagem. Além disso, segmentação, reconstrução e síntese de estilo são comumente tratadas como processos separados, levando à perda de elementos culturalmente importantes durante o reconstrução. Ao combinar segmentação semântica baseada em transformador, fusão de características com atenção cruzada, reconstrução CycleGAN e síntese artística orientada por SPADE dentro de uma arquitetura unificada, o framework proposto SegCycle-SPADE supera essas limitações e melhora a preservação de motivos, a consistência semântica e a autenticidade artística no reconstrução de padrões de PCI.

O principal objetivo deste estudo é desenvolver um framework aprimorado SegCycle-SPADE para a reconstrução artística orientada por segmentação semântica de padrões de ICH. O framework integra o SegFormer para segmentação precisa de motivos culturais, o CycleGAN para reconstrução de padrões e o SPADE para síntese artística com consistência de estilo. Para melhorar a representação de características e preservar detalhes estruturais finos, um CAFFM é introduzido para facilitar a interação eficaz entre características de segmentação e gerativas. Treinado nos conjuntos de dados Miao Batik e WikiArt, o framework proposto aprimora a autenticidade da reconstrução, a consistência de estilo e a preservação de motivos culturalmente significativos.

Ao combinar segmentação semântica, fusão de características orientada por atenção, reconstrução de padrões e síntese de estilo dentro de uma arquitetura unificada, este estudo apresenta um novo framework SegCycle-SPADE para a reconstrução artística de padrões ICH. As principais contribuições deste trabalho são as seguintes. Primeiro, desenvolve-se um novo framework de reconstrução guiado por segmentação semântica mediante a integração do SegFormer, permitindo a extração precisa e a preservação de motivos culturais complexos e elementos estruturais. Segundo, introduz-se um novo CAFFM para fundir eficazmente características de segmentação com representações gerativas, permitindo ao modelo capturar relações de longo alcance entre motivos culturais e padrões de estilo artístico. Terceiro, o CAFFM proposto melhora a preservação de elementos culturalmente significativos, ao mesmo tempo que aumenta o realismo visual e a coerência estrutural dos padrões do patrimônio reconstruídos. Quarto, ao integrar o CycleGAN para reconstrução de padrões culturais e o SPADE para síntese artística guiada por segmentação, o framework garante tanto a precisão semântica quanto a autenticidade estilística nas saídas geradas. Quinto, para melhorar a generalização e a diversidade artística, o modelo é treinado utilizando o conjunto de dados de motivos culturais Miao Batik para aprendizado de padrões culturais e o conjunto de dados WikiArt para representação de estilo artístico. O WikiArt atua como conjunto de dados auxiliar para avaliar a capacidade de generalização do framework, a robustez na aprendizagem de características e a eficácia no controle de estilo em diversos contextos visuais, e não como estilo-alvo para aplicação direta em produtos do patrimônio cultural Miao. Por fim, em comparação com métodos existentes baseados em GAN para reconstrução de patrimônio cultural, os resultados experimentais demonstram que o framework SegCycle-SPADE proposto alcança maior precisão na segmentação, qualidade de reconstrução e consistência estilística.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

O framework proposto, SegCycle-SPADE, foi projetado para reconstruir e aprimorar padrões tradicionais do patrimônio cultural por meio da segmentação semântica, realce de características usando mecanismos de atenção, reconstrução generativa e síntese de estilo artístico. Este estudo utilizou conjuntos de dados públicos de imagens artísticas e do patrimônio cultural, incluindo o conjunto de dados Miao Batik e o conjunto de dados WikiArt. Nenhum participante humano, dado de paciente, informação pessoal, sujeito animal ou registro clínico foi envolvido na pesquisa; portanto, não foi necessária aprovação do comitê de ética institucional nem consentimento informado. Inicialmente, o conjunto de dados de motivos culturais Miao Batik e o conjunto de dados WikiArt foram utilizados para a avaliação. O conjunto de dados Miao Batik foi descrito em Quan et al. (2024)³² e contém 15.148 imagens anotadas de motivos tradicionais de batik Miao. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas diretamente, e nenhuma anotação manual adicional foi gerada neste estudo. Em seguida, foi realizada a pré-processamento das imagens por meio de redimensionamento, normalização, remoção de ruído e criação de máscaras de segmentação. Os parâmetros exatos de pré-processamento são descritos na subseção Pré-processamento dos Dados. O framework proposto utiliza um modelo baseado em transformador denominado SegFormer-B2 para a segmentação semântica dos dados. O método foi projetado para detectar regiões-chave dos motivos culturais e aprender suas estruturas. As características segmentadas são então realçadas por meio de um mecanismo de atenção, no qual informações importantes relacionadas aos motivos culturais são destacadas e informações irrelevantes são descartadas. A configuração do mecanismo de atenção é descrita na subseção CAFFM. As características realçadas são então processadas pelo CycleGAN, onde estruturas danificadas são reconstruídas por meio de aprendizado cíclico. Durante o treinamento, amostras de motivos incompletos foram artificialmente criadas mediante aplicação de operações de máscara aleatória e oclusão parcial às imagens originais de Miao Batik. Esses procedimentos de degradação simularam regiões de motivos ausentes e danos estruturais comumente observados em artefatos de patrimônio cultural deteriorados. As imagens incompletas resultantes foram utilizadas como entradas para o módulo de reconstrução do CycleGAN, enquanto as imagens originais correspondentes serviram como alvos de reconstrução. Os padrões de patrimônio cultural reconstruídos são então aprimorados por meio do SPADE, onde o realce artístico é realizado com base nos mapas de segmentação gerados. O desempenho do framework proposto é avaliado por meio de métricas quantitativas de segmentação e qualidade de imagem, enquanto a autenticidade visual dos motivos culturais reconstruídos é avaliada qualitativamente. A autenticidade visual foi avaliada por inspeção visual dos padrões culturais gerados e não foi utilizada como métrica quantitativa independente. A avaliação concentrou-se na preservação do motivo, consistência semântica, características culturais, coerência estrutural e aparência artística em relação aos motivos culturais de referência correspondentes. A avaliação quantitativa do desempenho do modelo foi realizada utilizando Acurácia de Segmentação, Índice de Similaridade (IoU), Coeficiente de Dice, Índice de Similaridade Estrutural (SSIM), Relação Sinal-Ruído de Pico (PSNR) e Distância de Inception de Fréchet (FID). Figura 2 ilustra o fluxo de trabalho geral do framework proposto SegCycle-SPADE e resume as métricas de avaliação utilizadas neste estudo.

figure-protocol-1
Figura 2. Fluxo da Arquitetura Geral do Framework Proposto SegCycle-SPADE. Visão geral do fluxo de trabalho completo do SegCycle-SPADE. Imagens dos conjuntos de dados Miao Batik e WikiArt passam por pré-processamento antes de serem processadas por meio de segmentação semântica usando o SegFormer-B2, realce de características usando o CAFFM, reconstrução de padrões usando o CycleGAN e geração de estilo artístico usando o SPADE. O desempenho do modelo é avaliado por meio da Acurácia de Segmentação, Intersecção sobre União (IoU), Coeficiente Dice, Índice de Similaridade Estrutural (SSIM), PSNR e Distância de Inception de Fréchet (FID), enquanto a autenticidade visual é avaliada qualitativamente. Clique aqui para visualizar uma versão maior desta figura.

A estrutura SegCycle-SPADE para reconstrução de padrões do patrimônio cultural foi projetada para integrar múltiplos componentes de aprendizado profundo (DL) com o objetivo de realizar segmentação, reconstrução e aprimoramento artístico precisos de motivos, conforme ilustrado na Figura 2. Imagens do conjunto de dados de motivos culturais do Batik Miao e do conjunto de dados WikiArt são utilizadas para fornecer padrões culturais e estilos artísticos diversos. Inicialmente, as imagens são processadas por meio de um módulo de segmentação semântica baseado no SegFormer, para identificar e delimitar os motivos culturais em relação ao fundo. A arquitetura geral consiste em quatro etapas principais. Primeiro, o modelo SegFormer extrai mapas de segmentação semântica a partir das imagens de padrões culturais. Segundo, o CAFFM integra características de segmentação com representações gerativas para aprimorar a aprendizagem de características. Terceiro, o módulo CycleGAN reconstrói os padrões culturais utilizando as representações de características fundidas. Por fim, o módulo SPADE gera saídas artisticamente aprimoradas, preservando a consistência estrutural por meio de síntese guiada por segmentação. Os mapas de características refinados são posteriormente processados pelo módulo de reconstrução CycleGAN, que aprende a restaurar motivos culturais incompletos ao mapear padrões degradados para suas formas completas correspondentes. Amostras de motivos incompletos foram geradas mediante aplicação de operações aleatórias de mascaramento e oclusão parcial às imagens originais do Batik Miao, simulando assim regiões de padrão ausentes e degradação estrutural comumente observadas em artefatos culturais danificados. Cada imagem degradada foi emparelhada com sua imagem original correspondente, que serviu como alvo de reconstrução durante o treinamento. Essa estratégia permitiu que o módulo CycleGAN aprendesse a restaurar estruturas de motivos ausentes, preservando ao mesmo tempo a consistência semântica e características culturalmente significativas. Por fim, o gerador SPADE produz saídas artísticas visualmente aprimoradas ao condicionar a síntese da imagem aos mapas de segmentação gerados, mantendo assim a integridade estrutural dos motivos culturais ao longo de todo o processo de aprimoramento artístico.

Os seguintes passos estão envolvidos no framework proposto SegCycle-SPADE.

Etapa 1: Coleta do Conjunto de Dados
Dois conjuntos de dados foram utilizados para alcançar os objetivos de aprendizado de padrões culturais e geração de estilo artístico. O Conjunto de Dados de Motivos Culturais do Tingimento Miao foi utilizado para fornecer informações sobre padrões culturais tradicionais. O conjunto de dados está publicamente disponível no Zenodo (https://doi.org/10.5281/zenodo.20807658) e contém 15.148 imagens anotadas de motivos tradicionais de tingimento Miao. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas diretamente, e nenhuma anotação manual adicional foi gerada neste estudo. O conjunto de dados WikiArt foi utilizado para fornecer informações diversas sobre estilo artístico para a geração de estilo artístico e foi obtido a partir do repositório publicamente acessível do WikiArt (https://www.wikiart.org/).

Passo 2: Pré-processamento dos Dados
Todas as imagens foram pré-processadas por meio de redimensionamento, normalização e redução de ruído. As anotações existentes de motivos culturais obtidas das fontes originais do conjunto de dados foram utilizadas para apoiar a etapa de segmentação semântica. Nenhum procedimento adicional de anotação ou reclassificação foi realizado como parte deste estudo.

Passo 3: Segmentação de Padrão Semântico usando SegFormer
O modelo SegFormer foi utilizado para a segmentação de motivos culturais. O exato backbon e estratégia de inicialização do SegFormer são descritos na subseção Segmentação de Padrão Semântico Usando SegFormer. Especificamente, a arquitetura SegFormer-B2 com um backbon MIT-B2 pré-treinado no ImageNet foi empregada para a segmentação semântica de motivos. Este modelo captura efetivamente informações contextuais globais ao mesmo tempo em que preserva os detalhes estruturais complexos dos padrões culturais tradicionais.

Passo 4: CAFFM
O CAFFM combina características de segmentação semântica com representações gerativas, permitindo que o framework aprenda tanto as características dos motivos estruturais quanto as informações de estilo artístico. Os detalhes de integração do CAFFM são fornecidos na subseção CAFFM. O módulo está posicionado entre a etapa de segmentação semântica baseada no SegFormer e a etapa de reconstrução gerativa, onde funde características estruturais derivadas da segmentação com características de reconstrução por meio de atenção cruzada com múltiplas cabeças. Esse processo melhora a preservação dos motivos culturais e aumenta o realismo das saídas reconstruídas.

Etapa 5: Reconstrução do Padrão (CycleGAN)
Os recursos fundidos são subsequentemente processados pelo módulo CycleGAN para reconstruir estruturas de padrões culturais. A arquitetura CycleGAN e a configuração de treinamento são descritas na subseção Reconstrução do Padrão Utilizando CycleGAN. O módulo de reconstrução consiste em dois geradores e dois discriminadores, utiliza uma arquitetura de gerador baseada em rede residual com nove blocos residuais, emprega um discriminador PatchGAN e é treinado utilizando perdas adversariais e de consistência cíclica. Essa configuração permite mapeamento bidirecional entre domínios e facilita a reconstrução de estruturas de padrões culturais incompletas.

Etapa 6: Geração de Estilo Artístico (SPADE)
Os padrões reconstruídos são então processados pelo módulo SPADE para realizar a síntese de estilo artístico orientada por segmentação. A configuração do gerador SPADE é descrita na subseção Artistic Style Generation Using SPADE. O módulo emprega blocos residuais SPADE, camadas de normalização adaptativa espacial e condicionamento semântico derivado dos mapas de segmentação do SegFormer e das representações de características do CAFFM. Ao condicionar a geração de imagens nos mapas de segmentação, as saídas sintetizadas mantêm o alinhamento estrutural com os motivos culturais originais, ao mesmo tempo que incorporam características de estilo artístico.

Etapa 7: Estimativa de Desempenho
A estrutura proposta foi avaliada utilizando múltiplas métricas de segmentação e avaliação da qualidade da imagem, incluindo Acurácia de Segmentação, IoU, Coeficiente de Similaridade Dice (Dice), SSIM, PSNR e FID. Para avaliar a consistência experimental, todos os experimentos foram repetidos cinco vezes utilizando diferentes sementes aleatórias, e os resultados são apresentados como média ± desvio padrão. A significância estatística foi avaliada por meio de testes t pareados, com um limiar de significância de p < 0,05.

Coleta do Conjunto de Dados
Na estrutura proposta do SegCycle-SPADE, dois conjuntos de dados são utilizados para a compreensão de padrões culturais e o aprendizado de estilo. O primeiro conjunto de dados empregado na estrutura proposta é o conjunto de dados de motivos culturais do Batik Miao. Este conjunto contém motivos culturais do Batik Miao, geralmente imagens tradicionais do Batik Miao com motivos como animais, plantas e formas geométricas, usados na arte da etnia Miao. Este conjunto contém imagens com informações ricas em textura, que são geralmente importantes para a preservação do patrimônio cultural. O segundo conjunto de dados empregado na estrutura proposta do SegCycle-SPADE é o conjunto de dados WikiArt. Este conjunto contém um grande número de obras de arte, geralmente de estilos diferentes. Este conjunto é utilizado para o aprendizado de estilos complexos, o que é geralmente útil para aprimorar obras de arte. Este conjunto possui 80.000 obras de arte em alta definição, com 27 designs diferentes, tornando-o mais útil para tarefas baseadas em aprendizado profundo (DL) de geração ou transformação de estilo.

Conjunto de Dados Miao Batik:
O conjunto de dados Miao Batik (https://doi.org/10.5281/zenodo.20807658) compreende 15.148 imagens de padrões de batique que retratam motivos culturalmente significativos. As imagens incluem uma variedade de desenhos tradicionais, como motivos de animais (por exemplo, borboletas e peixes), padrões baseados em plantas e motivos geométricos que carregam simbolismo cultural. Este conjunto de dados é um componente importante da estrutura proposta, pois fornece estruturas culturais autênticas que permitem ao módulo de segmentação identificar e preservar com precisão os limites dos motivos durante a reconstrução do padrão (Tabela 1). Neste estudo, motivos culturalmente importantes referem-se a elementos visuais simbólicos comumente documentados na literatura sobre o patrimônio cultural Miao e representados nas anotações do conjunto de dados, incluindo aves, borboletas, padrões florais e totens ancestrais. Esses motivos foram selecionados com base em sua significância cultural documentada e presença recorrente nos desenhos tradicionais de batique e bordado Miao, e não apenas na frequência de ocorrência ou composição espacial. As anotações de motivos orientadas por especialistas e os rótulos de segmentação foram obtidos da fonte original do conjunto de dados Miao Batik e utilizados diretamente neste estudo. Os autores não realizaram nenhuma anotação manual adicional, reanotação ou procedimentos de anotação guiados por especialistas. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas para o treinamento e avaliação da segmentação semântica.

ParâmetroDescrição
Nome do Conjunto de DadosMiao Batik Cultural Pattern Dataset
Fonte do Conjunto de DadosRepositório Zenodo (DOI: 10.5281/zenodo.20807658)
DomínioPatrimônio Cultural Imaterial (PCI) / Análise de Padrões Têxteis
Número Total de Imagens15.148 imagens
Tipo de ImagemImagens digitais de padrões têxteis tradicionais de batique Miao
Categorias de PadrãoMotivos animais, motivos vegetais e motivos geométricos
Origem CulturalCultura étnica Miao, Província de Guizhou, China
Resolução Original das ImagensImagens de alta resolução (tipicamente ≥ 1.000 pixels no lado mais curto) capturadas como digitalizações ou fotografias brutas antes do pré-processamento
Resolução para TreinamentoImagens redimensionadas para 256 × 256 pixels durante o pré-processamento
Disponibilidade de AnotaçõesAs anotações de segmentação existentes fornecidas pelos criadores do conjunto de dados foram utilizadas sem modificações para treinamento e avaliação. Nenhum procedimento adicional de anotação manual, reetiquetagem ou confirmação por especialista foi realizado neste estudo.
Aplicação neste EstudoSegmentação de motivos culturais, extração de características, preservação de motivos e reconstrução de padrões

Tabela 1: Características do Conjunto de Dados de Padrões Culturais do Tingimento Miao Batik. Resumo do conjunto de dados de motivos culturais Miao Batik utilizado para segmentação semântica, análise de padrões culturais e reconstrução de motivos. A tabela descreve a fonte do conjunto de dados, características das imagens, categorias de motivos, origem cultural, resolução das imagens e seu papel dentro do framework proposto SegCycle-SPADE.

Conjunto de Dados WikiArt:
O conjunto de dados WikiArt [https://www.wikiart.org/] é um repositório digital de arte em larga escala e de grande popularidade, que compreende mais de 80.000 imagens de 27 estilos artísticos diferentes apresentados na Tabela 2. Os estilos incluem arte renascentista, impressionismo, cubismo e surrealismo. O conjunto de dados é muito importante na estrutura proposta, pois oferece conhecimento que permite ao módulo SPADE criar padrões enriquecidos culturalmente, mantendo ao mesmo tempo as informações estruturais obtidas a partir do processo de segmentação. O conjunto de dados compreende 56.000 imagens para treinamento e 12.000 imagens para validação e testes. As imagens do conjunto de dados auxiliam efetivamente no treinamento do modelo de aprendizado profundo (DL).

ParâmetroDescrição
Nome do Conjunto de DadosConjunto de Dados WikiArt
Fonte do Conjunto de DadosRepositório WikiArt (https://www.wikiart.org/)
DomínioArte Digital e Pinturas
Número Total de ImagensAproximadamente 80.000 obras de arte
Imagens de Treinamento56.000
Imagens de Validação12.000
Imagens de Teste12.000
Estilos Artísticos27 estilos artísticos, incluindo Renascença, Impressionismo, Cubismo, Surrealismo, Expressionismo, Realismo e Arte Abstrata
Resolução Original das ImagensAs resoluções originais das imagens variam entre as obras e fontes. As imagens foram redimensionadas para uma resolução uniforme de 256 × 256 pixels durante o pré-processamento.
Resolução de TreinamentoImagens redimensionadas para 256 × 256 pixels durante o pré-processamento, antes da aprendizagem de estilo artístico e da síntese de imagens orientada por segmentação.
Particionamento do Conjunto de DadosParticionamento aleatório estratificado (70% para treinamento, 15% para validação e 15% para teste), utilizando uma semente aleatória fixa de 42
Estratégia de Amostragem de EstiloUtilizou-se amostragem proporcional estratificada para preservar a distribuição dos 27 estilos artísticos nos subconjuntos de treinamento, validação e teste
Aplicação neste EstudoAprendizagem de estilo artístico, representação de estilo e síntese artística orientada por segmentação

Tabela 2: Características do Conjunto de Dados WikiArt. Resumo do conjunto de dados WikiArt utilizado para aprendizado de estilo artístico e síntese de imagens guiada por estilo. A tabela descreve a origem do conjunto de dados, distribuição das imagens, cobertura de estilos artísticos, particionamento do conjunto de dados, resolução das imagens e sua aplicação dentro do framework proposto SegCycle-SPADE.

O conjunto de dados Miao Batik contém 15.148 imagens representando motivos culturais tradicionais dos Miao.32 O conjunto de dados está publicamente disponível por meio do Zenodo (https://doi.org/10.5281/zenodo.20807658). Antes do treinamento do modelo, todas as imagens foram inspecionadas visualmente e redimensionadas para 256 × 256 pixels, normalizadas e examinadas quanto a amostras corrompidas ou duplicadas. A triagem de controle de qualidade não resultou na exclusão de nenhuma imagem; portanto, todas as 15.148 imagens foram mantidas para análises subsequentes. O conjunto de dados foi particionado aleatoriamente em subconjuntos de treinamento (70%), validação (15%) e teste (15%) utilizando uma semente aleatória fixa de 42 para garantir a reprodutibilidade das divisões do conjunto de dados. O conjunto de dados WikiArt foi acessado por meio do repositório oficial do WikiArt (https://www.wikiart.org/) e contém mais de 80.000 obras de arte que abrangem 27 estilos artísticos. Para os experimentos de aprendizado de estilo, 56.000 imagens foram utilizadas para treinamento, 12.000 para validação e 12.000 para teste.

Pré-processamento dos Dados
Antes de treinar o framework proposto SegCycle-SPADE, o conjunto de dados de motivos culturais do Tingimento Miao e o conjunto de dados WikiArt foram submetidos a várias etapas de pré-processamento para garantir qualidade de imagem consistente e representação precisa de características. O mesmo pipeline básico de pré-processamento, incluindo remoção de ruído gaussiano, normalização, redimensionamento para uma resolução de entrada consistente e verificação da qualidade da imagem, foi aplicado a ambos os conjuntos de dados. No entanto, os conjuntos de dados desempenharam papéis distintos dentro do framework. O conjunto de dados WikiArt foi utilizado para aprendizado e síntese de estilo artístico, enquanto o conjunto de dados Miao Batik foi usado principalmente para segmentação e reconstrução de motivos culturais. Nenhuma alteração específica de pré-processamento foi feita além desses papéis específicos de tarefa. Para garantir um processamento consistente pelo modelo de aprendizado profundo (DL), as imagens foram inicialmente redimensionadas para uma resolução fixa. Esta etapa foi necessária porque as imagens em ambos os conjuntos de dados variavam em resolução dependendo de sua origem. O redimensionamento melhorou a eficiência computacional e evitou inconsistências dimensionais que poderiam afetar o treinamento. A segunda etapa de pré-processamento foi a normalização, na qual os valores dos pixels foram escalonados para uma faixa padronizada para estabilizar as atualizações de gradiente durante o treinamento. Em seguida, as imagens foram processadas usando filtragem gaussiana para reduzir o ruído que poderia interferir nas estruturas dos motivos culturais. Para o conjunto de dados Miao Batik, as máscaras existentes de segmentação de motivos culturais obtidas diretamente da fonte original do conjunto de dados foram utilizadas sem modificação para o treinamento e avaliação de segmentação semântica. Nenhuma nova máscara de segmentação foi gerada especificamente para este estudo.

Salvo indicação em contrário, as equações que descrevem métodos estabelecidos foram adaptadas de estudos anteriores e estão devidamente citadas. As equações que descrevem o CAFFM proposto e o framework de otimização composto SegCycle-SPADE foram desenvolvidas pelos autores para este estudo.

Considere uma imagem de entrada do conjunto de dados representada como Equação 1:

figure-protocol-2  (1)

Aqui, H, W e C referem-se à altura da imagem, largura e número de canais de cor, respectivamente. Todas as imagens são redimensionadas para uma dimensão fixa H′ × W′, conforme mostrado na Equação 2:

figure-protocol-3

Aqui, Ir é a imagem redimensionada. Os valores normalizados dos pixels são calculados de acordo com a Equação 3:

figure-protocol-4   (3)

Isso ajuda a estabilizar o procedimento de treinamento. A filtragem de ruído é realizada utilizando um filtro gaussiano, conforme mostrado na Equação 4:

figure-protocol-5

Aqui, G(σ) é um filtro gaussiano e * representa a convolução. Foi utilizado um filtro gaussiano com kernel 5 × 5 e desvio padrão de σ = 1,0. Foi aplicado preenchimento reflexivo aos pixels das bordas para reduzir artefatos de borda. Antes da escala e normalização, o processo de remoção de ruído foi realizado imediatamente após o carregamento da imagem. Para garantir um pré-processamento uniforme ao longo do estudo, a mesma configuração de filtro foi aplicada a todas as imagens dos conjuntos de dados Miao Batik e WikiArt. Para o conjunto de dados Miao Batik, as máscaras de segmentação são criadas de acordo com a Equação 5:

figure-protocol-6

Aqui, M é uma máscara de segmentação utilizada para orientar o modelo SegFormer.

O pipeline de pré-processamento começa com a aquisição de imagens dos conjuntos de dados Miao Batik e WikiArt, conforme mostrado na Figura 3. Nenhuma técnica de aumento de dados foi empregada durante o treinamento. Após o pré-processamento, que incluiu redimensionamento, normalização, remoção de ruído gaussiano e preparação de máscaras de segmentação, as imagens foram utilizadas diretamente para o treinamento, validação e teste do framework proposto SegCycle-SPADE. O primeiro passo do pipeline de pré-processamento envolve o redimensionamento das imagens para um tamanho fixo, permitindo que o modelo de aprendizado profundo processe as imagens de forma mais eficiente. O segundo passo envolve a normalização, que converte os valores dos pixels em uma faixa numérica padronizada e facilita a convergência do modelo. O terceiro passo envolve a remoção de ruído, pela qual as imagens são limpas de ruídos indesejados para melhorar o reconhecimento de padrões. Além disso, para o conjunto de dados Miao Batik, as regiões dos motivos culturais são anotadas, permitindo a geração de máscaras utilizadas no módulo de segmentação do modelo proposto, garantindo que os motivos culturais sejam preservados durante a geração. A saída final desta etapa é um conjunto de dados limpo, pronto para o treinamento dos módulos de segmentação e geração do modelo proposto.

figure-protocol-7
Figura 3. Pipeline de Pré-processamento de Dados para Imagens de Patrimônio Cultural. Fluxograma ilustrando os procedimentos de pré-processamento de imagens aplicados antes do treinamento do modelo. O pipeline inclui a aquisição do conjunto de dados, redimensionamento das imagens, normalização, remoção de ruído gaussiano, anotações existentes de motivos culturais e preparação de máscaras de segmentação. As imagens e máscaras resultantes são utilizadas como entradas para segmentação semântica e reconstrução de padrões. Clique aqui para visualizar uma versão maior desta figura.

Todas as imagens foram submetidas a um processo de controle de qualidade antes do treinamento do modelo. O conjunto de dados Miao Batik continha 15.148 imagens. Amostras corrompidas, duplicadas e de baixa qualidade já haviam sido tratadas pelos criadores originais do conjunto de dados; portanto, nenhuma imagem adicional foi excluída durante a triagem de controle de qualidade neste estudo. Consequentemente, todas as 15.148 imagens foram mantidas para análise. As imagens foram carregadas no formato RGB durante o pré-processamento e redimensionadas para 256 × 256 pixels utilizando interpolação bilinear. Os valores dos pixels foram escalonados do intervalo [0, 255] para [0, 1] dividindo-se por 255. Em seguida, foi aplicada normalização por canal utilizando valores médios de [0,485, 0,456, 0,406] e valores de desvio padrão de [0,229, 0,224, 0,225] para os canais vermelho, verde e azul, respectivamente. O pipeline de pré-processamento incluiu o carregamento da imagem, conversão para RGB, redimensionamento, escalonamento dos valores dos pixels, normalização e conversão em tensor. Quando necessário, imagens em escala de cinza foram convertidas para o formato RGB de três canais para manter a compatibilidade com os modelos de aprendizado profundo. Após o pré-processamento, as imagens foram divididas em subconjuntos de treinamento, validação e teste. Todas as etapas do framework SegCycle-SPADE — incluindo segmentação semântica, fusão de características, reconstrução de motivos e síntese artística baseada em SPADE — utilizaram uma resolução de entrada consistente de 256 × 256 pixels.

Segmentação por Padrão Semântico usando SegFormer
Após esta etapa de pré-processamento, as imagens limpas e normalizadas do conjunto de dados de motivos culturais do Tingimento Miao e do conjunto de dados WikiArt são inseridas no módulo de segmentação semântica com base na estrutura proposta do SegFormer-B2. O objetivo desta etapa é identificar e separar corretamente os motivos culturais presentes em padrões do patrimônio. A estrutura proposta do SegFormer baseia-se em uma arquitetura de transformador que incorpora um codificador Transformer hierárquico e um decodificador MLP leve para capturar com precisão informações contextuais globais, bem como informações estruturais detalhadas de padrões complexos do patrimônio. O modelo primeiro extrai representações de características em múltiplas escalas a partir da imagem de entrada, seguido pela fusão dessas representações por meio do decodificador para gerar padrões segmentados precisos. Isso garante que os padrões na imagem do patrimônio sejam corretamente segmentados em motivos como padrões geométricos, padrões florais e padrões simbólicos, separando-os assim do fundo, ao mesmo tempo que mantém sua integridade estrutural. Essas informações estruturais são posteriormente utilizadas nas fases seguintes da geração de padrões dentro da estrutura SegCycle-SPADE.

Seja a imagem de entrada pré-processada representada como Equação 6:

figure-protocol-8    (6)

O codificador SegFormer divide a imagem em fragmentos e extrai características hierárquicas usando camadas de transformador, conforme mostrado na Equação 71:

figure-protocol-9

Aqui, F denota os mapas de características em múltiplas escalas obtidos a partir do codificador de transformador. Essas características codificam tanto padrões locais de textura quanto relações contextuais globais entre as regiões de motivos. O modelo SegFormer extrai mapas de características em diferentes escalas conforme definido na Equação 8:

figure-protocol-10

O uso de representações multiescala facilita a detecção de padrões de diferentes tamanhos dentro de motivos culturais. Por fim, as características são combinadas utilizando o decodificador MLP conforme mostrado na Equação 91:
 figure-protocol-11

Aqui, S denota o mapa final de segmentação previsto.

A base do SegFormer-B2 foi inicializada usando pesos pré-treinados no ImageNet e posteriormente ajustados no conjunto de dados Miao Batik para segmentação de motivos culturais. O ponto de controle pré-treinado foi obtido a partir da implementação oficial do SegFormer. Especificamente, o ponto de controle pré-treinado no ImageNet-1K MIT-B2 (mit_b2.pth) fornecido pelo repositório oficial do Segformer foi utilizado para inicializar a base do SegFormer-B2 antes do ajuste fino. Os pesos pré-treinados correspondem à base MIT-B2 lançada pelos autores do SegFormer e serviram como modelo de inicialização para o treinamento de segmentação semântica. As demais camadas específicas da tarefa foram inicializadas usando os procedimentos padrão do PyTorch para inicialização de pesos antes do treinamento.

Um codificador Transformer hierárquico de quatro estágios com incorporações de fragmentos sobrepostos é utilizado na arquitetura. No estágio inicial, o tamanho do fragmento foi definido como 7 × 7 com um passo de 4. Para cada um dos quatro estágios do codificador, as dimensões de incorporação foram 64, 128, 320 e 512. Ao longo dos quatro estágios, houve 1, 2, 5 e 8 cabeças de autoatenção multihead, e as profundidades correspondentes do codificador foram de 3, 4, 6 e 3 camadas. As características multiescala recuperadas do codificador foram agregadas usando um decodificador leve baseado inteiramente em MLP. Antes de gerar o mapa final de segmentação, o decodificador projetou as características de cada estágio do codificador em um único espaço de incorporação. Todos os blocos Transformer utilizaram a função de ativação Gaussian Error Linear Unit (GELU). Uma taxa de dropout de 0,1 foi utilizada durante o treinamento para melhorar a generalização e reduzir o sobreajuste.

Durante a fase de treinamento, o framework SegFormer recebe as imagens pré-processadas de ambas as bases de dados. As imagens da base de dados Miao Batik contêm regiões de motivos que servem como rótulos para o aprendizado supervisionado do modelo de segmentação. O codificador Transformer processa a imagem inteira e captura relações de longo alcance entre os componentes da imagem, o que é particularmente importante para padrões tradicionais de batique que contêm motivos distribuídos espacialmente. O mecanismo hierárquico de extração de características captura simultaneamente estruturas locais, como texturas geométricas repetidas. O decodificador MLP processa essas características extraídas e produz uma máscara de segmentação que destaca as regiões de motivos. Os mapas de segmentação gerados nesta etapa são subsequentemente utilizados como entradas estruturais para o módulo de atenção e a etapa de reconstrução de padrões, ajudando assim a preservar a autenticidade dos padrões gerados.

Os motivos culturais foram divididos em diferentes classes para segmentação semântica com base em suas características visuais e culturais. A taxonomia de segmentação compreendia motivos animais (por exemplo, borboletas, peixes, aves e outras fauna simbólicas), motivos vegetais (por exemplo, flores, folhas, videiras e padrões botânicos), motivos geométricos (por exemplo, formas repetidas, bordas e estruturas geométricas abstratas) e regiões de fundo que representam áreas sem motivos. Máscaras de segmentação em nível de pixel foram utilizadas para atribuir cada pixel a uma das classes predefinidas. Rótulos inteiros foram codificados da seguinte forma: Rótulo 0 = fundo, Rótulo 1 = motivos animais, Rótulo 2 = motivos vegetais e Rótulo 3 = motivos geométricos. As anotações de segmentação e os rótulos dos motivos foram obtidos diretamente da fonte original do conjunto de dados Miao Batik. Nenhum procedimento adicional de anotação manual, recodificação, verificação de contornos ou confirmação por especialista foi realizado neste estudo. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas sem modificações para treinamento e avaliação.

O modelo SegFormer para segmentação de motivos culturais processa as imagens pré-processadas do conjunto de dados Miao Batik e do conjunto de dados WikiArt utilizando um mecanismo baseado em transformador para detecção precisa de regiões com padrões culturais, conforme mostrado na Figura 4. Primeiramente, a imagem de entrada contendo motivos culturais tradicionais é fornecida ao modelo SegFormer. O codificador Transformer extrai tanto informações contextuais globais quanto características estruturais locais a partir de fragmentos da imagem. As características resultantes em múltiplas escalas são fornecidas ao decodificador de segmentação, que utiliza uma Rede Mix Feed-Forward para refinar as representações de características e aprimorar a detecção de motivos. A saída do modelo SegFormer é uma máscara de segmentação que destaca os pixels correspondentes aos padrões culturais, suprimindo ao mesmo tempo as informações irrelevantes do plano de fundo. Os padrões culturais isolados servem então como orientação estrutural para as etapas subsequentes do framework SegCycle-SPADE.

figure-protocol-12
Figura 4. Segmentação Semântica Baseada no SegFormer-B2 de Motivos Culturais. Arquitetura do módulo de segmentação semântica SegFormer-B2 utilizado para a extração de motivos culturais e treinado exclusivamente no conjunto de dados Miao Batik. O framework consiste em um codificador baseado em Transformer para extração de características em múltiplas escalas e um decodificador de segmentação leve para gerar máscaras de motivos. O modelo prevê quatro classes semânticas—animal, planta, geométrico e fundo—nas quais as máscaras de segmentação resultantes identificam regiões de motivos culturalmente significativos, suprimindo ao mesmo tempo informações irrelevantes de fundo. Essas saídas de segmentação fornecem orientação estrutural para as etapas subsequentes de fusão de características, reconstrução e síntese artística do framework proposto SegCycle-SPADE. Clique aqui para visualizar uma versão maior desta figura.

Não há necessidade de criar novas anotações de segmentação na estrutura sugerida. O conjunto de dados Miao Batik foi obtido de uma fonte pública já existente, e o modelo foi treinado utilizando as informações de motivos fornecidas pelos criadores do conjunto de dados. Durante o processo de aprendizado, o modelo SegFormer produziu mapas de segmentação semântica. Assim, o presente estudo não exigiu nenhum software adicional de anotação manual, diretrizes de anotação ou procedimentos de controle de qualidade de anotação.

CAFFM
Para melhorar a interação entre as características da segmentação semântica e as representações da reconstrução generativa, o estudo também propôs um CAFFM. O codificador SegFormer-B2 fornece mapas de características semânticas ao módulo CAFFM, enquanto a etapa de reconstrução CycleGAN fornece mapas de características generativas. Primeiro, camadas de projeção linear são usadas para projetar ambos os fluxos de características em um espaço comum de incorporação. Para o cálculo da atenção cruzada, representações de consulta (Q), chave (K) e valor (V) são criadas usando os tensores de características gerados. As relações entre as informações de motivos estruturais e os elementos de estilo artístico são então modeladas usando atenção cruzada com múltiplos cabeçotes. A normalização por camada, conexões residuais e camadas de alimentação direta com ativação GELU são então aplicadas às representações de características fundidas. O estágio de síntese baseado em SPADE recebe a saída do módulo CAFFM, permitindo a preservação de temas culturalmente significativos sem comprometer a coerência artística.

Para garantir a compatibilidade de características, as características de entrada são inicialmente projetadas, por meio de camadas de projeção linear, em um espaço de incorporação compartilhado com uma dimensão de incorporação de 256. As interconexões entre as informações estruturais semânticas e as representações estilísticas gerativas são então modeladas utilizando um mecanismo de atenção cruzada MultiHead com oito cabeças de atenção. O cálculo da atenção cruzada utiliza vetores de Consulta (Q), Chave (K) e Valor (V), gerados por camadas específicas de transformação linear. Para aumentar a estabilidade do treinamento e manter a integridade das características, são empregadas conexões residuais e Normalização de Camada para aprimorar ainda mais as representações de características fundidas. A aprendizagem não linear de características é então aprimorada pela aplicação de uma rede feed-forward com a função de ativação Unidade Linear de Erro Gaussiana (GELU). Uma representação de característica de saída com dimensão 256 é gerada pelo módulo e enviada a outras etapas para síntese criativa. O CAFFM combina com sucesso dados de estilo artístico com estruturas de motivos culturais utilizando uma técnica de fusão baseada em atenção cruzada, o que melhora a preservação dos motivos e a coerência visual nos padrões de patrimônio cultural reconstruídos.

No sistema proposto, as características estruturais são derivadas do conjunto de dados Miao Batik, enquanto as características estilísticas são aprendidas a partir do conjunto de dados WikiArt. Seja o mapa de características derivado da rede de segmentação SegFormer utilizando imagens do conjunto de dados Miao Batik denotado por Fs, enquanto o mapa de características derivado do ramo de extração de características estilísticas utilizando imagens WikiArt é denotado por Fa. O CAFFM proposto combina os dois domínios de características usando um mecanismo de atenção cruzada para aprender tanto as dependências estruturais quanto estilísticas dos padrões culturais. Tabela 3 apresenta todas as características arquitetônicas, incluindo dimensões de incorporação, camadas de normalização, funções de ativação e configuração de cabeças de atenção. Para um tamanho de imagem de entrada de 256 × 256 pixels, o codificador SegFormer-B2 produziu mapas de características semânticas de tamanho 64 × 64 × 128, enquanto o ramo de extração de características estilísticas produziu mapas de características de tamanho 64 × 64 × 128. Ambos os mapas de características foram projetados por meio de camadas lineares treináveis em um espaço de incorporação compartilhado de dimensão 256 antes da fusão por atenção cruzada.

ParâmetroConfiguração
Framework PropostoSegCycle-SPADE
Modelo de Segmentação SemânticaSegFormer-B2
Etapas do Codificador SegFormer4
Inicialização de PesosSegFormer-B2 pré-treinado no ImageNet-1K (Backbone MIT-B2)
Fonte do CheckpointRepositório Oficial NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); checkpoint: segformer.b2.512x512.ade.160k
Estratégia de Ajuste FinoAjuste fino completo no conjunto de dados Miao Batik
Tamanho do Patch Embedding7 × 7
Stride do Patch4
Dimensões de Embedding64, 128, 320 e 512
Profundidades do Codificador3, 4, 6 e 3
Cabeças de Atenção1, 2, 5 e 8
Tipo de DecodificadorDecodificador All-MLP
Função de AtivaçãoGELU
Taxa de Dropout0,1
Módulo de Aprimoramento de CaracterísticasMódulo de Fusão de Características Culturais com Atenção Cruzada (CAFFM)
Dimensão de Embedding do CAFFM256
Cabeças de Atenção do CAFFM8
Escala de Fusão do CAFFM4
Modelo de ReconstruçãoCycleGAN
Modelo de Geração de EstiloSPADE
Conjunto de Dados CulturalConjunto de Dados Miao Batik
Conjunto de Dados de EstiloConjunto de Dados WikiArt
Imagens Miao Batik15.148
Imagens WikiArtAproximadamente 80.000
Resolução da Imagem de Entrada256 × 256 pixels
Formato de CorRGB
Método de InterpolaçãoInterpolação Bilinear
Método de Remoção de RuídoFiltragem Gaussiana
Tamanho do Kernel Gaussiano5 × 5
Sigma Gaussiana (σ)1
Intervalo de Normalização[0, 1]
Tamanho do Lote16
Número de Épocas100
OtimizadorAdam
Taxa de Aprendizado0,0002
Parâmetros do Adamβ₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, decaimento de peso = 0
Funções de PerdaPerda de Segmentação, Perda Adversária, Perda de Consistência Cíclica, Perda de Reconstrução, Perda de Preservação de Motivo e Perda de Consistência de Estilo
Estratégia de Divisão do Conjunto de DadosTreinamento / Validação / Teste
Conjunto de Treinamento70%
Conjunto de Validação15%
Conjunto de Teste15%
Semente Aleatória42
Métricas de AvaliaçãoPrecisão de Segmentação, IoU, Coeficiente Dice, SSIM, PSNR e FID
Linguagem de ProgramaçãoPython 3.8.10
Framework de Aprendizado ProfundoPyTorch 1.10.0
Plataforma de HardwareGPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11ª Geração), 32 GB de RAM
Ambiente OperacionalUbuntu 20.04 LTS

Tabela 3: Configuração Experimental e Configuração do Modelo. Resumo dos componentes arquiteturais, configurações de treinamento, ajustes de pré-processamento, conjuntos de dados, parâmetros de otimização, métricas de avaliação e ambiente computacional utilizados para a implementação e avaliação do framework proposto SegCycle-SPADE.

O módulo de atenção mapeia inicialmente o mapa de características em representações de consulta, chave e valor usando a Equação 10:

figure-protocol-13

Aqui, Wq, Wk e Wv são matrizes de pesos ajustáveis. Os pesos de atenção são calculados com base na similaridade entre o vetor de consulta e o vetor-chave utilizando a Equação 1117

figure-protocol-14

Aqui, dk é a dimensão do vetor chave. A representação de características aprimorada é calculada multiplicando os pesos de atenção com a matriz de valores usando a Equação 12:

figure-protocol-15

Aqui, Fa é a representação aprimorada da característica do mapa de características. A representação aprimorada da característica é calculada combinando as características originais de segmentação com as características aprimoradas obtidas usando o mecanismo de atenção por meio da Equação 13:

figure-protocol-16                                

Aqui, Fe é o mapa de características aprimorado utilizado para a reconstrução do padrão. O CAFFM é estendido com um mecanismo de atenção cruzada em múltiplas escalas para extrair características de motivos culturais em diferentes escalas. Seja Fsi representando as características de segmentação na escala i, enquanto Faj representa as características de estilo artístico na mesma escala. A representação final da característica é definida usando a Equação 14:

  figure-protocol-17

Aqui, Qi, Ki e Vi representam, respectivamente, as matrizes de consulta, chave e valor na escala i, e N denota o número de escalas de características. Neste estudo, N = 4, correspondendo aos mapas de características extraídos em resoluções espaciais de 1/4, 1/8, 1/16 e 1/32 do tamanho da imagem de entrada. Essas representações de características em múltiplas escalas foram fundidas utilizando pesos de atenção aprendíveis antes da reconstrução e da síntese artística. A extensão acima permite que o método extraia motivos e texturas culturais globais para reconstruir padrões culturais. O CAFFM situa-se entre a etapa de segmentação baseada no SegFormer e a etapa de síntese criativa baseada no SPADE no sistema proposto SegCycle-SPADE. Primeiramente, enquanto o CycleGAN cria simultaneamente características de reconstrução com informações estilísticas e relacionadas a padrões, o SegFormer-B2 recupera mapas de características semânticas que descrevem as propriedades estruturais dos motivos culturais. O módulo CAFFM recebe esses dois fluxos de características e utiliza fusão baseada em atenção cruzada para identificar relações entre as representações estruturais e artísticas. A fim de criar padrões culturalmente autênticos mantendo a consistência semântica e as características estruturais, os mapas de características fundidos resultantes são então enviados ao módulo SPADE para síntese criativa orientada por segmentação.

Reconstrução de Padrão usando CycleGAN
Uma vez concluída a etapa de realce de características baseada na atenção, os mapas de características conterão as estruturas de motivos culturais aprimoradas. No entanto, os mapas de características ainda podem conter regiões de padrão incompletas ou danificadas. Portanto, para resolver o problema da reconstrução dos padrões, a estrutura proposta utilizará o modelo CycleGAN. Na estrutura proposta, os dois domínios serão os padrões originais de motivos culturais e os padrões reconstruídos de motivos culturais. Utilizando as características aprimoradas das etapas anteriores, o modelo CycleGAN reconstruirá os padrões culturais mantendo a consistência estrutural. Isso garantirá que padrões culturais, como padrões geométricos, florais e simbólicos, mantenham sua disposição espacial. As imagens originais de Batik Miao foram submetidas a operações de mascaramento aleatório e oclusão parcial para gerar motivos culturais incompletos ou danificados. Esses procedimentos de degradação simularam regiões de padrão ausentes e danos estruturais comumente observados em artefatos de patrimônio cultural deteriorados. As imagens degradadas foram usadas como entradas para o módulo de reconstrução, enquanto as imagens originais correspondentes serviram como imagens de referência para avaliação de desempenho e análise da qualidade da reconstrução. Essa estratégia permitiu que o modelo aprendesse a restaurar estruturas de motivos ausentes, preservando ao mesmo tempo a consistência semântica e as características culturais.

Seja X o domínio dos padrões culturais incompletos e Y o domínio dos padrões culturais reconstruídos. Os dois geradores aprendem a realizar a mapeamento bidirecional usando a Equação 15:

 figure-protocol-18

Aqui, GE é usado para reconstruir estruturas de motivos e FM é usado para mapear os padrões de volta ao domínio original. A perda adversarial é utilizada para garantir que os padrões reconstruídos sejam realistas (Equação 16)30

figure-protocol-19

Aqui, DY é o discriminador usado para distinguir padrões reais e reconstruídos, e GE(x) denota o padrão reconstruído gerado. O CycleGAN também impõe a consistência cíclica para preservar a disposição estrutural dos motivos culturais (Equação 17)30.

figure-protocol-20

A função de perda final é definida utilizando a Equação 1830:

figure-protocol-21

Aqui, λi denota o coeficiente de ponderação para a perda de consistência cíclica e foi definido como 10 durante o treinamento, em conformidade com a formulação original do CycleGAN. Esse valor foi escolhido para equilibrar a aprendizagem adversarial e a consistência de reconstrução entre os domínios de origem e destino.

O módulo de reconstrução CycleGAN consiste em dois geradores e dois discriminadores para tradução bidirecional de imagens. Cada gerador segue uma arquitetura de rede residual composta por uma camada convolucional inicial 7 × 7, seguida por duas camadas convolucionais de redução de resolução, nove blocos residuais e duas camadas de aumento de resolução. Todas as operações convolucionais utilizam um tamanho de kernel de 3 × 3, exceto a camada de entrada, que emprega um kernel 7 × 7 para extração aprimorada de características. A normalização por instância é aplicada após cada camada convolucional para melhorar a estabilidade do treinamento, enquanto a ativação ReLU é usada em toda a rede do gerador. A camada de saída utiliza uma função de ativação Tanh para gerar saídas de imagem normalizadas. O discriminador segue uma arquitetura PatchGAN 70 × 70, composta por uma série de camadas convolucionais com tamanhos de kernel de 4 × 4 e canais de características progressivamente crescentes. A normalização por instância e a ativação LeakyReLU (inclinação negativa = 0,2) são empregadas no discriminador para melhorar a discriminação de características e a aprendizagem adversarial. O módulo CycleGAN recebe como entrada imagens pré-processadas de motivos culturais e gera representações de padrões reconstruídos, que posteriormente são encaminhadas ao CAFFM para integração com características de segmentação. O treinamento do CycleGAN foi realizado utilizando o otimizador Adam (β₁ = 0,5, β₂ = 0,999) com uma taxa de aprendizado inicial de 0,0002. A taxa de aprendizado foi mantida constante durante as primeiras 100 épocas e posteriormente reduzida linearmente até zero ao longo do período restante de treinamento. Um buffer de replay contendo 50 imagens previamente geradas foi utilizado para estabilizar o treinamento do discriminador. Os geradores e discriminadores foram atualizados utilizando uma razão de atualização 1:1, com uma atualização do gerador seguida por uma atualização do discriminador em cada iteração de treinamento.

O processo de reconstrução do CycleGAN baseia-se nos mapas de características aprimorados obtidos utilizando o mecanismo CAFFM apresentado na Figura 5. Os mapas de características contêm motivos culturais aprimorados provenientes das etapas anteriores de segmentação e do CAFFM. Esses mapas são utilizados como entrada para o primeiro gerador GE. O primeiro gerador GE aprende o mapeamento necessário para reconstruir padrões culturais. As saídas são então encaminhadas ao discriminador DY para distinguir entre padrões culturais reais e padrões reconstruídos. O discriminador DY auxilia o gerador GE a produzir saídas realistas. Para garantir que os padrões culturais não sejam distorcidos durante a reconstrução, o segundo gerador FM realiza um mapeamento com consistência cíclica. O segundo gerador FM mapeia as saídas de volta ao domínio original. As saídas são então avaliadas pelo discriminador para assegurar realismo. As saídas finais são subsequentemente encaminhadas ao módulo SPADE para geração de estilo artístico na próxima etapa do framework proposto SegCycle-SPADE.

figure-protocol-22
Figura 5. Fluxo de Trabalho da Reconstrução de Padrões Baseado no CycleGAN. Fluxo de trabalho do módulo de reconstrução CycleGAN. Representações de características com realce de atenção são fornecidas como entradas para a rede geradora, a fim de reconstruir motivos culturais incompletos. O discriminador avalia as saídas reconstruídas em comparação com padrões de referência, enquanto o mapeamento de consistência cíclica preserva a integridade estrutural durante a tradução bidirecional de imagens. Os motivos reconstruídos são posteriormente encaminhados ao módulo SPADE para síntese de estilo artístico. Clique aqui para visualizar uma versão maior desta figura.

Geração de Estilo Artístico usando SPADE
Posteriormente, os motivos culturais reconstruídos são submetidos ao módulo SPADE para a geração de estilo artístico. O objetivo principal do módulo SPADE é adicionar texturas visualmente mais ricas de estilo artístico aos motivos culturais reconstruídos, sem comprometer o layout estrutural dos motivos. O SPADE é uma técnica de geração condicional de imagens que utiliza o conceito de segmentação de imagens para a geração de imagens. Mapas semânticos multicanais correspondentes às classes predeterminadas de motivos foram codificados a partir das máscaras de segmentação semântica produzidas pelo SegFormer-B2. O gerador SPADE recebeu esses mapas codificados como entradas condicionantes. Os parâmetros de escalamento espacialmente adaptativo (γ) e de bias (β) foram gerados processando os mapas semânticos por meio de camadas convolucionais dentro de cada camada SPADE. Assim, o gerador pôde manter os limites dos motivos, os layouts estruturais e as informações semânticas durante a síntese artística, aplicando esses parâmetros às ativações de características normalizadas. A orientação semântica conseguiu influenciar tanto a reconstrução estrutural de alto nível quanto a síntese de textura de baixo nível, já que o processo condicionante foi realizado em várias camadas do gerador SPADE. Como resultado, os padrões artísticos gerados incorporaram características estilísticas obtidas do conjunto de dados WikiArt, mantendo ao mesmo tempo as estruturas dos motivos culturais identificadas durante a etapa de segmentação.

O conjunto de dados WikiArt, que inclui obras de 27 categorias artísticas diferentes—como Renascença, Impressionismo, Cubismo, Expressionismo, Surrealismo, Realismo e Arte Abstrata—foi utilizado como recurso principal para compreender estilos artísticos. A fim de expor o modelo a uma variedade de traços criativos e aprimorar a generalização de estilo, imagens de estilo foram selecionadas aleatoriamente das diversas categorias durante o treinamento. O conjunto de dados foi dividido em subconjuntos de treinamento, validação e teste com representação equilibrada das categorias artísticas para reduzir o viés de estilo. Para garantir representação equilibrada de todas as 27 categorias artísticas, foi utilizada amostragem estratificada. As amostras de cada categoria foram alocadas proporcionalmente aos subconjuntos de treinamento, validação e teste, preservando a distribuição original das classes. O módulo CAFFM foi usado para mesclar os aspectos de estilo derivados das imagens WikiArt com as características de reconstrução produzidas pelo CycleGAN. Para permitir que a rede de síntese transfira qualidades artísticas mantendo as estruturas semânticas e os limites de motivos culturais derivados dos mapas de segmentação, as representações fusionadas resultantes foram fornecidas como informação de condicionamento ao gerador SPADE. A estrutura proposta foi capaz de produzir padrões artísticos culturalmente autênticos com representações estruturais e estilísticas consistentes graças a essa técnica de condicionamento de estilo.

O SPADE também introduz parâmetros adaptativos espacialmente que dependem do mapa de segmentação. Os parâmetros podem ser definidos conforme mostrado na Equação 191:

figure-protocol-23

Aqui, γ(S) é o parâmetro de escala com variação espacial e β(S) é o parâmetro de viés com variação espacial. Os parâmetros podem ajudar o gerador a criar diferentes texturas e estilos dependendo da região semântica nas imagens. A obra de arte cultural final pode ser definida conforme mostrado na Equação 20:

 figure-protocol-24

Aqui, GE é o gerador SPADE, XrP é o padrão reconstruído e SM é o mapa de segmentação. A obra final mantém a integridade estrutural dos motivos culturais enquanto aprimora a aparência artística. Uma função de perda composta que equilibra a precisão da segmentação semântica, a preservação de motivos culturais, a qualidade da reconstrução de padrões e a consistência do estilo artístico foi utilizada para otimizar a arquitetura proposta SegCycle-SPADE. Uma mistura ponderada da perda de segmentação (Lseg), perda adversarial (Ladv), perda de consistência cíclica (Lcycle), perda de reconstrução (Lrecon), perda de preservação de motivo (Lmotif) e perda de consistência de estilo (Lstyle) foi utilizada para estabelecer o objetivo geral de treinamento. A função de perda total é definida na Equação 21:

figure-protocol-25  (21)

Para garantir a consistência estrutural entre os motivos culturais de entrada e os reconstruídos, o coeficiente da perda de consistência cíclica foi definido como 10. Para manter características finas dos motivos e aprimorar a precisão visual, o coeficiente da perda de reconstrução foi ajustado para 5. Para destacar a preservação de padrões estruturais culturalmente essenciais durante a síntese artística, utilizou-se um coeficiente de 2 para a perda de preservação de motivos. A fim de promover a transferência de estilo artístico sem distorcer excessivamente as estruturas semânticas dos motivos, o coeficiente da perda de consistência de estilo foi ajustado para 1. Para manter uma contribuição equilibrada entre a geração realista de imagens e a segmentação precisa dos motivos, pesos iguais foram atribuídos às perdas de segmentação e adversariais. As representações de estilo baseadas em características do conjunto de dados WikiArt foram utilizadas para calcular a perda de consistência de estilo. Em particular, características de estilo artístico foram capturadas por meio de correlações de matrizes de Gram extraídas de mapas de características profundas. A diferença da norma de Frobenius entre as matrizes de Gram da imagem de estilo de destino e da imagem gerada foi utilizada para calcular a perda de estilo, conforme mostrado na Equação 22:

figure-protocol-26

Aqui, Gl é a matriz de Gram calculada a partir da lª camada de características, Igen denota a imagem artística gerada, Istyle denota a imagem de estilo alvo do conjunto de dados WikiArt e F denota a norma de Frobenius. Essa formulação permite que o framework proposto preserve as características artísticas, ao mesmo tempo que mantém a integridade estrutural e semântica dos motivos culturais.

As representações de características fundidas produzidas pelo módulo CAFFM são utilizadas como entradas condicionantes para o módulo SPADE, que atua como o componente de síntese artística da estrutura proposta. O gerador SPADE é composto por sete blocos residuais SPADE com uma dimensão de características latentes de 256 canais e gera imagens de saída com resolução de 256 × 256 pixels. Os mapas de segmentação semântica obtidos a partir do módulo SegFormer–CAFFM são utilizados como entradas condicionantes ao longo de todas as camadas residuais SPADE. As camadas SPADE são aplicadas antes das funções de ativação dentro de cada bloco residual, permitindo um condicionamento semântico guiado pela segmentação. Por meio de operações sucessivas de interpolação e convolucionais, a representação de características latentes é refinada progressivamente para gerar padrões artísticos de alta resolução, preservando ao mesmo tempo a consistência semântica e a estrutura dos motivos. São utilizadas funções de ativação LeakyReLU em todo o gerador, e uma função de ativação Tanh é aplicada na camada de saída para produzir imagens normalizadas.

Algoritmo e Fluxo de Trabalho
O framework SegCycle-SPADE integra segmentação semântica, fusão de características, reconstrução de padrões e síntese de estilo artístico em um único pipeline de treinamento. O fluxo de trabalho inicia com a aquisição e pré-processamento do conjunto de dados, incluindo redimensionamento de imagens, normalização, remoção de ruídos e preparação das máscaras de segmentação. As imagens pré-processadas são posteriormente processadas usando a rede de segmentação SegFormer-B2 para extrair representações semânticas de motivos. As características de segmentação resultantes são fundidas com características de reconstrução por meio do CAFFM, permitindo a interação entre informações estruturais dos motivos e representações de características artísticas. Os mapas de características fundidos são então fornecidos ao módulo de reconstrução CycleGAN, que restaura estruturas de motivos culturais incompletas, preservando a consistência semântica. Os padrões reconstruídos são subsequentemente enviados ao gerador SPADE para síntese artística orientada por segmentação, permitindo aprimoramento estilístico enquanto mantém os limites dos motivos e a autenticidade estrutural. Durante o treinamento, os parâmetros do modelo são otimizados usando a função de perda composta descrita nas Equações 21 e 22, que equilibra a precisão da segmentação, a preservação de motivos, a qualidade de reconstrução e a consistência do estilo artístico. Um fluxo de implementação detalhado, passo a passo, incluindo carregamento do conjunto de dados, pré-processamento, inicialização do modelo, iterações de treinamento, procedimentos de validação, seleção de pontos de controle e avaliação final, é fornecido no Arquivo Suplementar 1 (Algoritmo 1). O fluxo de trabalho algorítmico completo foi implementado com um tamanho de lote de 16, taxa de aprendizado de 0,0002 e 100 épocas de treinamento. Uma semente aleatória fixa de 42 foi utilizada para partição do conjunto de dados, inicialização do modelo e todos os experimentos de treinamento. A semente foi aplicada de forma consistente nos geradores de números aleatórios do Python, NumPy e PyTorch para garantir reprodutibilidade. O otimizador Adam foi configurado com β₁ = 0,5, β₂ = 0,999 e sem decaimento de peso (weight decay = 0). Os pontos de controle do modelo foram selecionados com base na maior pontuação de IoU de validação alcançada no conjunto de dados de validação.

Otimização da Função de Perda
Para preservar as estruturas de motivos culturais durante a reconstrução e a síntese artística, o framework proposto emprega um objetivo de otimização composto que combina perdas de segmentação, adversarial, consistência cíclica, reconstrução, preservação de motivos e consistência de estilo. A formulação matemática completa, os coeficientes de ponderação e a definição da perda de estilo são fornecidos nas Equações 21 e 22 na subseção Geracao de Estilo Artístico usando SPADE. O componente de preservação de motivos penaliza desvios estruturais entre as regiões de motivos previstos e as máscaras de segmentação correspondentes do padrão-ouro, incentivando assim a preservação de estruturas de padrões culturalmente significativas ao longo do processo de reconstrução.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A estrutura proposta SegCycle-SPADE foi avaliada utilizando dois conjuntos de dados: o conjunto de dados de motivos culturais Miao Batik e o conjunto de dados WikiArt. O conjunto de dados Miao Batik contém imagens de patrimônio cultural tradicional e foi utilizado principalmente para tarefas de segmentação semântica e reconstrução estrutural, enquanto o conjunto de dados WikiArt contém estilos artísticos diversos e foi usado para aprendizado e geração de estilos artísticos. As imagens de ambos os conjuntos de dados foram processadas por meio do pipeline completo do SegCycle-SPADE, incluindo segmentação semântica, CAFFM, reconstrução de padrões e geração de estilo artístico baseada em SPADE. A integração das informações de motivos culturais e representações de estilo artístico permitiu que a estrutura gerasse saídas culturalmente significativas e visualmente coerentes.

Todos os experimentos foram realizados em uma estação de trabalho com GPU, equipada com um processador Intel Core i7 e uma GPU NVIDIA. Especificamente, os experimentos foram realizados em uma estação de trabalho equipada com uma CPU Intel Core i7 (11ª Geração), uma GPU NVIDIA RTX 3090 com 24 GB de VRAM e 32 GB de memória do sistema. Os modelos foram implementados usando Python 3.8 e PyTorch 1.10 com aceleração CUDA. O treinamento foi realizado usando uma configuração com uma única GPU, sem treinamento distribuído. Foi utilizada precisão padrão FP32 em todos os experimentos, e o treinamento com precisão mista não foi empregado. O otimizador Adam foi usado com um tamanho de lote de 16 durante 100 épocas de treinamento. Tabela 3 resume os parâmetros de implementação e o ambiente computacional utilizados neste estudo.

A arquitetura proposta consiste em quatro componentes principais: SegFormer-B2 para segmentação semântica, CAFFM para fusão de características, CycleGAN para reconstrução de motivos e SPADE para síntese de estilo artístico. As imagens de ambos os conjuntos de dados foram redimensionadas para 256 × 256 pixels antes do treinamento. Essa resolução padronizada garantiu eficiência computacional, preservando ao mesmo tempo detalhes importantes dos motivos e contribuindo para um treinamento adversarial estável dos módulos CycleGAN e SPADE.

O desempenho do framework proposto foi avaliado utilizando métricas de segmentação e avaliação da qualidade da imagem, incluindo Acurácia de Segmentação, IoU, Coeficiente de Similaridade Dice (Dice), SSIM, PSNR e FID. A autenticidade visual foi avaliada qualitativamente por meio da inspeção visual dos padrões culturais gerados. A avaliação qualitativa concentrou-se na preservação de motivos, consistência semântica, características culturais e aparência artística em relação aos motivos culturais de referência. A autenticidade visual não foi utilizada como métrica quantitativa independente de avaliação.

A avaliação quantitativa do framework proposto foi realizada utilizando as seguintes métricas.

A precisão da segmentação foi calculada utilizando a Equação 23:

figure-results-1

Aqui, TP, TN, FP e FN denotam verdadeiros positivos, verdadeiros negativos, falsos positivos e falsos negativos, respectivamente.

A IoU foi calculada utilizando a Equação 24:

 figure-results-2

O Coeficiente de Similaridade de Dice (Dice) foi calculado utilizando a Equação 25:

figure-results-3

O SSIM foi utilizado para avaliar a similaridade perceptual entre imagens e é definido usando a Equação 2633:

figure-results-4  (26)

Aqui, μ denota a intensidade média, σ denota a variância, σxy denota a covariância entre as imagens, e C1 e C2 são constantes de estabilização.

O PSNR é uma métrica comumente usada para avaliar a qualidade de imagens geradas e é definido na Equação 2733:

figure-results-5

Aqui, MaxI denota o valor máximo possível de pixel da imagem e MSE é o erro médio quadrático entre a imagem original e a imagem reconstruída.

A FID pode ser calculada usando médias e matrizes de covariância conforme na Equação 2833:

figure-results-6   (28)

Aqui, μr é o valor médio da imagem real, μg é o valor médio da imagem gerada, e Σr e Σg são as matrizes de covariância das imagens reais e geradas, respectivamente.

Para comparação de desempenho, o framework proposto foi avaliado em relação a métodos representativos comumente utilizados para segmentação semântica, reconstrução de imagens e geração artística de imagens. U-Net e DeepLabV3+ foram incluídos como métodos básicos de segmentação, enquanto Pix2Pix e CycleGAN foram incluídos como métodos básicos de reconstrução. StyleGAN e AttentionGAN foram utilizados como métodos representativos de geração artística de imagens. Essas comparações foram realizadas para avaliar a eficácia do SegCycle-SPADE em preservar informações de motivos estruturais enquanto simultaneamente aprimora a qualidade artística.

Cada experimento foi repetido cinco vezes para avaliar a estabilidade e a reprodutibilidade do desempenho. Uma semente aleatória fixa de 42 foi utilizada para a partição do conjunto de dados, garantindo subconjuntos consistentes de treinamento, validação e teste em todos os experimentos. Os resultados são apresentados como média ± desvio padrão. Os baixos valores de desvio padrão observados nas métricas de Acurácia, IoU, Dice, SSIM, PSNR e FID indicam que o framework proposto alcançou desempenho estável ao longo das execuções experimentais repetidas. A significância estatística foi avaliada por meio de testes t pareados, e as diferenças foram consideradas estatisticamente significativas quando p < 0,05. Como todos os modelos foram avaliados nas mesmas partições do conjunto de dados, foram obtidas medições de desempenho pareadas ao longo das execuções repetidas, o que justifica o uso de testes t pareados. Para controlar a taxa de erro global associada a múltiplas comparações aos pares, foi aplicada a correção de Bonferroni, e a significância estatística foi determinada utilizando um limiar ajustado de α/n, em que n denota o número de comparações aos pares.

Os resultados experimentais apoiam fortemente a eficácia do framework proposto SegCycle-SPADE. O desempenho superior de segmentação alcançado pelo SegFormer-B2 demonstra sua capacidade de identificar e preservar com precisão as bordas dos motivos culturalmente significativos. Melhorias nos índices IoU e Dice indicam ainda a preservação eficaz das estruturas semânticas dos motivos ao longo do pipeline de processamento. A integração do CycleGAN e do SPADE reconstruiu com sucesso estruturas de motivos incompletas, mantendo detalhes visuais finos, conforme refletido pelos valores melhorados de SSIM e PSNR. Além disso, pontuações FID mais baixas indicam que os padrões artísticos gerados exibem maior semelhança com imagens autênticas de cultura e arte, sugerindo maior coerência estilística e realismo visual.

O CAFFM contribuiu significativamente para essas melhorias ao facilitar uma interação eficaz entre as informações estruturais derivadas da segmentação e as representações estilísticas gerativas. Por meio da fusão de características baseada em atenção cruzada, o CAFFM aprimorou tanto a fidelidade estrutural quanto a autenticidade artística, preservando ao mesmo tempo as relações de longo alcance entre os motivos culturais.

Figura 6 apresenta a comparação da precisão de segmentação entre o framework proposto SegCycle-SPADE e métodos existentes nos conjuntos de dados Miao Batik e WikiArt. Abordagens tradicionais de segmentação, como U-Net e DeepLabV3+, alcançaram desempenho competitivo devido à sua capacidade de aprender representações espaciais. No entanto, Pix2Pix e CycleGAN demonstraram menor precisão de segmentação, pois não foram especificamente projetados para tarefas de segmentação. O framework proposto SegCycle-SPADE alcançou a maior precisão de segmentação em ambos os conjuntos de dados, graças à integração do SegFormer-B2 e do realce de características baseado em CAFFM.

figure-results-7
Figura 6. Comparação da Precisão de Segmentação entre Diferentes Métodos. Comparação da precisão de segmentação obtida utilizando U-Net, DeepLabV3+, Pix2Pix, CycleGAN e o framework proposto SegCycle-SPADE nos conjuntos de dados Miao Batik e WikiArt. Os resultados são apresentados como média ± desvio padrão (DP) de cinco execuções independentes (n = 5). As barras de erro representam um desvio padrão. Valores mais altos indicam melhor desempenho de segmentação. O framework proposto SegCycle-SPADE alcançou a maior precisão de segmentação em ambos os conjuntos de dados. Clique aqui para visualizar uma versão ampliada desta figura.

Figura 7 apresenta a comparação da IoU entre os métodos avaliados. A U-Net e a DeepLabV3+ alcançaram um desempenho robusto de sobreposição devido às suas arquiteturas voltadas para segmentação. Em contraste, a Pix2Pix e a CycleGAN produziram valores de IoU mais baixos porque seu objetivo principal é a tradução de imagens, e não a segmentação semântica. O framework proposto SegCycle-SPADE alcançou os valores mais altos de IoU em ambos os conjuntos de dados, indicando melhor localização e preservação das regiões dos motivos culturais.

figure-results-8
Figura 7. Comparação dos Escores de Interseção sobre União (IoU) para Segmentação de Motivos Culturais. Comparação do desempenho em IoU entre métodos de segmentação nos conjuntos de dados Miao Batik e WikiArt. Os resultados são apresentados como média ± desvio padrão (DP) de cinco execuções independentes (n = 5). As barras de erro indicam um desvio padrão. Valores mais altos de IoU indicam maior sobreposição entre as regiões de motivos preditos e de referência, e melhor preservação dos limites dos motivos. O framework proposto SegCycle-SPADE obteve os escores de IoU mais altos em ambos os conjuntos de dados. Clique aqui para visualizar uma versão maior desta figura.

Figura 8 apresenta a comparação do Coeficiente de Similaridade Dice. O índice Dice mede a sobreposição entre máscaras de segmentação previstas e regiões reais dos motivos. Abordagens convencionais de segmentação alcançaram escores Dice relativamente altos devido à sua eficácia em aprender estruturas espaciais. No entanto, o framework proposto SegCycle-SPADE obteve os maiores escores Dice em ambos os conjuntos de dados, demonstrando maior consistência na segmentação e preservação dos motivos.

figure-results-9
Figura 8. Comparação do Coeficiente de Dice para Segmentação de Motivos Culturais. Comparação dos valores do coeficiente de Dice obtidos utilizando diferentes abordagens de segmentação nos conjuntos de dados Miao Batik e WikiArt. O coeficiente de Dice avalia a sobreposição entre máscaras de segmentação previstas e máscaras de referência, sendo que valores mais altos indicam melhor desempenho na segmentação e na identificação de regiões de motivos. O framework proposto SegCycle-SPADE alcançou os valores mais altos do coeficiente de Dice em ambos os conjuntos de dados. Clique aqui para visualizar uma versão maior desta figura.

Figura 9 apresenta a comparação SSIM entre os padrões culturais reconstruídos. Métodos baseados em GAN, como Pix2Pix, CycleGAN e StyleGAN, alcançaram valores SSIM mais altos do que os métodos tradicionais de segmentação, pois foram projetados para geração de imagens. No entanto, o framework proposto SegCycle-SPADE obteve os valores SSIM mais elevados em ambos os conjuntos de dados, indicando uma preservação superior dos detalhes estruturais e da coerência artística.figure-results-10

Figura 9. Comparação do Índice de Similaridade Estrutural (SSIM). Comparação dos valores do Índice de Similaridade Estrutural (SSIM) obtidos utilizando diferentes métodos de reconstrução nos conjuntos de dados Miao Batik e WikiArt. Os resultados são apresentados como média ± desvio padrão (DP) de cinco execuções independentes (n = 5). As barras de erro indicam um desvio padrão. Valores mais altos de SSIM indicam maior similaridade estrutural entre os padrões reconstruídos e os padrões de referência. O framework proposto SegCycle-SPADE obteve as pontuações mais altas de SSIM em ambos os conjuntos de dados. Clique aqui para visualizar uma versão maior desta figura.

A FID foi utilizada para avaliar o realismo e a similaridade distribucional dos padrões artísticos gerados. O cálculo da FID foi realizado utilizando uma rede Inception-v3 pré-treinada, com vetores de características extraídos da camada pool3, resultando em representações de características com 2048 dimensões. Antes da extração das características, as imagens geradas e de referência foram redimensionadas para 299 × 299 pixels utilizando interpolação bilinear e normalizadas de acordo com o protocolo padrão de pré-processamento do Inception-v3. A FID foi calculada utilizando distribuições de características extraídas do conjunto de dados de teste independente. As estatísticas de média e covariância foram estimadas a partir dos embeddings de características e utilizadas na formulação padrão da FID.

Como mostrado na Tabela 4, abordagens convencionais de geração de imagens, como Pix2Pix e CycleGAN, produziram pontuações FID relativamente altas porque careciam de orientação estrutural explícita. O StyleGAN e o AttentionGAN alcançaram pontuações FID mais baixas por meio de capacidades aprimoradas de aprendizado de características. No entanto, o framework proposto SegCycle-SPADE obteve as menores pontuações FID em ambos os conjuntos de dados, demonstrando realismo superior das imagens, consistência estilística e preservação de motivos culturais.

MétodoConjunto de Dados Miao Batik (FID)Conjunto de Dados WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (Proposto)28.531.2

Tabela 4: Resultados da Distância de Inception de Fréchet (FID) para a Reconstrução de Padrões Culturais. Comparação dos escores de Distância de Inception de Fréchet (FID) obtidos pelo framework proposto SegCycle-SPADE e modelos gerativos de referência nos conjuntos de dados Miao Batik e WikiArt. Valores menores de FID indicam maior similaridade entre as distribuições de características de imagens geradas e reais, refletindo, portanto, um realismo visual aprimorado dos padrões culturais reconstruídos.

Figura 10 compara a qualidade de reconstrução alcançada por diferentes métodos. A Qualidade de Reconstrução (%) foi calculada convertendo o SSIM entre a imagem reconstruída e a imagem de referência correspondente em uma escala percentual (SSIM × 100). Percentuais mais altos indicam maior fidelidade estrutural e similaridade visual em relação ao motivo cultural original. Modelos gerativos convencionais, como Pix2Pix e CycleGAN, alcançaram desempenho moderado de reconstrução. Arquiteturas mais avançadas, incluindo StyleGAN e AttentionGAN, alcançaram qualidade de reconstrução aprimorada devido às suas capacidades aprimoradas de aprendizado de características. No entanto, o framework proposto SegCycle-SPADE alcançou a mais alta qualidade de reconstrução graças à sua integração de orientação por segmentação semântica, fusão de características com atenção cruzada, aprendizado de reconstrução e síntese artística.

figure-results-11
Figura 10. Comparação da Qualidade de Reconstrução de Padrão. Comparação da qualidade de reconstrução obtida usando Pix2Pix, CycleGAN, StyleGAN, AttentionGAN e o framework proposto SegCycle-SPADE nos conjuntos de dados Miao Batik e WikiArt. Os resultados são apresentados como média ± desvio padrão (DP) de cinco execuções independentes (n = 5). As barras de erro indicam um desvio padrão. Valores mais altos indicam melhor preservação de detalhes estruturais, consistência semântica e fidelidade visual. O framework proposto SegCycle-SPADE obteve as pontuações mais altas de qualidade de reconstrução em ambos os conjuntos de dados. Clique aqui para visualizar uma versão maior desta figura.

O PSNR foi utilizado para avaliar a fidelidade da reconstrução, medindo a similaridade em nível de pixels entre as imagens reconstruídas e as imagens de referência correspondentes. O PSNR foi calculado entre cada imagem reconstruída e sua imagem original de Miao Batik correspondente, usada como referência de verdade absoluta. Valores mais altos de PSNR indicam menor erro de reconstrução. Como mostrado na Tabela 5, Pix2Pix e CycleGAN alcançaram valores moderados de PSNR porque reconstruíram padrões sem orientação estrutural explícita. StyleGAN e AttentionGAN alcançaram valores mais altos de PSNR por meio de aprendizado mais profundo de características. A estrutura proposta SegCycle-SPADE alcançou os valores mais altos de PSNR em ambos os conjuntos de dados, demonstrando fidelidade superior de reconstrução e preservação das estruturas de motivos culturais.

MétodoConjunto de Dados Miao Batik
(PSNR, dB)
Conjunto de Dados WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (Proposto)32.431.2

Tabela 5: Resultados da Relação Sinal-Ruído de Pico (PSNR) para a Reconstrução de Padrões Culturais. Comparação dos valores de Relação Sinal-Ruído de Pico (PSNR) obtidos pelo framework proposto SegCycle-SPADE e pelos métodos básicos nos conjuntos de dados Miao Batik e WikiArt. Valores mais altos de PSNR indicam fidelidade aprimorada na reconstrução e distorção reduzida em relação às imagens de referência correspondentes.

Figura 11 ilustra o comportamento de convergência do framework proposto SegCycle-SPADE durante o treinamento. As curvas de perda representam as médias das perdas de treinamento calculadas a partir de cinco execuções independentes de treinamento. Para reduzir a variabilidade estocástica e fornecer uma representação mais robusta da convergência do treinamento, os valores de perda foram médios em cada época ao longo de todas as execuções. Durante as épocas iniciais de treinamento, os valores de perda eram relativamente altos porque o modelo ainda estava aprendendo representações de características a partir dos dados de entrada. Conforme o treinamento avançou, todos os componentes de perda diminuíram e estabilizaram gradualmente, indicando uma otimização bem-sucedida dos objetivos de segmentação, reconstrução e síntese artística. O comportamento de convergência observado demonstra a eficácia, estabilidade e reprodutibilidade do framework proposto durante o treinamento.

figure-results-12
Figura 11. Convergência do Treinamento da Estrutura Proposta SegCycle-SPADE. Curvas de perda durante o treinamento da estrutura proposta SegCycle-SPADE ao longo de 100 épocas de treinamento, com média calculada a partir de cinco execuções independentes de treinamento (n = 5). A figura ilustra a evolução da perda total (LTotal), perda de segmentação (LSeg), perda do gerador (LG) e perda do discriminador (LD) durante o treinamento. A redução gradual e subsequente estabilização de todos os componentes de perda indicam convergência bem-sucedida e otimização estável da estrutura proposta. Clique aqui para visualizar uma versão maior desta figura.

Estudo de Ablação
Para avaliar a contribuição de cada componente dentro do framework proposto SegCycle-SPADE, foi realizado um estudo de ablação utilizando múltiplas configurações controladas de modelos. Os resultados são resumidos nas Tabelas 6 e 7.

Configuração do ModeloPrecisão de Segmentação (%)IoUSSIM
Apenas SegFormer87,30,760,82
SegFormer + CAFFM89,60,790,86
SegFormer + CAFFM + CycleGAN91,40,820,89
SegFormer + CAFFM + CycleGAN + SPADE (Proposto)93,80,860,93

Tabela 6: Estudo de Ablação dos Componentes do SegCycle-SPADE. Comparação de desempenho entre configurações de modelos progressivamente aprimoradas, com o objetivo de avaliar a contribuição de componentes individuais do framework. O estudo analisa os efeitos da segmentação semântica, do Módulo de Fusão de Recursos Culturais com Atenção Cruzada (CAFFM), da reconstrução baseada em CycleGAN e da síntese artística baseada em SPADE sobre a precisão da segmentação, Índice de Interseção sobre União (IoU) e Índice de Similaridade Estrutural (SSIM). Valores mais altos indicam melhorias na segmentação de motivos, na qualidade de reconstrução e na preservação estrutural.

VarianteIoU (%)Dice (%)SSIMPSNR (dB)FID ↓
Apenas SegFormer84,2 ± 0,488,5 ± 0,30,82 ± 0,0124,8 ± 0,231,8 ± 0,6
SegFormer + CycleGAN86,7 ± 0,390,2 ± 0,20,85 ± 0,0126,3 ± 0,227,5 ± 0,5
SegFormer + SPADE87,0 ± 0,390,5 ± 0,20,88 ± 0,0127,8 ± 0,223,4 ± 0,4
SegFormer + CAFFM90,0 ± 0,293,1 ± 0,20,90 ± 0,0129,6 ± 0,120,3 ± 0,3
SegCycle-SPADE (Modelo Completo)93,0 ± 0,295,4 ± 0,10,92 ± 0,0131,2 ± 0,117,6 ± 0,2

Tabela 7: Análise de Contribuição dos Componentes da Estrutura Proposta SegCycle-SPADE. Comparação de desempenho entre variantes individuais da estrutura utilizadas para avaliar a contribuição de CAFFM, CycleGAN, SPADE e da arquitetura completa SegCycle-SPADE. Os resultados são apresentados em termos do índice de Interseção sobre União (IoU), coeficiente de Dice, Índice de Similaridade Estrutural (SSIM), Razão de Sinal para Ruído de Pico (PSNR) e Distância de Inception de Fréchet (FID). Valores mais altos de IoU, Dice, SSIM e PSNR indicam melhor qualidade de segmentação e reconstrução, enquanto valores mais baixos de FID indicam maior realismo visual dos padrões culturais gerados.

Tabela 6 avalia a contribuição cumulativa dos principais componentes do arcabouço utilizando quatro configurações: (i) apenas SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN e (iv) SegFormer + CAFFM + CycleGAN + SPADE (arcabouço proposto). O modelo de referência SegFormer obteve uma precisão de segmentação de 87,3%, uma pontuação IoU de 0,76 e um valor SSIM de 0,82. A incorporação do módulo CAFFM melhorou o desempenho em todas as métricas de avaliação, aumentando a precisão de segmentação para 89,6%, o IoU para 0,79 e o SSIM para 0,86. A adição do CycleGAN aprimorou ainda mais a capacidade de reconstrução estrutural, resultando em um IoU de 0,82 e um valor SSIM de 0,89. O arcabouço completo SegCycle-SPADE alcançou o melhor desempenho geral, com uma precisão de segmentação de 93,8%, um IoU de 0,86 e um valor SSIM de 0,93. Esses resultados demonstram que cada componente contribui progressivamente para a melhoria da precisão de segmentação, da preservação estrutural e da qualidade de reconstrução de imagem.

Tabela 7 investiga mais profundamente a contribuição de componentes individuais da estrutura utilizando cinco variantes do modelo: (i) apenas SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM e (v) o modelo completo que incorpora SegFormer, CAFFM, CycleGAN, SPADE e perda por preservação de motivos. O desempenho foi avaliado usando as métricas IoU, coeficiente Dice, SSIM, PSNR e FID.

A configuração básica apenas com SegFormer obteve um IoU de 84,2%, um coeficiente Dice de 88,5%, um valor SSIM de 0,82, um PSNR de 24,8 dB e uma pontuação FID de 31,8. A adição do CycleGAN melhorou a qualidade da reconstrução e reduziu a pontuação FID para 27,5, indicando maior realismo da imagem. A incorporação do SPADE aprimorou ainda mais a similaridade estrutural e a qualidade da imagem, resultando em um valor SSIM de 0,88 e uma pontuação FID de 23,4. A inclusão do módulo proposto CAFFM gerou ganhos substanciais em todas as métricas, aumentando o IoU para 90,0%, o coeficiente Dice para 93,1%, o SSIM para 0,90 e o PSNR para 29,6 dB, ao mesmo tempo em que reduziu a pontuação FID para 20,3. O modelo completo, que adicionalmente incorpora a perda de preservação de motivo, alcançou o melhor desempenho geral, com um IoU de 93,0%, um coeficiente Dice de 95,4%, um valor SSIM de 0,92, um PSNR de 31,2 dB e uma pontuação FID de 17,6.

Tabela 8 apresenta uma visão geral comparativa das principais abordagens de aprendizado profundo (DL) utilizadas para reconstrução e preservação de padrões do patrimônio cultural. Métodos convencionais baseados em CNN fornecem um aprendizado eficaz de características locais e bom desempenho em segmentação, mas frequentemente enfrentam dificuldades para preservar estruturas complexas de motivos devido à modelagem limitada de dependências de longo alcance. Abordagens baseadas em GAN melhoram a síntese de imagens e as capacidades de transferência de estilo; no entanto, podem apresentar inconsistências semânticas e perda de detalhes estruturais finos. Métodos baseados em Transformadores aprimoram a compreensão contextual global, mas normalmente carecem de capacidades de reconstrução generativa, enquanto métodos baseados em difusão oferecem alta fidelidade visual ao custo de maior complexidade computacional. Abordagens híbridas Transformer-GAN parcialmente superam essas limitações ao combinar mecanismos de extração de características e geração de imagens. Em contraste, o framework proposto SegCycle-SPADE integra segmentação baseada em Transformador, fusão de características com atenção cruzada, reconstrução generativa e síntese artística guiada por segmentação em uma arquitetura unificada, melhorando assim a fidelidade estrutural, a consistência semântica e a preservação de motivos culturais. A comparação é resumida na Tabela 8.

AbordagemMetodologia CentralPontos FortesLimitaçõesRelevância para o Patrimônio Cultural
Métodos Baseados em CNN (por exemplo, U-Net, DeepLabV3+)Extração de características convolucionais e segmentação semânticaAprendizado eficaz de características locais e segmentação precisaModelagem limitada de dependências de longo alcance; dificuldade em preservar estruturas de motivos complexosAdequado para segmentação de motivos, mas menos eficaz para reconstrução artística
Métodos Baseados em GAN (por exemplo, Pix2Pix, CycleGAN)Geração adversarial de imagens e tradução imagem-para-imagemSíntese de imagens de alta qualidade e transferência de estiloInestabilidade durante o treinamento; inconsistência semântica; possível perda de detalhes estruturais finosÚtil para restauração de padrões, mas pode não preservar os motivos culturais com precisão
Métodos Baseados em TransformadoresAtenção própria e modelagem de contexto globalCaptura dependências de longo alcance e relações visuais complexasAlto custo computacional; exige grandes conjuntos de dados para treinamentoEficaz para análise de padrões complexos, mas capacidade gerativa limitada quando usado isoladamente
Métodos Baseados em DifusãoGeração de imagens baseada em denoising iterativoAlto realismo visual e diversidade de imagensVelocidade lenta de inferência; altos requisitos computacionais; controle estrutural limitadoPromissor para geração de imagens do patrimônio cultural, mas intensivo computacionalmente
Métodos Híbridos Transformador-GANCombinação de extração de características baseada em transformador e geração baseada em GANMelhor representação de características globais e qualidade de imagemFrequentemente carecem de orientação semântica explícita para preservação de motivosMelhora a qualidade da geração, mas não foi especificamente projetado para motivos do patrimônio cultural
SegCycle-SPADE PropostoSegFormer + CAFFM + CycleGAN + SPADESegmentação baseada em transformador, fusão de características guiada por atenção, consistência semântica, preservação de motivos e reconstrução artística controlávelComplexidade computacional maior do que abordagens baseadas em CNN isoladasProjetado especificamente para reconstrução e preservação de padrões do patrimônio cultural, com fidelidade estrutural e consistência semântica aprimoradas

Tabela 8: Comparação de Abordagens Representativas de Aprendizado Profundo para a Reconstrução e Preservação de Padrões do Patrimônio Cultural. Comparação qualitativa de abordagens representativas de aprendizado profundo utilizadas para segmentação de imagens, reconstrução de padrões, geração de estilo e preservação do patrimônio cultural. A tabela resume a metodologia central, pontos fortes, limitações e aplicabilidade de cada abordagem, destacando como o framework proposto SegCycle-SPADE combina segmentação semântica, fusão de características, reconstrução e síntese de estilo para enfrentar desafios relacionados à preservação estrutural e à consistência semântica em padrões do patrimônio cultural.

Os aprimoramentos observados demonstram que o módulo CAFFM melhora efetivamente a interação entre características estruturais derivadas da segmentação e representações de estilo artístico por meio da fusão de características baseada em atenção cruzada. Além disso, a perda de preservação de motivos contribui para manter estruturas de motivos culturalmente significativas durante a reconstrução e a síntese artística, resultando em maior consistência de segmentação, fidelidade estrutural e realismo visual. Em conjunto, os resultados da análise ablativa confirmam que a integração do SegFormer-B2, CAFFM, CycleGAN, SPADE e da perda de preservação de motivos é responsável pelo desempenho superior do framework proposto SegCycle-SPADE.

Disponibilidade de Dados:
O conjunto de dados WikiArt utilizado para a aprendizagem de estilo artístico está publicamente disponível por meio do repositório Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). O conjunto de dados Miao Batik utilizado neste estudo está publicamente disponível por meio do Zenodo (https://doi.org/10.5281/zenodo.20807658). Os conjuntos de dados processados, máscaras de segmentação, pesos do modelo pré-treinado, saídas geradas e arquivos de implementação em Python associados à estrutura proposta SegCycle-SPADE também estão disponíveis por meio do mesmo repositório Zenodo.

ARQUIVO SUPLEMENTAR:
Arquivo Suplementar 1. Algoritmo 1: Fluxo de Implementação do Framework SegCycle-SPADE Proposto. Pseudocódigo passo a passo descrevendo todo o pipeline de implementação do framework proposto SegCycle-SPADE, incluindo carregamento do conjunto de dados, pré-processamento, segmentação semântica utilizando o SegFormer-B2, fusão de características usando o Módulo de Fusão de Características Culturais com Atenção Cruzada (CAFFM), reconstrução de motivos culturais usando CycleGAN, síntese de estilo artístico usando SPADE, treinamento do modelo, validação, seleção de pontos de controle e avaliação final do desempenho. Clique aqui para baixar este arquivo.

Discussão

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

A preservação e a reconstrução digital de padrões do patrimônio cultural imaterial (ICH) têm recebido atenção crescente nos últimos anos devido à perda gradual dos ofícios tradicionais. Estudos anteriores tentaram abordar a perda do patrimônio cultural por meio de técnicas de processamento de imagens baseadas em aprendizado profundo (DL). Por exemplo, Quan et al.32 propuseram um framework de preservação do patrimônio cultural baseado em grafos de conhecimento e DL para a cultura do tingimento em cera Miao de Guizhou. Embora o estudo tenha se concentrado na reconstrução digital de padrões culturais, sua metodologia dependia principalmente de representações por grafos de conhecimento. Da mesma forma, Fu e Razmjooy16 propuseram um framework baseado na rede de pirâmide de características (FPN) para aprimoramento e restauração de imagens de patrimônio cultural. Embora este método tenha proporcionado uma extração eficaz de características para aprimoramento de imagens, ele não incorporou orientação por segmentação de imagens nem mecanismos de reconstrução generativa para padrões culturais incompletos. Em contraste, o framework proposto SegCycle-SPADE combina múltiplos componentes de aprendizado profundo para superar esses desafios. Primeiro, a segmentação semântica utilizando o modelo SegFormer é empregada para identificação precisa de regiões de motivos dentro dos padrões do patrimônio cultural. Em seguida, um módulo de aprimoramento de características baseado em CAFFM melhora as representações de características para estruturas de motivos finas. Um módulo de reconstrução CycleGAN é então usado para reconstruir regiões ausentes ou incompletas dentro dos padrões culturais por meio de aprendizado adversarial. Finalmente, um módulo SPADE realiza o aprimoramento estilístico mantendo o alinhamento estrutural com os mapas de segmentação. Os métodos existentes baseados em CNN, GAN, transformadores e difusão17,19,20,21,22,23,24,25,30,34 oferecem vantagens únicas; no entanto, também apresentam limitações na preservação da consistência semântica, na manutenção de características estruturais ou na eficiência computacional, conforme resumido na Tabela 8. A arquitetura proposta SegCycle-SPADE combina os pontos fortes da segmentação baseada em SegFormer, fusão de características com atenção cruzada, reconstrução CycleGAN e síntese guiada por SPADE, ao mesmo tempo em que supera essas limitações. Consequentemente, o framework alcança maior qualidade de reconstrução e melhor preservação de motivos culturalmente significativos.

Apesar do desempenho promissor, o framework proposto SegCycle-SPADE ainda apresenta várias limitações. Primeiro, a avaliação foi conduzida utilizando apenas os conjuntos de dados Miao Batik e WikiArt, o que pode limitar a generalização do framework para outros domínios do patrimônio cultural. Segundo, a implantação em plataformas com recursos limitados pode ser desafiadora, pois a integração do SegFormer, CAFFM, CycleGAN e SPADE aumenta a complexidade computacional e os requisitos de memória. Terceiro, o desempenho da segmentação depende fortemente da qualidade e consistência das anotações de motivos, e o viés de anotação pode afetar a preservação de estruturas culturalmente significativas. Por fim, como o framework foi avaliado utilizando apenas dois conjuntos de dados, dados adicionais de treinamento e adaptações específicas ao domínio podem ser necessários para garantir a aplicabilidade em diversas coleções de patrimônio cultural. Estudos futuros devem, portanto, explorar estratégias de treinamento mais robustas, arquiteturas leves, procedimentos aprimorados de anotação e avaliações cruzadas utilizando conjuntos adicionais de dados de patrimônio cultural.

A escalabilidade do framework SegCycle-SPADE para conjuntos de dados de patrimônio cultural maiores e mais diversos será um foco principal das pesquisas futuras. Será investigada a avaliação cruzada de motivos do patrimônio de diferentes regiões e tradições artísticas, com o objetivo de melhorar a generalização do modelo e sua adaptabilidade cultural. Além disso, extensões multimodais que incorporem descrições textuais, registros históricos e metadados culturais podem fornecer orientação semântica mais robusta durante a reconstrução. O framework também poderá ser estendido para suportar a reconstrução tridimensional do patrimônio cultural mediante a integração de técnicas de reconstrução baseadas em imagens com modelagem 3D. Adicionalmente, será explorada a implantação em arquivos digitais, museus, exposições virtuais e plataformas de preservação do patrimônio cultural, a fim de facilitar aplicações práticas da conservação e documentação do patrimônio assistidas por IA. Para melhorar ainda mais a interpretabilidade e autenticidade cultural, trabalhos futuros investigarão a integração de grafos de conhecimento cultural, documentação etnográfica, metadados históricos e bases de conhecimento curadas por especialistas, permitindo análises e reconstruções de motivos informadas culturalmente32.

Várias considerações práticas devem ser levadas em conta ao implementar o framework proposto SegCycle-SPADE. Durante o treinamento do CycleGAN, pode ocorrer convergência adversarial instável se as perdas do gerador e do discriminador se tornarem altamente desequilibradas. Nessas situações, reduzir a taxa de aprendizado, aumentar o peso da perda de consistência cíclica ou monitorar a dominância do discriminador pode melhorar a estabilidade do treinamento. O colapso de modos pode ocorrer quando o gerador produz repetidamente saídas visualmente semelhantes; esse problema pode ser mitigado por meio de um treinamento adversarial equilibrado, utilização de buffer de replay e monitoramento cuidadoso das tendências de perda do gerador e do discriminador. Falhas na segmentação também podem surgir quando motivos culturais apresentam texturas complexas, baixo contraste ou fronteiras ambíguas. Para resolver esse problema, a qualidade da imagem deve ser verificada antes do treinamento, e as máscaras de segmentação devem ser inspecionadas visualmente para garantir consistência nas anotações. Manter a resolução de entrada recomendada e as configurações de normalização também é importante para obter um desempenho confiável do SegFormer. A instabilidade no treinamento pode ainda resultar de configurações inadequadas de taxa de aprendizado, dados de treinamento insuficientes ou variações numéricas relacionadas ao hardware. Para melhorar a reprodutibilidade, devem ser utilizadas sementes aleatórias fixas para operações do NumPy, PyTorch, CUDA e embaralhamento de conjuntos de dados. Além disso, o mesmo pipeline de pré-processamento, partições do conjunto de dados, hiperparâmetros do modelo e ambiente de software devem ser mantidos em todas as execuções experimentais. Recomenda-se também salvar pontos de verificação periódicos e monitorar a perda de validação para evitar degradação de desempenho e facilitar a recuperação após sessões de treinamento interrompidas.

O trabalho proposto contribui para o avanço teórico dos quadros de reconstrução de patrimônio cultural baseados em IA. Abordagens convencionais de restauração de imagens geralmente tratam a segmentação de imagens, a reconstrução e a geração de estilo como processos independentes17,19,20,30. Em contraste, este estudo propõe um quadro que integra esses processos por meio de uma estratégia de reconstrução gerativa orientada por segmentação. Consequentemente, o estudo contribui para o desenvolvimento teórico da reconstrução de patrimônio cultural assistida por IA, demonstrando como segmentação, reconstrução e geração de estilo podem ser unificados dentro de um único quadro. Essa integração é particularmente importante em aplicações de patrimônio cultural, nas quais a preservação da estrutura dos motivos e do significado semântico é crítica. De uma perspectiva prática, o quadro proposto oferece uma solução eficaz para a preservação digital, restauração e aprimoramento artístico de padrões culturais tradicionais. Instituições de patrimônio cultural, museus e designers podem empregar o SegCycle-SPADE para identificar automaticamente regiões de motivos, reconstruir padrões danificados ou incompletos e gerar representações artísticas visualmente aprimoradas de desenhos tradicionais. Essa capacidade é especialmente valiosa para tradições artesanais ameaçadas, incluindo os padrões têxteis de batik Miao, nos quais artefatos históricos podem estar parcialmente danificados ou incompletos. Além disso, por meio da incorporação da síntese gerativa de estilo, o quadro pode apoiar aplicações modernas de design cultural, como design têxtil, criação artística digital e educação patrimonial. Dessa forma, o quadro proposto preenche a lacuna entre a preservação do patrimônio cultural e as aplicações contemporâneas de design cultural.

No entanto, apesar dos resultados promissores alcançados pelo framework proposto SegCycle-SPADE, várias limitações permanecem. Primeiro, a avaliação foi conduzida utilizando apenas os conjuntos de dados Miao Batik e WikiArt, o que pode afetar a capacidade de generalização do framework na reconstrução de outras formas de padrões do patrimônio cultural. Segundo, como o processo de reconstrução depende de modelos baseados em GAN, as saídas geradas podem ocasionalmente conter artefatos ou texturas não naturais ao lidar com estruturas de motivos altamente complexas. Terceiro, o framework atualmente se concentra na reconstrução de padrões bidimensionais, enquanto alguns artefatos do patrimônio cultural envolvem estruturas inerentemente tridimensionais. De modo geral, os resultados experimentais demonstram a eficácia do framework proposto SegCycle-SPADE na reconstrução artística de padrões do PCI. A integração da segmentação semântica baseada em SegFormer, CAFFM, reconstrução de motivos baseada em CycleGAN e síntese artística baseada em SPADE consistentemente melhorou as métricas de desempenho em segmentação, reconstrução e qualidade de imagem. Os estudos de ablação validaram ainda mais a contribuição de cada componente do framework, mostrando que o CAFFM e a perda de preservação de motivos substancialmente aprimoraram a fidelidade estrutural e a autenticidade visual. Esses resultados apoiam a hipótese central de que a reconstrução guiada por segmentação semântica combinada à fusão de características com atenção cruzada pode efetivamente preservar motivos culturalmente significativos enquanto gera saídas artisticamente ricas. Portanto, o framework proposto oferece uma abordagem computacional confiável e reprodutível para a preservação digital, restauração e revitalização criativa de padrões do PCI.

Divulgações

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Conflito de Interesses:
Os autores declaram não haver interesses conflitantes.

Agradecimentos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Os autores agradecem o apoio acadêmico e institucional fornecido pelo Guangdong Engineering Polytechnic e pela Universidade Normal do Sul da China durante a realização desta pesquisa. Esta pesquisa contou com o apoio do Projeto Geral do Fundo Nacional de Ciências Sociais de 2023 (nº 23BH161), intitulado “Museu de Regeneração Digital: Pesquisa sobre a Ativação e Comunicação de Relíquias Culturais Chinesas Clássicas de Caligrafia e Pintura”.

Materiais

Lista de materiais utilizados neste artigo
NomeEmpresaNúmero de catálogoComentários
Otimizador AdamBiblioteca de Otimizadores PyTorchAdamAlgoritmo de otimização utilizado durante o treinamento do modelo.
Toolkit CUDACorporação NVIDIACUDA 11.3Aceleração por GPU para cálculos de aprendizado profundo.
cuDNNCorporação NVIDIAcuDNN 8.2Biblioteca de aceleração de redes neurais profundas utilizada para acelerar o treinamento e a inferência.
CycleGANUniversidade da Califórnia, Berkeley / Código AbertoImplementação Oficial em PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Rede generativa adversarial utilizada para reconstrução de motivos culturais.
Parâmetros Pré-treinados do ImageNetImageNet / Código Abertomit_b2.pth (Ponto de controle pré-treinado no ImageNet-1K)Utilizado para inicializar a estrutura SegFormer-B2 antes do ajuste fino no conjunto de dados Miao Batik.
Processador IntelCorporação IntelIntel Core i7 (11ª Geração)CPU utilizada para pré-processamento de imagens, suporte ao treinamento do modelo e inferência.
MatplotlibEquipe de Desenvolvimento MatplotlibMatplotlib 3.5.1Visualização de curvas de treinamento e resultados de avaliação.
Conjunto de Dados Miao BatikRepositório ZenodoDOI: 10.5281/zenodo.20807658Conjunto de dados de motivos culturais contendo 15.148 imagens, utilizado para segmentação semântica e reconstrução de padrões.
NumPyDesenvolvedores NumPyNumPy 1.21.5Computação numérica e processamento de conjuntos de dados.
GPU NVIDIACorporação NVIDIANVIDIA RTX 3090 (24 GB de VRAM)Plataforma de hardware utilizada para treinamento e inferência do modelo.
OpenCVFundação OpenCVOpenCV 4.5.5Pré-processamento de imagens, redimensionamento, interpolação e redução de ruído gaussiano.
Sistema OperacionalCanonical Ltd.Ubuntu 20.04 LTSAmbiente de execução experimental.
Pillow (PIL)Biblioteca de Processamento de Imagens em PythonPillow 8.4.0Carregamento e manipulação de imagens.
PythonPython Software FoundationPython 3.8.10Linguagem de programação utilizada para implementação e experimentação.
PyTorchMeta AIPyTorch 1.10.0Framework de aprendizado profundo utilizado para treinamento e inferência do modelo.
Semente AleatóriaConfiguração Experimental42Semente fixa utilizada para partição do conjunto de dados, inicialização do modelo e reprodutibilidade experimental.
Scikit-learnDesenvolvedores Scikit-learnScikit-learn 1.0.2Partição de conjuntos de dados, análise estatística e métricas de avaliação.
SeabornComunidade de Código AbertoSeaborn 0.11.2Visualização estatística de dados.
SegFormer-B2Pesquisa NVIDIA / Código AbertoSegFormer-B2 (Estrutura MIT-B2)Modelo de segmentação semântica baseado em transformadores, utilizado para segmentação de motivos culturais.
Máscaras de Segmentação / AnotaçõesConjunto de Dados Miao BatikIncluído com o Conjunto de DadosRótulos de segmentação semântica em nível de pixel, utilizados para classificação de motivos e treinamento.
SPADEPesquisa NVIDIA / Código AbertoImplementação Oficial em PyTorch (https://github.com/NVlabs/SPADE)Modelo de síntese de imagens guiado por segmentação, utilizado para geração artística de padrões.
TorchVisionMeta AITorchVision 0.11.1Utilitários de processamento de imagens e transformações de conjuntos de dados utilizados com o PyTorch.
Conjunto de Dados WikiArtWikiArthttps://www.wikiart.org/Conjunto de dados de estilos artísticos contendo mais de 80.000 obras em 27 estilos artísticos, utilizado para aprendizado e síntese de estilo.

Referências

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Reimpressões e permissões

Solicitar permissão para reutilizar o texto ou as figuras deste artigo JoVE

Solicitar permissão

Etiquetas

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Artigos relacionados