$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
O framework proposto, SegCycle-SPADE, foi projetado para reconstruir e aprimorar padrões tradicionais do patrimônio cultural por meio da segmentação semântica, realce de características usando mecanismos de atenção, reconstrução generativa e síntese de estilo artístico. Este estudo utilizou conjuntos de dados públicos de imagens artísticas e do patrimônio cultural, incluindo o conjunto de dados Miao Batik e o conjunto de dados WikiArt. Nenhum participante humano, dado de paciente, informação pessoal, sujeito animal ou registro clínico foi envolvido na pesquisa; portanto, não foi necessária aprovação do comitê de ética institucional nem consentimento informado. Inicialmente, o conjunto de dados de motivos culturais Miao Batik e o conjunto de dados WikiArt foram utilizados para a avaliação. O conjunto de dados Miao Batik foi descrito em Quan et al. (2024)³² e contém 15.148 imagens anotadas de motivos tradicionais de batik Miao. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas diretamente, e nenhuma anotação manual adicional foi gerada neste estudo. Em seguida, foi realizada a pré-processamento das imagens por meio de redimensionamento, normalização, remoção de ruído e criação de máscaras de segmentação. Os parâmetros exatos de pré-processamento são descritos na subseção Pré-processamento dos Dados. O framework proposto utiliza um modelo baseado em transformador denominado SegFormer-B2 para a segmentação semântica dos dados. O método foi projetado para detectar regiões-chave dos motivos culturais e aprender suas estruturas. As características segmentadas são então realçadas por meio de um mecanismo de atenção, no qual informações importantes relacionadas aos motivos culturais são destacadas e informações irrelevantes são descartadas. A configuração do mecanismo de atenção é descrita na subseção CAFFM. As características realçadas são então processadas pelo CycleGAN, onde estruturas danificadas são reconstruídas por meio de aprendizado cíclico. Durante o treinamento, amostras de motivos incompletos foram artificialmente criadas mediante aplicação de operações de máscara aleatória e oclusão parcial às imagens originais de Miao Batik. Esses procedimentos de degradação simularam regiões de motivos ausentes e danos estruturais comumente observados em artefatos de patrimônio cultural deteriorados. As imagens incompletas resultantes foram utilizadas como entradas para o módulo de reconstrução do CycleGAN, enquanto as imagens originais correspondentes serviram como alvos de reconstrução. Os padrões de patrimônio cultural reconstruídos são então aprimorados por meio do SPADE, onde o realce artístico é realizado com base nos mapas de segmentação gerados. O desempenho do framework proposto é avaliado por meio de métricas quantitativas de segmentação e qualidade de imagem, enquanto a autenticidade visual dos motivos culturais reconstruídos é avaliada qualitativamente. A autenticidade visual foi avaliada por inspeção visual dos padrões culturais gerados e não foi utilizada como métrica quantitativa independente. A avaliação concentrou-se na preservação do motivo, consistência semântica, características culturais, coerência estrutural e aparência artística em relação aos motivos culturais de referência correspondentes. A avaliação quantitativa do desempenho do modelo foi realizada utilizando Acurácia de Segmentação, Índice de Similaridade (IoU), Coeficiente de Dice, Índice de Similaridade Estrutural (SSIM), Relação Sinal-Ruído de Pico (PSNR) e Distância de Inception de Fréchet (FID). Figura 2 ilustra o fluxo de trabalho geral do framework proposto SegCycle-SPADE e resume as métricas de avaliação utilizadas neste estudo.

Figura 2. Fluxo da Arquitetura Geral do Framework Proposto SegCycle-SPADE. Visão geral do fluxo de trabalho completo do SegCycle-SPADE. Imagens dos conjuntos de dados Miao Batik e WikiArt passam por pré-processamento antes de serem processadas por meio de segmentação semântica usando o SegFormer-B2, realce de características usando o CAFFM, reconstrução de padrões usando o CycleGAN e geração de estilo artístico usando o SPADE. O desempenho do modelo é avaliado por meio da Acurácia de Segmentação, Intersecção sobre União (IoU), Coeficiente Dice, Índice de Similaridade Estrutural (SSIM), PSNR e Distância de Inception de Fréchet (FID), enquanto a autenticidade visual é avaliada qualitativamente. Clique aqui para visualizar uma versão maior desta figura.
A estrutura SegCycle-SPADE para reconstrução de padrões do patrimônio cultural foi projetada para integrar múltiplos componentes de aprendizado profundo (DL) com o objetivo de realizar segmentação, reconstrução e aprimoramento artístico precisos de motivos, conforme ilustrado na Figura 2. Imagens do conjunto de dados de motivos culturais do Batik Miao e do conjunto de dados WikiArt são utilizadas para fornecer padrões culturais e estilos artísticos diversos. Inicialmente, as imagens são processadas por meio de um módulo de segmentação semântica baseado no SegFormer, para identificar e delimitar os motivos culturais em relação ao fundo. A arquitetura geral consiste em quatro etapas principais. Primeiro, o modelo SegFormer extrai mapas de segmentação semântica a partir das imagens de padrões culturais. Segundo, o CAFFM integra características de segmentação com representações gerativas para aprimorar a aprendizagem de características. Terceiro, o módulo CycleGAN reconstrói os padrões culturais utilizando as representações de características fundidas. Por fim, o módulo SPADE gera saídas artisticamente aprimoradas, preservando a consistência estrutural por meio de síntese guiada por segmentação. Os mapas de características refinados são posteriormente processados pelo módulo de reconstrução CycleGAN, que aprende a restaurar motivos culturais incompletos ao mapear padrões degradados para suas formas completas correspondentes. Amostras de motivos incompletos foram geradas mediante aplicação de operações aleatórias de mascaramento e oclusão parcial às imagens originais do Batik Miao, simulando assim regiões de padrão ausentes e degradação estrutural comumente observadas em artefatos culturais danificados. Cada imagem degradada foi emparelhada com sua imagem original correspondente, que serviu como alvo de reconstrução durante o treinamento. Essa estratégia permitiu que o módulo CycleGAN aprendesse a restaurar estruturas de motivos ausentes, preservando ao mesmo tempo a consistência semântica e características culturalmente significativas. Por fim, o gerador SPADE produz saídas artísticas visualmente aprimoradas ao condicionar a síntese da imagem aos mapas de segmentação gerados, mantendo assim a integridade estrutural dos motivos culturais ao longo de todo o processo de aprimoramento artístico.
Os seguintes passos estão envolvidos no framework proposto SegCycle-SPADE.
Etapa 1: Coleta do Conjunto de Dados
Dois conjuntos de dados foram utilizados para alcançar os objetivos de aprendizado de padrões culturais e geração de estilo artístico. O Conjunto de Dados de Motivos Culturais do Tingimento Miao foi utilizado para fornecer informações sobre padrões culturais tradicionais. O conjunto de dados está publicamente disponível no Zenodo (https://doi.org/10.5281/zenodo.20807658) e contém 15.148 imagens anotadas de motivos tradicionais de tingimento Miao. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas diretamente, e nenhuma anotação manual adicional foi gerada neste estudo. O conjunto de dados WikiArt foi utilizado para fornecer informações diversas sobre estilo artístico para a geração de estilo artístico e foi obtido a partir do repositório publicamente acessível do WikiArt (https://www.wikiart.org/).
Passo 2: Pré-processamento dos Dados
Todas as imagens foram pré-processadas por meio de redimensionamento, normalização e redução de ruído. As anotações existentes de motivos culturais obtidas das fontes originais do conjunto de dados foram utilizadas para apoiar a etapa de segmentação semântica. Nenhum procedimento adicional de anotação ou reclassificação foi realizado como parte deste estudo.
Passo 3: Segmentação de Padrão Semântico usando SegFormer
O modelo SegFormer foi utilizado para a segmentação de motivos culturais. O exato backbon e estratégia de inicialização do SegFormer são descritos na subseção Segmentação de Padrão Semântico Usando SegFormer. Especificamente, a arquitetura SegFormer-B2 com um backbon MIT-B2 pré-treinado no ImageNet foi empregada para a segmentação semântica de motivos. Este modelo captura efetivamente informações contextuais globais ao mesmo tempo em que preserva os detalhes estruturais complexos dos padrões culturais tradicionais.
Passo 4: CAFFM
O CAFFM combina características de segmentação semântica com representações gerativas, permitindo que o framework aprenda tanto as características dos motivos estruturais quanto as informações de estilo artístico. Os detalhes de integração do CAFFM são fornecidos na subseção CAFFM. O módulo está posicionado entre a etapa de segmentação semântica baseada no SegFormer e a etapa de reconstrução gerativa, onde funde características estruturais derivadas da segmentação com características de reconstrução por meio de atenção cruzada com múltiplas cabeças. Esse processo melhora a preservação dos motivos culturais e aumenta o realismo das saídas reconstruídas.
Etapa 5: Reconstrução do Padrão (CycleGAN)
Os recursos fundidos são subsequentemente processados pelo módulo CycleGAN para reconstruir estruturas de padrões culturais. A arquitetura CycleGAN e a configuração de treinamento são descritas na subseção Reconstrução do Padrão Utilizando CycleGAN. O módulo de reconstrução consiste em dois geradores e dois discriminadores, utiliza uma arquitetura de gerador baseada em rede residual com nove blocos residuais, emprega um discriminador PatchGAN e é treinado utilizando perdas adversariais e de consistência cíclica. Essa configuração permite mapeamento bidirecional entre domínios e facilita a reconstrução de estruturas de padrões culturais incompletas.
Etapa 6: Geração de Estilo Artístico (SPADE)
Os padrões reconstruídos são então processados pelo módulo SPADE para realizar a síntese de estilo artístico orientada por segmentação. A configuração do gerador SPADE é descrita na subseção Artistic Style Generation Using SPADE. O módulo emprega blocos residuais SPADE, camadas de normalização adaptativa espacial e condicionamento semântico derivado dos mapas de segmentação do SegFormer e das representações de características do CAFFM. Ao condicionar a geração de imagens nos mapas de segmentação, as saídas sintetizadas mantêm o alinhamento estrutural com os motivos culturais originais, ao mesmo tempo que incorporam características de estilo artístico.
Etapa 7: Estimativa de Desempenho
A estrutura proposta foi avaliada utilizando múltiplas métricas de segmentação e avaliação da qualidade da imagem, incluindo Acurácia de Segmentação, IoU, Coeficiente de Similaridade Dice (Dice), SSIM, PSNR e FID. Para avaliar a consistência experimental, todos os experimentos foram repetidos cinco vezes utilizando diferentes sementes aleatórias, e os resultados são apresentados como média ± desvio padrão. A significância estatística foi avaliada por meio de testes t pareados, com um limiar de significância de p < 0,05.
Coleta do Conjunto de Dados
Na estrutura proposta do SegCycle-SPADE, dois conjuntos de dados são utilizados para a compreensão de padrões culturais e o aprendizado de estilo. O primeiro conjunto de dados empregado na estrutura proposta é o conjunto de dados de motivos culturais do Batik Miao. Este conjunto contém motivos culturais do Batik Miao, geralmente imagens tradicionais do Batik Miao com motivos como animais, plantas e formas geométricas, usados na arte da etnia Miao. Este conjunto contém imagens com informações ricas em textura, que são geralmente importantes para a preservação do patrimônio cultural. O segundo conjunto de dados empregado na estrutura proposta do SegCycle-SPADE é o conjunto de dados WikiArt. Este conjunto contém um grande número de obras de arte, geralmente de estilos diferentes. Este conjunto é utilizado para o aprendizado de estilos complexos, o que é geralmente útil para aprimorar obras de arte. Este conjunto possui 80.000 obras de arte em alta definição, com 27 designs diferentes, tornando-o mais útil para tarefas baseadas em aprendizado profundo (DL) de geração ou transformação de estilo.
Conjunto de Dados Miao Batik:
O conjunto de dados Miao Batik (https://doi.org/10.5281/zenodo.20807658) compreende 15.148 imagens de padrões de batique que retratam motivos culturalmente significativos. As imagens incluem uma variedade de desenhos tradicionais, como motivos de animais (por exemplo, borboletas e peixes), padrões baseados em plantas e motivos geométricos que carregam simbolismo cultural. Este conjunto de dados é um componente importante da estrutura proposta, pois fornece estruturas culturais autênticas que permitem ao módulo de segmentação identificar e preservar com precisão os limites dos motivos durante a reconstrução do padrão (Tabela 1). Neste estudo, motivos culturalmente importantes referem-se a elementos visuais simbólicos comumente documentados na literatura sobre o patrimônio cultural Miao e representados nas anotações do conjunto de dados, incluindo aves, borboletas, padrões florais e totens ancestrais. Esses motivos foram selecionados com base em sua significância cultural documentada e presença recorrente nos desenhos tradicionais de batique e bordado Miao, e não apenas na frequência de ocorrência ou composição espacial. As anotações de motivos orientadas por especialistas e os rótulos de segmentação foram obtidos da fonte original do conjunto de dados Miao Batik e utilizados diretamente neste estudo. Os autores não realizaram nenhuma anotação manual adicional, reanotação ou procedimentos de anotação guiados por especialistas. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas para o treinamento e avaliação da segmentação semântica.
| Parâmetro | Descrição |
| Nome do Conjunto de Dados | Miao Batik Cultural Pattern Dataset |
| Fonte do Conjunto de Dados | Repositório Zenodo (DOI: 10.5281/zenodo.20807658) |
| Domínio | Patrimônio Cultural Imaterial (PCI) / Análise de Padrões Têxteis |
| Número Total de Imagens | 15.148 imagens |
| Tipo de Imagem | Imagens digitais de padrões têxteis tradicionais de batique Miao |
| Categorias de Padrão | Motivos animais, motivos vegetais e motivos geométricos |
| Origem Cultural | Cultura étnica Miao, Província de Guizhou, China |
| Resolução Original das Imagens | Imagens de alta resolução (tipicamente ≥ 1.000 pixels no lado mais curto) capturadas como digitalizações ou fotografias brutas antes do pré-processamento |
| Resolução para Treinamento | Imagens redimensionadas para 256 × 256 pixels durante o pré-processamento |
| Disponibilidade de Anotações | As anotações de segmentação existentes fornecidas pelos criadores do conjunto de dados foram utilizadas sem modificações para treinamento e avaliação. Nenhum procedimento adicional de anotação manual, reetiquetagem ou confirmação por especialista foi realizado neste estudo. |
| Aplicação neste Estudo | Segmentação de motivos culturais, extração de características, preservação de motivos e reconstrução de padrões |
Tabela 1: Características do Conjunto de Dados de Padrões Culturais do Tingimento Miao Batik. Resumo do conjunto de dados de motivos culturais Miao Batik utilizado para segmentação semântica, análise de padrões culturais e reconstrução de motivos. A tabela descreve a fonte do conjunto de dados, características das imagens, categorias de motivos, origem cultural, resolução das imagens e seu papel dentro do framework proposto SegCycle-SPADE.
Conjunto de Dados WikiArt:
O conjunto de dados WikiArt [https://www.wikiart.org/] é um repositório digital de arte em larga escala e de grande popularidade, que compreende mais de 80.000 imagens de 27 estilos artísticos diferentes apresentados na Tabela 2. Os estilos incluem arte renascentista, impressionismo, cubismo e surrealismo. O conjunto de dados é muito importante na estrutura proposta, pois oferece conhecimento que permite ao módulo SPADE criar padrões enriquecidos culturalmente, mantendo ao mesmo tempo as informações estruturais obtidas a partir do processo de segmentação. O conjunto de dados compreende 56.000 imagens para treinamento e 12.000 imagens para validação e testes. As imagens do conjunto de dados auxiliam efetivamente no treinamento do modelo de aprendizado profundo (DL).
| Parâmetro | Descrição |
| Nome do Conjunto de Dados | Conjunto de Dados WikiArt |
| Fonte do Conjunto de Dados | Repositório WikiArt (https://www.wikiart.org/) |
| Domínio | Arte Digital e Pinturas |
| Número Total de Imagens | Aproximadamente 80.000 obras de arte |
| Imagens de Treinamento | 56.000 |
| Imagens de Validação | 12.000 |
| Imagens de Teste | 12.000 |
| Estilos Artísticos | 27 estilos artísticos, incluindo Renascença, Impressionismo, Cubismo, Surrealismo, Expressionismo, Realismo e Arte Abstrata |
| Resolução Original das Imagens | As resoluções originais das imagens variam entre as obras e fontes. As imagens foram redimensionadas para uma resolução uniforme de 256 × 256 pixels durante o pré-processamento. |
| Resolução de Treinamento | Imagens redimensionadas para 256 × 256 pixels durante o pré-processamento, antes da aprendizagem de estilo artístico e da síntese de imagens orientada por segmentação. |
| Particionamento do Conjunto de Dados | Particionamento aleatório estratificado (70% para treinamento, 15% para validação e 15% para teste), utilizando uma semente aleatória fixa de 42 |
| Estratégia de Amostragem de Estilo | Utilizou-se amostragem proporcional estratificada para preservar a distribuição dos 27 estilos artísticos nos subconjuntos de treinamento, validação e teste |
| Aplicação neste Estudo | Aprendizagem de estilo artístico, representação de estilo e síntese artística orientada por segmentação |
Tabela 2: Características do Conjunto de Dados WikiArt. Resumo do conjunto de dados WikiArt utilizado para aprendizado de estilo artístico e síntese de imagens guiada por estilo. A tabela descreve a origem do conjunto de dados, distribuição das imagens, cobertura de estilos artísticos, particionamento do conjunto de dados, resolução das imagens e sua aplicação dentro do framework proposto SegCycle-SPADE.
O conjunto de dados Miao Batik contém 15.148 imagens representando motivos culturais tradicionais dos Miao.32 O conjunto de dados está publicamente disponível por meio do Zenodo (https://doi.org/10.5281/zenodo.20807658). Antes do treinamento do modelo, todas as imagens foram inspecionadas visualmente e redimensionadas para 256 × 256 pixels, normalizadas e examinadas quanto a amostras corrompidas ou duplicadas. A triagem de controle de qualidade não resultou na exclusão de nenhuma imagem; portanto, todas as 15.148 imagens foram mantidas para análises subsequentes. O conjunto de dados foi particionado aleatoriamente em subconjuntos de treinamento (70%), validação (15%) e teste (15%) utilizando uma semente aleatória fixa de 42 para garantir a reprodutibilidade das divisões do conjunto de dados. O conjunto de dados WikiArt foi acessado por meio do repositório oficial do WikiArt (https://www.wikiart.org/) e contém mais de 80.000 obras de arte que abrangem 27 estilos artísticos. Para os experimentos de aprendizado de estilo, 56.000 imagens foram utilizadas para treinamento, 12.000 para validação e 12.000 para teste.
Pré-processamento dos Dados
Antes de treinar o framework proposto SegCycle-SPADE, o conjunto de dados de motivos culturais do Tingimento Miao e o conjunto de dados WikiArt foram submetidos a várias etapas de pré-processamento para garantir qualidade de imagem consistente e representação precisa de características. O mesmo pipeline básico de pré-processamento, incluindo remoção de ruído gaussiano, normalização, redimensionamento para uma resolução de entrada consistente e verificação da qualidade da imagem, foi aplicado a ambos os conjuntos de dados. No entanto, os conjuntos de dados desempenharam papéis distintos dentro do framework. O conjunto de dados WikiArt foi utilizado para aprendizado e síntese de estilo artístico, enquanto o conjunto de dados Miao Batik foi usado principalmente para segmentação e reconstrução de motivos culturais. Nenhuma alteração específica de pré-processamento foi feita além desses papéis específicos de tarefa. Para garantir um processamento consistente pelo modelo de aprendizado profundo (DL), as imagens foram inicialmente redimensionadas para uma resolução fixa. Esta etapa foi necessária porque as imagens em ambos os conjuntos de dados variavam em resolução dependendo de sua origem. O redimensionamento melhorou a eficiência computacional e evitou inconsistências dimensionais que poderiam afetar o treinamento. A segunda etapa de pré-processamento foi a normalização, na qual os valores dos pixels foram escalonados para uma faixa padronizada para estabilizar as atualizações de gradiente durante o treinamento. Em seguida, as imagens foram processadas usando filtragem gaussiana para reduzir o ruído que poderia interferir nas estruturas dos motivos culturais. Para o conjunto de dados Miao Batik, as máscaras existentes de segmentação de motivos culturais obtidas diretamente da fonte original do conjunto de dados foram utilizadas sem modificação para o treinamento e avaliação de segmentação semântica. Nenhuma nova máscara de segmentação foi gerada especificamente para este estudo.
Salvo indicação em contrário, as equações que descrevem métodos estabelecidos foram adaptadas de estudos anteriores e estão devidamente citadas. As equações que descrevem o CAFFM proposto e o framework de otimização composto SegCycle-SPADE foram desenvolvidas pelos autores para este estudo.
Considere uma imagem de entrada do conjunto de dados representada como Equação 1:
(1)
Aqui, H, W e C referem-se à altura da imagem, largura e número de canais de cor, respectivamente. Todas as imagens são redimensionadas para uma dimensão fixa H′ × W′, conforme mostrado na Equação 2:

Aqui, Ir é a imagem redimensionada. Os valores normalizados dos pixels são calculados de acordo com a Equação 3:
(3)
Isso ajuda a estabilizar o procedimento de treinamento. A filtragem de ruído é realizada utilizando um filtro gaussiano, conforme mostrado na Equação 4:

Aqui, G(σ) é um filtro gaussiano e * representa a convolução. Foi utilizado um filtro gaussiano com kernel 5 × 5 e desvio padrão de σ = 1,0. Foi aplicado preenchimento reflexivo aos pixels das bordas para reduzir artefatos de borda. Antes da escala e normalização, o processo de remoção de ruído foi realizado imediatamente após o carregamento da imagem. Para garantir um pré-processamento uniforme ao longo do estudo, a mesma configuração de filtro foi aplicada a todas as imagens dos conjuntos de dados Miao Batik e WikiArt. Para o conjunto de dados Miao Batik, as máscaras de segmentação são criadas de acordo com a Equação 5:

Aqui, M é uma máscara de segmentação utilizada para orientar o modelo SegFormer.
O pipeline de pré-processamento começa com a aquisição de imagens dos conjuntos de dados Miao Batik e WikiArt, conforme mostrado na Figura 3. Nenhuma técnica de aumento de dados foi empregada durante o treinamento. Após o pré-processamento, que incluiu redimensionamento, normalização, remoção de ruído gaussiano e preparação de máscaras de segmentação, as imagens foram utilizadas diretamente para o treinamento, validação e teste do framework proposto SegCycle-SPADE. O primeiro passo do pipeline de pré-processamento envolve o redimensionamento das imagens para um tamanho fixo, permitindo que o modelo de aprendizado profundo processe as imagens de forma mais eficiente. O segundo passo envolve a normalização, que converte os valores dos pixels em uma faixa numérica padronizada e facilita a convergência do modelo. O terceiro passo envolve a remoção de ruído, pela qual as imagens são limpas de ruídos indesejados para melhorar o reconhecimento de padrões. Além disso, para o conjunto de dados Miao Batik, as regiões dos motivos culturais são anotadas, permitindo a geração de máscaras utilizadas no módulo de segmentação do modelo proposto, garantindo que os motivos culturais sejam preservados durante a geração. A saída final desta etapa é um conjunto de dados limpo, pronto para o treinamento dos módulos de segmentação e geração do modelo proposto.

Figura 3. Pipeline de Pré-processamento de Dados para Imagens de Patrimônio Cultural. Fluxograma ilustrando os procedimentos de pré-processamento de imagens aplicados antes do treinamento do modelo. O pipeline inclui a aquisição do conjunto de dados, redimensionamento das imagens, normalização, remoção de ruído gaussiano, anotações existentes de motivos culturais e preparação de máscaras de segmentação. As imagens e máscaras resultantes são utilizadas como entradas para segmentação semântica e reconstrução de padrões. Clique aqui para visualizar uma versão maior desta figura.
Todas as imagens foram submetidas a um processo de controle de qualidade antes do treinamento do modelo. O conjunto de dados Miao Batik continha 15.148 imagens. Amostras corrompidas, duplicadas e de baixa qualidade já haviam sido tratadas pelos criadores originais do conjunto de dados; portanto, nenhuma imagem adicional foi excluída durante a triagem de controle de qualidade neste estudo. Consequentemente, todas as 15.148 imagens foram mantidas para análise. As imagens foram carregadas no formato RGB durante o pré-processamento e redimensionadas para 256 × 256 pixels utilizando interpolação bilinear. Os valores dos pixels foram escalonados do intervalo [0, 255] para [0, 1] dividindo-se por 255. Em seguida, foi aplicada normalização por canal utilizando valores médios de [0,485, 0,456, 0,406] e valores de desvio padrão de [0,229, 0,224, 0,225] para os canais vermelho, verde e azul, respectivamente. O pipeline de pré-processamento incluiu o carregamento da imagem, conversão para RGB, redimensionamento, escalonamento dos valores dos pixels, normalização e conversão em tensor. Quando necessário, imagens em escala de cinza foram convertidas para o formato RGB de três canais para manter a compatibilidade com os modelos de aprendizado profundo. Após o pré-processamento, as imagens foram divididas em subconjuntos de treinamento, validação e teste. Todas as etapas do framework SegCycle-SPADE — incluindo segmentação semântica, fusão de características, reconstrução de motivos e síntese artística baseada em SPADE — utilizaram uma resolução de entrada consistente de 256 × 256 pixels.
Segmentação por Padrão Semântico usando SegFormer
Após esta etapa de pré-processamento, as imagens limpas e normalizadas do conjunto de dados de motivos culturais do Tingimento Miao e do conjunto de dados WikiArt são inseridas no módulo de segmentação semântica com base na estrutura proposta do SegFormer-B2. O objetivo desta etapa é identificar e separar corretamente os motivos culturais presentes em padrões do patrimônio. A estrutura proposta do SegFormer baseia-se em uma arquitetura de transformador que incorpora um codificador Transformer hierárquico e um decodificador MLP leve para capturar com precisão informações contextuais globais, bem como informações estruturais detalhadas de padrões complexos do patrimônio. O modelo primeiro extrai representações de características em múltiplas escalas a partir da imagem de entrada, seguido pela fusão dessas representações por meio do decodificador para gerar padrões segmentados precisos. Isso garante que os padrões na imagem do patrimônio sejam corretamente segmentados em motivos como padrões geométricos, padrões florais e padrões simbólicos, separando-os assim do fundo, ao mesmo tempo que mantém sua integridade estrutural. Essas informações estruturais são posteriormente utilizadas nas fases seguintes da geração de padrões dentro da estrutura SegCycle-SPADE.
Seja a imagem de entrada pré-processada representada como Equação 6:
(6)
O codificador SegFormer divide a imagem em fragmentos e extrai características hierárquicas usando camadas de transformador, conforme mostrado na Equação 71:

Aqui, F denota os mapas de características em múltiplas escalas obtidos a partir do codificador de transformador. Essas características codificam tanto padrões locais de textura quanto relações contextuais globais entre as regiões de motivos. O modelo SegFormer extrai mapas de características em diferentes escalas conforme definido na Equação 8:

O uso de representações multiescala facilita a detecção de padrões de diferentes tamanhos dentro de motivos culturais. Por fim, as características são combinadas utilizando o decodificador MLP conforme mostrado na Equação 91:

Aqui, S denota o mapa final de segmentação previsto.
A base do SegFormer-B2 foi inicializada usando pesos pré-treinados no ImageNet e posteriormente ajustados no conjunto de dados Miao Batik para segmentação de motivos culturais. O ponto de controle pré-treinado foi obtido a partir da implementação oficial do SegFormer. Especificamente, o ponto de controle pré-treinado no ImageNet-1K MIT-B2 (mit_b2.pth) fornecido pelo repositório oficial do Segformer foi utilizado para inicializar a base do SegFormer-B2 antes do ajuste fino. Os pesos pré-treinados correspondem à base MIT-B2 lançada pelos autores do SegFormer e serviram como modelo de inicialização para o treinamento de segmentação semântica. As demais camadas específicas da tarefa foram inicializadas usando os procedimentos padrão do PyTorch para inicialização de pesos antes do treinamento.
Um codificador Transformer hierárquico de quatro estágios com incorporações de fragmentos sobrepostos é utilizado na arquitetura. No estágio inicial, o tamanho do fragmento foi definido como 7 × 7 com um passo de 4. Para cada um dos quatro estágios do codificador, as dimensões de incorporação foram 64, 128, 320 e 512. Ao longo dos quatro estágios, houve 1, 2, 5 e 8 cabeças de autoatenção multihead, e as profundidades correspondentes do codificador foram de 3, 4, 6 e 3 camadas. As características multiescala recuperadas do codificador foram agregadas usando um decodificador leve baseado inteiramente em MLP. Antes de gerar o mapa final de segmentação, o decodificador projetou as características de cada estágio do codificador em um único espaço de incorporação. Todos os blocos Transformer utilizaram a função de ativação Gaussian Error Linear Unit (GELU). Uma taxa de dropout de 0,1 foi utilizada durante o treinamento para melhorar a generalização e reduzir o sobreajuste.
Durante a fase de treinamento, o framework SegFormer recebe as imagens pré-processadas de ambas as bases de dados. As imagens da base de dados Miao Batik contêm regiões de motivos que servem como rótulos para o aprendizado supervisionado do modelo de segmentação. O codificador Transformer processa a imagem inteira e captura relações de longo alcance entre os componentes da imagem, o que é particularmente importante para padrões tradicionais de batique que contêm motivos distribuídos espacialmente. O mecanismo hierárquico de extração de características captura simultaneamente estruturas locais, como texturas geométricas repetidas. O decodificador MLP processa essas características extraídas e produz uma máscara de segmentação que destaca as regiões de motivos. Os mapas de segmentação gerados nesta etapa são subsequentemente utilizados como entradas estruturais para o módulo de atenção e a etapa de reconstrução de padrões, ajudando assim a preservar a autenticidade dos padrões gerados.
Os motivos culturais foram divididos em diferentes classes para segmentação semântica com base em suas características visuais e culturais. A taxonomia de segmentação compreendia motivos animais (por exemplo, borboletas, peixes, aves e outras fauna simbólicas), motivos vegetais (por exemplo, flores, folhas, videiras e padrões botânicos), motivos geométricos (por exemplo, formas repetidas, bordas e estruturas geométricas abstratas) e regiões de fundo que representam áreas sem motivos. Máscaras de segmentação em nível de pixel foram utilizadas para atribuir cada pixel a uma das classes predefinidas. Rótulos inteiros foram codificados da seguinte forma: Rótulo 0 = fundo, Rótulo 1 = motivos animais, Rótulo 2 = motivos vegetais e Rótulo 3 = motivos geométricos. As anotações de segmentação e os rótulos dos motivos foram obtidos diretamente da fonte original do conjunto de dados Miao Batik. Nenhum procedimento adicional de anotação manual, recodificação, verificação de contornos ou confirmação por especialista foi realizado neste estudo. As anotações existentes fornecidas pelos criadores do conjunto de dados foram utilizadas sem modificações para treinamento e avaliação.
O modelo SegFormer para segmentação de motivos culturais processa as imagens pré-processadas do conjunto de dados Miao Batik e do conjunto de dados WikiArt utilizando um mecanismo baseado em transformador para detecção precisa de regiões com padrões culturais, conforme mostrado na Figura 4. Primeiramente, a imagem de entrada contendo motivos culturais tradicionais é fornecida ao modelo SegFormer. O codificador Transformer extrai tanto informações contextuais globais quanto características estruturais locais a partir de fragmentos da imagem. As características resultantes em múltiplas escalas são fornecidas ao decodificador de segmentação, que utiliza uma Rede Mix Feed-Forward para refinar as representações de características e aprimorar a detecção de motivos. A saída do modelo SegFormer é uma máscara de segmentação que destaca os pixels correspondentes aos padrões culturais, suprimindo ao mesmo tempo as informações irrelevantes do plano de fundo. Os padrões culturais isolados servem então como orientação estrutural para as etapas subsequentes do framework SegCycle-SPADE.

Figura 4. Segmentação Semântica Baseada no SegFormer-B2 de Motivos Culturais. Arquitetura do módulo de segmentação semântica SegFormer-B2 utilizado para a extração de motivos culturais e treinado exclusivamente no conjunto de dados Miao Batik. O framework consiste em um codificador baseado em Transformer para extração de características em múltiplas escalas e um decodificador de segmentação leve para gerar máscaras de motivos. O modelo prevê quatro classes semânticas—animal, planta, geométrico e fundo—nas quais as máscaras de segmentação resultantes identificam regiões de motivos culturalmente significativos, suprimindo ao mesmo tempo informações irrelevantes de fundo. Essas saídas de segmentação fornecem orientação estrutural para as etapas subsequentes de fusão de características, reconstrução e síntese artística do framework proposto SegCycle-SPADE. Clique aqui para visualizar uma versão maior desta figura.
Não há necessidade de criar novas anotações de segmentação na estrutura sugerida. O conjunto de dados Miao Batik foi obtido de uma fonte pública já existente, e o modelo foi treinado utilizando as informações de motivos fornecidas pelos criadores do conjunto de dados. Durante o processo de aprendizado, o modelo SegFormer produziu mapas de segmentação semântica. Assim, o presente estudo não exigiu nenhum software adicional de anotação manual, diretrizes de anotação ou procedimentos de controle de qualidade de anotação.
CAFFM
Para melhorar a interação entre as características da segmentação semântica e as representações da reconstrução generativa, o estudo também propôs um CAFFM. O codificador SegFormer-B2 fornece mapas de características semânticas ao módulo CAFFM, enquanto a etapa de reconstrução CycleGAN fornece mapas de características generativas. Primeiro, camadas de projeção linear são usadas para projetar ambos os fluxos de características em um espaço comum de incorporação. Para o cálculo da atenção cruzada, representações de consulta (Q), chave (K) e valor (V) são criadas usando os tensores de características gerados. As relações entre as informações de motivos estruturais e os elementos de estilo artístico são então modeladas usando atenção cruzada com múltiplos cabeçotes. A normalização por camada, conexões residuais e camadas de alimentação direta com ativação GELU são então aplicadas às representações de características fundidas. O estágio de síntese baseado em SPADE recebe a saída do módulo CAFFM, permitindo a preservação de temas culturalmente significativos sem comprometer a coerência artística.
Para garantir a compatibilidade de características, as características de entrada são inicialmente projetadas, por meio de camadas de projeção linear, em um espaço de incorporação compartilhado com uma dimensão de incorporação de 256. As interconexões entre as informações estruturais semânticas e as representações estilísticas gerativas são então modeladas utilizando um mecanismo de atenção cruzada MultiHead com oito cabeças de atenção. O cálculo da atenção cruzada utiliza vetores de Consulta (Q), Chave (K) e Valor (V), gerados por camadas específicas de transformação linear. Para aumentar a estabilidade do treinamento e manter a integridade das características, são empregadas conexões residuais e Normalização de Camada para aprimorar ainda mais as representações de características fundidas. A aprendizagem não linear de características é então aprimorada pela aplicação de uma rede feed-forward com a função de ativação Unidade Linear de Erro Gaussiana (GELU). Uma representação de característica de saída com dimensão 256 é gerada pelo módulo e enviada a outras etapas para síntese criativa. O CAFFM combina com sucesso dados de estilo artístico com estruturas de motivos culturais utilizando uma técnica de fusão baseada em atenção cruzada, o que melhora a preservação dos motivos e a coerência visual nos padrões de patrimônio cultural reconstruídos.
No sistema proposto, as características estruturais são derivadas do conjunto de dados Miao Batik, enquanto as características estilísticas são aprendidas a partir do conjunto de dados WikiArt. Seja o mapa de características derivado da rede de segmentação SegFormer utilizando imagens do conjunto de dados Miao Batik denotado por Fs, enquanto o mapa de características derivado do ramo de extração de características estilísticas utilizando imagens WikiArt é denotado por Fa. O CAFFM proposto combina os dois domínios de características usando um mecanismo de atenção cruzada para aprender tanto as dependências estruturais quanto estilísticas dos padrões culturais. Tabela 3 apresenta todas as características arquitetônicas, incluindo dimensões de incorporação, camadas de normalização, funções de ativação e configuração de cabeças de atenção. Para um tamanho de imagem de entrada de 256 × 256 pixels, o codificador SegFormer-B2 produziu mapas de características semânticas de tamanho 64 × 64 × 128, enquanto o ramo de extração de características estilísticas produziu mapas de características de tamanho 64 × 64 × 128. Ambos os mapas de características foram projetados por meio de camadas lineares treináveis em um espaço de incorporação compartilhado de dimensão 256 antes da fusão por atenção cruzada.
| Parâmetro | Configuração |
| Framework Proposto | SegCycle-SPADE |
| Modelo de Segmentação Semântica | SegFormer-B2 |
| Etapas do Codificador SegFormer | 4 |
| Inicialização de Pesos | SegFormer-B2 pré-treinado no ImageNet-1K (Backbone MIT-B2) |
| Fonte do Checkpoint | Repositório Oficial NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); checkpoint: segformer.b2.512x512.ade.160k |
| Estratégia de Ajuste Fino | Ajuste fino completo no conjunto de dados Miao Batik |
| Tamanho do Patch Embedding | 7 × 7 |
| Stride do Patch | 4 |
| Dimensões de Embedding | 64, 128, 320 e 512 |
| Profundidades do Codificador | 3, 4, 6 e 3 |
| Cabeças de Atenção | 1, 2, 5 e 8 |
| Tipo de Decodificador | Decodificador All-MLP |
| Função de Ativação | GELU |
| Taxa de Dropout | 0,1 |
| Módulo de Aprimoramento de Características | Módulo de Fusão de Características Culturais com Atenção Cruzada (CAFFM) |
| Dimensão de Embedding do CAFFM | 256 |
| Cabeças de Atenção do CAFFM | 8 |
| Escala de Fusão do CAFFM | 4 |
| Modelo de Reconstrução | CycleGAN |
| Modelo de Geração de Estilo | SPADE |
| Conjunto de Dados Cultural | Conjunto de Dados Miao Batik |
| Conjunto de Dados de Estilo | Conjunto de Dados WikiArt |
| Imagens Miao Batik | 15.148 |
| Imagens WikiArt | Aproximadamente 80.000 |
| Resolução da Imagem de Entrada | 256 × 256 pixels |
| Formato de Cor | RGB |
| Método de Interpolação | Interpolação Bilinear |
| Método de Remoção de Ruído | Filtragem Gaussiana |
| Tamanho do Kernel Gaussiano | 5 × 5 |
| Sigma Gaussiana (σ) | 1 |
| Intervalo de Normalização | [0, 1] |
| Tamanho do Lote | 16 |
| Número de Épocas | 100 |
| Otimizador | Adam |
| Taxa de Aprendizado | 0,0002 |
| Parâmetros do Adam | β₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, decaimento de peso = 0 |
| Funções de Perda | Perda de Segmentação, Perda Adversária, Perda de Consistência Cíclica, Perda de Reconstrução, Perda de Preservação de Motivo e Perda de Consistência de Estilo |
| Estratégia de Divisão do Conjunto de Dados | Treinamento / Validação / Teste |
| Conjunto de Treinamento | 70% |
| Conjunto de Validação | 15% |
| Conjunto de Teste | 15% |
| Semente Aleatória | 42 |
| Métricas de Avaliação | Precisão de Segmentação, IoU, Coeficiente Dice, SSIM, PSNR e FID |
| Linguagem de Programação | Python 3.8.10 |
| Framework de Aprendizado Profundo | PyTorch 1.10.0 |
| Plataforma de Hardware | GPU NVIDIA RTX 3090 (24 GB VRAM), Intel Core i7 (11ª Geração), 32 GB de RAM |
| Ambiente Operacional | Ubuntu 20.04 LTS |
Tabela 3: Configuração Experimental e Configuração do Modelo. Resumo dos componentes arquiteturais, configurações de treinamento, ajustes de pré-processamento, conjuntos de dados, parâmetros de otimização, métricas de avaliação e ambiente computacional utilizados para a implementação e avaliação do framework proposto SegCycle-SPADE.
O módulo de atenção mapeia inicialmente o mapa de características em representações de consulta, chave e valor usando a Equação 10:

Aqui, Wq, Wk e Wv são matrizes de pesos ajustáveis. Os pesos de atenção são calculados com base na similaridade entre o vetor de consulta e o vetor-chave utilizando a Equação 1117:

Aqui, dk é a dimensão do vetor chave. A representação de características aprimorada é calculada multiplicando os pesos de atenção com a matriz de valores usando a Equação 12:

Aqui, Fa é a representação aprimorada da característica do mapa de características. A representação aprimorada da característica é calculada combinando as características originais de segmentação com as características aprimoradas obtidas usando o mecanismo de atenção por meio da Equação 13:
Aqui, Fe é o mapa de características aprimorado utilizado para a reconstrução do padrão. O CAFFM é estendido com um mecanismo de atenção cruzada em múltiplas escalas para extrair características de motivos culturais em diferentes escalas. Seja Fsi representando as características de segmentação na escala i, enquanto Faj representa as características de estilo artístico na mesma escala. A representação final da característica é definida usando a Equação 14:

Aqui, Qi, Ki e Vi representam, respectivamente, as matrizes de consulta, chave e valor na escala i, e N denota o número de escalas de características. Neste estudo, N = 4, correspondendo aos mapas de características extraídos em resoluções espaciais de 1/4, 1/8, 1/16 e 1/32 do tamanho da imagem de entrada. Essas representações de características em múltiplas escalas foram fundidas utilizando pesos de atenção aprendíveis antes da reconstrução e da síntese artística. A extensão acima permite que o método extraia motivos e texturas culturais globais para reconstruir padrões culturais. O CAFFM situa-se entre a etapa de segmentação baseada no SegFormer e a etapa de síntese criativa baseada no SPADE no sistema proposto SegCycle-SPADE. Primeiramente, enquanto o CycleGAN cria simultaneamente características de reconstrução com informações estilísticas e relacionadas a padrões, o SegFormer-B2 recupera mapas de características semânticas que descrevem as propriedades estruturais dos motivos culturais. O módulo CAFFM recebe esses dois fluxos de características e utiliza fusão baseada em atenção cruzada para identificar relações entre as representações estruturais e artísticas. A fim de criar padrões culturalmente autênticos mantendo a consistência semântica e as características estruturais, os mapas de características fundidos resultantes são então enviados ao módulo SPADE para síntese criativa orientada por segmentação.
Reconstrução de Padrão usando CycleGAN
Uma vez concluída a etapa de realce de características baseada na atenção, os mapas de características conterão as estruturas de motivos culturais aprimoradas. No entanto, os mapas de características ainda podem conter regiões de padrão incompletas ou danificadas. Portanto, para resolver o problema da reconstrução dos padrões, a estrutura proposta utilizará o modelo CycleGAN. Na estrutura proposta, os dois domínios serão os padrões originais de motivos culturais e os padrões reconstruídos de motivos culturais. Utilizando as características aprimoradas das etapas anteriores, o modelo CycleGAN reconstruirá os padrões culturais mantendo a consistência estrutural. Isso garantirá que padrões culturais, como padrões geométricos, florais e simbólicos, mantenham sua disposição espacial. As imagens originais de Batik Miao foram submetidas a operações de mascaramento aleatório e oclusão parcial para gerar motivos culturais incompletos ou danificados. Esses procedimentos de degradação simularam regiões de padrão ausentes e danos estruturais comumente observados em artefatos de patrimônio cultural deteriorados. As imagens degradadas foram usadas como entradas para o módulo de reconstrução, enquanto as imagens originais correspondentes serviram como imagens de referência para avaliação de desempenho e análise da qualidade da reconstrução. Essa estratégia permitiu que o modelo aprendesse a restaurar estruturas de motivos ausentes, preservando ao mesmo tempo a consistência semântica e as características culturais.
Seja X o domínio dos padrões culturais incompletos e Y o domínio dos padrões culturais reconstruídos. Os dois geradores aprendem a realizar a mapeamento bidirecional usando a Equação 15:

Aqui, GE é usado para reconstruir estruturas de motivos e FM é usado para mapear os padrões de volta ao domínio original. A perda adversarial é utilizada para garantir que os padrões reconstruídos sejam realistas (Equação 16)30

Aqui, DY é o discriminador usado para distinguir padrões reais e reconstruídos, e GE(x) denota o padrão reconstruído gerado. O CycleGAN também impõe a consistência cíclica para preservar a disposição estrutural dos motivos culturais (Equação 17)30.

A função de perda final é definida utilizando a Equação 1830:

Aqui, λi denota o coeficiente de ponderação para a perda de consistência cíclica e foi definido como 10 durante o treinamento, em conformidade com a formulação original do CycleGAN. Esse valor foi escolhido para equilibrar a aprendizagem adversarial e a consistência de reconstrução entre os domínios de origem e destino.
O módulo de reconstrução CycleGAN consiste em dois geradores e dois discriminadores para tradução bidirecional de imagens. Cada gerador segue uma arquitetura de rede residual composta por uma camada convolucional inicial 7 × 7, seguida por duas camadas convolucionais de redução de resolução, nove blocos residuais e duas camadas de aumento de resolução. Todas as operações convolucionais utilizam um tamanho de kernel de 3 × 3, exceto a camada de entrada, que emprega um kernel 7 × 7 para extração aprimorada de características. A normalização por instância é aplicada após cada camada convolucional para melhorar a estabilidade do treinamento, enquanto a ativação ReLU é usada em toda a rede do gerador. A camada de saída utiliza uma função de ativação Tanh para gerar saídas de imagem normalizadas. O discriminador segue uma arquitetura PatchGAN 70 × 70, composta por uma série de camadas convolucionais com tamanhos de kernel de 4 × 4 e canais de características progressivamente crescentes. A normalização por instância e a ativação LeakyReLU (inclinação negativa = 0,2) são empregadas no discriminador para melhorar a discriminação de características e a aprendizagem adversarial. O módulo CycleGAN recebe como entrada imagens pré-processadas de motivos culturais e gera representações de padrões reconstruídos, que posteriormente são encaminhadas ao CAFFM para integração com características de segmentação. O treinamento do CycleGAN foi realizado utilizando o otimizador Adam (β₁ = 0,5, β₂ = 0,999) com uma taxa de aprendizado inicial de 0,0002. A taxa de aprendizado foi mantida constante durante as primeiras 100 épocas e posteriormente reduzida linearmente até zero ao longo do período restante de treinamento. Um buffer de replay contendo 50 imagens previamente geradas foi utilizado para estabilizar o treinamento do discriminador. Os geradores e discriminadores foram atualizados utilizando uma razão de atualização 1:1, com uma atualização do gerador seguida por uma atualização do discriminador em cada iteração de treinamento.
O processo de reconstrução do CycleGAN baseia-se nos mapas de características aprimorados obtidos utilizando o mecanismo CAFFM apresentado na Figura 5. Os mapas de características contêm motivos culturais aprimorados provenientes das etapas anteriores de segmentação e do CAFFM. Esses mapas são utilizados como entrada para o primeiro gerador GE. O primeiro gerador GE aprende o mapeamento necessário para reconstruir padrões culturais. As saídas são então encaminhadas ao discriminador DY para distinguir entre padrões culturais reais e padrões reconstruídos. O discriminador DY auxilia o gerador GE a produzir saídas realistas. Para garantir que os padrões culturais não sejam distorcidos durante a reconstrução, o segundo gerador FM realiza um mapeamento com consistência cíclica. O segundo gerador FM mapeia as saídas de volta ao domínio original. As saídas são então avaliadas pelo discriminador para assegurar realismo. As saídas finais são subsequentemente encaminhadas ao módulo SPADE para geração de estilo artístico na próxima etapa do framework proposto SegCycle-SPADE.

Figura 5. Fluxo de Trabalho da Reconstrução de Padrões Baseado no CycleGAN. Fluxo de trabalho do módulo de reconstrução CycleGAN. Representações de características com realce de atenção são fornecidas como entradas para a rede geradora, a fim de reconstruir motivos culturais incompletos. O discriminador avalia as saídas reconstruídas em comparação com padrões de referência, enquanto o mapeamento de consistência cíclica preserva a integridade estrutural durante a tradução bidirecional de imagens. Os motivos reconstruídos são posteriormente encaminhados ao módulo SPADE para síntese de estilo artístico. Clique aqui para visualizar uma versão maior desta figura.
Geração de Estilo Artístico usando SPADE
Posteriormente, os motivos culturais reconstruídos são submetidos ao módulo SPADE para a geração de estilo artístico. O objetivo principal do módulo SPADE é adicionar texturas visualmente mais ricas de estilo artístico aos motivos culturais reconstruídos, sem comprometer o layout estrutural dos motivos. O SPADE é uma técnica de geração condicional de imagens que utiliza o conceito de segmentação de imagens para a geração de imagens. Mapas semânticos multicanais correspondentes às classes predeterminadas de motivos foram codificados a partir das máscaras de segmentação semântica produzidas pelo SegFormer-B2. O gerador SPADE recebeu esses mapas codificados como entradas condicionantes. Os parâmetros de escalamento espacialmente adaptativo (γ) e de bias (β) foram gerados processando os mapas semânticos por meio de camadas convolucionais dentro de cada camada SPADE. Assim, o gerador pôde manter os limites dos motivos, os layouts estruturais e as informações semânticas durante a síntese artística, aplicando esses parâmetros às ativações de características normalizadas. A orientação semântica conseguiu influenciar tanto a reconstrução estrutural de alto nível quanto a síntese de textura de baixo nível, já que o processo condicionante foi realizado em várias camadas do gerador SPADE. Como resultado, os padrões artísticos gerados incorporaram características estilísticas obtidas do conjunto de dados WikiArt, mantendo ao mesmo tempo as estruturas dos motivos culturais identificadas durante a etapa de segmentação.
O conjunto de dados WikiArt, que inclui obras de 27 categorias artísticas diferentes—como Renascença, Impressionismo, Cubismo, Expressionismo, Surrealismo, Realismo e Arte Abstrata—foi utilizado como recurso principal para compreender estilos artísticos. A fim de expor o modelo a uma variedade de traços criativos e aprimorar a generalização de estilo, imagens de estilo foram selecionadas aleatoriamente das diversas categorias durante o treinamento. O conjunto de dados foi dividido em subconjuntos de treinamento, validação e teste com representação equilibrada das categorias artísticas para reduzir o viés de estilo. Para garantir representação equilibrada de todas as 27 categorias artísticas, foi utilizada amostragem estratificada. As amostras de cada categoria foram alocadas proporcionalmente aos subconjuntos de treinamento, validação e teste, preservando a distribuição original das classes. O módulo CAFFM foi usado para mesclar os aspectos de estilo derivados das imagens WikiArt com as características de reconstrução produzidas pelo CycleGAN. Para permitir que a rede de síntese transfira qualidades artísticas mantendo as estruturas semânticas e os limites de motivos culturais derivados dos mapas de segmentação, as representações fusionadas resultantes foram fornecidas como informação de condicionamento ao gerador SPADE. A estrutura proposta foi capaz de produzir padrões artísticos culturalmente autênticos com representações estruturais e estilísticas consistentes graças a essa técnica de condicionamento de estilo.
O SPADE também introduz parâmetros adaptativos espacialmente que dependem do mapa de segmentação. Os parâmetros podem ser definidos conforme mostrado na Equação 191:

Aqui, γ(S) é o parâmetro de escala com variação espacial e β(S) é o parâmetro de viés com variação espacial. Os parâmetros podem ajudar o gerador a criar diferentes texturas e estilos dependendo da região semântica nas imagens. A obra de arte cultural final pode ser definida conforme mostrado na Equação 20:

Aqui, GE é o gerador SPADE, XrP é o padrão reconstruído e SM é o mapa de segmentação. A obra final mantém a integridade estrutural dos motivos culturais enquanto aprimora a aparência artística. Uma função de perda composta que equilibra a precisão da segmentação semântica, a preservação de motivos culturais, a qualidade da reconstrução de padrões e a consistência do estilo artístico foi utilizada para otimizar a arquitetura proposta SegCycle-SPADE. Uma mistura ponderada da perda de segmentação (Lseg), perda adversarial (Ladv), perda de consistência cíclica (Lcycle), perda de reconstrução (Lrecon), perda de preservação de motivo (Lmotif) e perda de consistência de estilo (Lstyle) foi utilizada para estabelecer o objetivo geral de treinamento. A função de perda total é definida na Equação 21:
(21)
Para garantir a consistência estrutural entre os motivos culturais de entrada e os reconstruídos, o coeficiente da perda de consistência cíclica foi definido como 10. Para manter características finas dos motivos e aprimorar a precisão visual, o coeficiente da perda de reconstrução foi ajustado para 5. Para destacar a preservação de padrões estruturais culturalmente essenciais durante a síntese artística, utilizou-se um coeficiente de 2 para a perda de preservação de motivos. A fim de promover a transferência de estilo artístico sem distorcer excessivamente as estruturas semânticas dos motivos, o coeficiente da perda de consistência de estilo foi ajustado para 1. Para manter uma contribuição equilibrada entre a geração realista de imagens e a segmentação precisa dos motivos, pesos iguais foram atribuídos às perdas de segmentação e adversariais. As representações de estilo baseadas em características do conjunto de dados WikiArt foram utilizadas para calcular a perda de consistência de estilo. Em particular, características de estilo artístico foram capturadas por meio de correlações de matrizes de Gram extraídas de mapas de características profundas. A diferença da norma de Frobenius entre as matrizes de Gram da imagem de estilo de destino e da imagem gerada foi utilizada para calcular a perda de estilo, conforme mostrado na Equação 22:

Aqui, Gl é a matriz de Gram calculada a partir da lª camada de características, Igen denota a imagem artística gerada, Istyle denota a imagem de estilo alvo do conjunto de dados WikiArt e F denota a norma de Frobenius. Essa formulação permite que o framework proposto preserve as características artísticas, ao mesmo tempo que mantém a integridade estrutural e semântica dos motivos culturais.
As representações de características fundidas produzidas pelo módulo CAFFM são utilizadas como entradas condicionantes para o módulo SPADE, que atua como o componente de síntese artística da estrutura proposta. O gerador SPADE é composto por sete blocos residuais SPADE com uma dimensão de características latentes de 256 canais e gera imagens de saída com resolução de 256 × 256 pixels. Os mapas de segmentação semântica obtidos a partir do módulo SegFormer–CAFFM são utilizados como entradas condicionantes ao longo de todas as camadas residuais SPADE. As camadas SPADE são aplicadas antes das funções de ativação dentro de cada bloco residual, permitindo um condicionamento semântico guiado pela segmentação. Por meio de operações sucessivas de interpolação e convolucionais, a representação de características latentes é refinada progressivamente para gerar padrões artísticos de alta resolução, preservando ao mesmo tempo a consistência semântica e a estrutura dos motivos. São utilizadas funções de ativação LeakyReLU em todo o gerador, e uma função de ativação Tanh é aplicada na camada de saída para produzir imagens normalizadas.
Algoritmo e Fluxo de Trabalho
O framework SegCycle-SPADE integra segmentação semântica, fusão de características, reconstrução de padrões e síntese de estilo artístico em um único pipeline de treinamento. O fluxo de trabalho inicia com a aquisição e pré-processamento do conjunto de dados, incluindo redimensionamento de imagens, normalização, remoção de ruídos e preparação das máscaras de segmentação. As imagens pré-processadas são posteriormente processadas usando a rede de segmentação SegFormer-B2 para extrair representações semânticas de motivos. As características de segmentação resultantes são fundidas com características de reconstrução por meio do CAFFM, permitindo a interação entre informações estruturais dos motivos e representações de características artísticas. Os mapas de características fundidos são então fornecidos ao módulo de reconstrução CycleGAN, que restaura estruturas de motivos culturais incompletas, preservando a consistência semântica. Os padrões reconstruídos são subsequentemente enviados ao gerador SPADE para síntese artística orientada por segmentação, permitindo aprimoramento estilístico enquanto mantém os limites dos motivos e a autenticidade estrutural. Durante o treinamento, os parâmetros do modelo são otimizados usando a função de perda composta descrita nas Equações 21 e 22, que equilibra a precisão da segmentação, a preservação de motivos, a qualidade de reconstrução e a consistência do estilo artístico. Um fluxo de implementação detalhado, passo a passo, incluindo carregamento do conjunto de dados, pré-processamento, inicialização do modelo, iterações de treinamento, procedimentos de validação, seleção de pontos de controle e avaliação final, é fornecido no Arquivo Suplementar 1 (Algoritmo 1). O fluxo de trabalho algorítmico completo foi implementado com um tamanho de lote de 16, taxa de aprendizado de 0,0002 e 100 épocas de treinamento. Uma semente aleatória fixa de 42 foi utilizada para partição do conjunto de dados, inicialização do modelo e todos os experimentos de treinamento. A semente foi aplicada de forma consistente nos geradores de números aleatórios do Python, NumPy e PyTorch para garantir reprodutibilidade. O otimizador Adam foi configurado com β₁ = 0,5, β₂ = 0,999 e sem decaimento de peso (weight decay = 0). Os pontos de controle do modelo foram selecionados com base na maior pontuação de IoU de validação alcançada no conjunto de dados de validação.
Otimização da Função de Perda
Para preservar as estruturas de motivos culturais durante a reconstrução e a síntese artística, o framework proposto emprega um objetivo de otimização composto que combina perdas de segmentação, adversarial, consistência cíclica, reconstrução, preservação de motivos e consistência de estilo. A formulação matemática completa, os coeficientes de ponderação e a definição da perda de estilo são fornecidos nas Equações 21 e 22 na subseção Geracao de Estilo Artístico usando SPADE. O componente de preservação de motivos penaliza desvios estruturais entre as regiões de motivos previstos e as máscaras de segmentação correspondentes do padrão-ouro, incentivando assim a preservação de estruturas de padrões culturalmente significativas ao longo do processo de reconstrução.