Artículo de investigación

Reconstrucción guiada por segmentación semántica y síntesis de estilo artístico de patrones del patrimonio cultural inmaterial mediante un marco de aprendizaje profundo

DOI:

10.3791/71577

14 de agosto de 2026

En este artículo

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Este protocolo describe un flujo de trabajo de aprendizaje profundo para la segmentación semántica, reconstrucción y síntesis de estilos artísticos de patrones del patrimonio cultural inmaterial, utilizando extracción de características basada en transformadores, reconstrucción adversaria y generación espacialmente adaptativa de imágenes para apoyar la preservación digital y aplicaciones creativas del patrimonio.

Resumen

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La preservación digital y la reconstrucción de patrones del patrimonio cultural inmaterial (ICH) han atraído una atención creciente con el avance de las técnicas de síntesis de imágenes basadas en aprendizaje profundo. Los enfoques existentes basados en SegCycle-SPADE han demostrado potencial para la segmentación estructural y la reconstrucción artística de patrones artesanales tradicionales; sin embargo, persisten limitaciones, como la diversidad limitada de los conjuntos de datos, la incorporación insuficiente de semántica cultural y la preservación inadecuada de las características estructurales de los patrones durante la reconstrucción. Para abordar estos desafíos, este estudio propone un marco SegCycle-SPADE mejorado para la segmentación semántica y la reconstrucción artística de tipos de patrones de ICH. Se emplea un modelo de segmentación basado en Transformador, SegFormer, para identificar con precisión los límites de los motivos y las regiones del patrón. Además, se introduce un Módulo de Fusión de Características Culturales con Atención Cruzada para realzar los motivos culturalmente significativos y mejorar la representación de características. La traducción y reconstrucción del patrón se realizan utilizando CycleGAN, mientras que la Denormalización Espacialmente Adaptativa (SPADE) se utiliza para la síntesis de estilo artístico con el fin de mantener la coherencia semántica entre los mapas de segmentación y las imágenes generadas. Para mejorar la generalización del modelo y la diversidad artística, el marco se entrena utilizando tanto el conjunto de datos de motivos culturales Miao Batik como el conjunto de datos WikiArt. Los resultados experimentales demuestran que el marco SegCycle-SPADE guiado por atención propuesto mejora la precisión de segmentación y el rendimiento en la reconstrucción de patrones del patrimonio en comparación con los métodos existentes de reconstrucción basados en redes generativas antagónicas (GAN). El marco propuesto ofrece una solución escalable para la documentación asistida por inteligencia artificial, la reconstrucción y la revitalización artística de diseños de patrones tradicionales.

Introducción

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El patrimonio cultural, que incluye elementos intangibles como costumbres, lenguas y creencias, y elementos tangibles como obras de arte, edificios y registros escritos, es una manifestación fundamental de la historia, la creatividad y la identidad humanas1. La conservación del patrimonio busca permitir que las comunidades se reconecten con sus orígenes y posibilita que las generaciones futuras se beneficien de su memoria cultural colectiva. Asimismo, promueve el entendimiento intercultural, la apreciación de tradiciones y costumbres diversas, y el reconocimiento de diferentes narrativas históricas. Estos bienes culturales nos ayudan a comprender los valores, perspectivas y experiencias de generaciones pasadas y contribuyen a la formación de identidades sociales contemporáneas y a la continuidad cultural. Los principios básicos de la preservación del patrimonio cultural se ilustran en Figura 1.

figure-introduction-1
Figura 1. Vista conceptual de la reconstrucción de patrones del patrimonio cultural mediante el marco SegCycle-SPADE. Ilustración esquemática del enfoque propuesto para reconstruir y realzar patrones del patrimonio cultural inmaterial. El flujo de trabajo incluye la recopilación de conjuntos de datos procedentes de las bases de datos Miao Batik y WikiArt, preprocesamiento de imágenes, segmentación semántica mediante SegFormer-B2, fusión de características mediante el Módulo de Fusión de Características Culturales con Atención Cruzada (CAFFM), reconstrucción de patrones mediante CycleGAN, síntesis de estilo artístico mediante SPADE y evaluación final mediante métricas de segmentación y reconstrucción. Las flechas indican el flujo de datos y representaciones de características a través del marco. Haga clic aquí para ver una versión ampliada de esta figura.

La memoria colectiva y el legado cultural de la sociedad humana se encarnan en el patrimonio cultural inmaterial (PCI), que sirve como un medio importante de expresión artística e identidad cultural. Sin embargo, el PCI enfrenta desafíos significativos debido a los efectos de la globalización y la digitalización2,3,4. Muchas prácticas de PCI en peligro requieren nuevos enfoques para su preservación y desarrollo debido a la disminución del número de artesanos calificados y a la limitada capacidad de adaptación a los mercados modernos5,6. Como un área importante de la investigación sobre PCI, el diseño sostenible enfatiza el desarrollo integrado de la cultura, la sociedad y el medio ambiente, y proporciona una vía práctica para la preservación continua del PCI. A través de enfoques de diseño sostenible, el PCI puede revitalizarse adaptándose a las necesidades de la sociedad contemporánea7,8.

En este estudio, el término «patrones del patrimonio cultural inmaterial» se refiere a representaciones de motivos visuales que comunican y preservan valores culturales inmateriales subyacentes. En consecuencia, el marco propuesto tiene como objetivo preservar y documentar la información cultural asociada a estos motivos mientras se reconstruyen sus formas visuales.

El bordado miao y el batik son formas significativas del PCI chino, que reflejan la historia, creencias y tradiciones de la comunidad miao mediante motivos simbólicos como aves, mariposas y tótems ancestrales9. Estos motivos están profundamente arraigados en la vestimenta ritual y las prácticas festivas, y contribuyen al desarrollo cultural y económico local10,11. Los avances en tecnologías digitales, particularmente la inteligencia artificial (AI) y el aprendizaje profundo (DL), han creado nuevas oportunidades para la preservación, análisis, reconstrucción y documentación del patrimonio cultural. El batik miao de Guizhou, una de las tradiciones de batik mejor conservadas en China, sirve como un medio importante para transmitir el conocimiento cultural, creencias, costumbres y rituales del pueblo miao12,13,14,15,16.

Estudios recientes han demostrado el potencial del aprendizaje profundo (DL) para la preservación del patrimonio cultural y la reconstrucción de patrones, logrando una mayor precisión en la segmentación (precisión por píxel = 88,6 %, media de intersección sobre unión [IoU] = 78,1 %) y un mejor desempeño en la reconstrucción en comparación con U-Net y DeepLabV3+. Sin embargo, aún persisten varios desafíos. Los enfoques existentes basados en redes generativas antagónicas (GAN) suelen tener dificultades para preservar detalles estructurales finos en patrones complejos.17, mientras que la diversidad limitada de los conjuntos de datos restringe la generalización del modelo a través de dominios culturales18Además, los modelos de traducción de imagen a imagen, como CycleGAN, pueden no mantener la consistencia semántica entre los mapas de segmentación y las imágenes generadas.19, y la ausencia de mecanismos de atención puede provocar la pérdida de detalles de motivos culturalmente significativos durante la reconstrucción20Por lo tanto, se necesita un marco mejorado que integre la segmentación basada en transformadores, el aprendizaje de características guiado por la atención y el entrenamiento con múltiples conjuntos de datos para una reconstrucción efectiva de los patrones de HIC.

Han surgido nuevas oportunidades para la preservación del patrimonio cultural mediante la digitalización del bordado Miao y el rápido avance de la inteligencia artificial generativa. Los modelos de difusión, una clase emergente de modelos generativos profundos, han demostrado un rendimiento notable en tareas de visión por computadora debido a sus poderosas capacidades de generación de contenido21,22,23,24,25. Durante el proceso de difusión inversa, el modelo aprende gradualmente a reconstruir los datos originales a partir de representaciones ruidosas26,27,28. Estudios previos también han explorado la aplicación de tecnologías de reconstrucción tridimensional y diseño asistido por computadora (CAD) para la preservación y difusión del patrimonio cultural.

Aunque las redes neuronales convolucionales (CNN) y las GAN funcionan bien en la generación de imágenes y la preservación de características, aún enfrentan desafíos relacionados con campos receptivos limitados, colapso de modos e inestabilidad durante el entrenamiento29. Las arquitecturas basadas en transformadores, como SegFormer y Segmenter, sobresalen en captar el contexto global y las relaciones semánticas; sin embargo, son computacionalmente intensivas y pueden tener dificultades con detalles finos. Aunque los modelos de difusión como Stable Diffusion demuestran fuertes capacidades de generación de imágenes, a menudo carecen de control preciso sobre las características estructurales y artísticas de los diseños generados. Además, la mayoría de los enfoques existentes emplean estrategias de entrenamiento independientes que limitan el intercambio efectivo de información y la optimización colaborativa entre los componentes de segmentación y generación, lo que resulta en un equilibrio entre precisión estructural y autenticidad artística30.

Modelos recientes basados en difusión, como la difusión latente y la difusión estable (Stable Diffusion), logran una síntesis de imágenes de alta calidad, pero requieren un denoising iterativo, lo que incrementa el costo computacional y el tiempo de inferencia. Además, mantener motivos culturales finos y consistencia estructural sigue siendo un desafío sin mecanismos especializados de acondicionamiento. Los modelos generativos basados en transformadores capturan eficazmente relaciones contextuales globales, pero a menudo necesitan conjuntos de datos a gran escala y recursos computacionales sustanciales. En contraste, el marco propuesto SegCycle-Normalización Espacialmente Adaptativa (SegCycle-SPADE) combina segmentación basada en SegFormer, fusión de características con atención cruzada, reconstrucción mediante CycleGAN y síntesis guiada por SPADE para proporcionar una guía estructural explícita, mejorando así la preservación de motivos, la coherencia semántica y la reconstrucción controlable de patrones del patrimonio cultural.

La mayoría de las técnicas modernas de segmentación semántica se basan en CNN completamente convolucionales (FCNN) con arquitecturas en forma de U31. Durante la etapa de codificación, se extraen características profundas con campos receptivos grandes mediante una serie de operaciones de convolución y submuestreo. La etapa de decodificación restaura progresivamente la resolución espacial mediante sobremuestreo, permitiendo finalmente la predicción semántica a nivel de píxel. Al compensar la pérdida de información espacial durante el submuestreo y mejorar el rendimiento de la segmentación en una amplia gama de aplicaciones, las conexiones de salto permiten integrar directamente información de alta resolución proveniente de diferentes niveles del codificador en el decodificador32.

Si bien los métodos recientes basados en GAN, CNN y difusión han mostrado resultados prometedores en la generación de imágenes y la restauración del patrimonio cultural, a menudo tienen dificultades para mantener la coherencia semántica, preservar los motivos estructurales finos y garantizar una reconstrucción reproducible en diversos patrones culturales. La mayoría de los enfoques existentes tratan la segmentación, la reconstrucción y la síntesis de estilo como procesos separados, lo que puede provocar la pérdida de elementos culturalmente significativos y resultados inconsistentes. Para abordar esta brecha metodológica, este estudio propone un marco unificado SegCycle-SPADE que integra la segmentación semántica basada en SegFormer, un nuevo Módulo de Fusión de Características Culturales con Atención Cruzada (CAFFM), la reconstrucción basada en CycleGAN y la síntesis de estilo guiada por SPADE. Al integrar explícitamente la información de segmentación estructural con el aprendizaje generativo de características, el marco propuesto permite una reconstrucción más confiable, semánticamente coherente y reproducible de los motivos del patrimonio cultural inmaterial (ICH), preservando al mismo tiempo la autenticidad cultural y la calidad artística.

En este estudio se identifican tres limitaciones principales de los enfoques actuales de reconstrucción del patrimonio cultural: (i) la preservación insuficiente de motivos estructurales finos en los métodos de reconstrucción basados en GAN; (ii) la generalización limitada derivada del entrenamiento con conjuntos de datos pequeños o específicos del dominio; y (iii) la consistencia semántica inadecuada entre las salidas de segmentación y las imágenes generadas en los marcos de traducción de imagen a imagen. Además, la segmentación, la reconstrucción y la síntesis de estilo comúnmente se tratan como procesos separados, lo que provoca la pérdida de elementos culturalmente importantes durante la reconstrucción. Al combinar la segmentación semántica basada en transformadores, la fusión de características con atención cruzada, la reconstrucción mediante CycleGAN y la síntesis artística guiada por SPADE dentro de una arquitectura unificada, el marco propuesto SegCycle-SPADE aborda estas limitaciones y mejora la preservación de motivos, la consistencia semántica y la autenticidad artística en la reconstrucción de patrones del patrimonio cultural inmaterial (ICH).

El objetivo principal de este estudio es desarrollar un marco SegCycle-SPADE mejorado para la reconstrucción artística guiada por segmentación semántica de patrones de ICH. El marco integra SegFormer para la segmentación precisa de motivos culturales, CycleGAN para la reconstrucción de patrones y SPADE para la síntesis artística con consistencia de estilo. Para mejorar la representación de características y preservar detalles estructurales finos, se introduce un CAFFM para facilitar una interacción efectiva entre las características de segmentación y las generativas. Entrenado con los conjuntos de datos Miao Batik y WikiArt, el marco propuesto mejora la autenticidad de la reconstrucción, la consistencia de estilo y la preservación de motivos culturalmente significativos.

Al combinar la segmentación semántica, la fusión de características guiada por atención, la reconstrucción de patrones y la síntesis de estilo dentro de una arquitectura unificada, este estudio presenta un nuevo marco SegCycle-SPADE para la reconstrucción artística de patrones de patrimonio cultural. Las principales contribuciones de este trabajo son las siguientes. Primero, se desarrolla un nuevo marco de reconstrucción guiado por segmentación semántica mediante la integración de SegFormer, lo que permite la extracción y preservación precisas de motivos culturales intrincados y elementos estructurales. Segundo, se introduce un nuevo módulo CAFFM para fusionar eficazmente las características de segmentación con representaciones generativas, permitiendo al modelo capturar relaciones de largo alcance entre los motivos culturales y los patrones de estilo artístico. Tercero, el CAFFM propuesto mejora la preservación de elementos culturalmente significativos al mismo tiempo que aumenta el realismo visual y la coherencia estructural de los patrones del patrimonio reconstruidos. Cuarto, mediante la integración de CycleGAN para la reconstrucción de patrones culturales y SPADE para la síntesis artística guiada por segmentación, el marco garantiza tanto la precisión semántica como la autenticidad estilística en las salidas generadas. Quinto, para mejorar la generalización y la diversidad artística, el modelo se entrena utilizando el conjunto de datos de motivos culturales Miao Batik para el aprendizaje de patrones culturales y el conjunto de datos WikiArt para la representación de estilos artísticos. WikiArt sirve como un conjunto de datos auxiliar para evaluar la capacidad de generalización del marco, la solidez del aprendizaje de características y la eficacia del control de estilo en diversos contextos visuales, y no como un estilo objetivo para su aplicación directa en productos del patrimonio cultural Miao. Finalmente, en comparación con los métodos existentes basados en GAN para la reconstrucción del patrimonio cultural, los resultados experimentales demuestran que el marco propuesto SegCycle-SPADE logra una mayor precisión de segmentación, calidad de reconstrucción y consistencia estilística.

Protocolo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El marco propuesto de SegCycle-SPADE está diseñado para reconstruir y mejorar patrones tradicionales del patrimonio cultural mediante segmentación semántica, realce de características usando mecanismos de atención, reconstrucción generativa y síntesis de estilo artístico. Este estudio utilizó conjuntos de datos públicos de imágenes artísticas y del patrimonio cultural, incluyendo el conjunto de datos Miao Batik y el conjunto de datos WikiArt. La investigación no involucró participantes humanos, datos de pacientes, información personal, sujetos animales ni registros clínicos; por lo tanto, no se requirió la aprobación del comité ético institucional ni el consentimiento informado. En primer lugar, se utilizaron el conjunto de datos de motivos culturales Miao Batik y el conjunto de datos WikiArt para la evaluación. El conjunto de datos Miao Batik fue descrito por Quan et al. (2024)32 y contiene 15.148 imágenes anotadas de motivos tradicionales de batik Miao. Las anotaciones existentes proporcionadas por los creadores del conjunto de datos se utilizaron directamente, y no se generaron anotaciones manuales adicionales en este estudio. A continuación, se realiza el preprocesamiento de las imágenes mediante redimensionado, normalización, eliminación de ruido y creación de una máscara de segmentación. Los parámetros exactos de preprocesamiento se describen en la sección de Preprocesamiento de Datos. El marco propuesto utiliza un modelo basado en transformadores denominado SegFormer-B2 para la segmentación semántica de los datos. El método está diseñado para detectar regiones clave de los motivos culturales y aprender sus estructuras. Las características segmentadas se realzan posteriormente mediante un mecanismo de atención, en el cual se resalta la información relevante relacionada con los motivos culturales y se descarta la información irrelevante. La configuración del mecanismo de atención se describe en la sección CAFFM. Las características realzadas se procesan luego mediante CycleGAN, donde las estructuras dañadas se reconstruyen mediante aprendizaje cíclico. Durante el entrenamiento, se crearon artificialmente muestras de motivos incompletos aplicando operaciones de enmascaramiento aleatorio y oclusión parcial a las imágenes originales de Miao Batik. Estos procedimientos de degradación simularon regiones faltantes de los motivos y daños estructurales comúnmente observados en artefactos del patrimonio cultural deteriorados. Las imágenes incompletas resultantes se utilizaron como entradas para el módulo de reconstrucción de CycleGAN, mientras que las imágenes originales correspondientes sirvieron como objetivos de reconstrucción. Los patrones del patrimonio cultural reconstruidos se realzan posteriormente mediante SPADE, donde se lleva a cabo el realce artístico basado en los mapas de segmentación generados. El rendimiento del marco propuesto se evalúa mediante métricas cuantitativas de segmentación y calidad de imagen, mientras que la autenticidad visual de los motivos culturales reconstruidos se evalúa cualitativamente. La autenticidad visual se evaluó mediante inspección visual de los patrones culturales generados y no se utilizó como métrica cuantitativa independiente. La evaluación se centró en la preservación del motivo, la coherencia semántica, las características culturales, la coherencia estructural y la apariencia artística en relación con los motivos culturales de referencia correspondientes. La evaluación cuantitativa del rendimiento del modelo se realizó utilizando precisión de segmentación, coeficiente IoU, coeficiente de Dice, índice de similitud estructural (SSIM), relación pico de señal a ruido (PSNR) y distancia de Inception de Fréchet (FID). Figura 2 ilustra el flujo de trabajo general del marco propuesto SegCycle-SPADE y resume las métricas de evaluación utilizadas en este estudio.

figure-protocol-1
Figura 2. Flujo del Arquitectura General del Marco Propuesto SegCycle-SPADE. Descripción general del flujo de trabajo completo del marco SegCycle-SPADE. Las imágenes de los conjuntos de datos Miao Batik y WikiArt pasan por un preprocesamiento antes de ser procesadas mediante segmentación semántica utilizando SegFormer-B2, mejora de características mediante CAFFM, reconstrucción de patrones mediante CycleGAN y generación de estilo artístico mediante SPADE. El rendimiento del modelo se evalúa utilizando precisión de segmentación, intersección sobre unión (IoU), coeficiente de Dice, medida del índice de similitud estructural (SSIM), PSNR y distancia de Inception de Fréchet (FID), mientras que la autenticidad visual se evalúa de forma cualitativa. Haga clic aquí para ver una versión más grande de esta figura.

El marco SegCycle-SPADE para la reconstrucción de patrones del patrimonio cultural está diseñado para integrar múltiples componentes de aprendizaje profundo (DL) con el fin de lograr una segmentación precisa de motivos, su reconstrucción y mejora artística, como se ilustra en la Figura 2. Se utilizan imágenes del conjunto de datos de motivos culturales del Batik Miao y del conjunto de datos WikiArt para proporcionar patrones culturales y estilos artísticos diversos. En primer lugar, las imágenes se procesan mediante un módulo de segmentación semántica basado en SegFormer para identificar y delimitar los motivos culturales respecto al fondo. La arquitectura general consta de cuatro etapas principales. Primero, el modelo SegFormer extrae mapas de segmentación semántica a partir de las imágenes de patrones culturales. Segundo, el CAFFM integra características de segmentación con representaciones generativas para mejorar el aprendizaje de características. Tercero, el módulo CycleGAN reconstruye los patrones culturales utilizando las representaciones de características fusionadas. Finalmente, el módulo SPADE genera salidas mejoradas estilísticamente mientras preserva la coherencia estructural mediante una síntesis guiada por segmentación. Los mapas de características refinados son posteriormente procesados por el módulo de reconstrucción CycleGAN, que aprende a restaurar motivos culturales incompletos mediante la transformación de patrones degradados en sus formas completas correspondientes. Las muestras de motivos incompletos se generaron aplicando operaciones aleatorias de enmascaramiento y oclusión parcial a las imágenes originales de Batik Miao, simulando así regiones de patrón ausentes y degradación estructural comúnmente observadas en artefactos culturales dañados. Cada imagen degradada se emparejó con su imagen original correspondiente, que sirvió como objetivo de reconstrucción durante el entrenamiento. Esta estrategia permitió que el módulo CycleGAN aprendiera a restaurar las estructuras de motivos ausentes, preservando al mismo tiempo la coherencia semántica y las características culturalmente significativas. Finalmente, el generador SPADE produce salidas artísticas visualmente mejoradas al condicionar la síntesis de imágenes a los mapas de segmentación generados, manteniendo así la integridad estructural de los motivos culturales durante todo el proceso de mejora artística.

Los siguientes pasos están involucrados en el marco propuesto SegCycle-SPADE.

Paso 1: Recopilación del conjunto de datos
Se utilizaron dos conjuntos de datos para alcanzar los objetivos de aprendizaje de patrones culturales y generación de estilos artísticos. El conjunto de datos de motivos culturales del bordado Miao se empleó para proporcionar información sobre patrones culturales tradicionales. Este conjunto de datos está disponible públicamente a través de Zenodo (https://doi.org/10.5281/zenodo.20807658) y contiene 15 148 imágenes anotadas de motivos tradicionales de bordado Miao. Las anotaciones existentes proporcionadas por los creadores del conjunto de datos se utilizaron directamente, y en este estudio no se generaron anotaciones manuales adicionales. El conjunto de datos WikiArt se utilizó para aportar información diversa sobre estilos artísticos destinada a la generación de estilos artísticos, y se obtuvo del repositorio públicamente accesible WikiArt (https://www.wikiart.org/).

Paso 2: Preprocesamiento de datos
Todas las imágenes se preprocesaron mediante redimensionado, normalización y reducción de ruido. Se utilizaron las anotaciones existentes de motivos culturales obtenidas de las fuentes originales del conjunto de datos para apoyar la etapa de segmentación semántica. No se realizaron procedimientos adicionales de anotación ni de reclasificación como parte de este estudio.

Paso 3: Segmentación de patrones semánticos mediante SegFormer
Se utilizó el modelo SegFormer para la segmentación de motivos culturales. La arquitectura exacta de SegFormer y la estrategia de inicialización se describen en el apartado Segmentación de patrones semánticos mediante SegFormer. Específicamente, se empleó la arquitectura SegFormer-B2 con una base MIT-B2 preentrenada en ImageNet para la segmentación semántica de motivos. Este modelo captura eficazmente la información contextual global al tiempo que conserva los detalles estructurales complejos de los patrones culturales tradicionales.

Paso 4: CAFFM
El CAFFM combina características de segmentación semántica con representaciones generativas, permitiendo que el marco aprenda tanto las características de los motivos estructurales como la información del estilo artístico. Los detalles de integración del CAFFM se proporcionan en la subsección CAFFM. El módulo se sitúa entre la etapa de segmentación semántica basada en SegFormer y la etapa de reconstrucción generativa, donde fusiona características estructurales derivadas de la segmentación con características de reconstrucción mediante una atención cruzada multinúcleo. Este proceso mejora la preservación de los motivos culturales y aumenta el realismo de las salidas reconstruidas.

Paso 5: Reconstrucción del patrón (CycleGAN)
Las características fusionadas se procesan posteriormente mediante el módulo CycleGAN para reconstruir las estructuras de patrones culturales. La arquitectura CycleGAN y la configuración de entrenamiento se describen en la sección Reconstrucción del patrón mediante CycleGAN. El módulo de reconstrucción consta de dos generadores y dos discriminadores, utiliza una arquitectura de generador basada en redes residuales con nueve bloques residuales, emplea un discriminador PatchGAN y se entrena utilizando pérdidas adversariales y de consistencia cíclica. Esta configuración permite la asignación bidireccional entre dominios y facilita la reconstrucción de estructuras de patrones culturales incompletas.

Paso 6: Generación de estilo artístico (SPADE)
Los patrones reconstruidos se procesan luego a través del módulo SPADE para realizar una síntesis de estilo artístico guiada por segmentación. La configuración del generador SPADE se describe en el apartado Generación de estilo artístico mediante SPADE. El módulo emplea bloques residuales SPADE, capas de normalización adaptativa espacial y condicionamiento semántico derivado de mapas de segmentación de SegFormer y representaciones de características CAFFM. Al condicionar la generación de imágenes en los mapas de segmentación, las salidas sintetizadas mantienen una alineación estructural con los motivos culturales originales, a la vez que incorporan características de estilo artístico.

Paso 7: Estimación del rendimiento
El marco propuesto se evaluó utilizando múltiples métricas de segmentación y evaluación de la calidad de imagen, incluyendo la precisión de segmentación, la intersección sobre unión (IoU), el coeficiente de similitud de Dice (Dice), SSIM, PSNR y FID. Para evaluar la consistencia experimental, todos los experimentos se repitieron cinco veces utilizando diferentes semillas aleatorias, y los resultados se presentan como media ± desviación estándar. La significancia estadística se evaluó mediante pruebas t pareadas, con un umbral de significancia de p < 0,05.

Recolección de conjuntos de datos
En el marco propuesto de SegCycle-SPADE, se utilizan dos conjuntos de datos para la comprensión de patrones culturales y el aprendizaje de estilos. El primer conjunto de datos empleado en el marco propuesto es el conjunto de datos de motivos culturales de bordado Miao Batik. Este conjunto contiene motivos culturales del bordado Miao Batik, que generalmente son imágenes tradicionales de Miao Batik con diseños de animales, plantas y formas geométricas, utilizados en el arte de la etnia Miao. Este conjunto incluye imágenes con información rica en texturas, lo cual es generalmente importante para preservar el patrimonio cultural. El segundo conjunto de datos empleado en el marco propuesto de SegCycle-SPADE es el conjunto de datos WikiArt. Este conjunto contiene un gran número de obras artísticas, que generalmente pertenecen a diferentes estilos. Este conjunto se utiliza para el aprendizaje de estilos complejos, lo cual es generalmente útil para mejorar obras artísticas. Este conjunto tiene 80 000 obras artísticas en alta definición, con 27 diseños diferentes, lo que lo hace más útil para tareas de generación o transformación de estilos basadas en aprendizaje profundo (DL).

Conjunto de datos de Batik Miao:
El conjunto de datos de Batik Miao (https://doi.org/10.5281/zenodo.20807658) comprende 15.148 imágenes de patrones de batik que representan motivos de significado cultural. Las imágenes incluyen una variedad de diseños tradicionales, como motivos animales (por ejemplo, mariposas y peces), patrones basados en plantas y motivos geométricos que poseen simbolismo cultural. Este conjunto de datos es un componente importante del marco propuesto porque proporciona estructuras culturales auténticas que permiten al módulo de segmentación identificar y preservar con precisión los límites de los motivos durante la reconstrucción del patrón (Tabla 1). En este estudio, los motivos culturalmente importantes hacen referencia a elementos visuales simbólicos comúnmente documentados en la literatura sobre el patrimonio cultural Miao y representados en las anotaciones del conjunto de datos, incluyendo aves, mariposas, patrones florales y tótems ancestrales. Estos motivos fueron seleccionados en función de su significado cultural documentado y su presencia recurrente en diseños tradicionales de batik y bordado Miao, más que únicamente por su frecuencia de aparición o composición espacial. Las anotaciones de motivos guiadas por expertos y las etiquetas de segmentación se obtuvieron de la fuente original del conjunto de datos de Batik Miao y se utilizaron directamente en este estudio. Los autores no realizaron ninguna anotación manual adicional, reetiquetado ni procedimientos de anotación guiados por expertos. Las anotaciones existentes proporcionadas por los creadores del conjunto de datos se utilizaron para el entrenamiento y la evaluación en la segmentación semántica.

ParámetroDescripción
Nombre del conjunto de datosMiao Batik Cultural Pattern Dataset
Origen del conjunto de datosRepositorio Zenodo (DOI: 10.5281/zenodo.20807658)
DominioPatrimonio Cultural Inmaterial (PCI) / Análisis de patrones textiles
Número total de imágenes15,148 imágenes
Tipo de imagenImágenes digitales de patrones textiles tradicionales de batik Miao
Categorías de patrónMotivos animales, motivos vegetales y motivos geométricos
Origen culturalCultura étnica Miao, provincia de Guizhou, China
Resolución original de las imágenesImágenes de alta resolución (típicamente ≥ 1,000 píxeles en el lado más corto) capturadas como escaneos o fotografías en bruto antes del preprocesamiento
Resolución para entrenamientoImágenes redimensionadas a 256 × 256 píxeles durante el preprocesamiento
Disponibilidad de anotacionesSe utilizaron las anotaciones de segmentación existentes proporcionadas por los creadores del conjunto de datos sin modificaciones para el entrenamiento y la evaluación. En este estudio no se realizaron anotaciones manuales adicionales, reclasificaciones ni procedimientos de verificación por expertos.
Aplicación en este estudioSegmentación de motivos culturales, extracción de características, preservación de motivos y reconstrucción de patrones

Tabla 1: Características del conjunto de datos de patrones culturales de la técnica batik miao. Resumen del conjunto de datos de motivos culturales batik miao utilizado para la segmentación semántica, el análisis de patrones culturales y la reconstrucción de motivos. La tabla describe la fuente del conjunto de datos, las características de las imágenes, las categorías de motivos, el origen cultural, la resolución de las imágenes y su función dentro del marco propuesto SegCycle-SPADE.

Conjunto de datos de WikiArt:
El conjunto de datos de WikiArt [https://www.wikiart.org/] es un repositorio digital de arte a gran escala muy utilizado que comprende más de 80 000 imágenes de 27 estilos artísticos diferentes en la Tabla 2. Los estilos incluyen arte renacentista, impresionismo, cubismo y surrealismo. El conjunto de datos es muy importante en el marco propuesto, ya que ofrece conocimientos que permiten al módulo SPADE crear patrones enriquecidos culturalmente, manteniendo al mismo tiempo la información estructural obtenida del proceso de segmentación. El conjunto de datos consta de 56 000 imágenes para el aprendizaje y 12 000 imágenes para validación y pruebas. Las imágenes del conjunto de datos contribuyen a entrenar eficazmente el modelo de aprendizaje profundo.

ParámetroDescripción
Nombre del conjunto de datosConjunto de datos WikiArt
Fuente del conjunto de datosRepositorio WikiArt (https://www.wikiart.org/)
DominioArte digital y pinturas
Número total de imágenesAproximadamente 80 000 obras de arte
Imágenes de entrenamiento56 000
Imágenes de validación12 000
Imágenes de prueba12 000
Estilos artísticos27 estilos artísticos, incluyendo Renacimiento, Impresionismo, Cubismo, Surrealismo, Expresionismo, Realismo y Arte abstracto
Resolución original de las imágenesLas resoluciones originales de las imágenes varían según las obras y las fuentes. Las imágenes se redimensionaron a una resolución uniforme de 256 × 256 píxeles durante el preprocesamiento.
Resolución de entrenamientoLas imágenes se redimensionaron a 256 × 256 píxeles durante el preprocesamiento, antes del aprendizaje de estilo artístico y de la síntesis de imágenes guiada por segmentación.
Particionado del conjunto de datosParticionado aleatorio estratificado (70 % entrenamiento, 15 % validación y 15 % prueba) utilizando una semilla aleatoria fija de 42
Estrategia de muestreo de estilosSe empleó un muestreo proporcional estratificado para preservar la distribución de los 27 estilos artísticos en los subconjuntos de entrenamiento, validación y prueba
Aplicación en este estudioAprendizaje de estilo artístico, representación de estilos y síntesis artística guiada por segmentación

Tabla 2: Características del conjunto de datos WikiArt. Resumen del conjunto de datos WikiArt utilizado para el aprendizaje de estilos artísticos y la síntesis de imágenes guiada por estilo. La tabla describe la fuente del conjunto de datos, la distribución de imágenes, la cobertura de estilos artísticos, la partición del conjunto de datos, la resolución de las imágenes y su aplicación dentro del marco propuesto SegCycle-SPADE.

El conjunto de datos Miao Batik contiene 15 148 imágenes que representan motivos culturales tradicionales de los Miao.32 El conjunto de datos está disponible públicamente a través de Zenodo (https://doi.org/10.5281/zenodo.20807658). Antes del entrenamiento del modelo, todas las imágenes fueron inspeccionadas visualmente y redimensionadas a 256 × 256 píxeles, normalizadas y seleccionadas para descartar muestras corruptas o duplicadas. El control de calidad no resultó en la exclusión de ninguna imagen; por lo tanto, se mantuvieron las 15.148 imágenes para el análisis posterior. El conjunto de datos se dividió aleatoriamente en subconjuntos de entrenamiento (70 %), validación (15 %) y prueba (15 %) utilizando una semilla aleatoria fija de 42 para garantizar la reproducibilidad de las particiones del conjunto de datos. El conjunto de datos WikiArt se obtuvo a través del repositorio oficial de WikiArt (https://www.wikiart.org/) y contiene más de 80.000 obras de arte que abarcan 27 estilos artísticos. Para los experimentos de aprendizaje de estilo, se utilizaron 56.000 imágenes para entrenamiento, 12.000 para validación y 12.000 para pruebas.

Preprocesamiento de datos
Antes de entrenar el marco propuesto SegCycle-SPADE, el conjunto de datos de motivos culturales de bordado Miao y el conjunto de datos WikiArt se sometieron a varios pasos de preprocesamiento para garantizar una calidad de imagen consistente y una representación precisa de las características. La misma canalización básica de preprocesamiento, que incluye eliminación de ruido gaussiano, normalización, redimensionamiento a una resolución de entrada uniforme y verificación de la calidad de la imagen, se aplicó a ambos conjuntos de datos. Sin embargo, los conjuntos de datos desempeñaron funciones distintas dentro del marco. El conjunto de datos WikiArt se utilizó para el aprendizaje y la síntesis de estilos artísticos, mientras que el conjunto de datos de bordado Miao se utilizó principalmente para la segmentación y reconstrucción de motivos culturales. No se realizaron cambios específicos de preprocesamiento más allá de estos roles específicos de la tarea. Para asegurar un procesamiento consistente por parte del modelo de aprendizaje profundo, las imágenes se redimensionaron primero a una resolución fija. Este paso fue necesario porque las imágenes en ambos conjuntos de datos variaban en resolución según su origen. El redimensionamiento mejoró la eficiencia computacional y evitó que las inconsistencias dimensionales afectaran el entrenamiento. El segundo paso de preprocesamiento fue la normalización, en la cual los valores de los píxeles se escalonaron a un rango estandarizado para estabilizar las actualizaciones del gradiente durante el entrenamiento. Luego, las imágenes se procesaron utilizando filtrado gaussiano para reducir el ruido que podría interferir con las estructuras de los motivos culturales. Para el conjunto de datos de bordado Miao, las máscaras existentes de segmentación de motivos culturales obtenidas directamente de la fuente original del conjunto de datos se utilizaron sin modificaciones para el entrenamiento y evaluación de segmentación semántica. No se generaron nuevas máscaras de segmentación específicamente para este estudio.

A menos que se indique lo contrario, las ecuaciones que describen métodos establecidos fueron adaptadas de estudios previos y se citan en consecuencia. Las ecuaciones que describen el CAFFM propuesto y el marco de optimización compuesto SegCycle-SPADE fueron desarrolladas por los autores para este estudio.

Sea una imagen de entrada del conjunto de datos representada como Ec. 1:

figure-protocol-2  (1)

Aquí, H, W y C se refieren a la altura, anchura y número de canales de color de la imagen, respectivamente. Todas las imágenes se redimensionan a una dimensión fija H′ × W′, como se muestra en la Ecuación 2:

figure-protocol-3

Aquí, Ir es la imagen redimensionada. Los valores normalizados de los píxeles se calculan según la Ecuación 3:

figure-protocol-4   (3)

Esto ayuda a estabilizar el procedimiento de entrenamiento. El filtrado de ruido se realiza utilizando un filtro gaussiano, como se muestra en la Ecuación 4:

figure-protocol-5

Aquí, G(σ) es un filtro gaussiano y * representa la convolución. Se utilizó un filtro gaussiano con un kernel de 5 × 5 y una desviación estándar de σ = 1.0. Se aplicó un relleno reflectante a los píxeles del borde para reducir los artefactos de borde. Antes de la escalación y la normalización, el proceso de eliminación de ruido se realizó inmediatamente después de la carga de la imagen. Para garantizar un preprocesamiento uniforme durante todo el estudio, se aplicó la misma configuración de filtro a cada imagen de los conjuntos de datos Miao Batik y WikiArt. Para el conjunto de datos Miao Batik, las máscaras de segmentación se crean según la Ecuación 5:

figure-protocol-6

Aquí, M es una máscara de segmentación utilizada para guiar el modelo SegFormer.

La canalización de preprocesamiento comienza con la adquisición de imágenes del conjunto de datos Miao Batik y del conjunto de datos WikiArt, como se muestra en la Figura 3. No se emplearon técnicas de aumento de datos durante el entrenamiento. Después del preprocesamiento, que incluyó el redimensionamiento, la normalización, la eliminación de ruido gaussiano y la preparación de máscaras de segmentación, las imágenes se utilizaron directamente para el entrenamiento, validación y prueba del marco propuesto SegCycle-SPADE. El primer paso de la canalización de preprocesamiento consiste en redimensionar las imágenes a un tamaño fijo, lo que permite que el modelo de aprendizaje profundo procese las imágenes de manera más eficiente. El segundo paso implica la normalización, que convierte los valores de los píxeles a un rango numérico estandarizado y facilita la convergencia del modelo. El tercer paso consiste en la eliminación de ruido, mediante el cual se eliminan los ruidos no deseados de las imágenes para mejorar el reconocimiento de patrones. Además, para el conjunto de datos Miao Batik, se anotan las regiones de motivos culturales, lo que permite generar máscaras utilizadas en el módulo de segmentación del modelo propuesto, asegurando que los motivos culturales se conserven durante la generación. La salida final de esta etapa es un conjunto de datos limpio que está listo para entrenar los módulos de segmentación y generación del modelo propuesto.

figure-protocol-7
Figura 3. Tubo de preprocesamiento de datos para imágenes del patrimonio cultural. Flujo de trabajo que ilustra los procedimientos de preprocesamiento de imágenes aplicados antes del entrenamiento del modelo. La tubería incluye la adquisición del conjunto de datos, el cambio de tamaño de las imágenes, la normalización, la eliminación de ruido gaussiano, las anotaciones existentes de motivos culturales y la preparación de máscaras de segmentación. Las imágenes y máscaras procesadas resultantes se utilizan como entradas para la segmentación semántica y la reconstrucción de patrones. Haga clic aquí para ver una versión más grande de esta figura.

Cada imagen fue sometida a un proceso de control de calidad antes del entrenamiento del modelo. El conjunto de datos de Miao Batik contenía 15 148 imágenes. Las muestras corruptas, duplicadas y de baja calidad ya habían sido corregidas por los creadores originales del conjunto de datos; por lo tanto, no se excluyeron imágenes adicionales durante la evaluación de control de calidad en este estudio. En consecuencia, se conservaron las 15 148 imágenes para el análisis. Las imágenes se cargaron en formato RGB durante el preprocesamiento y se redimensionaron a 256 × 256 píxeles utilizando interpolación bilineal. Los valores de los píxeles se escalonaron desde el rango [0, 255] hasta [0, 1] dividiendo por 255. Luego se aplicó una normalización por canal utilizando valores medios de [0,485, 0,456, 0,406] y valores de desviación estándar de [0,229, 0,224, 0,225] para los canales rojo, verde y azul, respectivamente. La tubería de preprocesamiento incluyó la carga de imágenes, conversión a RGB, redimensionamiento, escalonamiento de valores de píxeles, normalización y conversión a tensor. Cuando fue necesario, las imágenes en escala de grises se convirtieron al formato RGB de tres canales para mantener la compatibilidad con los modelos de aprendizaje profundo. Tras el preprocesamiento, las imágenes se dividieron en subconjuntos de entrenamiento, validación y prueba. Todas las etapas del marco SegCycle-SPADE —incluyendo segmentación semántica, fusión de características, reconstrucción de motivos y síntesis artística basada en SPADE— utilizaron una resolución de entrada constante de 256 × 256 píxeles.

Segmentación por Patrones Semánticos usando SegFormer
Después de esta etapa de preprocesamiento, las imágenes limpias y normalizadas del conjunto de datos de motivos culturales del Batik Miao y del conjunto de datos de WikiArt se introducen en el módulo de segmentación semántica basado en el marco propuesto de SegFormer-B2. El objetivo de este paso es identificar y separar correctamente los motivos culturales presentes en los patrones patrimoniales. El marco propuesto de SegFormer se basa en una arquitectura de transformador que incorpora un codificador Transformer jerárquico y un decodificador MLP ligero para capturar con precisión la información contextual global, así como la información estructural detallada de patrones patrimoniales complejos. El modelo primero extrae representaciones de características a múltiples escalas a partir de la imagen de entrada, seguido de la fusión de estas representaciones mediante el decodificador para generar patrones segmentados precisos. Esto garantiza que los patrones en la imagen patrimonial se segmenten correctamente en motivos como patrones geométricos, patrones florales y patrones simbólicos, separándolos así del fondo mientras se mantiene su integridad estructural. Esta información estructural se utiliza posteriormente en las etapas posteriores de generación de patrones dentro del marco SegCycle-SPADE.

Sea que la imagen de entrada preprocesada se represente como Ec. 6:

figure-protocol-8    (6)

El codificador SegFormer divide la imagen en fragmentos y extrae características jerárquicas utilizando capas transformadoras, como se muestra en Ecuación 71:

figure-protocol-9

Aquí, F denota los mapas de características multiescala obtenidos del codificador transformer. Estas características codifican tanto los patrones de textura locales como las relaciones contextuales globales entre las regiones del motivo. El modelo SegFormer extrae mapas de características a diferentes escalas según se define en la Ecuación 8:

figure-protocol-10

El uso de representaciones multiescala facilita la detección de patrones de diferentes tamaños dentro de los motivos culturales. Finalmente, las características se combinan utilizando el decodificador MLP, como se muestra en la Ecuación 91:
 figure-protocol-11

Aquí, S denota el mapa final de segmentación predicho.

El modelo base SegFormer-B2 se inicializó utilizando pesos preentrenados en ImageNet y posteriormente se ajustó finamente en el conjunto de datos Miao Batik para la segmentación de motivos culturales. El punto de control preentrenado se obtuvo de la implementación oficial de SegFormer. Específicamente, se utilizó el punto de control MIT-B2 preentrenado en ImageNet-1K (mit_b2.pth) proporcionado por el repositorio oficial de SegFormer para inicializar el modelo base SegFormer-B2 antes del ajuste fino. Los pesos preentrenados corresponden al modelo base MIT-B2 publicado por los autores de SegFormer y sirvieron como modelo de inicialización para el entrenamiento de segmentación semántica. Las capas restantes específicas de la tarea se inicializaron utilizando los procedimientos predeterminados de inicialización de pesos de PyTorch antes del entrenamiento.

Se utiliza una arquitectura con codificador Transformer jerárquico de cuatro etapas y embebidos de fragmentos solapados. En la etapa inicial, el tamaño del fragmento se estableció en 7 × 7 con un paso de 4. Para cada una de las cuatro etapas del codificador, las dimensiones de embebido fueron 64, 128, 320 y 512. A lo largo de las cuatro etapas, hubo 1, 2, 5 y 8 cabezales de atención automática multinivel, y las profundidades correspondientes del codificador fueron de 3, 4, 6 y 3 capas. Las características multiescala recuperadas del codificador se agruparon mediante un decodificador ligero completamente basado en MLP. Antes de generar el mapa final de segmentación, el decodificador proyectó las características de cada etapa del codificador en un único espacio de embebido. Todos los bloques Transformer utilizaron la función de activación Unidad Lineal de Error Gaussiana (GELU). Durante el entrenamiento se empleó una tasa de abandono (dropout) de 0,1 para mejorar la generalización y reducir el sobreajuste.

Durante la fase de entrenamiento, el marco SegFormer recibe las imágenes preprocesadas de ambos conjuntos de datos. Las imágenes del conjunto de datos de Batik Miao contienen regiones de motivos que sirven como etiquetas para el aprendizaje supervisado del modelo de segmentación. El codificador Transformer procesa la imagen completa y captura relaciones de largo alcance entre los componentes de la imagen, lo cual es particularmente importante para los patrones tradicionales de batik que contienen motivos distribuidos espacialmente. El mecanismo jerárquico de extracción de características captura simultáneamente estructuras locales, como texturas geométricas repetidas. El decodificador MLP procesa estas características extraídas y produce una máscara de segmentación que resalta las regiones de los motivos. Los mapas de segmentación generados en esta etapa se utilizan posteriormente como entradas estructurales para el módulo de atención y la etapa de reconstrucción del patrón, ayudando así a preservar la autenticidad de los patrones generados.

Los motivos culturales se dividieron en diferentes clases para la segmentación semántica según sus características visuales y culturales. La taxonomía de segmentación comprendía motivos de animales (por ejemplo, mariposas, peces, aves y otra fauna simbólica), motivos de plantas (por ejemplo, flores, hojas, enredaderas y patrones botánicos), motivos geométricos (por ejemplo, formas repetitivas, bordes y estructuras geométricas abstractas) y regiones de fondo que representan áreas sin motivos. Se utilizaron máscaras de segmentación a nivel de píxel para asignar cada píxel a una de las clases predefinidas. Las etiquetas enteras se codificaron de la siguiente manera: Etiqueta 0 = fondo, Etiqueta 1 = motivos de animales, Etiqueta 2 = motivos de plantas y Etiqueta 3 = motivos geométricos. Las anotaciones de segmentación y las etiquetas de motivos se obtuvieron directamente de la fuente original del conjunto de datos Miao Batik. En este estudio no se realizaron anotaciones manuales adicionales, reetiquetado, verificación de límites ni procedimientos de confirmación por expertos. Las anotaciones existentes proporcionadas por los creadores del conjunto de datos se utilizaron sin modificaciones para el entrenamiento y la evaluación.

El modelo SegFormer para la segmentación de motivos culturales procesa las imágenes preprocesadas del conjunto de datos Miao Batik y del conjunto de datos WikiArt utilizando un mecanismo basado en transformadores para la detección precisa de regiones con patrones culturales, como se muestra en la Figura 4. En primer lugar, se proporciona al modelo SegFormer una imagen de entrada que contiene motivos culturales tradicionales. El codificador Transformer extrae tanto información contextual global como características estructurales locales a partir de fragmentos de la imagen. Las características multiescala resultantes se entregan al decodificador de segmentación, que utiliza una red de alimentación mixta (Mix Feed-Forward Network) para perfeccionar las representaciones de características y mejorar la detección de motivos. La salida del modelo SegFormer es una máscara de segmentación que resalta los píxeles correspondientes a los patrones culturales, suprimiendo al mismo tiempo la información irrelevante del fondo. Los patrones culturales aislados sirven entonces como guía estructural para las etapas posteriores del marco SegCycle-SPADE.

figure-protocol-12
Figura 4. Segmentación semántica basada en SegFormer-B2 de motivos culturales. Arquitectura del módulo de segmentación semántica SegFormer-B2 utilizado para la extracción de motivos culturales y entrenado exclusivamente con el conjunto de datos Miao Batik. El marco consta de un codificador basado en Transformer para la extracción de características multiescala y un decodificador de segmentación ligero para generar máscaras de motivos. El modelo predice cuatro clases semánticas—animal, vegetal, geométrico y fondo—donde las máscaras de segmentación resultantes identifican regiones de motivos con significado cultural mientras suprimen información de fondo irrelevante. Estas salidas de segmentación proporcionan orientación estructural para las etapas posteriores de fusión de características, reconstrucción y síntesis artística del marco propuesto SegCycle-SPADE. Haga clic aquí para ver una versión más grande de esta figura.

No es necesario crear nuevas anotaciones de segmentación en el marco sugerido. El conjunto de datos Miao Batik se obtuvo de una fuente pública ya existente, y el modelo se entrenó utilizando la información de motivos proporcionada por los creadores del conjunto de datos. Durante el proceso de aprendizaje, el modelo SegFormer generó mapas de segmentación semántica. Como resultado, el presente estudio no requirió software adicional de anotación manual, directrices de anotación ni procedimientos de control de calidad de las anotaciones.

CAFFM
Para mejorar la interacción entre las características de la segmentación semántica y las representaciones de la reconstrucción generativa, el estudio también propuso un CAFFM. El codificador SegFormer-B2 proporciona mapas de características semánticas al módulo CAFFM, mientras que el paso de reconstrucción CycleGAN proporciona mapas de características generativas. Primero, se utilizan capas de proyección lineal para proyectar ambos flujos de características en un espacio de incrustación común. Para el cálculo de la atención cruzada, se crean representaciones de consulta (Q), clave (K) y valor (V) utilizando los tensores de características generadas. Luego, se modelan las relaciones entre la información de los motivos estructurales y los elementos del estilo artístico mediante atención cruzada multinúcleo. A continuación, se aplican normalización por capas, conexiones residuales y capas de alimentación directa con activación GELU a las representaciones de características fusionadas. La etapa de síntesis basada en SPADE recibe la salida del módulo CAFFM, lo que permite preservar temas culturalmente significativos sin sacrificar la coherencia artística.

Para garantizar la compatibilidad de características, las características de entrada se proyectan primero mediante capas de proyección lineal en un espacio de incrustación compartido con una dimensión de incrustación de 256. Las interconexiones entre la información estructural semántica y las representaciones de estilo generativo se modelan luego mediante un mecanismo de atención cruzada multi-cabeza (MultiHead Cross-Attention) con ocho cabezas de atención. El cálculo de la atención cruzada utiliza los vectores Consulta (Q), Clave (K) y Valor (V), que son producidos por capas específicas de transformación lineal. Para aumentar la estabilidad durante el entrenamiento y mantener la integridad de las características, se emplean conexiones residuales y normalización por capa (Layer Normalization) para mejorar aún más las representaciones de características fusionadas. El aprendizaje de características no lineales se mejora posteriormente aplicando una red de alimentación directa con la función de activación Unidad Lineal de Error Gaussiana (GELU). El módulo genera una representación de características de salida con dimensión 256, que se envía a otras etapas para la síntesis creativa. CAFFM combina con éxito datos de estilo artístico con estructuras de motivos culturales mediante una técnica de fusión basada en atención cruzada, lo que mejora la preservación de motivos y la coherencia visual en los patrones de patrimonio cultural reconstruidos.

En el sistema propuesto, las características estructurales se derivan del conjunto de datos Miao Batik, mientras que las características estilísticas se aprenden a partir del conjunto de datos WikiArt. Sea el mapa de características derivado de la red de segmentación SegFormer utilizando imágenes del conjunto de datos Miao Batik representado por Fs, mientras que el mapa de características derivado de la rama de extracción de características estilísticas utilizando imágenes de WikiArt se denota por Fa. El CAFFM propuesto combina los dos dominios de características mediante un mecanismo de atención cruzada para aprender tanto las dependencias estructurales como estilísticas de los patrones culturales. Tabla 3 informa todas las características arquitectónicas, incluyendo dimensiones de incrustación, capas de normalización, funciones de activación y configuración de cabezales de atención. Para un tamaño de imagen de entrada de 256 × 256 píxeles, el codificador SegFormer-B2 produjo mapas de características semánticas de tamaño 64 × 64 × 128, mientras que la rama de extracción de características estilísticas produjo mapas de características de tamaño 64 × 64 × 128. Ambos mapas de características se proyectaron mediante capas lineales entrenables en un espacio de incrustación compartido de dimensión 256 antes de la fusión mediante atención cruzada.

ParámetroConfiguración
Marco propuestoSegCycle-SPADE
Modelo de segmentación semánticaSegFormer-B2
Etapa del codificador SegFormer4
Inicialización de pesosSegFormer-B2 preentrenado en ImageNet-1K (estructura MIT-B2)
Origen del punto de controlRepositorio oficial de NVIDIA SegFormer (https://github.com/NVlabs/SegFormer); punto de control: segformer.b2.512x512.ade.160k
Estrategia de ajuste finoAjuste fino de extremo a extremo en el conjunto de datos Miao Batik
Tamaño del parche de incrustación7 × 7
Paso del parche4
Dimensiones de incrustación64, 128, 320 y 512
Profundidades del codificador3, 4, 6 y 3
Cabezales de atención1, 2, 5 y 8
Tipo de decodificadorDecodificador completamente MLP
Función de activaciónGELU
Tasa de abandono (dropout)0,1
Módulo de mejora de característicasMódulo de fusión de características culturales con atención cruzada (CAFFM)
Dimensión de incrustación de CAFFM256
Cabezales de atención de CAFFM8
Escala de fusión de CAFFM4
Modelo de reconstrucciónCycleGAN
Modelo de generación de estiloSPADE
Conjunto de datos culturalConjunto de datos Miao Batik
Conjunto de datos de estiloConjunto de datos WikiArt
Imágenes Miao Batik15 148
Imágenes WikiArtAproximadamente 80 000
Resolución de imagen de entrada256 × 256 píxeles
Formato de colorRGB
Método de interpolaciónInterpolación bilineal
Método de eliminación de ruidoFiltrado gaussiano
Tamaño del kernel gaussiano5 × 5
Sigma gaussiana (σ)1
Rango de normalización[0, 1]
Tamaño del lote16
Número de épocas100
OptimizadorAdam
Tasa de aprendizaje0,0002
Parámetros de Adamβ₁ = 0,5, β₂ = 0,999, ε = 1 × 10⁻⁸, decaimiento de peso = 0
Funciones de pérdidaPérdida de segmentación, pérdida adversaria, pérdida de consistencia cíclica, pérdida de reconstrucción, pérdida de preservación de motivo y pérdida de consistencia de estilo
Estrategia de división del conjunto de datosEntrenamiento / Validación / Prueba
Conjunto de entrenamiento70 %
Conjunto de validación15 %
Conjunto de prueba15 %
Semilla aleatoria42
Métricas de evaluaciónPrecisión de segmentación, IoU, coeficiente Dice, SSIM, PSNR y FID
Lenguaje de programaciónPython 3.8.10
Framework de aprendizaje profundoPyTorch 1.10.0
Plataforma de hardwareGPU NVIDIA RTX 3090 (24 GB de VRAM), Intel Core i7 (11.ª generación), 32 GB de RAM
Entorno operativoUbuntu 20.04 LTS

Tabla 3: Configuración Experimental y Configuración del Modelo. Resumen de los componentes arquitectónicos, configuración de entrenamiento, ajustes de preprocesamiento, conjuntos de datos, parámetros de optimización, métricas de evaluación y entorno computacional utilizados para la implementación y evaluación del marco propuesto SegCycle-SPADE.

El módulo de atención primero transforma el mapa de características en representaciones de consulta, clave y valor utilizando la Ecuación 10:

figure-protocol-13

Aquí, Wq, Wk y Wv son matrices de pesos aprendibles. Los pesos de atención se calculan en función de la similitud entre el vector de consulta y el vector clave utilizando la Ecuación 1117

figure-protocol-14

Aquí, dk es la dimensión del vector clave. La representación de características mejorada se calcula multiplicando los pesos de atención con la matriz de valores utilizando la Ecuación 12:

figure-protocol-15

Aquí, Fa es la representación mejorada de la característica del mapa de características. La representación mejorada de la característica se calcula combinando las características originales de segmentación con las características mejoradas obtenidas mediante el mecanismo de atención utilizando la ecuación 13:

figure-protocol-16                                

Aquí, Fe es el mapa de características mejorado utilizado para la reconstrucción del patrón. La CAFFM se amplía con un mecanismo de atención cruzada multiscale para extraer características de motivos culturales a diferentes escalas. Sea Fsi la representación de las características de segmentación a la escala i, mientras que Faj denota las características de estilo artístico a la misma escala. La representación final de las características se define mediante la Ec. 14:

  figure-protocol-17

Aquí, Qi, Ki y Vi representan las matrices de consulta, clave y valor a la escala i, respectivamente, y N denota el número de escalas de características. En este estudio, N = 4, lo que corresponde a mapas de características extraídos a resoluciones espaciales de 1/4, 1/8, 1/16 y 1/32 del tamaño de la imagen de entrada. Estas representaciones de características multiescala se fusionaron utilizando pesos de atención entrenables antes de la reconstrucción y la síntesis artística. Esta extensión permite al método extraer motivos culturales globales y texturas para reconstruir patrones culturales. CAFFM se sitúa entre la etapa de segmentación basada en SegFormer y la etapa de síntesis creativa basada en SPADE en el sistema propuesto SegCycle-SPADE. Primero, mientras que CycleGAN crea simultáneamente características de reconstrucción con información estilística y relacionada con patrones, SegFormer-B2 recupera mapas de características semánticas que describen las propiedades estructurales de los motivos culturales. El módulo CAFFM recibe estos dos flujos de características y utiliza una fusión basada en atención cruzada para identificar relaciones entre las representaciones estructurales y artísticas. Con el fin de crear patrones culturalmente auténticos manteniendo la coherencia semántica y las características estructurales, los mapas de características fusionados resultantes se envían luego al módulo SPADE para la síntesis creativa guiada por segmentación.

Reconstrucción de Patrones usando CycleGAN
Una vez finalizada la etapa de mejora de características basada en la atención, los mapas de características contendrán las estructuras de motivos culturales realzadas. Sin embargo, los mapas de características aún podrían incluir regiones de patrón incompletas o dañadas. Por lo tanto, para abordar el problema de la reconstrucción de los patrones, el marco propuesto utilizará el modelo CycleGAN. En este marco, los dos dominios serán los patrones originales de motivos culturales y los patrones reconstruidos de motivos culturales. Utilizando las características mejoradas de las etapas anteriores, el modelo CycleGAN reconstruirá los patrones culturales manteniendo la coherencia estructural. Esto garantizará que los patrones culturales, como los patrones geométricos, florales y simbólicos, conserven su disposición espacial. Las imágenes originales de Batik Miao se sometieron a operaciones aleatorias de enmascaramiento y oclusión parcial para generar motivos culturales incompletos o dañados. Estos procedimientos de degradación simularon regiones de patrón faltantes y daños estructurales comúnmente observados en artefactos del patrimonio cultural deteriorados. Las imágenes degradadas se utilizaron como entradas para el módulo de reconstrucción, mientras que las imágenes originales correspondientes sirvieron como imágenes de referencia para la evaluación del rendimiento y la valoración de la calidad de la reconstrucción. Esta estrategia permitió al modelo aprender la restauración de estructuras de motivos faltantes, al tiempo que preservó la coherencia semántica y las características culturales.

Sea X el dominio de patrones culturales incompletos y Y el dominio de patrones culturales reconstruidos. Los dos generadores aprenden a realizar la asignación bidireccional utilizando la Ecuación 15:

 figure-protocol-18

Aquí, GE se utiliza para reconstruir estructuras de motivos y FM se emplea para mapear los patrones de vuelta al dominio original. La pérdida adversaria se utiliza para garantizar que los patrones reconstruidos sean realistas (Ecuación 16)30

figure-protocol-19

Aquí, DY es el discriminador utilizado para distinguir entre patrones reales y reconstruidos, y GE(x) denota el patrón reconstruido generado. CycleGAN también exige la consistencia cíclica para preservar la disposición estructural de los motivos culturales (Ecuación 17)30.

figure-protocol-20

La función de pérdida final se define utilizando la Ecuación 1830:

figure-protocol-21

Aquí, λi denota el coeficiente de ponderación para la pérdida de consistencia cíclica y se estableció en 10 durante el entrenamiento, de acuerdo con la formulación original de CycleGAN. Este valor se seleccionó para equilibrar el aprendizaje adversarial y la consistencia de reconstrucción entre los dominios fuente y objetivo.

El módulo de reconstrucción CycleGAN consta de dos generadores y dos discriminadores para la traducción bidireccional de imágenes. Cada generador sigue una arquitectura de red residual que comprende una capa convolucional inicial de 7 × 7, seguida de dos capas convolucionales de submuestreo, nueve bloques residuales y dos capas de sobremuestreo. Todas las operaciones convolucionales emplean un tamaño de kernel de 3 × 3, excepto la capa de entrada, que utiliza un kernel de 7 × 7 para una mejor extracción de características. Se aplica Normalización por Instancias después de cada capa convolucional para mejorar la estabilidad del entrenamiento, mientras que la activación ReLU se utiliza en toda la red del generador. La capa de salida emplea una función de activación Tanh para generar salidas de imagen normalizadas. El discriminador sigue una arquitectura PatchGAN de 70 × 70 que consiste en una serie de capas convolucionales con tamaños de kernel de 4 × 4 y canales de características progresivamente crecientes. Se utilizan Normalización por Instancias y activación LeakyReLU (pendiente negativa = 0,2) en el discriminador para mejorar la discriminación de características y el aprendizaje adversarial. El módulo CycleGAN recibe como entrada imágenes preprocesadas de motivos culturales y genera representaciones de patrones reconstruidos, que posteriormente se envían al CAFFM para su integración con características de segmentación. El entrenamiento de CycleGAN se realizó utilizando el optimizador Adam (β₁ = 0,5, β₂ = 0,999) con una tasa de aprendizaje inicial de 0,0002. La tasa de aprendizaje se mantuvo constante durante las primeras 100 épocas y luego se redujo linealmente a cero durante el resto del período de entrenamiento. Se empleó un búfer de repetición que contenía 50 imágenes generadas previamente para estabilizar el entrenamiento del discriminador. Los generadores y discriminadores se actualizaron utilizando una relación de actualización 1:1, con una actualización del generador seguida de una actualización del discriminador en cada iteración de entrenamiento.

El proceso de reconstrucción del CycleGAN se basa en los mapas de características mejorados obtenidos mediante el mecanismo CAFFM en la Figura 5. Los mapas de características contienen motivos culturales realzados procedentes de las etapas anteriores de segmentación y CAFFM. Estos mapas de características se utilizan como entrada para el primer generador GE. El primer generador GE aprende la transformación necesaria para reconstruir los patrones culturales. Las salidas se introducen luego en el discriminador DY para distinguir entre patrones culturales reales y patrones reconstruidos. El discriminador DY ayuda al generador GE a producir salidas realistas. Para garantizar que los patrones culturales no se distorsionen durante la reconstrucción, el segundo generador FM realiza una transformación de consistencia cíclica. El segundo generador FM proyecta las salidas de vuelta al dominio original. A continuación, el discriminador evalúa las salidas para asegurar su realismo. Las salidas finales se envían posteriormente al módulo SPADE para la generación de estilo artístico en la siguiente etapa del marco propuesto SegCycle-SPADE.

figure-protocol-22
Figura 5. Flujo de trabajo de reconstrucción de patrones basado en CycleGAN. Flujo de trabajo del módulo de reconstrucción CycleGAN. Las representaciones de características mejoradas mediante atención se proporcionan como entradas a la red generadora para reconstruir motivos culturales incompletos. El discriminador evalúa las salidas reconstruidas frente a patrones de referencia, mientras que la correspondencia de consistencia cíclica preserva la integridad estructural durante la traducción bidireccional de imágenes. Los motivos reconstruidos se envían posteriormente al módulo SPADE para la síntesis de estilo artístico. Haga clic aquí para ver una versión más grande de esta figura.

Generación de estilo artístico mediante SPADE
Posteriormente, los motivos culturales reconstruidos se someten al módulo SPADE para la generación de estilo artístico. El objetivo principal del módulo SPADE consiste en añadir texturas visualmente más ricas de estilo artístico a los motivos culturales reconstruidos sin comprometer la disposición estructural de dichos motivos. El módulo SPADE es una técnica de generación condicional de imágenes que utiliza el concepto de segmentación de imágenes para la creación de imágenes. Se codificaron mapas semánticos multicanal que correspondían a las clases predeterminadas de motivos a partir de las máscaras de segmentación semántica generadas por SegFormer-B2. El generador SPADE recibió estos mapas codificados como entradas condicionantes. Los parámetros de escalado espacialmente adaptativo (γ) y de sesgo (β) se generaron procesando los mapas semánticos a través de capas convolucionales dentro de cada capa SPADE. De este modo, el generador pudo mantener los límites de los motivos, las disposiciones estructurales y la información semántica durante la síntesis artística al aplicar estos parámetros a las activaciones de características normalizadas. La guía semántica fue capaz de influir tanto en la reconstrucción estructural de alto nivel como en la síntesis de texturas de bajo nivel, ya que el proceso de condicionamiento se llevó a cabo en varias capas del generador SPADE. Como resultado, los patrones artísticos creados incorporaron rasgos estilísticos obtenidos del conjunto de datos WikiArt, al tiempo que conservaron las estructuras de motivos culturales identificadas durante la etapa de segmentación.

El conjunto de datos WikiArt, que incluye obras de 27 categorías artísticas diferentes—como Renacimiento, Impresionismo, Cubismo, Expresionismo, Surrealismo, Realismo y Arte Abstracto—se utilizó como recurso principal para comprender los estilos artísticos. Con el fin de exponer el modelo a una variedad de rasgos creativos y mejorar la generalización de estilo, se seleccionaron aleatoriamente imágenes de estilo de las diversas categorías durante el entrenamiento. El conjunto de datos se dividió en subconjuntos de entrenamiento, validación y prueba con una representación equilibrada de las categorías artísticas para reducir el sesgo de estilo. Para garantizar una representación equilibrada de las 27 categorías artísticas, se utilizó muestreo estratificado. Las muestras de cada categoría se asignaron proporcionalmente a los subconjuntos de entrenamiento, validación y prueba, manteniendo la distribución original de clases. El módulo CAFFM se utilizó para fusionar los aspectos de estilo derivados de las imágenes de WikiArt con las características de reconstrucción generadas por CycleGAN. Con el fin de permitir que la red de síntesis transfiera cualidades artísticas manteniendo al mismo tiempo la estructura semántica y los límites de los motivos culturales derivados de los mapas de segmentación, las representaciones fusionadas resultantes se proporcionaron como información de condicionamiento al generador SPADE. Gracias a esta técnica de condicionamiento de estilo, el marco propuesto fue capaz de producir patrones artísticos culturalmente auténticos con representaciones estructurales y estilísticas coherentes.

SPADE también introduce parámetros adaptativos espacialmente que dependen del mapa de segmentación. Los parámetros pueden definirse como se muestra en la Ecuación 191:

figure-protocol-23

Aquí, γ(S) es el parámetro de escala que varía espacialmente y β(S) es el parámetro de sesgo que varía espacialmente. Los parámetros pueden ayudar al generador a crear diferentes texturas y estilos dependiendo de la región semántica en las imágenes. La obra de arte cultural final puede definirse como se muestra en la Ecuación 20:

 figure-protocol-24

Aquí, GE es el generador SPADE, XrP es el patrón reconstruido y SM es el mapa de segmentación. La obra final mantiene la integridad estructural de los motivos culturales mientras mejora la apariencia artística. Se utilizó una función de pérdida compuesta que equilibra la precisión de la segmentación semántica, la preservación de los motivos culturales, la calidad de la reconstrucción del patrón y la coherencia del estilo artístico para optimizar la arquitectura propuesta SegCycle-SPADE. Se empleó una mezcla ponderada de la pérdida de segmentación (Lseg), la pérdida adversaria (Ladv), la pérdida de consistencia cíclica (Lcycle), la pérdida de reconstrucción (Lrecon), la pérdida de preservación del motivo (Lmotif) y la pérdida de consistencia de estilo (Lstyle) para establecer el objetivo general de entrenamiento. La función de pérdida total se define en la Ecuación 21:

figure-protocol-25  (21)

Con el fin de garantizar la coherencia estructural entre los motivos culturales de entrada y los reconstruidos, el coeficiente de la pérdida de consistencia cíclica se estableció en 10. Para mantener características finas de los motivos y mejorar la precisión visual, el coeficiente de la pérdida de reconstrucción se fijó en 5. Para resaltar la preservación de patrones estructurales culturalmente esenciales durante la síntesis artística, se utilizó un coeficiente de 2 para la pérdida de preservación del motivo. Con el fin de promover la transferencia de estilo artístico sin distorsionar excesivamente las estructuras semánticas del motivo, el coeficiente de la pérdida de consistencia de estilo se ajustó a 1. Para mantener una contribución equilibrada entre la generación realista de imágenes y la segmentación precisa de motivos, se asignaron pesos iguales a las pérdidas de segmentación y adversaria. Se utilizaron representaciones de estilo basadas en características del conjunto de datos WikiArt para calcular la pérdida de consistencia de estilo. En particular, las características de estilo artístico se capturaron mediante correlaciones de matrices de Gram extraídas de mapas de características profundas. La diferencia de la norma de Frobenius entre las matrices de Gram de la imagen de estilo objetivo y la imagen generada se utilizó para calcular la pérdida de estilo, como se muestra en la Ecuación 22:

figure-protocol-26

Aquí, Gl es la matriz de Gram calculada a partir de la capa de características lª, Igen denota la imagen artística generada, Istyle denota la imagen de estilo objetivo del conjunto de datos WikiArt, y F denota la norma de Frobenius. Esta formulación permite que el marco propuesto conserve las características artísticas manteniendo al mismo tiempo la integridad estructural y semántica de los motivos culturales.

Las representaciones de características fusionadas producidas por el módulo CAFFM se utilizan como entradas condicionantes para el módulo SPADE, que actúa como el componente de síntesis artística del marco propuesto. El generador SPADE consta de siete bloques residuales SPADE con una dimensión de características latentes de 256 canales y genera imágenes de salida con una resolución de 256 × 256 píxeles. Los mapas de segmentación semántica obtenidos del módulo SegFormer–CAFFM se utilizan como entradas condicionantes a lo largo de todas las capas residuales SPADE. Las capas SPADE se aplican antes de las funciones de activación dentro de cada bloque residual, permitiendo una condición semántica guiada por segmentación. Mediante operaciones sucesivas de sobremuestreo y convolucionales, la representación de características latentes se refina progresivamente para generar patrones artísticos de alta resolución, al tiempo que se preserva la coherencia semántica y la estructura del motivo. Se utilizan funciones de activación LeakyReLU en todo el generador, y se aplica una función de activación Tanh en la capa de salida para producir imágenes normalizadas.

Algoritmo y flujo de trabajo
El marco SegCycle-SPADE integra segmentación semántica, fusión de características, reconstrucción de patrones y síntesis de estilo artístico dentro de una tubería de entrenamiento unificada. El flujo de trabajo comienza con la adquisición y preprocesamiento del conjunto de datos, incluyendo el redimensionamiento de imágenes, normalización, eliminación de ruido y preparación de máscaras de segmentación. Las imágenes preprocesadas se procesan posteriormente utilizando la red de segmentación SegFormer-B2 para extraer representaciones semánticas de motivos. Las características de segmentación resultantes se fusionan con las características de reconstrucción mediante el módulo CAFFM, permitiendo la interacción entre la información estructural de los motivos y las representaciones de características artísticas. Los mapas de características fusionados se proporcionan entonces al módulo de reconstrucción CycleGAN, que restaura estructuras de motivos culturales incompletas preservando la coherencia semántica. Los patrones reconstruidos se entregan posteriormente al generador SPADE para la síntesis artística guiada por segmentación, lo que permite mejorar el estilo manteniendo los límites de los motivos y la autenticidad estructural. Durante el entrenamiento, los parámetros del modelo se optimizan utilizando la función de pérdida compuesta descrita en las ecuaciones 21 y 22, que equilibra la precisión de la segmentación, la preservación de motivos, la calidad de reconstrucción y la coherencia del estilo artístico. Se proporciona un flujo de implementación detallado paso a paso, que incluye la carga del conjunto de datos, preprocesamiento, inicialización del modelo, iteraciones de entrenamiento, procedimientos de validación, selección de puntos de control y evaluación final, en el Archivo Suplementario 1 (Algoritmo 1). El flujo de trabajo algorítmico completo se implementó utilizando un tamaño de lote de 16, una tasa de aprendizaje de 0,0002 y 100 épocas de entrenamiento. Se utilizó una semilla aleatoria fija de 42 para la partición del conjunto de datos, la inicialización del modelo y todos los experimentos de entrenamiento. La semilla se aplicó de forma consistente en los generadores de números aleatorios de Python, NumPy y PyTorch para garantizar la reproducibilidad. El optimizador Adam se configuró con β₁ = 0,5, β₂ = 0,999 y sin decaimiento de peso (weight decay = 0). Los puntos de control del modelo se seleccionaron según la puntuación IoU más alta alcanzada en el conjunto de datos de validación.

Optimización de la función de pérdida
Para preservar las estructuras de los motivos culturales durante la reconstrucción y la síntesis artística, el marco propuesto emplea un objetivo de optimización compuesto que combina pérdidas de segmentación, adversariales, de consistencia cíclica, de reconstrucción, de preservación de motivos y de consistencia de estilo. La formulación matemática completa, los coeficientes de ponderación y la definición de la pérdida de estilo se proporcionan en las ecuaciones 21 y 22 dentro del apartado Generación de estilo artístico usando SPADE. El componente de preservación de motivos penaliza las desviaciones estructurales entre las regiones de motivos predichas y las máscaras de segmentación reales correspondientes, fomentando así la preservación de estructuras de patrones culturalmente significativas a lo largo del proceso de reconstrucción.

Resultados

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

El marco propuesto SegCycle-SPADE fue evaluado utilizando dos conjuntos de datos: el conjunto de datos de motivos culturales de bordado Miao y el conjunto de datos WikiArt. El conjunto de datos de bordado Miao contiene imágenes de patrimonio cultural tradicional y se utilizó principalmente para tareas de segmentación semántica y reconstrucción estructural, mientras que el conjunto de datos WikiArt contiene estilos artísticos diversos y se empleó para el aprendizaje y la generación de estilos artísticos. Las imágenes de ambos conjuntos de datos fueron procesadas mediante la tubería completa de SegCycle-SPADE, incluyendo segmentación semántica, CAFFM, reconstrucción de patrones y generación de estilo artístico basada en SPADE. La integración de la información de motivos culturales y las representaciones de estilo artístico permitió al marco generar salidas visualmente coherentes y culturalmente significativas.

Todos los experimentos se realizaron en una estación de trabajo con GPU equipada con un procesador Intel Core i7 y una GPU NVIDIA. Específicamente, los experimentos se llevaron a cabo en una estación de trabajo equipada con una CPU Intel Core i7 (11.ª generación), una GPU NVIDIA RTX 3090 con 24 GB de memoria VRAM y 32 GB de memoria del sistema. Los modelos se implementaron utilizando Python 3.8 y PyTorch 1.10 con aceleración CUDA. El entrenamiento se realizó utilizando una configuración de una sola GPU, sin entrenamiento distribuido. Se utilizó precisión estándar FP32 en todos los experimentos, y no se empleó entrenamiento con precisión mixta. Se utilizó el optimizador Adam con un tamaño de lote de 16 durante 100 épocas de entrenamiento. Tabla 3 resume los parámetros de implementación y el entorno computacional utilizados en este estudio.

La arquitectura propuesta consta de cuatro componentes principales: SegFormer-B2 para la segmentación semántica, CAFFM para la fusión de características, CycleGAN para la reconstrucción de motivos y SPADE para la síntesis de estilo artístico. Las imágenes de ambos conjuntos de datos se redimensionaron a 256 × 256 píxeles antes del entrenamiento. Esta resolución estandarizada garantizó una eficiencia computacional, al tiempo que preservó detalles importantes de los motivos y contribuyó a un entrenamiento adversarial estable de los módulos CycleGAN y SPADE.

El rendimiento del marco propuesto se evaluó mediante métricas de segmentación y evaluación de la calidad de la imagen, incluyendo la precisión de segmentación, la intersección sobre la unión (IoU), el coeficiente de similitud de Dice (Dice), SSIM, PSNR y FID. La autenticidad visual se evaluó cualitativamente mediante inspección visual de los patrones culturales generados. La evaluación cualitativa se centró en la preservación de los motivos, la coherencia semántica, las características culturales y la apariencia artística en relación con los motivos culturales de referencia. La autenticidad visual no se utilizó como métrica de evaluación cuantitativa independiente.

Se realizó la evaluación cuantitativa del marco propuesto utilizando las siguientes métricas.

La precisión de la segmentación se calculó utilizando la Ecuación 23:

figure-results-1

Aquí, TP, TN, FP y FN denotan verdaderos positivos, verdaderos negativos, falsos positivos y falsos negativos, respectivamente.

El IoU se calculó utilizando la ecuación 24:

 figure-results-2

Se calculó el coeficiente de similitud de Dice (Dice) utilizando la ecuación 25:

figure-results-3

El SSIM se utilizó para evaluar la similitud perceptual de imágenes y se define mediante la Ecuación 2633:

figure-results-4  (26)

Aquí, μ denota la intensidad media, σ denota la varianza, σxy denota la covarianza entre imágenes, y C1 y C2 son constantes de estabilización.

El PSNR es una métrica utilizada comúnmente para evaluar la calidad de las imágenes generadas y se define en la Ecuación 2733:

figure-results-5

Aquí, MaxI denota el valor máximo posible de píxel de la imagen y MSE es el error cuadrático medio entre la imagen original y la reconstruida.

FID se puede calcular utilizando medias y matrices de covarianza como en la Ecuación 2833:

figure-results-6   (28)

Aquí, μr es el valor medio de la imagen real, μg es el valor medio de la imagen generada, y Σr y Σg son las matrices de covarianza de las imágenes reales y generadas, respectivamente.

Para la comparación de rendimiento, el marco propuesto se evaluó frente a métodos representativos comúnmente utilizados para segmentación semántica, reconstrucción de imágenes y generación artística de imágenes. U-Net y DeepLabV3+ se incluyeron como métodos básicos de segmentación, mientras que Pix2Pix y CycleGAN se incluyeron como métodos básicos de reconstrucción. StyleGAN y AttentionGAN se utilizaron como métodos representativos de generación artística de imágenes. Estas comparaciones se realizaron para evaluar la eficacia de SegCycle-SPADE en la preservación de la información de los motivos estructurales mientras se mejora simultáneamente la calidad artística.

Cada experimento se repitió cinco veces para evaluar la estabilidad y reproducibilidad del rendimiento. Se utilizó una semilla aleatoria fija de 42 para la partición del conjunto de datos, con el fin de garantizar subconjuntos consistentes de entrenamiento, validación y prueba en todos los experimentos. Los resultados se presentan como media ± desviación estándar. Los bajos valores de desviación estándar observados en exactitud (Accuracy), IoU, Dice, SSIM, PSNR y FID indican que el marco propuesto logró un rendimiento estable a lo largo de las repeticiones experimentales. La significancia estadística se evaluó mediante pruebas t pareadas, y las diferencias se consideraron estadísticamente significativas cuando p < 0,05. Dado que todos los modelos se evaluaron en las mismas particiones del conjunto de datos, se obtuvieron mediciones de rendimiento pareadas a través de las repeticiones, lo que justifica el uso de pruebas t pareadas. Para controlar la tasa de error global asociada con múltiples comparaciones por pares, se aplicó la corrección de Bonferroni, y la significancia estadística se determinó utilizando un umbral ajustado de α/n, donde n denota el número de comparaciones por pares.

Los hallazgos experimentales respaldan firmemente la eficacia del marco propuesto SegCycle-SPADE. El rendimiento superior de segmentación alcanzado por SegFormer-B2 demuestra su capacidad para identificar y preservar con precisión los límites de los motivos culturalmente significativos. Las mejoras en las puntuaciones de IoU y Dice indican además una preservación efectiva de las estructuras semánticas de los motivos a lo largo de toda la canalización de procesamiento. La integración de CycleGAN y SPADE reconstruyó con éxito estructuras de motivos incompletas manteniendo detalles visuales finos, tal como lo reflejan los valores mejorados de SSIM y PSNR. Además, los puntajes más bajos de FID indican que los patrones artísticos generados presentan una mayor similitud con imágenes culturales y artísticas auténticas, lo que sugiere una coherencia estilística y realismo visual mejorados.

El CAFFM contribuyó significativamente a estas mejoras al facilitar una interacción eficaz entre la información estructural derivada de la segmentación y las representaciones de estilo generativo. Mediante la fusión de características basada en la atención cruzada, CAFFM mejoró tanto la fidelidad estructural como la autenticidad artística, al tiempo que preservó las relaciones de largo alcance entre los motivos culturales.

Figura 6 presenta la comparación de precisión de segmentación entre el marco propuesto SegCycle-SPADE y métodos existentes en los conjuntos de datos Miao Batik y WikiArt. Los enfoques tradicionales de segmentación, como U-Net y DeepLabV3+, alcanzaron un rendimiento competitivo debido a su capacidad para aprender representaciones espaciales. Sin embargo, Pix2Pix y CycleGAN mostraron una precisión de segmentación más baja porque no fueron diseñados específicamente para tareas de segmentación. El marco propuesto SegCycle-SPADE logró la mayor precisión de segmentación en ambos conjuntos de datos gracias a la integración de SegFormer-B2 y la mejora de características basada en CAFFM.

figure-results-7
Figura 6. Comparación de la precisión de segmentación entre diferentes métodos. Comparación de la precisión de segmentación obtenida mediante U-Net, DeepLabV3+, Pix2Pix, CycleGAN y el marco propuesto SegCycle-SPADE en los conjuntos de datos Miao Batik y WikiArt. Los resultados se presentan como media ± desviación estándar (DE) a partir de cinco ejecuciones independientes (n = 5). Las barras de error representan una desviación estándar. Valores más altos indican un mejor rendimiento de segmentación. El marco propuesto SegCycle-SPADE logró la mayor precisión de segmentación en ambos conjuntos de datos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 7 presenta la comparación del IoU entre los métodos evaluados. U-Net y DeepLabV3+ lograron un rendimiento de superposición elevado debido a sus arquitecturas orientadas a la segmentación. En contraste, Pix2Pix y CycleGAN produjeron valores de IoU más bajos porque su objetivo principal es la traducción de imágenes y no la segmentación semántica. El marco propuesto SegCycle-SPADE alcanzó los valores más altos de IoU en ambos conjuntos de datos, lo que indica una mejor localización y preservación de las regiones de motivos culturales.

figure-results-8
Figura 7. Comparación de los puntajes de Intersección sobre Unión (IoU) para la segmentación de motivos culturales. Comparación del rendimiento de IoU entre métodos de segmentación en los conjuntos de datos Miao Batik y WikiArt. Los resultados se presentan como media ± desviación estándar (DE) a partir de cinco ejecuciones independientes (n = 5). Las barras de error indican una desviación estándar. Valores más altos de IoU indican una mayor superposición entre las regiones de motivos predichas y de referencia, así como una mejor preservación de los límites de los motivos. El marco propuesto SegCycle-SPADE obtuvo los puntajes más altos de IoU en ambos conjuntos de datos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 8 presenta la comparación del coeficiente de similitud de Dice. Dice mide el solapamiento entre las máscaras de segmentación predichas y las regiones del motivo reales. Los enfoques convencionales de segmentación alcanzaron puntajes de Dice relativamente altos debido a su eficacia para aprender estructuras espaciales. Sin embargo, el marco propuesto SegCycle-SPADE obtuvo los puntajes de Dice más altos en ambos conjuntos de datos, lo que demuestra una mayor consistencia en la segmentación y una mejor preservación del motivo.

figure-results-9
Figura 8. Comparación del coeficiente de Dice para la segmentación de motivos culturales. Comparación de los valores del coeficiente de Dice obtenidos mediante diferentes enfoques de segmentación en los conjuntos de datos Miao Batik y WikiArt. El coeficiente de Dice evalúa el solapamiento entre las máscaras de segmentación predichas y las máscaras de referencia, siendo los valores más altos indicativos de un mejor desempeño en la segmentación y la identificación de regiones de motivos. El marco propuesto SegCycle-SPADE logró los valores más altos del coeficiente de Dice en ambos conjuntos de datos. Haga clic aquí para ver una versión más grande de esta figura.

Figura 9 presenta la comparación SSIM entre los patrones culturales reconstruidos. Los métodos basados en GAN, como Pix2Pix, CycleGAN y StyleGAN, alcanzaron valores SSIM más altos que los métodos tradicionales de segmentación porque fueron diseñados para la generación de imágenes. Sin embargo, el marco propuesto SegCycle-SPADE logró los valores SSIM más altos en ambos conjuntos de datos, lo que indica una mejor preservación de los detalles estructurales y la coherencia artística.figure-results-10

Figura 9. Comparación del Índice de Similitud Estructural (SSIM). Comparación de los valores del Índice de Similitud Estructural (SSIM) obtenidos mediante diferentes métodos de reconstrucción en los conjuntos de datos Miao Batik y WikiArt. Los resultados se presentan como media ± desviación estándar (DE) a partir de cinco ejecuciones independientes (n = 5). Las barras de error indican una desviación estándar. Valores más altos de SSIM indican una mayor similitud estructural entre los patrones reconstruidos y los patrones de referencia. El marco propuesto SegCycle-SPADE obtuvo las puntuaciones más altas de SSIM en ambos conjuntos de datos. Haga clic aquí para ver una versión más grande de esta figura.

Se utilizó FID para evaluar el realismo y la similitud distribucional de los patrones artísticos generados. El cálculo de FID se realizó empleando una red Inception-v3 previamente entrenada, con vectores de características extraídos de la capa pool3, lo que dio lugar a representaciones de características de 2048 dimensiones. Antes de la extracción de características, las imágenes generadas y de referencia se redimensionaron a 299 × 299 píxeles mediante interpolación bilineal y se normalizaron según el protocolo estándar de preprocesamiento de Inception-v3. El FID se calculó utilizando distribuciones de características extraídas del conjunto de datos de prueba independiente. Las estadísticas de media y covarianza se estimaron a partir de los embeddings de características y se utilizaron dentro de la formulación estándar de FID.

Como se muestra en la Tabla 4, los enfoques convencionales de generación de imágenes, como Pix2Pix y CycleGAN, produjeron puntajes FID relativamente altos porque carecían de orientación estructural explícita. StyleGAN y AttentionGAN lograron puntajes FID más bajos gracias a capacidades mejoradas de aprendizaje de características. Sin embargo, el marco propuesto SegCycle-SPADE alcanzó los puntajes FID más bajos en ambos conjuntos de datos, lo que demuestra una mayor realismo de las imágenes, coherencia estilística y preservación de motivos culturales.

MétodoConjunto de datos Miao Batik (FID)Conjunto de datos WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (Propuesto)28.531.2

Tabla 4: Resultados de la Distancia de Incepción de Fréchet (FID) para la Reconstrucción de Patrones Culturales. Comparación de los puntajes de Distancia de Incepción de Fréchet (FID) obtenidos por el marco propuesto SegCycle-SPADE y modelos generativos de referencia en los conjuntos de datos Miao Batik y WikiArt. Valores más bajos de FID indican una mayor similitud entre las distribuciones de características de imágenes generadas y reales, y por lo tanto reflejan una mayor realismo visual de los patrones culturales reconstruidos.

Figura 10 compara la calidad de reconstrucción alcanzada por diferentes métodos. La calidad de reconstrucción (%) se calculó convirtiendo el SSIM entre la imagen reconstruida y la imagen de referencia correspondiente a una escala porcentual (SSIM × 100). Porcentajes más altos indican una mayor fidelidad estructural y similitud visual con el motivo cultural original. Los modelos generativos convencionales, como Pix2Pix y CycleGAN, lograron un rendimiento de reconstrucción moderado. Arquitecturas más avanzadas, incluyendo StyleGAN y AttentionGAN, alcanzaron una calidad de reconstrucción mejorada debido a sus capacidades mejoradas de aprendizaje de características. Sin embargo, el marco propuesto SegCycle-SPADE logró la mayor calidad de reconstrucción gracias a su integración de la guía de segmentación semántica, fusión de características con atención cruzada, aprendizaje de reconstrucción y síntesis artística.

figure-results-11
Figura 10. Comparación de la Calidad de Reconstrucción de Patrones. Comparación de la calidad de reconstrucción obtenida mediante Pix2Pix, CycleGAN, StyleGAN, AttentionGAN y el marco propuesto SegCycle-SPADE en los conjuntos de datos Miao Batik y WikiArt. Los resultados se presentan como media ± desviación estándar (DE) a partir de cinco ejecuciones independientes (n = 5). Las barras de error indican una desviación estándar. Valores más altos indican una mejor preservación de los detalles estructurales, la coherencia semántica y la fidelidad visual. El marco propuesto SegCycle-SPADE obtuvo las puntuaciones más altas de calidad de reconstrucción en ambos conjuntos de datos. Haga clic aquí para ver una versión más grande de esta figura.

Se utilizó el PSNR para evaluar la fidelidad de la reconstrucción midiendo la similitud a nivel de píxeles entre las imágenes reconstruidas y las imágenes de referencia correspondientes. El PSNR se calculó entre cada imagen reconstruida y su imagen original de Miao Batik correspondiente, utilizada como referencia de verdad fundamental. Valores más altos de PSNR indican un error de reconstrucción más bajo. Como se muestra en Tabla 5, Pix2Pix y CycleGAN alcanzaron valores moderados de PSNR porque reconstruyeron patrones sin orientación estructural explícita. StyleGAN y AttentionGAN lograron valores más altos de PSNR mediante un aprendizaje más profundo de características. El marco propuesto SegCycle-SPADE alcanzó los valores más altos de PSNR en ambos conjuntos de datos, demostrando una fidelidad de reconstrucción superior y una mejor preservación de las estructuras de motivos culturales.

MétodoConjunto de datos Miao Batik
(PSNR, dB)
Conjunto de datos WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (Propuesto)32.431.2

Tabla 5: Resultados de la Relación Pico de Señal a Ruido (PSNR) para la Reconstrucción de Patrones Culturales. Comparación de los valores de Relación Pico de Señal a Ruido (PSNR) obtenidos por el marco propuesto SegCycle-SPADE y métodos básicos en los conjuntos de datos Miao Batik y WikiArt. Valores más altos de PSNR indican una mayor fidelidad de reconstrucción y una menor distorsión en relación con las imágenes de referencia correspondientes.

Figura 11 ilustra el comportamiento de convergencia del marco propuesto SegCycle-SPADE durante el entrenamiento. Las curvas de pérdida representan las pérdidas medias de entrenamiento promediadas a lo largo de cinco ejecuciones independientes de entrenamiento. Para reducir la variabilidad estocástica y proporcionar una representación más robusta de la convergencia del entrenamiento, los valores de pérdida se promediaron en cada época a través de todas las ejecuciones. Durante las primeras épocas de entrenamiento, los valores de pérdida fueron relativamente altos porque el modelo aún estaba aprendiendo representaciones de características a partir de los datos de entrada. A medida que avanzó el entrenamiento, todos los componentes de la pérdida disminuyeron gradualmente y se estabilizaron, lo que indica una optimización exitosa de los objetivos de segmentación, reconstrucción y síntesis artística. El comportamiento de convergencia observado demuestra la eficacia, estabilidad y reproducibilidad del marco propuesto durante el entrenamiento.

figure-results-12
Figura 11. Convergencia del Entrenamiento del Marco Propuesto SegCycle-SPADE. Curvas de pérdida durante el entrenamiento del marco propuesto SegCycle-SPADE a lo largo de 100 épocas de entrenamiento, promediadas en cinco ejecuciones independientes (n = 5). La figura muestra la evolución de la pérdida total (LTotal), la pérdida de segmentación (LSeg), la pérdida del generador (LG) y la pérdida del discriminador (LD) durante el entrenamiento. La reducción gradual y posterior estabilización de todos los componentes de pérdida indican una convergencia exitosa y una optimización estable del marco propuesto. Haga clic aquí para ver una versión más grande de esta figura.

Estudio de ablación
Para evaluar la contribución de cada componente dentro del marco propuesto SegCycle-SPADE, se realizó un estudio de ablación utilizando múltiples configuraciones controladas del modelo. Los resultados se resumen en las Tablas 6 y 7.

Configuración del modeloPrecisión de segmentación (%)IoUSSIM
Solo SegFormer87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (Propuesto)93.80.860.93

Tabla 6: Estudio de ablación de los componentes de SegCycle-SPADE. Comparación del rendimiento de configuraciones de modelos mejoradas progresivamente para evaluar la contribución de los componentes individuales del marco. El estudio examina los efectos de la segmentación semántica, el Módulo de Fusión de Características Culturales con Atención Cruzada (CAFFM), la reconstrucción basada en CycleGAN y la síntesis artística basada en SPADE sobre la precisión de la segmentación, la Intersección sobre Unión (IoU) y el Índice de Similitud Estructural (SSIM). Valores más altos indican una mejor segmentación de motivos, calidad de reconstrucción y preservación estructural.

VarianteIoU (%)Dice (%)SSIMPSNR (dB)FID ↓
Solo SegFormer84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (Modelo completo)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

Tabla 7:  Análisis de Contribución de Componentes del Marco Propuesto SegCycle-SPADE. Comparación del rendimiento de variantes individuales del marco utilizadas para evaluar la contribución de CAFFM, CycleGAN, SPADE y la arquitectura completa SegCycle-SPADE. Los resultados se presentan utilizando la Intersección sobre Unión (IoU), coeficiente de Dice, Índice de Similitud Estructural (SSIM), Relación Señal a Ruido de Pico (PSNR) y Distancia de Incepción de Fréchet (FID). Valores más altos de IoU, Dice, SSIM y PSNR indican una mejor calidad de segmentación y reconstrucción, mientras que valores más bajos de FID indican una mayor realismo visual de los patrones culturales generados.

Tabla 6 evalúa la contribución acumulativa de los componentes principales del marco mediante cuatro configuraciones: (i) solo SegFormer, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN, y (iv) SegFormer + CAFFM + CycleGAN + SPADE (marco propuesto). El modelo base SegFormer alcanzó una precisión de segmentación del 87,3 %, una puntuación de IoU de 0,76 y un valor de SSIM de 0,82. La incorporación del módulo CAFFM mejoró el rendimiento en todas las métricas de evaluación, aumentando la precisión de segmentación hasta el 89,6 %, el IoU hasta 0,79 y el SSIM hasta 0,86. La adición de CycleGAN potenció aún más la capacidad de reconstrucción estructural, obteniendo un IoU de 0,82 y un valor de SSIM de 0,89. El marco completo SegCycle-SPADE logró el mejor rendimiento general, con una precisión de segmentación del 93,8 %, un IoU de 0,86 y un valor de SSIM de 0,93. Estos resultados demuestran que cada componente contribuye de forma incremental a una mayor precisión de segmentación, preservación estructural y calidad de reconstrucción de imágenes.

Tabla 7 analiza más a fondo la contribución de los componentes individuales del marco mediante cinco variantes del modelo: (i) solo SegFormer, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM, y (v) el modelo completo que incorpora SegFormer, CAFFM, CycleGAN, SPADE y la pérdida por preservación de motivos. El rendimiento se evaluó utilizando las métricas de IoU, coeficiente de Dice, SSIM, PSNR y FID.

La configuración básica solo con SegFormer alcanzó un IoU del 84,2 %, un coeficiente Dice del 88,5 %, un valor SSIM de 0,82, un PSNR de 24,8 dB y una puntuación FID de 31,8. La adición de CycleGAN mejoró la calidad de reconstrucción y redujo la puntuación FID a 27,5, lo que indica un mayor realismo de la imagen. La incorporación de SPADE mejoró aún más la similitud estructural y la calidad de la imagen, obteniendo un valor SSIM de 0,88 y una puntuación FID de 23,4. La inclusión del módulo propuesto CAFFM produjo mejoras sustanciales en todas las métricas, aumentando el IoU al 90,0 %, el coeficiente Dice al 93,1 %, el SSIM a 0,90 y el PSNR a 29,6 dB, mientras reducía la puntuación FID a 20,3. El modelo completo, que además incorpora la pérdida de preservación de motivos, alcanzó el mejor rendimiento general con un IoU del 93,0 %, un coeficiente Dice del 95,4 %, un valor SSIM de 0,92, un PSNR de 31,2 dB y una puntuación FID de 17,6.

Tabla 8 presenta una visión general comparativa de enfoques representativos de aprendizaje profundo utilizados para la reconstrucción y preservación de patrones del patrimonio cultural. Los métodos convencionales basados en CNN proporcionan un aprendizaje eficaz de características locales y un buen rendimiento en segmentación, pero a menudo tienen dificultades para preservar estructuras de motivos complejas debido a una modelización limitada de dependencias de largo alcance. Los enfoques basados en GAN mejoran la síntesis de imágenes y las capacidades de transferencia de estilo; sin embargo, pueden presentar inconsistencias semánticas y pérdida de detalles estructurales finos. Los métodos basados en transformadores mejoran la comprensión contextual global, pero normalmente carecen de capacidades de reconstrucción generativa, mientras que los métodos basados en difusión ofrecen un alto realismo visual a costa de una mayor complejidad computacional. Los enfoques híbridos basados en transformadores y GAN abordan parcialmente estas limitaciones mediante la combinación de mecanismos de extracción de características y generación de imágenes. En contraste, el marco propuesto SegCycle-SPADE integra segmentación basada en transformadores, fusión de características mediante atención cruzada, reconstrucción generativa y síntesis artística guiada por segmentación dentro de una arquitectura unificada, mejorando así la fidelidad estructural, la coherencia semántica y la preservación de motivos culturales. La comparación se resume en la Tabla 8.

EnfoqueMetodología principalPuntos fuertesLimitacionesRelevancia para el patrimonio cultural
Métodos basados en CNN (por ejemplo, U-Net, DeepLabV3+)Extracción de características convolucionales y segmentación semánticaAprendizaje efectivo de características locales y segmentación precisaModelado limitado de dependencias de largo alcance; dificultad para preservar estructuras de motivos complejosAdecuado para la segmentación de motivos, pero menos eficaz para la reconstrucción artística
Métodos basados en GAN (por ejemplo, Pix2Pix, CycleGAN)Generación adversarial de imágenes y traducción de imagen a imagenSíntesis de imágenes de alta calidad y transferencia de estiloInestabilidad durante el entrenamiento; inconsistencia semántica; posible pérdida de detalles estructurales finosÚtil para la restauración de patrones, pero puede no preservar con precisión los motivos culturales
Métodos basados en transformadoresAtención propia y modelado del contexto globalCaptura dependencias de largo alcance y relaciones visuales complejasAlto costo computacional; requiere grandes conjuntos de datos para el entrenamientoEficaz para el análisis de patrones complejos, pero capacidad generativa limitada cuando se usa de forma aislada
Métodos basados en difusiónGeneración de imágenes basada en denoising iterativoAlto realismo visual y diversidad de imágenesVelocidad lenta de inferencia; altos requisitos computacionales; control estructural limitadoPrometedor para la generación de imágenes del patrimonio, pero intensivo computacionalmente
Métodos híbridos basados en transformador-GANCombinación de extracción de características basada en transformador y generación basada en GANMejora en la representación de características globales y calidad de imagenA menudo carecen de orientación semántica explícita para la preservación de motivosMejora la calidad de generación, pero no está específicamente diseñado para motivos del patrimonio cultural
SegCycle-SPADE propuestoSegFormer + CAFFM + CycleGAN + SPADESegmentación basada en transformador, fusión de características guiada por atención, consistencia semántica, preservación de motivos y reconstrucción artística controlableMayor complejidad computacional que los enfoques basados únicamente en CNNDiseñado específicamente para la reconstrucción y preservación de patrones del patrimonio cultural, con mayor fidelidad estructural y consistencia semántica

Tabla 8: Comparación de enfoques representativos de aprendizaje profundo para la reconstrucción y preservación de patrones del patrimonio cultural. Comparación cualitativa de enfoques representativos de aprendizaje profundo utilizados para la segmentación de imágenes, reconstrucción de patrones, generación de estilos y preservación del patrimonio cultural. La tabla resume la metodología principal, fortalezas, limitaciones y aplicabilidad de cada enfoque, y destaca cómo el marco propuesto SegCycle-SPADE combina segmentación semántica, fusión de características, reconstrucción y síntesis de estilo para abordar los desafíos relacionados con la preservación estructural y la coherencia semántica en los patrones del patrimonio cultural.

Las mejoras observadas demuestran que el módulo CAFFM mejora eficazmente la interacción entre las características estructurales derivadas de la segmentación y las representaciones del estilo artístico mediante la fusión de características basada en la atención cruzada. Además, la pérdida de preservación del motivo contribuye a mantener las estructuras de motivos culturalmente significativas durante la reconstrucción y la síntesis artística, lo que resulta en una mayor consistencia de la segmentación, fidelidad estructural y realismo visual. En conjunto, los resultados del estudio de eliminación confirman que la integración de SegFormer-B2, CAFFM, CycleGAN, SPADE y la pérdida de preservación del motivo es responsable del rendimiento superior del marco propuesto SegCycle-SPADE.

Disponibilidad de datos:
El conjunto de datos WikiArt utilizado para el aprendizaje de estilos artísticos está disponible públicamente a través del repositorio Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). El conjunto de datos Miao Batik utilizado en este estudio está disponible públicamente a través de Zenodo (https://doi.org/10.5281/zenodo.20807658). Los conjuntos de datos procesados, máscaras de segmentación, pesos del modelo preentrenado, resultados generados y archivos de implementación en Python asociados con el marco propuesto SegCycle-SPADE también están disponibles a través del mismo repositorio de Zenodo.

ARCHIVO SUPLEMENTARIO:
Archivo suplementario 1. Algoritmo 1: Flujo de implementación del marco propuesto SegCycle-SPADE. Código pseudocódigo paso a paso que describe la tubería completa de implementación del marco propuesto SegCycle-SPADE, incluyendo la carga del conjunto de datos, preprocesamiento, segmentación semántica mediante SegFormer-B2, fusión de características mediante el Módulo de Fusión de Características Culturales con Atención Cruzada (CAFFM), reconstrucción de motivos culturales mediante CycleGAN, síntesis de estilo artístico mediante SPADE, entrenamiento del modelo, validación, selección de puntos de control y evaluación final del rendimiento. Haga clic aquí para descargar este archivo.

Discusión

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

La preservación y reconstrucción digital de patrones del patrimonio cultural inmaterial (ICH) ha ganado una atención creciente en los últimos años debido a la pérdida gradual de oficios tradicionales. Estudios previos han intentado abordar la pérdida del patrimonio cultural mediante técnicas de procesamiento de imágenes basadas en el aprendizaje profundo (DL). Por ejemplo, Quan et al.32 propusieron un marco para la preservación del patrimonio cultural basado en grafos de conocimiento y DL para la cultura del arte batik Miao de Guizhou. Aunque el estudio se centró en la reconstrucción digital de patrones culturales, su metodología dependía principalmente de representaciones mediante grafos de conocimiento. De manera similar, Fu y Razmjooy16 propusieron un marco basado en la red de pirámide de características (FPN) para la mejora y restauración de imágenes del patrimonio cultural. Aunque este método proporcionó una extracción efectiva de características para la mejora de imágenes, no incorporó orientación por segmentación de imágenes ni mecanismos de reconstrucción generativa para patrones culturales incompletos. En contraste, el marco propuesto SegCycle-SPADE combina múltiples componentes de DL para superar estos desafíos. Primero, se emplea la segmentación semántica mediante el modelo SegFormer para la identificación precisa de regiones de motivos dentro de los patrones del patrimonio cultural. Posteriormente, un módulo de mejora de características basado en CAFFM mejora las representaciones de características para estructuras de motivos finas. Luego, se utiliza un módulo de reconstrucción CycleGAN para reconstruir regiones faltantes o incompletas dentro de los patrones culturales mediante aprendizaje adversario. Finalmente, un módulo SPADE realiza una mejora estilística manteniendo la alineación estructural con los mapas de segmentación. Los métodos existentes basados en CNN, GAN, transformadores y difusión17,19,20,21,22,23,24,25,30,34 ofrecen ventajas únicas; sin embargo, también presentan limitaciones en la preservación de la coherencia semántica, el mantenimiento de características estructurales o la eficiencia computacional, como se resume en Tabla 8. La arquitectura propuesta SegCycle-SPADE combina las fortalezas de la segmentación basada en SegFormer, la fusión de características mediante atención cruzada, la reconstrucción mediante CycleGAN y la síntesis guiada por SPADE, abordando al mismo tiempo estas limitaciones. En consecuencia, el marco logra una calidad de reconstrucción mejorada y una mayor preservación de motivos culturalmente significativos.

A pesar de su rendimiento prometedor, el marco propuesto SegCycle-SPADE aún presenta varias limitaciones. En primer lugar, la evaluación se realizó utilizando únicamente los conjuntos de datos Miao Batik y WikiArt, lo que podría limitar la generalización del marco a otros dominios del patrimonio cultural. En segundo lugar, la implementación en plataformas con recursos limitados puede ser difícil, ya que la integración de SegFormer, CAFFM, CycleGAN y SPADE incrementa la complejidad computacional y los requisitos de memoria. En tercer lugar, el rendimiento de la segmentación depende en gran medida de la calidad y consistencia de las anotaciones de los motivos, y el sesgo en las anotaciones podría afectar la preservación de estructuras culturalmente significativas. Por último, dado que el marco fue evaluado utilizando solo dos conjuntos de datos, puede ser necesario contar con más datos de entrenamiento y adaptaciones específicas del dominio para garantizar su aplicabilidad en diversas colecciones de patrimonio cultural. Por lo tanto, estudios futuros deberían explorar estrategias de entrenamiento más robustas, arquitecturas ligeras, procedimientos mejorados de anotación y evaluaciones cruzadas utilizando conjuntos adicionales de datos del patrimonio cultural.

La escalabilidad del marco SegCycle-SPADE a conjuntos de datos más grandes y diversos de patrimonio cultural será un enfoque principal de la investigación futura. Se investigará la evaluación cruzada de motivos patrimoniales procedentes de distintas regiones y tradiciones artísticas para mejorar la generalización del modelo y su adaptabilidad cultural. Además, las extensiones multimodales que incorporen descripciones textuales, registros históricos y metadatos culturales podrían proporcionar una orientación semántica más sólida durante la reconstrucción. El marco también podría ampliarse para apoyar la reconstrucción tridimensional del patrimonio cultural mediante la integración de técnicas de reconstrucción basadas en imágenes con métodos de modelado 3D. Asimismo, se explorará su implementación en archivos digitales, museos, exposiciones virtuales y plataformas de preservación del patrimonio cultural para facilitar aplicaciones prácticas de la conservación y documentación del patrimonio asistidas por inteligencia artificial. Para mejorar aún más la interpretabilidad y autenticidad cultural, trabajos futuros investigarán la integración de grafos de conocimiento cultural, documentación etnográfica, metadatos históricos y bases de conocimiento curadas por expertos, con el fin de permitir un análisis y reconstrucción de motivos informados culturalmente32.

Varios aspectos prácticos deben tenerse en cuenta al implementar el marco propuesto SegCycle-SPADE. Durante el entrenamiento de CycleGAN, puede producirse una convergencia adversarial inestable si las pérdidas del generador y del discriminador se vuelven muy desequilibradas. En tales situaciones, reducir la tasa de aprendizaje, aumentar el peso de la pérdida de consistencia cíclica o monitorear el dominio del discriminador puede mejorar la estabilidad del entrenamiento. El colapso de modos puede ocurrir cuando el generador produce repetidamente salidas visualmente similares; este problema puede mitigarse mediante un entrenamiento adversarial equilibrado, el uso de un búfer de reproducción y un monitoreo cuidadoso de las tendencias de las pérdidas del generador y del discriminador. También pueden surgir fallos en la segmentación cuando los motivos culturales presentan texturas complejas, bajo contraste o límites ambiguos. Para abordar este problema, se debe verificar la calidad de la imagen antes del entrenamiento, y las máscaras de segmentación deben inspeccionarse visualmente para garantizar la coherencia de las anotaciones. También es importante mantener la resolución de entrada recomendada y los ajustes de normalización para lograr un rendimiento confiable del SegFormer. La inestabilidad durante el entrenamiento puede deberse además a ajustes inadecuados de la tasa de aprendizaje, datos de entrenamiento insuficientes o variaciones numéricas relacionadas con el hardware. Para mejorar la reproducibilidad, deben emplearse semillas aleatorias fijas para las operaciones de NumPy, PyTorch, CUDA y el mezclado del conjunto de datos. Además, se debe mantener idéntica la canalización de preprocesamiento, las particiones del conjunto de datos, los hiperparámetros del modelo y el entorno de software en todos los experimentos. También se recomienda guardar puntos de control periódicos y monitorear la pérdida de validación para prevenir la degradación del rendimiento y facilitar la recuperación tras sesiones de entrenamiento interrumpidas.

El trabajo propuesto contribuye al avance teórico de los marcos de reconstrucción de patrimonio cultural basados en inteligencia artificial. Los enfoques convencionales de restauración de imágenes generalmente tratan la segmentación de imágenes, la reconstrucción y la generación de estilo como procesos independientes17,19,20,30. En contraste, este estudio propone un marco que integra estos procesos mediante una estrategia de reconstrucción generativa guiada por segmentación. En consecuencia, el estudio contribuye al desarrollo teórico de la reconstrucción de patrimonio cultural asistida por inteligencia artificial, demostrando cómo la segmentación, la reconstrucción y la generación de estilo pueden unificarse dentro de un único marco. Dicha integración es particularmente importante en aplicaciones de patrimonio cultural, donde preservar la estructura de los motivos y su significado semántico es fundamental. Desde una perspectiva práctica, el marco propuesto ofrece una solución eficaz para la preservación digital, restauración y mejora artística de patrones culturales tradicionales. Instituciones de patrimonio cultural, museos y diseñadores pueden emplear SegCycle-SPADE para identificar automáticamente regiones de motivos, reconstruir patrones dañados o incompletos y generar representaciones artísticas visualmente mejoradas de diseños tradicionales. Esta capacidad es especialmente valiosa para tradiciones artesanales en peligro, como los patrones textiles de batik Miao, donde los artefactos históricos pueden estar parcialmente dañados o incompletos. Además, mediante la incorporación de síntesis generativa de estilo, el marco puede apoyar aplicaciones modernas de diseño cultural, tales como el diseño textil, la creación artística digital y la educación patrimonial. De esta manera, el marco propuesto establece un puente entre la preservación del patrimonio cultural y las aplicaciones contemporáneas de diseño cultural.

No obstante, a pesar de los resultados prometedores alcanzados por el marco propuesto SegCycle-SPADE, aún persisten varias limitaciones. En primer lugar, la evaluación se realizó utilizando únicamente los conjuntos de datos Miao Batik y WikiArt, lo cual podría afectar la capacidad de generalización del marco para reconstruir otras formas de patrones del patrimonio cultural. En segundo lugar, dado que el proceso de reconstrucción depende de modelos basados en GAN, las salidas generadas pueden contener ocasionalmente artefactos o texturas poco naturales al manejar estructuras de motivos altamente complejas. En tercer lugar, el marco actual se centra en la reconstrucción de patrones bidimensionales, mientras que algunos artefactos del patrimonio cultural implican estructuras inherentemente tridimensionales. En conjunto, los hallazgos experimentales demuestran la eficacia del marco propuesto SegCycle-SPADE para la reconstrucción artística de patrones del PCI. La integración de la segmentación semántica basada en SegFormer, CAFFM, la reconstrucción de motivos basada en CycleGAN y la síntesis artística basada en SPADE mejoró consistentemente las métricas de rendimiento en segmentación, reconstrucción y calidad de imagen. Los estudios de ablación validaron además la contribución de cada componente del marco, mostrando que CAFFM y la pérdida de preservación de motivos mejoraron sustancialmente la fidelidad estructural y la autenticidad visual. Estos hallazgos respaldan la hipótesis central de que la reconstrucción guiada por segmentación semántica combinada con la fusión de características mediante atención cruzada puede preservar eficazmente motivos culturalmente significativos mientras genera salidas artísticamente ricas. Por lo tanto, el marco propuesto ofrece un enfoque computacional confiable y reproducible para la preservación digital, restauración y revitalización creativa de patrones del PCI.

Divulgaciones

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Conflicto de intereses:
Los autores declaran que no tienen intereses competidores.

Agradecimientos

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Los autores agradecen el apoyo académico e institucional brindado por la Escuela Politécnica de Guangdong y la Universidad Normal del Sur de China durante la realización de esta investigación. Esta investigación fue financiada por el Proyecto General del Fondo Nacional de Ciencias Sociales 2023 (No. 23BH161), titulado “Museo de Regeneración Digital: Investigación sobre la Activación y Difusión de Reliquias Culturales Chinas Clásicas de Caligrafía y Pintura”.

Materiales

Lista de materiales utilizados en este artículo
NombreEmpresaNúmero de catálogoComentarios
Optimizador AdamBiblioteca de optimizadores de PyTorchAdamAlgoritmo de optimización utilizado durante el entrenamiento del modelo.
Kit de herramientas CUDACorporación NVIDIACUDA 11.3Aceleración mediante GPU para cálculos de aprendizaje profundo.
cuDNNCorporación NVIDIAcuDNN 8.2Biblioteca de aceleración de redes neuronales profundas utilizada para acelerar el entrenamiento y la inferencia.
CycleGANUniversidad de California, Berkeley / Código abiertoImplementación oficial de PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)Red generativa antagonista utilizada para la reconstrucción de motivos culturales.
Pesos preentrenados de ImageNetImageNet / Código abiertomit_b2.pth (punto de control preentrenado en ImageNet-1K)Utilizado para inicializar la base del modelo SegFormer-B2 antes del ajuste fino en el conjunto de datos de Batik Miao.
Procesador IntelCorporación IntelIntel Core i7 (11.ª generación)CPU utilizada para el preprocesamiento de imágenes, soporte del entrenamiento del modelo y la inferencia.
MatplotlibEquipo de desarrollo de MatplotlibMatplotlib 3.5.1Visualización de curvas de entrenamiento y resultados de evaluación.
Conjunto de datos Batik MiaoRepositorio ZenodoDOI: 10.5281/zenodo.20807658Conjunto de datos de motivos culturales que contiene 15 148 imágenes, utilizado para segmentación semántica y reconstrucción de patrones.
NumPyDesarrolladores de NumPyNumPy 1.21.5Cálculo numérico y procesamiento del conjunto de datos.
GPU de NVIDIACorporación NVIDIANVIDIA RTX 3090 (24 GB de VRAM)Plataforma de hardware utilizada para el entrenamiento del modelo y la inferencia.
OpenCVFundación OpenCVOpenCV 4.5.5Preprocesamiento de imágenes, redimensionamiento, interpolación y reducción de ruido gaussiano.
Sistema operativoCanonical Ltd.Ubuntu 20.04 LTSEntorno de ejecución experimental.
Pillow (PIL)Biblioteca de imágenes de PythonPillow 8.4.0Carga y manipulación de imágenes.
PythonFundación del Software PythonPython 3.8.10Lenguaje de programación utilizado para la implementación y experimentación.
PyTorchMeta AIPyTorch 1.10.0Entorno de aprendizaje profundo utilizado para el entrenamiento y la inferencia del modelo.
Semilla aleatoriaConfiguración experimental42Semilla fija utilizada para la partición del conjunto de datos, inicialización del modelo y reproducibilidad experimental.
Scikit-learnDesarrolladores de Scikit-learnScikit-learn 1.0.2Partición del conjunto de datos, análisis estadístico y métricas de evaluación.
SeabornComunidad de código abiertoSeaborn 0.11.2Visualización estadística de datos.
SegFormer-B2Investigación de NVIDIA / Código abiertoSegFormer-B2 (base MIT-B2)Modelo de segmentación semántica basado en transformadores, utilizado para la segmentación de motivos culturales.
Máscaras de segmentación / anotacionesConjunto de datos Batik MiaoIncluidas con el conjunto de datosEtiquetas de segmentación semántica a nivel de píxel utilizadas para clasificación de motivos y entrenamiento.
SPADEInvestigación de NVIDIA / Código abiertoImplementación oficial de PyTorch (https://github.com/NVlabs/SPADE)Modelo de síntesis de imágenes guiado por segmentación, utilizado para la generación artística de patrones.
TorchVisionMeta AITorchVision 0.11.1Utilidades de procesamiento de imágenes y transformaciones de conjuntos de datos utilizadas con PyTorch.
Conjunto de datos WikiArtWikiArthttps://www.wikiart.org/Conjunto de datos de estilos artísticos que contiene más de 80 000 obras de arte en 27 estilos artísticos, utilizado para el aprendizaje y la síntesis de estilos.

Referencias

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

Reimpresiones y permisos

Solicitar permiso para reutilizar el texto o las figuras de este artículo de JoVE

Solicitar permiso

Etiquetas

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

Artículos relacionados