本方案描述了一种基于深度学习的工作流程,用于非物质文化遗产图案的语义分割、重建及艺术风格合成,通过基于变换器的特征提取、对抗性重建和空间自适应图像生成,支持文化遗产的数字化保护与创造性应用。
需要JoVE订阅才能观看此内容。 请登录或开始免费试用
本方案描述了一种基于深度学习的工作流程,用于非物质文化遗产图案的语义分割、重建及艺术风格合成,通过基于变换器的特征提取、对抗性重建和空间自适应图像生成,支持文化遗产的数字化保护与创造性应用。
随着基于深度学习的图像合成技术的发展,非物质文化遗产(ICH)图案的数字化保存与重构日益受到关注。现有的基于SegCycle-SPADE的方法在传统工艺图案的结构分割与艺术化重构方面已展现出潜力;然而仍存在若干局限,包括数据集多样性不足、文化语义信息融合不充分,以及在重构过程中对图案结构特征的保留不够完整。为应对这些挑战,本研究提出一种改进的SegCycle-SPADE框架,用于非物质文化遗产图案类型的语义分割与艺术化重构。该框架采用基于Transformer的分割模型SegFormer,以精确识别图案中的纹样边界与区域。此外,引入跨注意力文化特征融合模块,以增强具有文化意义的关键纹样并提升特征表达能力。图案的转换与重构通过CycleGAN实现,同时采用空间自适应去归一化(SPADE)进行艺术风格合成,以保持分割图与生成图像之间的语义一致性。为提升模型的泛化能力与艺术多样性,框架在苗族蜡染文化纹样数据集与WikiArt数据集上共同训练。实验结果表明,所提出的注意力引导的SegCycle-SPADE框架在分割准确率与遗产图案重构性能方面均优于现有的基于生成对抗网络(GAN)的重构方法。该框架为人工智能辅助下的文化遗产记录、重构及传统图案设计的艺术化复兴提供了可扩展的解决方案。
文化遗产包括无形元素(如习俗、语言和信仰)以及有形元素(如艺术品、建筑和文字记录),是人类历史、创造力和身份认同的基本体现1。遗产保护旨在帮助社区重新连接其文化根源,并使后代能够受益于集体文化记忆。它还促进跨文化理解,增进对不同传统与习俗的欣赏,并推动对多元历史叙事的认可。这些文化资产有助于我们理解前人的价值观、观点和经历,并对当代社会身份的形成和文化延续起到重要作用。文化遗产保护的基本原则如图1所示。

图1。基于 SegCycle-SPADE 框架的文化遗产图案重建概念示意图。 本研究提出的方法用于非物质文化遗产图案的重建与增强。该工作流程包括从苗族蜡染和 WikiArt 数据集中采集数据、图像预处理、使用 SegFormer-B2 进行语义分割、通过跨注意力文化特征融合模块(CAFFM)进行特征融合、利用 CycleGAN 进行图案重建、采用 SPADE 实现艺术风格合成,以及最终通过分割与重建指标进行评估。图中箭头表示数据和特征表示在整个框架中的流动方向。请点击此处查看该图的放大版本。
人类社会的集体记忆与文化传承体现在非物质文化遗产(ICH)之中,非物质文化遗产是艺术表达与文化认同的重要媒介。然而,由于全球化和数字化的影响,非物质文化遗产面临着严峻挑战2,3,4。许多濒危的非物质文化遗产实践因熟练工匠数量减少以及对现代市场的适应能力有限,亟需新的保护与发展途径5,6。作为非物质文化遗产研究的重要领域,可持续设计强调文化、社会与环境的协同发展,为非物质文化遗产的持续保护提供了切实可行的路径。通过可持续设计的方法,非物质文化遗产能够在适应当代社会需求的同时实现复兴7,8。
本研究中,“非物质文化遗产图案”指传达并保存潜在非物质文化价值的视觉图样表现形式。因此,所提出的框架旨在重建这些图样的视觉形态,同时保存和记录与之相关的文化信息。
苗绣和蜡染是中国非物质文化遗产的重要形式,通过鸟类、蝴蝶及祖先图腾等象征性图案,反映了苗族群体的历史、信仰与传统9。这些图案深深植根于仪式服饰与节庆习俗之中,并对当地文化与经济发展起到促进作用10,11。数字技术的进步,特别是人工智能(AI)与深度学习(DL)的发展,为文化遗产的保护、分析、重建与记录提供了新的机遇。贵州苗族蜡染是中国保存最完好的蜡染传统之一,是传承苗族文化知识、信仰、习俗与仪式的重要载体12,13,14,15,16。
近期研究表明,深度学习(DL)在文化遗产保护和图案重建方面具有巨大潜力,与U-Net和DeepLabV3+1相比,可实现更高的分割精度(像素准确率=88.6%,平均交并比[IoU]=78.1%)和更优的重建性能。然而,仍存在若干挑战。现有的基于生成对抗网络(GAN)的方法通常难以在复杂图案中保留精细的结构细节17,而数据集多样性不足也限制了模型在不同文化领域的泛化能力18。此外,图像到图像转换模型(如CycleGAN)可能无法保持分割图与生成图像之间的语义一致性19,且缺乏注意力机制可能导致重建过程中丢失具有文化意义的图案细节20。因此,亟需一种增强型框架,整合基于Transformer的分割方法、注意力引导的特征学习以及多数据集训练策略,以实现对非物质文化遗产图案的有效重建。
苗绣的数字化与生成式人工智能的快速发展,为文化遗产保护带来了新的机遇。扩散模型作为一类新兴的深度生成模型,因其强大的内容生成能力,在计算机视觉任务中表现出卓越性能21,22,23,24,25。在逆向扩散过程中,模型逐步学习从含噪声的表征中重建原始输入数据26,27,28。以往研究还探索了三维重建与计算机辅助设计(CAD)技术在文化遗产保护与传播中的应用。
尽管卷积神经网络(CNN)和生成对抗网络(GAN)在图像生成和特征保持方面表现良好,但仍面临感受野有限、模式崩溃以及训练不稳定等挑战29。基于Transformer的架构(如SegFormer和Segmenter)在捕捉全局上下文和语义关系方面表现出色;然而,这类模型计算开销大,可能难以处理细粒度细节。虽然Stable Diffusion等扩散模型展现出强大的图像生成能力,但通常难以对生成设计的结构和艺术特征实现精确控制。此外,大多数现有方法采用独立训练策略,限制了分割与生成组件之间有效的信息共享和协同优化,导致结构准确性与艺术真实性之间存在权衡30。
近期的基于扩散的模型(如潜在扩散和Stable Diffusion)虽然实现了高质量的图像合成,但需要进行迭代去噪,导致计算成本和推理时间增加。此外,在缺乏专门条件机制的情况下,精细文化纹样和结构一致性的保持仍然具有挑战性。基于Transformer的生成模型能够有效捕捉全局上下文关系,但通常需要大规模数据集和大量计算资源。相比之下,本文提出的SegCycle-空间自适应去归一化(SegCycle-SPADE)框架结合了基于SegFormer的分割、交叉注意力特征融合、CycleGAN重建以及SPADE引导合成,提供了明确的结构指导,从而提升了文化遗产图案中纹样的保持能力、语义一致性和可控性重建效果。
目前大多数先进的语义分割技术依赖于具有U形架构的全卷积神经网络(FCNNs)31。在编码阶段,通过一系列卷积和下采样操作提取具有较大感受野的深层特征。解码阶段则通过上采样逐步恢复空间分辨率,最终实现像素级的语义预测。跳跃连接能够补偿下采样过程中丢失的空间信息,并通过将来自编码器不同层级的高分辨率信息直接整合到解码器中,从而在广泛的应用中提升分割性能32。
尽管近年来基于生成对抗网络(GAN)、卷积神经网络(CNN)和扩散模型的方法在图像生成与文化遗产修复方面取得了令人瞩目的成果,但这些方法在保持语义一致性、保留精细结构纹样以及在不同文化图案中实现可重复重建方面仍常面临挑战。大多数现有方法将分割、重建和风格合成视为独立过程,这可能导致具有文化意义的元素丢失以及输出结果不一致。为弥补这一方法学上的不足,本研究提出了一种统一的SegCycle-SPADE框架,该框架融合了基于SegFormer的语义分割、一种新颖的跨注意力文化特征融合模块(CAFFM)、基于CycleGAN的重建以及SPADE引导的风格合成。通过将结构分割信息与生成式特征学习显式结合,所提出的框架能够在保持文化真实性和艺术质量的同时,实现对非物质文化遗产(ICH)纹样更可靠、语义一致且可重复的重建。
本研究指出了当前文化遗产重建方法存在的三个主要局限性:(i)基于生成对抗网络(GAN)的重建方法对精细结构图案的保留不足;(ii)由于在小规模或特定领域数据集上进行训练,导致模型泛化能力有限;(iii)图像到图像翻译框架中,分割输出与生成图像之间的语义一致性不足。此外,分割、重建和风格合成通常被视为相互独立的过程,导致重建过程中文化重要元素的丢失。本文提出的SegCycle-SPADE框架通过在一个统一架构中融合基于Transformer的语义分割、交叉注意力特征融合、CycleGAN重建以及SPADE引导的艺术合成,有效克服了上述局限性,显著提升了非物质文化遗产图案重建中的图案保留性、语义一致性和艺术真实性。
本研究的主要目标是开发一种增强型 SegCycle-SPADE 框架,用于指导脑出血(ICH)模式的语义分割艺术化重建。该框架结合了 SegFormer 以实现精确的文化纹样分割,采用 CycleGAN 进行图案重建,并利用 SPADE 实现风格一致的艺术合成。为了提升特征表示能力并保留精细结构细节,引入了一种通道注意力特征融合模块(CAFFM),以促进分割特征与生成特征之间的有效交互。该框架在苗族蜡染和 WikiArt 数据集上进行训练,可增强重建结果的真实性、风格一致性以及对具有文化意义纹样的保留。
通过在统一架构中结合语义分割、注意力引导的特征融合、模式重建和风格合成,本研究提出了一种新颖的SegCycle-SPADE框架,用于脑出血(ICH)模式的艺术化重建。本工作的主要贡献如下。第一,通过整合SegFormer,开发出一种新颖的语义分割引导的重建框架,能够精确提取并保留复杂的文化纹样和结构元素。第二,提出一种新的CAFFM模块,有效融合分割特征与生成表示,使模型能够捕捉文化纹样与艺术风格模式之间的长距离关联。第三,所提出的CAFFM在增强具有文化意义元素的保留的同时,提升了重建遗产纹样的视觉真实感和结构连贯性。第四,通过集成CycleGAN用于文化模式重建,以及SPADE用于分割引导的艺术合成,该框架确保了生成结果在语义准确性和风格真实性两方面的统一。第五,为提升模型的泛化能力与艺术多样性,模型训练采用了苗族蜡染文化纹样数据集以学习文化模式,同时采用WikiArt数据集以表征艺术风格。WikiArt作为辅助数据集,用于评估框架在不同视觉上下文中的泛化能力、特征学习鲁棒性及风格控制有效性,而非直接应用于苗族文化遗产产品中的目标风格。最后,与现有的基于GAN的文化遗产重建方法相比,实验结果表明,所提出的SegCycle-SPADE框架在分割精度、重建质量及风格一致性方面均取得更优性能。
访问受限。请登录或开始试用以查看此内容。
所提出的 SegCycle-SPADE 框架旨在通过语义分割、基于注意力的特征增强、生成式重建以及艺术风格合成,实现对传统文化遗产图案的重建与优化。本研究采用了公开可用的文化遗产与艺术图像数据集,包括苗族蜡染数据集(Miao Batik dataset)和 WikiArt 数据集。研究未涉及人类受试者、患者数据、个人信息、动物实验或临床记录,因此无需机构伦理委员会批准及知情同意。首先,本研究使用苗族蜡染文化纹样数据集与 WikiArt 数据集进行评估。苗族蜡染数据集由 Quan 等人(2024)32 描述,包含 15,148 张标注的传统苗族蜡染纹样图像。本研究直接使用数据集提供者已有的标注,未额外生成任何人工标注。随后,对图像进行预处理,包括调整尺寸、归一化、去噪以及生成分割掩码。具体的预处理参数详见“数据预处理”小节。所提出的框架采用一种基于 Transformer 的模型 SegFormer-B2,用于数据的语义分割。该方法旨在检测文化纹样的关键区域并学习其结构。分割所得特征随后通过注意力机制进行增强,突出与文化纹样相关的重要信息,并抑制无关内容。注意力机制的具体配置详见“CAFFM”小节。增强后的特征被输入 CycleGAN,通过循环学习重建受损结构。在训练过程中,通过在原始苗族蜡染图像上施加随机掩码和部分遮挡操作,人工构建不完整纹样样本。这些退化操作模拟了文化遗产文物中常见的纹样缺失区域与结构损伤。生成的不完整图像作为 CycleGAN 重建模块的输入,对应的原始图像则作为重建目标。重建后的文化遗产图案进一步通过 SPADE 进行增强,依据生成的分割图实现艺术化提升。所提出框架的性能通过定量的分割与图像质量指标进行评估,同时对重建文化纹样的视觉真实性进行定性分析。视觉真实性的评估基于生成纹样的视觉观察,未作为独立的定量指标使用。评估重点包括纹样保留度、语义一致性、文化特征、结构连贯性以及艺术表现力,相对于对应的参考文化纹样进行判断。模型性能的定量评估采用分割准确率(Segmentation Accuracy)、交并比(IoU)、Dice 系数、结构相似性指数(SSIM)、峰值信噪比(PSNR)以及弗雷歇 inception 距离(FID)。图 2 展示了所提出的 SegCycle-SPADE 框架的整体工作流程,并总结了本研究中使用的评估指标。

图2.所提出的SegCycle-SPADE框架的整体架构流程。 完整SegCycle-SPADE工作流程的概述。来自苗族蜡染和WikiArt数据集的图像在经过预处理后,依次通过SegFormer-B2进行语义分割、CAFFM进行特征增强、CycleGAN进行模式重建,以及SPADE进行艺术风格生成。模型性能通过分割准确率、交并比(IoU)、Dice系数、结构相似性指数(SSIM)、峰值信噪比(PSNR)和Fréchet Inception距离(FID)进行评估,同时对视觉真实性进行定性分析。 请点击此处查看该图的放大版本。
用于文化遗产图案重建的 SegCycle-SPADE 框架旨在整合多种深度学习组件,以实现精确的图案分割、重建和艺术增强,如图2所示。该框架使用苗族蜡染文化图案数据集和 WikiArt 数据集中的图像,以提供多样化的文化图案和艺术风格。首先,利用基于 SegFormer 的语义分割模块对图像进行处理,以识别并勾勒出背景中的文化图案。整体架构包含四个主要阶段:第一,SegFormer 模型从文化图案图像中提取语义分割图;第二,CAFFM 将分割特征与生成式表征相融合,以增强特征学习;第三,CycleGAN 模块利用融合后的特征表征重建文化图案;最后,SPADE 模块通过分割引导的合成方式生成在风格上得到增强的输出,同时保持结构一致性。经过优化的特征图随后由 CycleGAN 重建模块处理,该模块通过将退化的图案映射为其对应的完整形式,学习恢复不完整的文化图案。不完整的图案样本是通过对原始苗族蜡染图像施加随机掩码和部分遮挡操作生成的,从而模拟在受损文化遗产文物中常见的图案缺失区域和结构退化情况。每张退化图像均与其对应的原始图像配对,后者在训练过程中作为重建目标。该策略使 CycleGAN 模块能够学习缺失图案结构的恢复方法,同时保持语义一致性和具有文化意义的特征。最后,SPADE 生成器以生成的分割图为条件进行图像合成,产生视觉上增强的艺术化输出,从而在整个艺术增强过程中维持文化图案的结构完整性。
拟议的 SegCycle-SPADE 框架包含以下步骤。
步骤 1:数据集收集
为实现文化模式学习与艺术风格生成的目标,使用了两个数据集。苗族蜡染文化图案数据集用于提供传统的文化图案信息。该数据集通过 Zenodo 公开获取(https://doi.org/10.5281/zenodo.20807658),包含 15,148 张标注的传统苗族蜡染图案图像。本研究直接使用了数据集创建者提供的现有标注,未额外生成人工标注。WikiArt 数据集用于提供多样的艺术风格信息,以支持艺术风格生成,数据来源于公开的 WikiArt 仓库(https://www.wikiart.org/)。
步骤 2:数据预处理
所有图像均通过调整大小、归一化和降噪进行预处理。语义分割阶段使用了从原始数据集来源获得的现有文化图案标注。本研究未进行任何额外的标注或重新标注操作。
步骤3:使用SegFormer进行语义模式分割
SegFormer 模型被用于文化图案分割。具体的 SegFormer 骨干网络结构及初始化策略在下文中描述。 使用 SegFormer 进行语义模式分割 具体而言,采用基于ImageNet预训练的MIT-B2骨干网络的SegFormer-B2架构进行语义纹样分割。该模型在有效捕捉全局上下文信息的同时,保留了传统文化图案的复杂结构细节。
步骤 4:CAFFM
CAFFM 将语义分割特征与生成式表征相结合,使框架能够同时学习结构图案特征和艺术风格信息。CAFFM 的集成细节见“CAFFM”小节。该模块位于基于 SegFormer 的语义分割阶段与生成重建阶段之间,通过多头交叉注意力机制将来自分割的结构特征与重建特征进行融合。此过程可改善文化图案的保留效果,并提升重建输出的逼真度。
第5步:图像模式重建(CycleGAN)
融合后的特征随后由CycleGAN模块处理,以重建文化图案结构。CycleGAN的网络架构及训练配置详见下文 使用 CycleGAN 进行模式重建 子部分。重建模块包含两个生成器和两个判别器,采用具有九个残差块的残差网络生成器架构,使用PatchGAN判别器,并通过对抗损失和循环一致性损失进行训练。该配置实现了双向域映射,并有助于重建不完整的文化模式结构。
步骤6:艺术风格生成(SPADE)
重建的图案随后通过SPADE模块进行分割引导的艺术风格合成。SPADE生成器的配置详见于 使用SPADE生成艺术风格图像 子模块采用SPADE残差块、空间自适应归一化层,以及源自SegFormer分割图和CAFFM特征表示的语义条件。通过以分割图作为图像生成的条件,合成结果在保持与原始文化图案结构对齐的同时,融入了艺术风格特征。
步骤 7:性能评估
采用多种分割和图像质量评估指标对所提出的框架进行评估,包括分割准确率、IoU、Dice 相似系数(Dice)、SSIM、PSNR 和 FID。为评估实验的一致性,所有实验均使用不同的随机种子重复五次,结果以均值 ± 标准差形式报告。统计学显著性通过配对 t 检验进行评估,显著性阈值为 p < 0.05。
数据集采集
在所提出的 SegCycle-SPADE 框架中,使用了两个数据集用于文化图案理解与风格学习。该框架所采用的第一个数据集是苗族蜡染文化纹样数据集。该数据集包含苗族蜡染的文化纹样,通常为包含动物、植物和几何形状等图案的传统苗族蜡染图像,这些图案广泛应用于苗族艺术中。该数据集中的图像具有丰富的纹理信息,对于保护文化遗产具有重要意义。SegCycle-SPADE 框架中使用的第二个数据集是 WikiArt 数据集。该数据集包含大量来自不同艺术风格的艺术作品,用于复杂的风格学习,通常有助于提升艺术创作效果。该数据集包含 80,000 幅高清艺术作品,涵盖 27 种不同的艺术风格,因此在基于深度学习的风格生成或风格转换任务中具有更高的应用价值。
苗族蜡染数据集:
苗族蜡染数据集(https://doi.org/10.5281/zenodo.20807658)包含 15,148 张描绘具有文化意义图案的蜡染图像。这些图像涵盖多种传统设计,例如动物图案(如蝴蝶和鱼)、植物类纹样以及具有文化象征意义的几何图案。该数据集是所提出框架的重要组成部分,因其提供了真实的文化结构,使分割模块能够在图案重建过程中准确识别并保留图案边界(表 1)。在本研究中,具有文化重要性的图案是指在苗族文化遗产文献中常见并由数据集标注所体现的象征性视觉元素,包括鸟类、蝴蝶、花卉图案以及祖先图腾。这些图案的选择依据是其在文献中记载的文化重要性及其在传统苗族蜡染和刺绣设计中的频繁出现,而非仅基于其出现频率或空间构成。本研究所用的专家指导下的图案标注与分割标签均直接来源于原始的苗族蜡染数据集,未由作者进行额外的手动标注、重新标注或专家指导标注。数据集创建者提供的现有标注被直接用于语义分割的训练与评估。
| 参数 | 描述 |
| 数据集名称 | Miao Batik Cultural Pattern Dataset |
| 数据集来源 | Zenodo 仓储 (DOI: 10.5281/zenodo.20807658) |
| 领域 | 非物质文化遗产(ICH)/ 纺织图案分析 |
| 图像总数 | 15,148 张图像 |
| 图像类型 | 传统苗族蜡染纺织图案的数字图像 |
| 图案类别 | 动物图案、植物图案和几何图案 |
| 文化起源 | 中国贵州省苗族民族文化 |
| 原始图像分辨率 | 高分辨率图像(通常短边 ≥ 1,000 像素),在预处理前以原始扫描或摄影方式获取 |
| 训练分辨率 | 预处理过程中将图像调整为 256 × 256 像素 |
| 标注可用性 | 使用数据集创建者提供的现有分割标注进行训练与评估,未作任何修改。本研究未进行额外的手动标注、重新标注或专家确认流程。 |
| 本研究中的应用 | 文化图案分割、特征提取、图案保护与图案重建 |
表1:苗族蜡染文化图案数据集的特征。用于语义分割、文化图案分析和图案重建的苗族蜡染文化图案数据集的汇总。该表描述了数据集来源、图像特征、图案类别、文化起源、图像分辨率及其在所提出的SegCycle-SPADE框架中的作用。
WikiArt 数据集:
WikiArt 数据集 [https://www.wikiart.org/] 是一个广受欢迎的大规模数字艺术资源库,包含来自 表 2 中 27 种不同艺术风格的超过 80,000 张图像。这些风格包括文艺复兴艺术、印象派、立体主义和超现实主义。该数据集在所提出的框架中具有重要作用,因为它提供了使 SPADE 模块能够在保持来自分割过程的结构信息的同时生成文化内涵丰富的图案所需的知识。该数据集包含 56,000 张用于训练的图像,以及 12,000 张用于验证和测试的图像。数据集中的图像有助于高效地训练深度学习模型。
| 参数 | 描述 |
| 数据集名称 | WikiArt 数据集 |
| 数据集来源 | WikiArt 仓库 (https://www.wikiart.org/) |
| 领域 | 数字艺术与绘画 |
| 图像总数 | 约 80,000 件艺术作品 |
| 训练图像 | 56,000 |
| 验证图像 | 12,000 |
| 测试图像 | 12,000 |
| 艺术风格 | 27 种艺术风格,包括文艺复兴、印象派、立体主义、超现实主义、表现主义、现实主义和抽象艺术 |
| 原始图像分辨率 | 原始图像分辨率因作品和来源而异。在预处理过程中,图像被调整为统一的 256 × 256 像素分辨率。 |
| 训练分辨率 | 在进行艺术风格学习和基于分割的图像合成之前,图像在预处理阶段被调整为 256 × 256 像素。 |
| 数据集划分 | 采用分层随机划分方法(70% 训练、15% 验证、15% 测试),并使用固定的随机种子 42 |
| 风格采样策略 | 采用分层比例采样方法,以保持 27 种艺术风格在训练、验证和测试子集中的分布一致性 |
| 本研究中的应用 | 艺术风格学习、风格表征以及基于分割的艺术化图像合成 |
表2:WikiArt数据集的特征。用于艺术风格学习和风格引导图像合成的WikiArt数据集概要。该表描述了数据集来源、图像分布、艺术风格覆盖范围、数据集划分方式、图像分辨率,以及其在所提出的SegCycle-SPADE框架中的应用。
苗族蜡染数据集包含 15,148 张图像,代表了传统的苗族文化图案。32 该数据集通过 Zenodo 公开获取(https://doi.org/10.5281/zenodo.20807658)。在模型训练之前,所有图像均经过人工视觉检查,调整为 256 × 256 像素,进行归一化处理,并筛查损坏或重复的样本。质量控制筛查未导致任何图像被排除,因此全部 15,148 张图像均保留用于后续分析。该数据集使用固定的随机种子 42 随机划分为训练集(70%)、验证集(15%)和测试集(15%),以确保数据划分的可重复性。WikiArt 数据集通过官方 WikiArt 仓库(https://www.wikiart.org/)获取,包含超过 80,000 幅艺术作品,涵盖 27 种艺术风格。在风格学习实验中,使用 56,000 张图像进行训练,12,000 张用于验证,12,000 张用于测试。
数据预处理
在训练所提出的 SegCycle-SPADE 框架之前,苗族蜡染文化图案数据集和 WikiArt 数据集均经过若干预处理步骤,以确保图像质量的一致性和特征表示的准确性。两个数据集均采用相同的基本预处理流程,包括高斯去噪、归一化、调整至统一输入分辨率以及图像质量验证。然而,这两个数据集在框架中承担不同的角色:WikiArt 数据集用于艺术风格的学习与合成,而苗族蜡染数据集主要用于文化图案的语义分割与重建。除这些任务特定的角色外,未对任一数据集进行特定的预处理修改。为确保深度学习模型处理的一致性,首先将所有图像调整至固定分辨率。此步骤是必要的,因为两个数据集中的图像分辨率因其来源不同而存在差异。调整分辨率可提高计算效率,并防止因维度不一致而影响模型训练。第二个预处理步骤是归一化,即将像素值缩放到标准化范围内,以稳定训练过程中的梯度更新。随后,采用高斯滤波对图像进行处理,以降低可能干扰文化图案结构的噪声。对于苗族蜡染数据集,直接使用从原始数据集来源获取的现有文化图案分割掩膜,且未作任何修改,用于语义分割的训练与评估。本研究未专门生成新的分割掩膜。
除非另有说明,描述已有方法的方程均改编自先前的研究,并已相应引用。描述所提出的CAFFM方法及复合的SegCycle-SPADE优化框架的方程由作者为本研究专门开发。
设数据集中的输入图像表示为公式1:
(1)
其中,H、W 和 C 分别表示图像的高度、宽度和颜色通道数。所有图像均被调整为固定尺寸 H′ × W′,如公式 2所示:

其中,Ir 为调整大小后的图像。归一化像素值根据公式 3计算:
(3)
这有助于稳定训练过程。噪声滤波使用高斯滤波器进行,如公式 4所示:

其中,G(σ) 表示高斯滤波器,* 表示卷积运算。采用一个 5 × 5 卷积核的高斯滤波器,其标准差为 σ = 1.0。为减少边缘伪影,对边界像素应用了反射填充。在进行缩放和归一化之前,去噪处理在图像加载后立即执行。为确保整个研究过程中预处理的一致性,相同的滤波器配置被应用于 Miao Batik 和 WikiArt 数据集中的每一张图像。对于 Miao Batik 数据集,分割掩码根据公式 5生成:

此处,M 是用于引导 SegFormer 模型的分割掩膜。
预处理流程首先从苗族蜡染数据集(Miao Batik dataset)和 WikiArt 数据集获取图像,如图3所示。在训练过程中未采用任何数据增强技术。经过包括图像缩放、归一化、高斯去噪和分割掩膜制备在内的预处理后,图像被直接用于所提出的 SegCycle-SPADE 框架的训练、验证和测试。预处理流程的第一步是将图像调整为固定尺寸,以使深度学习模型能够更高效地处理图像。第二步是归一化处理,将像素值转换为标准化的数值范围,以促进模型的收敛。第三步是去噪处理,清除图像中的噪声,以提升图案识别效果。此外,针对苗族蜡染数据集,对文化图案区域进行标注,从而生成用于模型分割模块的掩膜,确保在生成过程中保留文化图案。该阶段的最终输出是一个干净且可用于训练所提出模型的分割与生成模块的数据集。

图 3.文化遗产图像的数据预处理流程。 该流程图展示了模型训练前应用的图像预处理步骤,包括数据集获取、图像缩放、归一化、高斯去噪、已有文化图案标注以及分割掩码制备。经处理后所得的图像与掩码将作为语义分割与图案重建的输入数据。请点击此处查看本图的高清版本。
在模型训练之前,每张图像均经过质量控制流程。苗族蜡染数据集共包含15,148张图像。原始数据集创建者已对损坏、重复及低质量样本进行了处理;因此,本研究在质量控制筛选过程中未额外排除任何图像。最终,全部15,148张图像均被保留用于分析。预处理过程中,图像以RGB格式加载,并使用双线性插值调整为256 × 256像素。像素值通过除以255,从[0, 255]范围缩放到[0, 1]范围。随后对红、绿、蓝三个通道分别采用均值[0.485, 0.456, 0.406]和标准差[0.229, 0.224, 0.225]进行通道级归一化。预处理流程包括图像加载、RGB格式转换、尺寸调整、像素值缩放、归一化及张量转换。必要时,将灰度图像转换为三通道RGB格式,以确保与深度学习模型的兼容性。预处理完成后,图像被划分为训练集、验证集和测试集。SegCycle-SPADE框架的所有阶段——包括语义分割、特征融合、纹样重建以及基于SPADE的艺术化合成——均采用统一的256 × 256像素输入分辨率。
基于 SegFormer 的语义图案分割
完成此预处理步骤后,苗族蜡染文化图案数据集和 WikiArt 数据集的已清洗和标准化图像将输入至基于 SegFormer-B2 框架构建的语义分割模块。该步骤的目的是准确识别并分离出文化遗产图案中存在的文化图案元素。所提出的 SegFormer 框架基于 Transformer 架构,结合了分层 Transformer 编码器和轻量级 MLP 解码器,以精确捕捉复杂文化遗产图案中的全局上下文信息以及详细的结构信息。该模型首先从输入图像中提取多尺度的特征表示,随后通过解码器融合这些表示,生成精确的分割图案。这确保了遗产图像中的图案能够被正确分割为几何图案、花卉图案和象征性图案等图案元素,同时将其与背景分离并保持其结构完整性。这些结构信息将在后续 SegCycle-SPADE 框架的图案生成阶段中被进一步利用。
设预处理后的输入图像表示为公式6:
(6)
SegFormer 编码器将图像分割成图像块,并利用 Transformer 层提取分层特征,如公式 71所示:

此处,F 表示从 Transformer 编码器获得的多尺度特征图。这些特征编码了局部纹理模式以及基序区域之间的全局上下文关系。SegFormer 模型按照公式 8中定义的方式提取不同尺度的特征图:

使用多尺度表征有助于在文化图案中检测不同尺寸的模式。最后,如公式91所示,通过MLP解码器对特征进行组合:

此处,S 表示最终的预测分割图。
SegFormer-B2 骨干网络使用 ImageNet 预训练权重进行初始化,随后在苗族蜡染数据集上进行微调,以实现文化图案的语义分割。预训练检查点来自官方的 SegFormer 实现。具体而言,在微调前,采用官方 SegFormer 仓库提供的 ImageNet-1K 预训练 MIT-B2 检查点(mit_b2.pth)来初始化 SegFormer-B2 骨干网络。该预训练权重对应于 SegFormer 作者发布的 MIT-B2 骨干网络,作为语义分割训练的初始化模型。其余任务特定的网络层则在训练前采用 PyTorch 默认的权重初始化方法进行初始化。
该架构采用具有重叠图像块嵌入的四阶段分层 Transformer 编码器。在第一阶段,图像块大小设置为 7 × 7,步长为 4。对于四个编码器阶段,嵌入维度分别为 64、128、320 和 512。在这四个阶段中,多头自注意力头的数量分别为 1、2、5 和 8,对应的编码器深度分别为 3、4、6 和 3 层。从编码器提取的多尺度特征通过一个轻量级的全 MLP 解码器进行聚合。在生成最终分割图之前,解码器将每个编码器阶段的特征投影到一个统一的嵌入空间中。所有 Transformer 模块均使用高斯误差线性单元(GELU)作为激活函数。训练过程中采用 0.1 的 dropout 率,以提升泛化能力并减少过拟合。
在训练阶段,SegFormer 框架接收来自两个数据集的预处理图像。苗族蜡染数据集中的图像包含作为分割模型监督学习标签的纹样区域。Transformer 编码器处理整幅图像,并捕捉图像组件之间的长距离关系,这对于包含空间分布纹样的传统蜡染图案尤为重要。分层特征提取机制同时捕捉局部结构,例如重复的几何纹理。MLP 解码器处理这些提取的特征,并生成突出显示纹样区域的分割掩膜。此阶段生成的分割图随后被用作注意力模块和图案重建阶段的结构输入,从而有助于保持生成图案的真实性。
根据视觉和文化特征,将文化图案划分为不同的类别以进行语义分割。分割的分类体系包括动物图案(例如蝴蝶、鱼类、鸟类及其他象征性动物)、植物图案(例如花朵、叶片、藤蔓及植物纹样)、几何图案(例如重复形状、边框及抽象几何结构)以及代表非图案区域的背景区域。采用像素级分割掩码将每个像素分配至一个预定义类别。整数标签编码如下:标签 0 = 背景,标签 1 = 动物图案,标签 2 = 植物图案,标签 3 = 几何图案。分割标注及图案标签均直接来源于原始苗族蜡染数据集。本研究未进行任何额外的手动标注、重新标注、边界验证或专家确认流程。训练与评估所使用的标注均由数据集创建者提供,且未作任何修改。
用于文化图案分割的 SegFormer 模型通过基于 Transformer 的机制处理来自苗族蜡染数据集(Miao Batik dataset)和 WikiArt 数据集的预处理图像,以精确检测文化图案区域,如图4所示。首先,将包含传统文化图案的输入图像输入至 SegFormer 模型。Transformer 编码器从图像块中提取全局上下文信息和局部结构特征。所得到的多尺度特征被送入分割解码器,该解码器利用混合前馈网络(Mix Feed-Forward Network)优化特征表示,提升图案检测精度。SegFormer 模型的输出为一个分割掩码,突出显示对应于文化图案的像素,同时抑制无关的背景信息。分离出的文化图案随后作为 SegCycle-SPADE 框架后续阶段的结构引导。

图4.基于SegFormer-B2的文化图案语义分割。 用于文化图案提取并在苗族蜡染数据集上专门训练的SegFormer-B2语义分割模块架构。该框架包含一个基于Transformer的编码器,用于多尺度特征提取,以及一个轻量级分割解码器,用于生成图案掩膜。模型预测四类语义类别——动物、植物、几何图形和背景,生成的分割掩膜可识别具有文化意义的图案区域,同时抑制无关的背景信息。这些分割输出为所提出的SegCycle-SPADE框架后续的特征融合、重建和艺术合成阶段提供结构指导。请点击此处查看该图的放大版本。
在建议的框架中无需创建新的分割标注。苗族蜡染数据集取自已有的公开资源,模型训练使用了数据集提供者提供的相关纹样信息。在学习过程中,SegFormer 模型生成了语义分割图。因此,本研究无需额外的手动标注软件、标注指南或标注质量控制流程。
CAFFM
为了增强语义分割特征与生成重建表征之间的交互,该研究还提出了一种 CAFFM 模块。SegFormer-B2 编码器向 CAFFM 模块提供语义特征图,而 CycleGAN 重建步骤则提供生成特征图。首先,通过线性投影层将两个特征流投影到一个共同的嵌入空间中。在进行交叉注意力计算时,利用生成的特征张量构建查询(Q)、键(K)和值(V)的表征。随后,采用多头交叉注意力机制对结构模体信息与艺术风格元素之间的关系进行建模。接着,对融合后的特征表征应用层归一化、残差连接以及带有 GELU 激活函数的前馈网络层。最终,SPADE 基成阶段接收 CAFFM 模块的输出,从而在不牺牲艺术一致性的前提下保留具有文化意义的主题。
为确保特征兼容性,首先使用线性投影层将输入特征投影到嵌入维度为256的共享嵌入空间中。随后,采用具有八个注意力头的多头交叉注意力机制(MultiHead Cross-Attention)对语义结构信息与生成式风格表示之间的关联进行建模。交叉注意力计算使用由特定线性变换层生成的查询向量(Query, Q)、键向量(Key, K)和值向量(Value, V)。为提高训练稳定性并保持特征完整性,引入残差连接与层归一化(Layer Normalization)以进一步增强融合后的特征表示。接着,通过应用带有高斯误差线性单元(GELU)激活函数的前馈网络,提升非线性特征学习能力。该模块最终生成维度为256的输出特征表示,并将其传递至后续阶段用于创意合成。CAFFM通过基于交叉注意力的融合技术,成功地将艺术风格数据与文化纹样结构相结合,从而在重建的文化遗产图案中增强了纹样保留性与视觉连贯性。
在所提出的系统中,结构特征源自苗族蜡染数据集,而风格特征则从 WikiArt 数据集学习得到。设通过苗族蜡染数据集图像经 SegFormer 分割网络提取的特征图表示为 Fs,而通过 WikiArt 图像在风格特征提取分支中获得的特征图表示为 Fa。所提出的 CAFFM 模块通过交叉注意力机制融合这两个特征域,以学习文化图案的结构与风格依赖关系。表3列出了所有架构特性,包括嵌入维度、归一化层、激活函数以及注意力头的配置。对于尺寸为 256 × 256 像素的输入图像,SegFormer-B2 编码器生成大小为 64 × 64 × 128 的语义特征图,风格特征提取分支也生成大小为 64 × 64 × 128 的特征图。在进行交叉注意力融合之前,这两个特征图均通过可学习的线性层投影到维度为 256 的共享嵌入空间中。
| 参数 | 配置 |
| 提出框架 | SegCycle-SPADE |
| 语义分割模型 | SegFormer-B2 |
| SegFormer 编码器阶段数 | 4 |
| 权重初始化 | ImageNet-1K 预训练 SegFormer-B2(MIT-B2 主干网络) |
| 检查点来源 | 官方 NVIDIA SegFormer 仓库(https://github.com/NVlabs/SegFormer);检查点:segformer.b2.512x512.ade.160k |
| 微调策略 | 在苗族蜡染数据集上进行端到端微调 |
| 图像块嵌入尺寸 | 7 × 7 |
| 图像块步长 | 4 |
| 嵌入维度 | 64, 128, 320, 和 512 |
| 编码器深度 | 3, 4, 6, 和 3 |
| 注意力头数 | 1, 2, 5, 和 8 |
| 解码器类型 | 全MLP解码器 |
| 激活函数 | GELU |
| Dropout率 | 0.1 |
| 特征增强模块 | 交叉注意力文化特征融合模块(CAFFM) |
| CAFFM嵌入维度 | 256 |
| CAFFM注意力头数 | 8 |
| CAFFM融合尺度数 | 4 |
| 重建模型 | CycleGAN |
| 风格生成模型 | SPADE |
| 文化数据集 | 苗族蜡染数据集 |
| 风格数据集 | WikiArt 数据集 |
| 苗族蜡染图像数量 | 15,148 |
| WikiArt图像数量 | 约 80,000 |
| 输入图像分辨率 | 256 × 256 像素 |
| 颜色格式 | RGB |
| 插值方法 | 双线性插值 |
| 去噪方法 | 高斯滤波 |
| 高斯核大小 | 5 × 5 |
| 高斯标准差(σ) | 1 |
| 归一化范围 | [0, 1] |
| 批量大小 | 16 |
| 训练轮数 | 100 |
| 优化器 | Adam |
| 学习率 | 0.0002 |
| Adam 参数 | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0 |
| 损失函数 | 分割损失、对抗损失、循环一致性损失、重建损失、图案保持损失和风格一致性损失 |
| 数据集划分策略 | 训练集 / 验证集 / 测试集 |
| 训练集比例 | 70% |
| 验证集比例 | 15% |
| 测试集比例 | 15% |
| 随机种子 | 42 |
| 评估指标 | 分割准确率、IoU、Dice系数、SSIM、PSNR 和 FID |
| 编程语言 | Python 3.8.10 |
| 深度学习框架 | PyTorch 1.10.0 |
| 硬件平台 | NVIDIA RTX 3090 GPU(24 GB 显存)、Intel Core i7(第11代)、32 GB 内存 |
| 操作系统环境 | Ubuntu 20.04 LTS |
表3:实验设置与模型配置。 所提出的SegCycle-SPADE框架在实现与评估过程中所使用的架构组件、训练配置、预处理设置、数据集、优化参数、评估指标及计算环境的汇总。
注意力模块首先使用公式10将特征图映射为查询、键和值表示:

其中,Wq、Wk 和 Wv 为可学习的权重矩阵。注意力权重通过查询向量与键向量之间的相似性计算,计算公式见公式 1117:

其中,dk 是键向量的维度。通过将注意力权重与值矩阵相乘,使用公式 12计算增强的特征表示:

其中,Fa 是特征图的增强特征表示。该增强特征表示通过将原始分割特征与利用注意力机制获得的增强特征相结合来计算,具体如公式 13所示:
其中,Fe 是用于图案重建的增强特征图。CAFFM 通过引入多尺度交叉注意力机制,以提取不同尺度下的文化纹样特征。设 Fsi 表示在尺度 i 上的分割特征,而 Faj 表示在同一尺度下的艺术风格特征。最终的特征表示由公式14定义:

其中,Qi、Ki 和 Vi 分别表示尺度 i 上的查询、键和值矩阵,N 表示特征尺度的数量。在本研究中,N = 4,对应于从输入图像尺寸的 1/4、1/8、1/16 和 1/32 空间分辨率下提取的特征图。这些多尺度特征表示在重建和艺术合成之前,通过可学习的注意力权重进行融合。上述扩展使该方法能够提取全球文化图案和纹理,以重建文化模式。CAFFM 位于所提出的 SegCycle-SPADE 系统中基于 SegFormer 的分割阶段与基于 SPADE 的创意合成阶段之间。首先,CycleGAN 并行生成包含风格和图案相关信息的重建特征,而 SegFormer-B2 则恢复描述文化图案结构特性的语义特征图。CAFFM 模块接收这两路特征流,并利用基于交叉注意力的融合机制识别结构表示与艺术表示之间的关联。为了在保持语义一致性和结构特征的同时生成具有文化真实性的图案,融合后的特征图随后被送入 SPADE 模块进行分割引导的创意合成。
使用 CycleGAN 进行图案重建
在基于注意力的特征增强阶段完成后,特征图将包含增强后的文化图案结构。然而,这些特征图可能仍存在不完整或受损的图案区域。因此,为解决图案重建问题,所提出的框架将采用 CycleGAN 模型。在该框架中,两个域分别为原始文化图案与重建后的文化图案。利用前一阶段得到的增强特征,CycleGAN 模型将在保持结构一致性的前提下重建文化图案。这将确保几何图案、花卉图案和象征性图案等文化图案的空间布局得以保留。原始苗族蜡染图像经过随机掩码和部分遮挡操作,以生成不完整或受损的文化图案。这些退化处理模拟了在劣化文化遗产文物中常见的图案缺失区域和结构损伤。退化后的图像被用作重建模块的输入,而对应的原始图像则作为参考图像,用于性能评估和重建质量评价。该策略使模型能够学习缺失图案结构的恢复,同时保持语义一致性和文化特征。
设 X 为不完整文化模式的域,Y 为重建文化模式的域。两个生成器通过公式 15学习执行双向映射:

此处, GE 用于重构基序结构以及 FM 用于将模式映射回原始域。对抗性损失用于确保重建的模式具有真实性(方程 16)30

其中,DY 是用于区分真实图案与重建图案的判别器,GE(x) 表示生成的重建图案。CycleGAN 还通过施加循环一致性约束,以保留文化图案的结构布局(公式 17)30。

最终的损失函数由公式1830定义:

其中,λi 表示循环一致性损失的权重系数,在训练过程中设为10,与原始 CycleGAN 的设定一致。该值的选择旨在平衡源域与目标域之间的对抗学习与重建一致性。
CycleGAN 重建模块包含两个生成器和两个判别器,用于实现双向图像转换。每个生成器采用残差网络结构,由一个初始的 7 × 7 卷积层组成,随后是两个下采样卷积层、九个残差块和两个上采样层。除输入层使用 7 × 7 卷积核以增强特征提取外,所有卷积操作均采用 3 × 3 的卷积核大小。每个卷积层后均应用实例归一化(Instance Normalization),以提高训练稳定性,生成器网络中全程使用 ReLU 激活函数。输出层采用 Tanh 激活函数以生成归一化的图像输出。判别器采用 70 × 70 的 PatchGAN 架构,由一系列卷积层构成,卷积核大小为 4 × 4,特征通道数逐层递增。判别器中使用实例归一化和 LeakyReLU 激活函数(负斜率 = 0.2),以增强特征判别能力和对抗学习效果。CycleGAN 模块接收预处理后的文化图案图像作为输入,生成重建的图案表示,并随后传递至 CAFFM 模块,与分割特征进行融合。CycleGAN 的训练采用 Adam 优化器(β₁ = 0.5,β₂ = 0.999),初始学习率为 0.0002。在前 100 个训练周期中保持该学习率,之后在剩余训练阶段线性衰减至零。训练中使用包含 50 张先前生成图像的重放缓冲区(replay buffer),以稳定判别器的训练过程。生成器与判别器采用 1:1 的更新比例,每个训练迭代中依次执行一次生成器更新和一次判别器更新。
CycleGAN 的重建过程基于利用 CAFFM 机制获得的增强特征图 图5特征图包含了从先前的分割阶段和CAFFM中获得的增强文化特征。这些特征图被用作第一生成器的输入 GE. 第一个发生器 GE 学习重建文化模式所需的映射关系。然后将输出结果输入至判别器 DY 以区分真实文化模式与重建模式。判别器 DY 有助于发生器 GE 生成逼真的输出。为了确保在重建过程中文化模式不被扭曲,第二个生成器 FM 执行循环一致性映射。第二个生成器 FM 将输出结果映射回原始域,随后由判别器对这些输出进行评估以确保其真实性。最终输出结果被传递至下一阶段所提出的 SegCycle-SPADE 框架中的 SPADE 模块,以实现艺术风格生成。

图 5.基于 CycleGAN 的模式重建工作流程。 CycleGAN 重建模块的工作流程。将经过注意力增强的特征表示作为输入提供给生成器网络,以重建不完整的文化图案。判别器将重建输出与参考图案进行比对,而循环一致性映射则在双向图像转换过程中保持结构完整性。重建后的图案随后被传递至 SPADE 模块,用于艺术风格合成。请点击此处查看该图的放大版本。
使用 SPADE 生成艺术风格
随后,重建的文化图案被输入 SPADE 模块以生成艺术风格。SPADE 模块的主要目标是在不破坏图案结构布局的前提下,为重建的文化图案添加更加丰富的艺术风格视觉纹理。SPADE 模块是一种条件图像生成技术,利用图像分割的概念来生成图像。通过 SegFormer-B2 生成语义分割掩码,并从中编码出对应于预定义图案类别的多通道语义图。这些编码后的语义图作为条件输入提供给 SPADE 生成器。在每个 SPADE 层中,语义图经由卷积层处理,生成空间自适应的缩放参数(γ)和偏置参数(β)。通过将这些参数应用于归一化的特征激活,生成器能够在艺术合成过程中保持图案边界、结构布局以及语义信息。由于条件化过程在 SPADE 生成器的多个层级上进行,语义引导能够同时影响高层级的结构重建与低层级的纹理合成。因此,生成的艺术图案在保留分割阶段识别出的文化图案结构的同时,融合了来自 WikiArt 数据集的艺术风格特征。
本研究采用 WikiArt 数据集作为理解艺术风格的主要资源,该数据集包含来自 27 种不同艺术类别的作品,例如文艺复兴、印象派、立体主义、表现主义、超现实主义、现实主义和抽象艺术。为了使模型接触多样的艺术特征并增强风格泛化能力,在训练过程中从各个类别中随机选取风格图像。为减少风格偏差,数据集被划分为训练集、验证集和测试集,并确保各类艺术类别在各子集中均衡分布。为保证全部 27 种艺术类别的均衡代表性,采用了分层抽样方法,使每个类别的样本按比例分配至训练、验证和测试子集,同时保持原始类别分布。CAFFM 模块用于融合从 WikiArt 图像中提取的风格特征与 CycleGAN 生成的重建特征。为使合成网络在保持由分割图导出的语义结构和文化图案边界的同时迁移艺术特性,将融合后的表征作为条件信息输入至 SPADE 生成器。得益于这种基于风格的条件化技术,所提出的框架能够生成具有文化真实性的艺术图案,并保持结构与风格表征的一致性。
SPADE 还引入了依赖于分割图的自适应空间参数。这些参数可按 公式 191 所示进行定义:

其中,γ(S) 是随空间变化的尺度参数,β(S) 是随空间变化的偏置参数。这些参数可帮助生成器根据图像中的语义区域生成不同的纹理和风格。最终的文化艺术作品可定义为公式 20所示:

其中,GE 为 SPADE 生成器,XrP 为重建图案,SM 为分割图。最终生成的作品在增强艺术表现力的同时,保持了文化图案的结构完整性。为优化所提出的 SegCycle-SPADE 架构,采用了一种复合损失函数,该函数在语义分割精度、文化图案保留、图案重建质量以及艺术风格一致性之间实现平衡。整体训练目标通过分割损失(Lseg)、对抗损失(Ladv)、循环一致性损失(Lcycle)、重建损失(Lrecon)、图案保留损失(Lmotif)和风格一致性损失(Lstyle)的加权组合来建立。总损失函数定义见公式 21:
(21)
为了确保输入文化图案与重建图案之间的结构一致性,循环一致性损失系数设置为 10。为保留细粒度的图案特征并提高视觉准确性,重建损失系数设为 5。为突出在艺术合成过程中对文化核心结构模式的保留,图案保留损失的系数设为 2。为促进艺术风格迁移的同时避免对语义图案结构造成过度扭曲,风格一致性损失系数调整为 1。为在真实图像生成与精确图案分割之间保持贡献均衡,分割损失与对抗损失被赋予相等权重。风格一致性损失的计算采用了 WikiArt 数据集基于特征的风格表示。具体而言,通过从深层特征图中提取的 Gram 矩阵相关性来捕捉艺术风格特征。风格损失的计算采用目标风格图像与生成图像 Gram 矩阵之间的 Frobenius 范数差异,如公式 22所示:

其中,Gl 是从第 lth 个特征层计算得到的格拉姆矩阵,Igen 表示生成的艺术图像,Istyle 表示来自 WikiArt 数据集的目标风格图像,F 表示弗罗贝尼乌斯范数。该公式化方法使所提出的框架能够在保持文化图案的结构和语义完整性的同时,保留其艺术特征。
CAFFM 模块生成的融合特征表示被用作 SPADE 模块的条件输入,该模块是所提出框架中的艺术合成组件。SPADE 生成器包含七个 SPADE 残差块,潜在特征维度为 256 个通道,并以 256 × 256 像素的分辨率生成输出图像。来自 SegFormer–CAFFM 模块的语义分割图在整个 SPADE 残差层中被用作条件输入。SPADE 层应用于每个残差块内的激活函数之前,从而实现由分割引导的语义条件控制。通过连续的上采样和卷积操作,潜在特征表示被逐步优化,在保持语义一致性和图案结构的同时生成高分辨率的艺术图案。生成器中普遍使用 LeakyReLU 激活函数,输出层则采用 Tanh 激活函数以生成归一化的图像。
算法与工作流程
SegCycle-SPADE 框架在一个统一的训练流程中集成了语义分割、特征融合、模式重建和艺术风格合成。该工作流程始于数据集的获取与预处理,包括图像缩放、归一化、去噪以及分割掩码的制备。预处理后的图像随后通过 SegFormer-B2 分割网络提取语义图案表征。所得到的分割特征通过 CAFFM 与重建特征进行融合,从而实现结构图案信息与艺术特征表征之间的交互。融合后的特征图被输入至 CycleGAN 重建模块,该模块在保持语义一致性的同时恢复不完整的文化图案结构。重建后的图案随后被送入 SPADE 生成器,进行基于分割引导的艺术化合成,从而在保留图案边界和结构真实性的前提下实现风格增强。在训练过程中,模型参数通过公式 21 和 22中描述的复合损失函数进行优化,以平衡分割精度、图案保留、重建质量以及艺术风格一致性。详细的逐步实现流程(包括数据集加载、预处理、模型初始化、训练迭代、验证过程、检查点选择和最终评估)见补充文件 1(算法 1)。完整的算法流程采用批量大小为 16、学习率为 0.0002,并进行了 100 个训练周期。数据集划分、模型初始化及所有训练实验均使用固定的随机种子 42。该种子在 Python、NumPy 和 PyTorch 的随机数生成器中保持一致,以确保实验可重复性。Adam 优化器的参数设置为 β₁ = 0.5,β₂ = 0.999,且不使用权重衰减(weight decay = 0)。模型检查点根据验证集上达到的最高验证 IoU 分数进行选择。
损失函数优化
为在重建和艺术合成过程中保留文化图案结构,所提出的框架采用了一种复合优化目标,该目标结合了分割损失、对抗损失、循环一致性损失、重建损失、图案保留损失以及风格一致性损失。完整的数学表达式、权重系数及风格损失的定义详见基于SPADE的艺术风格生成小节中的公式21和公式22。其中,图案保留项通过惩罚预测图案区域与对应真实分割掩码之间的结构偏差,从而在重建过程中促进对具有文化意义的图案结构的保留。
访问受限。请登录或开始试用以查看此内容。
所提出的 SegCycle-SPADE 框架通过两个数据集进行了评估:苗族蜡染文化图案数据集和 WikiArt 数据集。苗族蜡染数据集包含传统文化遗产图像,主要用于语义分割和结构重建任务;而 WikiArt 数据集包含多样的艺术风格,用于艺术风格学习与生成。来自这两个数据集的图像均经过完整的 SegCycle-SPADE 流程处理,包括语义分割、CAFFM、图案重建以及基于 SPADE 的艺术风格生成。文化图案信息与艺术风格表征的融合使该框架能够生成具有文化意义且视觉连贯的输出结果。
所有实验均在配备 Intel Core i7 处理器和 NVIDIA GPU 的支持 GPU 的工作站上进行。具体而言,实验所用工作站配置为 Intel Core i7(第 11 代)CPU、配备 24 GB VRAM 的 NVIDIA RTX 3090 GPU 以及 32 GB 系统内存。模型使用 Python 3.8 和 PyTorch 1.10 并结合 CUDA 加速实现。训练过程采用单 GPU 设置,未使用分布式训练。所有实验均全程使用标准 FP32 精度,未采用混合精度训练。优化器选用 Ad...
访问受限。请登录或开始试用以查看此内容。
近年来,由于传统工艺逐渐消失,非物质文化遗产(ICH)图案的保存与数字化重建受到越来越多的关注。先前的研究尝试通过基于深度学习(DL)的图像处理技术来应对文化遗产的流失问题。例如,Quan 等人32提出了一种基于知识图谱和深度学习的框架,用于贵州苗族蜡染文化的保护。尽管该研究聚焦于文化图案的数字化重建,但其方法主要依赖于知识图谱的表示。类似地,Fu 和 Razmjooy16提出了一种基于特征金字塔网络(FPN)的框架,用于文化遗产图像的增强与修复。尽管该方法在图像增强方面实现了有效的特征提取,但并未引入图像分割引导机制或针对不完整文化图案的生成式重建机制。相比之下,本文提出的 SegCycle-SPADE 框架结合了多种深度学习组件,以克服上述挑战。首先,采用 SegFormer 模型进行语义分割,以准确识别文化遗产图案中的纹样区域;随后,基于 CAFFM 的特征增强模块提升了细粒度纹样结构的特征表示;接着,利用 CycleGAN 重建模块通过对抗学习重建文化图案中缺失或不完整的区域;最后,SPADE 模块在保持与分割图结构对齐的同时实现风格...
访问受限。请登录或开始试用以查看此内容。
利益冲突:
作者声明无竞争利益。
作者感谢广东工程职业技术学院和华南师范大学在本研究完成过程中提供的学术与机构支持。本研究受2023年度国家社会科学基金一般项目(No. 23BH161)资助,项目名称为 数字再生博物馆:中国经典书画文物的活化与传播研究
访问受限。请登录或开始试用以查看此内容。
| 姓名 | 公司 | 目录编号 | 评论 |
|---|---|---|---|
| Adam 优化器 | PyTorch 优化器库 | Adam | 模型训练过程中使用的优化算法。 |
| CUDA 工具包 | NVIDIA 公司 | CUDA 11.3 | 用于深度学习计算的 GPU 加速。 |
| cuDNN | NVIDIA 公司 | cuDNN 8.2 | 用于加速训练和推理的深度神经网络加速库。 |
| CycleGAN | 加州大学伯克利分校 / 开源 | 官方 PyTorch 实现(https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix) | 用于文化纹样重建的生成对抗网络。 |
| ImageNet 预训练权重 | ImageNet / 开源 | mit_b2.pth(ImageNet-1K 预训练检查点) | 在苗族蜡染数据集上进行微调前,用于初始化 SegFormer-B2 主干网络。 |
| Intel 处理器 | Intel 公司 | Intel Core i7(第 11 代) | 用于图像预处理、模型训练支持和推理的 CPU。 |
| Matplotlib | Matplotlib 开发团队 | Matplotlib 3.5.1 | 用于训练曲线和评估结果的可视化。 |
| 苗族蜡染数据集 | Zenodo 仓库 | DOI: 10.5281/zenodo.20807658 | 包含 15,148 张图像的文化纹样数据集,用于语义分割和图案重建。 |
| NumPy | NumPy 开发者 | NumPy 1.21.5 | 用于数值计算和数据集处理。 |
| NVIDIA GPU | NVIDIA 公司 | NVIDIA RTX 3090(24 GB 显存) | 用于模型训练和推理的硬件平台。 |
| OpenCV | OpenCV 基金会 | OpenCV 4.5.5 | 用于图像预处理、缩放、插值和高斯去噪。 |
| 操作系统 | Canonical 公司 | Ubuntu 20.04 LTS | 实验执行环境。 |
| Pillow(PIL) | Python 图像库 | Pillow 8.4.0 | 用于图像加载和操作。 |
| Python | Python 软件基金会 | Python 3.8.10 | 用于实现和实验的编程语言。 |
| PyTorch | Meta AI | PyTorch 1.10.0 | 用于模型训练和推理的深度学习框架。 |
| 随机种子 | 实验设置 | 42 | 用于数据集划分、模型初始化和实验可重复性的固定种子。 |
| Scikit-learn | Scikit-learn 开发者 | Scikit-learn 1.0.2 | 用于数据集划分、统计分析和评估指标。 |
| Seaborn | 开源社区 | Seaborn 0.11.2 | 用于统计数据分析可视化。 |
| SegFormer-B2 | NVIDIA 研究院 / 开源 | SegFormer-B2(MIT-B2 主干网络) | 基于 Transformer 的语义分割模型,用于文化纹样分割。 |
| 分割掩码 / 标注 | 苗族蜡染数据集 | 随数据集提供 | 用于纹样分类和训练的像素级语义分割标签。 |
| SPADE | NVIDIA 研究院 / 开源 | 官方 PyTorch 实现(https://github.com/NVlabs/SPADE) | 基于分割引导的图像合成模型,用于艺术图案生成。 |
| TorchVision | Meta AI | TorchVision 0.11.1 | 与 PyTorch 配合使用的图像处理工具和数据集变换。 |
| WikiArt 数据集 | WikiArt | https://www.wikiart.org/ | 包含超过 80,000 件艺术品、涵盖 27 种艺术风格的艺术风格数据集,用于风格学习与合成。 |
访问受限。请登录或开始试用以查看此内容。