연구 논문

딥러닝 프레임워크를 이용한 무형문화유산 문양의 시맨틱 세그멘테이션 유도 재구성과 예술적 스타일 합성

DOI:

10.3791/71577

2026년 8월 14일

이 논문에서

요약

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

본 프로토콜은 디지털 보존 및 창의적 유산 활용을 지원하기 위해, 트랜스포머 기반 특징 추출, 적대적 재구성 및 공간 적응형 이미지 생성을 이용하여 무형문화유산 문양의 시맨틱 세그멘테이션, 재구성 및 예술적 스타일 합성을 수행하는 딥러닝 워크플로우를 설명합니다.

초록

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

딥러닝 기반 이미지 합성 기술의 발전과 함께 무형문화유산(ICH) 문양의 디지털 보존 및 복원에 대한 관심이 높아지고 있습니다. 기존의 SegCycle-SPADE 기반 접근 방식은 전통 공예 문양의 구조적 세그멘테이션과 예술적 복원 가능성을 입증하였으나, 데이터셋 다양성 부족, 문화적 의미론적 요소의 반영 미흡, 복원 과정에서의 구조적 문양 특징 보존 부족 등의 한계가 남아 있습니다. 이러한 과제를 해결하기 위해 본 연구에서는 ICH 문양 유형의 의미론적 세그멘테이션 및 예술적 복원을 위한 개선된 SegCycle-SPADE 프레임워크를 제안합니다. 모티프 경계와 문양 영역을 정확하게 식별하기 위해 Transformer 기반 세그멘테이션 모델인 SegFormer를 채택하였습니다. 또한, 문화적으로 중요한 모티프를 강화하고 특징 표현력을 높이기 위해 교차 주의 집중 문화 특징 융합 모듈(Cross-Attention Cultural Feature Fusion Module)을 도입하였습니다. 문양 변환 및 복원은 CycleGAN을 사용하여 수행하며, 세그멘테이션 맵과 생성된 이미지 간의 의미론적 일관성을 유지하기 위해 공간 적응형 비정규화(Spatially-Adaptive Denormalization, SPADE)를 통한 예술적 스타일 합성을 적용하였습니다. 모델의 일반화 성능과 예술적 다양성을 향상시키기 위해 묘족 바틱(Miao Batik) 문화 모티프 데이터셋과 WikiArt 데이터셋을 모두 사용하여 프레임워크를 학습시켰습니다. 실험 결과, 제안된 주의 집중 기반 SegCycle-SPADE 프레임워크는 기존의 생성적 적대 신경망(GAN) 기반 복원 방법과 비교하여 세그멘테이션 정확도와 문화유산 문양 복원 성능을 향상시키는 것으로 나타났습니다. 본 프레임워크는 인공지능 보조 문화유산 기록, 복원 및 전통 문양 디자인의 예술적 재생을 위한 확장 가능한 솔루션을 제공합니다.

서론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

관습, 언어, 신념과 같은 무형적 요소와 예술 작품, 건물, 기록물과 같은 유형적 요소를 모두 포함하는 문화유산은 인류의 역사, 창의성 및 정체성의 근본적인 발현입니다1. 유산 보존은 지역사회가 자신의 기원과 다시 연결될 수 있도록 하며, 미래 세대가 집단적 문화 기억의 혜택을 누릴 수 있게 합니다. 또한 문화 간의 이해와 다양한 전통 및 관습에 대한 감상, 그리고 서로 다른 역사적 서사에 대한 인식을 증진합니다. 이러한 문화적 자산은 이전 세대의 가치관, 관점 및 경험을 이해하는 데 도움을 주며, 현대의 사회적 정체성 형성과 문화적 연속성에 기여합니다. 문화유산 보존의 기본 원리는 그림 1에 예시되어 있습니다.

figure-introduction-1
그림 1SegCycle-SPADE 프레임워크를 이용한 문화유산 문양 복원의 개념적 개요. 무형문화유산 패턴의 복원 및 향상을 위해 제안된 접근 방식의 모식도. 워크플로우에는 Miao Batik 및 WikiArt 데이터셋으로부터의 데이터셋 수집, 이미지 전처리, SegFormer-B2를 이용한 시맨틱 세그멘테이션, 교차 주의 집중 문화 특징 융합 모듈(Cross-Attention Cultural Feature Fusion Module, CAFFM)을 이용한 특징 융합, CycleGAN을 이용한 패턴 복원, SPADE를 이용한 예술적 스타일 합성, 그리고 세그멘테이션 및 복원 지표를 이용한 최종 평가가 포함된다. 화살표는 프레임워크 전반에 걸친 데이터 및 특징 표현의 흐름을 나타낸다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

인류 사회의 집단적 기억과 문화적 유산은 무형문화유산(ICH)에 구현되어 있으며, 이는 예술적 표현과 문화적 정체성을 위한 중요한 매개체 역할을 합니다. 그러나 무형문화유산은 세계화와 디지털화의 영향으로 인해 상당한 어려움에 직면해 있습니다2,3,4. 숙련된 장인의 수 감소와 현대 시장에 대한 제한적인 적응력으로 인해, 멸종 위기에 처한 많은 무형문화유산 관습에는 보존과 발전을 위한 새로운 접근 방식이 필요합니다5,6. 무형문화유산 연구의 중요한 분야인 지속 가능한 디자인은 문화, 사회 및 환경의 통합적 발전을 강조하며, 무형문화유산의 지속적인 보존을 위한 실질적인 경로를 제공합니다. 지속 가능한 디자인 접근 방식을 통해 무형문화유산은 현대 사회의 요구에 적응하면서 동시에 활성화될 수 있습니다7,8.

본 연구에서 “무형문화유산 패턴”이라는 용어는 내재된 무형의 문화적 가치를 전달하고 보존하는 시각적 모티프 표현을 의미합니다. 따라서, 제안된 프레임워크는 이러한 모티프의 시각적 형태를 재구성하는 동시에 이와 관련된 문화 정보를 보존하고 기록하는 것을 목표로 합니다.

묘족 자수와 바틱(batik)은 중국의 중요한 무형문화유산(ICH)으로, 새, 나비, 조상 토템과 같은 상징적 문양을 통해 묘족 공동체의 역사, 신념 및 전통을 반영합니다9. 이러한 문양들은 제례 의복과 축제 관습에 깊이 새겨져 있으며, 지역의 문화적 및 경제적 발전에 기여하고 있습니다10,11. 디지털 기술, 특히 인공지능(AI)과 딥러닝(DL)의 발전은 문화유산의 보존, 분석, 재구성 및 기록을 위한 새로운 기회를 창출했습니다. 중국에서 가장 잘 보존된 바틱 전통 중 하나인 구이저우 묘족 바틱은 묘족의 문화적 지식, 신념, 관습 및 의례를 전달하는 중요한 매개체 역할을 합니다12,13,14,15,16.

최근 연구들은 문화유산 보존 및 패턴 복원을 위한 DL의 잠재력을 입증하였으며, U-Net 및 DeepLabV3+1과 비교하여 향상된 세그멘테이션 정확도(pixel accuracy = 88.6%, mean intersection over union [IoU]= 78.1%)와 복원 성능을 달성하였습니다. 하지만 여전히 몇 가지 과제가 남아 있습니다. 기존의 생성적 적대 신경망(GAN) 기반 접근 방식은 복잡한 패턴의 미세한 구조적 세부 사항을 보존하는 데 어려움을 겪는 경우가 많으며17, 제한된 데이터셋 다양성은 다양한 문화 영역에 걸친 모델의 일반화 능력을 제한합니다18. 또한, CycleGAN과 같은 이미지-대-이미지 변환 모델은 세그멘테이션 맵과 생성된 이미지 간의 의미적 일관성을 유지하지 못할 수 있으며19, 어텐션 메커니즘의 부재로 인해 복원 과정에서 문화적으로 중요한 모티프의 세부 사항이 손실될 수 있습니다20. 따라서 효과적인 ICH 패턴 복원을 위해서는 트랜스포머 기반 세그멘테이션, 어텐션 가이드 특징 학습 및 다중 데이터셋 학습이 통합된 강화된 프레임워크가 필요합니다.

묘족 자수의 디지털화와 생성형 AI의 급격한 발전으로 인해 문화유산 보존의 새로운 기회가 생겨났습니다. 신흥 딥 생성 모델의 일종인 확산 모델(Diffusion models)은 강력한 콘텐츠 생성 능력 덕분에 컴퓨터 비전 작업에서 뛰어난 성능을 입증했습니다21,22,23,24,25. 역확산 과정 동안 모델은 노이즈 섞인 표현으로부터 원래의 입력 데이터를 점진적으로 재구성하는 법을 학습합니다26,27,28. 기존 연구에서는 문화유산의 보존과 보급을 위해 3차원 재구성 및 컴퓨터 지원 설계(CAD) 기술의 적용 또한 탐구해 왔습니다.

합성곱 신경망(CNN)과 GAN은 이미지 생성 및 특징 보존에서 우수한 성능을 보이지만, 제한된 수용장(receptive field), 모드 붕괴(mode collapse) 및 훈련 불안정성과 관련된 문제에 여전히 직면해 있습니다29. SegFormer 및 Segmenter와 같은 트랜스포머 기반 아키텍처는 전역적 문맥과 의미적 관계를 포착하는 데 뛰어나지만, 계산 집약적이며 미세한 세부 사항을 처리하는 데 어려움을 겪을 수 있습니다. Stable Diffusion과 같은 확산 모델은 강력한 이미지 생성 능력을 보여주지만, 생성된 디자인의 구조적 및 예술적 특성에 대한 정밀한 제어가 부족한 경우가 많습니다. 또한, 기존의 대부분의 접근 방식은 세그멘테이션과 생성 구성 요소 간의 효과적인 정보 공유 및 협동 최적화를 제한하는 독립적인 훈련 전략을 채택하고 있으며, 이는 구조적 정확성과 예술적 진정성 사이의 트레이드오프를 초래합니다30.

잠재 확산(latent diffusion) 및 Stable Diffusion과 같은 최근의 확산 기반 모델들은 고품질의 이미지 합성을 달성하지만, 반복적인 노이즈 제거(denoising) 과정이 필요하여 계산 비용과 추론 시간이 증가한다는 단점이 있습니다. 또한, 전문적인 조건화 메커니즘 없이는 세밀한 문화적 모티프와 구조적 일관성을 유지하는 것이 여전히 어려운 과제로 남아 있습니다. 트랜스포머(Transformer) 기반 생성 모델은 전역적 문맥 관계를 효과적으로 포착하지만, 종종 대규모 데이터셋과 상당한 계산 자원을 필요로 합니다. 이와 대조적으로, 본 연구에서 제안하는 SegCycle-공간 적응형 비정규화(SegCycle-Spatially Adaptive Denormalization, SegCycle-SPADE) 프레임워크는 SegFormer 기반 세그멘테이션, 교차 주의 집중(cross-attention) 특징 융합, CycleGAN 재구성 및 SPADE 유도 합성을 결합하여 명시적인 구조적 가이드를 제공함으로써, 문화유산 패턴의 모티프 보존, 세그먼트 일관성 및 제어 가능한 재구성을 향상시킵니다.

최신 시맨틱 세그멘테이션 기술의 대부분은 U자형 구조를 가진 완전 합성곱 신경망(FCNN)에 의존합니다31. 인코딩 단계에서는 일련의 합성곱 및 다운샘플링 연산을 통해 수용 영역이 넓은 심층 특징을 추출합니다. 디코딩 단계에서는 업샘플링을 통해 공간 해상도를 점진적으로 복원하여 최종적으로 픽셀 수준의 시맨틱 예측을 가능하게 합니다. 스킵 연결은 서로 다른 인코더 레벨의 고해상도 정보를 디코더에 직접 통합함으로써, 다운샘플링 중 발생하는 공간 정보 손실을 보완하고 다양한 응용 분야에서 세그멘테이션 성능을 향상시킵니다32.

최근 GAN 기반, CNN 기반 및 확산 기반 방법들이 이미지 생성과 문화유산 복원 분야에서 유망한 결과를 보여주었으나, 의미론적 일관성을 유지하고 미세한 구조적 모티프를 보존하며 다양한 문화적 패턴에 걸쳐 재현 가능한 복원을 보장하는 데에는 여전히 어려움이 많습니다. 기존의 대부분의 접근 방식은 세그멘테이션, 복원 및 스타일 합성을 별개의 프로세스로 처리하며, 이는 문화적으로 중요한 요소의 손실과 일관성 없는 결과로 이어질 수 있습니다. 이러한 방법론적 간극을 해결하기 위해, 본 연구에서는 SegFormer 기반의 의미론적 세그멘테이션, 새로운 교차 주의집중 문화 특징 융합 모듈(Cross-Attention Cultural Feature Fusion Module, CAFFM), CycleGAN 기반 복원 및 SPADE 유도 스타일 합성을 통합한 단일 SegCycle-SPADE 프레임워크를 제안합니다. 구조적 세그멘테이션 정보와 생성적 특징 학습을 명시적으로 통합함으로써, 제안된 프레임워크는 문화적 진정성과 예술적 품질을 모두 유지하면서 무형문화유산(ICH) 모티프의 더욱 신뢰할 수 있고 의미론적으로 일관되며 재현 가능한 복원을 가능하게 합니다.

본 연구에서는 현재의 문화유산 복원 방식에서 나타나는 세 가지 주요 한계점을 확인하였습니다: (i) GAN 기반 복원 방법에서 미세한 구조적 모티프의 보존이 불충분함; (ii) 소규모 또는 도메인 특정 데이터셋으로 학습함에 따라 일반화 능력이 제한됨; (iii) 이미지-투-이미지 변환 프레임워크에서 세그멘테이션 결과물과 생성된 이미지 사이의 시맨틱 일관성이 부족함. 또한, 세그멘테이션, 복원 및 스타일 합성이 일반적으로 별개의 프로세스로 처리되어 복원 과정에서 문화적으로 중요한 요소들이 손실되는 결과가 발생합니다. 제안된 SegCycle-SPADE 프레임워크는 트랜스포머 기반 시맨틱 세그멘테이션, 교차 주의 집중(cross-attention) 특징 융합, CycleGAN 복원 및 SPADE 유도 예술적 합성을 통합 아키텍처 내에서 결합함으로써 이러한 한계점을 해결하고, 무형문화유산(ICH) 패턴 복원 시 모티프 보존, 시맨틱 일관성 및 예술적 진정성을 향상시킵니다.

본 연구의 주요 목적은 무형문화유산(ICH) 패턴의 시맨틱 세그멘테이션 가이드 기반 예술적 재구성을 위한 향상된 SegCycle-SPADE 프레임워크를 개발하는 것입니다. 이 프레임워크는 정확한 문화적 모티프 세그멘테이션을 위한 SegFormer, 패턴 재구성을 위한 CycleGAN, 그리고 스타일 일관성을 갖춘 예술적 합성을 위한 SPADE를 통합합니다. 특징 표현을 개선하고 미세한 구조적 세부 사항을 보존하기 위해, 세그멘테이션 특징과 생성 특징 간의 효과적인 상호작용을 촉진하는 CAFFM이 도입되었습니다. Miao Batik 및 WikiArt 데이터셋으로 학습된 제안된 프레임워크는 재구성의 진정성, 스타일 일관성 및 문화적으로 중요한 모티프의 보존 능력을 향상시킵니다.

본 연구는 시맨틱 세그멘테이션, 어텐션 기반 특징 융합, 패턴 재구성 및 스타일 합성을 단일 아키텍처 내에서 결합하여, 무형문화유산(ICH) 패턴의 예술적 재구성을 위한 새로운 SegCycle-SPADE 프레임워크를 제시합니다. 본 연구의 주요 기여도는 다음과 같습니다. 첫째, SegFormer를 통합하여 새로운 시맨틱 세그멘테이션 기반 재구성 프레임워크를 개발함으로써, 복잡한 문화적 모티프와 구조적 요소의 정밀한 추출 및 보존을 가능하게 했습니다. 둘째, 세그멘테이션 특징과 생성적 표현을 효과적으로 융합하는 새로운 CAFFM을 도입하여, 모델이 문화적 모티프와 예술적 스타일 패턴 간의 장거리 관계를 포착할 수 있도록 했습니다. 셋째, 제안된 CAFFM은 문화적으로 중요한 요소의 보존 능력을 강화하는 동시에, 재구성된 유산 패턴의 시각적 사실감과 구조적 일관성을 향상시켰습니다. 넷째, 문화 패턴 재구성을 위한 CycleGAN과 세그멘테이션 기반 예술적 합성을 위한 SPADE를 통합함으로써, 생성된 결과물의 시맨틱 정확성과 스타일적 진정성을 모두 확보했습니다. 다섯째, 일반화 능력과 예술적 다양성을 높이기 위해, 문화 패턴 학습에는 Miao Batik 문화 모티프 데이터셋을, 예술적 스타일 표현에는 WikiArt 데이터셋을 사용하여 모델을 학습시켰습니다. WikiArt는 Miao 문화유산 제품에 직접 적용할 대상 스타일이 아니라, 다양한 시각적 맥락에서 프레임워크의 일반화 능력, 특징 학습의 강건성 및 스타일 제어 효과를 평가하기 위한 보조 데이터셋으로 활용되었습니다. 마지막으로, 기존의 GAN 기반 문화유산 재구성 방법들과 비교하여, 실험 결과 제안된 SegCycle-SPADE 프레임워크가 세그멘테이션 정확도, 재구성 품질 및 스타일 일관성 측면에서 개선되었음을 입증하였습니다.

프로토콜

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

제안된 SegCycle-SPADE 프레임워크는 시맨틱 세그멘테이션, 어텐션을 이용한 특징 강화, 생성적 복원 및 예술적 스타일 합성을 통해 전통 문화유산 패턴을 재구성하고 개선하도록 설계되었습니다. 본 연구에서는 Miao Batik 데이터셋과 WikiArt 데이터셋을 포함하여 공개적으로 사용 가능한 문화유산 및 예술 이미지 데이터셋을 활용하였습니다. 연구 과정에서 인간 참여자, 환자 데이터, 개인 정보, 동물 피험자 또는 임상 기록이 포함되지 않았으므로, 기관 윤리 위원회의 승인 및 고지된 동의는 필요하지 않았습니다. 우선, 평가를 위해 Miao Batik 문화 모티프 데이터셋과 WikiArt 데이터셋이 활용됩니다. Miao Batik 데이터셋은 Quan et al. (2024)32에서 설명되었으며, 전통 Miao batik 모티프의 어노테이션이 완료된 이미지 15,148장을 포함하고 있습니다. 데이터셋 제작자가 제공한 기존 어노테이션을 직접 사용하였으며, 본 연구에서 추가적인 수동 어노테이션을 생성하지 않았습니다. 그 다음, 이미지 리사이징, 정규화, 노이즈 제거 및 세그멘테이션 마스크 생성을 통해 이미지 전처리가 수행됩니다. 정확한 전처리 파라미터는 데이터 전처리 소섹션에 설명되어 있습니다. 제안된 프레임워크는 데이터의 시맨틱 세그멘테이션을 위해 SegFormer-B2라는 트랜스포머 기반 모델을 활용합니다. 이 방법은 문화 모티프의 핵심 영역을 검출하고 그 구조를 학습하도록 설계되었습니다. 세그멘테이션된 특징은 어텐션 메커니즘을 통해 강화되며, 여기서 문화 모티프와 관련된 중요한 정보는 강조되고 무관한 정보는 제거됩니다. 어텐션 메커니즘 설정은 CAFFM 소섹션에 설명되어 있습니다. 강화된 특징은 이후 CycleGAN으로 전달되며, 여기서 순환 학습을 통해 손상된 구조가 복원됩니다. 학습 과정 동안, 원본 Miao Batik 이미지에 무작위 마스킹 및 부분 가림 작업을 적용하여 불완전한 모티프 샘플을 인위적으로 생성하였습니다. 이러한 퇴화 절차는 훼손된 문화유산 유물에서 흔히 관찰되는 모티프 영역의 결손 및 구조적 손상을 시뮬레이션하였습니다. 이렇게 생성된 불완전한 이미지는 CycleGAN 복원 모듈의 입력값으로 사용되었으며, 해당 원본 이미지는 복원 목표로 설정되었습니다. 복원된 문화유산 패턴은 이후 SPADE를 통해 강화되며, 여기서 생성된 세그멘테이션 맵을 기반으로 예술적 강화가 수행됩니다. 제안된 프레임워크의 성능은 정량적인 세그멘테이션 및 이미지 품질 지표를 사용하여 평가하며, 복원된 문화 모티프의 시각적 진위성은 정성적으로 평가합니다. 시각적 진위성은 생성된 문화 패턴의 시각적 검사를 통해 평가되었으며, 독립적인 정량적 지표로 사용되지 않았습니다. 평가는 대응하는 참조 문화 모티프와 비교하여 모티프 보존, 시맨틱 일관성, 문화적 특성, 구조적 응집성 및 예술적 외관에 중점을 두었습니다. 모델 성능의 정량적 평가는 Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) 및 Fréchet Inception Distance (FID)를 사용하여 수행되었습니다. 그림 2는 제안된 SegCycle-SPADE 프레임워크의 전체 워크플로우를 보여주며, 본 연구에서 사용된 평가 지표를 요약합니다.

figure-protocol-1
그림 2. 제안된 SegCycle-SPADE 프레임워크의 전체 아키텍처 워크플로우. 전체 SegCycle-SPADE 워크플로우의 개요. Miao Batik 및 WikiArt 데이터셋의 이미지는 전처리를 거친 후, SegFormer-B2를 이용한 시맨틱 세그멘테이션, CAFFM을 이용한 특징 강화, CycleGAN을 이용한 패턴 재구성, 그리고 SPADE를 이용한 예술적 스타일 생성 과정을 거칩니다. 모델 성능은 Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR, Fréchet Inception Distance (FID)를 사용하여 평가하며, 시각적 진위 여부는 정성적으로 평가합니다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

그림 2에 나타낸 바와 같이, 문화유산 패턴 재구성을 위한 SegCycle-SPADE 프레임워크는 정확한 모티프 분할, 재구성 및 예술적 향상을 위해 여러 딥러닝(DL) 구성 요소를 통합하도록 설계되었습니다. 다양한 문화적 패턴과 예술적 스타일을 제공하기 위해 Miao Batik 문화 모티프 데이터셋과 WikiArt 데이터셋의 이미지가 사용됩니다. 우선, SegFormer 기반의 시맨틱 분할 모듈을 사용하여 이미지를 처리함으로써 배경으로부터 문화적 모티프를 식별하고 경계를 구분합니다. 전체 아키텍처는 네 가지 주요 단계로 구성됩니다. 첫째, SegFormer 모델이 문화 패턴 이미지에서 시맨틱 분할 맵을 추출합니다. 둘째, CAFFM이 분할 특징과 생성적 표현을 통합하여 특징 학습을 강화합니다. 셋째, CycleGAN 모듈이 융합된 특징 표현을 사용하여 문화 패턴을 재구성합니다. 마지막으로, SPADE 모듈이 분할 안내 합성을 통해 구조적 일관성을 유지하면서 스타일적으로 향상된 결과물을 생성합니다. 정제된 특징 맵은 이후 CycleGAN 재구성 모듈에 의해 처리되며, 이 모듈은 훼손된 패턴을 그에 대응하는 완전한 형태로 매핑함으로써 불완전한 문화 모티프를 복원하는 방법을 학습합니다. 불완전한 모티프 샘플은 원본 Miao Batik 이미지에 무작위 마스킹 및 부분 가림 작업을 적용하여 생성되었으며, 이를 통해 손상된 문화 유물에서 흔히 관찰되는 패턴 영역의 누락과 구조적 퇴화를 시뮬레이션했습니다. 각 훼손된 이미지는 훈련 과정에서 재구성 목표로 사용되는 대응하는 원본 이미지와 쌍을 이루었습니다. 이러한 전략을 통해 CycleGAN 모듈은 시맨틱 일관성과 문화적으로 중요한 특성을 유지하면서 누락된 모티프 구조의 복원을 학습할 수 있었습니다. 마지막으로, SPADE 생성기는 생성된 분할 맵을 조건으로 이미지 합성을 수행하여 시각적으로 향상된 예술적 결과물을 생성함으로써, 예술적 향상 과정 전반에 걸쳐 문화적 모티프의 구조적 무결성을 유지합니다.

제안된 SegCycle-SPADE 프레임워크에는 다음 단계들이 포함됩니다.

1단계: 데이터셋 수집
문화적 패턴 학습 및 예술적 스타일 생성을 목표로 하기 위해 두 가지 데이터셋을 사용하였다. 전통 문화 패턴 정보를 제공하기 위해 묘족 바틱 문화 모티프 데이터셋(Miao Batik Cultural Motif Dataset)을 사용하였다. 이 데이터셋은 Zenodo(https://doi.org/10.5281/zenodo.20807658)를 통해 공개되어 있으며, 15,148개의 주석 처리된 전통 묘족 바틱 모티프 이미지를 포함하고 있다. 데이터셋 제작자가 제공한 기존 주석을 그대로 사용하였으며, 본 연구에서는 추가적인 수동 주석을 생성하지 않았다. 예술적 스타일 생성을 위해 다양한 예술적 스타일 정보를 제공하는 WikiArt 데이터셋을 사용하였으며, 이는 공개된 WikiArt 저장소(https://www.wikiart.org/)에서 확보하였다.

단계 2: 데이터 전처리
모든 이미지는 크기 조정, 정규화 및 노이즈 감소를 통해 전처리되었습니다. 시맨틱 세그멘테이션 단계를 지원하기 위해 기존 데이터셋 소스에서 얻은 문화적 모티프 주석을 사용하였습니다. 본 연구의 일환으로 추가적인 주석 작성이나 재레이블링 절차는 수행되지 않았습니다.

단계 3: SegFormer를 이용한 의미론적 패턴 분할
문화적 모티프 분할을 위해 SegFormer 모델이 사용되었습니다. 구체적인 SegFormer 백본 및 초기화 전략은 SegFormer를 이용한 의미론적 패턴 분할 소섹션에 기술되어 있습니다. 특히, 의미론적 모티프 분할을 위해 ImageNet으로 사전 학습된 MIT-B2 백본을 갖춘 SegFormer-B2 아키텍처가 채택되었습니다. 이 모델은 전통 문화 패턴의 복잡한 구조적 세부 사항을 유지하면서 전역적인 문맥 정보를 효과적으로 포착합니다.

단계 4: CAFFM
CAFFM은 시맨틱 세그멘테이션 특징과 생성적 표현을 결합하여, 프레임워크가 구조적 모티프 특성과 예술적 스타일 정보를 모두 학습할 수 있도록 합니다. CAFFM의 통합 세부 사항은 CAFFM 소섹션에 제공됩니다. 이 모듈은 SegFormer 기반의 시맨틱 세그멘테이션 단계와 생성적 재구성 단계 사이에 위치하며, 멀티 헤드 교차 주의집중(multi-head cross-attention)을 통해 세그멘테이션에서 도출된 구조적 특징과 재구성 특징을 융합합니다. 이 과정은 문화적 모티프의 보존력을 높이고 재구성된 결과물의 사실성을 향상시킵니다.

단계 5: 패턴 재구성 (CycleGAN)
융합된 특징들은 이후 CycleGAN 모듈에 의해 처리되어 문화적 패턴 구조를 재구성합니다. CycleGAN의 아키텍처 및 훈련 구성은 CycleGAN을 이용한 패턴 재구성 하위 섹션에 설명되어 있습니다. 재구성 모듈은 두 개의 생성자와 두 개의 판별자로 구성되며, 9개의 잔차 블록을 가진 잔차 네트워크 생성자 아키텍처를 활용하고 PatchGAN 판별자를 채택하며, 적대적 손실 및 사이클 일관성 손실을 사용하여 훈련됩니다. 이러한 구성은 양방향 도메인 매핑을 가능하게 하며 불완전한 문화적 패턴 구조의 재구성을 용이하게 합니다.

단계 6: 예술적 스타일 생성 (SPADE)
재구성된 패턴은 이후 SPADE 모듈을 통해 처리되어 세그멘테이션 유도 예술적 스타일 합성을 수행합니다. SPADE 생성기 구성은 SPADE를 이용한 예술적 스타일 생성 하위 섹션에 설명되어 있습니다. 이 모듈은 SPADE 잔차 블록, 공간 적응형 정규화 층, 그리고 SegFormer 세그멘테이션 맵과 CAFFM 특징 표현에서 도출된 시맨틱 컨디셔닝을 사용합니다. 이미지 생성을 세그멘테이션 맵에 컨디셔닝함으로써, 합성된 출력물은 예술적 스타일 특성을 통합하면서도 원래의 문화적 모티프와 구조적 정렬을 유지합니다.

단계 7: 성능 추정
제안된 프레임워크는 Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR 및 FID를 포함한 여러 분할 및 이미지 품질 평가 지표를 사용하여 평가되었습니다. 실험의 일관성을 평가하기 위해 모든 실험은 서로 다른 랜덤 시드를 사용하여 5회 반복되었으며, 결과는 평균 ± 표준 편차로 보고되었습니다. 통계적 유의성은 대응표본 t-검정(paired t-tests)을 사용하여 평가하였으며, 유의 수준 임계값은 p < 0.05로 설정하였습니다.

데이터셋 수집
제안된 SegCycle-SPADE 프레임워크에서는 문화적 패턴 이해와 스타일 학습을 위해 두 가지 데이터셋이 사용됩니다. 제안된 프레임워크에 사용된 첫 번째 데이터셋은 묘족 바틱(Miao Batik) 문화 문양 데이터셋입니다. 이 데이터셋은 묘족 예술에 사용되는 동물, 식물, 기하학적 모양과 같은 문양을 포함하는 전통적인 묘족 바틱 이미지인 문화 문양들을 포함하고 있습니다. 이 데이터셋은 문화유산 보존에 일반적으로 중요한 풍부한 질감 정보를 가진 이미지들을 포함합니다. SegCycle-SPADE의 제안된 프레임워크에 사용된 두 번째 데이터셋은 WikiArt 데이터셋입니다. 이 데이터셋은 일반적으로 서로 다른 스타일을 가진 방대한 양의 예술 작품을 포함하고 있습니다. 이 데이터셋은 예술 작품의 질을 높이는 데 일반적으로 유용한 복잡한 스타일 학습을 위해 사용됩니다. 이 데이터셋은 27가지의 서로 다른 디자인을 가진 80,000점의 HD 예술 작품으로 구성되어 있어, 딥러닝(DL) 기반의 스타일 생성 또는 변환 작업에 더욱 유용합니다.

먀오 바틱(Miao Batik) 데이터셋:
먀오 바틱 데이터셋(https://doi.org/10.5281/zenodo.20807658)은 문화적 의미를 지닌 모티프를 묘사한 15,148장의 바틱 패턴 이미지로 구성되어 있습니다. 해당 이미지에는 동물 모티프(예: 나비와 물고기), 식물 기반 패턴, 문화적 상징성을 띤 기하학적 모티프 등 다양한 전통 디자인이 포함되어 있습니다. 이 데이터셋은 세그멘테이션 모듈이 패턴 재구성 과정에서 모티프 경계를 정확하게 식별하고 보존할 수 있도록 실제적인 문화적 구조를 제공하므로, 제안된 프레임워크의 중요한 구성 요소가 됩니다(표 1). 본 연구에서 문화적으로 중요한 모티프란 조류, 나비, 꽃무늬, 조상 토템 등 먀오 문화유산 문헌에 일반적으로 기록되어 있으며 데이터셋 주석에 나타난 상징적인 시각적 요소를 의미합니다. 이러한 모티프는 단순히 출현 빈도나 공간적 구성이 아니라, 기록된 문화적 중요성과 전통 먀오 바틱 및 자수 디자인에서 반복적으로 나타나는 특성을 기반으로 선정되었습니다. 전문가가 안내한 모티프 주석 및 세그멘테이션 라벨은 기존 먀오 바틱 데이터셋 소스에서 가져와 본 연구에 직접적으로 사용되었습니다. 저자들에 의한 추가적인 수동 주석 처리, 라벨 재지정 또는 전문가 안내 주석 절차는 수행되지 않았습니다. 데이터셋 제작자가 제공한 기존 주석이 시맨틱 세그멘테이션 훈련 및 평가에 활용되었습니다.

매개변수설명
데이터 세트 이름묘족 바틱 문화 패턴 데이터셋
데이터세트 출처Zenodo 리포지토리 (DOI: 10.5281/zenodo.20807658)
도메인무형문화유산 (ICH) / 섬유 패턴 분석
전체 이미지15,148장의 이미지
이미지 유형전통 먀오족(Miao) 바틱 직물 패턴의 디지털 이미지
패턴 범주동물 문양, 식물 문양 및 기하학적 문양
문화적 기원중국 구이저우성 먀오족 문화
원본 이미지 해상도전처리 전 raw 스캔 또는 사진으로 캡처된 고해상도 이미지(통상적으로 짧은 쪽의 길이가 1,000 픽셀 이상)
교육 해상도이미지 크기를 256으로 조정함 × 전처리 과정 중 256 픽셀
주석 가용성데이터셋 제작자가 제공한 기존의 세그멘테이션 어노테이션을 수정 없이 훈련 및 평가에 사용하였다. 본 연구에서는 추가적인 수동 어노테이션, 재레이벨링 또는 전문가 확인 절차를 수행하지 않았다.
본 연구에서의 적용문화적 모티프 분할, 특징 추출, 모티프 보존 및 패턴 재구성

표 1: 묘족 바틱 문화 패턴 데이터셋의 특성. 시맨틱 세그멘테이션, 문화 패턴 분석 및 모티프 재구성을 위해 사용된 묘족 바틱 문화 모티프 데이터셋의 요약. 본 표는 데이터셋 소스, 이미지 특성, 모티프 범주, 문화적 기원, 이미지 해상도 및 제안된 SegCycle-SPADE 프레임워크 내에서의 역할을 설명한다.

WikiArt 데이터셋:
WikiArt 데이터셋 [https://www.wikiart.org/]은 표 2에 제시된 27가지의 서로 다른 예술 양식에서 추출한 80,000장 이상의 이미지로 구성된 유명한 대규모 디지털 예술 저장소입니다. 해당 양식에는 르네상스 미술, 인상주의, 입체주의 및 초현실주의가 포함됩니다. 이 데이터셋은 SPADE 모듈이 세그멘테이션 과정에서 얻은 구조적 정보를 유지하면서 문화적으로 풍부한 패턴을 생성할 수 있게 하는 지식을 제공하므로, 제안된 프레임워크에서 매우 중요합니다. 데이터셋은 학습용 이미지 56,000장과 검증 및 테스트용 이미지 12,000장으로 구성되어 있습니다. 데이터셋의 이미지들은 딥러닝(DL) 모델을 효과적으로 학습시키는 데 도움을 줍니다.

매개변수설명
데이터셋 이름WikiArt 데이터셋
데이터셋 출처WikiArt 저장소 (https://www.wikiart.org/)
도메인디지털 아트 및 회화
총 이미지 수약 80,000점의 예술 작품
훈련 이미지56,000
검증 이미지12,000
테스트 이미지12,000
예술적 양식르네상스, 인상주의, 입체주의, 초현실주의, 표현주의, 사실주의 및 추상 미술을 포함한 27가지 예술적 양식
원본 이미지 해상도원본 이미지 해상도는 작품과 출처에 따라 다양함. 전처리 과정에서 이미지를 256 × 256 픽셀의 균일한 해상도로 조정함.
훈련 해상도예술적 양식 학습 및 세그멘테이션 기반 이미지 합성에 앞서 전처리 단계에서 이미지를 256 × 256 픽셀로 조정함.
데이터셋 분할고정 랜덤 시드 42를 사용하여 층화 무작위 분할(훈련 70%, 검증 15%, 테스트 15%) 수행
양식 샘플링 전략훈련, 검증 및 테스트 서브셋 전반에 걸쳐 27가지 예술적 양식의 분포를 유지하기 위해 층화 비례 샘플링을 적용함
본 연구에서의 활용예술적 양식 학습, 양식 표현 및 세그멘테이션 기반 예술적 합성

표 2: WikiArt 데이터셋의 특성. 예술적 스타일 학습 및 스타일 기반 이미지 합성에 사용된 WikiArt 데이터셋의 요약입니다. 이 표는 데이터셋 소스, 이미지 분포, 예술적 스타일 범위, 데이터셋 분할, 이미지 해상도 및 제안된 SegCycle-SPADE 프레임워크 내에서의 활용 내용을 설명합니다.

Miao Batik 데이터셋은 묘족의 전통 문화 문양을 나타내는 15,148장의 이미지로 구성되어 있습니다.32 이 데이터셋은 Zenodo(https://doi.org/10.5281/zenodo.20807658)를 통해 공개적으로 이용 가능합니다. 모델 학습에 앞서 모든 이미지를 육안으로 검사하고, 크기를 256 × 256 픽셀로 조정하고, 정규화하였으며, 손상되었거나 중복된 샘플이 있는지 스크리닝하였습니다. 품질 관리 스크리닝 결과 제외된 이미지는 없었으며, 이에 따라 총 15,148장의 이미지 모두가 후속 분석에 사용되었습니다. 데이터셋 분할의 재현성을 보장하기 위해 고정 랜덤 시드 42를 사용하여 데이터셋을 학습용(70%), 검증용(15%), 테스트용(15%) 하위 집합으로 무작위 분할하였습니다. WikiArt 데이터셋은 공식 WikiArt 저장소(https://www.wikiart.org/)를 통해 접근하였으며, 27가지 예술 스타일을 아우르는 80,000점 이상의 예술 작품을 포함하고 있습니다. 스타일 학습 실험에는 학습용으로 56,000장, 검증용으로 12,000장, 테스트용으로 12,000장의 이미지가 사용되었습니다.

데이터 전처리
제안된 SegCycle-SPADE 프레임워크를 학습시키기 전, 이미지 품질의 일관성을 유지하고 정확한 특징 표현을 보장하기 위해 묘족 바틱(Miao Batik) 문화 문양 데이터셋과 WikiArt 데이터셋에 대해 여러 전처리 단계를 수행하였다. 가우시안 노이즈 제거, 정규화, 일관된 입력 해상도로의 크기 조정 및 이미지 품질 검증을 포함하는 동일한 기본 전처리 파이프라인이 두 데이터셋 모두에 적용되었다. 다만, 각 데이터셋은 프레임워크 내에서 서로 다른 역할을 수행하였다. WikiArt 데이터셋은 예술적 스타일 학습 및 합성에 사용되었으며, 묘족 바틱 데이터셋은 주로 문화 문양 분할 및 재구성에 사용되었다. 이러한 작업별 역할 외에 데이터셋별로 특정한 전처리 변경 사항은 없었다. 딥러닝(DL) 모델의 일관된 처리를 보장하기 위해, 우선 이미지들을 고정된 해상도로 크기를 조정하였다. 두 데이터셋의 이미지들이 출처에 따라 해상도가 다양했기 때문에 이 단계가 필수적이었다. 크기 조정은 계산 효율성을 높이고 차원 불일치가 학습에 영향을 주는 것을 방지하였다. 두 번째 전처리 단계는 정규화로, 학습 중 그래디언트 업데이트를 안정화하기 위해 픽셀 값을 표준화된 범위로 스케일링하였다. 그 후, 문화 문양 구조를 방해할 수 있는 노이즈를 줄이기 위해 가우시안 필터링을 사용하여 이미지들을 처리하였다. 묘족 바틱 데이터셋의 경우, 원래 데이터셋 출처에서 직접 얻은 기존의 문화 문양 분할 마스크를 수정 없이 시맨틱 분할 학습 및 평가에 사용하였다. 본 연구를 위해 별도의 새로운 분할 마스크를 생성하지는 않았다.

별도의 언급이 없는 한, 기성 방법을 설명하는 방정식은 이전 연구에서 인용 및 수정되었으며 이에 따라 출처가 표시되었습니다. 제안된 CAFFM 및 복합 SegCycle-SPADE 최적화 프레임워크를 설명하는 방정식은 본 연구를 위해 저자들이 개발하였습니다.

데이터셋의 입력 이미지를 식 1과 같이 나타냅니다:

figure-protocol-2  (1)

여기서 H, W, C는 각각 이미지의 높이, 너비 및 색상 채널 수를 나타냅니다. 모든 이미지는 식 2에 표시된 바와 같이 고정된 크기인 H′ × W′로 리사이징됩니다.

figure-protocol-3

여기에, I제공해주신 텍스트가 없습니다. 번역할 소스 텍스트를 입력해 주시면, 요청하신 지침에 따라 전문적인 한국어 학술 번역을 진행하겠습니다. 크기가 조정된 이미지입니다. 정규화된 픽셀 값은 다음과 같이 계산됩니다. 식 3:

figure-protocol-4   (3)

이는 훈련 과정의 안정화를 돕습니다. 노이즈 필터링은 다음에서 보여주는 바와 같이 가우시안 필터를 사용하여 수행됩니다. 식 4:

figure-protocol-5

여기서 G(σ)는 가우시안 필터이며 *는 컨볼루션을 나타냅니다. 표준 편차가 σ = 1.0인 5 × 5 커널 가우시안 필터가 사용되었습니다. 가장자리 아티팩트를 줄이기 위해 경계 픽셀에 반사 패딩(reflective padding)을 적용하였습니다. 스케일링 및 정규화에 앞서, 이미지 로딩 직후에 노이즈 제거 과정이 수행되었습니다. 연구 전반에 걸쳐 균일한 전처리를 보장하기 위해, Miao Batik 및 WikiArt 데이터셋의 모든 이미지에 동일한 필터 설정을 적용하였습니다. Miao Batik 데이터셋의 경우, 세그멘테이션 마스크는 수식 5에 따라 생성됩니다:

figure-protocol-6

여기서 M은 SegFormer 모델을 안내하는 데 사용되는 세그멘테이션 마스크입니다.

그림 3에 나타난 바와 같이, 전처리 파이프라인은 Miao Batik 데이터셋과 WikiArt 데이터셋으로부터 이미지를 획득하는 것으로 시작됩니다. 훈련 과정에서 데이터 증강 기법은 사용되지 않았습니다. 크기 조정, 정규화, 가우시안 노이즈 제거 및 세그멘테이션 마스크 준비를 포함하는 전처리를 거친 후, 이미지들은 제안된 SegCycle-SPADE 프레임워크의 훈련, 검증 및 테스트에 직접적으로 사용되었습니다. 전처리 파이프라인의 첫 번째 단계는 이미지를 고정된 크기로 조정하는 것이며, 이를 통해 DL 모델이 이미지를 더 효율적으로 처리할 수 있게 합니다. 두 번째 단계는 정규화로, 픽셀 값을 표준화된 수치 범위로 변환하여 모델의 수렴을 용이하게 합니다. 세 번째 단계는 노이즈 제거 단계이며, 여기서는 패턴 인식 능력을 향상시키기 위해 이미지에서 불필요한 노이즈를 제거합니다. 또한, Miao Batik 데이터셋의 경우 문화적 모티프 영역을 어노테이션하여 마스크를 생성하며, 이 마스크는 제안된 모델의 세그멘테이션 모듈에서 사용되어 생성 과정 동안 문화적 모티프가 보존되도록 합니다. 이 단계의 최종 출력물은 제안된 모델의 세그멘테이션 및 생성 모듈을 훈련시키기에 적합한 정제된 데이터셋입니다.

figure-protocol-7
그림 3. 문화유산 이미지의 데이터 전처리 파이프라인. 모델 학습 전에 적용되는 이미지 전처리 절차를 나타낸 워크플로우. 파이프라인에는 데이터셋 획득, 이미지 크기 조정, 정규화, 가우시안 노이즈 제거, 기존 문화 문양 주석 달기 및 세그멘테이션 마스크 준비가 포함된다. 이렇게 처리된 이미지와 마스크는 시맨틱 세그멘테이션 및 패턴 재구성의 입력값으로 사용된다. 이 그림의 더 큰 버전을 보시려면 여기를 클릭하십시오.

모델 학습 전 모든 이미지에 대해 품질 관리 프로세스를 수행하였다. Miao Batik 데이터셋은 15,148장의 이미지로 구성되었다. 손상되었거나 중복된 샘플, 그리고 저품질 샘플은 이미 원본 데이터셋 제작자에 의해 처리되었으므로, 본 연구의 품질 관리 스크리닝 과정에서 추가로 제외된 이미지는 없었다. 결과적으로 15,148장의 이미지 모두 분석에 사용되었다. 전처리 과정에서 이미지는 RGB 형식으로 로드되었으며, bilinear interpolation을 사용하여 256 × 256 픽셀로 크기를 조정하였다. 픽셀 값은 255로 나누어 [0, 255] 범위에서 [0, 1] 범위로 스케일링하였다. 이후 빨강, 초록, 파랑 채널에 대해 각각 [0.485, 0.456, 0.406]의 평균값과 [0.229, 0.224, 0.225]의 표준편차 값을 사용하여 채널별 정규화를 적용하였다. 전처리 파이프라인에는 이미지 로드, RGB 변환, 크기 조정, 픽셀 값 스케일링, 정규화 및 텐서 변환이 포함되었다. 필요한 경우, DL 모델과의 호환성을 유지하기 위해 그레이스케일 이미지를 3채널 RGB 형식으로 변환하였다. 전처리 후, 이미지는 훈련, 검증 및 테스트 서브셋으로 분할되었다. 시맨틱 세그멘테이션, 특징 융합, 모티프 재구성 및 SPADE 기반의 예술적 합성을 포함한 SegCycle-SPADE 프레임워크의 모든 단계에서는 256 × 256 픽셀의 일관된 입력 해상도를 사용하였다.

SegFormer를 이용한 의미론적 패턴 분할
이 전처리 단계 이후, 정제 및 정규화된 묘족 바틱(Miao Batik) 문화 모티프 데이터셋과 WikiArt 데이터셋의 이미지들이 제안된 SegFormer-B2 프레임워크 기반의 의미론적 분할(semantic segmentation) 모듈로 입력됩니다. 이 단계의 목적은 전통 문양에 존재하는 문화적 모티프를 정확하게 식별하고 분리하는 것입니다. 제안된 SegFormer 프레임워크는 계층적 트랜스포머 인코더와 경량 MLP 디코더를 결합한 트랜스포머 아키텍처를 기반으로 하며, 이를 통해 복잡한 전통 문양으로부터 전역적 문맥 정보와 세부적인 구조 정보를 정확하게 포착합니다. 모델은 먼저 입력 이미지에서 다중 스케일의 특징 표현을 추출한 다음, 디코더를 통해 이러한 표현들을 융합하여 정확하게 분할된 패턴을 생성합니다. 이를 통해 전통 이미지 내의 패턴들이 기하학적 문양, 꽃 문양, 상징적 문양과 같은 모티프로 정확하게 분할되어 구조적 무결성을 유지하면서 배경과 분리됩니다. 이렇게 얻은 구조 정보는 이후 SegCycle-SPADE 프레임워크 내의 패턴 생성 후반 단계에서 사용됩니다.

전처리된 입력 이미지를 식 6과 같이 나타냅니다:

figure-protocol-8    (6)

SegFormer 인코더는 이미지를 패치로 분할하고, 수식 71에 표시된 바와 같이 트랜스포머 층을 사용하여 계층적 특징을 추출합니다.

figure-protocol-9

여기서 F는 트랜스포머 인코더에서 얻은 다중 스케일 특징 맵을 나타냅니다. 이러한 특징들은 모티프 영역 간의 국소적 텍스처 패턴과 전역적 문맥 관계를 모두 인코딩합니다. SegFormer 모델은 식 8에 정의된 바와 같이 서로 다른 스케일의 특징 맵을 추출합니다.

figure-protocol-10

다중 스케일 표현을 사용하면 문화적 모티프 내에서 다양한 크기의 패턴을 탐지하는 것이 용이해집니다. 마지막으로, 특징들은 식 91에 표시된 것처럼 MLP 디코더를 사용하여 결합됩니다:
 figure-protocol-11

여기서 S는 최종 예측 분할 맵을 나타냅니다.

SegFormer-B2 백본은 ImageNet으로 사전 학습된 가중치를 사용하여 초기화되었으며, 이후 문화적 문양 분할을 위해 Miao Batik 데이터셋으로 미세 조정되었습니다. 사전 학습된 체크포인트는 SegFormer의 공식 구현체에서 확보하였습니다. 구체적으로, 미세 조정 전 SegFormer-B2 백본을 초기화하기 위해 공식 SegFormer 저장소에서 제공하는 ImageNet-1K 사전 학습 MIT-B2 체크포인트(mit_b2.pth)를 사용하였습니다. 사전 학습된 가중치는 SegFormer 저자들이 공개한 MIT-B2 백본에 해당하며, 시맨틱 분할 학습을 위한 초기화 모델로 사용되었습니다. 그 외의 작업 특정 레이어들은 학습 전 PyTorch의 기본 가중치 초기화 절차를 통해 초기화되었습니다.

중첩 패치 임베딩을 갖춘 4단계 계층적 Transformer 인코더가 아키텍처에 사용되었습니다. 초기 단계에서 패치 크기는 7 × 7, 스트라이드는 4로 설정되었습니다. 4개의 인코더 단계 각각에 대한 임베딩 차원은 64, 128, 320, 512였습니다. 4단계에 걸쳐 멀티헤드 셀프 어텐션 헤드는 각각 1, 2, 5, 8개였으며, 이에 해당하는 인코더 깊이는 3, 4, 6, 3 레이어였습니다. 인코더에서 추출된 다중 스케일 특징은 경량 all-MLP 디코더를 사용하여 집계되었습니다. 최종 세그멘테이션 맵을 생성하기 전, 디코더는 모든 인코더 단계의 특징을 단일 임베딩 공간으로 투영했습니다. 모든 Transformer 블록에는 Gaussian Error Linear Unit (GELU) 활성화 함수가 사용되었습니다. 일반화 성능을 높이고 과적합을 줄이기 위해 훈련 과정에서 0.1의 드롭아웃 비율이 적용되었습니다.

훈련 단계 동안, SegFormer 프레임워크는 두 데이터셋 모두에서 전처리된 이미지를 입력받습니다. Miao Batik 데이터셋의 이미지에는 세그멘테이션 모델의 지도 학습을 위한 라벨 역할을 하는 모티프 영역이 포함되어 있습니다. Transformer 인코더는 전체 이미지를 처리하고 이미지 구성 요소 간의 장거리 관계를 캡처하며, 이는 공간적으로 분산된 모티프를 포함하는 전통 바틱 패턴에서 특히 중요합니다. 계층적 특징 추출 메커니즘은 반복되는 기하학적 질감과 같은 국소 구조를 동시에 캡처합니다. MLP 디코더는 이렇게 추출된 특징들을 처리하여 모티프 영역을 강조하는 세그멘테이션 마스크를 생성합니다. 이 단계에서 생성된 세그멘테이션 맵은 이후 어텐션 모듈과 패턴 재구성 단계의 구조적 입력으로 사용되어, 생성된 패턴의 진본성을 유지하는 데 도움을 줍니다.

문화적 모티프는 시각적 및 문화적 특성에 따라 시맨틱 세그멘테이션을 위해 서로 다른 클래스로 분류되었습니다. 세그멘테이션 분류 체계는 동물 모티프(예: 나비, 물고기, 새 및 기타 상징적 동물), 식물 모티프(예: 꽃, 잎, 덩굴 및 식물학적 패턴), 기하학적 모티프(예: 반복되는 모양, 테두리 및 추상적 기하학적 구조), 그리고 모티프가 아닌 영역을 나타내는 배경 지역으로 구성되었습니다. 각 픽셀을 미리 정의된 클래스 중 하나에 할당하기 위해 픽셀 수준의 세그멘테이션 마스크가 사용되었습니다. 정수 레이블은 다음과 같이 인코딩되었습니다: 레이블 0 = 배경, 레이블 1 = 동물 모티프, 레이블 2 = 식물 모티프, 레이블 3 = 기하학적 모티프. 세그멘테이션 어노테이션과 모티프 레이블은 원래의 Miao Batik 데이터셋 소스에서 직접 가져왔습니다. 본 연구에서는 추가적인 수동 어노테이션, 레이블 재설정, 경계 확인 또는 전문가 확인 절차를 수행하지 않았습니다. 데이터셋 제작자가 제공한 기존 어노테이션을 수정 없이 학습 및 평가에 사용하였습니다.

문화적 모티프 세그멘테이션을 위한 SegFormer 모델은 그림 4에 나타낸 바와 같이, 문화적 패턴 영역의 정확한 검출을 위해 트랜스포머 기반 메커니즘을 사용하여 Miao Batik 데이터셋과 WikiArt 데이터셋의 전처리된 이미지를 처리합니다. 먼저, 전통 문화 모티프가 포함된 입력 이미지가 SegFormer 모델에 제공됩니다. 트랜스포머 인코더는 이미지 패치로부터 전역적 문맥 정보와 지역적 구조 특징을 모두 추출합니다. 이렇게 생성된 다중 스케일 특징은 세그멘테이션 디코더로 전달되며, 디코더는 Mix Feed-Forward 네트워크를 활용하여 특징 표현을 정교화하고 모티프 검출 능력을 향상시킵니다. SegFormer 모델의 출력은 무관한 배경 정보를 억제하면서 문화적 패턴에 해당하는 픽셀을 강조하는 세그멘테이션 마스크입니다. 이렇게 분리된 문화적 패턴은 이후 SegCycle-SPADE 프레임워크의 다음 단계에서 구조적 가이드 역할을 합니다.

figure-protocol-12
그림 4. SegFormer-B2 기반 문화 문양의 시맨틱 세그멘테이션. 문화 문양 추출을 위해 사용되었으며 Miao Batik 데이터셋으로만 학습된 SegFormer-B2 시맨틱 세그멘테이션 모듈의 구조. 이 프레임워크는 다중 스케일 특징 추출을 위한 Transformer 기반 인코더와 문양 마스크 생성을 위한 경량 세그멘테이션 디코더로 구성된다. 모델은 동물, 식물, 기하학적 문양, 배경의 네 가지 시맨틱 클래스를 예측하며, 결과로 생성된 세그멘테이션 마스크는 불필요한 배경 정보를 억제하는 동시에 문화적으로 중요한 문양 영역을 식별한다. 이러한 세그멘테이션 출력물은 제안된 SegCycle-SPADE 프레임워크의 후속 단계인 특징 융합, 재구성 및 예술적 합성 과정에 구조적 가이드를 제공한다. 여기에서 이 그림의 더 큰 버전을 확인하십시오.

제안된 프레임워크에서는 새로운 세그멘테이션 어노테이션을 생성할 필요가 없습니다. Miao Batik 데이터셋은 이미 존재하는 공개 소스에서 획득하였으며, 데이터셋 제작자가 제공한 관련 모티프 정보를 사용하여 모델을 학습시켰습니다. 학습 과정에서 SegFormer 모델이 시맨틱 세그멘테이션 맵을 생성하였습니다. 결과적으로, 본 연구에서는 추가적인 수동 어노테이션 소프트웨어, 어노테이션 가이드라인 또는 어노테이션 품질 관리 절차가 필요하지 않았습니다.

CAFFM
시맨틱 세그멘테이션의 특징과 생성적 재구성 표현 간의 상호작용을 개선하기 위해, 본 연구에서는 CAFFM을 제안하였습니다. SegFormer-B2 인코더는 CAFFM 모듈에 시맨틱 특징 맵을 제공하며, CycleGAN 재구성 단계는 생성적 특징 맵을 제공합니다. 우선, 두 특징 스트림을 공통 임베딩 공간으로 투영하기 위해 선형 투영 층이 사용됩니다. 교차 주의집중(cross-attention) 계산을 위해 생성된 특징 텐서를 사용하여 쿼리(Q), 키(K), 값(V) 표현을 생성합니다. 이후 멀티헤드 교차 주의집중을 통해 구조적 모티프 정보와 예술적 스타일 요소 간의 관계를 모델링합니다. 다음으로 융합된 특징 표현에 레이어 정규화, 잔차 연결 및 GELU 활성화 함수가 포함된 피드포워드 층을 적용합니다. SPADE 기반의 합성 단계는 CAFFM 모듈의 출력을 전달받아, 예술적 일관성을 유지하면서 문화적으로 의미 있는 테마를 보존할 수 있게 합니다.

특징 호환성을 보장하기 위해, 입력 특징들은 먼저 선형 투영 층을 통해 임베딩 차원이 256인 공유 임베딩 공간으로 투영됩니다. 그 후, 시맨틱 구조 정보와 생성적 스타일 표현 사이의 상호 연결은 8개의 어텐션 헤드를 갖는 MultiHead Cross-Attention 메커니즘을 사용하여 모델링됩니다. 교차 어텐션 계산에는 특정 선형 변환 층에서 생성된 쿼리(Q), 키(K), 값(V) 벡터가 사용됩니다. 학습 안정성을 높이고 특징의 무결성을 유지하기 위해, 잔차 연결과 층 정규화(Layer Normalization)를 적용하여 융합된 특징 표현을 더욱 향상시킵니다. 이어 Gaussian Error Linear Unit (GELU) 활성화 함수를 갖는 피드포워드 네트워크를 적용하여 비선형 특징 학습을 개선합니다. 해당 모듈에 의해 차원이 256인 출력 특징 표현이 생성되며, 이는 창의적 합성을 위해 다른 단계로 전달됩니다. CAFFM은 교차 어텐션 기반의 융합 기술을 사용하여 예술적 스타일 데이터와 문화적 모티프 구조를 성공적으로 결합하며, 이를 통해 재구성된 문화유산 패턴의 모티프 보존력과 시각적 일관성을 향상시킵니다.

제안된 시스템에서 구조적 특징은 Miao Batik 데이터셋에서 추출하며, 스타일 특징은 WikiArt 데이터셋에서 학습합니다. Miao Batik 데이터셋의 이미지를 사용하여 SegFormer 세그멘테이션 네트워크로부터 도출된 특징 맵을 Fs로, WikiArt 이미지를 사용하는 스타일 특징 추출 브랜치로부터 도출된 특징 맵을 Fa로 정의합니다. 제안된 CAFFM은 교차 주의 집중(cross-attention) 메커니즘을 사용하여 두 특징 도메인을 결합함으로써 문화적 패턴의 구조적 및 스타일적 의존성을 모두 학습합니다. 표 3에는 임베딩 차원, 정규화 레이어, 활성화 함수 및 어텐션 헤드 구성을 포함한 모든 아키텍처 특성이 기록되어 있습니다. 256 × 256 픽셀의 입력 이미지 크기에 대해 SegFormer-B2 인코더는 64 × 64 × 128 크기의 시맨틱 특징 맵을 생성했으며, 스타일 특징 추출 브랜치는 64 × 64 × 128 크기의 특징 맵을 생성했습니다. 두 특징 맵은 교차 주의 집중 융합 이전에 학습 가능한 선형 레이어를 통해 차원이 256인 공유 임베딩 공간으로 투영되었습니다.

매개변수설정
제안된 프레임워크SegCycle-SPADE
시맨틱 세그멘테이션 모델SegFormer-B2
SegFormer 인코더 단계4
가중치 초기화ImageNet-1K 사전 학습된 SegFormer-B2 (MIT-B2 백본)
체크포인트 출처공식 NVIDIA SegFormer 저장소 (https://github.com/NVlabs/SegFormer); 체크포인트: segformer.b2.512x512.ade.160k
미세 조정 전략Miao Batik 데이터셋에 대한 엔드투엔드 미세 조정
패치 임베딩 크기7 × 7
패치 스트라이드4
임베딩 차원64, 128, 320, 512
인코더 깊이3, 4, 6, 3
어텐션 헤드1, 2, 5, 8
디코더 유형All-MLP 디코더
활성화 함수GELU
드롭아웃 비율0.1
특징 강화 모듈교차 어텐션 문화 특징 융합 모듈 (CAFFM)
CAFFM 임베딩 차원256
CAFFM 어텐션 헤드8
CAFFM 융합 스케일4
재구성 모델CycleGAN
스타일 생성 모델SPADE
문화 데이터셋Miao Batik 데이터셋
스타일 데이터셋WikiArt 데이터셋
Miao Batik 이미지 수15,148
WikiArt 이미지 수약 80,000
입력 이미지 해상도256 × 256 pixels
색상 형식RGB
보간법쌍선형 보간법
노이즈 제거 방법가우시안 필터링
가우시안 커널 크기5 × 5
가우시안 시그마 (σ)1
정규화 범위[0, 1]
배치 크기16
에포크 수100
최적화 알고리즘Adam
학습률0.0002
Adam 파라미터β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, 가중치 감쇠 = 0
손실 함수세그멘테이션 손실, 적대적 손실, 사이클 일관성 손실, 재구성 손실, 모티프 보존 손실 및 스타일 일관성 손실
데이터셋 분할 전략훈련 / 검증 / 테스트
훈련 세트70%
검증 세트15%
테스트 세트15%
랜덤 시드42
평가 지표세그멘테이션 정확도, IoU, Dice 계수, SSIM, PSNR 및 FID
프로그래밍 언어Python 3.8.10
딥러닝 프레임워크PyTorch 1.10.0
하드웨어 플랫폼NVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (11세대), 32 GB RAM
운영 환경Ubuntu 20.04 LTS

표 3: 실험 설정 및 모델 구성. 제안된 SegCycle-SPADE 프레임워크의 구현 및 평가에 사용된 아키텍처 구성 요소, 학습 구성, 전처리 설정, 데이터셋, 최적화 파라미터, 평가 지표 및 컴퓨팅 환경의 요약.

어텐션 모듈은 먼저 식 10을 사용하여 특성 맵을 쿼리(query), 키(key) 및 밸류(value) 표현으로 매핑합니다:

figure-protocol-13

여기서 Wq, Wk, Wv는 학습 가능한 가중치 행렬입니다. 어텐션 가중치는 식 1117을 사용하여 쿼리 벡터와 키 벡터 사이의 유사성을 기반으로 계산됩니다: 

figure-protocol-14

여기서 dk는 키 벡터의 차원입니다. 강화된 특징 표현은 식 12를 사용하여 어텐션 가중치와 밸류 행렬을 곱함으로써 계산됩니다:

figure-protocol-15

여기서 Fa는 특징 맵의 강화된 특징 표현입니다. 강화된 특징 표현은 원래의 세분화 특징과 어텐션 메커니즘을 통해 얻은 강화된 특징을 식 13을 사용하여 결합함으로써 계산됩니다:

figure-protocol-16                                

여기서 Fe는 패턴 재구성에 사용되는 강화된 특징 맵입니다. CAFFM은 다양한 스케일의 문화적 모티프에 대한 특징을 추출하기 위해 멀티스케일 교차 주의 집중(cross-attention) 메커니즘으로 확장됩니다. Fsi를 스케일 i에서의 세그멘테이션 특징으로 정의하고, Faj를 동일한 스케일에서의 예술적 스타일 특징으로 정의합니다. 최종 특징 표현은 식 14를 사용하여 정의됩니다:

  figure-protocol-17

여기서 Qi, Ki, 및 Vi는 각각 스케일 i에서의 쿼리, 키, 값 행렬을 나타내며, N은 특징 스케일의 수를 나타냅니다. 본 연구에서 N = 4이며, 이는 입력 이미지 크기의 1/4, 1/8, 1/16, 1/32 공간 해상도에서 추출된 특징 맵에 해당합니다. 이러한 다중 스케일 특징 표현은 재구성 및 예술적 합성에 앞서 학습 가능한 어텐션 가중치를 사용하여 융합되었습니다. 위와 같은 확장을 통해 본 방법은 문화적 패턴을 재구성하기 위한 전역적 문화 모티프와 질감을 추출할 수 있습니다. CAFFM은 제안된 SegCycle-SPADE 시스템에서 SegFormer 기반의 세그멘테이션 단계와 SPADE 기반의 창의적 합성 단계 사이에 위치합니다. 먼저, CycleGAN이 스타일 및 패턴 관련 정보가 포함된 재구성 특징을 동시에 생성하는 동안, SegFormer-B2는 문화적 모티프의 구조적 특성을 묘사하는 시맨틱 특징 맵을 복원합니다. CAFFM 모듈은 이 두 특징 스트림을 전달받아 교차 어텐션 기반 융합을 통해 구조적 표현과 예술적 표현 사이의 관계를 식별합니다. 이후 시맨틱 일관성과 구조적 특징을 유지하면서 문화적으로 정통한 패턴을 생성하기 위해, 결과로 도출된 융합 특징 맵은 세그멘테이션 가이드 창의적 합성을 위해 SPADE 모듈로 전송됩니다.

CycleGAN을 이용한 패턴 복원
어텐션 기반의 특징 강화 단계가 완료되면, 특징 맵에는 강화된 문화적 모티프 구조가 포함됩니다. 하지만 특징 맵에는 여전히 불완전하거나 손상된 패턴 영역이 포함되어 있을 수 있습니다. 따라서 패턴 복원 문제를 해결하기 위해 제안된 프레임워크에서는 CycleGAN 모델을 사용합니다. 제안된 프레임워크에서 두 도메인은 원래의 문화적 모티프 패턴과 복원된 문화적 모티프 패턴이 됩니다. CycleGAN 모델은 이전 단계에서 얻은 강화된 특징을 사용하여 구조적 일관성을 유지하면서 문화적 패턴을 복원합니다. 이를 통해 기하학적 패턴, 꽃무늬 패턴, 상징적 패턴과 같은 문화적 패턴들이 공간적 배치를 유지하도록 보장합니다. 원래의 묘족 바틱(Miao Batik) 이미지에 무작위 마스킹 및 부분 가림 작업을 수행하여 불완전하거나 손상된 문화적 모티프를 생성했습니다. 이러한 퇴화 절차는 훼손된 문화 유산 유물에서 흔히 관찰되는 패턴 영역의 손실과 구조적 손상을 모사하였습니다. 퇴화된 이미지는 복원 모듈의 입력값으로 사용되었으며, 이에 대응하는 원본 이미지는 성능 평가 및 복원 품질 평가를 위한 참조 이미지로 활용되었습니다. 이러한 전략을 통해 모델은 시맨틱 일관성과 문화적 특성을 보존하면서 누락된 모티프 구조의 복원을 학습할 수 있었습니다.

X를 불완전한 문화 패턴의 영역이라 하고, Y를 재구성된 문화 패턴의 영역이라고 하자. 두 생성기는 식 15를 사용하여 양방향 매핑을 수행하도록 학습한다:

 figure-protocol-18

여기서 GE는 모티프 구조를 재구성하는 데 사용되고, FM은 패턴을 원래의 도메인으로 다시 매핑하는 데 사용됩니다. 적대적 손실(adversarial loss)은 재구성된 패턴이 실제와 유사하도록 보장하는 데 사용됩니다 (식 16)30

figure-protocol-19

여기서 DY는 실제 패턴과 재구성된 패턴을 구별하는 데 사용되는 판별자이며, GE(x)는 생성된 재구성 패턴을 나타냅니다. 또한 CycleGAN은 문화적 모티프의 구조적 배치를 보존하기 위해 사이클 일관성을 강제합니다(식 17)30.

figure-protocol-20

최종 손실 함수는 식 1830을 사용하여 정의됩니다:

figure-protocol-21

여기서 λi는 사이클 일관성 손실(cycle-consistency loss)에 대한 가중치 계수를 나타내며, 원래의 CycleGAN 공식과 일치하도록 학습 과정 동안 10으로 설정되었습니다. 이 값은 적대적 학습과 소스 및 타겟 도메인 간의 재구성 일관성 사이의 균형을 맞추기 위해 선택되었습니다.

CycleGAN 재구성 모듈은 양방향 이미지 변환을 위해 두 개의 생성자와 두 개의 판별자로 구성됩니다. 각 생성자는 초기 7 × 7 합성곱 층, 이어서 두 개의 다운샘플링 합성곱 층, 아홉 개의 잔차 블록, 그리고 두 개의 업샘플링 층으로 이루어진 잔차 네트워크 구조를 따릅니다. 입력 층은 향상된 특징 추출을 위해 7 × 7 커널을 사용하며, 그 외 모든 합성곱 연산에는 3 × 3 커널 크기가 적용됩니다. 훈련 안정성을 높이기 위해 각 합성곱 층 이후에 인스턴스 정규화(Instance Normalization)가 적용되며, 생성자 네트워크 전반에 걸쳐 ReLU 활성화 함수가 사용됩니다. 출력 층은 정규화된 이미지 출력을 생성하기 위해 Tanh 활성화 함수를 사용합니다. 판별자는 4 × 4 커널 크기의 일련의 합성곱 층과 점진적으로 증가하는 특징 채널로 구성된 70 × 70 PatchGAN 구조를 따릅니다. 판별자에서는 특징 판별 및 적대적 학습을 개선하기 위해 인스턴스 정규화와 LeakyReLU 활성화 함수(negative slope = 0.2)가 사용됩니다. CycleGAN 모듈은 전처리된 문화적 모티프 이미지를 입력으로 받아 재구성된 패턴 표현을 생성하며, 이는 이후 세그멘테이션 특징과 통합하기 위해 CAFFM으로 전달됩니다. CycleGAN 훈련은 Adam 옵티마이저(β₁ = 0.5, β₂ = 0.999)를 사용하여 초기 학습률 0.0002로 수행되었습니다. 학습률은 처음 100 epoch 동안 유지되었으며, 이후 남은 훈련 기간 동안 0까지 선형적으로 감소하였습니다. 판별자 훈련을 안정화하기 위해 이전에 생성된 이미지 50장을 포함하는 리플레이 버퍼가 사용되었습니다. 생성자와 판별자는 1:1 업데이트 비율로 업데이트되었으며, 각 훈련 반복마다 한 번의 생성자 업데이트 후 한 번의 판별자 업데이트가 이어졌습니다.

CycleGAN의 재구성 과정은 그림 5의 CAFFM 메커니즘을 통해 얻은 향상된 특징 맵을 기반으로 합니다. 특징 맵에는 이전 단계의 세그멘테이션과 CAFFM을 통해 얻은 향상된 문화적 모티프가 포함되어 있습니다. 이 특징 맵은 첫 번째 생성기 GE의 입력값으로 사용됩니다. 첫 번째 생성기 GE는 문화적 패턴을 재구성하는 데 필요한 매핑을 학습합니다. 이후 출력값은 판별기 DY로 전달되어 실제 문화적 패턴과 재구성된 패턴을 구분합니다. 판별기 DY는 생성기 GE가 사실적인 출력값을 생성하도록 돕습니다. 재구성 과정에서 문화적 패턴이 왜곡되지 않도록 두 번째 생성기 FM이 사이클 일관성 매핑을 수행합니다. 두 번째 생성기 FM은 출력값을 다시 원래 도메인으로 매핑합니다. 그 후 판별기를 통해 출력값의 사실성을 평가합니다. 최종 출력값은 제안된 SegCycle-SPADE 프레임워크의 다음 단계인 예술적 스타일 생성을 위해 SPADE 모듈로 전달됩니다.

figure-protocol-22
그림 5. CycleGAN 기반 패턴 재구성 워크플로우. CycleGAN 재구성 모듈의 워크플로우. 불완전한 문화적 모티프를 재구성하기 위해 어텐션 강화 특징 표현(Attention-enhanced feature representations)이 생성자 네트워크의 입력으로 제공된다. 판별자는 재구성된 결과물을 참조 패턴과 비교하여 평가하며, 사이클 일관성 매핑(cycle-consistency mapping)은 양방향 이미지 변환 과정에서 구조적 무결성을 유지한다. 재구성된 모티프는 이후 예술적 스타일 합성을 위해 SPADE 모듈로 전달된다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

SPADE를 이용한 예술적 스타일 생성
그 다음으로, 재구성된 문화적 모티프들은 예술적 스타일 생성을 위해 SPADE 모듈에 적용됩니다. SPADE 모듈의 주요 목표는 모티프의 구조적 배치를 훼손하지 않으면서 재구성된 문화적 모티프에 시각적으로 더욱 풍부한 예술적 스타일의 질감을 더하는 것입니다. SPADE 모듈은 이미지 생성을 위해 이미지 세그멘테이션 개념을 활용하는 조건부 이미지 생성 기술입니다. SegFormer-B2에 의해 생성된 시맨틱 세그멘테이션 마스크로부터 미리 정의된 모티프 클래스에 해당하는 다채널 시맨틱 맵이 인코딩되었습니다. SPADE 생성기는 이러한 인코딩된 맵을 조건부 입력으로 받았습니다. 공간 적응형 스케일(γ) 및 바이어스(β) 파라미터는 각 SPADE 레이어 내의 컨볼루션 레이어를 통해 시맨틱 맵을 처리함으로써 생성되었습니다. 따라서 생성기는 정규화된 특성 활성화에 이 파라미터들을 적용함으로써 예술적 합성 과정 동안 모티프 경계, 구조적 배치 및 시맨틱 정보를 유지할 수 있었습니다. 조건화 과정이 SPADE 생성기의 여러 레이어에서 수행되었기 때문에 시맨틱 가이딩은 상위 수준의 구조적 재구성과 하위 수준의 질감 합성 모두에 영향을 줄 수 있었습니다. 그 결과, 생성된 예술적 패턴은 세그멘테이션 단계에서 발견된 문화적 모티프 구조를 유지하면서 WikiArt 데이터셋에서 얻은 스타일적 특성을 결합하였습니다.

르네상스, 인상주의, 입체파, 표현주의, 초현실주의, 사실주의 및 추상 예술 등 27가지의 다양한 예술 범주를 포함하는 WikiArt 데이터셋이 예술적 스타일을 이해하기 위한 주요 리소스로 사용되었습니다. 모델이 다양한 창작 특성을 학습하고 스타일 일반화 능력을 향상시킬 수 있도록, 훈련 과정에서 여러 범주로부터 스타일 이미지를 무작위로 선택하였습니다. 스타일 편향을 줄이기 위해 데이터셋은 예술 범주가 균형 있게 포함된 훈련, 검증 및 테스트 서브셋으로 나누었습니다. 모든 27가지 예술 범주가 균형 있게 대표되도록 층화 추출법을 사용하였습니다. 각 범주의 샘플들은 원래의 클래스 분포를 유지하면서 훈련, 검증 및 테스트 서브셋에 비례적으로 할당되었습니다. WikiArt 이미지에서 도출된 스타일 요소와 CycleGAN에서 생성된 재구성 특징을 결합하기 위해 CAFFM 모듈이 사용되었습니다. 합성 네트워크가 세그멘테이션 맵에서 유도된 의미론적 구조와 문화적 모티브 경계를 유지하면서 예술적 특성을 전이할 수 있도록, 이렇게 융합된 표현을 SPADE 생성기의 조건 정보로 제공하였습니다. 이러한 스타일 조건화 기법 덕분에 제안된 프레임워크는 일관된 구조적 및 스타일적 표현을 갖춘 문화적으로 정통한 예술적 패턴을 생성할 수 있었습니다.

SPADE는 또한 세그멘테이션 맵에 따라 달라지는 공간 적응형 파라미터를 도입합니다. 해당 파라미터는 식 191에 표시된 것과 같이 정의될 수 있습니다:

figure-protocol-23

여기서 γ(S)는 공간적으로 변화하는 스케일 매개변수이고 β(S)는 공간적으로 변화하는 바이어스 매개변수입니다. 이러한 매개변수들은 생성자가 이미지의 시맨틱 영역에 따라 서로 다른 질감과 스타일을 생성하는 데 도움을 줍니다. 최종 문화 예술 작품은 식 20에 표시된 바와 같이 정의될 수 있습니다:

 figure-protocol-24

여기서 GE는 SPADE 생성기, XrP는 재구성된 패턴, SM은 세그멘테이션 맵입니다. 최종 작품은 문화적 모티프의 구조적 무결성을 유지하면서 예술적 외관을 향상시킵니다. 제안된 SegCycle-SPADE 아키텍처를 최적화하기 위해 시맨틱 세그멘테이션 정확도, 문화적 모티프 보존, 패턴 재구성 품질 및 예술적 스타일 일관성의 균형을 맞추는 복합 손실 함수가 사용되었습니다. 전체 학습 목표를 설정하기 위해 세그멘테이션 손실(Lseg), 적대적 손실(Ladv), 사이클 일관성 손실(Lcycle), 재구성 손실(Lrecon), 모티프 보존 손실(Lmotif) 및 스타일 일관성 손실(Lstyle)의 가중치 혼합이 사용되었습니다. 총 손실 함수는 수식 21에 정의되어 있습니다:

figure-protocol-25  (21)

입력된 문화적 모티프와 재구성된 모티프 사이의 구조적 일관성을 보장하기 위해 cycle-consistency 손실 계수를 10으로 설정했습니다. 세밀한 모티프 특징을 유지하고 시각적 정확도를 높이기 위해 reconstruction 손실 계수는 5로 설정했습니다. 예술적 합성 과정에서 문화적으로 필수적인 구조적 패턴의 보존을 강조하기 위해 motif-preservation 손실에 2의 계수를 사용했습니다. 의미론적 모티프 구조를 과도하게 왜곡하지 않으면서 예술적 스타일 전이를 촉진하기 위해 style-consistency 손실 계수를 1로 조정했습니다. 실사 이미지 생성과 정밀한 모티프 세그멘테이션 사이의 균형 잡힌 기여도를 유지하기 위해 segmentation 손실과 adversarial 손실에 동일한 가중치를 부여했습니다. style-consistency 손실을 계산하기 위해 WikiArt 데이터셋의 특징 기반 스타일 표현을 사용했습니다. 특히, 딥 피처 맵에서 추출한 Gram 행렬 상관관계를 사용하여 예술적 스타일 특성을 포착했습니다. Equation 22에 표시된 바와 같이, 타겟 스타일 이미지와 생성된 이미지의 Gram 행렬 간의 Frobenius 노름 차이를 사용하여 스타일 손실을 계산했습니다:

figure-protocol-26

여기서 Gll번째 특징 계층에서 계산된 Gram 행렬이며, Igen은 생성된 예술 이미지를, Istyle은 WikiArt 데이터셋의 대상 스타일 이미지를, 그리고 F는 Frobenius 노름을 나타냅니다. 이러한 공식화를 통해 제안된 프레임워크는 문화적 모티프의 구조적 및 의미적 무결성을 유지하면서 예술적 특성을 보존할 수 있습니다.

CAFFM 모듈에서 생성된 융합 특징 표현은 제안된 프레임워크의 예술적 합성 구성 요소 역할을 하는 SPADE 모듈의 조건부 입력으로 사용됩니다. SPADE 생성기는 256 채널의 잠재 특징 차원을 가진 7개의 SPADE 잔차 블록으로 구성되며, 256 × 256 픽셀 해상도의 출력 이미지를 생성합니다. SegFormer–CAFFM 모듈에서 얻은 시맨틱 세그멘테이션 맵은 SPADE 잔차 레이어 전반에 걸쳐 조건부 입력으로 사용됩니다. SPADE 레이어는 각 잔차 블록 내의 활성화 함수 이전에 적용되어 세그멘테이션 가이드 시맨틱 조건화를 가능하게 합니다. 연속적인 업샘플링 및 컨볼루션 연산을 통해 잠재 특징 표현이 점진적으로 정교해지며, 시맨틱 일관성과 모티프 구조를 유지하면서 고해상도 예술적 패턴을 생성합니다. 생성기 전반에 걸쳐 LeakyReLU 활성화 함수가 사용되며, 출력 레이어에는 Tanh 활성화 함수가 적용되어 정규화된 이미지를 생성합니다.

알고리즘 및 워크플로우
SegCycle-SPADE 프레임워크는 통합 훈련 파이프라인 내에서 시맨틱 세그멘테이션, 특징 융합, 패턴 재구성 및 예술적 스타일 합성을 통합합니다. 워크플로우는 이미지 크기 조정, 정규화, 노이즈 제거 및 세그멘테이션 마스크 준비를 포함한 데이터셋 획득 및 전처리로 시작됩니다. 전처리된 이미지는 이후 SegFormer-B2 세그멘테이션 네트워크를 사용하여 처리되어 시맨틱 모티프 표현을 추출합니다. 결과로 얻은 세그멘테이션 특징은 CAFFM을 통해 재구성 특징과 융합되며, 이를 통해 구조적 모티프 정보와 예술적 특징 표현 간의 상호작용이 가능해집니다. 융합된 특징 맵은 이후 CycleGAN 재구성 모듈로 전달되어, 시맨틱 일관성을 유지하면서 불완전한 문화 모티프 구조를 복원합니다. 재구성된 패턴은 이어서 SPADE 생성기에 제공되어 세그멘테이션 유도 예술적 합성을 수행하며, 이를 통해 모티프 경계와 구조적 정통성을 유지하면서 스타일적 향상을 가능하게 합니다. 훈련 과정에서 모델 파라미터는 수식 21 및 22에 기술된 복합 손실 함수를 사용하여 최적화되며, 이는 세그멘테이션 정확도, 모티프 보존, 재구성 품질 및 예술적 스타일 일관성의 균형을 맞춥니다. 데이터셋 로딩, 전처리, 모델 초기화, 훈련 반복, 검증 절차, 체크포인트 선택 및 최종 평가를 포함한 상세한 단계별 구현 워크플로우는 보충 파일 1 (알고리즘 1)에 제공됩니다. 전체 알고리즘 워크플로우는 배치 크기 16, 학습률 0.0002 및 100회의 훈련 에포크(epoch)로 구현되었습니다. 데이터셋 분할, 모델 초기화 및 모든 훈련 실험에는 42의 고정 랜덤 시드가 사용되었습니다. 재현성을 보장하기 위해 이 시드는 Python, NumPy 및 PyTorch 난수 생성기에 일관되게 적용되었습니다. Adam 옵티마이저의 설정은 β₁ = 0.5, β₂ = 0.999이며 가중치 감쇠는 적용하지 않았습니다 (weight decay = 0). 모델 체크포인트는 검증 데이터셋에서 달성한 가장 높은 검증 IoU 점수를 기준으로 선택되었습니다.

손실 함수 최적화
재구성 및 예술적 합성 과정에서 문화적 모티프 구조를 보존하기 위해, 제안된 프레임워크는 세그멘테이션, 적대적, 사이클 일관성, 재구성, 모티프 보존 및 스타일 일관성 손실을 결합한 복합 최적화 목적 함수를 사용합니다. 전체 수학적 공식, 가중치 계수 및 스타일 손실 정의는 SPADE를 이용한 예술적 스타일 생성 하위 섹션의 식 21 및 22에 제공되어 있습니다. 모티프 보존 구성 요소는 예측된 모티프 영역과 해당 정답(ground-truth) 세그멘테이션 마스크 사이의 구조적 편차에 패널티를 부여함으로써, 재구성 과정 전반에 걸쳐 문화적으로 중요한 패턴 구조가 보존되도록 유도합니다.

결과

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

제안된 SegCycle-SPADE 프레임워크는 먀오(Miao) 바틱 문화 문양 데이터셋과 WikiArt 데이터셋의 두 가지 데이터셋을 사용하여 평가되었습니다. 먀오 바틱 데이터셋은 전통 문화유산 이미지들을 포함하고 있으며 주로 시맨틱 세그멘테이션 및 구조적 재구성 작업에 사용된 반면, WikiArt 데이터셋은 다양한 예술적 스타일을 포함하고 있으며 예술적 스타일 학습 및 생성에 사용되었습니다. 두 데이터셋의 이미지들은 시맨틱 세그멘테이션, CAFFM, 패턴 재구성 및 SPADE 기반의 예술적 스타일 생성을 포함하는 전체 SegCycle-SPADE 파이프라인을 통해 처리되었습니다. 문화적 문양 정보와 예술적 스타일 표현의 통합을 통해 이 프레임워크는 문화적으로 의미 있고 시각적으로 일관된 결과물을 생성할 수 있었습니다.

모든 실험은 Intel Core i7 프로세서와 NVIDIA GPU가 탑재된 GPU 지원 워크스테이션에서 수행되었습니다. 구체적으로, Intel Core i7(11세대) CPU, 24 GB VRAM을 갖춘 NVIDIA RTX 3090 GPU 및 32 GB 시스템 메모리가 장착된 워크스테이션에서 실험이 진행되었습니다. 모델은 Python 3.8 및 CUDA 가속 기능이 포함된 PyTorch 1.10을 사용하여 구현되었습니다. 학습은 분산 학습 없이 단일 GPU 설정으로 수행되었습니다. 모든 실험 전반에 걸쳐 표준 FP32 정밀도가 사용되었으며, 혼합 정밀도 학습은 적용되지 않았습니다. Adam 옵티마이저를 사용하였으며, 배치 크기는 16, 학습 에폭은 100회로 설정하였습니다. 표 3은 본 연구에 사용된 구현 파라미터와 계산 환경을 요약하여 보여줍니다.

제안된 아키텍처는 시맨틱 세그멘테이션을 위한 SegFormer-B2, 특징 융합을 위한 CAFFM, 모티프 재구성을 위한 CycleGAN, 그리고 예술적 스타일 합성을 위한 SPADE의 네 가지 주요 구성 요소로 이루어져 있습니다. 두 데이터셋의 이미지는 학습 전 256 × 256 픽셀로 크기가 조정되었습니다. 이러한 표준화된 해상도는 중요한 모티프 세부 사항을 보존하는 동시에 계산 효율성을 보장하였으며, CycleGAN과 SPADE 모듈 모두의 안정적인 적대적 학습에 기여하였습니다.

제안된 프레임워크의 성능은 Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR 및 FID를 포함한 세그멘테이션 및 이미지 품질 평가 지표를 사용하여 평가되었습니다. 시각적 정통성은 생성된 문화적 패턴의 육안 검사를 통해 정성적으로 평가되었습니다. 정성적 평가는 참조 문화 모티프와 비교하여 모티프의 보존성, 의미론적 일관성, 문화적 특성 및 예술적 외형에 중점을 두었습니다. 시각적 정통성은 독립적인 정량적 평가 지표로 사용되지 않았습니다.

제안된 프레임워크의 정량적 평가는 다음 지표를 사용하여 수행되었습니다.

분할 정확도는 식 23을 사용하여 계산되었습니다:

figure-results-1

여기서 TP, TN, FP 및 FN은 각각 진양성, 진음성, 위양성 및 위음성을 나타냅니다.

IoU는 수식 24를 사용하여 계산되었습니다:

 figure-results-2

Dice 유사도 계수(Dice)는 식 25를 사용하여 계산되었습니다:

figure-results-3

지각적 이미지 유사도를 평가하기 위해 SSIM을 사용하였으며, 이는 다음과 같이 정의된다. 식 2633:

figure-results-4  (26)

여기서 μ는 평균 강도를, σ는 분산을, σxy는 이미지 간의 공분산을 나타내며, C1과 C2는 안정화 상수입니다.

PSNR은 생성된 이미지의 품질을 평가하는 데 흔히 사용되는 지표이며, 식 2733과 같이 정의됩니다:

figure-results-5

여기서 MaxI는 이미지의 최대 가능 픽셀 값을 나타내며, MSE는 원본 이미지와 재구성된 이미지 사이의 평균 제곱 오차를 의미합니다.

FID는 식 2833에서와 같이 평균과 공분산 행렬을 사용하여 계산할 수 있습니다.

figure-results-6   (28)

여기서 μr은 실제 이미지의 평균값, μg은 생성된 이미지의 평균값이며, ΣrΣg는 각각 실제 이미지와 생성된 이미지의 공분산 행렬입니다.

성능 비교를 위해, 제안된 프레임워크를 시맨틱 세그멘테이션, 이미지 재구성 및 예술적 이미지 생성에 일반적으로 사용되는 대표적인 방법들과 비교하여 평가하였습니다. 세그멘테이션 베이스라인으로는 U-Net과 DeepLabV3+가 포함되었으며, 재구성 베이스라인으로는 Pix2Pix와 CycleGAN이 포함되었습니다. 예술적 이미지 생성의 대표적인 방법으로는 StyleGAN과 AttentionGAN이 사용되었습니다. 이러한 비교는 구조적 모티프 정보를 보존하는 동시에 예술적 품질을 향상시키는 SegCycle-SPADE의 효과를 평가하기 위해 수행되었습니다.

성능 안정성과 재현성을 평가하기 위해 각 실험을 5회 반복하였습니다. 모든 실험에서 일관된 학습, 검증 및 테스트 하위 집합을 보장하기 위해 데이터셋 분할 시 42의 고정된 랜덤 시드를 사용하였습니다. 결과는 평균 ± 표준 편차로 표기하였습니다. Accuracy, IoU, Dice, SSIM, PSNR 및 FID에서 관찰된 낮은 표준 편차 값은 제안된 프레임워크가 반복된 실험 실행 전반에 걸쳐 안정적인 성능을 달성했음을 나타냅니다. 통계적 유의성은 대응 표본 t-검정(paired t-tests)을 사용하여 평가하였으며, p < 0.05일 때 차이가 통계적으로 유의미한 것으로 간주하였습니다. 모든 모델이 동일한 데이터셋 분할에서 평가되었으므로 반복 실행 간의 대응 성능 측정값을 얻었으며, 이는 대응 표본 t-검정의 사용을 정당화합니다. 다중 쌍별 비교와 관련된 가족오차율(family-wise error rate)을 제어하기 위해 본페로니 교정(Bonferroni correction)을 적용하였으며, 통계적 유의성은 α/n의 조정된 임계값을 사용하여 결정하였습니다(여기서 n은 쌍별 비교 횟수를 나타냅니다).

실험 결과는 제안된 SegCycle-SPADE 프레임워크의 효과를 강력하게 뒷받침합니다. SegFormer-B2가 달성한 우수한 세그멘테이션 성능은 문화적으로 중요한 모티프 경계를 정확하게 식별하고 보존하는 능력을 입증합니다. IoU 및 Dice 점수의 향상은 처리 파이프라인 전반에서 시맨틱 모티프 구조가 효과적으로 보존되었음을 나타냅니다. CycleGAN과 SPADE의 통합은 개선된 SSIM 및 PSNR 값에서 알 수 있듯이, 세밀한 시각적 세부 사항을 유지하면서 불완전한 모티프 구조를 성공적으로 재구성했습니다. 또한, 더 낮은 FID 점수는 생성된 예술적 패턴이 실제 문화 및 예술 이미지와 더 높은 유사성을 보임을 나타내며, 이는 스타일적 일관성과 시각적 사실성이 향상되었음을 시사합니다.

CAFFM은 세그멘테이션 기반의 구조 정보와 생성적 스타일 표현 간의 효과적인 상호작용을 촉진함으로써 이러한 개선에 크게 기여했습니다. 교차 주의(cross-attention) 기반의 특징 융합을 통해, CAFFM은 문화적 모티프 간의 장거리 관계를 유지하면서 구조적 충실도와 예술적 진정성을 모두 향상시켰습니다.

그림 6은 Miao Batik 및 WikiArt 데이터셋에서 제안된 SegCycle-SPADE 프레임워크와 기존 방법들 간의 세그멘테이션 정확도 비교를 보여줍니다. U-Net 및 DeepLabV3+와 같은 전통적인 세그멘테이션 접근 방식은 공간적 표현을 학습하는 능력 덕분에 경쟁력 있는 성능을 달성했습니다. 반면, Pix2Pix와 CycleGAN은 세그멘테이션 작업에 특화되어 설계되지 않았기 때문에 더 낮은 세그멘테이션 정확도를 보였습니다. 제안된 SegCycle-SPADE 프레임워크는 SegFormer-B2와 CAFFM 기반의 특징 향상 기술의 통합 덕분에 두 데이터셋 모두에서 가장 높은 세그멘테이션 정확도를 달성했습니다.

figure-results-7
그림 6. 서로 다른 방법에 따른 세분화 정확도 비교. Miao Batik 및 WikiArt 데이터셋에 대해 U-Net, DeepLabV3+, Pix2Pix, CycleGAN 및 제안된 SegCycle-SPADE 프레임워크를 사용하여 얻은 세분화 정확도의 비교. 결과는 5회의 독립적인 실행(n = 5)에 대한 평균 ± 표준 편차(SD)로 표시됨. 오차 막대는 1 표준 편차를 나타냄. 값이 높을수록 세분화 성능이 향상되었음을 의미함. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 세분화 정확도를 달성함. 여기를 클릭하여 이 그림의 더 큰 버전을 확인하십시오.

그림 7은 평가된 방법들 간의 IoU 비교를 보여줍니다. U-Net과 DeepLabV3+는 세그멘테이션 중심의 아키텍처 덕분에 강력한 중첩 성능을 달성했습니다. 반면, Pix2Pix와 CycleGAN은 주요 목적이 시맨틱 세그멘테이션보다 이미지 변환에 있기 때문에 더 낮은 IoU 값을 나타냈습니다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 IoU 값을 달성했으며, 이는 문화적 모티프 영역의 국소화 및 보존 능력이 향상되었음을 나타냅니다.

figure-results-8
그림 7. 문화적 모티프 세그멘테이션에 대한 IoU(Intersection over Union) 점수 비교. Miao Batik 및 WikiArt 데이터셋에서 세그멘테이션 방법별 IoU 성능 비교. 결과는 5회의 독립적인 실행(n = 5)에 대한 평균 ± 표준편차(SD)로 나타내었다. 오차 막대는 1표준편차를 나타낸다. IoU 값이 높을수록 예측된 모티프 영역과 참조 모티프 영역 간의 겹침이 개선되었으며 모티프 경계가 더 잘 보존되었음을 의미한다. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 IoU 점수를 기록하였다. 이 그림의 확대 버전을 보시려면 여기를 클릭하십시오.

그림 8은 Dice 유사도 계수(Dice Similarity Coefficient) 비교 결과를 보여줍니다. Dice 계수는 예측된 세그멘테이션 마스크와 정답(ground-truth) 모티프 영역 간의 중첩도를 측정합니다. 기존의 세그멘테이션 방식들은 공간 구조 학습의 효율성 덕분에 비교적 높은 Dice 점수를 기록했습니다. 하지만 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 Dice 점수를 달성하여, 향상된 세그멘테이션 일관성과 모티프 보존 능력을 입증했습니다.

figure-results-9
그림 8. 문화적 모티프 세그멘테이션에 대한 Dice 계수 비교. Miao Batik 및 WikiArt 데이터셋에서 서로 다른 세그멘테이션 접근 방식을 사용하여 얻은 Dice 계수 값의 비교. Dice 계수는 예측된 세그멘테이션 마스크와 참조 마스크 사이의 중첩도를 평가하며, 값이 높을수록 세그멘테이션 성능과 모티프 영역 식별 능력이 향상되었음을 나타낸다. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 Dice 계수 값을 달성하였다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

그림 9는 재구성된 문화 패턴 간의 SSIM 비교를 보여줍니다. Pix2Pix, CycleGAN, StyleGAN과 같은 GAN 기반 방법들은 이미지 생성을 위해 설계되었기 때문에 기존의 세그먼테이션 방법보다 더 높은 SSIM 값을 달성했습니다. 그럼에도 불구하고, 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 SSIM 값을 기록하여, 구조적 세부 사항의 보존과 예술적 일관성 면에서 우수함을 나타냈습니다.figure-results-10

그림 9. 구조적 유사도 지수(SSIM) 비교.Miao Batik 및 WikiArt 데이터셋에 대해 서로 다른 재구성 방법을 사용하여 얻은 구조적 유사도 지수(SSIM) 값의 비교. 결과는 5회의 독립적인 실행(n = 5)에서 얻은 평균 ± 표준 편차(SD)로 나타내었다. 오차 막대는 1 표준 편차를 나타낸다. SSIM 값이 높을수록 재구성된 패턴과 참조 패턴 사이의 구조적 유사성이 더 높음을 의미한다. 제안된 SegCycle-SPADE 프레임워크가 두 데이터셋 모두에서 가장 높은 SSIM 점수를 달성하였다. 이 그림의 확대 버전을 보려면 여기를 클릭하십시오.

생성된 예술적 패턴의 사실성과 분포 유사성을 평가하기 위해 FID를 사용하였습니다. FID 계산은 사전 학습된 Inception-v3 네트워크를 사용하여 수행되었으며, pool3 레이어에서 특징 벡터를 추출하여 2048차원의 특징 표현을 얻었습니다. 특징 추출 전에 생성된 이미지와 참조 이미지를 이선형 보간법을 사용하여 299 × 299 픽셀로 크기를 조정하고, 표준 Inception-v3 전처리 프로토콜에 따라 정규화하였습니다. FID는 독립 테스트 데이터셋에서 추출된 특징 분포를 사용하여 계산되었습니다. 특징 임베딩으로부터 평균 및 공분산 통계량을 추정하여 표준 FID 공식에 적용하였습니다.

표 4에 나타낸 바와 같이, Pix2Pix 및 CycleGAN과 같은 기존의 이미지 생성 방식은 명시적인 구조적 가이드가 부족하여 상대적으로 높은 FID 점수를 기록했습니다. StyleGAN과 AttentionGAN은 향상된 특징 학습 능력을 통해 더 낮은 FID 점수를 달성했습니다. 그러나 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 낮은 FID 점수를 기록하여, 우수한 이미지 실사감, 스타일 일관성 및 문화적 모티프 보존 능력을 입증했습니다.

방법먀오 바틱 데이터셋 (FID)WikiArt 데이터 세트 (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (제안함)28.531.2

표 4: 문화적 패턴 재구성을 위한 Frechet Inception Distance (FID) 결과. 제안된 SegCycle-SPADE 프레임워크와 기본 생성 모델을 사용하여 Miao Batik 및 WikiArt 데이터셋에서 얻은 Frechet Inception Distance (FID) 점수 비교. FID 값이 낮을수록 생성된 이미지와 실제 이미지의 특성 분포 간의 유사성이 더 높음을 나타내며, 따라서 재구성된 문화적 패턴의 시각적 사실성이 향상되었음을 반영합니다.

그림 10은 서로 다른 방법으로 달성한 복원 품질을 비교합니다. 복원 품질(%)은 복원된 이미지와 해당 참조 이미지 사이의 SSIM을 백분율 척도로 변환하여(SSIM × 100) 계산하였습니다. 백분율이 높을수록 원래의 문화적 모티프에 대한 구조적 충실도와 시각적 유사성이 더 높음을 나타냅니다. Pix2Pix 및 CycleGAN과 같은 기존 생성 모델은 보통 수준의 복원 성능을 보였습니다. StyleGAN 및 AttentionGAN을 포함한 더 발전된 아키텍처는 향상된 특징 학습 능력 덕분에 개선된 복원 품질을 달성했습니다. 그러나 제안된 SegCycle-SPADE 프레임워크는 시맨틱 세그멘테이션 가이드, 교차 주의 특징 융합, 복원 학습 및 예술적 합성을 통합함으로써 가장 높은 복원 품질을 달성했습니다.

figure-results-11
그림 10. 패턴 재구성 품질 비교. Miao Batik 및 WikiArt 데이터셋에 대해 Pix2Pix, CycleGAN, StyleGAN, AttentionGAN 및 제안된 SegCycle-SPADE 프레임워크를 사용하여 달성한 재구성 품질의 비교. 결과는 5회의 독립적인 실행(n = 5)에서 얻은 평균 ± 표준 편차(SD)로 표시되었다. 오차 막대는 1 표준 편차를 나타낸다. 값이 높을수록 구조적 세부 사항의 보존, 의미론적 일관성 및 시각적 충실도가 향상되었음을 나타낸다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 재구성 품질 점수를 달성하였다. 이 그림의 더 큰 버전을 보려면 여기를 클릭하십시오.

재구성된 이미지와 대응하는 참조 이미지 간의 픽셀 수준 유사도를 측정하여 재구성 충실도를 평가하기 위해 PSNR을 사용하였습니다. PSNR은 각 재구성된 이미지와 정답 참조(ground-truth reference)로 사용된 해당 원본 묘족 바틱(Miao Batik) 이미지 간에 계산되었습니다. PSNR 값이 높을수록 재구성 오차가 낮음을 나타냅니다. 표 5에 나타난 바와 같이, Pix2Pix와 CycleGAN은 명시적인 구조적 가이드 없이 패턴을 재구성했기 때문에 중간 수준의 PSNR 값을 기록했습니다. StyleGAN과 AttentionGAN은 더 깊은 특징 학습을 통해 더 높은 PSNR 값을 달성했습니다. 제안된 SegCycle-SPADE 프레임워크는 두 데이터셋 모두에서 가장 높은 PSNR 값을 기록하여, 우수한 재구성 충실도와 문화적 모티프 구조의 보존 능력을 입증하였습니다.

방법Miao Batik 데이터셋
(PSNR, dB)
WikiArt 데이터셋
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (제안함)32.431.2

표 5: 문화 패턴 재구성을 위한 최대 신호 대 잡음비(PSNR) 결과. Miao Batik 및 WikiArt 데이터셋에서 제안된 SegCycle-SPADE 프레임워크와 베이스라인 방법들로 얻은 최대 신호 대 잡음비(PSNR) 값의 비교. PSNR 값이 높을수록 해당 참조 이미지에 비해 재구성 충실도가 향상되고 왜곡이 감소했음을 나타냅니다.

그림 11 제안된 SegCycle-SPADE 프레임워크의 학습 중 수렴 동작을 보여줍니다. 손실 곡선은 다섯 번의 독립적인 학습 실행에서 평균낸 평균 학습 손실을 나타냅니다. 확률적 변동성을 줄이고 학습 수렴에 대한 보다 강건한 표현을 제공하기 위해, 각 에포크(epoch)에서의 손실 값을 모든 실행에 대해 평균냈습니다. 학습 초기 에포크 동안에는 모델이 입력 데이터로부터 특징 표현을 학습하는 중이었기 때문에 손실 값이 상대적으로 높았습니다. 학습이 진행됨에 따라 모든 손실 구성 요소가 점진적으로 감소하고 안정화되었으며, 이는 세그멘테이션, 재구성 및 예술적 합성 목표의 성공적인 최적화를 나타냅니다. 관찰된 수렴 동작은 제안된 프레임워크의 학습 과정 중 효과성, 안정성 및 재현성을 입증합니다.

figure-results-12
그림 11. 제안된 SegCycle-SPADE 프레임워크의 학습 수렴도. 5회의 독립적인 학습 실행(n = 5)에 대해 평균을 낸, 100회 학습 에포크 동안의 제안된 SegCycle-SPADE 프레임워크 학습 손실 곡선. 이 그림은 학습 과정 중 전체 손실(LTotal), 세그멘테이션 손실(LSeg), 생성기 손실(LG) 및 판별기 손실(LD)의 변화를 보여준다. 모든 손실 구성 요소가 점진적으로 감소한 후 안정화되는 것은 제안된 프레임워크의 성공적인 수렴과 안정적인 최적화를 나타낸다. 여기를 클릭하여 이 그림의 확대 버전을 확인하십시오.

소거 연구(Ablation Study)
제안된 SegCycle-SPADE 프레임워크 내 각 구성 요소의 기여도를 평가하기 위해, 여러 제어된 모델 설정을 사용하여 소거 연구를 수행하였습니다. 그 결과는 표 6과 7에 요약되어 있습니다.

모델 구성분할 정확도 (%)IoUSSIM
SegFormer 단독87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (제안 방법)93.80.860.93

표 6: SegCycle-SPADE 구성 요소의 절제 연구. 개별 프레임워크 구성 요소의 기여도를 평가하기 위해 점진적으로 강화된 모델 구성의 성능을 비교한 결과입니다. 본 연구에서는 시맨틱 세그멘테이션, 교차 주의 집중 문화적 특징 융합 모듈(CAFFM), CycleGAN 기반 재구성, 그리고 SPADE 기반 예술적 합성이 세그멘테이션 정확도, 교집합-합집합 비율(IoU) 및 구조적 유사도 지수(SSIM)에 미치는 영향을 조사하였습니다. 수치가 높을수록 모티프 세그멘테이션, 재구성 품질 및 구조적 보존 능력이 향상되었음을 나타냅니다.

변형 모델IoU (%)Dice (%)SSIMPSNR (dB)FID ↓
SegFormer Only84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (전체 모델)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

표 7: 제안된 SegCycle-SPADE 프레임워크의 구성 요소 기여도 분석. CAFFM, CycleGAN, SPADE 및 전체 SegCycle-SPADE 아키텍처의 기여도를 평가하기 위해 사용된 개별 프레임워크 변체들의 성능 비교. 결과는 Intersection over Union (IoU), Dice 계수, Structural Similarity Index (SSIM), Peak Signal-to-Noise Ratio (PSNR) 및 Frechet Inception Distance (FID)를 사용하여 보고되었습니다. IoU, Dice, SSIM 및 PSNR 값이 높을수록 세그멘테이션 및 재구성 품질이 향상되었음을 나타내며, FID 값이 낮을수록 생성된 문화적 패턴의 시각적 사실성이 더 높음을 나타냅니다.

표 6은 네 가지 구성으로 주요 프레임워크 구성 요소의 누적 기여도를 평가합니다: (i) SegFormer 단독, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN, 그리고 (iv) SegFormer + CAFFM + CycleGAN + SPADE (제안된 프레임워크). 베이스라인 SegFormer 모델은 87.3%의 세그멘테이션 정확도, 0.76의 IoU 점수, 그리고 0.82의 SSIM 값을 달성했습니다. CAFFM 모듈을 통합함으로써 모든 평가 지표에서 성능이 향상되었으며, 세그멘테이션 정확도는 89.6%, IoU는 0.79, SSIM은 0.86으로 증가했습니다. CycleGAN의 추가는 구조적 재구성 능력을 더욱 강화하여 0.82의 IoU와 0.89의 SSIM 값을 나타냈습니다. 전체 SegCycle-SPADE 프레임워크는 93.8%의 세그멘테이션 정확도, 0.86의 IoU, 그리고 0.93의 SSIM 값으로 최적의 전반적 성능을 달성했습니다. 이러한 결과는 각 구성 요소가 세그멘테이션 정확도, 구조 보존 및 이미지 재구성 품질의 향상에 점진적으로 기여함을 입증합니다.

표 7에서는 다섯 가지 모델 변형을 통해 개별 프레임워크 구성 요소의 기여도를 추가로 조사하였습니다: (i) SegFormer 단독, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM, 그리고 (v) SegFormer, CAFFM, CycleGAN, SPADE 및 motif-preservation loss를 모두 포함하는 전체 모델입니다. 성능 평가는 IoU, Dice coefficient, SSIM, PSNR 및 FID 지표를 사용하여 수행되었습니다.

기본 SegFormer 단독 구성에서는 IoU 84.2%, Dice 계수 88.5%, SSIM 값 0.82, PSNR 24.8 dB, FID 점수 31.8를 달성했습니다. CycleGAN을 추가하여 재구성 품질이 향상되었으며 FID 점수가 27.5로 감소하여 이미지의 사실성이 개선되었음을 나타냈습니다. SPADE를 통합함으로써 구조적 유사성과 이미지 품질이 더욱 향상되어 SSIM 값 0.88과 FID 점수 23.4를 기록했습니다. 제안된 CAFFM 모듈을 포함했을 때 모든 지표에서 상당한 이득이 발생하여 IoU는 90.0%, Dice 계수는 93.1%, SSIM은 0.90, PSNR은 29.6 dB로 증가했으며, FID 점수는 20.3으로 감소했습니다. 모티프 보존 손실(motif-preservation loss)을 추가로 통합한 전체 모델은 IoU 93.0%, Dice 계수 95.4%, SSIM 값 0.92, PSNR 31.2 dB, FID 점수 17.6으로 가장 우수한 전반적 성능을 달성했습니다.

표 8은 문화유산 패턴 복원 및 보존에 사용되는 대표적인 딥러닝(DL) 접근 방식의 비교 개요를 보여줍니다. 기존의 CNN 기반 방법은 효과적인 지역 특징 학습 및 세그멘테이션 성능을 제공하지만, 장거리 의존성 모델링 능력이 제한적이기 때문에 복잡한 모티프 구조를 보존하는 데 어려움을 겪는 경우가 많습니다. GAN 기반 접근 방식은 이미지 합성 및 스타일 전이 능력을 향상시키지만, 의미론적 불일치나 미세한 구조적 세부 사항의 손실이 발생할 수 있습니다. Transformer 기반 방법은 전역적 문맥 이해도를 높이지만 일반적으로 생성적 복원 능력이 부족하며, diffusion 기반 방법은 계산 복잡성이 증가하는 대신 높은 시각적 사실성을 제공합니다. 하이브리드 Transformer-GAN 접근 방식은 특징 추출과 이미지 생성 메커니즘을 결합하여 이러한 제한 사항을 부분적으로 해결합니다. 이와 대조적으로, 제안된 SegCycle-SPADE 프레임워크는 Transformer 기반 세그멘테이션, 교차 주의집중(cross-attention) 특징 융합, 생성적 복원 및 세그멘테이션 유도 예술적 합성을 통합 아키텍처 내에 결합함으로써 구조적 충실도, 의미론적 일관성 및 문화적 모티프 보존 능력을 향상시켰습니다. 비교 내용은 표 8에 요약되어 있습니다.

접근 방법핵심 방법론강점한계점문화유산과의 관련성
CNN 기반 방법(예: U-Net, DeepLabV3+)합성곱 특징 추출 및 시맨틱 세그멘테이션효과적인 지역 특징 학습 및 정확한 세분화제한적인 장거리 의존성 모델링, 복잡한 모티프 구조 유지의 어려움모티프 분할에는 적합하나 예술적 재구성에는 덜 효과적임
GAN 기반 방법 (예: Pix2Pix, CycleGAN)적대적 이미지 생성 및 이미지 간 변환고품질 이미지 합성 및 스타일 전이훈련 불안정성; 의미론적 불일치; 미세 구조 세부 사항의 잠재적 손실패턴 복원에는 유용하나 문화적 모티프를 정확하게 보존하지 못할 수 있음
트랜스포머 기반 방법론셀프 어텐션 및 글로벌 컨텍스트 모델링장거리 의존성과 복잡한 시각적 관계를 포착함높은 계산 비용; 대규모 훈련 데이터 세트 필요복잡한 패턴 분석에는 효과적이나, 단독으로 사용할 경우 생성 능력이 제한적임
확산 기반 방법반복적 잡음 제거 기반 이미지 생성높은 시각적 사실성과 이미지 다양성느린 추론 속도; 높은 계산 요구량; 제한적인 구조적 제어유산 이미지 생성에 유망하나 계산 집약적임
하이브리드 트랜스포머-GAN 방법론트랜스포머 기반 특징 추출과 GAN 기반 생성의 결합개선된 전역 특징 표현 및 이미지 품질모티프 보존을 위한 명시적인 의미론적 가이드가 부족한 경우가 많음생성 품질을 향상시키지만 문화유산 모티프를 위해 특별히 설계된 것은 아님
제안된 SegCycle-SPADESegFormer + CAFFM + CycleGAN + SPADE트랜스포머 기반 세그멘테이션, 어텐션 유도 특징 융합, 시맨틱 일관성, 모티프 보존 및 제어 가능한 예술적 재구성단독 CNN 기반 방식보다 더 높은 계산 복잡도구조적 충실도와 의미론적 일관성이 향상된 문화유산 패턴의 복원 및 보존을 위해 특별히 설계됨

표 8: 문화유산 패턴 복원 및 보존을 위한 대표적인 딥러닝 접근 방식 비교. 이미지 분할, 패턴 복원, 스타일 생성 및 문화유산 보존에 사용되는 대표적인 딥러닝 접근 방식의 정성적 비교. 본 표는 각 접근 방식의 핵심 방법론, 장점, 한계점 및 적용 가능성을 요약하며, 제안된 SegCycle-SPADE 프레임워크가 시맨틱 분할, 특징 융합, 복원 및 스타일 합성을 어떻게 결합하여 문화유산 패턴의 구조적 보존과 시맨틱 일관성 관련 문제를 해결하는지 강조한다.

관찰된 개선 사항은 CAFFM 모듈이 교차 주의 기반 특성 융합을 통해 세그멘테이션 유도 구조적 특성과 예술적 스타일 표현 간의 상호작용을 효과적으로 강화함을 입증합니다. 또한, 모티프 보존 손실은 재구성 및 예술적 합성 과정에서 문화적으로 중요한 모티프 구조를 유지하는 데 기여하여 세그멘테이션 일관성, 구조적 충실도 및 시각적 사실성을 향상시킵니다. 종합적으로, 어블레이션 결과는 SegFormer-B2, CAFFM, CycleGAN, SPADE 및 모티프 보존 손실의 통합이 제안된 SegCycle-SPADE 프레임워크의 우수한 성능을 가능하게 함을 확인시켜 줍니다.

데이터 가용성:
예술적 스타일 학습에 사용된 WikiArt 데이터셋은 Kaggle WikiArt 저장소(https://www.kaggle.com/datasets/steubk/wikiart)를 통해 공개적으로 이용 가능합니다. 본 연구에 사용된 묘족 바틱(Miao Batik) 데이터셋은 Zenodo(https://doi.org/10.5281/zenodo.20807658)를 통해 공개적으로 이용 가능합니다. 제안된 SegCycle-SPADE 프레임워크와 관련된 전처리된 데이터셋, 세그멘테이션 마스크, 사전 학습된 모델 가중치, 생성된 출력물 및 Python 구현 파일 또한 동일한 Zenodo 저장소를 통해 이용할 수 있습니다.

보충 파일:
보충 파일 1. 알고리즘 1: 제안된 SegCycle-SPADE 프레임워크의 구현 워크플로우. 데이터셋 로딩, 전처리, SegFormer-B2를 이용한 시맨틱 분할, Cross-Attention Cultural Feature Fusion Module (CAFFM)을 이용한 특징 융합, CycleGAN을 이용한 문화적 모티프 재구성, SPADE를 이용한 예술적 스타일 합성, 모델 학습, 검증, 체크포인트 선택 및 최종 성능 평가를 포함하여 제안된 SegCycle-SPADE 프레임워크의 전체 구현 파이프라인을 설명하는 단계별 의사코드입니다. 이 파일을 다운로드하려면 여기를 클릭하십시오.

토론

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

전통 공예의 점진적인 소실로 인해 최근 무형문화유산(ICH) 패턴의 보존 및 디지털 복원이 점점 더 많은 관심을 받고 있습니다. 이전 연구들은 딥러닝(DL) 기반의 이미지 처리 기술을 통해 문화유산의 손실 문제를 해결하려 시도해 왔습니다. 예를 들어, Quan 등32은 구이저우 묘족 바틱 문화를 위해 지식 그래프와 DL 기반의 문화유산 보존 프레임워크를 제안했습니다. 해당 연구는 문화 패턴의 디지털 복원에 중점을 두었으나, 그 방법론은 주로 지식 그래프 표현에 의존했습니다. 마찬가지로 Fu와 Razmjooy16는 문화유산 이미지의 강화 및 복원을 위해 피라미드 특징 네트워크(FPN) 기반의 프레임워크를 제안했습니다. 이 방법은 이미지 강화를 위한 효과적인 특징 추출을 제공했지만, 불완전한 문화 패턴에 대한 이미지 세그멘테이션 가이드나 생성적 복원 메커니즘을 포함하지 않았습니다. 이와 대조적으로, 제안된 SegCycle-SPADE 프레임워크는 이러한 한계를 극복하기 위해 여러 DL 구성 요소를 결합합니다. 먼저, SegFormer 모델을 이용한 시맨틱 세그멘테이션을 통해 문화유산 패턴 내 모티프 영역을 정확하게 식별합니다. 이어서 CAFFM 기반의 특징 강화 모듈이 세밀한 모티프 구조에 대한 특징 표현을 개선합니다. 그런 다음 CycleGAN 복원 모듈을 사용하여 적대적 학습을 통해 문화 패턴 내의 누락되었거나 불완전한 영역을 복원합니다. 마지막으로 SPADE 모듈이 세그멘테이션 맵과의 구조적 정렬을 유지하면서 스타일 강화를 수행합니다. 기존의 CNN-, GAN-, 트랜스포머- 및 확산 기반 방법들17,19,20,21,22,23,24,25,30,34은 각각 고유한 장점을 제공하지만, Table 8에 요약된 바와 같이 시맨틱 일관성 보존, 구조적 특징 유지 또는 계산 효율성 달성 측면에서 한계를 보입니다. 제안된 SegCycle-SPADE 아키텍처는 SegFormer 기반 세그멘테이션, 교차 주의 집중 특징 융합, CycleGAN 복원 및 SPADE 가이드 합성의 장점을 결합하여 이러한 한계를 해결합니다. 결과적으로, 이 프레임워크는 향상된 복원 품질과 문화적으로 중요한 모티프의 강화된 보존을 달성합니다.

고무적인 성능에도 불구하고, 제안된 SegCycle-SPADE 프레임워크에는 여전히 몇 가지 한계점이 있습니다. 첫째, 평가가 Miao Batik 및 WikiArt 데이터셋만을 사용하여 수행되었으므로, 다른 문화유산 도메인에 대한 프레임워크의 일반화 가능성이 제한될 수 있습니다. 둘째, SegFormer, CAFFM, CycleGAN 및 SPADE의 통합으로 인해 계산 복잡성과 메모리 요구 사항이 증가하여 리소스가 제한된 플랫폼에서의 배포가 어려울 수 있습니다. 셋째, 세분화 성능은 문양 어노테이션의 품질과 일관성에 크게 의존하며, 어노테이션 편향이 문화적으로 중요한 구조의 보존에 영향을 미칠 수 있습니다. 마지막으로, 프레임워크가 두 개의 데이터셋만을 사용하여 평가되었기 때문에, 다양한 문화유산 컬렉션 전반에 걸친 적용 가능성을 보장하기 위해서는 추가적인 훈련 데이터와 도메인별 최적화가 필요할 수 있습니다. 따라서 향후 연구에서는 더 강력한 훈련 전략, 경량 아키텍처, 개선된 어노테이션 절차 및 추가적인 문화유산 데이터셋을 이용한 교차 도메인 평가를 탐색해야 합니다.

더욱 방대하고 다양한 문화유산 데이터셋에 대한 SegCycle-SPADE 프레임워크의 확장 가능성이 향후 연구의 주요 초점이 될 것입니다. 모델의 일반화 능력과 문화적 적응성을 향상시키기 위해 서로 다른 지역과 예술적 전통을 가진 문화유산 모티프에 대한 교차 문화적 평가가 조사될 것입니다. 또한, 텍스트 설명, 역사적 기록 및 문화적 메타데이터를 통합한 멀티모달 확장은 재구성 과정에서 더 강력한 의미론적 가이드를 제공할 수 있습니다. 본 프레임워크는 이미지 기반 재구성을 3D 모델링 기술과 통합함으로써 3차원 문화유산 재구성을 지원하도록 확장될 수 있습니다. 아울러, AI 기반 문화유산 보존 및 기록의 실질적인 응용을 촉진하기 위해 디지털 아카이브, 박물관, 가상 전시 및 문화유산 보존 플랫폼으로의 배포가 모색될 것입니다. 해석 가능성과 문화적 진정성을 더욱 높이기 위해, 향후 연구에서는 문화적 지식 그래프, 민족지학적 기록, 역사적 메타데이터 및 전문가가 큐레이팅한 지식 베이스의 통합을 조사하여 문화적 맥락을 반영한 모티프 분석 및 재구성을 가능하게 할 것입니다32.

제안된 SegCycle-SPADE 프레임워크를 구현할 때 몇 가지 실질적인 고려 사항을 염두에 두어야 합니다. CycleGAN 학습 과정에서 생성자와 판별자의 손실 값이 심하게 불균형해지면 불안정한 적대적 수렴이 발생할 수 있습니다. 이러한 상황에서는 학습률을 낮추거나, 사이클 일관성 손실(cycle-consistency loss) 가중치를 높이거나, 판별자의 지배력을 모니터링함으로써 학습 안정성을 개선할 수 있습니다. 생성자가 시각적으로 유사한 출력을 반복적으로 생성하는 모드 붕괴(mode collapse)가 발생할 수 있으며, 이는 균형 잡힌 적대적 학습, 리플레이 버퍼(replay-buffer) 활용 및 생성자와 판별자의 손실 추세를 세밀하게 모니터링함으로써 완화할 수 있습니다. 또한 문화적 모티프가 복잡한 질감, 낮은 대비 또는 모호한 경계를 나타낼 때 세그멘테이션 실패가 발생할 수 있습니다. 이 문제를 해결하기 위해 학습 전 이미지 품질을 확인해야 하며, 어노테이션의 일관성을 보장하기 위해 세그멘테이션 마스크를 시각적으로 검수해야 합니다. 신뢰할 수 있는 SegFormer 성능을 달성하기 위해서는 권장되는 입력 해상도와 정규화 설정을 유지하는 것도 중요합니다. 학습 불안정성은 부적절한 학습률 설정, 불충분한 학습 데이터 또는 하드웨어 관련 수치 변동으로 인해 추가적으로 발생할 수 있습니다. 재현성을 높이기 위해 NumPy, PyTorch, CUDA 및 데이터셋 셔플링 작업에 고정된 랜덤 시드(random seed)를 사용해야 합니다. 또한 모든 실험 실행 전반에 걸쳐 동일한 전처리 파이프라인, 데이터셋 분할, 모델 하이퍼파라미터 및 소프트웨어 환경을 유지해야 합니다. 성능 저하를 방지하고 중단된 학습 세션으로부터의 복구를 용이하게 하기 위해 주기적인 체크포인트 저장과 검증 손실(validation-loss) 모니터링을 권장합니다.

본 연구는 AI 기반 문화유산 복원 프레임워크의 이론적 발전에 기여합니다. 기존의 이미지 복원 방식은 일반적으로 이미지 세그멘테이션, 복원 및 스타일 생성을 독립적인 프로세스로 처리합니다17,19,20,30. 이와 대조적으로, 본 연구는 세그멘테이션 유도 생성적 복원 전략을 통해 이러한 프로세스들을 통합하는 프레임워크를 제안합니다. 결과적으로, 본 연구는 세그멘테이션, 복원 및 스타일 생성이 어떻게 단일 프레임워크 내에서 통합될 수 있는지를 입증함으로써 AI 보조 문화유산 복원의 이론적 발전에 기여합니다. 이러한 통합은 문양 구조와 의미론적 의미를 보존하는 것이 매우 중요한 문화유산 응용 분야에서 특히 중요합니다. 실용적인 관점에서 제안된 프레임워크는 전통 문화 문양의 디지털 보존, 복원 및 예술적 향상을 위한 효과적인 솔루션을 제공합니다. 문화유산 기관, 박물관 및 디자이너는 SegCycle-SPADE를 활용하여 문양 영역을 자동으로 식별하고, 손상되었거나 불완전한 문양을 복원하며, 전통 디자인의 시각적으로 향상된 예술적 표현물을 생성할 수 있습니다. 이러한 기능은 역사적 유물이 부분적으로 손상되었거나 불완전할 수 있는 묘족 바틱 섬유 문양과 같은 멸종 위기의 공예 전통에 특히 가치가 있습니다. 나아가, 생성적 스타일 합성의 결합을 통해 본 프레임워크는 섬유 디자인, 디지털 예술 창작 및 유산 교육과 같은 현대적 문화 디자인 응용 분야를 지원할 수 있습니다. 이러한 방식으로 제안된 프레임워크는 문화유산 보존과 현대적 문화 디자인 응용 사이의 간극을 메웁니다.

그럼에도 불구하고, 제안된 SegCycle-SPADE 프레임워크가 거둔 유망한 결과에도 불구하고 몇 가지 한계점이 남아 있습니다. 첫째, 평가는 Miao Batik 및 WikiArt 데이터셋만을 사용하여 수행되었으며, 이는 다른 형태의 문화유산 패턴을 재구성하는 프레임워크의 일반화 능력에 영향을 미칠 수 있습니다. 둘째, 재구성 과정이 GAN 기반 모델에 의존하기 때문에, 매우 복잡한 모티프 구조를 다룰 때 생성된 결과물에 때때로 아티팩트나 부자연스러운 질감이 포함될 수 있습니다. 셋째, 현재 프레임워크는 2차원 패턴의 재구성에 집중하고 있으나, 일부 문화유산 유물은 본질적으로 3차원 구조를 포함하고 있습니다. 전반적으로, 실험 결과는 무형문화유산(ICH) 패턴의 예술적 재구성을 위한 제안된 SegCycle-SPADE 프레임워크의 효과를 입증합니다. SegFormer 기반의 시맨틱 세그멘테이션, CAFFM, CycleGAN 기반의 모티프 재구성 및 SPADE 기반의 예술적 합성의 통합은 세그멘테이션, 재구성 및 이미지 품질 성능 지표를 일관되게 향상시켰습니다. 어블레이션 연구를 통해 각 프레임워크 구성 요소의 기여도가 추가로 검증되었으며, CAFFM과 모티프 보존 손실이 구조적 충실도와 시각적 진정성을 상당히 높였음을 보여주었습니다. 이러한 발견은 시맨틱 세그멘테이션 가이드 재구성과 교차 주의 특징 융합의 결합이 예술적으로 풍부한 결과물을 생성하는 동시에 문화적으로 중요한 모티프를 효과적으로 보존할 수 있다는 핵심 가설을 뒷받침합니다. 따라서 제안된 프레임워크는 무형문화유산 패턴의 디지털 보존, 복원 및 창조적 활성화를 위한 신뢰할 수 있고 재현 가능한 계산적 접근 방식을 제공합니다.

공개 사항

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

이해상충:
저자들은 경쟁 관계에 있는 이해관계가 없음을 밝힙니다.

감사의 글

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

저자들은 본 연구를 수행하는 동안 광동공정폴리테크닉(Guangdong Engineering Polytechnic)과 화남사범대학교(South China Normal University)에서 제공한 학술적 및 제도적 지원에 감사를 표합니다. 본 연구는 “디지털 재생 박물관: 중국 고전 서화 문화유산의 활성화 및 소통에 관한 연구”라는 제목의 2023년 국가사회과학기금 일반 프로젝트(No. 23BH161)의 지원을 받았습니다.

재료

이 논문에 사용된 재료 목록
이름회사카탈로그 번호댓글
Adam OptimizerPyTorch Optimizer 라이브러리Adam모델 학습 중에 사용되는 최적화 알고리즘.
CUDA ToolkitNVIDIA CorporationCUDA 11.3딥러닝 연산을 위한 GPU 가속.
cuDNNNVIDIA CorporationcuDNN 8.2학습 및 추론 속도를 높이는 데 사용되는 딥 뉴럴 네트워크 가속 라이브러리.
CycleGANUniversity of California, Berkeley / 오픈 소스공식 PyTorch 구현체 (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)문화적 모티프 복원에 사용되는 생성적 적대 신경망.
ImageNet 사전 학습 가중치ImageNet / 오픈 소스mit_b2.pth (ImageNet-1K 사전 학습 체크포인트)Miao Batik 데이터셋으로 미세 조정하기 전 SegFormer-B2 백본을 초기화하는 데 사용됨.
Intel 프로세서Intel CorporationIntel Core i7 (11세대)이미지 전처리, 모델 학습 지원 및 추론에 사용되는 CPU.
MatplotlibMatplotlib 개발 팀Matplotlib 3.5.1학습 곡선 및 평가 결과의 시각화.
Miao Batik 데이터셋Zenodo 리포지토리DOI: 10.5281/zenodo.20807658시맨틱 세그멘테이션 및 패턴 복원에 사용되는 15,148장의 이미지가 포함된 문화적 모티프 데이터셋.
NumPyNumPy 개발자NumPy 1.21.5수치 연산 및 데이터셋 처리.
NVIDIA GPUNVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)모델 학습 및 추론에 사용되는 하드웨어 플랫폼.
OpenCVOpenCV FoundationOpenCV 4.5.5이미지 전처리, 크기 조정, 보간 및 가우시안 노이즈 제거.
운영 체제Canonical Ltd.Ubuntu 20.04 LTS실험 실행 환경.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0이미지 로딩 및 조작.
PythonPython Software FoundationPython 3.8.10구현 및 실험에 사용된 프로그래밍 언어.
PyTorchMeta AIPyTorch 1.10.0모델 학습 및 추론에 사용되는 딥러닝 프레임워크.
랜덤 시드실험 설정42데이터셋 분할, 모델 초기화 및 실험 재현성을 위해 사용된 고정 시드.
Scikit-learnScikit-learn 개발자Scikit-learn 1.0.2데이터셋 분할, 통계 분석 및 평가 지표.
Seaborn오픈 소스 커뮤니티Seaborn 0.11.2통계 데이터 시각화.
SegFormer-B2NVIDIA Research / 오픈 소스SegFormer-B2 (MIT-B2 백본)문화적 모티프 세그멘테이션에 사용되는 Transformer 기반 시맨틱 세그멘테이션 모델.
세그멘테이션 마스크 / 어노테이션Miao Batik 데이터셋데이터셋에 포함됨모티프 분류 및 학습에 사용되는 픽셀 수준의 시맨틱 세그멘테이션 레이블.
SPADENVIDIA Research / 오픈 소스공식 PyTorch 구현체 (https://github.com/NVlabs/SPADE)예술적 패턴 생성에 사용되는 세그멘테이션 가이드 이미지 합성 모델.
TorchVisionMeta AITorchVision 0.11.1PyTorch와 함께 사용되는 이미지 처리 유틸리티 및 데이터셋 변환.
WikiArt 데이터셋WikiArthttps://www.wikiart.org/스타일 학습 및 합성에 사용되는, 27가지 예술 스타일에 걸쳐 80,000점 이상의 예술 작품이 포함된 예술 스타일 데이터셋.

참고문헌

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

재인쇄 및 허가

이 JoVE 논문의 텍스트 또는 그림 재사용 허가 요청

허가 요청

태그

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

관련 논문