本プロトコルでは、デジタル保存および創造的な文化遺産の活用を目的とした、非物質文化遺産のパターンのセマンティックセグメンテーション、再構成、および芸術的スタイル合成のためのディープラーニングワークフローについて解説します。ここでは、トランスフォーマーベースの特徴抽出、敵対的再構成、および空間適応的な画像生成を用いています。
研究記事
本プロトコルでは、デジタル保存および創造的な文化遺産の活用を目的とした、非物質文化遺産のパターンのセマンティックセグメンテーション、再構成、および芸術的スタイル合成のためのディープラーニングワークフローについて解説します。ここでは、トランスフォーマーベースの特徴抽出、敵対的再構成、および空間適応的な画像生成を用いています。
深層学習ベースの画像合成技術の進展に伴い、無形文化遺産(ICH)パターンのデジタル保存と再構築がますます注目を集めています。既存のSegCycle-SPADEベースのアプローチは、伝統工芸パターンの構造的なセグメンテーションと芸術的な再構築において可能性を示してきましたが、データセットの多様性の不足、文化的意味論の組み込み不十分、および再構築時における構造的なパターン特徴の保持不足などの制限が残っています。これらの課題を解決するため、本研究ではICHパターン種類のセグメンテーションおよび芸術的再構築に向けた、改良版SegCycle-SPADEフレームワークを提案します。モチーフの境界とパターン領域を正確に特定するために、TransformerベースのセグメンテーションモデルであるSegFormerを採用しています。さらに、文化的に重要なモチーフを強調し、特徴表現を向上させるために、Cross-Attention Cultural Feature Fusion Moduleを導入しました。パターンの変換と再構築にはCycleGANを用い、セグメンテーションマップと生成画像間の意味的一貫性を維持するための芸術的スタイル合成にはSpatially-Adaptive Denormalization(SPADE)を使用しています。モデルの汎用性と芸術的多様性を高めるため、本フレームワークは苗族 Batikの文化的モチーフデータセットとWikiArtデータセットの両方を用いて学習されています。実験結果から、提案されたアテンション誘導型SegCycle-SPADEフレームワークは、既存の生成敵対的ネットワーク(GAN)ベースの再構築手法と比較して、セグメンテーション精度と文化遺産パターンの再構築性能を向上させることが実証されました。提案されたフレームワークは、人工知能を用いた文化遺産の記録、再構築、および伝統的なパターンデザインの芸術的再生のための拡張可能なソリューションを提供します。
慣習、言語、信仰などの無形要素と、芸術作品、建築物、文献記録などの有形要素の両方を含む文化遺産は、人類の歴史、創造性、およびアイデンティティの根源的な現れです1。遺産の保存は、コミュニティが自らの起源と再びつながることを可能にし、将来の世代が集団的な文化的記憶から恩恵を受けられるようにすることを目的としています。また、文化間の相互理解や多様な伝統と慣習への賞賛、そして異なる歴史的ナラティブの認識を促進します。これらの文化資産は、前世代の価値観、視点、経験を理解する助けとなり、現代の社会的アイデンティティの形成と文化的な連続性に寄与します。文化遺産保存の基本原則を図1に示します。

図 1. SegCycle-SPADEフレームワークを用いた文化遺産パターンの再構築に関する概念的概要。無形文化遺産のパターンの再構築および強化のために提案されたアプローチの概略図。ワークフローには、Miao BatikおよびWikiArtデータセットからのデータセット収集、画像の前処理、SegFormer-B2を用いたセマンティックセグメンテーション、Cross-Attention Cultural Feature Fusion Module (CAFFM)を用いた特徴融合、CycleGANを用いたパターンの再構築、SPADEを用いた芸術的スタイルの合成、およびセグメンテーションと再構築の指標を用いた最終評価が含まれる。矢印は、フレームワーク全体におけるデータおよび特徴表現の流れを示す。こちらのリンクをクリックして、この図の拡大版を表示してください。
人間社会の集団的記憶と文化的遺産は、芸術的表現や文化的アイデンティティの重要な媒体となる無形文化遺産(ICH)に具体化されています。しかし、ICHはグローバル化とデジタル化の影響により、重大な課題に直面しています2,3,4。熟練した職人の減少や現代市場への適応力の不足により、消滅の危機に瀕している多くのICHの実践には、保存と発展のための新たなアプローチが必要です5,6。ICH研究の重要な領域であるサステナブルデザインは、文化、社会、および環境の統合的な発展を重視しており、ICHを継続的に保存するための実践的な道筋を提供します。サステナブルデザインのアプローチを通じて、現代社会のニーズに適応させながら、ICHを活性化させることが可能です7,8。
本研究において、「無形文化遺産のパターン」という用語は、根底にある無形の文化的価値を伝え、保存する視覚的なモチーフ表現を指します。したがって、提案されたフレームワークは、これらのモチーフの視覚的な形態を再構築しつつ、それに関連する文化情報を保存し記録することを目的としています。
苗族の刺繍とバティック(ろうけつ染め)は、中国の重要な無形文化遺産(ICH)であり、鳥や蝶、祖先のトーテムなどの象徴的なモチーフを通じて、苗族コミュニティの歴史、信仰、伝統を反映しています9。これらのモチーフは儀礼衣装や祭事の慣習に深く組み込まれており、地域の文化および経済発展に寄与しています10,11。デジタル技術、特に人工知能(AI)とディープラーニング(DL)の進歩は、文化遺産の保存、分析、再構築、および記録に新たな機会をもたらしました。中国で最も保存状態の良いバティック伝統の一つである貴州苗族バティックは、苗族の文化的知識、信仰、習俗、そして儀式を伝承するための重要な媒体となっています12,13,14,15,16。
近年の研究により、文化遺産の保存およびパターンの再構成におけるディープラーニング(DL)の有用性が実証されており、U-NetやDeepLabV3+と比較して、セグメンテーション精度(ピクセル精度 = 88.6%、平均IoU [mean intersection over union] = 78.1%)および再構成性能の向上が達成されています。しかし、依然としていくつかの課題が残っています。既存の生成的敵対ネットワーク(GAN)ベースの手法では、複雑なパターンの微細な構造的詳細を保持することが困難な場合が多くあります。17一方で、データセットの多様性が限られているため、文化的な領域にわたるモデルの汎用性が制限されている。18さらに、CycleGANなどの画像間変換モデルでは、セグメンテーションマップと生成画像との間の意味論的一貫性を維持できない場合があります。19、また、アテンションメカニズムが欠如していることで、再構成時に文化的に重要なモチーフの詳細が失われる可能性があります。20したがって、効果的なICHパターンの再構築には、トランスフォーマーベースのセグメンテーション、アテンション誘導型特徴学習、およびマルチデータセット学習を統合した高度なフレームワークが必要である。
苗族刺繍のデジタル化と生成AIの急速な進展により、文化遺産保護の新たな可能性が開かれています。新興の深層生成モデルの一種である拡散モデルは、その強力なコンテンツ生成能力により、コンピュータビジョンタスクにおいて顕著な性能を示しています21,22,23,24,25。逆拡散過程において、モデルはノイズを含む表現から元の入力データを段階的に再構築することを学習します26,27,28。また、先行研究では、文化遺産の保存および普及を目的とした3次元再構成やコンピュータ支援設計(CAD)技術の応用についても検討されています。
畳み込みニューラルネットワーク(CNN)やGANは、画像生成や特徴保持において優れた性能を示しますが、受容野の制限、モード崩壊、および学習の不安定性に関連する課題が依然として存在します29。SegFormerやSegmenterなどのTransformerベースのアーキテクチャは、グローバルなコンテキストや意味的関係の把握に長けていますが、計算負荷が高く、微細な詳細の再現に苦慮する場合があります。Stable Diffusionなどの拡散モデルは強力な画像生成能力を示しますが、生成されるデザインの構造的および芸術的な特性を精密に制御できないことが多くあります。さらに、既存のアプローチの多くは独立した学習戦略を採用しているため、セグメンテーション成分と生成成分の間で効果的な情報共有や協調的な最適化が制限されており、結果として構造的な正確性と芸術的な真正性の間にトレードオフが生じています30。
潜在拡散モデルやStable Diffusionなどの最近の拡散ベースモデルは、高品質な画像合成を実現していますが、反復的なデノイジングが必要であり、計算コストと推論時間の増大を招いています。さらに、専門的な条件付けメカニズム 없いでは、微細な文化的モチーフの保持と構造的な一貫性の維持が依然として困難です。Transformerベースの生成モデルは、グローバルな文脈関係を効果的に捉えることができますが、多くの場合、大規模なデータセットと膨大な計算リソースを必要とします。対照的に、提案するSegCycle-Spatially Adaptive Denormalization(SegCycle-SPADE)フレームワークは、SegFormerベースのセグメンテーション、クロスアテンション特徴融合、CycleGAN再構成、およびSPADE誘導合成を組み合わせることで、明示的な構造的ガイダンスを提供し、それによって文化的遺産パターンのモチーフ保持、意味的一貫性、および制御可能な再構成を向上させます。
最新のセマンティックセグメンテーション技術の多くは、U字型アーキテクチャを持つ完全畳み込みニューラルネットワーク(FCNN)に依存しています31。エンコード段階では、一連の畳み込みおよびダウンサンプリング操作を通じて、大きな受容野を持つディープフィーチャーが抽出されます。デコード段階では、アップサンプリングによって空間解像度が段階的に復元され、最終的にピクセルレベルのセマンティック予測が可能になります。スキップ接続により、異なるエンコーダーレベルからの高解像度情報をデコーダーに直接統合することができ、ダウンサンプリング中の空間情報の損失を補い、幅広いアプリケーションにおけるセグメンテーション性能を向上させることができます32。
近年のGANベース、CNNベース、および拡散ベースの手法は、画像生成や文化遺産の復元において有望な結果を示していますが、意味的な一貫性の維持、微細な構造的モチーフの保存、および多様な文化的パターンにわたる再現可能な復元の確保に苦慮することがよくあります。既存のアプローチの多くは、セグメンテーション、復元、およびスタイル合成を個別のプロセスとして扱っており、その結果、文化的に重要な要素の喪失や出力の一貫性の欠如を招く可能性があります。この手法的なギャップを解消するため、本研究では、SegFormerベースの意味的セグメンテーション、新規のCross-Attention Cultural Feature Fusion Module(CAFFM)、CycleGANベースの復元、およびSPADEガイド付きスタイル合成を統合した、統一的なSegCycle-SPADEフレームワークを提案します。構造的セグメンテーション情報と生成的な特徴学習を明示的に統合することで、提案するフレームワークは、文化的な真正性と芸術的な質の双方を維持しながら、より信頼性が高く、意味的に一貫し、再現可能な無形文化遺産(ICH)モチーフの復元を可能にします。
本研究では、現在の文化遺産の復元手法における3つの大きな限界を明らかにしました。(i) GANベースの復元手法における微細な構造モチーフの保存不足、(ii) 小規模またはドメイン固有のデータセットで学習することによる汎用性の制限、そして(iii) image-to-image変換フレームワークにおけるセグメンテーション出力と生成画像間の不十分な意味論的一貫性です。さらに、セグメンテーション、復元、およびスタイル合成は通常、個別のプロセスとして扱われており、復元過程で文化的に重要な要素が失われる原因となっています。提案するSegCycle-SPADEフレームワークは、transformerベースの意味論的セグメンテーション、クロスアテンション特徴融合、CycleGAN復元、およびSPADEガイド付きの芸術的合成を単一のアーキテクチャ内で統合することで、これらの限界を解消し、無形文化遺産(ICH)パターンの復元におけるモチーフの保存性、意味論的一貫性、および芸術的な真正性を向上させます。
本研究の主な目的は、無形文化遺産(ICH)パターンの意味論的分割ガイド付き芸術的再構成のための、強化されたSegCycle-SPADEフレームワークを開発することである。このフレームワークは、文化的なモチーフを正確に分割するためのSegFormer、パターンの再構成のためのCycleGAN、およびスタイルの一貫性を保った芸術的合成のためのSPADEを統合している。特徴表現を改善し、微細な構造的詳細を保持するために、分割特徴と生成特徴の間の効果的な相互作用を促進するCAFFMを導入した。Miao BatikおよびWikiArtデータセットで学習させた結果、提案したフレームワークは、再構成の真正性、スタイルの一貫性、および文化的に重要なモチーフの保存性を向上させた。
本研究では、セマンティックセグメンテーション、アテンション誘導型特徴融合、パターン再構成、およびスタイル合成を統一されたアーキテクチャ内で組み合わせることで、無形文化遺産(ICH)パターンの芸術的な再構成のための新しいSegCycle-SPADEフレームワークを提案します。本研究の主な貢献は以下の通りです。第一に、SegFormerを統合することで、複雑な文化的モチーフや構造的要素の正確な抽出と保存を可能にする、新しいセマンティックセグメンテーション誘導型再構成フレームワークを開発しました。第二に、セグメンテーション特徴と生成表現を効果的に融合させる新しいCAFFMを導入し、文化的モチーフと芸術的スタイルパターンの間の長距離依存関係をモデルが捉えられるようにしました。第三に、提案したCAFFMにより、再構成された遺産パターンの視覚的なリアリズムと構造的な整合性を向上させつつ、文化的に重要な要素の保存能力を高めました。第四に、文化パターンの再構成にCycleGANを、セグメンテーション誘導型の芸術的合成にSPADEを統合することで、生成された出力におけるセマンティックな正確性とスタイルの真正性の両方を確保しました。第五に、汎用性と芸術的な多様性を向上させるため、文化パターンの学習には苗族バティックの文化モチーフデータセットを、芸術的スタイルの表現にはWikiArtデータセットを用いてモデルをトレーニングしました。WikiArtは、苗族の文化遺産製品に直接適用するためのターゲットスタイルとしてではなく、多様な視覚的コンテキストにおけるフレームワークの汎化能力、特徴学習の堅牢性、およびスタイル制御の有効性を評価するための補助的なデータセットとして機能します。最後に、既存のGANベースの文化遺産再構成手法と比較して、提案したSegCycle-SPADEフレームワークは、セグメンテーション精度、再構成品質、およびスタイルの整合性において改善を達成したことが実験結果により示されました。
提案されたSegCycle-SPADEのフレームワークは、セマンティックセグメンテーション、アテンションを用いた特徴量強化、生成的再構成、および芸術的なスタイル合成を通じて、伝統的な文化遺産のパターンを再構成し、向上させるように設計されています。本研究では、苗族バティック(Miao Batik)データセットおよびWikiArtデータセットを含む、公開されている文化遺産および芸術画像データセットを利用しました。本研究には、ヒト被験者、患者データ、個人情報、動物被験者、または臨床記録は含まれていないため、施設倫理委員会の承認およびインフォームドコンセントは必要ありませんでした。まず、評価のために苗族バティック文化モチーフデータセットとWikiArtデータセットを利用します。苗族バティックデータセットはQuanら(2024)32で記述されており、15,148枚の注釈付き伝統的苗族バティックモチーフ画像が含まれています。データセット作成者によって提供された既存の注釈を直接使用し、本研究において追加の手動注釈は生成していません。次に、リサイズ、正規化、ノイズ除去、およびセグメンテーションマスクの作成によって画像の前処理を行います。正確な前処理パラメータは「データ前処理」のサブセクションに記載されています。提案されたフレームワークでは、データのセマンティックセグメンテーションにSegFormer-B2というTransformerベースのモデルを利用します。この手法は、文化モチーフの主要領域を検出し、その構造を学習するように設計されています。次に、セグメント化された特徴量はアテンションメカニズムを通じて強化され、文化モチーフに関連する重要な情報が強調され、無関係な情報は破棄されます。アテンションメカニズムの設定はCAFFMのサブセクションに記載されています。強化された特徴量はその後CycleGANに渡され、サイクル学習を通じて損傷した構造が再構成されます。トレーニング中、元の苗族バティック画像にランダムなマスキングおよび部分的な遮蔽処理を適用することで、不完全なモチーフサンプルを人工的に作成しました。これらの劣化手順は、劣化した文化遺産遺物によく見られるモチーフ領域の欠損や構造的損傷をシミュレートしたものです。得られた不完全な画像はCycleGAN再構成モジュールの入力として使用され、対応する元の画像が再構成ターゲットとなりました。再構成された文化遺産パターンは、その後SPADEを通じて強化され、生成されたセグメンテーションマップに基づいて芸術的な強化が行われます。提案されたフレームワークの性能は、定量的なセグメンテーションおよび画質指標を用いて評価され、再構成された文化モチーフの視覚的な真正性は定性的に評価されました。視覚的な真正性は、生成された文化パターンの目視検査を通じて評価され、独立した定量的な指標としては使用されませんでした。評価では、対応する参照文化モチーフに対するモチーフの保存、セマンティックな一貫性、文化的特性、構造的コヒーレンス、および芸術的外観に焦点を当てました。モデル性能の定量評価は、Segmentation Accuracy、IoU、Dice Coefficient、Structural Similarity Index Measure (SSIM)、Peak Signal-to-Noise Ratio (PSNR)、およびFréchet Inception Distance (FID)を用いて行われました。図 2に、提案されたSegCycle-SPADEフレームワークの全体的なワークフローを示し、本研究で使用した評価指標をまとめています。

図2. 提案するSegCycle-SPADEフレームワークの全体的なアーキテクチャワークフロー。SegCycle-SPADEワークフロー全体の概要。Miao BatikおよびWikiArtデータセットの画像は、前処理を経て、SegFormer-B2を用いたセマンティックセグメンテーション、CAFFMを用いた特徴量強化、CycleGANを用いたパターン再構成、およびSPADEを用いた芸術的スタイルの生成へと処理される。モデルの性能は、Segmentation Accuracy、Intersection over Union (IoU)、Dice Coefficient、Structural Similarity Index Measure (SSIM)、PSNR、Fréchet Inception Distance (FID)を用いて評価し、視覚的な真正性は定性的に評価される。こちらのリンクをクリックして、この図の拡大版を表示してください。
文化遺産のパターン再構成のためのSegCycle-SPADEフレームワークは、Figure 2に示すように、モチーフの正確なセグメンテーション、再構成、および芸術的な強化を行うために、複数のDLコンポーネントを統合するように設計されています。多様な文化的パターンと芸術的スタイルを提供するために、Miao Batik文化モチーフデータセットとWikiArtデータセットの画像が使用されます。まず、SegFormerベースのセマンティックセグメンテーションモジュールを用いて画像を処理し、背景から文化的なモチーフを特定して境界を画定します。全体のアーキテクチャは4つの主要なステージで構成されています。第一に、SegFormerモデルが文化パターン画像からセマンティックセグメンテーションマップを抽出します。第二に、CAFFMがセグメンテーション特徴と生成表現を統合し、特徴学習を強化します。第三に、CycleGANモジュールが融合された特徴表現を用いて文化パターンを再構成します。最後に、SPADEモジュールが、セグメンテーション誘導合成を通じて構造的一貫性を維持しながら、スタイル的に強化された出力を生成します。精緻化された特徴マップはその後、CycleGAN再構成モジュールによって処理され、劣化したパターンを対応する完全な形式にマッピングすることで、不完全な文化モチーフを復元することを学習します。不完全なモチーフサンプルは、元のMiao Batik画像にランダムなマスキングおよび部分的遮蔽操作を適用することで生成され、これにより、損傷した文化遺物に一般的に見られるパターンの欠損領域や構造的劣化をシミュレートしました。各劣化画像は、トレーニング中の再構成ターゲットとして機能する対応する元の画像とペアにされました。この戦略により、CycleGANモジュールは、セマンティックな一貫性と文化的に重要な特性を維持しながら、欠損したモチーフ構造の復元を学習することが可能になりました。最終的に、SPADEジェネレーターは、生成されたセグメンテーションマップを条件として画像合成を行うことで、視覚的に強化された芸術的出力を生成し、これにより芸術的強化プロセス全体を通じて文化モチーフの構造的完全性を維持します。
提案されたSegCycle-SPADEフレームワークには、以下の手順が含まれます。
ステップ 1:データセットの収集
文化的なパターンの学習と芸術的スタイルの生成という目的を達成するために、2つのデータセットを使用した。伝統的な文化パターンの情報を提供するために、Miao Batik Cultural Motif Datasetを使用した。このデータセットはZenodo (https://doi.org/10.5281/zenodo.20807658) を通じて公開されており、15,148枚のアノテーション付き苗族バティック文様画像が含まれている。データセット作成者によって提供された既存のアノテーションをそのまま使用し、本研究において追加の手動アノテーションは作成しなかった。また、芸術的スタイル生成のための多様な芸術的スタイル情報を提供するためにWikiArtデータセットを使用し、これは公開されているWikiArtリポジトリ (https://www.wikiart.org/) から取得した。
ステップ2:データの前処理
すべての画像は、リサイズ、正規化、およびノイズ除去によって前処理されました。セマンティックセグメンテーション段階をサポートするために、元のデータセットソースから得られた既存の文化的モチーフのアノテーションを使用しました。本研究の一環として、追加のアノテーションやリラベリングの手順は実施していません。
ステップ3:SegFormerを用いた意味論的パターンセグメンテーション
文化的なモチーフのセグメンテーションにはSegFormerモデルを使用した。SegFormerの具体的なバックボーンおよび初期化戦略については、「Semantic Pattern Segmentation Using SegFormer」のサブセクションに記載されている。具体的には、意味論的なモチーフセグメンテーションのために、ImageNetで事前学習済みのMIT-B2バックボーンを持つSegFormer-B2アーキテクチャを採用した。このモデルは、伝統的な文化パターンの複雑な構造的詳細を保持しつつ、グローバルなコンテキスト情報を効果的に抽出することができる。
ステップ 4:CAFFM
CAFFMはセマンティックセグメンテーションの特徴を生成的な表現と組み合わせることで、フレームワークが構造的なモチーフの特性と芸術的なスタイルの情報の両方を学習することを可能にします。CAFFMの統合に関する詳細は、CAFFMのサブセクションで説明しています。このモジュールは、SegFormerベースのセマンティックセグメンテーション段階と生成的再構成段階の間に配置され、マルチヘッドクロスアテンションを通じて、セグメンテーションから得られた構造的特徴と再構成特徴を融合させます。このプロセスにより、文化的モチーフの保存性が向上し、再構成された出力のリアリズムが高まります。
ステップ 5:パターンの再構成 (CycleGAN)
融合された特徴量は、その後CycleGANモジュールによって処理され、文化的パターンの構造が再構成されます。CycleGANのアーキテクチャおよび学習設定については、「CycleGANを用いたパターンの再構成」のサブセクションで説明しています。この再構成モジュールは2つのジェネレーターと2つのディスクリミネーターで構成されており、9つの残差ブロックを持つ残差ネットワークジェネレーターアーキテクチャを採用し、PatchGANディスクリミネーターを用いて、敵対的損失およびサイクル一貫性損失を用いて学習されます。この構成により、双方向のドメインマッピングが可能となり、不完全な文化的パターン構造の再構成が促進されます。
ステップ 6:芸術的スタイルの生成 (SPADE)
次に、再構成されたパターンをSPADEモジュールで処理し、セグメンテーション誘導型の芸術的スタイル合成を行います。SPADEジェネレーターの設定については、「SPADEを用いた芸術的スタイルの生成」のサブセクションに記載されています。このモジュールでは、SPADE残差ブロック、空間適応型正規化層、およびSegFormerセグメンテーションマップとCAFFM特徴表現から導出されたセマンティック条件付けを採用しています。画像生成をセグメンテーションマップに基づいて条件付けることで、合成された出力は、芸術的なスタイルの特性を取り入れつつ、元の文化的モチーフとの構造的な整合性を維持します。
ステップ 7:性能評価
提案したフレームワークの評価には、セグメンテーション精度、IoU、Dice係数(Dice)、SSIM、PSNR、およびFIDを含む複数のセグメンテーション指標および画質評価指標を用いた。実験の再現性を確認するため、すべての実験を異なる乱数シードを用いて5回繰り返し、結果を平均値 ± 標準偏差として報告した。統計的有意性は対応のあるt検定を用いて評価し、有意水準はp < 0.05とした。
データセットの収集
提案するSegCycle-SPADEのフレームワークでは、文化パターンの理解とスタイルの学習のために2つのデータセットが用いられています。本フレームワークで用いられる1つ目のデータセットは、苗族バティック(Miao Batik)の文化モチーフデータセットです。このデータセットには苗族バティックの文化モチーフが含まれており、一般的に苗族の芸術に使用される動物、植物、幾何学図形などのモチーフを含む伝統的な苗族バティックの画像で構成されています。このデータセットには豊かなテクスチャ情報を持つ画像が含まれており、これらは一般的に文化遺産の保存にとって重要です。SegCycle-SPADEのフレームワークで用いられる2つ目のデータセットは、WikiArtデータセットです。このデータセットには、一般的に異なるスタイルを持つ膨大な数の芸術作品が含まれています。このデータセットは、芸術作品の向上に一般的に有用な複雑なスタイルの学習のために用いられます。本データセットにはHD画質の芸術作品が80,000点含まれ、27種類の異なるデザインがあるため、ディープラーニング(DL)ベースのスタイル生成や変換タスクに非常に有用です。
苗族バティックデータセット:
苗族バティックデータセット(https://doi.org/10.5281/zenodo.20807658)は、文化的に重要なモチーフを描いたバティックパターンの画像15,148枚で構成されています。これらの画像には、動物モチーフ(例:蝶や魚)、植物ベースのパターン、および文化的象徴性を備えた幾何学モチーフなど、多様な伝統的デザインが含まれています。本データセットは、パターンの再構築過程においてセグメンテーションモジュールがモチーフの境界を正確に特定し保持することを可能にする真正な文化的構造を提供するため、提案されたフレームワークの重要な構成要素となっています(表1)。本研究において、文化的に重要なモチーフとは、苗族の文化遺産に関する文献に一般的に記載され、データセットのアノテーション内で表現されている鳥、蝶、花柄、祖先のトーテムなどの象徴的な視覚的要素を指します。これらのモチーフは、単に出現頻度や空間的な構成に基づくのではなく、文献に記録された文化的意義および伝統的な苗族のバティックや刺繍デザインにおける反復的な出現に基づいて選定されました。専門家の指導によるモチーフのアノテーションおよびセグメンテーションラベルは、元の苗族バティックデータセットのソースから取得し、本研究で直接使用しました。著者による追加の手動アノテーション、リラベル、または専門家指導によるアノテーション手順は行っていません。データセット作成者によって提供された既存のアノテーションを、セマンティックセグメンテーションの学習および評価に利用しました。
| パラメータ | 概要 |
| データセット名 | ミャオ族バティック文化文様データセット |
| データセット出典 | Zenodoリポジトリ (DOI: 10.5281/zenodo.20807658) |
| ドメイン | 無形文化遺産 (ICH) / 織物文様解析 |
| 合計画像数 | 15,148枚の画像 |
| 画像タイプ | 伝統的な苗族バティック織物パターンのデジタル画像 |
| パターンカテゴリー | 動物文様、植物文様、および幾何学文様 |
| 文化的背景 | 中国貴州省の苗族文化 |
| 元画像の解像度 | 前処理前に、RAWスキャンまたは写真としてキャプチャされた高解像度画像(通常、短辺が1,000ピクセル以上) |
| トレーニング解像度 | 画像を256にリサイズ済み × 前処理中の256ピクセル |
| アノテーションの利用可能性 | データセット作成者が提供した既存のセグメンテーションアノテーションを、変更せずにトレーニングおよび評価に使用した。本研究において、追加の手動アノテーション、リラベル、または専門家による確認手順は実施していない。 |
| 本研究における応用 | 文化的モチーフのセグメンテーション、特徴抽出、モチーフ保存、およびパターンの再構成 |
表1: 苗族バティック文化パターンデータセットの特性。セマンティックセグメンテーション、文化パターン分析、およびモチーフ再構成に使用された苗族バティック文化モチーフデータセットの概要。本表では、データセットのソース、画像特性、モチーフカテゴリ、文化的な起源、画像解像度、および提案されたSegCycle-SPADEフレームワークにおける役割について記述する。
WikiArtデータセット:
WikiArtデータセット [https://www.wikiart.org/] は、Table 2 に示す27種類の異なる芸術スタイルにわたる80,000枚以上の画像で構成される、広く利用されている大規模なデジタルアートリポジトリです。スタイルには、ルネサンス美術、印象派、キュビスム、シュルレアリスムなどが含まれます。このデータセットは、セグメンテーションプロセスから得られた構造情報を維持しつつ、SPADEモジュールが文化的に豊かなパターンを生成することを可能にする知識を提供するため、提案されたフレームワークにおいて非常に重要です。本データセットは、学習用に56,000枚、検証およびテスト用に12,000枚の画像で構成されています。データセット内の画像は、DLモデルを効果的に学習させるのに役立ちます。
| パラメータ | 説明 |
| データセット名 | WikiArt Dataset |
| データセットソース | WikiArt Repository (https://www.wikiart.org/) |
| ドメイン | デジタルアートおよび絵画 |
| 総画像数 | 約 80,000 点の芸術作品 |
| トレーニング画像数 | 56,000 |
| 検証画像数 | 12,000 |
| テスト画像数 | 12,000 |
| 芸術スタイル | ルネサンス、印象派、キュビスム、シュルレアリスム、表現主義、写実主義、抽象芸術を含む 27 の芸術スタイル |
| 元の画像解像度 | 元の画像解像度は作品やソースによって異なります。前処理において、画像は 256 × 256 pixels の均一な解像度にリサイズされました。 |
| トレーニング解像度 | 芸術スタイルの学習およびセグメンテーション誘導画像合成に先立つ前処理において、画像は 256 × 256 pixels にリサイズされました。 |
| データセットの分割 | 固定乱数シード 42 を用いた層化ランダム分割(トレーニング 70%、検証 15%、テスト 15%) |
| スタイルサンプリング戦略 | トレーニング、検証、テストの各サブセットにおいて 27 の芸術スタイルの分布を維持するため、層化比例サンプリングを採用しました |
| 本研究における適用 | 芸術スタイルの学習、スタイルの表現、およびセグメンテーション誘導芸術合成 |
表 2: WikiArtデータセットの特性。芸術的スタイルの学習およびスタイルガイド付き画像合成に使用されるWikiArtデータセットの概要。本表では、データセットのソース、画像の分布、芸術的スタイルの網羅範囲、データセットの分割、画像解像度、および提案されたSegCycle-SPADEフレームワーク内での適用について述べている。
Miao Batikデータセットには、苗族の伝統的な文化的モチーフを表す15,148枚の画像が含まれている32。このデータセットは、Zenodo (https://doi.org/10.5281/zenodo.20807658) を通じて公開されている。モデルのトレーニングに先立ち、すべての画像を視覚的に検査し、256 × 256 pixelsにリサイズして正規化を行い、破損したサンプルや重複したサンプルのスクリーニングを実施した。品質管理スクリーニングによる画像の除外はなかったため、15,148枚すべての画像がその後の解析に使用された。データセットの分割の再現性を確保するため、固定ランダムシード 42 を使用して、データセットをトレーニング用(70%)、検証用(15%)、およびテスト用(15%)のサブセットにランダムに分割した。WikiArtデータセットは、公式のWikiArtリポジトリ (https://www.wikiart.org/) を通じてアクセスし、27の芸術様式にわたる80,000点以上の芸術作品が含まれている。スタイル学習実験では、トレーニングに56,000枚、検証に12,000枚、およびテストに12,000枚の画像を使用した。
データの前処理
提案するSegCycle-SPADEフレームワークの学習前に、一貫した画質と正確な特徴表現を確保するため、苗族バティック(Miao Batik)文化モチーフデータセットとWikiArtデータセットに対していくつかの前処理ステップを実施した。ガウスノイズ除去、正規化、一貫した入力解像度へのリサイズ、および画質検証を含む同様の基本的な前処理パイプラインを両データセットに適用した。ただし、フレームワーク内での各データセットの役割は異なっていた。WikiArtデータセットは芸術的なスタイルの学習と合成に使用され、苗族バティックデータセットは主に文化モチーフのセグメンテーションと再構成に使用された。これらのタスク固有の役割以外に、データセット固有の前処理の変更は行わなかった。DLモデルによる一貫した処理を保証するため、まず画像を固定解像度にリサイズした。このステップは、両データセットの画像がソースによって解像度が異なるため必要であった。リサイズにより計算効率が向上し、次元の不一致が学習に影響を与えることを防いだ。2番目の前処理ステップは正規化であり、学習中の勾配更新を安定させるためにピクセル値を標準化された範囲にスケーリングした。その後、文化モチーフの構造を妨げる可能性のあるノイズを低減させるため、ガウスフィルタリングを用いて画像を処理した。苗族バティックデータセットについては、オリジナルのデータセットソースから直接取得した既存の文化モチーフセグメンテーションマスクを、セマンティックセグメンテーションの学習および評価のために変更なしで使用した。本研究のために新しいセグメンテーションマスクを別途作成することはなかった。
特に断りのない限り、確立された手法を記述する方程式は先行研究から引用し、適切に参照しています。提案されるCAFFMおよび複合SegCycle-SPADE最適化フレームワークを記述する方程式は、本研究のために著者らが開発したものです。
データセットからの入力画像を式1として表します:
(1)
ここで、H、W、Cはそれぞれ画像の高さ、幅、およびカラーチャンネル数を表します。すべての画像は、式2に示すように、固定次元H′ × W′にリサイズされます:

ここで、Irはリサイズ後の画像です。正規化されたピクセル値は、式3に従って算出されます:
(3)
これにより、トレーニング手順の安定化に寄与します。ノイズフィルタリングは、式4に示すようにガウスフィルタを用いて行われます:

ここで、G(σ)はガウスフィルタ、*は畳み込みを表します。標準偏差σ = 1.0の5 × 5カーネルガウスフィルタを使用しました。エッジアーティファクトを低減するため、境界ピクセルに反射パディングを適用しました。スケーリングと正規化を行う前に、画像読み込み直後にデノイジング処理を実施しました。研究全体を通して前処理を均一にするため、Miao BatikおよびWikiArtデータセットのすべての画像に同じフィルタ構成を適用しました。Miao Batikデータセットの場合、セグメンテーションマスクは式 5に従って作成されます。

ここで、MはSegFormerモデルを誘導するために使用されるセグメンテーションマスクです。
図3に示すように、前処理パイプラインは、Miao BatikデータセットおよびWikiArtデータセットからの画像取得から始まります。トレーニングにおいてデータ拡張の手法は採用していません。リサイズ、正規化、ガウスデノイジング、およびセグメンテーションマスクの作成を含む前処理の後、画像は提案するSegCycle-SPADEフレームワークのトレーニング、検証、およびテストに直接使用されました。前処理パイプラインの最初のステップでは、画像を固定サイズにリサイズし、DLモデルがより効率的に画像を処理できるようにします。2番目のステップでは正規化を行い、画素値を標準化された数値範囲に変換することでモデルの収束を促進します。3番目のステップではノイズ除去を行い、不要なノイズを排除してパターン認識能を向上させます。さらに、Miao Batikデータセットについては、文化的モチーフ領域にアノテーションを付与し、提案モデルのセグメンテーションモジュールで使用するマスクを生成することで、生成過程において文化的モチーフが保存されるようにしています。この段階の最終的な出力は、提案モデルのセグメンテーションおよび生成モジュールのトレーニングに使用可能なクリーンなデータセットです。

図 3. 文化遺産画像のデータ前処理パイプライン。モデル学習前に適用される画像前処理手順を示すワークフロー。このパイプラインには、データセットの収集、画像のサイズ変更、正規化、ガウスノイズ除去、既存の文化的モチーフのアノテーション、およびセグメンテーションマスクの作成が含まれる。処理後の画像とマスクは、セマンティックセグメンテーションおよびパターン再構成の入力として使用される。ここをクリックして、この図の拡大版を表示してください。
モデルのトレーニング前に、すべての画像に対して品質管理プロセスを実施した。Miao Batikデータセットには15,148枚の画像が含まれていた。破損したサンプルや重複、低品質のサンプルについては、元のデータセット作成者がすでに対処していたため、本研究の品質管理スクリーニングにおいて追加で除外された画像はなかった。その結果、15,148枚すべての画像が解析に使用された。前処理において、画像はRGB形式で読み込まれ、バイリニア補間を用いて256 × 256ピクセルにリサイズされた。ピクセル値は255で除算し、[0, 255]の範囲から[0, 1]の範囲にスケーリングした。その後、赤、緑、青の各チャネルに対して、それぞれ[0.485, 0.456, 0.406]の平均値と[0.229, 0.224, 0.225]の標準偏差値を用いてチャネルごとの正規化を適用した。前処理パイプラインには、画像の読み込み、RGB変換、リサイズ、ピクセル値のスケーリング、正規化、およびテンソル変換が含まれていた。必要に応じて、DLモデルとの互換性を維持するために、グレースケール画像を3チャネルのRGB形式に変換した。前処理後、画像はトレーニング、検証、およびテストのサブセットに分割された。セマンティックセグメンテーション、特徴融合、モチーフ再構成、およびSPADEベースの芸術的合成を含むSegCycle-SPADEフレームワークのすべての段階において、256 × 256ピクセルの一定の入力解像度が使用された。
SegFormerを用いた意味的パターンセグメンテーション
この前処理ステップの後、クリーニングおよび正規化された苗族バティック文化モチーフデータセットとWikiArtデータセットの画像が、提案されたSegFormer-B2フレームワークに基づく意味的セグメンテーションモジュールに入力されます。このステップの目的は、伝統的なパターンに存在する文化的なモチーフを正しく識別し、分離することです。提案するSegFormerフレームワークは、階層的Transformerエンコーダーと軽量なMLPデコーダーを組み込んだTransformerアーキテクチャに基づいており、複雑な伝統的パターンからグローバルなコンテキスト情報と詳細な構造情報の両方を正確にキャプチャします。まず、モデルが入力画像から複数のスケールで特徴表現を抽出し、次いでデコーダーを通じてこれらの表現を融合させることで、正確なセグメント化パターンを生成します。これにより、伝統的な画像内のパターンが、幾何学パターン、花柄パターン、象徴的パターンなどのモチーフに正しくセグメント化され、構造的な完全性を維持しながら背景から分離されることが保証されます。この構造情報は、その後、SegCycle-SPADEフレームワーク内でのパターン生成の後半ステージで使用されます。
前処理済みの入力画像を次のように表す。 式 6:
(6)
SegFormerエンコーダーは、画像をパッチに分割し、式71に示すようにトランスフォーマー層を用いて階層的な特徴を抽出します:

ここで、Fはトランスフォーマーエンコーダーから得られたマルチスケール特徴マップを表します。これらの特徴は、モチーフ領域間の局所的なテクスチャパターンと大域的な文脈関係の両方をエンコードしています。SegFormerモデルは、式8で定義されるように、異なるスケールの特徴マップを抽出します。

マルチスケール表現を用いることで、文化的モチーフ内の異なるサイズのパターンの検出が容易になります。最後に、図に示されているように、MLPデコーダーを用いて特徴量を結合します。 式 91:

ここで、Sは最終的な予測セグメンテーションマップを表します。
SegFormer-B2バックボーンは、ImageNetで事前学習済みの重みを用いて初期化され、その後、文化的なモチーフのセグメンテーションのためにMiao Batikデータセットでファインチューニングが行われました。事前学習済みのチェックポイントは、公式のSegFormer実装から取得しました。具体的には、ファインチューニングに先立ち、公式のSegFormerリポジトリから提供されたImageNet-1K事前学習済みMIT-B2チェックポイント(mit_b2.pth)を使用してSegFormer-B2バックボーンを初期化しました。この事前学習済みの重みは、SegFormerの著者によって公開されたMIT-B2バックボーンに対応しており、セマンティックセグメンテーション学習の初期化モデルとして使用されました。その他のタスク固有のレイヤーは、学習前にデフォルトのPyTorch重み初期化手順を用いて初期化されました。
アーキテクチャには、オーバーラップパッチ埋め込みを備えた4段階の階層的Transformerエンコーダが使用されています。初期段階では、パッチサイズを7 × 7、ストライドを4に設定しました。4つのエンコーダステージそれぞれの埋め込み次元は、64、128、320、および512でした。これら4つのステージにおけるマルチヘッド自己アテンションヘッド数はそれぞれ1、2、5、および8であり、対応するエンコーダの深さは3、4、6、および3レイヤーでした。エンコーダから抽出されたマルチスケール特徴量は、軽量なオールMLPデコーダを用いて集約されました。最終的なセグメンテーションマップを作成する前に、デコーダはすべてのエンコーダステージからの特徴量を単一の埋め込み空間に投影しました。すべてのTransformerブロックには、活性化関数としてGaussian Error Linear Unit (GELU) が使用されました。汎化性能の向上と過学習の抑制のため、トレーニング時には0.1のドロップアウト率が適用されました。
トレーニングフェーズにおいて、SegFormerフレームワークは両方のデータセットから前処理された画像を受け取ります。Miao Batikデータセットの画像には、セグメンテーションモデルの教師あり学習のラベルとして機能するモチーフ領域が含まれています。Transformerエンコーダーは画像全体を処理し、画像コンポーネント間の長距離的な関係を捉えます。これは、空間的に分布したモチーフを含む伝統的なバティックパターンにおいて特に重要です。階層的な特徴抽出メカニズムは、繰り返される幾何学的テクスチャなどの局所的な構造を同時に捉えます。MLPデコーダーは、これらの抽出された特徴を処理し、モチーフ領域を強調したセグメンテーションマスクを生成します。この段階で生成されたセグメンテーションマップは、その後、アテンションモジュールおよびパターン再構成段階の構造的入力として使用され、これにより生成されるパターンの真正性の保持に寄与します。
文化的モチーフは、その視覚的および文化的特性に基づき、セマンティックセグメンテーションのために異なるクラスに分類されました。セグメンテーションの分類体系は、動物モチーフ(例:蝶、魚、鳥、およびその他の象徴的な動物相)、植物モチーフ(例:花、葉、蔓、および植物学的パターン)、幾何学モチーフ(例:反復形状、縁取り、および抽象的な幾何学的構造)、およびモチーフ以外の領域を表す背景領域で構成されました。ピクセルレベルのセグメンテーションマスクを用いて、各ピクセルを定義済みのクラスのいずれかに割り当てました。整数ラベルは次のようにエンコードされました:ラベル0 = 背景、ラベル1 = 動物モチーフ、ラベル2 = 植物モチーフ、ラベル3 = 幾何学モチーフ。セグメンテーションアノテーションとモチーフラベルは、元のMiao Batikデータセットソースから直接取得しました。本研究では、追加の手動アノテーション、ラベルの再割り当て、境界の検証、または専門家による確認手順は行っていません。データセット作成者によって提供された既存のアノテーションを、変更せずにトレーニングおよび評価に使用しました。
文化的なモチーフのセグメンテーションのためのSegFormerモデルは、図4に示すように、Miao BatikデータセットおよびWikiArtデータセットから得られた前処理済み画像を、トランスフォーマーベースのメカニズムを用いて処理し、文化的パターンの領域を正確に検出します。まず、伝統的な文化モチーフを含む入力画像がSegFormerモデルに提供されます。Transformerエンコーダーが、画像パッチからグローバルなコンテキスト情報とローカルな構造的特徴の両方を抽出します。得られたマルチスケールの特徴はセグメンテーションデコーダーに提供され、デコーダーはMix Feed-Forward Networkを利用して特徴表現を精緻化し、モチーフの検出精度を向上させます。SegFormerモデルの出力は、無関係な背景情報を抑制しつつ、文化的なパターンに対応する画素を強調したセグメンテーションマスクとなります。これにより分離された文化的パターンは、その後のSegCycle-SPADEフレームワークの段階における構造的なガイダンスとして機能します。

図4SegFormer-B2を用いた文化モチーフのセマンティックセグメンテーション 文化的なモチーフ抽出に使用され、Miao Batikデータセットのみで学習されたSegFormer-B2セマンティックセグメンテーションモジュールのアーキテクチャ。本フレームワークは、マルチスケール特徴抽出のためのTransformerベースのエンコーダーと、モチーフマスクを生成するための軽量なセグメンテーションデコーダーで構成されている。本モデルは、「動物」、「植物」、「幾何学模様」、「背景」の4つのセマンティッククラスを予測し、得られたセグメンテーションマスクによって、無関係な背景情報を抑制しつつ、文化的に重要なモチーフ領域を特定する。これらのセグメンテーション出力は、提案するSegCycle-SPADEフレームワークにおける後続の特徴融合、再構成、および芸術的合成ステージへの構造的なガイダンスを提供する。 この図の拡大版を表示するには、ここをクリックしてください。
提案されたフレームワークでは、新たなセグメンテーションアノテーションを作成する必要はありません。Miao Batikデータセットは既存の公開ソースから取得されており、モデルの学習にはデータセット作成者が提供した関連モチーフ情報が使用されました。学習プロセスにおいて、SegFormerモデルがセマンティックセグメンテーションマップを生成しました。その結果、本研究では追加の手動アノテーションソフトウェア、アノテーションガイドライン、またはアノテーションの品質管理手順を必要としませんでした。
CAFFM
セマンティックセグメンテーションの特徴と生成的な再構成の表現との相互作用を改善するため、本研究ではCAFFMも提案した。SegFormer-B2エンコーダーがCAFFMモジュールにセマンティック特徴マップを提供し、一方でCycleGANの再構成ステップが生成的特徴マップを提供する。まず、線形投影層を用いて、両方の特徴ストリームを共通の埋め込み空間に投影する。クロスアテンションの計算のために、生成された特徴テンソルを用いてクエリ(Q)、キー(K)、バリュー(V)の表現を作成する。次に、マルチヘッドクロスアテンションを用いて、構造的モチーフ情報と芸術的スタイル要素との関係をモデル化する。その後、融合された特徴表現に対して、レイヤー正規化、残差接続、およびGELU活性化関数を用いたフィードフォワード層を適用する。SPADEベースの合成ステージがCAFFMモジュールの出力を受け取ることで、芸術的な整合性を損なうことなく、文化的に意味のあるテーマを保存することが可能となる。
特徴量の互換性を保証するため、まず入力特徴量を線形投影層を用いて、埋め込み次元256の共有埋め込み空間に投影します。次に、意味的な構造情報と生成的なスタイル表現の間の相互接続を、8つのアテンションヘッドを持つマルチヘッドクロスアテンション(MultiHead Cross-Attention)メカニズムを用いてモデル化します。クロスアテンションの計算には、特定の線形変換層によって生成されるクエリ(Q)、キー(K)、およびバリュー(V)ベクトルを使用します。学習の安定性を高め、特徴量の整合性を維持するために、残差接続とレイヤー正規化(Layer Normalization)を採用し、融合された特徴表現をさらに強化します。その後、Gaussian Error Linear Unit(GELU)活性化関数を備えたフィードフォワードネットワークを適用することで、非線形な特徴学習を向上させます。このモジュールによって次元256の出力特徴表現が生成され、創造的な合成のために他のステージへ送られます。CAFFMは、クロスアテンションベースの融合技術を用いることで、芸術的スタイルデータと文化的モチーフ構造を正常に結合させ、再構成された文化遺産パターンのモチーフ保持能と視覚的一貫性を向上させます。
提案するシステムでは、構造的特徴はMiao Batikデータセットから導出され、スタイル的特徴はWikiArtデータセットから学習されます。Miao Batikデータセットの画像を用いてSegFormerセグメンテーションネットワークから導出された特徴マップをFsとし、WikiArt画像を用いたスタイル特徴抽出ブランチから導出された特徴マップをFaと定義します。提案するCAFFMは、クロスアテンション機構を用いてこれら2つの特徴ドメインを結合し、文化的なパターンの構造的およびスタイル的な依存関係の両方を学習します。表3に、埋め込み次元、正規化層、活性化関数、アテンションヘッドの構成を含むすべてのアーキテクチャ特性を示します。入力画像サイズが256 × 256ピクセルの場合、SegFormer-B2エンコーダは64 × 64 × 128サイズのセマンティック特徴マップを生成し、スタイル特徴抽出ブランチは64 × 64 × 128サイズの特徴マップを生成しました。両方の特徴マップは、クロスアテンション融合の前に、学習可能な線形層を通じて次元256の共有埋め込み空間に投影されました。
| パラメータ | 構成 |
| 提案されたフレームワーク | SegCycle-SPADE |
| セマンティックセグメンテーションモデル | SegFormer-B2 |
| SegFormerエンコーダーステージ | 4 |
| 重みの初期化 | ImageNet-1Kで事前学習済みSegFormer-B2(MIT-B2バックボーン) |
| チェックポイントソース | NVIDIA公式SegFormerリポジトリ (https://github.com/NVlabs/SegFormer); チェックポイント: segformer.b2.512x512.ade.160k |
| ファインチューニング戦略 | Miao Batikデータセットを用いたエンドツーエンドのファインチューニング |
| パッチ埋め込みサイズ | 7 × 7 |
| パッチストライド | 4 |
| 埋め込み次元 | 64, 128, 320, および 512 |
| エンコーダー深度 | 3、4、6、および3 |
| アテンションヘッド | 1、2、5、および8 |
| デコーダーの種類 | 全MLPデコーダー |
| 活性化関数 | ガウス誤差線形ユニット |
| 脱落率 | 0.1 |
| 特徴量強調モジュール | クロスアテンション文化的特徴融合モジュール (CAFFM) |
| CAFFM埋め込み次元 | 256 |
| CAFFMアテンションヘッド | 8 |
| CAFFM融合スケール | 4 |
| 再構築モデル | CycleGAN |
| スタイル生成モデル | SPADE |
| 文化データセット | ミャオ族バティックデータセット |
| スタイルデータセット | WikiArtデータセット |
| ミャオ族のバティック画像 | 15,148 |
| WikiArt画像 | 約80,000 |
| 入力画像解像度 | 256 × 256ピクセル |
| カラーフォーマット | RGB |
| 補間法 | 双線形補間 |
| デノイジング法 | ガウスフィルタリング |
| ガウスカーネルサイズ | 5 × 5 |
| ガウスシグマ(σ) | 1 |
| 正規化範囲 | [0, 1] |
| バッチサイズ | 16 |
| エポック数 | 100 |
| オプティマイザー | アダム |
| 学習率 | 0.0002 |
| Adamパラメータ | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, ウェイトディケイ = 0 |
| 損失関数 | セグメンテーション損失、敵対的損失、サイクル一貫性損失、再構成損失、モチーフ保存損失、およびスタイル一貫性損失 |
| データセット分割戦略 | トレーニング / 検証 / テスト |
| トレーニングセット | 70% |
| 検証セット | 15% |
| テストセット | 15% |
| 乱数シード | 42 |
| 評価指標 | セグメンテーション精度、IoU、ダイス係数、SSIM、PSNR、およびFID |
| プログラミング言語 | Python 3.8.10 |
| ディープラーニングフレームワーク | PyTorch 1.10.0 |
| ハードウェアプラットフォーム | NVIDIA RTX 3090 GPU (24 GB VRAM)、Intel Core i7 (第11世代)、32 GB RAM |
| 動作環境 | Ubuntu 20.04 LTS |
表 3: 実験設定およびモデル構成。提案されたSegCycle-SPADEフレームワークの実装および評価に使用された、アーキテクチャ構成要素、トレーニング設定、前処理設定、データセット、最適化パラメータ、評価指標、および計算環境の概要。
アテンションモジュールは、まず式10を用いて、特徴マップをクエリ、キー、およびバリューの表現へとマッピングします:

ここでは、 Wq, Wk、および Wv は学習可能な重み行列です。アテンション重みは、クエリベクトルとキーベクトルの類似度に基づき、以下を用いて算出されます。 式1117:

ここで、dkはキーベクトルの次元数です。強化された特徴表現は、式12を用いてアテンション重みとバリュー行列を乗算することで算出されます:

ここで、Faは特徴マップの強化された特徴表現です。この強化された特徴表現は、元のセグメンテーション特徴と、アテンションメカニズムを用いて得られた強化特徴を式13を用いて組み合わせることで算出されます。
ここで、Feはパターン再構成に使用される強化機能マップである。CAFFMは、異なるスケールの文化的なモチーフの特徴を抽出するために、マルチスケール・クロスアテンション機構で拡張されている。スケールiにおけるセグメンテーション特徴をFsiとし、同スケールにおける芸術的スタイル特徴をFajとする。最終的な特徴表現は、式14を用いて定義される:

ここで、Qi、Ki、およびViはそれぞれスケールiにおけるクエリ、キー、およびバリュー行列を表し、Nは特徴スケールの数を示します。本研究では、N = 4とし、これは入力画像サイズの1/4、1/8、1/16、および1/32の空間解像度で抽出された特徴マップに対応しています。これらのマルチスケール特徴表現は、再構成および芸術的合成の前に、学習可能なアテンション重みを用いて融合されました。上記の拡張により、本手法は文化的なモチーフやテクスチャをグローバルに抽出し、文化的なパターンを再構成することが可能になります。CAFFMは、提案するSegCycle-SPADEシステムにおいて、SegFormerベースのセグメンテーション段階とSPADEベースの創造的合成段階の間に位置しています。まず、CycleGANがスタイルおよびパターンに関連する情報を持つ再構成特徴を同時に生成する一方で、SegFormer-B2が文化的なモチーフの構造的特性を描写するセマンティック特徴マップを復元します。CAFFMモジュールはこれら2つの特徴ストリームを受け取り、クロスアテンションベースの融合を用いて、構造的表現と芸術的表現の間の関係を特定します。その後、セマンティックな一貫性と構造的特徴を維持しながら文化的に真正なパターンを作成するために、得られた融合特徴マップがSPADEモジュールに送られ、セグメンテーションガイド付きの創造的合成が行われます。
CycleGANを用いたパターンの再構成
アテンションベースの特徴量強調段階が完了すると、特徴マップには強調された文化的モチーフ構造が含まれます。しかし、特徴マップには依然として不完全または損傷したパターン領域が含まれている可能性があります。そこで、パターンの再構成という課題に対処するため、提案するフレームワークではCycleGANモデルを利用します。提案フレームワークにおいて、2つのドメインは元の文化的モチーフパターンと再構成された文化的モチーフパターンとなります。前の段階で得られた強調済みの特徴量を用いて、CycleGANモデルは構造的な一貫性を維持しながら文化的パターンの再構成を行います。これにより、幾何学模様、花柄、象徴的な模様などの文化的パターンが、その空間的配置を維持することが保証されます。元の苗族バティック(Miao Batik)の画像には、ランダムなマスキングおよび部分的な遮蔽処理を施し、不完全または損傷した文化的モチーフを生成しました。これらの劣化手順は、劣化した文化遺産に一般的に見られるパターンの欠落領域や構造的な損傷をシミュレートしたものです。劣化させた画像を再構成モジュールの入力として使用し、対応する元の画像を性能評価および再構成品質評価のための参照画像として使用しました。この戦略により、モデルは意味的な一貫性と文化的特性を維持しながら、欠落したモチーフ構造の復元を学習することが可能になりました。
Xを不完全な文化パターンのドメインとし、Yを再構成された文化パターンのドメインとします。2つのジェネレーターは、式15を用いて双方向マッピングを実行することを学習します:

ここでは、GEを用いてモチーフ構造を再構築し、FMを用いてパターンを元のドメインにマッピングします。再構築されたパターンが現実的であることを保証するために、敵対的損失が用いられます(式 16)30

ここで、DYは実パターンと再構成パターンを区別するために使用される識別器であり、GE(x)は生成された再構成パターンを表します。また、CycleGANは文化的なモチーフの構造的なレイアウトを保持するために、サイクル一貫性を強制します(式 17)30。

最終的な損失関数は、式1830を用いて定義されます:

ここで、λiはサイクル一貫性損失の重み係数を示し、オリジナルのCycleGANの定式化に従い、学習中は10に設定されました。この値は、敵対的学習と、ソースドメインおよびターゲットドメイン間の再構成の一貫性とのバランスを調整するために選択されました。
CycleGAN再構成モジュールは、双方向の画像変換を行うための2つのジェネレータと2つのディスクリミネータで構成されています。各ジェネレータは、最初の7 × 7畳み込み層、それに続く2つのダウンサンプリング畳み込み層、9つの残差ブロック、および2つのアップサンプリング層からなる残差ネットワーク(residual-network)アーキテクチャを採用しています。入力層では特徴抽出を強化するために7 × 7カーネルを使用していますが、それ以外のすべての畳み込み演算には3 × 3のカーネルサイズを用いています。学習の安定性を高めるために、各畳み込み層の後にインスタンス正規化(Instance Normalization)を適用し、ジェネレータネットワーク全体でReLU活性化関数を使用しています。出力層にはTanh活性化関数を用いて、正規化された画像出力を生成します。ディスクリミネータは、カーネルサイズ4 × 4の畳み込み層が連続し、特徴チャンネル数が段階的に増加する70 × 70のPatchGANアーキテクチャを採用しています。ディスクリミネータでは、特徴識別と敵対的学習を向上させるために、インスタンス正規化とLeakyReLU活性化(負の勾配 = 0.2)を用いています。CycleGANモジュールは、前処理済みの文化的なモチーフ画像を入力として受け取り、再構成されたパターンの表現を生成し、これをCAFFMに転送してセグメンテーション特徴と統合します。CycleGANの学習は、Adamオプティマイザ(β₁ = 0.5, β₂ = 0.999)を用い、初期学習率0.0002で実施しました。学習率は最初の100エポックの間維持され、その後、残りの学習期間にわたって線形にゼロまで減衰させました。ディスクリミネータの学習を安定させるため、過去に生成された50枚の画像を保持するリプレイバッファを使用しました。ジェネレータとディスクリミネータは1:1の更新比率で更新され、各学習イテレーションにおいて、1回のジェネレータ更新の後に1回のディスクリミネータ更新が行われました。
CycleGANの再構成プロセスは、図5のCAFFMメカニズムを用いて得られた強調特徴マップに基づいています。この特徴マップには、前段階のセグメンテーションおよびCAFFMから得られた、強調された文化的モチーフが含まれています。これらの特徴マップは、第1ジェネレーターGEへの入力として使用されます。第1ジェネレーターGEは、文化的パターンの再構成に必要なマッピングを学習します。その後、出力はディスクリミネーターDYに送られ、本物の文化的パターンと再構成されたパターンが区別されます。ディスクリミネーターDYは、ジェネレーターGEが写実的な出力を生成することを支援します。再構成中に文化的パターンが歪まないように、第2ジェネレーターFMがサイクル一貫性マッピング(cycle-consistency mapping)を実行します。第2ジェネレーターFMは、出力を元のドメインに再度マッピングします。その後、出力はディスクリミネーターによって評価され、写実性が確認されます。最終的な出力は、その後、提案するSegCycle-SPADEフレームワークの次段階である芸術的スタイル生成のために、SPADEモジュールへと送られます。

図5. CycleGANに基づくパターンの再構成ワークフロー。CycleGAN再構成モジュールのワークフロー。不完全な文化的モチーフを再構成するため、アテンション強化された特徴表現がジェネレーターネットワークへの入力として提供されます。ディスクリミネーターは、再構成された出力をリファレンスパターンと照らし合わせて評価し、サイクル一貫性マッピングによって双方向の画像変換における構造的完全性が維持されます。再構成されたモチーフは、その後、芸術的スタイル合成のためにSPADEモジュールに送られます。こちらのリンクをクリックして、この図の拡大版を表示してください。
SPADEを用いた芸術的スタイルの生成
続いて、再構成された文化的モチーフをSPADEモジュールにかけ、芸術的スタイルを生成します。SPADEモジュールの主な目的は、モチーフの構造的なレイアウトを損なうことなく、再構成された文化的モチーフに視覚的に豊かな芸術的スタイルのテクスチャを加えることです。SPADEモジュールは、画像生成に画像セグメンテーションの概念を利用した条件付き画像生成手法です。SegFormer-B2によって作成されたセマンティックセグメンテーションマスクから、あらかじめ定義されたモチーフクラスに対応するマルチチャネルのセマンティックマップをエンコードしました。SPADEジェネレーターは、これらのエンコードされたマップを条件付け入力として受け取りました。各SPADEレイヤー内の畳み込み層でセマンティックマップを処理することにより、空間適応的なスケーリング(γ)およびバイアス(β)パラメータが生成されました。これにより、ジェネレーターはこれらのパラメータを正規化された特徴量アクティベーションに適用することで、芸術的な合成過程においてモチーフの境界、構造的レイアウト、およびセマンティック情報を維持することができました。条件付けプロセスがSPADEジェネレーターの複数のレイヤーで実行されたため、セマンティックガイダンスは高レベルの構造再構成と低レベルのテクスチャ合成の両方に影響を与えることができました。その結果、生成された芸術的パターンは、セグメンテーション段階で得られた文化的モチーフの構造を維持しつつ、WikiArtデータセットから得られたスタイル上の特徴を取り込むことができました。
ルネサンス、印象派、キュビスム、表現主義、シュルレアリスム、写実主義、抽象芸術など、27の異なる芸術カテゴリーの作品を含むWikiArtデータセットを、芸術的スタイルの理解のための主要なリソースとして使用した。モデルを多様な創造的特性に触れさせ、スタイルの汎化性能を高めるため、トレーニング中にさまざまなカテゴリーからスタイル画像をランダムに選択した。スタイルのバイアスを軽減するため、データセットをトレーニング、検証、テストのサブセットに分割し、芸術カテゴリーが均衡に分布するようにした。全27の芸術カテゴリーを均等に表現するため、層化抽出法を用いた。元のクラス分布を維持しながら、各カテゴリーのサンプルをトレーニング、検証、テストの各サブセットに比例的に割り当てた。CycleGANによって生成された再構成特徴量と、WikiArt画像から得られたスタイル側面を統合するために、CAFFMモジュールを使用した。合成ネットワークが、セグメンテーションマップから得られた意味構造および文化的モチーフの境界を維持しつつ、芸術的特性を転送できるように、得られた融合表現を条件付け情報としてSPADEジェネレーターに提供した。このスタイル条件付け手法により、提案したフレームワークは、構造的およびスタイル的な表現が整合した、文化的に真正な芸術的パターンの生成を可能にした。
SPADEはまた、セグメンテーションマップに依存する空間適応型パラメータを導入しています。これらのパラメータは、式191に示すように定義できます。

ここで、γ(S)は空間的に変化するスケールパラメータであり、β(S)は空間的に変化するバイアスパラメータです。これらのパラメータにより、ジェネレータは画像内のセマンティック領域に応じて、異なるテクスチャやスタイルを生成することが可能になります。最終的な文化的芸術作品は、式 20に示すように定義されます:

ここで、GEはSPADEジェネレータ、XrPは再構成されたパターン、SMはセグメンテーションマップである。最終的な作品は、芸術的な外観を向上させつつ、文化的モチーフの構造的な整合性を維持している。提案されたSegCycle-SPADEアーキテクチャを最適化するために、セマンティックセグメンテーションの精度、文化的モチーフの保存、パターンの再構成品質、および芸術的スタイルの整合性のバランスを取る複合損失関数が用いられた。全体の学習目的を確立するために、セグメンテーション損失(Lseg)、敵対的損失(Ladv)、サイクル一貫性損失(Lcycle)、再構成損失(Lrecon)、モチーフ保存損失(Lmotif)、およびスタイル整合性損失(Lstyle)の重み付き混合が使用された。総損失関数は式21で定義される:
(21)
入力された文化的なモチーフと再構成されたモチーフとの間の構造的一貫性を保証するため、サイクル一貫性損失係数は10に設定されました。きめ細かなモチーフの特徴を維持し、視覚的な正確性を高めるため、再構成損失係数は5に設定されました。芸術的な合成における文化的に重要な構造パターンの保存を強調するため、モチーフ保存損失には係数2を用いました。セマンティックなモチーフ構造を過度に歪ませることなく芸術的なスタイル転送を促進するため、スタイル一貫性損失係数は1に調整されました。写実的な画像生成と精密なモチーフセグメンテーションの寄与度のバランスを維持するため、セグメンテーション損失と敵対的損失には等しい重みが割り当てられました。スタイル一貫性損失の算出には、WikiArtデータセットの特徴量ベースのスタイル表現が使用されました。具体的には、深い特徴マップから得られたグラム行列の相関を用いて、芸術的なスタイルの特性を抽出しました。スタイル損失の算出には、ターゲットとなるスタイル画像と生成された画像のグラム行列間のフロベニウスノルムの差を用いました。これは式22に示されています:

ここでは、 G申し訳ございませんが、翻訳対象となるソーステキストが提供されておりません。翻訳が必要な英文をご提示ください。 グラム行列は、~から計算されますか 翻訳対象のテキストを提供してください。th フィーチャーレイヤー I遺伝子 生成された芸術的画像を表し、 Iスタイル はWikiArtデータセットからのターゲットスタイル画像を表し、 F はフロベニウスノルムを表す。この定式化により、提案されたフレームワークは、文化的モチーフの構造的および意味的な整合性を維持しつつ、芸術的な特性を保存することが可能となる。
CAFFMモジュールによって生成された融合特徴表現は、提案フレームワークの芸術的合成コンポーネントとして機能するSPADEモジュールの条件付け入力として使用されます。SPADEジェネレーターは、潜在特徴次元が256チャネルの7つのSPADEレジデュアルブロックで構成され、256 × 256ピクセルの解像度で出力画像を生成します。SegFormer–CAFFMモジュールから得られたセマンティックセグメンテーションマップが、SPADEレジデュアルレイヤー全体を通して条件付け入力として使用されます。SPADEレイヤーは各レジデュアルブロック内の活性化関数の前に適用され、セグメンテーションによるガイド付きセマンティック条件付けを可能にします。連続的なアップサンプリングと畳み込み演算を通じて、潜在特徴表現が段階的に洗練され、セマンティックな一貫性とモチーフ構造を維持しながら高解像度の芸術的パターンが生成されます。ジェネレーター全体にLeakyReLU活性化関数が使用され、出力層には正規化された画像を生成するためにTanh活性化関数が適用されます。
アルゴリズムおよびワークフロー
SegCycle-SPADEフレームワークは、セマンティックセグメンテーション、特徴融合、パターンの再構成、および芸術的スタイル合成を統合した単一のトレーニングパイプラインで構成されています。ワークフローは、画像のサイズ変更、正規化、デノイジング、およびセグメンテーションマスクの作成を含む、データセットの取得と前処理から始まります。前処理された画像は、その後SegFormer-B2セグメンテーションネットワークを用いて処理され、セマンティックなモチーフ表現が抽出されます。得られたセグメンテーション特徴はCAFFMを通じて再構成特徴と融合され、構造的なモチーフ情報と芸術的な特徴表現との間の相互作用が可能になります。融合された特徴マップはCycleGAN再構成モジュールに供給され、セマンティックな一貫性を維持しながら不完全な文化的モチーフ構造を復元します。再構成されたパターンは、その後SPADEジェネレーターに提供され、セグメンテーションに基づいた芸術的合成が行われ、モチーフの境界と構造的な真正性を維持しつつ、スタイルの強化が行われます。トレーニング中、モデルパラメータは式21および22に記載されている複合損失関数を用いて最適化され、これによりセグメンテーション精度、モチーフの保存、再構成品質、および芸術的スタイルの整合性がバランスされます。データセットのロード、前処理、モデルの初期化、トレーニングの反復、検証手順、チェックポイントの選択、および最終評価を含む詳細なステップバイステップの実装ワークフローは、補足ファイル1(アルゴリズム1)に提供されています。完全なアルゴリズミックワークフローは、バッチサイズ16、学習率0.0002、トレーニングエポック数100で実装されました。データセットの分割、モデルの初期化、およびすべてのトレーニング実験には、固定ランダムシード42が使用されました。再現性を確保するため、このシードはPython、NumPy、およびPyTorchの乱数ジェネレーターに一貫して適用されました。Adamオプティマイザーは、β₁ = 0.5、β₂ = 0.999、および重み減衰なし(weight decay = 0)で設定されました。モデルのチェックポイントは、検証データセットで達成された最高の検証IoUスコアに基づいて選択されました。
損失関数の最適化
再構成および芸術的合成において文化的なモチーフ構造を維持するため、提案されたフレームワークでは、セグメンテーション損失、敵対的損失、サイクル一貫性損失、再構成損失、モチーフ保存損失、およびスタイル一貫性損失を組み合わせた複合的な最適化目的関数を採用しています。完全な数式、重み係数、およびスタイル損失の定義は、Artistic Style Generation using SPADEサブセクションの式21および22に記載されています。モチーフ保存コンポーネントは、予測されたモチーフ領域と対応するグランドトゥルースのセグメンテーションマスクとの間の構造的な偏差にペナルティを課すことで、再構成プロセス全体を通じて文化的に重要なパターン構造の保存を促進します。
提案されたSegCycle-SPADEフレームワークの評価には、苗族バティック(Miao Batik)文化モチーフデータセットとWikiArtデータセットの2つのデータセットが使用されました。苗族バティックデータセットは伝統的な文化遺産画像を含んでおり、主にセマンティックセグメンテーションおよび構造再構成タスクに使用されました。一方、WikiArtデータセットは多様な芸術的スタイルを含んでおり、芸術的スタイルの学習および生成に使用されました。両データセットの画像は、セマンティックセグメンテーション、CAFFM、パターン再構成、およびSPADEベースの芸術的スタイル生成を含む、完全なSegCycle-SPADEパイプラインを通じて処理されました。文化モチーフ情報と芸術的スタイル表現を統合することにより、本フレームワークは文化的に意味があり、視覚的に一貫した出力を生成することが可能となりました。
すべての実験は、Intel Core i7プロセッサとNVIDIA GPUを搭載したGPU対応ワークステーションで実施されました。具体的には、Intel Core i7(第11世代)CPU、24 GB VRAM搭載のNVIDIA RTX 3090 GPU、および32 GBのシステムメモリを搭載したワークステーションを使用しました。モデルはPython 3.8およびCUDA加速を用いたPyTorch 1.10を用いて実装されました。トレーニングは、分散トレーニングを行わず、シングルGPU構成で実施しました。すべての実験を通じて標準的なFP32精度を使用し、混合精度トレーニングは採用しませんでした。オプティマイザにはAdamを使用し、バッチサイズ16で100エポックのトレーニングを行いました。表3に、本研究で使用した実装パラメータおよび計算環境をまとめます。
提案されたアーキテクチャは、セマンティックセグメンテーション用のSegFormer-B2、特徴融合用のCAFFM、モチーフ再構成用のCycleGAN、および芸術的スタイル合成用のSPADEの4つの主要コンポーネントで構成されています。両データセットの画像は、トレーニング前に256 × 256ピクセルにリサイズされました。この標準化された解像度により、重要なモチーフの詳細を保持しつつ計算効率を確保し、CycleGANおよびSPADE両モジュールの安定した敵対的学習に寄与しました。
提案されたフレームワークの性能は、セグメンテーション精度、IoU、Dice係数(Dice)、SSIM、PSNR、およびFIDを含む、セグメンテーションおよび画像品質評価指標を用いて評価されました。視覚的な真正性は、生成された文化的パターンの目視検査を通じて定性的に評価されました。定性評価では、参照した文化的モチーフに対するモチーフの保持、意味的一貫性、文化的特性、および芸術的な外観に焦点を当てました。なお、視覚的な真正性は独立した定量的評価指標としては使用していません。
提案されたフレームワークの定量評価は、以下の指標を用いて行われました。
セグメンテーション精度は、式23を用いて算出されました:

ここで、TP、TN、FP、および FN は、それぞれ真陽性、真陰性、偽陽性、および偽陰性を表します。
IoUは式24を用いて算出した:

Dice係数(Dice Similarity Coefficient)は、式25を用いて算出した:

知覚的な画像の類似性を評価するためにSSIMが用いられ、以下のように定義される。 式2633:
(26)
ここで、μは平均強度、σは分散、σxyは画像間の共分散、C1およびC2は安定化定数を表します。
PSNRは生成された画像の品質を評価するために一般的に使用される指標であり、式 2733で定義されます:

ここで、MaxIは画像の最大画素値を表し、MSEは元の画像と再構成された画像との間の平均二乗誤差を表します。
FIDは、式 2833に示すように、平均と共分散行列を用いて算出できます。
(28)
ここで、μrは実画像の平均値、μgは生成画像の平均値であり、ΣrおよびΣgはそれぞれ実画像と生成画像の共分散行列である。
性能比較のため、提案したフレームワークを、セマンティックセグメンテーション、画像再構成、および芸術的画像生成で一般的に用いられている代表的な手法と比較評価した。セグメンテーションのベースラインとしてU-NetおよびDeepLabV3+を、再構成のベースラインとしてPix2PixおよびCycleGANをそれぞれ含めた。また、代表的な芸術的画像生成手法としてStyleGANおよびAttentionGANを用いた。これらの比較は、構造的モチーフ情報を保持しつつ、同時に芸術的品質を向上させるという点におけるSegCycle-SPADEの有効性を評価するために実施した。
性能の安定性と再現性を評価するため、各実験を5回繰り返した。すべての実験において一貫したトレーニング、検証、およびテストサブセットを確保するため、データセットの分割には固定ランダムシードとして42を使用した。結果は平均値 ± 標準偏差として報告している。Accuracy、IoU、Dice、SSIM、PSNR、およびFIDにおいて観察された標準偏差の値が低いことは、提案したフレームワークが繰り返しの実験実行を通じて安定した性能を達成したことを示している。統計的有意性は対応のあるt検定を用いて評価し、p < 0.05の場合に統計的に有意であると見なした。すべてのモデルが同一のデータセット分割で評価されたため、繰り返しの実行間で対応のある性能測定値が得られ、対応のあるt検定の使用が正当化された。複数のペア比較に伴うファミリーワイズ誤差率を制御するため、ボンフェローニ補正を適用し、調整済みしきい値 α/n(nはペア比較の数を示す)を用いて統計的有意性を判定した。
実験結果は、提案されたSegCycle-SPADEフレームワークの有効性を強く支持しています。SegFormer-B2によって達成された優れたセグメンテーション性能は、文化的に重要なモチーフの境界を正確に特定し、保持する能力があることを示しています。IoUおよびDiceスコアの向上は、処理パイプライン全体を通じてセマンティックなモチーフ構造が効果的に保持されたことをさらに示しています。CycleGANとSPADEの統合により、SSIMおよびPSNR値の向上に反映されている通り、微細な視覚的詳細を維持しながら不完全なモチーフ構造を正常に再構築できました。さらに、FIDスコアの低下は、生成された芸術的パターンが本物の文化・芸術的画像に対してより高い類似性を示していることを意味しており、様式的な一貫性と視覚的なリアリズムが向上したことが示唆されます。
CAFFMは、セグメンテーションから得られた構造情報と生成的なスタイル表現との間の効果的な相互作用を促進することにより、これらの改善に大きく貢献しました。クロスアテンションに基づく特徴融合を通じて、CAFFMは文化的なモチーフ間の長距離関係を維持しつつ、構造的な忠実度と芸術的な真正性の両方を向上させました。
図 6は、Miao BatikおよびWikiArtデータセットにおける、提案手法であるSegCycle-SPADEフレームワークと既存手法とのセグメンテーション精度の比較を示しています。U-NetやDeepLabV3+などの従来のセグメンテーション手法は、空間表現を学習する能力があるため、競争力のある性能を達成しました。一方で、Pix2PixやCycleGANは、セグメンテーションタスク専用に設計されていないため、セグメンテーション精度が低い結果となりました。提案するSegCycle-SPADEフレームワークは、SegFormer-B2とCAFFMベースの特徴量強化を統合したことにより、両データセットにおいて最高のセグメンテーション精度を達成しました。

図 6. 各手法におけるセグメンテーション精度の比較。Miao BatikおよびWikiArtデータセットを用いて、U-Net、DeepLabV3+、Pix2Pix、CycleGAN、および提案するSegCycle-SPADEフレームワークで得られたセグメンテーション精度の比較。結果は5回の独立した試行(n = 5)の平均値 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を表す。値が高いほど、セグメンテーション性能が向上していることを示す。提案するSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のセグメンテーション精度を達成した。こちらのリンクをクリックして、この図の拡大版を表示してください。
図7は、評価した各手法間でのIoUの比較を示しています。U-NetおよびDeepLabV3+は、セグメンテーションに特化したアーキテクチャを持つため、高いオーバーラップ性能を達成しました。対照的に、Pix2PixおよびCycleGANは、主目的がセマンティックセグメンテーションではなく画像変換であるため、IoUの値が低くなりました。提案するSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のIoU値を達成し、文化的なモチーフ領域の局在化と保存が改善されたことを示しました。

図 7. 文化的なモチーフのセグメンテーションにおけるIntersection over Union (IoU)スコアの比較。Miao BatikおよびWikiArtデータセットを用いた、セグメンテーション手法間でのIoU性能の比較。結果は5回の独立した試行(n = 5)の平均値 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を示す。IoU値が高いほど、予測されたモチーフ領域と参照モチーフ領域の重なりが改善され、モチーフの境界がより正確に保持されていることを示す。提案されたSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のIoUスコアを達成した。こちらのリンクをクリックして、この図の拡大版を表示してください。
図 8にDice係数の比較を示す。Dice係数は、予測されたセグメンテーションマスクとグランドトゥルースのモチーフ領域との重なりを測定する。従来のセグメンテーション手法は、空間構造の学習に有効であるため、比較的高いDiceスコアを達成した。しかし、提案したSegCycle-SPADEフレームワークは両方のデータセットにおいて最高のDiceスコアを達成し、セグメンテーションの一貫性とモチーフの保存性が向上していることが示された。

図 8. 文化的なモチーフセグメンテーションにおけるDice係数の比較。Miao BatikおよびWikiArtデータセットを用いて、異なるセグメンテーション手法で得られたDice係数の値を比較した。Dice係数は、予測されたセグメンテーションマスクと参照マスクの重なりを評価するものであり、値が高いほどセグメンテーション性能とモチーフ領域の識別能が向上していることを示す。提案されたSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高のDice係数を達成した。こちらのリンクをクリックして、この図の拡大版を表示してください。
図9に、再構成された文化パターンのSSIM比較を示す。Pix2Pix、CycleGAN、StyleGANなどのGANベースの手法は、画像生成用に設計されているため、従来のセグメンテーション手法よりも高いSSIM値を達成した。それにもかかわらず、提案したSegCycle-SPADEフレームワークは両方のデータセットで最高のSSIM値を達成し、構造的な詳細と芸術的な一貫性がより優れた状態で保持されていることが示された。
図 9. 構造的類似性指標 (SSIM) の比較。Miao Batik および WikiArt データセットを用い、異なる再構成手法で得られた構造的類似性指標 (SSIM) 値の比較。結果は、5 回の独立した実行 (n = 5) による平均値 ± 標準偏差 (SD) で示されている。エラーバーは 1 標準偏差を示す。SSIM 値が高いほど、再構成されたパターンと参照パターンの間の構造的類似性が高いことを示す。提案する SegCycle-SPADE フレームワークは、両方のデータセットにおいて最高の SSIM スコアを達成した。こちらのリンクをクリックして、この図の拡大版を表示してください。
生成された芸術的パターンのリアリズムと分布の類似性を評価するために、FIDを用いました。FIDの算出には、事前学習済みのInception-v3ネットワークを使用し、pool3層から特徴ベクトルを抽出して、2048次元の特徴表現を得ました。特徴抽出の前に、生成画像および参照画像をバイリニア補間を用いて299 × 299ピクセルにリサイズし、標準的なInception-v3前処理プロトコルに従って正規化しました。FIDは、独立したテストデータセットから抽出された特徴分布を用いて算出しました。平均および共分散統計量は特徴埋め込みから推定し、標準的なFID定式化の中で使用しました。
表4に示されるように、Pix2PixやCycleGANなどの従来の画像生成手法は、明示的な構造的ガイダンスを欠いていたため、FIDスコアが比較的高い値となりました。StyleGANおよびAttentionGANは、特徴学習能力の向上により、より低いFIDスコアを達成しました。しかし、提案したSegCycle-SPADEフレームワークは、両方のデータセットにおいて最低のFIDスコアを達成し、優れた画像のリアリズム、スタイルの整合性、および文化的モチーフの保存性を実証しました。
| 方法 | ミャオ族バティックデータセット (FID) | WikiArtデータセット(FID) |
| Pix2Pix | 48.6 | 52.3 |
| CycleGAN | 42.8 | 46.5 |
| StyleGAN | 39.7 | 43.1 |
| AttentionGAN | 36.9 | 40.4 |
| SegCycle-SPADE(提案手法) | 28.5 | 31.2 |
表4: 文化パターンの再構成におけるFrechet Inception Distance (FID) の結果。Miao BatikおよびWikiArtデータセットを用いて、提案するSegCycle-SPADEフレームワークとベースラインの生成モデルによって得られたFrechet Inception Distance (FID) スコアを比較した。FID値が低いほど、生成画像と実画像の特長分布の類似性が高く、したがって再構成された文化パターンの視覚的なリアリズムが向上していることを示す。
図10は、異なる手法によって達成された再構成品質を比較したものである。再構成品質(%)は、再構成画像と対応する参照画像との間のSSIMをパーセンテージスケールに変換して算出した(SSIM × 100)。パーセンテージが高いほど、元の文化的なモチーフに対する構造的な忠実度と視覚的な類似性が高いことを示す。Pix2PixやCycleGANなどの従来の生成モデルは、中程度の再構成性能を達成した。StyleGANやAttentionGANを含むより高度なアーキテクチャは、機能学習能力の向上により、再構成品質の改善を達成した。しかし、提案されたSegCycle-SPADEフレームワークは、セマンティックセグメンテーションガイダンス、クロスアテンション特徴融合、再構成学習、および芸術的合成を統合しているため、最高の再構成品質を達成した。

図 10. パターン再構成品質の比較。Miao BatikおよびWikiArtデータセットにおいて、Pix2Pix、CycleGAN、StyleGAN、AttentionGAN、および提案するSegCycle-SPADEフレームワークを用いて達成された再構成品質の比較。結果は5回の独立した試行(n = 5)の平均値 ± 標準偏差(SD)として示されている。エラーバーは1標準偏差を示す。値が高いほど、構造的な詳細の保存、意味的な一貫性、および視覚的な忠実度が向上していることを示す。提案するSegCycle-SPADEフレームワークは、両方のデータセットにおいて最高の再構成品質スコアを達成した。ここをクリックして、この図の拡大版を表示してください。
再構成画像と対応する参照画像との間のピクセルレベルの類似性を測定することにより、再構成の忠実度を評価するためにPSNRを用いました。PSNRは、各再構成画像と、正解参照として使用した対応する元の苗族バティック画像との間で算出しました。PSNR値が高いほど、再構成誤差が小さいことを示します。表5に示すように、Pix2PixとCycleGANは、明示的な構造的ガイダンスなしにパターンを再構成したため、中程度のPSNR値となりました。StyleGANとAttentionGANは、より深い特徴学習を通じて、より高いPSNR値を達成しました。提案したSegCycle-SPADEフレームワークは、両方のデータセットで最高のPSNR値を達成し、優れた再構成忠実度と文化的モチーフ構造の保持能力を実証しました。
| 手法 | Miao Batik データセット (PSNR, dB) | WikiArt データセット (PSNR, dB) |
| Pix2Pix | 25.8 | 24.6 |
| CycleGAN | 27.3 | 26.1 |
| StyleGAN | 28.7 | 27.5 |
| AttentionGAN | 29.9 | 28.6 |
| SegCycle-SPADE(提案手法) | 32.4 | 31.2 |
表 5: 文化的パターンの再構成におけるピーク信号対雑音比(PSNR)の結果。Miao BatikおよびWikiArtデータセットを用いて、提案するSegCycle-SPADEフレームワークとベースライン手法によって得られたピーク信号対雑音比(PSNR)値の比較。PSNR値が高いほど、対応する参照画像に対する再構成の忠実度が向上し、歪みが減少していることを示す。
図11 提案されたSegCycle-SPADEフレームワークの学習時における収束挙動を示す。損失曲線は、5回の独立した学習ランで平均した平均学習損失を表している。確率的な変動を抑え、学習の収束をより堅牢に表現するため、各エポックにおける損失値をすべてのランで平均化した。学習の初期エポックでは、モデルが入力データから特徴表現を学習している段階であったため、損失値は比較的高かった。学習が進むにつれて、すべての損失成分が徐々に減少し安定しており、セグメンテーション、再構成、および芸術的合成の目的関数が正常に最適化されたことを示している。観察された収束挙動は、提案フレームワークの学習における有効性、安定性、および再現性を実証している。

図11提案されたSegCycle-SPADEフレームワークの学習収束。 提案したSegCycle-SPADEフレームワークの100エポックにわたる学習損失曲線。5回の独立した学習ランの平均値(n = 5)を示す。本図は、学習中の全損失(LTotal)、セグメンテーション損失(LSeg)、ジェネレーター損失(LG)、およびディスクリミネーター損失(LD)の推移を示している。すべての損失成分が緩やかに減少し、その後安定していることは、提案フレームワークの収束が成功し、最適化が安定して行われたことを示している。 こちらの図の拡大版を表示するには、ここをクリックしてください。
アブレーション研究
提案されたSegCycle-SPADEフレームワークにおける各構成要素の寄与を評価するため、複数の制御されたモデル構成を用いてアブレーション研究を実施した。結果は表6および表7にまとめられている。
| モデル構成 | セグメンテーション精度 (%) | IoU | SSIM |
| SegFormerのみ | 87.3 | 0.76 | 0.82 |
| SegFormer + CAFFM | 89.6 | 0.79 | 0.86 |
| SegFormer + CAFFM + CycleGAN | 91.4 | 0.82 | 0.89 |
| SegFormer + CAFFM + CycleGAN + SPADE(提案手法) | 93.8 | 0.86 | 0.93 |
表 6: SegCycle-SPADE コンポーネントのアブレーション研究。個々のフレームワークコンポーネントの寄与を評価するために、段階的に強化されたモデル構成の性能を比較した。本研究では、セマンティックセグメンテーション、Cross-Attention Cultural Feature Fusion Module (CAFFM)、CycleGANベースの再構成、およびSPADEベースの芸術的合成が、セグメンテーション精度、Intersection over Union (IoU)、および Structural Similarity Index (SSIM) に及ぼす影響を検証している。値が高いほど、モチーフのセグメンテーション、再構成の品質、および構造の保存性が向上していることを示す。
| バリアント | IoU (%) | Dice (%) | SSIM | PSNR (dB) | FID ↓ |
| SegFormerのみ | 84.2 ± 0.4 | 88.5 ± 0.3 | 0.82 ± 0.01 | 24.8 ± 0.2 | 31.8 ± 0.6 |
| SegFormer + CycleGAN | 86.7 ± 0.3 | 90.2 ± 0.2 | 0.85 ± 0.01 | 26.3 ± 0.2 | 27.5 ± 0.5 |
| SegFormer + SPADE | 87.0 ± 0.3 | 90.5 ± 0.2 | 0.88 ± 0.01 | 27.8 ± 0.2 | 23.4 ± 0.4 |
| SegFormer + CAFFM | 90.0 ± 0.2 | 93.1 ± 0.2 | 0.90 ± 0.01 | 29.6 ± 0.1 | 20.3 ± 0.3 |
| SegCycle-SPADE (フルモデル) | 93.0 ± 0.2 | 95.4 ± 0.1 | 0.92 ± 0.01 | 31.2 ± 0.1 | 17.6 ± 0.2 |
表7: 提案するSegCycle-SPADEフレームワークの構成要素の寄与度分析。CAFFM、CycleGAN、SPADE、および完全なSegCycle-SPADEアーキテクチャの寄与度を評価するために使用した、個々のフレームワーク変体による性能比較。結果は、Intersection over Union (IoU)、Dice係数、構造的類似性指数 (SSIM)、ピーク信号対雑音比 (PSNR)、およびFrechet Inception Distance (FID)を用いて報告されている。IoU、Dice、SSIM、およびPSNRの値が高いほどセグメンテーションおよび再構成の品質が向上していることを示し、FIDの値が低いほど生成された文化パターンの視覚的な現実感が高いことを示す。
表 6 では、(i) SegFormerのみ、(ii) SegFormer + CAFFM、(iii) SegFormer + CAFFM + CycleGAN、および (iv) SegFormer + CAFFM + CycleGAN + SPADE(提案フレームワーク)の4つの構成を用いて、主要なフレームワーク構成要素の累積的な寄与を評価しています。ベースラインのSegFormerモデルでは、セグメンテーション精度 87.3%、IoUスコア 0.76、SSIM値 0.82を達成しました。CAFFMモジュールを組み込むことで、すべての評価指標においてパフォーマンスが向上し、セグメンテーション精度は 89.6%、IoUは 0.79、SSIMは 0.86へと上昇しました。さらにCycleGANを追加したことで、構造再構成能力が向上し、IoU 0.82、SSIM値 0.89となりました。完全なSegCycle-SPADEフレームワークは、セグメンテーション精度 93.8%、IoU 0.86、SSIM値 0.93となり、総合的に最高のパフォーマンスを達成しました。これらの結果は、各構成要素がセグメンテーション精度の向上、構造の保存、および画像再構成品質の向上に段階的に寄与していることを示しています。
表7では、(i) SegFormerのみ、(ii) SegFormer + CycleGAN、(iii) SegFormer + SPADE、(iv) SegFormer + CAFFM、および(v) SegFormer、CAFFM、CycleGAN、SPADE、およびmotif-preservation lossを統合したフルモデルの5つのモデルバリアントを用いて、個々のフレームワーク構成要素の寄与をさらに調査しています。性能評価には、IoU、Dice係数、SSIM、PSNR、およびFIDメトリクスが使用されました。
ベースラインのSegFormerのみの構成では、IoU 84.2%、Dice係数 88.5%、SSIM値 0.82、PSNR 24.8 dB、およびFIDスコア 31.8を達成した。CycleGANを追加することで再構成品質が向上し、FIDスコアは27.5まで低下し、画像のリアリズムが向上したことが示された。さらにSPADEを組み込むことで構造的類似性と画像品質がさらに向上し、SSIM値 0.88、FIDスコア 23.4となった。提案するCAFFMモジュールの導入により、すべての指標で大幅な改善が見られ、IoUは90.0%、Dice係数は93.1%、SSIMは0.90、PSNRは29.6 dBに上昇し、同時にFIDスコアは20.3まで低下した。さらにモチーフ保存損失(motif-preservation loss)を組み込んだ完全なモデルでは、IoU 93.0%、Dice係数 95.4%、SSIM値 0.92、PSNR 31.2 dB、FIDスコア 17.6となり、最高の総合性能を達成した。
表8は、文化遺産のパターンの再構築および保存に使用される代表的なディープラーニング(DL)アプローチの比較概要を示しています。従来のCNNベースの手法は、効果的な局所特徴学習とセグメンテーション性能を提供しますが、長距離依存性のモデリングに制限があるため、複雑なモチーフ構造の保持に苦慮することがよくあります。GANベースの手法は、画像合成およびスタイル転送能力を向上させますが、意味的な不整合や微細な構造的詳細の喪失が生じる可能性があります。Transformerベースの手法は、グローバルな文脈理解を強化しますが、一般的に生成的な再構築能力に欠けており、一方で拡散ベースの手法は、計算複雑性の増大という代償に高い視覚的リアリズムを提供します。ハイブリッドなTransformer-GANアプローチは、特徴抽出と画像生成メカニズムを組み合わせることで、これらの制限に部分的に対処しています。対照的に、提案するSegCycle-SPADEフレームワークは、Transformerベースのセグメンテーション、クロスアテンション特徴融合、生成的再構築、およびセグメンテーション誘導型芸術合成を統一されたアーキテクチャ内に統合しており、これにより構造的忠実度、意味的一貫性、および文化的モチーフの保存性を向上させています。この比較は表8にまとめられています。
| 手法 | 基幹手法 | 長所 | 限界点 | 文化遺産への関連性 |
| CNNベースの手法(例:U-Net、DeepLabV3+) | 畳み込み特徴抽出およびセマンティックセグメンテーション | 効果的な局所特徴学習と高精度なセグメンテーション | 限定的な長距離依存関係のモデリング、複雑なモチーフ構造の保持の困難さ | モチーフのセグメンテーションには適しているが、芸術的な再構成への効果は低い |
| GANベースの手法(例:Pix2Pix、CycleGAN) | 敵対的画像生成および画像間変換 | 高品質な画像合成とスタイル転送 | 学習の不安定性、意味的な不整合、微細構造の詳細の消失の可能性 | パターンの復元には有用であるが、文化的モチーフを正確に保持できない可能性がある |
| Transformerベースの手法 | 自己注意機構とグローバルコンテキストモデリング | 長距離の依存関係および複雑な視覚的関係を捉える | 計算コストが高い。また、大規模なトレーニングデータセットが必要である。 | 複雑なパターン分析に有効であるが、単独で使用した場合の生成能力は限定的である |
| 拡散ベースの手法 | 反復的デノイジングに基づく画像生成 | 高い視覚的リアリズムと画像の多様性 | 推論速度の低下、高い計算コスト、限定的な構造制御 | ヘリテージ画像の生成に有望である一方、計算負荷が高い |
| ハイブリッドTransformer-GAN手法 | Transformerベースの特徴抽出とGANベースの生成の組み合わせ | グローバル特徴表現と画質の向上 | モチーフ保存のための明示的な意味論的ガイダンスが不足していることが多い | 生成品質を向上させるが、文化遺産のモチーフに特化して設計されているわけではない |
| 提案されたSegCycle-SPADE | SegFormer + CAFFM + CycleGAN + SPADE | Transformerベースのセグメンテーション、アテンション誘導型特徴融合、意味的整合性、モチーフ保存、および制御可能な芸術的再構成 | 単独のCNNベースのアプローチよりも計算複雑度が高い | 構造的忠実度と意味的一貫性を向上させ、文化遺産のパターンの再構築および保存のために特化して設計されています。 |
表8: 文化遺産のパターン再構成および保存における代表的なディープラーニング手法の比較。画像セグメンテーション、パターン再構成、スタイル生成、および文化遺産保存に使用される代表的なディープラーニング手法の定性的比較。本表では、各手法の核心となる手法、長所、限界、および適用性をまとめ、提案するSegCycle-SPADEフレームワークが、セマンティックセグメンテーション、特徴融合、再構成、およびスタイル合成をどのように組み合わせ、文化遺産パターンの構造保存とセマンティックな一貫性に関する課題に対処しているかを強調している。
観察された改善は、CAFFMモジュールがクロスアテンションに基づく特徴融合を通じて、セグメンテーション由来の構造的特徴と芸術的スタイルの表現との相互作用を効果的に強化することを示しています。さらに、モチーフ保存損失は、再構成および芸術的合成において文化的に重要なモチーフ構造を維持することに寄与し、その結果、セグメンテーションの一貫性、構造的な忠実度、および視覚的なリアリズムが向上しました。総じて、アブレーション解析の結果から、SegFormer-B2、CAFFM、CycleGAN、SPADE、およびモチーフ保存損失の統合が、提案するSegCycle-SPADEフレームワークの優れた性能を実現していることが確認されました。
データの可用性:
芸術的スタイルの学習に使用されたWikiArtデータセットは、Kaggle WikiArtリポジトリ(https://www.kaggle.com/datasets/steubk/wikiart)を通じて公開されています。本研究で使用されたMiao Batikデータセットは、Zenodo(https://doi.org/10.5281/zenodo.20807658)経由で公開されています。提案されたSegCycle-SPADEフレームワークに関連する処理済みデータセット、セグメンテーションマスク、学習済みモデルの重み、生成された出力、およびPython実装ファイルも、同じZenodoリポジトリから入手可能です。
補足ファイル:
補足ファイル 1. アルゴリズム 1:提案する SegCycle-SPADE フレームワークの実装ワークフロー。 データセットの読み込み、前処理、SegFormer-B2 を用いたセマンティックセグメンテーション、Cross-Attention Cultural Feature Fusion Module (CAFFM) を用いた特徴融合、CycleGAN を用いた文化的モチーフの再構成、SPADE を用いた芸術的スタイルの合成、モデルのトレーニング、検証、チェックポイントの選択、および最終的な性能評価を含む、提案する SegCycle-SPADE フレームワークの完全な実装パイプラインを記述したステップバイステップの擬似コード。 こちらをクリックしてファイルをダウンロードしてください。
伝統工芸の緩やかな喪失に伴い、近年、無形文化遺産(ICH)パターンの保存とデジタル再構築への関心が高まっています。先行研究では、ディープラーニング(DL)に基づく画像処理技術を用いて文化遺産の喪失に対処することが試みられてきました。例えば、Quanら32は、貴州省の苗族バティック文化を対象に、ナレッジグラフとDLに基づく文化遺産保存フレームワークを提案しました。この研究は文化パターンのデジタル再構築に焦点を当てていましたが、その手法は主にナレッジグラフによる表現に依存していました。同様に、FuとRazmjooy16は、文化遺産画像の強調および修復のために、特徴ピラミッドネットワーク(FPN)に基づくフレームワークを提案しました。この手法は画像強調のための効果的な特徴抽出を実現しましたが、不完全な文化パターンに対する画像セグメンテーションによる誘導や、生成的な再構築メカニズムは組み込まれていませんでした。対照的に、提案するSegCycle-SPADEフレームワークは、複数のDLコンポーネントを組み合わせることで、これらの課題を克服しています。まず、SegFormerモデルを用いたセマンティックセグメンテーションを採用し、文化遺産パターン内のモチーフ領域を正確に特定します。続いて、CAFFMベースの特徴強調モジュールにより、きめ細やかなモチーフ構造の特徴表現を改善します。その後、CycleGAN再構築モジュールを用いて、敵対的学習を通じて文化パターン内の欠損または不完全な領域を再構築します。最後に、SPADEモジュールが、セグメンテーションマップとの構造的な整合性を維持しながら、スタイルの強調を行います。既存のCNN、GAN、Transformer、および拡散ベースの手法17,19,20,21,22,23,24,25,30,34は、それぞれ独自の利点を有していますが、Table 8にまとめられているように、セマンティックな一貫性の保持、構造的特徴の維持、または計算効率の達成において限界もあります。提案するSegCycle-SPADEアーキテクチャは、SegFormerベースのセグメンテーション、クロスアテンション特徴融合、CycleGAN再構築、およびSPADE誘導合成の強みを組み合わせることで、これらの限界に対処しています。その結果、本フレームワークは再構築品質を向上させ、文化的に重要なモチーフの保存性を高めることに成功しました。
有望な性能を示したものの、提案されたSegCycle-SPADEフレームワークには依然としていくつかの限界があります。第一に、評価がMiao BatikおよびWikiArtのデータセットのみを用いて行われたため、他の文化遺産ドメインへのフレームワークの汎用性が制限される可能性があります。第二に、SegFormer、CAFFM、CycleGAN、およびSPADEの統合により計算複雑性とメモリ要件が増大するため、リソース制限のあるプラットフォームへの展開が困難な場合があります。第三に、セグメンテーション性能はモチーフアノテーションの品質と一貫性に大きく依存しており、アノテーションのバイアスが文化的に重要な構造の保存に影響を与える可能性があります。最後に、本フレームワークは2つのデータセットのみで評価されたため、多様な文化遺産コレクションへの適用性を確保するには、追加のトレーニングデータとドメイン固有の適応が必要になる可能性があります。したがって、今後の研究では、より堅牢なトレーニング戦略、軽量なアーキテクチャ、改善されたアノテーション手順、および追加の文化遺産データセットを用いたクロスドメイン評価を検討する必要があります。
より大規模で多様な文化遺産データセットに対するSegCycle-SPADEフレームワークの拡張性は、今後の研究の主要な焦点となります。モデルの汎化性能と文化的適応性を向上させるため、異なる地域や芸術的伝統に由来する遺産モチーフの文化横断的な評価が調査される予定です。さらに、テキスト記述、歴史的記録、および文化的メタデータを組み込んだマルチモーダル拡張により、再構成中のより強力な意味論的ガイダンスが得られる可能性があります。また、画像ベースの再構成と3Dモデリング技術を統合することで、本フレームワークを3次元文化遺産再構成のサポートに拡張できる可能性があります。加えて、AI支援による文化遺産の保存および記録の実用的な応用を促進するため、デジタルアーカイブ、博物館、バーチャル展示、および文化遺産保存プラットフォームへの展開が検討されます。解釈可能性と文化的な真正性をさらに向上させるため、今後の研究では、文化知識グラフ、民族誌的記録、歴史的メタデータ、および専門家がキュレーションした知識ベースの統合を検討し、文化的に裏付けられたモチーフ分析と再構成を実現します32。
提案されたSegCycle-SPADEフレームワークを実装する際には、いくつかの実用的な考慮事項を検討する必要があります。CycleGANのトレーニング中、ジェネレーターとディスクリミネーターの損失のバランスが著しく崩れると、敵対的収束が不安定になる場合があります。このような状況では、学習率の低下、サイクル一貫性損失の重みの増加、またはディスクリミネーターの優位性の監視により、トレーニングの安定性が向上する可能性があります。ジェネレーターが視覚的に類似した出力を繰り返し生成する場合、モード崩壊が発生することがあります。この問題は、バランスの取れた敵対的トレーニング、リプレイバッファの利用、およびジェネレーターとディスクリミネーターの損失トレンドの慎重な監視によって軽減できます。また、文化的モチーフが複雑なテクスチャ、低コントラスト、または曖昧な境界を持つ場合、セグメンテーションの失敗が生じることがあります。この問題に対処するためには、トレーニング前に画像品質を確認し、アノテーションの一貫性を確保するためにセグメンテーションマスクを視覚的に検査する必要があります。信頼性の高いSegFormerの性能を達成するためには、推奨される入力解像度と正規化設定を維持することも重要です。さらに、不適切な学習率の設定、トレーニングデータの不足、またはハードウェアに関連する数値的な変動によって、トレーニングが不安定になる場合があります。再現性を向上させるためには、NumPy、PyTorch、CUDA、およびデータセットのシャッフル操作に固定の乱数シードを使用する必要があります。さらに、すべての実験ランにおいて、同一の前処理パイプライン、データセットの分割、モデルのハイパーパラメータ、およびソフトウェア環境を維持する必要があります。性能低下を防ぎ、中断されたトレーニングセッションからの復旧を容易にするために、定期的なチェックポイントの保存と検証損失の監視も推奨されます。
本研究は、AIベースの文化遺産復元フレームワークの理論的な進展に寄与するものである。従来の画像復元手法では、一般的に画像セグメンテーション、復元、およびスタイル生成を独立したプロセスとして扱ってきた17,19,20,30。対照的に本研究では、セグメンテーション誘導型生成復元戦略を通じてこれらのプロセスを統合するフレームワークを提案する。その結果、セグメンテーション、復元、およびスタイル生成を単一のフレームワーク内でどのように統一できるかを示すことで、AI支援による文化遺産復元の理論的発展に寄与している。このような統合は、モチーフの構造と意味的意味の保存が極めて重要である文化遺産への応用において特に重要である。実用的な観点から、提案されたフレームワークは、伝統的な文化パターンのデジタル保存、復元、および芸術的な向上に向けた効果的なソリューションを提供する。文化遺産機関、博物館、およびデザイナーは、SegCycle-SPADEを利用してモチーフ領域を自動的に特定し、損傷したまたは不完全なパターンを復元し、伝統的なデザインの視覚的に強化された芸術的表現を生成することができる。この機能は、歴史的な工芸品が部分的に損傷していたり不完全であったりする苗族のバティックテキスタイルパターンを含む、絶滅の危機に瀕した工芸伝統にとって特に価値がある。さらに、生成的なスタイル合成を組み込むことで、本フレームワークはテキスタイルデザイン、デジタル芸術創作、および遺産教育などの現代的な文化デザインアプリケーションをサポートすることが可能である。このように、提案されたフレームワークは、文化遺産の保存と現代の文化デザインアプリケーションの間の隔たりを埋めるものである。
しかしながら、提案したSegCycle-SPADEフレームワークによって有望な結果が得られたものの、いくつかの限界も残っています。第一に、評価がMiao BatikおよびWikiArtのデータセットのみを用いて行われたため、他の形態の文化遺産パターンの再構成における本フレームワークの汎化能力に影響を及ぼす可能性があります。第二に、再構成プロセスがGANベースのモデルに依存しているため、非常に複雑なモチーフ構造を扱う際に、生成された出力にアーティファクトや不自然なテクスチャが含まれる場合があります。第三に、現在のフレームワークは二次元パターンの再構成に焦点を当てていますが、一部の文化遺産遺物は本質的に三次元構造を有しています。総括すると、実験結果は、無形文化遺産(ICH)パターンの芸術的再構成における提案手法であるSegCycle-SPADEフレームワークの有効性を実証しています。SegFormerベースの意味論的セグメンテーション、CAFFM、CycleGANベースのモチーフ再構成、およびSPADEベースの芸術的合成の統合により、セグメンテーション、再構成、および画像品質の性能指標が一貫して向上しました。アブレーション研究により、各フレームワーク構成要素の寄与がさらに検証され、CAFFMとモチーフ保持損失が構造的な忠実度と視覚的な真正性を大幅に高めることが示されました。これらの知見は、意味論的セグメンテーション誘導型の再構成とクロスアテンション特徴融合を組み合わせることで、芸術的に豊かな出力を生成しつつ、文化的に重要なモチーフを効果的に保存できるという中心的な仮説を支持するものです。したがって、提案したフレームワークは、ICHパターンのデジタル保存、修復、および創造的な活性化のための、信頼性と再現性の高い計算論的アプローチを提供します。
利益相反:
著者は、競合する利益がないことを宣言します。
著者らは、本研究の遂行にあたり、広東工程 Polytechnic および華南師範大学から提供された学術的および機関的な支援に感謝いたします。本研究は、2023年国家社会科学基金一般プロジェクト(No. 23BH161)「(タイトル)」の支援を受けて実施されました。 「デジタル再生博物館:中国古典書画文化遺産の活性化と伝達に関する研究」
| 名前 | 会社 | カタログ番号 | コメント |
|---|---|---|---|
| Adam オプティマイザ | PyTorch Optimizer Library | Adam | モデルトレーニング中に使用される最適化アルゴリズム。 |
| CUDA Toolkit | NVIDIA Corporation | CUDA 11.3 | ディープラーニング計算のためのGPU加速。 |
| cuDNN | NVIDIA Corporation | cuDNN 8.2 | トレーニングと推論を高速化するために使用される深層ニューラルネットワーク加速ライブラリ。 |
| CycleGAN | University of California, Berkeley / オープンソース | Official PyTorch Implementation (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix) | 文化的なモチーフの再構成に使用される敵対的生成ネットワーク。 |
| ImageNet 学習済み重み | ImageNet / オープンソース | mit_b2.pth (ImageNet-1K Pretrained Checkpoint) | Miao Batik データセットでのファインチューニング前に、SegFormer-B2 バックボーンを初期化するために使用。 |
| Intel プロセッサ | Intel Corporation | Intel Core i7 (第11世代) | 画像の前処理、モデルトレーニングのサポート、および推論に使用されるCPU。 |
| Matplotlib | Matplotlib Development Team | Matplotlib 3.5.1 | トレーニング曲線と評価結果の可視化。 |
| Miao Batik データセット | Zenodo Repository | DOI: 10.5281/zenodo.20807658 | セマンティックセグメンテーションとパターン再構成に使用される、15,148 枚の画像を含む文化的モチーフのデータセット。 |
| NumPy | NumPy Developers | NumPy 1.21.5 | 数値計算およびデータセット処理。 |
| NVIDIA GPU | NVIDIA Corporation | NVIDIA RTX 3090 (24 GB VRAM) | モデルトレーニングと推論に使用されるハードウェアプラットフォーム。 |
| OpenCV | OpenCV Foundation | OpenCV 4.5.5 | 画像の前処理、リサイズ、補間、およびガウシアンデノイジング。 |
| オペレーティングシステム | Canonical Ltd. | Ubuntu 20.04 LTS | 実験実行環境。 |
| Pillow (PIL) | Python Imaging Library | Pillow 8.4.0 | 画像の読み込みと操作。 |
| Python | Python Software Foundation | Python 3.8.10 | 実装と実験に使用されるプログラミング言語。 |
| PyTorch | Meta AI | PyTorch 1.10.0 | モデルトレーニングと推論に使用されるディープラーニングフレームワーク。 |
| 乱数シード | 実験設定 | 42 | データセットの分割、モデルの初期化、および実験の再現性のために使用される固定シード。 |
| Scikit-learn | Scikit-learn Developers | Scikit-learn 1.0.2 | データセットの分割、統計分析、および評価指標。 |
| Seaborn | オープンソースコミュニティ | Seaborn 0.11.2 | 統計データの可視化。 |
| SegFormer-B2 | NVIDIA Research / オープンソース | SegFormer-B2 (MIT-B2 Backbone) | 文化的モチーフのセグメンテーションに使用される Transformer ベースのセマンティックセグメンテーションモデル。 |
| セグメンテーションマスク / アノテーション | Miao Batik データセット | データセットに含まれる | モチーフの分類とトレーニングに使用されるピクセルレベルのセマンティックセグメンテーションラベル。 |
| SPADE | NVIDIA Research / オープンソース | Official PyTorch Implementation (https://github.com/NVlabs/SPADE) | 芸術的なパターンの生成に使用されるセグメンテーション誘導型画像合成モデル。 |
| TorchVision | Meta AI | TorchVision 0.11.1 | PyTorch と併用される画像処理ユーティリティおよびデータセット変換。 |
| WikiArt データセット | WikiArt | https://www.wikiart.org/ | スタイル学習と合成に使用される、27 の芸術スタイルにわたる 80,000 点以上の芸術作品を含む芸術スタイルデータセット。 |
このJoVE記事のテキストまたは図の再利用許可をリクエスト
許可をリクエスト