$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
صُمّم الإطار المقترح لـ SegCycle-SPADE لإعادة بناء وتحسين أنماط التراث الثقافي التقليدية من خلال التقسيم الدلالي، وتعزيز الميزات باستخدام آلية الانتباه، وإعادة البناء التوليدية، وتوليف الأسلوب الفني. اعتمدت هذه الدراسة على مجموعات بيانات متاحة علنًا للصور الفنية والتراث الثقافي، بما في ذلك مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt. لم تتضمن الدراسة أي مشاركين بشريين، أو بيانات مرضى، أو معلومات شخصية، أو حيوانات تجارب، أو سجلات سريرية؛ وبناءً عليه، لم تكن هناك حاجة لموافقة لجنة الأخلاقيات المؤسسية أو الحصول على موافقة مستنيرة. في البداية، استُخدمت مجموعة بيانات زخارف التراث الثقافي لـ Miao Batik ومجموعة بيانات WikiArt لعملية التقييم. وقد وُصفت مجموعة بيانات Miao Batik في دراسة Quan et al. (2024)32 وهي تحتوي على 15,148 صورة مُصنفة لزخارف باتيك Miao التقليدية. استُخدمت التصنيفات الحالية المقدمة من منشئي مجموعة البيانات مباشرةً، ولم يتم إنشاء أي تصنيفات يدوية إضافية في هذه الدراسة. بعد ذلك، تم إجراء المعالجة المسبقة للصور عن طريق تغيير الحجم، والتطبيع، وإزالة الضوضاء، وإنشاء قناع تقسيم. تم وصف معاملات المعالجة المسبقة الدقيقة في القسم الفرعي للمعالجة المسبقة للبيانات. يستخدم الإطار المقترح نموذجًا قائمًا على المحولات يسمى SegFormer-B2 للتقسيم الدلالي للبيانات. صُممت هذه الطريقة للكشف عن المناطق الرئيسية للزخارف الثقافية وتعلم هياكلها. ثم يتم تعزيز الميزات المقسمة من خلال آلية الانتباه، حيث يتم إبراز المعلومات المهمة المتعلقة بالزخارف الثقافية واستبعاد المعلومات غير ذات الصلة. تم وصف إعدادات آلية الانتباه في القسم الفرعي CAFFM. ثم تُمرر الميزات المُحسنة عبر CycleGAN، حيث يتم إعادة بناء الهياكل التالفة من خلال التعلم الدوري. أثناء التدريب، تم إنشاء عينات زخارف غير مكتملة صناعيًا عن طريق تطبيق عمليات القناع العشوائي والحجب الجزئي على صور Miao Batik الأصلية. حاكت إجراءات التدهور هذه مناطق الزخارف المفقودة والتلف الهيكلي الملاحظ عادةً في القطع التراثية الثقافية المتدهورة. استُخدمت الصور غير المكتملة الناتجة كمدخلات لوحدة إعادة البناء CycleGAN، بينما عملت الصور الأصلية المقابلة كأهداف لإعادة البناء. بعد ذلك، يتم تحسين أنماط التراث الثقافي المعاد بناؤها من خلال SPADE، حيث يتم إجراء التحسين الفني بناءً على خرائط التقسيم المولدة. تم تقييم أداء الإطار المقترح باستخدام مقاييس كمية للتقسيم وجودة الصور، بينما تم تقييم الأصالة البصرية للزخارف الثقافية المعاد بناؤها نوعيًا. قُيمت الأصالة البصرية من خلال الفحص البصري للأنماط الثقافية المولدة ولم تُستخدم كمقياس كمي مستقل. ركز التقييم على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والتماسك الهيكلي، والمظهر الفني مقارنةً بالزخارف الثقافية المرجعية المقابلة. تم إجراء التقييم الكمي لأداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضوضاء (PSNR)، ومسافة فريشيه البادئة (FID). يوضح الشكل 2 سير العمل العام لإطار SegCycle-SPADE المقترح ويلخص مقاييس التقييم المستخدمة في هذه الدراسة.

الشكل 2. سير عمل البنية العامة لإطار عمل SegCycle-SPADE المقترح. نظرة عامة على سير عمل SegCycle-SPADE الكامل. تخضع الصور المأخوذة من مجموعات بيانات Miao Batik وWikiArt لمعالجة مسبقة قبل أن يتم معالجتها من خلال التجزئة الدلالية باستخدام SegFormer-B2، وتعزيز الميزات باستخدام CAFFM، وإعادة بناء النمط باستخدام CycleGAN، وتوليد النمط الفني باستخدام SPADE. يتم تقييم أداء النموذج باستخدام دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل Dice، ومقياس مؤشر التشابه الهيكلي (SSIM)، وPSNR، ومسافة Fréchet Inception (FID)، بينما يتم تقييم الأصالة البصرية نوعياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
صُمم إطار عمل SegCycle-SPADE لإعادة بناء أنماط التراث الثقافي لدمج مكونات متعددة من التعلم العميق (DL) من أجل تجزئة الزخارف وإعادة بنائها وتعزيزها فنياً بدقة، كما هو موضح في الشكل 2. تُستخدم صور من مجموعة بيانات زخارف "مياو باتيك" (Miao Batik) الثقافية ومجموعة بيانات WikiArt لتوفير أنماط ثقافية وأساليب فنية متنوعة. في البداية، يتم معالجة الصور باستخدام وحدة تجزئة دلالية تعتمد على SegFormer لتحديد وتعيين حدود الزخارف الثقافية وفصلها عن الخلفية. تتكون البنية العامة من أربع مراحل رئيسية؛ أولاً، يستخرج نموذج SegFormer خرائط التجزئة الدلالية من صور الأنماط الثقافية. ثانياً، تدمج وحدة CAFFM ميزات التجزئة مع التمثيلات التوليدية لتعزيز تعلم الميزات. ثالثاً، تقوم وحدة CycleGAN بإعادة بناء الأنماط الثقافية باستخدام تمثيلات الميزات المدمجة. وأخيراً، تقوم وحدة SPADE بتوليد مخرجات محسنة فنياً مع الحفاظ على الاتساق الهيكلي من خلال الاصطناع الموجه بالتجزئة. تُعالج خرائط الميزات المنقحة لاحقاً بواسطة وحدة إعادة بناء CycleGAN، التي تتعلم استعادة الزخارف الثقافية غير المكتملة عن طريق ربط الأنماط المتدهورة بأشكالها الكاملة المقابلة. تم توليد عينات زخرفية غير مكتملة من خلال تطبيق عمليات القناع العشوائي والحجب الجزئي على صور "مياو باتيك" الأصلية، وذلك لمحاكاة مناطق الأنماط المفقودة والتدهور الهيكلي الذي يُلاحظ عادةً في القطع الأثرية الثقافية التالفة. وقد تم إقران كل صورة متدهورة بالصورة الأصلية المقابلة لها، والتي كانت بمثابة هدف إعادة البناء أثناء التدريب. مكنت هذه الاستراتيجية وحدة CycleGAN من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص ذات الأهمية الثقافية. أخيراً، ينتج مولد SPADE مخرجات فنية محسنة بصرياً عن طريق جعل اصطناع الصور مشروطاً بخرائط التجزئة المولدة، مما يحافظ على السلامة الهيكلية للزخارف الثقافية طوال عملية التحسين الفني.
تتضمن الخطوات التالية إطار عمل SegCycle-SPADE المقترح.
الخطوة 1: جمع مجموعات البيانات
تم استخدام مجموعتي بيانات لتحقيق أهداف تعلم الأنماط الثقافية وتوليد الأنماط الفنية. استُخدمت مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik Cultural Motif Dataset) لتوفير معلومات عن الأنماط الثقافية التقليدية. تتوفر مجموعة البيانات هذه للعموم عبر Zenodo (https://doi.org/10.5281/zenodo.20807658) وتضم 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. وقد استُخدمت الشروحات التوضيحية الموجودة التي وفرها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي شروحات يدوية إضافية في هذه الدراسة. أما مجموعة بيانات WikiArt فقد استُخدمت لتوفير معلومات متنوعة عن الأساليب الفنية لغرض توليد الأنماط الفنية، وتم الحصول عليها من مستودع WikiArt المتاح للعموم (https://www.wikiart.org/).
الخطوة 2: المعالجة المسبقة للبيانات
تمت المعالجة المسبقة لجميع الصور من خلال تغيير الحجم، والتقييس، وتقليل الضوضاء. واستُخدمت تعليقات الزخارف الثقافية الموجودة والتي تم الحصول عليها من مصادر مجموعة البيانات الأصلية لدعم مرحلة التقسيم الدلالي. ولم يتم إجراء أي عمليات تعليق إضافية أو إعادة تسمية كجزء من هذه الدراسة.
الخطوة 3: تقسيم الأنماط الدلالية باستخدام SegFormer
استُخدم نموذج SegFormer لتقسيم الزخارف الثقافية. وقد وُصفت البنية الأساسية لنموذج SegFormer واستراتيجية التهيئة بدقة في القسم الفرعي تقسيم الأنماط الدلالية باستخدام SegFormer. وبشكل محدد، تم استخدام بنية SegFormer-B2 مع بنية أساسية MIT-B2 مُدربة مسبقاً على ImageNet لتقسيم الزخارف الدلالية. ويلتقط هذا النموذج بفعالية المعلومات السياقية العالمية مع الحفاظ على التفاصيل الهيكلية المعقدة للأنماط الثقافية التقليدية.
الخطوة 4: CAFFM
يجمع نموذج CAFFM بين ميزات التجزئة الدلالية والتمثيلات التوليدية، مما يمكن الإطار العملي من تعلم كل من خصائص الزخارف الهيكلية ومعلومات الأسلوب الفني. تتوفر تفاصيل التكامل الخاصة بـ CAFFM في القسم الفرعي CAFFM. يقع هذا النموذج بين مرحلة التجزئة الدلالية القائمة على SegFormer ومرحلة إعادة البناء التوليدية، حيث يقوم بدمج الميزات الهيكلية المستمدة من التجزئة مع ميزات إعادة البناء من خلال آلية الانتباه المتقاطع متعدد الرؤوس (multi-head cross-attention). وتعمل هذه العملية على تحسين الحفاظ على الزخارف الثقافية وتعزيز واقعية المخرجات المعاد بناؤها.
الخطوة 5: إعادة بناء الأنماط (CycleGAN)
تتم معالجة الميزات المدمجة لاحقاً بواسطة وحدة CycleGAN لإعادة بناء هياكل الأنماط الثقافية. تم وصف بنية CycleGAN وتكوين التدريب في القسم الفرعي إعادة بناء الأنماط باستخدام CycleGAN. تتكون وحدة إعادة البناء من مولدين ومميزين، وتستخدم بنية مولد قائمة على الشبكة المتبقية (residual-network) مكونة من تسعة بلوكات متبقية، وتوظف مميز PatchGAN، ويتم تدريبها باستخدام خسائر التنافسية واتساق الدورة (adversarial and cycle-consistency losses). يتيح هذا التكوين رسم خرائط ثنائية الاتجاه للمجالات ويسهل عملية إعادة بناء هياكل الأنماط الثقافية غير المكتملة.
الخطوة 6: توليد النمط الفني (SPADE)
تتم بعد ذلك معالجة الأنماط المعاد بناؤها من خلال وحدة SPADE لإجراء تركيب للنمط الفني بتوجيه من التجزئة. تم وصف تكوين مولد SPADE في القسم الفرعي توليد النمط الفني باستخدام SPADE. وتستخدم هذه الوحدة كتل SPADE المتبقية، وطبقات التطبيع التكيفية مكانيًا، والتكييف الدلالي المستمد من خرائط تجزئة SegFormer وتمثيلات ميزات CAFFM. ومن خلال تكييف توليد الصور بناءً على خرائط التجزئة، تحافظ المخرجات المُصنّعة على المحاذاة الهيكلية مع الزخارف الثقافية الأصلية مع دمج خصائص النمط الفني.
الخطوة 7: تقدير الأداء
تم تقييم الإطار المقترح باستخدام مقاييس متعددة لتقسيم الصور وتقييم جودتها، بما في ذلك دقة التقسيم (Segmentation Accuracy)، وتقاطع union (IoU)، ومعامل تشابه دايس (Dice Similarity Coefficient)، وSSIM، وPSNR، وFID. ولتقييم الاتساق التجريبي، كُررت جميع التجارب خمس مرات باستخدام بذور عشوائية مختلفة، وتم تسجيل النتائج كمتوسط ± الانحراف المعياري. كما تم تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة، مع تحديد عتبة الدلالة عند p < 0.05.
جمع البيانات
في إطار عمل SegCycle-SPADE المقترح، يتم استخدام مجموعتي بيانات لفهم الأنماط الثقافية وتعلم الأنماط الفنية. مجموعة البيانات الأولى المستخدمة في الإطار المقترح هي مجموعة بيانات زخارف باتيك مياو (Miao Batik) الثقافية. تحتوي هذه المجموعة على زخارف ثقافية لباتيك مياو، وهي بشكل عام صور لباتيك مياو التقليدي تضم زخارف مثل الحيوانات والنباتات والأشكال الهندسية المستخدمة في فن عرقية مياو. وتحتوي هذه المجموعة على صور ذات معلومات غنية في الملمس (texture)، والتي تكون مهمة عمومًا للحفاظ على التراث الثقافي. أما مجموعة البيانات الثانية المستخدمة في إطار عمل SegCycle-SPADE فهي مجموعة بيانات WikiArt. تحتوي هذه المجموعة على عدد هائل من الأعمال الفنية التي تنتمي عمومًا إلى أنماط مختلفة، وتُستخدم لتعلم الأنماط المعقدة، وهو أمر مفيد بشكل عام في تحسين الأعمال الفنية. تضم هذه المجموعة 80,000 عمل فني بدقة HD، مع 27 تصميمًا مختلفًا، مما يجعلها أكثر فائدة لمهام توليد أو تحويل الأنماط القائمة على التعلم العميق (DL).
مجموعة بيانات باتيك مياو (Miao Batik Dataset):
تتكون مجموعة بيانات باتيك مياو (https://doi.org/10.5281/zenodo.20807658) من 15,148 صورة لأنماط الباتيك التي تصور زخارف ذات أهمية ثقافية. وتشمل الصور مجموعة متنوعة من التصميمات التقليدية، مثل الزخارف الحيوانية (مثل الفراشات والأسماك)، والأنماط النباتية، والزخارف الهندسية التي تحمل رمزية ثقافية. وتعد مجموعة البيانات هذه مكوناً هاماً في الإطار المقترح لأنها توفر هياكل ثقافية أصلية تمكّن وحدة التجزئة من تحديد حدود الزخارف بدقة والحفاظ عليها أثناء إعادة بناء الأنماط (الجدول 1). وفي هذه الدراسة، تشير الزخارف ذات الأهمية الثقافية إلى العناصر البصرية الرمزية الموثقة عادةً في أدبيات التراث الثقافي لشعب مياو والممثلة ضمن تعليقات مجموعة البيانات، بما في ذلك الطيور والفراشات والأنماط الزهرية وطوطمات الأسلاف. وقد تم اختيار هذه الزخارف بناءً على أهميتها الثقافية الموثقة وتكرار وجودها في تصميمات باتيك وتطريز مياو التقليدية، وليس فقط بناءً على تكرار حدوثها أو تكوينها المكاني. تم الحصول على تعليقات الزخارف وعلامات التجزئة الموجهة من قبل الخبراء من مصدر مجموعة بيانات باتيك مياو الأصلي واستُخدمت مباشرة في هذه الدراسة. ولم يقم المؤلفون بأي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو إجراءات تعليق موجهة من قبل الخبراء. وقد تم استخدام التعليقات الحالية التي وفرها منشئو مجموعة البيانات لتدريب وتقييم التجزئة الدلالية.
| المعلمة | الوصف |
| اسم مجموعة البيانات | Miao Batik Cultural Pattern Dataset |
| مصدر مجموعة البيانات | Zenodo Repository (DOI: 10.5281/zenodo.20807658) |
| المجال | التراث الثقافي غير المادي (ICH) / تحليل أنماط المنسوجات |
| إجمالي الصور | 15,148 صورة |
| نوع الصور | صور رقمية لأنماط منسوجات باتيك Miao التقليدية |
| فئات الأنماط | زخارف حيوانية، وزخارف نباتية، وزخارف هندسية |
| الأصل الثقافي | ثقافة عرقية Miao، مقاطعة Guizhou، الصين |
| دقة الصورة الأصلية | صور عالية الدقة (عادةً ≥ 1,000 بكسل في الجانب الأصغر) تم التقاطها كمسوحات خام أو صور فوتوغرافية قبل المعالجة المسبقة |
| دقة التدريب | تم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة |
| توافر التعليقات التوضيحية | استُخدمت تعليقات تقسيم الصور الموجودة التي قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم. لم يتم إجراء أي تعليقات توضيحية يدوية إضافية، أو إعادة تسمية، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة. |
| التطبيق في هذه الدراسة | تقسيم الزخارف الثقافية، واستخراج الميزات، والحفاظ على الزخارف، وإعادة بناء الأنماط |
الجدول 1: خصائص مجموعة بيانات أنماط باتيك مياو الثقافية. ملخص لمجموعة بيانات زخارف باتيك مياو الثقافية المستخدمة في التقسيم الدلالي، وتحليل الأنماط الثقافية، وإعادة بناء الزخارف. يوضح الجدول مصدر مجموعة البيانات، وخصائص الصور، وفئات الزخارف، والأصل الثقافي، ودقة الصور، ودورها ضمن إطار عمل SegCycle-SPADE المقترح.
مجموعة بيانات WikiArt:
تُعد مجموعة بيانات WikiArt [https://www.wikiart.org/] مستودعاً رقمياً شائعاً للفنون على نطاق واسع، حيث تضم أكثر من 80,000 صورة من 27 أسلوباً فنياً مختلفاً كما هو موضح في الجدول 2. وتشمل هذه الأساليب فن عصر النهضة، والانطباعية، والتكعيبية، والسريالية. وتكتسب مجموعة البيانات هذه أهمية كبيرة في الإطار المقترح لأنها توفر معرفة تتيح لوحدة SPADE إنشاء أنماط غنية ثقافياً مع الحفاظ على المعلومات الهيكلية المستمدة من عملية التجزئة. وتتكون مجموعة البيانات من 56,000 صورة للتعلم و12,000 صورة لكل من التحقق والاختبار. وتساعد الصور الموجودة في هذه المجموعة في تدريب نموذج التعلم العميق (DL) بشكل فعال.
| المعيار | الوصف |
| اسم مجموعة البيانات | WikiArt Dataset |
| مصدر مجموعة البيانات | مستودع WikiArt (https://www.wikiart.org/) |
| المجال | الفن الرقمي واللوحات |
| إجمالي الصور | حوالي 80,000 عمل فني |
| صور التدريب | 56,000 |
| صور التحقق | 12,000 |
| صور الاختبار | 12,000 |
| الأنماط الفنية | 27 نمطاً فنياً، بما في ذلك عصر النهضة، والانطباعية، والتكعيبية، والسريالية، والتعبيرية، والواقعية، والفن التجريدي |
| دقة الصورة الأصلية | تختلف دقة الصور الأصلية باختلاف الأعمال الفنية والمصادر. تم تغيير حجم الصور إلى دقة موحدة تبلغ 256 × 256 بكسل أثناء المعالجة المسبقة. |
| دقة التدريب | تم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة قبل تعلم النمط الفني وتوليد الصور الموجه بالتجزئة. |
| تقسيم مجموعة البيانات | تقسيم عشوائي طبقي (70% للتدريب، و15% للتحقق، و15% للاختبار) باستخدام بذرة عشوائية ثابتة بقيمة 42 |
| استراتيجية أخذ عينات الأنماط | تم استخدام أخذ العينات التناسبي الطبقي للحفاظ على توزيع الأنماط الفنية الـ 27 عبر مجموعات التدريب والتحقق والاختبار |
| التطبيق في هذه الدراسة | تعلم النمط الفني، وتمثيل النمط، والتوليف الفني الموجه بالتجزئة |
الجدول 2: خصائص مجموعة بيانات WikiArt. ملخص لمجموعة بيانات WikiArt المستخدمة لتعلم الأنماط الفنية وتخليق الصور الموجهة بالنمط. يصف الجدول مصدر مجموعة البيانات، وتوزيع الصور، وتغطية الأنماط الفنية، وتقسيم مجموعة البيانات، ودقة الصور، وتطبيقها ضمن إطار عمل SegCycle-SPADE المقترح.
تحتوي مجموعة بيانات باتيك مياو (Miao Batik) على 15,148 صورة تمثل الزخارف الثقافية التقليدية لشعب مياو.32 وتتوفر مجموعة البيانات للعامة عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658). وقبل تدريب النموذج، خضعت جميع الصور لفحص بصري، وتم تغيير حجمها إلى 256 × 256 بكسل، وتطبيعها، وفحصها للتأكد من خلوها من العينات التالفة أو المكررة. لم يؤدِ فحص مراقبة الجودة إلى استبعاد أي صور؛ وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 لتحليلها لاحقاً. وقُسمت مجموعة البيانات عشوائياً إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام بذرة عشوائية ثابتة بقيمة 42 لضمان إمكانية تكرار تقسيمات مجموعة البيانات. أما مجموعة بيانات WikiArt فقد تم الوصول إليها من خلال مستودع WikiArt الرسمي (https://www.wikiart.org/) وهي تحتوي على أكثر من 80,000 عمل فني تشمل 27 أسلوباً فنياً. وفي تجارب تعلم الأسلوب، استُخدمت 56,000 صورة للتدريب، و12,000 للتحقق، و12,000 للاختبار.
المعالجة المسبقة للبيانات
قبل تدريب إطار عمل SegCycle-SPADE المقترح، خضعت مجموعة بيانات زخارف ثقافة Miao Batik ومجموعة بيانات WikiArt لعدة خطوات من المعالجة المسبقة لضمان اتساق جودة الصور ودقة تمثيل السمات. وقد طُبِّق مسار المعالجة المسبقة الأساسي ذاته على كلتا مجموعتي البيانات، بما في ذلك إزالة الضجيج باستخدام مرشح غاوس (Gaussian denoising)، والتقييس، وتغيير الحجم إلى دقة إدخال ثابتة، والتحقق من جودة الصور. ومع ذلك، لعبت مجموعات البيانات أدواراً متميزة داخل إطار العمل؛ حيث استُخدمت مجموعة بيانات WikiArt لتعلم الأنماط الفنية وتخليقها، بينما استُخدمت مجموعة بيانات Miao Batik بشكل أساسي لتقسيم وإعادة بناء الزخارف الثقافية. ولم يتم إجراء أي تغييرات في المعالجة المسبقة خاصة بكل مجموعة بيانات بما يتجاوز هذه الأدوار المحددة للمهام. ولضمان المعالجة المتسقة بواسطة نموذج التعلم العميق (DL model)، تم أولاً تغيير حجم الصور إلى دقة ثابتة، وكانت هذه الخطوة ضرورية لأن الصور في كلتا المجموعتين كانت تختلف في الدقة اعتماداً على مصدرها، وقد أدى تغيير الحجم إلى تحسين الكفاءة الحسابية ومنع التناقضات في الأبعاد من التأثير على التدريب. وكانت الخطوة الثانية من المعالجة المسبقة هي التقييس، حيث تم تغيير مقياس قيم البكسل إلى نطاق معياري لاستقرار تحديثات التدرج أثناء التدريب. ثم تمت معالجة الصور باستخدام ترشيح غاوس لتقليل الضجيج الذي قد يتداخل مع هياكل الزخارف الثقافية. أما بالنسبة لمجموعة بيانات Miao Batik، فقد استُخدمت أقنعة تقسيم الزخارف الثقافية الحالية التي تم الحصول عليها مباشرة من مصدر مجموعة البيانات الأصلية دون تعديل لتدريب وتقييم التقسيم الدلالي (semantic segmentation)، ولم يتم إنشاء أقنعة تقسيم جديدة خصيصاً لهذه الدراسة.
ما لم يُذكر خلاف ذلك، فقد تم اقتباس المعادلات التي تصف الطرق المعتمدة من دراسات سابقة وتم الاستشهاد بها وفقاً لذلك. أما المعادلات التي تصف طريقة CAFFM المقترحة وإطار عمل التحسين المركب SegCycle-SPADE فقد طورها المؤلفون خصيصاً لهذه الدراسة.
لتكن صورة مدخلة من مجموعة البيانات ممثلة كما في المعادلة 1:
(1)
هنا، تشير H و W و C إلى ارتفاع الصورة وعرضها وعدد قنوات الألوان، على التوالي. يتم تغيير حجم جميع الصور إلى بُعد ثابت H′ × W′ كما هو موضح في المعادلة 2:

هنا، يمثل Ir الصورة التي تم تغيير حجمها. يتم حساب قيم البكسل المعيرة وفقاً لـ المعادلة 3:
(3)
يساعد هذا في استقرار إجراء التدريب. ويتم إجراء تصفية الضجيج باستخدام مرشح غاوسي (Gaussian filter) كما هو موضح في المعادلة 4:

هنا، G(σ) هو مرشح غاوسي (Gaussian filter) و * تمثل عملية الالتفاف (convolution). تم استخدام مرشح غاوسي بنواة مقاس 5 × 5 وبانحراف معياري قدره σ = 1.0. كما تم تطبيق حشو انعكاسي (Reflective padding) على بكسلات الحدود لتقليل الآثار الاصطناعية عند الحواف. وقد أجريت عملية إزالة الضجيج مباشرة بعد تحميل الصور وقبل مرحلتي القياس والتطبيع. ولضمان توحيد المعالجة المسبقة في جميع أنحاء الدراسة، تم تطبيق نفس تكوين المرشح على كل صورة في مجموعتي بيانات Miao Batik و WikiArt. وبالنسبة لمجموعة بيانات Miao Batik، يتم إنشاء أقنعة التجزئة وفقاً لـ المعادلة 5:

هنا، يمثل M قناع تقسيم يستخدم لتوجيه نموذج SegFormer.
تبدأ سلسلة عمليات المعالجة المسبقة بالحصول على الصور من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt، كما هو موضح في الشكل 3. لم يتم استخدام أي تقنيات لزيادة البيانات (data augmentation) أثناء التدريب. وبعد المعالجة المسبقة، التي شملت تغيير الحجم، والتطبيع (normalization)، وإزالة الضجيج بطريقة غاوس (Gaussian denoising)، وإعداد أقنعة التجزئة (segmentation-mask)، استُخدمت الصور مباشرة لتدريب والتحقق من واختبار إطار عمل SegCycle-SPADE المقترح. تتضمن الخطوة الأولى من سلسلة المعالجة المسبقة تغيير حجم الصور إلى حجم ثابت، مما يسمح لنموذج التعلم العميق (DL) بمعالجة الصور بكفاءة أكبر. وتتضمن الخطوة الثانية التطبيع، الذي يقوم بتحويل قيم البكسل إلى نطاق عددي موحد ويسهل تقارب النموذج (model convergence). أما الخطوة الثالثة فتتضمن إزالة الضجيج، حيث يتم تنقية الصور من الضجيج غير المرغوب فيه لتحسين التعرف على الأنماط. بالإضافة إلى ذلك، بالنسبة لمجموعة بيانات Miao Batik، يتم تعيين مناطق الزخارف الثقافية، مما يسمح بتوليد الأقنعة التي تُستخدم في وحدة التجزئة للنموذج المقترح، وذلك لضمان الحفاظ على الزخارف الثقافية أثناء عملية التوليد. والمخرج النهائي لهذه المرحلة هو مجموعة بيانات نظيفة جاهزة لتدريب وحدتي التجزئة والتوليد في النموذج المقترح.

الشكل 3. مسار المعالجة المسبقة للبيانات لصور التراث الثقافي. مخطط سير العمل يوضح إجراءات المعالجة المسبقة للصور المطبقة قبل تدريب النموذج. يتضمن المسار الحصول على مجموعة البيانات، وتغيير حجم الصور، والتقييس، وإزالة الضوضاء باستخدام مرشح Gaussian، وتدوين الزخارف الثقافية الموجودة، وإعداد أقنعة التجزئة. تُستخدم الصور والأقنعة المعالجة الناتجة كمدخلات للتجزئة الدلالية وإعادة بناء الأنماط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
خضعت كل صورة لعملية مراقبة الجودة قبل تدريب النموذج. احتوت مجموعة بيانات Miao Batik على 15,148 صورة. وقد تمت معالجة العينات التالفة والمكررة ومنخفضة الجودة من قبل منشئي مجموعة البيانات الأصليين؛ لذا، لم يتم استبعاد أي صور إضافية أثناء فحص مراقبة الجودة في هذه الدراسة. وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 صورة للتحليل. تم تحميل الصور بتنسيق RGB أثناء المعالجة المسبقة، وإعادة تحجيمها إلى 256 × 256 بكسل باستخدام الاستيفاء الخطي الثنائي (bilinear interpolation). وتم تغيير مقياس قيم البكسل من النطاق [0, 255] إلى [0, 1] عن طريق القسمة على 255. ثم تم تطبيق تطبيع حسب القناة (Channel-wise normalization) باستخدام قيم متوسط تبلغ [0.485, 0.456, 0.406] وقيم انحراف معياري تبلغ [0.229, 0.224, 0.225] للقنوات الحمراء والخضراء والزرقاء على التوالي. تضمنت سلسلة المعالجة المسبقة تحميل الصور، والتحويل إلى RGB، وإعادة التحجيم، وتغيير مقياس قيم البكسل، والتطبيع، والتحويل إلى تنسيق tensor. وعند الضرورة، تم تحويل الصور ذات التدرج الرمادي إلى تنسيق RGB ثلاثي القنوات للحفاظ على التوافق مع نماذج التعلم العميق (DL models). وبعد المعالجة المسبقة، تم تقسيم الصور إلى مجموعات فرعية للتدريب والتحقق والاختبار. استخدمت جميع مراحل إطار عمل SegCycle-SPADE — بما في ذلك التقسيم الدلالي (semantic segmentation)، ودمج الميزات (feature fusion)، وإعادة بناء الزخارف (motif reconstruction)، والتركيب الفني القائم على SPADE — دقة إدخال ثابتة تبلغ 256 × 256 بكسل.
تجزئة الأنماط الدلالية باستخدام SegFormer
بعد خطوة المعالجة المسبقة هذه، يتم إدخال الصور التي تم تنظيفها وتوحيدها من مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt في وحدة التجزئة الدلالية القائمة على إطار عمل SegFormer-B2 المقترح. الغرض من هذه الخطوة هو تحديد وفصل الزخارف الثقافية الموجودة في الأنماط التراثية بشكل صحيح. يعتمد إطار عمل SegFormer المقترح على بنية محول (transformer) تتضمن مشفر محول هرمي وفك تشفير MLP خفيف الوزن لالتقاط المعلومات السياقية العالمية والمعلومات الهيكلية المفصلة من الأنماط التراثية المعقدة بدقة. يقوم النموذج أولاً باستخراج تمثيلات الميزات بمقاييس متعددة من الصورة المدخلة، يليه دمج هذه التمثيلات من خلال فك التشفير لتوليد أنماط مجزأة بدقة. يضمن ذلك تجزئة الأنماط في الصورة التراثية بشكل صحيح إلى زخارف مثل الأنماط الهندسية، والأنماط الزهرية، والأنماط الرمزية، وبالتالي فصلها عن الخلفية مع الحفاظ على سلامتها الهيكلية. تُستخدم هذه المعلومات الهيكلية لاحقاً خلال المراحل المتأخرة من توليد الأنماط ضمن إطار عمل SegCycle-SPADE.
لتكن الصورة المدخلة التي تمت معالجتها مسبقاً ممثلة بـ المعادلة 6:
(6)
يقوم مشفر SegFormer بتقسيم الصورة إلى رقع واستخراج الميزات الهرمية باستخدام طبقات المحول (transformer)، كما هو موضح في المعادلة 71:

هنا، يشير F إلى خرائط الميزات متعددة المقاييس التي تم الحصول عليها من مشفر المحول (transformer encoder). وتعمل هذه الميزات على ترميز كل من أنماط النسيج المحلية والعلاقات السياقية العالمية بين مناطق الزخرفة (motif regions). ويقوم نموذج SegFormer باستخراج خرائط الميزات بمقاييس مختلفة كما هو محدد في المعادلة 8:

يساهم استخدام التمثيلات متعددة المقاييس في تسهيل الكشف عن الأنماط ذات الأحجام المختلفة ضمن الزخارف الثقافية. وفي النهاية، يتم دمج الميزات باستخدام مفكك شفرة MLP كما هو موضح في المعادلة 91:

هنا، يشير S إلى خريطة التقسيم النهائية المتوقعة.
تم تهيئة العمود الفقري لنموذج SegFormer-B2 باستخدام أوزان مدربة مسبقاً على مجموعة بيانات ImageNet، ومن ثم تم ضبطه بدقة على مجموعة بيانات Miao Batik لتقسيم الزخارف الثقافية. تم الحصول على نقطة التحقق المدربة مسبقاً من التنفيذ الرسمي لنموذج SegFormer. وتحديداً، تم استخدام نقطة التحقق MIT-B2 المدربة مسبقاً على ImageNet-1K (mit_b2.pth) المقدمة من مستودع SegFormer الرسمي لتهيئة العمود الفقري لنموذج SegFormer-B2 قبل عملية الضبط الدقيق. تتوافق الأوزان المدربة مسبقاً مع العمود الفقري MIT-B2 الذي أصدره مؤلفو SegFormer، وقد عملت كنموذج تهيئة للتدريب على التقسيم الدلالي. أما الطبقات المتبقية الخاصة بالمهمة، فقد تم تهيئتها باستخدام إجراءات تهيئة أوزان PyTorch الافتراضية قبل البدء في التدريب.
تستخدم البنية الهيكلية مشفر Transformer هرمي مكون من أربع مراحل مع تضمينات رقع متداخلة. في المرحلة الأولية، تم تعيين حجم الرقعة على 7 × 7 بزيادة قدرها 4. وبالنسبة لكل مرحلة من مراحل المشفر الأربع، كانت أبعاد التضمين 64 و128 و320 و512. وعبر المراحل الأربع، كان هناك 1 و2 و5 و8 رؤوس انتباه ذاتي متعددة الرؤوس، وكانت أعماق المشفر المقابلة 3 و4 و6 و3 طبقات. تم تجميع الميزات متعددة المقاييس المستخرجة من المشفر باستخدام مفكك تشفير خفيف الوزن يعتمد كلياً على MLP. وقبل إنشاء خريطة التجزئة النهائية، قام مفكك التشفير بإسقاط الميزات من كل مرحلة من مراحل المشفر في مساحة تضمين واحدة. استخدمت جميع كتل Transformer دالة التنشيط Gaussian Error Linear Unit (GELU). كما تم استخدام معدل تسرب (dropout rate) قدره 0.1 أثناء التدريب لتحسين التعميم والحد من فرط التناسب.
خلال مرحلة التدريب، يستقبل إطار عمل SegFormer الصور التي تمت معالجتها مسبقاً من كلا مجموعتي البيانات. تحتوي الصور من مجموعة بيانات Miao Batik على مناطق الزخارف التي تعمل كملصقات للتعلم الخاضع للإشراف لنموذج التجزئة. يقوم مشفر Transformer بمعالجة الصورة بأكملها والتقاط العلاقات طويلة المدى بين مكونات الصورة، وهو أمر بالغ الأهمية خاصة لأنماط الباتيك التقليدية التي تحتوي على زخارف موزعة مكانياً. كما تقوم آلية استخراج الميزات الهرمية بالتقاط البنى المحلية في الوقت ذاته، مثل الأنسجة الهندسية المتكررة. ويعالج مفكك رموز MLP هذه الميزات المستخرجة وينتج قناع تجزئة يبرز مناطق الزخارف. وتُستخدم خرائط التجزئة التي تم إنشاؤها خلال هذه المرحلة لاحقاً كمدخلات هيكلية لوحدة الانتباه ومرحلة إعادة بناء الأنماط، مما يساعد بذلك في الحفاظ على أصالة الأنماط المُولدة.
وُزعت الزخارف الثقافية على فئات مختلفة للتقسيم الدلالي (semantic segmentation) بناءً على خصائصها البصرية والثقافية. شمل تصنيف التقسيم زخارف حيوانية (مثل الفراشات، والأسماك، والطيور، وغيرها من الكائنات الرمزية)، وزخارف نباتية (مثل الأزهار، والأوراق، والكروم، والأنماط النباتية)، وزخارف هندسية (مثل الأشكال المتكررة، والإطارات، والهياكل الهندسية التجريدية)، ومناطق الخلفية التي تمثل المساحات الخالية من الزخارف. استُخدمت أقنعة تقسيم على مستوى البكسل لتعيين كل بكسل إلى إحدى الفئات المحددة مسبقًا. وتم ترميز التسميات العددية كما يلي: التسمية 0 = الخلفية، والتسمية 1 = الزخارف الحيوانية، والتسمية 2 = الزخارف النباتية، والتسمية 3 = الزخارف الهندسية. تم الحصول على تعليقات التقسيم وتسميات الزخارف مباشرة من مصدر مجموعة بيانات "Miao Batik" الأصلية. لم يتم إجراء أي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو تحقق من الحدود، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة، بل استُخدمت التعليقات الموجودة التي وفرها منشئو مجموعة البيانات دون تعديل لعمليات التدريب والتقييم.
يقوم نموذج SegFormer الخاص بتجزئة الزخارف الثقافية بمعالجة الصور التي تمت معالجتها مسبقًا من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt باستخدام آلية تعتمد على المحولات (transformer) للكشف الدقيق عن مناطق الأنماط الثقافية، كما هو موضح في الشكل 4. أولاً، يتم تزويد نموذج SegFormer بالصورة المدخلة التي تحتوي على الزخارف الثقافية التقليدية. يقوم مشفر المحولات (Transformer encoder) باستخراج كل من المعلومات السياقية العالمية والميزات الهيكلية المحلية من رقع الصور. ثم يتم تزويد الميزات متعددة المقاييس الناتجة بفك تشفير التجزئة (segmentation decoder)، الذي يستخدم شبكة تغذية أمامية مختلطة (Mix Feed-Forward Network) لتحسين تمثيلات الميزات ورفع كفاءة الكشف عن الزخارف. وتكون مخرجات نموذج SegFormer عبارة عن قناع تجزئة يبرز البكسلات المقابلة للأنماط الثقافية مع استبعاد معلومات الخلفية غير ذات الصلة. بعد ذلك، تعمل الأنماط الثقافية المعزولة كإرشاد هيكلي للمراحل اللاحقة من إطار عمل SegCycle-SPADE.

الشكل 4. التجزئة الدلالية للزخارف الثقافية القائمة على SegFormer-B2. بنية وحدة التجزئة الدلالية SegFormer-B2 المستخدمة لاستخراج الزخارف الثقافية والتي تم تدريبها حصرياً على مجموعة بيانات Miao Batik. يتكون الإطار من مشفر قائم على Transformer لاستخراج الميزات متعددة المقاييس ومفكك تشفير تجزئة خفيف الوزن لتوليد أقنعة الزخارف. يتنبأ النموذج بأربع فئات دلالية وهي: الحيوان، والنبات، والهندسي، والخلفية، حيث تحدد أقنعة التجزئة الناتجة مناطق الزخارف ذات الأهمية الثقافية مع حجب معلومات الخلفية غير ذات الصلة. وتوفر مخرجات التجزئة هذه توجيهاً هيكلياً لمراحل دمج الميزات، وإعادة البناء، والتوليف الفني اللاحقة في إطار SegCycle-SPADE المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
لا توجد حاجة لإنشاء تعليقات توضيحية جديدة للتجزئة في الإطار المقترح. تم الحصول على مجموعة بيانات Miao Batik من مصدر عام موجود مسبقاً، وتم تدريب النموذج باستخدام معلومات الزخارف ذات الصلة التي قدمها منشئو مجموعة البيانات. وخلال عملية التعلم، أنتج نموذج SegFormer خرائط تجزئة دلالية. ونتيجة لذلك، لم تتطلب الدراسة الحالية أي برامج إضافية للتعليق التوضيحي اليدوي، أو إرشادات للتعليق التوضيحي، أو إجراءات لمراقبة جودة التعليقات التوضيحية.
وحدة CAFFM
لتحسين التفاعل بين سمات التجزئة الدلالية وتمثيلات إعادة البناء التوليدية، اقترحت الدراسة أيضاً وحدة CAFFM. حيث يوفر مشفر SegFormer-B2 خرائط سمات دلالية لوحدة CAFFM، بينما توفر خطوة إعادة البناء في CycleGAN خرائط سمات توليدية. أولاً، تُستخدم طبقات إسقاط خطي لإسقاط كلا تدفقي السمات في فضاء تضمين مشترك. ولحساب الانتباه المتقاطع، يتم إنشاء تمثيلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) باستخدام موترات السمات المولدة. ثم يتم نمذجة العلاقات بين معلومات الزخارف الهيكلية وعناصر الأسلوب الفني باستخدام الانتباه المتقاطع متعدد الرؤوس. بعد ذلك، يتم تطبيق تسوية الطبقة، والوصلات المتبقية، وطبقات التغذية الأمامية مع تنشيط GELU على تمثيلات السمات المدمجة. وتستقبل مرحلة التصنيع القائمة على SPADE مخرجات وحدة CAFFM، مما يسمح بالحفاظ على الموضوعات ذات الدلالات الثقافية دون التضحية بالتماسك الفني.
لضمان توافق الميزات، يتم أولاً إسقاط ميزات الإدخال باستخدام طبقات إسقاط خطية على فضاء تضمين مشترك ببعد تضمين يبلغ 256. ثم يتم نمذجة الترابطات بين المعلومات البنيوية الدلالية وتمثيلات الأسلوب التوليدي باستخدام آلية الانتباه المتقاطع متعدد الرؤوس (MultiHead Cross-Attention) بثمانية رؤوس انتباه. وتستخدم حسابات الانتباه المتقاطع ناقلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) التي تنتجها طبقات تحويل خطية محددة. ولزيادة استقرار التدريب والحفاظ على سلامة الميزات، يتم استخدام الوصلات المتبقية (residual connections) وتسوية الطبقة (Layer Normalization) لتعزيز تمثيلات الميزات المدمجة بشكل أكبر. ثم يتم تحسين تعلم الميزات غير الخطية من خلال تطبيق شبكة تغذية أمامية باستخدام دالة التنشيط وحدة الخطأ الغاوسية الخطية (GELU). ويقوم النموذج بتوليد تمثيل ميزات مخرج ببعد 256 يتم إرساله إلى مراحل أخرى من أجل الاصطناع الإبداعي. ينجح نموذج CAFFM في دمج بيانات الأسلوب الفني مع بنيات الزخارف الثقافية عن طريق استخدام تقنية دمج قائمة على الانتباه المتقاطع، مما يعزز الحفاظ على الزخارف والتماسك البصري في أنماط التراث الثقافي المعاد بناؤها.
في النظام المقترح، يتم اشتقاق السمات الهيكلية من مجموعة بيانات Miao Batik، بينما يتم تعلم السمات الأسلوبية من مجموعة بيانات WikiArt. لنرمز لخريطة السمات المشتقة من شبكة التجزئة SegFormer باستخدام صور من مجموعة بيانات Miao Batik بالرمز Fs، بينما ترمز خريطة السمات المشتقة من فرع استخراج السمات الأسلوبية باستخدام صور WikiArt بالرمز Fa. يقوم نموذج CAFFM المقترح بدمج مجالي السمات باستخدام آلية الانتباه المتقاطع (cross-attention mechanism) لتعلم التبعيات الهيكلية والأسلوبية للأنماط الثقافية. يوضح الجدول 3 جميع الخصائص المعمارية، بما في ذلك أبعاد التضمين (embedding dimensions)، وطبقات التسوية (normalization layers)، ودوال التنشيط (activation functions)، وتكوين رؤوس الانتباه (attention-head configuration). بالنسبة لحجم صورة إدخال قدره 256 × 256 بكسل، أنتج مشفر SegFormer-B2 خرائط سمات دلالية بحجم 64 × 64 × 128، بينما أنتج فرع استخراج السمات الأسلوبية خرائط سمات بحجم 64 × 64 × 128. تم إسقاط كلتا خريطتي السمات من خلال طبقات خطية قابلة للتعلم في فضاء تضمين مشترك ببعد 256 قبل عملية دمج الانتباه المتقاطع.
| المعلم | التكوين |
| الإطار المقترح | SegCycle-SPADE |
| نموذج التجزئة الدلالية | SegFormer-B2 |
| مراحل مشفر SegFormer | 4 |
| تهيئة الأوزان | SegFormer-B2 مدرب مسبقاً على ImageNet-1K (العمود الفقري MIT-B2) |
| مصدر نقطة التحقق | مستودع NVIDIA SegFormer الرسمي (https://github.com/NVlabs/SegFormer)؛ نقطة التحقق: segformer.b2.512x512.ade.160k |
| استراتيجية الضبط الدقيق | ضبط دقيق شامل من الطرف إلى الطرف على مجموعة بيانات Miao Batik |
| حجم تضمين الرقعة | 7 × 7 |
| خطوة الرقعة | 4 |
| أبعاد التضمين | 64، 128، 320، و 512 |
| أعماق المشفر | 3، 4، 6، و 3 |
| رؤوس الانتباه | 1، 2، 5، و 8 |
| نوع مفكك الشفرة | All-MLP Decoder |
| دالة التنشيط | GELU |
| معدل التسرب | 0.1 |
| وحدة تعزيز الميزات | وحدة دمج الميزات الثقافية عبر الانتباه المتقاطع (CAFFM) |
| بعد تضمين CAFFM | 256 |
| رؤوس انتباه CAFFM | 8 |
| مقاييس دمج CAFFM | 4 |
| نموذج إعادة البناء | CycleGAN |
| نموذج توليد النمط | SPADE |
| مجموعة البيانات الثقافية | مجموعة بيانات Miao Batik |
| مجموعة بيانات النمط | مجموعة بيانات WikiArt |
| صور Miao Batik | 15,148 |
| صور WikiArt | 80,000 تقريباً |
| دقة صورة الإدخال | 256 × 256 بكسل |
| تنسيق الألوان | RGB |
| طريقة الاستيفاء | الاستيفاء الخطي الثنائي |
| طريقة إزالة الضجيج | الترشيح الغاوسي |
| حجم النواة الغاوسية | 5 × 5 |
| السيجما الغاوسية (σ) | 1 |
| نطاق التطبيع | [0, 1] |
| حجم الدفعة | 16 |
| عدد الدورات | 100 |
| المحسن | Adam |
| معدل التعلم | 0.0002 |
| معاملات Adam | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0 |
| دوال الخسارة | خسارة التجزئة، والخسارة التنافسية، وخسارة اتساق الدورة، وخسارة إعادة البناء، وخسارة الحفاظ على الزخارف، وخسارة اتساق النمط |
| استراتيجية تقسيم مجموعة البيانات | تدريب / تحقق / اختبار |
| مجموعة التدريب | 70% |
| مجموعة التحقق | 15% |
| مجموعة الاختبار | 15% |
| البذرة العشوائية | 42 |
| مقاييس التقييم | دقة التجزئة، وIoU، ومعامل Dice، وSSIM، وPSNR، وFID |
| لغة البرمجة | Python 3.8.10 |
| إطار التعلم العميق | PyTorch 1.10.0 |
| المنصة العتادية | NVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (الجيل الحادي عشر), 32 GB RAM |
| بيئة التشغيل | Ubuntu 20.04 LTS |
الجدول 3: الإعداد التجريبي وتكوين النموذج. ملخص للمكونات المعمارية، وتكوين التدريب، وإعدادات المعالجة المسبقة، ومجموعات البيانات، ومعلمات التحسين، ومقاييس التقييم، والبيئة الحسابية المستخدمة لتنفيذ وتقييم إطار عمل SegCycle-SPADE المقترح.
تقوم وحدة الانتباه أولاً بتحويل خريطة الميزات إلى تمثيلات الاستعلام (query)، والمفتاح (key)، والقيمة (value) باستخدام المعادلة 10:

هنا، تمثل Wq وWk وWv مصفوفات أوزان قابلة للتعلم. يتم حساب أوزان الانتباه بناءً على التشابه بين متجه الاستعلام ومتجه المفتاح باستخدام المعادلة 1117:

هنا، dk هو بُعد متجه المفتاح. ويتم حساب تمثيل الميزات المعزز عن طريق ضرب أوزان الانتباه في مصفوفة القيمة باستخدام المعادلة 12:

هنا، يمثل Fa التمثيل المعزز للميزات لخريطة الميزات. ويتم حساب التمثيل المعزز للميزات من خلال دمج ميزات التجزئة الأصلية مع الميزات المعززة التي تم الحصول عليها باستخدام آلية الانتباه وفقاً لـ المعادلة 13:
هنا، تمثل Fe خريطة السمات المحسنة المستخدمة في إعادة بناء النمط. يتم توسيع وحدة CAFFM بآلية انتباه متقاطع متعددة المقاييس لاستخراج سمات الزخارف الثقافية بمقاييس مختلفة. لتكن Fsi دالة على سمات التجزئة عند المقياس i، بينما تمثل Faj سمات النمط الفني عند المقياس نفسه. يتم تعريف تمثيل السمات النهائي باستخدام المعادلة 14:

هنا، تمثل Qi و Ki و Vi مصفوفات الاستعلام (query)، والمفتاح (key)، والقيمة (value) عند المقياس i على التوالي، ويرمز N إلى عدد مقاييس السمات. في هذه الدراسة، N = 4، وهو ما يقابل خرائط السمات المستخرجة بدقة مكانية تبلغ 1/4 و 1/8 و 1/16 و 1/32 من حجم الصورة المدخلة. وقد دُمجت تمثيلات السمات متعددة المقاييس هذه باستخدام أوزان انتباه قابلة للتعلم قبل مرحلتي إعادة البناء والتركيب الفني. ويمكّن هذا التوسع المذكور أعلاه الطريقة من استخراج الزخارف الثقافية والأنسجة العالمية لإعادة بناء الأنماط الثقافية. يقع نموذج CAFFM بين مرحلة التجزئة القائمة على SegFormer ومرحلة التركيب الإبداعي القائمة على SPADE في نظام SegCycle-SPADE المقترح. أولاً، بينما يقوم CycleGAN بإنشاء سمات إعادة البناء المتزامنة مع المعلومات المتعلقة بالنمط والأسلوب، يقوم SegFormer-B2 باستعادة خرائط السمات الدلالية التي تصف الخصائص الهيكلية للزخارف الثقافية. وتستقبل وحدة CAFFM هذين التدفقين من السمات وتستخدم دمجاً قائماً على الانتباه المتقاطع (cross-attention) لتحديد العلاقات بين التمثيلات الهيكلية والفنية. ومن أجل إنشاء أنماط أصيلة ثقافياً مع الحفاظ على الاتساق الدلالي والسمات الهيكلية، يتم إرسال خرائط السمات المدمجة الناتجة بعد ذلك إلى وحدة SPADE للقيام بالتركيب الإبداعي الموجه بالتجزئة.
إعادة بناء الأنماط باستخدام CycleGAN
بمجرد الانتهاء من مرحلة تعزيز السمات القائمة على الانتباه، ستتضمن خرائط السمات هياكل الزخارف الثقافية المُعززة. ومع ذلك، قد تظل خرائط السمات تحتوي على مناطق أنماط غير مكتملة أو تالفة. لذلك، ولمعالجة مشكلة إعادة بناء الأنماط، سيعتمد الإطار المقترح على نموذج CycleGAN. في الإطار المقترح، سيكون النطاقان هما أنماط الزخارف الثقافية الأصلية وأنماط الزخارف الثقافية المعاد بناؤها. وباستخدام السمات المُعززة من المراحل السابقة، سيقوم نموذج CycleGAN بإعادة بناء الأنماط الثقافية مع الحفاظ على الاتساق الهيكلي. سيضمن ذلك احتفاظ الأنماط الثقافية، مثل الأنماط الهندسية، والأنماط الزهرية، والأنماط الرمزية، بترتيبها المكاني. وقد خضعت صور باتيك مياو (Miao Batik) الأصلية لعمليات قناع عشوائي وحجب جزئي لتوليد زخارف ثقافية غير مكتملة أو تالفة. وحاكت إجراءات التدهور هذه مناطق الأنماط المفقودة والتلف الهيكلي الذي يُلاحظ عادةً في القطع الأثرية للتراث الثقافي المتدهورة. استُخدمت الصور المتدهورة كمدخلات لوحدة إعادة البناء، بينما عملت الصور الأصلية المقابلة كصور مرجعية لتقييم الأداء وتقدير جودة إعادة البناء. وقد مكنت هذه الاستراتيجية النموذج من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص الثقافية.
لتكن X نطاق الأنماط الثقافية غير المكتملة و Y نطاق الأنماط الثقافية المعاد بناؤها. يتعلم المولدّان إجراء رسم خرائط ثنائي الاتجاه باستخدام المعادلة 15:

هنا، يُستخدم GE لإعادة بناء هياكل الزخارف (motif structures)، بينما يُستخدم FM لإسقاط الأنماط مرة أخرى على النطاق الأصلي. وتُستخدم الخسارة التنافسية لضمان أن تكون الأنماط المعاد بناؤها واقعية (المعادلة 16)30

هنا، يمثل DY المميز المستخدم للتفريق بين الأنماط الحقيقية والمعاد بناؤها، بينما يشير GE(x) إلى النمط المعاد بناؤه الذي تم توليده. كما يفرض نموذج CycleGAN اتساق الدورة للحفاظ على التخطيط الهيكلي للزخارف الثقافية (المعادلة 17)30.

تُحدد دالة الخسارة النهائية باستخدام المعادلة 1830:

هنا، يرمز λi إلى معامل الترجيح لخسارة اتساق الدورة، وقد تم ضبطه عند القيمة 10 أثناء التدريب، بما يتوافق مع صيغة CycleGAN الأصلية. تم اختيار هذه القيمة لتحقيق التوازن بين التعلم التنافسي واتساق إعادة البناء بين النطاقين المصدر والهدف.
تتكون وحدة إعادة بناء CycleGAN من مولدين ومميزين لترجمة الصور ثنائية الاتجاه. يتبع كل مولد بنية شبكة متبقية (residual-network) تضم طبقة تلافيفية أولية بحجم 7 × 7، تليها طبقتان تلافيفيتان لخفض العينات، وتسعة كتل متبقية، وطبقتان لزيادة العينات. تستخدم جميع العمليات التلافيفية حجم نواة 3 × 3، باستثناء طبقة الإدخال التي تستخدم نواة 7 × 7 لتعزيز استخلاص الميزات. يتم تطبيق تسوية الحالات (Instance Normalization) بعد كل طبقة تلافيفية لتحسين استقرار التدريب، بينما تُستخدم دالة التنشيط ReLU في جميع أنحاء شبكة المولد. وتستخدم طبقة الإخراج دالة تنشيط Tanh لإنتاج مخرجات صور مُعيرة. أما المميز فيتبع بنية PatchGAN بحجم 70 × 70 تتكون من سلسلة من الطبقات التلافيفية بأحجام نواة 4 × 4 وقنوات ميزات تزداد تدريجياً. ويتم استخدام تسوية الحالات وتنشيط LeakyReLU (بمنحدر سلبي = 0.2) في المميز لتحسين تمييز الميزات والتعلم التنافسي. تستقبل وحدة CycleGAN صور الزخارف الثقافية المعالجة مسبقاً كمدخلات وتنتج تمثيلات أنماط مُعاد بناؤها، والتي تُمرر لاحقاً إلى CAFFM لدمجها مع ميزات التجزئة. تم إجراء تدريب CycleGAN باستخدام محسِّن Adam (β₁ = 0.5, β₂ = 0.999) بمعدل تعلم أولي قدره 0.0002. تم الحفاظ على معدل التعلم خلال أول 100 حقبة (epoch)، ثم انخفض خطياً إلى الصفر على مدار فترة التدريب المتبقية. كما استُخدم مخزن مؤقت لإعادة التشغيل (replay buffer) يحتوي على 50 صورة تم إنتاجها مسبقاً لتثبيت تدريب المميز. تم تحديث المولدات والمميزين بنسبة تحديث 1:1، حيث يتبع كل تحديث للمولد تحديث واحد للمميز خلال كل تكرار تدريبي.
تعتمد عملية إعادة بناء CycleGAN على خرائط السمات المحسنة التي تم الحصول عليها باستخدام آلية CAFFM في الشكل 5. تحتوي خرائط السمات هذه على زخارف ثقافية محسنة تم الحصول عليها من مراحل التقسيم وCAFFM السابقة. تُستخدم خرائط السمات كمدخلات للمولد الأول GE، حيث يتعلم المولد الأول GE عملية الربط (mapping) المطلوبة لإعادة بناء الأنماط الثقافية. ثم يتم تمرير المخرجات إلى المميز DY للتمييز بين الأنماط الثقافية الحقيقية والأنماط المعاد بناؤها. ويساعد المميز DY المولد GE في إنتاج مخرجات واقعية. ولضمان عدم تشوه الأنماط الثقافية أثناء إعادة البناء، يقوم المولد الثاني FM بعملية ربط متسقة دورياً (cycle-consistency mapping). حيث يقوم المولد الثاني FM بربط المخرجات مرة أخرى بالنطاق الأصلي، ثم يتم تقييم المخرجات بواسطة المميز لضمان واقعيتها. بعد ذلك، يتم تمرير المخرجات النهائية إلى وحدة SPADE لتوليد النمط الفني في المرحلة التالية من إطار عمل SegCycle-SPADE المقترح.

الشكل 5. سير عمل إعادة بناء الأنماط القائم على CycleGAN. سير عمل وحدة إعادة البناء باستخدام CycleGAN. يتم تقديم تمثيلات الميزات المعززة بالانتباه كمدخلات إلى شبكة المولد لإعادة بناء الزخارف الثقافية غير المكتملة. ويقوم المميز بتقييم المخرجات المعاد بناؤها مقابل الأنماط المرجعية، بينما يحافظ تعيين الاتساق الدوري على السلامة الهيكلية أثناء ترجمة الصور ثنائية الاتجاه. يتم بعد ذلك توجيه الزخارف المعاد بناؤها إلى وحدة SPADE لتخليق النمط الفني. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
توليد الأسلوب الفني باستخدام SPADE
بعد ذلك، تخضع الزخارف الثقافية المعاد بناؤها إلى وحدة SPADE لتوليد الأسلوب الفني. الهدف الرئيسي من وحدة SPADE هو إضافة أنسجة غنية بصرياً من الأسلوب الفني إلى الزخارف الثقافية المعاد بناؤها دون المساس بالتخطيط الهيكلي للزخارف. وتُعد وحدة SPADE تقنية توليد صور شرطية تعتمد على مفهوم تقسيم الصور لتوليد الصور. وقد تم ترميز خرائط دلالية متعددة القنوات تتوافق مع فئات الزخارف المحددة مسبقاً من أقنعة التقسيم الدلالي التي أنتجها SegFormer-B2. وتلقى مولد SPADE هذه الخرائط المرمزة كمدخلات شرطية. كما تم إنتاج معاملات القياس التكيفي مكانيًا (γ) والانحياز (β) من خلال معالجة الخرائط الدلالية عبر طبقات تلافيفية داخل كل طبقة من طبقات SPADE. وبذلك تمكن المولد من الحفاظ على حدود الزخارف، والتخطيطات الهيكلية، والمعلومات الدلالية أثناء الاصطناع الفني من خلال تطبيق هذه المعاملات على تنشيطات الميزات المعيرة. واستطاع التوجيه الدلالي التأثير على كل من إعادة البناء الهيكلي عالي المستوى وتخليق الأنسجة منخفض المستوى بما أن عملية التكييف تمت في عدة طبقات من مولد SPADE. ونتيجة لذلك، دمجت الأنماط الفنية التي تم إنشاؤها السمات الأسلوبية المكتسبة من مجموعة بيانات WikiArt مع الحفاظ على هياكل الزخارف الثقافية التي تم العثور عليها خلال مرحلة التقسيم.
استُخدمت مجموعة بيانات WikiArt، والتي تضم أعمالاً من 27 فئة فنية مختلفة — مثل عصر النهضة، والانطباعية، والتكعيبية، والتعبيرية، والسريالية، والواقعية، والفن التجريدي — كمورد أساسي لفهم الأساليب الفنية. ومن أجل تعريض النموذج لمجموعة متنوعة من السمات الإبداعية وتعزيز تعميم الأسلوب، تم اختيار صور الأنماط عشوائياً من مختلف الفئات أثناء التدريب. قُسمت مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار مع تمثيل متوازن للفئات الفنية لتقليل الانحياز للأسلوب. ولضمان التمثيل المتوازن لجميع الفئات الفنية الـ 27، استُخدم أخذ العينات الطبقية؛ حيث وُزعت العينات من كل فئة تناسبياً على مجموعات التدريب والتحقق والاختبار مع الحفاظ على التوزيع الأصلي للفئات. استُخدمت وحدة CAFFM لدمج جوانب الأسلوب المستمدة من صور WikiArt مع سمات إعادة البناء التي أنتجها CycleGAN. وبغرض تمكين شبكة التصنيع من نقل الخصائص الفنية مع الحفاظ على البنية الدلالية وحدود الزخارف الثقافية المستمدة من خرائط التجزئة، تم تقديم التمثيلات المدمجة الناتجة كمعلومات شرطية لمولد SPADE. وبفضل تقنية تكييف الأسلوب هذه، تمكن الإطار المقترح من إنتاج أنماط فنية أصلية ثقافياً مع تمثيلات هيكلية وأسلوبية متسقة.
كما يقدم SPADE معلمات تكيفية مكانيًا تعتمد على خريطة التجزئة. ويمكن تعريف هذه المعلمات كما هو موضح في المعادلة 191:

هنا، تمثل γ(S) معامل المقياس المتغير مكانياً، بينما تمثل β(S) معامل الانحياز المتغير مكانياً. ويمكن لهذه المعاملات أن تساعد المولد في إنشاء أنسجة وأنماط مختلفة بناءً على المنطقة الدلالية في الصور. ويمكن تعريف العمل الفني الثقافي النهائي كما هو موضح في المعادلة 20:

هنا، يمثل GE مولد SPADE، ويمثل XrP النمط المعاد بناؤه، وتمثل SM خريطة التجزئة. يحافظ العمل الفني النهائي على السلامة الهيكلية للزخارف الثقافية مع تعزيز المظهر الفني. تم استخدام دالة فقد مركبة توازن بين دقة التجزئة الدلالية، والحفاظ على الزخارف الثقافية، وجودة إعادة بناء النمط، واتساق الأسلوب الفني لتحسين بنية SegCycle-SPADE المقترحة. ولتحديد هدف التدريب العام، تم استخدام خليط موزون من فقد التجزئة (Lseg)، والفقد التنافسي (Ladv)، وفقد اتساق الدورة (Lcycle)، وفقد إعادة البناء (Lrecon)، وفقد الحفاظ على الزخارف (Lmotif)، وفقد اتساق الأسلوب (Lstyle). تم تعريف دالة الفقد الإجمالية في المعادلة 21:
(21)
لضمان الاتساق الهيكلي بين الزخارف الثقافية المدخلة والمُعاد بناؤها، تم تعيين معامل فقدان الاتساق الدوري عند 10. وللحفاظ على سمات الزخارف دقيقة التفاصيل وتعزيز الدقة البصرية، تم تعيين معامل فقدان إعادة البناء عند 5. ولتسليط الضوء على الحفاظ على الأنماط الهيكلية الأساسية ثقافياً أثناء التركيب الفني، استُخدم معامل قدره 2 لفقدان الحفاظ على الزخارف. ومن أجل تعزيز نقل الأسلوب الفني دون تشويه الهياكل الدلالية للزخارف بشكل مفرط، تم ضبط معامل فقدان اتساق الأسلوب عند 1. وللحفاظ على مساهمة متوازنة بين إنتاج صور واقعية وتقسيم دقيق للزخارف، أُعطيت أوزان متساوية لفقدان التقسيم والفقدان التنافسي. استُخدمت تمثيلات الأسلوب القائمة على السمات من مجموعة بيانات WikiArt لحساب فقدان اتساق الأسلوب. وبشكل خاص، تم التقاط سمات الأسلوب الفني باستخدام ارتباطات مصفوفة Gram التي استُخرجت من خرائط السمات العميقة. استُخدم فرق معيار Frobenius بين مصفوفات Gram لصورة الأسلوب المستهدفة والصورة المولدة لحساب فقدان الأسلوب، كما هو موضح في المعادلة 22:

هنا، تمثل Gl مصفوفة غرام المحسوبة من طبقة الميزات lth، ويشير Igen إلى الصورة الفنية المولدة، بينما يشير Istyle إلى صورة النمط المستهدفة من مجموعة بيانات WikiArt، ويمثل F معيار فروبينيوس. تتيح هذه الصيغة للإطار المقترح الحفاظ على الخصائص الفنية مع الإبقاء على السلامة الهيكلية والدلالية للزخارف الثقافية.
تُستخدم تمثيلات الميزات المدمجة الناتجة عن وحدة CAFFM كمدخلات شرطية لوحدة SPADE، والتي تعمل كعنصر للتوليف الفني في الإطار المقترح. يتكون مولد SPADE من سبع كتل متبقية (residual blocks) من نوع SPADE ببعد ميزات كامن يبلغ 256 قناة، ويقوم بتوليد صور مخرجة بدقة 256 × 256 بكسل. تُستخدم خرائط التقسيم الدلالي (semantic segmentation maps) التي تم الحصول عليها من وحدة SegFormer–CAFFM كمدخلات شرطية عبر طبقات SPADE المتبقية. تُطبق طبقات SPADE قبل دوال التنشيط داخل كل كتلة متبقية، مما يسمح بإجراء تكييف دلالي موجه بالتقسيم. ومن خلال عمليات الرفع العيني (upsampling) والالتفاف (convolutional operations) المتتالية، يتم تحسين تمثيل الميزات الكامن تدريجيًا لتوليد أنماط فنية عالية الدقة مع الحفاظ على الاتساق الدلالي وبنية الزخارف. تُستخدم دوال تنشيط LeakyReLU في جميع أنحاء المولد، وتُطبق دالة تنشيط Tanh عند طبقة المخرجات لإنتاج صور معيرة.
الخوارزمية وسير العمل
يُدمج إطار عمل SegCycle-SPADE كلاً من التجزئة الدلالية، ودمج الميزات، وإعادة بناء الأنماط، وتوليف النمط الفني ضمن خط تدريب موحد. يبدأ سير العمل بالحصول على مجموعة البيانات ومعالجتها مسبقاً، بما في ذلك تغيير حجم الصور، والتقييس، وإزالة الضجيج، وإعداد أقنعة التجزئة. تُعالج الصور التي تمت معالجتها مسبقاً لاحقاً باستخدام شبكة التجزئة SegFormer-B2 لاستخراج تمثيلات الزخارف الدلالية. ثم تُدمج ميزات التجزئة الناتجة مع ميزات إعادة البناء من خلال وحدة CAFFM، مما يتيح التفاعل بين معلومات الزخارف الهيكلية وتمثيلات الميزات الفنية. بعد ذلك، يتم تزويد خرائط الميزات المدمجة بوحدة إعادة البناء CycleGAN، التي تعمل على استعادة هياكل الزخارف الثقافية غير المكتملة مع الحفاظ على الاتساق الدلالي. ثم تُقدم الأنماط المعاد بناؤها إلى مولد SPADE لإجراء توليف فني موجه بالتجزئة، مما يسمح بالتحسين الأسلوبي مع الحفاظ على حدود الزخارف والأصالة الهيكلية. أثناء التدريب، يتم تحسين معاملات النموذج باستخدام دالة الخسارة المركبة الموضحة في المعادلتين 21 و22، والتي توازن بين دقة التجزئة، والحفاظ على الزخارف، وجودة إعادة البناء، واتساق النمط الفني. يتوفر سير عمل تفصيلي للتنفيذ خطوة بخطوة، يشمل تحميل مجموعة البيانات، والمعالجة المسبقة، وتهيئة النموذج، وتكرارات التدريب، وإجراءات التحقق، واختيار نقاط التحقق، والتقييم النهائي، في الملف التكميلي 1 (الخوارزمية 1). تم تنفيذ سير العمل الخوارزمي الكامل باستخدام حجم دفعة قدره 16، ومعدل تعلم 0.0002، و100 حقبة تدريبية. استُخدمت بذرة عشوائية ثابتة بقيمة 42 لتقسيم مجموعة البيانات، وتهيئة النموذج، وجميع تجارب التدريب. طُبقت هذه البذرة باتساق عبر مولدات الأعداد العشوائية في Python وNumPy وPyTorch لضمان إمكانية إعادة إنتاج النتائج. تم تكوين مُحسّن Adam بقيم β₁ = 0.5 وβ₂ = 0.999 وبدون اضمحلال في الأوزان (weight decay = 0). تم اختيار نقاط تحقق النموذج بناءً على أعلى درجة IoU تحقق عليها في مجموعة بيانات التحقق.
تحسين دالة الخسارة
للحفاظ على هياكل الزخارف الثقافية أثناء عملية إعادة البناء والتركيب الفني، يستخدم الإطار المقترح هدف تحسين مركب يجمع بين خسائر التجزئة، والخسارة التنافسية، واتساق الدورة، وإعادة البناء، والحفاظ على الزخارف، واتساق النمط. تتوفر الصيغة الرياضية الكاملة، ومعاملات الوزن، وتعريف خسارة النمط في المعادلتين 21 و22 ضمن القسم الفرعي توليد النمط الفني باستخدام SPADE. يعمل مكون الحفاظ على الزخارف على معاقبة الانحرافات الهيكلية بين مناطق الزخارف المتوقعة وأقنعة التجزئة المرجعية المقابلة لها، مما يشجع على الحفاظ على هياكل الأنماط ذات الأهمية الثقافية طوال عملية إعادة البناء.