تم تصميم الإطار المقترح لـ SegCycle-SPADE لإعادة بناء وتحسين أنماط التراث الثقافي التقليدية من خلال التقسيم الدلالي، وتعزيز الميزات باستخدام آلية الانتباه، وإعادة البناء التوليدية، وتخليق الأنماط الفنية. استخدمت هذه الدراسة مجموعات بيانات متاحة للجمهور للتراث الثقافي والصور الفنية، بما في ذلك مجموعة بيانات باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. لم يشارك في البحث أي مشاركين بشريين، أو بيانات مرضى، أو معلومات شخصية، أو حيوانات تجارب، أو سجلات سريرية؛ وبالتالي، لم تكن هناك حاجة لموافقة لجنة أخلاقيات المؤسسة أو الحصول على موافقة مستنيرة. في البداية، تم استخدام مجموعة بيانات الزخارف الثقافية لباتيك مياو ومجموعة بيانات WikiArt لعملية التقييم. تم وصف مجموعة بيانات باتيك مياو في دراسة Quan et al. (2024)32 وهي تحتوي على 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. تم استخدام التوضيحات الموجودة التي وفرها منشئو مجموعة البيانات مباشرة، ولم يتم إنتاج أي توضيحات يدوية إضافية في هذه الدراسة. بعد ذلك، تم إجراء المعالجة المسبقة للصور من خلال تغيير الحجم، والتطبيع، وإزالة الضوضاء، وإنشاء قناع تقسيم. تم وصف معاملات المعالجة المسبقة الدقيقة في القسم الفرعي للمعالجة المسبقة للبيانات. يستخدم الإطار المقترح نموذجاً قائماً على المحولات يسمى SegFormer-B2 للتقسيم الدلالي للبيانات. تهدف هذه الطريقة إلى اكتشاف المناطق الرئيسية للزخارف الثقافية وتعلم هياكلها. ثم يتم تعزيز الميزات المقسمة من خلال آلية الانتباه، حيث يتم إبراز المعلومات المهمة المتعلقة بالزخارف الثقافية واستبعاد المعلومات غير ذات الصلة. تم وصف تهيئة آلية الانتباه في القسم الفرعي CAFFM. بعد ذلك، يتم تمرير الميزات المحسنة عبر CycleGAN، حيث يتم إعادة بناء الهياكل التالفة من خلال التعلم الدوري. أثناء التدريب، تم إنشاء عينات زخرفية غير مكتملة اصطناعياً عن طريق تطبيق عمليات القناع العشوائي والحجب الجزئي على صور باتيك مياو الأصلية. حاكت إجراءات التدهور هذه مناطق الزخارف المفقودة والتلف الهيكلي الشائع ملاحظته في القطع التراثية الثقافية المتدهورة. استُخدمت الصور غير المكتملة الناتجة كمدخلات لوحدة إعادة بناء CycleGAN، بينما عملت الصور الأصلية المقابلة كأهداف لإعادة البناء. ثم يتم تحسين أنماط التراث الثقافي المعاد بناؤها من خلال SPADE، حيث يتم إجراء التحسين الفني بناءً على خرائط التقسيم المولدة. يتم تقييم أداء الإطار المقترح باستخدام مقاييس كمية للتقسيم وجودة الصور، بينما يتم تقييم الأصالة البصرية للزخارف الثقافية المعاد بناؤها نوعياً. تم تقييم الأصالة البصرية من خلال الفحص البصري للأنماط الثقافية المولدة ولم تُستخدم كمقياس كمي مستقل. ركز التقييم على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والتماسك الهيكلي، والمظهر الفني مقارنة بالزخارف الثقافية المرجعية المقابلة. تم إجراء التقييم الكمي لأداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضوضاء (PSNR)، ومسافة فريشيه البادئة (FID). يوضح الشكل 2 سير العمل العام لإطار SegCycle-SPADE المقترح ويلخص مقاييس التقييم المستخدمة في هذه الدراسة.

الشكل 2. سير عمل البنية العامة لإطار عمل SegCycle-SPADE المقترح. نظرة عامة على سير عمل SegCycle-SPADE الكامل. تخضع الصور المأخوذة من مجموعات بيانات Miao Batik وWikiArt للمعالجة المسبقة قبل معالجتها عبر التجزئة الدلالية باستخدام SegFormer-B2، وتعزيز الميزات باستخدام CAFFM، وإعادة بناء الأنماط باستخدام CycleGAN، وتوليد النمط الفني باستخدام SPADE. يتم تقييم أداء النموذج باستخدام دقة التجزئة (Segmentation Accuracy)، والتقاطع فوق الاتحاد (IoU)، ومعامل Dice، ومقياس مؤشر التشابه الهيكلي (SSIM)، وPSNR، ومسافة Fréchet Inception (FID)، بينما يتم تقييم الأصالة البصرية نوعياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
صُمم إطار عمل SegCycle-SPADE لإعادة بناء أنماط التراث الثقافي لدمج مكونات متعددة من التعلم العميق (DL) من أجل تقسيم الزخارف وإعادة بنائها وتعزيزها فنياً بدقة، كما هو موضح في الشكل 2. تُستخدم صور من مجموعة بيانات زخارف مياو باتيك (Miao Batik) ومجموعة بيانات WikiArt لتوفير أنماط ثقافية وأنماط فنية متنوعة. في البداية، تُعالج الصور باستخدام وحدة تقسيم دلالي تعتمد على SegFormer لتحديد وتخطيط الزخارف الثقافية وفصلها عن الخلفية. تتكون البنية العامة من أربع مراحل رئيسية؛ أولاً، يستخرج نموذج SegFormer خرائط التقسيم الدلالي من صور الأنماط الثقافية. ثانياً، يقوم CAFFM بدمج ميزات التقسيم مع التمثيلات التوليدية لتعزيز تعلم الميزات. ثالثاً، تقوم وحدة CycleGAN بإعادة بناء الأنماط الثقافية باستخدام تمثيلات الميزات المدمجة. وأخيراً، تقوم وحدة SPADE بتوليد مخرجات محسنة فنياً مع الحفاظ على الاتساق الهيكلي من خلال التوليد الموجه بالتقسيم. تُعالج خرائط الميزات المنقحة لاحقاً بواسطة وحدة إعادة بناء CycleGAN، التي تتعلم استعادة الزخارف الثقافية غير المكتملة عن طريق ربط الأنماط المتدهورة بأشكالها الكاملة المقابلة. تم توليد عينات من الزخارف غير المكتملة عن طريق تطبيق عمليات قناع عشوائية وحجب جزئي على صور مياو باتيك الأصلية، وذلك لمحاكاة مناطق الأنماط المفقودة والتدهور الهيكلي الشائع ملاحظته في القطع الأثرية الثقافية المتضررة. وقد تم إقران كل صورة متدهورة بالصورة الأصلية المقابلة لها، والتي كانت بمثابة هدف إعادة البناء أثناء التدريب. مكنت هذه الاستراتيجية وحدة CycleGAN من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص ذات الأهمية الثقافية. وأخيراً، ينتج مولد SPADE مخرجات فنية محسنة بصرياً عن طريق جعل توليد الصور مشروطاً بخرائط التقسيم الناتجة، مما يحافظ على السلامة الهيكلية للزخارف الثقافية طوال عملية التعزيز الفني.
تتضمن الخطوات التالية إطار عمل SegCycle-SPADE المقترح.
الخطوة 1: جمع مجموعات البيانات
تم استخدام مجموعتي بيانات لتحقيق أهداف تعلم الأنماط الثقافية وتوليد الأنماط الفنية. استُخدمت مجموعة بيانات "Miao Batik Cultural Motif" لتوفير معلومات عن الأنماط الثقافية التقليدية، وهي متاحة للعموم عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658) وتحتوي على 15,148 صورة مُصنفة من زخارف الباتيك التقليدية لشعب المياو. وقد استُخدمت التصنيفات الموجودة التي وفرها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي تصنيفات يدوية إضافية في هذه الدراسة. كما استُخدمت مجموعة بيانات "WikiArt" لتوفير معلومات متنوعة عن الأنماط الفنية لغرض توليد الأنماط الفنية، وتم الحصول عليها من مستودع WikiArt المتاح للعموم (https://www.wikiart.org/).
الخطوة 2: المعالجة المسبقة للبيانات
خضعت جميع الصور لمعالجة مسبقة من خلال تغيير الحجم، والتطبيع، وتقليل الضوضاء. واستُخدمت تعليقات الزخارف الثقافية الموجودة، والتي تم الحصول عليها من مصادر مجموعة البيانات الأصلية، لدعم مرحلة التجزئة الدلالية. ولم يتم إجراء أي إجراءات تعليق أو إعادة تسمية إضافية كجزء من هذه الدراسة.
الخطوة 3: تقسيم الأنماط الدلالية باستخدام SegFormer
استُخدم نموذج SegFormer لتقسيم الزخارف الثقافية. تم وصف العمود الفقري لنموذج SegFormer واستراتيجية التهيئة بدقة في القسم الفرعي تقسيم الأنماط الدلالية باستخدام SegFormer. وتحديداً، تم توظيف بنية SegFormer-B2 مع عمود فقري من نوع MIT-B2 مُدرب مسبقاً على ImageNet لتقسيم الزخارف الدلالية. يلتقط هذا النموذج المعلومات السياقية العالمية بفعالية مع الحفاظ على التفاصيل الهيكلية المعقدة للأنماط الثقافية التقليدية.
الخطوة 4: CAFFM
يجمع CAFFM بين ميزات التقسيم الدلالي والتمثيلات التوليدية، مما يمكن الإطار من تعلم كل من خصائص الزخارف الهيكلية ومعلومات الأسلوب الفني. تتوفر تفاصيل تكامل CAFFM في القسم الفرعي CAFFM. يتم وضع هذه الوحدة بين مرحلة التقسيم الدلالي القائمة على SegFormer ومرحلة إعادة البناء التوليدية، حيث تقوم بدمج الميزات الهيكلية المستمدة من التقسيم مع ميزات إعادة البناء من خلال آلية الانتباه المتقاطع متعدد الرؤوس (multi-head cross-attention). وتعمل هذه العملية على تحسين الحفاظ على الزخارف الثقافية وتعزيز واقعية المخرجات المعاد بناؤها.
الخطوة 5: إعادة بناء النمط (CycleGAN)
تتم معالجة الميزات المدمجة لاحقاً بواسطة وحدة CycleGAN لإعادة بناء هياكل الأنماط الثقافية. تم وصف بنية CycleGAN وتكوين التدريب في القسم الفرعي إعادة بناء النمط باستخدام CycleGAN. تتكون وحدة إعادة البناء من مولدين ومميزين اثنين، وتستخدم بنية مولد شبكة متبقية (residual-network) تحتوي على تسع كتل متبقية، وتعتمد مميز PatchGAN، ويتم تدريبها باستخدام خسائر التنافس (adversarial losses) واتساق الدورة (cycle-consistency losses). يتيح هذا التكوين تعيين النطاقات ثنائي الاتجاه ويسهل عملية إعادة بناء هياكل الأنماط الثقافية غير المكتملة.
الخطوة 6: توليد النمط الفني (SPADE)
تتم بعد ذلك معالجة الأنماط المعاد بناؤها من خلال وحدة SPADE لإجراء تركيب نمط فني موجه بالتجزئة. تم وصف تهيئة مولد SPADE في القسم الفرعي توليد النمط الفني باستخدام SPADE. وتستخدم الوحدة كتل SPADE المتبقية، وطبقات تطبيع تكيفية مكانياً، وتكييفاً دلالياً مشتقاً من خرائط تجزئة SegFormer وتمثيلات ميزات CAFFM. ومن خلال تكييف توليد الصور بناءً على خرائط التجزئة، تحافظ المخرجات المركبة على المحاذاة الهيكلية مع الزخارف الثقافية الأصلية مع دمج خصائص النمط الفني.
الخطوة 7: تقدير الأداء
تم تقييم الإطار المقترح باستخدام مقاييس متعددة للتجزئة وتقييم جودة الصور، بما في ذلك دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل تشابه دايس (Dice)، ومؤشر التشابه الهيكلي (SSIM)، ونسبة إشارة الذروة إلى الضوضاء (PSNR)، والمسافة الفريشيه البداية (FID). ولتقييم الاتساق التجريبي، كُررت جميع التجارب خمس مرات باستخدام بذور عشوائية مختلفة، وسُجلت النتائج كمتوسط ± الانحراف المعياري. كما تم تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة، مع حد دلالة p < 0.05.
جمع مجموعات البيانات
في إطار عمل SegCycle-SPADE المقترح، يتم استخدام مجموعتي بيانات لفهم الأنماط الثقافية وتعلم الأسلوب. مجموعة البيانات الأولى المستخدمة في الإطار المقترح هي مجموعة بيانات زخارف باتيك مياو (Miao Batik) الثقافية. تحتوي هذه المجموعة على زخارف ثقافية من فن باتيك مياو، وهي عموماً صور لباتيك مياو التقليدي تحتوي على زخارف مثل الحيوانات والنباتات والأشكال الهندسية المستخدمة في فن عرقية مياو. وتتضمن هذه المجموعة صوراً ذات معلومات غنية في الملمس والنسيج، وهو أمر مهم بشكل عام للحفاظ على التراث الثقافي. أما مجموعة البيانات الثانية المستخدمة في إطار عمل SegCycle-SPADE فهي مجموعة بيانات WikiArt. تحتوي هذه المجموعة على عدد هائل من الأعمال الفنية التي تنتمي عموماً إلى أساليب مختلفة. وتُستخدم هذه المجموعة لتعلم الأساليب المعقدة، وهو أمر مفيد بشكل عام لتعزيز الأعمال الفنية. تضم هذه المجموعة 80,000 عمل فني بدقة HD، مع 27 تصميماً مختلفاً، مما يجعلها أكثر فائدة لمهام توليد الأساليب أو تحويلها القائمة على التعلم العميق (DL).
مجموعة بيانات باتيك مياو (Miao Batik Dataset):
تتكون مجموعة بيانات باتيك مياو (https://doi.org/10.5281/zenodo.20807658) من 15,148 صورة لأنماط الباتيك التي تصور زخارف ذات أهمية ثقافية. وتشتمل الصور على مجموعة متنوعة من التصاميم التقليدية، مثل الزخارف الحيوانية (مثل الفراشات والأسماك)، والأنماط القائمة على النباتات، والزخارف الهندسية التي تحمل رمزية ثقافية. وتعد مجموعة البيانات هذه مكوناً هاماً في الإطار المقترح لأنها توفر هياكل ثقافية أصيلة تمكّن وحدة التجزئة من تحديد حدود الزخارف والحفاظ عليها بدقة أثناء إعادة بناء النمط (الجدول 1). وفي هذه الدراسة، تشير الزخارف ذات الأهمية الثقافية إلى العناصر المرئية الرمزية الموثقة عادةً في أدبيات التراث الثقافي لشعب المياو والممثلة ضمن توصيفات مجموعة البيانات، بما في ذلك الطيور والفراشات والأنماط الزهرية وطواطم الأسلاف. وقد تم اختيار هذه الزخارف بناءً على أهميتها الثقافية الموثقة وتواجدها المتكرر في تصاميم باتيك وتطريز المياو التقليدية، بدلاً من الاعتماد فقط على تكرار ظهورها أو تكوينها المكاني. وتم الحصول على توصيفات الزخارف وعلامات التجزئة الموجهة من قبل الخبراء من مصدر مجموعة بيانات باتيك مياو الأصلي، واستُخدمت مباشرة في هذه الدراسة. ولم يقم المؤلفون بإجراء أي عمليات توصيف يدوي إضافية، أو إعادة تسمية، أو إجراءات توصيف موجهة من قبل الخبراء. وقد استُخدمت التوصيفات الحالية المقدمة من منشئي مجموعة البيانات لتدريب وتقييم التجزئة الدلالية.
| مَعلَمَة | الوصف |
| اسم مجموعة البيانات | مجموعة بيانات الأنماط الثقافية لباتيك مياو |
| مصدر مجموعة البيانات | مستودع Zenodo (معرف الكائن الرقمي: 10.5281/zenodo.20807658) |
| المجال | التراث الثقافي غير المادي / تحليل أنماط المنسوجات |
| إجمالي الصور | ١٥,١٤٨ صورة |
| نوع الصورة | صور رقمية لأنماط منسوجات الباتيك التقليدية لشعب مياو |
| فئات الأنماط | زخارف حيوانية، وزخارف نباتية، وزخارف هندسية |
| الأصل الثقافي | ثقافة عرقية مياو، مقاطعة قويتشو، الصين |
| دقة الصورة الأصلية | صور عالية الدقة (عادةً ≥ 1,000 بكسل في الجانب الأقصر) يتم التقاطها كمسوحات ضوئية خام أو صور فوتوغرافية قبل المعالجة المسبقة |
| دقة التدريب | تم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة |
| مدى توفر التعليقات التوضيحية | استُخدمت تعليقات التجزئة الموجودة التي وفرها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم. ولم يتم إجراء أي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة. |
| التطبيق في هذه الدراسة | تجزئة الزخارف الثقافية، واستخلاص الميزات، والحفاظ على الزخرفة، وإعادة بناء النمط |
الجدول 1: خصائص مجموعة بيانات أنماط باتيك مياو الثقافية. ملخص لمجموعة بيانات زخارف باتيك مياو الثقافية المستخدمة في التقسيم الدلالي، وتحليل الأنماط الثقافية، وإعادة بناء الزخارف. يصف الجدول مصدر مجموعة البيانات، وخصائص الصور، وفئات الزخارف، والأصل الثقافي، ودقة الصور، ودورها ضمن إطار عمل SegCycle-SPADE المقترح.
مجموعة بيانات WikiArt:
تُعد مجموعة بيانات WikiArt [https://www.wikiart.org/] مستودعاً رقمياً واسع النطاق وشائع الاستخدام للفنون، حيث تضم أكثر من 80,000 صورة موزعة على 27 أسلوباً فنياً مختلفاً كما هو موضح في الجدول 2. وتشمل هذه الأساليب فن عصر النهضة، والانطباعية، والتكعيبية، والسريالية. وتكتسب مجموعة البيانات هذه أهمية بالغة في الإطار المقترح كونها توفر المعرفة التي تسمح لوحدة SPADE بإنشاء أنماط غنية ثقافياً مع الحفاظ على المعلومات الهيكلية المستمدة من عملية التجزئة. تتكون مجموعة البيانات من 56,000 صورة للتدريب و12,000 صورة لكل من التحقق والاختبار. وتساعد الصور الموجودة في مجموعة البيانات في تدريب نموذج التعلم العميق (DL) بشكل فعال.
| مَعْلَمَة | الوصف |
| اسم مجموعة البيانات | مجموعة بيانات WikiArt |
| مصدر مجموعة البيانات | مستودع WikiArt (https://www.wikiart.org/) |
| المجال | الفنون واللوحات الرقمية |
| إجمالي الصور | ما يقرب من 80,000 عمل فني |
| صور التدريب | 56,000 |
| صور التحقق | 12,000 |
| صور اختبارية | 12,000 |
| الأساليب الفنية | ٢٧ أسلوباً فنياً، بما في ذلك عصر النهضة، والانطباعية، والتكعيبية، والسريالية، والتعبيرية، والواقعية، والفن التجريدي |
| دقة الصورة الأصلية | تتفاوت دقة الصور الأصلية عبر الأعمال الفنية والمصادر المختلفة. لذا، تم تغيير حجم الصور إلى دقة موحدة تبلغ 256 × 256 بكسل خلال مرحلة المعالجة المسبقة. |
| دقة التدريب | تم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة قبل تعلم النمط الفني والتوليف الصوري الموجه بالتجزئة. |
| تقسيم مجموعة البيانات | تقسيم عشوائي طبقي (70% للتدريب، و15% للتحقق، و15% للاختبار) باستخدام بذرة عشوائية ثابتة بقيمة 42 |
| استراتيجية أخذ عينات الأسلوب | تم استخدام المعاينة التناسبية الطبقية للحفاظ على توزيع الأنماط الفنية السبعة والعشرين عبر المجموعات الفرعية للتدريب والتحقق والاختبار. |
| التطبيق في هذه الدراسة | تعلم الأسلوب الفني، وتمثيل الأسلوب، والتوليف الفني الموجه بالتجزئة |
الجدول 2: خصائص مجموعة بيانات WikiArt. ملخص لمجموعة بيانات WikiArt المستخدمة في تعلم الأسلوب الفني وتخليق الصور الموجه بالأسلوب. يصف الجدول مصدر مجموعة البيانات، وتوزيع الصور، وتغطية الأساليب الفنية، وتقسيم مجموعة البيانات، ودقة الصور، وتطبيقها ضمن إطار عمل SegCycle-SPADE المقترح.
تحتوي مجموعة بيانات باتيك مياو (Miao Batik) على 15,148 صورة تمثل الزخارف الثقافية التقليدية لشعب المياو.32 تتوفر مجموعة البيانات للعامة عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658). وقبل تدريب النموذج، خضعت جميع الصور للفحص البصري، وتم تغيير حجمها إلى 256 × 256 بكسل، ومعايرتها، وفحصها للكشف عن أي عينات تالفة أو مكررة. ولم يسفر فحص مراقبة الجودة عن استبعاد أي صور؛ وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 للتحليل اللاحق. كما تم تقسيم مجموعة البيانات عشوائياً إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام بذرة عشوائية ثابتة بقيمة 42 لضمان إمكانية إعادة إنتاج تقسيمات مجموعة البيانات. تم الوصول إلى مجموعة بيانات WikiArt من خلال مستودع WikiArt الرسمي (https://www.wikiart.org/)، وهي تحتوي على أكثر من 80,000 عمل فني تشمل 27 نمطاً فنياً. وبالنسبة لتجارب تعلم النمط، استُخدمت 56,000 صورة للتدريب، و12,000 للتحقق، و12,000 للاختبار.
المعالجة المسبقة للبيانات
قبل تدريب إطار عمل SegCycle-SPADE المقترح، خضعت مجموعة بيانات زخارف باتيك مياو الثقافية ومجموعة بيانات WikiArt لعدة خطوات معالجة مسبقة لضمان اتساق جودة الصور ودقة تمثيل السمات. تم تطبيق نفس مسار المعالجة المسبقة الأساسي، بما في ذلك إزالة الضجيج بطريقة غاوس (Gaussian denoising)، والتطبيع (normalization)، وتغيير الحجم إلى دقة إدخال ثابتة، والتحقق من جودة الصور، على كلتا المجموعتين. ومع ذلك، لعبت مجموعات البيانات أدواراً متميزة داخل إطار العمل؛ حيث استُخدمت مجموعة بيانات WikiArt لتعلم الأنماط الفنية وتوليدها، بينما استُخدمت مجموعة بيانات باتيك مياو بشكل أساسي لتجزئة الزخارف الثقافية وإعادة بنائها. ولم يتم إجراء أي تغييرات في المعالجة المسبقة خاصة بمجموعة بيانات معينة خارج هذه الأدوار المحددة لكل مهمة. ولضمان معالجة متسقة بواسطة نموذج التعلم العميق (DL)، تم أولاً تغيير حجم الصور إلى دقة ثابتة. كانت هذه الخطوة ضرورية لأن الصور في كلتا المجموعتين تفاوتت في الدقة بناءً على مصدرها، وقد أدى تغيير الحجم إلى تحسين الكفاءة الحسابية ومنع التناقضات البعدية من التأثير على التدريب. وكانت الخطوة الثانية في المعالجة المسبقة هي التطبيع، حيث تم تغيير مقياس قيم البكسل إلى نطاق قياسي لاستقرار تحديثات التدرج أثناء التدريب. ثم تمت معالجة الصور باستخدام ترشيح غاوس لتقليل الضجيج الذي قد يتداخل مع هياكل الزخارف الثقافية. وبالنسبة لمجموعة بيانات باتيك مياو، استُخدمت أقنعة تجزئة الزخارف الثقافية الموجودة، والتي تم الحصول عليها مباشرة من مصدر مجموعة البيانات الأصلي، دون تعديل لتدريب وتقييم التجزئة الدلالية (semantic segmentation). ولم يتم إنشاء أقنعة تجزئة جديدة خصيصاً لهذه الدراسة.
ما لم يُذكر خلاف ذلك، تم اقتباس المعادلات التي تصف الطرق المعتمدة من دراسات سابقة وتم الاستشهاد بها وفقاً لذلك. أما المعادلات التي تصف طريقة CAFFM المقترحة وإطار عمل تحسين SegCycle-SPADE المركب، فقد طورها المؤلفون خصيصاً لهذه الدراسة.
لتكن صورة المدخلات من مجموعة البيانات مُمثلة على النحو التالي: المعادلة 1:
(1)
هنا، تشير H وW وC إلى ارتفاع الصورة وعرضها وعدد قنوات الألوان، على التوالي. يتم تغيير حجم جميع الصور إلى بُعد ثابت H′ × W′ كما هو موضح في المعادلة 2:

هنا، Iيرجى تقديم النص المصدر المراد ترجمته. هي الصورة بعد تغيير حجمها. وتُحسب قيم البكسل المُطبّعة وفقاً لـ المعادلة 3:
(3)
يساعد هذا في تثبيت إجراء التدريب. ويتم إجراء ترشيح الضوضاء باستخدام مرشح غاوسي كما هو موضح في المعادلة 4:

هنا، يمثل G(σ) مرشح غاوس (Gaussian filter) وتمثل العلامة * عملية الالتفاف (convolution). تم استخدام مرشح غاوس بنواة 5 × 5 وانحراف معياري قدره σ = 1.0. كما تم تطبيق حشو انعكاسي (Reflective padding) على بكسلات الحدود لتقليل التشوهات الحافية. وقد أُجريت عملية إزالة الضجيج فور تحميل الصور وقبل عمليتي القياس والتطبيع. ولضمان توحيد المعالجة المسبقة طوال فترة الدراسة، تم تطبيق نفس تكوين المرشح على كل صورة في مجموعتي بيانات Miao Batik و WikiArt. وبالنسبة لمجموعة بيانات Miao Batik، يتم إنشاء أقنعة التجزئة وفقًا لـ المعادلة 5:

هنا، يمثل M قناع تقسيم يُستخدم لتوجيه نموذج SegFormer.
تبدأ سلسلة المعالجة المسبقة بالحصول على الصور من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt، كما هو موضح في الشكل 3. لم يتم استخدام أي تقنيات لتعزيز البيانات أثناء التدريب. وبعد المعالجة المسبقة، التي شملت تغيير الحجم، والتطبيع، وإزالة الضجيج الغاوسي، وإعداد أقنعة التقسيم، استُخدمت الصور مباشرة لتدريب إطار SegCycle-SPADE المقترح والتحقق من صحته واختباره. تتضمن الخطوة الأولية في سلسلة المعالجة المسبقة تغيير حجم الصور إلى حجم ثابت، مما يسمح لنموذج التعلم العميق بمعالجة الصور بشكل أكثر كفاءة. وتتضمن الخطوة الثانية التطبيع، الذي يحول قيم البكسل إلى نطاق عددي موحد ويسهل تقارب النموذج. أما الخطوة الثالثة فتتضمن إزالة الضجيج، حيث يتم تنقية الصور من الضجيج غير المرغوب فيه لتحسين التعرف على الأنماط. بالإضافة إلى ذلك، وفيما يخص مجموعة بيانات Miao Batik، يتم تحديد مناطق الزخارف الثقافية، مما يسمح بتوليد أقنعة تُستخدم في وحدة التقسيم للنموذج المقترح، لضمان الحفاظ على الزخارف الثقافية أثناء التوليد. والمخرج النهائي لهذه المرحلة هو مجموعة بيانات نظيفة جاهزة لتدريب وحدات التقسيم والتوليد في النموذج المقترح.

الشكل 3سلسلة معالجة البيانات المسبقة لصور التراث الثقافي. مخطط لسير العمل يوضح إجراءات المعالجة المسبقة للصور المطبقة قبل تدريب النموذج. يتضمن المسار الحصول على مجموعة البيانات، وتغيير حجم الصور، والتطبيع، وإزالة الضجيج بطريقة غاوس، وتوصيفات الزخارف الثقافية الموجودة، وإعداد أقنعة التجزئة. تُستخدم الصور والأقنعة المعالجة الناتجة كمدخلات للتجزئة الدلالية وإعادة بناء الأنماط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
خضعت كل صورة لعملية مراقبة الجودة قبل تدريب النموذج. تضمنت مجموعة بيانات Miao Batik ١٥,١٤٨ صورة. وقد قام منشئو مجموعة البيانات الأصليون بالفعل بمعالجة العينات التالفة والمكررة ومنخفضة الجودة؛ لذا، لم يتم استبعاد أي صور إضافية أثناء فحص مراقبة الجودة في هذه الدراسة. وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها ١٥,١٤٨ للتحليل. حُمِّلت الصور بتنسيق RGB أثناء المعالجة المسبقة، وتم تغيير حجمها إلى 256 × 256 بكسل باستخدام الاستيفاء الثنائي الخطي (bilinear interpolation). تم تغيير مقياس قيم البكسل من النطاق [0, 255] إلى [0, 1] عن طريق القسمة على 255. ثم تم تطبيق التطبيع لكل قناة (Channel-wise normalization) باستخدام قيم متوسط [0.485, 0.456, 0.406] وقيم انحراف معياري [0.229, 0.224, 0.225] للقنوات الحمراء والخضراء والزرقاء على التوالي. شمل مسار المعالجة المسبقة تحميل الصور، والتحويل إلى RGB، وتغيير الحجم، وتغيير مقياس قيم البكسل، والتطبيع، والتحويل إلى تنسيق الموتر (tensor conversion). وعندما لزم الأمر، تم تحويل الصور ذات التدرج الرمادي إلى تنسيق RGB ثلاثي القنوات للحفاظ على التوافق مع نماذج التعلم العميق (DL). وبعد المعالجة المسبقة، قُسمت الصور إلى مجموعات فرعية للتدريب والتحقق والاختبار. استخدمت جميع مراحل إطار عمل SegCycle-SPADE — بما في ذلك التجزئة الدلالية، ودمج الميزات، وإعادة بناء الزخارف، والتخليق الفني القائم على SPADE — دقة إدخال ثابتة قدرها 256 × 256 بكسل.
تقسيم الأنماط الدلالية باستخدام SegFormer
بعد خطوة المعالجة المسبقة هذه، يتم إدخال الصور المنظفة والموحدة من مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt في وحدة التقسيم الدلالي بناءً على الإطار المقترح SegFormer-B2. والغرض من هذه الخطوة هو تحديد وفصل الزخارف الثقافية الموجودة في الأنماط التراثية بشكل صحيح. يعتمد الإطار المقترح لـ SegFormer على بنية محول (transformer) تدمج مشفر محول هرمي ومفكك شفرة MLP خفيف الوزن لالتقاط المعلومات السياقية العالمية والمعلومات الهيكلية التفصيلية من الأنماط التراثية المعقدة بدقة. يقوم النموذج أولاً باستخراج تمثيلات الميزات بمقاييس متعددة من الصورة المدخلة، يلي ذلك دمج هذه التمثيلات من خلال مفكك الشفرة لإنشاء أنماط مقسمة بدقة. ويضمن ذلك تقسيم الأنماط في الصورة التراثية بشكل صحيح إلى زخارف مثل الأنماط الهندسية، والأنماط النباتية، والأنماط الرمزية، وبالتالي فصلها عن الخلفية مع الحفاظ على سلامتها الهيكلية. تُستخدم هذه المعلومات الهيكلية لاحقاً خلال المراحل اللاحقة من توليد الأنماط ضمن إطار عمل SegCycle-SPADE.
لتكن الصورة المدخلة التي تمت معالجتها مسبقاً ممثلة كـ المعادلة 6:
(6)
يقوم مشفر SegFormer بتقسيم الصورة إلى رقع واستخراج الميزات الهرمية باستخدام طبقات المحول (transformer)، كما هو موضح في المعادلة 71:

هنا، ف تشير إلى خرائط السمات متعددة المقاييس التي تم الحصول عليها من مشفّر المحوّل (transformer encoder). وتشفّر هذه السمات كلًا من أنماط النسيج المحلية والعلاقات السياقية العالمية بين مناطق الزخارف (motif regions). ويستخرج نموذج SegFormer خرائط سمات بمقاييس مختلفة كما هو محدد في المعادلة 8:

يُسهِّل استخدام التمثيلات متعددة المقاييس اكتشاف أنماط ذات أحجام مختلفة ضمن الزخارف الثقافية. وأخيرًا، يتم دمج الميزات باستخدام مفكك شفرة MLP كما هو موضح في المعادلة 91:

هنا، يشير S إلى خريطة التجزئة النهائية المتوقعة.
تم تهيئة العمود الفقري لنموذج SegFormer-B2 باستخدام أوزان مُدربة مسبقاً على ImageNet، ثم تم ضبطه بدقة لاحقاً على مجموعة بيانات Miao Batik لتقسيم الزخارف الثقافية. تم الحصول على نقطة التحقق المُدربة مسبقاً من التنفيذ الرسمي لنموذج SegFormer. وتحديداً، تم استخدام نقطة التحقق MIT-B2 المُدربة مسبقاً على ImageNet-1K (mit_b2.pth) والمقدمة من مستودع SegFormer الرسمي لتهيئة العمود الفقري لنموذج SegFormer-B2 قبل عملية الضبط الدقيق. وتتوافق الأوزان المُدربة مسبقاً مع العمود الفقري MIT-B2 الذي أصدره مؤلفو SegFormer، وعملت كنموذج تهيئة للتدريب على التقسيم الدلالي. أما الطبقات المتبقية الخاصة بالمهمة، فقد تم تهيئتها باستخدام إجراءات تهيئة الأوزان الافتراضية في PyTorch قبل البدء في التدريب.
تستخدم البنية الهندسية مشفراً ترانسفورمر (Transformer encoder) هرمياً مكوناً من أربع مراحل مع تضمينات رقع متداخلة (overlapping patch embeddings). في المرحلة الأولية، تم تحديد حجم الرقعة بـ 7 × 7 مع خطوة إزاحة (stride) قدرها 4. وبالنسبة لكل مرحلة من مراحل التشفير الأربعة، كانت أبعاد التضمين 64، و128، و320، و512. وعلى مدار المراحل الأربعة، كان هناك 1، و2، و5، و8 رؤوس انتباه ذاتي متعددة الرؤوس (multihead self-attention heads)، وكانت أعماق المشفّر المقابلة 3، و4، و6، و3 طبقات. وتم تجميع الميزات متعددة المقاييس المستخرجة من المشفّر باستخدام مفك تشفير (decoder) خفيف الوزن يعتمد كلياً على الملحق متعدد الطبقات (all-MLP). وقبل إنشاء خريطة التجزئة النهائية، قام مفك التشفير بإسقاط الميزات من كل مرحلة تشفير في فضاء تضمين واحد. واستخدمت جميع كتل الترانسفورمر دالة تنشيط الوحدة الخطية للخطأ الغاوسي (GELU). كما تم استخدام معدل إسقاط (dropout rate) قدره 0.1 أثناء التدريب لتحسين التعميم وتقليل الإفراط في التخصيص (overfitting).
خلال مرحلة التدريب، يتلقى إطار عمل SegFormer الصور التي تمت معالجتها مسبقاً من كلتا مجموعتي البيانات. تحتوي الصور المستمدة من مجموعة بيانات Miao Batik على مناطق زخرفية تعمل كعلامات (labels) للتعلم الخاضع للإشراف لنموذج التجزئة. يقوم مشفر Transformer بمعالجة الصورة بأكملها والتقاط العلاقات طويلة المدى بين مكونات الصورة، وهو أمر بالغ الأهمية خاصة لأنماط الباتيك التقليدية التي تحتوي على زخارف موزعة مكانياً. كما تعمل آلية استخراج الميزات الهرمية في الوقت ذاته على التقاط البنى المحلية مثل الأنسجة الهندسية المتكررة. ويقوم مفكك رموز MLP بمعالجة هذه الميزات المستخرجة وإنتاج قناع تجزئة يبرز المناطق الزخرفية. وتُستخدم خرائط التجزئة الناتجة خلال هذه المرحلة لاحقاً كمدخلات هيكلية لوحدة الانتباه ومرحلة إعادة بناء الأنماط، مما يساعد بالتالي في الحفاظ على أصالة الأنماط المولدة.
قُسِّمت الزخارف الثقافية إلى فئات مختلفة للتجزئة الدلالية وفقاً لخصائصها البصرية والثقافية. وشمل تصنيف التجزئة الزخارف الحيوانية (مثل الفراشات والأسماك والطيور وغيرها من الحيوانات الرمزية)، والزخارف النباتية (مثل الزهور والأوراق والكروم والأنماط النباتية)، والزخارف الهندسية (مثل الأشكال المتكررة والحدود والهياكل الهندسية التجريدية)، بالإضافة إلى مناطق الخلفية التي تمثل المساحات غير المزخرفةة. استُخدمت أقنعة تجزئة على مستوى البكسل لتعيين كل بكسل إلى إحدى الفئات المحددة مسبقاً. وقد رُمزت التسميات الصحيحة على النحو التالي: التسمية 0 = الخلفية، التسمية 1 = الزخارف الحيوانية، التسمية 2 = الزخارف النباتية، والتسمية 3 = الزخارف الهندسية. تم الحصول على تعليقات التجزئة وتسميات الزخارف مباشرة من المصدر الأصلي لمجموعة بيانات Miao Batik. ولم يتم إجراء أي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو تحقق من الحدود، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة. واستُخدمت التعليقات الموجودة التي قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم.
يقوم نموذج SegFormer لتجزئة الزخارف الثقافية بمعالجة الصور التي تم تحضيرها مسبقاً من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt باستخدام آلية قائمة على المحولات (transformer) للكشف الدقيق عن مناطق الأنماط الثقافية، كما هو موضح في الشكل 4. أولاً، يتم تزويد نموذج SegFormer بالصورة المدخلة التي تحتوي على الزخارف الثقافية التقليدية. ويقوم مشفر المحول (Transformer encoder) باستخراج المعلومات السياقية العالمية والميزات الهيكلية المحلية من رقع الصور. ثم يتم توفير الميزات متعددة المقاييس الناتجة إلى مفكك التجزئة (segmentation decoder)، الذي يستخدم شبكة تغذية أمامية مختلطة (Mix Feed-Forward Network) لتحسين تمثيلات الميزات ورفع كفاءة الكشف عن الزخارف. وتكون مخرجات نموذج SegFormer عبارة عن قناع تجزئة يبرز البكسلات المقابلة للأنماط الثقافية مع حجب معلومات الخلفية غير ذات الصلة. بعد ذلك، تعمل الأنماط الثقافية المعزولة كإرشاد هيكلي للمراحل اللاحقة من إطار عمل SegCycle-SPADE.

الشكل 4التجزئة الدلالية للزخارف الثقافية استناداً إلى نموذج SegFormer-B2. بنية وحدة التجزئة الدلالية SegFormer-B2 المستخدمة لاستخراج الزخارف الثقافية، والتي تم تدريبها حصرياً على مجموعة بيانات باتيك مياو (Miao Batik). يتكون الإطار من مشفر يعتمد على محول (Transformer) لاستخراج السمات متعددة المقاييس، وفك تشفير تجزئة خفيف الوزن لتوليد أقنعة الزخارف. يتنبأ النموذج بأربع فئات دلالية هي: حيوان، ونبات، وهندسي، وخلفية؛ حيث تحدد أقنعة التجزئة الناتجة مناطق الزخارف ذات الأهمية الثقافية مع تثبيط معلومات الخلفية غير ذات الصلة. وتوفر مخرجات التجزئة هذه توجيهاً هيكلياً لمراحل دمج السمات، وإعادة البناء، والتوليف الفني اللاحقة في إطار عمل SegCycle-SPADE المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
لا توجد حاجة لإنشاء تعليقات توضيحية جديدة للتجزئة في الإطار المقترح. لقد تم الحصول على مجموعة بيانات باتيك مياو (Miao Batik) من مصدر عام متاح بالفعل، وتم تدريب النموذج باستخدام معلومات الزخارف ذات الصلة التي قدمها منشئو مجموعة البيانات. وخلال عملية التعلم، أنتج نموذج SegFormer خرائط تجزئة دلالية. ونتيجة لذلك، لم تتطلب الدراسة الحالية أي برامج إضافية للتعليق التوضيحي اليدوي، أو إرشادات للتعليق التوضيحي، أو إجراءات لمراقبة جودة التعليقات التوضيحية.
وحدة CAFFM
لتحسين التفاعل بين سمات التجزئة الدلالية وتمثيلات إعادة البناء التوليدية، اقترحت الدراسة أيضاً وحدة CAFFM. يوفر مشفر SegFormer-B2 خرائط سمات دلالية لوحدة CAFFM، بينما توفر خطوة إعادة البناء باستخدام CycleGAN خرائط سمات توليدية. أولاً، تُستخدم طبقات إسقاط خطية لإسقاط تدفقي السمات في فضاء تضمين مشترك. ولحساب الانتباه المتقاطع، يتم إنشاء تمثيلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) باستخدام موترات السمات المولدة. بعد ذلك، يتم نمذجة العلاقات بين معلومات الزخارف الهيكلية وعناصر الأسلوب الفني باستخدام الانتباه المتقاطع متعدد الرؤوس. ثم تُطبق عملية تسوية الطبقات، والوصلات المتبقية، وطبقات التغذية الأمامية مع تنشيط GELU على تمثيلات السمات المدمجة. وتتلقى مرحلة التوليف القائمة على SPADE مخرجات وحدة CAFFM، مما يسمح بالحفاظ على الموضوعات ذات الدلالة الثقافية دون التضحية بالتماسك الفني.
لضمان توافق الميزات، يتم أولاً إسقاط ميزات الإدخال باستخدام طبقات إسقاط خطية على فضاء تضمين مشترك بأبعاد تضمين تبلغ 256. ثم يتم نمذجة الترابطات بين المعلومات الهيكلية الدلالية وتمثيلات الأسلوب التوليدي باستخدام آلية الانتباه المتقاطع متعدد الرؤوس (MultiHead Cross-Attention) بثمانية رؤوس انتباه. وتستخدم حسابات الانتباه المتقاطع متجهات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) التي يتم إنتاجها بواسطة طبقات تحويل خطية محددة. ولزيادة استقرار التدريب والحفاظ على سلامة الميزات، يتم استخدام الوصلات المتبقية (residual connections) وتطبيع الطبقة (Layer Normalization) لتعزيز تمثيلات الميزات المدمجة بشكل أكبر. بعد ذلك، يتم تحسين تعلم الميزات غير الخطية من خلال تطبيق شبكة تغذية أمامية ذات دالة تنشيط الوحدة الخطية لخطأ غاوس (GELU). ويقوم النموذج بتوليد تمثيل ميزات مخرجات بأبعاد 256 يتم إرسالها إلى مراحل أخرى من أجل التركيب الإبداعي. ينجح نموذج CAFFM في دمج بيانات الأسلوب الفني مع هياكل الزخارف الثقافية باستخدام تقنية دمج قائمة على الانتباه المتقاطع، مما يعزز الحفاظ على الزخارف والتماسك البصري في أنماط التراث الثقافي المعاد بناؤها.
في النظام المقترح، يتم اشتقاق السمات الهيكلية من مجموعة بيانات Miao Batik، بينما يتم تعلم السمات الأسلوبية من مجموعة بيانات WikiArt. ليكن خريطة السمات المشتقة من شبكة تقسيم SegFormer باستخدام صور من مجموعة بيانات Miao Batik يرمز لها بـ Fs، بينما يرمز لخريطة السمات المشتقة من فرع استخراج السمات الأسلوبية باستخدام صور WikiArt بـ Fa. يدمج نموذج CAFFM المقترح بين مجالي السمات باستخدام آلية الانتباه المتقاطع (cross-attention mechanism) لتعلم كل من التبعيات الهيكلية والأسلوبية للأنماط الثقافية. يوضح الجدول 3 جميع الخصائص المعمارية، بما في ذلك أبعاد التضمين، وطبقات التسوية، ودوال التنشيط، وتكوين رؤوس الانتباه. بالنسبة لحجم صورة مدخلة يبلغ 256 × 256 بكسل، أنتج المشفر SegFormer-B2 خرائط سمات دلالية بحجم 64 × 64 × 128، بينما أنتج فرع استخراج السمات الأسلوبية خرائط سمات بحجم 64 × 64 × 128. وقد تم إسقاط كلتا خريطتي السمات عبر طبقات خطية قابلة للتعلم إلى فضاء تضمين مشترك ببعد 256 قبل عملية الدمج بالانتباه المتقاطع.
| المَعلَم | التكوين |
| الإطار المقترح | SegCycle-SPADE |
| نموذج التجزئة الدلالية | SegFormer-B2 |
| مراحل مشفر SegFormer | 4 |
| تهيئة الأوزان | SegFormer-B2 مُدرب مسبقاً على ImageNet-1K (العمود الفقري MIT-B2) |
| مصدر نقطة التحقق | المستودع الرسمي NVIDIA SegFormer (https://github.com/NVlabs/SegFormer)؛ نقطة التحقق: segformer.b2.512x512.ade.160k |
| استراتيجية الضبط الدقيق | ضبط دقيق شامل (End-to-end) على مجموعة بيانات Miao Batik |
| حجم تضمين الرقعة | 7 × 7 |
| خطوة الرقعة | 4 |
| أبعاد التضمين | 64 و128 و320 و512 |
| أعماق المشفر | 3 و4 و6 و3 |
| رؤوس الانتباه | 1 و2 و5 و8 |
| نوع مفكك الترميز | مفكك ترميز All-MLP |
| دالة التنشيط | GELU |
| معدل التسرب | 0.1 |
| وحدة تعزيز الميزات | وحدة دمج الميزات الثقافية عبر الانتباه المتبادل (CAFFM) |
| بعد تضمين CAFFM | 256 |
| رؤوس انتباه CAFFM | 8 |
| مقاييس دمج CAFFM | 4 |
| نموذج إعادة البناء | CycleGAN |
| نموذج توليد النمط | SPADE |
| مجموعة البيانات الثقافية | مجموعة بيانات Miao Batik |
| مجموعة بيانات النمط | مجموعة بيانات WikiArt |
| صور Miao Batik | 15,148 |
| صور WikiArt | حوالي 80,000 |
| دقة الصورة المدخلة | 256 × 256 بكسل |
| تنسيق الألوان | RGB |
| طريقة الاستيفاء | الاستيفاء الثنائي الخطي (Bilinear Interpolation) |
| طريقة إزالة الضجيج | الترشيح الغاوسي (Gaussian Filtering) |
| حجم النواة الغاوسية | 5 × 5 |
| سيجما الغاوسية (σ) | 1 |
| نطاق التطبيع | [0, 1] |
| حجم الدفعة | 16 |
| عدد الدورات (Epochs) | 100 |
| المُحسِّن | Adam |
| معدل التعلم | 0.0002 |
| معاملات Adam | β₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, اضمحلال الوزن = 0 |
| دوال الخسارة | خسارة التجزئة، الخسارة التنافسية، خسارة الاتساق الدوري، خسارة إعادة البناء، خسارة الحفاظ على الزخارف، وخسارة اتساق النمط |
| استراتيجية تقسيم مجموعة البيانات | تدريب / تحقق / اختبار |
| مجموعة التدريب | 70% |
| مجموعة التحقق | 15% |
| مجموعة الاختبار | 15% |
| البذرة العشوائية | 42 |
| مقاييس التقييم | دقة التجزئة، IoU، معامل Dice، SSIM، PSNR، وFID |
| لغة البرمجة | Python 3.8.10 |
| إطار التعلم العميق | PyTorch 1.10.0 |
| المنصة العتادية | وحدة معالجة الرسوميات NVIDIA RTX 3090 (ذاكرة VRAM بسعة 24 GB)، معالج Intel Core i7 (الجيل الحادي عشر)، ذاكرة RAM بسعة 32 GB |
| بيئة التشغيل | Ubuntu 20.04 LTS |
الجدول 3: الإعداد التجريبي وتكوين النموذج. ملخص للمكونات المعمارية، وتكوين التدريب، وإعدادات المعالجة المسبقة، ومجموعات البيانات، ومعاملات التحسين، ومقاييس التقييم، والبيئة الحوسبية المستخدمة في تنفيذ وتقييم إطار عمل SegCycle-SPADE المقترح.
تقوم وحدة الانتباه أولاً بتحويل خريطة الميزات إلى تمثيلات الاستعلام (query)، والمفتاح (key)، والقيمة (value) باستخدام Equation 10:

هنا، تعتبر Wq و Wk و Wv مصفوفات أوزان قابلة للتعلم. ويتم حساب أوزان الانتباه بناءً على التشابه بين متجه الاستعلام ومتجه المفتاح باستخدام المعادلة 1117:

هنا، دكـ هو بُعد متجه المفتاح. ويتم حساب تمثيل السمات المحسّن عن طريق ضرب أوزان الانتباه في مصفوفة القيمة باستخدام المعادلة 12:

هنا، يمثل Fa التمثيل المعزز للميزات لخريطة الميزات. ويتم حساب التمثيل المعزز للميزات عن طريق دمج ميزات التجزئة الأصلية مع الميزات المعززة التي تم الحصول عليها باستخدام آلية الانتباه وفقًا لـ المعادلة 13:
هنا، فهـ تُستخدم خريطة السمات المُحسَّنة لإعادة بناء الأنماط. ويتم توسيع وحدة CAFFM بآلية انتباه متقاطع متعددة المقاييس لاستخلاص سمات الزخارف الثقافية بمقاييس مختلفة. لنفترض أن فsi تحديد سمات التجزئة وفق المقياس iبينما فaج يشير إلى سمات النمط الفني عند المقياس نفسه. ويتم تحديد التمثيل النهائي للسمات باستخدام المعادلة ١٤:

هنا، تمثل Qi وKi وVi مصفوفات الاستعلام (query)، والمفتاح (key)، والقيمة (value) عند المقياس i على التوالي، بينما يشير N إلى عدد مقاييس الميزات. في هذه الدراسة، N = 4، وهو ما يقابل خرائط الميزات المستخرجة عند دقة مكانية تبلغ 1/4 و1/8 و1/16 و1/32 من حجم الصورة المدخلة. وقد تم دمج تمثيلات الميزات متعددة المقاييس هذه باستخدام أوزان انتباه قابلة للتعلم قبل مرحلتي إعادة البناء والتركيب الفني. يتيح هذا التوسع للمنهجية استخلاص الزخارف الثقافية والأنسجة العالمية لإعادة بناء الأنماط الثقافية. يقع موديل CAFFM بين مرحلة التجزئة القائمة على SegFormer ومرحلة التركيب الإبداعي القائمة على SPADE في نظام SegCycle-SPADE المقترح. أولاً، بينما يقوم CycleGAN بإنشاء ميزات إعادة البناء التي تحتوي على معلومات متعلقة بالأسلوب والنمط بشكل متزامن، يعمل SegFormer-B2 على استعادة خرائط الميزات الدلالية التي تصف الخصائص الهيكلية للزخارف الثقافية. يستقبل موديل CAFFM هذين التدفقين من الميزات ويستخدم الدمج القائم على الانتباه المتبادل (cross-attention) لتحديد العلاقات بين التمثيلات الهيكلية والفنية. ومن أجل إنشاء أنماط ثقافية أصيلة مع الحفاظ على الاتساق الدلالي والميزات الهيكلية، يتم إرسال خرائط الميزات المدمجة الناتجة بعد ذلك إلى موديل SPADE لإجراء تركيب إبداعي موجه بالتجزئة.
إعادة بناء الأنماط باستخدام CycleGAN
بمجرد الانتهاء من مرحلة تعزيز السمات القائمة على الانتباه، ستتضمن خرائط السمات هياكل الزخارف الثقافية المعززة. ومع ذلك، قد تظل خرائط السمات تحتوي على مناطق أنماط غير مكتملة أو تالفة. لذلك، ولمعالجة مشكلة إعادة بناء الأنماط، سيستخدم الإطار المقترح نموذج CycleGAN. وفي هذا الإطار المقترح، سيكون النطاقان هما أنماط الزخارف الثقافية الأصلية وأنماط الزخارف الثقافية المعاد بناؤها. وباستخدام السمات المعززة من المراحل السابقة، سيقوم نموذج CycleGAN بإعادة بناء الأنماط الثقافية مع الحفاظ على الاتساق الهيكلي. وهذا سيضمن احتفاظ الأنماط الثقافية، مثل الأنماط الهندسية والأنماط النباتية والأنماط الرمزية، بترتيبها المكاني. وقد خضعت صور باتيك مياو (Miao Batik) الأصلية لعمليات قناع عشوائي وحجب جزئي لتوليد زخارف ثقافية غير مكتملة أو تالفة. وقد حاكت إجراءات التدهور هذه مناطق الأنماط المفقودة والتلف الهيكلي الملاحظ عادةً في القطع الأثرية للتراث الثقافي المتدهورة. استُخدمت الصور المتدهورة كمدخلات لوحدة إعادة البناء، بينما كانت الصور الأصلية المقابلة بمثابة صور مرجعية لتقييم الأداء وتقدير جودة إعادة البناء. وقد مكنت هذه الاستراتيجية النموذج من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص الثقافية.
لنفترض أن X يمثل نطاق الأنماط الثقافية غير المكتملة و Y يمثل نطاق الأنماط الثقافية المعاد بناؤها. يتعلم المولدان تنفيذ تعيين ثنائي الاتجاه باستخدام المعادلة 15:

هنا، يُستخدم GE لإعادة بناء هياكل الزخارف (motif structures) ويُستخدم FM لربط الأنماط مرة أخرى بالمجال الأصلي. وتُستخدم الخسارة التنافسية (adversarial loss) لضمان أن تكون الأنماط المعاد بناؤها واقعية (المعادلة 16)30

هنا، يمثل DY المميز المستخدم للتمييز بين الأنماط الحقيقية والمعاد بناؤها، بينما يشير GE(x) إلى النمط المعاد بناؤه والموّلد. كما يفرض نموذج CycleGAN اتساق الدورة للحفاظ على التخطيط الهيكلي للزخارف الثقافية (المعادلة 17)30.

تُعرَّف دالة الخسارة النهائية باستخدام المعادلة 1830:

هنا، ترمز λi إلى معامل الوزن الخاص بخسارة الاتساق الدوري (cycle-consistency loss)، وقد تم ضبطه على القيمة 10 أثناء التدريب، بما يتوافق مع صياغة CycleGAN الأصلية. وقد تم اختيار هذه القيمة لتحقيق التوازن بين التعلم التنافسي واتساق إعادة البناء بين النطاقين المصدر والهدف.
تتكون وحدة إعادة بناء CycleGAN من مولدين ومميزين لترجمة الصور ثنائية الاتجاه. يتبع كل مولد بنية الشبكة المتبقية (residual-network) التي تضم طبقة تلافيف أولية بحجم 7 × 7، تليها طبقتان تلافيفيتان لتقليل العينات، وتسعة كتل متبقية، وطبقتان لزيادة العينات. تعتمد جميع العمليات التلافيفية حجم نواة 3 × 3، باستثناء طبقة الإدخال التي تستخدم نواة 7 × 7 لتعزيز استخراج الميزات. يتم تطبيق التطبيع المثيلي (Instance Normalization) بعد كل طبقة تلافيفية لتحسين استقرار التدريب، بينما تُستخدم دالة التنشيط ReLU في جميع أنحاء شبكة المولد. وتستخدم طبقة المخرجات دالة تنشيط Tanh لتوليد مخرجات صور مُطبعة. أما المميز فيتبع بنية PatchGAN بحجم 70 × 70 تتكون من سلسلة من الطبقات التلافيفية بأحجام نواة 4 × 4 وقنوات ميزات تزداد تدريجياً. ويُستخدم التطبيع المثيلي وتنشيط LeakyReLU (الميل السالب = 0.2) في المميز لتحسين تمييز الميزات والتعلم التنافسي. تستقبل وحدة CycleGAN صور الزخارف الثقافية التي تمت معالجتها مسبقاً كمدخلات وتولد تمثيلات لأنماط مُعاد بناؤها، والتي تُرسل لاحقاً إلى CAFFM لدمجها مع ميزات التجزئة. تم إجراء تدريب CycleGAN باستخدام مُحسن Adam (β₁ = 0.5, β₂ = 0.999) بمعدل تعلم أولي قدره 0.0002. تم الحفاظ على معدل التعلم هذا لأول 100 حقبة (epochs)، ثم انخفض خطياً إلى الصفر على مدى فترة التدريب المتبقية. واستُخدم مخزن مؤقت للإعادة (replay buffer) يحتوي على 50 صورة تم توليدها سابقاً لتحقيق استقرار تدريب المميز. تم تحديث المولدات والمميزات بنسبة تحديث 1:1، حيث يلي كل تحديث للمولد تحديث واحد للمميز خلال كل تكرار تدريبي.
تعتمد عملية إعادة البناء في نموذج CycleGAN على خرائط السمات المحسنة التي تم الحصول عليها باستخدام آلية CAFFM الموضحة في الشكل 5. تحتوي خرائط السمات على زخارف ثقافية محسنة تم استخلاصها من مراحل التجزئة وآلية CAFFM السابقة. تُستخدم خرائط السمات هذه كمدخلات للمولد الأول GE، حيث يتعلم المولد الأول GE عملية المطابقة اللازمة لإعادة بناء الأنماط الثقافية. بعد ذلك، يتم تمرير المخرجات إلى المميز DY للتمييز بين الأنماط الثقافية الحقيقية والأنماط المعاد بناؤها. ويساعد المميز DY المولد GE على إنتاج مخرجات واقعية. ولضمان عدم تشوه الأنماط الثقافية أثناء عملية إعادة البناء، يقوم المولد الثاني FM بإجراء مطابقة اتساق الدورة (cycle-consistency mapping)، حيث يقوم المولد الثاني FM بمطابقة المخرجات وإعادتها إلى النطاق الأصلي. ثم يتم تقييم هذه المخرجات بواسطة المميز لضمان واقعيتها. وفي الختام، تُرسل المخرجات النهائية إلى وحدة SPADE لتوليد النمط الفني في المرحلة التالية من إطار عمل SegCycle-SPADE المقترح.

الشكل 5. سير عمل إعادة بناء الأنماط القائم على CycleGAN. سير عمل وحدة إعادة البناء باستخدام CycleGAN. تُقدم تمثيلات الميزات المعززة بالانتباه كمدخلات لشبكة المولد لإعادة بناء الزخارف الثقافية غير المكتملة. ويقوم المميز بتقييم المخرجات المعاد بناؤها مقابل الأنماط المرجعية، بينما يحافظ تخطيط اتساق الدورة على السلامة الهيكلية أثناء ترجمة الصور ثنائية الاتجاه. ومن ثم تُرسل الزخارف المعاد بناؤها إلى وحدة SPADE لتركيب النمط الفني. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
توليد النمط الفني باستخدام SPADE
بعد ذلك، تخضع الزخارف الثقافية المعاد بناؤها إلى وحدة SPADE لتوليد النمط الفني. الهدف الرئيسي من وحدة SPADE هو إضافة أنسجة غنية بصرياً من النمط الفني إلى الزخارف الثقافية المعاد بناؤها دون المساس بالمخطط الهيكلي لهذه الزخارف. وتعد وحدة SPADE تقنية لتوليد الصور المشروطة تعتمد على مفهوم تقسيم الصور لتوليد الصور. وقد تم ترميز خرائط دلالية متعددة القنوات تتوافق مع فئات الزخارف المحددة مسبقاً من أقنعة التقسيم الدلالي الناتجة عن SegFormer-B2. واستقبل مولد SPADE هذه الخرائط المرمزة كمدخلات شرطية. كما تم إنتاج معاملات القياس التكيفي مكانيًا (γ) والانحياز (β) من خلال معالجة الخرائط الدلالية عبر طبقات تلافيفية داخل كل طبقة SPADE. وهكذا، تمكن المولد من الحفاظ على حدود الزخارف، والمخططات الهيكلية، والمعلومات الدلالية أثناء التخليق الفني عن طريق تطبيق هذه المعاملات على تنشيطات الميزات المُطبعة. وقد استطاع التوجيه الدلالي التأثير على كل من إعادة البناء الهيكلي رفيع المستوى وتخليق الأنسجة منخفض المستوى، نظراً لأن عملية التكييف تمت في عدة طبقات من مولد SPADE. ونتيجة لذلك، دمجت الأنماط الفنية المبتكرة سمات أسلوبية مُكتسبة من مجموعة بيانات WikiArt مع الحفاظ على هياكل الزخارف الثقافية التي عُثر عليها خلال مرحلة التقسيم.
تم استخدام مجموعة بيانات WikiArt، التي تضم أعمالاً من 27 فئة فنية مختلفة — مثل عصر النهضة، والانطباعية، والتكعيبية، والتعبيرية، والسريالية، والواقعية، والفن التجريدي — كمورد رئيسي لفهم الأساليب الفنية. ومن أجل تعريض النموذج لمجموعة متنوعة من السمات الإبداعية وتعزيز تعميم النمط، تم اختيار صور الأنماط عشوائياً من الفئات المختلفة أثناء التدريب. كما تم تقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار مع تمثيل متوازن للفئات الفنية من أجل تقليل الانحياز للنمط. ولضمان التمثيل المتوازن لجميع الفئات الفنية الـ 27، تم استخدام أخذ العينات الطبقية؛ حيث خُصصت العينات من كل فئة بشكل نسبي لمجموعات التدريب والتحقق والاختبار مع الحفاظ على التوزيع الأصلي للفئات. واستُخدمت وحدة CAFFM لدمج جوانب النمط المستمدة من صور WikiArt مع ميزات إعادة البناء الناتجة عن CycleGAN. ومن أجل السماح لشبكة التصنيع بنقل الخصائص الفنية مع الحفاظ على البنية الدلالية وحدود الزخارف الثقافية المستمدة من خرائط التجزئة، تم تزويد التمثيلات المدمجة الناتجة كمعلومات شرطية لمولد SPADE. وقد تمكن الإطار المقترح من إنتاج أنماط فنية أصيلة ثقافياً مع تمثيلات هيكلية ونمطية متسقة بفضل تقنية تكييف النمط هذه.
كما يقدم SPADE معاملات تكيفية مكانياً تعتمد على خريطة التجزئة. ويمكن تعريف هذه المعاملات كما هو موضح في المعادلة 191:

هنا، يمثل γ(S) معامل المقياس المتغير مكانيًا ويمثل β(S) معامل الانحياز المتغير مكانيًا. يمكن لهذه المعاملات أن تساعد المولد في إنشاء أنسجة وأنماط مختلفة اعتمادًا على المنطقة الدلالية في الصور. ويمكن تحديد العمل الفني الثقافي النهائي كما هو موضح في المعادلة 20:

هنا، تمثل GE مولد SPADE، وتمثل XrP النمط المعاد بناؤه، وتمثل SM خريطة التجزئة. يحافظ العمل الفني النهائي على السلامة الهيكلية للزخارف الثقافية مع تعزيز المظهر الفني. وقد استُخدمت دالة فقدان مركبة توازن بين دقة التجزئة الدلالية، والحفاظ على الزخارف الثقافية، وجودة إعادة بناء النمط، واتساق الأسلوب الفني لتحسين بنية SegCycle-SPADE المقترحة. ولتحديد هدف التدريب العام، استُخدم مزيج موزون من فقدان التجزئة (Lseg)، والفقدان التنافسي (Ladv)، وفقدان اتساق الدورة (Lcycle)، وفقدان إعادة البناء (Lrecon)، وفقدان الحفاظ على الزخارف (Lmotif)، وفقدان اتساق الأسلوب (Lstyle). وتُعرف دالة الفقدان الإجمالية في المعادلة 21:
(21)
لضمان الاتساق الهيكلي بين الزخارف الثقافية المدخلة والمعاد بناؤها، تم ضبط معامل فقدان الاتساق الدوري عند 10. وللحفاظ على الميزات الدقيقة للزخارف وتعزيز الدقة البصرية، تم ضبط معامل فقدان إعادة البناء عند 5. ومن أجل إبراز الحفاظ على الأنماط الهيكلية الجوهرية ثقافياً أثناء التركيب الفني، استُخدم معامل قدره 2 لفقدان الحفاظ على الزخارف. وبغرض تعزيز نقل الأسلوب الفني دون تشويه هياكل الزخارف الدلالية بشكل مفرط، تم تعديل معامل فقدان اتساق الأسلوب إلى 1. وللحفاظ على مساهمة متوازنة بين إنتاج صور واقعية وتقسيم دقيق للزخارف، أُعطيت أوزان متساوية لفقدان التقسيم والفقدان التناقضي. واستُخدمت تمثيلات الأسلوب القائمة على الميزات من مجموعة بيانات WikiArt لحساب فقدان اتساق الأسلوب. وبشكل خاص، تم التقاط سمات الأسلوب الفني باستخدام ارتباطات مصفوفة Gram المستمدة من خرائط الميزات العميقة. وحُسب فقدان الأسلوب باستخدام فرق معيار فروبينوس (Frobenius norm) بين مصفوفات Gram لصورة الأسلوب المستهدفة والصورة المولدة، كما هو موضح في المعادلة ٢٢:

هنا، جيرجى تقديم النص الذي ترغب في ترجمته. هل تُحسب مصفوفة غرام (Gram matrix) من الـ يرجى تزويدي بالنص المصدر الذي ترغب في ترجمته.th طبقة الميزات، Iجين يرمز إلى الصورة الفنية المُنشأة، Iالأسلوب يرمز إلى صورة النمط المستهدفة من مجموعة بيانات WikiArt، و و تشير إلى معيار فروبينيوس (Frobenius norm). وتمكّن هذه الصيغة الإطار المقترح من الحفاظ على الخصائص الفنية مع الإبقاء على السلامة البنيوية والدلالية للزخارف الثقافية.
تُستخدم تمثيلات الميزات المدمجة التي ينتجها نموذج CAFFM كمدخلات شرطية لنموذج SPADE، والذي يعمل كمكون للتخليق الفني في الإطار المقترح. يتكون مولد SPADE من سبع كتل متبقية من نوع SPADE ببعد ميزات كامن يبلغ 256 قناة، ويقوم بتوليد صور مخرجة بدقة 256 × 256 بكسل. تُستخدم خرائط التجزئة الدلالية التي تم الحصول عليها من نموذج SegFormer–CAFFM كمدخلات شرطية عبر الطبقات المتبقية لـ SPADE. تُطبق طبقات SPADE قبل دوال التنشيط داخل كل كتلة متبقية، مما يتيح التكييف الدلالي الموجه بالتجزئة. ومن خلال عمليات الرفع التصاعدي والالتفاف المتتالية، يتم تحسين تمثيل الميزات الكامنة تدريجياً لتوليد أنماط فنية عالية الدقة مع الحفاظ على الاتساق الدلالي وبنية الزخارف. تُستخدم دوال تنشيط LeakyReLU في جميع أنحاء المولد، بينما تُطبق دالة تنشيط Tanh عند طبقة المخرجات لإنتاج صور مُطبعة.
الخوارزمية وسير العمل
يدمج إطار عمل SegCycle-SPADE كلاً من التجزئة الدلالية، ودمج الميزات، وإعادة بناء الأنماط، وتوليف النمط الفني ضمن مسار تدريب موحد. يبدأ سير العمل بالحصول على مجموعة البيانات ومعالجتها مسبقاً، بما في ذلك تغيير حجم الصور، والتطبيع، وإزالة الضجيج، وإعداد أقنعة التجزئة. بعد ذلك، تُعالج الصور التي تمت معالجتها مسبقاً باستخدام شبكة التجزئة SegFormer-B2 لاستخراج تمثيلات الزخارف الدلالية. ثم تُدمج ميزات التجزئة الناتجة مع ميزات إعادة البناء من خلال وحدة CAFFM، مما يتيح التفاعل بين معلومات الزخارف الهيكلية وتمثيلات الميزات الفنية. بعد ذلك، تُقدم خرائط الميزات المدمجة إلى وحدة إعادة البناء CycleGAN، التي تعمل على استعادة هياكل الزخارف الثقافية غير المكتملة مع الحفاظ على الاتساق الدلالي. ثم تُمرر الأنماط المعاد بناؤها إلى مولد SPADE لإجراء توليف فني موجه بالتجزئة، مما يسمح بالتعزيز الأسلوبي مع الحفاظ على حدود الزخارف والأصالة الهيكلية. وأثناء التدريب، يتم تحسين معاملات النموذج باستخدام دالة الخسارة المركبة الموضحة في المعادلتين 21 و22، والتي توازن بين دقة التجزئة، والحفاظ على الزخارف، وجودة إعادة البناء، واتساق النمط الفني. يتوفر سير عمل تفصيلي للتنفيذ خطوة بخطوة، يتضمن تحميل مجموعة البيانات، والمعالجة المسبقة، وتهيئة النموذج، وتكرارات التدريب، وإجراءات التحقق، واختيار نقاط التحقق، والتقييم النهائي، في الملف التكميلي 1 (الخوارزمية 1). تم تنفيذ سير العمل الخوارزمي الكامل باستخدام حجم دفعة (batch size) قدره 16، ومعدل تعلم 0.0002، و100 حقبة تدريب (epochs). استُخدمت بذرة عشوائية ثابتة بقيمة 42 لتقسيم مجموعة البيانات، وتهيئة النموذج، وجميع تجارب التدريب. طُبقت هذه البذرة بشكل متسق عبر مولدات الأرقام العشوائية في Python وNumPy وPyTorch لضمان إمكانية إعادة إنتاج النتائج. تم تكوين مُحسِّن Adam بحيث تكون β₁ = 0.5 وβ₂ = 0.999، مع عدم وجود اضمحلال للأوزان (weight decay = 0). تم اختيار نقاط تحقق النموذج بناءً على أعلى درجة IoU تحقق منها في مجموعة بيانات التحقق.
تحسين دالة الخسارة
للحفاظ على هياكل الزخارف الثقافية أثناء عملية إعادة البناء والتركيب الفني، يستخدم الإطار المقترح هدف تحسين مركب يجمع بين خسائر التجزئة، والخسائر التنافسية، واتساق الدورة، وإعادة البناء، والحفاظ على الزخارف، واتساق الأسلوب. تتوفر الصيغة الرياضية الكاملة، ومعاملات الترجيح، وتعريف خسارة الأسلوب في المعادلتين 21 و22 ضمن القسم الفرعي توليد الأسلوب الفني باستخدام SPADE. ويعمل مكون الحفاظ على الزخارف على معاقبة الانحرافات الهيكلية بين مناطق الزخارف المتوقعة وأقنعة التجزئة المرجعية المقابلة، مما يشجع على الحفاظ على هياكل الأنماط ذات الدلالة الثقافية طوال عملية إعادة البناء.