مقالة بحثية

إعادة بناء وتخليق الأنماط الفنية للتراث الثقافي غير المادي الموجهة بالتجزئة الدلالية باستخدام إطار تعلم عميق

DOI:

10.3791/71577

أغسطس 14, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول سير عمل للتعلم العميق من أجل التجزئة الدلالية، وإعادة البناء، وتوليد الأنماط الفنية للتراث الثقافي غير المادي، وذلك باستخدام استخراج الميزات القائم على المحولات (transformer)، وإعادة البناء التنافسية، وتوليد الصور التكيفي مكانيًا لدعم الحفظ الرقمي وتطبيقات التراث الإبداعي.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لقد حظي الحفظ الرقمي وإعادة بناء أنماط التراث الثقافي غير المادي (ICH) باهتمام متزايد مع تقدم تقنيات توليد الصور القائمة على التعلم العميق. وقد أظهرت المنهجيات الحالية القائمة على SegCycle-SPADE إمكانات في التقسيم الهيكلي وإعادة البناء الفني لأنماط الحرف التقليدية؛ ومع ذلك، لا تزال هناك قيود قائمة، بما في ذلك محدودية تنوع مجموعة البيانات، وعدم كفاية دمج الدلالات الثقافية، وعدم الحفاظ بشكل كافٍ على ميزات الأنماط الهيكلية أثناء إعادة البناء. ولمعالجة هذه التحديات، تقترح هذه الدراسة إطار عمل SegCycle-SPADE مطوراً للتقسيم الدلالي وإعادة البناء الفني لأنواع أنماط التراث الثقافي غير المادي. تم استخدام نموذج تقسيم قائم على Transformer، وهو SegFormer، لتحديد حدود الزخارف ومناطق الأنماط بدقة. بالإضافة إلى ذلك، تم تقديم وحدة دمج الميزات الثقافية عبر الانتباه (Cross-Attention Cultural Feature Fusion Module) لتعزيز الزخارف ذات الأهمية الثقافية وتحسين تمثيل الميزات. ويتم تنفيذ ترجمة الأنماط وإعادة بنائها باستخدام CycleGAN، بينما يتم استخدام إلغاء التطبيع المتكيف مكانياً (SPADE) لتوليد الأسلوب الفني للحفاظ على الاتساق الدلالي بين خرائط التقسيم والصور المولدة. ولتحسين تعميم النموذج والتنوع الفني، تم تدريب إطار العمل باستخدام كل من مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. وتظهر النتائج التجريبية أن إطار عمل SegCycle-SPADE المقترح والموجه بالانتباه يحسن دقة التقسيم وأداء إعادة بناء أنماط التراث مقارنة بطرق إعادة البناء الحالية القائمة على الشبكات الخصومية التوليدية (GAN). ويوفر إطار العمل المقترح حلاً قابلاً للتوسع لتوثيق التراث الثقافي بمساعدة الذكاء الاصطناعي، وإعادة بنائه، وإحيائه فنياً من خلال تصميمات الأنماط التقليدية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يُعد التراث الثقافي، الذي يشمل العناصر غير المادية مثل العادات واللغات والمعتقدات، والعناصر المادية مثل الأعمال الفنية والمباني والسجلات المكتوبة، تجلياً أساسياً للتاريخ البشري والإبداع والهوية1. ويسعى صون التراث إلى تمكين المجتمعات من إعادة التواصل مع أصولها وإتاحة الفرصة للأجيال القادمة للاستفادة من ذاكرتهم الثقافية الجماعية. كما أنه يعزز التفاهم بين الثقافات، وتقدير التقاليد والعادات المتنوعة، والاعتراف بالروايات التاريخية المختلفة. وتساعدنا هذه الأصول الثقافية على فهم قيم ومنظورات وتجارب الأجيال السابقة، وتساهم في تكوين الهويات الاجتماعية المعاصرة والاستمرارية الثقافية. وتوضح الشكل 1 المبادئ الأساسية للحفاظ على التراث الثقافي.

figure-introduction-1
الشكل 1. نظرة مفاهيمية عامة على إعادة بناء أنماط التراث الثقافي باستخدام إطار عمل SegCycle-SPADE. توضيح تخطيطي للمنهج المقترح لإعادة بناء وتعزيز أنماط التراث الثقافي غير المادي. يتضمن سير العمل جمع مجموعة البيانات من مجموعات بيانات Miao Batik وWikiArt، والمعالجة المسبقة للصور، والتقسيم الدلالي باستخدام SegFormer-B2، ودمج الميزات باستخدام وحدة دمج الميزات الثقافية عبر الانتباه (CAFFM)، وإعادة بناء الأنماط باستخدام CycleGAN، وتوليف الأسلوب الفني باستخدام SPADE، والتقييم النهائي باستخدام مقاييس التقسيم وإعادة البناء. تشير الأسهم إلى تدفق البيانات وتمثيلات الميزات عبر إطار العمل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تتجسد الذاكرة الجماعية والموروث الثقافي للمجتمع البشري في التراث الثقافي غير المادي (ICH)، والذي يعمل كوسيط هام للتعبير الفني والهوية الثقافية. ومع ذلك، يواجه التراث الثقافي غير المادي تحديات كبيرة بسبب آثار العولمة والرقمنة2,3,4. وتتطلب العديد من ممارسات التراث الثقافي غير المادي المهددة بالاندثار مناهج جديدة للحفظ والتطوير نظرًا لتناقص أعداد الحرفيين المهرة ومحدودية القدرة على التكيف مع الأسواق الحديثة5,6. وباعتباره مجالاً هاماً في أبحاث التراث الثقافي غير المادي، يركز التصميم المستدام على التطوير المتكامل للثقافة والمجتمع والبيئة، ويوفر مساراً عملياً للاستمرار في الحفاظ على التراث الثقافي غير المادي. ومن خلال مناهج التصميم المستدام، يمكن إحياء التراث الثقافي غير المادي مع التكيف مع احتياجات المجتمع المعاصر7,8.

في هذه الدراسة، يشير مصطلح "أنماط التراث الثقافي غير المادي" إلى تمثيلات الزخارف البصرية التي تنقل وتحفظ القيم الثقافية غير المادية الكامنة. وبناءً على ذلك، يهدف الإطار المقترح إلى حفظ وتوثيق المعلومات الثقافية المرتبطة بهذه الزخارف أثناء إعادة بناء أشكالها البصرية.

يُعد تطريز وباتيك مياو من الأشكال الهامة للتراث الثقافي غير المادي الصيني، حيث يعكسان تاريخ ومعتقدات وتقاليد مجتمع مياو من خلال زخارف رمزية مثل الطيور والفراشات وطواطم الأسلاف9. وهذه الزخارف متجذرة بعمق في الملابس الطقسية وممارسات المهرجانات، وتساهم في التنمية الثقافية والاقتصادية المحلية10,11. وقد خلقت التطورات في التقنيات الرقمية، ولا سيما الذكاء الاصطناعي (AI) والتعلم العميق (DL)، فرصاً جديدة للحفاظ على التراث الثقافي وتحليله وإعادة بنائه وتوثيقه. ويُعد باتيك مياو في غويتشو، وهو أحد أفضل تقاليد الباتيك حفظاً في الصين، وسيلة مهمة لنقل المعارف الثقافية والمعتقدات والعادات والطقوس الخاصة بشعب مياو12,13,14,15,16.

أظهرت الدراسات الحديثة إمكانات التعلم العميق (DL) في الحفاظ على التراث الثقافي وإعادة بناء الأنماط، حيث حققت دقة تقسيم محسنة (دقة البكسل = 88.6%، ومتوسط التقاطع فوق الاتحاد [IoU]= 78.1%) وأداءً أفضل في إعادة البناء مقارنةً بـ U-Net و DeepLabV3+1. ومع ذلك، لا تزال هناك عدة تحديات؛ إذ غالبًا ما تواجه النهج القائمة على الشبكات التنافسية التوليدية (GAN) صعوبة في الحفاظ على التفاصيل الهيكلية الدقيقة في الأنماط المعقدة17، بينما يحد تنوع مجموعة البيانات المحدود من تعميم النموذج عبر المجالات الثقافية المختلفة18. بالإضافة إلى ذلك، قد تفشل نماذج ترجمة الصور من صورة إلى أخرى مثل CycleGAN في الحفاظ على الاتساق الدلالي بين خرائط التقسيم والصور المولدة19، كما يمكن أن يؤدي غياب آليات الانتباه إلى فقدان تفاصيل الزخارف ذات الأهمية الثقافية أثناء عملية إعادة البناء20. وبناءً على ذلك، هناك حاجة إلى إطار عمل مُحسَّن يدمج التقسيم القائم على المحولات (transformer)، وتعلم الميزات الموجه بالانتباه، والتدريب على مجموعات بيانات متعددة من أجل إعادة بناء فعالة لأنماط التراث الثقافي غير المادي (ICH).

ظهرت فرص جديدة للحفاظ على التراث الثقافي من خلال رقمنة تطريز المياو والتقدم السريع في الذكاء الاصطناعي التوليدي. وقد أظهرت نماذج الانتشار (Diffusion models)، وهي فئة ناشئة من النماذج التوليدية العميقة، أداءً ملحوظاً في مهام الرؤية الحاسوبية بفضل قدراتها القوية على توليد المحتوى21,22,23,24,25. وخلال عملية الانتشار العكسي، يتعلم النموذج تدريجياً إعادة بناء بيانات الإدخال الأصلية من تمثيلات مشوشة26,27,28. كما استكشفت دراسات سابقة تطبيق تقنيات إعادة البناء ثلاثية الأبعاد والتصميم بمساعدة الحاسوب (CAD) للحفاظ على التراث الثقافي ونشره.

على الرغم من أن الشبكات العصبية التلافيفية (CNNs) وشبكات الخصومة التوليدية (GANs) تؤدي أداءً جيداً في توليد الصور والحفاظ على السمات، إلا أنها لا تزال تواجه تحديات تتعلق بمحدودية الحقول الاستقبالية، وانهيار النمط، وعدم استقرار التدريب29. وتتفوق البنيات القائمة على المحولات (Transformers)، مثل SegFormer وSegmenter، في التقاط السياق العالمي والعلاقات الدلالية؛ ومع ذلك، فإنها تستهلك موارد حوسبية كثيفة وقد تواجه صعوبة في التعامل مع التفاصيل الدقيقة. ورغم أن نماذج الانتشار مثل Stable Diffusion تظهر قدرات قوية في توليد الصور، إلا أنها غالباً ما تفتقر إلى التحكم الدقيق في الخصائص الهيكلية والفنية للتصاميم المولدة. علاوة على ذلك، تعتمد معظم النهج الحالية استراتيجيات تدريب مستقلة تحد من التبادل الفعال للمعلومات والتحسين التعاوني بين مكونات التجزئة والتوليد، مما يؤدي إلى مقايضة بين الدقة الهيكلية والأصالة الفنية30.

تحقق النماذج القائمة على الانتشار الحديثة، مثل الانتشار الكامن وStable Diffusion، تركيباً صورياً عالي الجودة ولكنها تتطلب إزالة ضجيج تكرارية، مما يؤدي إلى زيادة التكلفة الحسابية ووقت الاستدلال. علاوة على ذلك، يظل الحفاظ على الزخارف الثقافية الدقيقة والاتساق الهيكلي أمراً صعباً دون آليات تكييف متخصصة. وتلتقط النماذج التوليدية القائمة على Transformer العلاقات السياقية العالمية بفعالية، ولكنها غالباً ما تتطلب مجموعات بيانات واسعة النطاق وموارد حسابية كبيرة. وفي المقابل، يجمع إطار عمل SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) المقترح بين التجزئة القائمة على SegFormer، ودمج الميزات عبر الانتباه (cross-attention)، وإعادة البناء باستخدام CycleGAN، والتركيب الموجه بـ SPADE لتوفير توجيه هيكلي صريح، مما يؤدي إلى تحسين الحفاظ على الزخارف، والاتساق الدلالي، وإعادة البناء القابلة للتحكم لأنماط التراث الثقافي.

تعتمد غالبية تقنيات التجزئة الدلالية الحديثة على الشبكات العصبية التلافيفية الكاملة (FCNNs) ذات البنى على شكل حرف U31. وخلال مرحلة الترميز، يتم استخراج سمات عميقة ذات مجالات استقبال واسعة من خلال سلسلة من عمليات التلافيف وأخذ العينات السفلي. أما مرحلة فك الترميز، فتعمل تدريجياً على استعادة الدقة المكانية من خلال أخذ العينات العلوي، مما يتيح في النهاية التنبؤ الدلالي على مستوى البكسل. ومن خلال تعويض فقدان المعلومات المكانية أثناء عملية أخذ العينات السفلي وتحسين أداء التجزئة عبر مجموعة واسعة من التطبيقات، تسمح الوصلات القافزة بدمج المعلومات عالية الدقة من مستويات مختلفة من المرمز مباشرة في مفكك الترميز32.

بينما أظهرت الطرق الحديثة القائمة على شبكات الخصومة التوليدية (GAN) والشبكات العصبية التلافيفية (CNN) ونماذج الانتشار نتائج واعدة في توليد الصور وترميم التراث الثقافي، إلا أنها غالباً ما تواجه صعوبة في الحفاظ على الاتساق الدلالي، وصون الزخارف الهيكلية الدقيقة، وضمان إمكانية إعادة بناء قابلة للتكرار عبر أنماط ثقافية متنوعة. تتعامل معظم النهج الحالية مع التجزئة، وإعادة البناء، وتوليف النمط كعمليات منفصلة، مما قد يؤدي إلى فقدان العناصر ذات الأهمية الثقافية والحصول على مخرجات غير متسقة. ولمعالجة هذه الفجوة المنهجية، تقترح هذه الدراسة إطار عمل SegCycle-SPADE موحداً يدمج التجزئة الدلالية القائمة على SegFormer، ووحدة دمج الميزات الثقافية القائمة على الانتباه المتقاطع (CAFFM) المبتكرة، وإعادة البناء القائمة على CycleGAN، وتوليف النمط الموجه بـ SPADE. ومن خلال الدمج الصريح لمعلومات التجزئة الهيكلية مع تعلم الميزات التوليدية، يتيح إطار العمل المقترح إعادة بناء أكثر موثوقية واتساقاً دلالياً وقابلية للتكرار لزخارف التراث الثقافي غير المادي (ICH)، مع الحفاظ على كل من الأصالة الثقافية والجودة الفنية.

تم في هذه الدراسة تحديد ثلاثة قصور رئيسية في منهجيات إعادة بناء التراث الثقافي الحالية: (1) عدم الكفاية في الحفاظ على الزخارف الهيكلية الدقيقة في طرق إعادة البناء القائمة على شبكات GAN؛ (2) محدودية التعميم الناتجة عن التدريب على مجموعات بيانات صغيرة أو متخصصة في مجال معين؛ (3) عدم كفاية الاتساق الدلالي بين مخرجات التقسيم والصور المولدة في أطر عمل تحويل الصورة إلى صورة. بالإضافة إلى ذلك، غالباً ما يتم التعامل مع التقسيم وإعادة البناء والتركيب الأسلوبي كعمليات منفصلة، مما يؤدي إلى فقدان عناصر ذات أهمية ثقافية أثناء عملية إعادة البناء. من خلال دمج التقسيم الدلالي القائم على المحولات (transformer)، ودمج الميزات عبر الانتباه المتقاطع (cross-attention)، وإعادة البناء باستخدام CycleGAN، والتركيب الفني الموجه بواسطة SPADE ضمن بنية موحدة، يعمل إطار SegCycle-SPADE المقترح على معالجة هذه القصور وتحسين الحفاظ على الزخارف، والاتساق الدلالي، والأصالة الفنية في إعادة بناء أنماط التراث الثقافي غير المادي (ICH).

الهدف الرئيسي من هذه الدراسة هو تطوير إطار عمل SegCycle-SPADE محسّن لإعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH) بتوجيه من التجزئة الدلالية. يدمج إطار العمل نموذج SegFormer لتجزئة الزخارف الثقافية بدقة، ونموذج CycleGAN لإعادة بناء الأنماط، ونموذج SPADE للتركيب الفني المتسق مع الأسلوب. ولتحسين تمثيل الميزات والحفاظ على التفاصيل الهيكلية الدقيقة، تم تقديم وحدة CAFFM لتسهيل التفاعل الفعال بين ميزات التجزئة والميزات التوليدية. ومن خلال التدريب على مجموعات بيانات Miao Batik وWikiArt، يعمل إطار العمل المقترح على تعزيز أصالة إعادة البناء، والاتساق الأسلوبي، والحفاظ على الزخارف ذات الأهمية الثقافية.

من خلال الجمع بين التقسيم الدلالي، ودمج السمات الموجه بالانتباه، وإعادة بناء الأنماط، وتوليف النمط ضمن بنية موحدة، تقدم هذه الدراسة إطار عمل SegCycle-SPADE المبتكر لإعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH). وتتمثل المساهمات الرئيسية لهذا العمل فيما يلي: أولاً، تطوير إطار عمل مبتكر لإعادة البناء الموجه بالتقسيم الدلالي من خلال دمج SegFormer، مما يتيح الاستخراج الدقيق والحفاظ على الزخارف الثقافية المعقدة والعناصر الهيكلية. ثانياً، تقديم وحدة CAFFM جديدة لدمج سمات التقسيم بشكل فعال مع التمثيلات التوليدية، مما يسمح للنموذج بالتقاط العلاقات بعيدة المدى بين الزخارف الثقافية وأنماط الأسلوب الفني. ثالثاً، تعمل وحدة CAFFM المقترحة على تعزيز الحفاظ على العناصر ذات الأهمية الثقافية مع تحسين الواقعية البصرية والتماسك الهيكلي لأنماط التراث المعاد بناؤها. رابعاً، من خلال دمج CycleGAN لإعادة بناء الأنماط الثقافية وSPADE للتوليف الفني الموجه بالتقسيم، يضمن إطار العمل الدقة الدلالية والأصالة الأسلوبية في المخرجات المولدة. خامساً، ولتحسين التعميم والتنوع الفني، تم تدريب النموذج باستخدام مجموعة بيانات زخارف باتيك مياو (Miao Batik) لتعلم الأنماط الثقافية ومجموعة بيانات WikiArt لتمثيل الأسلوب الفني؛ حيث تعمل WikiArt كمجموعة بيانات مساعدة لتقييم قدرة إطار العمل على التعميم، ومتانة تعلم السمات، وفعالية التحكم في الأسلوب عبر سياقات بصرية متنوعة، وليس كنمط مستهدف للتطبيق المباشر في منتجات التراث الثقافي لشعب مياو. وأخيراً، وبالمقارنة مع طرق إعادة بناء التراث الثقافي الحالية القائمة على شبكات GAN، أظهرت النتائج التجريبية أن إطار SegCycle-SPADE المقترح يحقق دقة أعلى في التقسيم، وجودة أفضل في إعادة البناء، واتساقاً أكبر في الأسلوب.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

صُمّم الإطار المقترح لـ SegCycle-SPADE لإعادة بناء وتحسين أنماط التراث الثقافي التقليدية من خلال التقسيم الدلالي، وتعزيز الميزات باستخدام آلية الانتباه، وإعادة البناء التوليدية، وتوليف الأسلوب الفني. اعتمدت هذه الدراسة على مجموعات بيانات متاحة علنًا للصور الفنية والتراث الثقافي، بما في ذلك مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt. لم تتضمن الدراسة أي مشاركين بشريين، أو بيانات مرضى، أو معلومات شخصية، أو حيوانات تجارب، أو سجلات سريرية؛ وبناءً عليه، لم تكن هناك حاجة لموافقة لجنة الأخلاقيات المؤسسية أو الحصول على موافقة مستنيرة. في البداية، استُخدمت مجموعة بيانات زخارف التراث الثقافي لـ Miao Batik ومجموعة بيانات WikiArt لعملية التقييم. وقد وُصفت مجموعة بيانات Miao Batik في دراسة Quan et al. (2024)32 وهي تحتوي على 15,148 صورة مُصنفة لزخارف باتيك Miao التقليدية. استُخدمت التصنيفات الحالية المقدمة من منشئي مجموعة البيانات مباشرةً، ولم يتم إنشاء أي تصنيفات يدوية إضافية في هذه الدراسة. بعد ذلك، تم إجراء المعالجة المسبقة للصور عن طريق تغيير الحجم، والتطبيع، وإزالة الضوضاء، وإنشاء قناع تقسيم. تم وصف معاملات المعالجة المسبقة الدقيقة في القسم الفرعي للمعالجة المسبقة للبيانات. يستخدم الإطار المقترح نموذجًا قائمًا على المحولات يسمى SegFormer-B2 للتقسيم الدلالي للبيانات. صُممت هذه الطريقة للكشف عن المناطق الرئيسية للزخارف الثقافية وتعلم هياكلها. ثم يتم تعزيز الميزات المقسمة من خلال آلية الانتباه، حيث يتم إبراز المعلومات المهمة المتعلقة بالزخارف الثقافية واستبعاد المعلومات غير ذات الصلة. تم وصف إعدادات آلية الانتباه في القسم الفرعي CAFFM. ثم تُمرر الميزات المُحسنة عبر CycleGAN، حيث يتم إعادة بناء الهياكل التالفة من خلال التعلم الدوري. أثناء التدريب، تم إنشاء عينات زخارف غير مكتملة صناعيًا عن طريق تطبيق عمليات القناع العشوائي والحجب الجزئي على صور Miao Batik الأصلية. حاكت إجراءات التدهور هذه مناطق الزخارف المفقودة والتلف الهيكلي الملاحظ عادةً في القطع التراثية الثقافية المتدهورة. استُخدمت الصور غير المكتملة الناتجة كمدخلات لوحدة إعادة البناء CycleGAN، بينما عملت الصور الأصلية المقابلة كأهداف لإعادة البناء. بعد ذلك، يتم تحسين أنماط التراث الثقافي المعاد بناؤها من خلال SPADE، حيث يتم إجراء التحسين الفني بناءً على خرائط التقسيم المولدة. تم تقييم أداء الإطار المقترح باستخدام مقاييس كمية للتقسيم وجودة الصور، بينما تم تقييم الأصالة البصرية للزخارف الثقافية المعاد بناؤها نوعيًا. قُيمت الأصالة البصرية من خلال الفحص البصري للأنماط الثقافية المولدة ولم تُستخدم كمقياس كمي مستقل. ركز التقييم على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والتماسك الهيكلي، والمظهر الفني مقارنةً بالزخارف الثقافية المرجعية المقابلة. تم إجراء التقييم الكمي لأداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضوضاء (PSNR)، ومسافة فريشيه البادئة (FID). يوضح الشكل 2 سير العمل العام لإطار SegCycle-SPADE المقترح ويلخص مقاييس التقييم المستخدمة في هذه الدراسة.

figure-protocol-1
الشكل 2. سير عمل البنية العامة لإطار عمل SegCycle-SPADE المقترح. نظرة عامة على سير عمل SegCycle-SPADE الكامل. تخضع الصور المأخوذة من مجموعات بيانات Miao Batik وWikiArt لمعالجة مسبقة قبل أن يتم معالجتها من خلال التجزئة الدلالية باستخدام SegFormer-B2، وتعزيز الميزات باستخدام CAFFM، وإعادة بناء النمط باستخدام CycleGAN، وتوليد النمط الفني باستخدام SPADE. يتم تقييم أداء النموذج باستخدام دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل Dice، ومقياس مؤشر التشابه الهيكلي (SSIM)، وPSNR، ومسافة Fréchet Inception (FID)، بينما يتم تقييم الأصالة البصرية نوعياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

صُمم إطار عمل SegCycle-SPADE لإعادة بناء أنماط التراث الثقافي لدمج مكونات متعددة من التعلم العميق (DL) من أجل تجزئة الزخارف وإعادة بنائها وتعزيزها فنياً بدقة، كما هو موضح في الشكل 2. تُستخدم صور من مجموعة بيانات زخارف "مياو باتيك" (Miao Batik) الثقافية ومجموعة بيانات WikiArt لتوفير أنماط ثقافية وأساليب فنية متنوعة. في البداية، يتم معالجة الصور باستخدام وحدة تجزئة دلالية تعتمد على SegFormer لتحديد وتعيين حدود الزخارف الثقافية وفصلها عن الخلفية. تتكون البنية العامة من أربع مراحل رئيسية؛ أولاً، يستخرج نموذج SegFormer خرائط التجزئة الدلالية من صور الأنماط الثقافية. ثانياً، تدمج وحدة CAFFM ميزات التجزئة مع التمثيلات التوليدية لتعزيز تعلم الميزات. ثالثاً، تقوم وحدة CycleGAN بإعادة بناء الأنماط الثقافية باستخدام تمثيلات الميزات المدمجة. وأخيراً، تقوم وحدة SPADE بتوليد مخرجات محسنة فنياً مع الحفاظ على الاتساق الهيكلي من خلال الاصطناع الموجه بالتجزئة. تُعالج خرائط الميزات المنقحة لاحقاً بواسطة وحدة إعادة بناء CycleGAN، التي تتعلم استعادة الزخارف الثقافية غير المكتملة عن طريق ربط الأنماط المتدهورة بأشكالها الكاملة المقابلة. تم توليد عينات زخرفية غير مكتملة من خلال تطبيق عمليات القناع العشوائي والحجب الجزئي على صور "مياو باتيك" الأصلية، وذلك لمحاكاة مناطق الأنماط المفقودة والتدهور الهيكلي الذي يُلاحظ عادةً في القطع الأثرية الثقافية التالفة. وقد تم إقران كل صورة متدهورة بالصورة الأصلية المقابلة لها، والتي كانت بمثابة هدف إعادة البناء أثناء التدريب. مكنت هذه الاستراتيجية وحدة CycleGAN من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص ذات الأهمية الثقافية. أخيراً، ينتج مولد SPADE مخرجات فنية محسنة بصرياً عن طريق جعل اصطناع الصور مشروطاً بخرائط التجزئة المولدة، مما يحافظ على السلامة الهيكلية للزخارف الثقافية طوال عملية التحسين الفني.

تتضمن الخطوات التالية إطار عمل SegCycle-SPADE المقترح.

الخطوة 1: جمع مجموعات البيانات
تم استخدام مجموعتي بيانات لتحقيق أهداف تعلم الأنماط الثقافية وتوليد الأنماط الفنية. استُخدمت مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik Cultural Motif Dataset) لتوفير معلومات عن الأنماط الثقافية التقليدية. تتوفر مجموعة البيانات هذه للعموم عبر Zenodo (https://doi.org/10.5281/zenodo.20807658) وتضم 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. وقد استُخدمت الشروحات التوضيحية الموجودة التي وفرها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي شروحات يدوية إضافية في هذه الدراسة. أما مجموعة بيانات WikiArt فقد استُخدمت لتوفير معلومات متنوعة عن الأساليب الفنية لغرض توليد الأنماط الفنية، وتم الحصول عليها من مستودع WikiArt المتاح للعموم (https://www.wikiart.org/).

الخطوة 2: المعالجة المسبقة للبيانات
تمت المعالجة المسبقة لجميع الصور من خلال تغيير الحجم، والتقييس، وتقليل الضوضاء. واستُخدمت تعليقات الزخارف الثقافية الموجودة والتي تم الحصول عليها من مصادر مجموعة البيانات الأصلية لدعم مرحلة التقسيم الدلالي. ولم يتم إجراء أي عمليات تعليق إضافية أو إعادة تسمية كجزء من هذه الدراسة.

الخطوة 3: تقسيم الأنماط الدلالية باستخدام SegFormer
استُخدم نموذج SegFormer لتقسيم الزخارف الثقافية. وقد وُصفت البنية الأساسية لنموذج SegFormer واستراتيجية التهيئة بدقة في القسم الفرعي تقسيم الأنماط الدلالية باستخدام SegFormer. وبشكل محدد، تم استخدام بنية SegFormer-B2 مع بنية أساسية MIT-B2 مُدربة مسبقاً على ImageNet لتقسيم الزخارف الدلالية. ويلتقط هذا النموذج بفعالية المعلومات السياقية العالمية مع الحفاظ على التفاصيل الهيكلية المعقدة للأنماط الثقافية التقليدية.

الخطوة 4: CAFFM
يجمع نموذج CAFFM بين ميزات التجزئة الدلالية والتمثيلات التوليدية، مما يمكن الإطار العملي من تعلم كل من خصائص الزخارف الهيكلية ومعلومات الأسلوب الفني. تتوفر تفاصيل التكامل الخاصة بـ CAFFM في القسم الفرعي CAFFM. يقع هذا النموذج بين مرحلة التجزئة الدلالية القائمة على SegFormer ومرحلة إعادة البناء التوليدية، حيث يقوم بدمج الميزات الهيكلية المستمدة من التجزئة مع ميزات إعادة البناء من خلال آلية الانتباه المتقاطع متعدد الرؤوس (multi-head cross-attention). وتعمل هذه العملية على تحسين الحفاظ على الزخارف الثقافية وتعزيز واقعية المخرجات المعاد بناؤها.

الخطوة 5: إعادة بناء الأنماط (CycleGAN)
تتم معالجة الميزات المدمجة لاحقاً بواسطة وحدة CycleGAN لإعادة بناء هياكل الأنماط الثقافية. تم وصف بنية CycleGAN وتكوين التدريب في القسم الفرعي إعادة بناء الأنماط باستخدام CycleGAN. تتكون وحدة إعادة البناء من مولدين ومميزين، وتستخدم بنية مولد قائمة على الشبكة المتبقية (residual-network) مكونة من تسعة بلوكات متبقية، وتوظف مميز PatchGAN، ويتم تدريبها باستخدام خسائر التنافسية واتساق الدورة (adversarial and cycle-consistency losses). يتيح هذا التكوين رسم خرائط ثنائية الاتجاه للمجالات ويسهل عملية إعادة بناء هياكل الأنماط الثقافية غير المكتملة.

الخطوة 6: توليد النمط الفني (SPADE)
تتم بعد ذلك معالجة الأنماط المعاد بناؤها من خلال وحدة SPADE لإجراء تركيب للنمط الفني بتوجيه من التجزئة. تم وصف تكوين مولد SPADE في القسم الفرعي توليد النمط الفني باستخدام SPADE. وتستخدم هذه الوحدة كتل SPADE المتبقية، وطبقات التطبيع التكيفية مكانيًا، والتكييف الدلالي المستمد من خرائط تجزئة SegFormer وتمثيلات ميزات CAFFM. ومن خلال تكييف توليد الصور بناءً على خرائط التجزئة، تحافظ المخرجات المُصنّعة على المحاذاة الهيكلية مع الزخارف الثقافية الأصلية مع دمج خصائص النمط الفني.

الخطوة 7: تقدير الأداء
تم تقييم الإطار المقترح باستخدام مقاييس متعددة لتقسيم الصور وتقييم جودتها، بما في ذلك دقة التقسيم (Segmentation Accuracy)، وتقاطع union (IoU)، ومعامل تشابه دايس (Dice Similarity Coefficient)، وSSIM، وPSNR، وFID. ولتقييم الاتساق التجريبي، كُررت جميع التجارب خمس مرات باستخدام بذور عشوائية مختلفة، وتم تسجيل النتائج كمتوسط ± الانحراف المعياري. كما تم تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة، مع تحديد عتبة الدلالة عند p < 0.05.

جمع البيانات
في إطار عمل SegCycle-SPADE المقترح، يتم استخدام مجموعتي بيانات لفهم الأنماط الثقافية وتعلم الأنماط الفنية. مجموعة البيانات الأولى المستخدمة في الإطار المقترح هي مجموعة بيانات زخارف باتيك مياو (Miao Batik) الثقافية. تحتوي هذه المجموعة على زخارف ثقافية لباتيك مياو، وهي بشكل عام صور لباتيك مياو التقليدي تضم زخارف مثل الحيوانات والنباتات والأشكال الهندسية المستخدمة في فن عرقية مياو. وتحتوي هذه المجموعة على صور ذات معلومات غنية في الملمس (texture)، والتي تكون مهمة عمومًا للحفاظ على التراث الثقافي. أما مجموعة البيانات الثانية المستخدمة في إطار عمل SegCycle-SPADE فهي مجموعة بيانات WikiArt. تحتوي هذه المجموعة على عدد هائل من الأعمال الفنية التي تنتمي عمومًا إلى أنماط مختلفة، وتُستخدم لتعلم الأنماط المعقدة، وهو أمر مفيد بشكل عام في تحسين الأعمال الفنية. تضم هذه المجموعة 80,000 عمل فني بدقة HD، مع 27 تصميمًا مختلفًا، مما يجعلها أكثر فائدة لمهام توليد أو تحويل الأنماط القائمة على التعلم العميق (DL).

مجموعة بيانات باتيك مياو (Miao Batik Dataset):
تتكون مجموعة بيانات باتيك مياو (https://doi.org/10.5281/zenodo.20807658) من 15,148 صورة لأنماط الباتيك التي تصور زخارف ذات أهمية ثقافية. وتشمل الصور مجموعة متنوعة من التصميمات التقليدية، مثل الزخارف الحيوانية (مثل الفراشات والأسماك)، والأنماط النباتية، والزخارف الهندسية التي تحمل رمزية ثقافية. وتعد مجموعة البيانات هذه مكوناً هاماً في الإطار المقترح لأنها توفر هياكل ثقافية أصلية تمكّن وحدة التجزئة من تحديد حدود الزخارف بدقة والحفاظ عليها أثناء إعادة بناء الأنماط (الجدول 1). وفي هذه الدراسة، تشير الزخارف ذات الأهمية الثقافية إلى العناصر البصرية الرمزية الموثقة عادةً في أدبيات التراث الثقافي لشعب مياو والممثلة ضمن تعليقات مجموعة البيانات، بما في ذلك الطيور والفراشات والأنماط الزهرية وطوطمات الأسلاف. وقد تم اختيار هذه الزخارف بناءً على أهميتها الثقافية الموثقة وتكرار وجودها في تصميمات باتيك وتطريز مياو التقليدية، وليس فقط بناءً على تكرار حدوثها أو تكوينها المكاني. تم الحصول على تعليقات الزخارف وعلامات التجزئة الموجهة من قبل الخبراء من مصدر مجموعة بيانات باتيك مياو الأصلي واستُخدمت مباشرة في هذه الدراسة. ولم يقم المؤلفون بأي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو إجراءات تعليق موجهة من قبل الخبراء. وقد تم استخدام التعليقات الحالية التي وفرها منشئو مجموعة البيانات لتدريب وتقييم التجزئة الدلالية.

المعلمةالوصف
اسم مجموعة البياناتMiao Batik Cultural Pattern Dataset
مصدر مجموعة البياناتZenodo Repository (DOI: 10.5281/zenodo.20807658)
المجالالتراث الثقافي غير المادي (ICH) / تحليل أنماط المنسوجات
إجمالي الصور15,148 صورة
نوع الصورصور رقمية لأنماط منسوجات باتيك Miao التقليدية
فئات الأنماطزخارف حيوانية، وزخارف نباتية، وزخارف هندسية
الأصل الثقافيثقافة عرقية Miao، مقاطعة Guizhou، الصين
دقة الصورة الأصليةصور عالية الدقة (عادةً ≥ 1,000 بكسل في الجانب الأصغر) تم التقاطها كمسوحات خام أو صور فوتوغرافية قبل المعالجة المسبقة
دقة التدريبتم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة
توافر التعليقات التوضيحيةاستُخدمت تعليقات تقسيم الصور الموجودة التي قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم. لم يتم إجراء أي تعليقات توضيحية يدوية إضافية، أو إعادة تسمية، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة.
التطبيق في هذه الدراسةتقسيم الزخارف الثقافية، واستخراج الميزات، والحفاظ على الزخارف، وإعادة بناء الأنماط

الجدول 1: خصائص مجموعة بيانات أنماط باتيك مياو الثقافية. ملخص لمجموعة بيانات زخارف باتيك مياو الثقافية المستخدمة في التقسيم الدلالي، وتحليل الأنماط الثقافية، وإعادة بناء الزخارف. يوضح الجدول مصدر مجموعة البيانات، وخصائص الصور، وفئات الزخارف، والأصل الثقافي، ودقة الصور، ودورها ضمن إطار عمل SegCycle-SPADE المقترح.

مجموعة بيانات WikiArt:
تُعد مجموعة بيانات WikiArt [https://www.wikiart.org/] مستودعاً رقمياً شائعاً للفنون على نطاق واسع، حيث تضم أكثر من 80,000 صورة من 27 أسلوباً فنياً مختلفاً كما هو موضح في الجدول 2. وتشمل هذه الأساليب فن عصر النهضة، والانطباعية، والتكعيبية، والسريالية. وتكتسب مجموعة البيانات هذه أهمية كبيرة في الإطار المقترح لأنها توفر معرفة تتيح لوحدة SPADE إنشاء أنماط غنية ثقافياً مع الحفاظ على المعلومات الهيكلية المستمدة من عملية التجزئة. وتتكون مجموعة البيانات من 56,000 صورة للتعلم و12,000 صورة لكل من التحقق والاختبار. وتساعد الصور الموجودة في هذه المجموعة في تدريب نموذج التعلم العميق (DL) بشكل فعال.

المعيارالوصف
اسم مجموعة البياناتWikiArt Dataset
مصدر مجموعة البياناتمستودع WikiArt (https://www.wikiart.org/)
المجالالفن الرقمي واللوحات
إجمالي الصورحوالي 80,000 عمل فني
صور التدريب56,000
صور التحقق12,000
صور الاختبار12,000
الأنماط الفنية27 نمطاً فنياً، بما في ذلك عصر النهضة، والانطباعية، والتكعيبية، والسريالية، والتعبيرية، والواقعية، والفن التجريدي
دقة الصورة الأصليةتختلف دقة الصور الأصلية باختلاف الأعمال الفنية والمصادر. تم تغيير حجم الصور إلى دقة موحدة تبلغ 256 × 256 بكسل أثناء المعالجة المسبقة.
دقة التدريبتم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة قبل تعلم النمط الفني وتوليد الصور الموجه بالتجزئة.
تقسيم مجموعة البياناتتقسيم عشوائي طبقي (70% للتدريب، و15% للتحقق، و15% للاختبار) باستخدام بذرة عشوائية ثابتة بقيمة 42
استراتيجية أخذ عينات الأنماطتم استخدام أخذ العينات التناسبي الطبقي للحفاظ على توزيع الأنماط الفنية الـ 27 عبر مجموعات التدريب والتحقق والاختبار
التطبيق في هذه الدراسةتعلم النمط الفني، وتمثيل النمط، والتوليف الفني الموجه بالتجزئة

الجدول 2: خصائص مجموعة بيانات WikiArt. ملخص لمجموعة بيانات WikiArt المستخدمة لتعلم الأنماط الفنية وتخليق الصور الموجهة بالنمط. يصف الجدول مصدر مجموعة البيانات، وتوزيع الصور، وتغطية الأنماط الفنية، وتقسيم مجموعة البيانات، ودقة الصور، وتطبيقها ضمن إطار عمل SegCycle-SPADE المقترح.

تحتوي مجموعة بيانات باتيك مياو (Miao Batik) على 15,148 صورة تمثل الزخارف الثقافية التقليدية لشعب مياو.32 وتتوفر مجموعة البيانات للعامة عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658). وقبل تدريب النموذج، خضعت جميع الصور لفحص بصري، وتم تغيير حجمها إلى 256 × 256 بكسل، وتطبيعها، وفحصها للتأكد من خلوها من العينات التالفة أو المكررة. لم يؤدِ فحص مراقبة الجودة إلى استبعاد أي صور؛ وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 لتحليلها لاحقاً. وقُسمت مجموعة البيانات عشوائياً إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام بذرة عشوائية ثابتة بقيمة 42 لضمان إمكانية تكرار تقسيمات مجموعة البيانات. أما مجموعة بيانات WikiArt فقد تم الوصول إليها من خلال مستودع WikiArt الرسمي (https://www.wikiart.org/) وهي تحتوي على أكثر من 80,000 عمل فني تشمل 27 أسلوباً فنياً. وفي تجارب تعلم الأسلوب، استُخدمت 56,000 صورة للتدريب، و12,000 للتحقق، و12,000 للاختبار.

المعالجة المسبقة للبيانات
قبل تدريب إطار عمل SegCycle-SPADE المقترح، خضعت مجموعة بيانات زخارف ثقافة Miao Batik ومجموعة بيانات WikiArt لعدة خطوات من المعالجة المسبقة لضمان اتساق جودة الصور ودقة تمثيل السمات. وقد طُبِّق مسار المعالجة المسبقة الأساسي ذاته على كلتا مجموعتي البيانات، بما في ذلك إزالة الضجيج باستخدام مرشح غاوس (Gaussian denoising)، والتقييس، وتغيير الحجم إلى دقة إدخال ثابتة، والتحقق من جودة الصور. ومع ذلك، لعبت مجموعات البيانات أدواراً متميزة داخل إطار العمل؛ حيث استُخدمت مجموعة بيانات WikiArt لتعلم الأنماط الفنية وتخليقها، بينما استُخدمت مجموعة بيانات Miao Batik بشكل أساسي لتقسيم وإعادة بناء الزخارف الثقافية. ولم يتم إجراء أي تغييرات في المعالجة المسبقة خاصة بكل مجموعة بيانات بما يتجاوز هذه الأدوار المحددة للمهام. ولضمان المعالجة المتسقة بواسطة نموذج التعلم العميق (DL model)، تم أولاً تغيير حجم الصور إلى دقة ثابتة، وكانت هذه الخطوة ضرورية لأن الصور في كلتا المجموعتين كانت تختلف في الدقة اعتماداً على مصدرها، وقد أدى تغيير الحجم إلى تحسين الكفاءة الحسابية ومنع التناقضات في الأبعاد من التأثير على التدريب. وكانت الخطوة الثانية من المعالجة المسبقة هي التقييس، حيث تم تغيير مقياس قيم البكسل إلى نطاق معياري لاستقرار تحديثات التدرج أثناء التدريب. ثم تمت معالجة الصور باستخدام ترشيح غاوس لتقليل الضجيج الذي قد يتداخل مع هياكل الزخارف الثقافية. أما بالنسبة لمجموعة بيانات Miao Batik، فقد استُخدمت أقنعة تقسيم الزخارف الثقافية الحالية التي تم الحصول عليها مباشرة من مصدر مجموعة البيانات الأصلية دون تعديل لتدريب وتقييم التقسيم الدلالي (semantic segmentation)، ولم يتم إنشاء أقنعة تقسيم جديدة خصيصاً لهذه الدراسة.

ما لم يُذكر خلاف ذلك، فقد تم اقتباس المعادلات التي تصف الطرق المعتمدة من دراسات سابقة وتم الاستشهاد بها وفقاً لذلك. أما المعادلات التي تصف طريقة CAFFM المقترحة وإطار عمل التحسين المركب SegCycle-SPADE فقد طورها المؤلفون خصيصاً لهذه الدراسة.

لتكن صورة مدخلة من مجموعة البيانات ممثلة كما في المعادلة 1:

figure-protocol-2  (1)

هنا، تشير H و W و C إلى ارتفاع الصورة وعرضها وعدد قنوات الألوان، على التوالي. يتم تغيير حجم جميع الصور إلى بُعد ثابت H′ × W′ كما هو موضح في المعادلة 2:

figure-protocol-3

هنا، يمثل Ir الصورة التي تم تغيير حجمها. يتم حساب قيم البكسل المعيرة وفقاً لـ المعادلة 3:

figure-protocol-4   (3)

يساعد هذا في استقرار إجراء التدريب. ويتم إجراء تصفية الضجيج باستخدام مرشح غاوسي (Gaussian filter) كما هو موضح في المعادلة 4:

figure-protocol-5

هنا، G(σ) هو مرشح غاوسي (Gaussian filter) و * تمثل عملية الالتفاف (convolution). تم استخدام مرشح غاوسي بنواة مقاس 5 × 5 وبانحراف معياري قدره σ = 1.0. كما تم تطبيق حشو انعكاسي (Reflective padding) على بكسلات الحدود لتقليل الآثار الاصطناعية عند الحواف. وقد أجريت عملية إزالة الضجيج مباشرة بعد تحميل الصور وقبل مرحلتي القياس والتطبيع. ولضمان توحيد المعالجة المسبقة في جميع أنحاء الدراسة، تم تطبيق نفس تكوين المرشح على كل صورة في مجموعتي بيانات Miao Batik و WikiArt. وبالنسبة لمجموعة بيانات Miao Batik، يتم إنشاء أقنعة التجزئة وفقاً لـ المعادلة 5:

figure-protocol-6

هنا، يمثل M قناع تقسيم يستخدم لتوجيه نموذج SegFormer.

تبدأ سلسلة عمليات المعالجة المسبقة بالحصول على الصور من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt، كما هو موضح في الشكل 3. لم يتم استخدام أي تقنيات لزيادة البيانات (data augmentation) أثناء التدريب. وبعد المعالجة المسبقة، التي شملت تغيير الحجم، والتطبيع (normalization)، وإزالة الضجيج بطريقة غاوس (Gaussian denoising)، وإعداد أقنعة التجزئة (segmentation-mask)، استُخدمت الصور مباشرة لتدريب والتحقق من واختبار إطار عمل SegCycle-SPADE المقترح. تتضمن الخطوة الأولى من سلسلة المعالجة المسبقة تغيير حجم الصور إلى حجم ثابت، مما يسمح لنموذج التعلم العميق (DL) بمعالجة الصور بكفاءة أكبر. وتتضمن الخطوة الثانية التطبيع، الذي يقوم بتحويل قيم البكسل إلى نطاق عددي موحد ويسهل تقارب النموذج (model convergence). أما الخطوة الثالثة فتتضمن إزالة الضجيج، حيث يتم تنقية الصور من الضجيج غير المرغوب فيه لتحسين التعرف على الأنماط. بالإضافة إلى ذلك، بالنسبة لمجموعة بيانات Miao Batik، يتم تعيين مناطق الزخارف الثقافية، مما يسمح بتوليد الأقنعة التي تُستخدم في وحدة التجزئة للنموذج المقترح، وذلك لضمان الحفاظ على الزخارف الثقافية أثناء عملية التوليد. والمخرج النهائي لهذه المرحلة هو مجموعة بيانات نظيفة جاهزة لتدريب وحدتي التجزئة والتوليد في النموذج المقترح.

figure-protocol-7
الشكل 3. مسار المعالجة المسبقة للبيانات لصور التراث الثقافي. مخطط سير العمل يوضح إجراءات المعالجة المسبقة للصور المطبقة قبل تدريب النموذج. يتضمن المسار الحصول على مجموعة البيانات، وتغيير حجم الصور، والتقييس، وإزالة الضوضاء باستخدام مرشح Gaussian، وتدوين الزخارف الثقافية الموجودة، وإعداد أقنعة التجزئة. تُستخدم الصور والأقنعة المعالجة الناتجة كمدخلات للتجزئة الدلالية وإعادة بناء الأنماط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

خضعت كل صورة لعملية مراقبة الجودة قبل تدريب النموذج. احتوت مجموعة بيانات Miao Batik على 15,148 صورة. وقد تمت معالجة العينات التالفة والمكررة ومنخفضة الجودة من قبل منشئي مجموعة البيانات الأصليين؛ لذا، لم يتم استبعاد أي صور إضافية أثناء فحص مراقبة الجودة في هذه الدراسة. وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 صورة للتحليل. تم تحميل الصور بتنسيق RGB أثناء المعالجة المسبقة، وإعادة تحجيمها إلى 256 × 256 بكسل باستخدام الاستيفاء الخطي الثنائي (bilinear interpolation). وتم تغيير مقياس قيم البكسل من النطاق [0, 255] إلى [0, 1] عن طريق القسمة على 255. ثم تم تطبيق تطبيع حسب القناة (Channel-wise normalization) باستخدام قيم متوسط تبلغ [0.485, 0.456, 0.406] وقيم انحراف معياري تبلغ [0.229, 0.224, 0.225] للقنوات الحمراء والخضراء والزرقاء على التوالي. تضمنت سلسلة المعالجة المسبقة تحميل الصور، والتحويل إلى RGB، وإعادة التحجيم، وتغيير مقياس قيم البكسل، والتطبيع، والتحويل إلى تنسيق tensor. وعند الضرورة، تم تحويل الصور ذات التدرج الرمادي إلى تنسيق RGB ثلاثي القنوات للحفاظ على التوافق مع نماذج التعلم العميق (DL models). وبعد المعالجة المسبقة، تم تقسيم الصور إلى مجموعات فرعية للتدريب والتحقق والاختبار. استخدمت جميع مراحل إطار عمل SegCycle-SPADE — بما في ذلك التقسيم الدلالي (semantic segmentation)، ودمج الميزات (feature fusion)، وإعادة بناء الزخارف (motif reconstruction)، والتركيب الفني القائم على SPADE — دقة إدخال ثابتة تبلغ 256 × 256 بكسل.

تجزئة الأنماط الدلالية باستخدام SegFormer
بعد خطوة المعالجة المسبقة هذه، يتم إدخال الصور التي تم تنظيفها وتوحيدها من مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt في وحدة التجزئة الدلالية القائمة على إطار عمل SegFormer-B2 المقترح. الغرض من هذه الخطوة هو تحديد وفصل الزخارف الثقافية الموجودة في الأنماط التراثية بشكل صحيح. يعتمد إطار عمل SegFormer المقترح على بنية محول (transformer) تتضمن مشفر محول هرمي وفك تشفير MLP خفيف الوزن لالتقاط المعلومات السياقية العالمية والمعلومات الهيكلية المفصلة من الأنماط التراثية المعقدة بدقة. يقوم النموذج أولاً باستخراج تمثيلات الميزات بمقاييس متعددة من الصورة المدخلة، يليه دمج هذه التمثيلات من خلال فك التشفير لتوليد أنماط مجزأة بدقة. يضمن ذلك تجزئة الأنماط في الصورة التراثية بشكل صحيح إلى زخارف مثل الأنماط الهندسية، والأنماط الزهرية، والأنماط الرمزية، وبالتالي فصلها عن الخلفية مع الحفاظ على سلامتها الهيكلية. تُستخدم هذه المعلومات الهيكلية لاحقاً خلال المراحل المتأخرة من توليد الأنماط ضمن إطار عمل SegCycle-SPADE.

لتكن الصورة المدخلة التي تمت معالجتها مسبقاً ممثلة بـ المعادلة 6:

figure-protocol-8    (6)

يقوم مشفر SegFormer بتقسيم الصورة إلى رقع واستخراج الميزات الهرمية باستخدام طبقات المحول (transformer)، كما هو موضح في المعادلة 71:

figure-protocol-9

هنا، يشير F إلى خرائط الميزات متعددة المقاييس التي تم الحصول عليها من مشفر المحول (transformer encoder). وتعمل هذه الميزات على ترميز كل من أنماط النسيج المحلية والعلاقات السياقية العالمية بين مناطق الزخرفة (motif regions). ويقوم نموذج SegFormer باستخراج خرائط الميزات بمقاييس مختلفة كما هو محدد في المعادلة 8:

figure-protocol-10

يساهم استخدام التمثيلات متعددة المقاييس في تسهيل الكشف عن الأنماط ذات الأحجام المختلفة ضمن الزخارف الثقافية. وفي النهاية، يتم دمج الميزات باستخدام مفكك شفرة MLP كما هو موضح في المعادلة 91:
 figure-protocol-11

هنا، يشير S إلى خريطة التقسيم النهائية المتوقعة.

تم تهيئة العمود الفقري لنموذج SegFormer-B2 باستخدام أوزان مدربة مسبقاً على مجموعة بيانات ImageNet، ومن ثم تم ضبطه بدقة على مجموعة بيانات Miao Batik لتقسيم الزخارف الثقافية. تم الحصول على نقطة التحقق المدربة مسبقاً من التنفيذ الرسمي لنموذج SegFormer. وتحديداً، تم استخدام نقطة التحقق MIT-B2 المدربة مسبقاً على ImageNet-1K (mit_b2.pth) المقدمة من مستودع SegFormer الرسمي لتهيئة العمود الفقري لنموذج SegFormer-B2 قبل عملية الضبط الدقيق. تتوافق الأوزان المدربة مسبقاً مع العمود الفقري MIT-B2 الذي أصدره مؤلفو SegFormer، وقد عملت كنموذج تهيئة للتدريب على التقسيم الدلالي. أما الطبقات المتبقية الخاصة بالمهمة، فقد تم تهيئتها باستخدام إجراءات تهيئة أوزان PyTorch الافتراضية قبل البدء في التدريب.

تستخدم البنية الهيكلية مشفر Transformer هرمي مكون من أربع مراحل مع تضمينات رقع متداخلة. في المرحلة الأولية، تم تعيين حجم الرقعة على 7 × 7 بزيادة قدرها 4. وبالنسبة لكل مرحلة من مراحل المشفر الأربع، كانت أبعاد التضمين 64 و128 و320 و512. وعبر المراحل الأربع، كان هناك 1 و2 و5 و8 رؤوس انتباه ذاتي متعددة الرؤوس، وكانت أعماق المشفر المقابلة 3 و4 و6 و3 طبقات. تم تجميع الميزات متعددة المقاييس المستخرجة من المشفر باستخدام مفكك تشفير خفيف الوزن يعتمد كلياً على MLP. وقبل إنشاء خريطة التجزئة النهائية، قام مفكك التشفير بإسقاط الميزات من كل مرحلة من مراحل المشفر في مساحة تضمين واحدة. استخدمت جميع كتل Transformer دالة التنشيط Gaussian Error Linear Unit (GELU). كما تم استخدام معدل تسرب (dropout rate) قدره 0.1 أثناء التدريب لتحسين التعميم والحد من فرط التناسب.

خلال مرحلة التدريب، يستقبل إطار عمل SegFormer الصور التي تمت معالجتها مسبقاً من كلا مجموعتي البيانات. تحتوي الصور من مجموعة بيانات Miao Batik على مناطق الزخارف التي تعمل كملصقات للتعلم الخاضع للإشراف لنموذج التجزئة. يقوم مشفر Transformer بمعالجة الصورة بأكملها والتقاط العلاقات طويلة المدى بين مكونات الصورة، وهو أمر بالغ الأهمية خاصة لأنماط الباتيك التقليدية التي تحتوي على زخارف موزعة مكانياً. كما تقوم آلية استخراج الميزات الهرمية بالتقاط البنى المحلية في الوقت ذاته، مثل الأنسجة الهندسية المتكررة. ويعالج مفكك رموز MLP هذه الميزات المستخرجة وينتج قناع تجزئة يبرز مناطق الزخارف. وتُستخدم خرائط التجزئة التي تم إنشاؤها خلال هذه المرحلة لاحقاً كمدخلات هيكلية لوحدة الانتباه ومرحلة إعادة بناء الأنماط، مما يساعد بذلك في الحفاظ على أصالة الأنماط المُولدة.

وُزعت الزخارف الثقافية على فئات مختلفة للتقسيم الدلالي (semantic segmentation) بناءً على خصائصها البصرية والثقافية. شمل تصنيف التقسيم زخارف حيوانية (مثل الفراشات، والأسماك، والطيور، وغيرها من الكائنات الرمزية)، وزخارف نباتية (مثل الأزهار، والأوراق، والكروم، والأنماط النباتية)، وزخارف هندسية (مثل الأشكال المتكررة، والإطارات، والهياكل الهندسية التجريدية)، ومناطق الخلفية التي تمثل المساحات الخالية من الزخارف. استُخدمت أقنعة تقسيم على مستوى البكسل لتعيين كل بكسل إلى إحدى الفئات المحددة مسبقًا. وتم ترميز التسميات العددية كما يلي: التسمية 0 = الخلفية، والتسمية 1 = الزخارف الحيوانية، والتسمية 2 = الزخارف النباتية، والتسمية 3 = الزخارف الهندسية. تم الحصول على تعليقات التقسيم وتسميات الزخارف مباشرة من مصدر مجموعة بيانات "Miao Batik" الأصلية. لم يتم إجراء أي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو تحقق من الحدود، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة، بل استُخدمت التعليقات الموجودة التي وفرها منشئو مجموعة البيانات دون تعديل لعمليات التدريب والتقييم.

يقوم نموذج SegFormer الخاص بتجزئة الزخارف الثقافية بمعالجة الصور التي تمت معالجتها مسبقًا من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt باستخدام آلية تعتمد على المحولات (transformer) للكشف الدقيق عن مناطق الأنماط الثقافية، كما هو موضح في الشكل 4. أولاً، يتم تزويد نموذج SegFormer بالصورة المدخلة التي تحتوي على الزخارف الثقافية التقليدية. يقوم مشفر المحولات (Transformer encoder) باستخراج كل من المعلومات السياقية العالمية والميزات الهيكلية المحلية من رقع الصور. ثم يتم تزويد الميزات متعددة المقاييس الناتجة بفك تشفير التجزئة (segmentation decoder)، الذي يستخدم شبكة تغذية أمامية مختلطة (Mix Feed-Forward Network) لتحسين تمثيلات الميزات ورفع كفاءة الكشف عن الزخارف. وتكون مخرجات نموذج SegFormer عبارة عن قناع تجزئة يبرز البكسلات المقابلة للأنماط الثقافية مع استبعاد معلومات الخلفية غير ذات الصلة. بعد ذلك، تعمل الأنماط الثقافية المعزولة كإرشاد هيكلي للمراحل اللاحقة من إطار عمل SegCycle-SPADE.

figure-protocol-12
الشكل 4. التجزئة الدلالية للزخارف الثقافية القائمة على SegFormer-B2. بنية وحدة التجزئة الدلالية SegFormer-B2 المستخدمة لاستخراج الزخارف الثقافية والتي تم تدريبها حصرياً على مجموعة بيانات Miao Batik. يتكون الإطار من مشفر قائم على Transformer لاستخراج الميزات متعددة المقاييس ومفكك تشفير تجزئة خفيف الوزن لتوليد أقنعة الزخارف. يتنبأ النموذج بأربع فئات دلالية وهي: الحيوان، والنبات، والهندسي، والخلفية، حيث تحدد أقنعة التجزئة الناتجة مناطق الزخارف ذات الأهمية الثقافية مع حجب معلومات الخلفية غير ذات الصلة. وتوفر مخرجات التجزئة هذه توجيهاً هيكلياً لمراحل دمج الميزات، وإعادة البناء، والتوليف الفني اللاحقة في إطار SegCycle-SPADE المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

لا توجد حاجة لإنشاء تعليقات توضيحية جديدة للتجزئة في الإطار المقترح. تم الحصول على مجموعة بيانات Miao Batik من مصدر عام موجود مسبقاً، وتم تدريب النموذج باستخدام معلومات الزخارف ذات الصلة التي قدمها منشئو مجموعة البيانات. وخلال عملية التعلم، أنتج نموذج SegFormer خرائط تجزئة دلالية. ونتيجة لذلك، لم تتطلب الدراسة الحالية أي برامج إضافية للتعليق التوضيحي اليدوي، أو إرشادات للتعليق التوضيحي، أو إجراءات لمراقبة جودة التعليقات التوضيحية.

وحدة CAFFM
لتحسين التفاعل بين سمات التجزئة الدلالية وتمثيلات إعادة البناء التوليدية، اقترحت الدراسة أيضاً وحدة CAFFM. حيث يوفر مشفر SegFormer-B2 خرائط سمات دلالية لوحدة CAFFM، بينما توفر خطوة إعادة البناء في CycleGAN خرائط سمات توليدية. أولاً، تُستخدم طبقات إسقاط خطي لإسقاط كلا تدفقي السمات في فضاء تضمين مشترك. ولحساب الانتباه المتقاطع، يتم إنشاء تمثيلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) باستخدام موترات السمات المولدة. ثم يتم نمذجة العلاقات بين معلومات الزخارف الهيكلية وعناصر الأسلوب الفني باستخدام الانتباه المتقاطع متعدد الرؤوس. بعد ذلك، يتم تطبيق تسوية الطبقة، والوصلات المتبقية، وطبقات التغذية الأمامية مع تنشيط GELU على تمثيلات السمات المدمجة. وتستقبل مرحلة التصنيع القائمة على SPADE مخرجات وحدة CAFFM، مما يسمح بالحفاظ على الموضوعات ذات الدلالات الثقافية دون التضحية بالتماسك الفني.

لضمان توافق الميزات، يتم أولاً إسقاط ميزات الإدخال باستخدام طبقات إسقاط خطية على فضاء تضمين مشترك ببعد تضمين يبلغ 256. ثم يتم نمذجة الترابطات بين المعلومات البنيوية الدلالية وتمثيلات الأسلوب التوليدي باستخدام آلية الانتباه المتقاطع متعدد الرؤوس (MultiHead Cross-Attention) بثمانية رؤوس انتباه. وتستخدم حسابات الانتباه المتقاطع ناقلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) التي تنتجها طبقات تحويل خطية محددة. ولزيادة استقرار التدريب والحفاظ على سلامة الميزات، يتم استخدام الوصلات المتبقية (residual connections) وتسوية الطبقة (Layer Normalization) لتعزيز تمثيلات الميزات المدمجة بشكل أكبر. ثم يتم تحسين تعلم الميزات غير الخطية من خلال تطبيق شبكة تغذية أمامية باستخدام دالة التنشيط وحدة الخطأ الغاوسية الخطية (GELU). ويقوم النموذج بتوليد تمثيل ميزات مخرج ببعد 256 يتم إرساله إلى مراحل أخرى من أجل الاصطناع الإبداعي. ينجح نموذج CAFFM في دمج بيانات الأسلوب الفني مع بنيات الزخارف الثقافية عن طريق استخدام تقنية دمج قائمة على الانتباه المتقاطع، مما يعزز الحفاظ على الزخارف والتماسك البصري في أنماط التراث الثقافي المعاد بناؤها.

في النظام المقترح، يتم اشتقاق السمات الهيكلية من مجموعة بيانات Miao Batik، بينما يتم تعلم السمات الأسلوبية من مجموعة بيانات WikiArt. لنرمز لخريطة السمات المشتقة من شبكة التجزئة SegFormer باستخدام صور من مجموعة بيانات Miao Batik بالرمز Fs، بينما ترمز خريطة السمات المشتقة من فرع استخراج السمات الأسلوبية باستخدام صور WikiArt بالرمز Fa. يقوم نموذج CAFFM المقترح بدمج مجالي السمات باستخدام آلية الانتباه المتقاطع (cross-attention mechanism) لتعلم التبعيات الهيكلية والأسلوبية للأنماط الثقافية. يوضح الجدول 3 جميع الخصائص المعمارية، بما في ذلك أبعاد التضمين (embedding dimensions)، وطبقات التسوية (normalization layers)، ودوال التنشيط (activation functions)، وتكوين رؤوس الانتباه (attention-head configuration). بالنسبة لحجم صورة إدخال قدره 256 × 256 بكسل، أنتج مشفر SegFormer-B2 خرائط سمات دلالية بحجم 64 × 64 × 128، بينما أنتج فرع استخراج السمات الأسلوبية خرائط سمات بحجم 64 × 64 × 128. تم إسقاط كلتا خريطتي السمات من خلال طبقات خطية قابلة للتعلم في فضاء تضمين مشترك ببعد 256 قبل عملية دمج الانتباه المتقاطع.

المعلمالتكوين
الإطار المقترحSegCycle-SPADE
نموذج التجزئة الدلاليةSegFormer-B2
مراحل مشفر SegFormer4
تهيئة الأوزانSegFormer-B2 مدرب مسبقاً على ImageNet-1K (العمود الفقري MIT-B2)
مصدر نقطة التحققمستودع NVIDIA SegFormer الرسمي (https://github.com/NVlabs/SegFormer)؛ نقطة التحقق: segformer.b2.512x512.ade.160k
استراتيجية الضبط الدقيقضبط دقيق شامل من الطرف إلى الطرف على مجموعة بيانات Miao Batik
حجم تضمين الرقعة7 × 7
خطوة الرقعة4
أبعاد التضمين64، 128، 320، و 512
أعماق المشفر3، 4، 6، و 3
رؤوس الانتباه1، 2، 5، و 8
نوع مفكك الشفرةAll-MLP Decoder
دالة التنشيطGELU
معدل التسرب0.1
وحدة تعزيز الميزاتوحدة دمج الميزات الثقافية عبر الانتباه المتقاطع (CAFFM)
بعد تضمين CAFFM256
رؤوس انتباه CAFFM8
مقاييس دمج CAFFM4
نموذج إعادة البناءCycleGAN
نموذج توليد النمطSPADE
مجموعة البيانات الثقافيةمجموعة بيانات Miao Batik
مجموعة بيانات النمطمجموعة بيانات WikiArt
صور Miao Batik15,148
صور WikiArt80,000 تقريباً
دقة صورة الإدخال256 × 256 بكسل
تنسيق الألوانRGB
طريقة الاستيفاءالاستيفاء الخطي الثنائي
طريقة إزالة الضجيجالترشيح الغاوسي
حجم النواة الغاوسية5 × 5
السيجما الغاوسية (σ)1
نطاق التطبيع[0, 1]
حجم الدفعة16
عدد الدورات100
المحسنAdam
معدل التعلم0.0002
معاملات Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0
دوال الخسارةخسارة التجزئة، والخسارة التنافسية، وخسارة اتساق الدورة، وخسارة إعادة البناء، وخسارة الحفاظ على الزخارف، وخسارة اتساق النمط
استراتيجية تقسيم مجموعة البياناتتدريب / تحقق / اختبار
مجموعة التدريب70%
مجموعة التحقق15%
مجموعة الاختبار15%
البذرة العشوائية42
مقاييس التقييمدقة التجزئة، وIoU، ومعامل Dice، وSSIM، وPSNR، وFID
لغة البرمجةPython 3.8.10
إطار التعلم العميقPyTorch 1.10.0
المنصة العتاديةNVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (الجيل الحادي عشر), 32 GB RAM
بيئة التشغيلUbuntu 20.04 LTS

الجدول 3: الإعداد التجريبي وتكوين النموذج. ملخص للمكونات المعمارية، وتكوين التدريب، وإعدادات المعالجة المسبقة، ومجموعات البيانات، ومعلمات التحسين، ومقاييس التقييم، والبيئة الحسابية المستخدمة لتنفيذ وتقييم إطار عمل SegCycle-SPADE المقترح.

تقوم وحدة الانتباه أولاً بتحويل خريطة الميزات إلى تمثيلات الاستعلام (query)، والمفتاح (key)، والقيمة (value) باستخدام المعادلة 10:

figure-protocol-13

هنا، تمثل Wq وWk وWv مصفوفات أوزان قابلة للتعلم. يتم حساب أوزان الانتباه بناءً على التشابه بين متجه الاستعلام ومتجه المفتاح باستخدام المعادلة 1117

figure-protocol-14

هنا، dk هو بُعد متجه المفتاح. ويتم حساب تمثيل الميزات المعزز عن طريق ضرب أوزان الانتباه في مصفوفة القيمة باستخدام المعادلة 12:

figure-protocol-15

هنا، يمثل Fa التمثيل المعزز للميزات لخريطة الميزات. ويتم حساب التمثيل المعزز للميزات من خلال دمج ميزات التجزئة الأصلية مع الميزات المعززة التي تم الحصول عليها باستخدام آلية الانتباه وفقاً لـ المعادلة 13:

figure-protocol-16                                

هنا، تمثل Fe خريطة السمات المحسنة المستخدمة في إعادة بناء النمط. يتم توسيع وحدة CAFFM بآلية انتباه متقاطع متعددة المقاييس لاستخراج سمات الزخارف الثقافية بمقاييس مختلفة. لتكن Fsi دالة على سمات التجزئة عند المقياس i، بينما تمثل Faj سمات النمط الفني عند المقياس نفسه. يتم تعريف تمثيل السمات النهائي باستخدام المعادلة 14:

  figure-protocol-17

هنا، تمثل Qi و Ki و Vi مصفوفات الاستعلام (query)، والمفتاح (key)، والقيمة (value) عند المقياس i على التوالي، ويرمز N إلى عدد مقاييس السمات. في هذه الدراسة، N = 4، وهو ما يقابل خرائط السمات المستخرجة بدقة مكانية تبلغ 1/4 و 1/8 و 1/16 و 1/32 من حجم الصورة المدخلة. وقد دُمجت تمثيلات السمات متعددة المقاييس هذه باستخدام أوزان انتباه قابلة للتعلم قبل مرحلتي إعادة البناء والتركيب الفني. ويمكّن هذا التوسع المذكور أعلاه الطريقة من استخراج الزخارف الثقافية والأنسجة العالمية لإعادة بناء الأنماط الثقافية. يقع نموذج CAFFM بين مرحلة التجزئة القائمة على SegFormer ومرحلة التركيب الإبداعي القائمة على SPADE في نظام SegCycle-SPADE المقترح. أولاً، بينما يقوم CycleGAN بإنشاء سمات إعادة البناء المتزامنة مع المعلومات المتعلقة بالنمط والأسلوب، يقوم SegFormer-B2 باستعادة خرائط السمات الدلالية التي تصف الخصائص الهيكلية للزخارف الثقافية. وتستقبل وحدة CAFFM هذين التدفقين من السمات وتستخدم دمجاً قائماً على الانتباه المتقاطع (cross-attention) لتحديد العلاقات بين التمثيلات الهيكلية والفنية. ومن أجل إنشاء أنماط أصيلة ثقافياً مع الحفاظ على الاتساق الدلالي والسمات الهيكلية، يتم إرسال خرائط السمات المدمجة الناتجة بعد ذلك إلى وحدة SPADE للقيام بالتركيب الإبداعي الموجه بالتجزئة.

إعادة بناء الأنماط باستخدام CycleGAN
بمجرد الانتهاء من مرحلة تعزيز السمات القائمة على الانتباه، ستتضمن خرائط السمات هياكل الزخارف الثقافية المُعززة. ومع ذلك، قد تظل خرائط السمات تحتوي على مناطق أنماط غير مكتملة أو تالفة. لذلك، ولمعالجة مشكلة إعادة بناء الأنماط، سيعتمد الإطار المقترح على نموذج CycleGAN. في الإطار المقترح، سيكون النطاقان هما أنماط الزخارف الثقافية الأصلية وأنماط الزخارف الثقافية المعاد بناؤها. وباستخدام السمات المُعززة من المراحل السابقة، سيقوم نموذج CycleGAN بإعادة بناء الأنماط الثقافية مع الحفاظ على الاتساق الهيكلي. سيضمن ذلك احتفاظ الأنماط الثقافية، مثل الأنماط الهندسية، والأنماط الزهرية، والأنماط الرمزية، بترتيبها المكاني. وقد خضعت صور باتيك مياو (Miao Batik) الأصلية لعمليات قناع عشوائي وحجب جزئي لتوليد زخارف ثقافية غير مكتملة أو تالفة. وحاكت إجراءات التدهور هذه مناطق الأنماط المفقودة والتلف الهيكلي الذي يُلاحظ عادةً في القطع الأثرية للتراث الثقافي المتدهورة. استُخدمت الصور المتدهورة كمدخلات لوحدة إعادة البناء، بينما عملت الصور الأصلية المقابلة كصور مرجعية لتقييم الأداء وتقدير جودة إعادة البناء. وقد مكنت هذه الاستراتيجية النموذج من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص الثقافية.

لتكن X نطاق الأنماط الثقافية غير المكتملة و Y نطاق الأنماط الثقافية المعاد بناؤها. يتعلم المولدّان إجراء رسم خرائط ثنائي الاتجاه باستخدام المعادلة 15:

 figure-protocol-18

هنا، يُستخدم GE لإعادة بناء هياكل الزخارف (motif structures)، بينما يُستخدم FM لإسقاط الأنماط مرة أخرى على النطاق الأصلي. وتُستخدم الخسارة التنافسية لضمان أن تكون الأنماط المعاد بناؤها واقعية (المعادلة 16)30

figure-protocol-19

هنا، يمثل DY المميز المستخدم للتفريق بين الأنماط الحقيقية والمعاد بناؤها، بينما يشير GE(x) إلى النمط المعاد بناؤه الذي تم توليده. كما يفرض نموذج CycleGAN اتساق الدورة للحفاظ على التخطيط الهيكلي للزخارف الثقافية (المعادلة 17)30.

figure-protocol-20

تُحدد دالة الخسارة النهائية باستخدام المعادلة 1830:

figure-protocol-21

هنا، يرمز λi إلى معامل الترجيح لخسارة اتساق الدورة، وقد تم ضبطه عند القيمة 10 أثناء التدريب، بما يتوافق مع صيغة CycleGAN الأصلية. تم اختيار هذه القيمة لتحقيق التوازن بين التعلم التنافسي واتساق إعادة البناء بين النطاقين المصدر والهدف.

تتكون وحدة إعادة بناء CycleGAN من مولدين ومميزين لترجمة الصور ثنائية الاتجاه. يتبع كل مولد بنية شبكة متبقية (residual-network) تضم طبقة تلافيفية أولية بحجم 7 × 7، تليها طبقتان تلافيفيتان لخفض العينات، وتسعة كتل متبقية، وطبقتان لزيادة العينات. تستخدم جميع العمليات التلافيفية حجم نواة 3 × 3، باستثناء طبقة الإدخال التي تستخدم نواة 7 × 7 لتعزيز استخلاص الميزات. يتم تطبيق تسوية الحالات (Instance Normalization) بعد كل طبقة تلافيفية لتحسين استقرار التدريب، بينما تُستخدم دالة التنشيط ReLU في جميع أنحاء شبكة المولد. وتستخدم طبقة الإخراج دالة تنشيط Tanh لإنتاج مخرجات صور مُعيرة. أما المميز فيتبع بنية PatchGAN بحجم 70 × 70 تتكون من سلسلة من الطبقات التلافيفية بأحجام نواة 4 × 4 وقنوات ميزات تزداد تدريجياً. ويتم استخدام تسوية الحالات وتنشيط LeakyReLU (بمنحدر سلبي = 0.2) في المميز لتحسين تمييز الميزات والتعلم التنافسي. تستقبل وحدة CycleGAN صور الزخارف الثقافية المعالجة مسبقاً كمدخلات وتنتج تمثيلات أنماط مُعاد بناؤها، والتي تُمرر لاحقاً إلى CAFFM لدمجها مع ميزات التجزئة. تم إجراء تدريب CycleGAN باستخدام محسِّن Adam (β₁ = 0.5, β₂ = 0.999) بمعدل تعلم أولي قدره 0.0002. تم الحفاظ على معدل التعلم خلال أول 100 حقبة (epoch)، ثم انخفض خطياً إلى الصفر على مدار فترة التدريب المتبقية. كما استُخدم مخزن مؤقت لإعادة التشغيل (replay buffer) يحتوي على 50 صورة تم إنتاجها مسبقاً لتثبيت تدريب المميز. تم تحديث المولدات والمميزين بنسبة تحديث 1:1، حيث يتبع كل تحديث للمولد تحديث واحد للمميز خلال كل تكرار تدريبي.

تعتمد عملية إعادة بناء CycleGAN على خرائط السمات المحسنة التي تم الحصول عليها باستخدام آلية CAFFM في الشكل 5. تحتوي خرائط السمات هذه على زخارف ثقافية محسنة تم الحصول عليها من مراحل التقسيم وCAFFM السابقة. تُستخدم خرائط السمات كمدخلات للمولد الأول GE، حيث يتعلم المولد الأول GE عملية الربط (mapping) المطلوبة لإعادة بناء الأنماط الثقافية. ثم يتم تمرير المخرجات إلى المميز DY للتمييز بين الأنماط الثقافية الحقيقية والأنماط المعاد بناؤها. ويساعد المميز DY المولد GE في إنتاج مخرجات واقعية. ولضمان عدم تشوه الأنماط الثقافية أثناء إعادة البناء، يقوم المولد الثاني FM بعملية ربط متسقة دورياً (cycle-consistency mapping). حيث يقوم المولد الثاني FM بربط المخرجات مرة أخرى بالنطاق الأصلي، ثم يتم تقييم المخرجات بواسطة المميز لضمان واقعيتها. بعد ذلك، يتم تمرير المخرجات النهائية إلى وحدة SPADE لتوليد النمط الفني في المرحلة التالية من إطار عمل SegCycle-SPADE المقترح.

figure-protocol-22
الشكل 5. سير عمل إعادة بناء الأنماط القائم على CycleGAN. سير عمل وحدة إعادة البناء باستخدام CycleGAN. يتم تقديم تمثيلات الميزات المعززة بالانتباه كمدخلات إلى شبكة المولد لإعادة بناء الزخارف الثقافية غير المكتملة. ويقوم المميز بتقييم المخرجات المعاد بناؤها مقابل الأنماط المرجعية، بينما يحافظ تعيين الاتساق الدوري على السلامة الهيكلية أثناء ترجمة الصور ثنائية الاتجاه. يتم بعد ذلك توجيه الزخارف المعاد بناؤها إلى وحدة SPADE لتخليق النمط الفني. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

توليد الأسلوب الفني باستخدام SPADE
بعد ذلك، تخضع الزخارف الثقافية المعاد بناؤها إلى وحدة SPADE لتوليد الأسلوب الفني. الهدف الرئيسي من وحدة SPADE هو إضافة أنسجة غنية بصرياً من الأسلوب الفني إلى الزخارف الثقافية المعاد بناؤها دون المساس بالتخطيط الهيكلي للزخارف. وتُعد وحدة SPADE تقنية توليد صور شرطية تعتمد على مفهوم تقسيم الصور لتوليد الصور. وقد تم ترميز خرائط دلالية متعددة القنوات تتوافق مع فئات الزخارف المحددة مسبقاً من أقنعة التقسيم الدلالي التي أنتجها SegFormer-B2. وتلقى مولد SPADE هذه الخرائط المرمزة كمدخلات شرطية. كما تم إنتاج معاملات القياس التكيفي مكانيًا (γ) والانحياز (β) من خلال معالجة الخرائط الدلالية عبر طبقات تلافيفية داخل كل طبقة من طبقات SPADE. وبذلك تمكن المولد من الحفاظ على حدود الزخارف، والتخطيطات الهيكلية، والمعلومات الدلالية أثناء الاصطناع الفني من خلال تطبيق هذه المعاملات على تنشيطات الميزات المعيرة. واستطاع التوجيه الدلالي التأثير على كل من إعادة البناء الهيكلي عالي المستوى وتخليق الأنسجة منخفض المستوى بما أن عملية التكييف تمت في عدة طبقات من مولد SPADE. ونتيجة لذلك، دمجت الأنماط الفنية التي تم إنشاؤها السمات الأسلوبية المكتسبة من مجموعة بيانات WikiArt مع الحفاظ على هياكل الزخارف الثقافية التي تم العثور عليها خلال مرحلة التقسيم.

استُخدمت مجموعة بيانات WikiArt، والتي تضم أعمالاً من 27 فئة فنية مختلفة — مثل عصر النهضة، والانطباعية، والتكعيبية، والتعبيرية، والسريالية، والواقعية، والفن التجريدي — كمورد أساسي لفهم الأساليب الفنية. ومن أجل تعريض النموذج لمجموعة متنوعة من السمات الإبداعية وتعزيز تعميم الأسلوب، تم اختيار صور الأنماط عشوائياً من مختلف الفئات أثناء التدريب. قُسمت مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار مع تمثيل متوازن للفئات الفنية لتقليل الانحياز للأسلوب. ولضمان التمثيل المتوازن لجميع الفئات الفنية الـ 27، استُخدم أخذ العينات الطبقية؛ حيث وُزعت العينات من كل فئة تناسبياً على مجموعات التدريب والتحقق والاختبار مع الحفاظ على التوزيع الأصلي للفئات. استُخدمت وحدة CAFFM لدمج جوانب الأسلوب المستمدة من صور WikiArt مع سمات إعادة البناء التي أنتجها CycleGAN. وبغرض تمكين شبكة التصنيع من نقل الخصائص الفنية مع الحفاظ على البنية الدلالية وحدود الزخارف الثقافية المستمدة من خرائط التجزئة، تم تقديم التمثيلات المدمجة الناتجة كمعلومات شرطية لمولد SPADE. وبفضل تقنية تكييف الأسلوب هذه، تمكن الإطار المقترح من إنتاج أنماط فنية أصلية ثقافياً مع تمثيلات هيكلية وأسلوبية متسقة.

كما يقدم SPADE معلمات تكيفية مكانيًا تعتمد على خريطة التجزئة. ويمكن تعريف هذه المعلمات كما هو موضح في المعادلة 191:

figure-protocol-23

هنا، تمثل γ(S) معامل المقياس المتغير مكانياً، بينما تمثل β(S) معامل الانحياز المتغير مكانياً. ويمكن لهذه المعاملات أن تساعد المولد في إنشاء أنسجة وأنماط مختلفة بناءً على المنطقة الدلالية في الصور. ويمكن تعريف العمل الفني الثقافي النهائي كما هو موضح في المعادلة 20:

 figure-protocol-24

هنا، يمثل GE مولد SPADE، ويمثل XrP النمط المعاد بناؤه، وتمثل SM خريطة التجزئة. يحافظ العمل الفني النهائي على السلامة الهيكلية للزخارف الثقافية مع تعزيز المظهر الفني. تم استخدام دالة فقد مركبة توازن بين دقة التجزئة الدلالية، والحفاظ على الزخارف الثقافية، وجودة إعادة بناء النمط، واتساق الأسلوب الفني لتحسين بنية SegCycle-SPADE المقترحة. ولتحديد هدف التدريب العام، تم استخدام خليط موزون من فقد التجزئة (Lseg)، والفقد التنافسي (Ladv)، وفقد اتساق الدورة (Lcycle)، وفقد إعادة البناء (Lrecon)، وفقد الحفاظ على الزخارف (Lmotif)، وفقد اتساق الأسلوب (Lstyle). تم تعريف دالة الفقد الإجمالية في المعادلة 21:

figure-protocol-25  (21)

لضمان الاتساق الهيكلي بين الزخارف الثقافية المدخلة والمُعاد بناؤها، تم تعيين معامل فقدان الاتساق الدوري عند 10. وللحفاظ على سمات الزخارف دقيقة التفاصيل وتعزيز الدقة البصرية، تم تعيين معامل فقدان إعادة البناء عند 5. ولتسليط الضوء على الحفاظ على الأنماط الهيكلية الأساسية ثقافياً أثناء التركيب الفني، استُخدم معامل قدره 2 لفقدان الحفاظ على الزخارف. ومن أجل تعزيز نقل الأسلوب الفني دون تشويه الهياكل الدلالية للزخارف بشكل مفرط، تم ضبط معامل فقدان اتساق الأسلوب عند 1. وللحفاظ على مساهمة متوازنة بين إنتاج صور واقعية وتقسيم دقيق للزخارف، أُعطيت أوزان متساوية لفقدان التقسيم والفقدان التنافسي. استُخدمت تمثيلات الأسلوب القائمة على السمات من مجموعة بيانات WikiArt لحساب فقدان اتساق الأسلوب. وبشكل خاص، تم التقاط سمات الأسلوب الفني باستخدام ارتباطات مصفوفة Gram التي استُخرجت من خرائط السمات العميقة. استُخدم فرق معيار Frobenius بين مصفوفات Gram لصورة الأسلوب المستهدفة والصورة المولدة لحساب فقدان الأسلوب، كما هو موضح في المعادلة 22:

figure-protocol-26

هنا، تمثل Gl مصفوفة غرام المحسوبة من طبقة الميزات lth، ويشير Igen إلى الصورة الفنية المولدة، بينما يشير Istyle إلى صورة النمط المستهدفة من مجموعة بيانات WikiArt، ويمثل F معيار فروبينيوس. تتيح هذه الصيغة للإطار المقترح الحفاظ على الخصائص الفنية مع الإبقاء على السلامة الهيكلية والدلالية للزخارف الثقافية.

تُستخدم تمثيلات الميزات المدمجة الناتجة عن وحدة CAFFM كمدخلات شرطية لوحدة SPADE، والتي تعمل كعنصر للتوليف الفني في الإطار المقترح. يتكون مولد SPADE من سبع كتل متبقية (residual blocks) من نوع SPADE ببعد ميزات كامن يبلغ 256 قناة، ويقوم بتوليد صور مخرجة بدقة 256 × 256 بكسل. تُستخدم خرائط التقسيم الدلالي (semantic segmentation maps) التي تم الحصول عليها من وحدة SegFormer–CAFFM كمدخلات شرطية عبر طبقات SPADE المتبقية. تُطبق طبقات SPADE قبل دوال التنشيط داخل كل كتلة متبقية، مما يسمح بإجراء تكييف دلالي موجه بالتقسيم. ومن خلال عمليات الرفع العيني (upsampling) والالتفاف (convolutional operations) المتتالية، يتم تحسين تمثيل الميزات الكامن تدريجيًا لتوليد أنماط فنية عالية الدقة مع الحفاظ على الاتساق الدلالي وبنية الزخارف. تُستخدم دوال تنشيط LeakyReLU في جميع أنحاء المولد، وتُطبق دالة تنشيط Tanh عند طبقة المخرجات لإنتاج صور معيرة.

الخوارزمية وسير العمل
يُدمج إطار عمل SegCycle-SPADE كلاً من التجزئة الدلالية، ودمج الميزات، وإعادة بناء الأنماط، وتوليف النمط الفني ضمن خط تدريب موحد. يبدأ سير العمل بالحصول على مجموعة البيانات ومعالجتها مسبقاً، بما في ذلك تغيير حجم الصور، والتقييس، وإزالة الضجيج، وإعداد أقنعة التجزئة. تُعالج الصور التي تمت معالجتها مسبقاً لاحقاً باستخدام شبكة التجزئة SegFormer-B2 لاستخراج تمثيلات الزخارف الدلالية. ثم تُدمج ميزات التجزئة الناتجة مع ميزات إعادة البناء من خلال وحدة CAFFM، مما يتيح التفاعل بين معلومات الزخارف الهيكلية وتمثيلات الميزات الفنية. بعد ذلك، يتم تزويد خرائط الميزات المدمجة بوحدة إعادة البناء CycleGAN، التي تعمل على استعادة هياكل الزخارف الثقافية غير المكتملة مع الحفاظ على الاتساق الدلالي. ثم تُقدم الأنماط المعاد بناؤها إلى مولد SPADE لإجراء توليف فني موجه بالتجزئة، مما يسمح بالتحسين الأسلوبي مع الحفاظ على حدود الزخارف والأصالة الهيكلية. أثناء التدريب، يتم تحسين معاملات النموذج باستخدام دالة الخسارة المركبة الموضحة في المعادلتين 21 و22، والتي توازن بين دقة التجزئة، والحفاظ على الزخارف، وجودة إعادة البناء، واتساق النمط الفني. يتوفر سير عمل تفصيلي للتنفيذ خطوة بخطوة، يشمل تحميل مجموعة البيانات، والمعالجة المسبقة، وتهيئة النموذج، وتكرارات التدريب، وإجراءات التحقق، واختيار نقاط التحقق، والتقييم النهائي، في الملف التكميلي 1 (الخوارزمية 1). تم تنفيذ سير العمل الخوارزمي الكامل باستخدام حجم دفعة قدره 16، ومعدل تعلم 0.0002، و100 حقبة تدريبية. استُخدمت بذرة عشوائية ثابتة بقيمة 42 لتقسيم مجموعة البيانات، وتهيئة النموذج، وجميع تجارب التدريب. طُبقت هذه البذرة باتساق عبر مولدات الأعداد العشوائية في Python وNumPy وPyTorch لضمان إمكانية إعادة إنتاج النتائج. تم تكوين مُحسّن Adam بقيم β₁ = 0.5 وβ₂ = 0.999 وبدون اضمحلال في الأوزان (weight decay = 0). تم اختيار نقاط تحقق النموذج بناءً على أعلى درجة IoU تحقق عليها في مجموعة بيانات التحقق.

تحسين دالة الخسارة
للحفاظ على هياكل الزخارف الثقافية أثناء عملية إعادة البناء والتركيب الفني، يستخدم الإطار المقترح هدف تحسين مركب يجمع بين خسائر التجزئة، والخسارة التنافسية، واتساق الدورة، وإعادة البناء، والحفاظ على الزخارف، واتساق النمط. تتوفر الصيغة الرياضية الكاملة، ومعاملات الوزن، وتعريف خسارة النمط في المعادلتين 21 و22 ضمن القسم الفرعي توليد النمط الفني باستخدام SPADE. يعمل مكون الحفاظ على الزخارف على معاقبة الانحرافات الهيكلية بين مناطق الزخارف المتوقعة وأقنعة التجزئة المرجعية المقابلة لها، مما يشجع على الحفاظ على هياكل الأنماط ذات الأهمية الثقافية طوال عملية إعادة البناء.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم تقييم إطار عمل SegCycle-SPADE المقترح باستخدام مجموعتي بيانات: مجموعة بيانات الزخارف الثقافية لباتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. تحتوي مجموعة بيانات باتيك مياو على صور للتراث الثقافي التقليدي واستُخدمت بشكل أساسي لمهام التقسيم الدلالي وإعادة البناء الهيكلي، بينما تحتوي مجموعة بيانات WikiArt على أنماط فنية متنوعة واستُخدمت لتعلم الأنماط الفنية وتوليدها. تمت معالجة الصور من كلتا المجموعتين من خلال مسار عمل SegCycle-SPADE الكامل، بما في ذلك التقسيم الدلالي، وCAFFM، وإعادة بناء الأنماط، وتوليد النمط الفني القائم على SPADE. وقد مكّن دمج معلومات الزخارف الثقافية وتمثيلات الأنماط الفنية إطار العمل من توليد مخرجات ذات دلالة ثقافية ومتسقة بصرياً.

أُجريت جميع التجارب على محطة عمل تدعم وحدة معالجة الرسوميات (GPU) ومجهزة بمعالج Intel Core i7 ووحدة معالجة رسوميات NVIDIA. وتحديداً، نُفذت التجارب على محطة عمل مجهزة بوحدة معالجة مركزية Intel Core i7 (الجيل الحادي عشر)، ووحدة معالجة رسوميات NVIDIA RTX 3090 بذاكرة فيديو VRAM سعة 24 GB، وذاكرة نظام سعة 32 GB. تم تنفيذ النماذج باستخدام لغة Python 3.8 وإطار عمل PyTorch 1.10 مع تسريع CUDA. وأُجري التدريب باستخدام إعداد وحدة معالجة رسوميات واحدة دون تدريب موزّع. استُخدمت دقة FP32 القياسية في جميع التجارب، ولم يتم تطبيق التدريب بدقة مختلطة. كما استُخدم مُحسِّن Adam مع حجم دفعة (batch size) قدره 16 لمدة 100 حقبة تدريبية. ويلخص الجدول 3 معاملات التنفيذ والبيئة الحسابية المستخدمة في هذه الدراسة.

تتكون البنية المقترحة من أربعة مكونات رئيسية: SegFormer-B2 للتجزئة الدلالية، وCAFFM لدمج الميزات، وCycleGAN لإعادة بناء الزخارف، وSPADE لتخليق النمط الفني. وقد تم تغيير حجم الصور من كلتا مجموعتي البيانات إلى 256 × 256 بكسل قبل التدريب. وقد ضمنت هذه الدقة الموحدة الكفاءة الحسابية مع الحفاظ على التفاصيل الهامة للزخارف، وساهمت في استقرار التدريب التنافسي لكل من وحدتي CycleGAN وSPADE.

تم تقييم أداء الإطار المقترح باستخدام مقاييس التجزئة وتقييم جودة الصور، بما في ذلك دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل تشابه دايس (Dice)، ومؤشر التشابه الهيكلي (SSIM)، ونسبة إشارة الذروة إلى الضوضاء (PSNR)، والمسافة الفريشيه البديلة (FID). كما تم تقييم الأصالة البصرية نوعياً من خلال الفحص البصري للأنماط الثقافية المولدة. وركز التقييم النوعي على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والمظهر الفني مقارنة بالزخارف الثقافية المرجعية. ولم تُستخدم الأصالة البصرية كمقياس تقييم كمي مستقل.

تم إجراء التقييم الكمي للإطار المقترح باستخدام المقاييس التالية.

تم حساب دقة التقسيم باستخدام المعادلة 23:

figure-results-1

هنا، تشير TP و TN و FP و FN إلى الإيجابيات الحقيقية، والسلبيات الحقيقية، والإيجابيات الكاذبة، والسلبيات الكاذبة، على التوالي.

تم حساب تقاطع الاتحاد (IoU) باستخدام المعادلة 24:

 figure-results-2

تم حساب معامل تشابه دايس (Dice) باستخدام المعادلة 25:

figure-results-3

استُخدم مؤشر التشابه الهيكلي (SSIM) لتقييم التشابه الإدراكي للصور، ويُعرَّف باستخدام المعادلة ٢٦33:

figure-results-4  (26)

هنا، تشير μ إلى متوسط الكثافة، وتشير σ إلى التباين، بينما تشير σxy إلى التباين المشترك بين الصور، أما C1 و C2 فهما ثابتان للتثبيت.

تعد نسبة الإشارة إلى الضجيء ذات التربيع العكسي (PSNR) مقياساً يُستخدم عادةً لتقييم جودة الصور المُولّدة، وهي مُعرَّفة في المعادلة 2733:

figure-results-5

هنا، تشير MaxI إلى أقصى قيمة ممكنة لبكسل الصورة، ويمثل MSE متوسط مربع الخطأ بين الصورة الأصلية والصورة المعاد بناؤها.

يمكن حساب FID باستخدام المتوسطات ومصفوفات التباين المشترك كما هو موضح في المعادلة 2833:

figure-results-6   (28)

هنا، تمثل μr القيمة المتوسطة للصورة الحقيقية، وتمثل μg القيمة المتوسطة للصورة المولدة، بينما تمثل Σr و Σg مصفوفة التباين المشترك للصور الحقيقية والمولدة، على التوالي.

لإجراء مقارنة في الأداء، تم تقييم الإطار المقترح مقابل طرق ممثلة شائعة الاستخدام في التقسيم الدلالي، وإعادة بناء الصور، وتوليد الصور الفنية. تم إدراج U-Net وDeepLabV3+ كخطوط أساس للتقسيم، بينما أُدرج Pix2Pix وCycleGAN كخطوط أساس لإعادة البناء. واستُخدم StyleGAN وAttentionGAN كطرق ممثلة لتوليد الصور الفنية. أُجريت هذه المقارنات لتقييم فعالية SegCycle-SPADE في الحفاظ على معلومات الأنماط الهيكلية مع تعزيز الجودة الفنية في الوقت ذاته.

كُررت كل تجربة خمس مرات لتقييم استقرار الأداء وقابلية التكرار. واستُخدمت بذرة عشوائية ثابتة بقيمة 42 لتقسيم مجموعة البيانات لضمان اتساق المجموعات الفرعية للتدريب والتحقق والاختبار عبر جميع التجارب. تم تسجيل النتائج في صورة المتوسط ± الانحراف المعياري. وتشير قيم الانحراف المعياري المنخفضة الملحوظة في كل من Accuracy وIoU وDice وSSIM وPSNR وFID إلى أن الإطار المقترح حقق أداءً مستقراً عبر دورات التجريب المتكررة. تم تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة، واعتُبرت الفروق ذات دلالة إحصائية عندما كانت p < 0.05. ونظراً لتقييم جميع النماذج على نفس تقسيمات مجموعة البيانات، فقد تم الحصول على قياسات أداء مقترنة عبر الدورات المتكررة، مما يبرر استخدام اختبارات t المقترنة. وللتحكم في معدل الخطأ العائلي المرتبط بالمقارنات الزوجية المتعددة، تم تطبيق تصحيح بونفروني (Bonferroni correction)، وحددت الدلالة الإحصائية باستخدام عتبة معدلة قدرها α/n، حيث ترمز n إلى عدد المقارنات الزوجية.

تدعم النتائج التجريبية بقوة فعالية إطار عمل SegCycle-SPADE المقترح. ويبرهن أداء التجزئة المتفوق الذي حققه SegFormer-B2 على قدرته على تحديد وحدات الزخرفة ذات الأهمية الثقافية والحفاظ على حدودها بدقة. كما تشير التحسينات في درجات IoU وDice إلى الحفاظ الفعال على الهياكل الدلالية للزخارف طوال مراحل معالجة البيانات. وقد نجح دمج CycleGAN وSPADE في إعادة بناء هياكل الزخارف غير المكتملة مع الحفاظ على التفاصيل البصرية الدقيقة، وهو ما انعكس في تحسن قيم SSIM وPSNR. علاوة على ذلك، تشير درجات FID المنخفضة إلى أن الأنماط الفنية المولدة تظهر تشابهاً أكبر مع الصور الثقافية والفنية الأصيلة، مما يشير إلى تحسن في التماسك الأسلوبي والواقعية البصرية.

ساهم نموذج CAFFM بشكل كبير في هذه التحسينات من خلال تسهيل التفاعل الفعال بين المعلومات الهيكلية المستمدة من التقسيم وتمثيلات الأسلوب التوليدية. ومن خلال دمج الميزات القائم على الانتباه المتقاطع (cross-attention)، عزز CAFFM كلاً من الدقة الهيكلية والأصالة الفنية مع الحفاظ على العلاقات طويلة المدى بين الزخارف الثقافية.

الشكل 6 يوضح مقارنة دقة التجزئة بين إطار عمل SegCycle-SPADE المقترح والطرق الحالية على مجموعتي بيانات Miao Batik وWikiArt. حققت نهج التجزئة التقليدية مثل U-Net وDeepLabV3+ أداءً تنافسياً نظراً لقدرتها على تعلم التمثيلات المكانية. ومع ذلك، أظهر كل من Pix2Pix وCycleGAN دقة تجزئة أقل لأنهما لم يتم تصميمهما خصيصاً لمهام التجزئة. حقق إطار عمل SegCycle-SPADE المقترح أعلى دقة تجزئة في كلتا مجموعتي البيانات بفضل دمج SegFormer-B2 وتعزيز الميزات القائم على CAFFM.

figure-results-7
الشكل 6. مقارنة دقة التجزئة عبر طرق مختلفة. مقارنة لدقة التجزئة التي تم الحصول عليها باستخدام U-Net و DeepLabV3+ و Pix2Pix و CycleGAN وإطار عمل SegCycle-SPADE المقترح على مجموعتي بيانات Miao Batik و WikiArt. يتم عرض النتائج كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تمثل أشرطة الخطأ انحرافاً معيارياً واحداً. تشير القيم الأعلى إلى تحسن في أداء التجزئة. حقق إطار عمل SegCycle-SPADE المقترح أعلى دقة تجزئة في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 7 يعرض مقارنة IoU بين الطرق التي تم تقييمها. حققت بنيتا U-Net وDeepLabV3+ أداءً قوياً في التداخل بسبب بنيتهما الموجهة نحو التجزئة. وفي المقابل، أنتجت Pix2Pix وCycleGAN قيم IoU أقل لأن هدفهما الأساسي هو ترجمة الصور وليس التجزئة الدلالية. حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم IoU في كلا مجموعتي البيانات، مما يشير إلى تحسن في التحديد الموضعي والحفاظ على مناطق الزخارف الثقافية.

figure-results-8
الشكل 7. مقارنة درجات تقاطع الاتحاد (IoU) لتجزئة الزخارف الثقافية. مقارنة لأداء IoU بين طرق التجزئة المختلفة في مجموعتي بيانات Miao Batik وWikiArt. عُرضت النتائج كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تشير أشرطة الخطأ إلى انحراف معياري واحد. تشير قيم IoU الأعلى إلى تحسن التداخل بين مناطق الزخارف المتوقعة والمرجعية والحفاظ بشكل أفضل على حدود الزخارف. حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات IoU في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 8 يعرض مقارنة معامل تشابه دايس (Dice Similarity Coefficient). يقيس معامل دايس مدى التداخل بين أقنعة التجزئة المتوقعة ومناطق الزخارف المرجعية (ground-truth). حققت منهجيات التجزئة التقليدية درجات دايس مرتفعة نسبيًا نظرًا لفعاليتها في تعلم الهياكل المكانية. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات دايس في كلتا مجموعتي البيانات، مما يثبت تحسنًا في اتساق التجزئة والحفاظ على الزخارف.

figure-results-9
الشكل 8. مقارنة لمعامل Dice لتقسيم الزخارف الثقافية. مقارنة لقيم معامل Dice التي تم الحصول عليها باستخدام مناهج تقسيم مختلفة على مجموعتي بيانات Miao Batik وWikiArt. يقيم معامل Dice التداخل بين أقنعة التقسيم المتوقعة والأقنعة المرجعية، حيث تشير القيم الأعلى إلى تحسن في أداء التقسيم وتحديد منطقة الزخرفة. حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم لمعامل Dice عبر مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 9 يعرض مقارنة SSIM بين الأنماط الثقافية المعاد بناؤها. حققت الطرق القائمة على شبكات GAN مثل Pix2Pix وCycleGAN وStyleGAN قيم SSIM أعلى من طرق التجزئة التقليدية لأنها صُممت لتوليد الصور. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم SSIM في كلتا مجموعتي البيانات، مما يشير إلى تفوق في الحفاظ على التفاصيل الهيكلية والاتساق الفني.figure-results-10

الشكل 9مقارنة مؤشر التشابه الهيكلي (SSIM). مقارنة لقيم مؤشر التشابه الهيكلي (SSIM) التي تم الحصول عليها باستخدام طرق إعادة بناء مختلفة على مجموعتي بيانات Miao Batik وWikiArt. النتائج معروضة كمتوسط ± الانحراف المعياري (SD) من خمس تجارب مستقلة (n = 5). تشير أشرطة الخطأ إلى انحراف معياري واحد. تشير قيم SSIM الأعلى إلى تشابه هيكلي أكبر بين الأنماط المُعاد بناؤها والأنماط المرجعية. حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات SSIM في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تم استخدام مسافة فريديهيلد (FID) لتقييم مدى واقعية الأنماط الفنية المولدة وتشابه توزيعها. وأُجري حساب FID باستخدام شبكة Inception-v3 مدربة مسبقاً، مع استخراج متجهات الميزات من طبقة pool3، مما نتج عنه تمثيلات ميزات ذات 2048 بُعداً. وقبل عملية استخراج الميزات، تم تغيير حجم الصور المولدة والمرجعية إلى 299 × 299 بكسل باستخدام الاستكمال الخطي الثنائي (bilinear interpolation) ومعايرتها وفقاً لبروتوكول المعالجة المسبقة القياسي لشبكة Inception-v3. وتم حساب FID باستخدام توزيعات الميزات المستخرجة من مجموعة بيانات الاختبار المستقلة. كما تم تقدير إحصائيات المتوسط والتباين المشترك من تضمينات الميزات واستخدامها ضمن صيغة FID القياسية.

كما هو موضح في الجدول 4، أنتجت مناهج توليد الصور التقليدية مثل Pix2Pix و CycleGAN درجات FID مرتفعة نسبيًا بسبب افتقارها إلى التوجيه الهيكلي الصريح. وحقق StyleGAN و AttentionGAN درجات FID أقل بفضل قدرات تعلم الميزات المحسنة. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أدنى درجات FID في كلتا مجموعتي البيانات، مما يدل على تفوقه في واقعية الصور، والاتساق الأسلوبي، والحفاظ على الزخارف الثقافية.

الطريقةمجموعة بيانات Miao Batik (FID)مجموعة بيانات WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (المقترحة)28.531.2

الجدول 4: نتائج مسافة فريدشيه للبداية (FID) لإعادة بناء الأنماط الثقافية.مقارنة لدرجات مسافة فريدشيه للبداية (FID) التي تم الحصول عليها بواسطة إطار عمل SegCycle-SPADE المقترح والنماذج التوليدية المرجعية على مجموعتي بيانات Miao Batik وWikiArt. تشير قيم FID المنخفضة إلى تشابه أكبر بين توزيعات ميزات الصور المولدة والصور الحقيقية، وبالتالي تعكس واقعية بصرية محسنة للأنماط الثقافية المعاد بناؤها.

تقارن الشكل 10 جودة إعادة البناء التي حققتها طرق مختلفة. وقد حُسبت جودة إعادة البناء (%) عن طريق تحويل مؤشر التشابه الهيكلي (SSIM) بين الصورة المعاد بناؤها والصورة المرجعية المقابلة إلى مقياس مئوي (SSIM × 100). وتشير النسب المئوية الأعلى إلى دقة هيكلية أكبر وتشابه بصري أكثر مع الزخرفة الثقافية الأصلية. وقد حققت النماذج التوليدية التقليدية مثل Pix2Pix وCycleGAN أداءً متوسطاً في إعادة البناء. بينما حققت البنى الأكثر تقدماً، بما في ذلك StyleGAN وAttentionGAN، جودة إعادة بناء محسنة بفضل قدراتها المعززة في تعلم الميزات. ومع ذلك، حقق إطار عمل SegCycle-SPADE المقترح أعلى جودة لإعادة البناء نظراً لتكامله مع توجيه التقسيم الدلالي، ودمج ميزات الانتباه المتقاطع، وتعلم إعادة البناء، والتركيب الفني.

figure-results-11
الشكل 10. مقارنة جودة إعادة بناء الأنماط. مقارنة لجودة إعادة البناء التي تم تحقيقها باستخدام Pix2Pix وCycleGAN وStyleGAN وAttentionGAN وإطار عمل SegCycle-SPADE المقترح على مجموعتي بيانات Miao Batik وWikiArt. يتم عرض النتائج كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تشير أشرطة الخطأ إلى انحراف معياري واحد. تشير القيم الأعلى إلى تحسن في الحفاظ على التفاصيل الهيكلية، والاتساق الدلالي، والدقة البصرية. حقق إطار عمل SegCycle-SPADE المقترح أعلى درجات جودة إعادة البناء في كلتا مجموعتي البيانات. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

استُخدمت نسبة إشارة الذروة إلى الضوضاء (PSNR) لتقييم دقة إعادة البناء من خلال قياس التشابه على مستوى البكسل بين الصور المعاد بناؤها والصور المرجعية المقابلة. حُسبت قيمة PSNR بين كل صورة معاد بناؤها وصورة باتيك مياو (Miao Batik) الأصلية المقابلة لها والتي استُخدمت كمرجع للحقيقة الأرضية (ground-truth). وتشير قيم PSNR الأعلى إلى انخفاض خطأ إعادة البناء. وكما هو موضح في الجدول 5، حقق كل من Pix2Pix وCycleGAN قيم PSNR متوسطة لأنها أعادت بناء الأنماط دون توجيه هيكلي صريح. بينما حقق StyleGAN وAttentionGAN قيم PSNR أعلى من خلال تعلم ميزات أكثر عمقاً. وقد حقق إطار عمل SegCycle-SPADE المقترح أعلى قيم PSNR في كلتا مجموعتي البيانات، مما يثبت دقة فائقة في إعادة البناء والحفاظ على هياكل الزخارف الثقافية.

الطريقةمجموعة بيانات Miao Batik
(PSNR, dB)
مجموعة بيانات WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (المقترحة)32.431.2

الجدول 5: نتائج نسبة ذروة الإشارة إلى الضوضاء (PSNR) لإعادة بناء الأنماط الثقافية.مقارنة لقيم نسبة ذروة الإشارة إلى الضوضاء (PSNR) التي تم الحصول عليها بواسطة إطار عمل SegCycle-SPADE المقترح والطرق المرجعية على مجموعات بيانات Miao Batik وWikiArt. تشير قيم PSNR الأعلى إلى تحسن في دقة إعادة البناء وتقليل التشوه بالنسبة للصور المرجعية المقابلة.

الشكل 11 يوضح سلوك التقارب لإطار عمل SegCycle-SPADE المقترح أثناء التدريب. وتمثل منحنيات الخسارة متوسط خسائر التدريب التي تم حسابها عبر خمس عمليات تدريب مستقلة. وللحد من التباين العشوائي وتقديم تمثيل أكثر قوة لتقارب التدريب، تم حساب متوسط قيم الخسارة عند كل حقبة تدريبية عبر جميع العمليات. وخلال حقبات التدريب الأولية، كانت قيم الخسارة مرتفعة نسبياً لأن النموذج كان لا يزال في مرحلة تعلم تمثيلات السمات من البيانات المدخلة. ومع تقدم التدريب، تناقصت جميع مكونات الخسارة تدريجياً واستقرت، مما يشير إلى نجاح تحسين أهداف التجزئة وإعادة البناء والتوليف الفني. ويظهر سلوك التقارب الملاحظ فعالية واستقرار وقابلية تكرار إطار العمل المقترح أثناء التدريب.

figure-results-12
الشكل 11. تقارب التدريب لإطار عمل SegCycle-SPADE المقترح. منحنيات خسارة التدريب لإطار عمل SegCycle-SPADE المقترح على مدى 100 حقبة تدريبية، بمتوسط خمس عمليات تدريب مستقلة (n = 5). يوضح الشكل تطور إجمالي الخسارة (LTotal)، وخسارة التقسيم (LSeg)، وخسارة المولد (LG)، وخسارة المميز (LD) أثناء التدريب. يشير الانخفاض التدريجي والاستقرار اللاحق لجميع مكونات الخسارة إلى نجاح التقارب والتحسين المستقر لإطار العمل المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

دراسة الاستئصال
لتقييم مساهمة كل مكون ضمن إطار عمل SegCycle-SPADE المقترح، أُجريت دراسة استئصال باستخدام تكوينات متعددة ومضبوطة للنموذج. تم تلخيص النتائج في الجدولين 6 و7.

تكوين النموذجدقة التجزئة (%)تقاطع الاتحاد (IoU)مؤشر التشابه الهيكلي (SSIM)
نموذج SegFormer فقط87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (المقترح)93.80.860.93

الجدول 6: دراسة الاستئصال لمكونات SegCycle-SPADE. مقارنة الأداء لتكوينات النموذج التي تم تحسينها تدريجياً لتقييم مساهمة المكونات الفردية للإطار العملي. تبحث الدراسة في تأثيرات التقسيم الدلالي، ووحدة دمج الميزات الثقافية عبر الانتباه المتقاطع (CAFFM)، وإعادة البناء القائمة على CycleGAN، والتوليف الفني القائم على SPADE على دقة التقسيم، وتقاطع الاتحاد (IoU)، ومؤشر التشابه الهيكلي (SSIM). تشير القيم الأعلى إلى تحسن في تقسيم الزخارف، وجودة إعادة البناء، والحفاظ على الهيكل.

متغيرتقاطع الاتحاد (%)معامل دايس (%)مؤشر التشابه الهيكلي (SSIM)نسبة الإشارة إلى الضجيج الذروية (ديسيبل)كاشف التأين باللهب ↓
SegFormer فقط84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (النموذج الكامل)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

الجدول 7: تحليل مساهمة المكونات في إطار عمل SegCycle-SPADE المقترح. مقارنة الأداء بين متغيرات إطار العمل الفردية المستخدمة لتقييم مساهمة كل من CAFFM وCycleGAN وSPADE وبنية SegCycle-SPADE الكاملة. تم تسجيل النتائج باستخدام تقاطع الاتحاد (IoU)، ومعامل Dice، ومؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضجيج (PSNR)، ومسافة فريدش إنسبشن (FID). تشير القيم الأعلى لـ IoU وDice وSSIM وPSNR إلى تحسن في جودة التقسيم وإعادة البناء، بينما تشير قيم FID الأقل إلى واقعية بصرية أكبر للأنماط الثقافية المولدة.

الجدول 6 يقيم المساهمة التراكمية لمكونات الإطار الرئيسية باستخدام أربعة تكوينات: (i) SegFormer فقط، (ii) SegFormer + CAFFM، (iii) SegFormer + CAFFM + CycleGAN، و (iv) SegFormer + CAFFM + CycleGAN + SPADE (الإطار المقترح). حقق نموذج SegFormer المرجعي دقة تجزئة بلغت 87.3%، ودرجة IoU بلغت 0.76، وقيمة SSIM بلغت 0.82. وقد أدى دمج وحدة CAFFM إلى تحسين الأداء عبر جميع مقاييس التقييم، حيث ارتفعت دقة التجزئة إلى 89.6%، وIoU إلى 0.79، وSSIM إلى 0.86. كما أدت إضافة CycleGAN إلى تعزيز قدرة إعادة البناء الهيكلي بشكل أكبر، مما أدى إلى تحقيق IoU بلغت 0.82 وقيمة SSIM بلغت 0.89. وحقق إطار SegCycle-SPADE الكامل أفضل أداء إجمالي، بدقة تجزئة بلغت 93.8%، وIoU بلغت 0.86، وقيمة SSIM بلغت 0.93. وتثبت هذه النتائج أن كل مكون يساهم بشكل تدريجي في تحسين دقة التجزئة، والحفاظ على البنية، وجودة إعادة بناء الصور.

يستقصي الجدول 7 بشكل أكبر مساهمة المكونات الفردية لإطار العمل باستخدام خمسة متغيرات للنموذج: (i) SegFormer فقط، و(ii) SegFormer + CycleGAN، و(iii) SegFormer + SPADE، و(iv) SegFormer + CAFFM، و(v) النموذج الكامل الذي يدمج SegFormer وCAFFM وCycleGAN وSPADE وخسارة الحفاظ على النمط (motif-preservation loss). وقد تم تقييم الأداء باستخدام مقاييس IoU، ومعامل Dice، وSSIM، وPSNR، وFID.

حققت التهيئة الأساسية المعتمدة على SegFormer وحده تقاطع اتحاد (IoU) بنسبة 84.2%، ومعامل Dice بنسبة 88.5%، وقيمة SSIM بلغت 0.82، وPSNR بمقدار 24.8 dB، ودرجة FID بلغت 31.8. وقد أدىت إضافة CycleGAN إلى تحسين جودة إعادة البناء وخفض درجة FID إلى 27.5، مما يشير إلى تعزيز واقعية الصورة. كما أدى دمج SPADE إلى تحسين التشابه الهيكلي وجودة الصورة بشكل أكبر، مما نتج عنه قيمة SSIM بلغت 0.88 ودرجة FID بلغت 23.4. وأدى إدراج وحدة CAFFM المقترحة إلى تحقيق مكاسب كبيرة في جميع المقاييس، حيث ارتفع IoU إلى 90.0%، ومعامل Dice إلى 93.1%، وSSIM إلى 0.90، وPSNR إلى 29.6 dB، بينما انخفضت درجة FID إلى 20.3. وحقق النموذج الكامل، الذي يدمج بالإضافة إلى ذلك فقدان الحفاظ على الزخارف (motif-preservation loss)، أفضل أداء إجمالي بتقاطع اتحاد (IoU) بنسبة 93.0%، ومعامل Dice بنسبة 95.4%، وقيمة SSIM بلغت 0.92، وPSNR بمقدار 31.2 dB، ودرجة FID بلغت 17.6.

يقدم الجدول 8 نظرة عامة مقارنة لنهج التعلم العميق (DL) التمثيلية المستخدمة في إعادة بناء أنماط التراث الثقافي والحفاظ عليها. توفر الطرق التقليدية القائمة على الشبكات العصبية التلافيفية (CNN) تعلمًا فعالًا للميزات المحلية وأداءً جيدًا في التجزئة، ولكنها غالبًا ما تواجه صعوبة في الحفاظ على هياكل الزخارف المعقدة بسبب محدودية نمذجة الاعتمادات طويلة المدى. أما النهج القائمة على شبكات الخصومة التوليدية (GAN) فتحسن من قدرات تخليق الصور ونقل الأسلوب؛ ومع ذلك، قد تعاني من عدم اتساق دلالي وفقدان في التفاصيل الهيكلية الدقيقة. وتعزز الطرق القائمة على المحولات (Transformer) الفهم السياقي العالمي ولكنها تفتقر عادةً إلى قدرات إعادة البناء التوليدية، بينما توفر الطرق القائمة على الانتشار (diffusion) واقعية بصرية عالية على حساب زيادة التعقيد الحسابي. وتعالج نهج المحولات-GAN الهجينة هذه القيود جزئيًا من خلال الجمع بين آليات استخراج الميزات وتوليد الصور. وفي المقابل، يدمج إطار عمل SegCycle-SPADE المقترح التجزئة القائمة على المحولات، ودمج الميزات عبر الانتباه المتقاطع، وإعادة البناء التوليدية، والتخليق الفني الموجه بالتجزئة ضمن بنية موحدة، مما يؤدي إلى تحسين الدقة الهيكلية، والاتساق الدلالي، والحفاظ على الزخارف الثقافية. وقد لُخصت هذه المقارنة في الجدول 8.

النهجالمنهجية الأساسيةنقاط القوةالقيودالأهمية للتراث الثقافي
الطرق القائمة على CNN (على سبيل المثال، U-Net، DeepLabV3+)استخلاص الميزات التلافيفية والتقسيم الدلاليتعلم فعال للميزات المحلية وتقسيم دقيقنمذجة محدودة للاعتمادات طويلة المدى؛ صعوبة في الحفاظ على هياكل الزخارف المعقدةمناسبة لتقسيم الزخارف ولكنها أقل فعالية في إعادة البناء الفني
الطرق القائمة على GAN (على سبيل المثال، Pix2Pix، CycleGAN)توليد الصور التنافسي وترجمة الصور إلى صورتخليق صور عالية الجودة ونقل النمطعدم استقرار التدريب؛ عدم اتساق دلالي؛ فقدان محتمل للتفاصيل الهيكلية الدقيقةمفيدة لترميم الأنماط ولكنها قد لا تحافظ على الزخارف الثقافية بدقة
الطرق القائمة على Transformerالانتباه الذاتي ونمذجة السياق العالميتلقط الاعتمادات طويلة المدى والعلاقات البصرية المعقدةتكلفة حوسبية عالية؛ تتطلب مجموعات بيانات تدريب ضخمةفعالة لتحليل الأنماط المعقدة ولكن قدرتها التوليدية محدودة عند استخدامها بمفردها
الطرق القائمة على الانتشار (Diffusion)توليد الصور القائم على إزالة الضجيج التكراريواقعية بصرية عالية وتنوع في الصورسرعة استدلال بطيئة؛ متطلبات حوسبية عالية؛ تحكم هيكلي محدودواعدة لتوليد صور التراث ولكنها مكثفة حوسبياً
طرق Transformer-GAN الهجينةالجمع بين استخلاص الميزات القائم على Transformer والتوليد القائم على GANتحسين تمثيل الميزات العالمية وجودة الصورغالباً ما تفتقر إلى توجيه دلالي صريح للحفاظ على الزخارفتعزز جودة التوليد ولكنها ليست مصممة خصيصاً لزخارف التراث الثقافي
نموذج SegCycle-SPADE المقترحSegFormer + CAFFM + CycleGAN + SPADEتقسيم قائم على Transformer، دمج ميزات موجه بالانتباه، اتساق دلالي، الحفاظ على الزخارف، وإعادة بناء فني قابلة للتحكمتعقيد حوسبي أعلى من النهج القائمة على CNN المستقلةمصمم خصيصاً لإعادة بناء وحفظ أنماط التراث الثقافي مع تحسين الدقة الهيكلية والاتساق الدلالي

الجدول 8: مقارنة بين مناهج التعلم العميق التمثيلية لإعادة بناء أنماط التراث الثقافي والحفاظ عليها.مقارنة نوعية لمناهج التعلم العميق التمثيلية المستخدمة في تقسيم الصور، وإعادة بناء الأنماط، وتوليد الأنماط، والحفاظ على التراث الثقافي. يلخص الجدول المنهجية الأساسية، ونقاط القوة، والقيود، وقابلية تطبيق كل منهج، ويسلط الضوء على كيفية دمج إطار عمل SegCycle-SPADE المقترح بين التقسيم الدلالي، ودمج الميزات، وإعادة البناء، وتوليد الأنماط لمعالجة التحديات المتعلقة بالحفاظ الهيكلي والاتساق الدلالي في أنماط التراث الثقافي.

تثبت التحسينات الملحوظة أن وحدة CAFFM تعزز بفعالية التفاعل بين السمات الهيكلية المستمدة من التجزئة وتمثيلات النمط الفني من خلال دمج السمات القائم على الانتباه المتقاطع. علاوة على ذلك، تساهم خسارة الحفاظ على الزخارف في الحفاظ على هياكل الزخارف ذات الأهمية الثقافية أثناء عملية إعادة البناء والتركيب الفني، مما يؤدي إلى تحسين اتساق التجزئة، والدقة الهيكلية، والواقعية البصرية. وبشكل جماعي، تؤكد نتائج دراسة الاستئصال أن دمج كل من SegFormer-B2 وCAFFM وCycleGAN وSPADE وخسارة الحفاظ على الزخارف هو المسؤول عن الأداء المتفوق لإطار عمل SegCycle-SPADE المقترح.

توافر البيانات:
إن مجموعة بيانات WikiArt المستخدمة في تعلم الأسلوب الفني متاحة للعموم من خلال مستودع Kaggle WikiArt ‏(https://www.kaggle.com/datasets/steubk/wikiart). كما أن مجموعة بيانات Miao Batik المستخدمة في هذه الدراسة متاحة للعموم عبر Zenodo ‏(https://doi.org/10.5281/zenodo.20807658). وتتوفر أيضاً مجموعات البيانات المعالجة، وأقنعة التجزئة، وأوزان النموذج مسبقة التدريب، والمخرجات المولدة، وملفات تنفيذ لغة Python المرتبطة بإطار عمل SegCycle-SPADE المقترح من خلال مستودع Zenodo نفسه.

الملف التكميلي:
الملف التكميلي 1. الخوارزمية 1: سير عمل تنفيذ إطار عمل SegCycle-SPADE المقترح. كود زائف تفصيلي يصف خط أنابيب التنفيذ الكامل لإطار عمل SegCycle-SPADE المقترح، بما في ذلك تحميل مجموعة البيانات، والمعالجة المسبقة، والتقسيم الدلالي باستخدام SegFormer-B2، ودمج الميزات باستخدام وحدة دمج الميزات الثقافية عبر الانتباه (CAFFM)، وإعادة بناء الزخارف الثقافية باستخدام CycleGAN، وتخليق الأسلوب الفني باستخدام SPADE، وتدريب النموذج، والتحقق من الصحة، واختيار نقاط الفحص، والتقييم النهائي للأداء. يرجى النقر هنا لتنزيل هذا الملف.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لقد حظي حفظ وإعادة البناء الرقمي لأنماط التراث الثقافي غير المادي (ICH) باهتمام متزايد في السنوات الأخيرة بسبب الفقدان التدريجي للحرف التقليدية. وقد حاولت الدراسات السابقة معالجة فقدان التراث الثقافي من خلال تقنيات معالجة الصور القائمة على التعلم العميق (DL). فعلى سبيل المثال، اقترح Quan et al.32 إطار عمل للحفاظ على التراث الثقافي يعتمد على الرسوم البيانية للمعرفة والتعلم العميق لثقافة الباتيك لشعب مياو في غويتشو. ورغم أن الدراسة ركزت على إعادة البناء الرقمي للأنماط الثقافية، إلا أن منهجيتها اعتمدت بشكل أساسي على تمثيلات الرسوم البيانية للمعرفة. وبالمثل، اقترح Fu and Razmjooy16 إطار عمل يعتمد على شبكة هرم الميزات (FPN) لتحسين وترميم صور التراث الثقافي. وبالرغم من أن هذه الطريقة وفرت استخلاصاً فعالاً للميزات لتحسين الصور، إلا أنها لم تدمج توجيهاً لتقسيم الصور أو آليات إعادة بناء توليدية للأنماط الثقافية غير المكتملة. وفي المقابل، يجمع إطار عمل SegCycle-SPADE المقترح بين مكونات متعددة من التعلم العميق للتغلب على هذه التحديات. أولاً، يتم استخدام التقسيم الدلالي باستخدام نموذج SegFormer للتحديد الدقيق لمناطق الزخارف داخل أنماط التراث الثقافي. بعد ذلك، تعمل وحدة تعزيز الميزات القائمة على CAFFM على تحسين تمثيلات الميزات لهياكل الزخارف دقيقة التفاصيل. ثم تُستخدم وحدة إعادة بناء CycleGAN لإعادة بناء المناطق المفقودة أو غير المكتملة داخل الأنماط الثقافية من خلال التعلم التنافسي. وأخيراً، تقوم وحدة SPADE بإجراء تحسين أسلوبي مع الحفاظ على المحاذاة الهيكلية مع خرائط التقسيم. تقدم الطرق الحالية القائمة على CNN- وGAN- وtransformer- وdiffusion17,19,20,21,22,23,24,25,30,34 مزايا فريدة؛ ومع ذلك، فإنها تظهر أيضاً قيوداً في الحفاظ على الاتساق الدلالي، أو الحفاظ على الميزات الهيكلية، أو تحقيق الكفاءة الحسابية، كما هو ملخص في الجدول 8. وتجمع بنية SegCycle-SPADE المقترحة بين نقاط القوة في التقسيم القائم على SegFormer، ودمج الميزات عبر الانتباه المتبادل، وإعادة بناء CycleGAN، والتوليف الموجه بـ SPADE مع معالجة هذه القيود. وبالتالي، يحقق إطار العمل جودة محسنة في إعادة البناء وتعزيزاً في الحفاظ على الزخارف ذات الأهمية الثقافية.

على الرغم من أدائه المشجع، لا يزال إطار عمل SegCycle-SPADE المقترح يواجه عدة قيود. أولاً، أُجري التقييم باستخدام مجموعتي بيانات Miao Batik وWikiArt فقط، مما قد يحد من إمكانية تعميم إطار العمل على مجالات أخرى من التراث الثقافي. ثانياً، قد يكون النشر على المنصات ذات الموارد المحدودة أمراً صعباً لأن دمج SegFormer وCAFFM وCycleGAN وSPADE يزيد من التعقيد الحسابي ومتطلبات الذاكرة. ثالثاً، يعتمد أداء التجزئة بشكل كبير على جودة واتساق تعليقات الزخارف التوضيحية، وقد يؤثر انحياز التعليق التوضيحي على الحفاظ على الهياكل ذات الأهمية الثقافية. وأخيراً، ونظراً لتقييم إطار العمل باستخدام مجموعتي بيانات فقط، قد تكون هناك حاجة إلى بيانات تدريب إضافية وتكيفات محددة لكل مجال لضمان القابلية للتطبيق عبر مجموعات التراث الثقافي المتنوعة. لذا، ينبغي أن تستكشف الدراسات المستقبلية استراتيجيات تدريب أكثر قوة، وبنيات خفيفة الوزن، وإجراءات تحسين للتعليقات التوضيحية، وتقييمات عبر المجالات باستخدام مجموعات بيانات إضافية للتراث الثقافي.

سيكون التركيز الرئيسي للأبحاث المستقبلية على مدى قابلية إطار عمل SegCycle-SPADE للتوسع ليشمل مجموعات بيانات أكبر وأكثر تنوعاً من التراث الثقافي. كما سيتم إجراء تقييم عبر ثقافي للزخارف التراثية من مناطق مختلفة وتقاليد فنية متنوعة لتحسين تعميم النموذج وقدرته على التكيف الثقافي. علاوة على ذلك، قد توفر التوسعات متعددة الوسائط التي تدمج الأوصاف النصية، والسجلات التاريخية، والبيانات الوصفية الثقافية توجيهاً دلالياً أقوى أثناء عملية إعادة البناء. ويمكن أيضاً توسيع إطار العمل لدعم إعادة بناء التراث الثقافي ثلاثي الأبعاد من خلال دمج إعادة البناء القائمة على الصور مع تقنيات النمذجة ثلاثية الأبعاد. بالإضافة إلى ذلك، سيتم استكشاف إمكانية النشر في الأرشيفات الرقمية، والمتاحف، والمعارض الافتراضية، ومنصات الحفاظ على التراث الثقافي لتسهيل التطبيقات العملية لصون التراث وتوثيقه بمساعدة الذكاء الاصطناعي. ولتحسين القابلية للتفسير والأصالة الثقافية بشكل أكبر، ستعمل الأبحاث المستقبلية على دراسة دمج الرسوم البيانية للمعرفة الثقافية، والتوثيق الإثنوغرافي، والبيانات الوصفية التاريخية، وقواعد المعرفة التي يشرف عليها الخبراء لتمكين تحليل وإعادة بناء الزخارف بناءً على معرفة ثقافية مستنيرة32.

يجب مراعاة عدة اعتبارات عملية عند تنفيذ إطار عمل SegCycle-SPADE المقترح. فخلال تدريب CycleGAN، قد يحدث تقارب تنافسي غير مستقر إذا أصبح فقد المولد والمميز غير متوازن بشكل كبير. وفي مثل هذه الحالات، قد يؤدي تقليل معدل التعلم، أو زيادة وزن فقد الاتساق الدوري، أو مراقبة هيمنة المميز إلى تحسين استقرار التدريب. كما قد يحدث انهيار النمط (Mode collapse) عندما ينتج المولد مخرجات متشابهة بصرياً بشكل متكرر؛ ويمكن التخفيف من هذه المشكلة من خلال التدريب التنافسي المتوازن، واستخدام ذاكرة التخزين المؤقت للإعادة (replay-buffer)، والمراقبة الدقيقة لاتجاهات فقد المولد والمميز. وقد تظهر أيضاً إخفاقات في التقسيم عندما تظهر الزخارف الثقافية أنسجة معقدة، أو تبايناً منخفضاً، أو حدوداً غامضة. ولمعالجة هذه المشكلة، يجب التحقق من جودة الصور قبل التدريب، وفحص أقنعة التقسيم بصرياً لضمان اتساق التوصيفات. ومن المهم أيضاً الحفاظ على دقة الإدخال وإعدادات التسوية الموصى بها لتحقيق أداء موثوق لنموذج SegFormer. وقد ينتج عدم استقرار التدريب أيضاً عن إعدادات غير مناسبة لمعدل التعلم، أو عدم كفاية بيانات التدريب، أو تباينات عددية متعلقة بالأجهزة. ولتحسين إمكانية إعادة الإنتاج، يجب استخدام بذور عشوائية ثابتة لعمليات NumPy وPyTorch وCUDA وعمليات خلط مجموعة البيانات. علاوة على ذلك، يجب الحفاظ على نفس مسار المعالجة المسبقة، وتقسيمات مجموعة البيانات، والمعلمات الفائقة للنموذج، والبيئة البرمجية عبر جميع عمليات التشغيل التجريبية. كما يُنصح بحفظ نقاط التحقق (checkpoint) بشكل دوري ومراقبة فقد التحقق لمنع تدهور الأداء وتسهيل الاستعادة من جلسات التدريب التي تعرضت للمقاطعة.

يساهم العمل المقترح في التطوير النظري لأطر إعادة بناء التراث الثقافي القائمة على الذكاء الاصطناعي. تعامل مناهج ترميم الصور التقليدية عمومًا عمليات تقسيم الصور، وإعادة البناء، وتوليد النمط كعمليات مستقلة17,19,20,30. وفي المقابل، تقترح هذه الدراسة إطار عمل يدمج هذه العمليات من خلال استراتيجية إعادة بناء توليدية موجهة بالتقسيم. وبناءً على ذلك، تساهم الدراسة في التطوير النظري لإعادة بناء التراث الثقافي بمساعدة الذكاء الاصطناعي من خلال توضيح كيفية توحيد عمليات التقسيم وإعادة البناء وتوليد النمط ضمن إطار عمل واحد. ويعد هذا التكامل مهمًا بشكل خاص في تطبيقات التراث الثقافي، حيث يكون الحفاظ على بنية الزخارف والمعنى الدلالي أمرًا بالغ الأهمية. ومن منظور عملي، يوفر إطار العمل المقترح حلًا فعالًا للحفظ الرقمي، والترميم، والتحسين الفني للأنماط الثقافية التقليدية. ويمكن لمؤسسات التراث الثقافي والمتاحف والمصممين استخدام SegCycle-SPADE لتحديد مناطق الزخارف تلقائيًا، وإعادة بناء الأنماط التالفة أو غير المكتملة، وتوليد تمثيلات فنية محسنة بصريًا للتصاميم التقليدية. وتكتسب هذه القدرة قيمة خاصة بالنسبة للحرف التقليدية المهددة بالاندثار، بما في ذلك أنماط منسوجات باتيك Miao، حيث قد تكون القطع الأثرية التاريخية تالفة جزئيًا أو غير مكتملة. علاوة على ذلك، ومن خلال دمج التوليف النمطي التوليدي، يمكن لإطار العمل دعم تطبيقات التصميم الثقافي الحديثة مثل تصميم المنسوجات، والإبداع الفني الرقمي، والتعليم التراثي. وبهذه الطريقة، يسد إطار العمل المقترح الفجوة بين الحفاظ على التراث الثقافي وتطبيقات التصميم الثقافي المعاصرة.

ومع ذلك، وعلى الرغم من النتائج الواعدة التي حققها إطار عمل SegCycle-SPADE المقترح، لا تزال هناك عدة قيود. أولاً، أُجري التقييم باستخدام مجموعتي بيانات Miao Batik وWikiArt فقط، مما قد يؤثر على قدرة الإطار على التعميم عند إعادة بناء أنماط أخرى من التراث الثقافي. ثانياً، نظراً لأن عملية إعادة البناء تعتمد على نماذج GAN، فقد تحتوي المخرجات الناتجة أحياناً على عيوب تقنية أو أنسجة غير طبيعية عند التعامل مع هياكل الزخارف شديدة التعقيد. ثالثاً، يركز الإطار حالياً على إعادة بناء الأنماط ثنائية الأبعاد، في حين أن بعض القطع التراثية الثقافية تتضمن هياكل ثلاثية الأبعاد بطبيعتها. وبشكل عام، تثبت النتائج التجريبية فعالية إطار عمل SegCycle-SPADE المقترح في إعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH). وقد أدى دمج التجزئة الدلالية القائمة على SegFormer، وCAFFM، وإعادة بناء الزخارف القائمة على CycleGAN، والتوليف الفني القائم على SPADE، إلى تحسين مقاييس أداء التجزئة وإعادة البناء وجودة الصورة بشكل مستمر. كما أكدت دراسات الاستئصال مساهمة كل مكون من مكونات الإطار، حيث أظهرت أن CAFFM وفقدان الحفاظ على الزخارف (motif-preservation loss) قد عززا بشكل كبير الدقة الهيكلية والأصالة البصرية. وتدعم هذه النتائج الفرضية المركزية القائلة بأن إعادة البناء الموجهة بالتجزئة الدلالية والمدمجة مع دمج الميزات عبر الانتباه (cross-attention feature fusion) يمكن أن تحافظ بفعالية على الزخارف ذات الأهمية الثقافية مع توليد مخرجات غنية فنياً. وبناءً على ذلك، يوفر الإطار المقترح نهجاً حاسوبياً موثوقاً وقابلاً للتكرار للحفظ الرقمي، والترميم، والإحياء الإبداعي لأنماط التراث الثقافي غير المادي.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تضارب المصالح:
يعلن المؤلفون عن عدم وجود أي تضارب في المصالح.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقر المؤلفون بالدعم الأكاديمي والمؤسسي المقدم من كلية قوانغدونغ المتعددة التقنيات وجامعة جنوب الصين العادية خلال إتمام هذا البحث. وقد حظي هذا البحث بدعم المشروع العام لصندوق العلوم الاجتماعية الوطني لعام 2023 (رقم 23BH161)، بعنوان “متحف التجديد الرقمي: بحث في تفعيل وتوصيل الآثار الثقافية للخط والرسم الصيني الكلاسيكي.”

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مُحسِّن Adamمكتبة PyTorch OptimizerAdamخوارزمية تحسين مستخدمة أثناء تدريب النموذج.
مجموعة أدوات CUDAشركة NVIDIACUDA 11.3تسريع وحدة معالجة الرسوميات (GPU) لحسابات التعلم العميق.
cuDNNشركة NVIDIAcuDNN 8.2مكتبة تسريع الشبكات العصبية العميقة المستخدمة لتسريع التدريب والاستدلال.
CycleGANجامعة كاليفورنيا، بيركلي / مصدر مفتوحتنفيذ PyTorch الرسمي (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)شبكة تنافسية توليدية مستخدمة لإعادة بناء الزخارف الثقافية.
أوزان ImageNet مسبقة التدريبImageNet / مصدر مفتوحmit_b2.pth (نقطة فحص ImageNet-1K مسبقة التدريب)تُستخدم لتهيئ العمود الفقري لنموذج SegFormer-B2 قبل الضبط الدقيق على مجموعة بيانات Miao Batik.
معالج Intelشركة IntelIntel Core i7 (الجيل الحادي عشر)وحدة المعالجة المركزية (CPU) المستخدمة في المعالجة المسبقة للصور، ودعم تدريب النموذج، والاستدلال.
Matplotlibفريق تطوير MatplotlibMatplotlib 3.5.1تصور منحنيات التدريب ونتائج التقييم.
مجموعة بيانات Miao Batikمستودع ZenodoDOI: 10.5281/zenodo.20807658مجموعة بيانات للزخارف الثقافية تحتوي على 15,148 صورة مستخدمة للتقسيم الدلالي وإعادة بناء الأنماط.
NumPyمطورو NumPyNumPy 1.21.5الحسابات العددية ومعالجة مجموعة البيانات.
وحدة معالجة الرسوميات NVIDIAشركة NVIDIANVIDIA RTX 3090 (24 GB VRAM)المنصة العتادية المستخدمة لتدريب النموذج والاستدلال.
OpenCVمؤسسة OpenCVOpenCV 4.5.5المعالجة المسبقة للصور، وتغيير الحجم، والاستكمال، وإزالة الضجيج باستخدام مرشح غاوس.
نظام التشغيلشركة Canonical Ltd.Ubuntu 20.04 LTSبيئة التنفيذ التجريبية.
Pillow (PIL)مكتبة صور بايثونPillow 8.4.0تحميل الصور ومعالجتها.
Pythonمؤسسة برمجيات بايثونPython 3.8.10لغة البرمجة المستخدمة في التنفيذ والتجريب.
PyTorchMeta AIPyTorch 1.10.0إطار عمل التعلم العميق المستخدم لتدريب النموذج والاستدلال.
البذرة العشوائيةالإعداد التجريبي42بذرة ثابتة مستخدمة لتقسيم مجموعة البيانات، وتهيئة النموذج، وقابلية تكرار التجربة.
Scikit-learnمطورو Scikit-learnScikit-learn 1.0.2تقسيم مجموعة البيانات، والتحليل الإحصائي، ومقاييس التقييم.
Seabornمجتمع المصادر المفتوحةSeaborn 0.11.2تصور البيانات الإحصائية.
SegFormer-B2أبحاث NVIDIA / مصدر مفتوحSegFormer-B2 (MIT-B2 Backbone)نموذج تقسيم دلالي يعتمد على المحولات (Transformer) مستخدم لتقسيم الزخارف الثقافية.
أقنعة التقسيم / التعليقات التوضيحيةمجموعة بيانات Miao Batikمدرجة مع مجموعة البياناتتسميات التقسيم الدلالي على مستوى البكسل مستخدمة لتصنيف الزخارف والتدريب.
SPADEأبحاث NVIDIA / مصدر مفتوحتنفيذ PyTorch الرسمي (https://github.com/NVlabs/SPADE)نموذج توليد صور موجه بالتقسيم مستخدم لإنشاء أنماط فنية.
TorchVisionMeta AITorchVision 0.11.1أدوات معالجة الصور وتحويلات مجموعات البيانات المستخدمة مع PyTorch.
مجموعة بيانات WikiArtWikiArthttps://www.wikiart.org/مجموعة بيانات للأنماط الفنية تحتوي على أكثر من 80,000 عمل فني عبر 27 نمطاً فنياً، مستخدمة لتعلم الأنماط وتوليدها.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

مقالات ذات صلة