يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية

مقالة بحثية

إعادة بناء وتخليق الأنماط الفنية للتراث الثقافي غير المادي الموجهة بالتجزئة الدلالية باستخدام إطار تعلم عميق

45 مشاهدة

DOI:

10.3791/71577

أغسطس 14, 2026

في هذه المقالة

ملخص

يصف هذا البروتوكول سير عمل للتعلم العميق من أجل التجزئة الدلالية، وإعادة البناء، وتوليد الأنماط الفنية للتراث الثقافي غير المادي، وذلك باستخدام استخراج الميزات القائم على المحولات (transformer)، وإعادة البناء التنافسية، وتوليد الصور التكيفي مكانيًا لدعم الحفظ الرقمي وتطبيقات التراث الإبداعي.

الملخص

لقد حظي الحفظ الرقمي وإعادة بناء أنماط التراث الثقافي غير المادي (ICH) باهتمام متزايد مع تقدم تقنيات توليد الصور القائمة على التعلم العميق. وقد أظهرت المنهجيات الحالية القائمة على SegCycle-SPADE إمكانات في التقسيم الهيكلي وإعادة البناء الفني لأنماط الحرف التقليدية؛ ومع ذلك، لا تزال هناك قيود قائمة، بما في ذلك محدودية تنوع مجموعة البيانات، وعدم كفاية دمج الدلالات الثقافية، وعدم الحفاظ بشكل كافٍ على ميزات الأنماط الهيكلية أثناء إعادة البناء. ولمعالجة هذه التحديات، تقترح هذه الدراسة إطار عمل SegCycle-SPADE مطوراً للتقسيم الدلالي وإعادة البناء الفني لأنواع أنماط التراث الثقافي غير المادي. تم استخدام نموذج تقسيم قائم على Transformer، وهو SegFormer، لتحديد حدود الزخارف ومناطق الأنماط بدقة. بالإضافة إلى ذلك، تم تقديم وحدة دمج الميزات الثقافية عبر الانتباه (Cross-Attention Cultural Feature Fusion Module) لتعزيز الزخارف ذات الأهمية الثقافية وتحسين تمثيل الميزات. ويتم تنفيذ ترجمة الأنماط وإعادة بنائها باستخدام CycleGAN، بينما يتم استخدام إلغاء التطبيع المتكيف مكانياً (SPADE) لتوليد الأسلوب الفني للحفاظ على الاتساق الدلالي بين خرائط التقسيم والصور المولدة. ولتحسين تعميم النموذج والتنوع الفني، تم تدريب إطار العمل باستخدام كل من مجموعة بيانات زخارف ثقافة باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. وتظهر النتائج التجريبية أن إطار عمل SegCycle-SPADE المقترح والموجه بالانتباه يحسن دقة التقسيم وأداء إعادة بناء أنماط التراث مقارنة بطرق إعادة البناء الحالية القائمة على الشبكات الخصومية التوليدية (GAN). ويوفر إطار العمل المقترح حلاً قابلاً للتوسع لتوثيق التراث الثقافي بمساعدة الذكاء الاصطناعي، وإعادة بنائه، وإحيائه فنياً من خلال تصميمات الأنماط التقليدية.

المقدمة

يُعد التراث الثقافي، الذي يشمل العناصر غير المادية مثل العادات واللغات والمعتقدات، والعناصر المادية مثل الأعمال الفنية والمباني والسجلات المكتوبة، تجلياً أساسياً للتاريخ البشري والإبداع والهوية1. وتهدف صيانة التراث إلى تمكين المجتمعات من إعادة التواصل مع أصولها، وإتاحة الفرصة للأجيال القادمة للاستفادة من ذاكرتهم الثقافية الجماعية. كما أنها تعزز التفاهم بين الثقافات، وتقدير التقاليد والعادات المتنوعة، والاعتراف بالروايات التاريخية المختلفة. وتساعدنا هذه الأصول الثقافية في فهم قيم ومنظورات وتجارب الأجيال السابقة، وتساهم في تكوين الهويات الاجتماعية المعاصرة والاستمرارية الثقافية. وتوضح الشكل 1 المبادئ الأساسية للحفاظ على التراث الثقافي.

عملية التجزئة: جمع البيانات، المعالجة المسبقة، إطار عمل SegCycle-SPADE؛ مقاييس التقييم.
الشكل 1. نظرة عامة مفاهيمية لإعادة بناء أنماط التراث الثقافي باستخدام إطار عمل SegCycle-SPADE. توضيح تخطيطي للمنهج المقترح لإعادة بناء وتعزيز أنماط التراث الثقافي غير المادي. يتضمن سير العمل جمع مجموعة البيانات من مجموعتي بيانات Miao Batik وWikiArt، والمعالجة المسبقة للصور، والتجزئة الدلالية باستخدام SegFormer-B2، ودمج الميزات باستخدام وحدة دمج الميزات الثقافية عبر الانتباه (CAFFM)، وإعادة بناء الأنماط باستخدام CycleGAN، وتوليف النمط الفني باستخدام SPADE، والتقييم النهائي باستخدام مقاييس التجزئة وإعادة البناء. تشير الأسهم إلى تدفق البيانات وتمثيلات الميزات عبر إطار العمل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تتجسد الذاكرة الجماعية والإرث الثقافي للمجتمع البشري في التراث الثقافي غير المادي (ICH)، والذي يعمل كوسيط هام للتعبير الفني والهوية الثقافية. ومع ذلك، يواجه التراث الثقافي غير المادي تحديات كبيرة نتيجة لآثار العولمة والرقمنة2,3,4. وتتطلب العديد من ممارسات التراث الثقافي غير المادي المهددة بالاندثار مناهج جديدة للحفظ والتطوير بسبب تناقص أعداد الحرفيين المهرة ومحدودية القدرة على التكيف مع الأسواق الحديثة5,6. وباعتباره مجالاً هاماً في أبحاث التراث الثقافي غير المادي، يركز التصميم المستدام على التطوير المتكامل للثقافة والمجتمع والبيئة، ويوفر مساراً عملياً للاستمرار في الحفاظ على التراث الثقافي غير المادي. ومن خلال مناهج التصميم المستدام، يمكن إحياء التراث الثقافي غير المادي مع تكييفه ليلبي احتياجات المجتمع المعاصر7,8.

في هذه الدراسة، يشير مصطلح "أنماط التراث الثقافي غير المادي" إلى التمثيلات الزخرفية البصرية التي تنقل القيم الثقافية غير المادية الكامنة وتحافظ عليها. وبناءً على ذلك، يهدف الإطار المقترح إلى الحفاظ على المعلومات الثقافية المرتبطة بهذه الزخارف وتوثيقها مع إعادة بناء أشكالها البصرية.

يُعد تطريز وباتيك شعب مياو أشكالاً بارزة من التراث الثقافي غير المادي الصيني، حيث يعكسان تاريخ ومعتقدات وتقاليد مجتمع مياو من خلال زخارف رمزية مثل الطيور والفراشات وطوطمات الأسلاف9. وتتجذر هذه الزخارف بعمق في الملابس الطقسية وممارسات المهرجانات، كما تساهم في التنمية الثقافية والاقتصادية المحلية10,11. وقد خلقت التطورات في التقنيات الرقمية، لا سيما الذكاء الاصطناعي (AI) والتعلم العميق (DL)، فرصاً جديدة للحفاظ على التراث الثقافي وتحليله وإعادة بنائه وتوثيقه. ويعد باتيك مياو في مقاطعة قويتشو، وهو أحد أفضل تقاليد الباتيك حفظاً في الصين، وسيلة مهمة لنقل المعارف الثقافية والمعتقدات والعادات والطقوس الخاصة بشعب مياو12,13,14,15,16.

أظهرت الدراسات الحديثة إمكانات التعلم العميق (DL) في الحفاظ على التراث الثقافي وإعادة بناء الأنماط، حيث حققت دقة تحسين في التجزئة (دقة البكسل = 88.6%، ومتوسط التقاطع فوق الاتحاد [IoU] = 78.1%) وأداءً أفضل في إعادة البناء مقارنة بـ U-Net وDeepLabV3+1. ومع ذلك، لا تزال هناك عدة تحديات؛ إذ تعاني النهج الحالية القائمة على الشبكات التنافسية التوليدية (GAN) غالباً في الحفاظ على التفاصيل الهيكلية الدقيقة في الأنماط المعقدة17، بينما يحد تنوع مجموعات البيانات المحدود من قدرة النموذج على التعميم عبر المجالات الثقافية المختلفة18. بالإضافة إلى ذلك، قد تفشل نماذج ترجمة الصور إلى صور مثل CycleGAN في الحفاظ على الاتساق الدلالي بين خرائط التجزئة والصور المولدة19، كما يمكن أن يؤدي غياب آليات الانتباه إلى فقدان تفاصيل الزخارف ذات الأهمية الثقافية أثناء عملية إعادة البناء20. وبناءً على ذلك، تبرز الحاجة إلى إطار عمل محسّن يدمج التجزئة القائمة على المحولات (transformer-based segmentation)، وتعلم الميزات الموجه بالانتباه، والتدريب باستخدام مجموعات بيانات متعددة، وذلك من أجل إعادة بناء فعالة لأنماط التراث الثقافي غير المادي (ICH).

ظهرت فرص جديدة للحفاظ على التراث الثقافي من خلال رقمنة تطريز المياو (Miao) والتقدم السريع للذكاء الاصطناعي التوليدي. وقد أظهرت نماذج الانتشار (Diffusion models)، وهي فئة ناشئة من النماذج التوليدية العميقة، أداءً ملحوظاً في مهام الرؤية الحاسوبية نظراً لقدراتها القوية في توليد المحتوى21,22,23,24,25. وخلال عملية الانتشار العكسي، يتعلم النموذج تدريجياً إعادة بناء بيانات الإدخال الأصلية من التمثيلات المشوشة26,27,28. كما استكشفت الدراسات السابقة تطبيق تقنيات إعادة البناء ثلاثية الأبعاد والتصميم بمساعدة الحاسوب (CAD) من أجل الحفاظ على التراث الثقافي ونشره.

على الرغم من أن الشبكات العصبية الالتفافية (CNNs) وشبكات الخصومة التوليدية (GANs) تؤدي أداءً جيداً في توليد الصور والحفاظ على السمات، إلا أنها لا تزال تواجه تحديات تتعلق بمجالات الاستقبال المحدودة، وانهيار النمط (mode collapse)، وعدم استقرار التدريب29. وتتميز البنى القائمة على المحولات (Transformer)، مثل SegFormer وSegmenter، بقدرتها الفائقة على التقاط السياق العالمي والعلاقات الدلالية؛ ومع ذلك، فإنها تتطلب موارد حسابية مكثفة وقد تواجه صعوبة في التعامل مع التفاصيل الدقيقة. ورغم أن نماذج الانتشار مثل Stable Diffusion تظهر قدرات قوية في توليد الصور، إلا أنها غالباً ما تفتقر إلى التحكم الدقيق في الخصائص الهيكلية والفنية للتصاميم المولدة. علاوة على ذلك، تعتمد معظم النهج الحالية استراتيجيات تدريب مستقلة تحد من المشاركة الفعالة للمعلومات والتحسين التعاوني بين مكونات التجزئة والتوليد، مما يؤدي إلى مفاضلة بين الدقة الهيكلية والأصالة الفنية30.

تحقق النماذج الحديثة القائمة على الانتشار، مثل الانتشار الكامن (latent diffusion) وStable Diffusion، توليداً عالي الجودة للصور، ولكنها تتطلب عملية إزالة ضوضاء تكرارية، مما يؤدي إلى زيادة التكلفة الحسابية ووقت الاستنتاج. علاوة على ذلك، لا يزال الحفاظ على الزخارف الثقافية الدقيقة والاتساق الهيكلي أمراً صعباً دون وجود آليات تكييف متخصصة. وتنجح النماذج التوليدية القائمة على Transformer في التقاط العلاقات السياقية العالمية، ولكنها غالباً ما تتطلب مجموعات بيانات ضخمة وموارد حسابية كبيرة. في المقابل، يدمج إطار عمل SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) المقترح بين التقسيم القائم على SegFormer، ودمج الميزات عبر الانتباه المتقاطع (cross-attention feature fusion)، وإعادة بناء CycleGAN، والتوليد الموجه بواسطة SPADE لتوفير توجيه هيكلي صريح، مما يؤدي إلى تحسين الحفاظ على الزخارف، والاتساق الدلالي، وإعادة البناء القابلة للتحكم لأنماط التراث الثقافي.

تعتمد غالبية تقنيات التجزئة الدلالية الحديثة على الشبكات العصبية التلافيفية الكاملة (FCNNs) ذات البنى المحدبة على شكل حرف U31. فخلال مرحلة الترميز، يتم استخراج ميزات عميقة ذات حقول استقبال واسعة من خلال سلسلة من عمليات التلافيف وأخذ العينات السفلي. أما مرحلة فك الترميز فتعمل تدريجيًا على استعادة الدقة المكانية من خلال أخذ العينات العلوي، مما يتيح في النهاية التنبؤ الدلالي على مستوى البكسل. ومن خلال تعويض فقدان المعلومات المكانية أثناء أخذ العينات السفلي وتحسين أداء التجزئة عبر مجموعة واسعة من التطبيقات، تسمح الوصلات القفزية بدمج المعلومات عالية الدقة من مستويات الترميز المختلفة مباشرة في فك الترميز32.

بينما أظهرت الأساليب الحديثة القائمة على شبكات الخصومة التوليدية (GAN) والشبكات العصبونية التفافية (CNN) ونماذج الانتشار (diffusion) نتائج واعدة في توليد الصور وترميم التراث الثقافي، إلا أنها غالباً ما تواجه صعوبة في الحفاظ على الاتساق الدلالي، وصون الزخارف الهيكلية الدقيقة، وضمان إمكانية إعادة بناء متسقة عبر أنماط ثقافية متنوعة. وتعامل معظم النهج الحالية عمليات التجزئة وإعادة البناء وتوليف النمط كعمليات منفصلة، مما قد يؤدي إلى فقدان العناصر ذات الأهمية الثقافية وظهور مخرجات غير متسقة. ولمعالجة هذه الفجوة المنهجية، تقترح هذه الدراسة إطار عمل SegCycle-SPADE موحد يدمج التجزئة الدلالية القائمة على SegFormer، ووحدة دمج الميزات الثقافية عبر الانتباه المتقاطع (CAFFM) المبتكرة، وإعادة البناء القائمة على CycleGAN، وتوليف النمط الموجه بـ SPADE. ومن خلال دمج معلومات التجزئة الهيكلية صراحةً مع تعلم الميزات التوليدية، يتيح إطار العمل المقترح إعادة بناء أكثر موثوقية واتساقاً دلالياً وقابلية للتكرار لزخارف التراث الثقافي غير المادي (ICH)، مع الحفاظ على كل من الأصالة الثقافية والجودة الفنية.

تم تحديد ثلاثة قيود رئيسية في نهج إعادة بناء التراث الثقافي الحالية في هذه الدراسة: (1) عدم الكفاية في الحفاظ على الزخارف الهيكلية الدقيقة في طرق إعادة البناء القائمة على شبكات GAN؛ (2) محدودية التعميم الناتجة عن التدريب على مجموعات بيانات صغيرة أو خاصة بمجال معين؛ و(3) عدم كفاية الاتساق الدلالي بين مخرجات التجزئة والصور المولدة في أطر ترجمة صورة إلى صورة. بالإضافة إلى ذلك، يتم التعامل مع التجزئة وإعادة البناء وتخليق النمط عادةً كعمليات منفصلة، مما يؤدي إلى فقدان عناصر ذات أهمية ثقافية أثناء إعادة البناء. ومن خلال دمج التجزئة الدلالية القائمة على المحولات (transformer)، ودمج الميزات عبر الانتباه المتبادل (cross-attention)، وإعادة بناء CycleGAN، والتخليق الفني الموجه بواسطة SPADE ضمن بنية موحدة، يعالج إطار SegCycle-SPADE المقترح هذه القيود ويحسن الحفاظ على الزخارف، والاتساق الدلالي، والأصالة الفنية في إعادة بناء أنماط التراث الثقافي غير المادي (ICH).

الهدف الرئيسي من هذه الدراسة هو تطوير إطار عمل SegCycle-SPADE مُحسن لإعادة البناء الفني للأنماط الخاصة بالتراث الثقافي غير المادي (ICH) بتوجيه من التقسيم الدلالي. يدمج إطار العمل نموذج SegFormer لتقسيم الزخارف الثقافية بدقة، ونموذج CycleGAN لإعادة بناء الأنماط، ونموذج SPADE للتوليف الفني المتسق أسلوبياً. ولتحسين تمثيل الميزات والحفاظ على التفاصيل الهيكلية الدقيقة، تم تقديم وحدة CAFFM لتسهيل التفاعل الفعال بين ميزات التقسيم والميزات التوليدية. ومن خلال التدريب على مجموعتي بيانات Miao Batik وWikiArt، يعمل إطار العمل المقترح على تعزيز موثوقية إعادة البناء، والاتساق الأسلوبي، والحفاظ على الزخارف ذات الأهمية الثقافية.

من خلال الدمج بين التجزئة الدلالية، ودمج الميزات الموجه بالانتباه، وإعادة بناء الأنماط، وتوليف الأسلوب ضمن بنية موحدة، تقدم هذه الدراسة إطار عمل SegCycle-SPADE المبتكر لإعادة البناء الفني لأنماط التراث الثقافي غير المادي (ICH). وتتمثل المساهمات الرئيسية لهذا العمل فيما يلي: أولاً، تطوير إطار عمل مبتكر لإعادة البناء موجه بالتجزئة الدلالية من خلال دمج SegFormer، مما يتيح الاستخراج الدقيق والحفاظ على الزخارف الثقافية المعقدة والعناصر الهيكلية. ثانياً، تقديم وحدة CAFFM جديدة لدمج ميزات التجزئة بفعالية مع التمثيلات التوليدية، مما يسمح للنموذج بالتقاط العلاقات بعيدة المدى بين الزخارف الثقافية وأنماط الأسلوب الفني. ثالثاً، تعمل وحدة CAFFM المقترحة على تعزيز الحفاظ على العناصر ذات الأهمية الثقافية مع تحسين الواقعية البصرية والتماسك الهيكلي لأنماط التراث المعاد بناؤها. رابعاً، من خلال دمج CycleGAN لإعادة بناء الأنماط الثقافية وSPADE للتوليف الفني الموجه بالتجزئة، يضمن إطار العمل كلاً من الدقة الدلالية والأصالة الأسلوبية في المخرجات المولدة. خامساً، ولتحسين التعميم والتنوع الفني، تم تدريب النموذج باستخدام مجموعة بيانات زخارف باتيك مياو (Miao Batik) لتعلم الأنماط الثقافية، ومجموعة بيانات WikiArt لتمثيل الأسلوب الفني؛ حيث تعمل WikiArt كمجموعة بيانات مساعدة لتقييم قدرة إطار العمل على التعميم، ومتانة تعلم الميزات، وفعالية التحكم في الأسلوب عبر سياقات بصرية متنوعة، بدلاً من كونها أسلوباً مستهدفاً للتطبيق المباشر في منتجات التراث الثقافي لمياو. وأخيراً، وبمقارنته مع طرق إعادة بناء التراث الثقافي الحالية القائمة على شبكات GAN، تظهر النتائج التجريبية أن إطار عمل SegCycle-SPADE المقترح يحقق دقة أعلى في التجزئة، وجودة أفضل في إعادة البناء، واتساقاً أكبر في الأسلوب.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

تم تصميم الإطار المقترح لـ SegCycle-SPADE لإعادة بناء وتحسين أنماط التراث الثقافي التقليدية من خلال التقسيم الدلالي، وتعزيز الميزات باستخدام آلية الانتباه، وإعادة البناء التوليدية، وتخليق الأنماط الفنية. استخدمت هذه الدراسة مجموعات بيانات متاحة للجمهور للتراث الثقافي والصور الفنية، بما في ذلك مجموعة بيانات باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt. لم يشارك في البحث أي مشاركين بشريين، أو بيانات مرضى، أو معلومات شخصية، أو حيوانات تجارب، أو سجلات سريرية؛ وبالتالي، لم تكن هناك حاجة لموافقة لجنة أخلاقيات المؤسسة أو الحصول على موافقة مستنيرة. في البداية، تم استخدام مجموعة بيانات الزخارف الثقافية لباتيك مياو ومجموعة بيانات WikiArt لعملية التقييم. تم وصف مجموعة بيانات باتيك مياو في دراسة Quan et al. (2024)32 وهي تحتوي على 15,148 صورة مشروحة لزخارف باتيك مياو التقليدية. تم استخدام التوضيحات الموجودة التي وفرها منشئو مجموعة البيانات مباشرة، ولم يتم إنتاج أي توضيحات يدوية إضافية في هذه الدراسة. بعد ذلك، تم إجراء المعالجة المسبقة للصور من خلال تغيير الحجم، والتطبيع، وإزالة الضوضاء، وإنشاء قناع تقسيم. تم وصف معاملات المعالجة المسبقة الدقيقة في القسم الفرعي للمعالجة المسبقة للبيانات. يستخدم الإطار المقترح نموذجاً قائماً على المحولات يسمى SegFormer-B2 للتقسيم الدلالي للبيانات. تهدف هذه الطريقة إلى اكتشاف المناطق الرئيسية للزخارف الثقافية وتعلم هياكلها. ثم يتم تعزيز الميزات المقسمة من خلال آلية الانتباه، حيث يتم إبراز المعلومات المهمة المتعلقة بالزخارف الثقافية واستبعاد المعلومات غير ذات الصلة. تم وصف تهيئة آلية الانتباه في القسم الفرعي CAFFM. بعد ذلك، يتم تمرير الميزات المحسنة عبر CycleGAN، حيث يتم إعادة بناء الهياكل التالفة من خلال التعلم الدوري. أثناء التدريب، تم إنشاء عينات زخرفية غير مكتملة اصطناعياً عن طريق تطبيق عمليات القناع العشوائي والحجب الجزئي على صور باتيك مياو الأصلية. حاكت إجراءات التدهور هذه مناطق الزخارف المفقودة والتلف الهيكلي الشائع ملاحظته في القطع التراثية الثقافية المتدهورة. استُخدمت الصور غير المكتملة الناتجة كمدخلات لوحدة إعادة بناء CycleGAN، بينما عملت الصور الأصلية المقابلة كأهداف لإعادة البناء. ثم يتم تحسين أنماط التراث الثقافي المعاد بناؤها من خلال SPADE، حيث يتم إجراء التحسين الفني بناءً على خرائط التقسيم المولدة. يتم تقييم أداء الإطار المقترح باستخدام مقاييس كمية للتقسيم وجودة الصور، بينما يتم تقييم الأصالة البصرية للزخارف الثقافية المعاد بناؤها نوعياً. تم تقييم الأصالة البصرية من خلال الفحص البصري للأنماط الثقافية المولدة ولم تُستخدم كمقياس كمي مستقل. ركز التقييم على الحفاظ على الزخارف، والاتساق الدلالي، والخصائص الثقافية، والتماسك الهيكلي، والمظهر الفني مقارنة بالزخارف الثقافية المرجعية المقابلة. تم إجراء التقييم الكمي لأداء النموذج باستخدام دقة التقسيم (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل دايس (Dice Coefficient)، ومقياس مؤشر التشابه الهيكلي (SSIM)، ونسبة ذروة الإشارة إلى الضوضاء (PSNR)، ومسافة فريشيه البادئة (FID). يوضح الشكل 2 سير العمل العام لإطار SegCycle-SPADE المقترح ويلخص مقاييس التقييم المستخدمة في هذه الدراسة.

مخطط التجزئة الدلالية؛ مجموعات البيانات، المعالجة، CAFFM، إعادة بناء الأنماط، ومقاييس التقييم.
الشكل 2. سير عمل البنية العامة لإطار عمل SegCycle-SPADE المقترح. نظرة عامة على سير عمل SegCycle-SPADE الكامل. تخضع الصور المأخوذة من مجموعات بيانات Miao Batik وWikiArt للمعالجة المسبقة قبل معالجتها عبر التجزئة الدلالية باستخدام SegFormer-B2، وتعزيز الميزات باستخدام CAFFM، وإعادة بناء الأنماط باستخدام CycleGAN، وتوليد النمط الفني باستخدام SPADE. يتم تقييم أداء النموذج باستخدام دقة التجزئة (Segmentation Accuracy)، والتقاطع فوق الاتحاد (IoU)، ومعامل Dice، ومقياس مؤشر التشابه الهيكلي (SSIM)، وPSNR، ومسافة Fréchet Inception (FID)، بينما يتم تقييم الأصالة البصرية نوعياً. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

صُمم إطار عمل SegCycle-SPADE لإعادة بناء أنماط التراث الثقافي لدمج مكونات متعددة من التعلم العميق (DL) من أجل تقسيم الزخارف وإعادة بنائها وتعزيزها فنياً بدقة، كما هو موضح في الشكل 2. تُستخدم صور من مجموعة بيانات زخارف مياو باتيك (Miao Batik) ومجموعة بيانات WikiArt لتوفير أنماط ثقافية وأنماط فنية متنوعة. في البداية، تُعالج الصور باستخدام وحدة تقسيم دلالي تعتمد على SegFormer لتحديد وتخطيط الزخارف الثقافية وفصلها عن الخلفية. تتكون البنية العامة من أربع مراحل رئيسية؛ أولاً، يستخرج نموذج SegFormer خرائط التقسيم الدلالي من صور الأنماط الثقافية. ثانياً، يقوم CAFFM بدمج ميزات التقسيم مع التمثيلات التوليدية لتعزيز تعلم الميزات. ثالثاً، تقوم وحدة CycleGAN بإعادة بناء الأنماط الثقافية باستخدام تمثيلات الميزات المدمجة. وأخيراً، تقوم وحدة SPADE بتوليد مخرجات محسنة فنياً مع الحفاظ على الاتساق الهيكلي من خلال التوليد الموجه بالتقسيم. تُعالج خرائط الميزات المنقحة لاحقاً بواسطة وحدة إعادة بناء CycleGAN، التي تتعلم استعادة الزخارف الثقافية غير المكتملة عن طريق ربط الأنماط المتدهورة بأشكالها الكاملة المقابلة. تم توليد عينات من الزخارف غير المكتملة عن طريق تطبيق عمليات قناع عشوائية وحجب جزئي على صور مياو باتيك الأصلية، وذلك لمحاكاة مناطق الأنماط المفقودة والتدهور الهيكلي الشائع ملاحظته في القطع الأثرية الثقافية المتضررة. وقد تم إقران كل صورة متدهورة بالصورة الأصلية المقابلة لها، والتي كانت بمثابة هدف إعادة البناء أثناء التدريب. مكنت هذه الاستراتيجية وحدة CycleGAN من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص ذات الأهمية الثقافية. وأخيراً، ينتج مولد SPADE مخرجات فنية محسنة بصرياً عن طريق جعل توليد الصور مشروطاً بخرائط التقسيم الناتجة، مما يحافظ على السلامة الهيكلية للزخارف الثقافية طوال عملية التعزيز الفني.

تتضمن الخطوات التالية إطار عمل SegCycle-SPADE المقترح.

الخطوة 1: جمع مجموعات البيانات
تم استخدام مجموعتي بيانات لتحقيق أهداف تعلم الأنماط الثقافية وتوليد الأنماط الفنية. استُخدمت مجموعة بيانات "Miao Batik Cultural Motif" لتوفير معلومات عن الأنماط الثقافية التقليدية، وهي متاحة للعموم عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658) وتحتوي على 15,148 صورة مُصنفة من زخارف الباتيك التقليدية لشعب المياو. وقد استُخدمت التصنيفات الموجودة التي وفرها منشئو مجموعة البيانات مباشرة، ولم يتم إنشاء أي تصنيفات يدوية إضافية في هذه الدراسة. كما استُخدمت مجموعة بيانات "WikiArt" لتوفير معلومات متنوعة عن الأنماط الفنية لغرض توليد الأنماط الفنية، وتم الحصول عليها من مستودع WikiArt المتاح للعموم (https://www.wikiart.org/).

الخطوة 2: المعالجة المسبقة للبيانات
خضعت جميع الصور لمعالجة مسبقة من خلال تغيير الحجم، والتطبيع، وتقليل الضوضاء. واستُخدمت تعليقات الزخارف الثقافية الموجودة، والتي تم الحصول عليها من مصادر مجموعة البيانات الأصلية، لدعم مرحلة التجزئة الدلالية. ولم يتم إجراء أي إجراءات تعليق أو إعادة تسمية إضافية كجزء من هذه الدراسة.

الخطوة 3: تقسيم الأنماط الدلالية باستخدام SegFormer
استُخدم نموذج SegFormer لتقسيم الزخارف الثقافية. تم وصف العمود الفقري لنموذج SegFormer واستراتيجية التهيئة بدقة في القسم الفرعي تقسيم الأنماط الدلالية باستخدام SegFormer. وتحديداً، تم توظيف بنية SegFormer-B2 مع عمود فقري من نوع MIT-B2 مُدرب مسبقاً على ImageNet لتقسيم الزخارف الدلالية. يلتقط هذا النموذج المعلومات السياقية العالمية بفعالية مع الحفاظ على التفاصيل الهيكلية المعقدة للأنماط الثقافية التقليدية.

الخطوة 4: CAFFM
يجمع CAFFM بين ميزات التقسيم الدلالي والتمثيلات التوليدية، مما يمكن الإطار من تعلم كل من خصائص الزخارف الهيكلية ومعلومات الأسلوب الفني. تتوفر تفاصيل تكامل CAFFM في القسم الفرعي CAFFM. يتم وضع هذه الوحدة بين مرحلة التقسيم الدلالي القائمة على SegFormer ومرحلة إعادة البناء التوليدية، حيث تقوم بدمج الميزات الهيكلية المستمدة من التقسيم مع ميزات إعادة البناء من خلال آلية الانتباه المتقاطع متعدد الرؤوس (multi-head cross-attention). وتعمل هذه العملية على تحسين الحفاظ على الزخارف الثقافية وتعزيز واقعية المخرجات المعاد بناؤها.

الخطوة 5: إعادة بناء النمط (CycleGAN)
تتم معالجة الميزات المدمجة لاحقاً بواسطة وحدة CycleGAN لإعادة بناء هياكل الأنماط الثقافية. تم وصف بنية CycleGAN وتكوين التدريب في القسم الفرعي إعادة بناء النمط باستخدام CycleGAN. تتكون وحدة إعادة البناء من مولدين ومميزين اثنين، وتستخدم بنية مولد شبكة متبقية (residual-network) تحتوي على تسع كتل متبقية، وتعتمد مميز PatchGAN، ويتم تدريبها باستخدام خسائر التنافس (adversarial losses) واتساق الدورة (cycle-consistency losses). يتيح هذا التكوين تعيين النطاقات ثنائي الاتجاه ويسهل عملية إعادة بناء هياكل الأنماط الثقافية غير المكتملة.

الخطوة 6: توليد النمط الفني (SPADE)
تتم بعد ذلك معالجة الأنماط المعاد بناؤها من خلال وحدة SPADE لإجراء تركيب نمط فني موجه بالتجزئة. تم وصف تهيئة مولد SPADE في القسم الفرعي توليد النمط الفني باستخدام SPADE. وتستخدم الوحدة كتل SPADE المتبقية، وطبقات تطبيع تكيفية مكانياً، وتكييفاً دلالياً مشتقاً من خرائط تجزئة SegFormer وتمثيلات ميزات CAFFM. ومن خلال تكييف توليد الصور بناءً على خرائط التجزئة، تحافظ المخرجات المركبة على المحاذاة الهيكلية مع الزخارف الثقافية الأصلية مع دمج خصائص النمط الفني.

الخطوة 7: تقدير الأداء
تم تقييم الإطار المقترح باستخدام مقاييس متعددة للتجزئة وتقييم جودة الصور، بما في ذلك دقة التجزئة (Segmentation Accuracy)، وتقاطع الاتحاد (IoU)، ومعامل تشابه دايس (Dice)، ومؤشر التشابه الهيكلي (SSIM)، ونسبة إشارة الذروة إلى الضوضاء (PSNR)، والمسافة الفريشيه البداية (FID). ولتقييم الاتساق التجريبي، كُررت جميع التجارب خمس مرات باستخدام بذور عشوائية مختلفة، وسُجلت النتائج كمتوسط ± الانحراف المعياري. كما تم تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة، مع حد دلالة p < 0.05.

جمع مجموعات البيانات
في إطار عمل SegCycle-SPADE المقترح، يتم استخدام مجموعتي بيانات لفهم الأنماط الثقافية وتعلم الأسلوب. مجموعة البيانات الأولى المستخدمة في الإطار المقترح هي مجموعة بيانات زخارف باتيك مياو (Miao Batik) الثقافية. تحتوي هذه المجموعة على زخارف ثقافية من فن باتيك مياو، وهي عموماً صور لباتيك مياو التقليدي تحتوي على زخارف مثل الحيوانات والنباتات والأشكال الهندسية المستخدمة في فن عرقية مياو. وتتضمن هذه المجموعة صوراً ذات معلومات غنية في الملمس والنسيج، وهو أمر مهم بشكل عام للحفاظ على التراث الثقافي. أما مجموعة البيانات الثانية المستخدمة في إطار عمل SegCycle-SPADE فهي مجموعة بيانات WikiArt. تحتوي هذه المجموعة على عدد هائل من الأعمال الفنية التي تنتمي عموماً إلى أساليب مختلفة. وتُستخدم هذه المجموعة لتعلم الأساليب المعقدة، وهو أمر مفيد بشكل عام لتعزيز الأعمال الفنية. تضم هذه المجموعة 80,000 عمل فني بدقة HD، مع 27 تصميماً مختلفاً، مما يجعلها أكثر فائدة لمهام توليد الأساليب أو تحويلها القائمة على التعلم العميق (DL).

مجموعة بيانات باتيك مياو (Miao Batik Dataset):
تتكون مجموعة بيانات باتيك مياو (https://doi.org/10.5281/zenodo.20807658) من 15,148 صورة لأنماط الباتيك التي تصور زخارف ذات أهمية ثقافية. وتشتمل الصور على مجموعة متنوعة من التصاميم التقليدية، مثل الزخارف الحيوانية (مثل الفراشات والأسماك)، والأنماط القائمة على النباتات، والزخارف الهندسية التي تحمل رمزية ثقافية. وتعد مجموعة البيانات هذه مكوناً هاماً في الإطار المقترح لأنها توفر هياكل ثقافية أصيلة تمكّن وحدة التجزئة من تحديد حدود الزخارف والحفاظ عليها بدقة أثناء إعادة بناء النمط (الجدول 1). وفي هذه الدراسة، تشير الزخارف ذات الأهمية الثقافية إلى العناصر المرئية الرمزية الموثقة عادةً في أدبيات التراث الثقافي لشعب المياو والممثلة ضمن توصيفات مجموعة البيانات، بما في ذلك الطيور والفراشات والأنماط الزهرية وطواطم الأسلاف. وقد تم اختيار هذه الزخارف بناءً على أهميتها الثقافية الموثقة وتواجدها المتكرر في تصاميم باتيك وتطريز المياو التقليدية، بدلاً من الاعتماد فقط على تكرار ظهورها أو تكوينها المكاني. وتم الحصول على توصيفات الزخارف وعلامات التجزئة الموجهة من قبل الخبراء من مصدر مجموعة بيانات باتيك مياو الأصلي، واستُخدمت مباشرة في هذه الدراسة. ولم يقم المؤلفون بإجراء أي عمليات توصيف يدوي إضافية، أو إعادة تسمية، أو إجراءات توصيف موجهة من قبل الخبراء. وقد استُخدمت التوصيفات الحالية المقدمة من منشئي مجموعة البيانات لتدريب وتقييم التجزئة الدلالية.

مَعلَمَةالوصف
اسم مجموعة البياناتمجموعة بيانات الأنماط الثقافية لباتيك مياو
مصدر مجموعة البياناتمستودع Zenodo (معرف الكائن الرقمي: 10.5281/zenodo.20807658)
المجالالتراث الثقافي غير المادي / تحليل أنماط المنسوجات
إجمالي الصور١٥,١٤٨ صورة
نوع الصورةصور رقمية لأنماط منسوجات الباتيك التقليدية لشعب مياو
فئات الأنماطزخارف حيوانية، وزخارف نباتية، وزخارف هندسية
الأصل الثقافيثقافة عرقية مياو، مقاطعة قويتشو، الصين
دقة الصورة الأصليةصور عالية الدقة (عادةً ≥ 1,000 بكسل في الجانب الأقصر) يتم التقاطها كمسوحات ضوئية خام أو صور فوتوغرافية قبل المعالجة المسبقة
دقة التدريبتم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة
مدى توفر التعليقات التوضيحيةاستُخدمت تعليقات التجزئة الموجودة التي وفرها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم. ولم يتم إجراء أي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة.
التطبيق في هذه الدراسةتجزئة الزخارف الثقافية، واستخلاص الميزات، والحفاظ على الزخرفة، وإعادة بناء النمط

الجدول 1: خصائص مجموعة بيانات أنماط باتيك مياو الثقافية. ملخص لمجموعة بيانات زخارف باتيك مياو الثقافية المستخدمة في التقسيم الدلالي، وتحليل الأنماط الثقافية، وإعادة بناء الزخارف. يصف الجدول مصدر مجموعة البيانات، وخصائص الصور، وفئات الزخارف، والأصل الثقافي، ودقة الصور، ودورها ضمن إطار عمل SegCycle-SPADE المقترح.

مجموعة بيانات WikiArt:
تُعد مجموعة بيانات WikiArt [https://www.wikiart.org/] مستودعاً رقمياً واسع النطاق وشائع الاستخدام للفنون، حيث تضم أكثر من 80,000 صورة موزعة على 27 أسلوباً فنياً مختلفاً كما هو موضح في الجدول 2. وتشمل هذه الأساليب فن عصر النهضة، والانطباعية، والتكعيبية، والسريالية. وتكتسب مجموعة البيانات هذه أهمية بالغة في الإطار المقترح كونها توفر المعرفة التي تسمح لوحدة SPADE بإنشاء أنماط غنية ثقافياً مع الحفاظ على المعلومات الهيكلية المستمدة من عملية التجزئة. تتكون مجموعة البيانات من 56,000 صورة للتدريب و12,000 صورة لكل من التحقق والاختبار. وتساعد الصور الموجودة في مجموعة البيانات في تدريب نموذج التعلم العميق (DL) بشكل فعال.

مَعْلَمَةالوصف
اسم مجموعة البياناتمجموعة بيانات WikiArt
مصدر مجموعة البياناتمستودع WikiArt (https://www.wikiart.org/)
المجالالفنون واللوحات الرقمية
إجمالي الصورما يقرب من 80,000 عمل فني
صور التدريب56,000
صور التحقق12,000
صور اختبارية12,000
الأساليب الفنية٢٧ أسلوباً فنياً، بما في ذلك عصر النهضة، والانطباعية، والتكعيبية، والسريالية، والتعبيرية، والواقعية، والفن التجريدي
دقة الصورة الأصليةتتفاوت دقة الصور الأصلية عبر الأعمال الفنية والمصادر المختلفة. لذا، تم تغيير حجم الصور إلى دقة موحدة تبلغ 256 × 256 بكسل خلال مرحلة المعالجة المسبقة.
دقة التدريبتم تغيير حجم الصور إلى 256 × 256 بكسل أثناء المعالجة المسبقة قبل تعلم النمط الفني والتوليف الصوري الموجه بالتجزئة.
تقسيم مجموعة البياناتتقسيم عشوائي طبقي (70% للتدريب، و15% للتحقق، و15% للاختبار) باستخدام بذرة عشوائية ثابتة بقيمة 42
استراتيجية أخذ عينات الأسلوبتم استخدام المعاينة التناسبية الطبقية للحفاظ على توزيع الأنماط الفنية السبعة والعشرين عبر المجموعات الفرعية للتدريب والتحقق والاختبار.
التطبيق في هذه الدراسةتعلم الأسلوب الفني، وتمثيل الأسلوب، والتوليف الفني الموجه بالتجزئة

الجدول 2: خصائص مجموعة بيانات WikiArt. ملخص لمجموعة بيانات WikiArt المستخدمة في تعلم الأسلوب الفني وتخليق الصور الموجه بالأسلوب. يصف الجدول مصدر مجموعة البيانات، وتوزيع الصور، وتغطية الأساليب الفنية، وتقسيم مجموعة البيانات، ودقة الصور، وتطبيقها ضمن إطار عمل SegCycle-SPADE المقترح.

تحتوي مجموعة بيانات باتيك مياو (Miao Batik) على 15,148 صورة تمثل الزخارف الثقافية التقليدية لشعب المياو.32 تتوفر مجموعة البيانات للعامة عبر منصة Zenodo (https://doi.org/10.5281/zenodo.20807658). وقبل تدريب النموذج، خضعت جميع الصور للفحص البصري، وتم تغيير حجمها إلى 256 × 256 بكسل، ومعايرتها، وفحصها للكشف عن أي عينات تالفة أو مكررة. ولم يسفر فحص مراقبة الجودة عن استبعاد أي صور؛ وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها 15,148 للتحليل اللاحق. كما تم تقسيم مجموعة البيانات عشوائياً إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام بذرة عشوائية ثابتة بقيمة 42 لضمان إمكانية إعادة إنتاج تقسيمات مجموعة البيانات. تم الوصول إلى مجموعة بيانات WikiArt من خلال مستودع WikiArt الرسمي (https://www.wikiart.org/)، وهي تحتوي على أكثر من 80,000 عمل فني تشمل 27 نمطاً فنياً. وبالنسبة لتجارب تعلم النمط، استُخدمت 56,000 صورة للتدريب، و12,000 للتحقق، و12,000 للاختبار.

المعالجة المسبقة للبيانات
قبل تدريب إطار عمل SegCycle-SPADE المقترح، خضعت مجموعة بيانات زخارف باتيك مياو الثقافية ومجموعة بيانات WikiArt لعدة خطوات معالجة مسبقة لضمان اتساق جودة الصور ودقة تمثيل السمات. تم تطبيق نفس مسار المعالجة المسبقة الأساسي، بما في ذلك إزالة الضجيج بطريقة غاوس (Gaussian denoising)، والتطبيع (normalization)، وتغيير الحجم إلى دقة إدخال ثابتة، والتحقق من جودة الصور، على كلتا المجموعتين. ومع ذلك، لعبت مجموعات البيانات أدواراً متميزة داخل إطار العمل؛ حيث استُخدمت مجموعة بيانات WikiArt لتعلم الأنماط الفنية وتوليدها، بينما استُخدمت مجموعة بيانات باتيك مياو بشكل أساسي لتجزئة الزخارف الثقافية وإعادة بنائها. ولم يتم إجراء أي تغييرات في المعالجة المسبقة خاصة بمجموعة بيانات معينة خارج هذه الأدوار المحددة لكل مهمة. ولضمان معالجة متسقة بواسطة نموذج التعلم العميق (DL)، تم أولاً تغيير حجم الصور إلى دقة ثابتة. كانت هذه الخطوة ضرورية لأن الصور في كلتا المجموعتين تفاوتت في الدقة بناءً على مصدرها، وقد أدى تغيير الحجم إلى تحسين الكفاءة الحسابية ومنع التناقضات البعدية من التأثير على التدريب. وكانت الخطوة الثانية في المعالجة المسبقة هي التطبيع، حيث تم تغيير مقياس قيم البكسل إلى نطاق قياسي لاستقرار تحديثات التدرج أثناء التدريب. ثم تمت معالجة الصور باستخدام ترشيح غاوس لتقليل الضجيج الذي قد يتداخل مع هياكل الزخارف الثقافية. وبالنسبة لمجموعة بيانات باتيك مياو، استُخدمت أقنعة تجزئة الزخارف الثقافية الموجودة، والتي تم الحصول عليها مباشرة من مصدر مجموعة البيانات الأصلي، دون تعديل لتدريب وتقييم التجزئة الدلالية (semantic segmentation). ولم يتم إنشاء أقنعة تجزئة جديدة خصيصاً لهذه الدراسة.

ما لم يُذكر خلاف ذلك، تم اقتباس المعادلات التي تصف الطرق المعتمدة من دراسات سابقة وتم الاستشهاد بها وفقاً لذلك. أما المعادلات التي تصف طريقة CAFFM المقترحة وإطار عمل تحسين SegCycle-SPADE المركب، فقد طورها المؤلفون خصيصاً لهذه الدراسة.

لتكن صورة المدخلات من مجموعة البيانات مُمثلة على النحو التالي: المعادلة 1:

المفهوم الرياضي للصورة في الفضاء الإقليدي، I ∈ ℝ^HxWxC، مما يشير إلى الأبعاد.  (1)

هنا، تشير H وW وC إلى ارتفاع الصورة وعرضها وعدد قنوات الألوان، على التوالي. يتم تغيير حجم جميع الصور إلى بُعد ثابت H′ × W′ كما هو موضح في المعادلة 2:

معادلة تغيير الحجم للأبعاد H' x W'؛ صيغة رياضية.

هنا، Iيرجى تقديم النص المصدر المراد ترجمته. هي الصورة بعد تغيير حجمها. وتُحسب قيم البكسل المُطبّعة وفقاً لـ المعادلة 3:

المعادلة In=Ir/255، وتوضح صيغة تطبيع الصور.   (3)

يساعد هذا في تثبيت إجراء التدريب. ويتم إجراء ترشيح الضوضاء باستخدام مرشح غاوسي كما هو موضح في المعادلة 4:

معادلة طريقة معالجة الإشارة، \( I_s = I_n * G(\sigma) \)، صيغة في التحليل الرياضي.

هنا، يمثل G(σ) مرشح غاوس (Gaussian filter) وتمثل العلامة * عملية الالتفاف (convolution). تم استخدام مرشح غاوس بنواة 5 × 5 وانحراف معياري قدره σ = 1.0. كما تم تطبيق حشو انعكاسي (Reflective padding) على بكسلات الحدود لتقليل التشوهات الحافية. وقد أُجريت عملية إزالة الضجيج فور تحميل الصور وقبل عمليتي القياس والتطبيع. ولضمان توحيد المعالجة المسبقة طوال فترة الدراسة، تم تطبيق نفس تكوين المرشح على كل صورة في مجموعتي بيانات Miao Batik و WikiArt. وبالنسبة لمجموعة بيانات Miao Batik، يتم إنشاء أقنعة التجزئة وفقًا لـ المعادلة 5:

الصيغة الرياضية M(x,y) لتصنيف البكسل في منطقة الزخرفة؛ معادلة قاعدة القرار.

هنا، يمثل M قناع تقسيم يُستخدم لتوجيه نموذج SegFormer.

تبدأ سلسلة المعالجة المسبقة بالحصول على الصور من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt، كما هو موضح في الشكل 3. لم يتم استخدام أي تقنيات لتعزيز البيانات أثناء التدريب. وبعد المعالجة المسبقة، التي شملت تغيير الحجم، والتطبيع، وإزالة الضجيج الغاوسي، وإعداد أقنعة التقسيم، استُخدمت الصور مباشرة لتدريب إطار SegCycle-SPADE المقترح والتحقق من صحته واختباره. تتضمن الخطوة الأولية في سلسلة المعالجة المسبقة تغيير حجم الصور إلى حجم ثابت، مما يسمح لنموذج التعلم العميق بمعالجة الصور بشكل أكثر كفاءة. وتتضمن الخطوة الثانية التطبيع، الذي يحول قيم البكسل إلى نطاق عددي موحد ويسهل تقارب النموذج. أما الخطوة الثالثة فتتضمن إزالة الضجيج، حيث يتم تنقية الصور من الضجيج غير المرغوب فيه لتحسين التعرف على الأنماط. بالإضافة إلى ذلك، وفيما يخص مجموعة بيانات Miao Batik، يتم تحديد مناطق الزخارف الثقافية، مما يسمح بتوليد أقنعة تُستخدم في وحدة التقسيم للنموذج المقترح، لضمان الحفاظ على الزخارف الثقافية أثناء التوليد. والمخرج النهائي لهذه المرحلة هو مجموعة بيانات نظيفة جاهزة لتدريب وحدات التقسيم والتوليد في النموذج المقترح.

سير عمل معالجة صور الأعمال الفنية: إدخال مجموعة البيانات، تغيير الحجم، التسوية، إزالة الضجيج، وتوصيف العناصر الزخرفية.
الشكل 3سلسلة معالجة البيانات المسبقة لصور التراث الثقافي. مخطط لسير العمل يوضح إجراءات المعالجة المسبقة للصور المطبقة قبل تدريب النموذج. يتضمن المسار الحصول على مجموعة البيانات، وتغيير حجم الصور، والتطبيع، وإزالة الضجيج بطريقة غاوس، وتوصيفات الزخارف الثقافية الموجودة، وإعداد أقنعة التجزئة. تُستخدم الصور والأقنعة المعالجة الناتجة كمدخلات للتجزئة الدلالية وإعادة بناء الأنماط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

خضعت كل صورة لعملية مراقبة الجودة قبل تدريب النموذج. تضمنت مجموعة بيانات Miao Batik ١٥,١٤٨ صورة. وقد قام منشئو مجموعة البيانات الأصليون بالفعل بمعالجة العينات التالفة والمكررة ومنخفضة الجودة؛ لذا، لم يتم استبعاد أي صور إضافية أثناء فحص مراقبة الجودة في هذه الدراسة. وبناءً على ذلك، تم الاحتفاظ بجميع الصور البالغ عددها ١٥,١٤٨ للتحليل. حُمِّلت الصور بتنسيق RGB أثناء المعالجة المسبقة، وتم تغيير حجمها إلى 256 × 256 بكسل باستخدام الاستيفاء الثنائي الخطي (bilinear interpolation). تم تغيير مقياس قيم البكسل من النطاق [0, 255] إلى [0, 1] عن طريق القسمة على 255. ثم تم تطبيق التطبيع لكل قناة (Channel-wise normalization) باستخدام قيم متوسط [0.485, 0.456, 0.406] وقيم انحراف معياري [0.229, 0.224, 0.225] للقنوات الحمراء والخضراء والزرقاء على التوالي. شمل مسار المعالجة المسبقة تحميل الصور، والتحويل إلى RGB، وتغيير الحجم، وتغيير مقياس قيم البكسل، والتطبيع، والتحويل إلى تنسيق الموتر (tensor conversion). وعندما لزم الأمر، تم تحويل الصور ذات التدرج الرمادي إلى تنسيق RGB ثلاثي القنوات للحفاظ على التوافق مع نماذج التعلم العميق (DL). وبعد المعالجة المسبقة، قُسمت الصور إلى مجموعات فرعية للتدريب والتحقق والاختبار. استخدمت جميع مراحل إطار عمل SegCycle-SPADE — بما في ذلك التجزئة الدلالية، ودمج الميزات، وإعادة بناء الزخارف، والتخليق الفني القائم على SPADE — دقة إدخال ثابتة قدرها 256 × 256 بكسل.

تقسيم الأنماط الدلالية باستخدام SegFormer
بعد خطوة المعالجة المسبقة هذه، يتم إدخال الصور المنظفة والموحدة من مجموعة بيانات زخارف باتيك مياو (Miao Batik) ومجموعة بيانات WikiArt في وحدة التقسيم الدلالي بناءً على الإطار المقترح SegFormer-B2. والغرض من هذه الخطوة هو تحديد وفصل الزخارف الثقافية الموجودة في الأنماط التراثية بشكل صحيح. يعتمد الإطار المقترح لـ SegFormer على بنية محول (transformer) تدمج مشفر محول هرمي ومفكك شفرة MLP خفيف الوزن لالتقاط المعلومات السياقية العالمية والمعلومات الهيكلية التفصيلية من الأنماط التراثية المعقدة بدقة. يقوم النموذج أولاً باستخراج تمثيلات الميزات بمقاييس متعددة من الصورة المدخلة، يلي ذلك دمج هذه التمثيلات من خلال مفكك الشفرة لإنشاء أنماط مقسمة بدقة. ويضمن ذلك تقسيم الأنماط في الصورة التراثية بشكل صحيح إلى زخارف مثل الأنماط الهندسية، والأنماط النباتية، والأنماط الرمزية، وبالتالي فصلها عن الخلفية مع الحفاظ على سلامتها الهيكلية. تُستخدم هذه المعلومات الهيكلية لاحقاً خلال المراحل اللاحقة من توليد الأنماط ضمن إطار عمل SegCycle-SPADE.

لتكن الصورة المدخلة التي تمت معالجتها مسبقاً ممثلة كـ المعادلة 6:

تمثيل رياضي لخصائص الصورة؛ معادلة؛ تدوين الفضاء البعدي \(I_p \in \mathbb{R}^{H \times W \times C}\).    (6)

يقوم مشفر SegFormer بتقسيم الصورة إلى رقع واستخراج الميزات الهرمية باستخدام طبقات المحول (transformer)، كما هو موضح في المعادلة 71:

تمثل الصيغة F=Encoder(Ip) عملية ترميز في طريقة حوسبية.

هنا، ف تشير إلى خرائط السمات متعددة المقاييس التي تم الحصول عليها من مشفّر المحوّل (transformer encoder). وتشفّر هذه السمات كلًا من أنماط النسيج المحلية والعلاقات السياقية العالمية بين مناطق الزخارف (motif regions). ويستخرج نموذج SegFormer خرائط سمات بمقاييس مختلفة كما هو محدد في المعادلة 8:

معادلة التوازن الساكن، F={F1,F2,F3,F4}، تعبير رياضي، القوى في دراسة الفيزياء

يُسهِّل استخدام التمثيلات متعددة المقاييس اكتشاف أنماط ذات أحجام مختلفة ضمن الزخارف الثقافية. وأخيرًا، يتم دمج الميزات باستخدام مفكك شفرة MLP كما هو موضح في المعادلة 91:
 معادلة عملية فك تشفير الإشارة باستخدام دالة فك التشفير؛ تمثيل المعادلة الرياضية.

هنا، يشير S إلى خريطة التجزئة النهائية المتوقعة.

تم تهيئة العمود الفقري لنموذج SegFormer-B2 باستخدام أوزان مُدربة مسبقاً على ImageNet، ثم تم ضبطه بدقة لاحقاً على مجموعة بيانات Miao Batik لتقسيم الزخارف الثقافية. تم الحصول على نقطة التحقق المُدربة مسبقاً من التنفيذ الرسمي لنموذج SegFormer. وتحديداً، تم استخدام نقطة التحقق MIT-B2 المُدربة مسبقاً على ImageNet-1K (mit_b2.pth) والمقدمة من مستودع SegFormer الرسمي لتهيئة العمود الفقري لنموذج SegFormer-B2 قبل عملية الضبط الدقيق. وتتوافق الأوزان المُدربة مسبقاً مع العمود الفقري MIT-B2 الذي أصدره مؤلفو SegFormer، وعملت كنموذج تهيئة للتدريب على التقسيم الدلالي. أما الطبقات المتبقية الخاصة بالمهمة، فقد تم تهيئتها باستخدام إجراءات تهيئة الأوزان الافتراضية في PyTorch قبل البدء في التدريب.

تستخدم البنية الهندسية مشفراً ترانسفورمر (Transformer encoder) هرمياً مكوناً من أربع مراحل مع تضمينات رقع متداخلة (overlapping patch embeddings). في المرحلة الأولية، تم تحديد حجم الرقعة بـ 7 × 7 مع خطوة إزاحة (stride) قدرها 4. وبالنسبة لكل مرحلة من مراحل التشفير الأربعة، كانت أبعاد التضمين 64، و128، و320، و512. وعلى مدار المراحل الأربعة، كان هناك 1، و2، و5، و8 رؤوس انتباه ذاتي متعددة الرؤوس (multihead self-attention heads)، وكانت أعماق المشفّر المقابلة 3، و4، و6، و3 طبقات. وتم تجميع الميزات متعددة المقاييس المستخرجة من المشفّر باستخدام مفك تشفير (decoder) خفيف الوزن يعتمد كلياً على الملحق متعدد الطبقات (all-MLP). وقبل إنشاء خريطة التجزئة النهائية، قام مفك التشفير بإسقاط الميزات من كل مرحلة تشفير في فضاء تضمين واحد. واستخدمت جميع كتل الترانسفورمر دالة تنشيط الوحدة الخطية للخطأ الغاوسي (GELU). كما تم استخدام معدل إسقاط (dropout rate) قدره 0.1 أثناء التدريب لتحسين التعميم وتقليل الإفراط في التخصيص (overfitting).

خلال مرحلة التدريب، يتلقى إطار عمل SegFormer الصور التي تمت معالجتها مسبقاً من كلتا مجموعتي البيانات. تحتوي الصور المستمدة من مجموعة بيانات Miao Batik على مناطق زخرفية تعمل كعلامات (labels) للتعلم الخاضع للإشراف لنموذج التجزئة. يقوم مشفر Transformer بمعالجة الصورة بأكملها والتقاط العلاقات طويلة المدى بين مكونات الصورة، وهو أمر بالغ الأهمية خاصة لأنماط الباتيك التقليدية التي تحتوي على زخارف موزعة مكانياً. كما تعمل آلية استخراج الميزات الهرمية في الوقت ذاته على التقاط البنى المحلية مثل الأنسجة الهندسية المتكررة. ويقوم مفكك رموز MLP بمعالجة هذه الميزات المستخرجة وإنتاج قناع تجزئة يبرز المناطق الزخرفية. وتُستخدم خرائط التجزئة الناتجة خلال هذه المرحلة لاحقاً كمدخلات هيكلية لوحدة الانتباه ومرحلة إعادة بناء الأنماط، مما يساعد بالتالي في الحفاظ على أصالة الأنماط المولدة.

قُسِّمت الزخارف الثقافية إلى فئات مختلفة للتجزئة الدلالية وفقاً لخصائصها البصرية والثقافية. وشمل تصنيف التجزئة الزخارف الحيوانية (مثل الفراشات والأسماك والطيور وغيرها من الحيوانات الرمزية)، والزخارف النباتية (مثل الزهور والأوراق والكروم والأنماط النباتية)، والزخارف الهندسية (مثل الأشكال المتكررة والحدود والهياكل الهندسية التجريدية)، بالإضافة إلى مناطق الخلفية التي تمثل المساحات غير المزخرفةة. استُخدمت أقنعة تجزئة على مستوى البكسل لتعيين كل بكسل إلى إحدى الفئات المحددة مسبقاً. وقد رُمزت التسميات الصحيحة على النحو التالي: التسمية 0 = الخلفية، التسمية 1 = الزخارف الحيوانية، التسمية 2 = الزخارف النباتية، والتسمية 3 = الزخارف الهندسية. تم الحصول على تعليقات التجزئة وتسميات الزخارف مباشرة من المصدر الأصلي لمجموعة بيانات Miao Batik. ولم يتم إجراء أي عمليات تعليق يدوي إضافية، أو إعادة تسمية، أو تحقق من الحدود، أو إجراءات تأكيد من قبل خبراء في هذه الدراسة. واستُخدمت التعليقات الموجودة التي قدمها منشئو مجموعة البيانات دون تعديل لأغراض التدريب والتقييم.

يقوم نموذج SegFormer لتجزئة الزخارف الثقافية بمعالجة الصور التي تم تحضيرها مسبقاً من مجموعة بيانات Miao Batik ومجموعة بيانات WikiArt باستخدام آلية قائمة على المحولات (transformer) للكشف الدقيق عن مناطق الأنماط الثقافية، كما هو موضح في الشكل 4. أولاً، يتم تزويد نموذج SegFormer بالصورة المدخلة التي تحتوي على الزخارف الثقافية التقليدية. ويقوم مشفر المحول (Transformer encoder) باستخراج المعلومات السياقية العالمية والميزات الهيكلية المحلية من رقع الصور. ثم يتم توفير الميزات متعددة المقاييس الناتجة إلى مفكك التجزئة (segmentation decoder)، الذي يستخدم شبكة تغذية أمامية مختلطة (Mix Feed-Forward Network) لتحسين تمثيلات الميزات ورفع كفاءة الكشف عن الزخارف. وتكون مخرجات نموذج SegFormer عبارة عن قناع تجزئة يبرز البكسلات المقابلة للأنماط الثقافية مع حجب معلومات الخلفية غير ذات الصلة. بعد ذلك، تعمل الأنماط الثقافية المعزولة كإرشاد هيكلي للمراحل اللاحقة من إطار عمل SegCycle-SPADE.

مخطط عملية التجزئة باستخدام SegFormer مع مشفرات المحولات (transformer encoders) لتحليل الصورة المدخلة.
الشكل 4التجزئة الدلالية للزخارف الثقافية استناداً إلى نموذج SegFormer-B2. بنية وحدة التجزئة الدلالية SegFormer-B2 المستخدمة لاستخراج الزخارف الثقافية، والتي تم تدريبها حصرياً على مجموعة بيانات باتيك مياو (Miao Batik). يتكون الإطار من مشفر يعتمد على محول (Transformer) لاستخراج السمات متعددة المقاييس، وفك تشفير تجزئة خفيف الوزن لتوليد أقنعة الزخارف. يتنبأ النموذج بأربع فئات دلالية هي: حيوان، ونبات، وهندسي، وخلفية؛ حيث تحدد أقنعة التجزئة الناتجة مناطق الزخارف ذات الأهمية الثقافية مع تثبيط معلومات الخلفية غير ذات الصلة. وتوفر مخرجات التجزئة هذه توجيهاً هيكلياً لمراحل دمج السمات، وإعادة البناء، والتوليف الفني اللاحقة في إطار عمل SegCycle-SPADE المقترح. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

لا توجد حاجة لإنشاء تعليقات توضيحية جديدة للتجزئة في الإطار المقترح. لقد تم الحصول على مجموعة بيانات باتيك مياو (Miao Batik) من مصدر عام متاح بالفعل، وتم تدريب النموذج باستخدام معلومات الزخارف ذات الصلة التي قدمها منشئو مجموعة البيانات. وخلال عملية التعلم، أنتج نموذج SegFormer خرائط تجزئة دلالية. ونتيجة لذلك، لم تتطلب الدراسة الحالية أي برامج إضافية للتعليق التوضيحي اليدوي، أو إرشادات للتعليق التوضيحي، أو إجراءات لمراقبة جودة التعليقات التوضيحية.

وحدة CAFFM
لتحسين التفاعل بين سمات التجزئة الدلالية وتمثيلات إعادة البناء التوليدية، اقترحت الدراسة أيضاً وحدة CAFFM. يوفر مشفر SegFormer-B2 خرائط سمات دلالية لوحدة CAFFM، بينما توفر خطوة إعادة البناء باستخدام CycleGAN خرائط سمات توليدية. أولاً، تُستخدم طبقات إسقاط خطية لإسقاط تدفقي السمات في فضاء تضمين مشترك. ولحساب الانتباه المتقاطع، يتم إنشاء تمثيلات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) باستخدام موترات السمات المولدة. بعد ذلك، يتم نمذجة العلاقات بين معلومات الزخارف الهيكلية وعناصر الأسلوب الفني باستخدام الانتباه المتقاطع متعدد الرؤوس. ثم تُطبق عملية تسوية الطبقات، والوصلات المتبقية، وطبقات التغذية الأمامية مع تنشيط GELU على تمثيلات السمات المدمجة. وتتلقى مرحلة التوليف القائمة على SPADE مخرجات وحدة CAFFM، مما يسمح بالحفاظ على الموضوعات ذات الدلالة الثقافية دون التضحية بالتماسك الفني.

لضمان توافق الميزات، يتم أولاً إسقاط ميزات الإدخال باستخدام طبقات إسقاط خطية على فضاء تضمين مشترك بأبعاد تضمين تبلغ 256. ثم يتم نمذجة الترابطات بين المعلومات الهيكلية الدلالية وتمثيلات الأسلوب التوليدي باستخدام آلية الانتباه المتقاطع متعدد الرؤوس (MultiHead Cross-Attention) بثمانية رؤوس انتباه. وتستخدم حسابات الانتباه المتقاطع متجهات الاستعلام (Q)، والمفتاح (K)، والقيمة (V) التي يتم إنتاجها بواسطة طبقات تحويل خطية محددة. ولزيادة استقرار التدريب والحفاظ على سلامة الميزات، يتم استخدام الوصلات المتبقية (residual connections) وتطبيع الطبقة (Layer Normalization) لتعزيز تمثيلات الميزات المدمجة بشكل أكبر. بعد ذلك، يتم تحسين تعلم الميزات غير الخطية من خلال تطبيق شبكة تغذية أمامية ذات دالة تنشيط الوحدة الخطية لخطأ غاوس (GELU). ويقوم النموذج بتوليد تمثيل ميزات مخرجات بأبعاد 256 يتم إرسالها إلى مراحل أخرى من أجل التركيب الإبداعي. ينجح نموذج CAFFM في دمج بيانات الأسلوب الفني مع هياكل الزخارف الثقافية باستخدام تقنية دمج قائمة على الانتباه المتقاطع، مما يعزز الحفاظ على الزخارف والتماسك البصري في أنماط التراث الثقافي المعاد بناؤها.

في النظام المقترح، يتم اشتقاق السمات الهيكلية من مجموعة بيانات Miao Batik، بينما يتم تعلم السمات الأسلوبية من مجموعة بيانات WikiArt. ليكن خريطة السمات المشتقة من شبكة تقسيم SegFormer باستخدام صور من مجموعة بيانات Miao Batik يرمز لها بـ Fs، بينما يرمز لخريطة السمات المشتقة من فرع استخراج السمات الأسلوبية باستخدام صور WikiArt بـ Fa. يدمج نموذج CAFFM المقترح بين مجالي السمات باستخدام آلية الانتباه المتقاطع (cross-attention mechanism) لتعلم كل من التبعيات الهيكلية والأسلوبية للأنماط الثقافية. يوضح الجدول 3 جميع الخصائص المعمارية، بما في ذلك أبعاد التضمين، وطبقات التسوية، ودوال التنشيط، وتكوين رؤوس الانتباه. بالنسبة لحجم صورة مدخلة يبلغ 256 × 256 بكسل، أنتج المشفر SegFormer-B2 خرائط سمات دلالية بحجم 64 × 64 × 128، بينما أنتج فرع استخراج السمات الأسلوبية خرائط سمات بحجم 64 × 64 × 128. وقد تم إسقاط كلتا خريطتي السمات عبر طبقات خطية قابلة للتعلم إلى فضاء تضمين مشترك ببعد 256 قبل عملية الدمج بالانتباه المتقاطع.

المَعلَمالتكوين
الإطار المقترحSegCycle-SPADE
نموذج التجزئة الدلاليةSegFormer-B2
مراحل مشفر SegFormer4
تهيئة الأوزانSegFormer-B2 مُدرب مسبقاً على ImageNet-1K (العمود الفقري MIT-B2)
مصدر نقطة التحققالمستودع الرسمي NVIDIA SegFormer (https://github.com/NVlabs/SegFormer)؛ نقطة التحقق: segformer.b2.512x512.ade.160k
استراتيجية الضبط الدقيقضبط دقيق شامل (End-to-end) على مجموعة بيانات Miao Batik
حجم تضمين الرقعة7 × 7
خطوة الرقعة4
أبعاد التضمين64 و128 و320 و512
أعماق المشفر3 و4 و6 و3
رؤوس الانتباه1 و2 و5 و8
نوع مفكك الترميزمفكك ترميز All-MLP
دالة التنشيطGELU
معدل التسرب0.1
وحدة تعزيز الميزاتوحدة دمج الميزات الثقافية عبر الانتباه المتبادل (CAFFM)
بعد تضمين CAFFM256
رؤوس انتباه CAFFM8
مقاييس دمج CAFFM4
نموذج إعادة البناءCycleGAN
نموذج توليد النمطSPADE
مجموعة البيانات الثقافيةمجموعة بيانات Miao Batik
مجموعة بيانات النمطمجموعة بيانات WikiArt
صور Miao Batik15,148
صور WikiArtحوالي 80,000
دقة الصورة المدخلة256 × 256 بكسل
تنسيق الألوانRGB
طريقة الاستيفاءالاستيفاء الثنائي الخطي (Bilinear Interpolation)
طريقة إزالة الضجيجالترشيح الغاوسي (Gaussian Filtering)
حجم النواة الغاوسية5 × 5
سيجما الغاوسية (σ)1
نطاق التطبيع[0, 1]
حجم الدفعة16
عدد الدورات (Epochs)100
المُحسِّنAdam
معدل التعلم0.0002
معاملات Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, اضمحلال الوزن = 0
دوال الخسارةخسارة التجزئة، الخسارة التنافسية، خسارة الاتساق الدوري، خسارة إعادة البناء، خسارة الحفاظ على الزخارف، وخسارة اتساق النمط
استراتيجية تقسيم مجموعة البياناتتدريب / تحقق / اختبار
مجموعة التدريب70%
مجموعة التحقق15%
مجموعة الاختبار15%
البذرة العشوائية42
مقاييس التقييمدقة التجزئة، IoU، معامل Dice، SSIM، PSNR، وFID
لغة البرمجةPython 3.8.10
إطار التعلم العميقPyTorch 1.10.0
المنصة العتاديةوحدة معالجة الرسوميات NVIDIA RTX 3090 (ذاكرة VRAM بسعة 24 GB)، معالج Intel Core i7 (الجيل الحادي عشر)، ذاكرة RAM بسعة 32 GB
بيئة التشغيلUbuntu 20.04 LTS

الجدول 3: الإعداد التجريبي وتكوين النموذج. ملخص للمكونات المعمارية، وتكوين التدريب، وإعدادات المعالجة المسبقة، ومجموعات البيانات، ومعاملات التحسين، ومقاييس التقييم، والبيئة الحوسبية المستخدمة في تنفيذ وتقييم إطار عمل SegCycle-SPADE المقترح.

تقوم وحدة الانتباه أولاً بتحويل خريطة الميزات إلى تمثيلات الاستعلام (query)، والمفتاح (key)، والقيمة (value) باستخدام Equation 10:

معادلة آلية المتجه: Q=FsWq, K=FsWk, V=FsWv؛ مخطط للتحليل في دراسة فيزيائية.

هنا، تعتبر Wq و Wk و Wv مصفوفات أوزان قابلة للتعلم. ويتم حساب أوزان الانتباه بناءً على التشابه بين متجه الاستعلام ومتجه المفتاح باستخدام المعادلة 1117

صيغة آلية الانتباه A=Softmax(QKᵀ/√dₖ)، طريقة التعلم العميق، معادلة.

هنا، دكـ هو بُعد متجه المفتاح. ويتم حساب تمثيل السمات المحسّن عن طريق ضرب أوزان الانتباه في مصفوفة القيمة باستخدام المعادلة 12:

معادلة حساب القوة، \( F_a = A \cdot V \)، من اشتقاق صيغة فيزيائية.

هنا، يمثل Fa التمثيل المعزز للميزات لخريطة الميزات. ويتم حساب التمثيل المعزز للميزات عن طريق دمج ميزات التجزئة الأصلية مع الميزات المعززة التي تم الحصول عليها باستخدام آلية الانتباه وفقًا لـ المعادلة 13:

معادلة التوازن الساكن: Fe=Fs+Fa. تعبير رياضي لتحليل توازن القوة.                                

هنا، فهـ تُستخدم خريطة السمات المُحسَّنة لإعادة بناء الأنماط. ويتم توسيع وحدة CAFFM بآلية انتباه متقاطع متعددة المقاييس لاستخلاص سمات الزخارف الثقافية بمقاييس مختلفة. لنفترض أن فsi تحديد سمات التجزئة وفق المقياس iبينما فaج يشير إلى سمات النمط الفني عند المقياس نفسه. ويتم تحديد التمثيل النهائي للسمات باستخدام المعادلة ١٤:

  معادلة آلية الانتباه في الشبكات العصبية، ΣAttention(Q,K,V)، صيغة رياضية.

هنا، تمثل Qi وKi وVi مصفوفات الاستعلام (query)، والمفتاح (key)، والقيمة (value) عند المقياس i على التوالي، بينما يشير N إلى عدد مقاييس الميزات. في هذه الدراسة، N = 4، وهو ما يقابل خرائط الميزات المستخرجة عند دقة مكانية تبلغ 1/4 و1/8 و1/16 و1/32 من حجم الصورة المدخلة. وقد تم دمج تمثيلات الميزات متعددة المقاييس هذه باستخدام أوزان انتباه قابلة للتعلم قبل مرحلتي إعادة البناء والتركيب الفني. يتيح هذا التوسع للمنهجية استخلاص الزخارف الثقافية والأنسجة العالمية لإعادة بناء الأنماط الثقافية. يقع موديل CAFFM بين مرحلة التجزئة القائمة على SegFormer ومرحلة التركيب الإبداعي القائمة على SPADE في نظام SegCycle-SPADE المقترح. أولاً، بينما يقوم CycleGAN بإنشاء ميزات إعادة البناء التي تحتوي على معلومات متعلقة بالأسلوب والنمط بشكل متزامن، يعمل SegFormer-B2 على استعادة خرائط الميزات الدلالية التي تصف الخصائص الهيكلية للزخارف الثقافية. يستقبل موديل CAFFM هذين التدفقين من الميزات ويستخدم الدمج القائم على الانتباه المتبادل (cross-attention) لتحديد العلاقات بين التمثيلات الهيكلية والفنية. ومن أجل إنشاء أنماط ثقافية أصيلة مع الحفاظ على الاتساق الدلالي والميزات الهيكلية، يتم إرسال خرائط الميزات المدمجة الناتجة بعد ذلك إلى موديل SPADE لإجراء تركيب إبداعي موجه بالتجزئة.

إعادة بناء الأنماط باستخدام CycleGAN
بمجرد الانتهاء من مرحلة تعزيز السمات القائمة على الانتباه، ستتضمن خرائط السمات هياكل الزخارف الثقافية المعززة. ومع ذلك، قد تظل خرائط السمات تحتوي على مناطق أنماط غير مكتملة أو تالفة. لذلك، ولمعالجة مشكلة إعادة بناء الأنماط، سيستخدم الإطار المقترح نموذج CycleGAN. وفي هذا الإطار المقترح، سيكون النطاقان هما أنماط الزخارف الثقافية الأصلية وأنماط الزخارف الثقافية المعاد بناؤها. وباستخدام السمات المعززة من المراحل السابقة، سيقوم نموذج CycleGAN بإعادة بناء الأنماط الثقافية مع الحفاظ على الاتساق الهيكلي. وهذا سيضمن احتفاظ الأنماط الثقافية، مثل الأنماط الهندسية والأنماط النباتية والأنماط الرمزية، بترتيبها المكاني. وقد خضعت صور باتيك مياو (Miao Batik) الأصلية لعمليات قناع عشوائي وحجب جزئي لتوليد زخارف ثقافية غير مكتملة أو تالفة. وقد حاكت إجراءات التدهور هذه مناطق الأنماط المفقودة والتلف الهيكلي الملاحظ عادةً في القطع الأثرية للتراث الثقافي المتدهورة. استُخدمت الصور المتدهورة كمدخلات لوحدة إعادة البناء، بينما كانت الصور الأصلية المقابلة بمثابة صور مرجعية لتقييم الأداء وتقدير جودة إعادة البناء. وقد مكنت هذه الاستراتيجية النموذج من تعلم استعادة هياكل الزخارف المفقودة مع الحفاظ على الاتساق الدلالي والخصائص الثقافية.

لنفترض أن X يمثل نطاق الأنماط الثقافية غير المكتملة و Y يمثل نطاق الأنماط الثقافية المعاد بناؤها. يتعلم المولدان تنفيذ تعيين ثنائي الاتجاه باستخدام المعادلة 15:

 تطابقات رياضية؛ الدوال GF:X→Y، FM:Y→X؛ مخطط المعادلة؛ تعيين جبري.

هنا، يُستخدم GE لإعادة بناء هياكل الزخارف (motif structures) ويُستخدم FM لربط الأنماط مرة أخرى بالمجال الأصلي. وتُستخدم الخسارة التنافسية (adversarial loss) لضمان أن تكون الأنماط المعاد بناؤها واقعية (المعادلة 16)30

معادلة دالة الخسارة لشبكة GAN، صيغة لتحليل التحسين، كلمات مفتاحية لأغراض البحث.

هنا، يمثل DY المميز المستخدم للتمييز بين الأنماط الحقيقية والمعاد بناؤها، بينما يشير GE(x) إلى النمط المعاد بناؤه والموّلد. كما يفرض نموذج CycleGAN اتساق الدورة للحفاظ على التخطيط الهيكلي للزخارف الثقافية (المعادلة 17)30.

معادلة توضح دالة الفقد لاتساق الدورة في النموذج التوليدي؛ الصيغة بالتدوين الرياضي.

تُعرَّف دالة الخسارة النهائية باستخدام المعادلة 1830:

معادلة الخسارة الكلية لتحسين شبكات GAN في تعلم الآلة.

هنا، ترمز λi إلى معامل الوزن الخاص بخسارة الاتساق الدوري (cycle-consistency loss)، وقد تم ضبطه على القيمة 10 أثناء التدريب، بما يتوافق مع صياغة CycleGAN الأصلية. وقد تم اختيار هذه القيمة لتحقيق التوازن بين التعلم التنافسي واتساق إعادة البناء بين النطاقين المصدر والهدف.

تتكون وحدة إعادة بناء CycleGAN من مولدين ومميزين لترجمة الصور ثنائية الاتجاه. يتبع كل مولد بنية الشبكة المتبقية (residual-network) التي تضم طبقة تلافيف أولية بحجم 7 × 7، تليها طبقتان تلافيفيتان لتقليل العينات، وتسعة كتل متبقية، وطبقتان لزيادة العينات. تعتمد جميع العمليات التلافيفية حجم نواة 3 × 3، باستثناء طبقة الإدخال التي تستخدم نواة 7 × 7 لتعزيز استخراج الميزات. يتم تطبيق التطبيع المثيلي (Instance Normalization) بعد كل طبقة تلافيفية لتحسين استقرار التدريب، بينما تُستخدم دالة التنشيط ReLU في جميع أنحاء شبكة المولد. وتستخدم طبقة المخرجات دالة تنشيط Tanh لتوليد مخرجات صور مُطبعة. أما المميز فيتبع بنية PatchGAN بحجم 70 × 70 تتكون من سلسلة من الطبقات التلافيفية بأحجام نواة 4 × 4 وقنوات ميزات تزداد تدريجياً. ويُستخدم التطبيع المثيلي وتنشيط LeakyReLU (الميل السالب = 0.2) في المميز لتحسين تمييز الميزات والتعلم التنافسي. تستقبل وحدة CycleGAN صور الزخارف الثقافية التي تمت معالجتها مسبقاً كمدخلات وتولد تمثيلات لأنماط مُعاد بناؤها، والتي تُرسل لاحقاً إلى CAFFM لدمجها مع ميزات التجزئة. تم إجراء تدريب CycleGAN باستخدام مُحسن Adam (β₁ = 0.5, β₂ = 0.999) بمعدل تعلم أولي قدره 0.0002. تم الحفاظ على معدل التعلم هذا لأول 100 حقبة (epochs)، ثم انخفض خطياً إلى الصفر على مدى فترة التدريب المتبقية. واستُخدم مخزن مؤقت للإعادة (replay buffer) يحتوي على 50 صورة تم توليدها سابقاً لتحقيق استقرار تدريب المميز. تم تحديث المولدات والمميزات بنسبة تحديث 1:1، حيث يلي كل تحديث للمولد تحديث واحد للمميز خلال كل تكرار تدريبي.

تعتمد عملية إعادة البناء في نموذج CycleGAN على خرائط السمات المحسنة التي تم الحصول عليها باستخدام آلية CAFFM الموضحة في الشكل 5. تحتوي خرائط السمات على زخارف ثقافية محسنة تم استخلاصها من مراحل التجزئة وآلية CAFFM السابقة. تُستخدم خرائط السمات هذه كمدخلات للمولد الأول GE، حيث يتعلم المولد الأول GE عملية المطابقة اللازمة لإعادة بناء الأنماط الثقافية. بعد ذلك، يتم تمرير المخرجات إلى المميز DY للتمييز بين الأنماط الثقافية الحقيقية والأنماط المعاد بناؤها. ويساعد المميز DY المولد GE على إنتاج مخرجات واقعية. ولضمان عدم تشوه الأنماط الثقافية أثناء عملية إعادة البناء، يقوم المولد الثاني FM بإجراء مطابقة اتساق الدورة (cycle-consistency mapping)، حيث يقوم المولد الثاني FM بمطابقة المخرجات وإعادتها إلى النطاق الأصلي. ثم يتم تقييم هذه المخرجات بواسطة المميز لضمان واقعيتها. وفي الختام، تُرسل المخرجات النهائية إلى وحدة SPADE لتوليد النمط الفني في المرحلة التالية من إطار عمل SegCycle-SPADE المقترح.

عملية إعادة بناء النمط، مخطط يتضمن المولد G، والمميز Dy، وتحقق اتساق الدورة.
الشكل 5. سير عمل إعادة بناء الأنماط القائم على CycleGAN. سير عمل وحدة إعادة البناء باستخدام CycleGAN. تُقدم تمثيلات الميزات المعززة بالانتباه كمدخلات لشبكة المولد لإعادة بناء الزخارف الثقافية غير المكتملة. ويقوم المميز بتقييم المخرجات المعاد بناؤها مقابل الأنماط المرجعية، بينما يحافظ تخطيط اتساق الدورة على السلامة الهيكلية أثناء ترجمة الصور ثنائية الاتجاه. ومن ثم تُرسل الزخارف المعاد بناؤها إلى وحدة SPADE لتركيب النمط الفني. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

توليد النمط الفني باستخدام SPADE
بعد ذلك، تخضع الزخارف الثقافية المعاد بناؤها إلى وحدة SPADE لتوليد النمط الفني. الهدف الرئيسي من وحدة SPADE هو إضافة أنسجة غنية بصرياً من النمط الفني إلى الزخارف الثقافية المعاد بناؤها دون المساس بالمخطط الهيكلي لهذه الزخارف. وتعد وحدة SPADE تقنية لتوليد الصور المشروطة تعتمد على مفهوم تقسيم الصور لتوليد الصور. وقد تم ترميز خرائط دلالية متعددة القنوات تتوافق مع فئات الزخارف المحددة مسبقاً من أقنعة التقسيم الدلالي الناتجة عن SegFormer-B2. واستقبل مولد SPADE هذه الخرائط المرمزة كمدخلات شرطية. كما تم إنتاج معاملات القياس التكيفي مكانيًا (γ) والانحياز (β) من خلال معالجة الخرائط الدلالية عبر طبقات تلافيفية داخل كل طبقة SPADE. وهكذا، تمكن المولد من الحفاظ على حدود الزخارف، والمخططات الهيكلية، والمعلومات الدلالية أثناء التخليق الفني عن طريق تطبيق هذه المعاملات على تنشيطات الميزات المُطبعة. وقد استطاع التوجيه الدلالي التأثير على كل من إعادة البناء الهيكلي رفيع المستوى وتخليق الأنسجة منخفض المستوى، نظراً لأن عملية التكييف تمت في عدة طبقات من مولد SPADE. ونتيجة لذلك، دمجت الأنماط الفنية المبتكرة سمات أسلوبية مُكتسبة من مجموعة بيانات WikiArt مع الحفاظ على هياكل الزخارف الثقافية التي عُثر عليها خلال مرحلة التقسيم.

تم استخدام مجموعة بيانات WikiArt، التي تضم أعمالاً من 27 فئة فنية مختلفة — مثل عصر النهضة، والانطباعية، والتكعيبية، والتعبيرية، والسريالية، والواقعية، والفن التجريدي — كمورد رئيسي لفهم الأساليب الفنية. ومن أجل تعريض النموذج لمجموعة متنوعة من السمات الإبداعية وتعزيز تعميم النمط، تم اختيار صور الأنماط عشوائياً من الفئات المختلفة أثناء التدريب. كما تم تقسيم مجموعة البيانات إلى مجموعات فرعية للتدريب والتحقق والاختبار مع تمثيل متوازن للفئات الفنية من أجل تقليل الانحياز للنمط. ولضمان التمثيل المتوازن لجميع الفئات الفنية الـ 27، تم استخدام أخذ العينات الطبقية؛ حيث خُصصت العينات من كل فئة بشكل نسبي لمجموعات التدريب والتحقق والاختبار مع الحفاظ على التوزيع الأصلي للفئات. واستُخدمت وحدة CAFFM لدمج جوانب النمط المستمدة من صور WikiArt مع ميزات إعادة البناء الناتجة عن CycleGAN. ومن أجل السماح لشبكة التصنيع بنقل الخصائص الفنية مع الحفاظ على البنية الدلالية وحدود الزخارف الثقافية المستمدة من خرائط التجزئة، تم تزويد التمثيلات المدمجة الناتجة كمعلومات شرطية لمولد SPADE. وقد تمكن الإطار المقترح من إنتاج أنماط فنية أصيلة ثقافياً مع تمثيلات هيكلية ونمطية متسقة بفضل تقنية تكييف النمط هذه.

كما يقدم SPADE معاملات تكيفية مكانياً تعتمد على خريطة التجزئة. ويمكن تعريف هذه المعاملات كما هو موضح في المعادلة 191:

y = γ(S)x̂ + β(S)، معادلة.

هنا، يمثل γ(S) معامل المقياس المتغير مكانيًا ويمثل β(S) معامل الانحياز المتغير مكانيًا. يمكن لهذه المعاملات أن تساعد المولد في إنشاء أنسجة وأنماط مختلفة اعتمادًا على المنطقة الدلالية في الصور. ويمكن تحديد العمل الفني الثقافي النهائي كما هو موضح في المعادلة 20:

 مخطط المعادلة العامة، I_gen = G_E(X^P_r, SM)، موضح للنمذجة الرياضية.

هنا، تمثل GE مولد SPADE، وتمثل XrP النمط المعاد بناؤه، وتمثل SM خريطة التجزئة. يحافظ العمل الفني النهائي على السلامة الهيكلية للزخارف الثقافية مع تعزيز المظهر الفني. وقد استُخدمت دالة فقدان مركبة توازن بين دقة التجزئة الدلالية، والحفاظ على الزخارف الثقافية، وجودة إعادة بناء النمط، واتساق الأسلوب الفني لتحسين بنية SegCycle-SPADE المقترحة. ولتحديد هدف التدريب العام، استُخدم مزيج موزون من فقدان التجزئة (Lseg)، والفقدان التنافسي (Ladv)، وفقدان اتساق الدورة (Lcycle)، وفقدان إعادة البناء (Lrecon)، وفقدان الحفاظ على الزخارف (Lmotif)، وفقدان اتساق الأسلوب (Lstyle). وتُعرف دالة الفقدان الإجمالية في المعادلة 21:

صيغة معادلة الفقد الكلي في تعلم الآلة، بمصطلحات التقسيم وإعادة البناء.  (21)

لضمان الاتساق الهيكلي بين الزخارف الثقافية المدخلة والمعاد بناؤها، تم ضبط معامل فقدان الاتساق الدوري عند 10. وللحفاظ على الميزات الدقيقة للزخارف وتعزيز الدقة البصرية، تم ضبط معامل فقدان إعادة البناء عند 5. ومن أجل إبراز الحفاظ على الأنماط الهيكلية الجوهرية ثقافياً أثناء التركيب الفني، استُخدم معامل قدره 2 لفقدان الحفاظ على الزخارف. وبغرض تعزيز نقل الأسلوب الفني دون تشويه هياكل الزخارف الدلالية بشكل مفرط، تم تعديل معامل فقدان اتساق الأسلوب إلى 1. وللحفاظ على مساهمة متوازنة بين إنتاج صور واقعية وتقسيم دقيق للزخارف، أُعطيت أوزان متساوية لفقدان التقسيم والفقدان التناقضي. واستُخدمت تمثيلات الأسلوب القائمة على الميزات من مجموعة بيانات WikiArt لحساب فقدان اتساق الأسلوب. وبشكل خاص، تم التقاط سمات الأسلوب الفني باستخدام ارتباطات مصفوفة Gram المستمدة من خرائط الميزات العميقة. وحُسب فقدان الأسلوب باستخدام فرق معيار فروبينوس (Frobenius norm) بين مصفوفات Gram لصورة الأسلوب المستهدفة والصورة المولدة، كما هو موضح في المعادلة ٢٢:

معادلة فقدان النمط، \(L_{\text{style}}\)، المستخدمة في تحليل صيغة الشبكة العصبية والتعلم العميق.

هنا، جيرجى تقديم النص الذي ترغب في ترجمته. هل تُحسب مصفوفة غرام (Gram matrix) من الـ يرجى تزويدي بالنص المصدر الذي ترغب في ترجمته.th طبقة الميزات، Iجين يرمز إلى الصورة الفنية المُنشأة، Iالأسلوب يرمز إلى صورة النمط المستهدفة من مجموعة بيانات WikiArt، و و تشير إلى معيار فروبينيوس (Frobenius norm). وتمكّن هذه الصيغة الإطار المقترح من الحفاظ على الخصائص الفنية مع الإبقاء على السلامة البنيوية والدلالية للزخارف الثقافية.

تُستخدم تمثيلات الميزات المدمجة التي ينتجها نموذج CAFFM كمدخلات شرطية لنموذج SPADE، والذي يعمل كمكون للتخليق الفني في الإطار المقترح. يتكون مولد SPADE من سبع كتل متبقية من نوع SPADE ببعد ميزات كامن يبلغ 256 قناة، ويقوم بتوليد صور مخرجة بدقة 256 × 256 بكسل. تُستخدم خرائط التجزئة الدلالية التي تم الحصول عليها من نموذج SegFormer–CAFFM كمدخلات شرطية عبر الطبقات المتبقية لـ SPADE. تُطبق طبقات SPADE قبل دوال التنشيط داخل كل كتلة متبقية، مما يتيح التكييف الدلالي الموجه بالتجزئة. ومن خلال عمليات الرفع التصاعدي والالتفاف المتتالية، يتم تحسين تمثيل الميزات الكامنة تدريجياً لتوليد أنماط فنية عالية الدقة مع الحفاظ على الاتساق الدلالي وبنية الزخارف. تُستخدم دوال تنشيط LeakyReLU في جميع أنحاء المولد، بينما تُطبق دالة تنشيط Tanh عند طبقة المخرجات لإنتاج صور مُطبعة.

الخوارزمية وسير العمل
يدمج إطار عمل SegCycle-SPADE كلاً من التجزئة الدلالية، ودمج الميزات، وإعادة بناء الأنماط، وتوليف النمط الفني ضمن مسار تدريب موحد. يبدأ سير العمل بالحصول على مجموعة البيانات ومعالجتها مسبقاً، بما في ذلك تغيير حجم الصور، والتطبيع، وإزالة الضجيج، وإعداد أقنعة التجزئة. بعد ذلك، تُعالج الصور التي تمت معالجتها مسبقاً باستخدام شبكة التجزئة SegFormer-B2 لاستخراج تمثيلات الزخارف الدلالية. ثم تُدمج ميزات التجزئة الناتجة مع ميزات إعادة البناء من خلال وحدة CAFFM، مما يتيح التفاعل بين معلومات الزخارف الهيكلية وتمثيلات الميزات الفنية. بعد ذلك، تُقدم خرائط الميزات المدمجة إلى وحدة إعادة البناء CycleGAN، التي تعمل على استعادة هياكل الزخارف الثقافية غير المكتملة مع الحفاظ على الاتساق الدلالي. ثم تُمرر الأنماط المعاد بناؤها إلى مولد SPADE لإجراء توليف فني موجه بالتجزئة، مما يسمح بالتعزيز الأسلوبي مع الحفاظ على حدود الزخارف والأصالة الهيكلية. وأثناء التدريب، يتم تحسين معاملات النموذج باستخدام دالة الخسارة المركبة الموضحة في المعادلتين 21 و22، والتي توازن بين دقة التجزئة، والحفاظ على الزخارف، وجودة إعادة البناء، واتساق النمط الفني. يتوفر سير عمل تفصيلي للتنفيذ خطوة بخطوة، يتضمن تحميل مجموعة البيانات، والمعالجة المسبقة، وتهيئة النموذج، وتكرارات التدريب، وإجراءات التحقق، واختيار نقاط التحقق، والتقييم النهائي، في الملف التكميلي 1 (الخوارزمية 1). تم تنفيذ سير العمل الخوارزمي الكامل باستخدام حجم دفعة (batch size) قدره 16، ومعدل تعلم 0.0002، و100 حقبة تدريب (epochs). استُخدمت بذرة عشوائية ثابتة بقيمة 42 لتقسيم مجموعة البيانات، وتهيئة النموذج، وجميع تجارب التدريب. طُبقت هذه البذرة بشكل متسق عبر مولدات الأرقام العشوائية في Python وNumPy وPyTorch لضمان إمكانية إعادة إنتاج النتائج. تم تكوين مُحسِّن Adam بحيث تكون β₁ = 0.5 وβ₂ = 0.999، مع عدم وجود اضمحلال للأوزان (weight decay = 0). تم اختيار نقاط تحقق النموذج بناءً على أعلى درجة IoU تحقق منها في مجموعة بيانات التحقق.

تحسين دالة الخسارة
للحفاظ على هياكل الزخارف الثقافية أثناء عملية إعادة البناء والتركيب الفني، يستخدم الإطار المقترح هدف تحسين مركب يجمع بين خسائر التجزئة، والخسائر التنافسية، واتساق الدورة، وإعادة البناء، والحفاظ على الزخارف، واتساق الأسلوب. تتوفر الصيغة الرياضية الكاملة، ومعاملات الترجيح، وتعريف خسارة الأسلوب في المعادلتين 21 و22 ضمن القسم الفرعي توليد الأسلوب الفني باستخدام SPADE. ويعمل مكون الحفاظ على الزخارف على معاقبة الانحرافات الهيكلية بين مناطق الزخارف المتوقعة وأقنعة التجزئة المرجعية المقابلة، مما يشجع على الحفاظ على هياكل الأنماط ذات الدلالة الثقافية طوال عملية إعادة البناء.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

تم تقييم إطار عمل SegCycle-SPADE المقترح باستخدام مجموعتي بيانات: مجموعة بيانات الزخارف الثقافية لـ Miao Batik ومجموعة بيانات WikiArt. تحتوي مجموعة بيانات Miao Batik على صور من التراث الثقافي التقليدي واستُخدمت بشكل أساسي في مهام التقسيم الدلالي وإعادة البناء الهيكلي، بينما تحتوي مجموعة بيانات WikiArt على أنماط فنية متنوعة واستُخدمت لتعلم وتوليد الأنماط الفنية. تمت معالجة الصور من كلتا المجموعتين من خلال مسار عمل SegCycle-SPADE الكامل، بما يشمل التقسيم الدلالي، وCAFFM، وإعادة بناء الأنماط، وتوليد الأنماط الفنية القائمة ع...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

لقد حظي حفظ وإعادة البناء الرقمي لأنماط التراث الثقافي غير المادي (ICH) باهتمام متزايد في السنوات الأخيرة بسبب الفقدان التدريجي للحرف التقليدية. وقد حاولت الدراسات السابقة معالجة فقدان التراث الثقافي من خلال تقنيات معالجة الصور القائمة على التعلم العميق (DL). فعلى سبيل المثال، اقترح Quan et al.32 إطار عمل للحفاظ على التراث الثقافي يعتمد على الرسوم البيانية للمعرفة والتعلم العميق لثقافة الباتيك لشعب مياو في غويتشو. ورغم أن الدراسة ركزت على إعادة البناء الرقمي للأنماط الثقافية، إلا أن منهجيتها اعتمد...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

تضارب المصالح:
يعلن المؤلفون عن عدم وجود أي تضارب في المصالح.

شكر وتقدير

يقر المؤلفون بالدعم الأكاديمي والمؤسسي المقدم من كلية قوانغدونغ المتعددة التقنيات وجامعة جنوب الصين العادية خلال إتمام هذا البحث. وقد حظي هذا البحث بدعم المشروع العام لصندوق العلوم الاجتماعية الوطني لعام 2023 (رقم 23BH161)، بعنوان “متحف التجديد الرقمي: بحث في تفعيل وتوصيل الآثار الثقافية للخط والرسم الصيني الكلاسيكي.”

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
مُحسِّن Adamمكتبة PyTorch OptimizerAdamخوارزمية تحسين مستخدمة أثناء تدريب النموذج.
مجموعة أدوات CUDAشركة NVIDIACUDA 11.3تسريع وحدة معالجة الرسوميات (GPU) لحسابات التعلم العميق.
cuDNNشركة NVIDIAcuDNN 8.2مكتبة تسريع الشبكات العصبية العميقة المستخدمة لتسريع التدريب والاستدلال.
CycleGANجامعة كاليفورنيا، بيركلي / مصدر مفتوحتنفيذ PyTorch الرسمي (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)شبكة تنافسية توليدية مستخدمة لإعادة بناء الزخارف الثقافية.
أوزان ImageNet مسبقة التدريبImageNet / مصدر مفتوحmit_b2.pth (نقطة فحص ImageNet-1K مسبقة التدريب)تُستخدم لتهيئ العمود الفقري لنموذج SegFormer-B2 قبل الضبط الدقيق على مجموعة بيانات Miao Batik.
معالج Intelشركة IntelIntel Core i7 (الجيل الحادي عشر)وحدة المعالجة المركزية (CPU) المستخدمة في المعالجة المسبقة للصور، ودعم تدريب النموذج، والاستدلال.
Matplotlibفريق تطوير MatplotlibMatplotlib 3.5.1تصور منحنيات التدريب ونتائج التقييم.
مجموعة بيانات Miao Batikمستودع ZenodoDOI: 10.5281/zenodo.20807658مجموعة بيانات للزخارف الثقافية تحتوي على 15,148 صورة مستخدمة للتقسيم الدلالي وإعادة بناء الأنماط.
NumPyمطورو NumPyNumPy 1.21.5الحسابات العددية ومعالجة مجموعة البيانات.
وحدة معالجة الرسوميات NVIDIAشركة NVIDIANVIDIA RTX 3090 (24 GB VRAM)المنصة العتادية المستخدمة لتدريب النموذج والاستدلال.
OpenCVمؤسسة OpenCVOpenCV 4.5.5المعالجة المسبقة للصور، وتغيير الحجم، والاستكمال، وإزالة الضجيج باستخدام مرشح غاوس.
نظام التشغيلشركة Canonical Ltd.Ubuntu 20.04 LTSبيئة التنفيذ التجريبية.
Pillow (PIL)مكتبة صور بايثونPillow 8.4.0تحميل الصور ومعالجتها.
Pythonمؤسسة برمجيات بايثونPython 3.8.10لغة البرمجة المستخدمة في التنفيذ والتجريب.
PyTorchMeta AIPyTorch 1.10.0إطار عمل التعلم العميق المستخدم لتدريب النموذج والاستدلال.
البذرة العشوائيةالإعداد التجريبي42بذرة ثابتة مستخدمة لتقسيم مجموعة البيانات، وتهيئة النموذج، وقابلية تكرار التجربة.
Scikit-learnمطورو Scikit-learnScikit-learn 1.0.2تقسيم مجموعة البيانات، والتحليل الإحصائي، ومقاييس التقييم.
Seabornمجتمع المصادر المفتوحةSeaborn 0.11.2تصور البيانات الإحصائية.
SegFormer-B2أبحاث NVIDIA / مصدر مفتوحSegFormer-B2 (MIT-B2 Backbone)نموذج تقسيم دلالي يعتمد على المحولات (Transformer) مستخدم لتقسيم الزخارف الثقافية.
أقنعة التقسيم / التعليقات التوضيحيةمجموعة بيانات Miao Batikمدرجة مع مجموعة البياناتتسميات التقسيم الدلالي على مستوى البكسل مستخدمة لتصنيف الزخارف والتدريب.
SPADEأبحاث NVIDIA / مصدر مفتوحتنفيذ PyTorch الرسمي (https://github.com/NVlabs/SPADE)نموذج توليد صور موجه بالتقسيم مستخدم لإنشاء أنماط فنية.
TorchVisionMeta AITorchVision 0.11.1أدوات معالجة الصور وتحويلات مجموعات البيانات المستخدمة مع PyTorch.
مجموعة بيانات WikiArtWikiArthttps://www.wikiart.org/مجموعة بيانات للأنماط الفنية تحتوي على أكثر من 80,000 عمل فني عبر 27 نمطاً فنياً، مستخدمة لتعلم الأنماط وتوليدها.

المراجع

  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

الوسوم

SegCycle SPADE SegFormer CycleGAN