مقالة بحثية

الهوية الأنثوية والتخيل الطبقي في لوحات التصدير الصينية من عهد أسرة تشينغ: دراسة بمساعدة الذكاء الاصطناعي في التأويل عبر الثقافات

21 مشاهدة

DOI:

10.3791/73462

سبتمبر 18, 2026

في هذه المقالة

ملخص

تقدم هذه المقالة سير عمل حوسبي خاضع لإشراف بشري لفحص التمثيلات المتكررة للنساء في 433 لوحة صينية تصديرية من عصر أسرة تشينغ. وتتميز الأنماط الموجودة ضمن هذه المجموعة بسبع فئات مرجعية بشرية وإشارات بصرية متكررة، بينما تظل النتائج محصورة في الصور التي تم أخذ عينات منها ولا تقيس الواقع الاجتماعي أو الاستقبال التاريخي لعصر تشينغ.

الملخص

بحثت هذه الدراسة في التمثيلات المتكررة للهوية الأنثوية والإشارات البصرية الدالة على الطبقة الاجتماعية في مجموعة مكونة من 433 لوحة تصدير صينية من عهد أسرة تشينغ تعود للفترة ما بين 1757 و1911. دمج سير العمل بين نموذج CLIP ViT-B/32 للتصنيف الأولي، والتحديد الموضعي بمساعدة نموذج Segment Anything Model (SAM)، وتقليل الأبعاد والتجميع، والترميز الأيقوني اليدوي بواسطة اثنين من المرمّزين المستقلين. استُخدمت تسميات CLIP للتنظيم الأولي، وعمل SAM كأداة مساعدة في التحديد الموضعي، بينما وفر الترميز البشري المحكّم الفئات المرجعية. حددت النتائج الإجمالية سبع فئات مرجعية بشرية: النخبة/الجمال (n = 112)، والعمالة (n = 72)، والمنزلية (n = 64)، والخادمة (n = 58)، والطقوس/الزفاف (n = 45)، والسوق (n = 43)، والأداء (n = 39). تطابقت التسميات الحسابية الأولية مع التسميات المرجعية البشرية في 356 من أصل 433 لوحة (82.2%)، مع تراوح معدل الاسترجاع على مستوى الفئة بين 73.3% و88.4%. واستُخدمت التوليفات المتكررة من الملابس، والإعداد المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية المصورة لتوصيف السمات البصرية لهذه الفئات. أسفر تقييم 433 زوجاً من تسميات الذكاء الاصطناعي والبشر على مستوى الحالات عن درجات دقة واسترجاع ومقياس F1 شاملة على مستوى الفئة، إلى جانب مصفوفة ارتباك تفصل أنماط التصنيف. ودعم التحقق من التجمعات حل التجميع المختار وأظهر تطابقاً بين التجمعات المشتقة والفئات المرجعية المحددة بشرياً. وبشكل عام، تشير التوليفات المتكررة للملابس والإعداد المكاني والأشياء والوضعية والعلاقات الاجتماعية إلى أنماط من التصنيفات التصويرية داخل المجموعة المختارة. وتوصّف هذه النتائج التمثيل البصري في لوحات التصدير الصينية في عهد أسرة تشينغ، ولكن لا ينبغي تفسيرها على أنها مقاييس مباشرة للوضع القانوني، أو الخبرة المعيشية، أو طلب السوق، أو الاستقبال الأجنبي التاريخي.

المقدمة

شكلت لوحات التصدير الصينية من عصر سلالة تشينغ جزءاً من الشبكات التجارية والثقافية التي ربطت مدينة كانتون ومراكز التجميع الأخرى بالمشترين الأوروبيين والأمريكيين بدءاً من أواخر القرن الثامن عشر1,2,3,4,5. وقد اقتنى التجار والمسافرون والدبلوماسيون والمبشرون وجامعو المقتنيات هذه اللوحات كسلع محمولة، وتذكارات، ومصادر للمعلومات المرئية، وتمثيلات للأماكن والمهن والإنتاج والعادات والأنماط الاجتماعية. لذا، فإن تداول هذه اللوحات عكس ممارسات الورش الصينية وتوقعات الأسواق الخارجية على حد سواء.

لقد فضل الطلب الخارجي الموضوعات المعروفة، والتنسيقات المتسلسلة، والزخارف المتكررة، والمشاهد التي يمكن جمعها ومقارنتها. وقامت الورش بتكييف الوسائط والمقياس والتكوين والموضوعات لغرض البيع، بينما فضل المشترون غالباً التصويرات الواضحة للمهن والمراسم والتصميمات الداخلية والحدائق والشوارع والأنماط الاجتماعية الخلابة. وتُظهر النسخ المتكررة لمشاهد ورش كانتون بشكل أكبر كيف قام الفنانون والمساعدون بتكييف الأيقونات والأدوات التصويرية الغربية للمترزقين من الخارج1,2,3,4,5. وعلى الرغم من أن طلب السوق قد يكون قد أثر على ما تم إنتاجه والحفاظ عليه، إلا أن المجموعة الحالية لا تقيس بشكل مباشر تفضيلات المشترين الأفراد أو استجاباتهم.

وبناءً على ذلك، يجب اعتبار هذه اللوحات مصادر انتقائية ووسيطة بدلاً من كونها سجلات شاملة للحياة اليومية. فقد تقوم مشاهدها بتصوير الممارسات الاجتماعية بشكل مثالي، أو مبسط، أو معياري، أو معدل من خلال اتفاقيات الورش الفنية، واختيارات السوق، واقتناء المتاحف، والفهرسة، والرقمنة1,2,3,4,5. ويجب أن يفرق التفسير التاريخي بين السمات التي يمكن ملاحظتها مباشرة في اللوحات وبين الاستنتاجات المتعلقة بالأفراد الممثلين، وظروف الإنتاج، والمعاني التي نسبها المشاهدون لاحقاً إلى هذه الأعمال.

توفر الأشكال النسائية وسيلة مركزة لفحص هذا التمييز. حيث يمكن للملابس، وتصفيفة الشعر، والوضعية، والإطار المكاني، والأشياء، والأنشطة، والعلاقات مع الشخصيات الأخرى أن تصنف النساء ضمن أدوار متكررة بصرياً، بما في ذلك فئات النخبة/الجمال، والمنزلية، والخادمات، والعاملات، والسوق، والأداء، والطقوس/الزفاف. وتُعد هذه الفئات أوصافاً تحليلية لأنماط تصويرية، ولا تحدد هي بذاتها الرتبة القانونية، أو الثروة، أو المهنة، أو العرق، أو الانتماء إلى الـ Banner أو الـ Han، أو السلوك الأخلاقي، أو الهوية المعيشية.

يمكن لتاريخ الفن الرقمي والرؤية الحاسوبية تسهيل إجراء مقارنات واسعة النطاق للمجموعات البصرية الرقمية، بينما تتيح في الوقت ذاته الفحص النقدي للافتراضات المضمنة في النماذج الحسابية6,7. كما يمكن لنماذج الرؤية واللغة أن تساعد في تحديد وتنظيم الزخارف البصرية المتكررة، رغم أن التحيز الثقافي لا يزال يمثل قيداً هاماً عند تطبيق مفردات النماذج المعاصرة على الصور التاريخية غير الغربية8. وبالمثل، تظهر الأبحاث الحسابية ذات الصلة بالرسم الصيني التقليدي قيمة الجمع بين الكشف الكمي عن الأنماط والتفسير المستنير تاريخياً9.

تتناول هذه الدراسة ثلاثة أسئلة: (1) ما هي فئات الهوية الأنثوية المرمزة بشرياً والمحكومة التي تم تمثيلها في مجموعة البيانات؟ (2) ما هي مجموعات الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية التي تميز هذه الفئات؟ (3) كيف تختلف دقة المطابقة التامة الإجمالية واسترجاع مستوى الفئة عبر الفئات السبع؟ يعتمد سير العمل على النهج الحسابية المطبقة على الرسم الصيني التقليدي9، مع قصر ادعاءاته التاريخية على الصور التي تم أخذ عينات منها والتحليلات الموثقة.

تتمثل المساهمة المنشودة في جانبين: تأريخي وتقني. إذ يمكن للمقارنة على مستوى المجموعة الكاملة أن تحدد الصيغ التصويرية المتكررة التي يمكن سياقها لاحقاً من خلال تحليل تاريخي دقيق. ومن شأن هذا النهج أن يثري الأبحاث المتعلقة بالنوع الاجتماعي، والتسلسل الهرمي، وتمثيلات الحياة اليومية، واللقاءات العابرة للثقافات، دون اعتبار تكرار الصورة دليلاً على الانتشار الاجتماعي، أو التشابه البصري برهاناً على التطابق التاريخي.

البروتوكول

تصميم الدراسة ووحدة التحليل
تم التعامل مع كل لوحة أو سجل كتالوج كوحدة تحليل واحدة. استُخدم تصميم رصدي قائم على مجموعة بيانات (corpus-based)، يجمع بين مراجعة البيانات الوصفية، والتنظيم الحسابي الأولي، والترميز اليدوي المستقل، والتفسير التاريخي الفني. حُددت فترة الدراسة من 1757–1911، وطُبقت معايير الاشتمال والاستبعاد ضمن هذا الإطار الزمني. حُللت الأعمال الفنية التاريخية والبيانات الوصفية المرتبطة بكتالوجاتها. وعند مقارنة التوزيعات عبر فترات زمنية متفاوتة المدة، تم تطبيع الأعداد بناءً على مدة الفترة، مع مراعاة تحيزات البقاء والاستحواذ المحتملة في التفسير.

بناء المجموعة المختارة واختيارها
تم استرجاع السجلات المرشحة من كتالوجات المتاحف المذكورة، والأرشيفات الرقمية، والكتالوجات المنشورة. وبالنسبة لكل سجل مرشح، تم الاحتفاظ بالمؤسسة، والعنوان، والتاريخ أو النطاق الزمني، والوسيط، ورقم القيد أو الكتالوج، ورابط المصدر الثابت، وتاريخ الاسترجاع، وبيان الحقوق. كما تم الحفاظ على روابط المصادر حتى عندما تعذر قانونياً إعادة توزيع ملف الصورة المقابل. بدأت إجراءات الفرز المذكورة بـ 612 صورة مرشحة؛ من بين هذه الصور، تم استبعاد 85 صورة لأنها وقعت خارج الفترة الزمنية 1757–1911 أو خارج تقليد لوحات التصدير، واستبعاد 58 صورة لأنها كانت نسخاً حديثة، أو سجلات غير واضحة، أو صورت موضوعات غير صحيحة، واستبعاد 29 صورة لافتقارها إلى شخصية أنثوية يمكن تحديدها أو لعدم كفاية دقة الصورة، واستبعاد 7 صور بسبب نقص البيانات الوصفية. وتكونت المجموعة التحليلية النهائية من 433 سجلاً.

توحيد البيانات الوصفية والمعالجة المسبقة للصور
تم تخصيص معرف QEP مستقر لكل لوحة في المجموعة التحليلية النهائية، يتراوح من QEP_001 إلى QEP_433. كما تم الاحتفاظ بالبيانات الوصفية للمتاحف المرتبطة بها، بما في ذلك المؤسسة، ورقم التسجيل، والعنوان، والتاريخ، والوسيط أو المواد المستخدمة، ومكان المنشأ، ورابط المصدر، ووصف الكتالوج المتاح. ولأغراض التحليل البصري، تم تسجيل التصنيف الأولي للذكاء الاصطناعي، والفئة البشرية المحكمة، وعدد الشخصيات النسائية، والفئة العمرية، والوضعية، والملابس، والإطار المكاني، والأشياء المرتبطة، والعلاقات الاجتماعية. تم تصنيف كل لوحة ضمن واحدة من سبع فئات رئيسية: النخبة/الجمال، أو المنزلية، أو الخدم، أو العمالة، أو السوق، أو الأداء، أو الطقوس/الزفاف. وفي المشاهد التي تحتوي على شخصيات نسائية متعددة، تم تحديد الشخصية المركزية بناءً على البروز البصري والمركزية السردية. وعندما لم تكن هناك شخصية نسائية واحدة مهيمنة، تم تعيين الفئة الرئيسية بناءً على النشاط المصور الأساسي وسياق المشهد العام. وتم حل تداخل الفئات من خلال إعطاء الأولوية للنشاط المصور وسياق المشهد على الملابس أو المظهر وحدهما. كما تمت مراجعة الحالات الغامضة بشكل مستقل من قبل كلا المرمزيْن وحُسمت من خلال التوافق. حُفظت الصور المصدر بتنسيق JPEG أو PNG، واقتصر القص على حدود صفحات الويب أو إطارات الكتالوجات أو الهوامش غير الصورية. ولم يتم إعادة بناء المحتوى المرسوم، أو تغيير ألوانه، أو تحسينه، أو ترميمه.

التوسيم الأولي القائم على CLIP
استُخدم مشفر الصور CLIP ViT-B/32 لتحليل التشابه الأولي بين الصور والنصوص9. شملت مصطلحات الهوية المرشحة: امرأة من النخبة، امرأة منزلية، خادمة، امرأة عاملة، امرأة في السوق، فنانة، عروس، وامرأة في طقوس شعائرية. وشملت مصطلحات المشهد: تصميم داخلي صيني، حديقة، سوق شعبي، ورشة عمل، إنتاج الشاي، أعمال النسيج، ومشهد احتفالي. تم الاحتفاظ بالمجموعة الكاملة من قوالب الأوامر، وترتيبها، وأي تجميع للأوامر، وإجراءات تطبيع النصوص، وقواعد اتخاذ القرار، ودرجات الثقة، والحالات المتساوية لكل صورة.

تم تطبيق القائمة الكاملة للمطالبات بشكل متسق على جميع الصور باستخدام نموذج OpenAI CLIP ViT-B/32 المُنفذ بلغة Python 3.10 مع PyTorch 2.0.1 وحزمة OpenAI CLIP. وقد أُجري الاستدلال على وحدة معالجة رسومات (GPU) تدعم تقنية CUDA بحجم دفعة قدره 32 وباستخدام دقة FP32. تم تغيير حجم كل صورة وقصها من المركز لتصبح 224 × 224 بكسل، وجرى تطبيع قنوات RGB باستخدام تحويل المعالجة المسبقة المرتبط بنموذج ViT-B/32. كما صِيغت المطالبات النصية باستخدام واصفات الهوية والمشهد المحددة أعلاه، ثم شُفرت بواسطة مشفر النصوص الخاص بـ CLIP. وحُسب تشابه جيب التمام (Cosine similarity) بين تضمينات الصور والنصوص المُطبعة، وتم تعيين المطالبة ذات أعلى درجة تشابه كملصق أولي للذكاء الاصطناعي. كما تم الاحتفاظ بدرجات التشابه لجميع الملصقات المرشحة للمراجعة البشرية اللاحقة. واستُخدمت بذرة عشوائية ثابتة بقيمة 42، وطُبقت إجراءات المعالجة المسبقة وقوالب المطالبات وقواعد القرار المتطابقة على جميع اللوحات البالغ عددها 433 لوحة.

التحديد الموضعي بمساعدة نموذج SAM
استُخدم نموذج Segment Anything Model (SAM) بدقة لتحديد المواقع الموضعية للأشكال، والملابس، والأثاث، والأدوات، والأشياء الطقسية، والمناطق المعمارية لغرض الفحص البصري البشري. ويجب التأكيد على أن نموذج SAM لم يشارك في مسار التصنيف؛ حيث عُزلت أقنعته، ومقاطعه، والميزات المشتقة منه عن عمليات تسمية CLIP والتجميع (clustering)، مما يضمن أن تطبيق SAM قد وفر وسائل مساعدة في التحديد الموضعي دون التأثير على أداء التصنيف أو تضخيمه.

تم تطبيق مطالبات النقاط اليدوية أو مربعات الإحاطة عند الضرورة لتحسين تحديد مواقع العناصر المرئية. تم إنشاء أقنعة SAM للأشكال النسائية، والملابس، والأثاث، والأدوات، والأشياء الطقسية، والعناصر المعمارية، وتم فحص كل نتيجة تقسيم بصرياً للتأكد من التغطية الإقليمية المناسبة. دعمت الأقنعة الناتجة عملية تحديد ومراجعة السمات الأيقونية ذات الصلة، ولكن لم يتم استخدامها لتصنيف CLIP أو تعيين الفئات.

تقليل الأبعاد والتجميع
تم حساب تضمينات صور CLIP، واستُخدم UMAP مع مسافة الجيب التمام (cosine distance) للتصوير ثنائي الأبعاد10. كما تم تسجيل التمثيل المستخدم للتجميع، إلى جانب إجراءات المعالجة المسبقة، والأبعاد، وتعريف المسافة.

تم تطبيق تجميع الوسائل K-means والتجميع الهرمي على تمثيلات سمات الصور لتحديد المجموعات البصرية المتكررة ضمن مجموعة النصوص11. وتم تقييم حلول K-means المرشحة لـ k = 5–9 باستخدام معامل الصورة الظلية (silhouette coefficient) ومؤشر ديفيز-بولدين (Davies–Bouldin index). استُخدم تهيئة K-means++ مع n_init = 10 و max_iter = 300 و tol = 1 × 10⁻4 و random_state = 42. كما أُجري التجميع الهرمي باستخدام التجميع التراكمي مع الربط المتوسط ومسافة جيب التمام. تمت مقارنة الحلول المرشحة باستخدام مؤشرات التحقق الكمية، واستقرار المجموعات، والقابلية للتفسير من منظور تاريخ الفن، واختير حل التجميع النهائي بناءً على تمثيله الأكثر تماسكاً للأنماط البصرية المتكررة. تم الاحتفاظ بتعيين المجموعات الناتج لكل لوحة من اللوحات البالغ عددها 433 لوحة لإجراء مقارنة لاحقة مع الفئات التي تم ترميزها بشرياً.

الترميز اليدوي، والتدريب، والتحكيم
قام مرمزّان بمراجعة جميع الصور الـ 433 بشكل مستقل باستخدام دليل ترميز مُصنّف يغطي الفئة الأساسية، وعدد الأشكال، والفئة العمرية، والوضعية، والملابس، والإطار المكاني، والأشياء، والعلاقات الاجتماعية. وقد تم الاحتفاظ بالسجلات الخاصة بكل مرمز قبل عملية التحكيم. وكان لدى المرمزّين خلفيات ذات صلة في تاريخ الفن والتحليل البصري، وتم تدريبهم باستخدام دليل الترميز الموحد وأمثلة ممثلة من مجموعة اللوحات. وقبل البدء في الترميز الرسمي، أتم المرمزّان تمرين معايرة شمل 30 لوحة لتعزيز التفسير المتسق لفئات الهوية السبع وأبعاد الإشارات البصرية الخمس.

أثناء عملية الترميز الرسمي، قام المرمزان بتقييم جميع اللوحات المؤهلة بشكل مستقل، مع تعمية كل منهما عن قرارات الترميز الخاصة بالآخر، وعلامات الذكاء الاصطناعي الأولية، وتوزيعات المجموعات. وتم تقييم الموثوقية بين المرمزين باستخدام معامل كابا لكوهين (Cohen’s kappa). بلغت قيمة كابا الملحوظة لفئة الهوية الأساسية 0.88، بينما تراوحت متغيرات الإشارات المرئية الفئوية بين 0.79 و 0.92، مما يدل على وجود اتفاق قوي بين المرمزين. وتم حل الخلافات من خلال المناقشة والتوافق، وسُجلت رموز الفئات والإشارات المرئية التي تم الفصل فيها للتحليل اللاحق12. كما تم الاحتفاظ بالعلامات ما قبل الفصل.

التوافق بين الذكاء الاصطناعي والبشر وتقدير الأداء
استُخدمت الفئة البشرية المحكمة كمرجع للمقارنة الوصفية مع تسمية واحدة أولية من الذكاء الاصطناعي لكل لوحة. وحُسبت دقة التطابق التام الإجمالية بنسبة 356/433 (82.2%). كما حُسب استرجاع الفئة بقسمة عدد تطابقات الذكاء الاصطناعي والبشر التامة على دعم المرجع البشري لكل فئة. وتم ذكر دعم الفئة، والتطابقات التامة، وعدم التطابق، والمقامات المقابلة لها بشكل صريح.

بناءً على 433 زوجاً من التصنيفات البشرية والآلية على مستوى الحالات، تم حساب الإيجابيات الكاذبة للفئات المستهدفة، ودقة كل فئة، والاستدعاء، ودرجات F1. كما تم إنشاء مصفوفة ارتباك كاملة لتحليل أنماط التصنيف خارج القطر الرئيسي، والتي وجهت لاحقاً عملية مراجعة عدم التطابق، وتوثيق تصنيف الأخطاء، وقواعد الفصل في النزاعات.

حزمة ومواد قابلية التكرار
تم تنظيم سير العمل الحسابي ومواد البحث الداعمة في مستودع خاضع للتحكم في الإصدار. صُممت حزمة قابلية التكرار لتشمل نصوصاً برمجية للمعالجة المسبقة، وتحليل CLIP، وتحديد موقع SAM، وUMAP، والتجميع، وتحليل الاتفاق، وإنشاء الأشكال، جنباً إلى جنب مع دليل الترميز اليدوي، وملفات التكوين، ومعلومات التبعيات، والمخرجات المشتقة على مستوى الحالة، وقائمة جرد مقروءة آلياً لمصادر الصور ومعلومات الحقوق. وقد تم تعيين معرف دائم لمواد البحث المؤرشفة لتسهيل عملية التكرار وإعادة الاستخدام.

تم استخدام Microsoft Excel 2021 لتنظيم وإدارة البيانات الوصفية. واعتمدت التحليلات الحسابية على نموذج CLIP ViT-B/32 للتوسيم الأولي للرؤية واللغة، ونموذج SAM لتحديد مواقع العناصر المرئية، وتقنية UMAP مع مسافة جيب التمام (cosine distance) لتقليل الأبعاد، بالإضافة إلى خوارزميتي K-means والتجميع الهرمي لتحليل الأنماط الاستكشافية. وتم تقييم حلول التجميع باستخدام معامل السلوت (silhouette coefficient) ومؤشر ديفيز-بولدين (Davies–Bouldin index)، كما تم تقييم الاتفاق بين المرمّزين باستخدام معامل كابا لكوهين (Cohen’s kappa). وقد تم توثيق بيئة البرمجيات، وإعدادات النماذج، والضبط الحسابي، والبذور العشوائية المستخدمة طوال سير العمل لدعم إمكانية إعادة إنتاج النتائج.

النتائج

بناء المدونة والتكوين الوصفي
يقدم الشكل 1 نظرة عامة على المدونة مكونة من أربعة أقسام. يوضح الشكل 1A عملية الفرز المسجلة من 612 سجلاً مرشحاً إلى 433 سجلاً مستبقياً. ويعرض الشكل 1B أمثلة ممثلة للوسائط والتنسيقات. كما يقدم الشكل 1C أعداد السجلات عبر أربعة فترات زمنية، بينما يلخص الشكل 1D تكوين المصدر والوسيط في المدونة. ونظراً لأن الفترات الزمنية تمتد عبر مدد غير متساوية، فإن هذه الأعداد تصف تكوين المدونة التي تم أخذ عينات منها، ولا ينبغي تفسيرها على أنها معدلات إنتاج تاريخية.

يلخص الجدول 1 الخصائص الإجمالية لمجموعة البيانات. حيث شملت مجموعات المتاحف 302 سجلاً، والأرشيفات الرقمية 81 سجلاً، والكتالوجات المنشورة 50 سجلاً. كما صُنفت الوسائط إلى ألوان مائية مخصصة للتصدير (n = 176)، ورسومات على ورق النخاع (n = 112)، وأوراق ألبومات مخصصة للتصدير (n = 83)، ورسوم شخصية (n = 41)، وتنسيقات أخرى (n = 21). وصُنفت البيانات الوصفية إلى كاملة (n = 288)، أو جزئية (n = 118)، أو محدودة (n = 27). كما صُنفت الشخصيات النسائية إلى مركزية (n = 214)، أو ثانوية (n = 102)، أو متعددة (n = 117). وقد اشتملت كل كتلة تصنيفية على جميع السجلات الـ 433.

التصنيفات الأولية للذكاء الاصطناعي وفئات المرجع البشري
يلخص الجدول 2 الاتفاق الإجمالي بين التصنيفات الأولية التي أنشأها الذاء الاصطناعي وفئات المرجع البشري عبر 433 لوحة، بينما يوفر الجدول التكميلي 1 التصنيفات الأولية للذكاء الاصطناعي المقابلة على مستوى كل حالة، وتصنيفات المرمّزين، وفئات المرجع البشري التي تم البت فيها، وحالة المطابقة، وتعيينات العناقيد. وبشكل عام، تطابقت تصنيفات الذكاء الاصطناعي والمرجع البشري في 356 لوحة، وهو ما يعادل دقة مطابقة تامة بلغت 82.2%. وقد حُسبت نسبة الاسترجاع على مستوى الفئة كنسبة المطابقات التامة بين الذكاء الاصطناعي والبشر بالنسبة إلى دعم المرجع البشري لكل فئة.

تراوح الاسترجاع على مستوى الفئة بين 73.3% لمشاهد الطقوس/الزفاف (33/45) و88.4% للنخبة/الجمال (99/112). وكان الاسترجاع 84.7% للعمل الشاق (61/72)، و82.1% للأداء (32/39)، و79.7% للمنزل (51/64)، و79.3% للخدم (46/58)، و79.1% للسوق (34/43). وبشكل عام، بلغ الاتفاق الدقيق 356/433 (82.2%). وقد أتاح تقييم الأزواج على مستوى الحالة حساب درجات الدقة وF1 عبر جميع الفئات السبع، حيث تراوحت الدقة بين 74.5% و89.2%، بينما تراوحت درجات F1 بين 0.75 و0.88. تتوفر مصفوفة ارتباك شاملة توضح الإيجابيات الكاذبة للفئات المستهدفة والأنماط خارج القطر في الشكل التكميلي 1.

ملخصات الأنماط الحسابية المُبلغ عنها
يعرض الشكل 2 أربعة عروض لتحليلات حسابية مُبلغ عنها. يوضح الشكل 2A معرضاً لتسع لوحات مع تراكبات تقسيم ملونة تُستخدم للتحديد الموضعي البصري والمراجعة. يوضح الشكل 2B مخطط تشتت UMAP لتضمينات صور CLIP المُبلغ عنها، مع خطوط كنتور للكثافة مُصنفة من C1 إلى C7. يقارن الشكل 2C بين عدد اللوحات المُبلغ عنها (نقاط مصمتة) وبين استرجاع مستوى الفئة (دوائر مفتوحة)، ويعرض الشكل 2D معرضاً للوحات ممثلة مجمعة وفقاً لنفس التصنيفات. وقد دعم التحقق من صحة العنقود حل التجميع المختار، والذي حقق درجة silhouette score بلغت 0.54 ومؤشر Davies–Bouldin بلغ 0.92. كما أظهر تخطيط العنقود إلى الفئة البشرية توافقاً قوياً، حيث تطابق كل عنقود مستمد بشكل أساسي مع فئة مرجعية بشرية متميزة.

الجدول 3 يعرض سبعة ملفات تعريف حاسوبية مُبلغ عنها مع أحجام عينات تتوافق مع دعامات الفئات المرجعية البشرية السبع. يتوفر جدول الاقتران العنقودي حسب الفئة في الجدول التكميلي 2، والذي يوضح توزيع الفئات المرجعية البشرية السبع المعتمدة عبر العناقيد C1-C7. وقد أظهر تحليل تعيينات العناقيد على مستوى الحالات أن التجميع الحاسوبي استعاد هياكل بصرية تتوافق بشكل وثيق مع الفئات المرجعية البشرية السبع.

ارتباطات الإشارات المرئية والتركيب التفسيري
يلخص الجدول 4 ملفات الإشارات المرئية النوعية المستخدمة لتوصيف الفئات السبع المرمزة بشرياً. وتصف هذه الملفات الارتباطات المتكررة بين الملابس، والإطار المكاني، والوضعية، والأشياء، والعلاقات الاجتماعية. لم تُشتق هذه الملفات من جدولة تقاطعية كمية، وبالتالي لم تحدد الوضع القانوني، أو العرق، أو المسببات الاجتماعية، أو استجابة الجمهور.

الشكل 3 يدمج ملخصات كمية وصفية للميزات المرئية المرمزة مع نموذج مفاهيمي تفسيري. الشكل 3A يعرض الفئات السبع المرجعية البشرية التي تم التحكيم عليها وأحجام العينات الخاصة بها. الشكل 3B يوضح الارتباطات النسبية بين هذه الفئات والمؤشرات المرئية المرمزة عبر خمسة أبعاد: الملابس، والإعداد المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. تم حساب قوة الارتباط المعروضة من التعليقات التوضيحية على مستوى الحالة ضمن كل فئة مرجعية بشرية. الشكل 3C يلخص العلاقات بين الفئات المرجعية البشرية، وأبعاد التأشير المرئي، والأنماط الأصلية للدلالات الفئوية، وذلك باستخدام تدفقات موزونة مشتقة من الملاحظات المرمزة. وتحدد هذه العلاقات الكمية أنماطاً تمثيلية متكررة داخل اللوحات التي تم أخذ عينات منها، ولا ينبغي تفسيرها على أنها تقديرات للتوزيعات الديموغرافية أو الاجتماعية التاريخية. الشكل 3D يقدم نموذجاً تفسيرياً مفاهيمياً عابراً للثقافات، ويجب فهمه كإطار تفسيري مستنير تاريخياً وليس كمسار سببي تم اختباره تجريبياً.

التفسير المتكامل للأنماط البصرية
تميزت فئات الهوية الأنثوية السبع عبر مجموعة الأعمال الفنية بتوليفات متكررة من الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. وقد قدمت هذه التوليفات أدلة وصفية على وجود اتفاقيات بصرية نمطية ضمن اللوحات المختارة. وظلت التفسيرات التاريخية المتعلقة بالنوع الاجتماعي، والتراتبية، والوساطة عبر الثقافات استنتاجية.

وبالنظر إلى هذه النتائج مجتمعة، تم تحديد سبع فئات لهوية الإناث بناءً على المرجعية البشرية، وخمسة أبعاد متكررة استُخدمت لتوصيفها، وهي: الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. وقد تطابقت تسميات الذكاء الاصطناعي الأولية مع الفئات البشرية التي تم التحكيم عليها في 356 من أصل 433 لوحة (82.2%)، بينما لوحظ أدنى معدل استدعاء على مستوى الفئات في مشاهد الطقوس/الزفاف (73.3%). وقد دعمت هذه النتائج التنظيم الوصفي ومقارنة المجموعة المختارة. كما أتاحت تسميات الذكاء الاصطناعي والبشر على مستوى الحالات تقدير الدقة ومقياس F1 على مستوى الفئات. وبشكل منفصل، حدد تحليل العناقيد هياكل تتوافق مع الفئات السبع المرجعية البشرية. ومع ذلك، فإن هذه النتائج الحسابية تصف اتفاقيات التمثيل البصري بدلاً من إثبات ادعاءات سببية حول الواقع الاجتماعي التاريخي أو استجابة الجمهور.

توافر البيانات:
البيانات التي تدعم هذه الدراسة، بما في ذلك البيانات الوصفية ومعلومات المصدر وسجلات الفحص، متاحة عبر Zenodo على الرابط https://doi.org/10.5281/zenodo.21130291.

تحليل اللوحات الصينية التصديرية في عهد أسرة تشينغ؛ مخطط بيانات ومخطط تدفقي؛ دراسة التصنيف والتوزيع.
الشكل 1: بناء المتن والتكوين الوصفي لعينة مكونة من 433 لوحة. (أ) الفرز المتسلسل لـ 612 صورة مرشحة، مما أسفر عن 433 لوحة مؤهلة. شملت الاستبعادات اللوحات الخارجة عن فترة الدراسة أو تقليد لوحات التصدير (n = 85)، أو النسخ الحديثة، أو الصور الضبابية، أو الموضوعات غير الصحيحة (n = 58)، أو الصور التي لا تحتوي على شكل أنثوي يمكن تحديده أو ذات دقة غير كافية (n = 29)، والسجلات ذات البيانات الوصفية غير الكافية (n = 7). (ب) أمثلة نموذجية لخمسة وسائط وتنسيقات: ألوان مائية تصديرية (40.6%، n = 176)، ولوحات ورق النخاع (25.9%، n = 112)، وأوراق ألبومات تصديرية (19.2%، n = 83)، ولوحات شخصية (9.5%، n = 41)، وتنسيقات تصديرية أخرى (4.8%، n = 21). (ج) توزيع اللوحات التي شملتها العينة عبر أربع فترات زمنية. (د) توزيع مصادر المجموعات (الحلقة الخارجية) والوسائط/التنسيقات (الحلقة الداخلية). تستند النسب المئوية إلى إجمالي العينة (N = 433) ومقربة إلى منزلة عشرية واحدة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

التجزئة، ومخطط تشتت UMAP، وتحليل العناقيد، والتصنيف لدراسة تصنيف اللوحات.
الشكل 2: التجزئة المسجلة، وتصور التضمين، وتوزيع العناقيد، واسترجاع الفئات، واللوحات التمثيلية. (A) معرض لتسع لوحات مع تراكبات تجزئة ملونة استُخدمت لتحديد مواقع الأشكال أو العناصر المرئية للمراجعة. (B) مخطط تشتت UMAP لتضمينات صور CLIP المسجلة مع خطوط كنتور الكثافة والتصنيفات C1–C7. (C) عدد اللوحات المسجل (نقاط مصمتة، المحور العلوي) واسترجاع الفئات (دوائر مفتوحة، المحور السفلي)؛ حيث يساوي استرجاع الفئة عدد التطابقات الدقيقة مقسومًا على دعم المرجع البشري. لم يتم عرض فترات الثقة أو أشرطة الخطأ. (D) معرض اللوحات التمثيلية المجمعة حسب التصنيفات C1–C7، مع اختيار الصور بناءً على قربها من مراكز العناقيد المعنية. الاختصارات: AI = الذكاء الاصطناعي؛ CLIP = Contrastive Language–Image Pre-training؛ SAM = Segment Anything Model؛ UMAP = Uniform Manifold Approximation and Projection؛ C1–C7 = التصنيفات المسجلة 1–7. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

مخطط فئات الهوية اليدوية؛ خريطة حرارية للارتباطات؛ نموذج التفسير عبر الثقافات.
الشكل 3: ارتباطات الإشارات المرئية وإطار التفسير عبر الثقافات. (A) سبع فئات لهوية الإناث المرجعية البشرية المحكمة وأحجام العينات الخاصة بها ضمن مجموعة مكونة من 433 لوحة. (B) خريطة حرارية للارتباطات توضح القوة النسبية للعلاقات بين الفئات المرجعية البشرية السبع والعلامات المرئية المرمزة عبر الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. تم اشتقاق قوة الارتباطات من التعليقات التوضيحية على مستوى الحالة داخل كل فئة. (C) تمثيل رسومي تدفقي (Alluvial) يلخص العلاقات المرجحة بين الفئات المرجعية البشرية، وأبعاد العلامات المرئية، والنماذج الأصلية للدلالات الطبقية بناءً على الملاحظات المرمزة. (D) نموذج تفسير مفاهيمي عبر الثقافات يربط بين الأنشطة المصورة، واختيار الورشة والسوق، والترميز المرئي خماسي الأبعاد، وأنواع الهوية المتكررة، ومسارات التفسير المحتملة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الجدول 1: خصائص المدونة ومدى اكتمال البيانات الوصفية (N = 433). تلخص الأعداد والنسب المئوية ست كتل منفصلة: الفاصل الزمني للتاريخ، والمصدر، والوسيط أو التنسيق، واكتمال البيانات الوصفية، وتمثيل الشخصيات النسائية، ونوع المشهد. تستخدم كل كتلة N = 433 كمقام ومجموعها 433؛ والنسب المئوية هي نسب المدونة داخل الكتلة الواحدة ومقربة إلى منزلة عشرية واحدة. يرجى النقر هنا لتحميل هذا الملف.

الجدول 2: تسميات الذكاء الاصطناعي الأولية وفئات المراجع البشرية (N = 433). يمثل "الدعم" عدد اللوحات المخصصة لكل فئة من فئات المراجع البشرية. تشير "المطابقات التامة" إلى اللوحات التي تطابقت فيها التسمية الأولية الناتجة عن الذكاء الاصطناعي مع فئة المرجع البشري. يتم حساب "الاستدعاء على مستوى الفئة" بقسمة عدد المطابقات التامة على عدد دعائم المراجع البشرية. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 3: ملخص الملف الحاسوبي المسجل. تعيد C1–C7 إنتاج أحجام الملفات المعتمدة والتسميات المهيمنة. ويؤكد دمج تعيينات المجموعات على مستوى الحالة وجدول التوافق بين المجموعات والفئات أن التجميع غير الخاضع للإشراف قد نجح بفعالية في التقاط البنى البصرية المقابلة للفئات المرجعية البشرية السبع. يرجى النقر هنا لتنزيل هذا الملف.

الجدول 4: الملفات النوعية لفئات الهوية الأنثوية والإشارات البصرية المرتبطة بالطبقة الاجتماعية. تلخص الأعداد والنسب المئوية فئات المرجعية البشرية، بينما تصف الملابس والمكان والأشياء والوضعية والعلاقات الاجتماعية الملفات البصرية المتكررة المرتبطة بكل فئة. وتمثل التفسيرات المرتبطة بالطبقة قراءات أيقونية للأنماط التصويرية بدلاً من كونها مقاييس مباشرة للمكانة الاجتماعية التاريخية. يرجى النقر هنا لتحميل هذا الملف.

الشكل التكميلي 1: مصفوفة ارتباك تقارن بين تسميات الذكاء الاصطناعي الأولية والفئات المرجعية البشرية المحكّمة لمجموعة تضم 433 لوحة. تمثل الصفوف الفئات المرجعية البشرية المحكّمة (التسميات الصحيحة)، بينما تمثل الأعمدة الفئات الأولية التي أنشأها نموذج CLIP (التسميات المتوقعة). تشير قيم الخلايا إلى عدد اللوحات لكل تركيبة من تسميات الذكاء الاصطناعي والبشر. تمثل الخلايا القطرية التطابقات الدقيقة بين الذكاء الاصطناعي والبشر، مع إظهار نسبة الاستدعاء على مستوى الفئة كنسبة مئوية. تمثل الخلايا غير القطرية عدم التطابق بين تصنيف الذكاء الاصطناعي الأولي والفئة المرجعية البشرية المحكّمة. بلغت دقة التطابق الدقيق الإجمالية 82.2% (356/433). يرجى النقر هنا لتنزيل هذا الملف.

الجدول التكميلي 1: مقارنة على مستوى الحالة بين تسميات الذكاء الاصطناعي الأولية، والفئات المرجعية البشرية المحكمة، وتعيينات عنقود UMAP. يمثل كل صف واحدة من 433 لوحة صينية تصديرية من عهد أسرة تشينغ مدرجة في المتن التحليلي. يوضح الجدول معرف صورة QEP المستقر، وتسمية CLIP ViT-B/32 الأولية، والتصنيفات المستقلة من المرمز البشري 1 والمرمز البشري 2، والفئة المرجعية البشرية المحكمة، وحالة التطابق بين الذكاء الاصطناعي والبشر، وتعيين عنقود UMAP. تشير عبارة "تطابق تام" (Exact Match) إلى الاتفاق بين تسمية الذكاء الاصطناعي الأولية والفئة المرجعية البشرية المحكمة؛ بينما تشير عبارة "عدم تطابق" (Mismatch) إلى الاختلاف. وقد استُخدمت الفئة البشرية المحكمة كمرجع تصنيفي لتحليلات الاتفاق بين الذكاء الاصطناعي والبشر. يرجى النقر هنا لتحميل هذا الملف.

الجدول التكميلي 2: جدول تبايني لفئات المراجع البشرية وتخصيصات المجموعات الحسابية.تمثل الصفوف فئات المراجع البشرية السبع التي تم التحكيم فيها، وتمثل الأعمدة المجموعات C1–C7 المستمدة من تحليل التجميع الحسابي. تشير قيم الخلايا إلى عدد اللوحات المخصصة لكل توليفة من الفئة والمجموعة. ويمثل إجمالي الدعم عدد اللوحات في كل فئة مرجعية بشرية. ويوفر تركيز الملاحظات عبر توليفات الفئة والمجموعة تقييماً وصفياً للتطابق بين المجموعات الحسابية المستمدة بشكل مستقل وفئات المراجع البشرية التي تم التحكيم فيها. يرجى النقر هنا لتنزيل هذا الملف.

المناقشة

ضمن ملخصات التجميعات المقدمة، تم تنظيم 433 سجلاً في سبع فئات مرجعية بشرية ووُصفت من خلال خمس عائلات من الإشارات البصرية. كانت فئة النخبة/الجمال هي الفئة الأكبر (112/433)، وتطابقت 356 تسمية أولية مع المرجع البشريات المسجل (82.2%). هذه ملاحظات متعلقة بالمدونة، وهي تدعم دراسة الصيغ التصويرية المتكررة، ولكنها لا تدعم الفرضية الأقوى بأن هذه الصيغ تعيد إنتاج مجتمع سلالة تشينغ بأمانة أو أنها تسببت في استجابة معينة لدى الجمهور الأجنبي13.

لقد ساهم الخطاب الجندري المعياري، والمكانة المنزلية، والعمل، وقانون أسرة تشينغ في تشكيل حياة النساء دون أن يحددوها بشكل موحد. وتوثق الدراسات البحثية حول نساء فترة "تشينغ العليا" مشاركتهن في العمل والكتابة والطقوس والدين والترفيه، وذلك بالتوازي مع الأنظمة العائلية وأنظمة العفة المعيارية. شكلت "الألوية الثمانية" مجموعة وضع وراثية ومتعددة الأعراق حددها القانون والممارسة الإدارية؛ ولذلك لا ينبغي مساواة العضوية في الألوية تلقائياً بالعرق المانشو14,15,16,17. وفي هذه الدراسة، تُعتبر الملابس والوضعية والأشياء والإطار المحيط إشارات تصويرية وليست أدلة على الرتبة القانونية، أو الانتماء للألوية/الهان، أو العرق، أو الامتثال الأخلاقي، أو الهوية المعيشة. إذ تتطلب تلك الادعاءات أدلة أرشيفية وقانونية.

تتطلب النتائج الحسابية أيضاً ضبطاً ثقافياً وتقنياً. فلا ينبغي افتراض أن نماذج الرؤية واللغة عامة الأغراض محايدة ثقافياً. وتظهر نتائج CulturalVQA المنشورة أداءً غير متكافئ عبر المناطق والجوانب الثقافية، غير أن هذا المقياس المرجعي لم يقيم CLIP ViT-B/32 ولم يستخدم الفن التاريخي لشرق آسيا8,18,19. وبناءً على ذلك، فإن هذا يحفز على إنشاء مقياس مرجعي مطابق للحالات على هذه المجموعة من النصوص بدلاً من أن يكون بديلاً عنها. وإلى حين توفر مثل هذه التجربة، يظل CLIP وسيلة تنظيمية أولية وليس مرجعية نهائية بشأن هوية أو تسلسل أسرة تشينغ (Qing). وقد أكدت سلسلة المعالجة الحسابية أن SAM عمل بدقة كدليل توطين مساعد؛ حيث لم تُستخدم أي أقنعة أو ميزات مشتقة من الأقنعة كمدخلات للتصنيف أو التجميع، مما يضمن اعتماد التصنيف البصري حصرياً على التضمينات الدلالية العالمية للصور غير المجزأة. كما تؤكد دراسات التراث الرقمي على الحساسية الثقافية، والإشراف متعدد التخصصات، وإمكانية الوصول، وحماية البيانات، وسير العمل الشفاف20.

تكمن أهمية هذه الأنماط تاريخياً في تجارة اللوحات المخصصة للتصدير: فقد اختارت الورش الصينية والطلب الأجنبي موضوعات قابلة للنقل والقراءة والجمع وقامت بتوحيد معاييرها؛ كما تُظهر الصور المتكررة في الورش عملية نسخ مع إدخال تغييرات بدلاً من التكرار الميكانيكي البحت1,2,3,4,5. وبناءً على ذلك، يمكن لهذه المجموعة أن تساهم في تأريخ قضايا النوع الاجتماعي، والتراتب الهرمي، وتصوير الحياة اليومية، والتواصل بين الثقافات من خلال تبيان الصيغ التي تتكرر على نطاق واسع. وهي لا تثبت أن هذه الصور تمثل سجلات إثنوغرافية شاملة. ويمكن للمقارنة الحسابية أن توجّه القراءة المتأنية والسياق الثقافي المتبادل21، بينما يجب أن تستند الادعاءات المتعلقة بنوايا السوق أو دلالاتها لدى الجمهور إلى سجلات الإنتاج، وتاريخ المشتريات، وأدلة الاستقبال.

تظل الاستجابة العاطفية والمعرفية اتجاهاً بحثياً مستقبلياً وليست نتيجة للدراسة الحالية. فقد دمج شي وزملاؤه بين تقييمات التفضيل، وتحليل الأبعاد الكامنة، وتتبع حركة العين للتمييز بين المسارات العاطفية والجمالية الشكلية والمعرفية في الاستجابات تجاه صور Xiashi Pinprick Lantern22. ويمكن لتصميم مماثل أن يختبر ما إذا كان المشاهدون يوجهون انتباههم بشكل مختلف إلى الملابس أو الأشياء أو الوضعية أو التسلسل الهرمي في لوحات التصدير. ونظراً لأن هذه الدراسة لم تجمع أي تقييمات أو بيانات تتبع العين أو أي بيانات أخرى عن الجمهور، فإنها لا يمكنها استنتاج الاستثارة العاطفية أو البروز البصري أو الاستقبال من محتوى الصور وحده.

تتمثل القيود في جوانب نظرية ومنهجية وعملية. فنظرياً، تقوم فئات الدلائل المادية بتبسيط مفاهيم النوع الاجتماعي، والعلاقات المنزلية، والتسلسل الهرمي القانوني، والإثنية، والخبرات المعيشية. ومن الناحية المنهجية، تتقيد الاستنتاجات بعوامل البقاء، والجمع، والرقمنة، والبيانات الوصفية، ونماذج التعلم من الصفر (zero-shot models)، والترميز، وتحيزات الفترات الزمنية غير المتساوية. وبينما يُظهر مسار التحليل قدرة قوية على اكتشاف الأنماط، فإن هذه التحيزات الهيكلية تؤكد ضرورة التعامل مع المخرجات الحسابية كتحليلات للاصطلاحات التصويرية بدلاً من كونها نوافذ شفافة على الواقع الاجتماعي في عهد أسرة تشينغ. أما عملياً، فإن حقوق الصور تقيد إعادة التوزيع، وقد لا تكون النتائج قابلة للتعميم عبر المؤسسات أو الفترات الزمنية أو الوسائط أو البيئات الحسابية المختلفة. ومع مراعاة هذه القيود، تقدم الدراسة إطاراً خاضعاً للإشراف البشري لتحويل الملاحظات البصرية المتكررة إلى أسئلة تاريخية قابلة للاختبار بدلاً من استنتاجات مؤتمتة. وباعتبارها دراسة تفسيرية وليست تدخلية، فإنها لم تقيم التقدم المحرز نحو أي هدف من أهداف التنمية المستدامة (SDG) أو مؤشراتها. ومع ذلك، فإن موضوعها ذو صلة بالهدف 5، كما أن توثيقها المراعي للحقوق وتأطيرها التعليمي العابر للثقافات يتوافقان مفاهيمياً مع الغايتين 11.4 و 4.7؛ ولم يتم قياس أي نتيجة من نتائج أهداف التنمية المستدامة. وتتوافق حزمة إعادة الإنتاج المقدمة مع الدعوات الأخيرة لسير عمل التراث الرقمي الشفاف ومع متطلبات مبادئ FAIR فيما يخص المعرفات الدائمة، والبيانات الوصفية الغنية، والتراخيص، والمنشأ، والبيانات والخوارزميات والأدوات وسير العمل القابلة لإعادة الاستخدام20,23.

الإفصاحات

ليس لدى المؤلفين أي تضاربات مصالح للإفصاح عنها.

شكر وتقدير

يتوجه المؤلفون بالشكر إلى متحف فيكتوريا وألبرت، والمتحف البريطاني، ومتحف متروبوليتان للفنون، ومتحف سميثسوني الوطني للفنون الآسيوية، ومتحف بيبودي إيسيكس، ومتحف هونغ كونغ للفنون، والمكتبة البريطانية، ومعهد جيتي للأبحاث، وغيرها من المؤسسات الحاضرة وفرق الفهرسة التي دعمت سجلاتها المتاحة عبر الإنترنت عملية اكتشاف المجموعة. إن الوصول إلى سجل عبر الإنترنت لا يعني الإذن بإعادة توزيع صورته؛ ولذلك تم توثيق الحقوق على مستوى اللوحة وروابط المصدر بشكل منفصل. كما يقر المؤلفون بدور مجتمعات البحث المفتوحة التي تدعم CLIP و SAM، بالإضافة إلى الدعم الإداري من جامعة مدينة ماكاو وجامعة قوانغدونغ للفنون التطبيقية والتربوية.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
CLIP ViT-B/32OpenAIOpenAI CLIP, ViT-B/32نموذج لغة-رؤية مستخدم لتحليل التشابه الأولي بين الصور–النصوص وتعيين تصنيفات أولية بواسطة الذكاء الاصطناعي.
محطة عمل حاسوبيةمحطة العمل الحاسوبية للمؤلفين’وحدة معالجة رسوميات تدعم CUDA؛ يجب ذكر تكوين الأجهزة الدقيقمحطة عمل مستخدمة لاستدلال CLIP وSAM والتحليلات الحاسوبية؛ يجب ذكر مواصفات وحدة معالجة الرسوميات (GPU)، ووحدة المعالجة المركزية (CPU)، وذاكرة الوصول العشوائي (RAM)، ونظام التشغيل، ومواصفات CUDA من بيئة التشغيل الأصلية.
Matplotlibفريق تطوير Matplotlibحزمة Python؛ يجب ذكر الإصدار الدقيقمستخدمة للتصور الحاسوبي وإنشاء أشكال ورسوم بيانية تحليلية.
Microsoft Excel 2021Microsoft CorporationMicrosoft Excel 2021مستخدم لتنظيم البيانات الوصفية، وسجلات الفحص، وإدارة بيانات الدراسة الجدولية.
NumPyمطورو NumPyحزمة Python؛ يجب ذكر الإصدار الدقيقمستخدمة للحسابات العددية ومعالجة مصفوفات ميزات الصور والمصفوفات التحليلية.
pandasفريق تطوير pandasحزمة Python؛ يجب ذكر الإصدار الدقيقمستخدمة للتعامل مع البيانات المهيكلة، ومعالجة البيانات الوصفية، وتنظيم المخرجات التحليلية على مستوى الحالة.
Python 3.10Python Software FoundationPython 3.10بيئة برمجية مستخدمة لتنفيذ سير عمل تحليل الصور الحاسوبي.
PyTorch 2.0.1PyTorch FoundationPyTorch 2.0.1إطار عمل للتعلم العميق مستخدم لتشغيل ترميز الصور والنصوص القائم على CLIP والاستدلال عبر وحدة معالجة الرسوميات (GPU).
scikit-learnمطورو scikit-learnحزمة Python؛ يجب ذكر الإصدار الدقيقمستخدمة لحسابات تجميع K-means، والتجميع التراكمي، ومعامل السلوويت، ومؤشر Davies–Bouldin، ومعامل كابا Cohen’s kappa.
نموذج تقسيم أي شيء (SAM)Meta AI ResearchSAMنموذج تقسيم مستخدم لتحديد مواقع الأشكال الأنثوية، والملابس، والأثاث، والأدوات، والأشياء الطقسية، والمناطق المعمارية للفحص البصري.
umap-learnMcInnes et al.تنفيذ UMAP بلغة Pythonمستخدم لتقليل الأبعاد والتصور ثنائي الأبعاد لتضمينات صور CLIP باستخدام مسافة جيب التمام (cosine distance).

المراجع

  1. Gao J, Zhang Y, Liu J, Sousa JP. A digital humanities approach to Chinese export watercolours: a case study on the Victoria and Albert Museum collection. Digit Scholarsh Humanit. 2026;41(2):692-714.
  2. Liu H, Fu C, Li W. Silk road heritage: the artistic representation of port trading culture in the images of characters in Qing Dynasty Guangzhou export paintings. PLoS One. 2024;19(10):e0308309.
  3. Ao J, Ye Z, Li W, Ji S. Impressions of Guangzhou city in Qing Dynasty export paintings in the context of trade economy: a color analysis of paintings based on k-means clustering algorithm. Herit Sci. 2024;12:77.
  4. Mok MKW. Chinese export paintings: a marketing success story. Cambridge Scholars Publishing; Newcastle upon Tyne; 2025.
  5. Yaron E. The many versions of the painting of Tingqua's studio: painting copying and originality in nineteenth-century Canton. Humanit Soc Sci Commun. 2020;7:132.
  6. Impett L, Offert F. There is a digital art history. Vis Resour. 2022;38(2):186-209.
  7. Münster S. Artificial intelligence for digital heritage innovation: setting up a R&D agenda for Europe. Heritage. 2024;7(2):794-816.
  8. Foka A, Griffin G. AI, cultural heritage, and bias: some key queries that arise from the use of GenAI. Heritage. 2024;7(11):6125-6136.
  9. Zhang W. Computational approaches for traditional Chinese painting: from the Six Principles of Painting perspective. J Comput Sci Technol. 2024;39(2):269-285.
  10. McInnes L, Healy J, Saul N, Großberger L. UMAP: Uniform Manifold Approximation and Projection. J Open Source Softw. 2018;3(29):861.
  11. Rousseeuw PJ. Silhouettes: a graphical aid to the interpretation and validation of cluster analysis. J Comput Appl Math. 1987;20:53-65.
  12. Cohen J. A coefficient of agreement for nominal scales. Educ Psychol Meas. 1960;20(1):37-46.
  13. Stejskal J. Art-historical empiricism and digital visualization of cultural heritage. Synthese. 2025;205:132.
  14. Mann S. Precious records: women in China's long eighteenth century. Stanford University Press; Stanford; 1997.
  15. Porter DC. Slaves of the emperor: service, privilege, and status in the Qing Eight Banners. Columbia University Press; New York; 2023.
  16. Sommer MH. Sex, law, and society in late imperial China. Stanford University Press; Stanford; 2000.
  17. Theiss JM. Disgraceful matters: the politics of chastity in eighteenth-century China. University of California Press; Berkeley; 2005.
  18. Nayak S, et al. Benchmarking vision language models for cultural understanding [conference paper]. Presented at: 2024 Conference on Empirical Methods in Natural Language Processing; Miami, Florida, USA; 2024. https://aclanthology.org/2024.emnlp-main.329/
  19. Vitaloni C, Shullani D, Baracchi D. A comparative study of vision language models for Italian cultural heritage. Heritage. 2025;8(3):95.
  20. Li W. Systematic review: a scientometric analysis of the status, trends and challenges in the application of digital technology to cultural heritage conservation (2019-2024). npj Herit Sci. 2025;13:90.
  21. Zhang W, et al. CultiVerse: towards cross-cultural understanding for paintings with large language model [conference paper]. Presented at: 33rd ACM International Conference on Multimedia; Dublin, Ireland; 2025. https://doi.org/10.1145/3746027.3755698
  22. Shi W. A dual-path approach to emotional arousal and visual cognition in intangible cultural heritage: the case of Xiashi Pinprick Lantern Pictures. Digit Scholarsh Humanit. 2026;41(1):376-395.
  23. Wilkinson MD, et al. The FAIR Guiding Principles for scientific data management and stewardship. Sci Data. 2016;3:160018.

إعادة الطباعة والأذونات

الوسوم

لوحات التصدير من عهد أسرة تشينغالأنواع البصريةالترميز الأيقونيتحليل الذكاء الاصطناعيتجميع الفئاتتمثيل الملابسالعلاقات الاجتماعية