بناء المدونة والتكوين الوصفي
يقدم الشكل 1 نظرة عامة على المدونة مكونة من أربعة أقسام. يوضح الشكل 1A عملية الفرز المسجلة من 612 سجلاً مرشحاً إلى 433 سجلاً مستبقياً. ويعرض الشكل 1B أمثلة ممثلة للوسائط والتنسيقات. كما يقدم الشكل 1C أعداد السجلات عبر أربعة فترات زمنية، بينما يلخص الشكل 1D تكوين المصدر والوسيط في المدونة. ونظراً لأن الفترات الزمنية تمتد عبر مدد غير متساوية، فإن هذه الأعداد تصف تكوين المدونة التي تم أخذ عينات منها، ولا ينبغي تفسيرها على أنها معدلات إنتاج تاريخية.
يلخص الجدول 1 الخصائص الإجمالية لمجموعة البيانات. حيث شملت مجموعات المتاحف 302 سجلاً، والأرشيفات الرقمية 81 سجلاً، والكتالوجات المنشورة 50 سجلاً. كما صُنفت الوسائط إلى ألوان مائية مخصصة للتصدير (n = 176)، ورسومات على ورق النخاع (n = 112)، وأوراق ألبومات مخصصة للتصدير (n = 83)، ورسوم شخصية (n = 41)، وتنسيقات أخرى (n = 21). وصُنفت البيانات الوصفية إلى كاملة (n = 288)، أو جزئية (n = 118)، أو محدودة (n = 27). كما صُنفت الشخصيات النسائية إلى مركزية (n = 214)، أو ثانوية (n = 102)، أو متعددة (n = 117). وقد اشتملت كل كتلة تصنيفية على جميع السجلات الـ 433.
التصنيفات الأولية للذكاء الاصطناعي وفئات المرجع البشري
يلخص الجدول 2 الاتفاق الإجمالي بين التصنيفات الأولية التي أنشأها الذاء الاصطناعي وفئات المرجع البشري عبر 433 لوحة، بينما يوفر الجدول التكميلي 1 التصنيفات الأولية للذكاء الاصطناعي المقابلة على مستوى كل حالة، وتصنيفات المرمّزين، وفئات المرجع البشري التي تم البت فيها، وحالة المطابقة، وتعيينات العناقيد. وبشكل عام، تطابقت تصنيفات الذكاء الاصطناعي والمرجع البشري في 356 لوحة، وهو ما يعادل دقة مطابقة تامة بلغت 82.2%. وقد حُسبت نسبة الاسترجاع على مستوى الفئة كنسبة المطابقات التامة بين الذكاء الاصطناعي والبشر بالنسبة إلى دعم المرجع البشري لكل فئة.
تراوح الاسترجاع على مستوى الفئة بين 73.3% لمشاهد الطقوس/الزفاف (33/45) و88.4% للنخبة/الجمال (99/112). وكان الاسترجاع 84.7% للعمل الشاق (61/72)، و82.1% للأداء (32/39)، و79.7% للمنزل (51/64)، و79.3% للخدم (46/58)، و79.1% للسوق (34/43). وبشكل عام، بلغ الاتفاق الدقيق 356/433 (82.2%). وقد أتاح تقييم الأزواج على مستوى الحالة حساب درجات الدقة وF1 عبر جميع الفئات السبع، حيث تراوحت الدقة بين 74.5% و89.2%، بينما تراوحت درجات F1 بين 0.75 و0.88. تتوفر مصفوفة ارتباك شاملة توضح الإيجابيات الكاذبة للفئات المستهدفة والأنماط خارج القطر في الشكل التكميلي 1.
ملخصات الأنماط الحسابية المُبلغ عنها
يعرض الشكل 2 أربعة عروض لتحليلات حسابية مُبلغ عنها. يوضح الشكل 2A معرضاً لتسع لوحات مع تراكبات تقسيم ملونة تُستخدم للتحديد الموضعي البصري والمراجعة. يوضح الشكل 2B مخطط تشتت UMAP لتضمينات صور CLIP المُبلغ عنها، مع خطوط كنتور للكثافة مُصنفة من C1 إلى C7. يقارن الشكل 2C بين عدد اللوحات المُبلغ عنها (نقاط مصمتة) وبين استرجاع مستوى الفئة (دوائر مفتوحة)، ويعرض الشكل 2D معرضاً للوحات ممثلة مجمعة وفقاً لنفس التصنيفات. وقد دعم التحقق من صحة العنقود حل التجميع المختار، والذي حقق درجة silhouette score بلغت 0.54 ومؤشر Davies–Bouldin بلغ 0.92. كما أظهر تخطيط العنقود إلى الفئة البشرية توافقاً قوياً، حيث تطابق كل عنقود مستمد بشكل أساسي مع فئة مرجعية بشرية متميزة.
الجدول 3 يعرض سبعة ملفات تعريف حاسوبية مُبلغ عنها مع أحجام عينات تتوافق مع دعامات الفئات المرجعية البشرية السبع. يتوفر جدول الاقتران العنقودي حسب الفئة في الجدول التكميلي 2، والذي يوضح توزيع الفئات المرجعية البشرية السبع المعتمدة عبر العناقيد C1-C7. وقد أظهر تحليل تعيينات العناقيد على مستوى الحالات أن التجميع الحاسوبي استعاد هياكل بصرية تتوافق بشكل وثيق مع الفئات المرجعية البشرية السبع.
ارتباطات الإشارات المرئية والتركيب التفسيري
يلخص الجدول 4 ملفات الإشارات المرئية النوعية المستخدمة لتوصيف الفئات السبع المرمزة بشرياً. وتصف هذه الملفات الارتباطات المتكررة بين الملابس، والإطار المكاني، والوضعية، والأشياء، والعلاقات الاجتماعية. لم تُشتق هذه الملفات من جدولة تقاطعية كمية، وبالتالي لم تحدد الوضع القانوني، أو العرق، أو المسببات الاجتماعية، أو استجابة الجمهور.
الشكل 3 يدمج ملخصات كمية وصفية للميزات المرئية المرمزة مع نموذج مفاهيمي تفسيري. الشكل 3A يعرض الفئات السبع المرجعية البشرية التي تم التحكيم عليها وأحجام العينات الخاصة بها. الشكل 3B يوضح الارتباطات النسبية بين هذه الفئات والمؤشرات المرئية المرمزة عبر خمسة أبعاد: الملابس، والإعداد المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. تم حساب قوة الارتباط المعروضة من التعليقات التوضيحية على مستوى الحالة ضمن كل فئة مرجعية بشرية. الشكل 3C يلخص العلاقات بين الفئات المرجعية البشرية، وأبعاد التأشير المرئي، والأنماط الأصلية للدلالات الفئوية، وذلك باستخدام تدفقات موزونة مشتقة من الملاحظات المرمزة. وتحدد هذه العلاقات الكمية أنماطاً تمثيلية متكررة داخل اللوحات التي تم أخذ عينات منها، ولا ينبغي تفسيرها على أنها تقديرات للتوزيعات الديموغرافية أو الاجتماعية التاريخية. الشكل 3D يقدم نموذجاً تفسيرياً مفاهيمياً عابراً للثقافات، ويجب فهمه كإطار تفسيري مستنير تاريخياً وليس كمسار سببي تم اختباره تجريبياً.
التفسير المتكامل للأنماط البصرية
تميزت فئات الهوية الأنثوية السبع عبر مجموعة الأعمال الفنية بتوليفات متكررة من الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. وقد قدمت هذه التوليفات أدلة وصفية على وجود اتفاقيات بصرية نمطية ضمن اللوحات المختارة. وظلت التفسيرات التاريخية المتعلقة بالنوع الاجتماعي، والتراتبية، والوساطة عبر الثقافات استنتاجية.
وبالنظر إلى هذه النتائج مجتمعة، تم تحديد سبع فئات لهوية الإناث بناءً على المرجعية البشرية، وخمسة أبعاد متكررة استُخدمت لتوصيفها، وهي: الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. وقد تطابقت تسميات الذكاء الاصطناعي الأولية مع الفئات البشرية التي تم التحكيم عليها في 356 من أصل 433 لوحة (82.2%)، بينما لوحظ أدنى معدل استدعاء على مستوى الفئات في مشاهد الطقوس/الزفاف (73.3%). وقد دعمت هذه النتائج التنظيم الوصفي ومقارنة المجموعة المختارة. كما أتاحت تسميات الذكاء الاصطناعي والبشر على مستوى الحالات تقدير الدقة ومقياس F1 على مستوى الفئات. وبشكل منفصل، حدد تحليل العناقيد هياكل تتوافق مع الفئات السبع المرجعية البشرية. ومع ذلك، فإن هذه النتائج الحسابية تصف اتفاقيات التمثيل البصري بدلاً من إثبات ادعاءات سببية حول الواقع الاجتماعي التاريخي أو استجابة الجمهور.
توافر البيانات:
البيانات التي تدعم هذه الدراسة، بما في ذلك البيانات الوصفية ومعلومات المصدر وسجلات الفحص، متاحة عبر Zenodo على الرابط https://doi.org/10.5281/zenodo.21130291.

الشكل 1: بناء المتن والتكوين الوصفي لعينة مكونة من 433 لوحة. (أ) الفرز المتسلسل لـ 612 صورة مرشحة، مما أسفر عن 433 لوحة مؤهلة. شملت الاستبعادات اللوحات الخارجة عن فترة الدراسة أو تقليد لوحات التصدير (n = 85)، أو النسخ الحديثة، أو الصور الضبابية، أو الموضوعات غير الصحيحة (n = 58)، أو الصور التي لا تحتوي على شكل أنثوي يمكن تحديده أو ذات دقة غير كافية (n = 29)، والسجلات ذات البيانات الوصفية غير الكافية (n = 7). (ب) أمثلة نموذجية لخمسة وسائط وتنسيقات: ألوان مائية تصديرية (40.6%، n = 176)، ولوحات ورق النخاع (25.9%، n = 112)، وأوراق ألبومات تصديرية (19.2%، n = 83)، ولوحات شخصية (9.5%، n = 41)، وتنسيقات تصديرية أخرى (4.8%، n = 21). (ج) توزيع اللوحات التي شملتها العينة عبر أربع فترات زمنية. (د) توزيع مصادر المجموعات (الحلقة الخارجية) والوسائط/التنسيقات (الحلقة الداخلية). تستند النسب المئوية إلى إجمالي العينة (N = 433) ومقربة إلى منزلة عشرية واحدة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 2: التجزئة المسجلة، وتصور التضمين، وتوزيع العناقيد، واسترجاع الفئات، واللوحات التمثيلية. (A) معرض لتسع لوحات مع تراكبات تجزئة ملونة استُخدمت لتحديد مواقع الأشكال أو العناصر المرئية للمراجعة. (B) مخطط تشتت UMAP لتضمينات صور CLIP المسجلة مع خطوط كنتور الكثافة والتصنيفات C1–C7. (C) عدد اللوحات المسجل (نقاط مصمتة، المحور العلوي) واسترجاع الفئات (دوائر مفتوحة، المحور السفلي)؛ حيث يساوي استرجاع الفئة عدد التطابقات الدقيقة مقسومًا على دعم المرجع البشري. لم يتم عرض فترات الثقة أو أشرطة الخطأ. (D) معرض اللوحات التمثيلية المجمعة حسب التصنيفات C1–C7، مع اختيار الصور بناءً على قربها من مراكز العناقيد المعنية. الاختصارات: AI = الذكاء الاصطناعي؛ CLIP = Contrastive Language–Image Pre-training؛ SAM = Segment Anything Model؛ UMAP = Uniform Manifold Approximation and Projection؛ C1–C7 = التصنيفات المسجلة 1–7. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3: ارتباطات الإشارات المرئية وإطار التفسير عبر الثقافات. (A) سبع فئات لهوية الإناث المرجعية البشرية المحكمة وأحجام العينات الخاصة بها ضمن مجموعة مكونة من 433 لوحة. (B) خريطة حرارية للارتباطات توضح القوة النسبية للعلاقات بين الفئات المرجعية البشرية السبع والعلامات المرئية المرمزة عبر الملابس، والإطار المكاني، والأشياء، والوضعية، والعلاقات الاجتماعية. تم اشتقاق قوة الارتباطات من التعليقات التوضيحية على مستوى الحالة داخل كل فئة. (C) تمثيل رسومي تدفقي (Alluvial) يلخص العلاقات المرجحة بين الفئات المرجعية البشرية، وأبعاد العلامات المرئية، والنماذج الأصلية للدلالات الطبقية بناءً على الملاحظات المرمزة. (D) نموذج تفسير مفاهيمي عبر الثقافات يربط بين الأنشطة المصورة، واختيار الورشة والسوق، والترميز المرئي خماسي الأبعاد، وأنواع الهوية المتكررة، ومسارات التفسير المحتملة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الجدول 1: خصائص المدونة ومدى اكتمال البيانات الوصفية (N = 433). تلخص الأعداد والنسب المئوية ست كتل منفصلة: الفاصل الزمني للتاريخ، والمصدر، والوسيط أو التنسيق، واكتمال البيانات الوصفية، وتمثيل الشخصيات النسائية، ونوع المشهد. تستخدم كل كتلة N = 433 كمقام ومجموعها 433؛ والنسب المئوية هي نسب المدونة داخل الكتلة الواحدة ومقربة إلى منزلة عشرية واحدة. يرجى النقر هنا لتحميل هذا الملف.
الجدول 2: تسميات الذكاء الاصطناعي الأولية وفئات المراجع البشرية (N = 433). يمثل "الدعم" عدد اللوحات المخصصة لكل فئة من فئات المراجع البشرية. تشير "المطابقات التامة" إلى اللوحات التي تطابقت فيها التسمية الأولية الناتجة عن الذكاء الاصطناعي مع فئة المرجع البشري. يتم حساب "الاستدعاء على مستوى الفئة" بقسمة عدد المطابقات التامة على عدد دعائم المراجع البشرية. يرجى النقر هنا لتنزيل هذا الملف.
الجدول 3: ملخص الملف الحاسوبي المسجل. تعيد C1–C7 إنتاج أحجام الملفات المعتمدة والتسميات المهيمنة. ويؤكد دمج تعيينات المجموعات على مستوى الحالة وجدول التوافق بين المجموعات والفئات أن التجميع غير الخاضع للإشراف قد نجح بفعالية في التقاط البنى البصرية المقابلة للفئات المرجعية البشرية السبع. يرجى النقر هنا لتنزيل هذا الملف.
الجدول 4: الملفات النوعية لفئات الهوية الأنثوية والإشارات البصرية المرتبطة بالطبقة الاجتماعية. تلخص الأعداد والنسب المئوية فئات المرجعية البشرية، بينما تصف الملابس والمكان والأشياء والوضعية والعلاقات الاجتماعية الملفات البصرية المتكررة المرتبطة بكل فئة. وتمثل التفسيرات المرتبطة بالطبقة قراءات أيقونية للأنماط التصويرية بدلاً من كونها مقاييس مباشرة للمكانة الاجتماعية التاريخية. يرجى النقر هنا لتحميل هذا الملف.
الشكل التكميلي 1: مصفوفة ارتباك تقارن بين تسميات الذكاء الاصطناعي الأولية والفئات المرجعية البشرية المحكّمة لمجموعة تضم 433 لوحة. تمثل الصفوف الفئات المرجعية البشرية المحكّمة (التسميات الصحيحة)، بينما تمثل الأعمدة الفئات الأولية التي أنشأها نموذج CLIP (التسميات المتوقعة). تشير قيم الخلايا إلى عدد اللوحات لكل تركيبة من تسميات الذكاء الاصطناعي والبشر. تمثل الخلايا القطرية التطابقات الدقيقة بين الذكاء الاصطناعي والبشر، مع إظهار نسبة الاستدعاء على مستوى الفئة كنسبة مئوية. تمثل الخلايا غير القطرية عدم التطابق بين تصنيف الذكاء الاصطناعي الأولي والفئة المرجعية البشرية المحكّمة. بلغت دقة التطابق الدقيق الإجمالية 82.2% (356/433). يرجى النقر هنا لتنزيل هذا الملف.
الجدول التكميلي 1: مقارنة على مستوى الحالة بين تسميات الذكاء الاصطناعي الأولية، والفئات المرجعية البشرية المحكمة، وتعيينات عنقود UMAP. يمثل كل صف واحدة من 433 لوحة صينية تصديرية من عهد أسرة تشينغ مدرجة في المتن التحليلي. يوضح الجدول معرف صورة QEP المستقر، وتسمية CLIP ViT-B/32 الأولية، والتصنيفات المستقلة من المرمز البشري 1 والمرمز البشري 2، والفئة المرجعية البشرية المحكمة، وحالة التطابق بين الذكاء الاصطناعي والبشر، وتعيين عنقود UMAP. تشير عبارة "تطابق تام" (Exact Match) إلى الاتفاق بين تسمية الذكاء الاصطناعي الأولية والفئة المرجعية البشرية المحكمة؛ بينما تشير عبارة "عدم تطابق" (Mismatch) إلى الاختلاف. وقد استُخدمت الفئة البشرية المحكمة كمرجع تصنيفي لتحليلات الاتفاق بين الذكاء الاصطناعي والبشر. يرجى النقر هنا لتحميل هذا الملف.
الجدول التكميلي 2: جدول تبايني لفئات المراجع البشرية وتخصيصات المجموعات الحسابية.تمثل الصفوف فئات المراجع البشرية السبع التي تم التحكيم فيها، وتمثل الأعمدة المجموعات C1–C7 المستمدة من تحليل التجميع الحسابي. تشير قيم الخلايا إلى عدد اللوحات المخصصة لكل توليفة من الفئة والمجموعة. ويمثل إجمالي الدعم عدد اللوحات في كل فئة مرجعية بشرية. ويوفر تركيز الملاحظات عبر توليفات الفئة والمجموعة تقييماً وصفياً للتطابق بين المجموعات الحسابية المستمدة بشكل مستقل وفئات المراجع البشرية التي تم التحكيم فيها. يرجى النقر هنا لتنزيل هذا الملف.