מבנה המחקר ויחידה אנליטית
כל ציור או רשומת קטלוג נחשבו כיחידה אנליטית אחת. נעשה שימוש במערך תצפיתי מבוס-קורפוס, המשלב סקירת מטא-נתונים, ארגון חישובי ראשוני, קידוד ידני עצמאי ופרשנות של תולדות האמנות. תקופת המחקר הוגדרה כ-1757–1911, וקריטריונים להכללה ולהדרה הוחלו בתוך מסגרת זמן זו. יצירות אמנות היסטוריות ומטא-נתוני הקטלוג המשויכים אליהן נותחו. כאשר הושוו התפלגויות לאורך מרווחי תאריכים באורכים שונים, נורמלו הספירות לפי משך המרווח, בעוד שהטיות אפשריות של הישרדות ורכישה נלקחו בחשבון בפרשנות.
בנייה ובחירה של קורפוס
רשומות מועמדות נשלפו מקטלוגי המוזיאונים שצוינו, מארכיונים דיגיטליים ומקטלוגים שפורסמו. עבור כל רשומת מועמד, נשמרו המוסד, הכותרת, התאריך או טווח התאריכים, המדיום, מספר הרישום או הקטלוג, כתובת URL יציבה של המקור, תאריך השליפה והצהרת הזכויות. קישורי המקור נשמרו גם כאשר לא ניתן היה להפיץ באופן חוקי את קובץ התמונה התואם. הליך הסינון המדווח החל עם 612 תמונות מועמדות. מתוכן, 85 נפסלו מכיוון שנפלו מחוץ לתקופה של 1757–191 או מחוץ למסורת של ציורי ייצוא, 58 נפסלו מכיוון שהיו רפרודוקציות מודרניות, רשומות מטושטשות או תיארו נושאים שגויים, 29 נפסלו בשל חסרונה של דמות נשית הניתנת לזיהוי או רזולוציית תמונה לא מספקת, ו-7 נפסלו עקב מטא-דאטה לא מספיק. הקורפוס האנליטי הסופי כלל 433 רשומות.
סטנדרטיזציה של מטא-נתונים ועיבוד מקדים של תמונות
לכל ציור בקורפוס האנליטי הסופי הוקצה מזהה QEP יציב בטווח שבין QEP_01 ל-QEP_43. מטא-נתונים נלווים מהמוזיאונים נשמרו, כולל המוסד, מספר הרישום, הכותרת, התאריך, המדיום או החומרים, מקור המוצא, קישור למקור ותיאור קטלוגי זמין. לצורך ניתוח חזותי, תועדו התווית הראשונית של ה-AI, הקטגוריה האנושית שנקבעה, מספר הדמויות הנשיות, קבוצת גיל, תנוחה, לבוש, הגדרה מרחבית, חפצים נלווים ויחסים חברתיים. כל ציור סווג לאחת משבע קטגוריות עיקריות: עילית/יופי, ביתית, משרתת, עובדת, שוק, מופיעה, או טקס/חתונה. בסצנות המכילות מספר דמויות נשיות, זוהתה הדמות המרכזית על פי בולטות חזותית ומרכזיות נרטיבית. כאשר לא הייתה דמות נשית אחת דומיננטית, נקבעה הקטגוריה העיקרית על בסיס הפעילות המרכזית המתוארת וההקשר הכללי של הסצנה. חפיפות בין קטגוריות נפתרו על ידי מתן עדיפות לפעילות המתוארת ולהקשר הסצנה על פני הלבוש או המראה לבדם. מקרים מעומתים נסקרו באופן עצמאי על ידי שני המקודדים ונפתרו באמצעות הגעה לקונצנזוס. תמונות המקור נשמרו בפורמט JPEG או PNG. רק גבולות דפי אינטרנט, מסגרות קטלוג או שוליים שאינם חלק מהתמונה נגזרו. תוכן הציור לא שוחזר, לא נצבע מחדש, לא שופר ולא הוחזר למצבו המקורי.
סימון ראשוני מבוס CLIP
מקודד התמונות CLIP ViT-B/32 שימש לניתוח ראשוני של דמיון בין תמונות לטקסט9. מונחי זהות מועמדים כללו elite woman, domestic woman, female servant, working woman, market woman, female performer, bride, ו-ritual woman. מונחי סצנה כללו Chinese interior, garden, street market, workshop, tea production, textile work, ו-ceremonial scene. קבוצה מלאה של תבניות הנחיה (prompt templates), סדרן, כל שילוב הנחיות (prompt ensembling), נהלי נרמול טקסט, כללי החלטה, ציוני ביטחון ותיקונו נשמרה עבור כל תמונה.
רשימת ההנחיות המלאה הוחלה באופן עקבי על כל התמונות באמצעות מודל OpenAI CLIP ViT-B/32 שיושם ב-Python 3.10 עם PyTorch 2.0.1 וחבילת OpenAI CLIP. ההסקה בוצעה על GPU התומך ב-CUDA עם גודל אצווה (batch size) של 32 תוך שימוש בדיוק FP32. כל תמונה שונה בגודלה ונחתכה למרכז (center-cropped) ל-24 × 224 פיקסלים, וערוצי ה-RGB נורמלו באמצעות התמרת העיבוד המקדים המשויכת למודל ViT-B/32. הנחיית הטקסט (Text prompts) נבנו באמצעות מתארי הזהות והסצנה שהוגדרו לעיל וקודדו עם מקודד הטקסט של CLIP. דמיון קוסינוס (Cosine similarity) חושב בין וקטורי ההטמעה (embeddings) הנורמליים של התמונה והטקסט, וההנחיה בעלת ציון הדמיון הגבוה ביותר הוקצתה כתווית ה-AI הראשונית. ציוני הדמיון עבור כל התוויות המועמדות נשמרו לצורך סקירה אנושית מאוחרת יותר. נעשה שימוש ב-random seed קבוע של 42, ונהלי עיבוד מקדים, תבניות הנחיה וכללי החלטה זהים הוחלו על כל 43 הציורים.
מיקום באמצעות SAM
מודל Segment Anything (SAM) שימש באופן בלעדי לצורך מיקום של דמויות, בגדים, רהיטים, כלים, חפצי פולחן ואזורים אדריכליים לצורך בדיקה חזותית אנושית. יש להדגיש כי SAM לא לקח חלק בתהליך הסיווג; המסכות, החתכים והמאפיינים הנגזרים ממנו הופרדו מתהליכי התיוג והצמידה (clustering) של CLIP, ובכך הובטח שיישומו של SAM סיפק עזרי מיקום מבלי להשפיע על ביצועי הסיווג או לנפח אותם.
הנחיות נקודות ידניות או תיבות חסם הוחלו בעת הצורך כדי לדייק את המיקום של אלמנטים חזותיים. מסכות SAM נוצרו עבור דמויות נשיות, בגדים, רהיטים, כלים, חפצי פולחן ואלמנטים אדריכליים, וכל תוצאת סגמנטציה נבחנה חזותית כדי לוודא כי הכיסוי האזורי היה הולם. המסכות שהתקבלו תמכו בזיהוי ובבחינה של מאפיינים איקונוגרפיים רלוונטיים, אך לא שימשו לצורך תיוג CLIP או להקצאה לקטגוריות.
הפחתת ממדיות וצבירה (Clustering)
חושבו וקטורי שיכון (embeddings) של תמונות CLIP, ונעשה שימוש ב-UMAP עם מרחק קוסינוס לצורך ויזואליזציה דו-מדית10. הייצוג ששימש לצבירה, יחד עם הליך עיבוד המקדמים, הממדיות והגדרת המרחק שלו, תועדו.
אלגוריתמי K-means וצבירה היררכית (hierarchical clustering) הוחלו על ייצוגי מאפייני התמונה כדי לזהות קבוצות חזותיות חוזרות בתוך הקורפוס1. פתרונות K-means מועמדים עבור k = 5–9 הוערכו באמצעות מקדם הסילואט (silhouette coefficient) ומדד Davies–Bouldin. נעשה שימוש באתחול K-means++ עם n_init = 10, max_iter = 30, tol = 1 × 10⁻4, ו-random_state = 42. צבירה היררכית בוצעה באמצעות צבירה אגלומרטיבית (agglomerative clustering) עם קישור ממוצע (average linkage) ומרחק קוסינוס (cosine distance). פתרונות מועמדים הושוו באמצעות מדדי תיקוף כמותיים, יציבות הצבירה וניתנות לפירוש מבחינה היסטוריה-אמנותית, ופתרון הצבירה הסופי נבחר בשל הייצוג הקוהרנטי ביותר של תבניות חזותיות חוזרות. השיוך לצבירה שהתקבל עבור כל אחד מ-433 הציורים נשמר לצורך השוואה עוקבת עם הקטגוריות שקודדו על ידי בני אדם.
קידוד ידני, הדרכה ובוררות
שני מקודדים סקרו באופן עצמאי את כל 43 התמונות באמצעות ספר קודים בגרסה מוגדרת, שהכיל קטגוריה ראשית, מספר דמויות, קבוצת גיל, תנוחה, לבוש, סביבה מרחבית, חפצים ויחסים חברתיים. רשומות ספציפיות של כל מקודד נשמרו לפני שלב הבוררות. למקודדים היה רקע רלוונטי בתולדות האמנות ובניתוח ויזואלי, והם הוכשרו באמצעות מדריך קידוד סטנדרטי ודוגמאות מייצגות ממאגר הציורים. לפני תחילת הקידוד הרשמי, הם ביצעו תרגיל כיול שכלל 30 ציורים כדי לקדם פרשנות עקבית של שבע קטגוריות הזהות וחמש ממדי הרמזים הוויזואליים.
במהלך הקידוד הפורמלי, שני מקודדים העריכו באופן עצמאי את כל הציורים המתאימים, בעודם מסווגים (blinded) להחלטות הקידוד זה של זה, לתוויות ה-AI הראשוניות ולהקצאות לצבירים. מהימנות בין-מקודדים נבחנה באמצעות מדד Cohen’s kappa. ערך הקאפה שנצפה עבור קטגוריית הזהות העיקרית היה 0.8, והמשתנים הקטגוריים של הרמזים החזותיים נעו בין 0.79 ל-0.92, מה שמעיד על הסכמה חזקה בין המקודדים. מחלוקות נפתרו באמצעות דיון והסכמה, והקטגוריה והקודים של הרמזים החזותיים שנקבעו נרשמו לצורך ניתוח מאוחר יותר12. התוויות שלפני הבתירה נשמרו.
הסכמה בין בינה מלאכותית לבני אדם והערכת ביצועים
הקטגוריה האנושית שנקבעה בבוררות שימשה כנקודת ייחוס להשוואה תיאורית עם תווית בינה מלאכותית ראשונית אחת לכל ציור. דיוק ההתאמה המדויקת הכולל חושב כ-356/43 (82.2%). רגישות הקטגוריה (Recall) חושבה כמספר ההתאמות המדויקות בין הבינה המלאכותית לבני האדם חלקי התמיכה של הייחוס האנושי עבור כל קטגוריה. תמיכת הקטגוריה, התאמות מדויקות, אי-התאמות והמכנים המתאימים דווחו באופן מפורש.
על בסיס 43 תוויות זוגיות של בינה מלאכותית ובני אדם ברמת המקרה, חושבו נתוני כושלים חיוביים (false positives) במחלקה המטרה, רמת דיוק (precision), רגישות (recall) ומדדי F1 לכל קטגוריה. נבנתה מטריצת בלבול מלאה כדי לנתח דפוסי סיווג חוצי-אלכסון, אשר הנחו לאחר מכן את סקירת אי-התאמות, תיעוד טקסונומיית השגיאות וכללי הפסיקה.
חבילת שחזור וחומרים
תהליך העבודה החישובי וחומרי המחקר התומכים אורגנו במאגר עם בקרת גרסאות. חבילת השחזור תוכננה לכלול סקריפטים לעיבוד מקדימה, ניתוח CLIP, לוקליזציה של SAM, UMAP, אשכולים (clustering), ניתוח הסכמה ויצירת איורים, יחד עם ספר קודים לקידוד ידני, קבצי הגדרה, מידע על תלויות, פלטים נגזרים ברמת המקרה, ורשימה קריאה למכונה של מקורות תמונות ומידע על זכויות. למשאבי המחקר שנשמרו הוקצה מזהה קבוע כדי להקל על השחזור והשימוש החוזר.
לצורך ארגון וניהול של מטא-נתונים נעשה שימוש ב-Microsoft Excel 2021. עבור הניתוחים החישוביים נעשה שימוש ב-CLIP ViT-B/32 לסימון ראשוני של שפה-חזון (vision–language labeling), ב-SAM למיקום של אלמנטים חזותיים, ב-UMAP עם מרחק קוסינוס (cosine distance) להפחתת ממדיות, וב-K-means ואשכולה היררכית (hierarchical clustering) לניתוח תבניות גישושי. פתרונות האשכולה הוערכו באמצעות מקדם הסילואט (silhouette coefficient) ומדד Davies–Bouldin, והסכמה בין מקודדים נבדקה באמצעות קאפא של כהן (Cohen’s kappa). סביבת התוכנה, הגדרות המודלים, ההגדרות החישוביות והזרעים האקראיים (random seeds) ששימשו לאורך תהליך העבודה תועדו כדי לתמוך בשחזוריות.