מאמר מחקר

שחזור וסינתזה של סגנון אמנותי של דגמים של מורשת תרבותית בלתי מוחשית באמצעות מסגרת למידה עמוקה המונחית על ידי סגמנטציה סמנטית

DOI:

10.3791/71577

14 באוגוסט 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

פרוטוקול זה מתאר תהליך עבודה של למידה עמוקה עבור סגמנטציה סמנטית, שחזור וסינתזה של סגנון אמנותי עבור דגמים של מורשת תרבותית בלתי מוחשית, תוך שימוש בחילוץ תכונות מבוסס transformer, שחזור אדברסרי ויצירת תמונות בעלת התאמה מרחבית, וזאת כדי לתמוך בשימור דיגיטלי וביישומי מורשת יצירתיים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השימור והשחזור הדיגיטלי של דגמים של מורשת תרבותית בלתי מומשית (ICH) זוכים לתשומת לב גוברת עם התקדמותן של טכניקות סינתזת תמונות מבוססות למידה עמוקה. גישות קיימות המבוססות על SegCycle-SPADE הדגימו פוטנציאל לסגמנטציה מבנית ושחזור אמנותי של דגמי מלאכה מסורתיים; עם זאת, נותרו מגבלות, הכוללות גיוון מוגבל של מערכי נתונים, שילוב לא מספק של סמנטיקה תרבותית, ושימור לא מספק של מאפייני דגם מבניים במהלך השחזור. כדי להתמודד עם אתגרים אלו, מחקר זה מציע מסגרת SegCycle-SPADE משופרת לסגמנטציה סמנטית ושחזור אמנותי של סוגי דגמי ICH. מודל סגמנטציה מבוסס Transformer, בשם SegFormer, מועסק כדי לזהות במדויק גבולות מוטיבים ואזורי דגמים. בנוסף, מוצג מודול Cross-Attention Cultural Feature Fusion לשיפור מוטיבים בעלי חשיבות תרבותית ולשיפור ייצוג המאפיינים. תרגום ושחזור של דגמים מבוצעים באמצעות CycleGAN, בעוד ש-Spatially-Adaptive Denormalization (SPADE) משמש לסינתזה של סגנון אמנותי כדי לשמור על עקביות סמנטית בין מפות הסגמנטציה לתמונות הנוצרות. כדי לשפר את הכללליות של המודל ואת הגיוון האמנותי, המסגרת מאומנת באמצעות מערך הנתונים של מוטיבים תרבותיים של Miao Batik ומערך הנתונים WikiArt. תוצאות ניסיוניות מדגימות כי מסגרת ה-SegCycle-SPADE המוצעת, המונחית על ידי attention, משפרת את דיוק הסגמנטציה ואת ביצועי שחזור דגמי המורשת בהשוואה לשיטות שחזור קיימות המבוססות על רשתות יריב גנרטיביות (GAN). המסגרת המוצעת מספקת פתרון ניתן להרחבה לתיעוד מורשת תרבותית, שחזור והחייאה אמנותית של עיצובי דגמים מסורתיים בסיוע בינה מלאכותית.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מורשת תרבותית, הכוללת הן אלמנטים בלתי מוחשיים כגון מנהגים, שפות ואמונות, והן אלמנטים מוחשיים כגון יצירות אמנות, מבנים ורישומים כתובים, היא ביטוי בסיסי של ההיסטוריה, היצירתיות והזהות האנושית1. שימור מורשת שואף לאפשר לקהילות להתחבר מחדש למקורותיהן ומאפשר לדורות הבאים להפיק תועלת מהזיכרון התרבותי הקולקטיבי שלהן. הוא גם מקדם הבנה בין-תרבותית, הערכה של מסורות ומנהגים מגוונים והכרה בנרטיבים היסטוריים שונים. נכסים תרבותיים אלו עוזרים לנו להבין את הערכים, נקודות המבט והחוויות של דורות קודמים ותורמים לעיצוב זהויות חברתיות עכשוויות ולהמשכיות תרבותית. העקרונות הבסיסיים של שימור מורשת תרבותית מומחשים ב-איור 1.

figure-introduction-1
איור 1. סקירה רעיונית של שחזור דגמי מורשת תרבותית באמצעות מסגרת ה-SegCycle-SPADE. איור סכמטי של הגישה המוצעת לשחזור והשבחה של דגמי מורשת תרבותית בלתי מוחשית. תהליך העבודה כולל איסוף נתונים ממאגרי הנתונים Miao Batik ו-WikiArt, עיבוד מקדים של תמונות, סגמנטציה סמנטית באמצעות SegFormer-B2, מיזוג תכונות באמצעות מודול מיזוג תכונות תרבותיות באמצעות תשומת לב צולבת (CAFFM), שחזור דגמים באמצעות CycleGAN, סינתזה של סגנון אמנותי באמצעות SPADE, והערכה סופית באמצעות מדדי סגמנטציה ושחזור. החיצים מצביעים על זרימת הנתונים והייצוגים של התכונות לאורך המסגרת. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

הזיכרון הקולקטיבי והמורשת התרבותית של החברה האנושית מגולמים במורשת תרבותית בלתי מוחשית (ICH), המשמשת כמדיום חשוב לביטוי אמנותי ולזהות תרבותית. עם זאת, ה-ICH ניצבת בפני אתגרים משמעותיים בשל השפעות הגלובליזציה והדיגיטציה2,3,4. פרקטיקות רבות של ICH הנמצאות בסכנה דורשות גישות חדשות לשימור ולפיתוח, בשל הירידה במספרם של בעלי מלאכה מיומנים והסתגלות מוגבלת לשווקים מודרניים5,6. כתחום חשוב במחקר של ICH, עיצוב בר-קיימא מדגיש את הפיתוח המשולב של התרבות, החברה והסביבה, ומספק נתיב מעשי להמשך שימורה של ה-ICH. באמצעות גישות של עיצוב בר-קיימא, ניתן להחיות את ה-ICH תוך התאמה לצרכיה של החברה העכשווית7,8.

במחקר זה, המונח "דפוסי מורשת תרבותית בלתי מוחשית" מתייחס לייצוגים של מוטיבים חזותיים המעבירים ומשמרים ערכים תרבותיים בלתי מוחשיים בסיסיים. כתוצאה מכך, המסגרת המוצעת שואפת לשמר ולתעד את המידע התרבותי הקשור למוטיבים אלו תוך שחזור צורותיהם החזותיות.

הרקמה והבאטיק של בני המיאו הם צורות משמעותיות של מורשת תרבותית בלתי מוחשית (ICH) סינית, המשקפות את ההיסטוריה, האמונות והמסורות של קהילת המיאו באמצעות מוטיבים סמליים כגון ציפורים, פרפרים וטוטמים אבקוטיים9. מוטיבים אלו מוטמעים עמוק בלבוש טקסי ובפרקטיקות של פסטיבלים, ותורמים לפיתוח התרבותי והכלכלי המקומי10,11. התקדמות בטכנולוגיות דיגיטליות, ובמיוחד בינה מלאכותית (AI) ולמידה עמוקה (DL), יצרה הזדמנויות חדשות לשימור, ניתוח, שחזור ותיעוד של מורשת תרבותית. באטיק מיאו מגוישואו, אחת ממסורות הבאטיק השמורות ביותר בסין, משמש כמדיום חשוב להעברת הידע התרבותי, האמונות, המנהגים והטקסים של בני המיאו12,13,14,15,16.

מחקרים אחרונים הדגימו את הפוטנציאל של DL לשימור מורשת תרבותית ושחזור תבניות, תוך השגת דיוק סגמנטציה משופר (pixel accuracy = 88.6%, mean intersection over union [IoU]= 78.1%) וביצועי שחזור טובים יותר בהשוואה ל-U-Net ו-DeepLabV3+1. עם זאת, נותרו מספר אתגרים. גישות קיימות המבוססות על רשתות Adversarial Generative (GAN) מתקשות לעיתים קרובות לשמר פרטים מבניים עדינים בתבניות מורכבות17, בעוד שגיוון מוגבל של מערכי נתונים מגביל את ההכללה של המודל בין תחומים תרבותיים שונים18. בנוסף, מודלים של תרגום תמונה-לתמונה כגון CycleGAN עלולים להיכשל בשמירה על עקביות סמנטית בין מפות סגמנטציה לתמונות הנוצרות19, והיעדר מנגנוני קשב (attention mechanisms) עלול להוביל לאובדן של פרטי מוטיבים בעלי חשיבות תרבותית במהלך השחזור20. לפיכך, נדרשת מסגרת משופרת המשלבת סגמנטציה מבוססת transformer, למידת תכונות מונחית-קשב ואימון על מערכי נתונים מרובים לשחזור יעיל של תבניות ICH.

הזדמנויות חדשות לשימור מורשת תרבותית הופיעו הודות לדיגיטציה של רקמת Miao ולהתקדמות המהירה של בינה מלאכותית יוצרת (generative AI). מודלי דיפוזיה (Diffusion models), מחלקה מתהווה של מודלים גנרטיביים עמוקים, הדגימו ביצועים מרשימים במשימות ראייה ממוחשבת בזכות יכולותיהם העוצמתיות ליצירת תוכן21,22,23,24,25. במהלך תהליך הדיפוזיה ההפוכה, המודל לומד בהדרגה לשחזר את נתוני הקלט המקוריים מתוך ייצוגים רועשים26,27,28. מחקרים קודמים בחנו גם את היישום של טכנולוגיות שחזור תלת-ממדי ותכנון בעזרת מחשב (CAD) לשימור והפצה של מורשת תרבותית.

אף על פי שרשתות עצביות קונבולוציוניות (CNNs) ו-GANs מציגות ביצועים טובים ביצירת תמונות ובשימור מאפיינים, הן עדיין מתמודדות עם אתגרים הקשורים לשדות קליטה מוגבלים, קריסת אופן (mode collapse) וחוסר יציבות באימון29. ארכיטקטורות מבוססות Transformer, כגון SegFormer ו-Segmenter, מצטיינות בלכידה של הקשר גלובלי ומערכות יחסים סמנטיות; עם זאת, הן דורשות משאבים חישוביים כבדים ועשויות להתקשות בטיפול בפרטים דקים. למרות שמודלי דיפוזיה כגון Stable Diffusion מדגימים יכולות חזקות של יצירת תמונות, הם לרוב חסרים שליטה מדויקת על המאפיינים המבניים והאמנותיים של העיצובים הנוצרים. יתרה מכך, מרבית הגישות הקיימות משתמשות באסטרטגיות אימון עצמאיות המגבילות שיתוף מידע יעיל ואופטימיזציה שיתופית בין רכיבי הסגמנטציה והיצירה, מה שמוביל לפשרה בין דיוק מבני לאותנטיות אמנותית30.

מודלים מבוססי דיפוזיה אחרונים, כגון latent diffusion ו-Stable Diffusion, משיגים סינתזה של תמונות באיכות גבוהה אך דורשים הסרת רעשים (denoising) איטרטיבית, דבר המוביל לעלייה בעלות החישוב ובזמן ההסקה. יתרה מכך, שימור מוטיבים תרבותיים עדינים ועקביות מבנית נותרים מאתגרים ללא מנגנוני התניה מיוחדים. מודלים גנרטיביים מבוססי Transformer לוכדים ביעילות קשרים קונטקסטואליים גלובליים, אך לעיתים קרובות הם דורשים מערכי נתונים רחבי היקף ומשאבי מחשוב משמעותיים. בניגוד לכך, מסגרת ה-SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) המוצעת משלבת סגמנטציה מבוססת SegFormer, היתוך מאפיינים באמצעות cross-attention, שחזור CycleGAN וסינתזה מונחית SPADE כדי לספק הדרכה מבנית מפורשת, ובכך לשפר את שימור המוטיבים, את העקביות הסמנטית ואת השחזור השליט של דפוסים של מורשת תרבותית.

מרבית הטכניקות המתקדמות לסגמנטציה סמנטית מסתמכות על רשתות נוירונים קונבולוציוניות מלאות (FCNNs) בעלות ארכיטקטורה בצורת U31. במהלך שלב הקידוד, מאפיינים עמוקים בעלי שדות קליטה גדולים מופקים באמצעות סדרה של פעולות קונבולוציה ודגימה מחדש כלפי מטה (downsampling). שלב הפענוח משחזר בהדרגה את הרזולוציה המרחבית באמצעות דגימה מחדש כלפי מעלה (upsampling), ובסופו של דבר מאפשר חיזוי סמנטי ברמת הפיקסל. על ידי פיצוי על אובדן מידע מרחבי במהלך הדגימה כלפי מטה ושיפור ביצועי הסגמנטציה במגוון רחב של יישומים, קשרי דילוג (skip connections) מאפשרים שילוב ישיר של מידע ברזולוציה גבוהה מרמות מקודד שונות אל תוך המפענח32.

בעוד ששיטות מבוססות GAN, CNN ודיפוזיה מהעת האחרונה הראו תוצאות מבטיחות ביצירת תמונות ובשימור מורשת תרבותית, הן מתקשות לעיתים קרובות לשמור על עקביות סמנטית, לשמר מוטיבים מבניים עדינים ולהבטיח שחזור הניתן לשחזור על פני דפוסים תרבותיים מגוונים. רוב הגישות הקיימות מתייחסות לסגמנטציה, שחזור וסינתזת סגנון כתהליכים נפרדים, מה שעלול להוביל לאובדן אלמנטים בעלי משמעות תרבותית ולתוצאות לא עקביות. כדי לגשר על פער מתודולוגי זה, מחקר זה מציע מסגרת SegCycle-SPADE מאוחדת המשלבת סגמנטציה סמנטית מבוססת SegFormer, מודול חדש למיזוג מאפיינים תרבותיים באמצעות Cross-Attention (CAFFM), שחזור מבוסס CycleGAN וסינתזת סגנון מונחית SPADE. על ידי שילוב מפורש של מידע סגמנטציה מבני עם למידת מאפיינים גנרטיבית, המסגרת המוצעת מאפשרת שחזור אמין יותר, עקבי סמנטית וניתן לשחזור של מוטיבים של ICH, תוך שימור הן של האותנטיות התרבותית והן של האיכות האמנותית.

במחקר זה זוהו שלוש מגבלות עיקריות של גישות נוכחיות לשחזור מורשת תרבותית: (i) שימור לא מספיק של מוטיבים מבניים עדינים בשיטות שחזור מבוססות GAN; (ii) יכולת הכללה מוגבלת כתוצאה מאימון על מערכי נתונים קטנים או ספציפיים לתחום; ו-(iii) עקביות סמנטית לא מספקת בין פלטי הסגמנטציה לבין התמונות הנוצרות במסגרות של תרגום תמונה-לתמונה. בנוסף, סגמנטציה, שחזור וסינתזה של סגנון מטופלים בדרך כלל כתהליכים נפרדים, מה שמוביל לאובדן של אלמנטים בעלי חשיבות תרבותית במהלך השחזור. באמצעות שילוב של סגמנטציה סמנטית מבוססת transformer, מיזוג מאפיינים באמצעות cross-attention, שחזור CycleGAN וסינתזה אמנותית מונחית SPADE בתוך ארכיטקטורה מאוחדת, מסגרת ה-SegCycle-SPADE המוצעת נותנת מענה למגבלות אלו ומשפרת את שימור המוטיבים, את העקביות הסמנטית ואת האותנטיות האמנותית בשחזור של דפוסי ICH.

המטרה העיקרית של מחקר זה היא לפתח מסגרת SegCycle-SPADE משופרת לשחזור אמנותי של דפוסי ICH המונחה על ידי סגמנטציה סמנטית. המסגרת משלבת את SegFormer עבור סגמנטציה מדויקת של מוטיבים תרבותיים, CycleGAN עבור שחזור דפוסים, ו-SPADE עבור סינתזה אמנותית עקבית בסגנונה. כדי לשפר את ייצוג התכונות ולשמר פרטים מבניים עדינים, הוצג CAFFM להנחלת אינטראקציה יעילה בין תכונות הסגמנטציה לתכונות הגנרטיביות. המסגרת המוצעת, שאומנה על מאגרי הנתונים Miao Batik ו-WikiArt, משפרת את אותנטיות השחזור, את העקביות הסגנונית ואת השימור של מוטיבים בעלי חשיבות תרבותית.

על ידי שילוב של סגמנטציה סמנטית, מיזוג תכונות מונחה-קשב, שחזור תבניות וסינתזת סגנון בתוך ארכיטקטורה מאוחדת, מחקר זה מציג את מסגרת SegCycle-SPADE החדשנית לשחזור אמנותי של תבניות מורשת תרבותית בלתי מוחשית (ICH). התרומות העיקריות של עבודה זו הן כדלקמן. ראשית, פותחה מסגרת שחזור חדשנית המונחית על ידי סגמנטציה סמנטית באמצעות שילוב של SegFormer, המאפשרת חילוץ ושימור מדויקים של מוטיבים תרבותיים מורכבים ואלמנטים מבניים. שנית, הוצג CAFFM חדש למיזוג יעיל של תכונות סגמנטציה עם ייצוגים גנרטיביים, המאפשר למודל ללכוד קשרים ארוכי-טווח בין מוטיבים תרבותיים לתבניות סגנון אמנותיות. שלישית, ה-CAFFM המוצע משפר את השימור של אלמנטים בעלי חשיבות תרבותית תוך שיפור הריאליזם הוויזואלי והקוהרנטיות המבנית של תבניות מורשת משוחזרות. רביעי, על ידי שילוב של CycleGAN לשחזור תבניות תרבותיות ו-SPADE לסינתזה אמנותית מונחית-סגמנטציה, המסגרת מבטיחה הן דיוק סמנטי והן אותנטיות סגנונית בתוצרי הגנרציה. חמישית, כדי לשפר את ההכללה ואת הגיוון האמנותי, המודל אומן באמצעות מערך נתוני מוטיבים תרבותיים של Miao Batik ללמידת תבניות תרבותיות ומערך נתוני WikiArt לייצוג סגנון אמנותי. WikiArt משמש כמאגר נתונים עזר להערכת יכולת ההכללה של המסגרת, עמידות למידת התכונות ויעילות בקרת הסגנון על פני הקשרים ויזואליים מגוונים, ולא כסגנון מטרה ליישום ישיר במוצרי מורשת תרבותית של Miao. לבסוף, בהשוואה לשיטות שחזור מורשת תרבותית קיימות המבוססות על GAN, תוצאות ניסיוניות מדגימות כי מסגרת SegCycle-SPADE המוצעת משיגה דיוק סגמנטציה משופר, איכות שחזור ועקביות סגנונית גבוהה יותר.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מסגרת העבודה המוצעת של SegCycle-SPADE נועדה לשחזר ולשפר דגמים של מורשת תרבותית מסורתית באמצעות סגמנטציה סמנטית, העשרת מאפיינים באמצעות מנגנון קשב (attention), שחזור גנרטיבי וסינתזה של סגנון אמנותי. מחקר זה השתמש במאגרי נתונים זמינים לציבור של מורשת תרבותית ותמונות אמנותיות, כולל מאגר הנתונים Miao Batik ומאגר הנתונים WikiArt. לא היו מעורבים במחקר משתתפים אנושיים, נתוני חולים, מידע אישי, בעלי חיים או רשומות קליניות; לכן, לא נדרשו אישור של ועדת אתיקה מוסדית או הסכמה מדעת. ראשית, מאגר מוטיבים תרבותיים של Miao Batik ומאגר הנתונים WikiArt משמשים להערכה. מאגר הנתונים Miao Batik תואר על ידי Quan et al. (2024)32 ומכיל 15,148 תמונות מתויגות של מוטיבים מסורתיים של באטיק Miao. התיוגים הקיימים שסופקו על ידי יוצרי מאגר הנתונים שימשו באופן ישיר, ולא הוכנסו תיוגים ידניים נוספים במחקר זה. לאחר מכן, ביצוע עיבוד מקדימה לתמונות מתבצע באמצעות שינוי גודל, נורמליזציה, הסרת רעשים ויצירת מסכת סגמנטציה. פרמטרי העיבוד המקדים המדויקים מתוארים בסעיף המשנה עיבוד מקדימה של נתונים. מסגרת העבודה המוצעת משתמשת במודל מבוסס transformer בשם SegFormer-B2 עבור הסגמנטציה הסמנטית של הנתונים. השיטה נועדה לזהות אזורי מפתח של מוטיבים תרבותיים וללמוד את המבנים שלהם. המאפיינים המפולחים מועשרים לאחר מכן באמצעות מנגנון קשב, שבו מידע חשוב הקשור למוטיבים תרבותיים מודגש ומידע לא רלוונטי נסלק. הגדרות מנגנון הקשב מתוארות בסעיף המשנה CAFFM. המאפיינים המועשרים מועברים לאחר מכן ל-CycleGAN, שבו מבנים פגומים משוחזרים באמצעות למידה מחזורית. במהלך האימון, דגימות מוטיבים חלקיות נוצרו באופן מלאכותי על ידי החלת פעולות של מיסוך אקראי והסתרה חלקית על תמונות Miao Batik המקוריות. הליכי הדרדרת אלו סימולו אזורי מוטיבים חסרים ונזקים מבניים הנצפים בדרך כלל בחפצי מורשת תרבותית שהתבלו. התמונות החלקיות שהתקבלו שימשו כקלט למודול השחזור של CycleGAN, בעוד שהתמונות המקוריות התואמות שימשו כיעדי שחזור. דגמי המורשת התרבותית המשוחזרים מועשרים לאחר מכן באמצעות SPADE, שבו מבוצעת העשרה אמנותית בהתבסס על מפות הסגמנטציה שנוצרו. ביצועיה של מסגרת העבודה המוצעת מוערכים באמצעות מדדי סגמנטציה כמותיים ומדדי איכות תמונה, בעוד שהאותנטיות הוויזואלית של המוטיבים התרבותיים המשוחזרים מוערכת באופן איכותי. האותנטיות הוויזואלית הוערכה באמצעות בדיקה ויזואלית של הדגמים התרבותיים שנוצרו ולא שימשה כמדד כמותי עצמאי. ההערכה התמקדה בשימור המוטיב, עקביות סמנטית, מאפיינים תרבותיים, קוהרנטיות מבנית ומראה אמנותי ביחס למוטיבים התרבותיים של הייחוס התואמים. הערכה כמותית של ביצועי המודל בוצעה באמצעות Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR), ו-Fréchet Inception Distance (FID). איור 2 ממחיש את זרימת העבודה הכוללת של מסגרת העבודה SegCycle-SPADE המוצעת ומסכם את מדדי ההערכה ששימשו במחקר זה.

figure-protocol-1
איור 2. זרימת העבודה הארכיטקטונית הכללית של מסגרת ה-SegCycle-SPADE המוצעת. סקירה כללית של זרימת העבודה המלאה של SegCycle-SPADE. תמונות ממאגרי הנתונים Miao Batik ו-WikiArt עוברות עיבוד מקדמי לפני שהן מעובדות באמצעות סגמנטציה סמנטית בעזרת SegFormer-B2, שיפור מאפיינים באמצעות CAFFM, שחזור תבניות באמצעות CycleGAN, ויצירת סגנון אמנותי באמצעות SPADE. ביצועי המודל מוערכים באמצעות Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR, Fréchet Inception Distance (FID), בעוד שהאותנטיות הוויזואלית מוערכת באופן איכותי. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

מסגרת SegCycle-SPADE לשחזור דגמים של מורשת תרבותית תוכננה לשלב מספר רכיבי DL לצורך סגמנטציה מדויקת של מוטיבים, שחזור והעשרה אמנותית, כפי שמוצג ב-איור 2. תמונות ממאגר נתוני מוטיבים תרבותיים של Miao Batik וממאגר הנתונים WikiArt משמשות כדי לספק דגמים תרבותיים וסגנונות אמנותיים מגוונים. בתחילה, התמונות מעובדות באמצעות מודול סגמנטציה סמנטית מבוסס SegFormer כדי לזהות ולהגדיר את המוטיבים התרבותיים מהרקע. הארכיטקטורה הכוללת מורכבת מארבעה שלבים עיקריים. ראשית, מודל ה-SegFormer מחלץ מפות סגמנטציה סמנטית מתמונות הדגמים התרבותיים. שנית, ה-CAFFM משלב תכונות סגמנטציה עם ייצוגים גנרטיביים כדי לשפר את למידת התכונות. שלישית, מודול ה-CycleGAN משחזר דגמים תרבותיים באמצעות ייצוגי התכונות הממוזגים. לבסוף, מודול ה-SPADE מייצר פלטים משופרים סגנונית תוך שמירה על עקביות מבנית באמצעות סינתזה מונחית סגמנטציה. מפות התכונות המזוקקות מעובדות לאחר מכן על ידי מודול השחזור CycleGAN, הלומד לשחזר מוטיבים תרבותיים חסרים על ידי מיפוי דגמים פגומים לצורותיהם השלמות המתאימות. דגימות של מוטיבים חסרים הופקו על ידי החלת פעולות של מיסוך אקראי והסתרה חלקית על תמונות ה-Miao Batik המקוריות, ובכך סומללו אזורים חסרים בדגם ודגישה מבנית הנצפים בדרך כלל בחפצי מורשת פגומים. כל תמונה פגומה צומדה לתמונה המקורית המתאימה לה, אשר שימשה כמטרה לשחזור במהלך האימון. אסטרטגיה זו אפשרה למודול ה-CycleGAN ללמוד את השחזור של מבני מוטיבים חסרים תוך שמירה על עקביות סמנטית ומאפיינים בעלי חשיבות תרבותית. לבסוף, מחולל ה-SPADE מייצר פלטים אמנותיים משופרים חזותית על ידי התניית סינתזת התמונה במפות הסגמנטציה שנוצרו, ובכך שומר על השלמות המבנית של המוטיבים התרבותיים לאורך תהליך ההעשרה האמנותית.

השלבים הבאים כלולים במסגרת ה-SegCycle-SPADE המוצעת.

שלב 1: איסוף מערכי נתונים
שני מערכי נתונים שימשו להשגת יעדי למידת דפוסים תרבותיים ויצירת סגנון אמנותי. מערך הנתונים של מוטיבי התרבות של באטיק מ尧 (Miao Batik Cultural Motif Dataset) שימש למסירת מידע על דפוסים תרבותיים מסורתיים. מערך הנתונים זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658) ומכיל 15,148 תמונות מתוייגות של מוטיבים מסורתיים של באטיק מ尧. התיוגים הקיימים שסופקו על ידי יוצרי מערך הנתונים שימשו באופן ישיר, ולא נוצרו תיוגים ידניים נוספים במחקר זה. מערך הנתונים WikiArt שימש למסירת מידע על סגנונות אמנותיים מגוונים לצורך יצירת סגנון אמנותי, והוא הושג ממאגר ה-WikiArt הזמין לציבור (https://www.wikiart.org/).

שלב 2: עיבוד מקדים של נתונים
כל התמונות עברו עיבוד מקדים הכולל שינוי גודל, נורמליזציה והפחתת רעשים. עבור שלב הסגמנטציה הסמנטית, נעשה שימוש באנוטציות קיימות של מוטיבים תרבותיים שהושגו ממקורות מערכי הנתונים המקוריים. לא בוצעו הליכי אנוטציה או תיוג מחדש נוספים כחלק ממחקר זה.

שלב 3: סגמנטציה של תבניות סמנטיות באמצעות SegFormer
מודל ה-SegFormer שימש לסגמנטציה של מוטיבים תרבותיים. ה-backbone המדויק של ה-SegFormer ואסטרטגיית האתחול מתוארים בתת-הסעיף Semantic Pattern Segmentation Using SegFormer. באופן ספציפי, ארכיטקטורת SegFormer-B2 עם backbone מסוג MIT-B2 שאימן מראש על ImageNet הועסקה לסגמנטציה סמנטית של מוטיבים. מודל זה לוכד ביעילות מידע קשרי גלובלי תוך שמירה על הפרטים המבניים המורכבים של תבניות תרבותיות מסורתיות.

שלב 4: CAFFM
ה-CAFFM משלב מאפייני סגמנטציה סמנטית עם ייצוגים גנרטיביים, מה שמאפשר למסגרת ללמוד הן מאפיינים של מוטיבים מבניים והן מידע על סגנון אמנותי. פרטי האינטגרציה של ה-CAFFM מופיעים בסעיף המשנה CAFFM. המודול ממוקם בין שלב הסגמנטציה הסמנטית המבוסס על SegFormer לבין שלב השחזור הגנרטיבי, ושם הוא ממזג מאפיינים מבניים שנגזרו מהסגמנטציה עם מאפייני שחזור באמצעות multi-head cross-attention. תהליך זה משפר את השימור של מוטיבים תרבותיים ומגביר את הריאליזם של תוצרי השחזור.

שלב 5: שחזור תבניות (CycleGAN)
המאפיינים המאוחדים מעובדים לאחר מכן על ידי מודול ה-CycleGAN כדי לשחזר מבני תבניות תרבותיות. ארכיטקטורת ה-CycleGAN ותצורת האימון מתוארות בסעיף המשנה Pattern Reconstruction Using CycleGAN. מודול השחזור מורכב משני מחוללים (generators) ושני מבדילים (discriminators), עושה שימוש בארכיטקטורת מחולל רשת שאריות (residual-network) עם תשעה בלוקי שאריות, משתמש במבדיל PatchGAN, ומאומן באמצעות הפסדי התנגשות (adversarial losses) והפסדי עקביות-מחזור (cycle-consistency losses). תצורה זו מאפשרת מיפוי דו-כיווני בין תחומים ומסייעת בשחזור של מבני תבניות תרבותיות חסרים.

שלב 6: יצירת סגנון אמנותי (SPADE)
הדפוסים המשוחזרים מעובדים לאחר מכן באמצעות מודול ה-SPADE לביצוע סינתזה של סגנון אמנותי מונחית-סגמנטציה. הגדרות הגנרטור של SPADE מתוארות בסעיף המשנה Artistic Style Generation Using SPADE. המודול עושה שימוש בבלוקים רסידואליים של SPADE, שכבות נורמליזציה אדפטיביות מרחבית, והתניה סמנטית הנגזרת ממפות סגמנטציה של SegFormer ומייצוגי תכונות של CAFFM. על ידי התניית יצירת התמונה במפות הסגמנטציה, הפלטים המסונתזים שומרים על יישור מבני עם המוטיבים התרבותיים המקוריים תוך שילוב מאפייני סגנון אמנותי.

שלב 7: הערכת ביצועים
המסגרת המוצעת הוערכה באמצעות מספר מדדי סגמנטציה והערכת איכות תמונה, כולל דיוק סגמנטציה (Segmentation Accuracy), IoU, מקדם דמיון דייס (Dice Similarity Coefficient), SSIM, PSNR ו-FID. כדי להעריך את העקביות הניסויית, כל הניסויים חזרו חמש פעמים תוך שימוש בזרעים אקראיים (random seeds) שונים, והתוצאות מדווחות כממוצע ± סטיית תקן. מובהקות סטטיסטית הוערכה באמצעות מבחני t מזווגים, עם סף מובהקות של p < 0.05.

איסוף מערכי נתונים
במסגרת המודל המוצע של SegCycle-SPADE, נעשה שימוש בשני מערכי נתונים להבנת דפוסים תרבותיים וללמידת סגנון. מערך הנתונים הראשון המשמש במסגרת המוצעת הוא מערך נתוני מוטיבים תרבותיים של באטיק Miao. מערך נתונים זה מכיל מוטיבים תרבותיים של באטיק Miao, שהם בדרך כלל תמונות של באטיק Miao מסורתי הכוללות מוטיבים כגון בעלי חיים, צמחים וצורות גיאומטריות, המשמשים באמנות של בני השבט Miao. מערך נתונים זה כולל תמונות בעלות מידע טקסטורלי עשיר, החשוב בדרך כלל לשימור מורשת תרבותית. מערך הנתונים השני המשמש במסגרת המוצעת של SegCycle-SPADE הוא מערך הנתונים WikiArt. מערך נתונים זה מכיל מספר עצום של יצירות אמנות, בדרך כלל בסגנונות שונים. מערך נתונים זה משמש ללמידת סגנון מורכב, דבר המועיל בדרך כלל לשיפור יצירות אמנות. מערך נתונים זה כולל 80,000 יצירות אמנות ברזולוציית HD, עם 27 עיצובים שונים, מה שהופך אותו למועיל יותר למשימות יצירה או טרנספורמציה של סגנון המבוססות על DL.

סט הנתונים Miao Batik:
סט הנתונים Miao Batik (https://doi.org/10.5281/zenodo.20807658) כולל 15,148 תמונות של דגמי באטיק המתארים מוטיבים בעלי משמעות תרבותית. התמונות כוללות מגוון של עיצובים מסורתיים, כגון מוטיבים של בעלי חיים (למשל, פרפרים ודגים), תבניות מבוססות צמחים ומוטיבים גיאומטריים הנושאים סמליות תרבותית. סט נתונים זה הוא מרכיב חשוב במסגרת המוצעת מכיוון שהוא מספק מבנים תרבותיים אותנטיים המאפשרים למודול הסגמנטציה לזהות ולשמר במדויק את גבולות המוטיבים במהלך שחזור התבנית (טבלה 1). במחקר זה, מוטיבים בעלי חשיבות תרבותית מתייחסים לאלמנטים חזותיים סמליים המתועדים נפוצים בספרות המורשת התרבותית של ה-Miao והמוצגים בתוך ההערות (annotations) של סט הנתונים, כולל ציפורים, פרפרים, תבניות פרחוניות וטוטמים אבותים. מוטיבים אלו נבחרו על סמך חשיבותם התרבותית המתועדת ונוכחותם החוזרת בעיצובי באטיק ורקמה מסורתיים של ה-Miao, ולא רק על סמך תדירות הופעתם או הרכבן המרחבי. ההערות של המוטיבים ותוויות הסגמנטציה בהנחיית מומחים התקבלו ממקור סט הנתונים המקורי של Miao Batik ושימשו ישירות במחקר זה. לא בוצעו על ידי המחברים הליכות נוספות של סימון ידני, תיוג מחדש או סימון בהנחיית מומחה. ההערות הקיימות שסיפקו יוצרי סט הנתונים שימשו לאימון ולהערכה של סגמנטציה סמנטית.

פרמטרתיאור
שם מערך הנתוניםMiao Batik Cultural Pattern Dataset
מקור מערך הנתוניםמאגר Zenodo (DOI: 10.5281/zenodo.20807658)
תחוםמורשת תרבותית בלתי מוחשית (ICH) / ניתוח דגמי טקסטיל
סך הכל תמונות15,148 תמונות
סוג תמונהתמונות דיגיטליות של דגמי טקסטיל מסורתיים של באטיק Miao
קטגוריות דגמיםמוטיבים של בעלי חיים, מוטיבים של צמחים ומוטיבים גיאומטריים
מקור תרבותיתרבות עדת Miao, מחוז Guizhou, סין
רזולוציית תמונה מקוריתתמונות ברזולוציה גבוהה (בדרך כלל ≥ 1,000 פיקסלים בצד הקצר) שצולמו כסריקות גולמיות או תצלומים לפני עיבוד מקדים
רזולוציית אימוןתמונות שגודלן שונה ל-256 × 256 פיקסלים במהלך העיבוד המקדים
זמינות השערות (Annotation)השערות סגמנטציה קיימות שסופקו על ידי יוצרי מערך הנתונים שימשו ללא שינוי לצורך אימון והערכה. במחקר זה לא בוצעו הליכי השערה ידנית נוספים, תיוג מחדש או הליכי אישור מומחים.
יישום במחקר זהסגמנטציה של מוטיבים תרבותיים, חילוץ מאפיינים, שימור מוטיבים ושחזור דגמים

טבלה 1: מאפייני מערך הנתונים של דגמי תרבות הבאטיק של המיאו. סיכום של מערך נתוני מוטיבים תרבותיים של באטיק מיאו המשמשים לסגמנטציה סמנטית, ניתוח דגמים תרבותיים ושחזור מוטיבים. הטבלה מתארת את מקור הנתונים, מאפייני התמונה, קטגוריות המוטיבים, המקור התרבותי, רזולוציית התמונה ואת תפקידו במסגרת ה-SegCycle-SPADE המוצעת.

סט הנתונים WikiArt:
סט הנתונים WikiArt [https://www.wikiart.org/] הוא מאגר אמנות דיגיטלי רחב היקף ופופולרי המכיל למעלה מ-80,000 תמונות מ-27 סגנונות אמנותיים שונים המופיעים ב-טבלה 2. הסגנונות כוללים את אמנות הרנסנס, אימפרסיוניזם, קוביזם וסוריאליזם. סט הנתונים חשוב מאוד במסגרת המוצעת, שכן הוא מספק ידע המאפשר למודול ה-SPADE ליצור דגמים מועשרים תרבותית תוך שמירה על מידע מבני שהתקבל מתהליך הסגמנטציה. סט הנתונים כולל 56,000 תמונות ללמידה ו-12,000 תמונות הן לוולידציה והן לבדיקה. התמונות בסט הנתונים מסייעות באימון יעיל של מודל ה-DL.

פרמטרתיאור
שם מערך הנתוניםWikiArt Dataset
מקור מערך הנתוניםWikiArt Repository (https://www.wikiart.org/)
תחוםאמנות דיגיטלית וציורים
סה"כ תמונותכ-80,000 יצירות אמנות
תמונות אימון56,000
תמונות תיקוף12,000
תמונות בדיקה12,000
סגנונות אמנותיים27 סגנונות אמנותיים, כולל רנסנס, אימפרסיוניזם, קוביזם, סוריאליזם, אקספרסיוניזם, ריאליזם ואמנות מופשטת
רזולוציית תמונה מקוריתרזולוציות התמונות המקוריות משתנות בין יצירות ומקורות שונים. התמונות שונו לגודל אחיד של 256 × 256 pixels במהלך העיבוד המקדים.
רזולוציית אימוןתמונות שונו לגודל של 256 × 256 pixels במהלך העיבוד המקדים לפני למידת הסגנון האמנותי וסינתזה של תמונות מונחית-סגמנטציה.
חלוקת מערך הנתוניםחלוקה אקראית מרובדת (70% אימון, 15% תיקוף ו-15% בדיקה) תוך שימוש ב-seed אקראי קבוע של 42
אסטרטגיית דגימת סגנוןנעשה שימוש בדגימה פרופורציונלית מרובדת כדי לשמר את ההתפלגות של 27 הסגנונות האמנותיים על פני תתי-הקבוצות של האימון, התיקוף והבדיקה
יישום במחקר זהלמידת סגנון אמנותי, ייצוג סגנוני וסינתזה אמנותית מונחית-סגמנטציה

טבלה 2: מאפייני מערך הנתונים WikiArt. סיכום של מערך הנתונים WikiArt המשמש ללמידת סגנון אמנותי וסינתזת תמונות מונחית-סגנון. הטבלה מתארת את מקור מערך הנתונים, התפלגות התמונות, כיסוי הסגנונות האמנותיים, חלוקת מערך הנתונים, רזולוציית התמונות והיישום שלו במסגרת SegCycle-SPADE המוצעת.

סט הנתונים Miao Batik מכיל 15,148 תמונות המייצגות מוטיבים תרבותיים מסורתיים של בני המיאו.32 סט הנתונים זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658). לפני אימון המודל, כל התמונות נבדקו ויזואלית, שונו לגודל של 256 × 256 pixels, עברו נורמליזציה ונבדקו לאיתור דגימות פגומות או כפולות. סינון בקרת האיכות לא הוביל להסרה של תמונות כלשהן; לפיכך, כל 15,148 התמונות נשמרו לצורך ניתוח המשך. סט הנתונים חולק באופן אקראי לתתי-קבוצות של אימון (70%), תיקוף (15%) ובדיקה (15%) באמצעות seed אקראי קבוע של 42 כדי להבטיח את השחזור של חלוקת הנתונים. הגישה לסט הנתונים WikiArt התבצעה דרך מאגר WikiArt הרשמי (https://www.wikiart.org/), והוא מכיל למעלה מ-80,000 יצירות אמנות המקיפות 27 סגנונות אמנותיים. עבור ניסויי למידת סגנון, נעשה שימוש ב-56,000 תמונות לאימון, 12,000 לתיקוף ו-12,000 לבדיקה.

עיבוד מקדים של נתונים
לפני אימון מסגרת SegCycle-SPADE המוצעת, מאגר הנתונים של מוטיבי התרבות של באטיק מיאו (Miao Batik) ומאגר הנתונים WikiArt עברו מספר שלבי עיבוד מקדים כדי להבטיח איכות תמונה עקבית וייצוג מדויק של תכונות. אותו תהליך עיבוד מקדים בסיסי, הכולל הסרת רעשים גאוסיאנית, נורמליזציה, שינוי גודל לרזולוציית קלט עקבית ואימות איכות התמונה, הוחל על שני מאגרי הנתונים. עם זאת, למאגרי הנתונים היו תפקידים שונים בתוך המסגרת. מאגר הנתונים WikiArt שימש ללמידה וסינתזה של סגנון אמנותי, בעוד שמאגר הנתונים של באטיק מיאו שימש בעיקר לסגמנטציה ושחזור של מוטיבים תרבותיים. לא בוצעו שינויים בעיבוד המקדים הספציפי למאגרי הנתונים מעבר לתפקידים ספציפיים אלו למשימה. כדי להבטיח עיבוד עקבי על ידי מודל ה-DL, תמונות שונו תחילה לרזולוציה קבועה. שלב זה היה נחוץ מכיוון שהתמונות בשני מאגרי הנתונים נבדלו ברזולוציה בהתאם למקורן. שינוי הגודל שיפר את היעילות החישובית ומנע מחוסר עקביות ממדית להשפיע על האימון. השלב השני בעיבוד המקדים היה נורמליזציה, שבה ערכי הפיקסלים הותאמו לטווח סטנדרטי כדי לייצב עדכוני גרדיאנט במהלך האימון. לאחר מכן התמונות עובדו באמצעות סינון גאוסיאני להפחתת רעשים שעלולים להפריע למבני המוטיבים התרבותיים. עבור מאגר הנתונים של באטיק מיאו, נעשה שימוש במסיכות סגמנטציה קיימות של מוטיבים תרבותיים שהושגו ישירות ממקור מאגר הנתונים המקורי, ללא שינוי, לצורך אימון והערכה של סגמנטציה סמנטית. לא הופקו מסיכות סגמנטציה חדשות במיוחד עבור מחקר זה.

אלא אם צוין אחרת, משוואות המתארות שיטות מבוססות הותאמו ממחקרים קודמים ומצוטטות בהתאם. המשוואות המתארות את ה-CAFFM המוצע ואת מסגרת האופטימיזציה המשולבת SegCycle-SPADE פותחו על ידי המחברים עבור מחקר זה.

נסמן תמונת קלט מתוך מערך הנתונים כפי שמוצג במשוואה 1:

figure-protocol-2  (1)

כאן, H, W ו-C מתייחסים לגובה התמונה, לרוחבה ולמספר ערוצי הצבע, בהתאמה. כל התמונות מותאמות לגודל קבוע H′ × W′ כפי שמוצג ב-משוואה 2:

figure-protocol-3

כאן, Iנא לספק את הטקסט באנגלית שברצונך לתרגם. היא התמונה לאחר שינוי הגודל. ערכי הפיקסלים הנורמליים מחושבים לפי משוואה 3:

figure-protocol-4   (3)

דבר זה מסייע בייצוב הליך האימון. סינון רעשים מבוצע באמצעות מסנן גאוסי, כפי שמוצג ב- משוואה 4:

figure-protocol-5

כאן, G(σ) הוא מסנן גאוסיאני ו-* מייצג קונבולוציה. נעשה שימוש במסנן גאוסיאני בעל גרעין (kernel) של 5 × 5 עם סטיית תקן של σ = 1.0. הוחלה ריפוד רפלקטיבי (Reflective padding) על פיקסלי השוליים כדי לצמצם ארטיפקטים של קצוות. תהליך הפחתת הרעש בוצע מיד לאחר טעינת התמונה, לפני השלב של שינוי קנה מידה ונורמליזציה. כדי להבטיח עיבוד מקדמי אחיד לאורך כל המחקר, אותה תצורת מסנן הוחלה על כל תמונה במאגרי הנתונים Miao Batik ו-WikiArt. עבור מאגר הנתונים Miao Batik, מסכות הסגמנטציה נוצרות בהתאם ל-משוואה 5:

figure-protocol-6

כאן, M היא מסכת סגמנטציה המשמשת להנחיית מודל ה-SegFormer.

תהליך העיבוד המקדים מתחיל ברכישת תמונות מתוך מאגר הנתונים Miao Batik ומאגר הנתונים WikiArt, כפי שמוצג ב-איור 3. לא נעשה שימוש בטכניקות של הרחבת נתונים (data augmentation) במהלך האימון. לאחר העיבוד המקדים, שכלל שינוי גודל, נורמליזציה, הסרת רעש גאוסיאנית והכנת מסכות סגמנטציה, התמונות שימשו ישירות לאימון, תיקוף ובדיקה של מסגרת SegCycle-SPADE המוצעת. השלב הראשוני של תהליך העיבוד המקדים כולל שינוי גודל של התמונות לגודל קבוע, מה שמאפשר למודל ה-DL לעבד את התמונות ביעילות רבה יותר. השלב השני כולל נורמליזציה, הממירה את ערכי הפיקסלים לטווח מספרי סטנדרטי ומסייעת להתכנסות המודל. השלב השלישי כולל הסרת רעשים, שבה התמונות מנוקות מרעשים בלתי רצויים כדי לשפר את זיהוי התבניות. בנוסף, עבור מאגר הנתונים Miao Batik, מבוצעים סימונים (annotation) של אזורי מוטיבים תרבותיים, מה שמאפשר יצירת מסכות המשמשות במודול הסגמנטציה של המודל המוצע ומבטיח שמוטיבים תרבותיים יישמרו במהלך היצירה. התוצר הסופי של שלב זה הוא מאגר נתונים נקי המוכן לאימון מודולי הסגמנטציה והיצירה של המודל המוצע.

figure-protocol-7
איור 3. תהליך עיבוד מקדים של נתונים עבור תמונות של מורשת תרבותית. תרשים זרימה הממחיש את הליכי העיבוד המקדים של התמונות המבוצעים לפני אימון המודל. התהליך כולל רכישת מערך נתונים, שינוי גודל תמונות, נורמליזציה, הפחתת רעשים גאוסיאנית, השמות קיימות של מוטיבים תרבותיים והכנת מסכות סגמנטציה. התמונות והמסכות המעובדות שמתקבלות משמשות כקלטים לסגמנטציה סמנטית ושחזור תבניות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

כל תמונה הועברה לתהליך בקרת איכות לפני אימון המודל. מערך הנתונים של Miao Batik הכיל 15,148 תמונות. דגימות פגומות, כפולות ודגימות באיכות נמוכה כבר טופלו על ידי יוצרי מערך הנתונים המקורי; לכן, לא הוצאו תמונות נוספות במהלך סינון בקרת האיכות במחקר זה. כתוצאה מכך, כל 15,148 התמונות נשמרו לצורך הניתוח. התמונות נטענו בפורמט RGB במהלך עיבוד מקדמי ושונו לגודל של 256 × 256 פיקסלים באמצעות אינטרפולציה ביליניארית. ערכי הפיקסלים הונורמלו מהטווח [0, 255] ל-[0, 1] על ידי חילוק ב-255. לאחר מכן הוחלה נורמליזציה לפי ערוצים באמצעות ערכי ממוצע של [0.485, 0.456, 0.406] וערכי סטיית תקן של [0.229, 0.224, 0.225] עבור הערוצים האדום, הירוק והכחול, בהתאמה. תהליך העיבוד המקדמי כלל טעינת תמונות, המרה ל-RGB, שינוי גודל, סקילום ערכי פיקסלים, נורמליזציה והמרה לטנזור. במידת הצורך, תמונות בגווני אפור הומרו לפורמט RGB בעל שלושה ערוצים כדי לשמור על תאימות עם מודלי ה-DL. לאחר העיבוד המקדמי, חולקו התמונות לתתי-קבוצות של אימון, תיקוף ובדיקה. כל השלבים של מסגרת ה-SegCycle-SPADE — כולל סגמנטציה סמנטית, היתוך מאפיינים, שחזור מוטיבים וסינתזה אמנותית מבוססת SPADE — השתמשו ברזולוציית קלט עקבית של 256 × 256 פיקסלים.

סגמנטציה של תבניות סמנטיות באמצעות SegFormer
לאחר שלב עיבוד מקדימה זה, התמונות הנקיות והנורמלליות של מערך נתוני מוטיבים תרבותיים של Miao Batik ומערך הנתונים WikiArt מוזנות למודול הסגמנטציה הסמנטית המבוסס על מסגרת SegFormer-B2 המוצעת. מטרת שלב זה היא לזהות ולהפריד נכונה מוטיבים תרבותיים המופיעים בתבניות מורשת. המסגרת המוצעת של SegFormer מבוססת על ארכיטקטורת transformer הכוללת מקודד Transformer היררכי ומפענח MLP קל משקל, במטרה ללכוד במדויק מידע קשרי גלובלי וכן מידע מבני מפורט מתבניות מורשת מורכבות. המודל מחלץ תחילה ייצוגי מאפיינים במקשבים מרובים מהתמונה הקלטית, ולאחריהם מיזוג של ייצוגים אלו באמצעות המפענח כדי להפיק תבניות מסגמנטות ומדויקות. דבר זה מבטיח שהתבניות בתמונת המורשת יסוגמנטו נכונה למוטיבים כגון תבניות גיאומטריות, תבניות פרחוניות ותבניות סמליות, ובכך יופרדו מהרקע תוך שמירה על השלמות המבנית שלהן. מידע מבני זה ישמש בהמשך בשלבים מאוחרים יותר של יצירת תבניות בתוך מסגרת SegCycle-SPADE.

יהי תמונת הקלט שעברה עיבוד מקדים מיוצגת כ- משוואה 6:

figure-protocol-8    (6)

המקודד (encoder) של SegFormer מחלק את התמונה לטלאים (patches) ומחלץ מאפיינים היררכיים באמצעות שכבות טרנספורמר, כפי שמוצג במשוואה 71:

figure-protocol-9

כאן, F מסמנת את מפות המאפיינים רב-הקשביות המתקבלות מהמקודד של הטרנספורמר. מאפיינים אלו מקודדים הן תבניות מרקם מקומיות והן קשרי הקשר גלובליים בין אזורי מוטיב. מודל ה-SegFormer מחלץ מפות מאפיינים בקשבים שונים כפי שמוגדר במשוואה 8:

figure-protocol-10

השימוש בייצוגים רב-קנה-מידה מקל על זיהוי של תבניות בגדלים שונים בתוך מוטיבים תרבותיים. לבסוף, המאפיינים משולבים באמצעות מפענח MLP כפי שמוצג ב-משוואה 91:
 figure-protocol-11

כאן, S מציין את מפת הסגמנטציה הסופית שנחזתה.

שלד ה-SegFormer-B2 אותחל באמצעות משקולות שעברו אימון מוקדם על ImageNet, ולאחר מכן עבר כוונון עדין (fine-tuning) על מערך נתוני ה-Miao Batik לצורך סגמנטציה של מוטיבים תרבותיים. נקודת הבקרה (checkpoint) של האימון המוקדם נלקחה מהמימוש הרשמי של SegFormer. באופן ספציפי, נקודת הבקרה MIT-B2 שעברה אימון מוקדם על ImageNet-1K (mit_b2.pth), כפי שסופקה במאגר הרשמי של SegFormer, שימשה לאתחול שלד ה-SegFormer-B2 לפני הכוונון העדין. המשקולות של האימון המוקדם תואמות לשלד MIT-B2 שפורסם על ידי מחברי SegFormer ושימשו כמודל האתחול לאימון סגמנטציה סמנטית. שאר השכבות הספציפיות למשימה אותחלו באמצעות נהלי אתחול המשקולות ברירת המחדל של PyTorch לפני האימון.

בארכיטקטורה נעשה שימוש במקודד Transformer היררכי בעל ארבעה שלבים עם שיבודי טלאים (patch embeddings) חופפים. בשלב הראשוני, גודל הטלאי נקבע ל-7 × 7 עם פסיעה (stride) של 4. עבור כל אחד מארבעת שלבי המקודד, ממדי השיבוד היו 64, 128, 320 ו-512. לאורך ארבעת השלבים, היו 1, 2, 5 ו-8 ראשי תשומת-לב עצמית מרובי-ראשים (multihead self-attention), ועומקי המקודד התואמים היו 3, 4, 6 ו-3 שכבות. מאפיינים רב-קניי במקור מהמקודד אוגגרו באמצעות מפענח all-MLP קל משקל. לפני יצירת מפת הסגמנטציה הסופית, המפענח השליך מאפיינים מכל שלב במקודד לתוך מרחב שיבוד יחיד. כל בלוקי ה-Transformer השתמשו בפונקציית ההפעלה Gaussian Error Linear Unit (GELU). שיעור dropout של 0.1 שימש במהלך האימון כדי לשפר את ההכללה ולהפחית התאמת-יתר (overfitting).

במהלך שלב האימון, מסגרת ה-SegFormer מקבלת את התמונות שעברו עיבוד מקדים משני מאגרי הנתונים. התמונות ממאגר הנתונים של Miao Batik מכילות אזורי מוטיבים המשמשים כתוויות ללמידה מודרכת של מודל הסגמנטציה. מקודד ה-Transformer מעבד את התמונה כולה ולוכד קשרים ארוכי טווח בין מרכיבי התמונה, דבר החשוב במיוחד עבור דגמי באטיק מסורתיים המכילים מוטיבים המפוזרים מרחבית. מנגנון חילוץ התכונות ההיררכי לוכד בו-זמנית מבנים מקומיים, כגון מרקמים גיאומטריים חוזרים. מפענח ה-MLP מעבד תכונות אלו ומפיק מסכת סגמנטציה המדגישה את אזורי המוטיבים. מפות הסגמנטציה הנוצרות בשלב זה משמשות לאחר מכן כקלט מבני עבור מודול הקשב (attention module) ושלב שחזור הדפוס, ובכך מסייעות בשמירה על האותנטיות של הדגמים הנוצרים.

מוטיבים תרבותיים חולקו למחלקות שונות לצורך סגמנטציה סמנטית בהתאם למאפייניהם החזותיים והתרבותיים. טקסונומיית הסגמנטציה כללה מוטיבים של בעלי חיים (למשל, פרפרים, דגים, ציפורים ופאונה סמלית אחרת), מוטיבים של צמחים (למשל, פרחים, עלים, גפנים ותבניות בוטניות), מוטיבים גיאומטריים (למשל, צורות חוזרות, מסגרות ומבנים גיאומטריים מופשטים), ואזורי רקע המייצגים אזורים שאינם מוטיבים. מסיכות סגמנטציה ברמת פיקסל שימשו לשיוך כל פיקסל לאחת המחלקות שהוגדרו מראש. תוויות מספרים שלמים קודדו באופן הבא: תווית 0 = רקע, תווית 1 = מוטיבים של בעלי חיים, תווית 2 = מוטיבים של צמחים, ותווית 3 = מוטיבים גיאומטריים. הערות הסגמנטציה ותוויות המוטיבים הופקו ישירות ממקור מערך הנתונים המקורי של Miao Batik. במחקר זה לא בוצעו הליכי התוויה ידנית נוספים, שינוי תוויות, אימות גבולות או הליכי אישור על ידי מומחים. ההערות הקיימות שסופקו על ידי יוצרי מערך הנתונים שימשו ללא שינוי לצורך אימון והערכה.

מודל ה-SegFormer לסגמנטציה של מוטיבים תרבותיים מעבד את התמונות שעברו עיבוד מקדים מתוך מערך הנתונים של Miao Batik ומערך הנתונים של WikiArt באמצעות מנגנון מבוסס טרנספורמר (transformer) לזיהוי מדויק של אזורי דגמים תרבותיים, כפי שמוצג ב-איור 4. ראשית, תמונת הקלט המכילה מוטיבים תרבותיים מסורתיים מוגשת למודל ה-SegFormer. מקודד ה-Transformer מחלץ מידע קשרי גלובלי ומאפיינים מבניים מקומיים מפיסות תמונה (image patches). המאפיינים רב-הקשריים המתקבלים מועברים למפענח הסגמנטציה, המשתמש ברשת Mix Feed-Forward כדי לזקק את ייצוגי המאפיינים ולשפר את זיהוי המוטיבים. הפלט של מודל ה-SegFormer הוא מסכת סגמנטציה המדגישה פיקסלים התואמים לדגמים תרבותיים תוך דיכוי מידע רקע שאינו רלוונטי. הדגמים התרבותיים המבודדים משמשים לאחר מכן כהנחיה מבנית לשלבים הבאים של מסגרת ה-SegCycle-SPADE.

figure-protocol-12
איור 4. סגמנטציה סמנטית של מוטיבים תרבותיים המבוססת על SegFormer-B2. ארכיטקטורה של מודול הסגמנטציה הסמנטית SegFormer-B2 המשמש לחילוץ מוטיבים תרבותיים ואומן באופן בלעדי על מערך נתוני Miao Batik. המסגרת מורכבת ממקודד (encoder) מבוסס Transformer לחילוץ מאפיינים רב-קנה מידה וממפענח (decoder) סגמנטציה קל משקל ליצירת מסכות של מוטיבים. המודל חוזה ארבע מחלקות סמנטיות — בעל חיים, צומח, גיאומטרי ורקע — כאשר מסכות הסגמנטציה המתקבלות מזהות אזורי מוטיבים בעלי משמעות תרבותית תוך דיכוי מידע רקע לא רלוונטי. פלטי סגמנטציה אלו מספקים הנחיה מבנית לשלבי היתוך המאפיינים, השחזור והסינתזה האמנותית העוקבים של מסגרת SegCycle-SPADE המוצעת. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

אין צורך ביצירת הערות סגמנטציה חדשות במסגרת המוצעת. מערך הנתונים של ה-Miao Batik נרכש ממקור ציבורי קיים, והמודל אומן באמצעות מידע על מוטיבים רלוונטיים שסופק על ידי יוצרי מערך הנתונים. במהלך תהליך הלמידה, מודל ה-SegFormer הפיק מפות סגמנטציה סמנטית. כתוצאה מכך, המחקר הנוכחי לא דרש תוכנה נוספת להערות ידניות, הנחיות להערות או נהלי בקרת איכות להערות.

CAFFM
כדי לשפר את האינטראקציה בין המאפיינים של סגמנטציה סמנטית לבין הייצוגים של שחזור גנרטיבי, המחקר הציע גם CAFFM. מקודד ה-SegFormer-B2 מספק מפות מאפיינים סמנטיים למודול ה-CAFFM, בעוד ששלב השחזור של ה-CycleGAN מספק מפות מאפיינים גנרטיביים. ראשית, נעשה שימוש בשכבות היטל ליניאריות כדי להטיל את שני זרמי המאפיינים למרחב הטמנה (embedding space) משותף. לצורך חישוב קשב צולב (cross-attention), נוצרים ייצוגי שאילתה (Q), מפתח (K) וערך (V) באמצעות טנזורי המאפיינים שנוצרו. לאחר מכן, הקשרים בין המידע על מוטיבים מבניים לבין אלמנטים של סגנון אמנותי ממודלים באמצעות קשב צולב רב-ראשי (multihead cross-attention). לאחר מכן מוחלים נרמול שכבות, חיבורים שיוריים ושכבות הזנה קדימה עם הפעלת GELU על ייצוגי המאפיינים המאוחדים. שלב הסינתזה המבוסס על SPADE מקבל את הפלט של מודול ה-CAFFM, מה שמאפשר שימור של תמות בעלות משמעות תרבותית מבלי להתפשר על העקביות האמנותית.

כדי להבטיח תאימות של המאפיינים, המאפיינים הנכנסים מוקרנים תחילה באמצעות שכבות הקרנה ליניאריות אל מרחב שיכון (embedding space) משותף עם ממד שיכון של 256. הקשרים בין המידע המבני הסמנטי לבין ייצוגי הסגנון הגנרטיביים ממודלים לאחר מכן באמצעות מנגנון MultiHead Cross-Attention עם שמונה ראשי קשב. חישוב ה-Cross-attention משתמש בוקטורי השאילתה (Q), המפתח (K) והערך (V) המופקים על ידי שכבות טרנספורמציה ליניאריות ספציפיות. כדי להגביר את יציבות האימון ולשמור על שלמות המאפיינים, נעשה שימוש בחיבורים שאריתיים (residual connections) ובנורמליזציה של שכבות (Layer Normalization) כדי לשפר עוד יותר את ייצוגי המאפיינים הממוזגים. למידת מאפיינים לא-ליניארית משופרת לאחר מכן על ידי יישום רשת feed-forward עם פונקציית האקטיבציה Gaussian Error Linear Unit (GELU). ייצוג מאפייני פלט בממד 256 נוצר על ידי המודול ונשלח לשלבים אחרים לצורך סינתזה יצירתית. ה-CAFFM משלב בהצלחה נתוני סגנון אמנותי עם מבני מוטיבים תרבותיים באמצעות טכניקת מיזוג מבוססת cross-attention, אשר משפרת את שימור המוטיב ואת הקוהרנטיות הוויזואלית בדפוסי המורשת התרבותית המשוחזרים.

במערכת המוצעת, המאפיינים המבניים נגזרים ממאגר הנתונים של Miao Batik, בעוד שהמאפיינים הסגנוניים נלמדים ממאגר הנתונים WikiArt. נסמן ב-Fs את מפת המאפיינים שנגזרה מרשת הסגמנטציה SegFormer באמצעות תמונות ממאגר הנתונים של Miao Batik, ואילו את מפת המאפיינים שנגזרה מענף הפקת מאפייני הסגנון באמצעות תמונות מ-WikiArt נסמן ב-Fa. ה-CAFFM המוצע משלב את שני תחומי המאפיינים באמצעות מנגנון תשומת לב צולבת (cross-attention) כדי ללמוד תלויות מבניות וסגנוניות של תבניות תרבותיות. טבלה 3 מפרטת את כל המאפיינים הארכיטקטוניים, כולל ממדי השכבות (embedding dimensions), שכבות נורמליזציה, פונקציות אקטיבציה ותצורת ראשי התשומת לב. עבור גודל תמונת קלט של 256 × 256 pixels, מקודד ה-SegFormer-B2 הפיק מפות מאפיינים סמנטיים בגודל 64 × 64 × 128, בעוד שענף הפקת מאפייני הסגנון הפיק מפות מאפיינים בגודל 64 × 64 × 128. שתי מפות המאפיינים הוקרנו באמצעות שכבות ליניאריות למידות אל תוך מרחב השכבה (embedding space) משותף בממד 256 לפני מיזוג התשומת לב הצולבת.

פרמטרתצורה
מסגרת מוצעתSegCycle-SPADE
מודל סגמנטציה סמנטיתSegFormer-B2
שלבי מקודד SegFormer4
אתחול משקולותSegFormer-B2 מאומן מראש על ImageNet-1K (שלד MIT-B2)
מקור נקודת ביקורת (Checkpoint)מאגר SegFormer הרשמי של NVIDIA (https://github.com/NVlabs/SegFormer); נקודת ביקורת: segformer.b2.512x512.ade.160k
אסטרטגיית כוונון עדין (Fine-Tuning)כוונון עדין מקצה לקצה על סט הנתונים Miao Batik
גודל שיבוץ פאץ' (Patch Embedding)7 × 7
צעד פאץ' (Patch Stride)4
ממדי שיבוץ64, 128, 320, ו-512
עומקי מקודד3, 4, 6, ו-3
ראשי קשב (Attention Heads)1, 2, 5, ו-8
סוג מפענחמפענח All-MLP
פונקציית אקטיבציהGELU
שיעור נשירה (Dropout Rate)0.1
מודול שיפור מאפייניםמודול מיזוג מאפיינים תרבותיים באמצעות קשב צולב (CAFFM)
ממד שיבוץ CAFFM256
ראשי קשב CAFFM8
קשקלי מיזוג CAFFM4
מודל שחזורCycleGAN
מודל יצירת סגנוןSPADE
סט נתונים תרבותיסט נתוני Miao Batik
סט נתוני סגנוןסט נתוני WikiArt
תמונות Miao Batik15,148
תמונות WikiArtבערך 80,000
רזולוציית תמונת קלט256 × 256 pixels
פורמט צבעRGB
שיטת אינטרפולציהאינטרפולציה ביליניארית
שיטת ניקוי רעשיםסינון גאוסי
גודל גרעין גאוסי5 × 5
סיגמא גאוסי (σ)1
טווח נורמליזציה[0, 1]
גודל אצווה (Batch Size)16
מספר תקופות (Epochs)100
אופטימייזרAdam
קצב למידה0.0002
פרמטרי Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0
פונקציות הפסדהפסד סגמנטציה, הפסד אדברסרי, הפסד עקביות-מחזורית, הפסד שחזור, הפסד שימור-מוטיב, והפסד עקביות-סגנון
אסטרטגיית פיצול סט נתוניםאימון / תיקוף / בדיקה
סט אימון70%
סט תיקוף15%
סט בדיקה15%
גרעין אקראי (Random Seed)42
מדדי הערכהדיוק סגמנטציה, IoU, מקדם Dice, SSIM, PSNR, ו-FID
שפת תכנותPython 3.8.10
מסגרת למידה עמוקהPyTorch 1.10.0
פלטפורמת חומרהNVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (דור 11), 32 GB RAM
סביבת הפעלהUbuntu 20.04 LTS

טבלה 3: מערך ניסויי ותצורת מודל. סיכום של רכיבי הארכיטקטורה, תצורת האימון, הגדרות עיבוד מקדים, מערכי נתונים, פרמטרי אופטימיזציה, מדדי הערכה והסביבה החישובית ששימשו למימוש ולהערכה של מסגרת ה-SegCycle-SPADE המוצעת.

מודול הקשב ממפה תחילה את מפת המאפיינים לייצוגי שאילתה (query), מפתח (key) וערך (value) באמצעות משוואה 10:

figure-protocol-13

כאן, Wq, Wk, ו-Wv הן מטריצות משקלים הניתנות ללמידה. משקולות הקשב מחושבות על בסיס הדמיון בין וקטור השאילתה לוקטור המפתח באמצעות משוואה 1117

figure-protocol-14

כאן, dk הוא ממד וקטור המפתח. ייצוג התכונות המשופר מחושב על ידי הכפלת משקולות הקשב במטריצת הערכים באמצעות משוואה 12:

figure-protocol-15

כאן, Fa הוא ייצוג התכונות המשופר של מפת התכונות. ייצוג התכונות המשופר מחושב על ידי שילוב תכונות הסגמנטציה המקוריות עם התכונות המשופרות שהתקבלו באמצעות מנגנון הקשב לפי משוואה 13:

figure-protocol-16                                

כאן, ז׳ה_ משמשת לשחזור תבניות. ה-CAFFM מורחב באמצעות מנגנון קשב-הצלבה (cross-attention) רב-קנה מידה כדי לחלץ מאפיינים עבור מוטיבים תרבותיים בקני מידה שונים. נניח ש- נכוןsi סמן את מאפייני הסגמנטציה בקנה מידה רחב iבעוד ש- ז'aג' מייצג את מאפייני הסגנונות האמנותיים באותו קנה מידה. ייצוג המאפיינים הסופי מוגדר באמצעות משוואה 14:

  figure-protocol-17

כאן, Qi, Ki, ו-Vi מייצגים את מטריצות השאילתה (query), המפתח (key) והערך (value) בקנה מידה i, בהתאמה, ו-N מציין את מספר קני המידה של המאפיינים. במחקר זה, N = 4, מה שמתאים למפות מאפיינים שהופקו ברזולוציות מרחביות של 1/4, 1/8, 1/16, ו-1/32 מגודל תמונת הקלט. ייצוגי מאפיינים רב-קני מידה אלו אוחדו באמצעות משקולות קשב (attention weights) למידה לפני השחזור והסינתזה האמנותית. הרחבה זו מאפשרת לשיטה לחלץ מוטיבים וטקסטורות תרבותיות גלובליות כדי לשחזר דפוסים תרבותיים. CAFFM ממוקם בין שלב הסגמנטציה המבוסס על SegFormer לבין שלב הסינתזה היצירתית המבוסס על SPADE במערכת SegCycle-SPADE המוצעת. ראשית, בעוד ש-CycleGAN יוצר במקביל מאפייני שחזור עם מידע סגנוני ומידע הקשור לדפוסים, SegFormer-B2 משחזר מפות מאפיינים סמנטיות המתארות את התכונות המבניות של מוטיבים תרבותיים. מודול ה-CAFFM מקבל את שני זרמי המאפיינים הללו ומשתמש באיחוד מבוסס קשב-הצלבה (cross-attention) כדי לזהות קשרים בין ייצוגים מבניים לאמנותיים. כדי ליצור דפוסים אותנטיים תרבותית תוך שמירה על עקביות סמנטית ותכונות מבניות, מפות המאפיינים המאוחדות שמתקבלות נשלחות לאחר מכן למודול ה-SPADE לסינתזה יצירתית מודרכת-סגמנטציה.

שחזור תבניות באמצעות CycleGAN
לאחר סיום שלב שיפור המאפיינים המבוסס על מנגנוני קשב (attention), מפות המאפיינים יכילו את מבני המוטיבים התרבותיים המשופרים. עם זאת, מפות המאפיינים עשויות להכיל עדיין אזורי תבנית חסרים או פגומים. לכן, כדי לפתור את בעיית שחזור התבניות, המסגרת המוצעת תשתמש במודל CycleGAN. במסגרת המוצעת, שני הדומיינים יהיו תבניות המוטיבים התרבותיים המקוריות ותבניות המוטיבים התרבותיים המשוחזרות. באמצעות המאפיינים המשופרים מהשלבים הקודמים, מודל ה-CycleGAN ישחזר את התבניות התרבותיות תוך שמירה על עקביות מבנית. דבר זה יבטיח שתבניות תרבותיות כגון תבניות גיאומטריות, תבניות פרחוניות ותבניות סמליות ישמרו על הסידור המרחבי שלהן. תמונות ה-Miao Batik המקוריות הוכפפו לפעולות של מיסוך אקראי והסתרה חלקית כדי לייצר מוטיבים תרבותיים חסרים או פגומים. הליכי דגרדציה אלו סימולצו אזורי תבנית חסרים ונזקים מבניים הנצפים בדרך כלל בחפצי מורשת תרבותית שהתבלו. התמונות שעברו דגרדציה שימשו כקלטים למודול השחזור, בעוד שהתמונות המקוריות התואמות שימשו כתמונות ייחוס להערכת ביצועים ולהערכת איכות השחזור. אסטרטגיה זו אפשרה למודל ללמוד את השחזור של מבני מוטיב חסרים תוך שימור עקביות סמנטית ומאפיינים תרבותיים.

תן X יהיה תחומם של דפוסים תרבותיים חסרים ו Y יהיו התחום של דפוסי תרבות משוחזרים. שני הגנרטורים לומדים לבצע מיפוי דו-כיווני באמצעות משוואה 15:

 figure-protocol-18

כאן, GE משמש לשחזור מבני מוטיבים ו-FM משמש למיפוי התבניות בחזרה לדומיין המקורי. ההפסד האדברסרי (adversarial loss) משמש כדי להבטיח שהתבניות המשוחזרות הן ריאליסטיות (משוואה 16)30

figure-protocol-19

כאן, DY הוא המבחין (discriminator) המשמש להבחנה בין תבניות אמיתיות למשוחזרות, ו-GE(x) מייצג את התבנית המשוחזרת שנוצרה. ה-CycleGAN אוכף גם עקביות מחזורית (cycle consistency) כדי לשמר את המבנה המבני של מוטיבים תרבותיים (משוואה 17)30.

figure-protocol-20

פונקציית ההפסד הסופית מוגדרת באמצעות משוואה 1830:

figure-protocol-21

כאן, λi מציין את מקדם השקלול עבור הפסד עקביות-המחזור (cycle-consistency loss) והוגדר כ-10 במהלך האימון, בהתאם לניסוח המקורי של CycleGAN. ערך זה נבחר כדי לאזן בין למידה אדברסרית (adversarial learning) לבין עקביות שחזור בין דומיין המקור לדומיין היעד.

מודול השחזור של CycleGAN מורכב משני גנרטורים ושני דיסרימינטורים לתרגום תמונות דו-כיווני. כל גנרטור מבוסס על ארכיטקטורת רשת שאריות (residual-network) הכוללת שכבת קונבולוציה ראשונית של 7 × 7, ולאחריה שתי שכבות קונבולוציה של דגימה מחדש כלפי מטה (downsampling), תשעה בלוקים של שאריות ושתי שכבות של דגימה מחדש כלפי מעלה (upsampling). כל פעולות הקונבולוציה משתמשות בגודל גרעין של 3 × 3, למעט שכבת הקלט, המשתמשת בגרעין של 7 × 7 לצורך חילוץ תכונות משופר. נורמליזציה של מופעים (Instance Normalization) מיושמת לאחר כל שכבת קונבולוציה כדי לשפר את יציבות האימון, בעוד שפונקציית הפעלה מסוג ReLU משמשת לאורך רשת הגנרטור. שכבת הפלט משתמשת בפונקציית הפעלה מסוג Tanh כדי להפיק פלטי תמונות מנורמלים. הדיסרימינטור מבוסס על ארכיטקטורת PatchGAN של 70 × 70 המורכבת מסדרה של שכבות קונבולוציה עם גדלי גרעין של 4 × 4 וערוצי תכונות העולים בהדרגה. נורמליזציה של מופעים והפעלת LeakyReLU (שיפוע שלילי = 0.2) מיושמות בדיסרימינטור כדי לשפר את הבחנה בין תכונות ולמידה אדברסרית. מודול ה-CycleGAN מקבל כתמונות קלט תמונות של מוטיבים תרבותיים שעברו עיבוד מקדים ומפיק ייצוגי דפוסים משוחזרים, אשר מועברים לאחר מכן ל-CAFFM לשילוב עם תכונות סגמנטציה. אימון ה-CycleGAN בוצע באמצעות אופטימייזר Adam (β₁ = 0.5, β₂ = 0.999) עם קצב למידה ראשוני של 0.0002. קצב הלמידה נשמר במהלך 100 האיפוכות (epochs) הראשונות ולאחר מכן דעך לינארית לאפס לאורך תקופת האימון הנותרת. בופר השמעה (replay buffer) המכיל 50 תמונות שנוצרו בעבר שימש לייצוב אימון הדיסרימינטור. הגנרטורים והדיסרימינטורים עודכנו ביחס עדכון של 1:1, כאשר עדכון גנרטור אחד ה followed על ידי עדכון דיסרימינטור אחד בכל איטרציית אימון.

תהליך השחזור של ה-CycleGAN מבוסס על מפות מאפיינים משופרות שהתקבלו באמצעות מנגנון ה-CAFFM ב-איור 5. מפות המאפיינים מכילות מוטיבים תרבותיים משופרים שהתקבלו משלבי הסגמנטציה וה-CAFFM הקודמים. מפות המאפיינים משמשות כקלט לגנרטור הראשון GE. הגנרטור הראשון GE לומד את המיפוי הנדרש לשחזור דפוסים תרבותיים. הפלטים מוזנים לאחר מכן למבחן (discriminator) DY כדי להבחין בין דפוסים תרבותיים אמיתיים לבין דפוסים משוחזרים. המבחן DY מסייע לגנרטור GE להפיק פלטים ריאליסטיים. כדי להבטיח שדפוסים תרבותיים לא יעוותו במהלך השחזור, הגנרטור השני FM מבצע מיפוי עקביות-מחזורית (cycle-consistency mapping). הגנרטור השני FM ממפה את הפלטים בחזרה לדומיין המקורי. הפלטים מוערכים לאחר מכן על ידי המבחן כדי להבטיח ריאליסטיות. הפלטים הסופיים מועברים לאחר מכן למודול ה-SPADE ליצירת סגנון אמנותי בשלב הבא של מסגרת ה-SegCycle-SPADE המוצעת.

figure-protocol-22
איור 5. זרימת עבודה לשחזור תבניות המבוססת על CycleGAN. זרימת העבודה של מודול השחזור CycleGAN. ייצוגי תכונות מועצמים באמצעות מנגנון קשב (Attention) מסופקים כקלטים לרשת הגנרטור כדי לשחזר מוטיבים תרבותיים חסרים. הדיסקרימינטור מעריך את הפלטים המשוחזרים אל מול תבניות ייחוס, בעוד שמיפוי עקביות-מחזור (cycle-consistency mapping) שומר על השלמות המבנית במהלך תרגום תמונות דו-כיווני. מוטיבים משוחזרים מועברים לאחר מכן למודול SPADE עבור סינתזה של סגנון אמנותי. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

יצירת סגנון אמנותי באמצעות SPADE
בשלב הבא, המוטיבים התרבותיים המשוחזרים מושמאים למודול ה-SPADE לצורך יצירת סגנון אמנותי. המטרה העיקרית של מודול ה-SPADE היא להוסיף טקסטורות עשירות חזותית של סגנון אמנותי למוטיבים התרבותיים המשוחזרים, מבלי לפגוע בפריסה המבנית של המוטיבים. מודול ה-SPADE הוא טכניקה ליצירת תמונות מותנית המשתמשת במושג של סגמנטציית תמונות ליצירת תמונות. מפות סמנטיות רב-ערוציות, שהתאימו למחלקות מוטיבים שנקבעו מראש, קודדו ממסכות הסגמנטציה הסמנטית שהופקו על ידי SegFormer-B2. מחולל ה-SPADE קיבל מפות מקודדות אלו כקלט מותנה. פרמטרי קנה מידה (γ) והטיה (β) 적אדפטיביים מרחבית הופקו על ידי עיבוד המפות הסמנטיות דרך שכבות קונבולוציה בתוך כל שכבת SPADE. כך יכול היה המחולל לשמר גבולות מוטיבים, פריסות מבניות ומידע סמנטי במהלך הסינתזה האמנותית, על ידי החלת פרמטרים אלו על הפעלות תכונות (feature activations) מנורמליות. ההכוונה הסמנטית יכלה להשפיע הן על שחזור מבני ברמה גבוהה והן על סינתזה של טקסטורה ברמה נמוכה, מכיוון שתהליך ההתניה בוצע במספר שכבות של מחולל ה-SPADE. כתוצאה מכך, הדפוסים האמנותיים שנוצרו שילבו מאפיינים סגנוניים שנרכשו ממאגר הנתונים WikiArt, תוך שמירה על מבני המוטיבים התרבותיים שנמצאו בשלב הסגמנטציה.

מערך הנתונים WikiArt, הכולל עבודות מ-27 קטגוריות אמנותיות שונות—כגון רנסנס, אימפרסיוניזם, קוביזם, אקספרסיוניזם, סוריאליזם, ריאליזם ואמנות מופשטת—שימש כמשאב המרכזי להבנת סגנונות אמנותיים. על מנת לחשוף את המודל למגוון של מאפיינים יצירתיים ולשפר את ההכללה הסגנונית, תמונות סגנון נבחרו באופן אקראי מהקטגוריות השונות במהלך האימון. מערך הנתונים חולק לתתי-קבוצות של אימון, תיקוף ובדיקה עם ייצוג מאוזן של הקטגוריות האמנותיות כדי להפחית הטיות סגנוניות. כדי להבטיח ייצוג מאוזן של כל 27 הקטגוריות האמנותיות, נעשה שימוש בדגימה מוקצבת (stratified sampling). דגימות מכל קטגוריה הוקצו באופן פרופורציונלי לתתי-הקבוצות של האימון, התיקוף והבדיקה, תוך שמירה על התפלגות המחלקות המקורית. מודול ה-CAFFM שימש למיזוג היבטי הסגנון שהופקו מתמונות WikiArt עם מאפייני השחזור שיוצרו על ידי CycleGAN. כדי לאפשר לרשת הסינתזה להעביר תכונות אמנותיות תוך שמירה על המבנה הסמנטי וגבולות המוטיב התרבותי הנגזרים ממפות הסגמנטציה, הייצוגים הממוזגים שהתקבלו סופקו כמידע התני (conditioning information) לגנרטור ה-SPADE. הודות לטכניקה זו של התניית סגנון, המסגרת המוצעת הייתה מסוגלת להפיק דגמים אמנותיים אותנטיים תרבותית עם ייצוגים מבניים וסגנוניים עקביים.

SPADE מציגה גם פרמטרים אדפטיביים מרחביים התלויים במפת הסגמנטציה. ניתן להגדיר את הפרמטרים כפי שמוצג ב- משוואה 191:

figure-protocol-23

כאן, γ(S) הוא פרמטר קנה המידה המשתנה מרחבית ו-β(S) הוא פרמטר ההטיה המשתנה מרחבית. הפרמטרים יכולים לסייע למחולל ליצור מרקמים וסגנונות שונים בהתאם לאזור הסמנטי בתמונות. ניתן להגדיר את היצירה התרבותית הסופית כפי שמוצג ב-משוואה 20:

 figure-protocol-24

כאן, GE הוא מחולל ה-SPADE, XrP הוא התבנית המשוחזרת, ו-SM הוא מפת הפילוח. היצירה הסופית שומרת על השלמות המבנית של מוטיבים תרבותיים תוך שיפור המראה האמנותי. פונקציית הפסד מורכבת, המאזנת בין דיוק פילוח סמנטי, שימור מוטיבים תרבותיים, איכות שחזור התבנית ועקביות הסגנון האמנותי, שימשה לאופטימיזציה של ארכיטקטורת ה-SegCycle-SPADE המוצעת. תערובת משוקללת של הפסד פילוח (Lseg), הפסד אדברסרי (Ladv), הפסד עקביות-מחזור (Lcycle), הפסד שחזור (Lrecon), הפסד שימור-מוטיבים (Lmotif) והפסד עקביות-סגנון (Lstyle) שימשה להגדרת מטרת האימון הכוללת. פונקציית ההפסד הכוללת מוגדרת במשוואה 21:

figure-protocol-25  (21)

על מנת להבטיח עקביות מבנית בין המוטיבים התרבותיים שהוזנו לאלה ששוחזרו, מקדם ההפסד של עקביות-המחזור (cycle-consistency loss) נקבע ל-10. כדי לשמר מאפייני מוטיב עדינים ולהגביר את הדיוק הוויזואלי, מקדם הפסד השחזור נקבע ל-5. כדי להדגיש את השימור של תבניות מבניות חיוניות מבחינה תרבותית במהלך הסינתזה האמנותית, נעשה שימוש במקדם של 2 עבור הפסד שימור-המוטיב. על מנת לקדם העברת סגנון אמנותי ללא עיוות מופרז של מבני מוטיב סמנטיים, מקדם הפסד עקביות-הסגנון הותאם ל-1. כדי לשמור על תרומה מאוזנת בין הפקת תמונה ריאליסטית לבין סגמנטציה מדויקת של המוטיב, נתנו משקלות שוות להפסדי הסגמנטציה וההפסדים האדברסריים. ייצוגי הסגנון מבוססי-מאפיינים של מאגר הנתונים WikiArt שימשו לחישוב הפסד עקביות-הסגנון. בפרט, מאפייני סגנון אמנותי נלכדו באמצעות קורלציות של מטריצת Gram שנלקחו ממפות מאפיינים עמוקות. כדי לחשב את הפסד הסגנון, נעשה שימוש בהפרש נורמת Frobenius בין מטריצות ה-Gram של תמונת סגנון המטרה לבין התמונה הנוצרת, כפי שמוצג ב-משוואה 22:

figure-protocol-26

כאן, Gl היא מטריצת הגרם שחושבה משכבת המאפיינים ה-lth, Igen מייצג את התמונה האמנותית שנוצרה, Istyle מייצג את תמונת הסגנון המטרה מתוך מאגר הנתונים WikiArt, ו-F מייצג את נורמת פרובניוס (Frobenius norm). ניסוח זה מאפשר למסגר המוצעת לשמר מאפיינים אמנותיים תוך שמירה על השלמות המבנית והסמנטית של מוטיבים תרבותיים.

ייצוגי התכונות הממוזגים המופקים על ידי מודול ה-CAFFM משמשים כקלט התניה למודול ה-SPADE, המשמש כרכיב הסינתזה האמנותית של המסגרה המוצעת. מחולל ה-SPADE מורכב משבעה בלוקים של SPADE residual עם ממד תכונות חבוי של 256 ערוצים, ומייצר תמונות פלט ברזולוציה של 256 × 256 פיקסלים. מפות סגמנטציה סמנטית שהתקבלו ממודול ה-SegFormer–CAFFM משמשות כקלט התניה לאורך שכבות ה-SPADE residual. שכבות SPADE מוחלות לפני פונקציות ההפעלה בתוך כל בלוק residual, מה שמאפשר התניה סמנטית מונחית סגמנטציה. באמצעות פעולות דגימה כלפי מעלה (upsampling) וקונבולוציה עוקבות, ייצוג התכונות החבוי עובר עידון הדרגתי כדי להפיק דפוסים אמנותיים ברזולוציה גבוהה תוך שמירה על עקביות סמנטית ומבנה מוטיבי. פונקציות הפעלת LeakyReLU נמצאות בשימוש לאורך כל המחולל, ופונקציית הפעלת Tanh מוחלת בשכבת הפלט כדי להפיק תמונות מנורמליות.

אלגוריתם וזרימת עבודה
מסגרת ה-SegCycle-SPADE משלבת סגמנטציה סמנטית, מיזוג מאפיינים, שחזור תבניות וסינתזה של סגנון אמנותי בתוך צינור אימון מאוחד. זרימת העבודה מתחילה ברכישת מערך נתונים ובעיבוד מקדימה, הכולל שינוי גודל תמונות, נורמליזציה, הסרת רעשים והכנת מסכות סגמנטציה. התמונות שעברו עיבוד מקדימה מעובדות לאחר מכן באמצעות רשת הסגמנטציה SegFormer-B2 כדי להפיק ייצוגי מוטיב סמנטיים. מאפייני הסגמנטציה המתקבלים ממוזגים עם מאפייני שחזור באמצעות ה-CAFFM, מה שמאפשר אינטראקציה בין מידע על מוטיבים מבניים לבין ייצוגי מאפיינים אמנותיים. מפות המאפיינים הממוזגות מסופקות לאחר מכן למודול השחזור CycleGAN, המשחזר מבני מוטיב תרבותיים חסרים תוך שמירה על עקביות סמנטית. התבניות המשוחזרות מסופקות לאחר מכן למחולל ה-SPADE לביצוע סינתזה אמנותית מונחית-סגמנטציה, המאפשרת שיפור סגנוני תוך שמירה על גבולות המוטיב ואותנטיות מבנית. במהלך האימון, פרמטרי המודל מותאמים באמצעות פונקציית ההפסד המורכבת המתוארת ב-משוואות 21 ו-22, המאזנת בין דיוק הסגמנטציה, שימור המוטיבים, איכות השחזור ועקביות הסגנון האמנותי. זרימת עבודה מפורטת ליישום שלב-אחר-שלב, הכוללת טעינת מערך נתונים, עיבוד מקדימה, אתחול מודל, איטרציות אימון, נהלי תיקוף, בחירת נקודות ביקורת (checkpoints) והערכה סופית, מופיעה ב-קובץ משלים 1 (אלגוריתם 1). זרימת העבודה האלגוריתמית המלאה יושמה עם גודל אצווה (batch size) של 16, קצב למידה של 0.0002 ו-100 תקופות אימון (epochs). גרעין אקראי קבוע של 42 שימש לחלוקת מערך הנתונים, לאתחול המודל ולכל ניסויי האימון. הגרעין הוחל באופן עקבי על מחוללי המספרים האקראיים של Python, NumPy ו-PyTorch כדי להבטיח שחזוריות. אופטימייזר ה-Adam הוגדר עם β₁ = 0.5, β₂ = 0.999 וללא דעיכת משקלים (weight decay = 0). נקודות ביקורת של המודל נבחרו על בסיס ציון ה-IoU הגבוה ביותר שהושג במערך הנתונים לתיקוף.

אופטימיזציה של פונקציית ההפסד
כדי לשמר מבני מוטיב תרבותיים במהלך השחזור והסינתזה האמנותית, המסגרת המוצעת עושה שימוש ביעד אופטימיזציה מורכב המשלב הפסדי סגמנטציה, הפסדים אדברסריים, עקביות מחזורית, שחזור, שימור מוטיב ועקביות סגנונית. הניסוח המתמטי המלא, מקדמי השקלול והגדרת הפסד הסגנון מופיעים במשוואות 21 ו-22 בתוך תת-הסעיף Artistic Style Generation using SPADE. רכיב שימור המוטיב מעניש סטיות מבניות בין אזורי המוטיב שנחזו לבין מסכות הסגמנטציה המקבילות של ה-ground-truth, ובכך מעודד שימור של מבני תבניות בעלי חשיבות תרבותית לאורך תהליך השחזור.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מסגרת ה-SegCycle-SPADE המוצעת הוערכה באמצעות שני מאגרי נתונים: מאגר מוטיבים תרבותיים של Miao Batik ומאגר הנתונים WikiArt. מאגר הנתונים של Miao Batik מכיל תמונות של מורשת תרבותית מסורתית ושימש בעיקר למשימות של סגמנטציה סמנטית ושחזור מבני, בעוד שמאגר הנתונים WikiArt מכיל סגנונות אמנותיים מגוונים ושימש ללמידה ויצירה של סגנון אמנותי. תמונות משני מאגרי הנתונים עובדו דרך צינור העיבוד המלא של SegCycle-SPADE, הכולל סגמנטציה סמנטית, CAFFM, שחזור תבניות ויצירת סגנון אמנותי מבוסס SPADE. השילוב של מידע על מוטיבים תרבותיים וייצוגים של סגנון אמנותי אפשר למסגרת לייצר פלטים בעלי משמעות תרבותית ועקביות חזותית.

כל הניסויים בוצעו בתחנת עבודה התומכת ב-GPU ומצוידת במעבד Intel Core i7 וב-GPU של NVIDIA. באופן ספציפי, הניסויים בוצעו בתחנת עבודה המצוידת ב-CPU מסוג Intel Core i7 (דור 11), GPU מסוג NVIDIA RTX 3090 עם 24 GB VRAM, ו-32 GB של זיכרון מערכת. המודלים הוממשו באמצעות Python 3.8 ו-PyTorch 1.10 עם האצת CUDA. האימון בוצע באמצעות הגדרה של GPU יחיד ללא אימון מבוזר. לאורך כל הניסויים נעשה שימוש בדיוק FP32 סטנדרטי, ולא נעשה שימוש באימון בדיוק מעורב (mixed-precision training). נעשה שימוש באופטימייזר Adam עם גודל batch של 16 למשך 100 תקופות אימון (epochs). טבלה 3 מסכמת את פרמטרי ההמישה והסביבה החישובית ששימשו במחקר זה.

הארכיטקטורה המוצעת מורכבת מארבעה רכיבים עיקריים: SegFormer-B2 לסגמנטציה סמנטית, CAFFM למיזוג תכונות, CycleGAN לשחזור מוטיבים, ו-SPADE לסנתזה של סגנון אמנותי. תמונות משני מאגרי הנתונים שונו לגודל של 256 × 256 פיקסלים לפני האימון. רזולוציה סטנדרטית זו הבטיחה יעילות חישובית תוך שימור פרטי מוטיבים חשובים, ותרמה לאימון אדברסרי יציב של מודול ה-CycleGAN ומודול ה-SPADE.

ביצועי המסגרת המוצעת הוערכו באמצעות מדדי סגמנטציה והערכת איכות תמונה, הכוללים Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR ו-FID. האותנטיות הוויזואלית הוערכה איכותית באמצעות בדיקה חזותית של הדפוסים התרבותיים שנוצרו. ההערכה האיכותית התמקדה בשימור מוטיבים, עקביות סמנטית, מאפיינים תרבותיים ומראה אמנותי ביחס למוטיבים התרבותיים המשמשים כייחוס. האותנטיות הוויזואלית לא שימשה כמדד הערכה כמותי עצמאי.

הערכה כמותית של המסגרת המוצעת בוצעה באמצעות המדדים הבאים.

דיוק הסגמנטציה חושב באמצעות משוואה 23:

figure-results-1

כאן, TP, TN, FP ו-FN מייצגים חיוביים אמיתיים, שליליים אמיתיים, חיוביים שגויים ושליליים שגויים, בהתאמה.

ה-IoU חושב באמצעות משוואה 24:

 figure-results-2

מקדם הדמיון של דייס (Dice) חושב באמצעות משוואה 25:

figure-results-3

נעשה שימוש ב-SSIM כדי להעריך דמיון תפיסתי בין תמונות, והוא מוגדר באמצעות משוואה 2633:

figure-results-4  (26)

כאן, μ מייצגת את העוצמה הממוצעת, σ מייצגת את השונות, σxy מייצגת את השונות המשותפת (covariance) בין התמונות, ו-C1 ו-C2 הם קבועים מייצבים.

PSNR הוא מדד המשמש באופן נפוץ להערכת האיכות של תמונות שנוצרו, והוא מוגדר במשוואה 2733:

figure-results-5

כאן, MaxI מציין את ערך הפיקסל המקסימלי האפשרי של התמונה, ו-MSE היא השגיאה הריבועית הממוצעת בין התמונה המקורית לתמונה המשוחזרת.

ניתן לחשב את ה-FID באמצעות ממוצעים ומטריצות שונות משותפת (covariance matrices) כפי שמוצג ב-משוואה 2833:

figure-results-6   (28)

כאן, μr הוא ערך הממוצע של התמונה האמיתית, μg הוא ערך הממוצע של התמונה הנוצרת, ו-Σr ו-Σg הן מטריצות השונות המשותפת (covariance matrix) של התמונות האמיתיות והנוצרות, בהתאמה.

להשוואת ביצועים, המסגרת המוצעת נבחנה אל מול שיטות מייצגות הנפוצות לפלחמנטיקה (semantic segmentation), שחזור תמונות ויצירת תמונות אמנותיות. U-Net ו-DeepLabV3+ נכללו כקווי בסיס לפלחמנטיקה, בעוד ש-Pix2Pix ו-CycleGAN נכללו כקווי בסיס לשחזור. StyleGAN ו-AttentionGAN שימשו כשיטות מייצגות ליצירת תמונות אמנותיות. השוואות אלו נערכו כדי להעריך את יעילותו של SegCycle-SPADE בשימור מידע על מוטיבים מבניים, תוך שיפור סימולטני של האיכות האמנותית.

כל ניסוי חזר חמש פעמים כדי להעריך את יציבות הביצועים והשחזוריות. נעשה שימוש בגרעין אקראי קבוע של 42 עבור חלוקת מערך הנתונים, כדי להבטיח תתי-קבוצות עקביות של אימון, תיקוף ובדיקה בכל הניסויים. התוצאות מדווחות כממוצע ± סטיית תקנית. ערכי סטיית התקנית הנמוכים שנצפו עבור Accuracy, IoU, Dice, SSIM, PSNR ו-FID מעידים על כך שהמסגרה המוצעת השיגה ביצועים יציבים לאורך הרצות ניסוייות חוזרות. מובהקות סטטיסטית הוערכה באמצעות מבחני t מזווגים, והבדלים נחשבו למובהקים סטטיסטית כאשר p < 0.05. מכיוון שכל המודלים הוערכו על אותן חלוקות של מערך הנתונים, התקבלו מדידות ביצועים מזווגות על פני הרצות חוזרות, דבר המצדיק את השימוש במבחני t מזווגים. כדי לשלוט בשיעור השגיאה המשפחתית (family-wise error rate) הקשורה להשוואות זוגיות מרובות, הוחל תיקון בונפרוני (Bonferroni correction), ומובהקות סטטיסטית נקבעה באמצעות סף מתוקנן של α/n, כאשר n מייצג את מספר ההשוואות הזוגיות.

הממצאים הניסיוניים תומכים בעוצמה ביעילותו של מסגרת ה-SegCycle-SPADE המוצעת. ביצועי הסגמנטציה העליונים שהושגו על ידי SegFormer-B2 מדגימים את יכולתו לזהות ולשמר במדויק גבולות של מוטיבים בעלי חשיבות תרבותית. שיפורים במדדי ה-IoU וה-Dice מעידים עוד על שימור יעיל של מבני מוטיבים סמנטיים לאורך צינור העיבוד. השילוב של CycleGAN ו-SPADE שחזר בהצלחה מבני מוטיבים חסרים תוך שמירה על פרטים ויזואליים עדינים, כפי שמשתקף בערכי ה-SSIM וה-PSNR המשופרים. יתרה מכך, מדדי FID נמוכים יותר מצביעים על כך שהדגמים האמנותיים שנוצרו מראים דמיון רב יותר לתמונות תרבותיות ואמנותיות אותנטיות, מה שמרמז על קוהרנטיות סגנונית וריאליזם ויזואלי משופרים.

ה-CAFFM תרם משמעותית לשיפורים אלו על ידי קידום אינטראקציה יעילה בין מידע מבני שהופק מפילוח (segmentation) לבין ייצוגים של סגנון גנרטיבי. באמצעות היתוך תכונות המבוסס על cross-attention, ה-CAFFM שיפר הן את הנאמנות המבנית והן את האותנטיות האמנותית, תוך שימור קשרים ארוכי טווח בין מוטיבים תרבותיים.

איור 6 מציג את השוואת דיוק הסגמנטציה בין מסגרת ה-SegCycle-SPADE המוצעת לבין שיטות קיימות על גבי מאגרי הנתונים Miao Batik ו-WikiArt. גישות סגמנטציה מסורתיות כגון U-Net ו-DeepLabV3+ השיגו ביצועים תחרותיים הודות ליכולתן ללמוד ייצוגים מרחביים. עם זאת, Pix2Pix ו-CycleGAN הראו דיוק סגמנטציה נמוך יותר מכיוון שלא תוכננו במיוחד למשימות סגמנטציה. מסגרת ה-SegCycle-SPADE המוצעת השיגה את דיוק הסגמנטציה הגבוה ביותר בשני מאגרי הנתונים, וזאת בשל השילוב של SegFormer-B2 והגברת תכונות מבוססת CAFFM.

figure-results-7
איור 6. השוואת דיוק הסגמנטציה בין שיטות שונות. השוואה של דיוק הסגמנטציה שהתקבל באמצעות U-Net, DeepLabV3+, Pix2Pix, CycleGAN ומסגרת ה-SegCycle-SPADE המוצעת על מערכי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמש הרצות עצמאיות (n = 5). פסי השגיאה מייצגים סטיית תקן אחת. ערכים גבוהים יותר מעידים על ביצועי סגמנטציה משופרים. מסגרת ה-SegCycle-SPADE המוצעת השיגה את דיוק הסגמנטציה הגבוה ביותר בשני מערכי הנתונים. אנא לחצו כאן להצגת גרסה גדולה יותר של איור זה.

איור 7 מציג את השוואת ה-IoU בין השיטות שנבחנו. U-Net ו-DeepLabV3+ הגיעו לביצועי חפיפה חזקים הודות לארכיטקטורות המכוונות לסגמנטציה שלהן. בניגוד אליהם, Pix2Pix ו-CycleGAN הניבו ערכי IoU נמוכים יותר מכיוון שמטרתן העיקרית היא תרגום תמונה ולא סגמנטציה סמנטית. מסגרת SegCycle-SPADE המוצעת השיגה את ערכי ה-IoU הגבוהים ביותר בשני מאגרי הנתונים, מה שמעיד על שיפור במיקום ובשימור של אזורי מוטיבים תרבותיים.

figure-results-8
איור 7. השוואת ציוני Intersection over Union (IoU) עבור סגמנטציה של מוטיבים תרבותיים. השוואת ביצועי IoU בין שיטות סגמנטציה שונות במאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמש הרצות עצמאיות (n = 5). פסי השגיאה מציינים סטיית תקן אחת. ערכי IoU גבוהים יותר מעידים על חפיפה משופרת בין אזורי המוטיב החזויים לאזורי הייחוס ועל שימור טוב יותר של גבולות המוטיב. מסגרת SegCycle-SPADE המוצעת השיגה את ציוני ה-IoU הגבוהים ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי להציג גרסה מוגדלת של איור זה.

איור 8 מציג את השוואת מקדם דמיון Dice. מדד Dice מודד את החפיפה בין מסכות הסגמנטציה החזויות לבין אזורי המוטיב המקוריים (ground-truth). גישות סגמנטציה קונבנציונליות השיגו ציוני Dice גבוהים יחסית בשל יעילותן בלמידת מבנים מרחביים. עם זאת, מסגרת SegCycle-SPADE המוצעת השיגה את ציוני ה-Dice הגבוהים ביותר בשני מערכי הנתונים, דבר המעיד על עקביות סגמנטציה משופרת ושימור טוב יותר של המוטיבים.

figure-results-9
איור 8. השוואה של מקדם Dice עבור סגמנטציה של מוטיבים תרבותיים. השוואה של ערכי מקדם Dice שהתקבלו באמצעות גישות סגמנטציה שונות על מאגרי הנתונים Miao Batik ו-WikiArt. מקדם Dice מעריך את החפיפה בין מסכות סגמנטציה שנחזו למסכות ייחוס, כאשר ערכים גבוהים יותר מעידים על ביצועי סגמנטציה משופרים ועל זיהוי טוב יותר של אזורי המוטיב. מסגרת SegCycle-SPADE המוצעת השיגה את ערכי מקדם Dice הגבוהים ביותר בשני מאגרי הנתונים. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

איור 9 מציג את השוואת ה-SSIM בין דפוסי התרבות השחזורים. שיטות המבוססות על GAN, כגון Pix2Pix, CycleGAN ו-StyleGAN, השיגו ערכי SSIM גבוהים יותר משיטות סגמנטציה מסורתיות כיוון שהן תוכננו ליצירת תמונות. עם זאת, מסגרת ה-SegCycle-SPADE המוצעת השיגה את ערכי ה-SSIM הגבוהים ביותר בשני מאגרי הנתונים, מה שמעיד על שימור עדיף של פרטים מבניים וקוהרנטיות אמנותית.figure-results-10

איור 9השוואה של מדד דמיון מבני (SSIM). השוואה של ערכי מדד דמיון מבני (SSIM) שהתקבלו באמצעות שיטות שחזור שונות על מאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמישה הרצות עצמאיות (n = 5). פסי השגיאה מציינים סטיית תקן אחת. ערכי SSIM גבוהים יותר מעידים על דמיון מבני רב יותר בין התבניות השחזוריות לתבניות הייחוס. מסגרת ה-SegCycle-SPADE המוצעת השיגה את ציוני ה-SSIM הגבוהים ביותר בשני המערכי נתונים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

נעשה שימוש ב-FID כדי להעריך את מידת הריאליזם והדמיון ההתפלגותי של דגמים אמנותיים שנוצרו. חישוב ה-FID בוצע באמצעות רשת Inception-v3 מאומנת מראש, כאשר וקטורי תכונות חולצו משכבת ה-pool3, מה שהביא לייצוגי תכונות במימד של 2048. לפני חילוץ התכונות, תמונות שנוצרו ותמונות ייחוס הותאמו לגודל של 299 × 299 פיקסלים באמצעות אינטרפולציה ביליניארית ונורמלו בהתאם לפרוטוקול עיבוד המקדימים הסטנדרטי של Inception-v3. ה-FID חושב באמצעות התפלגויות תכונות שחולצו מקובץ נתוני הבדיקה העצמאי. הסטטיסטיקות של הממוצע והשונות המשותפת (covariance) נאמדו מהשיכובים (embeddings) של התכונות ונכללו בתוך נוסחת ה-FID הסטנדרטית.

כפי שמוצג ב-טבלה 4, גישות קונבנציונליות ליצירת תמונות כגון Pix2Pix ו-CycleGAN הניבו מדדי FID גבוהים יחסית, כיוון שהן היו חסרות הנחיה מבנית מפורשת. StyleGAN ו-AttentionGAN השיגו מדדי FID נמוכים יותר הודות ליכולות למידת מאפיינים משופרות. עם זאת, מסגרת ה-SegCycle-SPADE המוצעת השיגה את מדדי ה-FID הנמוכים ביותר בשני מערכי הנתונים, ובכך הדגימה ריאליזם תמונתי עמוק יותר, עקביות סגנונית ושימור של מוטיבים תרבותיים.

שיטהערך הנתונים Miao Batik (FID)ערך הנתונים WikiArt (FID)
Pix2Pix48.652.3
CycleGAN42.846.5
StyleGAN39.743.1
AttentionGAN36.940.4
SegCycle-SPADE (מוצע)28.531.2

טבלה 4: תוצאות מרחק Frechet Inception (FID) עבור שחזור דפוסים תרבותיים. השוואה של ציוני מרחק Frechet Inception (FID) שהושגו על ידי מסגרת ה-SegCycle-SPADE המוצעת ומודלים גנרטיביים בסיסיים במאגרי הנתונים Miao Batik ו-WikiArt. ערכי FID נמוכים יותר מעידים על דמיון רב יותר בין התפלגויות התכונות של תמונות שנוצרו לתמונות אמיתיות, ולפיכך משקפים ריאליזם ויזואלי משופר של דפוסים תרבותיים ששוחזרו.

איור 10 משווה בין איכות השחזור שהושגה בשיטות שונות. איכות השחזור (%) חושבה על ידי המרת ה-SSIM בין התמונה המשוחזרת לתמונת הייחוס המתאימה לסולם אחוזים (SSIM × 100). אחוזים גבוהים יותר מעידים על נאמנות מבנית גבוהה יותר ודמיון חזותי רב יותר למוטיב התרבותי המקורי. מודלים גנרטיביים קונבנציונליים כגון Pix2Pix ו-CycleGAN השיגו ביצועי שחזור בינוניים. ארכיטקטורות מתקדמות יותר, הכוללות את StyleGAN ו-AttentionGAN, השיגו איכות שחזור משופרת הודות ליכולות למידת מאפיינים משופרות. עם זאת, מסגרת ה-SegCycle-SPADE המוצעת השיגה את איכות השחזור הגבוהה ביותר בזכות השילוב של הדרכת סגמנטציה סמנטית, מיזוג מאפיינים באמצעות cross-attention, למידת שחזור וסינתזה אמנותית.

figure-results-11
איור 10. השוואה של איכות שחזור תבניות. השוואה של איכות השחזור שהושגה באמצעות Pix2Pix, CycleGAN, StyleGAN, AttentionGAN ומסגרת ה-SegCycle-SPADE המוצעת על מאגרי הנתונים Miao Batik ו-WikiArt. התוצאות מוצגות כממוצע ± סטיית תקן (SD) מחמש הרצות עצמאיות (n = 5). פסי השגיאה מציינים סטיית תקן אחת. ערכים גבוהים יותר מעידים על שימור משופר של פרטים מבניים, עקביות סמנטית ונאמנות ויזואלית. מסגרת ה-SegCycle-SPADE המוצעת השיגה את ציוני איכות השחזור הגבוהים ביותר בשני מאגרי הנתונים. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

נעשה שימוש ב-PSNR כדי להעריך את נאמנות השחזור על ידי מדידת הדמיות ברמת הפיקסלים בין תמונות משוחזרות לתמונות ייחוס תואמות. PSNR חושב בין כל תמונה משוחזרת לבין תמונת Miao Batik המקורית התואמת לה, אשר שימשה כייחוס ה-ground-truth. ערכי PSNR גבוהים יותר מעידים על שגיאת שחזור נמוכה יותר. כפי שמוצג ב-Table 5, Pix2Pix ו-CycleGAN הגיעו לערכי PSNR בינוניים כיוון שהם שחזרו דפוסים ללא הנחיה מבנית מפורשת. StyleGAN ו-AttentionGAN הגיעו לערכי PSNR גבוהים יותר באמצעות למידת מאפיינים עמוקה יותר. מסגרת SegCycle-SPADE המוצעת השיגה את ערכי ה-PSNR הגבוהים ביותר בשני מאגרי הנתונים, דבר המדגים נאמנות שחזור מעולה ושימור של מבני מוטיבים תרבותיים.

שיטהמאגר הנתונים Miao Batik
(PSNR, dB)
מאגר הנתונים WikiArt
(PSNR, dB)
Pix2Pix25.824.6
CycleGAN27.326.1
StyleGAN28.727.5
AttentionGAN29.928.6
SegCycle-SPADE (מוצע)32.431.2

טבלה 5: תוצאות יחס אות לרעש שיא (PSNR) עבור שחזור דפוסים תרבותיים. השוואה של ערכי יחס אות לרעש שיא (PSNR) שהתקבלו באמצעות מסגרת SegCycle-SPADE המוצעת ושיטות בסיס (baseline) על מאגרי הנתונים Miao Batik ו-WikiArt. ערכי PSNR גבוהים יותר מעידים על נאמנות שחזור משופרת ועיוות מופחת ביחס לתמונות הייחוס המתאימות.

איור 11 ממחיש את התנהגות ההתכנסות של מסגרת ה-SegCycle-SPADE המוצעת במהלך האימון. עקומות ההפסד מייצגות את ממוצעי הפסדי האימון, המחושבים על פני חמישה ריצי אימון עצמאיים. כדי להפחית שונות סטוכסטית ולספק ייצוג חסון יותר של התכנסות האימון, ערכי ההפסד חושבו כממוצע בכל epoch על פני כל הריצים. במהלך epoch-י האימון הראשוניים, ערכי ההפסד היו גבוהים יחסית מכיוון שהמודל עדיין למד ייצוגי מאפיינים מנתוני הקלט. ככל שהאימון התקדם, כל רכיבי ההפסד פחתו בהדרגה והתייצבו, מה שמעיד על אופטימיזציה מוצלחת של יעדי הסגמנטציה, השחזור והסינתזה האמנותית. התנהגות ההתכנסות שנצפתה מדגימה את היעילות, היציבות והשחזוריות של המסגרת המוצעת במהלך האימון.

figure-results-12
איור 11. התכנסות האימון של מסגרת ה-SegCycle-SPADE המוצעת. עקומות הפסד האימון (training-loss) של מסגרת ה-SegCycle-SPADE המוצעת לאורך 100 תקופות אימון (epochs), ממוצעות על פני חמש הרצות אימון עצמאיות (n = 5). האיור ממחיש את התפתחות ההפסד הכולל (LTotal), הפסד הסגמנטציה (LSeg), הפסד הגנרטור (LG) והפסד הדיסקרימינטור (LD) במהלך האימון. ההפחתה ההדרגתית וההתייצבות העוקבת של כל מרכיבי ההפסד מעידות על התכנסות מוצלחת ואופטימיזציה יציבה של המסגרת המוצעת. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

ניתוח השפעת רכיבים (Ablation Study)
כדי להעריך את התרומה של כל רכיב במסגרת ה-SegCycle-SPADE המוצעת, נערך ניתוח השפעת רכיבים באמצעות מספר תצורות מודל מבוקרות. התוצאות מסוכמות בטבלאות 6 ו-7.

תצורת מודלדיוק סגמנטציה (%)IoUSSIM
SegFormer בלבד87.30.760.82
SegFormer + CAFFM89.60.790.86
SegFormer + CAFFM + CycleGAN91.40.820.89
SegFormer + CAFFM + CycleGAN + SPADE (מוצע)93.80.860.93

טבלה 6: ניתוח אבלציה של רכיבי SegCycle-SPADE. השוואת ביצועים של תצורות מודל המשופרות באופן הדרגתי כדי להעריך את תרומתם של רכיבי מסגרת עבודה בודדים. המחקר בוחן את ההשפעות של סגמנטציה סמנטית, מודול מיזוג מאפיינים תרבותיים מבוסס Cross-Attention (CAFFM), שחזור מבוסס CycleGAN, וסינתזה אמנותית מבוססת SPADE על דיוק הסגמנטציה, מדד החיתוך מעל האיחוד (IoU), ומדד דמיון מבני (SSIM). ערכים גבוהים יותר מעידים על שיפור בסגמנטציה של מוטיבים, באיכות השחזור ובשימור המבני.

גרסהIoU (%)מדד דייס (%)מדד הדמיון המבני (SSIM)PSNR (dB)גלאי יינון להבה (FID) ↓
SegFormer בלבד84.2 ± 0.488.5 ± 0.30.82 ± 0.0124.8 ± 0.231.8 ± 0.6
SegFormer + CycleGAN86.7 ± 0.390.2 ± 0.20.85 ± 0.0126.3 ± 0.227.5 ± 0.5
SegFormer + SPADE87.0 ± 0.390.5 ± 0.20.88 ± 0.0127.8 ± 0.223.4 ± 0.4
SegFormer + CAFFM90.0 ± 0.293.1 ± 0.20.90 ± 0.0129.6 ± 0.120.3 ± 0.3
SegCycle-SPADE (מודל מלא)93.0 ± 0.295.4 ± 0.10.92 ± 0.0131.2 ± 0.117.6 ± 0.2

טבלה 7: ניתוח תרומת רכיבים של מסגרת ה-SegCycle-SPADE המוצעת. השוואת ביצועים של גרסאות שונות של המסגרת ששימשו להערכת התרומה של CAFFM, CycleGAN, SPADE, והארכיטקטורה המלאה של SegCycle-SPADE. התוצאות מדווחות באמצעות Intersection over Union (IoU), מקדם Dice, מדד דמיון מבני (SSIM), יחס אות לרעש שיא (PSNR), ומרחק Frechet Inception (FID). ערכים גבוהים יותר של IoU, Dice, SSIM ו-PSNR מעידים על שיפור באיכות הסגמנטציה והשחזור, בעוד שערכי FID נמוכים יותר מעידים על ריאליזם ויזואלי רב יותר של דפוסי התרבות הנוצרים.

טבלה 6 מעריכה את התרומה המצטברת של רכיבי המסגרת המרכזיים תוך שימוש בארבע תצורות: (i) SegFormer בלבד, (ii) SegFormer + CAFFM, (iii) SegFormer + CAFFM + CycleGAN, ו-(iv) SegFormer + CAFFM + CycleGAN + SPADE (המסגרת המוצעת). מודל ה-SegFormer הבסיסי השיג דיוק סגמנטציה של 87.3%, ציון IoU של 0.76 וערך SSIM של 0.82. שילוב מודול ה-CAFFM שיפר את הביצועים בכל מדדי ההערכה, והעלה את דיוק הסגמנטציה ל-89.6%, את ה-IoU ל-0.79 ואת ה-SSIM ל-0.86. התוספת של CycleGAN שיפרה עוד יותר את יכולת השחזור המבני, והביאה ל-IoU של 0.82 ולערך SSIM של 0.89. מסגרת ה-SegCycle-SPADE המלאה השיגה את הביצועים הכוללים הטובים ביותר, עם דיוק סגמנטציה של 93.8%, IoU של 0.86 וערך SSIM של 0.93. תוצאות אלו מוכיחות כי כל רכיב תורם באופן הדרגתי לשיפור דיוק הסגמנטציה, לשימור המבנה ולאיכות שחזור התמונה.

טבלה 7 בוחנת לעומק את התרומה של רכיבי התשתית הבודדים באמצעות חמישה וריאנטים של המודל: (i) SegFormer בלבד, (ii) SegFormer + CycleGAN, (iii) SegFormer + SPADE, (iv) SegFormer + CAFFM, ו-(v) המודל המלא המשלב את SegFormer, CAFFM, CycleGAN, SPADE, והפסד שימור מוטיבים (motif-preservation loss). הביצועים הוערכו באמצעות מדדי IoU, מקדם Dice, SSIM, PSNR ו-FID.

תצורת הבסיס המבוססת על SegFormer בלבד השיגה IoU של 84.2%, מקדם Dice של 88.5%, ערך SSIM של 0.82, PSNR של 24.8 dB ומדד FID של 31.8. הוספת CycleGAN שיפרה את איכות השחזור והפחיתה את מדד ה-FID ל-27.5, דבר המעיד על ריאליזם משופר של התמונה. שילוב של SPADE שיפר עוד יותר את הדמיון המבני ואת איכות התמונה, והביא לערך SSIM של 0.88 ומדד FID של 23.4. הכללת מודול ה-CAFFM המוצע הניבה שיפורים משמעותיים בכל המדדים, והעלתה את ה-IoU ל-90.0%, את מקדם ה-Dice ל-93.1%, את ה-SSIM ל-0.90 ואת ה-PSNR ל-29.6 dB, תוך הפחתת מדד ה-FID ל-20.3. המודל המלא, המשלב בנוסף את ה-motif-preservation loss, השיג את הביצועים הכוללים הטובים ביותר עם IoU של 93.0%, מקדם Dice של 95.4%, ערך SSIM של 0.92, PSNR של 31.2 dB ומדד FID של 17.6.

טבלה 8 מציגה סקירה השוואתית של גישות DL מייצגות המשמשות לשחזור ושימור של תבניות במורשת תרבותית. שיטות קונבנציונליות המבוססות על CNN מספקות למידת מאפיינים מקומית וביצועי סגמנטציה יעילים, אך לעיתים קרובות מתקשות לשמר מבני מוטיבים מורכבים בשל מידול מוגבל של תלות לטווח ארוך. גישות המבוססות על GAN משפרות את יכולות סינתזת התמונות והעברת הסגנון; עם זאת, הן עלולות לסבול מחוסר עקביות סמנטית ומאובדן של פרטים מבניים עדינים. שיטות המבוססות על Transformer משפרות את ההבנה ההקשרית הגלובלית אך בדרך כלל חסרות יכולות שחזור גנרטיביות, בעוד ששיטות מבוססות דיפוזיה (diffusion) מציעות ריאליזם ויזואלי גבוה במחיר של מורכבות חישובית מוגברת. גישות היברידיות של Transformer-GAN נותנות מענה חלקי למגבלות אלו על ידי שילוב של מנגנוני חילוץ מאפיינים ויצירת תמונות. בניגוד אליהן, מסגרת ה-SegCycle-SPADE המוצעת משלבת סגמנטציה מבוססת transformer, מיזוג מאפיינים באמצעות cross-attention, שחזור גנרטיבי וסינתזה אמנותית מונחית-סגמנטציה בתוך ארכיטקטורה מאוחדת, ובכך משפרת את הנאמנות המבנית, העקביות הסמנטית ואת שימור המוטיבים התרבותיים. ההשוואה מסוכמת בטבלה 8.

גישהמתודולוגיית ליבהיתרונותמגבלותרלוונטיות למורשת תרבותית
שיטות מבוססות CNN (למשל, U-Net, DeepLabV3+)חילוץ תכונות קונבולוציוני וסגמנטציה סמנטיתלמידה יעילה של תכונות מקומיות וסגמנטציה מדויקתמידול מוגבל של תלויות ארוכות-טווח; קושי בשימור מבני מוטיבים מורכביםמתאים לסגמנטציה של מוטיבים אך פחות יעיל לשחזור אמנותי
שיטות מבוססות GAN (למשל, Pix2Pix, CycleGAN)יצירת תמונות אדברסרית ותרגום תמונה-לתמונהסינתזה של תמונות באיכות גבוהה והעברת סגנוןחוסר יציבות באימון; חוסר עקביות סמנטית; פוטנציאל לאובדן פרטים מבניים עדיניםמועיל לשחזור תבניות אך עלול שלא לשמר מוטיבים תרבותיים במדויק
שיטות מבוססות Transformerמנגנון תשומת לב עצמית (Self-attention) ומידול הקשר גלובלילכידת תלויות ארוכות-טווח ומערכות יחסים חזותיות מורכבותעלות חישובית גבוהה; דורש מאגרי נתונים גדולים לאימוןיעיל לניתוח תבניות מורכבות אך בעל יכולת גנרטיבית מוגבלת כאשר נעשה בו שימוש לבדו
שיטות מבוססות Diffusionיצירת תמונות מבוססת הסרת רעשים (denoising) איטרטיביתריאליזם חזותי גבוה ומגוון תמונותמהירות הסקה איטית; דרישות חישוביות גבוהות; שליטה מבנית מוגבלתמבטיח ליצירת תמונות מורשת אך תובעני מבחינה חישובית
שיטות היברידיות של Transformer-GANשילוב של חילוץ תכונות מבוסס transformer ויצירה מבוססת GANייצוג תכונות גלובלי ואיכות תמונה משופריםלרוב חסרה הנחיה סמנטית מפורשת לשימור מוטיביםמשפר את איכות היצירה אך אינו מתוכנן ספציפית למוטיבים של מורשת תרבותית
SegCycle-SPADE המוצעSegFormer + CAFFM + CycleGAN + SPADEסגמנטציה מבוססת Transformer, מיזוג תכונות מונחה-קשב, עקביות סמנטית, שימור מוטיבים ושחזור אמנותי נשלטמורכבות חישובית גבוהה יותר מאשר גישות מבוססות CNN בלבדתוכנן ספציפית לשחזור ושימור של תבניות מורשת תרבותית עם נאמנות מבנית ועקביות סמנטית משופרות

טבלה 8: השוואה בין גישות למידה עמוקה מייצגות לשחזור ושימור של תבניות במורשת תרבותית.השוואה איכותית של גישות למידה עמוקה מייצגות המשמשות לסגמנטציה של תמונות, שחזור תבניות, יצירת סגנון ושימור מורשת תרבותית. הטבלה מסכמת את מתודולוגיית הליבה, נקודות החוזק, המגבלות וההתאמה של כל גישה, ומדגישה כיצד מסגרת ה-SegCycle-SPADE המוצעת משלבת סגמנטציה סמנטית, היתוך מאפיינים, שחזור וסינתזת סגנון כדי להתמודד עם אתגרים הקשורים לשימור מבני ועקביות סמנטית בתבניות של מורשת תרבותית.

השיפורים שנצפו מדגימים כי מודול ה-CAFFM משפר ביעילות את האינטראקציה בין תכונות מבניות המופקות מסגמנטציה לבין ייצוגי סגנון אמנותי, באמצעות היתוך תכונות המבוסס על תשומת לב צולבת (cross-attention). יתרה מכך, הפסד שימור המוטיב (motif-preservation loss) תורם לשמירה על מבני מוטיב בעלי משמעות תרבותית במהלך השחזור והסינתזה האמנותית, מה שמוביל לעקביות משופרת בסגמנטציה, לנאמנות מבנית ולריאליזם ויזואלי. יחד, תוצאות הניתוח של השפעת הרכיבים (ablation results) מאשרות כי השילוב של SegFormer-B2, CAFFM, CycleGAN, SPADE והפסד שימור המוטיב הוא האחראי לביצועים העדיפים של מסגרת ה-SegCycle-SPADE המוצעת.

זמינות נתונים:
מערך הנתונים WikiArt ששימש ללמידת סגנון אמנותי זמין לציבור דרך מאגר ה-Kaggle WikiArt (https://www.kaggle.com/datasets/steubk/wikiart). מערך הנתונים Miao Batik ששימש במחקר זה זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658). מערכי הנתונים המעובדים, מסכות הסגמנטציה, משקולות המודלים שאומנו מראש, הפלטים שנוצרו וקבצי המימוש ב-Python הקשורים למסגרת SegCycle-SPADE המוצעת זמינים אף הם דרך אותו מאגר Zenodo.

קובץ נלווה:
קובץ נלווה 1. אלגוריתם 1: תזרים היישום של מסגרת ה-SegCycle-SPADE המוצעת. פסאודו-קוד שלב אחר שלב המתאר את צינור היישום המלא של מסגרת ה-SegCycle-SPADE המוצעת, כולל טעינת סט נתונים, עיבוד מקדימ, סגמנטציה סמנטית באמצעות SegFormer-B2, מיזוג תכונות באמצעות מודול מיזוג תכונות תרבותיות בשיטת Cross-Attention (CAFFM), שחזור מוטיבים תרבותיים באמצעות CycleGAN, סינתזת סגנון אמנותי באמצעות SPADE, אימון מודל, תיקוף, בחירת נקודת ביקורת (checkpoint) והערכת ביצועים סופית. אנא לחצו כאן כדי להוריד קובץ זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השימור והשחזור הדיגיטלי של דגמי ICH זכו לתשומת לב גוברת בשנים האחרונות בשל האובדן ההדרגתי של מלאכות מסורתיות. מחקרים קודמים ניסו לטפל באובדן המורשת התרבותית באמצעות טכניקות עיבוד תמונה מבוססות DL. לדוגמה, Quan et al.32 הציעו מסגרת לשימור מורשת תרבותית המבוססת על גרפי ידע ו-DL עבור תרבות הבאטיק של מיאו בְּ-Guizhou. למרות שהמחקר התמקד בשחזור דיגיטלי של דגמים תרבותיים, המתודולוגיה שלו הייתה תלויה בעיקר בייצוגים של גרפי ידע. באופן דומה, Fu ו-Razmjooy16 הציעו מסגרת המבוססת על רשת פירמידת מאפיינים (FPN) לשיפור ושחזור של תמונות מורשת תרבותית. למרות ששיטה זו סיפקה חילוץ מאפיינים יעיל לשיפור התמונה, היא לא שילבה הנחיית סגמנטציה של תמונות או מנגנוני שחזור גנרטיביים עבור דגמים תרבותיים חסרים. לעומת זאת, מסגרת SegCycle-SPADE המוצעת משלבת מספר רכיבי DL כדי להתגבר על אתגרים אלו. ראשית, נעשה שימוש בסגמנטציה סמנטית באמצעות מודל SegFormer לזיהוי מדויק של אזורי מוטיבים בתוך דגמי מורשת תרבותית. לאחר מכן, מודול שיפור מאפיינים מבוסס CAFFM משפר את ייצוגי המאפיינים עבור מבני מוטיבים בעלי רזולוציה גבוהה. לאחר מכן, מודול שחזור CycleGAN משמש לשחזור אזורים חסרים או לא שלמים בתוך דגמים תרבותיים באמצעות למידה אדברסרית. לבסוף, מודול SPADE מבצע שיפור סגנוני תוך שמירה על יישור מבני עם מפות הסגמנטציה. שיטות קיימות מבוססות CNN, GAN, transformer ו-diffusion17,19,20,21,22,23,24,25,30,34 מציעות כל אחת יתרונות ייחודיים; עם זאת, הן מציגות גם מגבלות בשמירה על עקביות סמנטית, שימור מאפיינים מבניים או השגת יעילות חישובית, כפי שמסוכם ב-Table 8. ארכיטקטורת SegCycle-SPADE המוצעת משלבת את החוזקות של סגמנטציה מבוססת SegFormer, מיזוג מאפיינים באמצעות cross-attention, שחזור CycleGAN וסינתזה מונחית SPADE תוך טיפול במגבלות אלו. כתוצאה מכך, המסגרת משיגה איכות שחזור משופרת ושימור משופר של מוטיבים בעלי חשיבות תרבותית.

למרות ביצועיו המעודדים, מסגרת ה-SegCycle-SPADE המוצעת עדיין סובלת ממספר מגבלות. ראשית, ההערכה בוצעה באמצעות מערכי הנתונים Miao Batik ו-WikiArt בלבד, דבר העשוי להגביל את יכולת ההכללה של המסגרת לתחומי מורשת תרבותית אחרים. שנית, פריסה על פלטפורמות עם משאבים מוגבלים עשויה להיות מאתגרת, כיוון שהשילוב של SegFormer, CAFFM, CycleGAN ו-SPADE מגביר את המורכבות החישובית ואת דרישות הזיכרון. שלישית, ביצועי הסגמנטציה תלויים רבות באיכות ובעקביות של ההערות (annotations) של המנימוטים, והטיה בהערות עלולה להשפיע על שימורם של מבנים בעלי חשיבות תרבותית. לבסוף, כיוון שהמסגרת הוערכה באמצעות שני מערכי נתונים בלבד, ייתכן שיהיה צורך בנתוני אימון נוספים ובהתאמות ספציפיות לתחום כדי להבטיח את התאימות לאוספי מורשת תרבותית מגוונים. על כן, מחקרים עתידיים צריכים לבחון אסטרטגיות אימון חסונות יותר, ארכיטקטורות קלות משקל, נהלי הערה משופרים והערכות חוצות-תחומים באמצעות מערכי נתונים נוספים של מורשת תרבותית.

היכולת להרחבה (scalability) של מסגרת ה-SegCycle-SPADE למאגרי נתונים גדולים ומגוונים יותר של מורשת תרבותית תהווה מוקד מרכזי במחקרים עתידיים. תיבחן הערכה בין-תרבותית של מוטיבים של מורשת מאזורים ומסורות אמנותיות שונות כדי לשפר את הכללת המודל ואת ההסתגלות התרבותית שלו. יתרה מכך, הרחבות מולטי-מודאליות המשלבות תיאורים טקסטואליים, רשומות היסטוריות ומטא-נתונים תרבותיים עשויות לספק הדרכה סמנטית חזקה יותר במהלך השחזור. ניתן יהיה להרחיב את המסגרת לתמוך גם בשחזור תלת-ממדי של מורשת תרבותית על ידי שילוב של שחזור מבוסס תמונה עם טכניקות מידול בתלת-ממד. בנוסף, ייבחנו אפשרויות פריסה בארכיונים דיגיטליים, מוזיאונים, תערוכות וירטואליות ופלטפורמות לשימור מורשת תרבותית כדי להקל על יישומים מעשיים של שימור ותיעוד מורשת בעזרת בינה מלאכותית. כדי לשפר עוד יותר את יכולת הפרשנות ואת האותנטיות התרבותית, עבודה עתידית תחקור את השילוב של גרפי ידע תרבותיים, תיעוד אתנוגרפי, מטא-נתונים היסטוריים ומאגרי ידע שנאצרו על ידי מומחים, כדי לאפשר ניתוח ושחזור של מוטיבים המבוססים על ידע תרבותי32.

יש לקחת בחשבון מספר שיקולים מעשיים בעת יישום מסגרת ה-SegCycle-SPADE המוצעת. במהלך אימון ה-CycleGAN, עלולה להתרחש התכנסות אדברסרית (adversarial convergence) לא יציבה אם תיווצר חוסר איזון משמעותי בין הפסדי הגנרטור (generator losses) לפסדי הדיסקרימינטור (discriminator losses). במצבים אלו, הפחתת קצב הלמידה (learning rate), הגדלת משקל הפסד עקביות המחזור (cycle-consistency loss weight), או ניטור הדומיננטיות של הדיסקרימינטור עשויים לשפר את יציבות האימון. קריסת מצב (Mode collapse) עלולה להתרחש כאשר הגנרטור מייצר שוב ושוב פלטים דומים ויזואלית; ניתן לצמצם בעיה זו באמצעות אימון אדברסרי מאוזן, שימוש במאגר שחזור (replay-buffer), וניטור קפדני של מגמות ההפסד בגנרטור ובדיסקרימינטור. כשלי סגמנטציה עלולים להתרחש גם כאשר מוטיבים תרבותיים מציגים טקסטורות מורכבות, ניגודיות נמוכה או גבולות מעומעמים. כדי לטפל בבעיה זו, יש לוודא את איכות התמונות לפני האימון, ולבצע בדיקה ויזואלית של מסכות הסגמנטציה כדי להבטיח עקביות באנוטציות. שמירה על רזולוציית הקלט המומלצת ועל הגדרות הנורמליזציה חשובה אף היא להשגת ביצועי SegFormer אמינים. חוסר יציבות באימון עשוי לנבוע עוד מהגדרות לא מתאימות של קצב הלמידה, נתוני אימון לא מספיקים או וריאציות מספריות הקשורות לחומרה. כדי לשפר את השחזוריות (reproducibility), יש להשתמש בזרעים אקראיים (random seeds) קבועים עבור NumPy, PyTorch, CUDA ופעולות ערבוב נתוני המערך (dataset-shuffling). יתר על כן, יש לשמור על אותו צינור עיבוד מקדים (preprocessing pipeline), אותן חלוקות של מערך הנתונים, אותם היפר-פרמטרים של המודל ואותה סביבת תוכנה בכל ההרצות הניסוייות. מומלץ גם לבצע שמירת נקודות ביקורת (checkpoint) תקופית וניטור של הפסד התיקוף (validation-loss) כדי למנוע ירידה בביצועים ולאפשר התאוששות ממפגשי אימון שהופסקו.

העבודה המוצעת תורמת לקידום התאורטי של מסגרות עבודה לשחזור מורשת תרבותית מבוססות AI. גישות קונבנציונליות לשיקום תמונות מתייחסות בדרך כלל לסגמנטציה של תמונות, שחזור ויצירת סגנון כתהליכים עצמאיים17,19,20,30. בניגוד לכך, מחקר זה מציע מסגרת עבודה המשלבת תהליכים אלו באמצעות אסטרטגיית שחזור גנרטיבית מונחית-סגמנטציה. כתוצאה מכך, המחקר תורם לפיתוח התאורטי של שחזור מורשת תרבותית בסיוע AI, על ידי הדגמה כיצד ניתן לאחד סגמנטציה, שחזור ויצירת סגנון בתוך מסגרת עבודה אחת. אינטגרציה כזו חשובה במיוחד ביישומים של מורשת תרבותית, שבהם שימור מבנה המוטיב והמשמעות הסמנטית הם קריטיים. מהיבט מעשי, מסגרת העבודה המוצעת מציעה פתרון יעיל לשימור דיגיטלי, שיקום והעשרה אמנותית של דגמים תרבותיים מסורתיים. מוסדות מורשת תרבותית, מוזיאונים ומעצבים יכולים להשתמש ב-SegCycle-SPADE כדי לזהות באופן אוטומטי אזורי מוטיב, לשחזר דגמים פגומים או חסרים, וליצור ייצוגים אמנותיים משופרים ויזואלית של עיצובים מסורתיים. יכולת זו בעלת ערך מיוחד עבור מסורות מלאכה בסכנת הכחדה, כולל דגמי טקסטיל של באטיק Miao, שבהם חפצים היסטוריים עשויים להיות פגומים חלקית או חסרים. יתרה מכך, באמצעות שילוב של סינתזת סגנון גנרטיבית, מסגרת העבודה עשויה לתמוך ביישומים מודרניים של עיצוב תרבותי כגון עיצוב טקסטיל, יצירה אמנותית דיגיטלית וחינוך למורשת. באופן זה, מסגרת העבודה המוצעת מגשרת על הפער בין שימור מורשת תרבותית לבין יישומי עיצוב תרבותי עכשוויים.

עם זאת, למרות התוצאות המבטיחות שהושגו על ידי מסגרת ה-SegCycle-SPADE המוצעת, נותרו מספר מגבלות. ראשית, ההערכה בוצעה באמצעות מאגרי הנתונים Miao Batik ו-WikiArt בלבד, מה שעשוי להשפיע על יכולת ההכללה של המסגרת לשחזור של צורות אחרות של דפוסי מורשת תרבותית. שנית, מכיוון שתהליך השחזור מסתמך על מודלים מבוססי GAN, פלטים שנוצרו עשויים להכיל מדי פעם ארטיפקטים או מרקמים לא טבעיים בעת התמודדות עם מבני מוטיבים מורכבים מאוד. שלישית, המסגרת מתמקדת כעת בשחזור של דפוסים דו-ממדיים, בעוד שחלק מחפצי המורשת התרבותית כוללים מבנים תלת-ממדיים מטבעם. באופן כללי, הממצאים הניסיוניים מדגימים את יעילותה של מסגרת ה-SegCycle-SPADE המוצעת לשחזור אמנותי של דפוסי ICH. השילוב של סגמנטציה סמנטית מבוססת SegFormer, CAFFM, שחזור מוטיבים מבוסס CycleGAN וסינתזה אמנותית מבוססת SPADE שיפר באופן עקבי את מדדי הביצועים של הסגמנטציה, השחזור ואיכות התמונה. מחקרי האבלאציה תיקפו עוד יותר את תרומתו של כל רכיב במסגרת, והראו כי CAFFM והפסד שימור המוטיבים שיפרו באופן משמעותי את הנאמנות המבנית ואת האותנטיות הוויזואלית. ממצאים אלו תומכים בהיפותזה המרכזית לפיה שחזור מונחה סגמנטציה סמנטית בשילוב עם מיזוג מאפיינים של cross-attention יכול לשמר ביעילות מוטיבים בעלי חשיבות תרבותית תוך יצירת פלטים עשירים מבחינה אמנותית. לפיכך, המסגרת המוצעת מספקת גישה חישובית מהימנה וניתנת לשחזור לשימור דיגיטלי, שיקום והחייאה יצירתית של דפוסי ICH.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ניגוד עניינים:
המחברים מצהירים כי אין להם ניגודי אינטרסים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מודים על התמיכה האקדמית והמוסדית שניתנה על ידי Guangdong Engineering Polytechnic ו-South China Normal University במהלך השלמת מחקר זה. מחקר זה נתמך על ידי הפרויקט הכללי של הקרן הלאומית למדעי החברה לשנת 2023 (מס' 23BH161), תחת הכותרת “Digital Regeneration Museum: Research on the Activation and Communication of Chinese Classic Calligraphy and Painting Cultural Relics.”

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Adam Optimizerספריית האופטימיזציה של PyTorchAdamאלגוריתם אופטימיזציה המשמש במהלך אימון המודל.
CUDA ToolkitNVIDIA CorporationCUDA 11.3האצת GPU לחישובים של למידה עמוקה.
cuDNNNVIDIA CorporationcuDNN 8.2ספריית האצה לרשתות עצביות עמוקות המשמשת להאצת אימון והסקה (inference).
CycleGANUniversity of California, Berkeley / קוד פתוחמימוש רשמי של PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)רשת יריב יוצרת (generative adversarial network) המשמשת לשחזור מוטיבים תרבותיים.
משקולות מאומנות של ImageNetImageNet / קוד פתוחmit_b2.pth (נקודת ביקורת מאומנת של ImageNet-1K)משמש לאתחול של שלד ה-SegFormer-B2 לפני כוונון עדין (fine-tuning) על מערך נתוני ה-Miao Batik.
מעבד IntelIntel CorporationIntel Core i7 (דור 11)CPU המשמש לעיבוד מקדים של תמונות, תמיכה באימון מודלים והסקה.
Matplotlibצוות הפיתוח של MatplotlibMatplotlib 3.5.1ויזואליזציה של עקומות אימון ותוצאות הערכה.
מערך נתוני Miao Batikמאגר ZenodoDOI: 10.5281/zenodo.20807658מערך נתוני מוטיבים תרבותיים המכיל 15,148 תמונות המשמשות לסגמנטציה סמנטית ושחזור תבניות.
NumPyמפתחי NumPyNumPy 1.21.5חישוב נומרי ועיבוד מערכי נתונים.
NVIDIA GPUNVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)פלטפורמת חומרה המשמשת לאימון מודלים והסקה.
OpenCVOpenCV FoundationOpenCV 4.5.5עיבוד מקדים של תמונות, שינוי גודל, אינטרפולציה וניקוי רעשים גאוסיאני.
מערכת הפעלהCanonical Ltd.Ubuntu 20.04 LTSסביבת ביצוע ניסיונית.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0טעינה ומניפולציה של תמונות.
PythonPython Software FoundationPython 3.8.10שפת תכנות המשמשת למימוש ולניסויים.
PyTorchMeta AIPyTorch 1.10.0מסגרת למידה עמוקה המשמשת לאימון מודלים והסקה.
גרעין אקראי (Random Seed)הגדרה ניסיונית42גרעין קבוע המשמש לחלוקת מערך הנתונים, אתחול מודלים ושחזור ניסיוני.
Scikit-learnמפתחי Scikit-learnScikit-learn 1.0.2חלוקת מערכי נתונים, ניתוח סטטיסטי ומדדי הערכה.
Seabornקהילת קוד פתוחSeaborn 0.11.2ויזואליזציה של נתונים סטטיסטיים.
SegFormer-B2NVIDIA Research / קוד פתוחSegFormer-B2 (שלד MIT-B2)מודל סגמנטציה סמנטית מבוסס Transformer המשמש לסגמנטציה של מוטיבים תרבותיים.
מסכות סגמנטציה / הערות (Annotations)מערך נתוני Miao Batikכלול במערך הנתוניםתוויות סגמנטציה סמנטית ברמת פיקסל המשמשות לסיווג מוטיבים ואימון.
SPADENVIDIA Research / קוד פתוחמימוש רשמי של PyTorch (https://github.com/NVlabs/SPADE)מודל סינתזה של תמונות מונחה-סגמנטציה המשמש ליצירת תבניות אמנותיות.
TorchVisionMeta AITorchVision 0.11.1כלי עיבוד תמונות והתמרות מערכי נתונים המשמשים עם PyTorch.
מערך נתוני WikiArtWikiArthttps://www.wikiart.org/מערך נתוני סגנונות אמנותיים המכיל יותר מ-80,000 יצירות אמנות ב-27 סגנונות אמנותיים, המשמש ללמידה וסינתזה של סגנונות.

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

EngineeringDeep LearningCAFFMArtistic ReconstructionIntangible Cultural HeritagePatternsEnd to End Framework

מאמרים קשורים