הרשמה ל-JoVE נדרשת לצפייה בתוכן זה. התחברו או התחילו בגרסת ניסיון בחינם.

מאמר מחקר

שחזור וסינתזה של סגנון אמנותי של דגמים של מורשת תרבותית בלתי מוחשית באמצעות מסגרת למידה עמוקה המונחית על ידי סגמנטציה סמנטית

45 צפיות

DOI:

10.3791/71577

14 באוגוסט 2026

במאמר זה

סיכום

פרוטוקול זה מתאר תהליך עבודה של למידה עמוקה עבור סגמנטציה סמנטית, שחזור וסינתזה של סגנון אמנותי עבור דגמים של מורשת תרבותית בלתי מוחשית, תוך שימוש בחילוץ תכונות מבוסס transformer, שחזור אדברסרי ויצירת תמונות בעלת התאמה מרחבית, וזאת כדי לתמוך בשימור דיגיטלי וביישומי מורשת יצירתיים.

תקציר

השימור והשחזור הדיגיטלי של דגמים של מורשת תרבותית בלתי מומשית (ICH) זוכים לתשומת לב גוברת עם התקדמותן של טכניקות סינתזת תמונות מבוססות למידה עמוקה. גישות קיימות המבוססות על SegCycle-SPADE הדגימו פוטנציאל לסגמנטציה מבנית ושחזור אמנותי של דגמי מלאכה מסורתיים; עם זאת, נותרו מגבלות, הכוללות גיוון מוגבל של מערכי נתונים, שילוב לא מספק של סמנטיקה תרבותית, ושימור לא מספק של מאפייני דגם מבניים במהלך השחזור. כדי להתמודד עם אתגרים אלו, מחקר זה מציע מסגרת SegCycle-SPADE משופרת לסגמנטציה סמנטית ושחזור אמנותי של סוגי דגמי ICH. מודל סגמנטציה מבוסס Transformer, בשם SegFormer, מועסק כדי לזהות במדויק גבולות מוטיבים ואזורי דגמים. בנוסף, מוצג מודול Cross-Attention Cultural Feature Fusion לשיפור מוטיבים בעלי חשיבות תרבותית ולשיפור ייצוג המאפיינים. תרגום ושחזור של דגמים מבוצעים באמצעות CycleGAN, בעוד ש-Spatially-Adaptive Denormalization (SPADE) משמש לסינתזה של סגנון אמנותי כדי לשמור על עקביות סמנטית בין מפות הסגמנטציה לתמונות הנוצרות. כדי לשפר את הכללליות של המודל ואת הגיוון האמנותי, המסגרת מאומנת באמצעות מערך הנתונים של מוטיבים תרבותיים של Miao Batik ומערך הנתונים WikiArt. תוצאות ניסיוניות מדגימות כי מסגרת ה-SegCycle-SPADE המוצעת, המונחית על ידי attention, משפרת את דיוק הסגמנטציה ואת ביצועי שחזור דגמי המורשת בהשוואה לשיטות שחזור קיימות המבוססות על רשתות יריב גנרטיביות (GAN). המסגרת המוצעת מספקת פתרון ניתן להרחבה לתיעוד מורשת תרבותית, שחזור והחייאה אמנותית של עיצובי דגמים מסורתיים בסיוע בינה מלאכותית.

מבוא

מורשת תרבותית, הכוללת הן אלמנטים בלתי מוחשיים כגון מנהגים, שפות ואמונות, והן אלמנטים מוחשיים כגון יצירות אמנות, מבנים ורישומים כתובים, היא ביטוי בסיסי של ההיסטוריה, היצירתיות והזהות האנושית1. שימור מורשת שואף לאפשר לקהילות להתחבר מחדש למקורותיהן ומאפשר לדורות הבאים להפיק תועלת מהזיכרון התרבותי הקולקטיבי שלהם. הוא גם מקדם הבנה בין-תרבותית, הערכה של מסורות ומנהגים מגוונים, והכרה בנרטיבים היסטוריים שונים. נכסים תרבותיים אלה עוזרים לנו להבין את הערכים, נקודות המבט והחוויות של דורות קודמים ותורמים לגיבוש זהויות חברתיות עכשוויות ולהמשכיות תרבותית. העקרונות הבסיסיים של שימור מורשת תרבותית מודגמים ב-איור 1.

תהליך סגמנטציה: איסוף נתונים, עיבוד מקדים, מסגרת SegCycle-SPADE; מדדי הערכה.
איור 1סקירה מושגית של שחזור דגמי מורשת תרבותית באמצעות מסגרת ה-SegCycle-SPADE. איור סכמתי של הגישה המוצעת לשחזור ושדרוג של תבניות מורשת תרבותית בלתי מוחשית. זרימת העבודה כוללת איסוף נתונים ממאגרי הנתונים Miao Batik ו-WikiArt, עיבוד מקדים של תמונות, סגמנטציה סמנטית באמצעות SegFormer-B2, מיזוג מאפיינים באמצעות מודול מיזוג מאפיינים תרבותיים עם תשומת לב צולבת (CAFFM), שחזור תבניות באמצעות CycleGAN, סינתזה של סגנון אמנותי באמצעות SPADE, והערכה סופית באמצעות מדדי סגמנטציה ושחזור. החיצים מצביעים על זרימת הנתונים והייצוגים של המאפיינים לאורך המסגרת. אנא לחצו כאן להצגת גרסה גדולה יותר של דמות זו.

הזיכרון הקולקטיבי והמורשת התרבותית של החברה האנושית מגולמים במורשת תרבותית בלתי מוחשית (ICH), המשמשת כמדיום חשוב לביטוי אמנותי וזהות תרבותית. עם זאת, ה-ICH ניצבת בפני אתגרים משמעותיים בשל השפעות הגלובליזציה והדיגיטציה2,3,4. פרקטיקות רבות של ICH הנמצאות בסכנה דורשות גישות חדשות לשימור ופיתוח, וזאת בשל ירידה במספרם של בעלי מלאכה מיומנים ויכולת הסתגלות מוגבלת לשווקים מודרניים5,6. כתחום חשוב במחקר ה-ICH, עיצוב בר-קיימא מדגיש את הפיתוח המשולב של התרבות, החברה והסביבה, ומספק נתיב מעשי להמשך שימורה של ה-ICH. באמצעות גישות של עיצוב בר-קיימא, ניתן להחיות את ה-ICH תוך התאמה לצרכיה של החברה העכשווית7,8.

במחקר זה, המונח "דפוסי מורשת תרבותית בלתי מוחשית" מתייחס לייצוגים של מוטיבים חזותיים המעבירים ומשמרים ערכים תרבותיים בלתי מוחשיים בבסיסם. כתוצאה מכך, המסגרת המוצעת שואפת לשמר ולתעד את המידע התרבותי הקשור למוטיבים אלו תוך שחזור צורותיהם החזותיות.

רקמת מיאו ובאטיק הם צורות משמעותיות של מורשת תרבותית בלתי מוחשית (ICH) סינית, המשקפות את ההיסטוריה, האמונות והמסורות של קהילת המיאו באמצעות מוטיבים סמליים כגון ציפורים, פרפרים וטוטמים אבותיים9. מוטיבים אלו מוטמעים עמוק בבגדי טקס ובפרקטיקות של פסטיבלים ותורמים לפיתוח התרבותי והכלכלי המקומי10,11. התקדמויות בטכנולוגיות דיגיטליות, ובמיוחד בבינה מלאכותית (AI) ולמידה עמוקה (DL), יצרו הזדמנויות חדשות לשימור, ניתוח, שחזור ותיעוד של מורשת תרבותית. באטיק מיאו מגוויז'ו (Guizhou), אחת ממסורות הבאטיק השמורות ביותר בסין, משמש כמדיום חשוב להעברת הידע התרבותי, האמונות, המנהגים והטקסים של בני המיאו12,13,14,15,16.

מחקרים אחרונים הדגימו את הפוטנציאל של למידה עמוקה (DL) לשימור מורשת תרבותית ושחזור תבניות, והשיגו דיוק סגמנטציה משופר (pixel accuracy = 88.6%, mean intersection over union [IoU]= 78.1%) וביצועי שחזור טובים יותר בהשוואה ל-U-Net ו-DeepLabV3+1. עם זאת, נותרו מספר אתגרים. גישות קיימות המבוססות על רשתות יריב גנרטיביות (GAN) מתקשות לעיתים קרובות לשמר פרטים מבניים עדינים בתבניות מורכבות17, בעוד שגיוון מוגבל של מאגרי נתונים מגביל את יכולת ההכללה של המודל בין תחומים תרבותיים שונים18. בנוסף, מודלים של תרגום תמונה-לתמונה כגון CycleGAN עלולים להיכשל בשמירה על עקביות סמנטית בין מפות סגמנטציה לתמונות שנוצרו19, והיעדר מנגנוני קשב (attention mechanisms) עלול להוביל לאובדן של פרטי מוטיבים בעלי חשיבות תרבותית במהלך השחזור20. לכן, נדרשת מסגרת משופרת המשלבת סגמנטציה מבוססת-transformer, למידת מאפיינים מודרכת-קשב ואימון על מאגרי נתונים מרובים לשחזור יעיל של תבניות מורשת תרבותית בלתי מוחשית (ICH).

הזדמנויות חדשות לשימור מורשת תרבותית נוצרו באמצעות הדיגיטציה של רקמת Miao וההתקדמות המהירה של בינה מלאכותית גנרטיבית. מודלי דיפוזיה (Diffusion models), מחלקה מתהווה של מודלים גנרטיביים עמוקים, הדגימו ביצועים מרשימים במשימות ראייה ממוחשבת הודות ליכולותיהם העוצמתיות ליצירת תוכן21,22,23,24,25. במהלך תהליך הדיפוזיה ההפוכה, המודל לומד בהדרגה לשחזר את נתוני הקלט המקוריים מתוך ייצוגים רועשים26,27,28. מחקרים קודמים בחנו גם את היישום של טכנולוגיות שחזור תלת-ממדי ותכנון בעזרת מחשב (CAD) לצורך שימור והפצה של מורשת תרבותית.

על אף שרשתות עצביות קונבולוציוניות (CNNs) ו-GANs מציגות ביצועים טובים ביצירת תמונות ובשימור מאפיינים, הן עדיין מתמודדות עם אתגרים הקשורים לשדות רספטיביים מוגבלים, קריסת מצבים (mode collapse) וחוסר יציבות באימון29. ארכיטקטורות מבוססות Transformer, כגון SegFormer ו-Segmenter, מצטיינות בלכידת הקשר גלובלי ומערכות יחסים סמנטיות; עם זאת, הן דורשות משאבי חישוב רבים ועשויות להתקשות בטיפול בפרטים עדינים. למרות שמודלי דיפוזיה כגון Stable Diffusion מדגימים יכולות חזקות של יצירת תמונות, לעיתים קרובות חסרה להם שליטה מדויקת במאפיינים המבניים והאמנותיים של העיצובים הנוצרים. יתרה מכך, מרבית הגישות הקיימות משתמשות באסטרטגיות אימון עצמאיות המגבילות שיתוף מידע יעיל ואופטימיזציה שיתופית בין רכיבי הסגמנטציה והיצירה, מה שמוביל לפשרה בין דיוק מבני לאותנטיות אמנותית30.

מודלים מבוססי דיפוזיה מהזמן האחרון, כגון latent diffusion ו-Stable Diffusion, משיגים סינתזה של תמונות באיכות גבוהה אך דורשים ביצוע של denoising איטרטיבי, מה שמוביל לעלייה בעלות החישובית ובזמן ההסקה (inference). יתרה מכך, שימור מוטיבים תרבותיים עדינים ועקביות מבנית נותרים מאתגרים ללא מנגנוני התנייה (conditioning) ייעודיים. מודלים גנרטיביים מבוססי Transformer לוכדים ביעילות קשרי הקשר גלובליים, אך לעיתים קרובות דורשים מאגרי נתונים רחבי היקף ומשאבים חישוביים ניכרים. לעומת זאת, מסגרת ה-SegCycle-Spatially Adaptive Denormalization (SegCycle-SPADE) המוצעת משלבת סגמנטציה מבוססת SegFormer, מיזוג מאפיינים באמצעות cross-attention, רקונסטרוקציה של CycleGAN וסינתזה מונחית SPADE כדי לספק הנחיה מבנית מפורשת, ובכך לשפר את שימור המוטיבים, העקביות הסמנטית והרקונסטרוקציה השליטה של דפוסי מורשת תרבותית.

מרבית הטכניקות המתקדמות לסגמנטציה סמנטית (semantic segmentation) מסתמכות על רשתות עצביות קונבולוציוניות מלאות (FCNNs) בעלות ארכיטקטורה בצורת U31. במהלך שלב הקידוד (encoding), מאפיינים עמוקים בעלי שדות קליטה (receptive fields) גדולים מופקים באמצעות סדרה של פעולות קונבולוציה ודגימה מחדש למטה (downsampling). שלב הפענוח (decoding) משחזר בהדרגה את הרזולוציה המרחבית באמצעות דגימה מחדש למעלה (upsampling), ובסופו של דבר מאפשר חיזוי סמנטי ברמת הפיקסל. על ידי פיצוי על אובדן מידע מרחבי במהלך הדגימה מחדש למטה ושיפור ביצועי הסגמנטציה במגוון רחב של יישומים, חיבורי דילוג (skip connections) מאפשרים למידע ברזולוציה גבוהה מרמות קידוד שונות להשתלב ישירות בתוך המפענח32.

בעוד ששיטות מבוססות GAN, CNN ודיפוזיה מהעת האחרונה הראו תוצאות מבטיחות ביצירת תמונות ובשחזור מורשת תרבותית, הן מתקשות לעיתים קרובות לשמור על עקביות סמנטית, לשמר מוטיבים מבניים עדינים ולהבטיח שחזור הדיר בקרב דפוסים תרבותיים מגוונים. רוב הגישות הקיימות מתייחסות לסגמנטציה, שחזור וסינתזת סגנון כתהליכים נפרדים, מה שעלול להוביל לאובדן אלמנטים בעלי חשיבות תרבותית ולתוצאות לא עקביות. כדי לגשר על פער מתודולוגי זה, מחקר זה מציע מסגרת SegCycle-SPADE מאוחדת המשלבת סגמנטציה סמנטית מבוססת SegFormer, מודול חדש למיזוג תכונות תרבותיות באמצעות Cross-Attention (CAFFM), שחזור מבוסס CycleGAN וסינתזת סגנון מונחית SPADE. באמצעות שילוב מפורש של מידע סגמנטציה מבני עם למידת תכונות גנרטיבית, המסגרת המוצעת מאפשרת שחזור אמין, עקבי סמנטית וניתן לשחזור של מוטיבים של מורשת תרבותית בלתי מוחשית (ICH), תוך שמירה על אותנטיות תרבותית ואיכות אמנותית כאחד.

במחקר זה זוהו שלוש מגבלות מרכזיות של גישות נוכחיות לשחזור מורשת תרבותית: (i) שימור לא מספק של מוטיבים מבניים עדינים בשיטות שחזור מבוססות GAN; (ii) יכולת הכללה מוגבלת כתוצאה מאימון על מאגרי נתונים קטנים או ספציפיים לתחום; ו-(iii) עקביות סמנטית לא מספקת בין תוצרי הסגמנטציה לבין התמונות שנוצרו במסגרות של תרגום תמונה-לתמונה. בנוסף, סגמנטציה, שחזור וסינתזה של סגנון נתפסים בדרך כלל כתהליכים נפרדים, מה שמוביל לאובדן של אלמנטים בעלי חשיבות תרבותית במהלך השחזור. באמצעות שילוב של סגמנטציה סמנטית מבוססת transformer, מיזוג תכונות באמצעות cross-attention, שחזור ב-CycleGAN וסינתזה אמנותית מונחית SPADE בתוך ארכיטקטורה מאוחדת, מסגרת ה-SegCycle-SPADE המוצעת נותנת מענה למגבלות אלו ומשפרת את שימור המוטיבים, את העקביות הסמנטית ואת האותנטיות האמנותית בשחזור דפוסי ICH.

המטרה העיקרית של מחקר זה היא לפתח מסגרת SegCycle-SPADE משופרת לשחזור אמנותי של דגמי ICH המודרך על ידי סגמנטציה סמנטית. המסגרת משלבת את SegFormer לסגמנטציה מדויקת של מוטיבים תרבותיים, CycleGAN לשחזור דגמים, ו-SPADE עבור סינתזה אמנותית עקבית מבחינת סגנון. כדי לשפר את ייצוג המאפיינים ולשמר פרטים מבניים עדינים, הוצג CAFFM כדי לאפשר אינטראקציה יעילה בין מאפייני הסגמנטציה למאפיינים הגנרטיביים. המסגרת המוצעת, שאומנה על מאגרי הנתונים Miao Batik ו-WikiArt, משפרת את אותנטיות השחזור, את עקביות הסגנון ואת השימור של מוטיבים בעלי חשיבות תרבותית.

על ידי שילוב של סגמנטציה סמנטית, מיזוג מאפיינים מונחה-קשב (attention-guided), שחזור תבניות וסינתזה של סגנון בתוך ארכיטקטורה מאוחדת, מחקר זה מציג את מסגרת SegCycle-SPADE החדשנית לשחזור אמנותי של תבניות מורשת תרבותית בלתי מוחשית (ICH). התרומות העיקריות של עבודה זו הן כדלקמן. ראשית, פותחה מסגרת שחזור חדשנית המונחית על ידי סגמנטציה סמנטית באמצעות שילוב של SegFormer, המאפשרת חילוץ ושימור מדויקים של מוטיבים תרבותיים מורכבים ואלמנטים מבניים. שנית, מוצג מודול CAFFM חדש למיזוג יעיל של מאפייני סגמנטציה עם ייצוגים גנרטיביים, המאפשר למודל ללכוד קשרים ארוכי-טווח בין מוטיבים תרבותיים לתבניות סגנון אמנותיות. שלישית, ה-CAFFM המוצע משפר את השימור של אלמנטים בעלי חשיבות תרבותית תוך שיפור הריאליזם הוויזואלי והקוהרנטיות המבנית של תבניות המורשת המשוחזרות. רביעית, באמצעות שילוב של CycleGAN לשחזור תבניות תרבותיות ו-SPADE לסינתזה אמנותית מונחית-סגמנטציה, המסגרת מבטיחה הן דיוק סמנטי והן אותנטיות סגנונית בתוצרים הנוצרים. חמישית, כדי לשפר את ההכללה והגיוון האמנותי, המודל אומן באמצעות מאגר נתוני מוטיבים תרבותיים של Miao Batik ללמידת תבניות תרבותיות ומאגר הנתונים WikiArt לייצוג סגנון אמנותי. WikiArt משמש כמאגר נתונים עזר להערכת יכולת ההכללה של המסגרת, חוסן למידת המאפיינים ויעילות בקרת הסגנון על פני הקשרים ויזואליים מגוונים, ולא כסגנון מטרה ליישום ישיר במוצרי מורשת תרבותית של Miao. לבסוף, בהשוואה לשיטות שחזור מורשת תרבותית קיימות המבוססות על GAN, תוצאות ניסיוניות מדגימות כי מסגרת SegCycle-SPADE המוצעת משיגה דיוק סגמנטציה, איכות שחזור ועקביות סגנונית משופרות.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

המסגרת המוצעת של SegCycle-SPADE תוכננה לשחזר ולשפר דפוסים מסורתיים של מורשת תרבותית באמצעות סגמנטציה סמנטית, שיפור מאפיינים באמצעות מנגנון קשב (attention), שחזור גנרטיבי וסינתזה של סגנון אמנותי. מחקר זה השתמש במאגרי תמונות זמינים לציבור של מורשת תרבותית ואמנות, כולל מאגר ה-Miao Batik ומאגר ה-WikiArt. לא השתתפו במחקר נבדקים אנושיים, נתוני חולים, מידע אישי, בעלי חיים או רשומות קליניות; לפיכך, לא נדרש אישור של ועדת אתיקה מוסדית או הסכמה מדעת. ראשית, מאגר מוטיבים תרבותיים של Miao Batik ומאגר ה-WikiArt משמשים לצורך ההערכה. מאגר ה-Miao Batik תואר על ידי Quan et al. (2024)32 והוא מכיל 15,148 תמונות מתויגות של מוטיבים מסורתיים של באטיק Miao. התיוגים הקיימים שסופקו על ידי יוצרי המאגר שימשו באופן ישיר, ולא הופקו תיוגים ידניים נוספים במחקר זה. לאחר מכן, מבוצע עיבוד מקדים של התמונות הכולל שינוי גודל, נרמול, הסרת רעשים ויצירת מסכת סגמנטציה. פרמטרי העיבוד המקדימי המדויקים מתוארים בסעיף עיבוד מקדים של נתונים. המסגרת המוצעת משתמשת במודל מבוסס transformer בשם SegFormer-B2 לצורך הסגמנטציה הסמנטית של הנתונים. השיטה תוכננה לזהות אזורי מפתח של מוטיבים תרבותיים וללמוד את המבנים שלהם. המאפיינים המופרדים משופרים לאחר מכן באמצעות מנגנון קשב, שבו מידע חשוב הקשור למוטיבים תרבותיים מודגש ומידע לא רלוונטי נפסל. הגדרת מנגנון הקשב מתוארת בסעיף CAFFM. המאפיינים המשופרים מועברים לאחר מכן דרך CycleGAN, שבו מבנים פגומים משוחזרים באמצעות למידה מחזורית. במהלך האימון, דגימות של מוטיבים לא שלמים נוצרו באופן מלאכותי על ידי החלת פעולות מיסוך אקראי והסתרה חלקית על תמונות Miao Batik המקוריות. הליכי דגרדציה אלה סימלו אזורי מוטיב חסרים ונזקים מבניים הנצפים בדרך כלל בפריטי מורשת תרבותית שהתבלו. התמונות הלא שלמות שהתקבלו שימשו כקלטים למודול השחזור של CycleGAN, בעוד שהתמונות המקוריות התואמות שימשו כיעדי השחזור. דפוסים משוחזרים של מורשת תרבותית משופרים לאחר מכן באמצעות SPADE, שבו מבוצע שיפור אמנותי על בסיס מפות הסגמנטציה שנוצרו. ביצועי המסגרת המוצעת מוערכים באמצעות מדדי סגמנטציה וכמותיים של איכות תמונה, בעוד שהאותנטיות הוויזואלית של המוטיבים התרבותיים המשוחזרים מוערכת באופן איכותני. האותנטיות הוויזואלית הוערכה באמצעות בדיקה ויזואלית של הדפוסים התרבותיים שנוצרו ולא שימשה כמדד כמותי עצמאי. ההערכה התמקדה בשימור המוטיב, עקביות סמנטית, מאפיינים תרבותיים, קוהרנטיות מבנית ומראה אמנותי ביחס למוטיבים התרבותיים של הייחוס התואמים. הערכה כמותית של ביצועי המודל בוצעה באמצעות Segmentation Accuracy, IoU, Dice Coefficient, Structural Similarity Index Measure (SSIM), Peak Signal-to-Noise Ratio (PSNR) ו-Fréchet Inception Distance (FID). איור 2 ממחיש את זרימת העבודה הכוללת של מסגרת SegCycle-SPADE המוצעת ומסכם את מדדי ההערכה ששימשו במחקר זה.

דיאגרמת סגמנטציה סמנטית; מערכי נתונים, עיבוד, CAFFM, שחזור תבניות, מדדי הערכה.
איור 2. זרימת העבודה הכוללת של ארכיטקטורת מסגרת ה-SegCycle-SPADE המוצעת. סקירה כללית של זרימת העבודה המלאה של SegCycle-SPADE. תמונות ממערכי הנתונים Miao Batik ו-WikiArt עוברות עיבוד מקדים לפני שהן מעובדות באמצעות סגמנטציה סמנטית בעזרת SegFormer-B2, הגברת מאפיינים באמצעות CAFFM, שחזור תבניות באמצעות CycleGAN, ויצירת סגנון אמנותי באמצעות SPADE. ביצועי המודל מוערכים באמצעות Segmentation Accuracy, Intersection over Union (IoU), Dice Coefficient, Structural Similarity Index Measure (SSIM), PSNR, ו-Fréchet Inception Distance (FID), בעוד שהאותנטיות הוויזואלית מוערכת באופן איכותני. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

מסגרת SegCycle-SPADE לשחזור דגמים של מורשת תרבותית תוכננה לשלב מספר רכיבי DL לצורך סגמנטציה מדויקת של מוטיבים, שחזור והעשרה אמנותית, כפי שמוצג ב-איור 2. תמונות ממאגר מוטיבים תרבותיים של Miao Batik וממאגר WikiArt משמשות כדי לספק דגמים תרבותיים וסגנונות אמנותיים מגוונים. תחילה, התמונות מעובדות באמצעות מודול סגמנטציה סמנטית מבוסס SegFormer כדי לזהות ולהגדיר את המוטיבים התרבותיים מהרקע. הארכיטקטורה הכוללת מורכבת מארבעה שלבים עיקריים. ראשית, מודל ה-SegFormer מחלץ מפות סגמנטציה סמנטית מתמונות הדגמים התרבותיים. שנית, ה-CAFFM משלב מאפייני סגמנטציה עם ייצוגים גנרטיביים כדי לשפר את למידת המאפיינים. שלישית, מודול ה-CycleGAN משחזר דגמים תרבותיים באמצעות ייצוגי המאפיינים הממוזגים. לבסוף, מודול ה-SPADE מייצר פלטים עם העשרה סגנונית תוך שמירה על עקביות מבנית באמצעות סינתזה מונחית-סגמנטציה. מפות המאפיינים המעובדות מעובדות לאחר מכן על ידי מודול השחזור של CycleGAN, הלומד לשחזר מוטיבים תרבותיים חסרים על ידי מיפוי דגמים פגומים לצורות השלמות התואמות להם. דגימות של מוטיבים חסרים נוצרו על ידי החלת פעולות מיסוך אקראי והסתרה חלקית על תמונות Miao Batik המקוריות, ובכך בוצע סימולציה של אזורי דגמים חסרים ודגראדציה מבנית הנצפיתים בדרך כלל בחפצי מורשת תרבותית פגומים. כל תמונה פגומה צומדה לתמונה המקורית התואמת לה, אשר שימשה כמטרה לשחזור במהלך האימון. אסטרטגיה זו אפשרה למודול CycleGAN ללמוד את השחזור של מבני מוטיבים חסרים תוך שמירה על עקביות סמנטית ומאפיינים בעלי חשיבות תרבותית. לבסוף, מחולל ה-SPADE מפיק פלטים אמנותיים משופרים חזותית על ידי התניית סינתזת התמונה במפות הסגמנטציה שנוצרו, ובכך שומר על השלמות המבנית של המוטיבים התרבותיים לאורך תהליך ההעשרה האמנותית.

השלבים הבאים מעורבים במסגרת ה-SegCycle-SPADE המוצעת.

שלב 1: איסוף מערכי נתונים
שני מערכי נתונים שימשו להשגת יעדי למידת תבניות תרבותיות ויצירת סגנון אמנותי. מערך הנתונים של מוטיבים תרבותיים של באטיק Miao שימש לספק מידע על תבניות תרבותיות מסורתיות. מערך הנתונים זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658) ומכיל 15,148 תמונות מתויגות של מוטיבי באטיק Miao מסורתיים. התיוגים הקיימים שסופקו על ידי יוצרי מערך הנתונים שימשו באופן ישיר, ולא נוצרו תיוגים ידניים נוספים במחקר זה. מערך הנתונים WikiArt שימש לספק מידע מגוון על סגנונות אמנותיים לצורך יצירת סגנון אמנותי, והוא הושג ממאגר WikiArt הזמין לציבור (https://www.wikiart.org/).

שלב 2: עיבוד מקדים של נתונים
כל התמונות עברו עיבוד מקדים הכולל שינוי גודל, נורמליזציה והפחתת רעשים. הערות קיימות של מוטיבים תרבותיים שהושגו ממקורות מערכי הנתונים המקוריים שימשו לתמיכה בשלב הסגמנטציה הסמנטית. לא בוצעו הליכי התחלה או תיווית מחדש נוספים כחלק ממחקר זה.

שלב 3: סגמנטציית תבניות סמנטיות באמצעות SegFormer
מודל ה-SegFormer שימש לסגמנטציה של מוטיבים תרבותיים. ה-backbone המדויק של ה-SegFormer ואסטרטגיית האתחול מתוארים בסעיף המשנה Semantic Pattern Segmentation Using SegFormer. באופן ספציפי, נעשה שימוש בארכיטקטורת SegFormer-B2 עם backbone מסוג MIT-B2 שאומן מראש על ImageNet לצורך סגמנטציה סמנטית של מוטיבים. מודל זה לוכד ביעילות מידע קשרי גלובלי תוך שימור הפרטים המבניים המורכבים של תבניות תרבותיות מסורתיות.

שלב 4: CAFFM
ה-CAFFM משלב מאפייני סגמנטציה סמנטית עם ייצוגים גנרטיביים, מה שמאפשר למסגרת ללמוד הן מאפייני מוטיבים מבניים והן מידע על סגנון אמנותי. פרטי האינטגרציה של ה-CAFFM מופיעים בסעיף המשנה CAFFM. המודול ממוקם בין שלב הסגמנטציה הסמנטית המבוססת על SegFormer לבין שלב השחזור הגנרטיבי, שם הוא ממזג מאפיינים מבניים שנגזרו מהסגמנטציה עם מאפייני שחזור באמצעות cross-attention רב-ראשי (multi-head cross-attention). תהליך זה משפר את השימור של מוטיבים תרבותיים ומגביר את הריאליזם של הפלטים המשוחזרים.

שלב 5: שחזור תבניות (CycleGAN)
המאפיינים הממוזגים מעובדים לאחר מכן על ידי מודול ה-CycleGAN כדי לשחזר מבני תבניות תרבותיות. ארכיטקטורת ה-CycleGAN ותצורת האימון מתוארות בסעיף המשני Pattern Reconstruction Using CycleGAN. מודול השחזור מורכב משני גנרטורים ושני דיסקרימינטורים, משתמש בארכיטקטורת גנרטור של רשת שאריות (residual-network) עם תשעה בלוקים של שאריות, עושה שימוש בדיסקרימינטור PatchGAN, ומאומן באמצעות פונקציות הפסד של למידה אדברסרית ועקביות מחזורית (cycle-consistency). תצורה זו מאפשרת מיפוי דומיינים דו-כיווני ומסייעת בשחזור של מבני תבניות תרבותיות שאינם שלמים.

שלב 6: יצירת סגנון אמנותי (SPADE)
הדפוסים המשוחזרים מעובדים לאחר מכן באמצעות מודול ה-SPADE כדי לבצע סינתזה של סגנון אמנותי מונחית-סגמנטציה. תצורת מחולל ה-SPADE מתוארת בסעיף המשני Artistic Style Generation Using SPADE. המודול משתמש בבלוקים של שארית (residual blocks) מסוג SPADE, שכבות נרמול 적טיביות מרחבית, והתניה סמנטית הנגזרת ממפות סגמנטציה של SegFormer ומייצוגי תכונות של CAFFM. על ידי התניית יצירת התמונה במפות הסגמנטציה, הפלטים המסונתזים שומרים על התאמה מבנית עם המוטיבים התרבותיים המקוריים תוך שילוב מאפייני סגנון אמנותי.

שלב 7: הערכת ביצועים
המסגרת המוצעת הוערכה באמצעות מספר מדדי סגמנטציה והערכת איכות תמונה, כולל Segmentation Accuracy, IoU, Dice Similarity Coefficient (Dice), SSIM, PSNR ו-FID. כדי להעריך את העקביות הניסויית, כל הניסויים חזרו חמש פעמים באמצעות זרעים אקראיים (random seeds) שונים, והתוצאות מדווחות כממוצע ± סטיית תקן. מובהקות סטטיסטית הוערכה באמצעות מבחני t מזווגים, עם סף מובהקות של p < 0.05.

איסוף מערכי נתונים
במסגרת המבנה המוצע של SegCycle-SPADE, נעשה שימוש בשני מערכי נתונים להבנת דגמים תרבותיים ולמידת סגנון. מערך הנתונים הראשון המשמש במסגרת המוצעת הוא מערך נתוני מוטיבים תרבותיים של Batik Miao. מערך נתונים זה מכיל מוטיבים תרבותיים של Batik Miao, שהם בדרך כלל תמונות של Batik Miao מסורתי המכילות מוטיבים כגון בעלי חיים, צמחים וצורות גיאומטריות, המשמשים באמנות של העדתיות Miao. מערך נתונים זה כולל תמונות עם מידע מרקמי עשיר, החשוב בדרך כלל לשימור מורשת תרבותית. מערך הנתונים השני המשמש במסגרת המוצעת של SegCycle-SPADE הוא מערך הנתונים WikiArt. מערך נתונים זה מכיל מספר עצום של יצירות אמנות, אשר הן בדרך כלל מסגנונות שונים. מערך נתונים זה משמש ללמידת סגנונות מורכבים, דבר המועיל בדרך כלל לשיפור יצירות אמנות. מערך נתונים זה כולל 80,000 יצירות אמנות ברזולוציית HD, עם 27 עיצובים שונים, מה שהופך אותו למועיל יותר למשימות של יצירה או טרנספורמציה של סגנון מבוססות DL.

סט הנתונים Miao Batik:
סט הנתונים Miao Batik (https://doi.org/10.5281/zenodo.20807658) כולל 15,148 תמונות של דגמי באטיק המציגים מוטיבים בעלי חשיבות תרבותית. התמונות כוללות מגוון עיצובים מסורתיים, כגון מוטיבים של בעלי חיים (למשל, פרפרים ודגים), דגמים מבוססי צמחים ומוטיבים גיאומטריים הנושאים סימבוליקה תרבותית. סט נתונים זה הוא מרכיב חשוב במסגרת המוצעת כיוון שהוא מספק מבנים תרבותיים אותנטיים המאפשרים למודול הסגמנטציה לזהות ולשמר במדויק את גבולות המוטיבים במהלך שחזור הדגם (טבלה 1). במחקר זה, מוטיבים בעלי חשיבות תרבותית מתייחסים לאלמנטים חזותיים סימבוליים המתועדים נפוצות בספרות על מורשת התרבות של עם המיאו ומיוצגים בתוך ההערות של סט הנתונים, כולל ציפורים, פרפרים, דגמי פרחים וטוטמים אבותים. מוטיבים אלו נבחרו על סמך חשיבותם התרבותית המתועדת ונוכחותם החוזרת בעיצובים מסורתיים של באטיק ורקמה של המיאו, ולא רק על סמך תדירות הופעתם או הרכבן המרחבי. הערות המוטיבים ותוויות הסגמנטציה בהנחיית מומחים הושגו ממקור סט הנתונים המקורי של Miao Batik ושימשו ישירות במחקר זה. המחברים לא ביצעו שום הליך נוסף של הערה ידנית, תיוג מחדש או הערה בהנחיית מומחה. ההערות הקיימות שסופקו על ידי יוצרי סט הנתונים שימשו לאימון ולהערכה של סגמנטציה סמנטית.

פרמטרתיאור
שם מערך הנתוניםמאגר נתוני דגמי תרבות של באטיק מיאו
מקור מערך הנתוניםמאגר Zenodo (DOI: 10.5281/zenodo.20807658)
תחוםמורשת תרבותית בלתי מוחשית (ICH) / ניתוח דפוסי טקסטיל
סה"כ תמונות15,148 תמונות
סוג תמונהתמונות דיגיטליות של דפוסי טקסטיל מסורתיים של באטיק מיאו (Miao)
קטגוריות תבניותמוטיבים של בעלי חיים, מוטיבים של צמחים ומוטיבים גיאומטריים
מקור תרבותיתרבות השבט מיאו, מחוז גוויג'ו, סין
רזולוציית תמונה מקוריתתמונות ברזולוציה גבוהה (בדרך כלל ≥ 1,000 פיקסלים בצד הקצר יותר) שצולמו כסריקות גולמיות או כצילומים לפני עיבוד מקדים
רזולוציית אימוןתמונות שגודלן שונה ל-256 × 256 פיקסלים במהלך העיבוד המקדם
זמינות הערות (Annotation)נעשה שימוש באנוטציות סגמנטציה קיימות שסופקו על ידי יוצרי מערך הנתונים, ללא שינוי, לצורכי אימון והערכה. במחקר זה לא בוצעו הליכי אנוטציה ידנית נוספים, תיוג מחדש או הליכי אישור על ידי מומחים.
יישום במחקר זהסגמנטציית מוטיבים תרבותיים, חילוץ מאפיינים, שימור מוטיבים ושחזור תבניות

טבלה 1: מאפייני מערך הנתונים של דגמי תרבות הבאטיק של המיאו. סיכום של מערך הנתונים של מוטיבים תרבותיים של באטיק מיאו ששימש לפילוח סמנטי, ניתוח דגמים תרבותיים ושחזור מוטיבים. הטבלה מתארת את מקור מערך הנתונים, מאפייני התמונות, קטגוריות המוטיבים, המקור התרבותי, רזולוציית התמונות ותפקידו במסגרת ה-SegCycle-SPADE המוצעת.

מאגר הנתונים WikiArt:
מאגר הנתונים WikiArt [https://www.wikiart.org/] הוא מאגר אמנות דיגיטלי נפוץ ורחב-היקף הכולל למעלה מ-80,000 תמונות מ-27 סגנונות אמנותיים שונים ב- טבלה 2הסגנונות כוללים אמנות רנסנס, אימפרסיוניזם, קוביזם וסוריאליזם. מערך הנתונים חשוב מאוד במסגרת המוצעת, שכן הוא מספק ידע המאפשר למודול ה-SPADE ליצור דפוסים מועשרים תרבותית תוך שמירה על מידע מבני שהתקבל מתהליך הסגמנטציה. מערך הנתונים כולל 56,000 תמונות ללמידה ו-12,000 תמונות הן לוולידציה והן לבדיקה. התמונות במערך הנתונים מסייעות באימון יעיל של מודל ה-DL.

פרמטרתיאור
שם מערך הנתוניםמאגר הנתונים WikiArt
מקור מערך הנתוניםמאגר WikiArt (https://www.wikiart.org/)
תחוםאמנות וציורים דיגיטליים
סה"כ תמונותכ-80,000 יצירות אמנות
תמונות אימון56,000
תמונות תיקוף12,000
תמונות בדיקה12,000
סגנונות אמנותיים27 סגנונות אמנותיים, כולל רנסנס, אימפרסיוניזם, קוביזם, סוריאליזם, אקספרסיוניזם, ריאליזם ואמנות מופשטת
רזולוציית תמונה מקוריתרזולוציות התמונות המקוריות משתנות בין יצירות אמנות ומקורות שונים. במהלך עיבוד מקדמי, התמונות שונו לגודל אחיד של 256 × 256 פיקסלים.
רזולוציית אימוןהתמונות הוקטנו לגודל של 256 × 256 פיקסלים במהלך עיבוד מקדמי לפני למידת סגנון אמנותי וסינתזת תמונות מונחית סגמנטציה.
חלוקת מערכי נתוניםחלוקה אקראית מרובדת (70% אימון, 15% תיקוף ו-15% בדיקה) תוך שימוש בזרע אקראי קבוע של 42
אסטרטגיית דגימת סגנוןנעשה שימוש בדגימה פרופורציונלית מרובדת כדי לשמר את ההתפלגות של 27 הסגנונות האמנותיים בין תתי-הקבוצות של האימון, התיקוף והבדיקה.
יישום במחקר זהלמידת סגנון אמנותי, ייצוג סגנון וסינתזה אמנותית מונחית סגמנטציה

טבלה 2: מאפייני מערך הנתונים WikiArt. סיכום של מערך הנתונים WikiArt ששימש ללמידת סגנון אמנותי וסינתזת תמונות מונחית-סגנון. הטבלה מתארת את מקור מערך הנתונים, התפלגות התמונות, כיסוי הסגנונות האמנותיים, חלוקת מערך הנתונים, רזולוציית התמונות והיישום שלו במסגרת ה-SegCycle-SPADE המוצעת.

מאגר הנתונים Miao Batik מכיל 15,148 תמונות המייצגות מוטיבים תרבותיים מסורתיים של בני המיאו.32 מאגר הנתונים זמין לציבור באמצעות Zenodo (https://doi.org/10.5281/zenodo.20807658). לפני אימון המודל, כל התמונות נבחנו באופן חזותי, שונו לגודל של 256 × 256 פיקסלים, נורמלו ונבדקו לאיתור דגימות פגומות או כפולות. סינון בקרת האיכות לא הוביל להסרה של תמונות כלשהן; לפיכך, כל 15,148 התמונות נשמרו לצורך ניתוח המשך. מאגר הנתונים חולק באופן אקראי לתתי-קבוצות של אימון (70%), תיקוף (15%) ובדיקה (15%) באמצעות seed אקראי קבוע של 42 כדי להבטיח את השחזור של חלוקת מאגר הנתונים. מאגר הנתונים WikiArt נשג בגישה למאגר הרשמי של WikiArt (https://www.wikiart.org/) והוא מכיל יותר מ-80,000 יצירות אמנות המקיפות 27 סגנונות אמנותיים. עבור ניסויי למידת סגנון, נעשה שימוש ב-56,000 תמונות לאימון, 12,000 לתיקוף ו-12,000 לבדיקה.

עיבוד מקדים של נתונים
לפני אימון מסגרת ה-SegCycle-SPADE המוצעת, מאגר הנתונים של מוטיבים תרבותיים מבטי מיאו (Miao Batik) ומאגר הנתונים WikiArt הועברו מספר שלבי עיבוד מקדים כדי להבטיח איכות תמונה עקבית וייצוג מדויק של מאפיינים. אותו תהליך עיבוד מקדים בסיסי, הכולל הסרת רעשים גאוסיאנית, נורמליזציה, שינוי גודל לרזולוציית קלט עקבית ואימות איכות התמונה, הוחל על שני מאגרי הנתונים. עם זאת, למאגרי הנתונים היו תפקידים שונים בתוך המסגרת. מאגר הנתונים WikiArt שימש ללמידה וסינתזה של סגנון אמנותי, בעוד שמאגר הנתונים של בטי מיאו שימש בעיקר לסגמנטציה ושחזור של מוטיבים תרבותיים. לא בוצעו שינויים בעיבוד המקדים הייחודיים למאגר נתונים מעבר לתפקידים ספציפיים אלו. כדי להבטיח עיבוד עקבי על ידי מודל ה-DL, התמונות שונו תחילה לרזולוציה קבועה. שלב זה היה נחוץ מכיוון שהתמונות בשני מאגרי הנתונים נבדלו ברזולוציה בהתאם למקורן. שינוי הגודל שיפר את היעילות החישובית ומנע מחוסר עקביות ממדית להשפיע על האימון. שלב העיבוד המקדים השני היה נורמליזציה, שבה ערכי הפיקסלים הותאמו לטווח סטנדרטי כדי לייצב את עדכוני הגראדיאנט במהלך האימון. לאחר מכן, התמונות עובדו באמצעות סינון גאוסיאני להפחתת רעשים שעלולים להפריע למבני המוטיבים התרבותיים. עבור מאגר הנתונים של בטי מיאו, נעשה שימוש במסכות סגמנטציה של מוטיבים תרבותיים קיימות, שהושגו ישירות ממקור מאגר הנתונים המקורי, ללא שינוי, לצורך אימון והערכה של סגמנטציה סמנטית. לא הופקו מסכות סגמנטציה חדשות במיוחד עבור מחקר זה.

אלא אם צוין אחרת, משוואות המתארות שיטות מבוססות הותאמו ממחקרים קודמים ומצוטטות בהתאם. משוואות המתארות את ה-CAFFM המוצע ואת מסגרת האופטימיזציה המורכבת SegCycle-SPADE פותחו על ידי המחברים למחקר זה.

תהי תמונת קלט מתוך מערך הנתונים מיוצגת כ- משוואה 1:

מושג מתמטי של תמונה במרחב אוקלידי, I ∈ ℝ^HxWxC, המציין ממדים.  (1)

כאן, ה, וו- C מתייחסים לגובה התמונה, לרוחבה ולמספר ערוצי הצבע, בהתאמה. כל התמונות שונו לגודל קבוע ג' × ר' כפי שמוצג ב- משוואה 2:

משוואת שינוי גודל עבור ממדים H' x W'; נוסחה מתמטית.

כאן, Iנראה כי לא הוזנה טקסט למסירה. אנא ספק את הטקסט באנגלית שברצונך לתרגם לעברית. היא התמונה לאחר שינוי הגודל. ערכי הפיקסלים הנורמליים מחושבים לפי משוואה 3:

משוואה In=Ir/255, המציגה את נוסחת הנורמליזציה של התמונה.   (3)

דבר זה מסייע בייצוב תהליך האימון. סינון רעשים מבוצע באמצעות מסנן גאוסי כפי שמוצג ב- משוואה 4:

משוואה של שיטת עיבוד אותות, \( I_s = I_n * G(\sigma) \), נוסחה בניתוח מתמטי.

כאן, G(σ) הוא מסנן גאוסיאני ו-* מייצג קונבולוציה. נעשה שימוש במסנן גאוסיאני עם גרעין (kernel) של 5 × 5 וסטיית תקן של σ = 1.0. הוחל ריפוד השתקפותי (reflective padding) על פיקסלי השוליים כדי לצמצם ארטיפקטים של קצוות. תהליך הסרת הרעשים בוצע מיד לאחר טעינת התמונה, לפני השלב של שינוי קנה המידה והנורמליזציה. כדי להבטיח עיבוד מקדים אחיד לאורך המחקר, אותה הגדרת מסנן הוחלה על כל תמונה במאגרי הנתונים Miao Batik ו-WikiArt. עבור מאגר הנתונים Miao Batik, מסכות הסגמנטציה נוצרות בהתאם למשוואה 5:

נוסחה מתמטית M(x,y) לסיווג פיקסלים באזור המוטיב; משוואת כלל ההכרעה.

כאן, M משמשת כמסכת סגמנטציה להנחיית מודל ה-SegFormer.

תהליך העיבוד המוקדם מתחיל ברכישת תמונות ממאגר הנתונים Miao Batik וממאגר הנתונים WikiArt, כפי שמוצג ב-איור 3. לא נעשה שימוש בטכניקות של הרחבת נתונים (data augmentation) במהלך האימון. לאחר העיבוד המוקדם, שכלל שינוי גודל, נורמליזציה, הסרת רעש גאוסיאנית והכנת מסכות סגמנטציה, התמונות שימשו ישירות לאימון, תיקוף ובדיקה של מסגרת ה-SegCycle-SPADE המוצעת. השלב הראשוני של תהליך העיבוד המוקדם כולל שינוי גודל של התמונות לגודל קבוע, מה שמאפשר למודל ה-DL לעבד את התמונות ביעילות רבה יותר. השלב השני כולל נורמליזציה, הממירה את ערכי הפיקסלים לטווח מספרי סטנדרטי ומסייעת להתכנסות המודל. השלב השלישי כולל הסרת רעשים, שבה התמונות מנוקות מרעשים לא רצויים כדי לשפר את זיהוי התבניות. בנוסף, עבור מאגר הנתונים Miao Batik, מסומנים אזורי מוטיבים תרבותיים, מה שמאפשר יצירת מסכות המשמשות במודול הסגמנטציה של המודל המוצע, ומבטיח כי המוטיבים התרבותיים יישמרו במהלך היצירה. הפלט הסופי של שלב זה הוא מאגר נתונים נקי המוכן לאימון מודולי הסגמנטציה והיצירה של המודל המוצע.

זרימת עיבוד תמונות אמנות: קלט מערך נתונים, שינוי גודל, נורמליזציה, הסרת רעשים, השראת מוטיבים.
איור 3. תהליך עיבוד מקדמי של נתונים עבור תמונות מורשת תרבותית. תרשים זרימה הממחיש את נהלי העיבוד המקדמי של התמונות המיושמים לפני אימון המודל. התהליך כולל רכישת מערך נתונים, שינוי גודל תמונות, נורמליזציה, ניקוי רעשים גאוסיאני, השראות קיימות של מוטיבים תרבותיים והכנת מסכות סגמנטציה. התמונות והמסכות המעובדות שמתקבלות משמשות כקלט לסגמנטציה סמנטית ושחזור תבניות. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

כל תמונה הועברה בתהליך בקרת איכות לפני אימון המודל. מערך הנתונים של Miao Batik הכיל 15,148 תמונות. דגימות פגומות, כפולות ובעלות איכות נמוכה טופלו כבר על ידי יוצרי מערך הנתונים המקורי; לפיכך, לא הוצאו תמונות נוספות במהלך סינון בקרת האיכות במחקר זה. כתוצאה מכך, כל 15,148 התמונות נשמרו לניתוח. התמונות נטענו בפורמט RGB במהלך העיבוד המקדים ושונו לגודל של 256 × 256 pixels באמצעות אינטרפולציה בילניארית. ערכי הפיקסלים הותאמו מהטווח [0, 255] לטווח [0, 1] באמצעות חלוקה ב-255. לאחר מכן הוחלה נורמליזציה לפי ערוצים תוך שימוש בערכי ממוצע של [0.485, 0.456, 0.406] וערכי סטיית תקן של [0.229, 0.224, 0.225] עבור הערוצים האדום, הירוק והכחול, בהתאמה. תהליך העיבוד המקדים כלל טעינת תמונות, המרה ל-RGB, שינוי גודל, התאמת ערכי פיקסלים, נורמליזציה והמרה לטנזור. במידת הצורך, תמונות בגווני אפור הומרו לפורמט RGB בעל שלושה ערוצים כדי לשמור על תאימות עם מודלי ה-DL. לאחר העיבוד המקדים, התמונות חולקו לתתי-קבוצות של אימון, תיקוף ובדיקה. כל השלבים של מסגרת ה-SegCycle-SPADE — כולל סגמנטציה סמנטית, מיזוג מאפיינים, שחזור מוטיב וסינתזה אמנותית מבוססת SPADE — השתמשו ברזולוציית קלט עקבית של 256 × 256 pixels.

סגמנטציה של תבניות סמנטיות באמצעות SegFormer
לאחר שלב עיבוד מקדים זה, התמונות הנקיות והמנורמליות של מערך נתוני מוטיבי התרבות של Miao Batik ומערך הנתונים WikiArt מוזנות למודול הסגמנטציה הסמנטית המבוסס על המסגרה המוצעת של SegFormer-B2. מטרת שלב זה היא לזהות ולהפריד באופן נכון מוטיבים תרבותיים המופיעים בתבניות מורשת. המסגרת המוצעת של SegFormer מבוססת על ארכיטקטורת transformer הכוללת מקודד Transformer היררכי ומפענח MLP קל משקל, כדי ללכוד במדויק מידע קשרי גלובלי וכן מידע מבני מפורט מתבניות מורשת מורכבות. המודל מחלץ תחילה ייצוגי מאפיינים במספר קני מידה מהתמונה הקלטית, ולאחר מכן מתבצע מיזוג של ייצוגים אלו באמצעות המפענח כדי להפיק תבניות מסגמנטריות מדויקות. דבר זה מבטיח שהתבניות בתמונת המורשת יסוגמנטרו נכון למוטיבים כגון תבניות גיאומטריות, תבניות פרחוניות ותבניות סמליות, ובכך יופרדו מהרקע תוך שמירה על השלמות המבנית שלהן. מידע מבני זה משמש לאחר מכן בשלבים מאוחרים יותר של יצירת תבניות בתוך מסגרת ה-SegCycle-SPADE.

תהי תמונת הקלט שעברה עיבוד מקדים מיוצגת כ- משוואה 6:

ייצוג מתמטי של תכונות התמונה; משוואה; סימון מרחב ממדי \(I_p \in \mathbb{R}^{H \times W \times C}\).    (6)

המקודד של SegFormer מחלק את התמונה לטלאים (patches) ומחלץ מאפיינים היררכיים באמצעות שכבות טרנספורמר, כפי שמוצג ב- משוואה 71:

הנוסחה F=Encoder(Ip) מייצגת תהליך קידוד בשיטה חישובית.

כאן, פ מייצג את מפות המאפיינים רב-הקנה (multiscale feature maps) המתקבלות מהמקודד של הטרנספורמר (transformer encoder). מאפיינים אלו מקודדים הן דפוסי טקסטורה מקומיים והן קשרי הקשר גלובליים בין אזורי מוטיב. מודל ה-SegFormer מחלץ מפות מאפיינים בקני מידה שונים כפי שמוגדר ב- משוואה 8:

משוואת שיווי משקל סטטי, F={F1,F2,F3,F4}, ביטוי מתמטי, כוחות בלימודי פיזיקה

השימוש בייצוגים רב-קנה-מידה מקל על זיהוי תבניות בגדלים שונים בתוך מוטיבים תרבותיים. לבסוף, המאפיינים משולבים באמצעות מפענח MLP כפי שמוצג ב-משוואה 91:
 משוואה של תהליך פענוח אותות באמצעות פונקציית מפענח; ייצוג של משוואה מתמטית.

כאן, S מייצגת את מפת הסגמנטציה הסופית החזויה.

שלד ה-SegFormer-B2 אותחל באמצעות משקולות שאומנו מראש על ImageNet, ולאחר מכן עבר כיוונון עדין (fine-tuning) על מערך הנתונים של Miao Batik לצורך סגמנטציה של מוטיבים תרבותיים. נקודת השחזור (checkpoint) המאומנת מראש הופקה מהמימוש הרשמי של SegFormer. באופן ספציפי, נעשה שימוש בנקודת השחזור של MIT-B2 שאומנה על ImageNet-1K (mit_b2.pth), כפי שסופקה במאגר הרשמי של SegFormer, כדי לאתחל את שלד ה-SegFormer-B2 לפני הכיוונון העדין. המשקולות המאומנות מראש תואמות לשלד ה-MIT-B2 שפורסם על ידי מחברי SegFormer ושימשו כמודל האתחול לאימון סגמנטציה סמנטית. שאר השכבות הספציפיות למשימה אותחלו באמצעות נהלי אתחול המשקולות ברירת המחדל של PyTorch לפני האימון.

בארכיטקטורה נעשה שימוש במקודד Transformer היררכי בעל ארבעה שלבים עם שיכמומי טלאים (patch embeddings) חופפים. בשלב הראשוני, גודל הטלאי נקבע ל-7 × 7 עם פסיעה (stride) של 4. עבור כל אחד מארבעת שלבי המקודד, ממדי השיכמום היו 64, 128, 320 ו-512. לאורך ארבעת השלבים, היו 1, 2, 5 ו-8 ראשי קשב עצמי רב-ראשיים (multihead self-attention heads), ועומקי המקודד התואמים היו 3, 4, 6 ו-3 שכבות. מאפיינים רב-קנימיים שהופקו מהמקודד אוגדו באמצעות מפענח all-MLP קל משקל. לפני יצירת מפת הסגמנטציה הסופית, המפענח השליך מאפיינים מכל שלב של המקודד למרחב שיכמום יחיד. כל בלוקי ה-Transformer השתמשו בפונקציית ההפעלה Gaussian Error Linear Unit (GELU). שיעור dropout של 0.1 שימש במהלך האימון כדי לשפר את ההכללה ולצמצם התאמת יתר (overfitting).

במהלך שלב האימון, מסגרת ה-SegFormer מקבלת את התמונות שעברו עיבוד מקדים משני מאגרי הנתונים. התמונות ממאגר הנתונים של Miao Batik מכילות אזורי מוטיב המשמשים כתוויות ללמידה מונחית (supervised learning) של מודל הסגמנטציה. מקודד ה-Transformer מעבד את התמונה כולה ולוכד קשרים ארוכי טווח בין רכיבי התמונה, דבר החשוב במיוחד עבור דגמי באטיק מסורתיים המכילים מוטיבים המפוזרים מרחבית. מנגנון חילוץ התכונות ההיררכי לוכד בו-זמנית מבנים מקומיים, כגון מרקמים גיאומטריים חוזרים. מפענח ה-MLP מעבד את התכונות שחולצו ומפיק מסכת סגמנטציה המדגישה את אזורי המוטיב. מפות הסגמנטציה שנוצרו בשלב זה משמשות לאחר מכן כקלטים מבניים עבור מודול הקשב (attention module) ושלב שחזור הדפוס, ובכך מסייעות בשימור האותנטיות של הדגמים הנוצרים.

מוטיבים תרבותיים חולקו למחלקות שונות לצורך פילוח סמנטי (semantic segmentation) בהתאם למאפיינים החזותיים והתרבותיים שלהם. טקסונומיית הפילוח כללה מוטיבים של בעלי חיים (למשל, פרפרים, דגים, ציפורים ופאונה סימבולית אחרת), מוטיבים של צמחים (למשל, פרחים, עלים, גפנים ודגמים בוטניים), מוטיבים גיאומטריים (למשל, צורות חוזרות, מסגרות ומבנים גיאומטריים מופשטים), ואזורי רקע המייצגים אזורים שאינם מוטיבים. מסכות פילוח ברמת פיקסל שימשו להקצאת כל פיקסל לאחת המחלקות שהוגדרו מראש. תוויות של מספרים שלמים קודדו באופן הבא: תווית 0 = רקע, תווית 1 = מוטיבים של בעלי חיים, תווית 2 = מוטיבים של צמחים, ותווית 3 = מוטיבים גיאומטריים. הערות הפילוח ותוויות המוטיבים התקבלו ישירות ממקור מערך הנתונים המקורי של Miao Batik. במחקר זה לא בוצעו נתוני הערה ידניים נוספים, תיווית מחדש, אימות גבולות או נהלי אישור על ידי מומחים. ההערות הקיימות שסופקו על ידי יוצרי מערך הנתונים שימשו ללא שינוי לצורך אימון והערכה.

מודל ה-SegFormer לסגמנטציה של מוטיבים תרבותיים מעבד את התמונות שעברו עיבוד מקדים ממאגר הנתונים של Miao Batik וממאגר הנתונים של WikiArt, תוך שימוש במנגנון מבוסס Transformer לזיהוי מדויק של אזורי דגמים תרבותיים, כפי שמוצג ב-איור 4. ראשית, תמונת הקלט המכילה מוטיבים תרבותיים מסורתיים מוזנת למודל ה-SegFormer. מקודד ה-Transformer מחלץ הן מידע הקשרי גלובלי והן מאפיינים מבניים מקומיים מתוך טלאי (patches) של התמונה. המאפיינים הרב-סולמיים המתקבלים מוזנים למפענח הסגמנטציה, המשתמש ברשת Mix Feed-Forward כדי לזקק את ייצוגי המאפיינים ולשפר את זיהוי המוטיבים. הפלט של מודל ה-SegFormer הוא מסכת סגמנטציה המדגישה פיקסלים התואמים לדגמים תרבותיים תוך דיכוי מידע רקע לא רלוונטי. הדגמים התרבותיים המבודדים משמשים לאחר מכן כהנחיה מבנית עבור השלבים הבאים של מסגרת ה-SegCycle-SPADE.

דיאגרמת תהליך הפילוח באמצעות SegFormer עם מקודדי טרנספורמר (transformer encoders) לניתוח תמונת קלט.
איור 4סגמנטציה סמנטית של מוטיבים תרבותיים המבוססת על SegFormer-B2. ארכיטקטורה של מודול הסגמנטציה הסמנטית SegFormer-B2 המשמש להפקת מוטיבים תרבותיים ואומן באופן בלעדי על מערך נתוני ה-Miao Batik. המסגרת מורכבת ממקודד (encoder) מבוסס Transformer להפקת מאפיינים ברב-קנה מידה וממפענח (decoder) סגמנטציה קל-משקל ליצירת מסכות של מוטיבים. המודל חוזה ארבע מחלקות סמנטיות — בעל חיים, צמח, גיאומטרי ורקע — כאשר מסכות הסגמנטציה המתוצאות מזהות אזורי מוטיבים בעלי חשיבות תרבותית תוך דיכוי מידע רקע שאינו רלוונטי. פלטי סגמנטציה אלו מספקים הנחיה מבנית לשלבי מיזוג המאפיינים, השחזור והסינתזה האמנותית העוקבים של מסגרת ה-SegCycle-SPADE המוצעת. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

אין צורך ביצירת תוויות סגמנטציה חדשות במסגרת המוצעת. מאגר הנתונים של Miao Batik נרכש ממקור ציבורי קיים, והמודל אומן באמצעות מידע על מוטיבים קשורים שסופק על ידי יוצרי מאגר הנתונים. במהלך תהליך הלמידה, מודל ה-SegFormer הפיק מפות סגמנטציה סמנטית. כתוצאה מכך, המחקר הנוכחי לא הצריך תוכנת תוויות ידנית נוספת, הנחיות למתן תוויות או נהלי בקרת איכות של התוויות.

CAFFM
כדי לשפר את האינטראקציה בין המאפיינים של סגמנטציה סמנטית לבין הייצוגים של שחזור גנרטיבי, המחקר הציע גם מודול CAFFM. המקודד SegFormer-B2 מספק מפות מאפיינים סמנטיים למודול ה-CAFFM, בעוד ששלב השחזור של ה-CycleGAN מספק מפות מאפיינים גנרטיביים. ראשית, נעשה שימוש בשכבות היטל ליניאריות כדי להטיל את שני זרמי המאפיינים אל מרחב שיכון (embedding space) משותף. לצורך חישוב קשב צולב (cross-attention), נוצרים ייצוגי שאילתה (Q), מפתח (K) וערך (V) באמצעות הטנזורים של המאפיינים שנוצרו. לאחר מכן, הקשרים בין מידע על מוטיבים מבניים לבין אלמנטים של סגנון אמנותי ממודלים באמצעות קשב צולב רב-ראשי (multihead cross-attention). לאחר מכן, מוחלים נורמליזציה של שכבות, קשרים שיוריים (residual connections) ושכבות feed-forward עם אקטיבציית GELU על ייצוגי המאפיינים הממוזגים. שלב הסינתזה המבוסס על SPADE מקבל את הפלט של מודול ה-CAFFM, מה שמאפשר שימור של תכנים בעלי משמעות תרבותית מבלי להקריב את הלכידות האמנותית.

כדי להבטיח תאימות של מאפיינים, מאפייני הקלט מוקרנים תחילה באמצעות שכבות הקרנה ליניאריות אל מרחב שיבוץ (embedding space) משותף עם ממד שיבוץ של 256. הקשרים בין מידע מבני סמנטי לבין ייצוגי סגנון גנרטיביים ממודלים לאחר מכן באמצעות מנגנון MultiHead Cross-Attention עם שמונה ראשי קשב. חישוב ה-Cross-attention משתמש בווקטורים של שאילתה (Q), מפתח (K) וערך (V) המופקים על ידי שכבות טרנספורמציה ליניאריות ספציפיות. כדי להגביר את יציבות האימון ולשמור על שלמות המאפיינים, נעשה שימוש בקשרי שארית (residual connections) ובנרמול שכבות (Layer Normalization) כדי לשפר עוד יותר את ייצוגי המאפיינים הממוזגים. למידה לא-ליניארית של מאפיינים משופרת לאחר מכן על ידי יישום רשת feed-forward עם פונקציית אקטיבציה מסוג Gaussian Error Linear Unit (GELU). ייצוג מאפיין פלט בממד 256 נוצר על ידי המודול ונשלח לשלבים אחרים לצורך סינתזה יצירתית. ה-CAFFM משלב בהצלחה נתוני סגנון אמנותי עם מבני מוטיב תרבותיים באמצעות טכניקת מיזוג מבוססת cross-attention, אשר משפרת את שימור המוטיבים ואת העקביות הוויזואלית בדגמי המורשת התרבותית המשוחזרים.

במערכת המוצעת, המאפיינים המבניים נגזרים ממאגר הנתונים Miao Batik, בעוד שהמאפיינים הסגנוניים נלמדים ממאגר הנתונים WikiArt. נסמן ב-Fs את מפת המאפיינים שנגזרה מרשת הסגמנטציה SegFormer באמצעות תמונות ממאגר הנתונים Miao Batik, ואת מפת המאפיינים שנגזרה מענף מיצוי מאפייני-הסגנון באמצעות תמונות WikiArt נסמן ב-Fa. ה-CAFFM המוצע משלב את שני דומייני המאפיינים באמצעות מנגנון תשומת-לב צולבת (cross-attention) כדי ללמוד תלויות מבניות וסגנוניות של תבניות תרבותיות. טבלה 3 מפרטת את כל מאפייני הארכיטקטורה, כולל ממדי שיכון (embedding dimensions), שכבות נורמליזציה, פונקציות הפעלה ותצורת ראשי התשומת-לב. עבור גודל תמונת קלט של 256 × 256 פיקסלים, מקודד ה-SegFormer-B2 הפיק מפות מאפיינים סמנטיות בגודל 64 × 64 × 128, בעוד שענף מיצוי מאפייני-הסגנון הפיק מפות מאפיינים בגודל 64 × 64 × 128. שתי מפות המאפיינים הוקרנו באמצעות שכבות ליניאריות למידיות אל מרחב שיכון משותף בממד 256 לפני מיזוג התשומת-לב הצולבת.

פרמטרתצורה
מסגרת מוצעתSegCycle-SPADE
מודל סגמנטציה סמנטיתSegFormer-B2
שלבי מקודד SegFormer4
אתחול משקולותSegFormer-B2 שמאומן מראש על ImageNet-1K (שלד MIT-B2)
מקור נקודת בדיקה (Checkpoint)מאגר SegFormer הרשמי של NVIDIA (https://github.com/NVlabs/SegFormer); נקודת בדיקה: segformer.b2.512x512.ade.160k
אסטרטגיית כוונון עדין (Fine-Tuning)כוונון עדין מקצה לקצה על מערך הנתונים Miao Batik
גודל שיבוץ פאטץ' (Patch Embedding)7 × 7
צעד פאטץ' (Patch Stride)4
ממדי שיבוץ64, 128, 320, ו-512
עומקי מקודד3, 4, 6, ו-3
ראשי תשומת לב (Attention Heads)1, 2, 5, ו-8
סוג מפענחמפענח All-MLP
פונקציית אקטיבציהGELU
שיעור נשירה (Dropout)0.1
מודול שיפור מאפייניםמודול מיזוג מאפיינים תרבותיים באמצעות תשומת לב צולבת (CAFFM)
ממד שיבוץ CAFFM256
ראשי תשומת לב CAFFM8
קשקלי מיזוג CAFFM4
מודל שחזורCycleGAN
מודל יצירת סגנוןSPADE
מערך נתונים תרבותימערך נתוני Miao Batik
מערך נתוני סגנוןמערך נתוני WikiArt
תמונות Miao Batik15,148
תמונות WikiArtבערך 80,000
רזולוציית תמונת קלט256 × 256 pixels
פורמט צבעRGB
שיטת אינטרפולציהאינטרפולציה ביליניארית
שיטת ניקוי רעשיםסינון גאוסי
גודל גרעין גאוסי5 × 5
סיגמא גאוסי (σ)1
טווח נורמליזציה[0, 1]
גודל אצווה (Batch Size)16
מספר תקופות (Epochs)100
אופטימייזרAdam
קצב למידה0.0002
פרמטרי Adamβ₁ = 0.5, β₂ = 0.999, ε = 1 × 10⁻⁸, weight decay = 0
פונקציות הפסדהפסד סגמנטציה, הפסד אדברסרי, הפסד עקביות-מחזורית, הפסד שחזור, הפסד שימור מוטיבים והפסד עקביות-סגנון
אסטרטגיית חלוקת מערך נתוניםאימון / תיקוף / בדיקה
סט אימון70%
סט תיקוף15%
סט בדיקה15%
גרעין אקראי (Random Seed)42
מדדי הערכהדיוק סגמנטציה, IoU, מקדם Dice, SSIM, PSNR, ו-FID
שפת תכנותPython 3.8.10
מסגרת למידה עמוקהPyTorch 1.10.0
פלטפורמת חומרהNVIDIA RTX 3090 GPU (24 GB VRAM), Intel Core i7 (דור 11), 32 GB RAM
סביבת הפעלהUbuntu 20.04 LTS

טבלה 3: הגדרה ניסיונית ותצורת מודל. סיכום של מרכיבי הארכיטקטורה, תצורת האימון, הגדרות עיבוד מקדמי, מערכי נתונים, פרמטרי אופטימיזציה, מדדי הערכה והסביבה החישובית ששימשו ליישום ולהערכה של מסגרת ה-SegCycle-SPADE המוצעת.

מודול הקשב ממפה תחילה את מפת המאפיינים לייצוגי שאילתה (query), מפתח (key) וערך (value) באמצעות משוואה 10:

משוואת מנגנון וקטורי: Q=FsWq, K=FsWk, V=FsWv; תרשים לניתוח במחקר פיזיקה.

כאן, וק, ו'קו- וּv הן מטריצות משקולות הניתנות ללמידה. משקולות הקשב מחושבות על בסיס הדמיון בין וקטור השאילתה (query vector) לוקטור המפתח (key vector) באמצעות משוואה 1117

נוסחת מנגנון קשב A=Softmax(QKᵀ/√dₖ), שיטת למידה עמוקה, משוואה.

כאן, dk הוא הממד של וקטור המפתח. ייצוג המאפיינים המשופר מחושב על ידי הכפלת משקולות הקשב במטריצת הערכים באמצעות משוואה 12:

משוואה לחישוב כוח, \( F_a = A \cdot V \), מתוך פיתוח נוסחה פיזיקלית.

כאן, Fa הוא ייצוג התכונות המשופר של מפת התכונות. ייצוג התכונות המשופר מחושב על ידי שילוב תכונות הסגמנטציה המקוריות עם התכונות המשופרות שהתקבלו באמצעות מנגנון הקשב (attention mechanism) באמצעות משוואה 13:

משוואת שיווי משקל סטטי: Fe=Fs+Fa. ביטוי מתמטי לניתוח מאזן כוחות.                               

כאן, Fה היא מפת המאפיינים המשופרת המשמשת לשחזור תבניות. ה-CAFFM מורחב באמצעות מנגנון קשב-צולב רב-קנימי (multiscale cross-attention mechanism) כדי לחלץ מאפיינים עבור מוטיבים תרבותיים בקניינים שונים. נניח ש- נקבהsi סמן את מאפייני הסגמנטציה בקנה מידה (at scale) iבעוד ש-, בעוד ש- פנייהaג' מציין את מאפייני הסגנון האמנותי באותו קנה מידה. ייצוג המאפיינים הסופי מוגדר באמצעות משוואה 14:

  משוואת מנגנון הקשב ברשתות נוירונים, ΣAttention(Q,K,V), נוסחה מתמטית.

כאן, Qi, Ki, ו-Vi מייצגים את מטריצות השאילתה (query), המפתח (key) והערך (value) בקנה מידה i, בהתאמה, ו-N מציין את מספר קני המידה של המאפיינים. במחקר זה, N = 4, וזה תואם למפות מאפיינים שהופקו ברזולוציות מרחביות של 1/4, 1/8, 1/16, ו-1/32 מגודל תמונת הקלט. ייצוגי מאפיינים רב-קני מידה אלו מוזגו באמצעות משקולות קשב (attention weights) למידה לפני השחזור והסינתזה האמנותית. הרחבה זו מאפשרת למתודה לחלץ מוטיבים תרבותיים ומרקמים גלובליים כדי לשחזר דגמים תרבותיים. רכיב ה-CAFFM ממוקם בין שלב הסגמנטציה המבוסס על SegFormer לבין שלב הסינתזה היצירתית המבוסס על SPADE במערכת ה-SegCycle-SPADE המוצעת. ראשית, בעוד ש-CycleGAN יוצר במקביל מאפייני שחזור עם מידע סגנוני ומידע הקשור לדגמים, SegFormer-B2 משחזר מפות מאפיינים סמנטיות המתארות את התכונות המבניות של מוטיבים תרבותיים. מודול ה-CAFFM מקבל את שני זרמי המאפיינים הללו ומשתמש במיזוג מבוסס קשב-צולב (cross-attention) כדי לזהות קשרים בין ייצוגים מבניים לאמנותיים. כדי ליצור דגמים אותנטיים תרבותית תוך שמירה על עקביות סמנטית ומאפיינים מבניים, מפות המאפיינים הממוזגות שנוצרו נשלחות לאחר מכן למודול ה-SPADE לסינתזה יצירתית מונחית-סגמנטציה.

שחזור תבניות באמצעות CycleGAN
לאחר השלמת שלב שיפור המאפיינים המבוסס על מנגנוני קשב (attention), מפות המאפיינים יכילו את מבני המוטיבים התרבותיים המשופרים. עם זאת, ייתכן שמפות המאפיינים עדיין יכילו אזורי תבניות חסרים או פגומים. לכן, כדי לפתור את בעיית שחזור התבניות, המסגרת המוצעת תשתמש במודל CycleGAN. במסגרת המוצעת, שני הדומיינים יהיו תבניות המוטיבים התרבותיים המקוריות ותבניות המוטיבים התרבותיים המשוחזרות. באמצעות המאפיינים המשופרים מהשלבים הקודמים, מודל ה-CycleGAN ישחזר את התבניות התרבותיות תוך שמירה על עקביות מבנית. הדבר יבטיח שתבניות תרבותיות, כגון תבניות גיאומטריות, תבניות פרחוניות ותבניות סימבólicas, ישמרו על הסידור המרחבי שלהן. תמונות ה-Miao Batik המקוריות הועברו תהליכי מיסוך אקראי (random masking) ופעולות הסתרה חלקית כדי לייצר מוטיבים תרבותיים חסרים או פגומים. הליכי דגרדציה אלו סימלו אזורי תבניות חסרים ונזקים מבניים הנצפים בדרך כלל בפריטי מורשת תרבותית שהתבלו. התמונות המעובדות שימשו כקלטים למודול השחזור, בעוד שהתמונות המקוריות התואמות שימשו כתמונות ייחוס להערכת ביצועים ובחינת איכות השחזור. אסטרטגיה זו אפשרה למודל ללמוד את השחזור של מבני מוטיבים חסרים תוך שמירה על עקביות סמנטית ומאפיינים תרבותיים.

יהי X תחום של תבניות תרבותיות לא שלמות ויהי Y תחום של תבניות תרבותיות משוחזרות. שני הגנרטורים לומדים לבצע מיפוי דו-כיווני באמצעות משוואה 15:

 ביג'קציות מתמטיות; פונקציות GF:X→Y, FM:Y→X; תרשים משוואות; מיפוי אלגברי.

כאן, נעשה שימוש ב-GE כדי לשחזר מבני מוטיבים וב-FM כדי למפות את התבניות בחזרה לדומיין המקורי. ההפסד האדברסרי משמש כדי להבטיח שהתבניות המשוחזרות הן ריאליסטיות (משוואה 16)30

משוואת פונקציית ההפסד של GAN, נוסחה לניתוח אופטימיזציה, מילות מפתח למחקר.

כאן, DY הוא המבדיל (discriminator) המשמש להבחנה בין תבניות אמיתיות לתבניות ששוחזרו, ו-GE(x) מייצג את התבנית המשוחזרת שנוצרה. ה-CycleGAN אוכפת גם עקביות מחזורית כדי לשמר את המבנה המבני של מוטיבים תרבותיים (משוואה 17)30.

משוואה המראה את פונקציית ההפסד עבור עקביות מחזורית במודל גנרטיבי; נוסחה בסימון מתמטי.

פונקציית ההפסד הסופית מוגדרת באמצעות משוואה 1830:

משוואת ההפסד הכולל עבור אופטימיזציה של GAN בלמידה מכונה.

כאן, λi מציין את מקדם השקלול עבור הפסד עקביות המחזור (cycle-consistency loss), אשר נקבע ל-10 במהלך האימון, בהתאם לניסוח המקורי של CycleGAN. ערך זה נבחר כדי לאזן בין הלמידה האדברסרית לבין עקביות השחזור בין דומיין המקור לדומיין היעד.

מודול השחזור של CycleGAN מורכב משני גנרטורים ושני דיסקרימינטורים עבור תרגום תמונות דו-כיווני. כל גנרטור עוקב אחר ארכיטקטורת רשת שאריות (residual-network) הכוללת שכבת קונבולוציה ראשונית של 7 × 7, ולאחריה שתי שכבות קונבולוציה של דגימה מוחדשת למטה (downsampling), תשעה בלוקים של שאריות ושתי שכבות דגימה מוחדשת למעלה (upsampling). כל פעולות הקונבולוציה משתמשות בגודל גרעין של 3 × 3, למעט שכבת הקלט, המשתמשת בגרעין של 7 × 7 להגברת חילוץ המאפיינים. נורמליזציית מופעים (Instance Normalization) מוחלת לאחר כל שכבת קונבולוציה לשיפור יציבות האימון, בעוד שפונקציית הפעלה מסוג ReLU משמשת לאורך רשת הגנרטור. שכבת הפלט משתמשת בפונקציית הפעלת Tanh כדי להפיק פלטי תמונות מנורמלים. הדיסקרימינטור עוקב אחר ארכיטקטורת PatchGAN של 70 × 70 המורכבת מסדרה של שכבות קונבולוציה עם גדלי גרעין של 4 × 4 וערוצי מאפיינים העולים בהדרגה. נורמליזציית מופעים והפעלת LeakyReLU (שיפוע שלילי = 0.2) מיושמות בדיסקרימינטור כדי לשפר את הבחנה בין מאפיינים ולמידה אדבסריאלית. מודול ה-CycleGAN מקבל תמונות של מוטיבים תרבותיים שעברו עיבוד מקדים כקלט ומייצר ייצוגי תבניות משוחזרים, אשר מועברים לאחר מכן ל-CAFFM לשילוב עם מאפייני סגמנטציה. אימון ה-CycleGAN בוצע באמצעות אופטימייזר Adam (β₁ = 0.5, β₂ = 0.999) עם קצב למידה ראשוני של 0.0002. קצב הלמידה נשמר במהלך 100 האיפוכות (epochs) הראשונות ולאחר מכן דעך באופן ליניארי לאפס לאורך תקופת האימון הנותרת. באפר השמעה (replay buffer) המכיל 50 תמונות שנוצרו בעבר שימש לייצוב אימון הדיסקרימינטור. הגנרטורים והדיסקרימינטורים עודכנו ביחס עדכון של 1:1, כאשר עדכון גנרטור אחד ה diikuti על ידי עדכון דיסקרימינטור אחד במהלך כל איטרציית אימון.

תהליך השחזור של ה-CycleGAN מבוסס על מפות התכונות המשופרות שהתקבלו באמצעות מנגנון ה-CAFFM ב-איור 5. מפות התכונות מכילות מוטיבים תרבותיים משופרים שהושגו משלבי הסגמנטציה וה-CAFFM הקודמים. מפות התכונות משמשות כקלט לגנרטור הראשון GE. הגנרטור הראשון GE לומד את המיפוי הנדרש לשחזור דפוסים תרבותיים. הפלטים מוזנים לאחר מכן לדיסקרימינטור DY כדי להבחין בין דפוסים תרבותיים אמיתיים לבין דפוסים משוחזרים. הדיסקרימינטור DY מסייע לגנרטור GE להפיק פלטים ריאליסטיים. כדי להבטיח שדפוסים תרבותיים לא יעוותו במהלך השחזור, הגנרטור השני FM מבצע מיפוי עקביות-מחזור (cycle-consistency mapping). הגנרטור השני FM ממפה את הפלטים חזרה לדומיין המקורי. הפלטים מוערכים לאחר מכן על ידי הדיסקרימינטור כדי להבטיח ריאליזם. הפלטים הסופיים מועברים לאחר מכן למודול ה-SPADE ליצירת סגנון אמנותי בשלב הבא של מסגרת ה-SegCycle-SPADE המוצעת.

תהליך שחזור תבניות, תרשים עם גנרטור G, דיסקרמינטור Dy, ובדיקת עקביות מחזורית.
איור 5. זרימת עבודה לשחזור תבניות מבוסס CycleGAN. זרימת העבודה של מודול השחזור של CycleGAN. ייצוגי מאפיינים מועצמי-קשב (Attention-enhanced) מסופקים כקלטים לרשת הגנרטור כדי לשחזר מוטיבים תרבותיים חסרים. הדיסקרמינטור מעריך את הפלטים המשוחזרים אל מול תבניות ייחוס, בעוד שמיפוי עקביות-מחזורית (cycle-consistency mapping) שומר על השלמות המבנית במהלך תרגום תמונות דו-כיווני. המוטיבים המשוחזרים מועברים לאחר מכן למודול SPADE לצורך סינתזת סגנון אמנותי. אנא לחץ כאן להצגת גרסה גדולה יותר של איור זה.

יצירת סגנון אמנותי באמצעות SPADE
בהמשך, המוטיבים התרבותיים המשוחזרים עוברים למודול ה-SPADE לצורך יצירת סגנון אמנותי. המטרה העיקרית של מודול ה-SPADE היא להוסיף מרקמים עשירים יותר מבחינה חזותית של סגנון אמנותי למוטיבים התרבותיים המשוחזרים, מבלי לפגוע בפריסה המבנית של המוטיבים. מודול ה-SPADE הוא טכניקה ליצירת תמונות מותנית המשתמשת במושג של סגמנטציית תמונות ליצירת תמונות. מפות סמנטיות רב-ערוציות, שהתאימו למחלקות מוטיבים שנקבעו מראש, קודדו ממסכות הסגמנטציה הסמנטית שהופקו על ידי SegFormer-B2. הגנרטור של SPADE קיבל מפות מקודדות אלו כקלטים מותנים. פרמטרי התיסגול המרחבי של קנה המידה (γ) וההטיה (β) הופקו על ידי עיבוד המפות הסמנטיות דרך שכבות קונבולוציה בתוך כל שכבת SPADE. כך היה הגנרטור מסוגל לשמר את גבולות המוטיבים, את הפריסות המבניות ואת המידע הסמנטי במהלך הסינתזה האמנותית, וזאת על ידי החלת פרמטרים אלה על הפעלות המאפיינים הנורמליות. ההנחיה הסמנטית יכלה להשפיע הן על השחזור המבני ברמה הגבוהה והן על סינתזת המרקם ברמה הנמוכה, מכיוון שתהליך ההתניה בוצע במספר שכבות של גנרטור ה-SPADE. כתוצאה מכך, הדפוסים האמנותיים שנוצרו שילבו מאפיינים סגנוניים שנרכשו ממאגר הנתונים WikiArt, תוך שמירה על מבני המוטיבים התרבותיים שנמצאו בשלב הסגמנטציה.

בסיס הנתונים WikiArt, הכולל יצירות מ-27 קטגוריות אמנותיות שונות — כגון רנסנס, אימפרסיוניזם, קוביזם, אקספרסיוניזם, סוריאליזם, ריאליזם ואמנות מופשטת — שימש כמשאב העיקרי להבנת סגנונות אמנותיים. כדי לחשוף את המודל למגוון מאפיינים יצירתיים ולשפר את ההכללה של הסגנונות, נבחרו תמונות סגנון באופן אקראי מהקטגוריות השונות במהלך האימון. בסיס הנתונים חולק לתתי-קבוצות של אימון, תיקוף ובדיקה עם ייצוג מאוזן של הקטגוריות האמנותיות כדי לצמצם הטיות סגנוניות. כדי להבטיח ייצוג מאוזן של כל 27 הקטגוריות האמנותיות, נעשה שימוש בדגימה מוקצית (stratified sampling). דגימות מכל קטגוריה הוקצו באופן פרופורציונלי לתתי-קבוצות האימון, התיקוף והבדיקה תוך שמירה על התפלגות המחלקות המקורית. מודול ה-CAFFM שימש למיזוג היבטי הסגנון שהופקו מתמונות WikiArt עם מאפייני השחזור שיוצרו על ידי CycleGAN. כדי לאפשר לרשת הסינתזה להעביר תכונות אמנותיות תוך שמירה על המבנה הסמנטי וגבולות המוטיבים התרבותיים שנגזרו ממפות הסגמנטציה, הייצוגים הממוזגים שהתקבלו סופקו כמידע התניה (conditioning information) לגנרטור ה-SPADE. בזכות טכניקת התניית סגנון זו, המסגרת המוצעת הייתה מסוגלת להפיק דפוסים אמנותיים אותנטיים תרבותית עם ייצוגים מבניים וסגנוניים עקביים.

SPADE מציגה גם פרמטרים 적דפטיביים מרחביים התלויים במפת הסגמנטציה. ניתן להגדיר את הפרמטרים כפי שמוצג ב- משוואה 191:

y = γ(S)x̂ + β(S), משוואה.

כאן, γ(S) הוא פרמטר קנה המידה המשתנה מרחבית ו-β(S) הוא פרמטר ההטיה המשתנה מרחבית. הפרמטרים יכולים לסייע למחולל ליצור טקסטורות וסגנונות שונים בהתאם לאזור הסמנטי בתמונות. ניתן להגדיר את היצירה התרבותית הסופית כפי שמוצג ב-משוואה 20:

 דיאגרמת המשוואה הכללית, I_gen = G_E(X^P_r, SM), המוצגת עבור מידול מתמטי.

כאן, GE הוא מחולל ה-SPADE, XrP הוא התבנית המשוחזרת, ו-SM הוא מפת הסגמנטציה. היצירה הסופית שומרת על השלמות המבנית של מוטיבים תרבותיים תוך שיפור המראה האמנותי. פונקציית אובדן מורכבת, המאזנת בין דיוק סגמנטציה סמנטית, שימור מוטיבים תרבותיים, איכות שחזור התבנית ועקביות סגנונית אמנותית, שימשה לאופטימיזציה של ארכיטקטורת ה-SegCycle-SPADE המוצעת. תערובת משוקללת של אובדן סגמנטציה (Lseg), אובדן אדברסרי (Ladv), אובדן עקביות מחזורית (Lcycle), אובדן שחזור (Lrecon), אובדן שימור מוטיבים (Lmotif) ואובדן עקביות סגנונית (Lstyle) שימשה לקביעת יעד האימון הכולל. פונקציית האובדן הכוללת מוגדרת במשוואה 21:

נוסחת משוואת ההפסד הכולל בלמידת מכונה, במונחי סגמנטציה ושחזור.  (21)

על מנת להבטיח עקביות מבנית בין המוטיבים התרבותיים שנקלטו לאלה ששוחזרו, מקדם הפסד עקביות-המחזור (cycle-consistency loss) נקבע ל-10. כדי לשמר מאפייני מוטיב עדינים ולהגביר את הדיוק הוויזואלי, מקדם הפסד השחזור נקבע ל-5. כדי להדגיש את השימור של תבניות מבניות חיוניות תרבותית במהלך הסינתזה האמנותית, נעשה שימוש במקדם של 2 עבור הפסד שימור-המוטיב (motif-preservation loss). על מנת לקדם העברת סגנון אמנותי מבלי לעוות יתר על המידה את המבנים הסמנטיים של המוטיבים, מקדם הפסד עקביות-הסגנון (style-consistency loss) הותאם ל-1. כדי לשמור על תרומה מאוזנת בין הפקת תמונה ריאליסטית לבין סגמנטציה מדויקת של המוטיבים, ניתןו משקולות שוות להפסדי הסגמנטציה וההפסדים האדברסריים (adversarial losses). ייצוגי הסגנון מבוססי-המאפיינים של מאגר הנתונים WikiArt שימשו לחישוב הפסד עקביות-הסגנון. בפרט, מאפייני סגנון אמנותי נלכדו באמצעות קורלציות של מטריצת Gram שנלקחו ממפות מאפיינים עמוקות. ההבדל בנורמת פרובניוס (Frobenius norm) בין מטריצות ה-Gram של תמונת סגנון המטרה לבין התמונה הנוצרת שימש לחישוב הפסד הסגנון, כפי שמוצג ב-משוואה 22:

משוואת הפסד סגנון, \(L_{\text{style}}\), המשמשת בניתוח נוסחאות של רשתות עצביות ולמידה עמוקה.

כאן, Gl היא מטריצת גראם (Gram matrix) שחושבה משכבת התכונות ה-lth, Igen מייצגת את התמונה האמנותית הנוצרת, Istyle מייצגת את תמונת הסגנון המטרה ממאגר הנתונים WikiArt, ו-F מייצגת את נורמת פרובניוס (Frobenius norm). ניסוח זה מאפשר למסגרת המוצעת לשמר מאפיינים אמנותיים תוך שמירה על השלמות המבנית והסמנטית של מוטיבים תרבותיים.

ייצוגי המאפיינים הממוזגים המופקים על ידי מודול ה-CAFFM משמשים כקלטים להתניה (conditioning inputs) עבור מודול ה-SPADE, המשמש כרכיב הסינתזה האמנותית של המסגרת המוצעת. מחולל ה-SPADE מורכב משבעה בלוקים שיוריים (residual blocks) של SPADE עם ממד מאפיינים חבוי של 256 ערוצים, ומפיק תמונות פלט ברזולוציה של 256 × 256 פיקסלים. מפות סגמנטציה סמנטית המתקבלות ממודול ה-SegFormer–CAFFM משמשות כקלטים להתניה לאורך השכבות השיוריות של ה-SPADE. שכבות SPADE מיושמות לפני פונקציות ההפעלה בתוך כל בלוק שיורי, מה שמאפשר התניה סמנטית מונחית-סגמנטציה. באמצעות פעולות דגימה כלפי מעלה (upsampling) וקונבולוציה רצופות, ייצוג המאפיינים החבוי עובר עידון הדרגתי כדי להפיק דפוסים אמנותיים ברזולוציה גבוהה תוך שמירה על עקביות סמנטית ומבנה המוטיב. פונקציות הפעלה מסוג LeakyReLU משמשות לאורך המחולל, ופונקציית הפעלה מסוג Tanh מיושמת בשכבת הפלט כדי להפיק תמונות מנורמלות.

אלגוריתם וזרימת עבודה
מסגרת SegCycle-SPADE משלבת סגמנטציה סמנטית, מיזוג מאפיינים, שחזור תבניות וסינתזה של סגנון אמנותי בתוך צינור אימון מאוחד. זרימת העבודה מתחילה ברכישת מערך נתונים ובעיבוד מקדמי, הכוללים שינוי גודל תמונות, נורמליזציה, הסרת רעשים והכנת מסכות סגמנטציה. תמונות שעברו עיבוד מקדמי מעובדות לאחר מכן באמצעות רשת הסגמנטציה SegFormer-B2 כדי לחלץ ייצוגים של מוטיבים סמנטיים. מאפייני הסגמנטציה המתקבלים ממוזגים עם מאפייני שחזור באמצעות ה-CAFFM, מה שמאפשר אינטראקציה בין מידע על מוטיבים מבניים לבין ייצוגי מאפיינים אמנותיים. מפות המאפיינים הממוזגות מסופקות לאחר מכן למודול השחזור CycleGAN, המשחזר מבני מוטיבים תרבותיים לא שלמים תוך שמירה על עקביות סמנטית. התבניות המשוחזרות מועברות לאחר מכן למחולל ה-SPADE לסינתזה אמנותית מונחית-סגמנטציה, המאפשרת שיפור סגנוני תוך שמירה על גבולות המוטיב ואותנטיות מבנית. במהלך האימון, פרמטרי המודל מותאמים באמצעות פונקציית ההפסד המורכבת המתוארת במשוואות 21 ו-22, המאזנת בין דיוק הסגמנטציה, שימור המוטיב, איכות השחזור ועקביות הסגנון האמנותי. זרימת עבודה מפורטת ליישום שלב-אחר-שלב, הכוללת טעינת מערך נתונים, עיבוד מקדמי, אתחול מודל, איטרציות אימון, נהלי תיקוף, בחירת נקודות בקרה (checkpoints) והערכה סופית, מופיעה בקובץ משלים 1 (אלגוריתם 1). זרימת העבודה האלגוריתמית המלאה יושמה עם batch size של 16, קצב למידה של 0.0002 ו-100 תקופות אימון (epochs). גרעין אקראי קבוע של 42 שימש לחלוקת מערך הנתונים, לאתחול המודל ולכל ניסויי האימון. הגרעין הוחל באופן עקבי על מחוללי המספרים האקראיים של Python, NumPy ו-PyTorch כדי להבטיח שחזוריות. האופטימייזר Adam הוגדר עם β₁ = 0.5, β₂ = 0.999 וללא weight decay (weight decay = 0). נקודות בקרה של המודל נבחרו על בסיס ציון ה-IoU הגבוה ביותר שהושג במערך הנתונים לתיקוף.

אופטימיזציה של פונקציית ההפסד
כדי לשמר מבני מוטיבים תרבותיים במהלך השחזור והסינתזה האמנותית, המסגרת המוצעת משתמשת ביעד אופטימיזציה מורכב המשלב הפסדי סגמנטציה, הפסדים אדברסריים, עקביות מחזורית (cycle-consistency), שחזור, שימור מוטיבים ועקביות סגנונית. הניסוח המתמטי המלא, מקדמי השקלול והגדרת הפסד הסגנון מופיעים במשוואות 21 ו-22 בתוך תת-הסעיף Artistic Style Generation using SPADE. רכיב שימור המוטיבים מעניש סטיות מבניות בין אזורי המוטיבים שנחזו לבין מסכות הסגמנטציה של ה-ground-truth התואמות, ובכך מעודד שימור של מבני תבניות בעלי חשיבות תרבותית לאורך תהליך השחזור.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

מסגרת ה-SegCycle-SPADE המוצעת הוערכה באמצעות שני מערכי נתונים: מערך נתוני מוטיבים תרבותיים של Miao Batik ומערך נתוני WikiArt. מערך הנתונים של Miao Batik מכיל תמונות של מורשת תרבותית מסורתית ושימש בעיקר למשימות של סגמנטציה סמנטית ושחזור מבני, בעוד שמערך הנתונים של WikiArt מכיל סגנונות אמנותיים מגוונים ושימש ללמידה ולהפקה של סגנון אמנותי. תמונות משני מערכי הנתונים עובדו דרך צינור העבודה השלם של SegCycle-SPADE, הכולל סגמנטציה סמנטית, CAFFM, שחזור דפוסים והפקה של סגנון אמנותי מבוססת SPADE. השילוב של מידע על מוטיבים תרבותיים ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

השימור והשחזור הדיגיטלי של דגמי ICH זכו לתשומת לב גוברת בשנים האחרונות בשל האובדן ההדרגתי של מלאכות מסורתיות. מחקרים קודמים ניסו לטפל באובדן המורשת התרבותית באמצעות טכניקות עיבוד תמונה מבוססות DL. לדוגמה, Quan et al.32 הציעו מסגרת לשימור מורשת תרבותית המבוססת על גרפי ידע ו-DL עבור תרבות הבאטיק של מיאו בְּ-Guizhou. למרות שהמחקר התמקד בשחזור דיגיטלי של דגמים תרבותיים, המתודולוגיה שלו הייתה תלויה בעיקר בייצוגים של גרפי ידע. באופן דומה, Fu ו-Razmjooy16 הציעו מסגרת המבוססת על רש...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

ניגוד עניינים:
המחברים מצהירים כי אין להם ניגודי אינטרסים.

תודות

המחברים מודים על התמיכה האקדמית והמוסדית שניתנה על ידי Guangdong Engineering Polytechnic ו-South China Normal University במהלך השלמת מחקר זה. מחקר זה נתמך על ידי הפרויקט הכללי של הקרן הלאומית למדעי החברה לשנת 2023 (מס' 23BH161), תחת הכותרת “Digital Regeneration Museum: Research on the Activation and Communication of Chinese Classic Calligraphy and Painting Cultural Relics.”

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Adam Optimizerספריית האופטימיזציה של PyTorchAdamאלגוריתם אופטימיזציה המשמש במהלך אימון המודל.
CUDA ToolkitNVIDIA CorporationCUDA 11.3האצת GPU לחישובים של למידה עמוקה.
cuDNNNVIDIA CorporationcuDNN 8.2ספריית האצה לרשתות עצביות עמוקות המשמשת להאצת אימון והסקה (inference).
CycleGANUniversity of California, Berkeley / קוד פתוחמימוש רשמי של PyTorch (https://github.com/junyanz/pytorch-CycleGAN-and-pix2pix)רשת יריב יוצרת (generative adversarial network) המשמשת לשחזור מוטיבים תרבותיים.
משקולות מאומנות של ImageNetImageNet / קוד פתוחmit_b2.pth (נקודת ביקורת מאומנת של ImageNet-1K)משמש לאתחול של שלד ה-SegFormer-B2 לפני כוונון עדין (fine-tuning) על מערך נתוני ה-Miao Batik.
מעבד IntelIntel CorporationIntel Core i7 (דור 11)CPU המשמש לעיבוד מקדים של תמונות, תמיכה באימון מודלים והסקה.
Matplotlibצוות הפיתוח של MatplotlibMatplotlib 3.5.1ויזואליזציה של עקומות אימון ותוצאות הערכה.
מערך נתוני Miao Batikמאגר ZenodoDOI: 10.5281/zenodo.20807658מערך נתוני מוטיבים תרבותיים המכיל 15,148 תמונות המשמשות לסגמנטציה סמנטית ושחזור תבניות.
NumPyמפתחי NumPyNumPy 1.21.5חישוב נומרי ועיבוד מערכי נתונים.
NVIDIA GPUNVIDIA CorporationNVIDIA RTX 3090 (24 GB VRAM)פלטפורמת חומרה המשמשת לאימון מודלים והסקה.
OpenCVOpenCV FoundationOpenCV 4.5.5עיבוד מקדים של תמונות, שינוי גודל, אינטרפולציה וניקוי רעשים גאוסיאני.
מערכת הפעלהCanonical Ltd.Ubuntu 20.04 LTSסביבת ביצוע ניסיונית.
Pillow (PIL)Python Imaging LibraryPillow 8.4.0טעינה ומניפולציה של תמונות.
PythonPython Software FoundationPython 3.8.10שפת תכנות המשמשת למימוש ולניסויים.
PyTorchMeta AIPyTorch 1.10.0מסגרת למידה עמוקה המשמשת לאימון מודלים והסקה.
גרעין אקראי (Random Seed)הגדרה ניסיונית42גרעין קבוע המשמש לחלוקת מערך הנתונים, אתחול מודלים ושחזור ניסיוני.
Scikit-learnמפתחי Scikit-learnScikit-learn 1.0.2חלוקת מערכי נתונים, ניתוח סטטיסטי ומדדי הערכה.
Seabornקהילת קוד פתוחSeaborn 0.11.2ויזואליזציה של נתונים סטטיסטיים.
SegFormer-B2NVIDIA Research / קוד פתוחSegFormer-B2 (שלד MIT-B2)מודל סגמנטציה סמנטית מבוסס Transformer המשמש לסגמנטציה של מוטיבים תרבותיים.
מסכות סגמנטציה / הערות (Annotations)מערך נתוני Miao Batikכלול במערך הנתוניםתוויות סגמנטציה סמנטית ברמת פיקסל המשמשות לסיווג מוטיבים ואימון.
SPADENVIDIA Research / קוד פתוחמימוש רשמי של PyTorch (https://github.com/NVlabs/SPADE)מודל סינתזה של תמונות מונחה-סגמנטציה המשמש ליצירת תבניות אמנותיות.
TorchVisionMeta AITorchVision 0.11.1כלי עיבוד תמונות והתמרות מערכי נתונים המשמשים עם PyTorch.
מערך נתוני WikiArtWikiArthttps://www.wikiart.org/מערך נתוני סגנונות אמנותיים המכיל יותר מ-80,000 יצירות אמנות ב-27 סגנונות אמנותיים, המשמש ללמידה וסינתזה של סגנונות.

מקורות

  1. Huang B, Mo L. SegCycle-SPADE: An end-to-end framework for semantic segmentation-based automated extraction and artistic reconstruction of traditional craft patterns using conditional GAN. PLoS ONE. 2025;20:e0329100.
  2. Yan Z, et al. Digital sustainability of heritage: Exploring indicators affecting the effectiveness of digital dissemination of intangible cultural heritage through qualitative interviews. Sustainability. 2025;17:1593.
  3. Yan Z, et al. Construction of digital dissemination effects evaluation indicator system of traditional techniques of intangible cultural heritage. npj Heritage Science. 2025;13:224.
  4. Imon SS. Intangible cultural heritage as a tourism product in the historic city of Macao. In: Sustainable Management of Historic Settlements in Asia: Role of Intangible Cultural Heritage. Springer Nature Singapore; Singapore. 2025. p.233-240.
  5. Buragohain D, et al. Digitalizing cultural heritage through metaverse applications: Challenges, opportunities, and strategies. Heritage Science. 2024;12:295.
  6. Ma Y. The ghostly ethics of mediatized shaping: Cultural memory creative transformation of Anhui’s ICH in reviving the craftsmanship. Journal of Current Social Issues Studies. 2025;2:240-249.
  7. Wanju T, Wang Z, Tu Y. ICH and e-commerce: Bridging tradition and modernity in cultural creative products. Journal of Economics, Management and Trade. 2025;31:1-8.
  8. Sun L, et al. Research on the redesign of China’s intangible cultural heritage based on sustainable livelihood—The case of Luanzhou shadow play empowering rural development. Sustainability. 2024;16:4555.
  9. Pan S, et al. Constructing a sustainable evaluation framework for AIGC technology in Yixing Zisha pottery: Balancing heritage preservation and innovation. Sustainability. 2025;17:910.
  10. Na Z, Sharul Azim SR. Research on innovative development of Miao embroidery intangible cultural heritage in Guizhou, China based on digital design. Journal of Business and Economic Review. 2024;9:85-94.
  11. Guo S, Canessa A. Ethnic elder poverty: Miao household livelihoods and elderly self-sufficiency practices in Midwest China. Culture, Agriculture, Food and Environment. 2023;45:55-68.
  12. Han D, Cong L. Miao traditional patterns: The origins and design transformation. Visual Studies. 2023;38:425-432.
  13. Dong B, et al. Spatial distribution and tourism competition of intangible cultural heritage: Take Guizhou, China as an example. Heritage Science. 2023;11:64-80.
  14. Chen Z, Ren X, Zhang Z. Cultural heritage as rural economic development: Batik production amongst China’s Miao population. Journal of Rural Studies. 2021;81:182-193.
  15. Zhennan LY, Yahaya SR. An aesthetic study on traditional batik design of Miao ethnicity in China. Kupas Seni. 2021;9:12-25.
  16. Fu X, Razmjooy N. Preserving and enhancing cultural heritage through art design using feature pyramid network optimized by modified builder optimization algorithm. Scientific Reports. 2025;15:42603.
  17. Liu X, Wan J, Wang N. Ancient painting inpainting with regional attention-style transfer and global context perception. Applied Sciences. 2024;14:8777.
  18. Xu Q, Iwasaki M. Image restoration model of wood-structured raw lacquer cultural relics based on diffusion generation network. Journal of Asian Architecture and Building Engineering. 2025:1-19.
  19. Cherian A, Sullivan A. Sem-GAN: Semantically-consistent image-to-image translation [conference presentation]. Presented at: IEEE Winter Conference on Applications of Computer Vision (WACV); 2019. doi: 10.1109/WACV.2019.00196.
  20. Rombach R, et al. High-resolution image synthesis with latent diffusion models [conference presentation]. Presented at: IEEE/CVF Conference on Computer Vision and Pattern Recognition (CVPR); 2022. p.10684-10695. Available from: http://openaccess.thecvf.com/content/CVPR2022/papers/Rombach_High-Resolution_Image_Synthesis_With_Latent_Diffusion_Models_CVPR_2022_paper.pdf.
  21. Gendy GGH, Nabil S. Diffusion models for image super-resolution: State-of-the-art and future directions. Neurocomputing. 2025;617:128911.
  22. Kazerouni A, et al. Diffusion models in medical imaging: A comprehensive survey. Medical Image Analysis. 2023;88:102846.
  23. Yang L, et al. Diffusion models: A comprehensive survey of methods and applications. ACM Computing Surveys. 2023;56:1-39.
  24. Croitoru FA, Hondru V, Ionescu RT, Shah M. Diffusion models in vision: A survey. IEEE Transactions on Pattern Analysis and Machine Intelligence. 2023;45:10850-10869.
  25. Cao H, et al. A survey on generative diffusion models. IEEE Transactions on Knowledge and Data Engineering. 2024;36:2814-2830.
  26. Po R, et al. State of the art on diffusion models for visual computing. Computer Graphics Forum. 2024;43:e15063.
  27. Thampanichwat C, et al. Mindful architecture from text-to-image AI perspectives: A case study of DALL-E, Midjourney, and Stable Diffusion. Buildings. 2025;15:972.
  28. Li W. Enhanced automated art curation using supervised modified CNN for art style classification. Scientific Reports. 2025;15:7319.
  29. Chen C. Algorithm and tool development for creative generation of graphic design of folk houses and ancient buildings integrating cultural and creative elements. Scalable Computing: Practice and Experience. 2024;25:4729-4736.
  30. Liu B, Ji J, Gu L, Jiang Z. An integrated CycleGAN-diffusion approach for realistic image generation [conference presentation]. Presented at: International Conference on Signal Processing and Machine Learning; 2024. p.92-101. doi: 10.1117/12.3027121.
  31. Bao Q, Zhao J, Liu Z, Liang N. AI-assisted inheritance of Qinghua porcelain cultural genes and sustainable design using low-rank adaptation and stable diffusion. Electronics. 2025;14:725.
  32. Quan H, et al. Protection of Guizhou Miao batik culture based on knowledge graph and deep learning. Heritage Science. 2024;12:1-22.
  33. Sun H, et al. HRPGAN: A GAN-based model to generate high-resolution remote sensing images. IOP Conference Series: Earth and Environmental Science. 2020;428:012060.
  34. Ho J, Jain A, Abbeel P. Denoising diffusion probabilistic models [conference presentation]. Presented at: Advances in Neural Information Processing Systems (NeurIPS); 2020. Available from: https://proceedings.neurips.cc/paper/2020/file/4c5bcfec8584af0d967f1ab10179ca4b-Paper.pdf.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

תגיות

SegCycle SPADESegFormerCycleGANSpatially Adaptive Denormalization