מאמר מחקר

מיפוי חזותי של מאפייני רגש רב-מודאליים לעיצוב אינטראקציה חכמה

DOI:

10.3791/71171

21 באוגוסט 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

העבודה מציעה מסגרת מקצה לקצה לניתוח רגשות רב-מודאלי, המנצלת מקודדי transformer, ייצוגי רגשות מופרדים (disentangled) ותשומת לב חוצת-מודאליות מבוססת גרפים עם מיפוי חזותי, במטרה לשפר את דיוק זיהוי הרגשות בשני מאגרי נתונים.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מיפוי חזותי של מאפייני רגש רב-מודאליים הוא חיוני לתכנון ממשקים חכמים, שכן הוא מאפשר למכונות להבין, לפרש ולהגיב למצבים רגשיים אנושיים. עם זאת, אלגוריתמים נוכחיים לזיהוי רגשות רב-מודאליים מתמקדים בעיקר בביצועים חיזויים, ומספקים תובנות מועטות לגבי יכולת הפרשנות, מודעות לאינטראקציה או אינטראקציות בין-מודאליות ברמת המאפיינים. עבודה זו הציגה מסגרת למיפוי חזותי של היבטי רגש רב-מודאליים המשלבת ויזואליזציה מכוונת-אינטראקציה, למידת ייצוג ניתנת לפרשנות וחיזוי רגשות. ללא שימוש במאפיינים שנוצרו ידנית, נעשה שימוש במקודדים מבוססי transformer כדי לחלץ שימועים (embeddings) רגשיים ברמה גבוהה ממודליות טקסטואליות, קוליות וחזותיות. כדי לשפר את החסינות, מידע ספציפי לרגש ומידע ספציפי למודליות הופרדו באמצעות טכניקה של למידת ייצוג מופרדת (disentangled representation learning). בנוסף, פותחה רשת קשב בין-מודאלית מבוססת גרף כדי להשתמש בשקלול קשב אדפטיבי לצורך סימולציה של קשרים רגשיים עדינים בין המודליות. מודול מיפוי חזותי רב-מבטי פותח כדי לתאר מסלולי רגש זמניים, התפלגויות קשב בין-מודאליות ושימועים רגשיים חבויים במטרה לשפר את השקיפות. מאגר הנתונים Multimodal Opinion Sentiment and Emotion Intensity (CMU-MOSEI) של אוניברסיטת קרנגי מלון ומאגר הנתונים הסיני לניתוח סנטימנט רב-מודאלי (CH-SIMS) שימשו להערכת המסגרת המוצעת. על פי תוצאות ניסיוניות, המסגרת המוצעת סיפקה יכולת פרשנות משופרת ברמת המאפיינים וויזואליזציה מודעת-אינטראקציה, תוך שהיא עולה בעקביות בביצועיה על טכניקות בסיס מייצגות במונחים של דיוק, F1-score, מתאם וטעות מוחלטת ממוצעת. בנוסף, מודול המיפוי החזותי סייע בפרשנות איכותנית של ייצוגי רגש רב-מודאליים, אינטראקציות בין-מודאליות ודינמיקה רגשית זמנית, ובכך תמך בויזואליזציה ובניתוח מודעים-אינטראקציה.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

היכולת לזהות ולהבין נכונה רגשות אנושיים הפכה למכריעה לשיפור האינטראקציה בין בני אדם למכונות. בנוסף להיותו חיוני לשיפור האינטראקציה בין אדם למחשב, לניתוח רגשות יש פוטנציאל לחולל מהפכה במספר תחומים, כולל אבחון רפואי טרום-דיאגנוסטי1, ניתוח התנהגותי בכיתות לימוד2, מעקב פסיכולוגי אחר מטופלים3, זיהוי עייפות בכלי רכב4, וניהול חכם בסביבות בית חכם5. התפתחויות אחרונות במחשוב רגשי (affective computing) ובלמידה עמוקה6 הגבירו את העניין ביצירת מערכות בזמן אמת המסוגלות ללכוד את המורכבות של הרגש האנושי.

שיטות רבות כיום מסתמכות בעיקר על נתונים חד-מודאליים (unimodal), כגון סימנים טקסטואליים, גרפיים או שמיעתיים7,8,9. גישות אלו נכשלות שוב ושוב בזיהוי אותות מעודנים, כגון סרקזם או ניואנסים תלויי-הקשר. המחקר עבר להערכת רגשות רב-מודאלית (multimodal), המשלבת נתונים משלימים ממקורות מרובים כדי להתגבר על מגבלות אלו10,11,12. היתרונות של מיזוג מודאליות מרובות הודגמו על ידי מודלי בסיס כגון early fusion-long short-term memory (EF-LSTM)13, רשתות עצביות עמוקות מסוג light and FM (LF-DNN)14, רשתות tensor fusion (TFN), וגישות מיזוג רב-מודאליות בדרגה נמוכה (low-rank). עם זאת, רוב הגישות הללו מסתמכות על יצירת מאפיינים במצב לא מקוון (offline) ואינן מתאימות למצבים דינמיים בעולם האמיתי.

על מנת להכיל מצבים רגשיים, מחקרי ויישומי זיהוי רגשות רב-מודאליים גדלו במהלך עשר השנים האחרונות15. אחד מתחומי המחקר המאתגרים והמשמעותיים ביותר כיום הוא ניטור רציף של מצבים רגשיים באמצעות מגוון מקורות נתונים16. הרעיון של רב-מודאליות הופיע באופן טבעי למדי עם עלייתם של מערכות ידע מגוונות שכאלה, והוא הוביל להתקדמויות רבות ביישום רגשות בתחומים כגון מחשוב רגשי, אינטראקציית אדם-מחשב (HCI), למידה, משחקי וידאו, שירות לקוחות, טיפול רפואי, הערכת חווית משתמש (UX) ועוד. עם זאת, לא תמיד היה פשוט ליישם טכניקות לזיהוי רגשות בהערכת UX.

אחת הסיבות העיקריות להתמקדות בזיהוי רב-מודאלי (multimodal) במקום בשיטות חד-מודאליות היא החסרונות המובנים בהסתמכות על מקור מידע יחיד. מערכות לזיהוי רגשות חד-מודאליות עלולות לסבול מדיוק נמוך יותר עקב נתונים חסרים או לא ברורים, בעוד שסכמות MER הן אמינות יותר ומציעות הבנה מקיפה ומעמיקה יותר של מצבים הבעתיים על ידי שילוב של מספר מקורות נתונים17. לדוגמה, שפת פנים לבדה עשויה שלא להספיק כדי לסווג רגשות בצורה מדויקת, במיוחד כאשר המחוות מורכבות או לא ברורות. עם זאת, שילוב של הבעות פנים עם צורות תקשורת אחרות, כגון שפה או רמזים פיזיים, עשוי להעלות את רמת הדיוק בזיהוי הרגשות.

מחקרים נרחבים על זיהוי רגשות נערכו במספר מודליות. מחקרים מוקדמים התמקדו בזיהוי מאפיינים מבדילים ממודליות שונות, כגון קלט גרפי, אקוסטי או מבוסס טקסט. עם זאת, הולך ומתברר ששילוב של מודליות שונות יכול לספק מידע רגשי מאוזן, המוביל לזיהוי סנטימנט מהימן ומדויק יותר. חלק זה סוקר התקדמויות מרכזיות בניתוח רגשות במודליות בודדות ובניתוח רב-מודלי, תוך התמקדות בגישות הבסיס, בחסרונותיהן ובנימוקים לשיטה שלנו.

המחקר הראשוני על זיהוי רגשות התמקד בעיקר במודאליות אחת. בתחום הראייתי, מחקר פורץ דרך הוביל לסיווג של תנועות פנים פרוטוטיפיות20. התקדמויות מאוחרות יותר כללו טכניקות ללכידת דינמיקה זמנית, כגון תנועה חזותית21 ומודלי מרקוב חבויים22, בעוד שתגובות פנים חולקו ליחידות פעולה באמצעות מערכת קידוד פעולות פנים (FACS)23. רשתות LSTM ורשתות נוירונים קונבולוציוניות (CNNs) שימשו בהצלחה להפקת מאפיינים משמעותיים ישירות מאותות שמע גולמיים; מתודולוגיות לזיהוי רגשות מבוסס שמע התקדמו מעיבוד אותות קונבנציונלי ללמידה עמוקה24. הפקת אותות סנטימנטים הקשריים בניתוח רגשות מבוסס טקסט שופרה משמעותית על ידי רשתות נוירונים רקורסיביות (RNNs) המשלבות מנגנוני קשב, ולאחרונה, על ידי מודלים מבוססי Transformer. למרות הישגיהן, טכניקות של מודאליות אחת אינן מסוגלות מטבען לייצג במדויק את המורכבויות שבני האדם חווים, כיוון שחסר להן המידע המשלים שנמצא במודאליות אחרות.

מספר מודלים המבוססים על מנגנוני קשב (attention mechanism), כגון מודל DialogXL25, הוצעו בשנת 2021 כדי לאסוף נתונים סביבתיים לטווח ארוך יותר בתחום זיהוי סנטימנט בשיחות. Kim et al.26 הציגו בשנת 2021 את מודל EmoBERTa במטרה להגביר את הדיוק של ERC. מודל זה משתמש בנתוני הדוברים כדי לשפר את מאפייני הדוברים בשיחות ואת האינטראקציות שלהם זה עם זה. בשנת 2022, Li et al.27 הציגו את שיטת CoG-BART. שיטה זו משתמשת בלמידה ניגודית מונחית (supervised contrastive learning) כדי לשפר את יכולתו של המודל לפרש נתונים רלוונטיים. יש לציין כי למידה מונחית דורשת כמות ניכרת של נתונים מתויגים.

דוגמה טיפוסית לעבודה מסוג זה היא מסגרת ה-Multimodal Interaction-Aware Representation (MIAR)28, המשתמשת בטוקנים של אינטראקציית מאפיינים וביישור ניגודי (contrastive alignment) כדי לשפר את ההכללה בין מודליות שונות. MIAR משפרת את יישור המודליות ומשיגה ביצועים חזקים במספר מערכי נתונים; עם זאת, היא מתמקדת בעיקר בדיוק חיזוי מבלי להתייחס למיפוי חזותי. באופן דומה, מודל ה-Cross-Attentional Audio-Visual Fusion29 לוכד ביעילות אינטראקציות אודיו-ויזואליות ברזולוציה גבוהה לצורך חיזוי ערות (arousal) וולנס (valence), אך הוא מוגבל לשתי מודליות וחסר יכולות ויזואליזציה. גישות למידול זמני המבוססות על רשתות LSTM ומיזוג אוטואנקודר לוכדות בהצלחה את הדינמיקה הזמנית של רגשות, אך מספקות תובנה מוגבלת לגבי אינטראקציות בין מודליות והייצוגים הרגשיים שנלמדו. לאחרונה, שיטות מבוססות טרנספורמר, כגון ה-Transformer-based Multimodal Fusion Network (TMFN)30, הדגימו ביצועים חזקים ב-CMU-MOSI וב-CMU-MOSEI באמצעות מיזוג רב-מודלי משופר ולמידה ניגודית. עם זאת, גישות אלו נותרות בעיקר מונעות ביצועים ומספקות תמיכה מוגבלת ביכולת הסבר (explainability), פרשנות ברמת המאפיין וויזואליזציה מוכוונת-אינטראקציה.

כדי לשפר את השילוב של נתונים טקסטואליים, אקוסטיים וויזואליים, הוצעו מספר טכניקות לזיהוי רגשות רב-מודאלי (multimodal). למרות שלא הצליחו ללכוד אינטראקציות מורכבות בין מודאליות שונות, טכניקות מיזוג מוקדם כגון EF-LSTM ו-LF-DNN הדגימו את היתרונות של שימוש במידע רב-מודאלי לצורך ניתוח סנטימנט ורגשות. אף על פי שה-TFN שיפר את הביצועים במאגרי נתונים סטנדרטיים כגון CMU-MOSI ו-CMU-MOSEI והציג מידול מפורש של אינטראקציות בין-מודאליות, הפרשנות המוגבלת שלו והמורכבות החישובית הגבוהה עיכבו את יעילותו. כדי לשפר את היישור בין המודאליות (modality alignment) ואת מיזוג התכונות הדינמי, טכניקות מודרניות יותר כגון MIAR, מודלי מיזוג בעלי תשומת לב צולבת (cross-attentional fusion), TMFN וטרנספורמרים רב-מודאליים אדפטיביים השתמשו בטופולוגיות של טרנספורמר ובמנגנוני קשב (attention mechanisms). שיטות אלו התמקדו בעיקר בביצועים חיזויים, והעניקו תובנות מועטות לגבי ייצוגים רגשיים ברמת התכונה ותלויות בין-מודאליות, וזאת למרות השגתן תוצאות תחרותיות במדדי הערכה נפוצים כגון accuracy, F1-score ו-mean absolute error. יתרה מכך, מחקרים מעטים ביססו טכניקות ויזואליזציה שיכולות לחשוף קידודי רגש חבויים (latent emotion embeddings), התפלגויות קשב ודינמיקה רגשית זמנית, או שילבו מידול מבוסס גרפים של אינטראקציות בין-מודאליות. הגישה המוצעת משלבת מיפוי ויזואלי רב-מבטי, מיזוג קשב צולב מבוסס גרפים ולמידת ייצוג מופרדת (disentangled representation learning) כדי להתגבר על חסרונות אלו ולשפר את ביצועי זיהוי הרגשות הרב-מודאלי.

בדומה לכך, ה-Adaptive Multimodal Transformer32 מציע מיזוג מבוסס-החלפה כדי למתן באופן אדפטיבי מידע מודאלי רועש או חסר, ובכך לשפר את ביצועי סיווג הסנטימנט. למרות שגישה זו יכולה לטפל ביעילות בפערים בהפצה של המידע המודאלי, תכנונה ספציפי למשימה של ניתוח סנטימנט והיא מספקת תובנה מוגבלת לגבי הייצוגים הרגשיים שנלמדו. תרומה משמעותית נוספת היא ה-Multimodal Fusion Model33, המשלב רשתות CNN, רשתות LSTM כפליות ומנגנוני קשב מבוססי-טרנספורמר לזיהוי רגשות מולטי-מודאלי בזמן אמת. המודל מבצע מיזוג מלא של מודליות וידאו, אודיו וטקסט ומראה ביצועי זיהוי חסונים. עם זאת, בדומה למודלים קיימים אחרים, הוא מתמקד בעיקר בדיוק החיזוי וחסר מאפיינים מפורשים לוויזואליזציה וליכולת פירוש המכוונת לאינטראקציה.

לסיכום, בעוד שגישות עדכניות לזיהוי רגשות רב-מודאלי השיגו הצלחה ניכרת בלכידת אינטראקציות בין-מודאליות ובשיפור דיוק התחזיות, רובן מתמקדות במשימות מונחות-זיהוי. תחומים כגון פרשנות ברמת המאפיינים, ויזואליזציה של ייצוגים רגשיים במרחב התמונה, ושילוב המסגרת המוצעת לעיצוב אינטראקציה חכמה קיבלו תשומת לב מועטה. עם אתגרים אלו לנגד עינינו, מוצגת המסגרת המוצעת.

מרבית השיטות הנוכחיות מתמקדות בעיקר בשיפור ביצועי החיזוי תוך שהן מציעות יכולת פרשנות מוגבלת של ייצוגים רגשיים נלמדים ואינטראקציות בין-מודאליות, וזאת למרות התקדמויות בולטות בזיהוי רגשות רב-מודאלי28,29. לעיתים קרובות קשה לאסטרטגיות היתוך נוכחיות למדל אינטראקציות מורכבות בין מודאליות טקסטואליות, אקוסטיות וויזואליות, במיוחד כאשר מתרחשים פערים בין המודאליות ומחסור במידע 28,31. בעוד שעיצובים מבוססי-transformer ומנגנוני קשב שיפרו את למידת הייצוג, השקיפות והפרשנות שלהם נפגעות לעיתים קרובות בשל היעדר הפרדה מפורשת בין מידע ספציפי לרגש למידע ספציפי למודאליות31,32,33. בנוסף, רק מספר קטן של מחקרים בחנו מידול מבוסס-גרף של אינטראקציות בין-מודאליות או יצרו מסגרות ויזואליזציה שיכולות לחשוף דינמיקה רגשית זמנית, התפלגויות קשב ושיבוצים רגשיים (emotion embeddings). חסרונות אלו מדגישים את הצורך במסגרת רב-מודאלית הניתנת לפרשנות עבור אינטראקציה חכמה בין אדם למכונה, המשלבת מיפוי ויזואלי מוכוון-אינטראקציה עם למידה בין-מודאלית חזקה.

עבודה זו מציגה מסגרת ניתנת לפירוש למיפוי חזותי של היבטי רגש רב-מודאליים בעיצוב ממשקים חכמים. ללא צורך במאפיינים שנוצרו ידנית, המערכת משתמשת בלמידה עמוקה מקצה לקצה (end-to-end) כדי לחלץ ייצוגים רגשיים ברמה גבוהה ממודליות טקסטואליות, קוליות וחזותיות. אינטראקציות רגשיות חוצות-מודאליות ממודלות באמצעות מנגנון היתוך תשומת לב (attention fusion) מבוסס גרף המפריד בין מידע ספציפי לרגש לבין מידע ספציפי למודאליות, מה שמאפשר למידה של ייצוגים מופרדים ומשפר את יכולת הפירוש ואת החוסן של המערכת. בנוסף, פותח מודול ויזואליזציה רב-מבטים להצגת דינמיקה רגשית זמנית, דפוסי תשומת לב חוצי-מודאליות ושיבוצי רגש (emotion embeddings). היעילות וההתאמה של המסגרת המוצעת במערכות אינטראקציה חכמות בין אדם למכונה נבחנות באמצעות תיקוף על מאגרי נתונים סטנדרטיים לזיהוי רגשות רב-מודאליים.

עבודה זו מציעה מסגרת ייחודית למיפוי חזותי של היבטי רגש רב-מודאליים, החורגת מגישות מסורתיות מוכוונות-חיזוי כדי להתגבר על מידול לקוי של אינטראקציות בין-מודאליות ועל הפרשנות המוגבלת במערכות נוכחיות לזיהוי רגשות רב-מודאליים. בתוך ארכיטקטורה אחת, הגישה המוצעת משלבת למידת ייצוג רב-מודאלית מבוססת transformer, מידול תכונות מופרד (disentangled) מודע-רגש, מיזוג קשב בין-מודאלי מבוסס גרף, וויזואליזציה מוכוונת-אינטראקציה. המסגרת מפרידה בבירור בין ייצוגים ספציפיים לרגש לבין ייצוגים ספציפיים למודאליות כדי לשפר את הפרשנות, החסינות והעקביות הבין-מודאלית, בניגוד לגישות נוכחיות המתמקדות בעיקר בביצועי הסיווג. בנוסף, מוצג מנגנון קשב מבוסס גרף המאפשר מידול אדפטיבי של אינטראקציות בין-מודאליות על ידי לכידה של תלות רגשית ברמת פירוט גבוהה בין מודאליות טקסטואלית, קולית וחזותית. מודול מיפוי חזותי רב-מבטים נוצר כדי להגביר את השקיפות באמצעות חשיפת מסלולי רגש זמניים, דפוסי קשב בין-מודאליים והטמעות (embeddings) רגשיות חבויות, המספקים תובנות אינטואיטיביות לגבי תהליך קבלת ההחלטות של המודל. בנוסף לאספקת ויזואליזציה ופרשנות משופרות של דינמיקה רגשית רב-מודאלית, הערכה ניסיונית על מאגרי הבקרת CH-SIMS ו-CMU-MOSEI הראתה ביצועים תחרותיים במונחים של דיוק, F1-score, שגיאה מוחלטת ממוצעת ומתאם.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

העבודה המוצעת שואפת לשפר את עיצוב האינטראקציה האינטליגנטית על ידי הצעת מסגרת ניתנת לפירוש למיפוי ויזואלי של מאפייני רגש רב-מודאליים. בעבודה זו נעשה שימוש במאגרי המידע CH-SIMS ו-CMU-MOSEI, הזמינים לציבור. שני מאגרי הנתונים נרכשו ממקורותיהם הרשמיים ונוצלו בהתאם להנחיות השימוש, לתקני המחקר ולתנאי הרישוי שנקבעו על ידי יוצריהם. התוכן הרב-מודאלי של מאגרי הנתונים, הכולל נתוני טקסט, אודיו ווידאו, נאסף תחילה וסומן על ידי ספקי מאגרי הנתונים בהתאם להרשאות המשתתפים המאושרות ולפרוטוקולי איסוף הנתונים שלהם. במחקר זה לא התבצעה אינטראקציה אנושית ישירה, לא גויסו משתתפים חדשים ולא נאסף מידע המאפשר זיהוי אישי. כל ניתוח בוצע באמצעות מאגרי נתונים מחקריים הזמינים לציבור. כתוצאה מכך, ניתוח הנתונים המשני שלנו לא דרש אישור אתי נוסף או ביקורת של ועדת הלסינקי (IRB). המחקר בוצע בהתאם לנורמות מוסדיות רלוונטיות השולטות בשימוש במאגרי נתונים זמינים לציבור, בהליכי מחקר אתיים ובמדיניות שימוש בנתונים החלה.

מנגנון קשב חוצה-מודליות (cross-modal attention) מבוסס גרף הועסק כדי ללמוד אפיוני רגש בין מודליות שונות, תוך שימוש במאפיינים ספציפיים לרגש או למודליות כדי לשפר את ההבנה. רכיב מיפוי חזותי רב-מבטים משמש לשיפור עיצוב אינטראקטיבי מודע-רגש בזמן אמת, ויעילותו מוערכת לצורך זיהוי רגשות. הממצאים מראים כי השיטה המוצעת משפרת הן את יכולת הפירוש והן את היעילות של ממשקי משתמש חכמים מודעי-רגש בעולם האמיתי. איור 1 מציג את זרימת העבודה הארכיטקטונית של העבודה המוצעת. איור 1 מציג את זרימת העבודה המלאה של מסגרת המיפוי החזותי המוצעת ללמידת מאפייני רגש רב-מודליים בהקשר של מערכות אינטראקציה חכמות. זרימת העבודה מתחילה בשלוש מודליות קלט מסונכרנות, דהיינו טקסט, אודיו ווידאו, הלוכדות מידע רגשי משלים מהמודליות הלשונית, הפרוזודית ומביטויי הפנים, בהתאמה. מקודד transformer ספציפי למודליות מעבד כל מודליות כדי להשיג ייצוגים ברמה גבוהה של נתוני הקלט הגולמיים. הייצוגים מוזנים לאחר מכן למודול למידת ייצוגים מופרדים (disentangled representation learning), שבו השכבות (embeddings) הספציפיות לרגש מופרדות מהמאפיינים הספציפיים למודליות כדי להבטיח עקביות ברגשות הנלמדים על פני מקורות נתונים הטרוגניים. השכבות הספציפיות לרגש מכל מודליות מאוגדות לאחר מכן על ידי רשת קשב חוצה-מודליות מבוססת גרף, המדמה את התלויות הרגשיות הבין-מודליות ומקצה משקולות חשיבות דינמיות לכל מודליות בהתבסס על הקשר האינטראקציה. לבסוף, המסגרת מספקת הן פלטי סיווג רגשות והן תובנות אינטראקטיביות, המאפשרות קבלת החלטות שקופה ומודעת-רגש ועיצוב אינטראקציה חכמה ואדפטיבית.

רכישת נתונים רב-מודאלית

מאגרי הנתונים CH-SIMS ו-CMU-MOSEI הם שני מאגרי נתונים רב-מודאליים (multimodal) קיימים בנחלת הכלל, שבהם נאסף מידע רב-מודאלי, כגון וידאו, אודיו וטקסט מסונכרנים. מאגר הנתונים CH-SIMS כולל בדיקות רב-מודאליות של אנשים סינים, הכוללות 2,281 מקטעי וידאו, שהופקו ממספר מקטעי וידאו מסרטים, דרמות טלוויזיוניות ותוכניות בידור. מחקרים על ניתוח רב-מודאלי של רגשות באמצעות נתונים רב-מודאליים הופכים למרתקים וישימים יותר הודות להוספת אודיו וטקסט תואמים למקטעי וידאו אלו. עם זאת, מאגר הנתונים CMU-MOSEI הוא אחד ממאגרי הנתונים הרב-מודאליים הגדולים ביותר לבחינת דעות, תחושות ורגשות, ואסף למעלה מ-23,000 קליפי וידאו של ביטויים שנאמרו על ידי למעלה מ-1,000 דוברים במגוון נושאים. מאגר הנתונים חולק באופן אקראי לתת-קבוצות של אימון (70%), תיקוף (15%) ובדיקה (15%) תוך שמירה על התפלגות המחלקות.

תמלילים טקסטואליים, אותות שמע ופריימים של וידאו נאספים ומסונכרנים לפי חותמות זמן כדי להתאימו ברמה זמנית מדויקת. אינטגרציה ברמת הפריים מבטיחה שניתן יהיה למדל ולנצל באופן משותף, באמצעות מנגנוני למידת הייצוג וההיתוך מבוססי הגרפים המוצעים, תוכן רגשי הנובע מהבעות חזותיות, טוני רחש ולשון. סוג זה של טכניקת רכישה רב-מודאלית מאפשר חילוץ יעיל של דינמיקות רגשיות בין-מודאליות, דבר החיוני לעיצוב אינטראקציה חכמה ולמיפוי חזותי מובן.

טבלה 1 מציגה את המבנים המרכזיים של מאגרי הנתונים הרב-מודאליים של רגשות ששימשו בשיטה המוצעת. כדי להשיג טווח רחב יותר של רגשות קשורים, כגון מילים מדוברות, אינטונציות קוליות והבעות פנים, מאגרי הנתונים CH-SIMS ו-CMU-MOSEI משלבים מודליות של וידאו, אודיו וטקסט. יתרה מכך, מספר מוגבל של דגימות נתונים זמינות ב-CH-SIMS, מה שמאפשר בחינה מעמיקה של אינטראקציות בין מודליות ושונות רגשית בסין. מצד שני, מאגר הנתונים CMU-MOSEI חשוב יותר להערכת העמידות של למידת הייצוג ואלגוריתמי הוויזואליזציה הרלוונטיים הנידונים בעבודה זו, שכן הוא מכיל כמות גדולה של נתונים בשפות שונות, נושאים שונים ורמות רגש מסומנות. בנוסף, בהשוואה למחקרים קודמים, הוא מפחית קשיים בבחירת מידע בעת בדיקת המודלים.

עיבוד מקדים רב-מודאלי וסנכרון

הערות חותמות הזמן ממאגרי הנתונים CH-SIMS ו-CMU-MOSEI שימשו לסנכרון המודליות הטקסטואלית, השמעית והחזותית, כדי להבטיח למידה עקבית של ייצוג רב-מודלי (multimodal representation learning). כל מבע functioned כיחידת הניתוח הבסיסית וקושר למקטעי אודיו ווידאו תואמים באותו מרווח זמן. היישור בוצע ברמת המבע. התמלול חולק למקטעים על בסיס חותמות הזמן של תחילת וסיום כל מבע. ההתאמה בין התמלול, האודיו והווידאו נקבעה על ידי חילוץ פריימי הווידאו ואותות האודיו המתאימים שנפלו בתוך אותו מרווח זמן. בעוד שמקטעי האודיו עובדו באמצעות Wav2Vec 2.0 להפקת ייצוגים אקוסטים, פריימים חזותיים ממקטע הווידאו נדגמו בקצב שנקבע מראש וקודדו באמצעות Vision Transformer (ViT). מקודד RoBERTa שימש ליצירת שיכובים (embeddings) טקסטואליים מתמלולי המבעים. סנכרון זמני הושג על ידי יישור כל מאפייני המודליות לגבול מבע יחיד, מכיוון ששלוש המודליות הפיקו רצפי מאפיינים באורכים משתנים. פורמט באורך קבוע שימש לנורמליזציה של רצפים באורכים שונים. רצפים ארוכים יותר קוצרו לאורך הרצף המקסימלי המותר, בעוד שרצפים קצרים יותר עברו ריפוד באפסים (zero-padded). במהלך האימון, מסכות קשב (attention masks) שימשו להפרדת אלמנטים מרופדים מעמדות מאפיינים לגיטימיות. שיכובים ספציפיים למודליות הוקרינו למרחב חבוי (latent space) משותף לפני האיחוד, וזאת כדי להתגבר על אורכי רצפים שונים בין המודליות. הדבר הבטיח עקביות ממדית ואפשר למנגנון הקשב מבוסס-גרף להקל על למידה מוצלחת של אינטראקציה בין-מודלית. כדי לשמר את איכות הנתונים ואת שלמות הסנכרון, דגימות עם קבצים פגומים, הערות חסרות או מידע מודלי חלקי הוצאו מהמחקרים.

חילוץ מאפיינים מבוסס Transformer

שיטת למידה עמוקה משמשת ללמידת ייצוגי מאפיינים ברמה גבוהה המודעים לרגשות מתוך מידע ממספר מודליות, כגון ראייה, שמע וטקסט, באופן מקצה לקצה לאחר יישור הנתונים הרב-מודאליים וביצוע עיבוד מקדים נדרש. על ידי שימוש במקודד transformer ללמידת ייצוגי מאפיינים מבדילים באופן מהותי מנתונים רב-מודאליים גולמיים, השיטה המוצעת מבטלת את הצורך בהנדסת מאפיינים. כדי להבטיח עקביות בין מערכי הנתונים המשמשים בגישה המוצעת, נלמד embedding בגודל קבוע עבור כל מודליות. לדוגמה, embedding של מאפיינים ב-768 ממדים נלמד עבור כל אחת מהמודליות האינדיבידואליות, כולל מודליות של תמונה, שמע וטקסט, אשר יחד יוצרים מרחב מאפיינים מאוחד המשמש לאורך כל הגישה, ובמיוחד בגישת חילוץ מאפיינים המשמשת במערך הנתונים CH-SIMS המוצע ובמערך הנתונים CMU-MOSEI כדי ללמוד מאפיינים ברמה גבוהה מתוך נתונים בגדלים שונים.

מודאליות חזותית: Vision transformer עבור שיכובים (embeddings) של פריימים מודעי-רגש

מודל Vision Transformer (ViT-Base) שימש להפקת מידע חזותי מפרימי וידאו במטרה להשיג ייצוגים מרחביים רלוונטיים לרגשות. לפני הפקת המאפיינים, הפרימים של כל מקטע וידאו הותאמו לגודל של (224 × 224) פיקסלים ונדגמו במרווחי זמן קבועים. באמצעות גודל פאץ' (patch) של 16 × 16 פיקסלים, ארכיטקטורת ה-ViT-Base מייצרת סדרה של טוקנים חזותיים המעובדים על ידי 12 שכבות מקודד טרנספורמר. הייצוגים שהופקו ברמת הפריים הוקרינו למרחב שיכון (embedding space) בן 768 ממדים באמצעות מודל ViT מאומן מראש כשלד חזותי (visual backbone). שיכוני רמת הפריים אוגדו באמצעות mean pooling כדי ליצור את הייצוג החזותי הסופי עבור כל מקטע. במהלך האימון, נעשה שימוש בנורמליזציה של תמונות ובשיטות אוגמנטציה נפוצות, כגון חיתוך אקראי (random cropping) והיפוך אופקי, כדי לשפר את ההכללה. לאחר מכן, מסגרת מיזוג המולטי-מודאלית המוצעת שימשה לשילוב שיכונים חזותיים אלה עם ייצוגים טקסטואליים ושמיעתיים.

כדי לשמר את הדינמיקה הזמנית ברגש, דגימות וידאו ממסדי הנתונים CH-SIMS ו-CMU-MOSEI יידגמו באופן אחיד עבור המודליות החזותית. ניתן לחלק את הפריימים של כל סרטון, figure-protocol-1, ל-N מקטעים בגודל קבוע, אשר לאחר מכן יישטחו ויועברו באופן הפוך למרחב הטמעות חבוי (latent embedding space) בעל ממד figure-protocol-2. סדרה תיווצר על ידי הוספת הטמעות מיקום (positional embeddings) ואסימון קיבוץ (grouping token) למידתי:

figure-protocol-3   (1)

כאשר figure-protocol-4  מייצג קידוד מיקומי ו-figure-protocol-5  היא מטריצת השיכון של ה-patch.

שכבות מקודד Transformer מוערמות, המורכבות מרשתות feed-forward וממנגנוני multi-head self-attention, משמשות לעיבוד רצף ה-patch המוטמע. הטרנספורמציה בשכבה l מתוארת כך:

figure-protocol-6   (2)

figure-protocol-7   (3)

כדי להשיג את וקטור המאפיינים החזותיים המודע לרגשות, מוצא את הפלט השקול ל-class token כוקטור המאפיינים figure-protocol-8. כדי לטפל בייצוגי רגשות חזותיים עקביים למרות הבדלים בשפה ובתוכן בין מערכי נתונים, שילובים (embeddings) ברמת הפריימים מכל מקטע וידאו ממוזגים כדי ללכוד הבעות פנים ואת התפתחות הרגש.

מודאליות שמע המשתמשת ב-Wav2Vec 2.0 עבור פרוסודיה והטמעות אקוסטיות סמנטיות הטמעות דיבור הקשריות הופקו באמצעות מקודד Wav2Vec 2.0 שעבר אימון מוקדם כשלד אקוסטי. וקטור מאפיינים אקוסטי באורך קבוע עבור כל ביטוי התקבל על ידי אגרגציה של ייצוגי השכבות החבויות (hidden representations) באמצעות mean pooling. מודל ה-Wav2Vec 2.0 שימש להפקת ייצוגים אקוסטיים מאותות שמע כדי ללכוד מאפייני דיבור הקשריים ורלוונטיים לרגש. לפני הפקת המאפיינים, הקלטות השמע נורמלו ונדגמו מחדש ל-16 kHz. כדי להבטיח סנכרון בין המודאליות הטקסטואלית לוויזואלית, כל מקטע שמע ברמת המבע (utterance) הופרד באמצעות גבולות חותם הזמן שסופקו באנוטציות של מערך הנתונים. המקודד האקוסטי שעבר אימון מוקדם הותאם במהלך אימון המודל כדי לשפר את ההתאמה למשימה הספציפית, מה שאיפשר לייצוגים הנגזרים לייצג בצורה מדויקת יותר את ההיבטים הרגשיים של אותות הדיבור. לאחר מכן, בוצעו מיזוג תשומת לב חוצה-מודאליות מבוסס גרף (Graph-based cross-modal attention fusion) ולמידת ייצוגים מופרדים (disentangled representation learning) באמצעות הטמעות השמע הסופיות.

במודאליות השמע, נעשה שימוש ב-Wav2Vec-2.0 כדי למדל אותות דיבור הנגזרים ממידע דיבור ראשוני במאגרי הנתונים CH-SIMS ו-CMU-MOSEI, תוך חילוץ ישיר של מאפייני שמע הקשורים לרגש. קידוד מאפיינים קונבולוציוני קיים עבור כל אות דיבור קלט figure-protocol-9:

figure-protocol-10   (4)

כאשר Z מייצג מאפיינים פרוזודיים ברמה נמוכה כגון מלודיה, טון ואנרגיה. רשת הקשר (context network) מבוססת-transformer מועילה למבנים שהוזכרו לעיל, ומייצגת תלויות זמן ארוכות-טווח:

figure-protocol-11   (5)

נתונים אקוסטיים פרוסודיים וסמנטיים, החיוניים לביטוי רגש, נכללים בייצוגים אקוסטיים הקשריים אלו. שיכון שמע (audio embedding) באורך ספציפי נוצר באמצעות ביצוע הליך של איגוד זמני (temporal pooling):

figure-protocol-12   (6)

התכנון נמנע משימוש במאפיינים אקוסטיים כגון MFCCs ומשיג עמידות באמצעות נתוני דיבור באנגלית מ-CMU-MOSEI ונתוני דיבור בסינית מ-CH-SIMS, וזאת על ידי הפקת ייצוגים מצורות גל בלבד.

מודליות טקסט באמצעות RoBERTa להטמעות רגשיות הקשריות

עבור המודליות הטקסטואלית, נעשה שימוש ב-RoBERTa, שנשנה (transformer) דו-כיווני עמוק, על תמלולי הדיבור משני מערכי הנתונים כדי להפיק סמנטיקה הקשרית ומשמעות רגשית. מקודדי שנשנה מבוססי RoBERTa שימשו לחילוץ ייצוגים טקסטואליים מנתוני התמלול כדי ללכוד מידע סמנטי ורגשי הקשרי. מודל RoBERTa מאומן מראש שימש עבור מערך הנתונים CMU-MOSEI בשפה האנגלית, בעוד שגרסת RoBERTa סינית שימשה עבור מערך הנתונים הסיני CH-SIMS כדי לתת מענה טוב יותר למאפיינים לשוניים ספציפיים לשפה. עיבוד מקדים של הטקסט כלל טוקניזציה באמצעות טוקנייזר RoBERTa המתאים לכל שפה ונורמליזציה של הטקסט. כדי להבטיח עיבוד אצוות (batch processing) עקבי, רצפי הקלט הומרו להטמעות טוקנים (token embeddings) ונוספו להם ריפודים (padding) או שקוצרו לאורך רצף מקסימלי שנקבע מראש. בהתאם לפורמט הקלט של RoBERTa, הוכנסו טוקנים מיוחדים לסיווג ולהפרדה. הטמעה טקסטואלית באורך קבוע הושגה על ידי אגרגציה של ייצוגי הטוקנים ההקשריים שהופקו על ידי מקודד השנשנה, תוך שימוש בייצוג המשפט הסופי השקול ל-[CLS]. כדי להתאים את הייצוגים הנלמדים למשימת זיהוי הרגשות, מקודדי RoBERTa המאומנים מראש עברו כוונון (refining) באמצעות אימון רב-מודאלי. לאחר מכן, מסגרת היתוך רב-מודאלית המוצעת שימשה למיזוג ההטמעות הטקסטואליות עם המאפיינים האודיופוניים והחזותיים.

ניתן לשלב את שיכמודי הטוקנים (token embeddings) ואת הקידודים המיקומיים (positional encodings) עבור כל קלט שעבר טוקניזציה, figure-protocol-13, כדי ליצור את ייצוג הקלט בטכניקת הטרנספורמציה הדו-כיוונית העמוקה המכונה

figure-protocol-14   (7)

צורה זו מיוצגת באמצעות השכבות של ה-L transformer, המשתמש במנגנון self-attention כדי לגלות את תלויות ההקשר בין המילים:

figure-protocol-15  (8)

השיכון (embedding) של הרגש ההקשרי מתקבל באמצעות המצב החבוי הסופי של אסימון הסיווג:

figure-protocol-16   (9)

פולריות רגשית, רגשות עזים והשלכות נלוות הם דוגמאות למאפיינים לשוניים הקשורים לרגשות אשר ייוצגו על ידי שיכון (embedding) זה. RoBERTa מקלה על מידול שאינו תלוי בשפה. דבר זה מאפשר למערכת להשתמש באותו גודל שיכון הן עבור טקסטים באנגלית ממאגר הנתונים CMU-MOSEI והן עבור טקסטים בסינית ממאגר הנתונים CH-SIMS.

שלושה וקטורי מאפיינים ספציפיים למודאליות בעלי 768 ממדים, אחד עבור מודאליות חזותית fv, אחד עבור מודאליות שמע fa ואחד עבור מודאליות טקסטואלית ft , מחולצים על ידי שלב למידת ייצוג המאפיינים העמוק המוצע. בעיצוב האינטראקציה האינטליגנטית, ייצוגים נלמדים אלו יוצרים מרחב מאפיינים רב-מודאלי מאוחד המשמש כבסיס למיפוי חזותי ברמת המאפיינים, מיזוג חוצה-מודאלי מבוסס גרף ולמידת ייצוג מופרד (disentangled representation learning).

למידת ייצוגים מופרדים

לאחר למידת ייצוג תכונות עמוק, עיבוד נוסף של וקטורי התכונות הרב-מודאליים מהמודאליות החזותית, השמעית והטקסטואלית יכול להניב תיאור רגש מופרד. אם השכבות (embeddings) של התכונות הספציפיות למודאליות עבור המודאליות השמעית, החזותית והטקסטואלית שנעשה בהן שימוש בשלב הקודם מיוצגות על ידי fv, fa ו-ft, בהתאמה, כך ש-figure-protocol-17  ו-figure-protocol-18, מטרתו של שלב זה היא לבצע פירוק (factorization) של כל תכונות המודאליות לשני תיאורים חבויים (latent depictions) נפרדים, הכוללים את תיאורי הרגש לאחר התחשבות בסמנטיקה הקודמת של כל אחת מהמודאליות השונות.

דבר זה מושג על ידי הזנת מאפיין כל מודאליות, fm , לשתי רשתות הקרנה מקבילות: מקודד רגש figure-protocol-19 ומקודד מודאליות figure-protocol-20, שבהם מופקים שני הקידודים.

figure-protocol-21  (10)

שם figure-protocol-22 המאפיין החבוי המקושר לרגש מיוצג על ידי figure-protocol-23 המייצג מאפיין חבוי ספציפי למודליות (modality). הדבר מאפשר להטמעות (embeddings) ספציפיות לרגש לתקשר עם מרחב באופן חוזר על פני מספר קלטים, כולל אודיו, ויזואליה וטקסט, תוך שמירה על הנתונים המבניים הייחודיים הקשורים לכל מודליות.

הפרדה יעילה מושגת על ידי שחזור עם אילוצי אי-תלות. השחזור של מאפיין המודאליות המקורי ניתן על ידי:

figure-protocol-24  (11)

כאשר figure-protocol-25 היא רשת פענוח (decoder network). הפסד השחזור (reconstruction loss) משמר את הנתונים הבאים:

figure-protocol-26   (12)

בנוסף, אורתוגונליות, או דקורלציה, בין רגש לבין תיאורים ספציפיים לאופן ההצגה (modality) מגבילה לעיתים קרובות את חפיפת המידע:

figure-protocol-27   (13)

על ידי השגת יעדים אלה, המודל עשוי ללמוד ייצוגי רגש שהם אמינים, מובנים ועמידים לשונות בין המודליות השונות. מיזוג חוצה-מודליות מבוסס גרפים ומאפייני מיפוי חזותי מאוחרים יותר, במיוחד עבור תכנון אינטראקציה חכמה, מסתמכים במידה רבה על ייצוגי רגש מובנים וניתנים לפירוש.

עקביות רגשית בין מודליות

הוספת עקביות רגשית משפרת בבירור את יעילות המיזוג בין המודליות. זאת מכיוון שאסטרטגיות המיזוג אינן צריכות להתחשב בפערים גדולים בין שני הייצוגים, היות שהשיכובים (embeddings) הרגשיים הספציפיים למודליות חולקים מרחב חבוי. האיור המשולב של שני הרגשות מתואר כך figure-protocol-28. מיזוג משוקלל יהיה יציב יותר כאשר הייצוגים הספציפיים לרגשות עקביים, מכיוון ששינויים בין אותות ממודליות שונות לא ישפיעו יותר על התוצאה.

figure-protocol-29   (14)

באמצעות אכיפת יישור סמנטי של מידע רגשי, מטרה זו ממזערת פערים בין מודליות שונות ומבטיחה שתפיסת הרגש תישאר עקבית ללא קשר למודליות המשמשת לביטויו. כתוצאה מכך, נוצר מרחב ייצוג רגשי ומלוכד על ידי השלכה של רמזים רגשיים שהופקו מאותות דיבור, הבעות פנים ותוכן לשוני.

השפעה על מיזוג חוצה-מודאלי (cross-modal fusion)

מיזוג רב-מודאלי (Cross-modal fusion) הופך ליעיל יותר כאשר מוכנסה עקביות רגשית בין המודאליות השונות. מנגנוני המיזוג אינם נדרשים עוד לפצות על פערים משמעותיים בייצוגים הבין-מודאליים, מכיוון שהשימועים (embeddings) הספציפיים לרגש מיושרים במרחב חבוי (latent space) משותף. ייצוג הרגש הממוזג מוגדר כדלקמן:

figure-protocol-30  (15)

כאשר  αm מייצג את משקל התשומת לב המוקדש למודליות m. מיזוג המשוקל הופך ליציב ומובן יותר כאשר ייצוגים ספציפיים לרגש הם עקביים, שכן תוצאת המיזוג מראה ראיות רגשיות משלימות במקום אותות מודליות סותרים.

מבחינה מתמטית, הורדה figure-protocol-31 השונות בין סוגים שונים של ייצוגים ספציפיים לרגשות ביחס ל- figure-protocol-32 שקול ל:

figure-protocol-33   (16)

שם figure-protocol-34 מייצג את ביטוי הרגש הממוצע. שונות מופחתת גורמת לכך שצורות הקלט ישוקללו בהתאם למשמעות הרגשית המדויקת שלהן ולא בהתבסס על רעש של צורת הקלט, מה שמבטיח התכנסות משופרת של הרשת והערכת קשב מדויקת יותר.

מטרת הלמידה הסופית של ויזואליזציות של רגשות מופרדים (disentangled) היא לשלב פרגמנטציה, שחזור ואחידות רגשית:

figure-protocol-35   (17)

שני ההיפר-פרמטרים, λ1 ו-λ2, שולטים במערכת היחסים בין אמינות רגשית חוצת-מודליות לבין דיסוציאציה. המודל המוצע משיג ייצוגים רגשיים שאינם תלויי-מודליות, ניתנים לפירוש וניתנים למיזוג כדי להשיג זאת, תוך דגש על אספקת בסיס איתן למיזוג מבוסס-גרף מאוחר יותר וייצוג ברמת התכונות בעיצוב ממשקים חכמים.

מיזוג קשב חוצה-מודאליות מבוסס גרף

רשת קשב חוצת-מודליות מבוססת גרף שימשה לסימולציה של קשרי רגש ברזולוציה גבוהה בין מודליות. כדי להקל על זרימת המידע בין המודליות, נבנה גרף רב-מודלי מחובר באופן מלא, שבו כל שיכון (embedding) ספציפי למודליות (טקסט, שמע וויזואלי) מיוצג כצומת בגרף. קשרי המודליות שימשו להקמת מטריצת הסמיכות של הגרף, אשר שופרה לאחר מכן באמצעות שיטת קשב למידה. מרחב חבוי משותף נוצר על ידי שרשור והקרנה של הפלטים ממספר ראשי קשב. ייצוג רגשי רב-מודלי מאוחד הופק לאחר מכן על ידי אגרגציה של ייצוגי הצמתים באמצעות איסוף (pooling) המשוקלל בקשב. מודולי הניבוי והויזואליזציה לניתוח מודע-אינטראקציה וזיהוי רגשות קיבלו לאחר מכן ייצוג ממוזג זה. למודול היתוך-הגרף היה ממד ייצוג חבוי של 256 ושתי שכבות קשב של גרף, שכל אחת מהן כללה שמונה ראשי קשב. כדי לקבוע את החשיבות היחסית של מודליות סמוכות, חושבו מקדמי קשב בין צמתים מחוברים והם נורמלו באמצעות פונקציית softmax. לאחר כל שכבת קשב של גרף בוצעו נורמליזציית שכבה, חיבורי שאריות (residual connections) ושיעור dropout של 0.2 כדי להגביר את יציבות האימון ולהפחית התאמת-יתר (overfitting). לאחר שרשור והקרנה של פלטי מספר ראשי קשב למרחב חבוי משותף, ייצוגי הצמתים שולבו לשיכון רגשי רב-מודלי יחיד באמצעות איסוף המשוקלל בקשב. לאחר מכן, הייצוג הממוזג שימש למיפוי ויזואלי רב-מבטי ולניבוי רגשות.

אינטראקציות רב-מודאליות מגוונות נלכדו באמצעות קשב גרפי רב-ראשי (multi-head graph attention). פונקציית softmax שימשה לנרמול מקדמי הקשב בין צמתים מחוברים עבור כל צומת. כדי להגביר את יציבות האימון ולמנוע התאמת יתר (overfitting), לאחר שכבות הקשב הגרפי המערכמות של מודול מיזוג הגרף הוטמעו חיבורים שאריתיים (residual connections), נרמול שכבות (layer normalization) והסדרת dropout.

נניח כי האיברים figure-protocol-36 מייצגים בנפרד את הייצוגים המתאימים לרגשות ספציפיים שנאספו על ידי המודליות החזותית, השמיעתית והטקסטואלית; כל רכיב נמצא בתוך המרחב החבוי המשותף figure-protocol-37. המודלים עבור צמתי המודליות משתמשים בסימון עבור הגרף figure-protocol-38, כאשר הצמתים של האוסף figure-protocol-39 מתאימים לשלושת צמתי המודליות עצמם, כדי לחזק במפורש את התלויות הרגשיות המשותפות בין ייצוגי המודליות השונות.

לאחר הקצאת וקטור מאפיינים ספציפי לרגש לכל צומת בגרף, נקבל:

figure-protocol-40   (18)

בניגוד לשיטות מיזוג מסורתיות, המשתמשות במשקלי מיזוג קבועים או שנקבעו מראש, השיטה המוצעת לומדת משקלי קצוות אדפטיביים בהתבסס על חשיבותם והתלות ההדדית ביניהם, הן בין ערוצים והן בין מצבים רגשיים.

רשת תשומת לב גרפית (Graph Attention Network - GAT) מנוצלת לצורך מיזוג רב-מודאלי (cross-modal fusion). מקדם תשומת לב מחושב עבור כל צומת i והצמתים השכנים לו, כלומר, צומת j:

figure-protocol-41   (19)

ההשפעה הרגשית של מעבר ממצב j למודליות i נמדדת על ידי המשקולות הנורמליזציה αij.

בשלב הבא, המראה הממזג של כל צומת מודאליות מחושב כקיבוץ משוקלל של שכניו:

figure-protocol-42   (20)

כאשר פונקציית ההפעלה figure-protocol-43 היא אי-ליניארית. לבסוף, המאפיינים המעודכנים של כל צומת משולבים כדי לקבל ייצוג רגשי ממוזג גלובלי:

figure-protocol-44   (21)

זוהי טכניקה שימושית למידול רגשות ניתן-לפירוש ומיפוי חזותי עוקב, כיוון שהיא לוכדת מידע משלים ממודליות שונות תוך שימור מערכות יחסים בין-מודליות מורכבות.

אלגוריתם 1 (קובץ משלים 1) מספק את התוכנית הכללית לביצוע מיזוג חוצה-מודאליות מבוסס-גרף. תחילה, נוצר גרף שבו המאפיינים הספציפיים לרגש מקושרים לכל אחת מהמודאליות החזותית, השמעית והטקסטואלית. לאחר מכן, מחושבים ציוני הקשב (attention scores) עבור זוגות הצמתים בכל גרף, המייצגים את השילוב של התלות הרגשית. ציוני הקשב מנורמלים לאחר מכן כדי להצביע על התרומה היחסית של כל מודאליות להקשר הרגשי שצוין, מה שמאפשר למידה של משקולות הקשב. בשלב האחרון, השכבה הרגשית הכללית (general emotion embedding) מופקת על ידי אגרגציה של המאפיינים הקשורים לצמתי הגרף. במובן זה, המיזוג הכללי של האלגוריתם עבור המאפיינים הרב-מודאליים המקושרים לרגשות שצוינו מבטיח יכולת הסתגלות, יכולת פרשנות ואינטליגנציה הקשרית.

איור 2 מציג את המבנה ואת אופן הפעולה של רשת תשומת לב צולבת-מודאלית (cross-modal attention network) המוצעת לצורך היתוך סנטימנט רב-מודאלי. ייצוגי הווקטורים (embeddings) הספציפיים לרגש, שנגזרים באופן עצמאי עבור המודאליות של הטקסט, השמע והווידאו, עוברים תחילה דרך מנגנוני תשומת לב ברמת המודאליות הלומדים את החשיבות היחסית של מידע לשוני, קולי ופנים עבור הקשר רגשי נתון. הייצוגים של המודאליות המשוקללים לפי תשומת לב משולבים לאחר מכן כדי ליצור ייצוג רגשי מאוחד, שבו מטריצת תשומת הלב לוכדת את התלויות הבין-מודאליות ואת עוצמות האינטראקציה. מטריצת תשומת הלב הנלמדת על ידי הרשת מווסתת באופן דינמי את התרומות של המודאליות, מה שמאפשר לה להתמקד במודאליות ההוראתית החזקה ביותר שלה תוך התעלמות מאלו שרועשות ופחות אינפורמטיביות. ייצוג הרגש המותוך מאפשר זיהוי רגשות מדויק וניתוח ברזולוציה גבוהה של מצבים רגשיים כגון ניטרליות, חיבוק ודאגה.

מודול מיפוי חזותי

בעזרת סעיף המיפוי הוויזואלי, שנוצר במיוחד למטרה זו, מעצב אינטראקציה חכם יכול להמיר את הייצוג המאוחד של המצב הרגשי לצורה ויזואלית מובנת ונגישה לאחר תהליך ההיתוך רב-מודאלי (cross-modal fusion), בהתבסס על הגרף.

כדי להקל על הבנת הייצוגים הרגשיים החבויים, נעשה שימוש בטכניקות להפחתת ממדיות כדי להציג באופן ויזואלי את השכבות (embeddings) הרגשיות הרב-מודאליות שנלמדו. לאחר הפחתת ממדיות התכונות תוך שמירה על מרבית השונות באמצעות ניתוח רכיבים ראשיים (PCA), השכבות הוקרנו למרחב דו-ממדי לתצוגה באמצעות t-distributed Stochastic Neighbor Embedding (t-SNE). עבור ה-t-SNE נעשה שימוש במספר perplexity של 30, קצב למידה של 200 ו-1,000 איטרציות אופטימיזציה. אשכולות ספציפיים לרגשות ומערכות יחסים בין מודאליות הוצגו ויזואלית באמצעות ההקרנות שהתקבלו. משקולות קשב חוצות-מודאליות מנורמלות, שהתקבלו מרשת קשב מבוססת גרף, שימשו ליצירת מפות חום של קשב. התרומות היחסיות של המודאליות הטקסטואלית, השמעית והחזותית במהלך חיזוי הרגש מוצגות במפות חום אלו. מקדמי הקשב שנלמדו שימשו כמשקולות קשתים ליצירת גרפי אינטראקציה חוצי-מודאליות, אשר אפשרו בחינה ויזואלית של יחסי גומלין בין מודאליות וזרימת מידע בתוך מסגרת היתוך (fusion framework). תרשימי מסלול רגשי נוצרו על ידי ניטור ההתפתחות של שכבות רגשיות חבויות לאורך התבטאויות עוקבות כדי לבחון דינמיקה רגשית זמנית. מסלולים אלו שופכים אור על האופן שבו מצבים רגשיים ותרומות מודאליות מתפתחים לאורך זמן. Matplotlib ו-Scikit-learn הן שתי חבילות Python ששימשו ליצירת כל הוויזואליזציות. כדי להעריך את יכולת הפירוש (interpretability), את היווצרות האשכולות, את תרומות המודאליות ואת הדינמיקה הרגשית הזמנית, נערכו ניתוחים איכותניים של ויזואליזציות השכבות, גרפי האינטראקציה ומפות החום של הקשב.

יהי המשתנה figure-protocol-45 כייצוג המאוחד של המצב הרגשי על ידי פונקציית רשת תשומת הלב הגרפית (graph attention network). בניגוד להדמיה ברמת הפלט של גרפי המצב הרגשי, מטרתו העיקרית של המודול היא להמיר את ייצוגי המצב הרגשי ואת המשקולות המתאימות של מנגנון תשומת הלב לצורה חזותית מובנת.

באמצעות ה-αji שנלמד, נוצר מפת חום של קשב (attention heatmap) כדי לבחון באופן חזותי את תרומתה של כל מודליות. לאחר מכן, משקלי הקשב הנכנסים מ summed יחד כדי לקבוע ציון חשיבות מורכב עבור כל מודליות:

figure-protocol-46    (22)

כאשר si מייצג את התרומה הרגשית היחסית של מודאליות I. כדי לסייע ביצירת מפת חום של קשב, הערכים שהתקבלו מנורמלים ומופנו למפת צבעים המקלה על המשתמש לזהות את המודאליות הדומיננטית בצעדי זמן שונים או במצבים אינטראקטיביים. באמצעות מודאליות קלט חזותיות, שמיעתיות או טקסטואליות שונות, ממשק כזה מסייע למשתמש להבין כיצד פועל מנגנון הקשב של המערכת.

הגרף הנלמד ממודל באופן ספציפי כ"גרף אינטראקציה משוקלל" כדי לייצג את התלות רב-מודאלית של רגשות אנושיים. המודאליות עצמה מיוצגת על ידי כל צומת בגרף, ועוצמת האינטראקציות המערבות רגשות אנושיים מיוצגת על ידי משקלות בצורה של αji על הקשתות המחברות ביניהם. הגרף המשוקלל לעיל ממחיש את עוצמת האינטראקציות הרגשיות האנושיות. ההגדרות של i ו-j הן:

figure-protocol-47   (23)

עובי הקו או השקיפות של ויזואליזציית הגרף מוצגים באופן הולם הודות למשקלים אלו. דבר זה מקל על הבנת האופן שבו המודליות מקיימות אינטראקציה. המעצב יכול להבין טוב יותר כיצד אינדיקטורים רגשיים מקיימים אינטראקציה במהלך תהליך הפוזיה (fusion) בעזרת גרפים של אינטראקציה חוצת-מודליות.

השיכנויות (embeddings) של הרגשות הממוזגים figure-protocol-48 בשלבים שונים של הזמן מופחתות למרחב בעל ממד נמוך יותר באמצעות אלגוריתם להפחתת ממדים כגון PCA או t-SNE, וזאת כדי להציג את התפתחות הרגשות לאורך זמן:

figure-protocol-49   (24)

כאשר פונקציית ההקרנה מיוצגת על ידי figure-protocol-50. הופעתם של מסלולי רגש ב-2D/3D, המציגים מעברים רגשיים, עוצמות ויציבות באינטראקציות, יכולה להתפרש כתיאור אינטואיטיבי של התפתחותם של מצבים רגשיים לאורך זמן. היבטים אלו יכולים לשמש לאינטראקציה חכמה, לקבלת החלטות ולניטור בזמן אמת.

בניגוד למערכות רגש קונבנציונליות המספקות רק מיפויים למחלקות או ציונים מסוימים, מערכת זו מתמקדת בהדגמת האופן שבו רגשות אנושיים מתגבשים בתוכה. היא חושפת את תהליך קבלת ההחלטות שלה באמצעות הצגת ויזואליזציות של מאפיינים ביניים, כולל גורמי שקלול, אינטראקציות בין מודלים והנתיבים התואמים להם. דבר זה מאפשר למשתמש להבין כיצד כל גורם — חזותי, קולי או לשוני — משפיע עליה ביצירת התגובות שלה לרגש אנושי.

מיפוי רגשות לצורות מובנות באמצעות ייצוגים חזותיים יכול לגשר על הפער שבין ניתוח רגשות באמצעות שיטות למידה עמוקה לבין שילובן בתכנון ממשקים חכמים. ניתן להשתמש בנתונים שנאספו משתי הגישות כדי ליצור ממשקי משתמש מדויקים יותר. לפיכך, הגישה המוצעת יכולה לספק למעצבי אינטראקציה מידע חיוני ליצירת ממשקי משתמש מדויקים יותר. במילים אחרות, הבנת הרגש הופכת לחלק פעיל מאוד בתכנון האינטראקציה. הדיוק יכול לעלות רק כאשר הבנת הרגש משולבת באופן פעיל בתכנון האינטראקציה.

מודול המיפוי הוויזואלי מאפשר הסבירות (explainability) במספר דרכים מקושרות אך שונות: הסבירות ברמת התכונה (feature-level explainability) חושפת ייצוגים בסיסיים של רגש שנוצרו על ידי ה-DNN, ובכך מאפשרת לנו להבין את הסמנטיקה המשמשת לתיאור כל תכונה הקשורה לרגש; הסבירות ברמת המודליות (modality-level explainability) משתמשת בנתונים מגרפי האינטראקציה וממפות חום של קשב ויזואלי כדי לתאר כיצד כל מודליות – ויזואלית, שמעית או טקסטואלית – תורמת להחלטות שהתקבלו לצורך ביטוי רגשות; ולבסוף, המסלולים הנובעים מהטמעת הרגש (emotion embedding) מאפשרים לנו להבין כיצד כל מודליות ויזואלית וטקסטואלית משתנה לאורך זמן מנקודת מבט של אינטראקציה דינמית. נא לעיין באלגוריתם 2 (Supplementary File 1).

מאפייני הרגש הרב-מודאליים הממוזגים ממופים לייצוגים בעלי משמעות ויזואלית לצורך עיצוב אינטראקציה חכמה באמצעות אלגוריתם המיפוי הוויזואלי המוצע, Algorithm 2. משקולות הקשב הרב-מודאליות המבוססות על גרף משמשות לכימות הבדלים בין האלמנטים הוויזואליים, השמעיים והטקסטואליים של הקלט בכל שלב של זמן. הבדלים אלו ממופים לאחר מכן לייצוגים ויזואליים כדי להדגיש את המקורות העיקריים המשפיעים על הרגשות באמצעות אלמנטים ויזואליים של מפת חום (heatmap). כדי לספק מבט מעמיק על האינטראקציה בין אלמנטי הקלט ולהעביר את האבולוציה הרגשית שנוצרה על ידי האלמנטים הרב-מודאליים, המערכת מחשבת עוצמות אינטראקציה זוגיות ליצירת משקולות האינטראקציה הרב-מודאליות. במקביל, נוצר מבט של אבולוציה רגשית על ידי מיפוי האלמנטים הרגשיים הממוזגים שנאספו לאורך זמן למרחב בעל ממד נמוך, כדי להפיק אבולוציה רציפה של אלמנטים רגשיים.

חיזוי רגשות ומשוב אינטראקטיבי

תוצאת ייצוג הרגש הממוזג, המיוצגת כ- figure-protocol-51, משמשת לאחר מכן כפונקציה הן עבור משוב אינטראקציה והן עבור חיזוי רגשות. יתרה מכך, חיזוי הרגשות מתואר כמודל רב-משימתי הכולל משימת רגרסיה לזיהוי רציף של עוצמת הרגש ומשימת סיווג לזיהוי רגשות בדידים. מודל הסיווג הבא המבוסס על softmax משמש לזיהוי רגשות בדידים:

figure-protocol-52   (25)

כאשר  figure-protocol-53 מייצג את ההסתברויות הצפויות למחלקת הרגש ו-Wc  ו-bc הם אילוצים הניתנים ללמידה. הפסד צולב-אנטרופיה (cross-entropy loss) מנוצל כדי לשפר את מטרת הסיווג:

figure-protocol-54  (26)

כאשר yk הוא התג של האמת (ground-truth tag), ו-K הוא מספר מחלקות הרגש. ענף רגרסיה משמש להערכת עוצמת הרגש במקביל, ומפיק תחזית של מאפיינים רגשיים רציפים שונים, כולל valence ו-arousal. הגדר זאת באופן הבא:

figure-protocol-55   (27)

כאשר ציון עוצמת הרגש הצפוי מסומן על ידי figure-protocol-56. פונקציית הפסד של טעות ריבועית ממוצעת (Mean-squared error loss) משמשת לשיפור משימת הרגרסיה:

figure-protocol-57   (28)

באופן כללי, שתי המשימות משולבות ביעד הניבוי:

figure-protocol-58   (29)

שבה מטרות הרגרסיה והסיווג מאוזנות על ידי λ. הדבר מרמז על שינוי דינמי של מודול הוויזואליזציה בהתבסס על מצב הרגש שזוהה, כדי לאפשר סוג זה של משוב המודע לאינטראקציה. הקשר האינטראקציה בזמן נתון t מיוצג על ידי ct. תגובת מודול הוויזואליזציה מסופקת על ידי:

figure-protocol-59    (30)

כאשר פונקציית התאמת הוויזואליזציה מיוצגת על ידי figure-protocol-60. דבר זה מאפשר להתאים את מפות החום של המודאליות, גרפי האינטראקציה ומסלולי הרגשות בזמן אמת בהתבסס על שינויים ורגשות צפויים. สิ่งนี้ מעיד על כך שהמערכת מספקת תמיכה משמעותית למשוב, בנוסף לביצועים טובים בחיזוי מצבי רגש.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו מתקפת את מסגרת המיפוי הוויזואלי המוצעת למאפייני רגש רב-מודאליים (multimodal) הן במונחים של יכולת פירוש מודעת-אינטראקציה והן במונחים של ביצועים חיזויים, תוך שימוש בשני מאגרי נתונים בנצ'מרק, CH-SIMS ו-CMU-MOSEI. על פי תוצאות ניסיוניות, הגישה המוצעת מציגה ביצועים טובים יותר באופן עקבי מטכניקות זיהוי רגשות רב-מודאליות קיימות במגוון מדדים, כולל מתאם (correlation), דיוק (accuracy), מדד F1 וטעות מוחלטת ממוצעת (MAE). ייצוג הרגש המופרד (disentangled), מנגנון ההיתוך הבין-מודאלי מבוסס-גרף ואסטרטגיית למידת הייצוג העמוקה מקצה לקצה תורמים כולם לשיפור זה על ידי מתן אפשרות למידול רגשי יציב יותר ומיושר סמנטית. הגישה המוצעת מספקת תובנות עשירות יותר ברמת המאפיינים באמצעות מיפוי ויזואלי, מה שמעבר לרווחים כמותיים, מקל על הבנת התרומות של המודאליות השונות והדינמיקה הרגשית. למרות הבדלים בשפה, בביטוי תרבותי ובגודל מאגרי הנתונים, שיפור הביצועים שהוזכר נצפה באופן עקבי בשני מאגרי הנתונים, מה שמעיד על יכולת הכללה חזקה של המסגרת המוצעת.

בעבודה המוצעת נעשה שימוש במאגרי הנתונים הציבוריים CH-SIMS ו-CMU-MOSEI עבור רגשות מולטי-מודאליים. מאגר הנתונים CH-SIMS כולל 2,281 קטעי וידאו מסרטים, דרמות טלוויזיוניות ותוכניות בידור. ב-CH-SIMS זמינים נתונים מסונכרנים של טקסט, אודיו וויזואליה. תוויות סנטימנט, הן של מודוס בודד (unimodal) והן מולטי-מודאליות, מסווגות לקטגוריות חיוביות, ניטרליות ושליליות. מאגר הנתונים המולטי-מודאלי הגדול בשפה האנגלית הידוע כ-CMU-MOSEI מכיל כ-23,453 קטעי וידאו מתויגים הכוללים למעלה מ-1,000 דוברים הדנים במגוון רחב של נושאים. מאגר נתונים זה מכיל הן הערות רציפות של עוצמת רגש, כגון valence ו-arousal, והן תוויות רגש קטגוריאליות. התנסויות על שני מאגרי נתונים אלו באמצעות המסגרת המוצעת, התומכת במגוון תנאים לשוניים, תרבותיים ורגשיים, מחזקות את החסון (robustness) ואת האמינות. טבלה 2 מציגה את פרטי סביבת הסימולציה.

הגדרות הניסוי והיישום העיקריות ששימשו להערכת המסגרת המוצעת מסוכמות בסביבת סימולציה זו. כדי להבטיח ממד מאפיינים אחיד בין המודליות הטקסטואלית, השמעית והחזותית, מיושמים מקודדים מבוססי transformer באופן אחיד. המערכת משתמשת במנגנון קשב מבוסס גרף לצורך היתוך חוצה-מודליות (cross-modal fusion), המאפשר למידה אדפטיבית של תלויות בין-מודליות הנוגעות למצבים רגשיים.

המסגרת המוצעת מחלצת ייצוגים טקסטואליים, שמיעתיים וחזותיים באמצעות מקודדי מודאליות מבוססי transformer. שכבות מחוברות באופן מלא (fully connected layers) עם הפעלת ReLU מקרינות את ההטמעות הספציפיות למודאליות אל מרחב חבוי משותף. לאחר מכן, נעשה שימוש במקודדים נפרדים הספציפיים לרגש והספציפיים למודאליות, שכל אחד מהם כולל שתי שכבות מחוברות באופן מלא, הפעלה לא ליניארית ונורמליזציה, כדי ללמוד ייצוגים מופרדים (disentangled representations). הייצוגים החבויים מקרינים אל מרחב מאפיינים בן 256 ממדים, שבו מידע עבור כל מודאליות ורגש נלמד בנפרד. כדי לשמר את מידע המודאליות ולקדם הפרדה יעילה, נעשה שימוש במפענחי שחזור (reconstruction decoders). לפני מיזוג רב-מודאלי וחיזוי, מודול קשב חוצה-מודאליות מבוסס גרף ממדל תלויות רגשיות בין מודאליות באמצעות הייצוגים החבויים. הרשת אומנה באמצעות אופטימייזר Adam עם קצב למידה ראשוני של 1 × 10⁻4 וגודל אצווה (batch size) של 32. נעשה שימוש בעצירה מוקדמת (early stopping) על בסיס הפסד התיקוף כדי למנוע התאמת יתר (overfitting). פונקציית המטרה הכוללת כללה הפסדי סיווג, שחזור ועקביות ייצוגים, כאשר כל אחד מהם שוקלל באמצעות היפר-פרמטרים הניתנים לכיוונון. אימון המודל הורץ עד ל-100 epochs, והמודל בעל הביצועים הטובים ביותר במערך התיקוף נשמר לצורך בדיקה.

המסגרת המוצעת הוערכה באמצעות מדדי סיווג, הכוללים דיוק (Accuracy), דיוק חיובי (Precision), רגישות (Recall) ומדד F1, יחד עם מדדי רגרסיה כגון טעות מוחלטת ממוצעת (MAE). הדיוק החיובי, הרגישות ומדד F1 חושבו באמצעות ממוצע מאקרו (macro-averaging) כדי להתחשב בחוסר איזון בין המחלקות בקטגוריות הרגש. עבור ניסויי הסיווג, תוויות הרגש/סנטימנט שהוגדרו מראש במאגרי הנתונים CH-SIMS ו-CMU-MOSEI שימשו כמחלקות האמת (ground-truth). עבור חיזוי סנטימנט מבוסס רגרסיה, ציוני עוצמת הסנטימנט הרציפים של מאגרי הנתונים שימשו כמשתני המטרה. מטריצות בלבול הופקו כדי לנתח את ביצועי החיזוי לכל מחלקה ואת דפוסי הסיווג השגוי עם רווח סמך של 95%. כדי להבטיח חסון (robustness), כל ניסוי חזר על עצמו 5 פעמים תוך שימוש באתחולים אקראיים שונים, והתוצאות המדווחות תואמות לממוצע. ±± סטיית התקן של הביצועים בכל ההרצות. מובהקות סטטיסטית הוערכה באמצעות נהלי בדיקת השערות מתאימים, ומרווחי סמך חושבו במקומות הרלוונטיים. זמן האימון נמדד כסך הזמן שחלף עד להתכנסות המודל על פלטפורמת החומרה המוגדרת.

ניתן להשוות את השיטה המוצעת למספר מודלי בסיס (baseline) מייצגים, הכוללים מיזוג מוקדם (early fusion) ומיזוג מאוחר (late fusion), כגון TFN, שיטות מבוססות LSTM, מודלים של מיזוג מולטי-מודאלי בדרגה נמוכה (low-rank multimodal fusion), טרנספורמרים מולטי-מודאליים אדפטיביים, וארכיטקטורות חדשות המבוססות על קשב חוצה-מודאלים (cross-modal attention). מודלי בסיס אלו משקפים טכניקות חלוציות המתמקדות בעיקר בשיפור דיוק זיהוי הרגשות באמצעות שיטות מיזוג שונות. בניגוד לשיטות אלו, המתרכזות בעיקר בניבוי ברמת הפלט, למידת הייצוג המופרד (disentangled representation learning) והמיזוג מבוסס הגרף של המסגרת המוצעת משפרים את יכולת הפירוש (interpretability) ואת המודעות לאינטראקציה. דוגמאות למודלי בסיס שיושמו באמצעות המאגרים הרשמיים שלהם או מימושים ייחוסים הזמינים לציבור כוללות את LSTM Fusion, TFN, Low-Rank Multimodal Fusion (LMF), Adaptive-Graph וטכניקות מבוססות טרנספורמר. כאשר היו זמינים, נעשה שימוש בהגדרות ההיפר-פרמטרים המקוריות של המחברים. כל מודלי הבסיס שעברו אימון מחדש הוערכו באמצעות אותן חלוקות של מערך הנתונים, טכניקות עיבוד מקדמי, פרמטרי אופטימיזציה ומדדי הערכה, כדי להבטיח השוואה הוגנת. טבלאות ההשוואה מציינות בבירור את המקורות הרלוונטיים עבור נתונים שהופקו ישירות מפרסומים קודמים.

דיוק

דיוק הסיווג של רגשות בדיד נמדד הן עבור CH-SIMS והן עבור CMU-MOSEI; עם זאת, מגמת הדיוק שונה בהתאם למאפיינים של שני מאגרי הנתונים. מכיוון ש-CH-SIMS הוא מאגר נתונים בגודל בינוני עם מספר שווה של קטגוריות סנטימנט וסרטוני וידאו שעברו עיבוד מקדים קפדני, הדיוק שלו גבוה, מה שמעיד על כך שהמודל יכול ללכוד מידע רגשי מולטי-מודאלי דק עם רעש מועט. מנגד, סיווג מדויק של רגשות הוא מאתגר במקרה של CMU-MOSEI, שכן זהו מאגר נתונים רחב היקף עם דוברים מרקעים מגוונים. לכן, בנוסף ליכולתו של המודל לזהות סנטימנט, הדיוק במאגר הנתונים CMU-MOSEI מעיד על יכולתו להכליל ולעמוד במגוון תרחישי אינטראקציה. השיפור בדיוק בשני מאגרי הנתונים מראה כי הגישה המוצעת מכלילה היטב על מאגרי נתונים בשפות, גדלים ורמות מורכבות רגשית שונות.

דיוקי הסיווג של הגישה המוצעת ושל בסיסי השוואה נפוצים אחרים במאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצגים בטבלה 3. כפי שמוצג בטבלה 3, המסגרת המוצעת השיגה את הדיוק הגבוה ביותר הן במאגר הנתונים CH-SIMS והן במאגר הנתונים CMU-MOSEI, תוך עקיפת בסיס ההשוואה החזק ביותר (Adaptive-Graph) בכ-3.3% ו-3.1 נקודות אחוז, בהתאמה. ערכי סטיית תקן נמוכים יותר מעידים גם על יציבות רבה יותר לאורך הרצות ניסיוניות חוזרות. לגישות מסוג LSTM-fusion מסורתיות יש דיוק נמוך יותר בשל יכולתן המוגבלת ללכוד קשרים מורכבים בין מודליות (cross-modal). TFN ו-LMF משפרים את דיוק הסיווג על ידי מידול של קשרים בין-מודליים.

מדד F1 (F1-Score)

בבעיות של סיווג רגשות, האיזון בין ה-recall ל-precision נמדד באמצעות מדד ה-F1-score. לפיכך, מדד זה מתאים יותר עבור מערכי נתונים לסיווג רגשות רב-מודאליים (multimodal), שסביר להניח שבהם מספר הדגימות בין המחלקות אינו שווה. במשימות של סיווג רגשות, האיזון בין ה-recall ל-precision נמדד באמצעות ה-F1-score. מכיוון שמערכי נתונים לסיווג רגשות רב-מודאליים צפויים להיות לא מאוזנים, ה-F1-score הוא המדד המתאים יותר. ככל שהמודל מסוגל לזהות טוב יותר את מחלקות הרגש, כך ה-F1-score יהיה גבוה יותר.

איור 3 ממחיש את הערכת ה-F1-score של הטכניקה המוצעת בהשוואה לבסיסי ההשוואה (baselines) על מערך הנתונים CH-SIMS. היכולת של בסיס ההשוואה המבוסס על LSTM למדל מערכות יחסים רגשיות מורכבות בין מודליות (cross-modal) נחשפת על ידי ה-F1-score הנמוך ביותר שלו. ה-F1-scores שהושגו על ידי הטכניקות שנבחנו במערך הנתונים CH-SIMS מושווים באיור 3. כפי שהודגם, מבנים מתוחכמים יותר המבוססים על גרפים וטרנספורמרים עולים באופן עקבי בביצועיהם על שיטות מסורתיות יותר המבוססות על היתוך (fusion). מודל ה-LSTM רשם את התוצאה הנמוכה ביותר עם F1-score של 0.71, ואחריו TFN (0.74) ו-LMF (0.76). ה-F1-score עלה עוד ל-0.79 באמצעות Adaptive-Graph, מה שמדגיש את הערך של מידול קשרי בין-מודליים. עם F1-score של 0.82, המסגרת המוצעת עלתה בביצועיה על Adaptive-Graph ב-3.8%, על LMF ב-7.9%, על TFN ב-10.8% ועל LSTM ב-15.5%. ממצאים אלו מראים כי מנגנון הקשב הבין-מודלי המבוסס על גרפים ולמידת ייצוג מופרד (disentangled representation learning) שהוצע לוכדים בצורה יעילה יותר מידע רגשי משלים בין המודליות הטקסטואלית, השמעית והחזותית, מה שמוביל לביצועי סיווג טובים יותר.

המגמות היחסיות עקביות, למרות שכל השיטות מראות ירידה קלה ב-F1-score בהשוואה ל-CH-SIMS, כפי שמוצג ב-איור 4. הממצאים מראים שיפור עקבי בביצועים משיטות מיזוג מסורתיות לאסטרטגיות למידה מולטי-מודאליות מבוססות גרפים. המודלים עם ה-F1-score הנמוך ביותר היו LSTM (0.69), TFN (0.72) ו-LMF (0.74). ביצועי מודל ה-Adaptive-Graph עלו ל-0.77, מה שמדגים עד כמה ניתן למדל היטב קשרי צלב-מודאליים (cross-modal connections). המסגרת המוצעת עלתה בביצועיה על כל שאר הגישות והשיגה את ה-F1-score הגבוה ביותר של 0.80. התרומות של למידת ייצוג רגשי מופרד (disentangled emotion representation learning) ומנגנון קשב צלב-מודאלי מבוסס גרפים ללכידת רמזים רגשיים משלימים על פני מודאליות טקסטואלית, אקוסטית וויזואלית, מודגמות על ידי השיפור לעומת קו הבסיס החזק ביותר, Adaptive-Graph. תוצאות אלו מראות כי המסגרת המוצעת לזיהוי רגשות מולטי-מודאלי היא אמינה ויעילה. הגישה המוצעת מדגימה שיפור משמעותי הן לעומת הגישה המבוססת גרפים והן לעומת שיטת המיזוג המסורתית, מה שמאשר עוד יותר את יכולת ההכללה החזקה של השיטה. השיפור ב-F1-score במערך הנתונים CMU-MOSEI מדגים כי הגישה המוצעת יכולה להשיג ביצועי סיווג רגשות מאוזנים גם בסביבות רועשות ומגוונות.

דיוק

במערכות תקשורת חכמות, רמת הדיוק (precision) היא קריטית מכיוון שאות רגשי שגוי עלול לפגוע בחוויית המשתמש. היחס בין המקרים שבהם רגש ספציפי נחזה במדויק לבין המספר הכולל של המקרים שנחזו כרגש זה מוגדר כדיוק. מכיוון שייצוגי הרגשות המופרדים (disentangled emotion representations) הם פחות רועשים ופחות פגיעים לסיווג שגוי בתוך המודאליות, המודל המוצע משיג ביצועים טובים יותר ממודלי הבסיס על מערך הנתונים CH-SIMS, כפי שמוצג ב-איור 5.

הדיוק שהושג על ידי מספר טכניקות לזיהוי רגשות מולטי-מודאלי במאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצג בהשוואה ב-איור 5. ככל שהמודלים עוברים מטכניקות מסורתיות מבוססות היתוך (fusion) לארכיטקטורות מתוחכמות יותר מבוססות גרפים, הדיוק עולה בהתמדה. המסגרת המוצעת השיגה את הדיוק המקסימלי של 0.82 במאגר הנתונים CH-SIMS, כאשר הדיוק עלה מ-0.71 עבור LSTM ל-0.74, 0.76 ו-0.79 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה. במאגר הנתונים CMU-MOSEI, הדיוק עלה מ-0.69 עבור LSTM ל-0.72, 0.74 ו-0.77 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה. הגישה המוצעת השיגה את הדיוק הגבוה ביותר של 0.80. המסגרת המוצעת העלתה את הדיוק בכ-3.8% ב-CH-SIMS וב-3.9% ב-CMU-MOSEI בהשוואה לקו הבסיס החזק ביותר (Adaptive-Graph). ממצאים אלה מראים כי על ידי לכידה של מידע רגשי משלים בין מודליות טקסטואליות, אקוסטיות וויזואליות, למידת הייצוג המופרד (disentangled representation learning) ומנגנון תשומת הלב חוות-המודאלי מבוסס הגרפים שהוצעו מפחיתים בהצלחה תחזיות חיוביות שגויות (false-positive). השפעתה של מודליות לא רלוונטית מומטת עוד יותר על ידי תשומת הלב חוות-המודאלי מבוססת הגרפים. הגיוון המוגבר של הדוברים והביטויים הלשוניים בקורפוס CMU-MOSEI גורם לירידה קלה בדיוק עבור כל המודלים.

חזרה

במשימות של זיהוי רגשות, recall (רגישות), המהווה מדד ליכולתו של מודל לסווג כראוי מקרים רגשיים השייכים למחלקה ספציפית, הוא קריטי מכיוון שחוסר במידע רגשי עלול להשפיע לרעה על איכות האינטראקציה. ערך recall גבוה יותר מעיד על כך שהמודל מזהה פחות תוצאות שליליות שגויות (false negatives) ויותר ביטויים רגשיים ממשיים. ניתן להתייחס ל-recall כמדד ליעילות שבה מופק מידע רגשי מתוך מודליות של טקסט, שמע וויזואליה בהקשר של ניתוח רגשות רב-מודאלי.

היתרון של הטכניקה המוצעת על פני גישות הבסיס במאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצג בהשוואת ה-recall ב-איור 6. ככל שהמודלים מתפתחים משיטות המבוססות על מיזוג (fusion) קונבנציונלי למבנים רב-מודליים מתוחכמים יותר המבוססים על גרפים, התוצאות מראות עקביות בעלייה ב-recall. ה-recall במאגר הנתונים CH-SIMS עלה מ-0.70 עבור LSTM ל-0.73, 0.75 ו-0.78 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה; ה-recall המקסימלי של 0.82 הושג על ידי המסגרת המוצעת. הגישה המוצעת השיגה את ה-recall הטוב ביותר של 0.80 במאגר הנתונים CMU-MOSEI, שבו ה-recall עלה מ-0.68 עבור LSTM ל-0.71, 0.73 ו-0.76 עבור TFN, LMF ו-Adaptive-Graph, בהתאמה. המסגרת המוצעת הניבה שיפורים יחסיים של כ-5.1% ב-CH-SIMS ו-5.3% ב-CMU-MOSEI בהשוואה לגישת הבסיס החזקה ביותר (Adaptive-Graph). תוצאות אלו מראות כי באמצעות לכידה של רמזים רגשיים משלימים לאורך מודליות טקסטואליות, אקוסטיות וויזואליות, למידת הייצוג המופרד (disentangled representation learning) ומנגנון התשומת לב הבין-מודלי המבוסס על גרפים שהוצעו מפחיתים בהצלחה תחזיות שגויות מסוג false-negative, ובכך משפרים את זיהוי מחלקות הרגש בשני מאגרי הנתונים. מכיוון שלשיטות מסורתיות יש יכולת מוגבלת למדל קשרים בין-מודליים מורכבים, נטייתן היא לערכי recall נמוכים יותר. באמצעות מידול מפורש יותר של קשרי המודליות, TFN ו-LMF משיגים שיפורים מתונים. על ידי סימולציה של הקשרים המובנים בין המודליות, שיטת ה-Adaptive-Graph שיפרה עוד יותר את ה-recall. עבור שני מאגרי הנתונים, השיטה המוצעת משיגה את ה-recall הגבוה ביותר, מה שמעיד על יכולתה הטובה יותר לזהות מופעים רגשיים בתרחישי אינטראקציה שונים. השיפור בולט יותר במאגר הנתונים רחב ההיקף CMU-MOSEI, מה שמעיד על החוסן וההכללה של המסגרת המוצעת.

טעות מוחלטת ממוצעת (MAE)

טעות מוחלטת ממוצעת (MAE) משמשת להערכת הביצועים של משימות חיזוי עוצמת רגש רציפה, כגון חיזוי ערכיות (valence) או עוררות (arousal). בניגוד לדיוק (accuracy), MAE משקף טוב יותר את הקרבה של עוצמת הרגש החזויה למצב הרגשי בפועל. זו הסיבה ש-MAE מתאים יותר למאגרי נתונים כגון CH-SIMS ו-CMU-MOSEI, בעלי תוויות רגשיות רציפות. ערך MAE נמוך יותר מעיד על דיוק רב יותר בחיזוי עוצמת הרגש.

השוואת ה-MAE בין המסגרת המוצעת לבין גישות הבסיס במאגרי הנתונים CH-SIMS ו-CMU-MOSEI מוצגת ב- טבלה 4שיטות מיזוג מסורתיות המבוססות על LSTM נוטות להציג ערכי MAE גבוהים יותר בשל יכולתן המוגבלת למדל תלויות רגשיות מולטי-מודאליות מורכבות. רשתות TFN ו-LMF יכולות להפחית את ה-MAE על ידי מידול אינטראקציות מולטי-מודאליות, וגישת ה-Adaptive-Graph מפחיתה אותו עוד יותר באמצעות למידה של קשרי גרף בין מודאליות. המסגרת המוצעת משיגה את ה-MAE הנמוך ביותר בשני מאגרי הנתונים, מה שמעיד על הערכה מדויקת יותר של עוצמת הרגש. ראוי לציין כי השיפור משמעותי יותר במאגר הנתונים CMU-MOSEI, שבו השונות הגדולה בנתונים ותנאי הדוברים הופכים את משימת הניבוי למאתגרת יותר.

מטריצת בלבול עבור מערך הנתונים CH-SIMS

שיטות הבסיס של early fusion LSTM ו-TFN מראות בלבול משמעותי בין מחלקות הרגשות הניטרליים והחיוביים, על פי מטריצות הבלבול עבור מערך הנתונים CH-SIMS. הדבר מרמז כי שיטות אלו אינן יעילות מספיק בזיהוי ביטויים רגשיים מולטי-מודאליים עדינים. מנגד, השיטה המוצעת מציגה בבירור דומיננטיות אלכסונית חזקה, עם מעט מאוד איברים מחוץ לאלכסון, ובכך משפרת את יכולת ההפרדה בין המחלקות. מנגנון למידת הרגש המופרד (disentangled emotion learning) של השיטה המוצעת מבטיח ייצוג עקבי של רגשות בין המודאליות השונות, וגישת מיזוג הגרפים שלה משפרת את ההבחנה בין מחלקות סנטימנט קרובות. איור 7A–E מציג את מטריצת הבלבול עבור מערך הנתונים CH-SIMS עם שיטות בסיס שונות.

מטריצת בלבול עבור מערך הנתונים CMU-MOSEI

המסגרת המוצעת משתמשת בשיכובים (embeddings) של רגשות שאינם תלויים במודליות ובמשקולות קשב אדפטיביות כדי להפחית באופן משמעותי את שיעור הסיווג השגוי, במיוחד עבור קלטים מעומבנים רגשית. הדבר מאשר שהמסגרת המוצעת פועלת היטב במגוון תרחישים של אינטראקציות רב-מודליות בקנה מידה גדול. בשל גודל מערך הנתונים, השונות בין הדוברים והטבע הרציף של תוויות הסנטימנט, מטריצות הבלבול של CMU-MOSEI מראות שיעור סיווג שגוי כולל גבוה יותר. שיטות הבסיס (baseline) מראות דרגה ניכרת של בלבול בין קטגוריות רגש שונות. איור 8A–E מציג את מטריצת הבלבול עבור מערך הנתונים CMU-MOSEI עם שיטות בסיס שונות.

זמן אימון לכל epoch

הפשרות החישוביות של טכניקות היתוך מולטי-מודאליות מתקדמות מודגשות על ידי השוואת זמן האימון לכל epoch. בשל מקודדי ה-transformer ומנגנוני תשומת לב גרפיים (graph attention), המודל המוצע דורש זמן אימון מעט רב יותר מאשר גישות היתוך פשוטות, אך עלייה זו אינה בלתי סבירה. המסגרת המוצעת הפגינה ביצועים חזקים במאגרי נתונים בנצ'מרק של ניתוח רגשות מולטי-מודאלי, ומראה פוטנציאל לשילוב במערכות אינטליגנטיות של אינטראקציה בין אדם למכונה. עם זאת, התאמתו של פריסה בזמן אמת לא הוערכה במחקר הנוכחי ודורשת חקירה נוספת באמצעות ניתוחים של שיהוי (latency), תפוקה (throughput), זיכרון ופריסה. ראוי לציין כי יציבות ההתכנסות המשופרת וביצועי הניבוי והפרשנות העדיפים הופכים את העלות החישובית הנוספת לכדאית. איור 9 מציג את תוצאת זמן האימון לכל epoch עבור השיטה המוצעת.

ניתוח אבלציה (Ablation study)

כדי לקבוע את השפעתו של כל מרכיב חשוב במסגרת המוצעת, כגון מודול המיפוי החזותי, מיזוג חוצה-מודאלי מבוסס גרף וייצוג רגשי מופרד (disentangled), נערך ניתוח אבלציה (ablation study). כדי להבין את ההשפעה, כל מרכיב הוסר בנפרד. על פי תוצאות הניסוי, אסטרטגיית מיזוג הגרף משפרת את מידול התלות החוצה-מודאלית, ותרומתו של הייצוג הרגשי המופרד היא החשובה ביותר ליציבות הביצועים. תפקידו העזר של מודול המיפוי החזותי הוכח על ידי ההשפעה המזערית שיש להסרתו על הביצועים. תוצאות ניתוח האבלציה תחת אותם תנאי אימון והערכה מוצגות ב-Table 5. הירידה המשמעותית ביותר בביצועים נצפתה לאחר הסרת מודול הקשב החוצה-מודאלי המבוסס גרף, אשר הפחית את הדיוק מ-81.72% ל-77.88% ואת מדד ה-F1-score מ-0.823 ל-0.776. דבר זה מדגיש את החשיבות של מידול אינטראקציות בין-מודאליות מורכבות. תפקידו של מודול למידת הייצוג המופרד בלמידת ייצוגים חסונים ספציפיים לרגש הודגם על ידי העובדה שהסרתו הפחיתה את הדיוק ב-2.78 נקודות אחוז ואת ה-F1-score ב-0.032. היתרון העיקרי של מודול המיפוי החזותי הוא יכולת הפירוש (interpretability) ולא דיוק הסיווג, כפי שמעידה הירידה המתונה יותר בביצועי הניבוי עם הסרתו. תצורת ה-Basic Fusion הציגה את הביצועים הנמוכים ביותר, מה שמוכיח כי ביצועי זיהוי רגשות מולטי-מודאליים מיטביים דורשים את השפעתם המשולבת של כל המודולים המוצעים.

זמינות נתונים:

מאגרי הנתונים ששימשו במחקר זה הם מאגרי נתונים ייחוס (benchmark) הזמינים לציבור. מאגר הנתונים CMU-MOSEI מסופק על ידי ה-Multimodal SDK של אוניברסיטת קרנגי מלון ומתואר ב-Zadeh et al. (2018) (https://doi.org/10.18653/v1/P18-1208), והגישה אליו זמינה בכתובת https://multicomp.cs.cmu.edu/multimodal-language-analysis-in-the-wild-cmu-mosei-dataset-and-interpretable-dynamic-fusion-graph/. מאגר הנתונים CH-SIMS מתואר ב-Yu et al. (2020) (https://doi.org/10.18653/v1/2020.acl-main.343) וניתן לגשת אליו באופן ציבורי דרך משאבים שסיפקו המחברים, כולל https://github.com/thuiar/MMSA. כל הניסויים בוצעו באמצעות הגרסאות הרשמיות של מאגרי נתונים אלה. הנתונים הגולמיים שהופקו, קובצי הנתונים המעובדים, פלטי עיבוד מקדים, חלוקות של אימון/תיקוף/בדיקה, ייצוגי מאפיינים נגזרים ופרטי מימוש התומכים בממצאי מחקר זה זמינים לציבור במאגר Zenodo בכתובת https://doi.org/10.5281/zenodo.21124921.

figure-results-1
איור 1: תרשים סכמטי של מסגרת המיפוי הוויזואלי המוצעת למאפייני רגש רב-מודאליים. איור מושגי של הארכיטקטורה הכוללת, המציג את מרכיבי חילוץ המאפיינים הרב-מודאליים, למידת ייצוג מופרד (disentangled representation learning), היתוך תשומת לב חוצה-מודאלי מבוסס גרף, ומיפוי ויזואלי לצורך ניתוח רגשי רב-מודאלי ניתן לפירוש.. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-2
איור 2: תרשים זרימה סכמטי של הפרוטוקול החישובי המוצע.
ייצוג מושגי של צינור העיבוד מקצה לקצה, הכולל שלבי רכישת נתונים, עיבוד מקדים, הפקת מאפיינים ספציפיים למודאליות, מיזוג רב-מודאלי, ויזואליזציה וחיזוי רגשות אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-3
איור 3: השוואת ביצועי F1-score במערך הנתונים CH-SIMS. ערכי F1-score ממוצעים שהתקבלו מחמש הרצות ניסיוניות עצמאיות (n = 5) תוך שימוש באתחולים שונים של גרעיני אקראיות (random seed). פסי השגיאה מייצגים ±± סטיית תקן אחת (SD). ערכי F1-score גבוהים יותר מעידים על ביצועים טובים יותר בסיווג רגשות. אנא לחץ כאן כדי להציג גרסה מוגדלת של איור זה.

figure-results-4
איור 4: השוואת ביצועי F1-score במערך הנתונים CMU-MOSEI. ערכי F1-score ממוצעים שהתקבלו מחמש הרצות ניסיוניות עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעים אקראיים (random seed). פסי השגיאה מייצגים ±± סטיית תקן אחת (SD), וערכי ה-mean ±± SD המתאימים מוצגים מעל כל נקודת נתון. ערכי F1-score גבוהים יותר מעידים על ביצועי סיווג רגשות טובים יותר. אנא לחצו כאן כדי לצפות בגרסה מורחבת של איור זה.

figure-results-5
איור 5: השוואת דיוק במאגרי הנתונים CH-SIMS ו-CMU-MOSEI. ציוני דיוק ממוצעים שהושגו על ידי LSTM, TFN, LMF, Adaptive-Graph והמסגרת המוצעת לאורך חמישה הרצות ניסיוניות עצמאיות (n = 5). פסי השגיאה מייצגים ±± סטיית תקן אחת (SD) שחושבה מהרצות חוזרות עם אתחול של זרעים אקראיים שונים. המסגרת המוצעת משיגה את הדיוק הגבוה ביותר בשני מאגרי הנתונים, מה שמעיד על שיפור בהבחנה בין מחלקות רגש באמצעות למידה יעילה של מאפיינים רב-מודאליים ומיזוג חוצה-מודאלי מבוסס גרפים. אנא לחץ כאן כדי להציג גרסה גדולה יותר של איור זה.

figure-results-6
איור 6: השוואת Recall במאגרי הנתונים CH-SIMS ו-CMU-MOSEI. ציוני recall ממוצעים שהושגו על ידי LSTM, TFN, LMF, Adaptive-Graph והמסגרת המוצעת לאורך חמישה הרצות ניסוייות עצמאיות (n = 5). סטיות התקן מסומנות על ידי ±± סטיית תקן אחת (SD) שנגזרה מניסויים חוזרים. המסגרת המוצעת משיגה באופן עקבי את ה-recall הגבוה ביותר בשני מאגרי הנתונים, מה שמעיד על יכולת עליונה בלכידת מידע רגשי רב-מודאלי (multimodal) והפחתת תחזיות שגויות מסוג false-negative. אנא לחץ כאן כדי לצפות בגרסה מורחבת של איור זה.

figure-results-7
איור 7: מטריצת בלבול עבור סט הנתונים CH-SIMS עם שיטות בסיס שונות. השורות תואמות למחלקות הרגש של ה-ground-truth, והעמודות תואמות למחלקות שנחזו. ערכי התאים מייצגים את אחוז הדגימות שנורמלו ביחס לכל מחלקה אמיתית. מטריצת הבלבול חושבה באמצעות מחיצת הבדיקה המופרדת של CH-SIMS. אחומי אלכסון גבוהים יותר מעידים על דיוק זיהוי טוב יותר עבור קטגוריית הרגש התואמת. מטריצות בלבול של (A) Early fusion LSTM, (B) TFN, (C) LMF, (D) Adaptive Graph, ו-(E) השיטה המוצעת על סט הנתונים CH-SIMS. אנא לחצו כאן כדי לצפות בגרסה גדולה יותר של איור זה.

figure-results-8
איור 8: מטריצת בלבול עבור מערך הנתונים CMU-MOSEI עם שיטות בסיס שונות. השורות מייצגות תוויות רגש בפועל והעמודות מייצגות תוויות שנחזו. הערכים מדווחים כאחוזים מנורמלים לפי מחלקה על קבוצת הבדיקה של CMU-MOSEI. המטריצה ממחישה הן דגימות שסווגו נכון (איברי האלכסון) והן בלבול בין קטגוריות רגש (איברים מחוץ לאלכסון). מטריצת בלבול ב-CMU-MOSEI (A) Early fusion LSTM, (B) TFN, (C) LMF, (D) Adaptive Graph, ו-(E) השיטה המוצעת על מערך הנתונים CMU-MOSEI. אנא לחצו כאן כדי להציג גרסה גדולה יותר של איור זה.

figure-results-9
איור 9השוואה של זמן האימון לכל תקופה (epoch) במאגרי נתונים רב-מודאליים של רגשות המשמשים כבנצ'מרק.
זמן אימון ממוצע לכל תקופה (epoch) שהתקבל מ- חמישה הרצות ניסוייות בלתי תלויות (n = 5) עבור מערכי הנתונים CH-SIMS ו-CMU-MOSEI תחת הגדרות חומרה ותוכנה זהות. פסי השגיאה מייצגים ±± סטיית תקן אחת (SD) חושב מניסויים חוזרים תוך שימוש באתחולים שונים של זרעים אקראיים (random seeds). ערכים נמוכים יותר מעידים על יעילות חישובית גבוהה יותר, בעוד שזמני אימון יציבים בין הרצות מעידים על שיפור ביכולת השחזור ובעקביות האימון. אנא לחץ כאן כדי לצפות בגרסה גדולה יותר של איור זה.

סט נתוניםמודליותמספר דגימותשפהתוויות רגש/סנטימנט
CH-SIMS34וידאו, אודיו, טקסט2,281 מקטעי וידאוסיניתתוויות סנטימנט מולטי-מודאליות ויוני-מודאליות (שלילי, ניטרלי, חיובי)
CMU-MOSEI35וידאו, אודיו, טקסט~23,453 קליפים מתויגיםאנגליתתוויות סנטימנט ועוצמת רגש (רציפות וקטגוריות)

טבלה 1: תיאור מערכי הנתונים. סיכום של מערכי הנתונים ששימשו במחקר זה, המודליות, מספר הדגימות, השפה, ותוויות הרגש/סנטימנט עבור מערכי הנתונים CH-SIMS ו-CMU-MOSEI.

מרכיבמפרט
מסגרת תכנותPython עם PyTorch
מחלץ מאפיינים חזותייםVision Transformer (ViT)
מחלץ מאפיינים קולייםWav2Vec 2.0
מחלץ מאפייני טקסטRoBERTa
אסטרטגיית מיזוגרשת קשב חוצת-מודליות מבוססת גרף (Graph-based Cross-Modal Attention Network)
ממד מאפיינים768 לכל מודליות
אופטימייזר אימוןAdam
קצב למידה1.00E-04
גודל אצווה (Batch Size)16
חומרהNVIDIA GPU (למשל, סדרת RTX)
מאגרי נתונים להערכהCH-SIMS, CMU-MOSEI
ממד חבוי (Latent Dimension)2.56E+02
ממד שיכון (Embedding Dimension)768
פונקציית אקטיבציהReLU
אופטימייזרAdam
קצב למידה1.00E-04
גודל אצווה (Batch Size)32
איטרציות (Epochs)100
עצירה מוקדמתפעיל
פונקציית הפסדסיווג + שחזור + עקביות

טבלה 2: סביבת סימולציה. הגדרות ניסוייות ופרטי יישום של סביבת הסימולציה, כגון מפרטי המודל, מאפיינים, אופטימייזר והחומרה שבה נעשה שימוש.

שיטהדיוק CH-SIMS (%)דיוק CMU-MOSEI (%)
LSTM (Early/Late Fusion)72.84 ± 1.1270.35 ± 1.26
TFN74.91 ± 0.9872.68 ± 1.10
LMF76.23 ± 0.8574.12 ± 0.94
Adaptive-Graph78.46 ± 0.7376.89 ± 0.81
השיטה המוצעת81.72 ± 0.6179.94 ± 0.69

טבלה 3: הערכת דיוק השיטה המוצעת מול טכניקות בסיס (baseline) על מאגרי הנתונים CH-SIMS ו-CMU-MOSEI. התוצאות מדווחות כממוצע ±± סטיית תקן שהתקבלו מחמש הרצות ניסיוניות עצמאיות (n = 5) תוך שימוש באתחולים שונים של גרעינים אקראיים (random seed). כל השיטות הוערכו באמצעות חלוקות זהות של נתוני אימון, תיקוף ובדיקה במאגרי הנתונים שלהן כדי להבטיח השוואה הוגנת.

שיטהCH-SIMS MAE ↓CMU-MOSEI MAE ↓
LSTM (מיזוג מוקדם/מאוחר)0.412 ± 0.0140.465 ± 0.016
TFN0.387 ± 0.0120.439 ± 0.014
LMF0.361 ± 0.0100.412 ± 0.012
Adaptive-Graph0.334 ± 0.0090.379 ± 0.010
השיטה המוצעת0.298 ± 0.0070.341 ± 0.008

טבלה 4: תוצאות השגיאה המוחלטת הממוצעת. התוצאות מדווחות כממוצע ±± סטיית תקן שהתקבלו מחמישה הרצות ניסיוניות בלתי תלויות (n = 5) תוך שימוש באתחולים שונים של גרעיני אקראיות (random seed). כל השיטות הוערכו באמצעות חלוקות זהות של נתוני אימון, תיקוף ובדיקה במאגרי הנתונים שלהן כדי להבטיח השוואה הוגנת. השוואה של MAE עבור חיזוי רציף של עוצמת רגש באמצעות המסגרת המוצעת וגישות בסיס (baseline) בשני מאגרי הנתונים.

גרסת מודלדיוק (%)F1-score
מודל מלא81.72 ± 0.610.823 ± 0.008
ללא הפרדה (Disentanglement)78.94 ± 0.740.791 ± 0.010
ללא מיזוג גרפים (Graph Fusion)77.88 ± 0.810.776 ± 0.011
ללא מיפוי חזותי (Visual Mapping)80.11 ± 0.660.807 ± 0.009
מיזוג בסיסי74.91 ± 0.980.742 ± 0.013

טבלה 5: תוצאות מחקר אבלציה (ablation study) עם שיטות בסיס. התוצאות מדווחות כ- ממוצע ±± סטיית תקן התקבלו מ- חמשה הרצות ניסויים עצמאיות (n = 5) תוך שימוש באתחולים שונים של זרעי אקראיות (random seed). כל השיטות הוערכו באמצעות חלוקות זהות של נתוני אימון, תיקוף ובדיקה במאגרי הנתונים שלהן, כדי להבטיח השוואה הוגנת. השוואה של ביצועים בין גרסאות המודל, המעידה על היעילות של למידה מייצוגים מופרדים (disentangled representations), מיזוג מבוסס גרף ומודול מיפוי חזותי.

קובץ משלים 1: אלגוריתם 1 ואלגוריתם 2.אנא לחץ כאן להורדת קובץ זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הממצאים הניסיוניים מדגימים כי במאגרי הנתונים CH-SIMS ו-CMU-MOSEI, מסגרת המיפוי הוויזואלי המוצעת למאפייני רגש רב-מודאליים עולה בביצועיה על טכניקות נוכחיות לזיהוי רגשות רב-מודאלי. בהשוואה למודלים של מיזוג מוקדם ומאוחר, כגון EF-LSTM ו-TFN, הטכניקה המוצעת משיגה דיוק גבוה יותר ומדדי F1 Scores גבוהים יותר, דבר המעיד על חסינותה בטיפול במידע רגשי מגוון. ניתן לייחס את השיפור בשיטה לייצוג הרגש המופרד (disentangled), המדכא רעש ספציפי למודאליות ומבטיח עקביות רגשית בין המודאליות הוויזואלית, השמעית והטקסטואלית36.

לאחרונה, מודלים מולטי-מודאליים מבוססי transformer, כגון Adaptive Multimodal Transformers37 ו-MIAR38, הראו תוצאות מרשימות במידול תלויות חוצות-מודאליות. עם זאת, מודלים אלה עוסקים בעיקר בחיזוי וחסרים מנגנונים התומכים בפרשנות ברמת המאפיינים. לעומת זאת, המערכת המוצעת משלבת קשב חוצה-מודאלי מבוסס גרף עם מודול מיפוי ויזואלי, מה שמאפשר ניתוח שקוף של האינטראקציות בין המודאליות לרגשות. זהו היבט קריטי החסר כעת בספרות, שבה הסקת מסקנות רגשית נתפסת כתהליך של "קופסה שחורה".

המסגרת המוצעת הדגימה ביצועים עקביים על פני מערכי הנתונים של CH-SIMS ו-CMU-MOSEI. בעוד שלמסגרת עשויות להיות יישומים פוטנציאליים באינטראקציה חכמה בין אדם למכונה, ניטור רפואי, סביבות למידה אדפטיביות ומערכות אחרות המודעות לרגשות, המחקר הנוכחי העריך את השיטה רק תחת תנאי benchmark מבוקרים. לא בוצע פריסה בעולם האמיתי, הערכת ממשק משתמש, מחקר שמישות או הערכה של נבדקים אנושיים. לכן, היעילות המעשית של המסגרת בסביבות תפעוליות עדיין דורשת בדיקה. עבודה עתידית תתמקד בהערכות מכוונות-פריסה, מחקרים ממוקדי-משתמש, ניתוח השהיה (latency), הערכת צריכת זיכרון וביצועי אינטראקציה בזמן אמת.

יתרה מכך, השיפורים בביצועים על פני מאגרי נתונים מגוונים מבחינה תרבותית ולשונית מדגימים את תקפות המסגרת המוצעת. בניגוד לעבודות קודמות שתוקפו בוצע על מאגר נתונים בודד או תרחיש אינטראקציה ספציפי, המסגרת המוצעת מראה ביצועים חסונים על פני שפות, דוברים וביטויים רגשיים שונים. לפיכך, המסגרת המוצעת מתאימה מאוד למערכות אינטראקציה חכמות מעשיות הדורשות זיהוי רגשות מדויק וקבלת החלטות ניתנת לפירוש.

הפרשנות של המסגרת המוצעת הוערכה באמצעות ניתוח מבוסס ויזואליזציה של הייצוגים הרב-מודאליים שנלמדו. באופן ספציפי, נבחנו שיבוצי רגשות חבויים (latent emotion embeddings), מפות קשב חוצות-מודאליות, גרפים של אינטראקציה בין מודאליות ומסלולי רגש זמניים, כדי לספק תובנות לגבי תהליך קבלת ההחלטות של המודל ותרומת המודאליות השונות. מטרתו של מודול המיפוי הוויזואלי היא להגביר את השקיפות על ידי מתן אפשרות לצפייה באינטראקציות ברמת המאפיינים ובדינמיקה רגשית. עם זאת, מדדי פרשנות פורמליים, הערכות נאמנות לקשב (attention-faithfulness) ומחקרי משתמשים לא נכללו בעבודה הנוכחית. לפיכך, יש לפרש את יתרונות הפרשנות המדווחים כראיות מבוססות ויזואליזציה ולא כמדדי הסבריות שתוקפו הוכח כמותית.

מנקודת מבט תיאורטית, מחקר זה תורם את הדברים הבאים למחשוב רגשי מולטי-מודאלי: הוא מציע דרך שיטתית למידול רגשות המבדילה בבירור בין ייצוגים ספציפיים לרגש לבין ייצוגים ספציפיים למודאליות. על ידי הבטחת עקביות רגשית בין מודאליות שונות במרחב חבוי משותף, המסגרת המוצעת מקדמת את התיאוריה של למידת ייצוגים במערכות מולטי-מודאליות. השילוב של מנגנוני קשב מבוססי גרף מעגן באופן פורמלי יותר את התלויות בין המודאליות השונות בביטוי רגשות.

מנקודת מבט מעשית, המסגרת המוצעת מועילה מאוד לעיצוב אינטראקציה חכמה ולממשקי משתמש מודעי-רגש. מודול המיפוי הוויזואלי במסגרת המוצעת מאפשר למתכנני מערכות להבין את ההשפעה של מודליות שונות על חיזוי רגשות, דבר החשוב מאוד עבורם. המסגרת המוצעת מועילה מאוד ליישומים כגון סוכני שיחה רגשיים, מערכות למידה אדפטיביות, ממשקי ניטור רפואיים ופלטפורמות להערכת חווית משתמש.

עם זאת, למסגרת המוצעת ישנן מספר מגבלות. השימוש במנגנוני תשומת לב גרפיים (graph attention mechanisms) ובמקודדי טרנספורמר (transformer encoders) מוסיף מורכבות, שעלולה להיות בעייתית עבור מכשירים בעלי יכולות מוגבלות. יתרה מכך, המחקר הנוכחי מתעלם מאותות פיזיולוגיים אחרים, כגון EEG ומעקב עיניים, לטובת התמקדות במודליות חזותית, קולית וטקסטואלית. היעילות החישובית של המסגרת המוצעת לצורך פריסה בזמן אמת לא הוערכה באופן ספציפי, למרות העובדה שהיא השיגה ביצועי ניבוי תחרותיים ויכולת ויזואליזציה משופרת. מחקרים עתידיים יבחנו ביצועי פריסה בהקשרי אינטראקציה חכמה בעולם האמיתי, עיכוב בהסקה (inference delay), קיבולת עיבוד (throughput), צריכת זיכרון וטכניקות לדחיסת מודלים. כדי לשפר עוד יותר את דיוק מידול הרגשות ואת התגובתיות של האינטראקציה, מחקרים עתידיים יתמקדו בפיתוח מודלים קלילים, טכניקות אופטימיזציה לזמן אמת ושילוב של מודליות נוספות. ביצועי פריסה בזמן אמת לא הוערכו, והשילוב של מקודדי טרנספורמר ושיטות תשומת לב מבוססות גרפים מעלה את המורכבות החישובית. רק מערכי הנתונים הבנצ'מרק CH-SIMS ו-CMU-MOSEI שימשו לתיקוף המתודולוגיה, דבר שעלול להוביל להטיות ספציפיות למערכי הנתונים ולהגביל את היכולת להכליל את התוצאות לדומיינים, שפות ואוכלוסיות משתמשים אחרים. בנוסף, המחקר הנוכחי אינו כולל אותות פיזיולוגיים כמו נתוני EEG או מעקב עיניים; תחת זאת, הוא מתמקד במודליות חזותית, קולית וטקסטואלית. למרות שתיאורים מפורטים של המימוש ושל סביבת הסימולציה שיפרו את יכולת השחזור, קוד המקור ומודלים מאומנים מראש אינם זמינים כעת לציבור.

בעבודה זו נעשה שימוש במסגרת מיפוי חזותית חדשנית ללמידת מאפייני רגש רב-מודאליים עבור עיצוב אינטראקציה חכמה. השיטה המוצעת משלבת למידת ייצוג מבוססת transformer מקצה לקצה, מידול רגשות מופרד (disentangled emotion modeling) ותשומת לב חוצת-מודאליות מבוססת גרף, וזאת כדי להשיג דיוק חיזוי ופרשנות גבוהים. ניסויים על מאגרי הנתונים CH-SIMS ו-CMU-MOSEI מראים כי המסגרת המוצעת עולה בביצועיה על מודלים קיימים של זיהוי רגשות רב-מודאליים מבחינת דיוק ומדד F1-score. חשוב מכך, פתרון המיפוי החזותי המוצע מגשר על הפער שבין זיהוי רגשות לבין אסטרטגיית אינטראקציה, ומציע כיוון חדש לעיצוב של מערכות מחשוב רגשי רב-מודאליות המודעות לאינטראקציה וניתנות לפרשנות.

כדי להקל על עיצוב אינטראקציה חכם וניתן לפירוש, מחקר זה הציג מסגרת מיפוי ויזואלית חדשנית ללמידה של מאפייני רגש רב-מודאליים. המערכת המוצעת משלבת בהצלחה זיהוי רגשות ויכולת פירוש בתוך ארכיטקטורה אחת, על ידי שילוב של חילוץ מאפיינים רב-מודאליים מבוסס-transformer, למידה של ייצוג רגשי מופרד (disentangled), היתוך קשב חוצה-מודאליות מבוסס-גרף, ושיטות מיפוי ויזואלי. בנוסף למתן ייצוגים ויזואליים ברורים של תרומות המודאליות, אינטראקציות חוצות-מודאליות ודינמיקה רגשית זמנית, הערכה ניסיונית על מאגרי הנתונים CH-SIMS ו-CMU-MOSEI הראתה ביצועים משופרים לעומת שיטות בסיס מייצגות במספר מדדים, כולל Accuracy, Precision, Recall, F1-score ו-Mean Absolute Error (MAE). עם זאת, מחקרי פריסה בעולם האמיתי, הערכות ממוקדות-משתמש, הערכות כמותיות של יכולת ההסבר ושילוב של מודאליות פיזיולוגיות אינם כלולים במחקר זה, המוגבל להערכות על שני מאגרי נתוני ייחוס. יתרה מכך, סביבות עם משאבים מוגבלים עלולות להיתקל בקשיים בשל העלות החישובית של מקודדי transformer ותהליכי קשב מבוססי-גרף. בעוד שעבודות עתידיות יתמקדו בתיקוף נרחב יותר על מאגרי נתונים שונים, שילוב של מודאליות נוספות, מחקרי שמישות, שחרור משאבים ניתנים לשחזור ואופטימיזציה לתרחישי פריסה בזמן אמת, המסגרת המוצעת מראה באופן כללי את הפוטנציאל של ניתוח רגשות רב-מודאלי וניתן לפירוש עבור מחשוב רגשי (affective computing) ויישומי אינטראקציה חכמה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין ניגודי עניינים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מעוניינים להודות על התמיכה שניתנה על ידי בית הספר לדיור, בנייה ותכנון, Universiti Sains Malaysia, פנאנג, מלזיה, ובית הספר לאמנות העיצוב, Changsha University of Science & Technology, צ'אנגשה, סין. כמו כן, המחברים מביעים את הערכתם ל-Xiamen Academy of Arts and Design, Fuzhou University, שיאמן, סין, על תמיכתם האקדמית והמחקרית לאורך עבודה זו.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
Adamספריית PyTorch Optimizerhttps://pytorch-optimizers.readthedocs.io/en/latest/ (Learning Rate = 1 × 10-4)אופטימיזציה של פרמטרים במהלך אימון המודל
CH-SIMSמאגר הנתונים המקוריהגרסה הציבורית האחרונהסט נתוני ייחוס (Benchmark) לניתוח רגשות/סנטימנטים רב-מודאלי בסינית
CMU-MOSEIמאגר CMU Multimodal SDKhttps://github.com/CMU-MultiComp-Lab/CMU-MultimodalSDK (הגרסה הציבורית האחרונה)סט נתוני ייחוס (Benchmark) לזיהוי סנטימנטים ורגשות רב-מודאליים
Disentangled Emotion Encoderמימוש מותאם אישיתhttps://pytorch-geometric.readthedocs.io/en/latest/(ארכיטקטורת Dual Encoder)הפרדה בין ייצוגים חבויים (latent representations) ספציפיים לרגש וספציפיים למודאליות
Graph Attention Network (GAT)PyTorch GeometricMulti-head GAT (https://pytorch-geometric.readthedocs.io/en/latest/)מידול קשרים רגשיים חוצי-מודאליות ומיזוג מאפיינים אדפטיבי
Graph-Based Cross-Modal Attention Layerמימוש מותאם אישיתמיזוג Multi-Head Attentionלמידה של תלויות רגשיות ברזולוציה גבוהה בין מודאליות
Matplotlibפרויקט Matplotlib3.7+יצירת תרשימים ואנליזה ויזואלית
NetworkXפרויקט NetworkX3.0+בנייה וויזואליזציה של גרפים של אינטראקציות חוצות-מודאליות
NVIDIA GPUתאגיד NVIDIAGPU תומך CUDAהאצה של אימון רשתות טרנספורמר ורשתות עצביות גרפיות
Principal Component Analysis (PCA)Scikit-learnsklearn.decomposition.PCAהפחתה ראשונית של ממד השכבות (embeddings) הרגשיות רב-ממדיות
PythonPython Software Foundation3.8+שפת התכנות המרכזית להטמעת מסגרת ניתוח הרגשות הרב-מודאלית
PyTorchPyTorch Foundation2.0+פיתוח, אימון ואופטימיזציה של רשתות עצביות עמוקות
RoBERTaHugging Face Transformershttps://huggingface.co/docs/transformers/index (roberta-base, 768-dim embeddings)חילוץ ייצוגי רגשות לשוניים וסמנטיים בהקשר
Seabornפרויקט Seaborn0.12+יצירת מפות חום של קשב (attention heatmaps) וויזואליזציות סטטיסטיות
t-distributed Stochastic Neighbor Embedding (t-SNE)Scikit-learn
scikit-learn.org (Perplexity = 30, Iterations = 1000)
ויזואליזציה של אשכולות רגשיים חבויים ומסלולים
Ubuntu LinuxCanonical Ubuntu20.04 LTS או גרסה מאוחרת יותרסביבת הרצה ניסויית
Vision Transformer (ViT-Base)Google Research Vision TransformerViT-Base/16, 768-dim embeddingsחילוץ ייצוגים ויזואליים מודעי-רגש מתוך פריימים של וידאו
Wav2Vec 2.0Meta AI ResearchBase Model, 768-dim embeddingsחילוץ מאפייני רגש אקוסטים וקוליים בהקשר

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Zhu X, et al. EMVAS: End-to-end multimodal emotion visualization analysis system. Complex Intell Syst. 2025;11:1-15.
  2. Zhu X, et al. A client-server based recognition system: Non-contact single/multiple emotional and behavioral state assessment methods. Comput Methods Programs Biomed. 2025;260:108564.
  3. Lasri I, Riadsolh A, Elbelkacemi M. Facial emotion recognition of deaf and hard-of-hearing students for engagement detection using deep learning. Educ Inf Technol. 2023;28:4069-4092.
  4. Saibene A, Assale M, Giltri M. Expert systems: Definitions, advantages and issues in medical field applications. Expert Syst Appl. 2021;177:114900.
  5. Poria S, Cambria E, Bajpai R, Hussain A. A review of affective computing: From unimodal analysis to multimodal fusion. Inf Fusion. 2017;37:98-125.
  6. Chatterjee R, et al. Real-time speech emotion analysis for smart home assistants. IEEE Trans Consum Electron. 2021;67(1):68-76.
  7. Zhu X, Huang Y, Wang X, Wang R. Emotion recognition based on brain-like multimodal hierarchical perception. Multimed Tools Appl. 2024;83:56039-56057.
  8. Khan M, El Saddik A, Alotaibi FS, Pham NT. AAD-Net: Advanced end-to-end signal processing system for human emotion detection and recognition using attention-based deep echo state network. Knowl Based Syst. 2023;270:110525.
  9. Chaturvedi I, Chen Q, Cambria E, McConnell D. Landmark calibration for facial expressions and fish classification. Signal Image Video Process. 2022;16:377-384.
  10. Li D, Liu J, Yang Z, Sun L, Wang Z. Speech emotion recognition using recurrent neural networks with directional self-attention. Expert Syst Appl. 2021;173:114683.
  11. Zhu X, et al. A review of key technologies for emotion analysis using multimodal information. Cogn Comput. 2024;16:1504-1530.
  12. Wang R, et al. Multimodal emotion recognition using tensor decomposition fusion and self-supervised multitasking. Int J Multimed Inf Retr. 2024;13:39.
  13. Fan C, Lin J, Mao R, Cambria E. Fusing pairwise modalities for emotion recognition in conversations. Inf Fusion. 2024;106:102306.
  14. Williams J, Kleinegesse S, Comanescu R, Radu O. Recognizing emotions in video using multimodal DNN feature fusion. Proceedings of Grand Challenge and Workshop on Human Multimodal Language. Melbourne, Australia. 2018;10.18653/v1/W18-3302.
  15. Zhao Z, Wang Y, Wang Y. Multi-level fusion of Wav2Vec 2.0 and BERT for multimodal emotion recognition. arXiv. 2022;arXiv:2207.04697.
  16. Middya AI, Nag B, Roy S. Deep learning based multimodal emotion recognition using model-level fusion of audio-visual modalities. Knowl Based Syst. 2022;244:108580.
  17. Maithri M, et al. Automated emotion recognition: Current trends and future perspectives. Comput Methods Programs Biomed. 2022;215:106646.
  18. Wu Y, Mi Q, Gao T. A comprehensive review of multimodal emotion recognition: Techniques, challenges, and future directions. Biomimetics. 2025;10(4):418.
  19. Zheng S, Zhang X, Liu Y, Li Z. CMFF: A cross-modal multi-layer feature fusion network for multimodal sentiment analysis. Appl Soft Comput. 2025;184(Pt B):113868.
  20. Yan L, Shi Y, Wei M, Wu Y. Multi-feature fusing local directional ternary pattern for facial expressions signal recognition based on video communication system. Alex Eng J. 2023;63:307-320.
  21. Guo X, Zhang Y, Lu S, Lu Z. Facial expression recognition: A review. Multimed Tools Appl. 2024;83(8):23689-23735.
  22. Liu ZT, Han MT, Wu BH, Rehman A. Audio emotion recognition based on convolutional neural network with attention-based bidirectional long short-term memory network and multitask learning. Appl Acoust. 2023;202:109178.
  23. Mirsamadi S, Barsoum E, Zhang C. Automatic audio emotion recognition using recurrent neural networks with local attention. 2017 IEEE International Conference on Acoustics, Speech and Signal Processing (ICASSP), New Orleans, LA, USA. 2017; 10.1109/ICASSP.2017.7952552.
  24. Gu T, He Z, Zhao H, Li M, Ying D. Aspect-based sentiment analysis with multi-granularity information mining and sentiment hint. Expert Syst Appl. 2024;252:124104.
  25. Shen W, Chen J, Quan X, Xie Z. DialogXL: All-in-one XLNet for multi-party conversation emotion recognition. Proc AAAI Conf Artif Intell. 2021;35(15):13789-13797.
  26. Kim T, Vossen P. EmoBERTa: Speaker-aware emotion recognition in conversation with RoBERTa. arXiv. 2021;arXiv:2108.12009.
  27. Li S, Yan H, Qiu X. Contrast and generation make BART a good dialogue emotion recognizer. Proc AAAI Conf Artif Intell. 2022;36(10):11002-11010.
  28. Zhu J, Yu J. MIAR: Modality interaction and alignment representation fusion for multimodal emotion. arXiv. 2026;arXiv:2601.02414.
  29. Praveen RG, Granger E, Cardinal P. Cross attentional audio-visual fusion for dimensional emotion recognition. 2021 16th IEEE International Conference on Automatic Face and Gesture Recognition (FG 2021), Jodhpur, India. 2021;10.1109/FG52635.2021.9667055.
  30. Salas-Cáceres J, López M, Martínez A, Rodríguez P. Multimodal emotion recognition based on a fusion of audio-visual information with temporal dynamics. Multimed Tools Appl. 2025;84:27327-27343.
  31. Fu J, Zhang Y, Wang L, Chen H. TMFN: A text-based multimodal fusion network with multi-scale feature extraction and unsupervised contrastive learning for multimodal sentiment analysis. Complex Intell Syst. 2025;11:133.
  32. Tuerhong G, Fu F, Wushouer M. Adaptive multimodal transformer based on exchanging for multimodal sentiment analysis. Sci Rep. 2025;15:27265.
  33. Gupta C, Sharma R, Patel S, Verma A. A multimodal fusion model for real-time environment emotion recognition using audio-visual-textual features. J Big Data. 2025;12:256.
  34. Yu W, Li X, Zhang H, Wang Z, Liu Z. CH-SIMS: A Chinese multimodal sentiment analysis dataset with fine-grained annotation of modality. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics. 2020; 10.18653/v1/2020.acl-main.343.
  35. Zadeh A, et al. Multimodal language analysis in the wild: CMU-MOSEI dataset and interpretable dynamic fusion graph. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics, Melbourne, Australia. 2018; 10.18653/v1/P18-1208.
  36. Zadeh A, Chen M, Poria S, Cambria E, Morency LP. Tensor fusion network for multimodal sentiment analysis. arXiv. 2017;arXiv:1707.07250.
  37. Tsai YHH, Bai S, Yamada M, Morency LP, Salakhutdinov R. Multimodal transformer for unaligned multimodal language sequences. Proceedings of the 57th Annual Meeting of the Association for Computational Linguistics, Florence, Italy. 2019; 10.18653/v1/P19-1656.
  38. Moreno M, Rioseco P, Van Den Bosch H. Spectrum of the linearized Vlasov–Poisson equation around steady states from galactic dynamics. arXiv. 2023;arXiv:2305.05749.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

TransformerDisentangled Representation

מאמרים קשורים