$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
הארכיטקטורה המוצעת להרחבת שיתוף הפעולה בין אדם לבינה מלאכותית משתמשת בצינור אינטראקציה רב-מודלי אדפטיבי המשלב מודאליות ראייה ודיבור במסגרת הסקה דינמית והיררכית. מחקר זה השתמש בנתונים זמינים לציבור מניסויים שפורסמו בעבר. לא היו מעורבים נבדקים אנושיים חדשים, ולא נדרשה אישור אתי נוסף.
ארכיטקטורת אינטראקציה מולטימודלית אדפטיבית מוצעת
בעיקרון, המערכת מתחילה במודולי תפיסה, כגון זרם ויזואלי לוכד תנוחת ותנועה של המשתמש באמצעות חיישני RGB-D, וזרם שמע מנתח קלטי דיבור באמצעות מנוע ASR (זיהוי דיבור אוטומטי) קל משקל. קלטים גולמיים כאלה מוזנים למודול חיזוי הפעולות המבוסס על טרנספורמר, שמקודד תלות זמנית ברצפי תנוחה ופקודות כדי להבין פעולות אנושיות ברמה נמוכה. בהמשך, כדי לאפשר תכנון שיתופי פעולה ברמה גבוהה, מנגנון עיוות זמן דינמי (DTW) מיישר את הפעולות שזוהו עם צמתים בגרף משימות מוגדר מראש כדי לחזות מטרות המשתמש ופעולות הבאות. מודול מיזוג מבוסס קשב חדש מחליט, בכל צעד זמן, איזו מודאליות (אודיו או חזון) מספקת את המידע החשוב ביותר מבחינה קונטקסטואלית ומכוון את משקלי הקלט באופן דינמי. כדי להתאים את האינטראקציה באופן אישי, המערכת כוללת התאמת מודלים מקוונים, תוך התאמת מנבאי פעולה בזמן אמת לשינוי התנהגות המשתמשים. מודול הסבר קל גם יוצר סיכומים ידידותיים למשתמש של כוונות צפויות והחלטות בינה מלאכותית לשיפור השקיפות והאמון. כל המערכת נבדקת בסביבת הרכבה שיתופית מדומה אך מהעולם האמיתי, המאפשרת השוואה בין סביבות חד-מודליות ורב-מודליות אדפטיביות. גישה כזו מאפשרת שיתוף פעולה גמיש, אינטואיטיבי ואמין יותר עם סוכני בינה מלאכותית בכל התחומים.
איור 1 מציג את הארכיטקטורה של מסגרת האינטראקציה הרב-מודלית האדפטיבית המתוארת, שמטרתה לשפר את שיתוף הפעולה בין אדם לבינה מלאכותית. הוא מתחיל בשלב רכישת הקלט, המבוסס על שני מכשירי חישה עיקריים: מצלמת RGB-D לצפייה במידע חזותי משופר בעומק (למשל, יציבה ותנועה) ומיקרופון כיווני לאיסוף פקודות דיבור. אותות גולמיים מועברים לאחר מכן דרך מודול Pre-Processing, שמעבד את נתוני האודיו-ויזואליים לניתוח נוסף על ידי ניקוי, נרמול ועיצוב זרמי הקלט. לאחר מכן, הצינור ממשיך לשלב חילוץ תכונות, שבו הנתונים מחולקים לשני זרמים: הזרם הוויזואלי, שמבודד תכונות תנוחה ותנועה באמצעות אלגוריתמים להערכת תנוחה, וזרם האודיו, שמתמלל את הדיבור להטמעות פקודות ניתנות לפענוח. מקודד טרנספורמר רב-מודלי, המשתמש בתשומת לב עצמית רב-ראשית ובקידוד מיקום זמני כדי לבטא תלות הדדית לטווח ארוך בין רצפי אינטראקציה, מעבד לאחר מכן את הייצוג המאוחד. מצב המטרה הנוכחי של המשתמש מוערך על ידי כוונת אופק ארוך ומנבא התקדמות משימה, ופעולות ברמה נמוכה ממופות לצמתים בגרף משימות היררכי למעקב אמין אחר משימות באמצעות מודול יישור מבוסס DTW. משקלי המיזוג ופרמטרי החיזוי מתעדכנים באופן רציף באמצעות לולאת התאמת מודלים מקוונת בתגובה למשוב אינטראקציה, ומודול הסבר מספק הסברים ברורים לקידום פתיחות וביטחון. כל הצינור מאפשר למערכת לעבוד יחד באופן אדפטיבי ויעיל עם המשתמשים במשימות וסביבות דינמיות.

איור 1: סקירה של מסגרת האינטראקציה המולטימודלית המוצעת המבוססת על טרנספורמרים. טכניקה מונחית קשב משמשת לקידוד ואינטגרציה דינמית של נתונים ויזואליים ושמיעתיים. מודול טרנספורמר, המשלב מידול היררכי של משימות והתאמה מקוונת, מעבד את הייצוג המאוחד לחיזוי כוונת אופק ארוך והערכת התקדמות במשימה. . אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
המערכת המוצעת משלבת מודול הסבר קל משקל שפועל בשילוב עם רכיבי המיזוג הרב-מודלי ותכנון היררכי לשיפור השקיפות וביטחון המשתמש. המודול מפיק רמזים ניתנים לפירוש מיישור גרף המשימות מבוסס DTW (למשל, התקדמות המשימה הנוכחית והפעולה הבאה הצפויה בדיוק) ומשכבת המיזוג מבוססת הקשב (למשל, משקלי חשיבות מודאליות). רמזים אלו מומרים להסברים מובנים לבני אדם, כמו האם פקודות מדוברות או מחוות חזותיות השפיעו בעיקר על בחירת מערכת וכיצד הפעולה הצפויה משתלבת בתוכנית העבודה הרחבה יותר. המשתמשים מקבלים הסברים בצורת משוב כתוב או חזותי תמציתי, המסייע להם להבין, לחזות ואם יש צורך, לתקן את התנהגות המערכת. שיפור שביעות הרצון של המשתמשים, חלקות האינטראקציה ומדדים הקשורים לאמון שצוינו בהערכה הם אינדיקטורים עקיפים לתפיסת המשתמש לגבי ההסברות. הממצאים מרמזים שבאינטראקציה ארוכת טווח בין אדם לבינה מלאכותית, חשיבה שקופה להחלטות בינה מלאכותית מגבירה את ביטחון המשתמש, מקלה על שיתוף פעולה ומגבירה את קבלת התנהגות המערכת האדפטיבית.
נתוני קלט
רכישת קלט במסגרת המתוכננת לשיתוף פעולה בין אדם לבינה מלאכותית מתבצעת באמצעות מנגנון חישה רב-מודלי מובנה המשלב גם מודאליות ראייה וגם שמיעה כדי לממש ביעילות פעולות וכוונות אנושיות. קלט חזותי מתקבל באמצעות מצלמת RGB-D, שלוכדת מידע בזמן אמת על תנוחות של בני אדם, מיקום מרחבי והקשר של הסביבה. נתונים ויזואליים מעובדים באמצעות מודלים מאומנים מראש כמו BlazePose כדי לקבל נקודות מפתח מעניינות בגוף העליון למשימות אינטראקציה. במקביל, מידע שמיעתי מתקבל ממיקרופון כיווני ומתפורש באמצעות מודל DeepSpeech מאומן מראש כדי לזהות פקודות דיבור שמבחנות או מספקות רמזים ויזואליים לא ודאיים נוספים. בהקשרים שיתופיים, מערכת הקלט הכפול מציעה התאמה דינמית ותפיסה מודעת להקשר. מאגר הנתונים של ההדרכה וההערכה כולל יותר מ-5,000 מסלולי תנועה מולטימודליים של בני אדם,1, למגוון פעילויות אינטראקציה, כגון התנהגויות הרכבה והעברה, שנאספו מארבעה משתמשים בסביבות מבוקרות וחצי-מובנות. כדי לשפר את ההכללה, המערכת מאפשרת התאמת מודל מקוונת בפריסה, מה שמאפשר למודל לעדכן את התחזיות בזמן אמת בהתאם לשינוי התנהגות המשתמש ודינמיקה סביבתית.
תיאור מערך הנתונים
מאגר הנתונים של האימון וההערכה למסגרת המוצעת התקבל מניסויי שיתוף פעולה אמיתי בין אדם לרובוט במסגרת משימת הרכבת רכב צעצוע באמצעות רובוט KINOVAGEN3 1. הסביבה הניסיונית נועדה לחקות פעילויות שיתופיות ארוכות טווח הכוללות אינטראקציה רב-מודלית, שכללה גם מודאליות ויזואלית וגם שמיעתית. בפרט, מאגר הנתונים של האימון מורכב מ-3,003 רצפים של מסלולים משני משתמשים, ומאגר הבדיקה מכיל 2,088 רצפים, כולל נתונים משני משתמשים חדשים להערכת הכללת המודל. כל מסלול מתעד רצף של 5 שלבים של נקודות מפתח בתנוחת הגוף העליון שנאספו באמצעות BlazePose, יחד עם פקודות דיבור מתאימות שהועתקו על ידי DeepSpeech33. הנתונים שנאספו מתארים שונות טבעית אנושית בתנועות ובביטוי פקודות בפעילויות הכוללות מסירת חפצים, שימוש בכלים ופעולות שיתופיות. מאגר הנתונים הרב-מודלי הוא הבסיס ללמידה מפוקחת של מודלי הפעולה וחיזוי המסלול של DLinear ומהווה את המדד המרכזי במחקרי משתמשים בתנאי ראייה בלבד, אודיו בלבד ורב-מודאליים. שילוב סוגים שונים של משתמשים ותנאי רעש ריאליסטיים מבטיח עמידות ובדיקות התאמה למערכות HRC קבועות. טבלה 2 מציגה את התיאור המפורט של מערך הנתונים.
| תכונות | פרטים |
| שם מאגר הנתונים | מאגר נתוני הרכבת רכבי צעצועים (נאסף בתוך החברה) |
| סביבת האיסוף | ניסוי HRC אמיתי עם זרוע KINOVA GEN3 |
| מספר המשתמשים (הכשרה) | 2 משתמשים |
| מספר המשתמשים (בדיקות) | 4 משתמשים (2 מהסט האימון, 2 לא נראים) |
| מסלולים כוללים (אימונים) | 3,003 מסלולים |
| מסלולים כוללים (בדיקות) | 2,088 מסלולים |
| מודליות שנתפסו | ויזואלי (RGB-D לתנוחה), אודיו (פקודות דיבור) |
| פורמט הנתונים | נקודות מפתח בפוזה (מ-BlazePose), פקודות דיבור לטקסט |
| רזולוציה זמנית | כל מסלול כולל 5 צעדי זמן |
| משימות מכוסות | 3 משימות עיקריות: איסוף והנחה, סיבוב עצמים, הרכבה שיתופית |
| שימוש | אימון מפוקח של מודלים לחיזוי פעולה/מסלול; מחקר משתמשים |
טבלה 2: תיאור מאגר נתונים. מידע על סביבת הסימולציה, כולל מסגרת תכנות, הגדרות חומרה וסביבת הערכה.
עיבוד מוקדם של מערך נתונים
כדי לאפשר אינטראקציה מולטימודלית אדפטיבית בשיתוף פעולה בין אדם לבינה מלאכותית, מערך הנתונים הגולמי, כגון נתונים ויזואליים (RGB ותמונות עומק), נתוני שמיעה (פקודות דיבור) והתנהגות זמנית (נקודות מפתח של תנוחות), עוברים עיבוד מובנה. נתונים ויזואליים מופקים תחילה באמצעות מודל הערכת תנוחה fפוזה, שלרוב נגזר מ-BlazePose או OpenPose. עבור מסגרת t, וקטור תנוחת האדם מוגדר כך:
(1)
כאשר k הוא מספר נקודות המפתח וכל נקודת מפתח מכילה קואורדינטות דו-ממדיות. הרצפים מנורמלים לפי אורך הגוף ומוחלקים לאורך זמן באמצעות מסנן סביצקי-גולאי:
(2)
כאשר w הוא גודל חלון הסינון. שנית, זרמי אודיו גולמיים ב-At נחתכים לקטעים באמצעות גלאי פעילות קולית (VAD). מקטעים אמינים מוזנים למודל זיהוידיבור של דיבור, (למשל, DeepSpeech) כדי לשלוף אסימוני פקודה:
(3)
כאשר V הוא אוצר המילים של פקודות מוכרות. לאינטגרציה, אסימוני פקודה עבור כולם מיושרים בזמן לחותמות זמן של תנוחה ויזואלית באמצעות פונקציית יישור מבוססת אינטרפולציה τ:
(4)
שלישית, כדי ליצור רצפי
אימון כוונה זמניים , נגדיר רצפי מסלול , יחד עם פקודות
דיבור נלוות. חלונות אלו מחולקים למקטעים באורך קבוע באמצעות חלונות הזזה בגודל l:
(5)
(6)
לבסוף, הקלטים מנורמלים לממוצע אפס ושונות יחידה לכל ממד נקודת מפתח עבור התכנסות במודלים מבוססי מסלול:
(7)
כאשרμ j, σj הם ממוצע וסטיית תקן של נקודת מפתח j שהשלימו את קבוצת האימונים.
חילוץ תכונות
בפרדיגמת האינטראקציה המולטימודלית האדפטיבית המתוארת, שיתוף פעולה חזק ובזמן אמת מתאפשר על ידי שילוב תכונות ויזואליות, אודיו והקשריות של משימות. צינור חילוץ התכונות מתחיל באיסוף נתונים מקבילי משני מודאליות עיקריות: אותות
ויזואליים ואותות
שמע, שמאונדקסים בשלב הזמן t. תצפיות אלו עוברות דרך מודולי תפיסה תואמים כדי לקבל תכונות סמנטיות ברמה גבוהה הקשורות להתנהגות אנושית, כוונה ופקודת דיבור.
חילוץ תכונות ויזואליות
הנתונים
הוויזואליים הגולמיים ממצלמות RGB-D מוזנים דרך מעריך תנוחה אנושי (למשל, BlazePose), המספק וקטור
נקודת מפתח מרחבי , כאשר k מייצג את מספר נקודות המפתח שזוהה וכל אחת מכילה קואורדינטות תלת-ממדיות:
(8)
נקודות מפתח אלו מוטמעות-זמן במסלול
תנוחה , שממנו מופקות דינמיקת תנועה באמצעות פירוק עונתי מגמה:
(9)
כאשר ∈_t מייצג את הרעש השארי.
חילוץ תכונות אודיו
קלט
האודיו מעובד באמצעות מודל זיהוי דיבור מאומן מראש (למשל, DeepSpeech) ומייצר ייצוג
פקודה טוקני , כאשר n הוא אורך הטוקן:
(10)
היתוך רב-מודלי
כדי לבנות הקשר אינטראקציה מאוחד, אנו משלבים את התכונות באמצעות תשומת לב משוקללת על סמך המבוסס על ביטחון ומידע הדדי:
(11)
כאשרφ V ו-φA הן פונקציות ההקרנה של תכונות חזותיות ושמיעתיות למרחב סמוי משותף,ו-α t∈[0,1] הוא מונח משקל מודאליות דינמי המחושב על בסיס אנטרופיה:
(12)
כאן,
ו
- הם מידע הדדי בין מצב המטרה g למודאליות שנצפה.
תכנון באמצעות הטמעה קונטקסטואלית
וקטור התכונה הרב-מודלי האחרון Ft מועשר בהקשר המשימה ובהתקדמות Pt והופך לקלט מצב למודול התכנון האדפטיבי:
(13)
תכונה שהופקה xt משמשת כקלט למודלים של חיזוי כוונה ותכנון תנועה במורד הזרם, ותומכת בשיתוף פעולה אדפטיבי וחזק בין אדם לבינה מלאכותית בסביבות דינמיות ובלתי ודאיות.
חיזוי פעולה ותוכנית באמצעות יישור גרף משימות
לאחר תהליך חילוץ תכונות רב-מודלי, שבו נתוני כוונת דיבור (אודיו), מסלול תנוחה (חזותי), והקשר (למשל, יומני משימות או רגש) משולבים בעיבוד הבא כולל חיזוי פעולה אנושית אדפטיבית והסקת תוכנית באמצעות יישור גרפי משימות היררכי.
יהי וקטור התכונות המולטימודלי המשולב בצעד הזמן t מיוצג כך:
(14)
המערכת חוזה בתחילה את הפעולה האנושית ברמה הנמוכה באמצעות פונקציה f act, שלעיתים מיוצגת כמקודד-מפענח חוזר או טרנספורמר:
(15)
כאשר F(t-k:t) מציין את רצף ההיתוך של התכונות ב-k צעדי הזמן האחרונים, ו
- הוא הפעולה החזויה מתוך קבוצת הפעולות A. המודול מחובר לאינטרנט ומכוון במדויק על ידי אובדן אדפטיבי:
(16)
כאן, CE הוא אובדן אנטרופיה חוצה של סיווג פעולה, ואז האיבר השני דוחף את חיזוי המסלול העתידי הטוב.
לחיזוי תוכנית ברמה גבוהה, אנו ממסגרים את המשימה כהתקדמות לאורך גרף משימה היררכי G = (N, E), שבו כל צומת ni ∈N מסמן תת-משימה או מטרה ביניים. המטרה היא להתאים את רצף הפעולות הנצפה לנתיב משימה ייחוס R*∈G על ידי הפחתת המרחק:
(17)
כאשר Pt מציין את מסלול ההתקדמות הנוכחי ו-d(⋅) מציין את מרחק עיוות הזמן הדינמי (DTW) או מדד יישור רך.
הכוונה
האולטימטיבית ברמת התוכנית נגזרת על ידי הקרנת הפעולה החזויה a ̂_t על הצעד הבא הסביר ביותר במסלול
המיושר:
(18)
פענוח היררכי זה מבטיח שגם עם קלט חושי לא ברור או רועש, המערכת בוחרת את הכוונה הגבוהה הרמה הרלוונטית ביותר בהתאם לרצף המשימות הנוכחי. תכנון חיזוי זה לא רק משפר את יעילות שיתוף הפעולה, אלא גם משפר את הציפייה והיכולת להסתגל בתוך אינטראקציה רב-תורית בין אדם לבינה מלאכותית.
מנגנון מיזוג רב-מודלי (מבוסס קשב)
בשיתוף פעולה אדפטיבי בין אדם לבינה מלאכותית, אינטגרציה רב-מודלית של מספר מודאליות חושיות (למשל, ויזואלית: תנוחת אדם, מסלול; שמיעה: פקודות דיבור) היא הכרחית לפרשנות נכונה של כוונת המשתמש. גישה מבוססת כללים או מיזוג סטטי אינה יכולה להתמודד עם אינטראקציות אנושיות דינמיות בעולם האמיתי. לשם כך, מוצג כאן מנגנון מיזוג המבוסס על תשומת לב כדי לשקול כל מודאליות באופן דינמי בהתאם לחשיבותה ההקשרית בכל שלב זמן.
נסמן את וקטורי התכונה שהופקו מהמודאליות הוויזואלית והקולית כ-
ו
- , בהתאמה. וקטורים אלה מקודדים מידע סמנטי שהושג דרך צינורות עיבוד קודמים, לדוגמה, תכונות ויזואליות עשויות להיווצר מהערכת פוזה וחיזוי פעולה, בעוד שתכונות שמע עשויות להיגזר מהטמעות-דיבור באמצעות מודלים כמו DeepSpeech או wav2vec.
המטרה של מיזוג מבוסס קשב היא לחשב משקלי קשב ספציפיים למודאליות הלכודים את המשמעות היחסית של כל מודאליות. זה נעשה באמצעות מנגנון קשב רך.
חישוב קשב-משקל
בשלב הראשון, שני הוקטורים הופכים למרחב קשב משותף באמצעות טרנספורמציה שניתן ללמוד. כלומר, עבור כל מודאליות i∈{V,A}, ציון הקשב הביניים מחושב כך:
(19)
כאשר
ו-
הם פרמטרים ניתנים ללמידה ברשת קשב, ו-tanh היא פונקציית הפעלה לא ליניארית. המרה זו מאפשרת למודל להפיק מתאמים ברמה גבוהה ובולטות קונטקסטואלית של כל מודאליות.
ציוני קשב לא מנורמלים אלה eV ו-αA מנורמלים עם פונקציית softmax כך שהם מסתכמים ל-1
(20)
כאן,α V ו-αA הם משקלי הקשב על המודאליות הוויזואלית והקולית, בהתאמה. המשקלים אדפטיביים ואז מתעדכנים לאורך זמן בהתאם להקשר המשימה הקיים, איכות האות ופעילות המשתמש.
(21)
הייצוג
המאוחד המתקבל מתקבל כשילוב משוקלל של וקטורי מודאליות הקלט:
וקטור משולב זה מקודד את הסמנטיקה המשותפת של המידע החזותי והשמיעתי באופן שמדגיש באופן פעיל את הזרם המידעי ביותר. לאחר מכן הוא מוזן למודולים במורד הזרם כמו התאמת גרף המשימות, חיזוי כוונה או מנוע תכנון תנועת רובוט.
אלגוריתם 1: מיזוג מבוסס קשב רב-מודלי
קלט: וקטור תכונה ויזואלית הוא hV∈Rd, וקטור תכונות האודיו הוא hA∈Rd
פרמטרים ניתנים ללמידה: W∈Rk*d,w∈Rk ו-b∈Rk
פלט: ייצוג מותך hמאוחד∈Rd.
שלב 1: קביעת ייצוגים ביניים על ידי חישוב באמצעות משוואה 19
שלב 2: השתמש ב-Softmax כדי לנרמל ציוני קשב באמצעות משוואה 20
שלב 3: חשב את הווקטור המאוחד באמצעות משוואה 21
שלב 4: החזרת hמותך
אלגוריתם Focus-Based Multimodal Fusion מספק אמצעי למיזוג חכם של תכונות של מודאליות קלט שונות, כגון זרמים ויזואליים וקוליים, יחד באופן מודע להקשר. מיזוג חיוני במערכות שבהן כל מודאליות מציגה מידע משלים אך משתנה, כמו בסביבות שיתופיות בין אדם לבינה מלאכותית שבה הראייה לוכדת מחוות או מיקום גוף והאודיו לוכד פקודות דיבור או אותות קוליים.
האלגוריתם 1 מתחיל בקביעת ייצוגים ביניים לכל מודאליות. כדי לחשב את שני המודלים הללו, eV לזרימה הוויזואלית ו-eA עבור זרם האודיו, שכבת רשת עצבית משותפת מבצעת תחילה טרנספורמציה לא ליניארית על וקטורי התכונה המתאימים. לאחר מכן, משקלי הקשב αV ו-αA מחושבים על ידי ביצוע פונקציית softmax על הציונים הביניים. זה עוזר שהמשקלים יהיו חיוביים ומסתכמים ל-1, מה שגורם בעצם לנורמליזציה את התרומות מכל מודאליות. ככל שהמודליות היא אינפורמטיבית יותר, כפי שמודל, כך משקל תשומת הלב שלה גדול יותר.
בסופו של דבר, האלגוריתם מחשב את התיאור הממוזג hהמאוחד באמצעות שילוב משוקלל של וקטורי הגרפיקה והקול, המנורמל לפי משקלי הקשב שלהם. וקטור מאוחד זה משלב את שתי השיטות באופן מונע נתונים ורגיש להקשר, ומשמש למשימות בהמשך כמו זיהוי כוונות, קבלת החלטות או תכנון תנועת רובוט. בסך הכול, אלגוריתם זה מאפשר למערכת להתמקד דינמית במודאליות או בשילוב המודאליות הרלוונטי ביותר ברגע מסוים, במקום להשתמש בגישות מיזוג קבועות או מבוססות כללים. זה הופך את המסגרת לחזקה, גמישה ומגיבה יותר במצבי אינטראקציה דינמיים בין אדם לבינה מלאכותית.
איור 2 ממחיש את תהליך העבודה של מנגנון מיזוג מולטימודלי מבוסס קשב, הפועל באינטגרציה רגישה להקשר של קלטים ויזואליים ושמיעתיים. חילוץ תכונות חזותי, השלב הראשון בזרימת העבודה, כולל חילוץ תכונות מרחביות או הקשורות לתנוחה מתמונות קלט או וידאו (כגון מצלמות RGB-D). אלו מוקלטים לאחר מכן למודול קשב חזותי שלומד להדגיש את התוכן האינפורמטיבי ביותר של המידע החזותי. במקביל, מודולי Audio Attention מעבדים הטמעות-דיבור או אסימוני שמע מפקודות מדוברות, ומייחסים משמעות קונטקסטואלית לאותות שמיעתיים שונים. התכונות המושקלות לפי תשומת לב מתקבלות משולבות דרך שכבת מיזוג מבוססת קשב ומועברות לרשת הזנה קדימה לפי מיקום עם חיבורים שאריים ונרמול שכבה, ויוצרות בלוק מקודד טרנספורמר סטנדרטי. הפלט הוא הטמעה מולטימודלית מאוחדת התומכת בחיזוי כוונות אופק ארוך חזק וקבלת החלטות אדפטיבית בתנאי אינטראקציה משתנים. עיצוב זה מאפשר למערכת להתרכז באופן סלקטיבי במודאליות החזקה יותר בכל רגע, ולשפר את החוסן והיכולת לפרשנות באינטראקציה בזמן אמת בין אדם לבינה מלאכותית.

איור 2: המבנה המפורט של מודול ההיתוך הרב-מודלי מונחה קשב. כדי ליצור ייצוג מאוחד מודע להקשר בכל שלב זמן, מקודדים ספציפיים למודאליות אוספים תכונות מזרמים ויזואליים ושמיעתיים. תכונות אלו משוקללות דינמית באמצעות מנגנון קשב מונחה נתונים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.
התאמת מודלים מקוונים
כדי להבטיח שיתוף פעולה איכותי בין אדם לבינה מלאכותית תחת התנהגויות והקשרים שונים של משתמשים, המסגרת שלנו משלבת מנגנון התאמת מודלים מקוון שממקסם בהדרגה מודלים ספציפיים למשתמש במהלך האינטראקציה. המודול עוקב אחרי אותות התנהגות בזמן אמת (למשל, תנועה, מסלולי מחוות, טון דיבור) ועדכון את המודלים החיזויים הבסיסיים עם אלגוריתמים ללמידה הדרגתית. במיוחד, מודלים של חיזוי מסלול וזיהוי כוונות מותאמים עם קלט עדכני באמצעות כיוונון עדין מבוסס גרדיאנט או התאמת דרגה נמוכה (LoRA), כך שהמערכת תוכל להסתגל לשינויים בהתנהגות המשתמש או לדרישות ספציפיות למשימה מבלי לעבור הכשרה מלאה.
שכבת המשוב פועלת בהרמוניה יחד עם התאמה באמצעות משוב מרומז (למשל, תיקונים, היסוסים, עיכובים) ופקודות מפורשות (למשל, דיבור או ממשק גרפי). יש לו שתי מטרות: כיול אדפטיבי של הבולטות של רמזים מולטימודליים, והעברת מדדי אמון/ביטחון למודולי ההחלטה והבקרה.
מחזור המשוב מאפשר ביצוע חלק יותר של משימות ותגובות מוכוונות משתמש. כדי לטפח אמון ושקיפות, המסגרת משלבת מודול הסבר שמתרגם החלטות מודל ברמה נמוכה להצדקות מובנות לאדם. הוא משתמש במפות רציונל משנאי מיזוג רב-מודלי, בתוספת מעקב לוגי דרך גרף המשימות. ניתן להציג את ההיגיון הזה באמצעות ממשק גרפי או עזר שמיעתי כדי לאפשר למשתמשים להבין ואולי אפילו לתקן התנהגות מערכתית.