מאמר מחקר

עיצוב מסגרות אינטראקציה מולטימודליות אדפטיביות לשיפור שיתוף הפעולה בין אדם לבינה מלאכותית

DOI:

10.3791/69830

24 בפברואר 2026

במאמר זה

סיכום

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

עבודה זו מציעה מנגנון יישור היררכי המבוסס על עיוות זמן דינמי (DTW) עם התאמה מקוונת ומיזוג מולטימודלי מונע קשב, המאפשר חיזוי כוונות ומשימות אמינות באופק ארוך. מודול הסבר קל משפר את הפרשנות, ומטפח אמון בשיתוף פעולה בין אדם לבינה מלאכותית. הגישה מתרחבת הן למערכות אינטראקטיביות רובוטיות והן למערכות אינטראקטיביות וירטואליות.

תקציר

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

השגת שיתוף פעולה יעיל וטבעי בין אדם לבינה מלאכותית נותרת אתגר מרכזי, במיוחד בסביבות דינמיות בעולם האמיתי. המסגרות הקיימות מוגבלות לעיתים קרובות על ידי קלטים חד-מודליים נוקשים או מיזוג רב-מודלי מבוסס כללים, מה שמגביל את החוסן שלהן, ההתאמה האישית והגמישות שלהן. מחקר זה מציג מסגרת אינטראקציה רב-מודלית אדפטיבית המשלבת הערכת תנוחה מבוססת ראייה והבנת פקודה מבוססת דיבור בתוך מודל היררכי לחיזוי כוונה אנושית. המסגרת משתמשת במודלים מבוססי טרנספורמר לחיזוי פעולות ועיוות זמן דינמי כדי ליישר את התנהגות האדם עם גרפים מובנים לתכנון ארוך טווח. בניגוד לגישות קודמות שהסתמכו על החלפת מודאליות סטטית, הארכיטקטורה שלנו מיישמת מנגנון היתוך מבוסס קשב כדי לשקול דינמית את הקלטים המידעיים ביותר. יתרה מזאת, מודול התאמה מקוון מאפשר התאמה בזמן אמת להתנהגות המשתמש, בתוספת שכבת הסבר קלה לטיפוח אמון המשתמשים. ההערכה הניסויית במשימת הרכבה שיתופית מראה שיפורים משמעותיים בביצועי המשימה (עד 24%), דיוק חיזוי כוונה (עד 18%) ובשביעות רצון המשתמשים. תוצאות אלו מדגישות את היעילות והגמישות של מסגרות האינטראקציה הרב-מודליות האדפטיביות, ותומכות בפוטנציאל שלהן לקדם אינטליגנציה שיתופית לעבר מערכות בינה מלאכותית אמינות, שקופות וממוקדות בבני אדם.

מבוא

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

שיתוף פעולה בין אדם לרובוט (HRC) הוא אחד מתחומי המחקר החשובים, במיוחד מכיוון שרובוטים מופעלים יותר ויותר בסביבות ממוקדות אדם. בעוד שמסגרות וטכנולוגיות ל-HRC לטווח קצר השתפרו משמעותית 1,2, HRC לטווח ארוך עדיין לא בשלה3. ביישומים תעשייתיים, ניצול HRC לטווח ארוך יכול להוביל לעלייה בולטת בפרודוקטיביות ובגמישות בתהליכי ייצור מורכבים4. בסביבה ביתית, רובוטים כחברים או כסוכני טיפול בקשישים יכולים לשפר את איכות החיים באמצעות HRC5 לטווח ארוך. רפואהמציבה את המכשירים הקהילתיים כתחליף למשפחה ולמטפלים, ומכסה טיפול בתפקיד הנפגע עם דמנציה, אוטיזם ומחלות פיזיות או נפשיות נוספות. במקביל, תחומי הנסיעה והידידותיות משתמשים ברובוטים תעשייתיים כדי לקדם את הידע של המשתמש7. בהנדסה חכמה, המטרה היא להשתתף בבינה מלאכותית באופן ממוקד אדם כדי לשחזר מיומנויות וליצור גידולים מותאמים אישית, שלב הידוע כתעשייה 5.0. מערכות שיתוף פעולה בין אדם-בינה מלאכותית ואדם-רובוט נחקרו בתחומי יישום מגוונים: 8,9,10; עם זאת, מחקרים עדכניים מתמקדים יותר ויותר בסביבות רובוטיות שיתופיות שדורשות חיזוי כוונה אמין והבנת משימות ארוכות אופק.

הבינה המלאכותית כבר מושרשת עמוק בחיי היומיום, ויישומיה האוטונומיים או החצי-אוטונומיים שלה מתבטאים יותר ויותר בתחומים רבים של העסקים. זה פשוט אומר שפונקציות עסקיות שפועלות היטב כיום דורשות מערכות המסוגלות להסתגל לשינויים בטכנולוגיה ולהגיב לאתגרים ארגוניים11. כתוצאה מכך, הצורך לשפר את הפעולה האנושית באמצעות היברידיזציה בתהליך אימוץ ויישום הבינה המלאכותית מסייע בהתמודדות עם כמה מכשולים. כתוצאה מכך, מערכות היברידיות משלבות בינה מלאכותית ואנושית כדי להשיג משימות מורכבות יחד, להביא תוצאות משופרות ולקדם את כישוריהן באמצעות למידה מעמיתים. לכן, מושגים מורחבים הכוללים מערכות חכמותהיברידיות 12, שיתוף פעולה ואינטליגנציה מוגברת מעצבים באופן בלתי פורמלי את המחקר וההבנה של חיזוק שיתוף פעולה באמצעות שילוב מודאליות בינה מלאכותית מגוונת.

המונח "אמון" נגזר ממחקרי מערכות יחסים בין-אישיות, שהגדירו קשר רגשי במערכות יחסים אנושיות. לדוגמה, המחבר13 זיהה שרמת האמון קובעת טכנית היבטים של רגשות, משיכה לכאורה ואתיקה של צדדים משתפים פעולה. סוציולוגית, לשינויים באמון בין-אישי יש השפעה עמוקה על רווחה נפרדת, אינטראקציה קהילתית, צמיחה חברתית-כלכלית והתנהגות מעשית 14,15,16. HRI, במהותו, הוא ניסיון לגשר בין שיחות פרוצדורליות בין עובדים סוציאליים ואוטומטים חכמים מעבר למכשולים הלשוניים המקובלים של אוטומטים17. אינטראקציה כזו משלבת את החוזקות החישוביות של מערכות אוטונומיות עם אינטואיציה אנושית, ומאפשרת שיתוף פעולה אפקטיבי במגוון סביבות יישומים. השימוש באוטומטים מביא עמו יתרונות אמיתיים: ירידה משמעותית בהוצאות הכספיות, ירידה בטביעת רגל אקולוגית, וסיכון אנושי נמוך בהרבה10. אך בתוך הישגים, הביטחון האנושי ברובוטים הוא עמוד תווך, במיוחד כאשר מעריכים את איכות האינטראקציה הכללית18,19.

רמת האמון האנושי שניתן לרובוטים משקפת את חשיבותם ותפקידם המרכזי בתחומים רבים. בתחום הבריאות, אמון הרובוטים משפיע על חלוקת המשאבים הרפואיים בהתאם ל-HRI וכן על יעילות דיכוי מחלות מדבקות 20,21,22. ביישומים צבאיים, רמת האמונה החברתית באוטומטים שולטת ברמת הכשירות האופרטיבית של אסטרטגיות מכשירי חקירה חיילי ועל רמת הדיוק של כלי הלחימה 23,24. בנוסף, האמונה במכונות משפיעה על כניעה ושימוש במנגנוני תקנון אמונה פעילה של בינה מלאכותית בקבלת החלטות צבאית ספקולטיבית25. אפילו בחקירה סביבתית, למשל מחקר תנועה גופנית ברמה גבוהה, הרציונליות של התוצאות תלויה במידת האמונה ב-HRI26. אזהרה משמעותית, עם זאת, היא שבעיות החלטות גוברות עלולות להחליש את האמון הזה, ולסכן את האינטראקציה27. טבלה 1 מתארת סקירה השוואתית של מספר מחקרים.

מאמר (שנה, מקור)מטרות עיקריותשיטות ושיטות מפתחתובנות
שי & פארק (2021, arXiv) [28]התאמת אינטראקציות בין רובוטים לרובוטים חברתיים רגשייםמדיניות ללמידת חיזוק המבוססת על רמזים מילוליים ולא-מילוליים (תנוחת גוף, דיבור והבעות פנים)התנהגותו של רובוט מאומן ב-RL משתנה בתגובה לרגשות אנושיים, מה שמגביר את הפשטות והמעורבות.
לי ואח' (2022, IEEE T-IE) [29]להקל על תמיכה פרואקטיבית בהרכבת ייצורחיזוי כוונה, למידת העברה ולמידה רב-מודלית (חזותי + שלד)שיפור יוזמת הרובוטים בהשוואה לבסיסים; חיזוי פעולה מהיר ומדויק יותר במהלך ההרכבה
עבד אלרחמן ואח' (2022, IEEE Access) [30]הערכת מעורבות בזמן אמת ב-HRI קבוצתיסיווג מבוסס כללים בשילוב עם למידה עמוקה ותנוחת מבט/ראש מבוססת ראייה≥90% ציון נכבה; מנהל מספר משתמשים בו-זמנית בתצורות פיזיות
Chiossi ואח' (2025, arXiv) [31]מבנה להעברת כוונה דינמית רב-מודלית בסביבות ייצורפריסה תיאורטית רב-ממדית: שכבות שקיפות SAT; מצבים הפטיים, השמיעתיים והוויזואלייםקובע את המסגרת הקונספטואלית ומסביר את המדיה, התכנון והכוונה של סביבת העיצוב.
מקגרת' ואח' (2024, arXiv) [32]מדמה את פיתוח האמון בקשרים אנושיים-בינה מלאכותיים שהם גמישים.שלבי צוות בתוספת קודמי אמון; מודל אמון דינמי שאינו תלוי במודאליות מסוימותמספק עקרונות עיצוב מודעים לאמון לכל שלבי האינטראקציה והזמן.
פרגיאדאקיס ואח' (2024, arXiv) [33]לאחד את הערכת שיתוף הפעולה בין בני אדם לבינה מלאכותית.מדדים שנבחרו על ידי עץ החלטות לפי מצב HAIC; מדדים בשיטות מעורבותהמסגרת מסייעת בבחירת מדדים רלוונטיים למודאליות אינטראקציה סימביוטית ממוקדות בינה מלאכותית/אנושית.
יוניס ואח' (2023, MDPI) [34]HRI שמתאים את עצמו להקשר באמצעות הסקה דמוגרפיתהגיל והמגדר מוערכים באמצעות מודלים של ראייה ושמע, והתנהגות הרובוטים מותאמת כראוי.הסקר מסכם את הגישות ומדגיש את חשיבות ההתאמה המותאמת אישית ב-HRI.

טבלה 1: סקירה השוואתית של מחקרים עדכניים בשיתוף פעולה בין אדם לבינה מלאכותית, המדגישה את המטרות המרכזיות, המתודולוגיות והממצאים של כל מחקר. מערכי הנתונים ששימשו במחקר, המפרט שלהם, גודלם, המודליות והתפלגות המשתתפים.

למרות שמסגרת שיתוף הפעולה ההיררכית והרב-מודלית הנוכחית בין אדם לרובוט (HRC) מראה התקדמות מרשימה בשימוש במודאליות ויזואלית וקולית לשיתוף פעולה ארוך טווח, עדיין קיימים פערי מחקר, מה שמקשה על יישומה בסביבות שיתוף פעולה כלליות יותר בין אדם לבינה מלאכותית. ראשית, המסגרת הנוכחית מתאימה בעיקר לרובוטיקה פיזית (למשל, זרוע KINOVA GEN3) ואינה ניתנת להעברה לסוכני בינה מלאכותית לא מגולמים או וירטואליים הקיימים בסביבות דיגיטליות מגוונות28. שנית, בעוד שמולטימודליות מטופלת באמצעות ראייה ודיבור, המערכת מיישמת אסטרטגיית החלפת מודליות מוגדרת מראש במקום מיזוג דינמי ותלוי הקשר בהתאם למצב המשתמש או לקושי המשימה29. שלישית, הגישה מדגישה יעילות וחוסן משימות, אך אינה מדגימה במפורש אמון משתמש, נטל קוגניטיבי או מצב רגשי, שהם חיוניים לשיתוף פעולה ארוך טווח ולהסבר מערכת. בנוסף, פרשנות אנושית וביטחון בהתנהגות האדפטיבית של המערכת מוגבלים כאשר תהליכי הסבר אינם קיימים בקבלת החלטות. ולבסוף, ההערכה מוגבלת לתחום יחיד (הרכבת רכב צעצוע) ללא אימות רב-תחומי, המייצג שונות בעולם האמיתי30. פערים כאלה מחייבים פיתוח מסגרת אינטראקציה מולטימודלית כללית, אדפטיבית וממוקדת אדם, המשלבת ערוצי קלט הטרוגניים באופן דינמי ומדמה כוונה, אמון והקשר אנושיים בזמן אמת, כדי להעצים את שיתוף הפעולה בין אדם לבינה מלאכותית.

המטרה המרכזית של מחקר זה היא למקסם את שיתוף הפעולה בין אדם לבינה מלאכותית באמצעות עיצוב מערכת אינטראקציה רב-מודלית אדפטיבית המאחדת מודאליות ראייה ודיבור עם מידול משתמש בזמן אמת. בהתבסס על בסיס איתן של שיתוף פעולה ארוך טווח בין אדם לרובוט, עבודה זו תכלילה את הארכיטקטורה הרב-מודלית למערכות בינה מלאכותית כלליות מחוץ לרובוטיקה, כגון סוכנים וירטואליים וממשקים חכמים. הדגש העיקרי הוא על חיזוי כוונה דינמי באמצעות מנגנוני תכנון היררכיים, המשלבים הבנת פעולה ברמה נמוכה ומעקב התקדמות במשימה ברמה גבוהה. בניגוד למערכות מבוססות כללים, המסגרת המוצגת כאן תשתמש בשיטות למידה אדפטיבית, כולל עדכוני מודלים ספציפיים למשתמש ומיזוג מודאליות מודעות להקשר, כדי להתאים דינמית את התנהגות האינטראקציה בהתאם להעדפות המשתמש, מצב קוגניטיבי ודינמיקה סביבתית. יתרה מזאת, המסגרת שואפת גם להגברת השקיפות והאמון באמצעות הסקת אינטראקציה מוסברת, המאפשרת למשתמשים להבין את בחירות הבינה המלאכותית ולתת משוב. לבסוף, מחקר זה שואף לשפר את שוטפות האינטראקציה, יעילות המשימה ושביעות רצון המשתמשים לטווח ארוך בהקשרים שיתופיים שונים.

מאמר זה מציג מסגרת אינטראקציה מולטימודלית אדפטיבית חדשה שמטרתה לקדם שיתוף פעולה בין אדם לבינה מלאכותית על ידי מיזוג דינמי של מודאליות ויזואלית וקולית. המערכת 'יונימודלית' מתייחסת למודל המשתמש רק במודליות קלט אחת (למשל, ויזואלית או דיבורית) לביצוע משימות וחיזוי כוונות, מבלי לשלב מידע בין ערוצים מרובים. המערכת 'לא אדפטיבית' מתייחסת למערכת מבוססת חוקים או אסטרטגיה קבועה שאינה מתאימה את התנהגותה בהתאם לפעולות או ההקשר של המשתמש, כמו קו הבסיס של החלפה מבוססת חוקים. קווי בסיס אלו מספקים נקודות ייחוס להערכת היתרונות של אסטרטגיות תפיסה רב-מודלית ואינטראקציה אדפטיבית שמיושמות במודל ה-Transformer עם מיזוג מונחה קשב שהצענו. בהתבסס על פרדיגמות HRC היררכיות קודמות31, השיטה שלנו מביאה מספר חידושים חשובים:

עבודה זו מציגה מנגנון יישור מבוסס עיוות זמן דינמי (DTW) שממפה פעולות אנושיות ברמה נמוכה צפויות לצמתים בגרף משימות היררכי, בניגוד למערכות אינטראקציה מולטימודליות קודמות שהתמקדו בעיקר בזיהוי פעולות לטווח קצר32. נוכח אי-צפיות זמניות וקלטים מולטימודליים רועשים, הדבר מאפשר חיזוי כוונה אמין באופק ארוך ומעקב אחר התקדמות משימה.

מודול התאמה מקוון שמעדכן באופן רציף מודלים של הסקת כוונה וחיזוי פעולה במהלך האינטראקציה משולב במערכת המוצעת. דבר זה מתגבר על החסרונות של מודלים מולטימודליים סטטיים או מאומנים לא מקוון, בכך שהוא מאפשר למערכת להסתגל באופן דינמי להתנהגויות ייחודיות, העדפות ושינויים הקשריים של משתמשים.

מודאליות ויזואלית ושמיעתית משוקללות דינמית בהתאם לחשיבותם הקונטקסטואלית בכל שלב זמן באמצעות טכניקת מיזוג ייחודית מבוססת קשב. גישה זו של מיזוג מונחית נתונים משפרת את החוסן במגוון סביבות אינטראקציה ומחליפה החלפת מודאליות מבוססת כללים.

מחקר זה משלב מודול הסבר קל משקל שממיר החלטות תכנון היררכיות ומיזוג להצדקות מובנות במטרה לסגור את פער הפרשנות במערכות אדם-בינה מלאכותית אדפטיביות. דבר זה משפר את איכות שיתוף הפעולה לטווח ארוך ומעודד כיול אמון נכון.

הגישה המוצעת נועדה להכליל מעבר לרובוטים מגולמים לסוכנים וירטואליים וממשקים אינטליגנטיים, ולהרחיב את השימושיות שלה למגוון תחומי שיתוף פעולה בין אדם לבינה מלאכותית, אף על פי שהוכחה בפעילות הרכבה שיתופית בעולם האמיתי תוך שימוש בפלטפורמה רובוטית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

פרוטוקול

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הארכיטקטורה המוצעת להרחבת שיתוף הפעולה בין אדם לבינה מלאכותית משתמשת בצינור אינטראקציה רב-מודלי אדפטיבי המשלב מודאליות ראייה ודיבור במסגרת הסקה דינמית והיררכית. מחקר זה השתמש בנתונים זמינים לציבור מניסויים שפורסמו בעבר. לא היו מעורבים נבדקים אנושיים חדשים, ולא נדרשה אישור אתי נוסף.

ארכיטקטורת אינטראקציה מולטימודלית אדפטיבית מוצעת

בעיקרון, המערכת מתחילה במודולי תפיסה, כגון זרם ויזואלי לוכד תנוחת ותנועה של המשתמש באמצעות חיישני RGB-D, וזרם שמע מנתח קלטי דיבור באמצעות מנוע ASR (זיהוי דיבור אוטומטי) קל משקל. קלטים גולמיים כאלה מוזנים למודול חיזוי הפעולות המבוסס על טרנספורמר, שמקודד תלות זמנית ברצפי תנוחה ופקודות כדי להבין פעולות אנושיות ברמה נמוכה. בהמשך, כדי לאפשר תכנון שיתופי פעולה ברמה גבוהה, מנגנון עיוות זמן דינמי (DTW) מיישר את הפעולות שזוהו עם צמתים בגרף משימות מוגדר מראש כדי לחזות מטרות המשתמש ופעולות הבאות. מודול מיזוג מבוסס קשב חדש מחליט, בכל צעד זמן, איזו מודאליות (אודיו או חזון) מספקת את המידע החשוב ביותר מבחינה קונטקסטואלית ומכוון את משקלי הקלט באופן דינמי. כדי להתאים את האינטראקציה באופן אישי, המערכת כוללת התאמת מודלים מקוונים, תוך התאמת מנבאי פעולה בזמן אמת לשינוי התנהגות המשתמשים. מודול הסבר קל גם יוצר סיכומים ידידותיים למשתמש של כוונות צפויות והחלטות בינה מלאכותית לשיפור השקיפות והאמון. כל המערכת נבדקת בסביבת הרכבה שיתופית מדומה אך מהעולם האמיתי, המאפשרת השוואה בין סביבות חד-מודליות ורב-מודליות אדפטיביות. גישה כזו מאפשרת שיתוף פעולה גמיש, אינטואיטיבי ואמין יותר עם סוכני בינה מלאכותית בכל התחומים.

איור 1 מציג את הארכיטקטורה של מסגרת האינטראקציה הרב-מודלית האדפטיבית המתוארת, שמטרתה לשפר את שיתוף הפעולה בין אדם לבינה מלאכותית. הוא מתחיל בשלב רכישת הקלט, המבוסס על שני מכשירי חישה עיקריים: מצלמת RGB-D לצפייה במידע חזותי משופר בעומק (למשל, יציבה ותנועה) ומיקרופון כיווני לאיסוף פקודות דיבור. אותות גולמיים מועברים לאחר מכן דרך מודול Pre-Processing, שמעבד את נתוני האודיו-ויזואליים לניתוח נוסף על ידי ניקוי, נרמול ועיצוב זרמי הקלט. לאחר מכן, הצינור ממשיך לשלב חילוץ תכונות, שבו הנתונים מחולקים לשני זרמים: הזרם הוויזואלי, שמבודד תכונות תנוחה ותנועה באמצעות אלגוריתמים להערכת תנוחה, וזרם האודיו, שמתמלל את הדיבור להטמעות פקודות ניתנות לפענוח. מקודד טרנספורמר רב-מודלי, המשתמש בתשומת לב עצמית רב-ראשית ובקידוד מיקום זמני כדי לבטא תלות הדדית לטווח ארוך בין רצפי אינטראקציה, מעבד לאחר מכן את הייצוג המאוחד. מצב המטרה הנוכחי של המשתמש מוערך על ידי כוונת אופק ארוך ומנבא התקדמות משימה, ופעולות ברמה נמוכה ממופות לצמתים בגרף משימות היררכי למעקב אמין אחר משימות באמצעות מודול יישור מבוסס DTW. משקלי המיזוג ופרמטרי החיזוי מתעדכנים באופן רציף באמצעות לולאת התאמת מודלים מקוונת בתגובה למשוב אינטראקציה, ומודול הסבר מספק הסברים ברורים לקידום פתיחות וביטחון. כל הצינור מאפשר למערכת לעבוד יחד באופן אדפטיבי ויעיל עם המשתמשים במשימות וסביבות דינמיות.

figure-protocol-1
איור 1: סקירה של מסגרת האינטראקציה המולטימודלית המוצעת המבוססת על טרנספורמרים. טכניקה מונחית קשב משמשת לקידוד ואינטגרציה דינמית של נתונים ויזואליים ושמיעתיים. מודול טרנספורמר, המשלב מידול היררכי של משימות והתאמה מקוונת, מעבד את הייצוג המאוחד לחיזוי כוונת אופק ארוך והערכת התקדמות במשימה. . אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

המערכת המוצעת משלבת מודול הסבר קל משקל שפועל בשילוב עם רכיבי המיזוג הרב-מודלי ותכנון היררכי לשיפור השקיפות וביטחון המשתמש. המודול מפיק רמזים ניתנים לפירוש מיישור גרף המשימות מבוסס DTW (למשל, התקדמות המשימה הנוכחית והפעולה הבאה הצפויה בדיוק) ומשכבת המיזוג מבוססת הקשב (למשל, משקלי חשיבות מודאליות). רמזים אלו מומרים להסברים מובנים לבני אדם, כמו האם פקודות מדוברות או מחוות חזותיות השפיעו בעיקר על בחירת מערכת וכיצד הפעולה הצפויה משתלבת בתוכנית העבודה הרחבה יותר. המשתמשים מקבלים הסברים בצורת משוב כתוב או חזותי תמציתי, המסייע להם להבין, לחזות ואם יש צורך, לתקן את התנהגות המערכת. שיפור שביעות הרצון של המשתמשים, חלקות האינטראקציה ומדדים הקשורים לאמון שצוינו בהערכה הם אינדיקטורים עקיפים לתפיסת המשתמש לגבי ההסברות. הממצאים מרמזים שבאינטראקציה ארוכת טווח בין אדם לבינה מלאכותית, חשיבה שקופה להחלטות בינה מלאכותית מגבירה את ביטחון המשתמש, מקלה על שיתוף פעולה ומגבירה את קבלת התנהגות המערכת האדפטיבית.

נתוני קלט

רכישת קלט במסגרת המתוכננת לשיתוף פעולה בין אדם לבינה מלאכותית מתבצעת באמצעות מנגנון חישה רב-מודלי מובנה המשלב גם מודאליות ראייה וגם שמיעה כדי לממש ביעילות פעולות וכוונות אנושיות. קלט חזותי מתקבל באמצעות מצלמת RGB-D, שלוכדת מידע בזמן אמת על תנוחות של בני אדם, מיקום מרחבי והקשר של הסביבה. נתונים ויזואליים מעובדים באמצעות מודלים מאומנים מראש כמו BlazePose כדי לקבל נקודות מפתח מעניינות בגוף העליון למשימות אינטראקציה. במקביל, מידע שמיעתי מתקבל ממיקרופון כיווני ומתפורש באמצעות מודל DeepSpeech מאומן מראש כדי לזהות פקודות דיבור שמבחנות או מספקות רמזים ויזואליים לא ודאיים נוספים. בהקשרים שיתופיים, מערכת הקלט הכפול מציעה התאמה דינמית ותפיסה מודעת להקשר. מאגר הנתונים של ההדרכה וההערכה כולל יותר מ-5,000 מסלולי תנועה מולטימודליים של בני אדם,1, למגוון פעילויות אינטראקציה, כגון התנהגויות הרכבה והעברה, שנאספו מארבעה משתמשים בסביבות מבוקרות וחצי-מובנות. כדי לשפר את ההכללה, המערכת מאפשרת התאמת מודל מקוונת בפריסה, מה שמאפשר למודל לעדכן את התחזיות בזמן אמת בהתאם לשינוי התנהגות המשתמש ודינמיקה סביבתית.

תיאור מערך הנתונים

מאגר הנתונים של האימון וההערכה למסגרת המוצעת התקבל מניסויי שיתוף פעולה אמיתי בין אדם לרובוט במסגרת משימת הרכבת רכב צעצוע באמצעות רובוט KINOVAGEN3 1. הסביבה הניסיונית נועדה לחקות פעילויות שיתופיות ארוכות טווח הכוללות אינטראקציה רב-מודלית, שכללה גם מודאליות ויזואלית וגם שמיעתית. בפרט, מאגר הנתונים של האימון מורכב מ-3,003 רצפים של מסלולים משני משתמשים, ומאגר הבדיקה מכיל 2,088 רצפים, כולל נתונים משני משתמשים חדשים להערכת הכללת המודל. כל מסלול מתעד רצף של 5 שלבים של נקודות מפתח בתנוחת הגוף העליון שנאספו באמצעות BlazePose, יחד עם פקודות דיבור מתאימות שהועתקו על ידי DeepSpeech33. הנתונים שנאספו מתארים שונות טבעית אנושית בתנועות ובביטוי פקודות בפעילויות הכוללות מסירת חפצים, שימוש בכלים ופעולות שיתופיות. מאגר הנתונים הרב-מודלי הוא הבסיס ללמידה מפוקחת של מודלי הפעולה וחיזוי המסלול של DLinear ומהווה את המדד המרכזי במחקרי משתמשים בתנאי ראייה בלבד, אודיו בלבד ורב-מודאליים. שילוב סוגים שונים של משתמשים ותנאי רעש ריאליסטיים מבטיח עמידות ובדיקות התאמה למערכות HRC קבועות. טבלה 2 מציגה את התיאור המפורט של מערך הנתונים.

תכונותפרטים
שם מאגר הנתוניםמאגר נתוני הרכבת רכבי צעצועים (נאסף בתוך החברה)
סביבת האיסוףניסוי HRC אמיתי עם זרוע KINOVA GEN3
מספר המשתמשים (הכשרה)2 משתמשים
מספר המשתמשים (בדיקות)4 משתמשים (2 מהסט האימון, 2 לא נראים)
מסלולים כוללים (אימונים)3,003 מסלולים
מסלולים כוללים (בדיקות)2,088 מסלולים
מודליות שנתפסוויזואלי (RGB-D לתנוחה), אודיו (פקודות דיבור)
פורמט הנתוניםנקודות מפתח בפוזה (מ-BlazePose), פקודות דיבור לטקסט
רזולוציה זמניתכל מסלול כולל 5 צעדי זמן
משימות מכוסות3 משימות עיקריות: איסוף והנחה, סיבוב עצמים, הרכבה שיתופית
שימושאימון מפוקח של מודלים לחיזוי פעולה/מסלול; מחקר משתמשים

טבלה 2: תיאור מאגר נתונים. מידע על סביבת הסימולציה, כולל מסגרת תכנות, הגדרות חומרה וסביבת הערכה.

עיבוד מוקדם של מערך נתונים

כדי לאפשר אינטראקציה מולטימודלית אדפטיבית בשיתוף פעולה בין אדם לבינה מלאכותית, מערך הנתונים הגולמי, כגון נתונים ויזואליים (RGB ותמונות עומק), נתוני שמיעה (פקודות דיבור) והתנהגות זמנית (נקודות מפתח של תנוחות), עוברים עיבוד מובנה. נתונים ויזואליים מופקים תחילה באמצעות מודל הערכת תנוחה fפוזה, שלרוב נגזר מ-BlazePose או OpenPose. עבור מסגרת t, וקטור תנוחת האדם מוגדר כך:

figure-protocol-2(1)

כאשר k הוא מספר נקודות המפתח וכל נקודת מפתח מכילה קואורדינטות דו-ממדיות. הרצפים מנורמלים לפי אורך הגוף ומוחלקים לאורך זמן באמצעות מסנן סביצקי-גולאי:

figure-protocol-3(2)

כאשר w הוא גודל חלון הסינון. שנית, זרמי אודיו גולמיים ב-At נחתכים לקטעים באמצעות גלאי פעילות קולית (VAD). מקטעים אמינים מוזנים למודל זיהוידיבור של דיבור, (למשל, DeepSpeech) כדי לשלוף אסימוני פקודה:

figure-protocol-4(3)

כאשר V הוא אוצר המילים של פקודות מוכרות. לאינטגרציה, אסימוני פקודה עבור כולם מיושרים בזמן לחותמות זמן של תנוחה ויזואלית באמצעות פונקציית יישור מבוססת אינטרפולציה τ:

figure-protocol-5(4)

שלישית, כדי ליצור רצפי figure-protocol-6אימון כוונה זמניים , נגדיר רצפי מסלול , יחד עם פקודות figure-protocol-7דיבור נלוות. חלונות אלו מחולקים למקטעים באורך קבוע באמצעות חלונות הזזה בגודל l:

figure-protocol-8(5)

figure-protocol-9(6)

לבסוף, הקלטים מנורמלים לממוצע אפס ושונות יחידה לכל ממד נקודת מפתח עבור התכנסות במודלים מבוססי מסלול:

figure-protocol-10(7)

כאשרμ j, σj הם ממוצע וסטיית תקן של נקודת מפתח j שהשלימו את קבוצת האימונים.

חילוץ תכונות

בפרדיגמת האינטראקציה המולטימודלית האדפטיבית המתוארת, שיתוף פעולה חזק ובזמן אמת מתאפשר על ידי שילוב תכונות ויזואליות, אודיו והקשריות של משימות. צינור חילוץ התכונות מתחיל באיסוף נתונים מקבילי משני מודאליות עיקריות: אותות figure-protocol-11 ויזואליים ואותות figure-protocol-12שמע, שמאונדקסים בשלב הזמן t. תצפיות אלו עוברות דרך מודולי תפיסה תואמים כדי לקבל תכונות סמנטיות ברמה גבוהה הקשורות להתנהגות אנושית, כוונה ופקודת דיבור.

חילוץ תכונות ויזואליות

הנתונים figure-protocol-13 הוויזואליים הגולמיים ממצלמות RGB-D מוזנים דרך מעריך תנוחה אנושי (למשל, BlazePose), המספק וקטור figure-protocol-14נקודת מפתח מרחבי , כאשר k מייצג את מספר נקודות המפתח שזוהה וכל אחת מכילה קואורדינטות תלת-ממדיות:

figure-protocol-15(8)

נקודות מפתח אלו מוטמעות-זמן במסלול figure-protocol-16תנוחה , שממנו מופקות דינמיקת תנועה באמצעות פירוק עונתי מגמה:

figure-protocol-17(9)

כאשר ∈_t מייצג את הרעש השארי.

חילוץ תכונות אודיו

קלט figure-protocol-18 האודיו מעובד באמצעות מודל זיהוי דיבור מאומן מראש (למשל, DeepSpeech) ומייצר ייצוג figure-protocol-19פקודה טוקני , כאשר n הוא אורך הטוקן:

figure-protocol-20(10)

היתוך רב-מודלי

כדי לבנות הקשר אינטראקציה מאוחד, אנו משלבים את התכונות באמצעות תשומת לב משוקללת על סמך המבוסס על ביטחון ומידע הדדי:

figure-protocol-21(11)

כאשרφ V ו-φA הן פונקציות ההקרנה של תכונות חזותיות ושמיעתיות למרחב סמוי משותף,ו-α t∈[0,1] הוא מונח משקל מודאליות דינמי המחושב על בסיס אנטרופיה:

figure-protocol-22(12)

כאן, figure-protocol-23 ו figure-protocol-24- הם מידע הדדי בין מצב המטרה g למודאליות שנצפה.

תכנון באמצעות הטמעה קונטקסטואלית

וקטור התכונה הרב-מודלי האחרון Ft מועשר בהקשר המשימה ובהתקדמות Pt והופך לקלט מצב למודול התכנון האדפטיבי:

figure-protocol-25(13)

תכונה שהופקה xt משמשת כקלט למודלים של חיזוי כוונה ותכנון תנועה במורד הזרם, ותומכת בשיתוף פעולה אדפטיבי וחזק בין אדם לבינה מלאכותית בסביבות דינמיות ובלתי ודאיות.

חיזוי פעולה ותוכנית באמצעות יישור גרף משימות

לאחר תהליך חילוץ תכונות רב-מודלי, שבו נתוני כוונת דיבור (אודיו), מסלול תנוחה (חזותי), והקשר (למשל, יומני משימות או רגש) משולבים בעיבוד הבא כולל חיזוי פעולה אנושית אדפטיבית והסקת תוכנית באמצעות יישור גרפי משימות היררכי.

יהי וקטור התכונות המולטימודלי המשולב בצעד הזמן t מיוצג כך:

figure-protocol-26(14)

המערכת חוזה בתחילה את הפעולה האנושית ברמה הנמוכה באמצעות פונקציה f act, שלעיתים מיוצגת כמקודד-מפענח חוזר או טרנספורמר:

figure-protocol-27(15)

כאשר F(t-k:t) מציין את רצף ההיתוך של התכונות ב-k צעדי הזמן האחרונים, ו figure-protocol-28- הוא הפעולה החזויה מתוך קבוצת הפעולות A. המודול מחובר לאינטרנט ומכוון במדויק על ידי אובדן אדפטיבי:

figure-protocol-29(16)

כאן, CE הוא אובדן אנטרופיה חוצה של סיווג פעולה, ואז האיבר השני דוחף את חיזוי המסלול העתידי הטוב.

לחיזוי תוכנית ברמה גבוהה, אנו ממסגרים את המשימה כהתקדמות לאורך גרף משימה היררכי G = (N, E), שבו כל צומת ni ∈N מסמן תת-משימה או מטרה ביניים. המטרה היא להתאים את רצף הפעולות הנצפה לנתיב משימה ייחוס R*∈G על ידי הפחתת המרחק:

figure-protocol-30(17)

כאשר Pt מציין את מסלול ההתקדמות הנוכחי ו-d(⋅) מציין את מרחק עיוות הזמן הדינמי (DTW) או מדד יישור רך.

הכוונה figure-protocol-31 האולטימטיבית ברמת התוכנית נגזרת על ידי הקרנת הפעולה החזויה a ̂_t על הצעד הבא הסביר ביותר במסלול figure-protocol-32המיושר:

figure-protocol-33(18)

פענוח היררכי זה מבטיח שגם עם קלט חושי לא ברור או רועש, המערכת בוחרת את הכוונה הגבוהה הרמה הרלוונטית ביותר בהתאם לרצף המשימות הנוכחי. תכנון חיזוי זה לא רק משפר את יעילות שיתוף הפעולה, אלא גם משפר את הציפייה והיכולת להסתגל בתוך אינטראקציה רב-תורית בין אדם לבינה מלאכותית.

מנגנון מיזוג רב-מודלי (מבוסס קשב)

בשיתוף פעולה אדפטיבי בין אדם לבינה מלאכותית, אינטגרציה רב-מודלית של מספר מודאליות חושיות (למשל, ויזואלית: תנוחת אדם, מסלול; שמיעה: פקודות דיבור) היא הכרחית לפרשנות נכונה של כוונת המשתמש. גישה מבוססת כללים או מיזוג סטטי אינה יכולה להתמודד עם אינטראקציות אנושיות דינמיות בעולם האמיתי. לשם כך, מוצג כאן מנגנון מיזוג המבוסס על תשומת לב כדי לשקול כל מודאליות באופן דינמי בהתאם לחשיבותה ההקשרית בכל שלב זמן.

נסמן את וקטורי התכונה שהופקו מהמודאליות הוויזואלית והקולית כ- figure-protocol-34 ו figure-protocol-35- , בהתאמה. וקטורים אלה מקודדים מידע סמנטי שהושג דרך צינורות עיבוד קודמים, לדוגמה, תכונות ויזואליות עשויות להיווצר מהערכת פוזה וחיזוי פעולה, בעוד שתכונות שמע עשויות להיגזר מהטמעות-דיבור באמצעות מודלים כמו DeepSpeech או wav2vec.

המטרה של מיזוג מבוסס קשב היא לחשב משקלי קשב ספציפיים למודאליות הלכודים את המשמעות היחסית של כל מודאליות. זה נעשה באמצעות מנגנון קשב רך.

חישוב קשב-משקל

בשלב הראשון, שני הוקטורים הופכים למרחב קשב משותף באמצעות טרנספורמציה שניתן ללמוד. כלומר, עבור כל מודאליות i∈{V,A}, ציון הקשב הביניים מחושב כך:

figure-protocol-36(19)

כאשר figure-protocol-37 ו- figure-protocol-38 הם פרמטרים ניתנים ללמידה ברשת קשב, ו-tanh היא פונקציית הפעלה לא ליניארית. המרה זו מאפשרת למודל להפיק מתאמים ברמה גבוהה ובולטות קונטקסטואלית של כל מודאליות.

ציוני קשב לא מנורמלים אלה eV ו-αA מנורמלים עם פונקציית softmax כך שהם מסתכמים ל-1

figure-protocol-39(20)

כאן,α V ו-αA הם משקלי הקשב על המודאליות הוויזואלית והקולית, בהתאמה. המשקלים אדפטיביים ואז מתעדכנים לאורך זמן בהתאם להקשר המשימה הקיים, איכות האות ופעילות המשתמש.

figure-protocol-40(21)

הייצוג figure-protocol-41 המאוחד המתקבל מתקבל כשילוב משוקלל של וקטורי מודאליות הקלט:

וקטור משולב זה מקודד את הסמנטיקה המשותפת של המידע החזותי והשמיעתי באופן שמדגיש באופן פעיל את הזרם המידעי ביותר. לאחר מכן הוא מוזן למודולים במורד הזרם כמו התאמת גרף המשימות, חיזוי כוונה או מנוע תכנון תנועת רובוט.

אלגוריתם 1: מיזוג מבוסס קשב רב-מודלי

קלט: וקטור תכונה ויזואלית הוא hV∈Rd, וקטור תכונות האודיו הוא hA∈Rd

פרמטרים ניתנים ללמידה: W∈Rk*d,w∈Rk ו-b∈Rk

פלט: ייצוג מותך hמאוחד∈Rd.

שלב 1: קביעת ייצוגים ביניים על ידי חישוב באמצעות משוואה 19

שלב 2: השתמש ב-Softmax כדי לנרמל ציוני קשב באמצעות משוואה 20

שלב 3: חשב את הווקטור המאוחד באמצעות משוואה 21

שלב 4: החזרת hמותך

אלגוריתם Focus-Based Multimodal Fusion מספק אמצעי למיזוג חכם של תכונות של מודאליות קלט שונות, כגון זרמים ויזואליים וקוליים, יחד באופן מודע להקשר. מיזוג חיוני במערכות שבהן כל מודאליות מציגה מידע משלים אך משתנה, כמו בסביבות שיתופיות בין אדם לבינה מלאכותית שבה הראייה לוכדת מחוות או מיקום גוף והאודיו לוכד פקודות דיבור או אותות קוליים.

האלגוריתם 1 מתחיל בקביעת ייצוגים ביניים לכל מודאליות. כדי לחשב את שני המודלים הללו, eV לזרימה הוויזואלית ו-eA עבור זרם האודיו, שכבת רשת עצבית משותפת מבצעת תחילה טרנספורמציה לא ליניארית על וקטורי התכונה המתאימים. לאחר מכן, משקלי הקשב αV ו-αA מחושבים על ידי ביצוע פונקציית softmax על הציונים הביניים. זה עוזר שהמשקלים יהיו חיוביים ומסתכמים ל-1, מה שגורם בעצם לנורמליזציה את התרומות מכל מודאליות. ככל שהמודליות היא אינפורמטיבית יותר, כפי שמודל, כך משקל תשומת הלב שלה גדול יותר.

בסופו של דבר, האלגוריתם מחשב את התיאור הממוזג hהמאוחד באמצעות שילוב משוקלל של וקטורי הגרפיקה והקול, המנורמל לפי משקלי הקשב שלהם. וקטור מאוחד זה משלב את שתי השיטות באופן מונע נתונים ורגיש להקשר, ומשמש למשימות בהמשך כמו זיהוי כוונות, קבלת החלטות או תכנון תנועת רובוט. בסך הכול, אלגוריתם זה מאפשר למערכת להתמקד דינמית במודאליות או בשילוב המודאליות הרלוונטי ביותר ברגע מסוים, במקום להשתמש בגישות מיזוג קבועות או מבוססות כללים. זה הופך את המסגרת לחזקה, גמישה ומגיבה יותר במצבי אינטראקציה דינמיים בין אדם לבינה מלאכותית.

איור 2 ממחיש את תהליך העבודה של מנגנון מיזוג מולטימודלי מבוסס קשב, הפועל באינטגרציה רגישה להקשר של קלטים ויזואליים ושמיעתיים. חילוץ תכונות חזותי, השלב הראשון בזרימת העבודה, כולל חילוץ תכונות מרחביות או הקשורות לתנוחה מתמונות קלט או וידאו (כגון מצלמות RGB-D). אלו מוקלטים לאחר מכן למודול קשב חזותי שלומד להדגיש את התוכן האינפורמטיבי ביותר של המידע החזותי. במקביל, מודולי Audio Attention מעבדים הטמעות-דיבור או אסימוני שמע מפקודות מדוברות, ומייחסים משמעות קונטקסטואלית לאותות שמיעתיים שונים. התכונות המושקלות לפי תשומת לב מתקבלות משולבות דרך שכבת מיזוג מבוססת קשב ומועברות לרשת הזנה קדימה לפי מיקום עם חיבורים שאריים ונרמול שכבה, ויוצרות בלוק מקודד טרנספורמר סטנדרטי. הפלט הוא הטמעה מולטימודלית מאוחדת התומכת בחיזוי כוונות אופק ארוך חזק וקבלת החלטות אדפטיבית בתנאי אינטראקציה משתנים. עיצוב זה מאפשר למערכת להתרכז באופן סלקטיבי במודאליות החזקה יותר בכל רגע, ולשפר את החוסן והיכולת לפרשנות באינטראקציה בזמן אמת בין אדם לבינה מלאכותית.

figure-protocol-42
איור 2: המבנה המפורט של מודול ההיתוך הרב-מודלי מונחה קשב. כדי ליצור ייצוג מאוחד מודע להקשר בכל שלב זמן, מקודדים ספציפיים למודאליות אוספים תכונות מזרמים ויזואליים ושמיעתיים. תכונות אלו משוקללות דינמית באמצעות מנגנון קשב מונחה נתונים. אנא לחצו כאן כדי לצפות בגרסה מוגדלת של הדמות הזו.

התאמת מודלים מקוונים

כדי להבטיח שיתוף פעולה איכותי בין אדם לבינה מלאכותית תחת התנהגויות והקשרים שונים של משתמשים, המסגרת שלנו משלבת מנגנון התאמת מודלים מקוון שממקסם בהדרגה מודלים ספציפיים למשתמש במהלך האינטראקציה. המודול עוקב אחרי אותות התנהגות בזמן אמת (למשל, תנועה, מסלולי מחוות, טון דיבור) ועדכון את המודלים החיזויים הבסיסיים עם אלגוריתמים ללמידה הדרגתית. במיוחד, מודלים של חיזוי מסלול וזיהוי כוונות מותאמים עם קלט עדכני באמצעות כיוונון עדין מבוסס גרדיאנט או התאמת דרגה נמוכה (LoRA), כך שהמערכת תוכל להסתגל לשינויים בהתנהגות המשתמש או לדרישות ספציפיות למשימה מבלי לעבור הכשרה מלאה.

שכבת המשוב פועלת בהרמוניה יחד עם התאמה באמצעות משוב מרומז (למשל, תיקונים, היסוסים, עיכובים) ופקודות מפורשות (למשל, דיבור או ממשק גרפי). יש לו שתי מטרות: כיול אדפטיבי של הבולטות של רמזים מולטימודליים, והעברת מדדי אמון/ביטחון למודולי ההחלטה והבקרה.

מחזור המשוב מאפשר ביצוע חלק יותר של משימות ותגובות מוכוונות משתמש. כדי לטפח אמון ושקיפות, המסגרת משלבת מודול הסבר שמתרגם החלטות מודל ברמה נמוכה להצדקות מובנות לאדם. הוא משתמש במפות רציונל משנאי מיזוג רב-מודלי, בתוספת מעקב לוגי דרך גרף המשימות. ניתן להציג את ההיגיון הזה באמצעות ממשק גרפי או עזר שמיעתי כדי לאפשר למשתמשים להבין ואולי אפילו לתקן התנהגות מערכתית.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

תוצאות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

מודל האינטראקציה הרב-מודאלי האדפטיבי המוצע כאן מטפל בדאגות אלו ומחזק משמעותית את שיתוף הפעולה בין אדם לבינה מלאכותית על ידי שילוב חלק של מודאליות ראייה ודיבור עם תהליכי הסתגלות משתמש בזמן אמת. בניגוד למערכת הרב-מודלית ההיררכית הבסיסית, הגישה שלנו כוללת לולאת משוב מותאמת אישית וכן התאמה קוגניטיבית מודעת לעומס שמספקת אינטראקציה אינטואיטיבית ומודעת להקשר. לאחר בדיקות ניסיוניות בפעילויות שיתופיות מדומות, כגון טיפול באובייקטים, הצגת רכיבים והשלמת מטרות לפי רצף, המערכת תמיד הראתה יעילות משופרת...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

דיון

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

הממצאים מראים באופן חד-משמעי את יעילות הבסיס המוצע לאינטראקציה רב-מודלית אדפטיבית לשיפור שיתוף הפעולה בין אדם לבינה מלאכותית.

מלבד ציוני ההערכה הסטנדרטיים כמו זמן השלמת משימה (TCT), דיוק חיזוי כוונה אנושית (HIPA), יעילות מיזוג רב-מודלית (MFE), שיעור שחזור שגיאות (ERR), ציון שביעות רצון משתמש (USS) ומדד חלקות אינטראקציה (ISI), ניתן להוסיף מדדים ממוקדי משתמש נוספים לניתוח מעמיק של מסגרות רב-מודליות אדפטיביות. במיוחד, ניתן להציג את מדד העומס הקוגניטיבי (CLI) כדי ...

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

גילויים

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

למחברים אין ניגודי עניינים.

תודות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

המחברים מודים בהכרת תודה על התמיכה שניתנה על ידי בית הספר לעיצוב, אוניברסיטת ג'יאנגנאן, וו שי, סין.

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

חומרים

רשימת החומרים שנעשה בהם שימוש במאמר זה
שםחברהמספר קטלוגהערות
מצלמת RGB-D (Intel RealSense D435)חברת אינטלD435רזולוציית עומק פי 1280; 720 פיקסלים @ 30 פריימים לשנייה; רזולוציית RGB 1920> 1080 פיקסים @ 30 פריימים לשנייה; משמש ללכידת תנוחת המשתמש, תנועות הגוף וההקשר המרחבי
מיקרופון כיווניגנרי / ספקים מרוביםלא זמיןמיקרופון רחב פס עם ביטול רעש (16 kHz– 44.1 קילוהרץ); משמש לאיסוף פקודות מדוברות
BlazePose (מודל מאומן מראש)גוגלhttps://developers.google.com/mediapipe/solutions/vision/poseמודל הערכת פוזה עם 33 נקודות מפתח; חילוץ תנוחה אנושית בזמן אמת
OpenPose (מודל מאומן מראש)מעבדת המחשוב התפיסתי של CMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeמסגרת הערכת תנוחה מרובת אנשים המשמשת לחילוץ מסלולי תנועה
מנוע ASR של דיפספשמוזילהv0.9.3מודל זיהוי דיבור אוטומטי מאומן מראש לתמלול דיבור לטקסט
מנוע wav2vec 2.0 ASRמטא AIhttps://github.com/facebookresearch/fairseqמודל ייצוג דיבור בפיקוח עצמי לעיבוד דיבור בזמן אמת
מודל חיזוי פעולה מבוסס שנאי (DLinear / Seq2Seq)מימוש מותאם אישיתלא זמיןארכיטקטורת מקודד-מפענח זמני עם תשומת לב לחיזוי פעולה לטווח קצר
מודול עיוות זמן דינמי (DTW)מותאם אישית / מבוסס מדעhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlאלגוריתם יישור רך להתאמת פעולות משתמש לגרפים מוגדרים מראש של משימות
רשת מיזוג רב-מודלית מבוססת קשבמימוש מותאם אישיתלא זמיןמנגנון קשב משוקלל-ביטחון למיזוג קלטי ראייה ודיבור
מודול התאמה מקוון (מבוסס LoRA / גרדיאנט)מימוש מותאם אישיתhttps://github.com/microsoft/LoRAכיוונון עדין קל ויעיל מבחינת פרמטרים להתאמה להתנהגות המשתמש
מודול הסבר (מבוסס כללים + מפות קשב)מימוש מותאם אישיתלא זמיןמספק הצדקה להחלטה ניתנת לפרשנות באמצעות כללים והדמיות קשב
זרוע רובוטית KINOVA Gen3רובוטיקה קינובהדור 3מניפולטור רובוטי 7-DOF עם חיישני מומנט משולבים; שימשו להרכבת רכבי צעצוע שיתופיים
סביבת סימולציית הרכבה שיתופיתסביבה מותאמת אישיתלא זמיןמערכת הרכבת רכבי צעצוע בעולם האמיתי המשמשת לבניית ביצועים לשיתוף פעולה רב-מודלי
מדדי הערכה (TCT, HIPA, MFE, LATENCY, ERR, USS, ISI)הגדרות מותאמות אישיתלא זמיןמדדים כמותיים וממוקדי משתמש להערכת יעילות, דיוק ואמון בשיתוף פעולה

מקורות

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

הגישה מוגבלת. התחברו או התחילו תקופת ניסיון כדי לצפות בתוכן זה.

הדפסות חוזרות והרשאות

בקש הרשאה לשימוש חוזר בטקסט או באיורים של מאמר JoVE זה

בקש הרשאה

תגיות

TransformerAttention FusionDynamic Time Warping

מאמרים קשורים