مقالة بحثية

تصميم أطر تفاعل متعددة الوسائط التكيفية لتعزيز التعاون بين الإنسان والذكاء الاصطناعي

DOI:

10.3791/69830

فبراير 24, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقترح هذا العمل آلية محاذاة هرمية قائمة على التشويه الزمني الديناميكي (DTW) مع التكيف عبر الإنترنت والاندماج متعدد الوسائط المدفوع بالانتباه، مما يتيح التنبؤ بالنوايا والمتابعة الموثوقة للأفق البعيد. وحدة التفسير الخفيفة تحسن التفسير، مما يعزز الثقة في التعاون بين الإنسان والذكاء الاصطناعي. يعمم هذا النهج على الأنظمة التفاعلية الروبوتية والافتراضية على حد سواء.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يظل تحقيق تعاون فعال وطبيعي بين الإنسان والذكاء الاصطناعي تحديا كبيرا، خاصة في البيئات الديناميكية في العالم الحقيقي. غالبا ما تكون الأطر الحالية محدودة بالمدخلات الصارمة ذات النمط الواحد أو الدمج متعدد الوسائط القائم على القواعد، مما يحد من متانتها وتخصيصها وقابليتها للتكيف. تقدم هذه الدراسة إطار عمل تفاعلي متعدد الوسائط تكيفي يدمج تقدير الوضعية القائم على الرؤية وفهم الأوامر المعتمد على الكلام ضمن نموذج هرمي لتوقع النية البشرية. يستخدم الإطار نماذج التسلسل المعتمدة على المحولات لتوقع الأفعال والتشوه الزمني الديناميكي لمواءمة سلوك الإنسان مع الرسوم البيانية المنظمة للمهام للتخطيط طويل الأمد. على عكس الأساليب السابقة التي تعتمد على التبديل الساكن للطرائق، تطبق بنيتنا آلية اندماج قائمة على الانتباه لوزن أكثر المدخلات إفادة ديناميكيا. علاوة على ذلك، تتيح وحدة التكيف عبر الإنترنت التعديل في الوقت الحقيقي لسلوك المستخدم، مع طبقة تفسير خفيفة لتعزيز ثقة المستخدم. يظهر التقييم التجريبي في مهمة تجميع تعاونية مكاسب كبيرة في أداء المهمة (حتى 24٪)، ودقة التنبؤ بالنية (حتى 18٪)، ورضا المستخدمين. تسلط هذه النتائج الضوء على فعالية وتنوع أطر التفاعل متعددة الوسائط التكيفية، مما يدعم إمكاناتها في تطوير الذكاء التعاوني نحو أنظمة ذكاء اصطناعي أكثر موثوقية وشفافية وموجها نحو الإنسان.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

كان التعاون بين الإنسان والروبوت (HRC) أحد مجالات البحث المهمة، خاصة وأن الروبوتات تنشر بشكل متزايد في بيئات تركز على الإنسان. بينما تحسنت الأطر والتقنيات للبحث البشري قصير الأجل بشكل ملحوظ 1,2، لم ينضج HRC طويل الأمد بعد3. في التطبيقات الصناعية، يمكن أن يؤدي استغلال HRC طويل الأمد إلى زيادة ملحوظة في الإنتاجية والقدرة على التكيف في عمليات التصنيع المعقدة4. في البيئات المنزلية، والروبوتات كرفيقات أو وكلاء رعاية للمسنين لديها القدرة على تحسين جودة الحياة من خلال HRC5 طويل الأمد. يضع الطب آلات المجتمع كبديل للمنزل ومقدمي الرعاية، ويشمل الرعاية للدور المتأثر بالخرف والتوحد، والأمراض الجسدية أو النفسية الإضافية6. وفي الوقت نفسه، تستخدم مجالات السفر والودية الروبوتات الصناعيةلتعزيز معرفة المستخدمين. في الهندسة الذكية، الهدف هو إشراك الذكاء الاصطناعي بطريقة تركز على الإنسان لاستعادة الكفاءات وصنع محاصيل مخصصة، وهي مرحلة تعرف باسم الصناعة 5.0. تم استكشاف أنظمة التعاون بين الإنسان والذكاء الاصطناعي والروبوت عبر مجالات تطبيقات متنوعة8، 9، 10؛ ومع ذلك، ركزت الأبحاث الحديثة بشكل متزايد على البيئات الروبوتية التعاونية التي تتطلب توقعا موثوقا للنية وفهما لمهام بعيدة الأفق.

الذكاء الاصطناعي متجذر بالفعل بعمق في الحياة اليومية، وتطبيقاته ذات الحكم الذاتي أو شبه المستقل تظهر بشكل متزايد في العديد من مجالات الأعمال. هذا ينص ببساطة على أن الوظائف التجارية التي تعمل بشكل جيد تتطلب حاليا أنظمة قادرة على التكيف مع التغيرات في التكنولوجيا والاستجابة للتحديات التنظيمية11. وبالتالي، تساعد الحاجة إلى تحسين العمل البشري من خلال التهجين في عملية تبني وتنفيذ الذكاء الاصطناعي في تسهيل تجاوز بعض الحواجز. وبالتالي، تجمع الأنظمة الهجينة بين الذكاء الاصطناعي والبشري لتحقيق مهام معقدة معا، وتحقيق نتائج أفضل، وتطوير مهاراتها من خلال التعلم من الزملاء. لذلك، فإن المفاهيم الموسعة التي تشمل أنظمة الذكاء الهجينة12، والتعاون، والذكاء المضخم تشكل بشكل غير رسمي البحث والفهم لتعزيز التعاون من خلال دمج أنماط الذكاء الاصطناعي المتنوعة.

تم اشتقاق مصطلح "الثقة" من دراسات العلاقات بين الأشخاص، حيث عرف الرابطة العاطفية في العلاقات الإنسانية. على سبيل المثال، حدد المؤلف13 أن مستوى الثقة يحدد تقنيا جوانب المشاعر، والجاذبية المفترضة، وأخلاقيات الأطراف المتعاونة. اجتماعيا، لاختلافات الثقة بين الأشخاص تأثيرات عميقة على رفاهية الفرد، والتفاعل الجماعي، والنمو الاجتماعي والاقتصادي، والسلوك العملي 14,15,16. يعد HRI، في جوهره، محاولة لجسر الحوارات الإجرائية بين الأخصائيين الاجتماعيين والآلات الذكية إلى ماوراء العقبات اللغوية التقليدية للآلات. يجمع هذا التفاعل بين القوة الحاسوبية للأنظمة الذاتية الذاتية والحدس البشري، مما يمكن التعاون الفعال عبر بيئات تطبيقات متنوعة. استخدام الآلات الآلية يجلب معه فوائد حقيقية: انخفاض كبير في النفقات المالية، وانخفاض البصمة البيئية، وتقليل المخاطر البشرية بشكل كبير. ولكن وسط الإنجازات، تعد الثقة البشرية في الروبوتات ركيزة، خاصة عند تقييم الجودة العامة للتفاعل18,19.

مستوى الثقة البشرية الممنوحة للروبوتات يعكس أهميتها ودورها المركزي في العديد من المجالات. في مجال الصحة، يؤثر ثقة الروبوتات على توزيع الموارد الطبية وفقا لمؤشر الموارد البشرية وكذلك على كفاءة كبح الأمراض المعدية 20,21,22. في التطبيقات الجندية، يتحكم مستوى الإيمان الاجتماعي بالآلات الآلية في مستوى الكفاءة التشغيلية لاستراتيجيات أجهزة التحقيق الجنودية ودقة وسائل النقل القتالية23,24. بالإضافة إلى ذلك، يؤثر الإيمان بالآلات على الخضوع واستخدام الذكاء الاصطناعي لآليات توحيد الإيمان النشطفي صنع السياسات الجندي التخميني. حتى في التحقيقات البيئية، مثل أبحاث حركة الجسم عالية المستوى، تعتمد منطقية النتائج على درجة الإيمان بمؤشر HRI26. تحذير مهم، مع ذلك، هو أن تصاعد صعوبات اتخاذ القرار قد يؤدي إلى تدهور هذه الثقة، ممايعرض التفاعل للخطر. يصف الجدول 1 نظرة مقارنة لعدة دراسات.

الورقة (السنة، المصدر)الأهداف الرئيسيةالطرق الرئيسية والأساليبرؤى
شي & بارك (2021، arXiv) [28]تخصيص تفاعلات الروبوتات مع الروبوتات الاجتماعية العاطفيةسياسة التعلم المعزز بناء على كل من التلميحات اللفظية وغير اللفظية (وضعية الجسم، الكلام، وتعبيرات الوجه)يتغير سلوك الروبوت المدرب على التعلم المعزز استجابة للمشاعر البشرية، مما يزيد من البساطة والتفاعل.
لي وآخرون (2022، IEEE T-IE) [29]تسهيل الدعم الاستباقي لتجميع التصنيعالتنبؤ بالنية، التعلم الانتقالي، والتعلم متعدد الوسائط (بصري + هيكلي)تحسنت استباقية الروبوتات مقارنة بالخطوط الأساسية؛ توقع فعل أسرع وأكثر دقة أثناء التجميع
عبد الرحمن وآخرون (2022، IEEE Access) [30]تقدير المشاركة في الوقت الحقيقي في مؤشر HRI الجماعيالتصنيف القائم على القواعد مع التعلم العميق ووضعية النظر/الرأس القائمة على الرؤية≥90٪ درجة F; تدير عدة مستخدمين في نفس الوقت في التكوينات الفيزيائية
كيوسي وآخرون (2025، arXiv) [31]هيكل النقل متعدد الوسائط والديناميكي للنية في بيئات التصنيعالتخطيط النظري متعدد الأوجه: طبقات شفافية SAT؛ الأنماط اللمسية، السمعية، والبصريةيؤسس الإطار المفاهيمي ويشرح الوسيط والتخطيط والنية لبيئة التصميم.
ماكغراث وآخرون (2024، arXiv) [32]نمذجة تطور الثقة في الروابط بين الإنسان والذكاء الاصطناعي القابلة للتكيف.مراحل الفريق بالإضافة إلى السوابق الثقيلة؛ نموذج ثقة ديناميكي لا يعتمد على أنماط معينةيوفر مبادئ تصميم واعية بالثقة لجميع مراحل التفاعل والوقت.
فراجياداكيس وآخرون (2024، arXiv) [33]توحيد تقييم التعاون بين البشر والذكاء الاصطناعي.المقاييس المختارة بواسطة شجرة القرار وفقا لنمط HAIC؛ المقاييس المختلطة الأساليبيساعد الإطار في اختيار المقاييس ذات الصلة لأنماط التفاعل التكافلي التي تركز على الذكاء الاصطناعي والإنسان.
يونس وآخرون (2023، MDPI) [34]مؤشر HRI الذي يتكيف مع السياق باستخدام الاستنتاج الديموغرافييتم تقدير العمر والجنس باستخدام نماذج الرؤية والصوت، ويتم تعديل سلوك الروبوتات بشكل مناسب.يلخص المسح الأساليب ويؤكد على أهمية التكيف المخصص في التحليل البشري البشري (HRI).

الجدول 1: نظرة مقارنة على الأبحاث الحديثة في التعاون بين الإنسان والذكاء الاصطناعي تركز على الأهداف الرئيسية والمنهجيات والنتائج لكل دراسة. مجموعات البيانات المستخدمة في الدراسة، مواصفاتها، حجمها، أساليبها، وتوزيع المشاركين.

على الرغم من أن إطار العمل الحالي للتعاون الهرمي والمتعدد الوسائط بين الإنسان والروبوت (HRC) يظهر تقدما ملحوظا في استخدام الأساليب البصرية والسمعية للتعاون طويل الأمد، إلا أن عددا من الفجوات البحثية لا تزال قائمة، مما يعيق تطبيقه في بيئات التعاون بين الإنسان والذكاء الاصطناعي بشكل عام. أولا، الإطار الحالي قابل للتطبيق في الغالب على الروبوتات الفيزيائية (مثل ذراع KINOVA GEN3) وغير قابل للنقل إلى وكلاء الذكاء الاصطناعي غير المجسدين أو الافتراضيين الذين يعيشون في بيئات رقمية متنوعة28. ثانيا، بينما يتم معالجة التعدد الوسائلي من خلال الرؤية والكلام، ينفذ النظام استراتيجية تبديل الأنماط المحددة مسبقا بدلا من الدمج الديناميكي المعتمد على السياق وفقا لحالة المستخدم أو صعوبة المهمة29. ثالثا، يركز النهج على كفاءة المهام والمرونة لكنه لا يمثل تحديدا ثقة المستخدم، أو العبء المعرفي، أو الحالة العاطفية، وهي ضرورية للتعاون طويل الأمد وقابلية التفسير النظامي. بالإضافة إلى ذلك، فإن قابلية التفسير البشرية والثقة في سلوك النظام التكيفي محدودة عندما تكون عمليات التفسير غائبة عن اتخاذ القرار. وأخيرا وليس آخرا، يقتصر التقييم على مجال واحد (تجميع سيارة لعبة) دون التحقق متعدد المجالات، مما يمثل التباين في العالم الحقيقي30. تتطلب هذه الفجوات تطوير إطار تفاعل متعدد الوسائط عام ومتكيف ومتمركز حول الإنسان يجمع بين قنوات الإدخال غير المتجانسة ديناميكيا ونمذجة النية البشرية والثقة والسياق في الوقت الحقيقي لتعزيز التعاون بين الإنسان والذكاء الاصطناعي.

الهدف الرئيسي لهذه الدراسة هو تعظيم التعاون بين الإنسان والذكاء الاصطناعي من خلال تصميم نظام تفاعل متعدد الوسائط متكيف يوحد بين الرؤية وأساليب الكلام ونمذجة المستخدم في الوقت الحقيقي. استنادا إلى الأساس المتين للتعاون القوي طويل الأمد بين الإنسان والروبوت، سيعمم هذا العمل الهندسة متعددة الوسائط لتشمل أنظمة الذكاء الاصطناعي العامة خارج الروبوتات، مثل الوكلاء الافتراضيين والواجهات الذكية. التركيز الرئيسي هو التنبؤ الديناميكي بالنوايا من خلال آليات التخطيط الهرمية، التي تدمج فهم الإجراءات على المستوى المنخفض وتتبع تقدم المهام على المستوى العالي. على عكس الأنظمة القائمة على القواعد، سيستخدم الإطار المعروض هنا طرق التعلم التكيفي، بما في ذلك تحديثات النماذج الخاصة بالمستخدم ودمج الأساليب الواعية للسياق، لتكييف سلوك التفاعل ديناميكيا وفقا لتفضيلات المستخدم، والحالة المعرفية، والديناميكيات البيئية. علاوة على ذلك، يهدف الإطار أيضا إلى تعزيز الشفافية والثقة من خلال التفكير التفاعلي القابل للتفسير، مما يسمح للمستخدمين بفهم خيارات الذكاء الاصطناعي وتقديم الملاحظات. وأخيرا، يأمل هذا البحث في تعزيز طلاقة التفاعل، وفعالية المهام، ورضا المستخدمين على المدى الطويل في سياقات التعاون المختلفة.

تقدم هذه الورقة إطار عمل تفاعلي متعدد الوسائط تكيفي جديد يهدف إلى تعزيز التعاون بين الإنسان والذكاء الاصطناعي من خلال دمج الوسائط البصرية والصوتية ديناميكيا. يشير نظام 'أحادي النمط' إلى نموذج يستخدم فقط طريقة إدخال واحدة (مثل البصرية أو الكلام) لتنفيذ المهام والتنبؤ بالنوايا، دون دمج المعلومات عبر قنوات متعددة. يشير النظام 'غير التكيفي' إلى نظام قائم على قواعد أو استراتيجية ثابتة لا يعدل سلوكه بناء على أفعال المستخدم أو السياق، مثل خط التبديل القائم على القواعد. توفر هذه الخطوط الأساسية نقاط مرجعية لتقييم مزايا استراتيجيات الإدراك متعدد الوسائط والتفاعل التكيفي التي تم تنفيذها في نموذج الدمج الموجه بالانتباه الذي اقترحناه في المحول الموجه. استنادا إلى نماذج HRC الهرمية السابقة31، تقدم طريقتنا عدة ابتكارات مهمة:

يقدم هذا العمل آلية محاذاة قائمة على التشويه الزمني الديناميكي (DTW) ترسم تحركات بشرية منخفضة المستوى المتوقعة إلى عقد في رسم مهام هرمي، على عكس أنظمة التفاعل متعددة الوسائط السابقة التي تركز بشكل رئيسي على التعرف على الأفعال قصيرة المدى32. في ظل عدم التوقع الزمني والمدخلات متعددة الوسائط الصاخبة، يسمح ذلك بتوقع نية طويلة الأفق وتتبع تقدم المهام بشكل موثوق.

يتم دمج وحدة تكييف عبر الإنترنت تقوم بتحديث نماذج الاستنتاج النية وتوقع الإجراءات أثناء التفاعل بشكل مستمر في النظام المقترح. يتغلب هذا على عيوب النماذج متعددة الوسائط الثابتة أو المدربة دون اتصال من خلال تمكين النظام من التكيف ديناميكيا مع سلوكيات المستخدم الفريدة وتفضيلاتهم والتغيرات السياقية.

يتم وزن الوسائط البصرية والسمعية ديناميكيا بناء على أهميتها السياقية في كل خطوة زمنية باستخدام تقنية دمج فريدة قائمة على الانتباه. يحسن هذا النهج المعتمد على البيانات المتانة في مجموعة متنوعة من بيئات التفاعل ويحل محل التبديل القائم على القواعد.

تتضمن هذه الدراسة وحدة خفيفة الوزن لإمكانية التفسير تحول التخطيط الهرمي وقرارات الدمج إلى مبررات مفهومة لسد فجوة قابلية التفسير في أنظمة الإنسان والذكاء الاصطناعي التكيفية. هذا يعزز جودة التعاون طويل الأمد ويشجع على معايرة الثقة بشكل صحيح.

يهدف النهج المقترح إلى تعميم ما هو أبعد من الروبوتات المتجسدة إلى الوكلاء الافتراضيين والواجهات الذكية، وتوسيع فائدته عبر العديد من مجالات التعاون بين الإنسان والذكاء الاصطناعي، رغم أنه ثبت في نشاط تجميع تعاوني حقيقي باستخدام منصة روبوتية.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تستخدم البنية المقترحة لتعزيز التعاون بين الإنسان والذكاء الاصطناعي خط تفاعل متعدد الوسائط تكيفي يجمع بين أنماط الرؤية والكلام في إطار استدلال ديناميكي وهري. استخدمت هذه الدراسة بيانات متاحة للجمهور من تجارب منشورة سابقا. لم يتم تضمين أي أشخاص جدد، ولم تكن هناك حاجة لموافقة أخلاقية إضافية.

بنية التفاعل متعددة الوسائط التكيفية المقترحة

بشكل أساسي، يبدأ النظام بوحدات إدراك، مثل التقاط التدفق البصري لوضعية وحركة المستخدم باستخدام حساسات RGB-D، بينما يحلل تدفق الصوت مدخلات الكلام باستخدام محرك ASR خفيف الوزن (التعرف التلقائي على الكلام). يتم تغذية هذه المدخلات الخام إلى وحدة التنبؤ بالإجراءات المعتمدة على المحول، والتي ترمز الاعتماديات الزمنية في تسلسلات الوضعيات والأوامر لتفكير الأفعال البشرية منخفضة المستوى. لاحقا، لتمكين التخطيط التعاوني عالي المستوى، تقوم آلية تشويه الزمن الديناميكي (DTW) بمحاذاة الإجراءات المكتشفة مع عقد رسم مهام محدد مسبقا للتنبؤ بأهداف المستخدم والإجراءات التالية. وحدة الاندماج المعتمدة على الانتباه تقرر في كل خطوة زمنية أي طريقة (صوت أو رؤية) تعطي المعلومات الأكثر أهمية في السياق وتضبط أوزان الإدخال ديناميكيا. ولتخصيص التفاعل، يشمل النظام تكييف النماذج عبر الإنترنت، مع تكييف متغيرات التنبؤ بالإجراءات في الوقت الحقيقي لتغير سلوك المستخدم. كما أن وحدة الشرح الخفيفة تنشئ ملخصات سهلة الاستخدام للنوايا المتوقعة وقرارات الذكاء الاصطناعي لتحسين الشفافية والثقة. يتم اختبار النظام بأكمله في بيئة تجميع تعاونية محاكاة لكنها واقعية، مما يسمح بالمقارنة بين البيئات أحادية النمط والبيئات متعددة الوسائط التكيفية. يسهل هذا النهج تعاونا أكثر قابلية للتكيف، وأكثر بديهية، وموثوقية مع وكلاء الذكاء الاصطناعي في جميع المجالات.

يوضح الشكل 1 بنية إطار التفاعل متعدد الوسائط التكيفية الموصوف ويهدف إلى تحسين التعاون بين الإنسان والذكاء الاصطناعي. يبدأ بمرحلة اكتساب المدخلات، والتي تعتمد على جهازين رئيسيين للاستشعار: كاميرا RGB-D لمراقبة المعلومات البصرية المحسنة للعمق (مثل وضعية الإنسان وحركته) وميكروفون اتجاهي لجمع أوامر الكلام. يتم تشغيل الإشارات الخام بعد ذلك عبر وحدة المعالجة المسبقة، التي تعالج البيانات السمعية والبصرية للتحليل اللاحق من خلال تنظيف، وتطبيع، وتنسيق تدفقات الإدخال. ثم ينتقل خط الأنابيب إلى مرحلة استخراج الميزات، حيث يتم تقسيم البيانات إلى تدفين: التدفق البصري، الذي يعزل ميزات الوضعية والحركة من خلال خوارزميات تقدير الوضعية، وتدفق الصوت، الذي ينسخ الكلام إلى تضمينات أوامر قابلة للتفسير. يقوم مشفر المحول متعدد الوسائط، الذي يستخدم التركيز الذاتي متعدد الرؤوس والترميز الموضعي الزمني للتعبير عن الاعتماد المتبادل طويل المدى عبر تسلسلات التفاعل، ثم يعالج التمثيل المدمج. يتم تقدير حالة الهدف الحالية للمستخدم بواسطة نية طويلة الأفق ومتنبئ تقدم المهمة، ويتم تعيين الإجراءات منخفضة المستوى إلى عقد في رسم مهام هرمي لتتبع المهام بشكل موثوق بواسطة وحدة محاذاة مبنية على DTW. يتم تحديث أوزان الاندماج ومعلمات التنبؤ باستمرار عبر حلقة تكييف النماذج عبر الإنترنت استجابة لتغذية راجعة التفاعل، وتوفر وحدة التفسير تفسيرات واضحة لتعزيز الانفتاح والثقة. يتيح خط الأنابيب بأكمله للنظام العمل بشكل تكيفي وفعال مع المستخدمين في المهام والبيئات الديناميكية.

figure-protocol-1
الشكل 1: نظرة عامة على إطار التفاعل متعدد الوسائط المقترح بناء على المحولات. يستخدم تقنية موجهة بالانتباه لترميز ودمج البيانات البصرية والسمعية ديناميكيا. وحدة Transformer، التي تدمج نمذجة المهام الهرمية والتكيف عبر الإنترنت، تعالج التمثيل المدمج لتوقع النية على الأفق الطويل وتقدير تقدم المهمة. . يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يتضمن النظام المقترح وحدة تفسيرية خفيفة الوزن تعمل جنبا إلى جنب مع مكونات الدمج متعدد الوسائط والتخطيط الهرمي لتحسين الشفافية وثقة المستخدم. تستمد الوحدة إشارات قابلة للتفسير من محاذاة رسم المهام القائم على DTW (مثل تقدم المهمة الحالي والإجراء التالي المتوقع) وطبقة الدمج المعتمدة على الانتباه (مثل أوزان أهمية الوسائط). يتم تحويل هذه الإشارات إلى تفسيرات مفهومة للبشر، مثل ما إذا كانت الأوامر المنطوقة أو الإيماءات البصرية تؤثر بشكل أساسي على اختيار النظام وكيف يتناسب الفعل المتوقع مع خطة العمل الأوسع. يتلقى المستخدمون شروحات على شكل تغذية راجعة مكتوبة أو بصرية موجزة، تساعدهم على فهم وتوقع وتحسين سلوك النظام إذا لزم الأمر. تحسين سعادة المستخدمين، وسلاسة التفاعل، والمقاييس المتعلقة بالثقة التي تم الإشارة إليها في التقييم هي مؤشرات غير مباشرة على إدراك المستخدم لقابلية التفسير. تشير النتائج إلى أنه في التفاعل طويل الأمد بين الإنسان والذكاء الاصطناعي، يعزز التفكير الشفاف لقرارات الذكاء الاصطناعي ثقة المستخدم، ويسهل التعاون، ويزيد من قبول سلوك النظام التكيفي.

بيانات الإدخال

يتم جمع المدخلات في الإطار المتصور للتعاون بين الإنسان والذكاء الاصطناعي من خلال آلية استشعار متعددة الوسائط منظمة تجمع بين الرؤية والسمع لتحقيق الأفعال والنوايا البشرية بفعالية. يتم الحصول على المدخلات البصرية باستخدام كاميرا RGB-D، التي تلتقط معلومات الوضعيات الحية للبشر، والموقع المكاني، وسياق المحيط. تتم معالجة البيانات البصرية من خلال نماذج مدربة مسبقا مثل BlazePose للحصول على نقاط رئيسية في الجزء العلوي من الجسم مهمة لمهام التفاعل. وفي الوقت نفسه، يتم الحصول على المعلومات السمعية من ميكروفون اتجاهي وتفسيرها من خلال نموذج DeepSpeech المدرب مسبقا لتحديد أوامر الكلام التي تفصل أو توفر إشارات بصرية غير مؤكدة إضافية. في البيئات التعاونية، يوفر نظام الإدخال المزدوج التكيف الديناميكي والإدراك الواعي بالسياق. تتضمن مجموعة بيانات التدريب والتقييم أكثر من 5000 مسار حركة بشري متعدد الوسائط1 لمجموعة من أنشطة التفاعل، مثل التجميع وسلوكيات التسليم، تم جمعها من أربعة مستخدمين في بيئات محكومة وشبه منظمة. لتعزيز التعميم، يتيح النظام تكييف النماذج عبر الإنترنت أثناء النشر، مما يسمح للنموذج بتحديث توقعاته في الوقت الحقيقي كدالة لتغير سلوك المستخدم والديناميكيات البيئية.

وصف مجموعة البيانات

تم الحصول على مجموعة بيانات التدريب والتقييم للإطار المقترح من تجارب تعاون حقيقية بين الإنسان والروبوت ضمن مهمة تجميع سيارة لعبة باستخدام روبوت كينوفاGEN3 1. كان هدف البيئة التجريبية إلى محاكاة الأنشطة التعاونية طويلة الأمد التي تشمل التفاعل متعدد الوسائط، والتي شملت الأساليب البصرية والسمعية معا. على وجه الخصوص، تتكون مجموعة بيانات التدريب من 3003 تسلسل من المسارات من مستخدمين، وتحتوي مجموعة البيانات التجريبية على 2088 تسلسلا، بما في ذلك بيانات من مستخدمين جديدين لتقييم تعميم النموذج. يسجل كل مسار سلسلة من 5 خطوات من نقاط الوضعية العلوية التي تم استرجاعها بواسطة BlazePose، إلى جانب أوامر الكلام المقابلة التي تم نسخها بواسطة DeepSpeech33. تظهر البيانات المجمعة التفاوت الطبيعي البشري في التعبير عن الإيماءات والأوامر في الأنشطة بما في ذلك تسليم الأشياء، واستخدام الأدوات، والإجراءات التعاونية. تعد مجموعة البيانات متعددة الوسائط الأساس للتعلم المراقب لنماذج التنبؤ بالحركة والمسار، وهي المعيار المركزي في دراسات المستخدمين التي تجرى تحت ظروف الرؤية فقط، والصوتية فقط، ومتعددة الوسائط. يضمن دمج أنواع مختلفة من المستخدمين وظروف ضوضاء واقعية الصلابة واختبار التكيف لأنظمة HRC الدائمة. يوضح الجدول 2 الوصف التفصيلي لمجموعة البيانات.

السماتتفاصيل
اسم مجموعة البياناتمجموعة بيانات تجميع سيارات الألعاب (تم جمعها داخليا)
بيئة المجموعاتتجربة HRC في العالم الحقيقي مع ذراع KINOVA GEN3
عدد المستخدمين (التدريب)2 مستخدمون
عدد المستخدمين (الاختبار)4 مستخدمين (2 من مجموعة التدريب، 2 غير مرئيين)
المسارات الكاملة (التدريب)3,003 مسارات
المسارات الكلية (الاختبار)2,088 مسارا
الأساليب التي تم الاستيلاء عليهابصري (RGB-D للوضعية)، الصوت (أوامر الكلام)
تنسيق البياناتنقاط المفاتيح في الوضعيات (من BlazePose)، أوامر تحويل الكلام إلى نص
الحل الزمنييشمل كل مسار خمس خطوات زمنية
المهام المغطاة3 مهام رئيسية: الاختيار والوضع، تدوير الأشياء، التجميع التعاوني
الاستخدامالتدريب المراقب لنماذج التنبؤ بالحركة والمسار؛ دراسة المستخدم

الجدول 2: وصف مجموعة البيانات. معلومات عن بيئة المحاكاة، بما في ذلك إطار البرمجة، إعدادات الأجهزة، وبيئة التقييم.

معالجة مجموعة البيانات المسبقة

لتمكين التفاعل متعدد الوسائط التكيفي في التعاون بين الإنسان والذكاء الاصطناعي، تخضع مجموعة البيانات الخام، مثل البيانات البصرية (صور RGB والعمق)، والسمعية (أوامر الكلام)، والسلوك الزمني (نقاط مفاتيح الوضعية)، لمعالجة مسبقة هيكلية. يتم استخراج البيانات البصرية أولا بواسطة نموذج تقدير الوضعية fوضعية، والذي غالبا ما يستمد من BlazePose أو OpenPose. بالنسبة للإطار t، يعرف متجه وضعية الإنسان على النحو التالي:

figure-protocol-2(1)

حيث k هو عدد نقاط المفتاح وكل نقطة مفتاح تحتوي على إحداثيات ثنائية الأبعاد. يتم تطبيع التسلسلات حسب طول الجذع وتنعيمها مع مرور الوقت باستخدام مرشح سافيتسكي-غولاي:

figure-protocol-3(2)

حيث w هو حجم نافذة التصفية. ثانيا، يتم تقسيم تدفقات الصوت الخام في At إلى أجزاء باستخدام كاشف نشاط الصوت (VAD). يتم إدخال مقاطع موثوقة إلى نموذج التعرف علىالكلام f للكلام (مثل DeepSpeech) لسحب رموز الأوامر:

figure-protocol-4(3)

حيث V هي مفردات الأوامر المعترف بها. للتكامل، يتم محاذاة رموز الأوامر للجميع مع طوابع الوضعية البصرية باستخدام دالة محاذاة قائمة على الاستيفاء τ:

figure-protocol-5(4)

ثالثا، لتشكيل تسلسلات figure-protocol-6تدريب النية الزمنية، نعرف تسلسلات المسار ، مع أوامر figure-protocol-7الكلام المرتبطة . يتم تقسيم هذه النوافذ إلى أجزاء ذات طول ثابت باستخدام نوافذ منزلقة بحجم l:

figure-protocol-8(5)

figure-protocol-9(6)

أخيرا، يتم تطبيع المدخلات إلى متوسط صفر وتباين وحدة لكل بعد نقطة مفتاحية للتقارب في نماذج التنبؤ القائمة على المسار:

figure-protocol-10(7)

حيث μj σj هي المتوسط والانحراف المعياري لنقطة المفتاح j التي أكملت مجموعة التدريب.

استخراج الميزات

في نموذج التفاعل التكيفي متعدد الوسائط الموضح المذكور، يتم تمكين التعاون القوي والفوري من خلال دمج ميزات المهام البصرية والصوتية والسياقية. يبدأ خط استخلاص الميزات بجمع البيانات المتزامن من طريقتين رئيسيتين: الإشارات figure-protocol-11 البصرية والإشارات figure-protocol-12الصوتية، المفهرسة عند الخطوة الزمنية t. تمر هذه الملاحظات عبر وحدات الإدراك المقابلة للحصول على ميزات دلالية عالية المستوى تتعلق بالسلوك البشري، والنوايا، وأوامر الكلام.

استخراج الميزات البصرية

يتم تغذية البيانات figure-protocol-13 البصرية الخام من كاميرات RGB-D عبر مقدر وضعية بشري (مثل BlazePose)، مما يوفر متجه figure-protocol-14نقطة مفتاح مكانية ، حيث يمثل k عدد نقاط المفتاح المكتشف وتحتوي كل نقطة على إحداثيات ثلاثية الأبعاد:

figure-protocol-15(8)

تدمج هذه النقاط الرئيسية زمنيا في مسار figure-protocol-16وضعية ، حيث يتم استخراج ديناميكيات الحركة عبر تحليل الاتجاه الموسمي:

figure-protocol-17(9)

حيث ∈_t يمثل الضوضاء المتبقية.

استخراج ميزات الصوت

يتم معالجة إدخال figure-protocol-18 الصوت من خلال نموذج تعرف على الكلام مدرب مسبقا (مثل DeepSpeech) وينتج تمثيلا figure-protocol-19للأوامر المميز، حيث n هو طول الرمز:

figure-protocol-20(10)

الاندماج متعدد الوسائط

لبناء سياق تفاعل موحد، ندمج السمات من خلال انتباه موزون بالثقة بناء على الثقة والمعلومات المتبادلة:

figure-protocol-21(11)

حيث φV و φA هما دوال الإسقاط للميزات البصرية والسمعية في فضاء كامن مشترك، و αt∈[0,1] هو مصطلح وزن للطرائق الديناميكية يحسب على أساس الإنتروبيا:

figure-protocol-22(12)

هنا، figure-protocol-23 و figure-protocol-24 هي معلومات متبادلة بين حالة الهدف g والطرائق المرصودة.

التخطيط باستخدام التضمين السياقي

آخر متجه ميزة متعدد الوسائط Ft يثري بسياق المهمة والتقدم Pt ويصبح مدخل الحالة لوحدة التخطيط التكيفي:

figure-protocol-25(13)

تستخدم هذه الميزة المستخرجة xt كمدخل لنماذج التنبؤ بالنوايا وتخطيط الحركة في المراحل النهائية، مما يدعم التعاون التكيفي والقوي بين الإنسان والذكاء الاصطناعي في بيئات ديناميكية وغير مؤكدة.

توقع الإجراءات والخطة عبر محاذاة رسم المهام

باتباع عملية استخراج الميزات متعددة الوسائط، حيث يتم دمج نية الكلام (الصوت)، ومسار الوضعية (المرئي)، والسياقات (مثل سجلات المهام أو المشاعر) في المعالجة اللاحقة، تشمل المعالجة اللاحقة التنبؤ بالفعل البشري التكيفي واستنتاج الخطة باستخدام محاذاة مخطط المهام الهرمي.

ليكن متجه الميزة متعددة الوسائط المتكامل عند الخطوة الزمنية t ممثلا كالتالي:

figure-protocol-26(14)

يتنبأ النظام في البداية بالفعل البشري منخفض المستوى عبر دالة fact، والتي غالبا ما تمثل كمشفر-مفكك متكرر أو محول:

figure-protocol-27(15)

حيث F(t-k:t) تشير إلى تسلسل اندماج الميزات في آخر k خطوات زمنية، و figure-protocol-28 هو الفعل المتوقع من مجموعة الأفعال A. الوحدة تعمل على الإنترنت ومضبوطة بدقة بواسطة الفقدان التكيفي:

figure-protocol-29(16)

هنا، CE هو فقدان الإنتروبيا المتقاطع لتصنيف الأفعال، ثم يدفع الحد الثاني التنبؤ الجيد بالمسار المستقبلي.

لتوقع الخطة عالية المستوى، نؤطر المهمة كتقدم على طول رسم بياني هرمي للمهمة G = (N, E)، حيث تشير كل عقدة ni ∈N إلى مهمة فرعية أو هدف وسيط. الهدف هو مطابقة تسلسل الإجراءات المرصود مع مسار المهمة المرجعي R*∈G عن طريق تقليل المسافة:

figure-protocol-30(17)

حيث Pt يشير إلى مسار التقدم الحالي وd(⋅) يشير إلى مسافة التشوه الزمني الديناميكي (DTW) أو مقياس المحاذاة الناعمة.

ثم يتم اشتقاق النية figure-protocol-31 النهائية على مستوى الخطة عن طريق إسقاط الفعل المتوقع أ ̂_t على الخطوة التالية الأكثر احتمالا في المسار figure-protocol-32المتوافق :

figure-protocol-33(18)

يضمن هذا الفك الهرمي أنه حتى مع المدخلات الحسية غير الواضحة أو المزعجة، يختار النظام النية عالية المستوى الأكثر صلة بالسياق ومتوافقة مع تسلسل المهام الحالي. هذا التخطيط التنبؤي لا يعزز فقط كفاءة التعاون، بل يعزز أيضا التوقع والقدرة على التكيف ضمن التفاعل متعدد الأدوار بين الإنسان والذكاء الاصطناعي.

آلية الاندماج متعدد الوسائط (القائم على الانتباه)

في التعاون التكيفي بين الإنسان والذكاء الاصطناعي، يعد التكامل متعدد الوسائط لعدة أنماط حسية (مثل البصرية: وضعية الإنسان، المسار؛ السمعي: أوامر الكلام) ضروريا لتفسير نية المستخدم بشكل صحيح. لا يمكن لنهج الاندماج القائم على القواعد أو الاندماج الثابت التعامل مع التفاعلات البشرية الديناميكية في العالم الحقيقي. لهذا الغرض، يتم تقديم آلية اندماج تعتمد على الانتباه هنا لوزن كل نمط ديناميكيا وفقا لأهميته السياقية في كل خطوة زمنية.

دعونا نرمز إلى متجهات الميزات المستخرجة من الأنماط البصرية والصوتية ك figure-protocol-34 و figure-protocol-35، على التوالي. تقوم هذه المتجهات بترميز المعلومات الدلالية التي تم الحصول عليها من خلال خطوط معالجة سابقة، مثل أن الميزات البصرية قد تنتج عن تقدير الوضعية والتنبؤ بالإجراءات، بينما يمكن اشتقاق ميزات الصوت من تضمين الكلام باستخدام نماذج مثل DeepSpeech أو wav2vec.

الهدف من الاندماج القائم على الانتباه هو حساب أوزان الانتباه الخاصة بالنمط التي تلتقط الأهمية النسبية لكل نمط. يتم ذلك باستخدام آلية انتباه ناعمة.

حساب الانتباه والوزن

في الخطوة الأولى، يتم تحويل كلا المتجهين إلى فضاء انتباه مشترك من خلال تحول قابل للتعلم. أي أنه لكل طريقة i∈{V,A}، يتم حساب درجة الانتباه الوسيط كما يلي:

figure-protocol-36(19)

حيث figure-protocol-37 و figure-protocol-38 هما معلمات قابلة للتعلم، و tanh دالة تنشيط غير خطية. يسمح هذا التحويل للنموذج باستخراج ارتباطات عالية المستوى وأهمية سياقية لكل نمط.

ثم يتم تطبيع هذه الدرجات غير الطبيعية للانتباه eV و αA بواسطة دالة softmax بحيث تساوي 1

figure-protocol-39(20)

هنا، αV و αA هما أوزان الانتباه على الوسائط البصرية والصوتية على التوالي. الأوزان قابلة للتكيف ثم يتم تحديثها مع مرور الوقت حسب سياق المهمة الحالي، وجودة الإشارة، ونشاط المستخدم.

figure-protocol-40(21)

يتم الحصول على التمثيل figure-protocol-41 المدمج الناتج كتركيبة موزونة من متجهات النمط المدخل:

هذا المتجه المدمج يرمز للدلالات المشتركة للمعلومات البصرية والسمعية بطريقة تبرز بنشاط التيار الأكثر إفادة. ثم يتم تغذيته إلى وحدات لاحقة مثل مطابقة رسم المهام، أو توقع النية، أو محرك تخطيط حركة الروبوت.

خوارزمية 1: الاندماج القائم على الانتباه متعدد الوسائط

الإدخال: متجه الميزة البصرية هو hV∈Rd، متجه ميزات الصوت هو hA∈Rd

المعلمات القابلة للتعلم: W∈Rk*d,w∈Rk و b∈Rk

المخرج: تمثيل مدمج hمدمج ∈Rd.

الخطوة 1: تحديد التمثيلات الوسيطة بالحساب باستخدام المعادلة 19

الخطوة 2: استخدم Softmax لتطبيع درجات الانتباه باستخدام المعادلة 20

الخطوة 3: حساب المتجه الملتقى باستخدام المعادلة 21

الخطوة 4: إعادة ال Hالملتصقة

توفر خوارزمية الاندماج متعدد الوسائط القائم على الانتباه وسيلة للدمج الذكي لميزات أنماط إدخال مختلفة، مثل التدفقات البصرية والصوتية، معا بطريقة واعية للسياق. يعد الاندماج ضروريا في الأنظمة التي تقدم فيها كل طريقة معلومات مكملة لكنها متنوعة، مثل بيئات التعاون بين الإنسان والذكاء الاصطناعي حيث تلتقط الرؤية الإيماءات أو وضعية الجسد، بينما يلتقط الصوت أوامر الكلام أو الإشارات الصوتية.

تبدأ الخوارزمية 1 بتحديد تمثيلات وسيطة لكل نمط. لحساب كلا النموذجين، eV للتدفق البصري وeA لتدفق الصوت، تقوم طبقة الشبكة العصبية المشتركة أولا بتحويل غير خطي على متجهات الميزات المقابلة. ثم تحسب أوزان الانتباه αV و αA عن طريق أداء دالة softmax على الدرجات الوسيطة. هذا يساعد الأوزان على أن تكون موجبة وتجمع إلى 1، مما يجعل مساهمات كل نمط يتم تطبيعها. كلما كانت الوسيلة أكثر إفادة، كما هو موضح، زاد وزن انتباهها.

في النهاية، تحسب الخوارزمية التصوير المختلطh من خلال مزيج موزون من متجهات الرسومات والميزات الصوتية، موحدة مع أوزان الانتباه الخاصة بها. يجمع هذا المتجه المدمج بين الطريقتين بطريقة مدفوعة بالبيانات وحساسة للسياق، ويخدم المهام التالية مثل التعرف على النية، اتخاذ القرار، أو تخطيط حركة الروبوتات. بشكل عام، تمكن هذه الخوارزمية النظام من التركيز ديناميكيا على أكثر تركيبة للطريقة أو التركيبة الموضوعية ملاءمة في لحظة محددة، بدلا من استخدام طرق الدمج الثابتة أو القائمة على القواعد. هذا يجعل الإطار أكثر قوة ومرونة واستجابة في مواقف التفاعل الديناميكي بين الإنسان والذكاء الاصطناعي.

يوضح الشكل 2 سير عمل آلية الاندماج متعدد الوسائط المعتمد على الانتباه التي تعمل من خلال التكامل الحساس للسياق بين المدخلات البصرية والسمعية. استخراج الميزات البصرية، وهو الخطوة الأولى في سير العمل، يتضمن استخراج الميزات المكانية أو المتعلقة بالوضعيات من الصور المدخلة أو الفيديو (مثل كاميرات RGB-D). يتم إدخال هذه المقاطع لاحقا في وحدة الانتباه البصري التي تتعلم إبراز أكثر محتوى المعلومات البصرية إفادة. بالتوازي، تعالج وحدات الانتباه الصوتي تضمين الكلام أو رموز الصوت من الأوامر المنطوقة، مع إعطاء الأهمية السياقية لإشارات سمعية مختلفة. يتم دمج الميزات المرجحة بالانتباه الناتجة من خلال طبقة اندماج قائمة على الانتباه وتمرر إلى شبكة تغذية موضعية مع اتصالات متبقية وتطبيع طبقات، مكونة كتلة ترميز محول قياسية. المخرج هو تضمين متعدد الوسائط موحد يدعم التنبؤ القوي بالنوايا طويلة الأفق واتخاذ القرار التكيفي تحت ظروف تفاعل متغيرة. يتيح هذا التصميم للنظام التركيز بشكل انتقائي على النمط الأكثر قوة في أي وقت، مما يحسن المتانة وقابلية التفسير في التفاعل الفوري بين الإنسان والذكاء الاصطناعي.

figure-protocol-42
الشكل 2: البناء التفصيلي لوحدة الاندماج متعدد الوسائط الموجه بالانتباه. لتوليد تمثيل مدمج واع للسياق في كل خطوة زمنية، تجمع المشفرات الخاصة بالنمط ميزات من التيارات البصرية والسمعية. ثم يتم وزن هذه الميزات ديناميكيا باستخدام آلية انتباه مدفوعة بالبيانات. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

تكييف النماذج عبر الإنترنت

لضمان تعاون عالي الجودة بين الإنسان والذكاء الاصطناعي تحت سلوكيات وسياقات مستخدمين مختلفة، يدمج إطارنا آلية تكييف نماذج عبر الإنترنت تقوم بتحسين نماذج المستخدم الخاصة تدريجيا أثناء التفاعل. تتبع الوحدة الإشارات السلوكية في الوقت الحقيقي (مثل الوضعية، مسارات الإيماءات، نبرة الكلام) وتحديث النماذج التنبؤية الأساسية بخوارزميات التعلم التدريجي. على وجه الخصوص، يتم ضبط نماذج التنبؤ بالمسار والتعرف على النية بدقة مع المدخلات الحديثة عبر الضبط الدقيق القائم على التدرج أو التكيف المنخفض (LoRA) بحيث يتمكن النظام من التكيف مع سلوك المستخدم المتغير أو متطلبات المهمة الخاصة دون الحاجة إلى إعادة تدريب كاملة.

تعمل طبقة التغذية الراجعة بتناغم مع التكيف من خلال التغذية الراجعة الضمنية (مثل التصحيحات، التردد، التأخيرات) والأوامر الصريحة (مثل الكلام أو واجهة الرسوم). له غرضان: معايرة تكيفية لأهمية الإشارات متعددة الوسائط، ونقل مقاييس الثقة/الثقة إلى وحدات القرار والتحكم.

تمكن دورة التغذية الراجعة أداء أكثر سلاسة للمهمة واستجابات موجهة نحو المستخدم. لتنمية الثقة والشفافية، يدمج الإطار وحدة قابلية التفسير التي تحول قرارات النماذج منخفضة المستوى إلى مبررات مفهومة للبشر. يستخدم خرائط المنطق من محول الاندماج متعدد الوسائط، مع دعم تتبع منطقي عبر رسم المهمة. يمكن أن يقدم هذا المنطق اختياريا عبر واجهة المستخدم الرسومية أو المساعد السمعي لتمكين المستخدمين من فهم وربما حتى تصحيح سلوك النظام.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعالج نموذج التفاعل متعدد الوسائط التكيفي المقترح هنا هذه المخاوف ويعزز بشكل كبير التعاون بين الإنسان والذكاء الاصطناعي من خلال دمج أساليب الرؤية والكلام بسلاسة مع عمليات تكيف المستخدم في الوقت الحقيقي. على عكس النظام الهرمي متعدد الوسائط الأساسي، يتضمن نهجنا حلقة تغذية راجعة شخصية بالإضافة إلى التكيف المعرفي الواعي بالحمل الذي يوفر تفاعلا أكثر حدسية ووعيا بالسياق. عند الاختبارات التجريبية في أنشطة تعاونية محاكاة، مثل التعامل مع الكائنات، عرض المكونات، وإكمال الأهداف بناء على التسلسل، أظ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تظهر النتائج بشكل قاطع كفاءة الأساس المقترح للتفاعل متعدد الوسائط التكيفية لتعزيز التعاون بين الإنسان والذكاء الاصطناعي.

بعيدا عن درجات التقييم القياسية مثل زمن إكمال المهمة (TCT)، دقة التنبؤ بالنية البشرية (HIPA)، كفاءة الاندماج متعدد الوسائط (MFE)، معدل استعادة الأخطاء (ERR)، درجة رضا المستخدم (USS)، ومؤشر سلاسة التفاعل (ISI)، يمكن إضافة مقاييس إضافية تركز على المستخدم لتحليل الأطر متعددة الوسائط التكيفية بشكل معمق. على وجه الخصوص، يمكن إدخال مؤشر العبء المع...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يوجد تضارب مصالح لدى المؤلفين.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يشكر المؤلفون بكل امتنان الدعم الذي قدمته كلية التصميم بجامعة جيانغنان، ووشي، الصين.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
كاميرا RGB-D (Intel RealSense D435)شركة إنتلD435دقة العمق 1280&00؛ 720 بكسل @ 30 إطار في الثانية؛ دقة RGB 1920&00؛ 1080 بكسل @ 30 إطار في الثانية؛ يستخدم لالتقاط وضعية المستخدم، وحركات الجسم، والسياق المكاني
الميكروفون الاتجاهيالموردون العامة / المتعددونلا يوجدميكروفون واسع النطاق وإلغاء الضوضاء (16 كيلوهرتز&ndash؛ 44.1 كيلوهرتز)؛ يستخدم لجمع الأوامر المنطوقة
BlazePose (نموذج مدرب مسبقا)جوجلhttps://developers.google.com/mediapipe/solutions/vision/poseنموذج تقدير الوضعية مع 33 نقطة رئيسية؛ استخراج وضعية الإنسان في الوقت الحقيقي
OpenPose (نموذج مدرب مسبقا)مختبر الحوسبة الإدراكية في جامعة كارنيجي ميلونhttps://github.com/CMU-Perceptual-Computing-Lab/openposeإطار تقدير وضعية متعددة الأشخاص المستخدم لاستخراج مسارات الحركة
محرك ASR من ديب سبيتشموزيلاv0.9.3نموذج التعرف التلقائي على الكلام المدرب مسبقا لتحويل الكلام إلى نص
محرك wav2vec 2.0 ASRالذكاء الاصطناعي الضخمhttps://github.com/facebookresearch/fairseqنموذج تمثيل الكلام الذاتي الإشراف لمعالجة الكلام في الوقت الحقيقي
نموذج التنبؤ بالإجراءات المعتمد على المحولات (DLinear / Seq2Seq)تنفيذ مخصصلا يوجدبنية المشفر-فك الترميز الزمني مع الانتباه للتنبؤ بالإجراءات قصيرة المدى
وحدة التشويه الزمني الديناميكي (DTW)مخصص / معتمد على SciPyhttps://docs.scipy.org/doc/scipy/reference/generated/scipy.spatial.distance.cdist.htmlخوارزمية المحاذاة الناعمة لمطابقة إجراءات المستخدم مع رسوم المهام المحددة مسبقا
شبكة الاندماج متعددة الوسائط المعتمدة على الانتباهتنفيذ مخصصلا يوجدآلية الانتباه المرجونة بالثقة لدمج مدخلات الرؤية والكلام
وحدة التكيف عبر الإنترنت (تعتمد على LoRA / التدرج)تنفيذ مخصصhttps://github.com/microsoft/LoRAضبط خفيف الوزن وفعال من حيث المعلمات للتكيف مع سلوك المستخدم
وحدة التفسير (قائمة على القواعد + خرائط الانتباه)تنفيذ مخصصلا يوجديوفر مبررات قرار قابلة للتفسير باستخدام القواعد وتصورات الانتباه
كينوفا الجيل الثالث الذراع الروبوتيةكينوفا روبوتيكسالجيل الثالثمعالج روبوتي 7-DOF مع حساسات عزم دوران مدمجة؛ تستخدم لتجميع سيارات الألعاب التعاونية
بيئة محاكاة التجميع التعاونيالبيئة المخصصةلا يوجدإعداد تجميع سيارات الألعاب في العالم الحقيقي المستخدم في مقارنة الأداء التعاوني متعدد الوسائط
مقاييس التقييم (TCT، HIPA، MFE، LATENCY، ERR، USS، ISI)تعريفات مخصصةلا يوجدمقاييس كمية وتركز على المستخدم لتقييم كفاءة التعاون ودقته والثقة

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Yu, P., Abuduweili, A., Liu, R., Liu, C. Robustifying long-term human-robot collaboration through a hierarchical and multimodal framework. arXiv. , (2024).
  2. Cheng, Y., Sun, L., Liu, C., Tomizuka, M. Towards efficient human-robot collaboration with robust plan recognition and trajectory prediction. IEEE Robot Autom Lett. 5, 2602-2609 (2020).
  3. Abuduweili, A., Li, S., Liu, C. Adaptable human intention and trajectory prediction for human-robot collaboration. arXiv. , (2019).
  4. Amirova, A., Rakhymbayeva, N., Yadollahi, E., Sandygulova, A., Johal, W. Ten years of human-NAO interaction research: A scoping review. Front Robot AI. 8, 744526(2021).
  5. Liu, R., Liu, C. Human motion prediction using adaptable recurrent neural networks and inverse kinematics. IEEE Control Syst Lett. 5, 1651-1656 (2021).
  6. Wang, T., Zhao, Y., Chen, L., Li, Q., Xu, Y., Zhang, H. Multimodal human-robot interaction for human-centric smart manufacturing: A survey. Adv Intell Syst. 6, 2300359(2024).
  7. Ergonomic adaptation of robotic movements in human-robot collaboration. van den Broek, M. K., Moeslund, T. B. Companion Proc. ACM/IEEE Int Conf Hum-Robot Interact, 2020, 499-501 (2020).
  8. Human-robot collaboration using multimodal perception. Yang, Y., et al. Proc IEEE Int Conf Robot Biomimetics (ROBIO), , 358-363 (2021).
  9. Sawadwuthikul, G., et al. Intelligent manufacturing with deep reinforcement learning. IEEE Trans Ind Inform. 18, 1883-1894 (2022).
  10. Multimodal robotic manipulation in collaborative tasks. Huang, W., Gu, J., Duan, P., Hou, S., Zheng, Y. Proc IEEE Int Conf Robot Autom (ICRA), , 14213-14219 (2021).
  11. Dellermann, D., et al. The future of human-AI collaboration: A taxonomy of design knowledge for hybrid intelligence systems. arXiv. , (2021).
  12. Ostheimer, J., Chowdhury, S., Iqbal, S. An alliance of humans and machines for machine learning: Hybrid intelligent systems and their design principles. Technol. Soc. 66, 101647(2021).
  13. Afsar, B., Al-Ghazali, B. M., Cheema, S., Javed, F. Cultural intelligence and innovative work behavior: The role of work engagement and interpersonal trust. Eur J Innov Manag. 24, 1082-1109 (2020).
  14. Spadaro, G., Gangl, K., Van Prooijen, J. W., Van Lange, P. A. M., Mosso, C. O. Enhancing feelings of security: How institutional trust promotes interpersonal trust. PLoS ONE. 15, e0237934(2020).
  15. Pavez, I., Gómez, H., Laulié, L., González, V. A. Project team resilience: The effect of group potency and interpersonal trust. Int J Proj Manag. 39, 697-708 (2021).
  16. Yuan, H., Long, Q., Huang, G., Huang, L., Luo, S. Different roles of interpersonal trust and institutional trust in COVID-19 pandemic control. Soc Sci Med. 293, 114677(2022).
  17. Yun, Y., Ma, D., Yang, M. Human-computer interaction-based decision support systems with applications in data mining. Future Gener Comput Syst. 114, 285-289 (2021).
  18. Nazar, M., Alam, M. M., Yafi, E., Su'ud, M. M. A systematic review of human-computer interaction and explainable artificial intelligence in healthcare. IEEE Access. 9, 153316-153348 (2021).
  19. Ho, Y. H., Tsai, Y. J. Open collaborative platforms for multi-drone search and rescue operations. Drones. 6, 132(2022).
  20. VAHAK: A blockchain-based outdoor delivery scheme using UAVs for healthcare 4.0 services. Gupta, R., et al. Proc IEEE INFOCOM Workshops, , 255-260 (2020).
  21. BloCoV6: A blockchain-based 6G-assisted UAV contact tracing scheme for COVID-19. Zuhair, M., Patel, F., Navapara, D., Bhattacharya, P., Saraswat, D. Proc 2nd Int Conf. Intell Eng Manag (ICIEM), , 271-276 (2021).
  22. Sahoo, S. K., et al. Intelligent trust-based utility and reusability model using UAV-assisted sensor networks. Appl Sci. 12, 1317(2022).
  23. Ko, Y., et al. Drone secure communication protocol for future sensitive military applications. Sensors. 21, 2057(2021).
  24. Gupta, R., Kumari, A., Tanwar, S., Kumar, N. Blockchain-envisioned softwarized multi-swarming UAVs to tackle COVID-19 situations. IEEE Netw. 35, 160-167 (2020).
  25. Tomsett, R., et al. Rapid trust calibration through interpretable and uncertainty-aware. Patterns. 1, 100049(2020).
  26. Huang, R., Zhou, H., Liu, T., Sheng, H. Multi-UAV collaboration to survey Tibetan antelopes in Hoh Xil. Drones. 6, 196(2022).
  27. Seeber, I., et al. Machines as teammates: A research agenda on AI in team collaboration. Inf Manag. 57, 103174(2020).
  28. Ajoudani, A., et al. Progress and prospects of the human-robot collaboration. Auton Robots. 42, 957-975 (2018).
  29. Oviatt, S., et al. The Handbook of Multimodal-Multisensor Interfaces, Volume 1: Foundations, User Modeling, and Common Modality Combinations. , Association for Computing Machinery. New York, NY, USA. (2017).
  30. Villani, V., Pini, F., Leali, F., Secchi, C. Survey on human-robot collaboration in industrial settings. Mechatronics. 55, 248-266 (2018).
  31. Nikolaidis, S., et al. Human-robot collaboration in manufacturing: Quantitative evaluation of predictable, convergent robot behavior. Auton Robots. 41, 123-140 (2017).
  32. Roggen, D., Junker, M., Transter, G., Roques, D. L. Collecting complex activity datasets in smart environments. J Ambient Intell Humaniz Comput. 1, 1-17 (2009).
  33. Bazarevsky, V., et al. BlazePose: On-device real-time body pose tracking. arXiv. , (2020).
  34. Garcia, S., Gomez-Donoso, F., Cazorla, M. Enhancing human-robot interaction: Development of a multimodal robotic assistant for user emotion recognition. Appl Sci. 14, 11914(2024).
  35. Li, S., et al. Toward proactive human-robot collaborative assembly: A multimodal transfer-learning-enabled action prediction approach. IEEE Trans Ind Electron. 69, 8579-8588 (2021).
  36. Abdelrahman, A. A., Almotiri, J., Yaseen, Q., Alanazi, A., Alotaibi, B. Multimodal engagement prediction in multiperson human-robot interaction. IEEE Access. 10, 61980-61991 (2022).
  37. Chiossi, F., et al. Designing intent: A multimodal framework for human-robot cooperation in industrial workspaces. arXiv. , (2025).
  38. McGrath, M. J., Chen, Y., Patel, A., Smith, J., Rao, V. Collaborative human-AI trust (CHAI-T): A process framework for active management of trust in human-AI collaboration. arXiv. , (2024).
  39. Fragiadakis, G., Nikas, C., Karageorgiou, E., Papadopoulos, A. Evaluating human-AI collaboration: A review and methodological framework. arXiv. , (2024).
  40. Younis, H. A., Khan, S., Raza, M., Ahmed, F., Mahmood, T. Multimodal age and gender estimation for adaptive human-robot interaction: A systematic literature review. Processes. 11, 1488(2023).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

مقالات ذات صلة