Research Article

النمذجة الحاسوبية لتجربة المستخدم العاطفية باستخدام الإشارات الفسيولوجية والسلوكية متعددة الوسائط

DOI:

10.3791/69823

April 7th, 2026

In This Article

Summary

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول إطارا حاسوبيا ينمذج تجربة المستخدم العاطفية من خلال دمج الإشارات الفسيولوجية والسلوكية بطريقة متعددة الوسائط، باستخدام تقنيات التعلم القائم على الارتباط والدمج متعدد الوسائط. يقترح هذا البروتوكول ويختبر إطارا لنمذجة التأثير متعددة الوسائط على مجموعة بيانات اختبار AMIGOS.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يقترح هذا العمل بروتوكولا حسابيا قابلا للتكرار لنمذجة العاطفة متعددة الوسائط يستخدم الإشارات الفسيولوجية. هدف البروتوكول هو تمكين التعرف على المشاعر دون اتصال بالإنترنت من خلال دمج إشارات حيوية متعددة باستخدام إطار تعلم عميق موحد. يتكون العمل المقترح من خمس خطوات: جمع البيانات، المعالجة المسبقة، محاذاة الميزات، دمج الوسائط المتعددة، والتقييم. تم استخدام إشارات EEG وتخطيط القلب وGSR من بيانات AMIGOS المتاحة للجمهور كأساس تجريبي في هذا العمل. تمت معالجة الإشارات الحيوية مسبقا وتطبيعها لاستخراج ميزات خاصة بالنمط. تم محاذاة فضاءات الميزات غير المتجانسة عبر الأنماط باستخدام تحليل الارتباط القانوني العميق، تلاها شبكة اندماج متعددة الوسائط لتصنيف حالة عاطفية. تم تقييم البروتوكول من خلال تجارب غير متصلة ومقارنته مع نماذج الدمج والتصنيف التقليدية باستخدام مقاييس أداء قياسية مثل الدقة، والدقة، والاسترجاع، ودرجة F1، وAUC. تركز هذه الدراسة على تطوير والتحقق من صحة إطار عمل حاسوبي لنمذجة تجربة المستخدم العاطفية متعددة الوسائط بدلا من نشر نظام تفاعلي في الوقت الحقيقي. مع دقة 92.1٪ في توقع حالة تجربة المستخدم العاطفية و94.2٪ في تصنيف الإثارة والتكافؤية، تفوقت النتائج باستمرار على النماذج الأساسية في الأبعاد العاطفية. وقد أكدت هذه النتائج فعالية سير عمل الاندماج متعدد الوسائط المقترح في النمذجة العاطفية الحاسوبية من خلال مقارنة البيانات الفسيولوجية.

Introduction

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

التفاعل المعقد بين التفكير والمشاعر والأفعال يشكل طريقة تفكير الناس وتصرفاتهم. الحوسبة العاطفية هي دراسة هذه العلاقات من خلال الاستفادة من المعرفة متعددة التخصصات من علوم الأعصاب وعلم النفس والذكاء الاصطناعي لبناء أنظمة قادرة على تحليل وفهم وتفاعل مع المشاعر الإنسانية. وقد تم تطبيق هذا المجال بشكل متزايد على التواصل البشري مع التكنولوجيا من خلال دمج الوعي التعبيري في هياكل الذكاء الاصطناعي المستجيبة، مما يجعل التكنولوجيا تتفاعل ليس فقط مع الظروف الفكرية بل أيضا مع الظروف العاطفية، مما يؤدي إلى معرفة مستخدم أكثر فردية ووعي بالعاطفة. العاطفة، وهي عملية ذهنية معقدة، هي انعكاس للتصورات البشرية ولها دور كبير في التفاعلات البشرية1. اليوم، هناك العديد من تطبيقات التفاعل بين الإنسان والحاسوب (HCI) التي تحتاج إلى أبحاث في التعرف على المشاعر2. بيئة نظام HCI ديناميكية ومعقدة. في معظم الحالات، يحتاج إلى مزامنة وظائفه مع المدعى عليهم؛ لذا، يمكن للسياق الذي يحتوي على الذكاء العاطفي أن يتكيف أكثر في هذا النوع من الأجواء. لذلك، في هذه الدراسة، يتم استكشاف النمذجة الحاسوبية لتجربة المستخدم العاطفية من خلال الإشارات الفسيولوجية والسلوكية متعددة الوسائط3. بدلا من تطوير أو التحقق من صحة نظام تفاعلي عمليا، يميل العمل أكثر إلى المساهمة في المنهجية المتعلقة بتكامل الإشارات متعددة الوسائط أو الاستنتاج العاطفي في سياقات التطبيق للانغماس أو البيئات القائمة على المعرض. ولتجنب اتساع المفاهيم، يركز هذا العمل على مفهومين رئيسيين: تنفيذ إطار عمل للنمذجة العاطفية متعددة الوسائط باستخدام الأساليب الحاسوبية، وتقنيات دمج البيانات متعددة الوسائط لدمج البيانات الفسيولوجية والسلوكية. جميع المواضيع الأخرى التي تظهر في المخطوطة يتم الإشارة إليها للسياق فيما يتعلق بأهمية النماذج المطورة.

كل نمط من أشكال العاطفة ينقل معلومات مختلفة عن مشاعر الشخص لا يمكن اشتقاقها من نظام حسي آخر. استخراج المشاعر من حركة الجسد، الذي يتضمن نمطا عاما لحركة الجسم، له مزايا تحديد المشاعر غير اللفظية للشخص4. الكلام ومظهر الوجه يمكن أن ينقلوا مواد غير متوفرة في حركة الجسم وإشارات جسم الإنسان. يستخدم البشر أنماط عاطفية مختلفة بالتوازي وبالدمج. كل نمط محدود وله نقاط قوته. لكي تكتشف الشعور بشكل صحيح، قد تتمتع طرق التعرف على المشاعر متعددة الوسائط بأداء تعرف أكبر من التعرف الأحادي النمط على المشاعر. ومع ذلك، في حال حدوث تحول عاطفي، تميل إشارات تعبير الوجه، والإشارات البيولوجية/الفسيولوجية، وإشارات الكلام إلى الظهور في وقت أبكر من الإشارات الأخرى. لذا، فإن الكشف عن المشاعر القائم على الرؤية الحاسوبية يركز بشكل رئيسي على التعبير العاطفي للوجه5.

تم دراسة الحوسبة العاطفية بشكل شامل في تفاعل الطفل والروبوت (CRI)؛ تغير الأنظمة الواعية بالعاطفة استجابتها بناء على الإشارات الفسيولوجية والسلوكية للمستخدمين. توضح هذه الأعمال جدوى الاستشعار العاطفي الفيزيائي الحيوي والتفاعل التكيفي. ومع ذلك، في الغالب، فإن أنظمة CRI المصممة مناسبة فقط للسياقات المنظمة والموجهة نحو المهام والمشاركين. وبالتالي، فإن أنظمة CRI لديها قابلية محدودة للتعميم على البيئات العامة الديناميكية مثل المعارض التفاعلية. تشير أعمالهم إلى أن الروبوتات الواعية بالعواطف ضرورية لتعزيز الدافع، بالإضافة إلى معالجة بعض الأمور مثل التخصيص. المشاركة عنصر أساسي في التفاعل العاطفي بين الطفل والروبوت، حيث توفر الروبوتات التفاعلية عاطفيا تجارب تعليمية أكثر ثراء وفعالية. يقدم المؤلف6 إطارا لاكتشاف تفاعل المستخدم بناء على خصائص المهمة والتفاعل الاجتماعي. أثبتوا من خلال نتائجهم أن تحديد الإشارات العاطفية، بما في ذلك تعبيرات الوجه والسلوك الاجتماعي، يسمح للروبوتات بتعديل استجاباتها ديناميكيا لتعزيز تفاعل المستخدمين وتفاعلهم. التكيف العاطفي في الإصابة بالرأي النفسي طويل الأمد هو تحد مستمر. يعرض المؤلفون في7 مشاعر الأطفال خلال فترة زمنية، مؤكدين على أن الروبوتات بحاجة إلى التكيف مع أنماط المشاعر وأنماط التعلم الشخصية.

كما حقق أداء قويا من تخطيط الدماغ الكهربائي بسبب دقته الزمنية العالية وحساسيته للحالات العاطفية. الأعمال الحديثة 8,9,10 باستخدام أساليب التعلم العميق حسنت من المتانة عبر المواضيع من خلال إدخال النمذجة الزمانية المكانية وآليات الانتباه القائمة على الرسوم البيانية. ومع ذلك، تظل معظم الدراسات أحادية الوضع، وقليل فقط يأخذ في الاعتبار تفاعلات الإدراك والعاطفة عبر قنوات حسية متعددة؛ لذا، فهي أقل قابلية للتطبيق في سيناريوهات تجربة المستخدم الغامرة11، 12، 13. تم تقييم النموذج بناء على مجموعة البيانات، التي أظهرت تحسنا في الأداء مقارنة بالتقنيات الحديثة الحالية. تم اقتراح خوارزمية الاختيار النقدي المعتمد على المشاعر من قبل المؤلفين في14، وتم دراسة قوة ومعامل التجميع ومركزية متجه النفس لميزات شبكة الاتصال الوظيفي في تخطيط الدماغ الكهربائي. بحث المؤلفون في15 دراسة على شبكة وحدات متكررة عميقة وبسيطة في محاولة للحصول على الميزات الزمنية من إشارات تخطيط الدماغ الكهربائي، وتجاوزت النتائج التجريبية الأعمال ذات الصلة في الأدبيات16، 17، 18، 19. من شبه المستحيل جمع مجموعة بيانات كبيرة من إشارات تخطيط الدماغ الكهربائي، لكن يمكن تجربة طرق أخرى، مثل النهج عبر المواضيع.

وقد أحرزت الدراسات الحديثة20,21 تقدما كبيرا في استخدام خوارزميات نمذجة مكانية وزمانية متقدمة للغاية لمعالجة مسألة تصنيف المشاعر عبر المواضيع بناء على إشارات تخطيط الدماغ الكهربائي (EEG). يشمل ذلك شبكة هجينة بين الزمكان والزمان مع تكيف محسن في المجال وتركيز ديناميكي على الرسوم البيانية للتعامل مع التغير بين الأشخاص في تصنيف المشاعر من إشارات EEG22. على وجه الخصوص، من خلال استخدام آليات النمذجة الزمنية ونمذجة علاقات الدماغ المكانية مع الانتباه الديناميكي، عززت بشكل كبير أداء تصنيف المشاعر المستقل عن الموضوع. تشمل جهود بحثية أخرى حول هذه المشكلة شبكة تفاعل متشابهة بين مناطق الدماغ المكانية والزمانية23. في هذا البحث، يركز بشكل أكبر على نمذجة الثوابت المكانية والزمانية لتعزيز المتانة بين الأشخاص بشكل كبير في تصنيف المشاعر من إشارات تخطيط الدماغ الكهربائي. على الرغم من أن هذين المساهمتين البحثيتين وثقتا بنجاح أداء متميز في تصنيف المشاعر من الإشارات العصبية البحتة، إلا أنهما مقتصران على الإشارات أحادية النمط وتفتقران إلى استكشاف التفاعلات متعددة الوسائط بين P-E. على العكس، تتقدم الأبحاث الحالية نحو نماذج إشارات أحادية النمط الموسعة من خلال حلول التعلم العميق التي تربط عدة أنماط P/E معا عبر التعلم الارتباطي العميق، مما يوفر حلا أكثر ثراء لنمذجة تجربة المستخدم العاطفية.

على الرغم من أن الأبحاث الحالية، بما في ذلك مشروع الواجهة التعبيرية بين الطفل والروبوت باستخدام المعلومات الفيزيائية الحيوية، أكدت إمكانية الاستفادة من الإشارات الفسيولوجية متعددة الوسائط لتحسين التعرف على المشاعر، إلا أنها محدودة بقيود مرتبطة بالمجال. على وجه الخصوص، هذه الأنظمة محسنة إلى حد كبير للتفاعل المنظم والموجه نحو المهام مع الأطفال ولا يمكن تعميمها على بيئات أكثر تعقيدا وديناميكية مثل المعارض التفاعلية. علاوة على ذلك، فإن تقنيات دمج الميزات المستخدمة ضمن العمل الأساسي ليست قابلة للتوسع وتميل إلى الاعتماد على أساليب اندماج سطحية، والتي لا تلتقط بشكل فعال التفاعل المعقد بين الإدراك والعاطفة الموجود في بيئات تجربة المستخدم متعددة الحواس. أيضا، لا تستخدم الورقة الأساسية تقنيات التعلم العميق المتقدمة التي يمكنها مواءمة ودمج تدفقات البيانات متعددة الأبعاد عالية الأبعاد، مثل تخطيط الدماغ الكهربائي (EEG)، وتعبيرات الوجه، وتتبع العين، تحت محفزات بيئية مختلفة. يكشف هذا عن فجوة معرفية أساسية في إنشاء نموذج حسابي عالي الأداء لا يستوعب فقط اختلافات الجمهور وسياقيات المحفز، بل يلتقط أيضا تفاعل الإدراك مع المشاعر من خلال تحليل الارتباط القانوني العميق (DCCA) وبنى شبكات الاندماج متعددة الوسائط (MMFN). سد هذه الفجوة يمكن أن يعزز فهما مؤثرا بشكل كبير لتجربة المستخدم (UX).

الهدف الرئيسي من هذا العمل هو إنشاء نظام حاسوبي يسهل تجربة المستخدم التكيفية عاطفيا ضمن سياقات العرض التفاعلية من خلال الاستشعار الفيزيائي الحيوي والسلوكي متعدد الوسائط. استنادا إلى المبادئ الأساسية لنمذجة المشاعر من أبحاث تفاعل الطفل والروبوت والحوسبة العاطفية، يهدف هذا الإطار إلى نمذجة وتسجيل تفاعلات إدراك المستخدم والمشاعر بناء على إشارات فسيولوجية وسلوكية متجانسة مثل تخطيط الدماغ الكهربائي (EEG)، وتخطيط القلب (ECG)، وEDA، وتعبيرات الوجه، وتتبع العين. من خلال دمج تحليل الارتباط القانوني العميق (DCCA) مع شبكة الاندماج متعددة الوسائط (MMFN)، يسعى النظام إلى تعلم التمثيلات العاطفية الكامنة المشتركة عبر الأنماط وإسقاط هذه التمثيلات على حالات تجربة المستخدم العاطفية (UX). مهمة البنية هي التغلب على عقوقات دمج الميزات السطحية والنماذج العاطفية المقيدة بالعمر من خلال دعم الاستنتاج العاطفي الواعي للسياق والتكامل متعدد الحواس في بيئات عامة ديناميكية. وأخيرا، يهدف هذا العمل إلى المساعدة في تطوير أنظمة عرض أكثر تقدما وذكية وحساسة عاطفيا تستجيب لأنماط التفاعل والتغذية الراجعة العاطفية للمستخدمين، وبالتالي تعزز التفاعل والرضا والصدى المعرفي العاطفي في التجارب الثقافية الرقمية.

تساهم هذه الورقة في الأدبيات بالطرق التالية: إطار حسابي لنمذجة العاطفة متعددة الوسائط يأخذ في الاعتبار البيانات الفسيولوجية والسلوكية على حد سواء. نهج دمج متعدد الوسائط يسهل التعلم الفعال للإدراك وتمثيل المشاعر من مصادر بيانات متعددة. يقدم هذا العمل المقترح نموذجا حاسوبيا جديدا لتعزيز تجربة المستخدم العاطفية (UX) من خلال الاستشعار متعدد الوسائط المعتمد على الذكاء الاصطناعي ونمذجة أنابيب التكامل الحسي المتعدد لتفاعل الإدراك والعاطفة. المساهمة الأساسية هي دمج DCCA مع MMFN لتسهيل محاذاة الميزات القوية وتعلم التمثيل عالي المستوى عبر وسائل متنوعة مثل تخطيط الدماغ الكهربائي، تخطيط القلب الكهربائي، EDA، تعبيرات الوجه، وتتبع العين. هذا يمكن الشخص من نمذجة تقييم دقيق خارج الإنترنت يربط بين الإدراك الحسي والحالات العاطفية مثل الاهتمام أو التفاعل أو المفاجأة أو الملل. تظهر التجارب التي تحقق من خلال مجموعة بيانات AMIGOS المتاحة للجمهور أن نموذج DCCA+MMFN المطور يؤدي أداء أفضل من النماذج الأساسية (مثل 1D-CNN، CNN-ResNet، وLSTM-CNN) بدقة تصنيف متوسطة تبلغ 89.4٪ لحالات المشاعر العاطفية المثيرة والتكافؤية و87.1٪ لفئات المشاعر المنفصلة.

على عكس الدراسات السابقة التي ركزت على المشاركين أو المواقف المرتكزة على المهام أو استخدمت تقنيات دمج الميزات على المستوى السطحي، يقدم النهج المقترح إطار تعلم عميق مصمم خصيصا لبيئات العرض الديناميكية الواقعية. من خلال دمج DCCA وMMFN، يوفر هذا العمل طريقة قابلة للتوسع وقوية من حيث الضوضاء قادرة على فهم التحولات المستمرة بين الإدراك والعاطفة في مجموعات المستخدمين غير المتجانسة. هذا الاندماج الواضح للإشارات الفسيولوجية والسلوكية والبيئية عالية الأبعاد هو ابتكار أساسي لنمذجة تجربة المستخدم العاطفية. تقدم هذه الورقة إطارا مدفوعا بالذكاء الاصطناعي لنمذجة تجارب المستخدم العاطفية في المعارض التفاعلية باستخدام الاستشعار متعدد الوسائط والتكامل الحسي المتعدد. يحقق الإطار المقترح محاذاة قوية ودمج الأساليب المختلفة مثل تخطيط الدماغ الكهربائي (EEG)، تخطيط القلب (ECG)، تحليل التفاعل الداخلي (EDA)، تعابير الوجه، وتتبع العين من خلال دمج DCCA مع MMFN. وعلى عكس الدراسات السابقة التي اقتصرت على إعدادات تركز على المستخدم أو المهام، يدعم النهج المقترح نمذجة الإدراك والعاطفة المستمرة ضمن بيئات عامة ديناميكية، مما يشكل تقدما رئيسيا في أبحاث تجربة المستخدم العاطفية.

إن إنشاء نهج حسابي متعدد الوسائط منهجي وقابل للتكرار لنمذجة التأثيرات الفسيولوجية يتعامل بشكل منهجي مع محاذاة الميزات غير المتجانسة قبل الاندماج هو الميزة الرئيسية لهذا العمل. يفرض الإطار المقترح تعلم التمثيل المرتبط عبر إشارات تخطيط الدماغ الكهربائي (EEG)، وتخطيط القلب الكهربائي (ECG)، وإشارات الإشارة الجيردية من خلال إدخال مرحلة محاذاة كامنة متعددة الوسائط وسيطة باستخدام DCCA، على عكس دراسات التعرف على المشاعر متعددة الوسائط التقليدية التي تعتمد على دمج الميزات المباشر أو دمج القرارات على مستوى القرار. من خلال ضمان اتساق الأسلوب قبل التصنيف، يعزز هذا النهج المدفوع بالمحاذاة قابلية التعميم والمتانة عبر الأبعاد العاطفية. المساهمة هي سير عمل متكامل موجه نحو المعايير من البداية إلى النهاية، يتوحيد المعالجة المسبقة، ومحاذاة التمثيل، والدمج متعدد الوسائط، والتقييم ضمن بنية تعلم عميق واحدة، مما يسمح بنمذجة المشاعر الفسيولوجية القابلة للتكرار والمحايدة للمهام، بدلا من اقتراح تغيير خوارزمي واحد. الإطار المقترح في هذه الدراسة يحدد كجدوى وعرض مفاهيمي لنمذجة العاطفة متعددة الوسائط لتجارب شبيهة بالمعارض. بدلا من محاولة نمذجة بيئات العرض متعددة الحواس الحقيقية مباشرة، تستخدم مجموعة بيانات AMIGOS كمؤشر مرجعي للتحقق من صحة نهج النمذجة في بيئة محكمة.

Access restricted. Please log in or start a trial to view this content.

Protocol

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مجموعة بيانات AMIGOS المستخدمة في هذه الدراسة متاحة للجمهور وتم جمعها بموافقة مسبقة من لجنة المراجعة المؤسسية وموافقة مستنيرة، كما ورد في المنشور الأصلي. تتضمن هذه الدراسة فقط تحليلا ثانويا لمجموعة البيانات، ولم تكن هناك حاجة لموافقة أخلاقية إضافية.

تستخدم الطريقة الحالية نهج محاذاة الميزات والاندماج متعدد الوسائط للتعامل مع البيانات الفسيولوجية والسلوكية متعددة الوسائط لوصف ارتباطات الإدراك والعاطفة. تقترح هذه الدراسة نموذجا حسابيا لتجربة المستخدم العاطفية (UX) في المعارض التفاعلية، مستفيدا من الاستشعار الفيزيائي الحيوي متعدد الوسائط ونمذجة المشاعر المعتمدة على الذكاء الاصطناعي. استنادا إلى رؤى البيانات الفيزيائية الحيوية من ورقة الأساس، تقوم هذه المنهجية برقمنة حالات المستخدم النمذجة الحاسوبية من تخطيط الدماغ المتزامن، تخطيط القلب، التفاعل العاطفي (EDA)، تتبع العين، تعابير الوجه، والمدخلات البيئية. مصطلح "النمذجة المكانية-الزمنية" في المخطوطة يشير إلى تمثيل الميزات الفسيولوجية متعددة القنوات المكانية ومحاذاة الارتباط بين الوسائط عبر DCCA. الزمن: الترميز التسلسلي عبر BiLSTM والحفاظ على الاعتماد الزمني ضمن النوافذ المجزأة. يتم معالجة هذه الإشارات المتنوعة مسبقا وتطبيره في البداية لمراعاة الترابطات الزمنية والمكانية عبر الوسائط. يتم تعلم متجهات الميزات بشكل مستقل لكل نمط، حيث تلتقط أنماطا متعلقة بالعاطفة مثل الإثارة، والانتباه، والتفاعل. للتعلم بنجاح من التمثيلات العاطفية المشتركة عبر تدفقات البيانات غير المتجانسة، يستخدم DCCA. يعرض DCCA كل نمط إلى فضاء فرعي مشترك كامن حيث يتم تعظيم الميزات المترابطة، مع الاحتفاظ بالمعلومات الخاصة بالنمط من خلال تعزيز الصلة بين الوسائط. ثم تنقل هذه التضمينات الكامنة المتوافقة مع النمط إلى شبكة دمج متعددة الوسائط (MMFN) تجمع بين المعلومات الزمنية والسياقية عبر BiLSTM هجين وطبقات الانتباه. يمكن هذا الدمج النظام من إنتاج حالات عاطفية عالية المستوى، والتي تترجم إلى مؤشرات تجربة المستخدم (مثل الملل، الاهتمام، الانزعاج). أخيرا، تقدر وحدة التصنيف حالة تجربة المستخدم العاطفية وتقدم تغذية راجعة لتكيف العرض، مثل تعديل المحفزات البصرية أو الصوتية في النمذجة الحاسوبية. يوضح الشكل 1 هيكلية الطريقة المقترحة.

الشكل 1
الشكل 1: هندسة الطريقة المقترحة. هيكل إطار نمذجة تجربة المستخدم المقترح يدمج المدخلات متعددة الوسائط، بما في ذلك تخطيط الدماغ الكهربائي (EEG)، وتخطيط القلب (ECG)، وEDA، وتعبيرات الوجه، ونظرة العين، باستخدام DCCA وMMFN. الاختصارات؛ تجربة المستخدم = تجربة المستخدم؛ EEG = تخطيط كهربائي الدماغ; تخطيط القلب = تخطيط القلب الكهربائي؛ EDA = النشاط الكهربائي الجلدي؛ DCCA = تحليل الارتباط المعياري العميق؛ MMFN = شبكة الاندماج متعددة الوسائط. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

توضح البنية المقترحة في الشكل 1 نظام تجربة مستخدم عاطفية (UX) من طرف إلى طرف باستخدام تحليل الارتباط القانوني العميق (DCCA) وشبكة الاندماج متعددة الوسائط (MMFN) لنمذجة تفاعل الإدراك والعاطفة في المعارض التفاعلية. يبدأ النظام بأخذ مدخلات خام متعددة الوسائط مثل تخطيط الدماغ الكهربائي (EEG)، وتخطيط القلب (ECG)، والإشارات الفسيولوجية EDA؛ تعبيرات الوجه وإشارات النظرة السلوكية بالعين؛ والمدخلات السياقية مثل المعلومات السمعية والبصرية والبيئية. ثم يتم تغذية هذه الإشارات إلى وحدة معالجة مسبقة واستخراج الميزات، حيث يتم تنفيذ معالجة خاصة بالإشارة (مثل إزالة الضوضاء، التطبيع، حساب الميزات) لإنتاج أوصاف ذات معنى لكل نمط. ثانيا، تسقط وحدة DCCA أزواج من الأساليب في فضاء كامنة مشترك وتتعلم التضمينات ذات الارتباط الأقصى التي ترمز أنماطا عاطفية جوهرية عبر الأنماط المختلفة. يتم دمج ميزات الارتباط العالي لهذه الوحدات متعددة DCCA لاحقا بواسطة شبكة الاندماج متعددة الوسائط (MMFN)، التي تدمج الميزات المكتسبة بشكل هرمي مع طبقات التعلم العميق، وربما BiLSTM، أو آليات الانتباه، أو المحولات لإنشاء تمثيل عاطفي مضغوط وعالي المستوى. يتم بعد ذلك إدخال هذا التمثيل المتكامل إلى طبقة تصنيف حالات العاطفة وتجربة المستخدم، حيث يتنبأ النموذج بنتائج عاطفية مثل التكافؤ أو الإثارة، أو الحالات المعرفية/العاطفية مثل التفاعل أو الملل أو التحميل الزائد. يتم توفير حلقة تغذية راجعة تكيفية لتجربة المستخدم اختياريا عند نهاية خط الأنابيب، مما يمكن النظام من الاستجابة بشكل تفاعلي لحالات المستخدم من خلال تكييف المحفزات أو المحتوى في سياق المعرض. تضمن هذه البنية القابلة للتوسع والوحدات نمذجة قوية للعواطف من خلال تعلم التمثيل الواعي بالارتباط والتكامل متعدد الوسائط العميق، وهو أمر مناسب للغاية للنمذجة الحاسوبية للحوسبة العاطفية في البيئات التفاعلية أو التجريبية.

يعتمد اختيار دمج DCCA مع MMFN على القيود الحالية لنماذج الاندماج أحادية النمط والسطحية القياسية. على الرغم من أن CNN-ResNet وLSTM-CNN يستخلصان ميزات زمنية أو مكانية، إلا أنهما ضعيفان في موازنة الأنماط غير المتجانسة مثل تخطيط الدماغ الكهربائي (EEG)، وEDA، وتعبيرات الوجه تحت تحفيزات بيئية مختلفة. تعظم DCCA الارتباط بين الوسائط لضمان تمثيلات كامنة مشتركة، بينما تستخدم MMFN آليات الدمج والانتباه الهرمية لتسليط الضوء ديناميكيا على أكثر الإشارات إفادة. عند دمجها، تقدم هذه الوحدات نهجا أكثر موثوقية وفهما وتطبيقا أوسع لبيئات متعددة الحواس التفاعلية.

جمع البيانات
في إطار النموذج المقترح لتفاعل الإدراك والعاطفة للمعارض التفاعلية، يستخدم مجموعة بيانات AMIGOS المتاحة للجمهوررقم 24 كأساس لبيانات عاطفية متعددة الوسائط. توفر مجموعة بيانات AMIGOS مجموعة شاملة من المقاييس الفسيولوجية والسلوكية من المشاركين البشر الذين يخضعون لمحفزات تثير المشاعر مثل مقاطع الفيديو. تحتوي هذه البيانات على إشارات متزامنة لتخطيط الدماغ الكهربائي وتخطيط القلب وأشعة الجاذبية الجيدة، وتسجيلات فيديو للوجه، وتسميات عاطفية تم الإبلاغ عنها ذاتيا بأشكال منفصلة (مثل السعادة، الحزن) والأبعاد (التكافؤ/الإثارة). تتوافق هذه الأساليب بشكل جيد مع احتياجات النظام المقترح هنا، الذي يهدف إلى استنتاج حالات تجربة المستخدم العاطفية (UX) أثناء التفاعلات الغامرة والمتعددة الحواس في المعارض. تتضمن مجموعة البيانات تسجيلات من 40 شخصا، تعرض كل منهم لمحفزات قصيرة (مقاطع فيديو <150 ثانية) وطويلة (أفلام >14 دقيقة) تثير المشاعر، في ظروف تحاكي تفاعل الإعلام الحقيقي. لنطاق هذا العمل المقترح، يتم استخدام مجموعة فرعية معالجة مسبقا من مجموعة البيانات: سجلات من 30 شخصا بإشارات EEG وECG وGSR عالية الجودة خالية من العيوب الأثرية، بالإضافة إلى ملفات فيديو كاملة للوجه وملفات تعليقات توضيحية. هذه هي العينات المختارة لمحاكاة الديناميكيات العاطفية متعددة الوسائط خلال المواقف القائمة على المعرض. تعد مجموعة البيانات المتعلمة قاعدة تدريب ومقارنة لشبكة DCCA + شبكة الاندماج متعددة الوسائط (MMFN)، مع استكشاف حالات عاطفية مثل الانخراط والملل، والارتباك، والإثارة كاستجابة للمحفزات البصرية والسمعية والمكانية في بيئة عرض محاكاة. يوضح الجدول 1 وصف مجموعة البيانات للطريقة المقترحة.

المعلمةتفاصيل
اسم مجموعة البياناتAMIGOS (مجموعة بيانات لأبحاث العاطفة والشخصية والمزاج)
لا. عدد المشاركين40 إجمالا (30 مستخدمة في العمل المقترح مع بيانات متعددة الوسائط كاملة)
نوع المحفزاتمقاطع فيديو قصيرة وطويلة (مع تعليقات عاطفية)
قنوات تخطيط الدماغسماعة Emotiv EPOC EEG ذات 14 قناة
تخطيط القلبحساس معدل ضربات القلب (لمعدل ضربات القلب والإثارة)
GSRحساس توصيل الجلد (يقيس النشاط الودي)
فيديو الوجهفيديو الوجه الأمامي عالي الدقة لتحليل التعبيرات
ملصقات المشاعرالقيمة الذاتية للتكافؤ، الإثارة، الهيمنة (المقياس 1–9)، بالإضافة إلى تسميات منفصلة
معدل أخذ العينةتخطيط الكهربائي: 128 هرتز، تخطيط القلب/المقاومة الغازية: 1000 هرتز
تنسيق البياناتملفات .mat وسجلات الطوابع الزمنية المتزامنة
تزامن الأنماطنعم – متزامنة عبر جميع الحساسات والفيديو
مدة كل جلسةمقاطع قصيرة (<150 ثانية) وأفلام طويلة (>14 دقيقة)
ملاءمة التطبيقنمذجة تجربة المستخدم العاطفية، الاندماج متعدد الوسائط، رسم خرائط الإدراك والعاطفة في الوقت الحقيقي

الجدول 1: وصف مجموعة بيانات AMIGOS. وصف مجموعة بيانات AMIGOS المستخدمة في الإطار المقترح، بما في ذلك معلومات المشاركين، والأساليب، ومعدلات أخذ العينة، وتصميم التجارب. الاختصارات؛ AMIGOS = مجموعة بيانات لأبحاث العاطفة والشخصية والمزاج على الأفراد والمجموعات.

تتكون مجموعة بيانات AMIGOS المتاحة للجمهور والمطبقة في الإطار المقترح من بيانات سلوكية وفسيولوجية متعددة الوسائط تم جمعها من 40 مشاركا، تم اختيار 33 منهم لهذه الدراسة بناء على تميز واكتمال التسجيلات. تسجل مجموعة البيانات ردود الفعل العاطفية تجاه مقاطع الفيديو القصيرة والطويلة، وتحتوي على إشارات مثل تخطيط الدماغ (EEG) من سماعة Emotive ذات 14 قناة، وتخطيط القلب لتغير معدل ضربات القلب، وGSR لموصلية الجلد، وفيديو وجه عالي الدقة لقياس التعبير. الحالات العاطفية يتم الإبلاغ عنها ذاتيا في كل من الأبعاد (التكافؤ، الإثارة، الهيمنة) والفئات المنفصلة. البيانات متوافقة جيدا مع بعضها البعض في الأنماط ويتم أخذ عينات مناسبة - 128 هرتز لتخطيط الدماغ الكهربائي، 1000 هرتز لتخطيط القلب الكهربائي، وGSR. يجعل هذا التكوين مجموعة البيانات مثالية لنمذجة تجربة المستخدم (UX) في المعارض التفاعلية بحيث يمكن تتبع تفاعلات الإدراك والمشاعر بدقة باستخدام الاستشعار متعدد الوسائط المعتمد على الذكاء الاصطناعي.

معالجة البيانات المسبقة
تم تنفيذ جميع خطوات المعالجة المسبقة، وتدريب النماذج، والتقييمات في سكريبتات بايثون المكتوبة خصيصا (بايثون 3.10، بايتورش 2.0) بشكل فردي، مع كل وحدة لمعالجة الإشارات، ومحاذاة القواعد القائمة على DCCA، وتدريب MMFN، وتقييم الأداء؛ يتم تلخيص إعداد المعلمات الرئيسية وبعض التكوينات الحاسوبية الأساسية في الجدول 1. لمعالجة مجموعة بيانات AMIGOS المتاحة للجمهور لنمذجة تجربة المستخدم العاطفية للمعارض التفاعلية، يجب تنفيذ مسار معالجة بيانات منهجية على الأساليب الفسيولوجية والسلوكية مثل EEG، تخطيط القلب، GSR، وفيديو الوجه. في البداية، توحيد ومزامنة كل نمط، ثم قم بإجراء معالجة مسبقة خاصة بكل نمط. حاليا، يتم الحصول على المعلومات السياقية فقط من الإشارات السمعية والبصرية الجوهرية داخل محفزات الفيديو، مثل تعبيرات الوجه، أنماط الحركة البصرية، والميزات الصوتية مثل النبرة الكلامية والصوت الخلفي.

تطبيع الإشارة وإعادة أخذ عينات
يتم إعادة أخذ عينات الإشارات الفسيولوجية الخام x(t) من جميع الوسائط إلى تردد مشترك fs=128 هرتز للمحاذاة الزمنية عبر الوسائط:

المعادلة 1(1)

تم إجراء إعادة العينات باستخدام وظيفة مكتبة معالجة الإشارة القياسية بدلا من خوارزمية مصممة خصيصا. تم تنفيذ التنفيذ تحديدا باستخدام أداة إعادة العينات المتوفرة في نظام معالجة الإشارات بايثون (SciPy)، والتي تطبق الاستيفاء المعتمد على طريقة فورييه لتحويل الإشارات إلى تردد أخذ العينات المستهدف. تم اختيار معدل أخذ العينة المستهدف fs لضمان دقة زمنية متجانسة عبر الأنماط قبل التقسيم واستخراج الميزات. يتم بعد ذلك تطبيع كل إشارة بدرجة z لإلغاء التغير بين الموضوعات:

المعادلة 2(2)

حيث μx و σx هما متوسط نافذة التجربة والانحراف المعياري للإشارة.

معالجة تخطيط الدماغ المسبق
إشارات EEG، التي تلتقطها من 14 قناة، يتم تصفيتها عبر النطاق باختيار 4–45 هرتز للحفاظ على الترددات المرتبطة بالإدراك:

المعادلة 3(3)

يستخدم طيف الطاقة لتحديد أنماط التردد في الإشارات، وقد يختلف ذلك حسب نوع العاطفة، في حالة إشارة الدماغ، ويمكن أن يوفر معلومات مفيدة حول الإشارة. تقنية ويلش هي تقنية متفوقة لمعادلة مخططات الدورات 3، والتي توفر تقديرا للكثافة الطيفية ويمكن استخدامها للحصول على مخططيات. تقنية ويلش تقسم إشارة المجال الزمني إلى فترات زمنية منفصلة وتبنى متقطعة. مخطط طيفي لكل جزء، ثم يتم حساب متوسط جميع الطيفات كما هو موضح في المعادلة 4. هذه العملية أكثر سلاسة مقارنة بنهج FFT الكامل، وبالتالي تحصل على أقصى طاقة من الإشارات. أخيرا، يتم حساب كثافة الطيف للطاقة (PSD)19 باستخدام تقنية ويلش لالتقاط خصائص مجال التردد:

المعادلة 4(4)

تجمع ميزات PSD على خمسة نطاقات: ثيتا (4–8 هرتز)، ألفا (8–13 هرتز)، بيتا (13–30 هرتز)، لو جاما (30–45 هرتز).

ميزات الوجه المعتمدة على الفيديو
باستخراج وحدات حركة الوجه (AUs) ومتجهات النظرة البصرية لكل إطار فيديو باستخدام مجموعة بيانات تخطيط الدماغ متعدد القنوات أو برنامج مشابه، يتم دمجها لاحقا كتسلسلات زمنية:

المعادلة 5(5)

تعيين تسمية المشاعر
يتم إعطاء كل من درجات إثارة التكافؤ وعلامات المشاعر المنفصلة بواسطة AMIGOS. يتم تطبيع التصنيفات المستمرة إلى [0,1]:

المعادلة 6(6)

حيث V هي القيمة المرصودة الفعلية قبل التطبيع ، Vالأدنى هو أصغر قيمة للمتغير في مجموعة البيانات، Vmax هو أكبر قيمة للمتغير في مجموعة البيانات، وV' هو القيمة الممطبعة في النطاق من 0 إلى 1. تطبق هذه التسميات كحقيقة أساسية لنمذجة التأثير الخاضعة للإشراف. تطبق هذه التسميات كحقيقة أساسية لنمذجة التأثير الخاضعة للإشراف.

المزامنة عبر الأنماط
يتم مزامنة جميع الأساليب باستخدام محاذاة الطوابع الزمنية أو التشويه الزمني الديناميكي (DTW) عند الضرورة:

المعادلة 7(7)

يتم بعد ذلك إدخال البيانات الغنية بالميزات المعالجة مسبقا إلى وحدة تحليل الارتباط الكانوني العميق (DCCA)، التي تتعلم التمثيلات ذات الارتباط الأقصى بين الأنماط المختلفة.

استخراج الميزات باستخدام DCCA
في الإطار المتصور لنمذجة تجربة المستخدم العاطفية للمعارض التفاعلية، يستخدم DCCA لتعلم الخصائص الكامنة المتصلة في أنماط غير متجانسة مثل تخطيط الدماغ الكهربائي (EEG)، وتخطيط القلب (ECG)، وEDA، وتعبيرات الوجه، وبيانات تتبع العين. الهدف هو تعلم فضاء تمثيل مشترك حيث تكون الإشارات من أنماط مختلفة، رغم أنها صاخبة فردية أو محددة بالطرق، مترابطة بشكل أقصى ومتسقة دلاليا من حيث الحالات العاطفية المدركة. في هذا العمل، تم تطبيق DCCA على أزواج الأنماط التالية: 1) تخطيط الدماغ الكهربائي (EEG–ECG)، 2) تخطيط الدماغ الكهربائي – الجاذبية الراقصة، و3) تمثيلات ملامح الوجه لتخطيط الدماغ الكهربائي. تم اختيار هذه الأزواج لالتقاط الارتباطات التكميلية العصبية الفسيولوجية والعصبية السلوكية ذات الصلة بالمشاركة العاطفية. ولتمديد DCCA إلى إعداد متعدد الوسائط، تم حساب التضمين الثنائي لكل زوج من الأنماط ثم دمجه باستخدام MMFN المقترح، الذي يسمح بتكامل فعال لأكثر من نمطين دون تغيير صياغة DCCA الأساسية.

من خلال تنفيذ محاذاة كامنة مدفوعة بالارتباط قبل الاندماج، يفصل DCCA هيكليا محاذاة التمثيل عن دمج القرار، على عكس الانتباه عبر الوسائط أو شبكات دمج التنسور، التي تعمل مباشرة على تمثيلات قد تكون غير محاذاة. يتم تقليل التكرار، ويتحسن تماسك التمثيل بفضل هذه البنية ذات المرحلتين. علاوة على ذلك، يحسن DCCA الاعتماد الإحصائي عبر الوسائط مباشرة بدلا من الاعتماد فقط على دوال الخسارة المشتركة، وهو ما ينسب أكثر للبيانات الفسيولوجية غير المتجانسة مقارنة بأطر التعلم متعددة المهام. أولا، تستخدم DCCA20 لحساب تمثيلات لعدد من الأنماط عن طريق معالجتها بشكل تسلسلي عبر طبقات متعددة مكدسة من التحويلات غير الخطية. يوضح الشكل 2 بناء DCCA المستخدم في هذا العمل البحثي. استخدمنا طريقة البحث الشبكي لتحديد المعايير الفائقة المثلى لتصميم نموذج التعلم العميق المستخدم في نهج DCCA. بعد تحليل تجريبي شامل، اختار المؤلفون محسن هبوط التدرج العشوائي، وفقدان الإنتروبيا المتقاطعة، ومعامل تنظيم 1e5. بعد ذلك، اختار المؤلفون 15 خطوة تحسين باستخدام متجه التحيز كأصفار كلها، ومجموعة التحقق كمعايير توقف مبكرة، ومبدأ Xavier كمهيئ للوزن. يوضح الشكل 2 عملية عمل DCCA.

الشكل 2
الشكل 2: عملية عمل DCCA. سير عمل العملية في DCCA، مع إظهار خريطة خصائص من أنماط متنوعة إلى فضاء كامنة مشترك لتعظيم الارتباط.
الاختصارات؛ DCCA = تحليل الارتباط القانوني العميق. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

يوضح الشكل 2 بصريا إطار العمل الداخلي لتحليل الارتباط القانوني العميق (DCCA) لتعلم التمثيل المشترك بين نمطين مختلفين، تخطيط الدماغ الكهربائي (EEG) (النمط A) وEDA (النمطية B). يتم تغذية كلا الوضعين في شبكات استخراج الميزات العميقة الخاصة بهما (مستخرج الميزات A و B)، والتي تحتوي على عدة طبقات مخفية تتعلم ميزات مجردة وخاصة بالنمط. قبل الاندماج، يتم تنفيذ المحاذاة الكامنة عبر الوسائط باستخدام تحليل الارتباط القانوني العميق (DCCA). يتم بناء شبكتين متوازيتين للإسقاط العميق لكل زوج من الوسائط (EEG–ECG، EEG–EDA، وEEG–Faceial). باستخدام تفعيل ReLU، تتكون كل شبكة إسقاط من ثلاث طبقات متصلة بالكامل بأبعاد [256، 128، 64]. بالنسبة للمساحة الكامنة المشتركة، فإن 64 هو البعد النهائي للتضمين. مع معامل تنظيم L2 من 1e-5 لضمان الاستقرار العددي، تعظم دالة الهدف الارتباط الكانوني بين تضمينات النمط المتوقعة. يتم تهيئة متجهات التحيز إلى الصفر، وتهيئة الأوزان عبر تهيئة زافييه. لتثبيت التعلم بالمحاذاة، يتم تدريب وحدات DCCA بشكل منفصل قبل تدريب MMFN. للحفاظ على اتساق المحاذاة، لا يوجد ضبط دقيق من البداية إلى النهاية بين DCCA وMMFN. تقبل هذه الخطوط من الشبكات العصبية تدفقات بيانات الإدخال بشكل متوازي ولكن معزولة. يتم إسقاط مستخرج المستخرج من كل منهما إلى الفضاء الكامن المشترك، حيث يتم تعيين ميزات كلا النوعين لتصبح قابلة للمقارنة في البنية. يتم تحسين الإسقاطات وفقا لهدف DCCA، وهو تعظيم الارتباط بين التمثيلات الكامنة المقابلة لتخطيط الدماغ الكهربائي وEDA. من خلال اقتناء هذا الفضاء الفرعي المرتبط بأقصى حد، يضمن DCCA أن تدمج المخرجات يحتفظ بأنماط تكميلية ودلالية ذات دلالة من كلا الطريقتين، وهما ضروريان للتطبيقات اللاحقة مثل التعرف على المشاعر أو الحوسبة العاطفية.

في هذا العمل، يتم تحويل الميزات باستخدام DCCA ثم دمجها للتصنيف. يستخدم نموذج DCCA، الموضح في الشكل 2، نموذج التعلم العميق لتحويل الميزات. تحسب طبقة CCA الارتباط، والذي يستخدم بعد ذلك لدمج الميزات وتصنيفها. افترض أن المصفوفة المعادلة 8 تخزن تجارب نمط تخطيط الدماغ الكهربائي، وأن المصفوفة المعادلة 9 تشمل تجارب وضع مقاطع الفيديو الوجهية. في هذه الحالة، يتم تمثيل أبعاد الميزات في تجارب تخطيط الدماغ ومقاطع الفيديو الوجهية ب n1 و n 2 على التوالي، بينما يتم الإشارة إلى إجمالي عدد التجارب بواسطة MA. لكل نمط، أنشأ المؤلفون الشبكة العصبية العميقة التالية لإعادة ترتيب خصائص الإدخال بطريقة غير خطية:

المعادلة 10(8)

حيث يتم تمثيل معاملات التحويل غير الخطي ك HT1 و HT2؛ الخصائص اللاحقة من كل شبكة عصبية ممثلة ك المعادلة 11 و المعادلة 12 وقياس خاصية DCCA ك n. المعلمات المكتسبة بشكل تكراري HT1 وHT2، المولدة من DCCA، عززت الارتباط بين ON1 وON2 إلى مستوى قدر الإمكان:

المعادلة 13(9)

تم تدريب المعلمات المتبادلة مثل HT1 وHT2 بواسطة خوارزمية الانتشار العكسي. للحصول على الإجابة المقصودة، تم تقريب تدرجات دالة الهدف كما هو مقترح. الميزات المعدلة ON1 وON2 ∈ SP موجودة في SP الفضاء الفائق المدمج بعد تدريب الشبكتين العصبيتين. لم يذكر مؤلفو DCCA بشكل رئيسي استخدام الخصائص المعدلة بشكل خاص. يمكن استخدام الميزات المعدلة بطريقة تخدم تطبيق المستخدم بأفضل شكل. في هذا العمل، حصل المؤلفون على الميزات المدمجة التالية من الميزات المعدلة:

المعادلة 14(10)

حيث تمثل α و β أوزانا تحافظ على α + β = 1. يتم إدخال الخصائص المدمجة باستخدام DCCA إلى مصنف SoftMax. تستخدم مهام التعرف على المشاعر لتدريب المصنف. كما ذكر سابقا، فإن بناء DCCA لدمج البيانات عبر العديد من الصيغ له بعض المزايا. لملاحظة خصائص وارتباط التحويلات التي تركز على الوديولوجيا، على سبيل المثال، تحصل DCCA صراحة على ON1 و ON2 لكل نمط عند دمج مستوى الميزات. علاوة على ذلك، يمكن حفظ البيانات المعتمدة على المشاعر من خلال التحكم في دوال التحويل غير الخطية f1(·) و f2(·). علاوة على ذلك، يستخدم المؤلفون أوزانا مكافئة لكل نمط في دمج المجموع المرجح. شبكة الاندماج متعددة الوسائط (MMFN) التي تتنبأ بحالات تجربة المستخدم تستقبل هذه المساحة المجمعة. بالنسبة للمحاذاة متعددة الوسائط، يستخدم نهج هرمي، حيث يتم أولا محاذاة الإشارات الخام زمنيا مع إعادة الأخذ والمحاذاة الزمني، ويتم الحصول على محاذاة الإشارات الغنية دلاليا من أنماط متنوعة عبر تحليل الارتباط الكانوني العميق (DCCA). هذا يضمن تحويل التمثيلات الواعية للنمطية إلى فضاء كامنة مشترك قبل عملية الاندماج القائم على الانتباه في MMFN.

شبكة الاندماج متعددة الوسائط (MMFN) لنمذجة تجربة المستخدم العاطفية
يقوم MMFN بترميز كل نمط بشكل منفصل، ثم يدمجهما باستخدام بوابة اندماج وآلية انتباه لإخراج تمثيل متكامل للتنبؤ بالعواطف.

ترميز خاص بالنمط
لتكن x(i)Rdi هي متجه الخصائص للطريقة رقم i (مثل EEG، EDA). يتم ترميز كل طريقة بواسطة مشفر عصبي:

المعادلة 15(11)

آلية الاندماج المحجوزة
لإدارة تدفق المعلومات من كل نمط، يتم استخدام بوابة اندماج:

المعادلة 16(12)

المعادلة 17(13)

σ هي وظيفة تنشيط السيغمويد. ⊙ يميز تطور العناصر حسب العناصر. هذا يمكن الشبكة من تقليل وزن الوسائط المزعجة أو زيادة وزن الميزات المفيدة ديناميكيا.

دمج الانتباه عبر الوسائط
طبقة الانتباه تتعلم مقدار الوزن الذي يجب وضعه على تمثيل كل نمط:

المعادلة 18(14)

المعادلة 19(15)

α(i) هي أوزانالمعادلة 21الانتباه للتمثيل النهائي المدمجه.

التنبؤ بالحالة العاطفية
يتم إدخال المتجه الملتحم إلى طبقة إخراج لإجراء توقعات لحالات التكافؤ/الإثارة أو تجربة المستخدم:

المعادلة 2222(16)

حيث المعادلة 23 يمكن استخدامها لتمثيل: فئة المشاعر المنفصلة (سعيدة، محايدة، حزينة)، مقياس مستمر (تكافؤ/إثارة)، وفئات تجربة المستخدم (متفاعلة، مشتتة، مثقلة بالأعلى).

الشكل 3
الشكل 3: هيكل MMFN. هيكل MMFN مع مشفرات خاصة بالنمط، والاندماج المغلق، والتكامل القائم على الانتباه للتنبؤ بالحالة العاطفية.
الاختصارات؛ MMFN = شبكة الاندماج متعددة الوسائط. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3 هو عملية عمل شبكة الاندماج متعددة الوسائط (MMFN) المستخدمة في إطار حوسبة عاطفية للتنبؤ بالعواطف وتجربة المستخدم (UX). تشكل الترميز الهرمي لنظام MMFN مشفرات خاصة بالنمط، وطبقات الاندماج المبوابة، ووحدة التكامل المعتمدة على الانتباه، ورأس التصنيف النهائي. يوضح كيف تتم معالجة مختلف أنماط الإدخال غير المتجانسة، مثل EEG (النمط A)، EDA (النمط B)، وتعبيرات الوجه (Modality C)، باستخدام شبكات مشفرات متخصصة خاصة بها (المشفر A وB وC). يقوم مشفر مستقل مكون من طبقتين متصلتين بالكامل مع تفعيل ReLU بمعالجة كل طريقة (تخطيط الدماغ الكهربائي، تخطيط القلب الكهربائي، التفاعل العاطفي (EDA، وخصائص الوجه) قبل أن تلتقط طبقة الذاكرة طويلة المدى قصيرة المدى ثنائية الاتجاه (BiLSTM) الاعتمادات الزمنية. يتعلم كل مشفر تمثيلا خاصا بنمط معين يحتفظ بخصائص عاطفية أو فسيولوجية مهمة من تدفق البيانات المقابل. كل اتجاه في BiLSTM يحتوي على 128 وحدة مخفية، مما يمنح كل طريقة تضمين سياقي ب 256 بعدا. لتجنب الإفراط في التوافق، يتم إجراء انقطاع (معدل = 0.5) بعد طبقة BiLSTM. ثم يتم تطبيق نهج دمج محصن يستخدم تفعيل السيجمويد للتحكم ديناميكيا في مساهمات الوسائط على تمثيلات الأنماط المشفرة. ثم تقوم طبقة الانتباه الذاتي بحساب أوزان الانتباه عبر الأساليب لقمع الإشارات الضوضاء وتسليط الضوء على المعلومات ذات الصلة. طبقة متصلة بالكامل وطبقة إخراج خطية لمهام الانحدار التوازي أو طبقة إخراج سوفتماكس لمهام التصنيف المنفصلة تسقط التمثيل المدمج. يتم بعد ذلك إدخال مخرجات كل مشفر إلى طبقة اندماج متعددة الوسائط، التي تقوم بدمج جميع ميزات الوضع وتطبق آلية انتباه لتسليط الضوء على الإشارات الأكثر إفادة وضوضاء القناع. تنتج هذه العملية تمثيلا كامنا مشتركا يدمج الإشارات العاطفية عبر جميع الأنماط في متجه كثيف عالي المستوى.

طبقات BiLSTM المطبقة على التضمينات التسلسلية الخاصة بالنمط تنمذج الديناميكيات الزمنية مباشرة. يتيح BiLSTM النمذجة السياقية لتغيرات الحالات العاطفية من خلال التقاط الاعتماديات الزمنية الأمامية والخلفية ضمن التسلسلات الفسيولوجية المجزأة. علاوة على ذلك، يتم الترجيح التكيفي للميزات الإعلامية الزمنية ممكنا بفضل طبقة الاندماج المعتمدة على الانتباه التي تلي ذلك، والتي تعمل فوق تمثيلات مشفرة زمنيا. قام المؤلفون مؤخرا بتحديث النص لتوضيح كيفية عمل بناء التسلسل، والترميز المتكرر، ووزن الانتباه معا لدعم النمذجة الزمنية.

يظهر الرمز الزائف المقترح 1 العملية العامة لنمذجة تجربة المستخدم العاطفية باستخدام DCCA-MMFN بشكل قابل للتكرار. في البداية، يتم تغذية الإشارات الفسيولوجية والسلوكية متعددة الوسائط في خطوة معالجة مستقلة تتضمن تقليل الضوضاء وتطبيع المقاييس. ثم يتم تغذية الميزات إلى DCCA، حيث يتم تعلم الميزات المرتبطة بشكل مشترك لأزواج الأنماط المحددة، بهدف محاذاة متقاطعة متينة. يتم دمج الميزات المحازفة لاحقا ضمن MMFN يتكون من آليات بوابات وانتباه للتعديل الخاص بالنمط تهدف إلى تعزيز الأساليب المعلوماتية وقمع الضوضاء. يتم استخدام التمثيل النهائي للميزات المجمعة لتدريب مصنف مخصص لتقدير الحالة العاطفية وتجربة المستخدم، ويتم إجراء تقييم الأداء العام بناء على المقاييس القياسية. تضمن الطبيعة خطوة بخطوة لهذا الرمز الزائف المقترح الشفافية والجدوى وسهولة النسخ من قبل الآخرين لجميع الأفراد المتخصصين تقنيا المهتمين بهذا البروتوكول المقترح.

يهدف الإطار المقترح إلى التنبؤ بحالة تجربة المستخدم العاطفية (UX) باستخدام إشارات فسيولوجية وسلوكية متعددة الوسائط من مجموعة بيانات AMIGOS بناء على الخطوات التالية: الخطوة 1: تتكون بيانات الإدخال متعددة الوسائط من إشارات تخطيط الدماغ الكهربائي (EEG)، تخطيط القلب (ECG)، EDA، نظرة العين، وتعبيرات الوجه. في البداية، يتم الوصول إلى مجموعة بيانات AMIGOS متعددة الوسائط، وتخضع كل طريقة لمعالجة مسبقة للإشارة، بما في ذلك تصفية الضوضاء وتطبيعها لضمان جودة البيانات واتساقها. الخطوة 2: للحفاظ على التوحيد الزمني عبر الوسائط، يتم إعادة أخذ جميع الإشارات إلى تردد معياري. بعد ذلك، يتم استخراج الميزات حسب النمط للحصول على تمثيلات ميزات مميزة تتوافق مع كل نوع إشارة. الخطوة 3: لالتقاط العلاقات متعددة الوسائط، تتم معالجة أزواج الأنماط المختارة (EEG–ECG، EEG–EDA، وEEG–Faceial) باستخدام تحليل الارتباط القانوني العميق (DCCA). يتم تدريب شبكات DCCA على تعلم التمثيلات الكامنة المترابطة بين الأنماط المزدوجة، مما يؤدي إلى تضمين ميزات محاذية لكل زوج من الوصائح. ثم تدمج هذه التمثيلات المتوافقة لتشكيل فضاء ميزات متعدد الوسائط موحد. الخطوة 4: يتم توفير الميزات المجمعة كإدخال لشبكة اندماج متعددة الوسائط (MMFN)، حيث تستخدم آليات الانتباه واستراتيجيات الاندماج المحدد لدمج المعلومات التكميلية بفعالية عبر الوسائط. تولد هذه العملية تمثيلا عاطفيا شاملا. الخطوة 5: يستخدم التمثيل الناتج لاحقا لتدريب مصنف ببيانات عاطفية معنونة على التنبؤ بحالة تجربة المستخدم العاطفية. وأخيرا، يتم تقييم أداء النموذج باستخدام مقاييس قياسية، بما في ذلك الدقة، الدقة، الاستدعاء، درجة F1، والمساحة تحت المنحنى (AUC). يتم إعادة حالة تجربة المستخدم العاطفية المتوقعة كمخرج نهائي للإطار.

نمذجة الإدراك والعاطفة باستخدام إطار DCCA-MMFN المقترح
في الإطار الحاسوبي المقترح لتجربة المستخدم العاطفية (UX) للمعارض التفاعلية، تعد وحدة نمذجة الإدراك–المشاعر العملية المركزية التي تربط ردود فعل المستخدم الإدراكية تجاه المحفزات البيئية بحالاته العاطفية المشتقة من الفيزياء الحيوية متعددة الوسائط. تعتمد هذه الوحدة على التمثيلات الشائعة التي اكتسبها DCCA للأساليب الفسيولوجية والسلوكية مثل تخطيط الدماغ الكهربائي (EEG)، وتحليل الدماغ (EDA)، وتخطيط القلب الكهربائي، وتعبيرات الوجه، وحركات العين لتسجيل الديناميكيات العاطفية للمستخدم. في الوقت نفسه، تستخدم البيانات الوصفية حول بيئة العرض المحيطة – المحفزات البصرية، المشاهد الصوتية، أنماط التفاعل، والخصائص المحيطة – لترميز الإشارات الإدراكية. باستخدام شبكة الاندماج متعددة الوسائط (MMFN) لدمج هذه التمثيلات متعددة الوسائط، يكتسب النموذج خرائط مفصلة وغير خطية من ميزات المنبه الإدراكي وتسميات أو أبعاد المشاعر (مثل التكافؤ، الإثارة، التفاعل). تمكن هذه الخريطة النظام من معرفة كيف يتفاعل المستخدم عاطفيا مع عناصر العرض المختلفة ثم تعديل المحتوى أو الواجهة وفقا لذلك لتعزيز التفاعل أو الرضا أو الرنين المعرفي. أخيرا، يسهل نمذجة الإدراك والعاطفة التكيف الواعي بالعاطفة للتفاعل، والذي يشكل جوهر النمذجة الحاسوبية وأنظمة العرض الحساسة للمستخدم.

أولا، تم تدريب وحدات DCCA على تعلم التمثيلات الكامنة المترابطة لكل زوج من الوسائط. يعمل التضمين الناتج كمدخل لبرنامج MMFN، ويتم تدريبه بشكل متسلسل لمهمة التنبؤ العاطفي. لا يتم إجراء أي تعديل دقيق من البداية إلى النهاية للحفاظ على استقرار التدريب.

الفئةالمعلمةالقيمة / الوصف
معالجة الإشارة المسبقةمرشح تمرير النطاق EEG4–45 هرتز
تكرار إعادة العينات128 هرتز
طول النافذة2 ثانية
تداخل النوافذ50%
التطبيعتطبيع درجة Z
هندسة DCCAعدد الطبقات المخفية3 طبقات لكل نمط
الخلايا العصبية في كل طبقة128–64–32
حجم البعد الكامن (n)32
معامل التنظيم1 × 10⁻⁵
المحسنآدم
معدل التعلم0.001
حجم الدفعة32
أقصى فترات التدريب150
صبر التوقف المبكر15 حقبة
تكوين MMFNنوع المشفرBiLSTM
الوحدات المخفية64
معدل التسرب0.3
استراتيجية الاندماجدمج محصن مع انتباه
نوع الانتباهتخطيط الدماغ الكهربائي، تخطيط الكهربائي الكهربائي، الأشعة العريضة القديمة، الفيديو
التدريب والتقييمدالة الخسارةفقدان الإنتروبيا المتقاطع
تقسيم القطار-الاختبارالتحقق المتقاطع من خمسة أضعاف
مقاييس التقييمالدقة، الدقة، الاستدعاء، نتيجة F1، كابا كوهين، AUC–ROC
نقاط التحقق للتكرارشكل موتر إدخال EEGالقنوات × عينات زمنية (مثلا، 14 × 256 لكل نافذة)
تمثيل مخرجات DCCAالتضمين الكامن المشترك ذو 32 بعد
مخرجات MMFNاحتمالات فئة المشاعر (الفئات التكافؤية–الإثارة أو الفئات المتقطعة)
أداء التحقق المتوقعدقة تصنيف تتراوح بين 85–90٪

الجدول 2: معلمات خوارزمية DCCA–MMFN المقترحة. ملخص لمعايير المعالجة المسبقة، والهندسة المعمارية، والاندماج، والتدريب، والتقييم، وقابلية التكرار التي تم النظر فيها في إطار نمذجة تجربة المستخدم العاطفي المقترح. الاختصارات؛ DCCA = تحليل الارتباط المعياري العميق؛ MMFN = شبكة الاندماج متعددة الوسائط؛ تجربة المستخدم = تجربة المستخدم.

في الجدول 2، تم توفير مجموعة كاملة من المعلمات المستخدمة ضمن إطار العمل المقترح ل DCCA-MMFN، والتي تأخذ في الاعتبار معالجة الإشارة المسبقة، وتصميم البنية العميقة، وتقنية الاندماج، بالإضافة إلى ظروف التدريب. تم إعادة أخذ عينات الإشارات الفسيولوجية بشكل موحد وتطبيعها لتزامنها بالنسبة لأنماط عملها. تم تكوين طبقة DCCA لاستخدام تحويلات غير خطية متعددة الطبقات، مما ساعد في تعلم الفضاءات الكامنة ذات الترابط الأقصى، بينما استخدم مكون MMFN شبكات ترميز BiLSTM مع آليات انتباه موحدة لوزن قيمة الأنماط المختلفة ديناميكيا. تم تحديد متطلبات التدريب والتقييم بشكل صريح، مما يضمن مقارنة عادلة مع الخيارات القائمة.

يهدف الإطار المقترح إلى أن يكون الأساس الحاسوبي لأنظمة الوعي بالعاطفة التي تستخدم المعلومات السلوكية والفسيولوجية في عدة أبعاد. البنية قابلة للتكيف من الناحية المفاهيمية مع بيئات العالم الحقيقي مثل مساحات العرض الذكية، والواجهات الذكية التكيفية، وأنظمة التفاعل بين الإنسان والحاسوب الواعية للمشاعر، رغم أن الدراسة الحالية تتحقق من صحة النموذج من خلال تجارب محكمة دون اتصال باستخدام مجموعة بيانات AMIGOS المتاحة للجمهور. يمكن أن يعمل الإطار كوحدة أساسية للتطبيقات التي تحتاج إلى استدلال مشاعر موثوق من خلال تقديم تقنيات دمج موحدة، ومحاذاة متعددة الوسائط، ومعالجة مسبقة منظمة. ومع ذلك، بدلا من أن تكون هذه البيئات أنظمة تم نشرها تجريبيا، تم وصف هذه البيئات في هذه الدراسة كسياقات نشر محتملة.

Access restricted. Please log in or start a trial to view this content.

Results

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقييم النظام المقترح
لتقييم النظام المقترح، أجرى المركز تجارب على مجموعة بيانات AMIGOS المتاحة للجمهور، والتي توفر قياسات متزامنة لتخطيط الدماغ الكهربائي (EEG) وتخطيط القلب (ECG) وأشعة الرؤية العالية (CSR)، والفيديو، والصوت ل 40 مستخدما تعرضوا لمحفزات عاطفية مؤثرة. لغرض هذا البحث، استخدم المؤلفون بيانات من 33 مشاركا (بعد المعالجة المسبقة وإزالة التجارب غير المكتملة)، مما أدى إلى 1,320 عينة صالحة على أبعاد التكافؤ والإثارة. ركز التقييم على تصنيف المشاعر والتنبؤ بحالة تجربة المستخدم العاطفية باستخدام طب...

Access restricted. Please log in or start a trial to view this content.

Discussion

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

سياقات التفاعل المكانية والبيئية والمادية، مثل التخطيط المكاني، كثافة الحشود، أو الظروف البيئية المحيطة، غير مذكورة صراحة في مجموعة بيانات AMIGOS. لذا، فإن مثل هذه العوامل لا يتم نمذجتها مباشرة في التجارب الحالية. يتقدم الإطار الحاسوبي المقترح لنمذجة تجربة المستخدم العاطفية (UX) بشكل أبعد بكثير من المفاهيم الأساسية للورقة الأساسية التي تناولت تفاعل المستخدم الموجه نحو المهام بين الطفل والروبوت باستخدام اكتشاف المشاعر الفيزيائية الحيوية. من خلال تعميم الحوسبة العاطفية إلى بيئات العرض الدي...

Access restricted. Please log in or start a trial to view this content.

Disclosures

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لا يوجد تضارب مصالح لدى المؤلفين.

Acknowledgements

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يشكر المؤلفون دعم كلية تصميم الفضاء وكلية التصميم الصناعي في جامعة هونغيك. كما يشكر المؤلفون شركاء المعرض والمشاركين على مساهماتهم في الدراسة.

Access restricted. Please log in or start a trial to view this content.

Materials

List of materials used in this article
NameCompanyCatalog NumberComments
مجموعة البياناتمجموعة بيانات AMIGOS40 مشاركا؛ تخطيط الدماغ (EEG) (128 هرتز)، تخطيط القلب (ECG) (1000 هرتز)، GSR (1000 هرتز)، فيديو الوجه، وتصنيفات التوالينس/الإثارة المبلغ عنها ذاتيابيانات الحقيقة الأرضية متعددة الوسائط لنمذجة الحالة العاطفية
الحساسات الفسيولوجيةسماعة EEGEmotiv EPOC+ (14 قناة، 128 هرتز)التقاط نشاط الدماغ المرتبط بالانتباه والإثارة والتفاعل
حساس تخطيط القلبBiopac MP150 أو ما يعادلها (1000 هرتز)تغير معدل ضربات القلب والإثارة
حساس GSR/EDAShimer GSR+ أو ما يعادله (1000 هرتز)توصيل الجلد كمقياس للإثارة
الحساسات السلوكيةجهاز تتبع العينتوبي برو X2-60 أو ما يعادلهاتسجيل تثبيت النظرة والساكاد
تسجيل تعبيرات الوجهكاميرا فيديو عالية الدقة؛ تم تحليله باستخدام OpenFace (AUs، متجهات النظرة)استخراج وحدات الحركة الوجهية (AUs) وإشارات النظرة
المدخلات البيئيةإعداد التسجيل السمعي والبصريميكروفون + كاميرا (متزامنة مع المحفزات)التقاط المحفزات السياقية أثناء المعرض
البرمجيات / الأدواتOpenFaceمجموعة أدوات تحليل سلوك الوجه مفتوحة المصدراستخراج وحدات الحركة (AUs)، اتجاه النظرة
MATLAB / بايثون (NumPy، SciPy، scikit-learn)معالجة الإشارة المسبقة (إعادة العينات، تطبيع درجة z، حساب PSD)معالجة البيانات واستخراج الميزات
TensorFlowv2.13 / PyTorchv2.0إطار عمل التعلم العميق ل DCCA و MMFNتنفيذ النموذج والتدريب
الخوارزميات / النماذجتحليل الارتباط القانوني العميق (DCCA)طريقة محاذاة الميزات غير الخطيةتعلم التمثيلات الكامنة المترابطة عبر الأنماط
شبكة الاندماج متعددة الوسائط (MMFN)BiLSTM + طبقات الاندماج المعتمدة على الانتباهالاندماج الهرمي للأنماط غير المتجانسة لتصنيف حالات تجربة المستخدم
مقاييس التقييمالدقة، الدقة، الاستدعاء، نتيجة الفورمولا 1، كوهين s كابا، AUC-ROC، مصفوفة الارتباكتم تنفيذها باستخدام مقاييس scikit-learn / TensorFlowتقييم أداء النموذج
أجهزة الحوسبةمجموعة محطة العمل / وحدة معالجة الرسوماتNVIDIA RTX 3080 (10GB) أو ما يعادله، 32 جيجابايت رام، معالج Intel i9تدريب النماذج والمحاكاة

Reprints and Permissions

Request permission to reuse the text or figures of this JoVE article

Request Permission

Tags

Affective ModelingMultimodal FusionPhysiological SignalsEmotion RecognitionDeep Learning FrameworkEEG SignalsECG SignalsGSR SignalsFeature AlignmentOffline Experiments

Related Articles