يصف هذا البروتوكول الاكتساب المتزامن لتخطيط كهربائية الدماغ وبيانات الوجه في بيئات الرسم والمشاهدة وشبكة تركيز متقاطع مزدوجة الفرع للتعرف على المشاعر متعددة الوسائط، بما في ذلك المعالجة المسبقة، ودمج الميزات، وتصنيف أربع حالات عاطفية.
يتطلب اشتراك JoVE لعرض هذا المحتوى. تسجيل الدخول أو ابدأ نسخة تجريبية مجانية
مقالة منهجية
يصف هذا البروتوكول الاكتساب المتزامن لتخطيط كهربائية الدماغ وبيانات الوجه في بيئات الرسم والمشاهدة وشبكة تركيز متقاطع مزدوجة الفرع للتعرف على المشاعر متعددة الوسائط، بما في ذلك المعالجة المسبقة، ودمج الميزات، وتصنيف أربع حالات عاطفية.
يظل التعرف على المشاعر أثناء مشاهدة اللوحة صعبا لأن الاستجابات الجمالية ديناميكية، تعتمد على السياق، ولا يمكن ملاحظتها جزئيا إلا من خلال السلوك الخارجي. لذلك، فإن المناهج الأحادية النمط التي تعتمد فقط على تعبيرات الوجه أو الإشارات الفسيولوجية فقط، غالبا ما توفر تمثيلات غير مكتملة لتجربة المشاهد. تصف هذه المقالة طريقة قابلة للتكرار لبناء شبكة مزدوجة التوجه المتقاطع تدمج فيديو الوجه مع بيانات تخطيط كهربائي الدماغ (EEG) للتعرف على المشاعر متعددة الوسائط في سياق معرض لوحة. يبدأ البروتوكول بإنشاء بيئة اقتناص متزامنة باستخدام نظام تخطيط الدماغ ذو 64 قناة وكاميرا عالية الدقة للتسجيل المتزامن أثناء مشاهدة الطلاء. الإجراء التالي يوضح معالجة الإشارة المسبقة، بما في ذلك ترشيح تخطيط الدماغ الكهربائي، والتقسيم، واستخراج ميزات الإنتروبيا التفاضلية، إلى جانب اكتشاف الوجه، والمحاذاة، وتحضير الإطارات لتحليل الفيديو. تحتوي الشبكة العصبية على فرعين محددين بنمط الاستخدام. يستخدم فرع تخطيط الدماغ شبكة عصبية الالتفافية وشبكة ذاكرة قصيرة المدى ثنائية الاتجاه لنمذجة الميزات العصبية المكانية-الزمكانية، بينما يستخدم فرع الوجه شبكة الالتفافية خفيفة الوزن معززة بالانتباه لاستخراج ميزات التعبير البصري. ثم يستخدم وحدة تركيز متقاطع متعددة الرؤوس لدمج التيارين من خلال تعلم الصلة بين الوسائط. تحت الظروف التجريبية المذكورة هنا، حقق الإطار متعدد الوسائط دقة تصنيف أعلى من نماذج المقارنة أحادية النمط في التعرف على المشاعر ذات الفئات الأربع. هذه الطريقة مناسبة جدا للتحليل غير المتصل بالإنترنت في بيئات الاكتساب المسيطر عليها وتوفر إطارا عمليا للحوسبة العاطفية، والجماليات التجريبية، وأبحاث التفاعل بين الإنسان والحاسوب الموجهة للمعارض.
العاطفة هي عملية نفسية وفسيولوجية متعددة الأبعاد تتشكل بواسطة المحفزات الخارجية، والتقييم الداخلي، والتنظيم المعرفي المستمر، وبالتالي تحتل مكانة مركزية في التفاعل بين الإنسان والحاسوب وعلوم الإدراك1. في بيئات المعرض اللوحة، تتوسط المشاعر أيضا العلاقة بين الأعمال الفنية البصرية وتفسير المشاهد. لهذا السبب، فإن تحديد الحالات العاطفية للمشاهد له قيمة عملية لتقييم المعرض، والتصميم المكاني، والدراسات التجريبية للتجربة الجمالية2. وفي الوقت نفسه، يظل قياس المشاعر في بيئات العرض شبه الطبيعية صعبا تقنيا لأن الاستجابات دقيقة وعابرة وتتأثر بكل من العمل الفني وسياق المشاهدة.
تطورت أبحاث التعرف على المشاعر عموما على خطين رئيسيين: التحليل السلوكي والتحليل الفسيولوجي. تستخدم الأساليب السلوكية، خاصة تحليل تعبيرات الوجه المعتمدة على الرؤية الحاسوبية، على نطاق واسع لأنها غير جراحية وسهلة التطبيق نسبيا.3. أظهرت نماذج التعلم العميق مثل الشبكات المتبقية والشبكات الالتفافية خفيفة الوزن أداء قويا في مهام تصنيف عواطف الوجه الأساسية4. ومع ذلك، قد يكون سلوك الوجه أثناء مشاهدة الرسم ضعيفا، أو معتدلا اجتماعيا، أو مقيدا عمدا، مما يقلل من التوافق بين التعبير المرئي والشعور الذاتي5. توفر المناهج الفسيولوجية، خاصة تلك القائمة على تخطيط كهربائي الدماغ (EEG)، وصولا مباشرا أكثر إلى النشاط العصبي المرتبط بالمعالجة العاطفية6. تم استخدام تخطيط الدماغ الكهربائي على نطاق واسع في دراسات المشاعر لأن التقلبات الزمنية في الإشارات العصبية مفيدة للتغيرات في الحالة العاطفية، بما في ذلك الأبعاد المتعلقة بالتكافؤ والإثارة7. ومع ذلك، فإن تسجيلات EEG حساسة لتأثيرات الحركة، والتلوث الكهربائي العضلي، والضوضاء البيئية، وغالبا ما توفر EEG وحده معلومات سياقية محدودة حول ما يستجيب له المشاهد بصريا8.
هذه النقاط القوية والضعف التكميلية زادت الاهتمام بالتعرف على المشاعر متعددة الوسائط9. الفرضية المركزية للاندماج متعدد الوسائط هي أن الإشارات غير المتجانسة يمكن أن توفر أدلة مفيدة للطرفين وتقلل الغموض الذي ينشأ عند تفسير نمط واحد بشكل منفصل10. في مهام مشاهدة الرسم، على سبيل المثال، قد يتزامن سلوك الوجه المقيد مع تغييرات عصبية قابلة للقياس مرتبطة بالانتباه أو الانخراط العاطفي. ومع ذلك، فإن الأنظمة متعددة الوسائط الحالية لا تنمجي هذه العلاقة دائما بشكل فعال. استراتيجيات الاندماج المبكرة المبنية على التداخل المباشر في الميزات يمكن أن تزيد من عبء الأبعاد وقد تشوش البنية الزمنية الخاصة بالنمط11. استراتيجيات الاندماج المتأخرة المبنية على قرارات منفصلة أسهل في التنفيذ، لكنها قد تتجاهل التفاعلات الدقيقة بين الإشارات البصرية والفسيولوجية أثناء معالجة المشاعر12. بالإضافة إلى ذلك، تستخدم العديد من النماذج متعددة الوسائط أنظمة اندماج ثابتة أو ضعيفة التكيف، والتي لا تناسب استجابات المشاهدين المتقلبة في إعدادات شبيهة بالمعرض13.
لمعالجة هذه القيود، يصف البروتوكول الحالي شبكة تركيز متقاطع ذات فرعين للتعرف على المشاعر متعددة الوسائط أثناء مشاهدة الرسم. في هذا الإطار، تعالج ميزات تخطيط الدماغ بواسطة نموذج الذاكرة العصبية الالتفاوية ثنائية الاتجاه طويلة الأجل قصيرة المدى (CNN-BiLSTM)، والذي يستخدم لتمثيل الديناميكيات العصبية المكانية-الزمكانية. تتم معالجة ميزات الفيديو الوجهي بواسطة فرع MobileNetV2 معزز بالانتباه بالإحداثيات، والذي يستخدم لالتقاط إشارات تعبير منخفضة الشدة مع الحفاظ على كفاءة الحوسبة14. يتم دمج الفرعين من خلال آلية تركيز متعدد الرؤوس تتعلم الصلة بين الأنماط بدلا من مجرد دمج مخرجاتها15,16. يهدف هذا التصميم إلى الحفاظ على البنية الخاصة بالنمط مع تحسين نمذجة التفاعل عبر الوسائط.
تم تصميم الطريقة بشكل أساسي للتحليل غير المتصلة بالإنترنت تحت ظروف جمع بيانات محكمة بدلا من النشر المباشر في الوقت الحقيقي في أماكن العرض العامة المفتوحة. يتطلب التنفيذ الموثوق تخطيط الدماغ والتقاط الفيديو المتزامن، وإضاءة مستقرة، ووضع كاميرا محكم، ومقاومة كهربائية مقبولة، وموارد حوسبة كافية لتدريب النماذج. قد يعتمد الأداء أيضا على تركيب العينة، ونوع المنبه، ودرجة تعديل المشاركين للسلوك لأنهم يعلمون أنهم يتم تسجيلهم. يجب أخذ هذه القيود التشغيلية في الاعتبار عند تكييف البروتوكول مع بيئات أو مجموعات معارض أخرى.
يغطي البروتوكول المعروض هنا كامل خط التجارب التجريبي، بما في ذلك الاقتناء المتزامن من 327 مشاركا، والمعالجة المسبقة لتخطيط الدماغ وبيانات الفيديو الوجهية، واستخراج الميزات، والدمج متعدد الوسائط، والتصنيف. الهدف هو توفير سير عمل قابل للتكرار للتعرف على المشاعر متعددة الوسائط في أبحاث معارض الرسم. بعيدا عن الحوسبة العاطفية17، قد يدعم البروتوكول أيضا التحقيق الكمي في الجماليات التجريبية والدراسات النفسية ذات الصلة18.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تمت مراجعة بروتوكول الدراسة والموافقة عليه من قبل لجنة الأخلاقيات لحماية أبحاث الإنسان في جامعة شينغيي مينزو للمعلمين (رقم الموافقة 2600AL0621). تم الحصول على موافقة مكتوبة ومستنيرة من جميع المشاركين قبل إدراجهم في الدراسة وقبل جمع البيانات.
1. استقطاب المشاركين والامتثال الأخلاقي
2. البيئة التجريبية وإعداد المحفزات
3. جمع البيانات متعدد الوسائط
4. المعالجة المسبقة لتخطيط الدماغ واستخراج الميزات
5. معالجة الفيديو للوجه
6. بناء الشبكة العصبية متعددة الوسائط
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
تم تقييم أداء شبكة الانتباه المتقاطع ذات الفرعين المقترحة باستخدام مجموعة البيانات متعددة الوسائط التي جمعت من 327 مشاركا أثناء مشاهدة الرسم. كانت النتيجة الأساسية هي تصنيف المشاعر بأربع فئات للخوف، والسعادة، والهدوء، والحزن. فحصت تحليلات إضافية سلوك النموذج أحادي الطريقة، والتقارب متعدد الوسائط، والحساسية لعدد رؤوس الانتباه، وأداء التعرف المقارن، وسلوك الشبكات الفرعية للوجه وتخطيط الدماغ الكهربائي. لم يتم تضمين مجموعة ضابطة منفصلة في هذه الدراسة، لأن الهدف كان تقييم الأداء النسبي عبر ال...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يعالج هذا البروتوكول مشكلة عملية في الحوسبة العاطفية، وهي كيفية التعرف على الحالات العاطفية في بيئات مشاهدة الرسم حيث قد لا يتطابق التعبير المرئي والاستجابة الفسيولوجية تماما في كل لحظة. تحت الظروف التجريبية المذكورة هنا، حقق إطار الفرع المزدوج أداء تصنيفي أعلى من نماذج المقارنة أحادية الوضع، مما يدعم قيمة دمج تخطيط كهربائي الدماغ ومعلومات التعبير عن الوجه في بيئات شبيهة بالعرض. تشير النتائج إلى أن التكامل متعدد الوسائط مفيد بشكل خاص عندما تكون التغيرات في الوجه طفيفة أو معتدلة اجتماعيا،...
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
يعلن المؤلفون عدم وجود تضارب مصالح.
نعبر عن خالص امتناننا للمتطوعين من جامعة مينزو نورمال في شينغيي وجامعة ساوثويست لمشاركتهم في التجارب. نشكر أيضا الطاقم الفني في جامعة جيرونا على مساعدتهم في جمع بيانات EEG والمراجعين المجهولين على تعليقاتهم العميقة.
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.
| الاسم | الشركة | رقم فهرسي | التعليقات |
|---|---|---|---|
| إطار التعلم العميق | بايتورش | v2.0 / https://pytorch.org | يستخدم في بناء النماذج والتدريب والتقييم |
| نظام اكتساب EEG (64 قناة) | منتجات برين GmbH | actiCHamp Plus / v1.6 | يستخدم لاكتساب إشارة EEG عالية الدقة أثناء التجارب |
| غطاء قطب EEG (10– نظام 20) | منتجات برين GmbH | أكتي كاب / 64 قناة | ستاندرد إنترناشونال 10– وضع 20 قطب كهربائي |
| كاميرا عالية الدقة | شركة سوني | مستشعر IMX327 | يستخدم لتسجيل تعبيرات الوجه بالفيديو (≥ 1080p، 30 إطار في الثانية) |
الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.