مقالة بحثية

التعرف على السلوك في الفصول الدراسية من خلال المحولات وآلية الانتباه: التطبيق في تقييم جودة التدريس للتعليم الطبي الذكاء الاصطناعي

DOI:

10.3791/69052

أغسطس 15, 2025

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة نظام الذكاء الاصطناعي القائم على المحولات للتعرف على سلوك الفصول الدراسية في التعليم الطبي والتمريضي. باستخدام البيانات متعددة الوسائط ، يقوم النظام بتقييم مشاركة المتعلم والحالات العاطفية. تظهر النتائج دقة أعلى مقارنة بالنماذج التقليدية ، مما يتيح التغذية الراجعة في الوقت الفعلي والدعم المعزز لجودة التدريس والصحة العقلية للطلاب.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تقدم هذه الدراسة نظام ذكاء اصطناعي قائم على المحولات مصمم للتعرف على سلوك الفصول الدراسية ، ويهدف إلى تعزيز تقييم جودة التدريس ومراقبة الصحة العقلية في التعليم الطبي والتمريضي. يستخدم النموذج بيانات متعددة الوسائط ، وتحديدا الفيديو والصوت وحركة الهيكل العظمي ، لتقييم المؤشرات الرئيسية لمشاركة الطلاب ، مثل مدى الانتباه وتكرار التفاعل والتقلبات العاطفية. تمكن استراتيجية الاندماج متعددة الوسائط الجديدة ، جنبا إلى جنب مع آليات الانتباه الزماني المكاني ، النظام من التقاط سلوكيات الفصول الدراسية المعقدة بدقة ومتانة محسنة. تظهر النتائج التجريبية على مجموعات بيانات EduSense و SBU Kinect أن الطريقة المقترحة تتفوق بشكل كبير على النماذج التقليدية في كل من الدقة ومعدل الإنذار الكاذب. بالإضافة إلى ذلك ، تؤكد دراسات الاستئصال مساهمة وحدات الانتباه المكاني والزماني في قدرة التعرف على النظام. يدعم إطار العمل التغذية الراجعة في الوقت الفعلي ورسم خرائط السلوك المرئي ، مما يوفر قيمة عملية في بيئات التعلم التجريبية. يوفر هذا النهج حلا قابلا للتطوير وقابلا للتكيف لمراقبة سلوك الفصل الدراسي ويدعم استراتيجيات التدخل المبكر في التعليم الطبي.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

مع تزايد تحديات الصحة العقلية بين طلاب التمريض والطب بسبب الإجهاد الأكاديمي والسريري ، فإن دمج الذكاء الاصطناعي في بيئات الفصول الدراسية يمكن أن يوفر ليس فقط مراقبة جودة التدريس ولكن أيضا الدعم النفسي في الوقت الفعلي. تضع هذه الدراسة التعرف على السلوك في التعليم الطبي لدعم التعلم التجريبي وتعزيز رفاهيةالطلاب 1. يشير الفصل الدراسي الذكي إلى نموذج تعليمي جديد وعالي الجودة يجمع بين عمليات التدريس الذكية والشخصية من خلال تطبيق التقنيات المتطورة ، مثل تكنولوجيا المعلومات والذكاء الاصطناعي والبيانات الضخمة وإنترنت الأشياء ، للمساعدة في إدارة التدريس والتفاعل في الفصولالدراسية 2،3،4. حاليا ، مع تطور تقنيات مثل الكاميرات وأجهزة الاستشعار ، لا تتضمن البيانات السلوكية التي يتم جمعها في الفصل مقاطع الفيديو فحسب ، بل تشمل أيضا بيانات متعددة الوسائط ، مثل الصوت والصوت5. ومع ذلك ، فإن التعامل مع هذه المعلومات والبيانات المكانية والزمانية المعقدة واستخراج الميزات السلوكية القيمة منها بدقة هي التحديات الرئيسية التي تواجه مجال التعرف الذكي على سلوك الفصلالدراسي 6،7. تعتمد مناهج التعرف على السلوك الحالية بشكل أساسي على استخراج الميزات من مصادر البيانات أحادية الوضع، مثل تدفقات الفيديو في الفصل الدراسي أو الصور المتسلسلة8. في حين أن هذه الطرق يمكنها اكتشاف الأحداث السلوكية الخشنة ، إلا أنها غالبا ما تفشل في نمذجة التطور الزمني والفروق الدقيقة المكانية لإيماءات الطلاب أو تعبيراتهم أو عوامل تكرار التفاعل الحاسمة لفهم رفاهية المتعلموتركيزه 9. علاوة على ذلك ، تفتقر النماذج الحالية إلى آليات قوية لدمج مصادر البيانات غير المتجانسة مثل الإشارات الصوتية وحركة الهيكل العظمي ، مما يحد من حساسيتها للسلوك العاطفي أو المنفصل10. لمعالجة هذه القيود ، تقترح هذه الدراسة نظاما للتعرف على سلوك الفصل الدراسي قائم على المحولات معززا بآليات الانتباه المكاني والزماني. من خلال الاستفادة من قدرة المحول على نمذجة التبعيات بعيدة المدى ودمجها مع استراتيجيات دمج الميزات متعددة الوسائط ، يهدف النظام المقترح إلى تحسين دقة تصنيف السلوك مع تمكين التصور في الوقت الفعلي للمشاركة والمؤشرات العاطفية. الهدف النهائي هو دعم تقييم جودة التدريس الديناميكي وتعليقات الصحة العقلية المضمنة في التعليم الطبي ، وتقديم حل قابل للتطوير وقابل للتكيف لمراقبة وتعزيز كل من الفعالية التعليمية ورفاهية المتعلم.

يقترح التقييم نظاما جديدا للتعرف على السلوك قائم على المحولات يجمع بين آليات الانتباه الزماني المكاني ودمج البيانات متعددة الوسائط (مدخلات الفيديو والهيكل العظمي) المصممة خصيصا لمراقبة الفصول الدراسية الذكية في التعليم الطبي والتمريضي. على عكس النماذج الحالية ، يسهل النموذج الجديد انتباه الطلاب الدقيق في الوقت الفعلي واكتشاف الحالة العاطفية ، وهو أمر ذو قيمة لكل من تقييم الجودة التعليمية والرفاهية النفسية.

أعمال ذات صلة
الفصل الدراسي الذكي هو بيئة تعليمية جديدة تستخدم تكنولوجيا المعلومات الحديثة لتعزيز تفاعل التدريس والتعلم الشخصي وإدارة التدريس. يمكنه استخدام طرق التدريس الذكية لتحسين كفاءة التدريس وجودته مع تزويد الطلاب بتجارب تعليمية أكثر ثراء وتخصيصا. لذلك ، بحث العديد من العلماء حول العالم في التكنولوجيا الذكية والتدريس في الفصول الدراسية. اقترح Radosavljevic et al. نموذجا ذكيا للفصل الدراسي يعتمد على الذكاء البيئي ، والذي يقيم مستويات إجهاد الطلاب ويضبط استراتيجيات التعلم من خلال تحليل بيانات نشاطهم الأكاديمي اليومي لتحسين نتائجالتعلم 11. درس Tai T. Y تأثير المساعدين الشخصيين الأذكياء على تحسين القدرة على التحدث بلغة أجنبية ووجد أن استخدام مساعد Google أدى إلى تحسين قدرة التحدث لغير الناطقين بها بشكل كبير ، مع تأثيرات مماثلة للمتحدثين الأصليين في الاتصال12. وجد Chen et al. من خلال بحثهم أن استخدام روبوتات الدردشة كأدوات تعليمية يمكن أن يستجيب بسرعة لاحتياجات الطلاب ، ويعزز التفاعل ، ويوضح التطبيق المحتمل للتكنولوجيا الذكية في الفصلالدراسي 13. أثارت الأبحاث طريقة تقييم فعالية التدريس في الفصول الدراسية بناء على وضع التدريس الذكي ، مما أدى إلى تحسين دقة التقييم باستخدام خوارزمية البحث عن الوقواق وآلة التعلمالمتطرفة 14.

يعد التعرف على السلوك في الفصول الدراسية الذكية تقنية رئيسية لتحقيق التدريس الشخصي وتحسين إدارة الفصول الدراسية. يمكنه مراقبة حالة سلوك الطلاب في الوقت الفعلي وتقديم ملاحظات فعالة. من خلال التعرف على السلوك ، يمكن للمدرسين فهم مشاركة الطلاب وتركيزهم بدقة ، وبالتالي تحسين فعالية التدريس والمساعدة في اتخاذ القرار. في هذا السياق ، أجرى العلماء في جميع أنحاء العالم أبحاثا مكثفة حول التعرف الذكي على سلوك الفصول الدراسية. اقترح البحث نظام مراقبة بصرية في الوقت الفعلي يعتمد على الذكاء الاصطناعي ، والذي استخدم التعلم الآلي لتدريب نماذج التعرف على سلوك الطلاب لمساعدة المعلمين على مراقبة مشاركة الطلاب وتفاعلهم في الفصل الدراسي بشكل أفضل ، وبالتالي تحسين جودةالتدريس 15. حقق Chonggao P التعرف على سلوك الطلاب في الوقت الفعلي وتحسين دقة تحليل سلوك الفصل الدراسي في التدريس عن بعد من خلال الجمع بين تحليل التجميع وخوارزمية الغابة العشوائية ، بالإضافة إلى نموذج الهيكل العظمي البشري16. طور Wu S نموذجا للتعرف على سلوك الطالب يجمع بين تحسين سرب الجسيمات وخوارزمية أقرب جار K ، مما يعزز دقة التعرف على المشاعر لتلبية الاحتياجات العملية للتدريس في الفصلالدراسي 17. استخدم نظام ACORN الذي اقترحه Ramakrishnan et al. التعلم الآلي متعدد الوسائط والشبكات العصبية التلافيفية المدمجة لتحليل بيانات الصوت والوجه والصور. أدى دمج هذه الميزات من خلال الشبكات التلافيفية الزمنية إلى تحقيق تقييم تلقائي لجو الفصل الدراسي وأحرز تقدماأوليا 18.

باختصار ، اقترحت الأبحاث الحالية العديد من التقنيات القائمة على التعلم الآلي والتعلم العميق للتعرف الذكي على سلوك الفصول الدراسية ، والتي تغطي مجالات مثل اكتشاف إجهاد الطلاب وتحليل المشاعر ومراقبة التفاعل في الفصل الدراسي. ومع ذلك ، لا تزال هناك بعض أوجه القصور في البحث الحالي ، وتفتقر العديد من الأساليب إلى الوقت الفعلي الكافي وقابلية التوسع في التطبيقات العملية ، مما يجعل من الصعب التكيف مع سيناريوهات الفصول الدراسية المعقدة والمتغيرة. لذلك ، تقترح الدراسة طريقة ذكية للتعرف على سلوك الفصل الدراسي باستخدام Transformer و AM. يكمن ابتكار البحث في الاستفادة من قدرة النمذجة الزمنية القوية للمحول جنبا إلى جنب مع AM الزماني المكاني لالتقاط اللحظات والمناطق السلوكية الرئيسية بدقة في الفصل الدراسي ، ودمج مصادر متعددة للمعلومات ، مثل الفيديو والصوت ، من خلال دمج البيانات متعددة الوسائط لتعزيز شمولية ودقة التعرف على السلوك.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تستخدم هذه الدراسة مجموعات بيانات متاحة للجمهور لا تحتوي على أي معلومات تعريف شخصية. تم إخفاء هوية جميع البيانات المستخدمة في البحث لضمان خصوصية المشاركين. تم الحصول على الموافقة المستنيرة من جميع المشاركين في وقت جمع البيانات ، وتلتزم الدراسة بالمبادئ التوجيهية الأخلاقية. يشرح البروتوكول طريقة التعرف على سلوك الفصل الدراسي الذكية ، والتي تتكون من استخراج الميزات بناء على دمج البيانات متعددة الوسائط والتعرف على السلوك الزماني المكاني بناء على المحول والانتباه. يتم تحسين أداء الطريقة بأكملها من خلال التدريب المشترك.

1. جمع البيانات متعددة النماذج

تضمن جمع البيانات متعددة الوسائط جمع بيانات سلوك الفصل الدراسي المتزامنة من مجموعتي بيانات: مجموعة بيانات EduSense ومجموعة بيانات تفاعل SBU Kinect. سجلت EduSense تسجيلات واقعية في الفصول الدراسية الجامعية ، وسجلت SBU Kinect تسلسلات هيكلية قائمة على التفاعل. احتوت مجموعات البيانات على تدفقات فيديو وإشارات صوتية ومعلومات مشتركة هيكلية ثلاثية الأبعاد لنمذجة أوضاع الطلاب وحركتهم. تضمن المعالجة المسبقة للبيانات المحاذاة الزمنية وإزالة الضوضاء للتنظيف. وفر هذا التقارب مراقبة السلوك الشاملة ، وتسجيل الإيماءات البصرية وحركة الجسم عبر العديد من مواقف التعلم.

2. استخراج الميزات على أساس دمج البيانات متعددة الوسائط

لاستهداف مسألة التعرف على سلوك الطلاب في الفصول الدراسية الذكية ، تم اقتراح طريقة للتعرف الذكي على سلوك الفصل الدراسي باستخدام Transformer و AM. نظرا للطبيعة المعقدة للفصول الدراسية التي تضم العديد من الطلاب ، يمكن أن تتداخل التغييرات في العوامل داخل المشهد مع التعرف على سلوك الطلاب. بالإضافة إلى ذلك ، فإن استخراج الميزة الفردية له قيود مثل المعلومات غير المكتملة ، والقابلية للتداخل البيئي ، وصعوبة التقاط السلوكيات المعقدة19،20. لذلك ، تقترح الدراسة أولا طريقة استخراج ميزات الفصول الدراسية للطلاب بناء على دمج البيانات متعددة الوسائط. تجمع هذه الطريقة بين البيانات من طرائق الفيديو والهيكل العظمي ، باستخدام تكاملها لتحقيق استخراج ميزات أكثر شمولا ودقة لسلوك الطالب. على وجه الخصوص ، يتم تقسيم كل تسلسل فيديو مدخل حسب الإطار. يتم تغذية الإطارات في Faster R-CNN المدربة مسبقا لتوطين المناطق البشرية ذات الأهمية. يتم تغذية المناطق المكتشفة في العمود الفقري للشبكة العصبية التلافيفية للحصول على ميزات بصرية زمنية. بالنسبة لطريقة الهيكل العظمي ، يتم طرح مواضع المفصل ثلاثية الأبعاد كتسلسلات وترميزها باستخدام نموذج BERT المدرب مسبقا للحصول على التبعيات الزمنية والمكانية. يتم تطبيعها وتضمينها قبل إدخالها في شبكة الاندماج متعددة الوسائط. من بينها ، طريقة الفيديو مسؤولة بشكل أساسي عن التقاط الميزات المرئية مثل حركات الطلاب وتعبيراتهم ، بينما تصف طريقة الهيكل العظمي بدقة تغيرات وضع الطلاب من خلال معلومات النقطة المشتركة. بينما تعتمد طريقة الفيديو على السمات العالمية للإدراك البصري ، في حين أن الميزات المرئية العالمية لطريقة الهيكل العظمي لتمثيل السلوك البشري ، تركز طريقة الهيكل العظمي على التغييرات الديناميكية في الموضع المشترك ، مما يؤدي إلى اختلافات دلالية كبيرة بين الاثنين21. لذلك ، من الضروري تطوير شبكة اندماج متعددة الوسائط متخصصة لنمذجة العلاقة بين الطريقتين بشكل فعال. تظهر شبكة الاندماج متعدد الوسائط في الشكل 1.

في الشكل 1 ، يتم تقسيم الشبكة بشكل أساسي إلى ثلاث وحدات. من بينها ، مدخلات وحدة معالجة طريقة الفيديو عبارة عن تسلسل فيديو ، يتم استخراجه من خلال شبكة عصبية محيطية أسرع قائمة على المنطقة (أسرع R-CNN) لاستخراج الميزات. تبدأ معالجة طريقة الفيديو بترجمة لقطات الفيديو في الفصل الدراسي إلى مدخلات إطارا تلو الآخر لاستخراج الميزات. تتم معالجة الإطارات بشبكة عصبية تلافيفية أسرع قائمة على المنطقة (أسرع R-CNN) مع قاعدة ResNet-50 مدربة على ImageNet. تتعامل الشبكة مع إطارات RGB التي تم تغيير حجمها إلى 224 × 224 بكسل ، مما ينتج عنه خرائط ميزات مرئية عالية المستوى مع ميزات مكانية ومحددة للكائنات لنشاط الطالب. يتم بعد ذلك إدخال هذه الميزات في وحدة الانتباه الذاتي ، والتي تتعلم العلاقات الزمنية بين الإطارات قبل ترميزها إلى التضمينات الزمانية المكانية عبر طبقة المحولات. يحافظ هذا على الإشارات السلوكية الخافتة ، مثل إمالة الرأس أو رفع اليد ، في تضمين التمثيلات للاندماج اللاحق. يتم التقاط ميزات الفيديو المستخرجة بواسطة وحدة الانتباه الذاتي لالتقاط العلاقات الزمانية والمكانية داخل طريقة الفيديو ، ثم يتم نمذجتها بواسطة محول لإنشاء متجهات تضمين للمعلومات الزمانية المكانية لتسلسل الفيديو. مدخلات وحدة معالجة طريقة الهيكل العظمي عبارة عن تسلسل هيكلي ، تتم معالجته بواسطة تمثيل التشفير ثنائي الاتجاه من المحولات (BERT) لاستخراج السمات الزمنية والمكانية للمفاصل الهيكلية. بالنسبة لبيانات الهيكل العظمي ، يتم نمذجة وضع كل طالب كسلسلة من الإحداثيات المشتركة ثنائية الأبعاد من مقاطع الفيديو في الفصل الدراسي باستخدام مقدر الوضع المستند إلى OpenPose. يتم تحويل هذه التسلسلات إلى رموز مميزة للتضمين يتوافق فيها كل رمز مميز مع إطار يحتوي على 18 نقطة رئيسية. يتم نمذجة السياق الزمني والتبعيات لهذه التسلسلات المشتركة باستخدام تمثيلات التشفير ثنائية الاتجاه من المحولات (BERT). يستخدم النموذج 12 طبقة محولات ، و 8 رؤوس انتباه ، وحجم مخفي يبلغ 768 ، وهي بنية قاعدة BERT القياسية. يتم ضبط النموذج أثناء التدريب للحصول على أنماط مشتركة خاصة بالسلوك. تمثل عمليات تضمين الإخراج الخصائص الهيكلية والمتعلقة بالحركة لسلوك الطالب والتي يتم دمجها لاحقا مع ميزات طريقة الفيديو. بعد ذلك ، يتم تجميع ميزات الهيكل العظمي بشكل أكبر في ميزات مكانية وزمانية من خلال 3D CNN وعمليات التجميع ، مما يؤدي إلى إنشاء متجهات مضمنة للهيكل العظمي كتمثيلات ميزات لطريقة الهيكل العظمي.

3. وحدة الانصهار عبر الانتباه

في وحدة اندماج الانتباه المتقاطع ، تستخدم الدراسة آلية الانتباه متعدد الرؤوس (MHAM) لبناء علاقة التفاعل بين طريقة الفيديو وطريقة الهيكل العظمي ، وتستخرج ميزات اندماج أكثر إحكاما من خلال 3D CNN وعمليات التجميع من ميزات الاندماج متعدد الوسائط التي تم إنشاؤها. يتم إنجاز عملية الاندماج باستخدام شبكة انتباه ثنائية التيار ، حيث يتم تمرير التضمينات الزمنية لكل طريقة من خلال شبكات CNN ثلاثية الأبعاد و GRUs ثنائية الاتجاه. تتم محاذاة تدفقات البيانات متعددة الوسائط باستخدام وحدات الانتباه متعددة الرؤوس (MHAM) ، مع اهتمام المنتج النقطي المتدرج لتحقيق تبعيات بين الوسائط. ثم يتم تجميع التضمينات لمعالجة تعقيد الأبعاد وإرسالها إلى طبقة Softmax متصلة بالكامل للتصنيف.

في شبكات الاندماج متعددة الوسائط ، يتم استخدام وحدة الانتباه الذاتي لنمذجة الاعتماد الزمني والمكاني داخل وضع واحد ، بينما يتم استخدام وحدة اندماج الانتباه المتقاطع لإنشاء الارتباط وتفاعل المعلومات بين الأوضاع المختلفة. لذلك ، كلاهما مهم جدا. تلتقط وحدة الانتباه الذاتي التبعيات الداخلية لتسلسل الإدخال عن طريق حساب العلاقة بين الاستعلام Q والمفتاح K والقيمة V. يظهر حساب Q والمفتاح K والقيمة V في المعادلة (1). أين figure-protocol-1 هي مصفوفات الاستعلام والمفتاح والقيمة على التوالي ؛ DK هي أبعاد المتجه الرئيسية ، و dk هي أبعاد متجهات القيمة. تم اعتماد عامل البعد dk من أجل تجنب أن تصبح المنتجات النقطية كبيرة ، مما قد يؤثر على استقرار التدرجات أثناء التدريب.

figure-protocol-2(1)

في المعادلة (1) ، figure-protocol-3 تمثل ميزات الإدخال ، حيث n هو طول تسلسل الإدخال ، والنموذج d هو بعد الميزات ، ويمثل WQ و WK و WV ثلاث مجموعات من مصفوفات الإسقاط القابلة للتعلم. من خلال تعيينات المصفوفة هذه ، يتم تحويل ميزات الإدخال إلى استعلامات ومفاتيح وقيم. يتم استخدام حاصل الضرب النقطي للاستعلام Q والمفتاح K لحساب أوزان الانتباه وقياسها ، كما هو موضح في المعادلة (2).

figure-protocol-4(2)

في المعادلة (2) ، يمثل dk بعد الاستعلام عن Q والمفتاح K ، ويشير softmax إلى وظيفة softmax المستخدمة للحصول على مصفوفة وزن الانتباه. يمكن أن يمنع التحجيم بشكل فعال مشكلة كون التدرج صغيرا جدا بسبب قيم المنتج النقطي المفرطة الناتجة عن الأبعاد. يتم تطبيق مصفوفة وزن الانتباه على القيمة V للحصول على الإخراج Z لوحدة الانتباه الذاتي ، كما هو موضح في المعادلة (3).

figure-protocol-5(3)

في المعادلة (3) ، يعني aij وزن الانتباه لمتجه الاستعلام i على متجه المفتاح j . يشار إلى الهيكل المحدد لوحدة اندماج الانتباه المتقاطع في الشكل 2.

من الشكل 2 ، تبدأ هذه الوحدة بشكل أساسي في معالجة ميزات الإدخال من طرائق الهيكل العظمي والفيديو. أولا ، يخضع تسلسل الهيكل العظمي وتسلسل الفيديو بشكل منفصل لطبقات تلافيفية ثلاثية الأبعاد لاستخراج السمات الزمانية المكانية ، ثم يتم نمذجة هذه الميزات الزمانية المكانية باستخدام الوحدات المتكررة ثنائية الاتجاه (Bi-GRUs) للنمذجة الزمنية. بعد ذلك ، يتم استخراج ميزات الطريقتين بشكل أكبر من خلال MHAMs لاستخراج الارتباطات داخل الطرائق. تحقق كل طريقة تمثيل الميزات داخليا من خلال آليات الاستعلامات والمفاتيح والقيم. بعد ذلك، يتم إجراء التجميع بمتوسط الوقت على ميزات الإخراج لتقليل تعقيد البعد الزمني. بعد التجميع ، يتم تجميع الميزات متعددة الوسائط إحصائيا لحساب المتوسط والانحراف المعياري لكل طريقة ، وأخيرا إخراج التعرف على عمل الطالب وتصنيفه من خلال طبقة متصلة بالكامل (FCL) ومصنف Softmax. لذلك ، يستخدم استخراج الميزة المستند إلى دمج البيانات متعددة الوسائط المقترحة في الدراسة الانتباه الذاتي وعبر AMs لالتقاط ونمذجة السمات الزمانية المكانية لسلوك الطالب بدقة عن طريق دمج البيانات من طرائق الفيديو والهيكل العظمي ، وبالتالي تحسين دقة وشمولية التعرف على سلوك الطلاب في الفصول الدراسية الذكية.

4. التعرف على السلوك الزماني المكاني على أساس المحول والانتباه

يحقق استخراج الميزة المستند إلى دمج البيانات متعددة الوسائط تحسنا أوليا في شمولية ودقة سلوك الطلاب من خلال دمج البيانات من طرائق الفيديو والهيكل العظمي. ومع ذلك ، في سياق الفصول الدراسية الذكية ، غالبا ما يتغير سلوك الطلاب بمرور الوقت ، وقد يظهر نفس السلوك خصائص مختلفة في نقاط زمنية ومناطق مكانية مختلفة. لا يمكن للاعتماد فقط على المعلومات الثابتة المدمجة من الميزات متعددة الوسائط أن يلتقط بشكل كامل العلاقات الديناميكية الزمانية المكانية المعقدة في تسلسل السلوك22،23. لذلك ، يقترح المزيد من البحث نمذجة السلوك الزماني المكاني و AM بناء على المحول. اختارت الدراسة محول الرؤية (ViT) كبنية الشبكة ، والتي يمكنها نمذجة المعلومات الزمانية المكانية العالمية للمدخلات من خلال AM الذاتي ولديها قدرة أقوى على التقاط التبعيات الزمانية المكانية. بعد الاندماج متعدد الوسائط ، يتم تمثيل الميزات المنصهرة مرة أخرى باستخدام محول الرؤية (ViT) للتنبؤ بالسلوك الزماني المكاني. يتم تقسيم خرائط الميزات في المدخلات إلى 16 × 16 رقعة منفصلة ، مضمنة خطيا في متجهات أحادية البعد ، ويتم تشفيرها موضعيا للحفاظ على النظام المكاني. يحتوي هيكل ViT على 12 كتلة تشفير محولات ، تتكون من انتباه ذاتي متعدد الرؤوس (8 رؤوس) وطبقات تغذية أمامية أبعادها الخفية هو 768. لتعزيز البروز السلوكي ، يقترح وحدات الانتباه المكاني (SA) والانتباه الزمني (TA). تشجع وحدة SA على أهمية الميزات في المناطق المكانية من خلال تنشيط Tanh ، بينما تسلط وحدة TA الضوء على الإطارات الزمنية المهمة عبر تنشيط ReLU. يتم دمج هذين التيارين للانتباه لاحقا مع العمود الفقري ل ViT عبر طريقة تدريب من مرحلتين بحيث يتعلم النموذج التقاط التطور الديناميكي لسلوك الفصل الدراسي بكفاءة. يظهر هيكل ViT في الشكل 3.

في الشكل 3 ، في ViT ، المدخلات الأصلية عبارة عن صورة مقسمة إلى كتل صغيرة متعددة ذات حجم ثابت ، يتم تمثيل كل منها كجزء من الصورة ، ويتم تسويتها خطيا إلى متجه أحادي البعد. نظرا لأن المحول لا يمكنه إدراك معلومات الموقع ، فإن كل كتلة صغيرة مضمنة بمعلومات الموقع قبل إدخالها في المحول للتأكد من قدرتها على التقاط علاقة الموضع المكاني النسبي بين الكتل الصغيرة المختلفة. الوحدة الأساسية ل ViT هي مشفر المحولات ، والتي تتكون من كتل ترميز محولات متعددة مكدسة. تتكون كتل الترميز من MHAM وشبكة عصبية للتغذية الأمامية. يلتقط MHAM التبعيات بين تسلسلات الإدخال بالتوازي ، بينما تقوم الشبكة العصبية للتغذية الأمامية بإجراء تحويلات غير خطية على النتائج لتعزيز قدرة النموذج على التقاط المعلومات العالمية والتعبير عنها. بعد أن يعالج مشفر المحول جميع الأجزاء الصغيرة من المعلومات ، يتم تمرير إخراج طبقة الترميز الأخيرة إلى رأس المستقبل متعدد الطبقات (MLP Head) ، والذي ينتج نتائج التعرف النهائي على إجراءات الطالب وتصنيفها.

عمليا ، يتم تقسيم كل إطار إلى 16 × 16 رقعة غير متداخلة ، مسطحة ومضمنة موضعيا من أجل الحفاظ على العلاقات المكانية. تتم معالجة عمليات تضمين التصحيح بالتتابع بواسطة مشفرات المحولات المكدسة في بنية ViT. تستخدم وحدة الانتباه المكاني (SA) تنشيط tanh لتغيير الانتباه عبر مجالات الاهتمام داخل كل إطار ، وتستخدم وحدة الانتباه الزمني (TA) ReLU لتسليط الضوء على الإطارات المهمة مؤقتا. تتيح آلية الانتباه المزدوج هذه النمذجة الفعالة لديناميكيات سلوك المكان والزمان.

لزيادة تعزيز أداء ViT في التسلسلات السلوكية المعقدة ، يتم تقديم الانتباه المكاني (SA) والانتباه الزمني (TA) لتمكين ViT ليس فقط من اختيار المفاصل المكانية المهمة بشكل مستقل ، ولكن أيضا التركيز على السلوكيات في نقاط زمنية مختلفة ، والتقاط التغييرات الديناميكية الزمانية المكانية للسلوك بشكل أفضل. يشار إلى وحدة SA ووحدة TA في الشكل 4.

في الشكل 4 أ ، تعالج وحدة SA معلومات البعد المكاني للإدخال عن طريق تمرير ميزات الإطار الحالي إلى طبقة ViT لاستخراج الحالات المخفية. يتم دمجها مع ميزات الإطار السابق ويتم إدخالها بشكل مشترك في FCL. سيقوم FCL بإجراء تحويل خطي على الميزات لإنشاء تمثيلات الميزات الكامنة. بعد ذلك ، يتم تمريره إلى وظيفة تنشيط Tanh لتعيين الإخراج إلى نطاق [-1،1] ، مما يعزز اللاخطية والتمييز بشكل أفضل بين الميزات المهمة وغير المهمة. أخيرا ، يتم تطبيع الميزات من خلال طبقة تطبيع للتأكد من أن ميزات الإخراج لها مقياس مستقر نسبيا. في الشكل 4 ب ، تركز وحدة TA بشكل أكبر على المعلومات الأساسية الواردة في كل إطار في البعد الزمني. على عكس Tanh في SA ، تستخدم وحدة TA وظيفة تنشيط ReLU لقمع القيم السلبية وتحتفظ فقط بإخراج القيم الموجبة ، مما يزيل معلومات الضوضاء السلبية بشكل فعال ويعزز قدرة الالتقاط الزمني للنموذج.

5. طريقة التدريب المشترك

لحل مشكلة الميزات الزمانية المكانية المتحيزة والزائدة عن الحاجة الناتجة عن التأثير المتبادل بين ViT و SA النمطية ووحدة TA في التعرف على السلوك الزماني المكاني بناء على المحول والانتباه ، تم اعتماد طريقة تدريب مشتركة لتحسين الوحدات الثلاث. يشار إلى العملية المحددة في الشكل 5.

في الشكل 5 ، تقوم استراتيجية التدريب المشترك أولا بإدخال معلمات تدريب النموذج ، وتحدد هيكل الشبكة ، والمعلمات الفائقة. بعد ذلك ، يتم إجراء تدريب مسبق منفصل على SA و TA لتعلم الميزات المحلية بشكل أفضل. تجدر الإشارة إلى أنه أثناء التدريب المسبق لنموذج واحد ، يتم الاحتفاظ بأوزان النموذج الآخر ثابتة ولا يتم تحديثها. بعد الانتهاء من التدريب المسبق الفردي ، يتم دمج طبقة ViT للتدريب. بعد ذلك ، سيتم إصلاح نموذجين للانتباه ، وسيتم تدريب شبكة ViT الرئيسية بشكل منفصل. أخيرا ، من خلال التدريب المشترك لشبكة ViT الرئيسية و SA و TA ، تم تحسين الشبكة الشاملة لإنشاء النموذج النهائي للتعرف الذكي على سلوك الفصول الدراسية. يتم تنفيذ إجراء التدريب خطوة بخطوة: (1) التدريب المسبق المستقل لوحدات SA و TA مع معلمات ViT المجمدة ، (2) التدريب التدريجي ل ViT مع أوزان وحدة الانتباه المجمدة ، و (3) الضبط الدقيق من طرف إلى طرف لجميع المكونات جنبا إلى جنب مع محسن Adam (معدل التعلم = 0.001 ، حجم الدفعة = 64 ، الفترات = 100). يعمل هذا النهج على استقرار تعلم الميزات وتقليل التداخل بين الوحدات أثناء التحسين.

بشكل عام ، تجمع طريقة التعرف على سلوك الفصول الدراسية الذكية المقترحة بين طرائق الفيديو والهيكل العظمي لنمذجة العلاقات الزمانية المكانية من خلال الانتباه الذاتي وعبر AMs. من خلال الاستفادة من قدرة النمذجة الزمانية المكانية العالمية ل ViT والجمع بين الوحدات المكانية والمعلمة ، تم تحسين النموذج لالتقاط السلوكيات الرئيسية والديناميكيات الزمنية ، مما يحقق التعرف على سلوك الطلاب بشكل أكثر شمولا ودقة. يتم تنفيذ عمليات الاندماج الحرجة ، حيث يتم الجمع بين تمثيلات الميزات متعددة الوسائط ، في البنية قيد الدراسة. على وجه التحديد ، ترتبط الميزات المكانية التي تعلمتها CNN بالسمات الزمنية ل Bi-LSTM. ثم يتم دمج هذا الإخراج مع ميزات MHAM المعززة بالاهتمام قبل مهمة التصنيف. تعتبر عمليات الاندماج هذه ضرورية لدمج وجهات النظر التكميلية للبيانات السلوكية ويتم التأكيد عليها في الشكل 1 والشكل 5.

توضح الخوارزمية 1 البيانات متعددة الوسائط المجمعة ومعلومات الهيكل العظمي والنصوص والفيديو ، باستخدام النماذج المستندة إلى ViT و BERT و GCN لاستخراج الميزات الإعلامية في الفصل. ثم يتم وضع علامة على التمثيل المشترك لتحديد سلوك الطالب ، بدقة أعلى باستخدام التعلم متعدد الوسائط.

الخوارزمية 1: عملية التعرف على السلوك متعدد الوسائط باستخدام ViT و BERT و GCN.

تهيئه:

نموذج BERT المدرب مسبقا

نموذج R-CNN أسرع المدرب مسبقا

نموذج ViT المدرب مسبقا

نموذج GCN لبيانات الهيكل العظمي

المصنف (على سبيل المثال ، MLP أو Transformer)

تحميل مجموعة البيانات:

لكل عينة في مجموعة البيانات متعددة الوسائط:

استخراج إطارات الفيديو

استخراج النص الصوتي

استخراج بيانات الهيكل العظمي (OpenPose أو MediaPipe)

الخطوة 1: معالجة طريقة الفيديو

لكل إطار في الفيديو:

تطبيق R-CNN أسرع لاكتشاف الكائنات / المشاركين

تطبيق محول الرؤية (ViT) لاستخراج الميزات على مستوى الإطار

تجميع الميزات بمرور الوقت للتمثيل الزمني

الخطوة 2: معالجة طريقة النص

نص نسخة ما قبل المعالجة:

الترميز باستخدام الرمز المميز BERT

تمرير الرموز المميزة من خلال نموذج BERT

استخراج عمليات التضمين السياقية من الرمز المميز [CLS] أو متوسط التجميع

الخطوة 3: معالجة طريقة الهيكل العظمي

لكل تسلسل هيكل عظمي:

تطبيع الإحداثيات

قم بالمرور عبر GCN أو ST-GCN لاستخراج ميزات الحركة

الخطوة 4: اندماج الميزات

تسلسل أو فتيل الانتباه:

ميزات الفيديو

ميزات النص

ميزات الهيكل العظمي

الحصول على تمثيل موحد متعدد الوسائط

الخطوة 5: التصنيف

تمرير التمثيل المنصهر إلى المصنف النهائي

توقع تسمية سلوك الفصل الدراسي (على سبيل المثال ، منتبه ، مشتت)

الخطوة 6: التقييم

قارن التنبؤات بالحقيقة الأرضية

مقاييس الحوسبة: الدقة، الدقة، الاستدعاء، درجة F1

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

لتقييم فعالية وتفوق طريقة التعرف على سلوك الفصل الدراسي الذكي المرتفع باستخدام Transformer و AM ، تم إجراء التحقق من الأداء التجريبي وتحليله. أولا ، تم تكوين البيئة والمعلمات التجريبية ، كما هو موضح في الجدول 1.

استنادا إلى الجدول 1 ، اختارت الدراسة مجموعة بيانات EduSense ومجموعة بيانات تفاعل SBU Kinect كمجموعات بيانات تجريبية ، تسمى D1 و D2 ، على التوالي. جمع D1 سلوكيات الطلاب والمعلمين في الفصول الدراسية الجامعية ، بينما تم استخدام D2 للتعرف على تفاعل السلوك...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تم اقتراح طريقة التعرف على السلوك للفصول الدراسية الذكية القائمة على Transformer و AM لمواجهة تحديات سلوك الطلاب المعقد والتعرف على البيانات متعددة الوسائط. تم إنشاء شبكة ViT مع قدرة النمذجة الزمانية المكانية العالمية من خلال دمج البيانات من طرائق الفيديو والهيكل العظمي ، وتم استخدام الانتباه الذاتي وعبر AMs لالتقاط السمات الزمانية المكانية للسلوك. من خلال دمج بيانات الفيديو والصوت في إطار عمل جديد لإطار الاستشعار الذكي (ISF) باستخدام محول إطار عمل متعدد الوسائط (MFT) ، يسعى التقييم إلى ...

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

المؤلفون ليس لديهم ما يكشفون عنه.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

اي.

مساهمة المؤلف:
ليو لي: مسؤول عن مفهوم وتصميم البحث. اقترح طريقة دمج البيانات متعددة الوسائط القائمة على المحولات للتعرف الذكي على سلوك الفصل الدراسي. قاد تطوير النموذج والتصميم التجريبي ، وأدار جمع البيانات ومعالجتها ، وصياغة المخطوطة الأولية. ساهم في تحليل ومناقشة النتائج التجريبية.

هي تشيهوا: قدم التوجيه والإشراف الشاملين على الدراسة. ساهم في إطار البحث والدعم المنهجي. شارك في تحسين النموذج والتحليل التجريبي ، وراجع المخطوطة ونقحها ، وتأكد من الامتثال للمعايير الأخلاقية ، وأعطى الموافقة النهائية على التقديم. مسؤول عن المراسلات.

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
ذاكرة وصول عشوائي DDR4 سعة 128 جيجابايتhttps://www.crucial.com/memory/ddr4بائعون متعددونذاكرة كافية لمعالجة البيانات متعددة الوسائط
SSD سعة 2 تيرابايتبائعين متعددينhttps://www.samsung.com/ssdلتخزين مجموعات البيانات والنماذج
BERT (التكوين الأساسي) نموذجhttps://huggingface.co/bert-base-uncased الوجه المعانقلتضمين تسلسل الهيكل العظمي
CUDA 11.1 Toolkitتتيح NVIDIAhttps://developer.nvidia.com/cuda-toolkitتسريع وحدة معالجة الرسومات لمكتبة PyTorch
cuDNN 8.0مكتبة NVIDIAhttps://developer.nvidia.com/cudnnالمسرعة بوحدة معالجة الرسومات للشبكات العصبية العميقة
مجموعة بيانات EduSenseجامعة كارنيجيميلون https://www.cs.cmu.edu/~./edusenseمجموعة
بيانات الفصول الدراسية الجامعية الواقعيةأسرع R-CNN (ResNet-50)مفتوح المصدر (PyTorch)https://github.com/facebookresearch/detectron2كاشف الكائنات المستخدم لاستخراج ميزات الفيديو
Xeon E5-2680 v4 وحدة المعالجة المركزيةIntelhttps://www.intel.com/products/xeon-e5-2680-v4معالج عالي الأداء للتدريب على النموذج
Matplotlibمفتوح المصدرhttps://matplotlib.orgيستخدم لرسم مقاييس الأداء
NVIDIA Tesla V100 GPUNVIDIA https://www.nvidia.com/en-us/data-center/tesla-v100تستخدم للتدريب والاستدلال ؛ يدعم التعرف على السلوك في الوقت الفعلي
OpenPoseCMUhttps://github.com/CMU-Perceptual-Computing-Lab/openposeيستخرج النقاط الرئيسية للهيكل العظمي ثنائي الأبعاد من إطارات الفيديو
PyTorch 1.8 Frameworkمفتوح المصدرhttps://www.pytorch.orgمكتبة التعلم العميق المستخدمة ل تطوير النموذج
مجموعة بيانات تفاعل SBU Kinectجامعة ستونيبروك https://www3.cs.stonybrook.edu/~kyunghan/sbu_kinectمجموعة بيانات الهيكل العظمي القائمة على التفاعل
TensorBoardمفتوح المصدر (Google)https://www.tensorflow.org/tensorboardتستخدم للتدريب على التصور
التشغيل Ubuntu 20.04 LTSCanonicalhttps://www.ubuntu.com/downloadيستخدم نظام التشغيل Linux كبيئة تطوير محول
الرؤية (ViT) Google/ Hugging Facehttps://huggingface.co/google/vit-base-patch16-224يستخدم لنمذجة السلوك المكاني والزماني العالمي
تخزين لغة Intel نظام

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. He, F., Yuan, X. An analysis of ways to optimize teacher-student relationship in ideological and political wisdom classroom teaching in senior high school. Int J Educ Humanit. 14 (1), 40-44 (2024).
  2. Tambunan, M. A., Sirait, J., Silitonga, I. Implementation of the Glasser model with the help of animation media based on local wisdom to improve the writing skills of UHNP Indonesian language education program students. IDEAS J Engl Lang Teach Learn Linguist Lit. 12 (2), 1110-1117 (2024).
  3. Munisa, M., Putri, U. N., Sari, W. V., Fitri, N. A. Digital literacy based on local wisdom in inclusive education. Pionir J Pendidik. 13 (1), 120-124 (2024).
  4. Intelligent classroom perception system based on artificial intelligence. Eur Alliance Innov. Zhang, T. EAI Urb-IoT 2021: Proc 6th EAI Int Conf IoT Urban Space, 20-21 Dec 2021, Shenzhen, China, 51, (2022).
  5. Badawi, H. Exploring classroom discipline strategies and cultural dynamics: Lessons from the Japanese education system. Tafkir Interdiscip J Islam Educ. 5 (1), 1-12 (2024).
  6. Yang, F. A spatio-temporal attention-based method for detecting student classroom behaviors. arXiv. , (2023).
  7. Wang, Z., Wang, M., Zeng, C., Li, L. Multi-scale deformable transformers for student learning behavior detection in smart classroom. Xiv. , (2024).
  8. Lin, L., Yang, H., Xu, Q., Xue, Y., Li, D. Research on student classroom behavior detection based on the real-time detection transformer algorithm. Appl Sci. 14 (14), 6153(2024).
  9. Wang, Z., Yao, J., Zeng, C., Li, L., Tan, C. Students' classroom behavior detection system incorporating deformable DETR with Swin transformer and lightweight feature pyramid network. Systems. 11 (7), 372(2023).
  10. Lyons, J., Tarc, P. How might IB classroom pedagogy 'make a better world?' (Toward) illuminating a promising IBDP teacher praxis. Globalisation Soc Educ. 22 (4), 605-624 (2024).
  11. Radosavljevic, V., Radosavljevic, S., Jelic, G. Ambient intelligence-based smart classroom model. Interact Learn Environ. 30 (2), 307-321 (2022).
  12. Tai, T. Y. Effects of intelligent personal assistants on EFL learners' oral proficiency outside the classroom. Comput Assist Lang Learn. 37 (5-6), 1281-1310 (2024).
  13. Chen, Y., Jensen, S., Albert, L. J., Gupta, S., Lee, T. Artificial intelligence (AI) student assistants in the classroom: Designing chatbots to support student success. Inf Syst Front. 25 (1), 161-182 (2023).
  14. Chen, J., Lu, H. Evaluation method of classroom teaching effect under intelligent teaching mode. Mob Netw Appl. 27 (3), 1262-1270 (2022).
  15. Trabelsi, Z., Alnajjar, F., Parambil, M. M. A., Gochoo, M., Ali, L. Real-time attention monitoring system for classroom: A deep learning approach for student's behavior recognition. Big Data Cogn Comput. 7 (1), 48-56 (2023).
  16. Chonggao, P. Simulation of student classroom behavior recognition based on cluster analysis and random forest algorithm. J Intell Fuzzy Syst. 40 (2), 2421-2431 (2021).
  17. Wu, S. Simulation of classroom student behavior recognition based on PSO-kNN algorithm and emotional image processing. J Intell Fuzzy Syst. 40 (4), 7273-7283 (2021).
  18. Ramakrishnan, A., Zylich, B., Ottmar, E., LoCasale-Crouch, J., Whitehill, J. Toward automated classroom observation: Multimodal machine learning to estimate class positive climate and negative climate. IEEE Trans Affect Comput. 14 (1), 664-679 (2021).
  19. Lee, J., Kim, H. Discrete cosine transformed images are easy to recognize in vision transformers. IEIE Trans Smart Process Comput. 12 (1), 48-54 (2023).
  20. Rachman, R. K., Setiadi, D. R. I. M., Susanto, A., Nugroho, K., Islam, H. M. M. Enhanced vision transformer and transfer learning approach to improve rice disease recognition. J Comput Theor Appl. 1 (4), 446-460 (2024).
  21. Wu, H., Triebe, M. J., Sutherland, J. W. A transformer-based approach for novel fault detection and fault classification/diagnosis in manufacturing: A rotary system application. J Manuf Syst. 67 (1), 439-452 (2023).
  22. Zhong, X., Gu, Y., Luo, Y., Zeng, X., Liu, G. Bi-hemisphere asymmetric attention network: Recognizing emotion from EEG signals based on the Transformer. Appl Intell. 53 (12), 15278-15294 (2023).
  23. Jamali, A., Roy, S. K., Bhattacharya, A., Ghamisi, P. Local window attention transformer for polarimetric SAR image classification. IEEE Geosci Remote Sens Lett. 20 (1), 1-5 (2023).
  24. Zhao, X. M., Yusop, F. D. B., Liu, H. C., Prilanita, Y. N., Chang, Y. X. Classroom student behavior recognition using an intelligent sensing framework. IEEE Access. 13, 49767-49776 (2025).
  25. Huang, Y., et al. A method for classroom behavior state recognition and teaching quality monitoring. Int J Intell Comput Cybern. 18 (2), 382-396 (2025).

الوصول مقيد. يرجى تسجيل الدخول أو بدء فترة تجريبية لعرض هذا المحتوى.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

الفيديو قريباً

مقالات ذات صلة