$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
تستخدم هذه الدراسة مجموعات بيانات متاحة للجمهور لا تحتوي على أي معلومات تعريف شخصية. تم إخفاء هوية جميع البيانات المستخدمة في البحث لضمان خصوصية المشاركين. تم الحصول على الموافقة المستنيرة من جميع المشاركين في وقت جمع البيانات ، وتلتزم الدراسة بالمبادئ التوجيهية الأخلاقية. يشرح البروتوكول طريقة التعرف على سلوك الفصل الدراسي الذكية ، والتي تتكون من استخراج الميزات بناء على دمج البيانات متعددة الوسائط والتعرف على السلوك الزماني المكاني بناء على المحول والانتباه. يتم تحسين أداء الطريقة بأكملها من خلال التدريب المشترك.
1. جمع البيانات متعددة النماذج
تضمن جمع البيانات متعددة الوسائط جمع بيانات سلوك الفصل الدراسي المتزامنة من مجموعتي بيانات: مجموعة بيانات EduSense ومجموعة بيانات تفاعل SBU Kinect. سجلت EduSense تسجيلات واقعية في الفصول الدراسية الجامعية ، وسجلت SBU Kinect تسلسلات هيكلية قائمة على التفاعل. احتوت مجموعات البيانات على تدفقات فيديو وإشارات صوتية ومعلومات مشتركة هيكلية ثلاثية الأبعاد لنمذجة أوضاع الطلاب وحركتهم. تضمن المعالجة المسبقة للبيانات المحاذاة الزمنية وإزالة الضوضاء للتنظيف. وفر هذا التقارب مراقبة السلوك الشاملة ، وتسجيل الإيماءات البصرية وحركة الجسم عبر العديد من مواقف التعلم.
2. استخراج الميزات على أساس دمج البيانات متعددة الوسائط
لاستهداف مسألة التعرف على سلوك الطلاب في الفصول الدراسية الذكية ، تم اقتراح طريقة للتعرف الذكي على سلوك الفصل الدراسي باستخدام Transformer و AM. نظرا للطبيعة المعقدة للفصول الدراسية التي تضم العديد من الطلاب ، يمكن أن تتداخل التغييرات في العوامل داخل المشهد مع التعرف على سلوك الطلاب. بالإضافة إلى ذلك ، فإن استخراج الميزة الفردية له قيود مثل المعلومات غير المكتملة ، والقابلية للتداخل البيئي ، وصعوبة التقاط السلوكيات المعقدة19،20. لذلك ، تقترح الدراسة أولا طريقة استخراج ميزات الفصول الدراسية للطلاب بناء على دمج البيانات متعددة الوسائط. تجمع هذه الطريقة بين البيانات من طرائق الفيديو والهيكل العظمي ، باستخدام تكاملها لتحقيق استخراج ميزات أكثر شمولا ودقة لسلوك الطالب. على وجه الخصوص ، يتم تقسيم كل تسلسل فيديو مدخل حسب الإطار. يتم تغذية الإطارات في Faster R-CNN المدربة مسبقا لتوطين المناطق البشرية ذات الأهمية. يتم تغذية المناطق المكتشفة في العمود الفقري للشبكة العصبية التلافيفية للحصول على ميزات بصرية زمنية. بالنسبة لطريقة الهيكل العظمي ، يتم طرح مواضع المفصل ثلاثية الأبعاد كتسلسلات وترميزها باستخدام نموذج BERT المدرب مسبقا للحصول على التبعيات الزمنية والمكانية. يتم تطبيعها وتضمينها قبل إدخالها في شبكة الاندماج متعددة الوسائط. من بينها ، طريقة الفيديو مسؤولة بشكل أساسي عن التقاط الميزات المرئية مثل حركات الطلاب وتعبيراتهم ، بينما تصف طريقة الهيكل العظمي بدقة تغيرات وضع الطلاب من خلال معلومات النقطة المشتركة. بينما تعتمد طريقة الفيديو على السمات العالمية للإدراك البصري ، في حين أن الميزات المرئية العالمية لطريقة الهيكل العظمي لتمثيل السلوك البشري ، تركز طريقة الهيكل العظمي على التغييرات الديناميكية في الموضع المشترك ، مما يؤدي إلى اختلافات دلالية كبيرة بين الاثنين21. لذلك ، من الضروري تطوير شبكة اندماج متعددة الوسائط متخصصة لنمذجة العلاقة بين الطريقتين بشكل فعال. تظهر شبكة الاندماج متعدد الوسائط في الشكل 1.
في الشكل 1 ، يتم تقسيم الشبكة بشكل أساسي إلى ثلاث وحدات. من بينها ، مدخلات وحدة معالجة طريقة الفيديو عبارة عن تسلسل فيديو ، يتم استخراجه من خلال شبكة عصبية محيطية أسرع قائمة على المنطقة (أسرع R-CNN) لاستخراج الميزات. تبدأ معالجة طريقة الفيديو بترجمة لقطات الفيديو في الفصل الدراسي إلى مدخلات إطارا تلو الآخر لاستخراج الميزات. تتم معالجة الإطارات بشبكة عصبية تلافيفية أسرع قائمة على المنطقة (أسرع R-CNN) مع قاعدة ResNet-50 مدربة على ImageNet. تتعامل الشبكة مع إطارات RGB التي تم تغيير حجمها إلى 224 × 224 بكسل ، مما ينتج عنه خرائط ميزات مرئية عالية المستوى مع ميزات مكانية ومحددة للكائنات لنشاط الطالب. يتم بعد ذلك إدخال هذه الميزات في وحدة الانتباه الذاتي ، والتي تتعلم العلاقات الزمنية بين الإطارات قبل ترميزها إلى التضمينات الزمانية المكانية عبر طبقة المحولات. يحافظ هذا على الإشارات السلوكية الخافتة ، مثل إمالة الرأس أو رفع اليد ، في تضمين التمثيلات للاندماج اللاحق. يتم التقاط ميزات الفيديو المستخرجة بواسطة وحدة الانتباه الذاتي لالتقاط العلاقات الزمانية والمكانية داخل طريقة الفيديو ، ثم يتم نمذجتها بواسطة محول لإنشاء متجهات تضمين للمعلومات الزمانية المكانية لتسلسل الفيديو. مدخلات وحدة معالجة طريقة الهيكل العظمي عبارة عن تسلسل هيكلي ، تتم معالجته بواسطة تمثيل التشفير ثنائي الاتجاه من المحولات (BERT) لاستخراج السمات الزمنية والمكانية للمفاصل الهيكلية. بالنسبة لبيانات الهيكل العظمي ، يتم نمذجة وضع كل طالب كسلسلة من الإحداثيات المشتركة ثنائية الأبعاد من مقاطع الفيديو في الفصل الدراسي باستخدام مقدر الوضع المستند إلى OpenPose. يتم تحويل هذه التسلسلات إلى رموز مميزة للتضمين يتوافق فيها كل رمز مميز مع إطار يحتوي على 18 نقطة رئيسية. يتم نمذجة السياق الزمني والتبعيات لهذه التسلسلات المشتركة باستخدام تمثيلات التشفير ثنائية الاتجاه من المحولات (BERT). يستخدم النموذج 12 طبقة محولات ، و 8 رؤوس انتباه ، وحجم مخفي يبلغ 768 ، وهي بنية قاعدة BERT القياسية. يتم ضبط النموذج أثناء التدريب للحصول على أنماط مشتركة خاصة بالسلوك. تمثل عمليات تضمين الإخراج الخصائص الهيكلية والمتعلقة بالحركة لسلوك الطالب والتي يتم دمجها لاحقا مع ميزات طريقة الفيديو. بعد ذلك ، يتم تجميع ميزات الهيكل العظمي بشكل أكبر في ميزات مكانية وزمانية من خلال 3D CNN وعمليات التجميع ، مما يؤدي إلى إنشاء متجهات مضمنة للهيكل العظمي كتمثيلات ميزات لطريقة الهيكل العظمي.
3. وحدة الانصهار عبر الانتباه
في وحدة اندماج الانتباه المتقاطع ، تستخدم الدراسة آلية الانتباه متعدد الرؤوس (MHAM) لبناء علاقة التفاعل بين طريقة الفيديو وطريقة الهيكل العظمي ، وتستخرج ميزات اندماج أكثر إحكاما من خلال 3D CNN وعمليات التجميع من ميزات الاندماج متعدد الوسائط التي تم إنشاؤها. يتم إنجاز عملية الاندماج باستخدام شبكة انتباه ثنائية التيار ، حيث يتم تمرير التضمينات الزمنية لكل طريقة من خلال شبكات CNN ثلاثية الأبعاد و GRUs ثنائية الاتجاه. تتم محاذاة تدفقات البيانات متعددة الوسائط باستخدام وحدات الانتباه متعددة الرؤوس (MHAM) ، مع اهتمام المنتج النقطي المتدرج لتحقيق تبعيات بين الوسائط. ثم يتم تجميع التضمينات لمعالجة تعقيد الأبعاد وإرسالها إلى طبقة Softmax متصلة بالكامل للتصنيف.
في شبكات الاندماج متعددة الوسائط ، يتم استخدام وحدة الانتباه الذاتي لنمذجة الاعتماد الزمني والمكاني داخل وضع واحد ، بينما يتم استخدام وحدة اندماج الانتباه المتقاطع لإنشاء الارتباط وتفاعل المعلومات بين الأوضاع المختلفة. لذلك ، كلاهما مهم جدا. تلتقط وحدة الانتباه الذاتي التبعيات الداخلية لتسلسل الإدخال عن طريق حساب العلاقة بين الاستعلام Q والمفتاح K والقيمة V. يظهر حساب Q والمفتاح K والقيمة V في المعادلة (1). أين
هي مصفوفات الاستعلام والمفتاح والقيمة على التوالي ؛ DK هي أبعاد المتجه الرئيسية ، و dk هي أبعاد متجهات القيمة. تم اعتماد عامل البعد dk من أجل تجنب أن تصبح المنتجات النقطية كبيرة ، مما قد يؤثر على استقرار التدرجات أثناء التدريب.
(1)
في المعادلة (1) ،
تمثل ميزات الإدخال ، حيث n هو طول تسلسل الإدخال ، والنموذج d هو بعد الميزات ، ويمثل WQ و WK و WV ثلاث مجموعات من مصفوفات الإسقاط القابلة للتعلم. من خلال تعيينات المصفوفة هذه ، يتم تحويل ميزات الإدخال إلى استعلامات ومفاتيح وقيم. يتم استخدام حاصل الضرب النقطي للاستعلام Q والمفتاح K لحساب أوزان الانتباه وقياسها ، كما هو موضح في المعادلة (2).
(2)
في المعادلة (2) ، يمثل dk بعد الاستعلام عن Q والمفتاح K ، ويشير softmax إلى وظيفة softmax المستخدمة للحصول على مصفوفة وزن الانتباه. يمكن أن يمنع التحجيم بشكل فعال مشكلة كون التدرج صغيرا جدا بسبب قيم المنتج النقطي المفرطة الناتجة عن الأبعاد. يتم تطبيق مصفوفة وزن الانتباه على القيمة V للحصول على الإخراج Z لوحدة الانتباه الذاتي ، كما هو موضح في المعادلة (3).
(3)
في المعادلة (3) ، يعني aij وزن الانتباه لمتجه الاستعلام i على متجه المفتاح j . يشار إلى الهيكل المحدد لوحدة اندماج الانتباه المتقاطع في الشكل 2.
من الشكل 2 ، تبدأ هذه الوحدة بشكل أساسي في معالجة ميزات الإدخال من طرائق الهيكل العظمي والفيديو. أولا ، يخضع تسلسل الهيكل العظمي وتسلسل الفيديو بشكل منفصل لطبقات تلافيفية ثلاثية الأبعاد لاستخراج السمات الزمانية المكانية ، ثم يتم نمذجة هذه الميزات الزمانية المكانية باستخدام الوحدات المتكررة ثنائية الاتجاه (Bi-GRUs) للنمذجة الزمنية. بعد ذلك ، يتم استخراج ميزات الطريقتين بشكل أكبر من خلال MHAMs لاستخراج الارتباطات داخل الطرائق. تحقق كل طريقة تمثيل الميزات داخليا من خلال آليات الاستعلامات والمفاتيح والقيم. بعد ذلك، يتم إجراء التجميع بمتوسط الوقت على ميزات الإخراج لتقليل تعقيد البعد الزمني. بعد التجميع ، يتم تجميع الميزات متعددة الوسائط إحصائيا لحساب المتوسط والانحراف المعياري لكل طريقة ، وأخيرا إخراج التعرف على عمل الطالب وتصنيفه من خلال طبقة متصلة بالكامل (FCL) ومصنف Softmax. لذلك ، يستخدم استخراج الميزة المستند إلى دمج البيانات متعددة الوسائط المقترحة في الدراسة الانتباه الذاتي وعبر AMs لالتقاط ونمذجة السمات الزمانية المكانية لسلوك الطالب بدقة عن طريق دمج البيانات من طرائق الفيديو والهيكل العظمي ، وبالتالي تحسين دقة وشمولية التعرف على سلوك الطلاب في الفصول الدراسية الذكية.
4. التعرف على السلوك الزماني المكاني على أساس المحول والانتباه
يحقق استخراج الميزة المستند إلى دمج البيانات متعددة الوسائط تحسنا أوليا في شمولية ودقة سلوك الطلاب من خلال دمج البيانات من طرائق الفيديو والهيكل العظمي. ومع ذلك ، في سياق الفصول الدراسية الذكية ، غالبا ما يتغير سلوك الطلاب بمرور الوقت ، وقد يظهر نفس السلوك خصائص مختلفة في نقاط زمنية ومناطق مكانية مختلفة. لا يمكن للاعتماد فقط على المعلومات الثابتة المدمجة من الميزات متعددة الوسائط أن يلتقط بشكل كامل العلاقات الديناميكية الزمانية المكانية المعقدة في تسلسل السلوك22،23. لذلك ، يقترح المزيد من البحث نمذجة السلوك الزماني المكاني و AM بناء على المحول. اختارت الدراسة محول الرؤية (ViT) كبنية الشبكة ، والتي يمكنها نمذجة المعلومات الزمانية المكانية العالمية للمدخلات من خلال AM الذاتي ولديها قدرة أقوى على التقاط التبعيات الزمانية المكانية. بعد الاندماج متعدد الوسائط ، يتم تمثيل الميزات المنصهرة مرة أخرى باستخدام محول الرؤية (ViT) للتنبؤ بالسلوك الزماني المكاني. يتم تقسيم خرائط الميزات في المدخلات إلى 16 × 16 رقعة منفصلة ، مضمنة خطيا في متجهات أحادية البعد ، ويتم تشفيرها موضعيا للحفاظ على النظام المكاني. يحتوي هيكل ViT على 12 كتلة تشفير محولات ، تتكون من انتباه ذاتي متعدد الرؤوس (8 رؤوس) وطبقات تغذية أمامية أبعادها الخفية هو 768. لتعزيز البروز السلوكي ، يقترح وحدات الانتباه المكاني (SA) والانتباه الزمني (TA). تشجع وحدة SA على أهمية الميزات في المناطق المكانية من خلال تنشيط Tanh ، بينما تسلط وحدة TA الضوء على الإطارات الزمنية المهمة عبر تنشيط ReLU. يتم دمج هذين التيارين للانتباه لاحقا مع العمود الفقري ل ViT عبر طريقة تدريب من مرحلتين بحيث يتعلم النموذج التقاط التطور الديناميكي لسلوك الفصل الدراسي بكفاءة. يظهر هيكل ViT في الشكل 3.
في الشكل 3 ، في ViT ، المدخلات الأصلية عبارة عن صورة مقسمة إلى كتل صغيرة متعددة ذات حجم ثابت ، يتم تمثيل كل منها كجزء من الصورة ، ويتم تسويتها خطيا إلى متجه أحادي البعد. نظرا لأن المحول لا يمكنه إدراك معلومات الموقع ، فإن كل كتلة صغيرة مضمنة بمعلومات الموقع قبل إدخالها في المحول للتأكد من قدرتها على التقاط علاقة الموضع المكاني النسبي بين الكتل الصغيرة المختلفة. الوحدة الأساسية ل ViT هي مشفر المحولات ، والتي تتكون من كتل ترميز محولات متعددة مكدسة. تتكون كتل الترميز من MHAM وشبكة عصبية للتغذية الأمامية. يلتقط MHAM التبعيات بين تسلسلات الإدخال بالتوازي ، بينما تقوم الشبكة العصبية للتغذية الأمامية بإجراء تحويلات غير خطية على النتائج لتعزيز قدرة النموذج على التقاط المعلومات العالمية والتعبير عنها. بعد أن يعالج مشفر المحول جميع الأجزاء الصغيرة من المعلومات ، يتم تمرير إخراج طبقة الترميز الأخيرة إلى رأس المستقبل متعدد الطبقات (MLP Head) ، والذي ينتج نتائج التعرف النهائي على إجراءات الطالب وتصنيفها.
عمليا ، يتم تقسيم كل إطار إلى 16 × 16 رقعة غير متداخلة ، مسطحة ومضمنة موضعيا من أجل الحفاظ على العلاقات المكانية. تتم معالجة عمليات تضمين التصحيح بالتتابع بواسطة مشفرات المحولات المكدسة في بنية ViT. تستخدم وحدة الانتباه المكاني (SA) تنشيط tanh لتغيير الانتباه عبر مجالات الاهتمام داخل كل إطار ، وتستخدم وحدة الانتباه الزمني (TA) ReLU لتسليط الضوء على الإطارات المهمة مؤقتا. تتيح آلية الانتباه المزدوج هذه النمذجة الفعالة لديناميكيات سلوك المكان والزمان.
لزيادة تعزيز أداء ViT في التسلسلات السلوكية المعقدة ، يتم تقديم الانتباه المكاني (SA) والانتباه الزمني (TA) لتمكين ViT ليس فقط من اختيار المفاصل المكانية المهمة بشكل مستقل ، ولكن أيضا التركيز على السلوكيات في نقاط زمنية مختلفة ، والتقاط التغييرات الديناميكية الزمانية المكانية للسلوك بشكل أفضل. يشار إلى وحدة SA ووحدة TA في الشكل 4.
في الشكل 4 أ ، تعالج وحدة SA معلومات البعد المكاني للإدخال عن طريق تمرير ميزات الإطار الحالي إلى طبقة ViT لاستخراج الحالات المخفية. يتم دمجها مع ميزات الإطار السابق ويتم إدخالها بشكل مشترك في FCL. سيقوم FCL بإجراء تحويل خطي على الميزات لإنشاء تمثيلات الميزات الكامنة. بعد ذلك ، يتم تمريره إلى وظيفة تنشيط Tanh لتعيين الإخراج إلى نطاق [-1،1] ، مما يعزز اللاخطية والتمييز بشكل أفضل بين الميزات المهمة وغير المهمة. أخيرا ، يتم تطبيع الميزات من خلال طبقة تطبيع للتأكد من أن ميزات الإخراج لها مقياس مستقر نسبيا. في الشكل 4 ب ، تركز وحدة TA بشكل أكبر على المعلومات الأساسية الواردة في كل إطار في البعد الزمني. على عكس Tanh في SA ، تستخدم وحدة TA وظيفة تنشيط ReLU لقمع القيم السلبية وتحتفظ فقط بإخراج القيم الموجبة ، مما يزيل معلومات الضوضاء السلبية بشكل فعال ويعزز قدرة الالتقاط الزمني للنموذج.
5. طريقة التدريب المشترك
لحل مشكلة الميزات الزمانية المكانية المتحيزة والزائدة عن الحاجة الناتجة عن التأثير المتبادل بين ViT و SA النمطية ووحدة TA في التعرف على السلوك الزماني المكاني بناء على المحول والانتباه ، تم اعتماد طريقة تدريب مشتركة لتحسين الوحدات الثلاث. يشار إلى العملية المحددة في الشكل 5.
في الشكل 5 ، تقوم استراتيجية التدريب المشترك أولا بإدخال معلمات تدريب النموذج ، وتحدد هيكل الشبكة ، والمعلمات الفائقة. بعد ذلك ، يتم إجراء تدريب مسبق منفصل على SA و TA لتعلم الميزات المحلية بشكل أفضل. تجدر الإشارة إلى أنه أثناء التدريب المسبق لنموذج واحد ، يتم الاحتفاظ بأوزان النموذج الآخر ثابتة ولا يتم تحديثها. بعد الانتهاء من التدريب المسبق الفردي ، يتم دمج طبقة ViT للتدريب. بعد ذلك ، سيتم إصلاح نموذجين للانتباه ، وسيتم تدريب شبكة ViT الرئيسية بشكل منفصل. أخيرا ، من خلال التدريب المشترك لشبكة ViT الرئيسية و SA و TA ، تم تحسين الشبكة الشاملة لإنشاء النموذج النهائي للتعرف الذكي على سلوك الفصول الدراسية. يتم تنفيذ إجراء التدريب خطوة بخطوة: (1) التدريب المسبق المستقل لوحدات SA و TA مع معلمات ViT المجمدة ، (2) التدريب التدريجي ل ViT مع أوزان وحدة الانتباه المجمدة ، و (3) الضبط الدقيق من طرف إلى طرف لجميع المكونات جنبا إلى جنب مع محسن Adam (معدل التعلم = 0.001 ، حجم الدفعة = 64 ، الفترات = 100). يعمل هذا النهج على استقرار تعلم الميزات وتقليل التداخل بين الوحدات أثناء التحسين.
بشكل عام ، تجمع طريقة التعرف على سلوك الفصول الدراسية الذكية المقترحة بين طرائق الفيديو والهيكل العظمي لنمذجة العلاقات الزمانية المكانية من خلال الانتباه الذاتي وعبر AMs. من خلال الاستفادة من قدرة النمذجة الزمانية المكانية العالمية ل ViT والجمع بين الوحدات المكانية والمعلمة ، تم تحسين النموذج لالتقاط السلوكيات الرئيسية والديناميكيات الزمنية ، مما يحقق التعرف على سلوك الطلاب بشكل أكثر شمولا ودقة. يتم تنفيذ عمليات الاندماج الحرجة ، حيث يتم الجمع بين تمثيلات الميزات متعددة الوسائط ، في البنية قيد الدراسة. على وجه التحديد ، ترتبط الميزات المكانية التي تعلمتها CNN بالسمات الزمنية ل Bi-LSTM. ثم يتم دمج هذا الإخراج مع ميزات MHAM المعززة بالاهتمام قبل مهمة التصنيف. تعتبر عمليات الاندماج هذه ضرورية لدمج وجهات النظر التكميلية للبيانات السلوكية ويتم التأكيد عليها في الشكل 1 والشكل 5.
توضح الخوارزمية 1 البيانات متعددة الوسائط المجمعة ومعلومات الهيكل العظمي والنصوص والفيديو ، باستخدام النماذج المستندة إلى ViT و BERT و GCN لاستخراج الميزات الإعلامية في الفصل. ثم يتم وضع علامة على التمثيل المشترك لتحديد سلوك الطالب ، بدقة أعلى باستخدام التعلم متعدد الوسائط.
الخوارزمية 1: عملية التعرف على السلوك متعدد الوسائط باستخدام ViT و BERT و GCN.
تهيئه:
نموذج BERT المدرب مسبقا
نموذج R-CNN أسرع المدرب مسبقا
نموذج ViT المدرب مسبقا
نموذج GCN لبيانات الهيكل العظمي
المصنف (على سبيل المثال ، MLP أو Transformer)
تحميل مجموعة البيانات:
لكل عينة في مجموعة البيانات متعددة الوسائط:
استخراج إطارات الفيديو
استخراج النص الصوتي
استخراج بيانات الهيكل العظمي (OpenPose أو MediaPipe)
الخطوة 1: معالجة طريقة الفيديو
لكل إطار في الفيديو:
تطبيق R-CNN أسرع لاكتشاف الكائنات / المشاركين
تطبيق محول الرؤية (ViT) لاستخراج الميزات على مستوى الإطار
تجميع الميزات بمرور الوقت للتمثيل الزمني
الخطوة 2: معالجة طريقة النص
نص نسخة ما قبل المعالجة:
الترميز باستخدام الرمز المميز BERT
تمرير الرموز المميزة من خلال نموذج BERT
استخراج عمليات التضمين السياقية من الرمز المميز [CLS] أو متوسط التجميع
الخطوة 3: معالجة طريقة الهيكل العظمي
لكل تسلسل هيكل عظمي:
تطبيع الإحداثيات
قم بالمرور عبر GCN أو ST-GCN لاستخراج ميزات الحركة
الخطوة 4: اندماج الميزات
تسلسل أو فتيل الانتباه:
ميزات الفيديو
ميزات النص
ميزات الهيكل العظمي
الحصول على تمثيل موحد متعدد الوسائط
الخطوة 5: التصنيف
تمرير التمثيل المنصهر إلى المصنف النهائي
توقع تسمية سلوك الفصل الدراسي (على سبيل المثال ، منتبه ، مشتت)
الخطوة 6: التقييم
قارن التنبؤات بالحقيقة الأرضية
مقاييس الحوسبة: الدقة، الدقة، الاستدعاء، درجة F1