وظفت هذه الدراسة إطار عمل للتعلم العميق يتكون من مرحلتين للتعرف على الأفعال في مقاطع الفيديو الرياضية، حيث يدمج بين شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) وشبكة الذاكرة الطويلة قصيرة المدى (LSTM). وقد استُخدمت مجموعات بيانات مرجعية متاحة للعموم، وهي UCF11 وUCF Sports وJHMDB، لتطوير النموذج وتقييمه. لم يتم جمع أي بيانات جديدة من مشاركين بشريين، ولم يتم الوصول إلى أي معلومات تحديد هوية شخصية أو معالجتها. وبما أن الدراسة تضمنت تحليلاً ثانوياً لمجموعات بيانات مجهولة المصدر ومتاحة للعموم، ولم تتضمن مشاركة بشرية مباشرة، فلم تكن هناك حاجة إلى موافقة أخلاقية مؤسسية أو موافقة مستنيرة.
تكون سير العمل من أخذ عينات الإطارات والتطبيع الزمني، يليه استخراج الميزات باستخدام وحدة MSCNN. تمت معالجة الميزات المستخرجة لاحقاً باستخدام شبكة LSTM للنمذجة الزمنية، ثم مررت إلى طبقة تصنيف متعددة الفئات. وأخيراً، تم تدريب النموذج وتقييمه باستخدام مجموعات البيانات المرجعية المختارة. يوضح الشكل 1 البنية العامة للإطار المقترح.

الشكل 1: إطار عمل MSCNN-LSTM المقترح للتعرف على الأفعال في مقاطع الفيديو الرياضية. يوضح سير العمل العام عمليات المعالجة المسبقة للفيديو، واستخراج الميزات المكانية متعددة المقاييس، وتعلم التسلسل الزمني، وتصنيف الأفعال. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 1 يوضح سير العمل لإطار التعرف على الأنشطة في مقاطع الفيديو الرياضية المقترح بناءً على بنية هجينة من MSCNN-LSTM. تبدأ العملية بمقاطع فيديو رياضية تحتوي على أنشطة رياضية متنوعة، بما في ذلك الركل، وركوب الخيل، وأرجحة كرة الغولف. تم تفكيك مقاطع الفيديو الخام إلى إطارات فردية خلال مرحلة المعالجة المسبقة، حيث تم قص الإطارات وتوحيد مقاييسها وتجهيزها كمدخلات للنموذج. ثم تم إدخال الإطارات التي تمت معالجتها مسبقاً إلى وحدة MSCNN لاستخراج الميزات. وتعمل البنية التلافيفية متعددة المقاييس على التقاط الميزات المكانية في مجالات استقبال مختلفة، مما يتيح استخراج المعلومات المحلية والسياقية من إطارات الفيديو الرياضي. بعد ذلك، تمت معالجة متجهات الميزات المستخرجة بواسطة شبكة LSTM لنمذجة التبعيات الزمنية وتطور الحركة عبر الإطارات المتتالية. وأخيراً، استخدمت وحدة التصنيف والتدريب التمثيلات المكانية والزمانية المكتسبة للتنبؤ بفئة النشاط لكل مقطع فيديو. يتكون الإطار المقترح من أربع خطوات متسلسلة، تبدأ بجمع البيانات والمعالجة المسبقة باستخدام مجموعات البيانات المرجعية UCF11 (YouTube Actions) وUCF Sports وJHMDB. تم تحويل كل فيديو رياضي إلى تسلسل من الإطارات، والتي تم تغيير حجمها وتطبيعها وتعزيزها من خلال التدوير والقلب والقص لتحسين القوة في مواجهة المتغيرات البيئية. ثم تمت معالجة الإططارات المعالجة مسبقاً بواسطة الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN) المقترحة، حيث استخرجت الفروع التلافيفية المتوازية بنوى 3 × 3 و5 × 5 و7 × 7 ميزات مكانية محلية وسياقية مكملة. تم دمج هذه الميزات متعددة المقاييس وتنقيحها باستخدام تطبيع الدفعة (batch normalization) والتجميع الأقصى (max pooling) لتوليد تمثيلات ميزات مدمجة. بعد ذلك، تم تزويد الميزات الناتجة على مستوى الإطار بشبكة الذاكرة القصيرة المدى الطويلة (LSTM) لنمذجة التبعيات الزمنية عبر الإطارات المتتالية. تم تسطيح مخرجات LSTM النهائية وتمريرها عبر طبقات متصلة بالكامل مع تفعيل ReLU، يليه مصنف Softmax للتنبؤ بفئة النشاط. تم تدريب الشبكة باستخدام مُحسن Adam مع دالة فقدان الإنتروبيا المتقاطعة (cross-entropy loss) وتنظيم الإسقاط (dropout regularization) لتقليل الإفراط في التخصيص. وأخيراً، تم تقييم أداء النموذج على مجموعات البيانات المرجعية UCF11 وUCF Sports وJHMDB باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1-score.
1. جمع البيانات والمعالجة المسبقة
تم استخدام ثلاث مجموعات بيانات مرجعية متاحة للعموم للرياضات والحركة البشرية في هذه الدراسة. تحتوي مجموعات البيانات هذه على لقطات رياضية من العالم الحقيقي مع تباين في حركة الكاميرا ووجهات النظر وتعقيد الخلفية. وبشكل محدد، استخدمت الدراسة مجموعة UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php)، والتي تحتوي على 11 فئة من الحركات جُمعت من 1,168 مقطع فيديو من YouTube سُجلت لحوالي 25 شخصاً، مع عينات متعددة لكل حركة. وتحتوي قاعدة بيانات الحركة البشرية المشروحة مشتركاً (JHMDB)34,35 على 21 فئة من الحركات و928 مقطع فيديو مشروحاً. وتتكون مجموعة بيانات UCF Sports من 10 فئات من الحركات و150 تسلسلاً فيديو تم التقاطها من مصادر البث بدقة 720 × 480 pixels (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
تغطي هذه المجموعات من البيانات مجتمعةً الرياضات الفردية والجماعية، وتوفر تنوعاً في المدة الزمنية والمقياس البصري لتقييم إطار عمل MSCNN-LSTM المقترح للتعرف على الأفعال. وكجزء من عملية فحص جودة البيانات، تم فحص مجموعات بيانات UCF11 وUCF Sports وJHMDB بحثاً عن مقاطع فيديو تالفة، أو ملفات مكررة، أو مقاطع ذات تعليقات توضيحية غير مكتملة. ولم يتم تحديد أي عينات تستوفي معايير الاستبعاد هذه؛ وبناءً على ذلك، تم الاحتفاظ بجميع مقاطع الفيديو المتاحة للتحليل اللاحق. ثم قُسمت مجموعات البيانات إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام استراتيجية تقسيم عشوائي متسقة. يعرض الشكل 2 صوراً نموذجية استُخدمت في التدريب والتقييم.

الشكل 2: إطارات تمثيلية من مجموعات بيانات معيارية للتعرف على الأنشطة الرياضية. توضح اللوحات (A–D) أمثلة من مجموعة بيانات UCF11 (YouTube Actions)، واللوحات (E–H) من مجموعة بيانات UCF Sports، واللوحات (I–L) من مجموعة بيانات JHMDB. وتوضح هذه الإطارات التباينات في فئات الأنشطة، وزوايا الرؤية، والخلفيات، وظروف الإضاءة، وتعقيد الحركة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
تم تقييم نموذج التعرف على الأفعال المقترح على مجموعات البيانات المرجعية UCF11 وUCF Sports وJHMDB، كما هو ملخص في الجدول 3. تمثل مجموعات البيانات هذه أنماط حركة متنوعة وظروفاً بيئية صعبة. تحتوي مجموعة بيانات UCF11 (YouTube Actions) على أفعال رياضية من 11 فئة تم الحصول عليها في ظل ظروف إضاءة ووجهات نظر وخلفيات متنوعة. وتضم مجموعة بيانات UCF Sports ما مجموعه 150 مقطع فيديو للرياضات الميدانية من بث احترافي، وتتميز بتسلسلات حركة واقعية. بينما توفر مجموعة بيانات JHMDB تعليقات توضيحية مفصلة لحركة الإنسان لـ 21 فئة من الأفعال دقيقة التفاصيل، وتعمل كمجموعة بيانات مرجعية للتعرف على الأفعال المكانية الزمانية. وقد استُخدمت هذه المجموعات معاً لتقييم أداء النموذج عبر سيناريوهات رياضية وأفعال بشرية. تم تدريب الشبكة باستخدام محسن Adam لمدة 100 حقبة (epochs) بحجم دفعة قدره 32، ومعدل تعلم أولي قدره 0.001، ودالة فقدان الإنتروبيا المتقاطعة (cross-entropy loss function). وقد اختير النموذج الذي حقق أدنى فقدان في التحقق للتقييم النهائي. استخدمت جميع التجارب بذرة عشوائية ثابتة بقيمة 42. كما تم تطبيق التوقف المبكر وتقليل معدل التعلم عند الثبات لتحسين التقارب، واستُخدم قص التدرج (gradient clipping) بعتبة قدرها 5.0 أثناء تدريب LSTM لمنع انفجار التدرجات. احتوى نموذج MSCNN-LSTM المقترح على حوالي 15 مليون معلمة قابلة للتدريب. تم تلخيص تكوين الأجهزة والبرامج المستخدمة للتنفيذ في الجدول 4. وبما أن توزيعات الفئات كانت متوازنة بما يكفي، لم يتم تطبيق أي إجراءات إضافية لوزن الفئات أو إعادة أخذ العينات. نُفذت النماذج المقارنة باستخدام المعلمات الفائقة المذكورة في دراساتها الأصلية، مع توحيد إعدادات التدريب حيثما أمكن. أُبلغت قيم الأداء كمتوسط ± الانحراف المعياري من خمس عمليات تشغيل مستقلة بتهيئات عشوائية مختلفة. وقُيمت الاختلافات بين النموذج المقترح والنماذج المقارنة باستخدام اختبارات t المقترنة عند عتبة دلالة p < 0.05.
| مجموعة البيانات | عدد الفئات | عدد الفيديوهات | الدقة (بكسل) | يرجى تزويدي بالنص المصدر المراد ترجمته. | الوصف |
| UCF11 (إجراءات يوتيوب) | 11 | 1168 | متغير (≈ 320×240) | جامعة سنترال فلوريدا | يتضمن 11 إجراءً بشرياً من الرياضات (مثل: التصويب في كرة السلة، والغطس، وضربة الجولف، والتنطيط في كرة القدم). جُمعت مقاطع الفيديو من موقع YouTube مع وجود تباين عالٍ في الإضاءة، وزاوية الرؤية، والخلفية. |
| رياضات جامعة UCF | 10 | 150 | 720×480 | مجموعة بيانات UCF للأعمال الرياضية | يتضمن أنشطة رياضية مثل الغطس، وركوب الخيل، وضربة الجولف، والجري، ورفع الأثقال، مسجلة من لقطات حقيقية لبث تلفزيوني (BBC, ESPN). |
| قاعدة بيانات JHMDB | 21 | 928 | 320×240 | معهد ماكس بلانك للأنظمة الذكية | تتضمن أنشطة يومية ورياضية مثل الإمساك، والقفز، وتمشيط الشعر، والتسديد، والجري، مع تعليقات توضيحية مشتركة لتحليل الحركة والوضعية. |
الجدول 3: خصائص مجموعات البيانات المرجعية المستخدمة في التدريب والتقييم. نظرة عامة على مجموعات بيانات UCF11 وUCF Sports وJHMDB، بما في ذلك عدد فئات الأفعال، وعينات الفيديو، وخصائص مجموعة البيانات، وأدوارها في تدريب النموذج والتحقق منه واختباره.
| المعاملات المستخدمة | الوصف |
| لغة البرمجة | Python 3.8.18 [4] |
| إطار عمل التعلم العميق | TensorFlow 2.15.0 [1] |
| مسرع وحدة معالجة الرسوميات (GPU) | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| وحدة المعالجة المركزية (CPU) | Intel Core i9 @ 3.5 GHz × 16 Cores |
| نظام التشغيل | Windows 11 |
| الذاكرة (RAM) | 64 GB DDR4 |
| المحسن (Optimizer) | Adam (learning rate = 0.001) |
| حجم الدفعة (Batch Size) | 32 |
| عدد الدورات (Epochs) | 100 |
| دوال التنشيط | ReLU (طبقات CNN)، Softmax (طبقة المخرجات) |
| معدل الإسقاط (Dropout Rate) | 0.5 |
الجدول 4: بيئة المحاكاة وتكوين المعلمات الفائقة لنموذج MSCNN-LSTM المقترح. مواصفات الأجهزة، وبيئة البرامج، وإعدادات المُحسِّن، ومعدل التعلم، وحجم الدفعة، وعدد الدورات، وأبعاد المدخلات، وغيرها من المعلمات الفائقة المستخدمة أثناء تدريب النموذج وتقييمه.
2. المعالجة المسبقة
قبل التدريب، تم تحويل كل مقطع فيديو خام إلى تسلسل من الإطارات المرتبة زمنياً، ثم جرى توحيد معاييرها، وأخذ عينات زمنية منها، وتعزيزها. أولاً، تم تحويل كل فيديو مدخل V إلى تسلسل من الإطارات وتم تمثيله كموتر رباعي الأبعاد V ∈ RT×H×W×C، حيث تمثل T عدد الإطارات، وH × W i مؤشر الإطار، وتمثل C عدد قنوات الألوان (3 لـ RGB). تضمنت سلسلة المعالجة المسبقة استخراج الإطارات، وتغيير الحجم المكاني متبوعاً بقص مركزي أو عشوائي إلى دقة ثابتة (H′, W′)، وتوحيد كثافة كل بكسل، وتعزيز البيانات الاختياري، بما في ذلك القلب العشوائي، وتغيير القياس، والاضطراب اللوني، وذلك قبل عملية استخراج الميزات. وبشكل ملموس، تم تنفيذ توحيد الكثافة إما كتوحيد درجة معياري كما في المعادلة (1).
(1)
حيث تمثل μ و σ متوسطات القنوات والانحرافات المعيارية المحسوبة على مجموعة التدريب، أو يتم استخدام القياس الأدنى-الأقصى (min–max scaling) كما في المعادلة (2).
(2)
بعد التسوية، تم تمثيل كل إطار كـ F̃t ∈ RH′×W′×C′ وتم تمثيل موتر الفيديو الناتج كـ V′ ∈ RT×H′×W′×C. وفي واجهة أمامية تلافيفية متعددة المقاييس، يتم الحصول على خرائط سمات مكانية متعددة للمجال الاستقبالي عن طريق تطبيق عدة تلافيف ثنائية الأبعاد (أو ثلاثية الأبعاد للتلافيف الزمكانية المبكرة) بأحجام نوى مختلفة؛ ثم تم توليد تمثيل سمات زمنية لكل إطار أو مقطع فيديو قصير وإرساله إلى وحدة LSTM. تطبق الورقة الأصلية نموذج MobileNetV2 ثم نموذج Deep BiLSTM للنمذجة الزمنية؛ كما أن مسار المعالجة المسبقة المذكور أعلاه متوافق تمامًا مع استبداله بنموذج تلافيفي متعدد المقاييس + LSTM.
3. أخذ العينات والتطبيع الزمني
نظرًا لأن أطوال الفيديو T تختلف بين مجموعات البيانات وداخلها، فإننا نقوم بأخذ عينات منتظمة أو إعادة أخذ عينات زمنية للإطارات لمنح التلافيف متعددة المقاييس + LSTM طول إدخال ثابت N من حيث عدد الإطارات أو المقاطع القصيرة. ويمكن حساب مؤشرات الإطارات المنتظمة كما هو موضح في المعادلة (3)،
(3)
وبالتالي، يكون تسلسل الإطارات التي تم أخذ عيناتها هو Vs = {F̃t0, …, F̃tN−1}. وعندما يتطلب الأمر دقة زمنية أعلى، نقوم بإجراء استكمال زمني خطي: لأي زمن كسري تمت إعادة أخذ عيناته τ ∈ [0, T−1] يتم حسابه كما في المعادلة (4).
(4)
بحيث تحتوي التسلسلات المعاد أخذ عيناتها Vs على N إطارات بالضبط وتحافظ على سلاسة الحركة. بدلاً من ذلك، فإن أخذ العينات عبر مقاطع متصلة قصيرة (طول النافذة الزمنية w مع خطوة s) ينتج مجموعة من موترات المقاطع حيث يكون كل مقطع Cj ∈ RT×H′×W′×C و j = 0, …, ⌊(T − w)/s⌋. ولأغراض التسوية الزمنية داخل الشبكة، يكون التجميع الزمني البسيط بمقاييس متعددة فعالاً: فبناءً على تسلسل الميزات الزمنية X = {x1, …, xN} الناتج عن عمليات الالتفاف متعددة المقاييس، يتم تطبيق الميزات المجمعة كما هو موضح في المعادلة (5).
(5)
أين Sك هل الدعم الزمني مناسب للمقياس؟ كـ (على سبيل المثال، Sك قد تكون كتلًا غير متداخلة أو مؤشرات موسعة) و مك = |Sك|.
قبل استخراج الميزات، تم تغيير مقياس جميع مقاطع الفيديو إلى 224 × 224 بكسل وأخذ عينات منها بمعدل 25 إطاراً في الثانية. واستخدمت كل تجربة طول تسلسل ثابتاً قدره 32 إطاراً. وشملت تقنيات تعزيز البيانات القص العشوائي (المقياس = 0.8–1.0)، والتدوير العشوائي (±15°)، والقلب الأفقي العشوائي (الاحتمالية = 0.5)، وتعديل السطوع (±20%). وقد استُخدمت قيم المتوسط الحسابي لـ ImageNet [0.485, 0.456, 0.406] والانحرافات المعيارية [0.229, 0.224, 0.225] لتوحيد قيم البكسل. وبالنسبة لكل تسلسل فيديو، استُخدم اختيار الإطارات الموحد لأخذ العينات الزمنية. أما المقاطع الأطول فقد تم تقليمها أو أخذ عينات منها بشكل موحد للحفاظ على طول تسلسل متسق، بينما تمت إضافة حشوة صفرية للمقاطع التي تحتوي على أقل من 32 إطاراً. وقد طُبقت هذه الإعدادات باستمرار طوال عمليتي التدريب والتقييم.
4. استخلاص الميزات باستخدام MSCNN
تم استخدام شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) لتعزيز التمثيل المكاني للأفعال في مقاطع الفيديو الرياضية. قد تمتلك الشبكات العصبية التلافيفية التقليدية التي تعتمد على حجم نواة واحد قدرة محدودة في التقاط الميزات بمقاييس مكانية متعددة. ونظرًا لأن بعض الأفعال الرياضية تظهر خصائص بصرية متشابهة، فقد يصعب على البنية التلافيفية أحادية المقياس التقاط الميزات المحلية والعالمية في آن واحد. ولمعالجة هذا القصور، يستخدم الإطار المقترح نوى تلافيفية بأحجام مختلفة لإجراء استخراج ميزات متعدد المقاييس ودمج الميزات.
في بنية الشبكة المقترحة، تم استخدام نويات تلافيف (convolution kernels) بحجم 1 × 1 لتنظيم المعلومات عبر القنوات وتقليل أبعاد خرائط السمات المدخلة. بالإضافة إلى ذلك، تزيد هذه الطبقات من القدرة التعبيرية للشبكة من خلال تقديم تحويلات إضافية للسمات وتمثيلات غير خطية. وتتيح نويات التلافيف ذات الأحجام المختلفة استخلاص المعلومات المكانية بمقاييس متعددة. كما يتم إجراء تطبيع تسلسلي (sequential normalization) بعد دمج السمات متعددة المقاييس الموزونة لتحسين استقرار التدريب. ومن أجل التخفيف من مشكلات تلاشي التدرج وانفجار التدرج أثناء تدريب الشبكات العميقة، تستخدم البنية المقترحة اتصالات متبقية (residual connections) ونمذجة زمنية قائمة على LSTM.
يعزز التصميم متعدد المقاييس قدرة الشبكة على التقاط الميزات بدقة مكانية مختلفة ويحسن من قدرة تمثيل الميزات. علاوة على ذلك، يتم تفكيك نواة الالتفاف التقليدية N × N إلى عمليات التفاف N × 1 و 1 × N. وقد صُممت عمليات الالتفاف N × 1 و 1 × N المستخدمة في وحدة MSCNN لالتقاط ميزات مكانية اتجاهية ومتعددة المقاييس ومتكاملة من إطارات الفيديو الفردية. وتعزز عمليات الالتفاف هذه تمثيل الميزات المكانية من خلال استخراج الأنماط بمقاييس مختلفة للمجال الاستقبالي. بعد ذلك، يتم نمذجة العلاقات الزمنية بين الإطارات المتتالية بواسطة وحدة LSTM، التي تعالج تسلسل الميزات المستخرجة بواسطة MSCNN لتعلم التبعيات الزمنية طويلة المدى للتعرف على الأفعال.
يتم تفكيك كل فيديو رياضي V = {F1, F2, …, FT} إلى T من الإطارات. ولتشفير التغيرات المكانية، على سبيل المثال، وضعية اللاعب، وضبابية الحركة، ومسار الكرة، تعمل فروع تلافيفية عند ثلاثة مقاييس مختلفة s ∈ {1, 2, 3}، بما يتوافق مع أحجام النواة 3 × 3 و 5 × 5 و 7 × 7. ويقوم كل فرع باستخراج خرائط الميزات كما هو موضح في المعادلة (6):
(6)
حيث تمثل Ws و bs أوزان وانحيازات الالتفاف عند المقياس s، و σ هي دالة التنشيط ReLU. تقوم طبقة دمج المقاييس المتعددة بتجميع الميزات كما هو موضح في المعادلة (7):
(7)
يدمج موتر السمات المدمج هذا كلاً من إشارات الحركة الدقيقة والمعلومات السياقية للمساحات الواسعة، مثل الأنشطة الجماعية. يوضح الشكل 3 وحدة استخراج السمات الخاصة بـ MSCNN فقط. أما طبقة LSTM (256 وحدة خفية)، والطبقة الكثيفة (128 عصبوناً)، وطبقة الإسقاط (0.5) المستخدمة للنمذجة الزمنية والتصنيف، فقد عُرضت بشكل منفصل في الشكل 4.

الشكل 3: وحدة استخراج الميزات المقترحة للشبكة العصبية التلافيفية متعددة المقاييس (MSCNN). تقوم ثلاثة فروع تلافيفية متوازية بأحجام نواة 3 × 3 و5 × 5 و7 × 7 باستخراج ميزات مكانية متكاملة متعددة المقاييس، والتي يتم دمجها قبل النمذجة الزمنية بواسطة شبكة LSTM. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4: بنية LSTM المقترحة للتعرف على الأنشطة في مقاطع الفيديو الرياضية. تقوم وحدة LSTM بنمذجة التبعيات الزمنية من خلال عمليات بوابات الإدخال، والنسيان، والإخراج عبر إطارات الفيديو المتتالية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 3 يوضح وحدة استخراج الميزات المقترحة باستخدام الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN) للتعرف على الحركات في مقاطع الفيديو الرياضية. تمت معالجة إطارات الفيديو المدخلة بالتوازي عبر ثلاثة فروع تلافيفية بأحجام نوى (kernel sizes) تبلغ 3 × 3 و 5 × 5 و 7 × 7، حيث يحتوي كل منها على 64 مرشحاً لالتقاط الميزات المكانية الدقيقة والخشنة المتكاملة. تم تحسين المخرجات باستخدام تسوية الدفعات (Batch Normalization)، وتنشيط ReLU، والتجميع الأقصى (max pooling) بحجم 2 × 2، ثم دُمجت وصُهرت بواسطة تلافيف 1 × 1 مع 128 مرشحاً. حافظت وصلة تخطي متبقية (residual skip connection) على المعلومات المكانية منخفضة المستوى وحسّنت تدفق التدرج. تم تسطيح خرائط الميزات المصهورة وتمريرها إلى طبقة LSTM تحتوي على 256 وحدة خفية للنمذجة الزمنية، تلتها طبقة متصلة بالكامل (fully connected layer) تحتوي على 128 عصبوناً، وتنشيط ReLU، ومعدل إسقاط (dropout rate) قدره 0.5 قبل التصنيف النهائي باستخدام طبقة Softmax. تم دمج خرائط الميزات متعددة المقاييس (f1l و f2l و f3l) لتشكيل التمثيل المصهور (Fl)، والذي تم تحسينه لاحقاً بواسطة تلافيف 3 × 3 لتوليد خريطة الميزات المخرجة للطبقة التالية. وقد مكنت هذه البنية الهرمية من تعلم الميزات المكانية المتكاملة عبر مجالات استقبال متعددة، مما أدى إلى تحسين أداء التعرف على الحركات الرياضية.
5. النمذجة الزمنية باستخدام LSTM
من أجل نمذجة التطور الزمني عبر حواف الفيديو، تم تزويد نظام LSTM بتسلسل الميزات المجمعة لالتقاط التبعيات الديناميكية واستمرارية الحركة. بالنسبة لكل فيديو مدخل، قمنا أولاً باستخراج ميزات CNN متعددة المقاييس لكل إطار. ولنفرض أن إطارات الفيديو هي I1، ...، IT. وبالنسبة لكل إطار t وكل مقياس s، ينتج المشفر التفافي متعدد المقاييس متجه ميزات ft(s) ∈ Rd. بعد ذلك، يتم دمج المقاييس في واصف إطار واحد إما عن طريق الإسقاط + الدمج أو المجموع الموزون كما هو موضح في المعادلة (8):
(8)
ثم يتم تغذية التسلسل {xt}tT=1 في شبكة LSTM لنمذجة الديناميكيات الزمنية. في تدوين LSTM القياسي، تكون البوابات والحالات عند الزمن t كما هي موضحة في المعادلات من (9) إلى (13):
(9)
(10)
(11)
(12)
(13)
هنا σ تمثل التنشيط السينيغي (sigmoid activation)، و ⊙ تمثل الضرب العنصري.) وبالرغم من إمكانية استخدام بنى LSTM ثنائية الاتجاه لالتقاط السياق الزمني الماضي والمستقبلي معاً، إلا أن الإطار المقترح يستخدم LSTM قياسياً لنمذجة التبعيات الزمنية عبر إطارات الفيديو المتسلسلة. ويتوافق خيار التصميم هذا مع بنية MSCNN-LSTM المعروضة في هذه الدراسة. وبعد معالجة المقطع، تم الحصول على تمثيل للمقطع (على سبيل المثال، الحالة الخفية الأخيرة أو التجميع الزمني): z = Poolt(vt).
الشكل 4 يوضح سير عمل بنية LSTM المقترحة للتعرف على الأنشطة الرياضية. استقبلت الشبكة تسلسلاً من إطارات الفيديو أو الميزات المستخرجة بواسطة CNN وعالجتها عبر خطوات زمنية متتالية (t−2، وt−1، وt). وتكونت كل خلية LSTM من بوابة إدخال، وبوابة نسيان، وبوابة إخراج، والتي نظمت تدفق المعلومات عبر الشبكة. قامت بوابة الإدخال بدمج المعلومات الجديدة في حالة الخلية، وقامت بوابة النسيان بالتخلص من المعلومات الزمنية غير ذات الصلة، بينما أنتجت بوابة الإخراج الحالة المخفية التي يتم نقلها إلى الخطوة الزمنية التالية. وحافظت حالة الخلية على التبعيات الزمنية طويلة المدى، بينما التقطت الحالة المخفية المعلومات الزمنية قصيرة المدى. وبعد المعالجة التسلسلية، تم تجميع مخرجات LSTM لتوليد تمثيل للميزات الزمنية، والذي تم تمريره إلى طبقة متصلة بالكامل ومصنف Softmax للتنبؤ بالنشاط الرياضي المقابل. تم تدريب الشبكة باستخدام محسّن Adam لمدة 100 حقبة (epochs) بحجم دفعة قدره 32، ومعدل تعلم أولي 0.001، ودالة خسارة الإنتروبيا المتقاطعة (cross-entropy loss function). وقد تم اختيار النموذج الذي سجل أدنى خسارة تحقق للتقييم النهائي. ولضمان قابلية التكرار، أجريت جميع التجارب باستخدام بذرة عشوائية ثابتة قيمتها 42. كما تم استخدام التوقف المبكر وخفض معدل التعلم عند الثبات (learning-rate reduction on plateau) لتحسين التقارب، وطُبق قص التدرج (gradient clipping) بعتبة 5.0 أثناء تدريب LSTM لمنع تضخم التدرجات. واحتوى نموذج MSCNN-LSTM المقترح على ما يقرب من 15 مليون معامل قابل للتدريب.
تستخدم درجات الفئة النهائية والاحتمالية طبقة خطية + softmax كما هو موضح في المعادلة (14):
(14)
يتم التدريب عن طريق تقليل فقدان الإنتروبيا المتقاطعة (cross-entropy loss) عبر المقاطع المصنفة كما هو موضح في المعادلة (15):
(15)
حيث تمثل Nb حجم الدفعة، وC عدد الفئات، وy(n) هي الحقيقة الأرضية ذات الترميز الأحادي (one-hot). يتم تطبيق التنظيم (dropout على مخرجات xt/LSTM، واضمحلال الوزن) وتطبيق قص التدرج للمساعدة في استقرار تسلسلات الرياضات الطويلة.