وظفت هذه الدراسة إطار عمل للتعلم العميق يتكون من مرحلتين للتعرف على الأفعال في فيديوهات الرياضة، حيث يدمج بين شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) وشبكة الذاكرة الطويلة قصيرة المدى (LSTM). وقد استُخدمت مجموعات بيانات مرجعية متاحة للعموم، وهي UCF1 وUCF Sports وJHMDB، لتطوير النموذج وتقييمه. لم يتم جمع أي بيانات جديدة من مشاركين بشريين، ولم يتم الوصول إلى أي معلومات تحديد هوية شخصية أو معالجتها. ونظراً لأن الدراسة تضمنت تحليلاً ثانوياً لمجموعات بيانات مجهولة المصدر ومتاحة للعموم، ولم تتضمن مشاركة بشرية مباشرة، فلم تكن هناك حاجة إلى موافقة أخلاقية مؤسسية أو موافقة مستنيرة.
تألف سير العمل من أخذ عينات الإطارات والتطبيع الزمني، يليه استخراج الميزات باستخدام وحدة MSCNN. تمت معالجة الميزات المستخرجة لاحقاً باستخدام شبكة LSTM للنمذجة الزمنية ثم تمريرها إلى طبقة تصنيف متعددة الفئات. وأخيراً، تم تدريب النموذج وتقييمه باستخدام مجموعات بيانات مرجعية مختارة. يوضح الشكل 1 البنية العامة للإطار المقترح.

الشكل 1إطار عمل MSCNN-LSTM المقترح للتعرف على الأفعال في مقاطع الفيديو الرياضية. سير العمل العام الذي يوضح المعالجة المسبقة للفيديو، واستخراج الميزات المكانية متعددة المقاييس، وتعلم التسلسل الزمني، وتصنيف الأفعال. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
يوضح الشكل 1 سير العمل في إطار عمل التعرف على الأنشطة في الفيديوهات الرياضية المقترح، والذي يعتمد على بنية هجينة من MSCNN-LSTM. تبدأ العملية بمقاطع فيديو رياضية تحتوي على أنشطة رياضية متنوعة، بما في ذلك الركل، وركوب الخيل، وضرب كرة الغولف. تم تفكيك الفيديوهات الخام إلى إطارات فردية خلال مرحلة المعالجة المسبقة، حيث يتم قص الإطارات وتوحيد قياساتها وتجهيزها كمدخلات للنموذج. بعد ذلك، تم تغذية الإطارات التي تمت معالجتها مسبقاً في وحدة MSCNN لاستخراج الميزات. وتعمل البنية التلافيفية متعددة المقاييس على التقاط الميزات المكانية في مجالات استقبال مختلفة، مما يتيح استخراج المعلومات المحلية والسياقية من إطارات الفيديو الرياضي. ثم تمت معالجة متجهات الميزات المستخرجة بواسطة شبكة LSTM لنمذجة التبعيات الزمنية وتطور الحركة عبر الإطارات المتتالية. وأخيراً، استخدمت وحدة التصنيف والتدريب التمثيلات المكانية والزمانية المكتسبة للتنبؤ بفئة النشاط لكل مقطع فيديو. يتكون إطار العمل المقترح من أربع خطوات متسلسلة، تبدأ بجمع البيانات والمعالجة المسبقة باستخدام مجموعات البيانات المرجعية UCF1 (YouTube Actions) وUCF Sports وJHMDB. تم تحويل كل فيديو رياضي إلى تسلسل من الإطارات، والتي تمت إعادة تحجيمها وتطبيعها وتعزيزها من خلال التدوير والقلب والقص لتحسين القدرة على التكيف مع المتغيرات البيئية. ثم تمت معالجة الإطارات التي خضعت للمعالجة المسبقة بواسطة الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN) المقترحة، حيث قامت فروع تلافيفية متوازية بنوى بحجم 3 × 3 و5 × 5 و7 × 7 باستخراج ميزات مكانية محلية وسياقية تكميلية. تم دمج هذه الميزات متعددة المقاييس وتنقيحها باستخدام تطبيع الدفعات (batch normalization) والتجميع الأقصى (max pooling) لتوليد تمثيلات ميزات مدمجة. تلت ذلك تزويد شبكة الذاكرة القصيرة المدى المطولة (LSTM) بميزات مستوى الإطار الناتجة لنمذجة التبعيات الزمنية عبر الإطارات المتتالية. تم تسطيح مخرجات LSTM النهائية وتمريرها عبر طبقات متصلة بالكامل مع تفعيل ReLU، يتبعها مصنف Softmax للتنبؤ بفئة النشاط. تم تدريب الشبكة باستخدام محسن Adam مع دالة خسارة الإنتروبيا المتقاطعة (cross-entropy loss) وتنظيم الإسقاط (dropout regularization) لتقليل الإفراط في التجهيز. وأخيراً، تم تقييم أداء النموذج على مجموعات البيانات المرجعية UCF1 وUCF Sports وJHMDB باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1-score.
1. جمع البيانات ومعالجتها الأولية
استُخدمت في هذه الدراسة ثلاث مجموعات بيانات مرجعية متاحة للعامة للرياضات والحركات البشرية. تحتوي مجموعات البيانات هذه على لقطات رياضية من العالم الحقيقي مع تباين في حركة الكاميرا، ووجهات النظر، وتعقيد الخلفية. وبشكل محدد، استفادت الدراسة من مجموعة UCF1 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php)، والتي تتضمن 11 فئة من الحركات جُمعت من 1,168 مقطع فيديو من YouTube سُجلت لحوالي 25 شخصاً، مع عينات متعددة لكل حركة. وتضم قاعدة بيانات الحركة البشرية ذات التعليقات التوضيحية المشتركة (JHMDB)34,35 21 فئة من الحركات و928 مقطع فيديو مشروحاً. أما مجموعة بيانات UCF Sports فتتكون من 10 فئات من الحركات و150 تسلسلاً فيديو تم التقاطها من مصادر بث بدقة 720 × 480 pixels (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).
تغطي هذه المجموعات من البيانات مجتمعةً الرياضات الفردية والجماعية، وتوفر تنوعاً في المدة الزمنية والمقياس البصري لتقييم إطار عمل MSCNN-LSTM المقترح للتعرف على الأفعال. وكجزء من عملية فحص جودة البيانات، تم فحص مجموعات بيانات UCF1 وUCF Sports وJHMDB للبحث عن مقاطع فيديو تالفة، أو ملفات مكررة، أو مقاطع ذات تعليقات توضيحية غير مكتملة. ولم يتم تحديد أي عينات تستوفي معايير الاستبعاد هذه؛ وبناءً عليه، تم الاحتفاظ بجميع مقاطع الفيديو المتاحة للتحليل اللاحق. بعد ذلك، تم تقسيم مجموعات البيانات إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام استراتيجية تقسيم عشوائية متسقة. ويعرض الشكل 2 صوراً نموذجية مستخدمة في التدريب والتقييم.

الشكل 2إطارات ممثلة من مجموعات بيانات معيارية للتعرف على الأفعال الرياضية. لوحات (أ-دتُظهر الرسوم التوضيحية أمثلة من مجموعة بيانات UCF1 (إجراءات YouTube)، اللوحات (هـ–ح) من مجموعة بيانات UCF Sports، واللوحات (١-١٢من مجموعة بيانات JHMDB. وتوضح الإطارات التباينات في فئات الأفعال، وزوايا الرؤية، والخلفيات، وظروف الإضاءة، وتعقيد الحركة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
تم تقييم نموذج التعرف على الأفعال المقترح على مجموعات البيانات المرجعية UCF1 وUCF Sports وJHMDB، كما هو ملخص في الجدول 3. وتمثل مجموعات البيانات هذه أنماط حركة متنوعة وظروفاً بيئية صعبة. تحتوي مجموعة بيانات UCF1 (YouTube Actions) على أفعال رياضية من 1 فئة تم الحصول عليها في ظل ظروف إضاءة ووجهات نظر وخلفيات متنوعة. وتضم مجموعة بيانات UCF Sports ما مجموعه 150 مقطع فيديو لرياضات ميدانية من بث احترافي، وتتميز بتسلسلات حركية واقعية. أما مجموعة بيانات JHMDB فتوفر تعليقات توضيحية مفصلة لحركة الإنسان لـ 21 فئة من الأفعال دقيقة التفاصيل، وتعمل كمجموعة بيانات مرجعية للتعرف على الأفعال المكانية والزمانية. وقد استُخدمت هذه المجموعات معاً لتقييم أداء النموذج عبر سيناريوهات رياضية وأفعال بشرية. تم تدريب الشبكة باستخدام محسن Adam لمدة 10 epoch وبحجم دفعة (batch size) قدره 32، ومعدل تعلم أولي 0.001، ودالة فقدان الإنتروبيا المتقاطعة (cross-entropy loss function). وتم اختيار النموذج الذي حقق أدنى فقدان في التحقق للتقييم النهائي. استُخدمت جميع التجارب بذرة عشوائية ثابتة قدرها 42. كما طُبق التوقف المبكر وخفض معدل التعلم عند استقرار الأداء (plateau) لتحسين التقارب، واستُخدم قص التدرج (gradient clipping) بعتبة 5.0 أثناء تدريب LSTM لمنع تضخم التدرجات. احتوى نموذج MSCNN-LSTM المقترح على ما يقرب من 15 مليون معامل قابل للتدريب. وتلخص الجدول 4 تكوين الأجهزة والبرمجيات المستخدمة في التنفيذ. ونظراً لأن توزيعات الفئات كانت متوازنة بشكل كافٍ، لم يتم تطبيق أي إجراءات إضافية لوزن الفئات أو إعادة أخذ العينات. تم تنفيذ النماذج المقارنة باستخدام المعلمات الفائقة (hyperparameters) المذكورة في دراساتها الأصلية، مع مواءمة إعدادات التدريب حيثما كان ذلك ممكناً. وقد أُبلغت قيم الأداء كمتوسط ± الانحراف المعياري من خمس عمليات تشغيل مستقلة بتهيئات عشوائية مختلفة. وتم تقييم الاختلافات بين النموذج المقترح والنماذج المقارنة باستخدام اختبارات t المقترنة عند عتبة دلالة p < 0.05.
| مجموعة البيانات | عدد الفئات | عدد الفيديوهات | الدقة (بكسل) | يرجى تزويدي بالنص المصدر (Source text) المراد ترجمته، وسأقوم فوراً بتحويله إلى اللغة العربية وفقاً للمعايير الأكاديمية والعلمية الدقيقة التي حددتها. | الوصف |
| UCF1 (إجراءات يوتيوب) | 11 | 1168 | متغير (≈ 320×240) | جامعة سنترال فلوريدا | يتضمن 11 إجراءً بشرياً من الرياضات (على سبيل المثال: تصويب كرة السلة، والغطس، وأرجحة كرة الغولف، وتنطيط كرة القدم). جُمعت مقاطع الفيديو من YouTube مع تباين عالٍ في الإضاءة، وزاوية الرؤية، والخلفية. |
| رياضات جامعة سنترال فلوريدا (UCF) | 10 | 150 | 720×480 | مجموعة بيانات UCF للأفعال الرياضية | يحتوي على أنشطة رياضية مثل الغوص، وركوب الخيل، وأرجحة كرة الغولف، والجري، ورفع الأثقال، تم تسجيلها من لقطات بث تلفزيوني واقعية (BBC، ESPN). |
| قاعدة بيانات JHMDB | 21 | 928 | 320×240 | معهد ماكس بلانك للأنظمة الذكية | تضمن أنشطة يومية ورياضية مثل الإمساك، والقفز، وتمشيط الشعر، والتسديد، والجري، مع تعليقات توضيحية مشتركة للمفاصل لتحليل الحركة والوضعية. |
الجدول 3: خصائص مجموعات البيانات المرجعية المستخدمة في التدريب والتقييم. نظرة عامة على مجموعات بيانات UCF1 وUCF Sports وJHMDB، بما في ذلك عدد فئات الأفعال، وعينات الفيديو، وخصائص مجموعة البيانات، وأدوارها في تدريب النموذج والتحقق منه واختباره.
| المعلمات المستخدمة | الوصف |
| لغة البرمجة | Python 3.8.18 [4] |
| إطار عمل التعلم العميق | TensorFlow 2.15.0 [1] |
| مسرع وحدة معالجة الرسوميات | NVIDIA GeForce RTX 3090 (24 GB VRAM) [1] |
| وحدة المعالجة المركزية | Intel Core i9 @ 3.5 جيجاهرتز × 16 نواة |
| نظام التشغيل | ويندوز 1 |
| ذاكرة الوصول العشوائي (RAM) | 64 جيجابايت DDR4 |
| المُحسِّن | Adam (معدل التعلم = 0.001) |
| حجم الدفعة | 32 |
| عدد الدورات التدريبية | 100 |
| دوال التنشيط | وحدة التصحيح الخطي (طبقات الشبكة العصبية التلافيفية)، سوفت ماكس (طبقة المخرجات) |
| معدل التسرب | 0.5 |
الجدول 4: بيئة المحاكاة وتكوين المعلمات الفائقة لنموذج MSCNN-LSTM المقترح. مواصفات الأجهزة، وبيئة البرمجيات، وإعدادات المُحسِّن، ومعدل التعلم، وحجم الدفعة، وعدد العصور، وأبعاد الإدخال، والمعلمات الفائقة الأخرى المستخدمة أثناء تدريب النموذج وتقييمه.
2. المعالجة المسبقة
قبل التدريب، تم تحويل كل مقطع فيديو خام إلى تسلسل من الإطارات المرتبة زمنياً، ثم خضعت للتطبيع، وأخذ العينات زمنياً، والتعزيز. أولاً، تم تحويل كل فيديو إدخال V إلى تسلسل من الإطارات وتم تمثيله كموتّر رباعي الأبعاد V ∈ RT×H×W×C، حيث تمثل T عدد الإطارات، و H × W i تشير إلى مؤشر الإطار، وتمثل C عدد قنوات الألوان (3 لنظام RGB). تألف مسار المعالجة المسبقة من استخراج الإطارات، وتغيير الحجم المكاني يليه قص مركزي أو عشوائي إلى دقة ثابتة (H′, W′)، وتطبيع شدة كل بكسل، وتعزيز اختياري للبيانات، بما في ذلك القلب العشوائي، وتغيير المقياس، والاضطراب اللوني، وذلك قبل استخراج الميزات. وبشكل ملموس، تم تنفيذ تطبيع الشدة إما عن طريق تطبيع الدرجة المعيارية كما هو موضح في المعادلة (1).
(1)
حيث تمثل μ و σ متوسطات القنوات والانحرافات المعيارية التي تم حسابها عبر مجموعة التدريب، أو باستخدام قياس الحد الأدنى-الأقصى (min–max scaling) كما هو موضح في المعادلة (2).
(2)
بعد التطبيع، تمثيل كل إطار كـ F̃t ∈ RH′×W′×C′، وتم تمثيل تنسور الفيديو الناتج كـ V′ ∈ RT×H′×W′×C. في الواجهة الأمامية الالتفافية متعددة المقاييس، يتم الحصول على خرائط سمات مكانية متعددة للمجال الاستقبالي من خلال تطبيق عدة عمليات التفاف ثنائية الأبعاد (أو ثلاثية الأبعاد لعمليات الالتفاف الزمكانية المبكرة) بأحجام نواة مختلفة؛ ومن ثم تم إنشاء تمثيل سمات زمنية لكل إطار أو مقطع فيديو قصير وإرساله إلى وحدة LSTM. تطبق الورقة البحثية الأصلية نموذج MobileNetV2 ثم نموذج Deep BiLSTM للنمذجة الزمنية؛ كما أن مسار المعالجة المسبقة المذكور أعلاه متوافق تماماً مع استبدالها بنموذج التفاف متعدد المقاييس + LSTM.
3. أخذ العينات والتطبيع الزمني
بما أن أطوال مقاطع الفيديو T تختلف بين مجموعات البيانات وداخل المجموعة الواحدة، فإننا نقوم بأخذ عينات منتظمة أو إعادة أخذ عينات زمنية للإطارات لتزويد عملية الالتفاف متعددة المقاييس + LSTM بطول إدخال ثابت N من حيث الإطارات أو المقاطع القصيرة. ويمكن حساب مؤشرات الإطارات المنتظمة كما هو موضح في المعادلة (3)،
(3)
وبالتالي، يكون تسلسل الإطارات التي تم أخذ عينات منها هو Vs = {F̃t0, …, F̃tN−1}. وعندما تبرز الحاجة إلى دقة زمنية أعلى، نقوم بإجراء استكمال زمني خطي: لأي زمن كسري مُعاد أخذ عينات منه τ ∈ [0, T−1] يتم حسابه كما في المعادلة (4).
(4)
بحيث تحتوي التسلسلة المعاد أخذ عيناتها Vs على N من الإطارات بالضبط وتحافظ على سلاسة الحركة. وبدلاً من ذلك، فإن أخذ العينات عن طريق مقاطع قصيرة متصلة (طول النافذة الزمنية w وبخطوة s) ينتج مجموعة من موترات المقاطع حيث كل مقطع Cj ∈ RT×H′×W′×C و j = 0, …, ⌊(T − w)/s⌋. ولأغراض التطبيع الزمني داخل الشبكة، يكون التجميع الزمني البسيط على مقاييس متعددة فعالاً: فبالنظر إلى تسلسل سمات زمنية X = {x1, …, xN} ناتج عن عمليات التلافيف متعددة المقاييس، يتم تطبيق السمات المجمعة كما هو موضح في المعادلة (5).
(5)
أين Sك هل الدعم الزمني مناسب للمقياس كـ (على سبيل المثال، Sك قد تكون كتلًا غير متداخلة أو مؤشرات موسعة) و مك = |Sكـ|.
قبل استخراج السمات، تم تغيير حجم جميع مقاطع الفيديو إلى 24 × 24 بكسل وأخذ عينات منها بمعدل 25 إطاراً في الثانية. وقد اعتمدت كل تجربة طول تسلسل ثابتاً قدره 32 إطاراً. تضمنت تقنيات تعزيز البيانات القص العشوائي (المقياس = 0.8–1.0)، والتدوير العشوائي (±15°)، والقلب الأفقي العشوائي (الاحتمالية = 0.5)، وتعديل السطوع (±20%). واستُخدمت قيم المتوسط الحسابي لـ ImageNet وهي [0.485, 0.456, 0.406] والانحرافات المعيارية [0.29, 0.24, 0.25] لتوحيد قيم البكسل. وبالنسبة لكل تسلسل فيديو، استُخدم اختيار الإطارات المنتظم لأخذ العينات الزمنية. كما تم تقليم أو أخذ عينات من المقاطع الأطول بشكل منتظم للحفاظ على طول تسلسل ثابت، بينما تمت إضافة أصفار (zero-padding) لمقاطع الفيديو التي تحتوي على أقل من 32 إطاراً. وقد طُبقت هذه الإعدادات باستمرار طوال مرحلتي التدريب والتقييم.
4. استخراج الميزات باستخدام MSCNN
تَمّ استخدام شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) لتعزيز التمثيل المكاني للأفعال في مقاطع الفيديو الرياضية. قد تعاني الشبكات العصبية التلافيفية التقليدية التي تعتمد على حجم نواة واحد من قدرة محدودة في التقاط الميزات بمقاييس مكانية متعددة. ونظراً لأن بعض الأفعال الرياضية تُظهر خصائص بصرية متشابهة، فقد يكون من الصعب على البنية التلافيفية أحادية المقياس التقاط الميزات المحلية والعالمية في آن واحد. ولمعالجة هذا القصور، يستخدم الإطار المقترح نوى تلافيفية بأحجام مختلفة لإجراء استخراج ميزات متعدد المقاييس ودمج للميزات.
في بنية الشبكة المقترحة، تم استخدام نوى تلافيف بـمقاس 1 × 1 لتنظيم المعلومات عبر القنوات وتقليل أبعاد خرائط السمات المدخلة. بالإضافة إلى ذلك، تزيد هذه الطبقات من القدرة التعبيرية للشبكة من خلال إدخال تحويلات سمات إضافية وتمثيلات غير خطية. وتتيح نوى التلافيف ذات الأحجام المختلفة استخراج المعلومات المكانية بمقاييس متعددة. ويتم إجراء تسوية تسلسلية بعد دمج السمات متعدد المقاييس الموزونة لتحسين استقرار التدريب. وبغية التخفيف من مشكلات تلاشي التدرج وانفجار التدرج أثناء تدريب الشبكة العميقة، تستخدم البنية المقترحة اتصالات متبقية ونمذجة زمنية تعتمد على LSTM.
يعز التصميم متعدد المقاييس من قدرة الشبكة على التقاط السمات بدقات مكانية مختلفة ويحسن من قدرة تمثيل السمات. علاوة على ذلك، يتم تفكيك نواة الالتفاف التقليدية ذات الحجم N × N إلى عمليات التفاف بحجم N × 1 و 1 × N. وقد صُممت عمليات الالتفاف N × 1 و 1 × N المستخدمة في وحدة MSCNN لالتقاط سمات مكانية اتجاهية ومتعددة المقاييس ومتكاملة من إطارات الفيديو الفردية. وتعمل عمليات الالتفاف هذه على تعزيز تمثيل السمات المكانية من خلال استخراج الأنماط بمقاييس مختلفة من الحقول الاستقبالية. بعد ذلك، يتم نمذجة العلاقات الزمنية بين الإطارات المتتالية بواسطة وحدة LSTM، التي تعالج تسلسل السمات المستخرجة بواسطة MSCNN لتعلم التبعيات الزمنية طويلة المدى من أجل التعرف على الأفعال.
يتم تحليل كل فيديو رياضي V = {F1, F2, …, FT} إلى T من الإطارات. ولترميز التغيرات المكانية، على سبيل المثال، وضعية اللاعب، وضبابية الحركة، ومسار الكرة، تعمل فروع تلافيفية بثلاثة مقاييس مختلفة s ∈ {1, 2, 3}، بما يتوافق مع أحجام نوى تبلغ 3 × 3 و 5 × 5 و 7 × 7. ويستخلص كل فرع خرائط الميزات كما في المعادلة (6):
(6)
حيث يمثل Ws و bs أوزان وانحيازات التلافيف عند المقياس s، وتمثل σ دالة التنشيط ReLU. وتقوم طبقة الدمج متعددة المقاييس بتجميع الميزات كما هو موضح في المعادلة (7):
(7)
يضمن موتر السمات المدمج هذا تلميحات الحركة دقيقة التفاصيل والمعلومات السياقية للمساحات الواسعة، مثل الأنشطة الجماعية. يوضح الشكل 3 وحدة استخراج السمات الخاصة بـ MSCNN فقط. أما طبقة LSTM (بـ 256 وحدة مخفية)، والطبقة الكثيفة (بـ 128 عصبوناً)، وطبقة الإسقاط (0.5) المستخدمة في النمذجة الزمنية والتصنيف، فهي معروضة بشكل منفصل في الشكل 4.

الشكل 3وحدة استخراج الميزات المقترحة للشبكة العصبية التلافيفية متعددة المقاييس (MSCNN). تستخلص ثلاثة فروع تلافيفية متوازية بأحجام نواة تبلغ 3 × 3 و 5 × 5 و 7 × 7 سمات مكانية متكاملة متعددة المقاييس، والتي يتم دمجها قبل النمذجة الزمنية بواسطة شبكة LSTM. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 4بنية LSTM المقترحة للتعرف على الأفعال في مقاطع الفيديو الرياضية. تقوم وحدة LSTM بنمذجة الاعتمادات الزمنية من خلال عمليات بوابات الإدخال، والنسيان، والإخراج عبر إطارات الفيديو المتتالية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.
الشكل 3 يوضح وحدة استخراج الميزات المقترحة باستخدام الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN) للتعرف على الحركات في مقاطع الفيديو الرياضية. تمت معالجة إطارات الفيديو المدخلة بالتوازي من خلال ثلاثة فروع تلافيفية بأحجام نواة 3 × 3 و 5 × 5 و 7 × 7، حيث يحتوي كل منها على 64 مرشحاً لالتقاط ميزات مكانية مكملة دقيقة وخشنة الحبيبات. تم تحسين المخرجات باستخدام التسوية الدفعية (Batch Normalization)، وتنشيط ReLU، والتجميع الأقصى (max pooling) بحجم 2 × 2، ثم تم دمجها ودمجها بواسطة تلافيف 1 × 1 مع 128 مرشحاً. حافظ اتصال القفزة المتبقي (residual skip connection) على المعلومات المكانية منخفضة المستوى وحسن تدفق التدرج. تم تسطيح خرائط الميزات المدمجة وتمريرها إلى طبقة LSTM تحتوي على 256 وحدة خفية للنمذجة الزمنية، تلتها طبقة متصلة بالكامل تحتوي على 128 عصبوناً، وتنشيط ReLU، ومعدل إسقاط (dropout rate) قدره 0.5 قبل التصنيف النهائي باستخدام طبقة Softmax. تم دمج خرائط الميزات متعددة المقاييس (f1l، و f2l، و f3l) لتكوين التمثيل المدمج (Fl)، والذي تم تحسينه لاحقاً بواسطة تلافيف 3 × 3 لتوليد خريطة الميزات المخرجة للطبقة التالية. مكنت هذه البنية الهرمية من تعلم ميزات مكانية مكملة في مجالات استقبال متعددة، مما أدى إلى تحسين أداء التعرف على الحركات الرياضية.
5. النمذجة الزمنية باستخدام LSTM
من أجل نمذجة التطور الزمني عبر حواف الفيديو، تم تزويد نظام LSTM بتسلسل الميزات المجمعة لالتقاط التبعيات الديناميكية واستمرارية الحركة. بالنسبة لكل فيديو مدخل، قمنا أولاً باستخراج ميزات CNN متعددة المقاييس لكل إطار. لتكن إطارات الفيديو I1، ...، IT. لكل إطار t وكل مقياس s، ينتج المشفر الالتفافي متعدد المقاييس متجه ميزات ft(s) ∈ Rd. ثم يتم دمج المقاييس في واصف إطار واحد إما عن طريق الإسقاط + الدمج (projection + concat) أو المجموع المرجح كما في المعادلة (8):
(8)
بعد ذلك، يتم إدخال التسلسل {xt}tT=1 في نموذج LSTM لنمذجة الديناميكيات الزمنية. وفي تدوين LSTM القياسي، تكون البوابات والحالات عند الزمن t كما هي موضح في المعادلات من (9) إلى (13):
(9)
(10)
(11)
(12)
(13)
هنا تمثل σ تنشيط السجمويد (sigmoid activation)، وتمثل ⊙ الضرب العنصري (element-wise multiplication). وبالرغم من إمكانية استخدام بنيات LSTM ثنائية الاتجاه لالتقاط السياق الزمني الماضي والمستقبلي معاً، إلا أن الإطار المقترح يستخدم LSTM قياسياً لنمذجة التبعيات الزمنية عبر إطارات الفيديو المتسلسلة. ويتوافق خيار التصميم هذا مع بنية MSCNN-LSTM المعروضة في هذه الدراسة. وبعد معالجة المقطع، تم الحصول على تمثيل للمقطع (على سبيل المثال، الحالة الخفية الأخيرة أو التجميع الزمني): z = Poolt(vt).
الشكل 4 يوضح سير العمل لبنية LSTM المقترحة للتعرف على الأنشطة الرياضية. استقبلت الشبكة تسلسلاً من إطارات الفيديو أو الميزات المستخرجة بواسطة CNN وقامت بمعالجتها عبر خطوات زمنية متتالية (t−2 و t−1 و t). وتكونت كل خلية LSTM من بوابة إدخال، وبوابة نسيان، وبوابة إخراج، والتي عملت على تنظيم تدفق المعلومات عبر الشبكة. حيث قامت بوابة الإدخال بدمج المعلومات الجديدة في حالة الخلية، وتخلصت بوابة النسيان من المعلومات الزمنية غير ذات الصلة، بينما قامت بوابة الإخراج بتوليد الحالة المخفية التي يتم تمريرها إلى الخطوة الزمنية اللاحقة. حافظت حالة الخلية على الاعتمادات الزمنية طويلة المدى، بينما التقطت الحالة المخفية المعلومات الزمنية قصيرة المدى. وبعد المعالجة التسلسلية، تم تجميع مخرجات LSTM لتوليد تمثيل للميزات الزمنية، والذي تم تمريره إلى طبقة متصلة بالكامل ومصنف Softmax للتنبؤ بالنشاط الرياضي المقابل. تم تدريب الشبكة باستخدام محسن Adam لمدة 10 دورة (epochs) وبحجم دفعة (batch size) قدره 32، ومعدل تعلم أولي 0.001، ودالة خسارة الإنتروبيا المتقاطعة (cross-entropy loss function). تم اختيار النموذج الذي سجل أدنى خسارة في التحقق للتقييم النهائي. ولضمان إمكانية التكرار، أجريت جميع التجارب باستخدام بذرة عشوائية ثابتة بقيمة 42. كما تم استخدام التوقف المبكر وخفض معدل التعلم عند الثبات (learning-rate reduction on plateau) لتحسين التقارب، وطُبق قص التدرج (gradient clipping) بحد أقصى 5.0 أثناء تدريب LSTM لمنع تضخم التدرجات (exploding gradients). احتوى نموذج MSCNN-LSTM المقترح على ما يقرب من 15 مليون معلمة قابلة للتدريب.
تستخدم درجات الفئة النهائية والاحتمالية طبقة خطية + softmax كما هو موضح في المعادلة (14):
(14)
يتم التدريب عن طريق تقليل فقدان الإنتروبيا المتقاطعة (cross-entropy loss) عبر المقاطع المصنفة كما في المعادلة (15):
(15)
حيث تمثل Nb حجم الدفعة، و C عدد الفئات، و y(n) الحقيقة الأرضية بنظام الترميز أحادي الساخن (one-hot). يتم تطبيق التسوية (إسقاط عشوائي على xt/مخرجات LSTM، واضمحلال الوزن)، كما يتم تطبيق قص التدرج للمساعدة في استقرار التسلسلات الرياضية الطويلة.