مقالة بحثية

التعرف على الأفعال في فيديوهات الرياضة باستخدام الشبكات التلافيفية متعددة المقاييس مع النمذجة الزمنية القائمة على الذاكرة الطويلة قصيرة المدى (LSTM)

0 مشاهدة

DOI:

10.3791/72030

سبتمبر 15, 2026

في هذه المقالة

ملخص

يدمج إطار عمل MSCNN-LSTM المقترح استخراج الميزات المكانية متعددة المقاييس مع نمذجة التسلسل الزمني للتعرف على الأفعال في مقاطع الفيديو الرياضية، مما يتيح التقاط ميزات مكانية دقيقة وأنماط حركة زمنية مع تحقيق أداء تصنيف تنافسي في مجموعات بيانات الأفعال الرياضية المرجعية.

الملخص

لا يزال التعرف على الأفعال في مقاطع الفيديو الرياضية يمثل تحدياً بسبب ديناميكيات الحركة المعقدة، والتداخل، والتباين العالي داخل الفئة الواحدة. ورغم أن نهج التعلم العميق الحالية، بما في ذلك نماذج CNN-BiLSTM والنماذج القائمة على التعلم بنقل المعرفة، قد أثبتت فعاليتها في التعرف على النشاط البشري، إلا أن أداءها قد يكون محدوداً في السيناريوهات الرياضية التي تتسم بحركات سريعة ومتنوعة. تعتمد العديد من الطرق الحالية على مرشحات تلافيفية أحادية المقياس، والتي قد لا تلتقط خصائص الحركة الدقيقة والخشنة بشكل فعال في آن واحد. ولمعالجة هذا القصور، تقترح هذه الدراسة شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) مدمجة مع شبكة الذاكرة الطويلة قصيرة المدى (LSTM) للتعرف على الأفعال في مقاطع الفيديو الرياضية. تقوم MSCNN باستخراج تمثيلات مكانية عبر مجالات استقبال متعددة من خلال نوى تلافيفية متوازية، مما يسمح بتعلم سمات الحركة التفصيلية والسياقية معاً. تتم بعد ذلك معالجة هذه السمات بواسطة LSTM لالتقاط الاعتمادات الزمنية واستمرارية الحركة عبر الإطارات المتتالية. أُجري التقييم التجريبي على مجموعات البيانات المرجعية UCF11 وUCF Sports وJHMDB. وحقق نموذج MSCNN-LSTM المقترح دقة تصنيف بلغت 98.3% و95.4% و81.7% على التوالي، متفوقاً على النهج المقارنة التي تم تقييمها في هذه الدراسة. كما أظهرت دراسة استئصال مساهمة استخراج السمات متعددة المقاييس والنمذجة الزمنية في تحسين الأداء العام. وتثبت هذه النتائج قدرة الإطار المقترح على الجمع بين المعلومات المكانية والزمانية للتعرف على الأفعال في مقاطع الفيديو الرياضية.

المقدمة

تتمتع عملية التعرف على النشاط البشري بتطبيقات واسعة في مختلف المجالات الواقعية، بما في ذلك المراقبة الذكية، وكشف الشذوذ، والاسترجاع السمعي البصري القائم على الأفعال، ومراقبة المرضى في مجال الرعاية الصحية.1,2ينطوي التعرف على الأنشطة، لا سيما في تدفقات الفيديو الواردة من أنظمة المراقبة ومنصات التواصل الاجتماعي، على إمكانات كبيرة للكشف عن الشذوذ وفهم الأحداث.3يتم تحديد الأفعال البشرية في تحليل الفيديو من خلال ملاحظة أجزاء مختلفة من الجسم، مثل اليدين والساقين. وبخلاف الصور الثابتة، غالبًا ما يكون الإطار الواحد غير كافٍ لتمثيل الفعل.4على سبيل المثال، قد تبدو الوضعية الأولية لنشاطي لعب كرة القدم وقفز الحبل متشابهة في إطار واحد، إلا أن الاختلافات بين هذين الفعلين تصبح جلية عند ملاحظتهما عبر تسلسل من الإطارات التي ترصد أنماط الحركة وتفاعلات جسم الإنسان مع محيطه.5,6,7تتلخص الاختصارات المستخدمة في جميع أنحاء هذه المخطوطة في الجدول 1 لتحسين القراءة وضمان الاتساق في المصطلحات.

اختصارالصيغة الكاملة
الذكاء الاصطناعيالذكاء الاصطناعي
المساحة تحت المنحنىالمساحة تحت المنحنى
الذاكرة طويلة قصيرة المدى ثنائية الاتجاه (BiLSTM)الذاكرة قصيرة المدى طويلة المدى ثنائية الاتجاه
الشبكات العصبية التلافيفيةالشبكة العصبونية الالتفافية
CUDAبنية الجهاز الموحدة الحسابية
مقياس F1 (F1-score)المتوسط التوافقي للدقة والاسترجاع
وحدة معالجة الرسومياتوحدة معالجة الرسوميات
مستقبلات الأنجيوتنسين من النوع الثاني (HAR)التعرف على النشاط البشري
قاعدة بيانات JHMDBقاعدة بيانات حركة الإنسان المشتركة
الذاكرة طويلة قصيرة المدى (LSTM)الذاكرة قصيرة المدى المطولة
mAP-Tمتوسط الدقة المتوسطة الزمنية
كربوكسي ميثيل السليلوزمعامل ارتباط ماثيوز
الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN)شبكة عصبية تلافيفية متعددة المقاييس
منحنى خصائص تشغيل المستقبل (ROC)خصائص تشغيل المستقبل
اختبار السكر الثلاثي (TSI)مؤشر الاستقرار الزمني
جامعة سنترال فلوريدا (UCF)جامعة سنترال فلوريدا
ذاكرة الوصول العشوائي للفيديوذاكرة الوصول العشوائي للفيديو

الجدول 1: قائمة بالاختصارات المستخدمة في المخطوطة.الاختصارات والمصطلحات الشائعة المستخدمة في جميع أنحاء الدراسة وأشكالها الكاملة المقابلة.

يعد التصنيف السريع والدقيق لمقاطع الفيديو الرياضية أمرًا بالغ الأهمية لمجموعة واسعة من التطبيقات8,9,10، بما في ذلك تحليلات الرياضة، والكشف عن الأحداث، والاسترجاع القائم على المحتوى، وأنظمة التوصية11,12,13. ومع النمو السريع لمحتوى الفيديو المتعلق بالرياضة، أصبحت قيود أطر التحليل السابقة واضحة بشكل متزايد14. وبناءً على ذلك، هناك طلب متزايد على مناهج قوية قادرة على معالجة التعقيد والطبيعة الديناميكية للأنشطة الرياضية. وقد اعتمدت الطرق التقليدية لتصنيف مقاطع الفيديو الرياضية بشكل كبير على الواصفات المصممة يدويًا، مثل التدفق البصري ومدرج التكرار للتدرجات الموجهة (HOG)، لتوصيف أنماط الحركة والأنشطة في مقاطع الفيديو الرياضية15.

لقد طُبقت الشبكات التلافيفية (ConvNets)، التي حققت نجاحاً ملحوظاً في تصنيف الصور الثابتة، في تحليل الفيديو أيضاً. ومع ذلك، لا يزال التعرف على الأفعال يمثل تحدياً أكبر لأن مقاطع الفيديو تحتوي على معلومات زمانية ومكانية ديناميكية. ويمكن تصنيف النهج الحالية القائمة على التعلم العميق عموماً إلى ثلاث مجموعات: شبكات التدفق المزدوج16، والشبكات التلافيفية ثلاثية الأبعاد (3D convolutional networks)، والبنى ذات الكفاءة الحسابية. ولتعلم المعلومات الزمانية من التدفق البصري، تستخدم شبكات التدفق المزدوج شبكة ConvNet إضافية17,18، على الرغم من أن هذا النهج مكلف حسابياً. وبينما تستطيع البنى التلافيفية ثلاثية الأبعاد مثل C3D وI3D وR3D نمذجة المعلومات الزمانية بشكل مباشر، فإنها تزيد بشكل كبير من عدد المعلمات، مما يجعل عملية التحسين أكثر صعوبة. وتحاول الطرق ذات الكفاءة الحسابية تقليل تعقيد النموذج من خلال استكشاف العمليات ثلاثية الأبعاد المفككة.

علاوة على ذلك، نظرًا لقدرة الشبكات العصبية التلافيفية (CNNs) على استخلاص الميزات المكانية المحلية وقدرة شبكات الذاكرة الطويلة قصيرة المدى (LSTMs) على التقاط معلومات السياق الزمني، يمكن للنماذج الهجينة تعلم أنماط الحركة المكانية والزمانية بفعالية من مدخلات المستشعرات. وقد أسفرت الدراسات الحديثة التي تدمج بين بنيات CNN والشبكات العصبية المتكررة عن نتائج مشجعة18,19,20. ومع ذلك، وبسبب قيام شبكات LSTMs بضغط المعلومات أثناء معالجة التسلسل، فقد تؤثر الضوضاء الناتجة أثناء استخلاص الميزات على أداء التعرف. ولمعالجة هذه المشكلة، دمجت عدة دراسات آليات الانتباه (attention mechanisms)21,22. تمكن آليات الانتباه النموذج من التركيز على الميزات الأكثر صلة بمهمة التعرف، مما يؤدي بالتالي إلى تحسين أداء التصنيف.

على الرغم من أن نماذج LSTM ثنائية الاتجاه والعميقة والمدمجة مع استخراج الميزات القائم على CNN قد حققت نتائج واعدة في التعرف على الأنشطة البشرية، إلا أن العديد من التحديات لا تزال قائمة عند توسيع هذه الأطر لتشمل التعرف على الحركات في مقاطع الفيديو الرياضية. أولاً، غالباً ما تعتمد بنيات CNN-LSTM الحالية على استخراج ميزات تلافيفية أحادية المقياس، مما قد يحد من قدرتها على التقاط الحركات التي تحدث بدقات مكانية وزمانية متعددة، مثل الحركة المتزامنة للاعب والأجسام في المشاهد الرياضية. وقد أثبتت الشبكات التلافيفية متعددة المقاييس، بما في ذلك 3D CNNs23 و CNNs ثنائية المسار، أهمية التقاط الإشارات المكانية والحركية بمقاييس مختلفة، رغم أن هذا المفهوم لا يزال أقل استكشافاً في الأنظمة الهجينة القائمة على LSTM. ثانياً، تركز معظم نماذج CNN-BiLSTM السابقة24 بشكل أساسي على الاعتمادات الزمانية قصيرة المدى، بينما قد لا يتم تمثيل استمرارية الحركة طويلة المدى والتفاعلات بين الأجسام الشائعة في الرياضات الجماعية بشكل كافٍ. تعتمد العديد من النهج القائمة على تعلم النقل، مثل MobileNetV2 و ResNet، على ميزات الإطارات الساكنة ولا تستغل بشكل كامل آليات الانتباه الزماني أو دمج الميزات التكيفي متعدد المقاييس25. علاوة على ذلك، تم تقييم معظم النماذج الحالية بشكل أساسي على مجموعات بيانات مرجعية مثل UCF11 و JHMDB، بينما تظل مجموعات البيانات الأحدث المتخصصة في الرياضات والتي تلتقط أنماط حركة الكاميرا والنشاط المعقدة، مثل SoccerNet و FineGym، غير مستكشفة بما يكفي. تسلط هذه القيود الضوء على الحاجة إلى إطار عمل لاستخراج الميزات التلافيفية متعددة المقاييس مدمج مع وحدات الذاكرة الزمانية، مثل شبكات LSTM أو BiLSTM، لالتقاط التمثيلات المكانية دقيقة التفاصيل والاعتمادات الزمانية طويلة المدى بشكل أفضل في التعرف على الحركات في مقاطع الفيديو الرياضية.

بالإضافة إلى ذلك، يمكن للشبكات العصبية التلافيفية (CNNs) استخراج الميزات المكانية المحلية، بينما يمكن لنماذج الذاكرة طويلة قصيرة المدى (LSTMs) نمذجة السياق الزمني. وبناءً على ذلك، أظهرت البنى الهجينة من نوع CNN-RNN أداءً واعدًا في التعرف على النشاط البشري26,27. وقد قامت دراسات حديثة بتوسيع أطر عمل CNN-LSTM التقليدية من خلال دمج استراتيجيات تعلم تكميلية لتحسين التعرف على النشاط البشري. على سبيل المثال، تم إدخال آليات الانتباه للتأكيد على الميزات ذات الصلة بالمهمة وتثبيط التمثيلات الأقل إفادة، مما أدى إلى تحسين أداء التعرف28. كما اعتمدت مقاربات أخرى التعلم متعدد المهام لتحسين مهام التعرف على الأفعال والتقسيم الزمني بشكل مشترك، مما عزز كفاءة التعلم وتمثيل الميزات29. ورغم هذه التطورات، قد تظل الطرق الحالية ذات قدرة محدودة على التمييز بين الأفعال المتشابهة بصريًا لأن الميزات المكانية والزمنية الدقيقة لا يتم التقاطها دائمًا بشكل فعال. يلخص الجدول 2 نقاط القوة والقيود في المقاربات الحالية30.

المرجع / السنةالطريقة المستخدمةمجموعة (مجموعات) البياناتمقاييس الأداءنقاط القوة الرئيسيةالقيود
Hassan et al. (2024)1KFDI (Key Frame Dynamic Image)UCF11الدقة: 85.3%اختيار فعال للإطارات الرئيسية وتحسين تمثيل الصور الديناميكية.حساسية تجاه أخطاء اختيار الإطارات؛ نمذجة زمنية محدودة.
Zhou et al. (2023)24Dilated CNN + BiLSTM + Residual BlockUCF11, UCF Sportsالدقة: UCF11: 89 و UCF Sports: 92.2% يدمج التعلم المكاني والزمني؛ يلتقط معلومات متعددة المقاييس.كثيف حاسوبياً؛ خطر حدوث فرط التخصيص (overfitting) في مجموعات البيانات الصغيرة.
Ullah et al. (2025)34Local–Global Feature + QSVMUCF11الدقة: 82.6%يجمع بين الميزات المصممة يدوياً والميزات العميقة لتحقيق التعرف القوي.يتطلب ضبطاً يدوياً؛ قابلية توسع محدودة.
Shin et al. (2025)25ViT-ReT (Vision Transformer + Recurrent Transformer)UCF11, UCF50, UCF101, and JHMDBالدقة: UCF11: 97.73%؛ UCF50: 98.81%؛ UCF101: 98.46%؛ JHMDB: 83.38%يلتقط الاعتمادات المكانية والزمنية طويلة المدى.تكلفة حاسوبية عالية ومتطلبات بيانات كبيرة.
Su et al. (2024)233D-CNNUCF11الدقة: 85.1%تعلم الميزات المكانية والزمنية من الطرف إلى الطرف.متطلبات عالية للذاكرة ووحدات معالجة الرسوميات (GPU).
Karuppannan et al. (2024)35Deep Autoencoder + CNNUCF11الدقة: 96.2%يتعلم تمثيلات ميزات مدمجة.نمذجة زمنية محدودة على المدى الطويل.
Sahoo et al. (2020)36HAR-DepthKTH, UCF sports, JHMDB, UCF101, and HMDB51الدقة: KTH: 97.67%؛ UCF Sports: 95.00%؛ JHMDB: 73.13%؛ UCF101: 92.97%؛ HMDB51: 69.74%تعلم زمني فعال قائم على العمق.يتطلب تقديراً دقيقاً للعمق ومعالجة مسبقة مكثفة.

الجدول 2: مقارنة بين طرق التعلم العميق الحالية للتعرف على الأفعال في مقاطع الفيديو الرياضية. ملخص لنهج التعلم العميق التمثيلية، بما في ذلك مجموعات البيانات، والخصائص المنهجية، والمزايا، والقيود، مع تسليط الضوء على الفجوات البحثية التي يعالجها إطار عمل MSCNN-LSTM المقترح.

تم اقتراح إطار عمل للتحريك الوجهي المدفوع بمزامنة الصوت، حيث يجمع بين نموذج إزالة الضجيج الوجهي (FDM) ونموذج انتشار كامن من المحلي إلى العالمي (LG-LDM) لتوليد تحريكات وجهية معبرة عاطفياً. وقد استُخدم مشفر تلقائي تبايني مكمم المتجهات متمحور حول العاطفة (EVQ-VAE) لإعادة بناء هندسة وجهية ثلاثية الأبعاد مفصلة وتغيرات دقيقة في التعبيرات31. كما تم تطوير إطار عمل للقبض الروبوتي المدرك للاحتجاب باستخدام الرؤية الستيريوية الثنائية لإجراء تجزئة الهدف، وتحديد الموقع، واستنتاج الاحتجاب، وتقدير وضعية القبض على أهداف متعددة في ظروف الاحتجاب32. بالإضافة إلى ذلك، تم تقديم إطار عمل من مرحلتين لاستخراج الأرض من السحب النقطية باستخدام الإسقاط الشبكي وتقسيم الصناديق التكيفي، حيث استُخدمت احتمالات الارتفاع والانحناء لتحسين حدود الأرض والعوائق بعد عملية الاستخراج الأولية من خلال تحليل الميزات القائم على الشبكة33.

على الرغم من التقدم الملحوظ في التعرف على الأفعال القائم على التعلم العميق، لا تزال الطرق الحالية تعاني في التعامل مع التباين العالي والتعقيد في مقاطع الفيديو الرياضية، بما في ذلك الحركة السريعة، وتحرك الكاميرا، والتفاعلات بين عدة لاعبين. وتعمل العديد من النماذج التقليدية القائمة على الشبكات العصبية التلافيفية (CNN) أو الذاكرة الطويلة قصيرة المدى (LSTM) بنطاق مكاني واحد، وبالتالي قد تواجه صعوبة في التقاط أنماط الحركة المحلية والعالمية بشكل فعال. علاوة على ذلك، لا يزال الحفاظ على التماسك الزمني في التسلسلات طويلة المدة أو الأفعال المتداخلة يمثل تحديًا. ورغم أن طرق التعلم الانتقالي قد حسنت من استخراج الميزات، إلا أن تكيفها مع مجموعات البيانات الخاصة بالرياضة لا يزال غير مستكشف بشكل كافٍ نسبياً.

تهدف هذه الدراسة إلى تطوير وتقييم إطار عمل يعتمد على الشبكة العصبية التلافيفية متعددة المقاييس والذاكرة الطويلة قصيرة المدى (MSCNN-LSTM) للتعرف على الحركات في مقاطع الفيديو الرياضية، وذلك من خلال دمج استخراج الميزات المكانية متعددة المقاييس مع النمذجة الزمنية القائمة على LSTM لالتقاط كل من الميزات المكانية دقيقة التفاصيل والتبعيات الزمنية طويلة المدى. يستخدم إطار العمل المقترح نوى تلافيفية تكميلية ودمجاً للميزات متعددة المستويات لتحسين تمثيل الحركات الرياضية المعقدة في ظل الظروف الصعبة. وقد تم تقييم أدائه على مجموعات البيانات المرجعية UCF11 وUCF Sports وJHMDB باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1-score، ومتوسط الدقة المتوسطة بمرور الوقت (mAP-T)، ومؤشر الاستقرار الزمني (TSI)، ومعامل كوهين كابا (κ)، ومعامل ارتباط ماتيوس (MCC)، والمساحة تحت منحنى خصائص التشغيل المستقبلي (AUC). وأظهرت النتائج التجريبية أداءً تنافسياً مقارنة بالطرق التي تم تقييمها في هذه الدراسة، مما يسلط الضوء على إمكانات إطار العمل في التحليلات الرياضية، ومراقبة أداء الرياضيين، والكشف التلقائي عن الأحداث، وفهم مقاطع الفيديو الرياضية.

البروتوكول

وظفت هذه الدراسة إطار عمل للتعلم العميق يتكون من مرحلتين للتعرف على الأفعال في مقاطع الفيديو الرياضية، حيث يدمج بين شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) وشبكة الذاكرة الطويلة قصيرة المدى (LSTM). وقد استُخدمت مجموعات بيانات مرجعية متاحة للعموم، وهي UCF11 وUCF Sports وJHMDB، لتطوير النموذج وتقييمه. لم يتم جمع أي بيانات جديدة من مشاركين بشريين، ولم يتم الوصول إلى أي معلومات تحديد هوية شخصية أو معالجتها. وبما أن الدراسة تضمنت تحليلاً ثانوياً لمجموعات بيانات مجهولة المصدر ومتاحة للعموم، ولم تتضمن مشاركة بشرية مباشرة، فلم تكن هناك حاجة إلى موافقة أخلاقية مؤسسية أو موافقة مستنيرة.

تكون سير العمل من أخذ عينات الإطارات والتطبيع الزمني، يليه استخراج الميزات باستخدام وحدة MSCNN. تمت معالجة الميزات المستخرجة لاحقاً باستخدام شبكة LSTM للنمذجة الزمنية، ثم مررت إلى طبقة تصنيف متعددة الفئات. وأخيراً، تم تدريب النموذج وتقييمه باستخدام مجموعات البيانات المرجعية المختارة. يوضح الشكل 1 البنية العامة للإطار المقترح.

figure-protocol-1
الشكل 1: إطار عمل MSCNN-LSTM المقترح للتعرف على الأفعال في مقاطع الفيديو الرياضية. يوضح سير العمل العام عمليات المعالجة المسبقة للفيديو، واستخراج الميزات المكانية متعددة المقاييس، وتعلم التسلسل الزمني، وتصنيف الأفعال. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 1 يوضح سير العمل لإطار التعرف على الأنشطة في مقاطع الفيديو الرياضية المقترح بناءً على بنية هجينة من MSCNN-LSTM. تبدأ العملية بمقاطع فيديو رياضية تحتوي على أنشطة رياضية متنوعة، بما في ذلك الركل، وركوب الخيل، وأرجحة كرة الغولف. تم تفكيك مقاطع الفيديو الخام إلى إطارات فردية خلال مرحلة المعالجة المسبقة، حيث تم قص الإطارات وتوحيد مقاييسها وتجهيزها كمدخلات للنموذج. ثم تم إدخال الإطارات التي تمت معالجتها مسبقاً إلى وحدة MSCNN لاستخراج الميزات. وتعمل البنية التلافيفية متعددة المقاييس على التقاط الميزات المكانية في مجالات استقبال مختلفة، مما يتيح استخراج المعلومات المحلية والسياقية من إطارات الفيديو الرياضي. بعد ذلك، تمت معالجة متجهات الميزات المستخرجة بواسطة شبكة LSTM لنمذجة التبعيات الزمنية وتطور الحركة عبر الإطارات المتتالية. وأخيراً، استخدمت وحدة التصنيف والتدريب التمثيلات المكانية والزمانية المكتسبة للتنبؤ بفئة النشاط لكل مقطع فيديو. يتكون الإطار المقترح من أربع خطوات متسلسلة، تبدأ بجمع البيانات والمعالجة المسبقة باستخدام مجموعات البيانات المرجعية UCF11 (YouTube Actions) وUCF Sports وJHMDB. تم تحويل كل فيديو رياضي إلى تسلسل من الإطارات، والتي تم تغيير حجمها وتطبيعها وتعزيزها من خلال التدوير والقلب والقص لتحسين القوة في مواجهة المتغيرات البيئية. ثم تمت معالجة الإططارات المعالجة مسبقاً بواسطة الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN) المقترحة، حيث استخرجت الفروع التلافيفية المتوازية بنوى 3 × 3 و5 × 5 و7 × 7 ميزات مكانية محلية وسياقية مكملة. تم دمج هذه الميزات متعددة المقاييس وتنقيحها باستخدام تطبيع الدفعة (batch normalization) والتجميع الأقصى (max pooling) لتوليد تمثيلات ميزات مدمجة. بعد ذلك، تم تزويد الميزات الناتجة على مستوى الإطار بشبكة الذاكرة القصيرة المدى الطويلة (LSTM) لنمذجة التبعيات الزمنية عبر الإطارات المتتالية. تم تسطيح مخرجات LSTM النهائية وتمريرها عبر طبقات متصلة بالكامل مع تفعيل ReLU، يليه مصنف Softmax للتنبؤ بفئة النشاط. تم تدريب الشبكة باستخدام مُحسن Adam مع دالة فقدان الإنتروبيا المتقاطعة (cross-entropy loss) وتنظيم الإسقاط (dropout regularization) لتقليل الإفراط في التخصيص. وأخيراً، تم تقييم أداء النموذج على مجموعات البيانات المرجعية UCF11 وUCF Sports وJHMDB باستخدام الدقة (accuracy)، والضبط (precision)، والاستدعاء (recall)، ومقياس F1-score.

1. جمع البيانات والمعالجة المسبقة

تم استخدام ثلاث مجموعات بيانات مرجعية متاحة للعموم للرياضات والحركة البشرية في هذه الدراسة. تحتوي مجموعات البيانات هذه على لقطات رياضية من العالم الحقيقي مع تباين في حركة الكاميرا ووجهات النظر وتعقيد الخلفية. وبشكل محدد، استخدمت الدراسة مجموعة UCF11 (YouTube Actions) (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php)، والتي تحتوي على 11 فئة من الحركات جُمعت من 1,168 مقطع فيديو من YouTube سُجلت لحوالي 25 شخصاً، مع عينات متعددة لكل حركة. وتحتوي قاعدة بيانات الحركة البشرية المشروحة مشتركاً (JHMDB)34,35  على 21 فئة من الحركات و928 مقطع فيديو مشروحاً. وتتكون مجموعة بيانات UCF Sports من 10 فئات من الحركات و150 تسلسلاً فيديو تم التقاطها من مصادر البث بدقة 720 × 480 pixels (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php).

تغطي هذه المجموعات من البيانات مجتمعةً الرياضات الفردية والجماعية، وتوفر تنوعاً في المدة الزمنية والمقياس البصري لتقييم إطار عمل MSCNN-LSTM المقترح للتعرف على الأفعال. وكجزء من عملية فحص جودة البيانات، تم فحص مجموعات بيانات UCF11 وUCF Sports وJHMDB بحثاً عن مقاطع فيديو تالفة، أو ملفات مكررة، أو مقاطع ذات تعليقات توضيحية غير مكتملة. ولم يتم تحديد أي عينات تستوفي معايير الاستبعاد هذه؛ وبناءً على ذلك، تم الاحتفاظ بجميع مقاطع الفيديو المتاحة للتحليل اللاحق. ثم قُسمت مجموعات البيانات إلى مجموعات فرعية للتدريب (70%)، والتحقق (15%)، والاختبار (15%) باستخدام استراتيجية تقسيم عشوائي متسقة. يعرض الشكل 2 صوراً نموذجية استُخدمت في التدريب والتقييم.

figure-protocol-2
الشكل 2: إطارات تمثيلية من مجموعات بيانات معيارية للتعرف على الأنشطة الرياضية. توضح اللوحات (A–D) أمثلة من مجموعة بيانات UCF11 (YouTube Actions)، واللوحات (E–H) من مجموعة بيانات UCF Sports، واللوحات (I–L) من مجموعة بيانات JHMDB. وتوضح هذه الإطارات التباينات في فئات الأنشطة، وزوايا الرؤية، والخلفيات، وظروف الإضاءة، وتعقيد الحركة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تم تقييم نموذج التعرف على الأفعال المقترح على مجموعات البيانات المرجعية UCF11 وUCF Sports وJHMDB، كما هو ملخص في الجدول 3. تمثل مجموعات البيانات هذه أنماط حركة متنوعة وظروفاً بيئية صعبة. تحتوي مجموعة بيانات UCF11 (YouTube Actions) على أفعال رياضية من 11 فئة تم الحصول عليها في ظل ظروف إضاءة ووجهات نظر وخلفيات متنوعة. وتضم مجموعة بيانات UCF Sports ما مجموعه 150 مقطع فيديو للرياضات الميدانية من بث احترافي، وتتميز بتسلسلات حركة واقعية. بينما توفر مجموعة بيانات JHMDB تعليقات توضيحية مفصلة لحركة الإنسان لـ 21 فئة من الأفعال دقيقة التفاصيل، وتعمل كمجموعة بيانات مرجعية للتعرف على الأفعال المكانية الزمانية. وقد استُخدمت هذه المجموعات معاً لتقييم أداء النموذج عبر سيناريوهات رياضية وأفعال بشرية. تم تدريب الشبكة باستخدام محسن Adam لمدة 100 حقبة (epochs) بحجم دفعة قدره 32، ومعدل تعلم أولي قدره 0.001، ودالة فقدان الإنتروبيا المتقاطعة (cross-entropy loss function). وقد اختير النموذج الذي حقق أدنى فقدان في التحقق للتقييم النهائي. استخدمت جميع التجارب بذرة عشوائية ثابتة بقيمة 42. كما تم تطبيق التوقف المبكر وتقليل معدل التعلم عند الثبات لتحسين التقارب، واستُخدم قص التدرج (gradient clipping) بعتبة قدرها 5.0 أثناء تدريب LSTM لمنع انفجار التدرجات. احتوى نموذج MSCNN-LSTM المقترح على حوالي 15 مليون معلمة قابلة للتدريب. تم تلخيص تكوين الأجهزة والبرامج المستخدمة للتنفيذ في الجدول 4. وبما أن توزيعات الفئات كانت متوازنة بما يكفي، لم يتم تطبيق أي إجراءات إضافية لوزن الفئات أو إعادة أخذ العينات. نُفذت النماذج المقارنة باستخدام المعلمات الفائقة المذكورة في دراساتها الأصلية، مع توحيد إعدادات التدريب حيثما أمكن. أُبلغت قيم الأداء كمتوسط ± الانحراف المعياري من خمس عمليات تشغيل مستقلة بتهيئات عشوائية مختلفة. وقُيمت الاختلافات بين النموذج المقترح والنماذج المقارنة باستخدام اختبارات t المقترنة عند عتبة دلالة p < 0.05.

مجموعة البياناتعدد الفئاتعدد الفيديوهاتالدقة (بكسل)يرجى تزويدي بالنص المصدر المراد ترجمته.الوصف
UCF11 (إجراءات يوتيوب)111168متغير (≈ 320×240)جامعة سنترال فلوريدايتضمن 11 إجراءً بشرياً من الرياضات (مثل: التصويب في كرة السلة، والغطس، وضربة الجولف، والتنطيط في كرة القدم). جُمعت مقاطع الفيديو من موقع YouTube مع وجود تباين عالٍ في الإضاءة، وزاوية الرؤية، والخلفية.
رياضات جامعة UCF10150720×480مجموعة بيانات UCF للأعمال الرياضيةيتضمن أنشطة رياضية مثل الغطس، وركوب الخيل، وضربة الجولف، والجري، ورفع الأثقال، مسجلة من لقطات حقيقية لبث تلفزيوني (BBC, ESPN).
قاعدة بيانات JHMDB21928320×240معهد ماكس بلانك للأنظمة الذكيةتتضمن أنشطة يومية ورياضية مثل الإمساك، والقفز، وتمشيط الشعر، والتسديد، والجري، مع تعليقات توضيحية مشتركة لتحليل الحركة والوضعية.

الجدول 3: خصائص مجموعات البيانات المرجعية المستخدمة في التدريب والتقييم. نظرة عامة على مجموعات بيانات UCF11 وUCF Sports وJHMDB، بما في ذلك عدد فئات الأفعال، وعينات الفيديو، وخصائص مجموعة البيانات، وأدوارها في تدريب النموذج والتحقق منه واختباره.

المعاملات المستخدمةالوصف
لغة البرمجةPython 3.8.18 [4]
إطار عمل التعلم العميقTensorFlow 2.15.0 [1]
مسرع وحدة معالجة الرسوميات (GPU)NVIDIA GeForce RTX 3090 (24 GB VRAM) [1]
وحدة المعالجة المركزية (CPU)Intel Core i9 @ 3.5 GHz × 16 Cores
نظام التشغيلWindows 11 
الذاكرة (RAM)64 GB DDR4
المحسن (Optimizer)Adam (learning rate = 0.001)
حجم الدفعة (Batch Size)32
عدد الدورات (Epochs)100
دوال التنشيطReLU (طبقات CNN)، Softmax (طبقة المخرجات)
معدل الإسقاط (Dropout Rate)0.5

الجدول 4: بيئة المحاكاة وتكوين المعلمات الفائقة لنموذج MSCNN-LSTM المقترح. مواصفات الأجهزة، وبيئة البرامج، وإعدادات المُحسِّن، ومعدل التعلم، وحجم الدفعة، وعدد الدورات، وأبعاد المدخلات، وغيرها من المعلمات الفائقة المستخدمة أثناء تدريب النموذج وتقييمه.

2. المعالجة المسبقة

قبل التدريب، تم تحويل كل مقطع فيديو خام إلى تسلسل من الإطارات المرتبة زمنياً، ثم جرى توحيد معاييرها، وأخذ عينات زمنية منها، وتعزيزها. أولاً، تم تحويل كل فيديو مدخل V إلى تسلسل من الإطارات وتم تمثيله كموتر رباعي الأبعاد VRT×H×W×C، حيث تمثل T عدد الإطارات، وH × W i مؤشر الإطار، وتمثل C عدد قنوات الألوان (3 لـ RGB). تضمنت سلسلة المعالجة المسبقة استخراج الإطارات، وتغيير الحجم المكاني متبوعاً بقص مركزي أو عشوائي إلى دقة ثابتة (H′, W′)، وتوحيد كثافة كل بكسل، وتعزيز البيانات الاختياري، بما في ذلك القلب العشوائي، وتغيير القياس، والاضطراب اللوني، وذلك قبل عملية استخراج الميزات. وبشكل ملموس، تم تنفيذ توحيد الكثافة إما كتوحيد درجة معياري كما في المعادلة (1).

figure-protocol-3    (1)

حيث تمثل μ و σ متوسطات القنوات والانحرافات المعيارية المحسوبة على مجموعة التدريب، أو يتم استخدام القياس الأدنى-الأقصى (min–max scaling) كما في المعادلة (2).

figure-protocol-4    (2)

بعد التسوية، تم تمثيل كل إطار كـ tRH′×W′×C وتم تمثيل موتر الفيديو الناتج كـ V′ ∈ RT×H′×W′×C. وفي واجهة أمامية تلافيفية متعددة المقاييس، يتم الحصول على خرائط سمات مكانية متعددة للمجال الاستقبالي عن طريق تطبيق عدة تلافيف ثنائية الأبعاد (أو ثلاثية الأبعاد للتلافيف الزمكانية المبكرة) بأحجام نوى مختلفة؛ ثم تم توليد تمثيل سمات زمنية لكل إطار أو مقطع فيديو قصير وإرساله إلى وحدة LSTM. تطبق الورقة الأصلية نموذج MobileNetV2 ثم نموذج Deep BiLSTM للنمذجة الزمنية؛ كما أن مسار المعالجة المسبقة المذكور أعلاه متوافق تمامًا مع استبداله بنموذج تلافيفي متعدد المقاييس + LSTM.

3. أخذ العينات والتطبيع الزمني

نظرًا لأن أطوال الفيديو T تختلف بين مجموعات البيانات وداخلها، فإننا نقوم بأخذ عينات منتظمة أو إعادة أخذ عينات زمنية للإطارات لمنح التلافيف متعددة المقاييس + LSTM طول إدخال ثابت N من حيث عدد الإطارات أو المقاطع القصيرة. ويمكن حساب مؤشرات الإطارات المنتظمة كما هو موضح في المعادلة (3)،

figure-protocol-5 (3)

وبالتالي، يكون تسلسل الإطارات التي تم أخذ عيناتها هو Vs = {t0, …, tN−1}. وعندما يتطلب الأمر دقة زمنية أعلى، نقوم بإجراء استكمال زمني خطي: لأي زمن كسري تمت إعادة أخذ عيناته τ ∈ [0, T−1] يتم حسابه كما في المعادلة (4).

figure-protocol-6 (4)

بحيث تحتوي التسلسلات المعاد أخذ عيناتها Vs على N إطارات بالضبط وتحافظ على سلاسة الحركة. بدلاً من ذلك، فإن أخذ العينات عبر مقاطع متصلة قصيرة (طول النافذة الزمنية w مع خطوة s) ينتج مجموعة من موترات المقاطع حيث يكون كل مقطع CjRT×H′×W′×C و j = 0, …, ⌊(Tw)/s⌋. ولأغراض التسوية الزمنية داخل الشبكة، يكون التجميع الزمني البسيط بمقاييس متعددة فعالاً: فبناءً على تسلسل الميزات الزمنية X = {x1, …, xN} الناتج عن عمليات الالتفاف متعددة المقاييس، يتم تطبيق الميزات المجمعة كما هو موضح في المعادلة (5).

figure-protocol-7 (5)

أين Sك هل الدعم الزمني مناسب للمقياس؟ كـ (على سبيل المثال، Sك قد تكون كتلًا غير متداخلة أو مؤشرات موسعة) و مك = |Sك|.

قبل استخراج الميزات، تم تغيير مقياس جميع مقاطع الفيديو إلى 224 × 224 بكسل وأخذ عينات منها بمعدل 25 إطاراً في الثانية. واستخدمت كل تجربة طول تسلسل ثابتاً قدره 32 إطاراً. وشملت تقنيات تعزيز البيانات القص العشوائي (المقياس = 0.8–1.0)، والتدوير العشوائي (±15°)، والقلب الأفقي العشوائي (الاحتمالية = 0.5)، وتعديل السطوع (±20%). وقد استُخدمت قيم المتوسط الحسابي لـ ImageNet [0.485, 0.456, 0.406] والانحرافات المعيارية [0.229, 0.224, 0.225] لتوحيد قيم البكسل. وبالنسبة لكل تسلسل فيديو، استُخدم اختيار الإطارات الموحد لأخذ العينات الزمنية. أما المقاطع الأطول فقد تم تقليمها أو أخذ عينات منها بشكل موحد للحفاظ على طول تسلسل متسق، بينما تمت إضافة حشوة صفرية للمقاطع التي تحتوي على أقل من 32 إطاراً. وقد طُبقت هذه الإعدادات باستمرار طوال عمليتي التدريب والتقييم.

4. استخلاص الميزات باستخدام MSCNN

تم استخدام شبكة عصبية تلافيفية متعددة المقاييس (MSCNN) لتعزيز التمثيل المكاني للأفعال في مقاطع الفيديو الرياضية. قد تمتلك الشبكات العصبية التلافيفية التقليدية التي تعتمد على حجم نواة واحد قدرة محدودة في التقاط الميزات بمقاييس مكانية متعددة. ونظرًا لأن بعض الأفعال الرياضية تظهر خصائص بصرية متشابهة، فقد يصعب على البنية التلافيفية أحادية المقياس التقاط الميزات المحلية والعالمية في آن واحد. ولمعالجة هذا القصور، يستخدم الإطار المقترح نوى تلافيفية بأحجام مختلفة لإجراء استخراج ميزات متعدد المقاييس ودمج الميزات.

في بنية الشبكة المقترحة، تم استخدام نويات تلافيف (convolution kernels) بحجم 1 × 1 لتنظيم المعلومات عبر القنوات وتقليل أبعاد خرائط السمات المدخلة. بالإضافة إلى ذلك، تزيد هذه الطبقات من القدرة التعبيرية للشبكة من خلال تقديم تحويلات إضافية للسمات وتمثيلات غير خطية. وتتيح نويات التلافيف ذات الأحجام المختلفة استخلاص المعلومات المكانية بمقاييس متعددة. كما يتم إجراء تطبيع تسلسلي (sequential normalization) بعد دمج السمات متعددة المقاييس الموزونة لتحسين استقرار التدريب. ومن أجل التخفيف من مشكلات تلاشي التدرج وانفجار التدرج أثناء تدريب الشبكات العميقة، تستخدم البنية المقترحة اتصالات متبقية (residual connections) ونمذجة زمنية قائمة على LSTM.

يعزز التصميم متعدد المقاييس قدرة الشبكة على التقاط الميزات بدقة مكانية مختلفة ويحسن من قدرة تمثيل الميزات. علاوة على ذلك، يتم تفكيك نواة الالتفاف التقليدية N × N إلى عمليات التفاف N × 1 و 1 × N. وقد صُممت عمليات الالتفاف N × 1 و 1 × N المستخدمة في وحدة MSCNN لالتقاط ميزات مكانية اتجاهية ومتعددة المقاييس ومتكاملة من إطارات الفيديو الفردية. وتعزز عمليات الالتفاف هذه تمثيل الميزات المكانية من خلال استخراج الأنماط بمقاييس مختلفة للمجال الاستقبالي. بعد ذلك، يتم نمذجة العلاقات الزمنية بين الإطارات المتتالية بواسطة وحدة LSTM، التي تعالج تسلسل الميزات المستخرجة بواسطة MSCNN لتعلم التبعيات الزمنية طويلة المدى للتعرف على الأفعال.

يتم تفكيك كل فيديو رياضي V = {F1, F2, …, FT} إلى T من الإطارات. ولتشفير التغيرات المكانية، على سبيل المثال، وضعية اللاعب، وضبابية الحركة، ومسار الكرة، تعمل فروع تلافيفية عند ثلاثة مقاييس مختلفة s ∈ {1, 2, 3}، بما يتوافق مع أحجام النواة 3 × 3 و 5 × 5 و 7 × 7. ويقوم كل فرع باستخراج خرائط الميزات كما هو موضح في المعادلة (6):

figure-protocol-8    (6)

حيث تمثل Ws و bs أوزان وانحيازات الالتفاف عند المقياس s، و σ هي دالة التنشيط ReLU. تقوم طبقة دمج المقاييس المتعددة بتجميع الميزات كما هو موضح في المعادلة (7):

figure-protocol-9    (7)

يدمج موتر السمات المدمج هذا كلاً من إشارات الحركة الدقيقة والمعلومات السياقية للمساحات الواسعة، مثل الأنشطة الجماعية. يوضح الشكل 3 وحدة استخراج السمات الخاصة بـ MSCNN فقط. أما طبقة LSTM (256 وحدة خفية)، والطبقة الكثيفة (128 عصبوناً)، وطبقة الإسقاط (0.5) المستخدمة للنمذجة الزمنية والتصنيف، فقد عُرضت بشكل منفصل في الشكل 4.

figure-protocol-10
الشكل 3: وحدة استخراج الميزات المقترحة للشبكة العصبية التلافيفية متعددة المقاييس (MSCNN). تقوم ثلاثة فروع تلافيفية متوازية بأحجام نواة 3 × 3 و5 × 5 و7 × 7 باستخراج ميزات مكانية متكاملة متعددة المقاييس، والتي يتم دمجها قبل النمذجة الزمنية بواسطة شبكة LSTM. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-11
الشكل 4: بنية LSTM المقترحة للتعرف على الأنشطة في مقاطع الفيديو الرياضية. تقوم وحدة LSTM بنمذجة التبعيات الزمنية من خلال عمليات بوابات الإدخال، والنسيان، والإخراج عبر إطارات الفيديو المتتالية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

الشكل 3 يوضح وحدة استخراج الميزات المقترحة باستخدام الشبكة العصبية التلافيفية متعددة المقاييس (MSCNN) للتعرف على الحركات في مقاطع الفيديو الرياضية. تمت معالجة إطارات الفيديو المدخلة بالتوازي عبر ثلاثة فروع تلافيفية بأحجام نوى (kernel sizes) تبلغ 3 × 3 و 5 × 5 و 7 × 7، حيث يحتوي كل منها على 64 مرشحاً لالتقاط الميزات المكانية الدقيقة والخشنة المتكاملة. تم تحسين المخرجات باستخدام تسوية الدفعات (Batch Normalization)، وتنشيط ReLU، والتجميع الأقصى (max pooling) بحجم 2 × 2، ثم دُمجت وصُهرت بواسطة تلافيف 1 × 1 مع 128 مرشحاً. حافظت وصلة تخطي متبقية (residual skip connection) على المعلومات المكانية منخفضة المستوى وحسّنت تدفق التدرج. تم تسطيح خرائط الميزات المصهورة وتمريرها إلى طبقة LSTM تحتوي على 256 وحدة خفية للنمذجة الزمنية، تلتها طبقة متصلة بالكامل (fully connected layer) تحتوي على 128 عصبوناً، وتنشيط ReLU، ومعدل إسقاط (dropout rate) قدره 0.5 قبل التصنيف النهائي باستخدام طبقة Softmax. تم دمج خرائط الميزات متعددة المقاييس (f1l و f2l و f3l) لتشكيل التمثيل المصهور (Fl)، والذي تم تحسينه لاحقاً بواسطة تلافيف 3 × 3 لتوليد خريطة الميزات المخرجة للطبقة التالية. وقد مكنت هذه البنية الهرمية من تعلم الميزات المكانية المتكاملة عبر مجالات استقبال متعددة، مما أدى إلى تحسين أداء التعرف على الحركات الرياضية.

5. النمذجة الزمنية باستخدام LSTM

من أجل نمذجة التطور الزمني عبر حواف الفيديو، تم تزويد نظام LSTM بتسلسل الميزات المجمعة لالتقاط التبعيات الديناميكية واستمرارية الحركة. بالنسبة لكل فيديو مدخل، قمنا أولاً باستخراج ميزات CNN متعددة المقاييس لكل إطار. ولنفرض أن إطارات الفيديو هي I1، ...، IT. وبالنسبة لكل إطار t وكل مقياس s، ينتج المشفر التفافي متعدد المقاييس متجه ميزات ft(s)Rd. بعد ذلك، يتم دمج المقاييس في واصف إطار واحد إما عن طريق الإسقاط + الدمج أو المجموع الموزون كما هو موضح في المعادلة (8):

figure-protocol-12     (8)

ثم يتم تغذية التسلسل {xt}tT=1 في شبكة LSTM لنمذجة الديناميكيات الزمنية. في تدوين LSTM القياسي، تكون البوابات والحالات عند الزمن t كما هي موضحة في المعادلات من (9) إلى (13):

figure-protocol-13 (9)

figure-protocol-14 (10)

figure-protocol-15 (11)

figure-protocol-16 (12)

figure-protocol-17 (13)

هنا σ تمثل التنشيط السينيغي (sigmoid activation)، و ⊙ تمثل الضرب العنصري.) وبالرغم من إمكانية استخدام بنى LSTM ثنائية الاتجاه لالتقاط السياق الزمني الماضي والمستقبلي معاً، إلا أن الإطار المقترح يستخدم LSTM قياسياً لنمذجة التبعيات الزمنية عبر إطارات الفيديو المتسلسلة. ويتوافق خيار التصميم هذا مع بنية MSCNN-LSTM المعروضة في هذه الدراسة. وبعد معالجة المقطع، تم الحصول على تمثيل للمقطع (على سبيل المثال، الحالة الخفية الأخيرة أو التجميع الزمني): z = Poolt(vt).

الشكل 4 يوضح سير عمل بنية LSTM المقترحة للتعرف على الأنشطة الرياضية. استقبلت الشبكة تسلسلاً من إطارات الفيديو أو الميزات المستخرجة بواسطة CNN وعالجتها عبر خطوات زمنية متتالية (t−2، وt−1، وt). وتكونت كل خلية LSTM من بوابة إدخال، وبوابة نسيان، وبوابة إخراج، والتي نظمت تدفق المعلومات عبر الشبكة. قامت بوابة الإدخال بدمج المعلومات الجديدة في حالة الخلية، وقامت بوابة النسيان بالتخلص من المعلومات الزمنية غير ذات الصلة، بينما أنتجت بوابة الإخراج الحالة المخفية التي يتم نقلها إلى الخطوة الزمنية التالية. وحافظت حالة الخلية على التبعيات الزمنية طويلة المدى، بينما التقطت الحالة المخفية المعلومات الزمنية قصيرة المدى. وبعد المعالجة التسلسلية، تم تجميع مخرجات LSTM لتوليد تمثيل للميزات الزمنية، والذي تم تمريره إلى طبقة متصلة بالكامل ومصنف Softmax للتنبؤ بالنشاط الرياضي المقابل. تم تدريب الشبكة باستخدام محسّن Adam لمدة 100 حقبة (epochs) بحجم دفعة قدره 32، ومعدل تعلم أولي 0.001، ودالة خسارة الإنتروبيا المتقاطعة (cross-entropy loss function). وقد تم اختيار النموذج الذي سجل أدنى خسارة تحقق للتقييم النهائي. ولضمان قابلية التكرار، أجريت جميع التجارب باستخدام بذرة عشوائية ثابتة قيمتها 42. كما تم استخدام التوقف المبكر وخفض معدل التعلم عند الثبات (learning-rate reduction on plateau) لتحسين التقارب، وطُبق قص التدرج (gradient clipping) بعتبة 5.0 أثناء تدريب LSTM لمنع تضخم التدرجات. واحتوى نموذج MSCNN-LSTM المقترح على ما يقرب من 15 مليون معامل قابل للتدريب.

تستخدم درجات الفئة النهائية والاحتمالية طبقة خطية + softmax كما هو موضح في المعادلة (14):

figure-protocol-18 (14)

يتم التدريب عن طريق تقليل فقدان الإنتروبيا المتقاطعة (cross-entropy loss) عبر المقاطع المصنفة كما هو موضح في المعادلة (15):

figure-protocol-19 (15)

حيث تمثل Nb حجم الدفعة، وC عدد الفئات، وy(n) هي الحقيقة الأرضية ذات الترميز الأحادي (one-hot). يتم تطبيق التنظيم (dropout على مخرجات xt/LSTM، واضمحلال الوزن) وتطبيق قص التدرج للمساعدة في استقرار تسلسلات الرياضات الطويلة.

النتائج

تم تدريب وتقييم نموذج MSCNN-LSTM المقترح على مجموعات بيانات UCF11 (YouTube Actions)، وUCF Sports، وJHMDB، والتي تضمنت أنماط حركة ووجهات نظر وأفعال رياضية متنوعة. ونظراً لأن توزيعات الفئات كانت متوازنة بشكل كافٍ، لم يتم تطبيق أي إجراءات إضافية لوزن الفئات أو إعادة أخذ العينات. تم تنفيذ النماذج المقارنة باستخدام المعلمات الفائقة الواردة في دراساتها الأصلية، مع تنسيق إعدادات التدريب حيثما أمكن ذلك. تم تسجيل النتائج كمتوسط ± الانحراف المعياري من خمس عمليات تشغيل مستقلة بتهيئات عشوائية مختلفة. كما تم تقييم الفروق بين النموذج المقترح والنماذج المقارنة باستخدام اختبارات t المقترنة عند عتبة دلالة p < 0.05.

تقارن الشكل 5 دقة التصنيف عبر مجموعات البيانات الثلاث. حقق نموذج MSCNN-LSTM أعلى دقة، حيث وصلت إلى 98.3% في UCF11، و95.4% في UCF Sports، و81.7% في JHMDB. وقد تجاوزت هذه القيم تلك التي حققتها نماذج Dilated CNN–BiLSTM وTwo-Stream LSTM وViT-ReT. وتعكس الدقة المنخفضة في JHMDB الصعوبة الأكبر في التعرف على الإجراءات دقيقة التفاصيل في مقاطع الفيديو ذات الدقة المنخفضة.

figure-results-1
الشكل 5: مقارنة دقة التصنيف (%) لنماذج التعلم العميق المختلفة على مجموعات بيانات مقاطع الفيديو الرياضية. دقة التصنيف لنماذج MSCNN-LSTM وViT-ReT وTwo-Stream LSTM وDilated CNN + BiLSTM على مجموعات بيانات UCF11 وUCF Sports وJHMDB. يتم عرض النتائج كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تمثل أشرطة الخطأ انحرافاً معيارياً واحداً. تم تقييم الدلالة الإحصائية باستخدام اختبارات t المقترنة ثنائية الذيل (p < 0.05). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

كما حقق النموذج المقترح أعلى دقة عبر جميع مجموعات البيانات، حيث بلغت القيم حوالي 96% في UCF11، و93% في UCF Sports، و78% في JHMDB (الشكل 6). وكانت قيم الاستذكار حوالي 95%، و94%، و77% على التوالي (الشكل 7)، بينما كانت درجات F1 المقابلة حوالي 95.5%، و93.5%، و77.5% (الشكل 8). وأشارت هذه النتائج إلى أن النموذج حافظ على توازن ملائم بين التحديد الصحيح لفئات الأنشطة والحد من التنبؤات الإيجابية الكاذبة.

figure-results-2
الشكل 6: مقارنة الدقة (%) لنماذج التعلم العميق المختلفة على مجموعات بيانات مقاطع الفيديو الرياضية. يتم تقديم قيم الدقة كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تمثل أشرطة الخطأ انحرافاً معيارياً واحداً. تم تقييم الدلالة الإحصائية باستخدام اختبارات t المزدوجة ذات الذيلين (p < 0.05). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-3
الشكل 7: مقارنة لنسبة الاستدعاء (Recall %) لنماذج تعلم عميق مختلفة على مجموعات بيانات فيديوهات رياضية. تم تسجيل قيم الاستدعاء كمتوسط ± الانحراف المعياري (SD) من خمس تشغيلات مستقلة (n = 5). تمثل أشرطة الخطأ انحرافاً معيارياً واحداً. تم تقييم الدلالة الإحصائية باستخدام اختبارات t المزدوجة ذات الذيلين (p < 0.05). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-4
الشكل 8: مقارنة لدرجة F1 (%) لنماذج تعلم عميق مختلفة على مجموعات بيانات فيديوهات رياضية. تم تسجيل درجات F1 كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5). تمثل أشرطة الخطأ انحرافاً معيارياً واحداً. تم تقييم الدلالة الإحصائية باستخدام اختبارات t المزدوجة ذات الذيلين (p < 0.05). يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

يعرض الجدول 5 نتائج معامل كابا لكوهين (Cohen’s kappa) ومعامل ارتباط ماتيوز (Matthews correlation coefficient). في مجموعة بيانات UCF11، حقق النموذج المقترح قيمة κ = 0.96 وMCC = 0.96، مقارنة بقيم κ/MCC بلغت 0.92/0.92 لنموذج ViT-ReT، و0.90/0.90 لنموذج Two-Stream LSTM، و0.87/0.87 لنموذج Dilated CNN–BiLSTM. وفي مجموعة بيانات UCF Sports، حقق نموذج MSCNN-LSTM قيمة κ = 0.95 وMCC = 0.94، متجاوزاً القيم المقابلة التي حققها كل من ViT-ReT (0.90/0.90)، وTwo-Stream LSTM (0.88/0.89)، وDilated CNN–BiLSTM (0.84/0.85). أما في مجموعة بيانات JHMDB، فقد حقق النموذج المقترح قيمة κ = 0.83 وMCC = 0.84، مقارنة بـ 0.74/0.75 لـ ViT-ReT، و0.70/0.71 لـ Two-Stream LSTM، و0.71/0.72 لـ Dilated CNN–BiLSTM. وأظهرت هذه النتائج توافقاً أقوى بين التسميات المتوقعة والتسميات المرجعية الفعلية (ground-truth labels) بالنسبة للنموذج المقترح.

نموذجمجموعة البياناتمعامل كابا لكوهين (κ)معامل ارتباط ماثيوز (MCC)
شبكة عصبية تلافيفية موسعة + شبكة ذاكرة طويلة قصيرة المدى ثنائية الاتجاه [4]UCF11 (إجراءات يوتيوب)0.87 ± 0.010.88 ± 0.01
رياضات جامعة UCF0.84 ± 0.020.85 ± 0.02
قاعدة بيانات JHMDB0.71 ± 0.030.72 ± 0.03
نموذج الذاكرة الطويلة قصيرة المدى ثنائي المسار (Two-Stream LSTM) [38]UCF11 (إجراءات يوتيوب)0.90 ± 0.010.91 ± 0.01
رياضات جامعة فلوريدا المركزية (UCF)0.88 ± 0.020.89 ± 0.02
JHMDB0.70 ± 0.030.71 ± 0.03
ViT-ReT (محول الرؤية + المحول التكراري) [6]UCF11 (إجراءات يوتيوب)0.92 ± 0.010.92 ± 0.01
رياضات جامعة سنترال فلوريدا (UCF)0.90 ± 0.010.90 ± 0.01
قاعدة بيانات JHMDB0.74 ± 0.020.75 ± 0.02
نموذج MSCNN–LSTM المقترحUCF11 (إجراءات يوتيوب)0.96 ± 0.010.96 ± 0.01
رياضات جامعة سنترال فلوريدا (UCF)0.95 ± 0.010.94 ± 0.01
JHMDB0.83 ± 0.020.84 ± 0.02

الجدول 5: مقارنة بين معامل كوهين كابا (κ) ومعامل ارتباط ماثيوز (MCC) عبر نماذج التعلم العميق المختلفة. مقارنة أداء نماذج MSCNN-LSTM وViT-ReT وTwo-Stream LSTM وDilated CNN + BiLSTM على مجموعات بيانات UCF11 وUCF Sports وJHMDB. تشير القيم الأعلى إلى توافق أقوى بين التسميات المتوقعة والتسميات الحقيقية وموثوقية أكبر في التصنيف. تم تسجيل القيم كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5).

يوضح الشكل 9 منحنيات خصائص تشغيل المستقبل. حقق نموذج MSCNN-LSTM المقترح قيم AUC بلغت 0.975 على مجموعة بيانات UCF11، و0.961 على UCF Sports، و0.937 على JHMDB. وقد أشارت قيم AUC المرتفعة باستمرار إلى قدرة تمييز قوية بين فئات الأنشطة عبر مجموعات بيانات ذات تعقيدات مختلفة.

figure-results-5
الشكل 9: منحنيات خصائص تشغيل المستقبل (ROC) لنموذج MSCNN-LSTM المقترح. منحنيات ROC لمجموعات بيانات UCF11 وUCF Sports وJHMDB التي توضح المقايضة بين معدل الإيجابيات الصحيحة ومعدل الإيجابيات الكاذبة. تلخص المساحة تحت المنحنى (AUC) أداء التمييز للنموذج عبر عتبات التصنيف. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

تم تلخيص نتائج الأداء الزمني في الجدول 6. في مجموعة بيانات UCF11، حقق النموذج المقترح mAP-T بنسبة 98.3%، ودقة على مستوى الإطار بنسبة 96.5%، وTSI بنسبة 0.95. وفي مجموعة بيانات UCF Sports، كانت القيم المقابلة هي 95.4%، و94.0%، و0.93. أما في مجموعة بيانات JHMDB، فقد حقق النموذج mAP-T بنسبة 81.7%، ودقة على مستوى الإطار بنسبة 78.9%، وTSI بنسبة 0.88 (الجدول 7). وكانت هذه القيم أعلى من تلك التي حققتها النماذج المقارنة، مما يشير إلى تحسن في التماسك الزمني واستقرار التنبؤ عبر تسلسلات الأنشطة قصيرة وطويلة المدى على حد سواء.

الطريقةمجموعة البياناتمتوسط دقة التحديد - T (%)دقة مستوى الإطار (%)مؤشر الاستقرار الزمني (TSI)
شبكة عصبية تلافيفية متسعة + شبكة ذاكرة طويلة قصيرة المدى ثنائية الاتجاه (Dilated CNN + BiLSTM)4UCF11 (إجراءات يوتيوب)93.6 ± 0.891.8 ± 0.90.87 ± 0.01
الرياضات في جامعة UCF90.2 ± 1.089.1 ± 1.10.83 ± 0.02
قاعدة بيانات جينوم الإنسان المرجعية (JHMDB)72.4 ± 1.570.3 ± 1.70.78 ± 0.03
شبكة الذاكرة طويلة قصيرة المدى ذات المسارين (Two-Stream LSTM)38UCF11 (إجراءات يوتيوب)94.8 ± 0.792.6 ± 0.80.89 ± 0.01
الرياضات في جامعة سنترال فلوريدا (UCF)91.3 ± 0.990.0 ± 1.00.85 ± 0.02
قاعدة بيانات جينوم الإنسان (JHMDB)73.8 ± 1.471.5 ± 1.60.79 ± 0.03
ViT-ReT (محول الرؤية + المحول المتكرر)6UCF11 (إجراءات يوتيوب)95.5 ± 0.693.4 ± 0.70.90 ± 0.01
رياضات جامعة فلوريدا المركزية (UCF)92.4 ± 0.891.2 ± 0.90.87 ± 0.01
JHMDB74.6 ± 1.372.8 ± 1.40.81 ± 0.02
.UCF11 (إجراءات يوتيوب)98.3 ± 0.596.5 ± 0.60.95 ± 0.01
رياضات جامعة سنترال فلوريدا (UCF)95.4 ± 0.794.0 ± 0.80.93 ± 0.01
قاعدة بيانات JHMDB81.7 ± 1.178.9 ± 1.30.88 ± 0.02

الجدول 6: مقارنة مقاييس الأداء الزمني للتعرف على الأنشطة في الفيديوهات الرياضية. النتائج التجريبية لمتوسط الدقة المتوسطة عبر المقاطع الزمنية (mAP-T)، والدقة على مستوى الإطار، ومؤشر الاستقرار الزمني (TSI) لنماذج تعلم عميق مختلفة عبر مجموعات البيانات المرجعية. يتم عرض القيم كمتوسط ± الانحراف المعياري (SD) من خمس عمليات تشغيل مستقلة (n = 5).

الإعداداتالشبكة العصبية التلافيفية متعددة المقاييس (MSCNN)الذاكرة طويلة قصيرة المدى (LSTM)الدقة (%)درجة F1 (%)متوسط الدقة المتوسطة - T (%)
الخط المرجعي المعتمد على الشبكات العصبونية التلافيفية فقط90.4 ± 1.289.8 ± 1.388.9 ± 1.4
الشبكة العصبية التلافيفية (CNN) + الذاكرة طويلة قصيرة المدى (LSTM)93.1 ± 0.992.4 ± 1.091.7 ± 1.1
شبكات CNN متعددة المقاييس فقط94.2 ± 0.893.6 ± 0.992.8 ± 1.0
شبكة MSCNN-LSTM المقترحة98.3 ± 0.597.8 ± 0.697.1 ± 0.6

الجدول 7: دراسة الاستئصال لإطار عمل MSCNN-LSTM المقترح. المساهمة في الأداء لمكونات MSCNN وLSTM تحت إعدادات تدريب وتقييم متطابقة. القيم المسجلة هي المتوسط ± الانحراف المعياري من خمس عمليات تشغيل مستقلة (n = 5).

الشكل 10, الشكل 11, الشكل 12 تعرض مصفوفات الارتباك الموحدة حسب الصفوف لـ UCF11 وUCF Sports وJHMDB، على التوالي. أظهرت المصفوفات الثلاث هيمنة قطرية واضحة، مما يشير إلى أنه تم تحديد معظم فئات الأفعال بشكل صحيح. حدثت أخطاء محدودة خارج القطر بشكل أساسي بين الأفعال ذات الخصائص البصرية أو الحركية المتشابهة. وأظهرت مصفوفة JHMDB ارتباكاً أكبر بين الفئات نسبياً، وهو ما يتفق مع الأداء الكمي المنخفض الملاحظ في مجموعة البيانات هذه الأكثر تحدياً.

figure-results-6
الشكل 10: مصفوفة ارتباك مُطبعة الصفوف لنموذج MSCNN-LSTM المقترح على مجموعة بيانات UCF11. تم تطبيع كل صف إلى الواحد الصحيح، وتمثل المدخلات القطرية الاستدعاء الخاص بكل فئة بدلاً من دقة التصنيف الإجمالية، والتي تم ذكرها بشكل منفصل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-7
الشكل 11: مصفوفة الارتباك المعيرة حسب الصف لنموذج MSCNN-LSTM المقترح على مجموعة بيانات UCF Sports. يتم تعيير كل صف إلى الوحدة، وتمثل المدخلات القطرية الاستدعاء لكل فئة بدلاً من دقة التصنيف الإجمالية، والتي يتم ذكرها بشكل منفصل. يرجى الضغط هنا لعرض نسخة أكبر من هذا الشكل.

figure-results-8
الشكل 12: مصفوفة الارتباك الموحدة صفياً لنموذج MSCNN-LSTM المقترح على مجموعة بيانات JHMDB. يتم توحيد كل صف إلى الواحد الصحيح، وتمثل المدخلات القطرية استدعاء كل فئة بدلاً من دقة التصنيف الإجمالية، والتي تم ذكرها بشكل منفصل. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

بشكل عام، تفوق إطار عمل MSCNN-LSTM المقترح باستمرار على النماذج المقارنة التي تم تقييمها عبر مقاييس التصنيف، والتوافق، والتمييز، والاستقرار الزمني. وقد دعمت هذه النتائج الفرضية القائلة بأن الجمع بين استخراج الميزات المكانية متعددة المقاييس والنمذجة الزمنية القائمة على LSTM أدى إلى تحسين التعرف على الأفعال الرياضية عبر مجموعات بيانات ذات تعقيدات حركية، وجودة صور، وظروف زوايا رؤية متفاوتة.

توفر البيانات:

تتوفر مجموعات البيانات التي تم تحليلها خلال هذه الدراسة علنًا من المصادر التالية: مجموعة بيانات UCF11 (YouTube Actions) عبر (https://www.crcv.ucf.edu/data/UCF_YouTube_Action.php) ومجموعة بيانات UCF Sports عبر (https://www.crcv.ucf.edu/data/UCF_Sports_Action.php). ولدعم إمكانية تكرار هذه الدراسة، تم إيداع مسار المعالجة المسبقة، وتقسيم مجموعات البيانات (توليد تقسيمات التدريب/التحقق/الاختبار)، وملفات التنفيذ، وملفات التكوين، والوثائق الداعمة المستخدمة في التجارب في مستودع Zenodo، وهي متاحة علنًا على الرابط https://doi.org/10.5281/zenodo.21020947.

المناقشة

تفوق إطار عمل MSCNN-LSTM المقترح باستمرار على الطرق التي تم تقييمها عبر مجموعات بيانات UCF11 وUCF Sports وJHMDB المرجعية. وقد أظهرت الطرق السابقة القائمة على Dilated CNN–BiLSTM، وبنيات Vision Transformer، و3D CNNs قدرة فعالة على تعلم الميزات المكانية والزمانية، ولكنها قد تكون محدودة بسبب التعقيد الحسابي العالي، أو متطلبات التدريب الكبيرة، أو التمثيل غير الكافي لأنماط الحركة دقيقة التفاصيل23,24,25. وفي المقابل، دمج إطار العمل المقترح استخراج الميزات المكانية متعددة المقاييس مع النمذجة الزمانية القائمة على LSTM، مما مكن من التقاط كل من تفاصيل الحركة المحلية والاعتمادات الزمانية طويلة المدى. وقد أدى هذا التكامل إلى تحسين التعرف على الأفعال الرياضية المعقدة، وتقليل الخلط بين الفئات، وتعزيز الاتساق الزماني، لا سيما في مجموعة بيانات JHMDB الأكثر تحديًا. وتشير هذه النتائج إلى أن إطار العمل المقترح قدم تمثيلاً متوازنًا للمعلومات المكانية والزمانية مقارنةً بالطرق القائمة على CNN والشبكات المتكررة والمحولات التي تم تقييمها.

من منظور نظري، وفّر إطار عمل MSCNN-LSTM نهجاً موحداً لدمج الميزات متعددة المقاييس والتعلم الزمني التسلسلي36,37. وقد مكن استخدام مجالات الاستقبال الهرمية من استخراج المعلومات المكانية بمقاييس مختلفة، بينما قامت شبكة LSTM بنمذجة التبعيات عبر إطارات الفيديو المتتالية. وقد وسّع هذا التصميم خط عمل CNN-LSTM التقليدي من خلال الحفاظ على المعلومات المكانية المحلية والسياقية قبل النمذجة الزمنية. كما عزز الأداء المتسق عبر مجموعات البيانات التي تحتوي على فئات حركية وأنماط حركة وزوايا رؤية مختلفة من الكاميرا مدى قوة البنية المقترحة.

من منظور عملي، أظهر الإطار إمكانات واعدة في التحليلات الرياضية المؤتمتة، وتقييم أداء الرياضيين، واكتشاف الأحداث، وفهم مقاطع الفيديو الرياضية. ومع ذلك، يلزم إجراء مزيد من التحقق تحت ظروف التشغيل في العالم الحقيقي قبل النشر. ورغم أن البنية حققت أداءً قويًا في التعرف، إلا أنه يجب تأكيد مدى ملاءمتها للأجهزة ذات الموارد المحدودة أو منصات التحليلات السحابية من خلال تقييم إضافي للتكلفة الحسابية، ووقت الاستدلال، ومتطلبات الذاكرة، واستهلاك الطاقة.

أظهرت دراسة الاستئصال المساهمات التكاملية لمكونات MSCNN و LSTM. حيث حسنت MSCNN استخراج الميزات المكانية من خلال تعلم التمثيلات بمقاييس متعددة للمجال الاستقبالي، بينما عززت LSTM النمذجة الزمنية عبر التقاط اعتمادات الحركة عبر الإطارات المتتالية. وقد حقق تكوين MSCNN-LSTM الكامل أفضل أداء، مما يشير إلى أن استخراج الميزات المكانية متعددة المقاييس ونمذجة التسلسلات الزمنية قد ساهمَا معاً في التحسن الملحوظ في التعرف على الأفعال.

بشكل عام، نجح إطار عمل MSCNN-LSTM المقترح في دمج تعلم التمثيلات المكانية والزمانية للتعرف على الحركات في مقاطع الفيديو الرياضية. وقد أظهر التقييم الذي أجري على مجموعات بيانات UCF11 وUCF Sports وJHMDB تحسناً في الأداء مقارنة بنهج التعلم العميق التي تم تقييمها. ودعمت هذه النتائج الفرضية القائلة بأن دمج الميزات التلافيفية متعددة المقاييس مع النمذجة الزمانية القائمة على LSTM يحسن من التعرف على الحركات الرياضية المعقدة. ومع ذلك، فإن التحقق من صحة النتائج باستخدام مجموعات بيانات أكبر وأكثر تنوعاً وعبر نطاقات مختلفة يعد أمراً ضرورياً لإثبات القابلية للتعميم والتطبيق في العالم الحقيقي.

يجب مراعاة عدة قيود. أولاً، اقتصر التقييم على مجموعات بيانات مرجعية متاحة للعموم، وقد لا تمثل بشكل كامل تنوع وتعقيد البيئات الرياضية في العالم الحقيقي. ثانياً، على الرغم من استخدام تقسيمات ثابتة للتدريب والتحقق والاختبار، إلا أنه لا يمكن استبعاد انحياز مجموعة البيانات وتسرب البيانات غير المقصود بشكل كامل. ثالثاً، قد يختلف الأداء المسجل وفقاً لتكوين مجموعة البيانات، وتهيئة النموذج، وإجراءات المعالجة المسبقة، وإعدادات التدريب. بالإضافة إلى ذلك، أدت مكونات النمذجة الزمنية والتلافيفية متعددة المقاييس إلى زيادة المتطلبات الحسابية، مما قد يؤثر على النشر في الأجهزة ذات الموارد المحدودة. كما لم يتم تقييم الإطار باستخدام مجموعات بيانات خارجية أو سيناريوهات إنتاج في الوقت الفعلي.

أظهرت نماذج الفيديو القائمة على المحولات (Transformers) أداءً قوياً في مجموعات بيانات التعرف على الأفعال واسعة النطاق، ولكنها غالباً ما تتطلب موارد حوسبية كبيرة وبيانات تدريب مكثفة. ويقدم إطار عمل MSCNN-LSTM المقترح نهجاً بديلاً من خلال الجمع بين استخراج الميزات المكانية متعددة المقاييس والنمذجة الزمنية المتكررة. وينبغي أن تبحث الأعمال المستقبلية في التحقق من الصحة عبر مجموعات بيانات مختلفة، والاستدلال في الوقت الفعلي، والتحسين الحوسبي، وتقدير عدم اليقين، والبنى الهجينة التي تدمج آليات الانتباه القائمة على المحولات مع إطار عمل CNN-LSTM متعدد المقاييس المقترح38.

الإفصاحات

يعلن المؤلفون عن عدم وجود تضارب في المصالح.

شكر وتقدير

أُجري هذا البحث في مركز تكنولوجيا الذكاء الاصطناعي (CAIT)، كلية علوم وتكنولوجيا المعلومات، بجامعة Kebangsaan Malaysia. ويعرب المؤلفون عن امتنانهم للدعم المؤسسي والمرافق البحثية المقدمة. لم يتلقَ هذا العمل أي تمويل محدد من أي وكالة تمويل عامة أو تجارية أو غير ربحية.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
وحدة معالجة الرسوميات GeForce RTX 3090شركة NVIDIARTX 3090، ذاكرةات وصول عشوائي للفيديو (VRAM) بسعة 24 جيجابايتتُستخدم لتدريب نماذج التعلم العميق والاستدلال بها
معالج Intel Core i9شركة إنتل (Intel Corporation)16 نواة، 3.5 جيجاهرتزتُستخدم للمعالجة المسبقة للبيانات والحوسبة
ذاكرة النظامعامذاكرة وصول عشوائي (RAM) بسعة 64 جيجابايت من نوع DDR4يدعم معالجة الفيديو على نطاق واسع
لغة برمجة بايثون (Python)مؤسسة برمجيات بايثون (Python Software Foundation)الإصدار 3.8.18لغة البرمجة الأساسية للتنفيذ
تنسور فلو (TensorFlow)جوجلالإصدار 2.15إطار عمل التعلم العميق المستخدم لتطوير النموذج
نظام التشغيلشركة مايكروسوفت (Microsoft Corporation)ويندوز 11تطوير النموذج والتجريب
مجموعة أدوات CUDANVIDIA CorporationCUDA 11.8تسريع تدريب النماذج باستخدام وحدة معالجة الرسوميات (GPU)
cuDNNشركة NVIDIAcuDNN 8.9.7مكتبة تسريع الشبكات العصبية العميقة
OpenCVمفتوح المصدرالإصدار 4.8.1استخراج إطارات الفيديو ومعالجتها مسبقاً
NumPyمفتوح المصدرالإصدار 1.24.4الحساب العددي ومعالجة المصفوفات
Scikit-learnمفتوح المصدرالإصدار 1.3.2تقييم الأداء والتحليل الإحصائي
مات بلوت ليب (Matplotlib)مفتوح المصدرالإصدار 3.7.5تصوير النتائج التجريبية
مجموعة بيانات UCF11جامعة سنترال فلوريدامجموعة بيانات عامةمجموعة بيانات مرجعية للتعرف على الأنشطة الرياضية
مجموعة بيانات UCF للرياضاتجامعة سنترال فلوريدامجموعة بيانات عامةمجموعة بيانات مرجعية للتعرف على الأنشطة الرياضية
مجموعة بيانات JHMDBمعهد ماكس بلانك للمعلوماتيةمجموعة بيانات عامةمجموعة بيانات مرجعية للتعرف على الحركة والعمل البشرية

المراجع

  1. Hassan N, Miah ASM, Shin J. A deep bidirectional LSTM model enhanced by transfer-learning-based feature extraction for dynamic human activity recognition. Appl Sci. 2024;14:603. https://doi.org/10.3390/app14020603
  2. Egawa R, et al. Dynamic fall detection using graph-based spatial temporal convolution and attention network. Electronics. 2023;12:3234. https://doi.org/10.3390/electronics12153234
  3. Riahi M, Eslami M, Safavi SH, Torkamani Azar F. Human activity recognition using improved dynamic image. IET Image Process. 2020;14:3223–3231. https://doi.org/10.1049/iet-ipr.2020.0372
  4. Muhammad K, et al. Human action recognition using attention-based LSTM network with dilated CNN features. Future Gener Comput Syst. 2021;125:820–830. https://doi.org/10.1016/j.future.2021.06.017
  5. Al-Obaidi S, Al-Khafaji H, Abhayaratne C. Making sense of neuromorphic event data for human action recognition. IEEE Access. 2021;9:82686–82700. https://doi.org/10.1109/ACCESS.2021.3085769
  6. Wensel J, Ullah H, Munir A. ViT-ReT: Vision and recurrent transformer neural networks for human activity recognition in videos. IEEE Access. 2023;11:72227–72249. https://doi.org/10.1109/ACCESS.2023.3293445
  7. Vrskova R, Hudec R, Kamencay P, Sykora P. Human activity classification using the 3DCNN architecture. Appl Sci. 2022;12:931. https://doi.org/10.3390/app12020931
  8. Ullah A, et al. Action recognition using optimized deep autoencoder and CNN for surveillance data streams of non-stationary environments. Future Gener Comput Syst. 2019;96:386–397. https://doi.org/10.1016/j.future.2019.01.041
  9. Jaouedi N, Boujnah N, Bouhlel MS. A new hybrid deep learning model for human action recognition. J King Saud Univ Comput Inf Sci. 2020;32:447–453. https://doi.org/10.1016/j.jksuci.2018.08.001
  10. Zebhi S, Al-Modarresi SMT, Abootalebi V. Converting video classification problem to image classification with global descriptors and pre-trained network. IET Comput Vis. 2020;14:614–624. https://doi.org/10.1049/iet-cvi.2020.0023
  11. Cust E, Sweeting AJ, Ball K, Robertson S. Machine and deep learning for sport-specific movement recognition: A systematic review. J Sports Sci. 2019;37:568–600. https://doi.org/10.1080/02640414.2018.1504613
  12. Cao S, Wang B, Zhang W, Ma L. Visual consensus modeling for video-text retrieval. In Proc AAAI Conf Artif Intell. 2022:167–175. https://doi.org/10.1609/aaai.v36i1.19890
  13. Yu H, et al. Fine-grained video captioning for sports narrative. In Proc IEEE Conf Comput Vis Pattern Recognit (CVPR). 2018:6006–6015. https://doi.org/10.1109/CVPR.2018.00628
  14. Browne P, Sweeting AJ, Woods CT, Robertson S. Methodological considerations for furthering the understanding of constraints in applied sports. Sports Med Open. 2021;7:22. https://doi.org/10.1186/s40798-021-00307-9
  15. Gao T, et al. Sports video classification method based on improved deep learning. Appl Sci. 2024;14:948. https://doi.org/10.3390/app14020948
  16. Dong Z, Xie M, Li X. Multi-scale receptive fields convolutional network for action recognition. Appl Sci. 2023;13:3403. https://doi.org/10.3390/app13063403
  17. Liu S, et al. Human memory update strategy: A multi-layer template update mechanism for remote visual monitoring. IEEE Trans Multimed. 2021;23:2188–2198. https://doi.org/10.1109/TMM.2020.3009234
  18. Liu S, Liu D, Muhammad K, Ding W. Effective template update mechanism in visual tracking with background clutter. Neurocomputing. 2021;458:615–625. https://doi.org/10.1016/j.neucom.2021.05.032
  19. Haque MN, et al. GRU-based attention mechanism for human activity recognition. In Proc ICASERT. 2019:1–6. https://doi.org/10.1109/ICASERT.2019.8934521
  20. Al-qaness MA, Dahou A, AbdElaziz M, Helmi A. Multi-ResAtt: Multilevel residual network with attention for human activity recognition using wearable sensors. IEEE Trans Ind Inform. 2022;19:144–152. https://doi.org/10.1109/TII.2022.3147850
  21. Duan F, et al. A multi-task deep learning approach for sensor-based human activity recognition and segmentation. IEEE Trans Instrum Meas. 2023;72:2514012. https://doi.org/10.1109/TIM.2023.3264512
  22. Gomes E, et al. Machine learning algorithms for activity-intensity recognition using accelerometer data. Sensors. 2021;21:1214. https://doi.org/10.3390/s21041214
  23. Su C, et al. A novel model for fall detection and action recognition combining lightweight 3D-CNN and ConvLSTM networks. Pattern Anal Appl. 2024;27:3. https://doi.org/10.1007/s10044-023-01234-5
  24. Zhou T, et al. Behavior recognition based on improved density clustering and context-guided Bi-LSTM model. Multimed Tools Appl. 2023;82:45471–45488. https://doi.org/10.1007/s11042-023-14678-9
  25. Shin J, et al. Video-based human activity recognition using hybrid deep learning model. Comput Model Eng Sci. 2025;143:3615. https://doi.org/10.32604/cmes.2025.058341
  26. Vrskova R, Hudec R, Kamencay P, Sykora P. A new approach for abnormal human activities recognition based on ConvLSTM architecture. Sensors. 2022;22:2946. https://doi.org/10.3390/s22082946
  27. Vijeikis R, Raudonis V, Dervinis G. Efficient violence detection in surveillance. Sensors. 2022;22:2216. https://doi.org/10.3390/s22062216
  28. Rendón-Segador F, et al. ViolenceNet: Dense multi-head self-attention with bidirectional ConvLSTM for detecting violence. Electronics. 2021;10:1601. https://doi.org/10.3390/electronics10131601
  29. Kalfaoglu E, Kalkan S, Alatan A. Late temporal modeling in 3D CNN architectures with BERT for action recognition. In Proc ECCV Workshops. 2020. https://doi.org/10.1007/978-3-030-66823-5_43
  30. Moaaz M, Mohamed E. Violence detection in surveillance videos using deep learning. Inf Bull Fac Comput Artif Intell. 2020;2:6.
  31. Song W, et al. Expressive 3D facial animation generation based on local-to-global latent diffusion. IEEE Trans Vis Comput Graph. 2024;30:7397–7407. https://doi.org/10.1109/TVCG.2024.3456213
  32. Li L, Cherouat A, Snoussi H, Wang T. Grasping with occlusion-aware ally method in complex scenes. IEEE Trans Autom Sci Eng. 2025;22:5944–5954. https://doi.org/10.1109/TASE.2024.3434610
  33. Li R, et al. UE-Extractor: A grid-to-point ground extraction framework for unstructured environments. IEEE Robot Autom Lett. 2025;10:5991–5998. https://doi.org/10.1109/LRA.2025.3563127
  34. Jhuang, H., Gall, J., Zuffi, S., Schmid, C., Black, M. J. Towards understanding action recognition. Proceedings of the IEEE International Conference on Computer Vision. 3192–3199, doi:10.1109/ICCV.2013.396 (2013).
  35. OpenMMLab. MMAction2: JHMDB dataset preparation. GitHub. https://github.com/open-mmlab/mmaction2/tree/main/tools/data/jhmdb (2026).
  36. Ullah W, Khalid YN, Khan SH. A novel deep hybrid framework with ensemble-based feature optimization for HAR. arXiv preprint arXiv:2508.18695. 2025. https://arxiv.org/abs/2508.18695
  37. Karuppannan K, Darmanayagam SE, Cyril SR. Human action recognition using fusion-based discriminative features and LSTM classification. Concurr Comput Pract Exp. 2022;34:e7250. https://doi.org/10.1002/cpe.7250
  38. Sahoo SP, et al. HAR-depth: A novel framework for human action recognition using sequential learning and depth estimated history images. IEEE Trans Emerg Top Comput Intell. 2020;5:813–825. https://doi.org/10.1109/TETCI.2020.3006543

إعادة الطباعة والأذونات

الوسوم

LSTM CNN BiLSTM