مقالة منهجية

طريقة لتتبع الأجسام المتعددة موجهة بالثقة لمقاطع فيديو الرياضة باستخدام دمج دلالات القمصان

DOI:

10.3791/71557

أغسطس 14, 2026

في هذه المقالة

ملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصف هذا البروتوكول سير عمل لتتبع متعدد الأهداف موجه بالثقة لمقاطع الفيديو الرياضية، حيث يدمج معلومات لون القميص ورقم اللاعب لتحسين ربط المسارات واتساق الهوية في ظل تقلبات الثقة، وحالات الحجب، وتشابه المظهر البصري للرياضيين.

الملخص

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يوفر تتبع الأجسام المتعددة (MOT) في مقاطع الفيديو الرياضية معلومات عن المسارات من أجل التحليل التكتيكي، وتفسير سلوك اللاعبين، والتحليل الإحصائي الآلي. ومع ذلك، غالباً ما تتضمن السيناريوهات الرياضية تغيرات سريعة في الاتجاه، وتوقفات مفاجئة، وحالات احتجاب متكررة، وزملاء فريق متشابهين بصرياً، مما يؤدي إلى تقلبات في ثقة الكشف وارتباك في الهوية أثناء الربط بين الإطارات. ولمعالجة هذه التحديات، تقدم هذه الدراسة JerseyTrack، وهي طريقة لتتبع الأجسام المتعددة في الرياضة موجهة بالثقة وتعتمد على الدمج الدلالي للقمصان. يقوم سير العمل بتقسيم صناديق الكشف تكيفياً إلى فترات ثقة عالية ومتوسطة ومنخفضة وفقاً لتوزيع الثقة في كل إطار. يتم ربط عمليات الكشف عالية الثقة بشكل أساسي باستخدام تشابه الحركة، بينما تدمج عمليات الكشف متوسطة ومنخفضة الثقة إضافياً ميزات لون القميص ورقم اللاعب المستخرجة عبر تجميع الألوان ونموذج خفيف للتعرف الضوئي على الحروف (OCR). يتم دمج هذه الميزات الدلالية مع معلومات الحركة أثناء المطابقة التكميلية لتحسين استمرارية المسار واتساق الهوية. تم تقييم هذه الطريقة باستخدام مجموعة بيانات SportsMOT؛ حيث حقق JerseyTrack دقة تتبع أجسام متعددة (MOTA) بلغت 88.9%، ودرجة F1 للهوية (IDF1) بلغت 74.3%، ودقة تتبع من الرتبة الأعلى (HOTA) بلغت 69.9%، مما أظهر تحسناً في أداء التتبع في ظل إعدادات تتبع الرياضة التي تم تقييمها. يوفر هذا البروتوكول سير عمل قابلاً للتكرار لدمج الربط الموجه بالثقة مع المعلومات الدلالية للقمصان لتحسين تتبع الأجسام المتعددة في مقاطع الفيديو الرياضية.

المقدمة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يوفر تتبع الأجسام المتعددة (MOT) تحديداً مستمراً لمواقع الأجسام والحفاظ على هويتها في التسلسلات المرئية، وهو ما يدعم استخراج مسارات الرياضيين، والتحليل التكتيكي، والتحليل الإحصائي الآلي في تطبيقات الفيديو الرياضي1,2,3. كما ترتبط المعلومات المرئية الموثوقة بعمليات اتخاذ القرار وتقييم الأداء الخاصة بكل رياضة في علوم الرياضة، مما يؤكد أهمية بيانات الحركة المستقرة المستمدة من الفيديو لإجراء التحليلات الرياضية اللاحقة4. وفي السيناريوهات الرياضية، تعتمد موثوقية البيانات التكتيكية على استمرارية مسارات التتبع واتساق هويات الأهداف.

بالمقارنة مع سيناريوهات تتبع الأجسام المتعددة (MOT) العامة، تحتوي مقاطع الفيديو الرياضية على تغيرات سريعة في الاتجاه، وتوقفات مفاجئة، وقفزات، وتفاعلات كثيفة، وحالات انسداد متكررة. وتتسبب هذه العوامل في تقلبات ملحوظة في درجة الثقة بصناديق الكشف، كما تزيد من تكرار عمليات الكشف ذات الثقة المنخفضة، مما قد يؤدي إلى انقطاع ارتباط المسارات5,6. علاوة على ذلك، تقلل قمصان الفريق الموحدة من قدرة التمييز لميزات المظهر العامة وتزيد من الخلط في الهوية بين الزملاء المتشابهين بصرياً7,8. وعندما يحدث الانسداد والتشابه في المظهر في نفس التسلسل، تنخفض الثقة في الكشف وتصبح معلومات مظهر الهدف غير مكتملة، مما يزيد من صعوبة ارتباط المسار والحفاظ على الهوية9,10. وفي سياق تتبع الأجسام المتعددة (MOT)، تشير إعادة التعرف (Re-ID) إلى عملية ربط هوية الهدف نفسه عبر الإطارات، أو فترات الانسداد، أو حالات إعادة الدخول باستخدام الأدلة البصرية المرتبطة بالهوية. وفي مقاطع الفيديو الخاصة بالرياضات الجماعية، قد تضعف مؤشرات إعادة التعرف العامة لأن الرياضيين من الفريق نفسه غالباً ما يتشاركون الزي الموحد والمظهر الجسدي المتشابه. وتشير المراجعة الفنية للأدبيات إلى أن تفتت المسارات والخلط في الهوية في تتبع الأجسام المتعددة الرياضي يتم معالجتهما عادةً من خلال نهجين متكاملين: الاستفادة من الثقة في الكشف وتعزيز مؤشرات الهوية. ويتموضع JerseyTrack عند تقاطع هذين النهجين من خلال تنظيم استخدام المؤشرات الدلالية للقميص وفقاً لجودة الكشف، بدلاً من تطبيق معلومات اللون ورقم اللاعب بشكل موحد على جميع عمليات الكشف.

تقدم هذه الدراسة JerseyTrack، وهي طريقة لتتبع كائنات متعددة (MOT) في الرياضات موجهة بالثقة وتعتمد على الدمج الدلالي لقمصان الرياضيين. صُممت هذه الطريقة لمقاطع فيديو الرياضات الجماعية التي يرتدي فيها الرياضيون قمصانًا مرئية، حيث توفر نتائج الكشف صناديق إحاطة مع درجات ثقة. يجمع JerseyTrack بين أربعة مكونات رئيسية: الكشف عن الرياضيين، وتقسيم مستويات الثقة، واستخراج الميزات الدلالية للقمصان، والربط المتتالي بين الإطارات. تُستخدم ثقة الكشف لتقسيم عمليات الكشف تكيفيًا إلى مجموعات عالية ومتوسطة ومنخفضة الثقة، والتي يتم معالجتها باستخدام استراتيجيات ربط مختلفة. يتم ربط عمليات الكشف عالية الثقة بشكل أساسي من خلال معلومات الحركة، بينما تدمج عمليات الكشف متوسطة ومنخفضة الثقة بالإضافة إلى ذلك معلومات لون القميص ورقم اللاعب لتحسين الحفاظ على الهوية عندما تكون الأدلة المرئية ضعيفة. تهدف هذه الطريقة إلى مهام تحليل مقاطع الفيديو الرياضية التي تتطلب مسارات مستقرة للرياضيين، مثل التحليل التكتيكي وتفسير سلوك اللاعبين.

كما أن النهج المقترح لديه قيود تشغيلية؛ إذ قد يتأثر الاستخراج الدلالي للقميص بالانسداد الشديد، أو ضبابية الحركة، أو انخفاض دقة الصورة، أو وضعيات القميص غير الطبيعية، أو عدم رؤية أرقام اللاعبين. وفي هذه الحالات، قد تصبح الإشارات الدلالية القائمة على القميص غير مكتملة، وتعتمد عملية الربط بشكل أكبر على اتساق الحركة والتحقق متعدد الإطارات. وبناءً على ذلك، فإن ادعاءات الأداء في هذه الدراسة تقتصر على مجموعات البيانات المقيّمة والإعدادات التجريبية. وتظهر التجارب على مجموعة بيانات SportsMOT أن JerseyTrack يحسن مقاييس التتبع المقيّمة ويقلل من أحداث تبديل الهوية في ظل ظروف تتبع الرياضة المختبرة. تكمن الصعوبة الرئيسية لتتبع الأجسام المتعددة (MOT) في الفيديوهات الرياضية في الحفاظ على استمرارية المسار واتساق الهوية في ظل الحركة السريعة، والانسداد، وتشابه المظهر. ويمكن تصنيف الدراسات الحالية ذات الصلة بـ JerseyTrack بشكل عام إلى اتجاهين بحثيين: استخدام ثقة الكشف لربط المسارات، وتعزيز إشارات الهوية من خلال الميزات الدلالية الخاصة بالرياضة.

لقد استُخدمت ثقة الكشف (detection confidence) على نطاق واسع لتقدير موثوقية صناديق الكشف وتوجيه ربط المسارات في تتبع الأجسام المتعددة (MOT). كانت طرق التتبع المبكرة تعامل الثقة عادةً كمعيار تصفية ثنائي، حيث يتم إزالة عمليات الكشف التي تقل عن عتبة ثابتة لتقليل الإيجابيات الكاذبة11,12. وتؤدي هذه الاستراتيجية إلى تقليل عمليات الكشف المشوشة، ولكنها قد تتسبب أيضاً في استبعاد أهداف حقيقية تحت ظروف الاحتجاب، أو الحركة السريعة، أو جودة الصورة المنخفضة، مما ينتج عنه تفتت في المسارات13,14,15. كما أظهرت استراتيجيات تصفية مماثلة أن عتبات الثقة الثابتة تكون حساسة للتغيرات في المشهد وجودة الكشف16,17. ولتحسين الاستفادة من عمليات الكشف ذات الثقة المنخفضة، قدم ByteTrack استراتيجية ربط تحتفظ بالصناديق ذات الثقة المنخفضة كأهداف مرشحة للمطابقة الثانوية، وتربطها بالمسارات الموجودة من خلال تشابه الحركة وسجل المسار18. ويقوم McByte بتوسيع ربط MOT في الرياضات بشكل أكبر من خلال دمج أقنعة التجزئة المنتشرة زمنياً كدليل للربط، مما يحسن المتانة في ظروف الحركة السريعة، والاحتجاب، وإزاحة الكاميرا دون الحاجة إلى تدريب إضافي لكل مقطع فيديو19. كما قامت دراسات ذات صلة بتعديل استخدام عمليات الكشف ذات الثقة المنخفضة للاحتفاظ بالأهداف الضعيفة ولكن الصالحة احتماليةً أثناء عملية الربط20,21,22. لاحقاً، قامت استراتيجيات الربط التكيفية مع الثقة بتنقية معايير المطابقة وفقاً لاتساق الحركة وموثوقية الكشف23,24,25. كما استُخدمت طرق تنقية المسارات القائمة على انحدار صندوق الكشف وتحسين سلاسة المسار لتقليل تفتت المسارات26,27,28. وتوفر استراتيجيات التنقية الإضافية دعماً تكميلياً للحفاظ على استمرارية المسار في ظروف الحركة المعقدة29. علاوة على ذلك، يقوم تدفق الأجسام المتسق زمنياً بنمذجة الاتساق الزمني على مستوى الجسم عبر الإطارات، مما يوفر نهجاً آخر موجهاً للربط لتقليل انقطاع المسارات في سيناريوهات MOT المعقدة30. كما تتعلم طرق دمج المتتبعات من مخرجات متتبعات متعددة وتستخدم استراتيجيات اختيار أو دمج قائمة على التعلم لتحسين متانة التتبع عبر معايير MOT المختلفة31. وبشكل جماعي، تشير هذه الدراسات إلى أن الربط المدرك للثقة يساعد في استعادة المسارات المنقطعة؛ ومع ذلك، فإن أدلة الثقة والحركة توفر معلومات محدودة عن الهوية عندما يكون للاعبين من نفس الفريق مظاهر بصرية متشابهة. ورغم أن هذه الطرق تخفف بفعالية من تفتت المسارات في السيناريوهات العامة، إلا أنها تواجه قيوداً متأصلة في الإعدادات الرياضية لأن اللاعبين في الفريق نفسه غالباً ما يمتلكون مظاهر بصرية متشابهة للغاية، والاعتماد فقط على معلومات الثقة والحركة لا يمكن أن يوفر أساساً كافياً لتمييز الهوية32,33,34. وحتى عند استعادة الصناديق ذات الثقة المنخفضة بفعالية، يمكن أن يؤدي تشابه الميزات إلى تبديل الهوية، مما يجعل من الصعب تلبية المتطلبات الصارمة لاتساق الهوية في التحليل الرياضي.

استُخدمت مؤشرات الهوية الخاصة بالرياضة أيضاً لتحسين تمييز الهوية في تتبع الرياضيين. توفر المعلومات الدلالية للقمصان، مثل لون الفريق ورقم اللاعب، مؤشرات هوية ترتبط بسيناريوهات الرياضة بشكل مباشر أكثر من تمثيلات المظهر العامة35,36,37. وقد استُخدم لون القميص لدعم التمييز على مستوى الفريق وتقليل الخلط بين الفرق، بينما يوفر التعرف على رقم اللاعب مؤشراً أدق للهوية عندما تكون منطقة الرقم مرئية وقابلة للقراءة38,39. وقد دمجت دراسات تتبع الرياضة الحالية الميزات البصرية الخاصة بالمجال والتعرف على لون القميص لتحسين ربط اللاعبين في الظروف الرياضية المزدحمة40,41. كما يدعم العمل ذو الصلة حول التعرف على رقم القميص وبيانات الأرقام الاصطناعية نمذجة الهوية في ظروف الدقة المنخفضة أو الانسداد الجزئي42,43. وتشير هذه الدراسات إلى أن دلالات القمصان يمكن أن تعزز تمثيل الهوية في تتبع الأهداف المتعددة (MOT) في الرياضة. ومع ذلك، فإن معظم طرق التتبع المعززة دلالياً لا تضع نموذجاً كافياً للعلاقة بين ثقة الكشف وجودة الميزات الدلالية. فقد تحتوي عمليات الكشف ذات الثقة العالية بالفعل على معلومات مكانية ومظهرية موثوقة، مما يجعل الاستخراج الدلالي المتكرر أقل كفاءة. بينما تعاني عمليات الكشف ذات الثقة المنخفضة غالباً من الانسداد، أو الضبابية، أو القطع، أو انخفاض الدقة، مما يقلل من موثوقية مؤشرات اللون ورقم اللاعب. يدفع هذا القصور نحو تصميم ربط موجه بالثقة، حيث يتم إدخال دلالات القمصان وفقاً لجودة الكشف بدلاً من تطبيقها بشكل موحد على جميع عمليات الكشف. وتظهر الدراسات المراجعة أن الربط المدرك للثقة ونمذجة دلالات القمصان يعالجان جوانب مختلفة من تتبع الأهداف المتعددة في الرياضة؛ حيث تحدد الاستراتيجيات القائمة على الثقة بشكل أساسي ما إذا كان يجب أن يشارك الكشف في عملية الربط وكيفية مطابقته مع المسارات الموجودة، بينما تعمل استراتيجيات دلالات القمصان أساساً على تعزيز تمثيل الهوية من خلال مؤشرات خاصة بالرياضة. ومع ذلك، غالباً ما يتم تصميم هاتين الآليتين كمكونات منفصلة. ونتيجة لذلك، لا يتم ضبط المؤشرات الدلالية دائماً وفقاً لجودة الكشف، ولا تنظم مستويات الثقة بشكل مباشر استخدام معلومات اللون ورقم اللاعب أثناء عملية الربط. يحد هذا الفصل من المعالجة المشتركة لتجزئة المسار والخلط في الهوية في فيديوهات الرياضات الجماعية. وتكمن الفجوة البحثية المتبقية في ربط تقييم جودة ثقة الكشف مع الربط الدلالي للقمصان ضمن سير عمل تتبع واحد.

البروتوكول

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

تضمنت هذه الدراسة تحليلاً ثانوياً لمجموعات بيانات فيديو مرجعية متاحة للعامة، وهي SportsMOT و TeamTrack و SoccerNet Tracking و MOT17 و MOT20. لم يتم استقطاب أي مشاركين، ولم يتم إجراء أي تدخل، كما لم يتم جمع أي بيانات جديدة من بشر. لم يتطلب هذا البحث موافقة لجنة الأخلاقيات بموجب المتطلبات المؤسسية المعمول بها في جامعة بانكوك ثونبوري (Bangkok Thonburi University).

يصف البروتوكول التالي سير العمل المستخدم لإعادة إنتاج JerseyTrack، بدءاً من تحضير البيانات وصولاً إلى تقييم التتبع. يشمل سير العمل تحضير مجموعة البيانات، وتحضير الكاشف، والاستخلاص الدلالي للقمصان، وتقسيم مستويات الثقة، والربط الموجه بالثقة، واستنتاج التتبع، وتقييم الأداء، كما هو ملخص في الشكل 1. تم إدراج البرامج ومجموعات البيانات وموارد الأجهزة المطلوبة في جدول المواد.

figure-protocol-1
الشكل 1. سير العمل العام لمنهجية JerseyTrack. يتكون سير العمل من استخراج السمات الدلالية للقميص، والمطابقة الأولية للكائنات، والمطابقة التكميلية الموجهة بالثقة، ودمج السمات. يتم استخراج سمات لون الفريق ورقم اللاعب من مناطق الرياضيين المكتشفة ودمجها في عملية الربط لتحسين مطابقة المسار في ظل ظروف الكشف غير المؤكدة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

1. تحضير مجموعات البيانات وهيكل المجلدات

  1. قم بتنزيل مجموعات بيانات المقارنة المرجعية العامة المدرجة في جدول المواد. استخدم SportsMOT كمجموعة البيانات الأساسية لتجهيز الكاشف وتقييم التتبع. احتفظ بكل من TeamTrack وSoccerNet Tracking وMOT17 وMOT20 لغرض التقييم عبر مجموعات البيانات المختلفة.
  2. قم بتخزين جميع مجموعات البيانات تحت دليل مشروع موحد. تأكد من أن الكاشف، ووحدة الاستخراج الدلالي، ووحدة التتبع، ومجموعة أدوات التقييم تستخدم معرفات تسلسل متطابقة.
  3. حول تعليقات SportsMOT الرسمية إلى تنسيق تدريب الكاشف باستخدام نص برمجي لتجهيز البيانات المستخدم في هذه الدراسة. نفذ الأمر التالي:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. يتوفر النص البرمجي لتجهيز البيانات (scripts/prepare_data.py) في مستودع الكود المصدري لـ JerseyTrack عبر الرابط (https://doi.org/10.5281/zenodo.21274352). تم تحديد تبعات البرمجيات المطلوبة في ملف environment.yml، بما في ذلك Python 3.12 وPyTorch 2.11.0 وOpenCV 4.10 أو إصدار أحدث. قم بتكوين البيئة البرمجية باستخدام الأمر التالي: conda env create -f environment.yml. نفذ النص البرمجي لتجهيز البيانات باستخدام الأمر التالي: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. تحقق من أن عملية التحويل قد أنتجت ملف تكوين تدريب الكاشف: data\processed\SportsMOT_yolo\data.yaml وبيان التحويل: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    ملاحظة: في هذه الدراسة، احتوت مجموعة بيانات تدريب وتحقق SportsMOT المحولة على 90 تسلسلاً، و55,544 إطاراً، و608,152 كائناً معلماً.
  6. افحص تسلسلات ممثلة للتحقق من أن ترتيب الإطارات، وإحداثيات صناديق الإحاطة، وملصقات الهوية تظل متوافقة مع تعليقات المقارنة المرجعية الأصلية.
  7. حافظ على ملفات التعليقات المحولة دون تعديل طوال مراحل تجهيز الكاشف، واستدلال التتبع، والتقييم، بحيث تستخدم جميع الطرق نفس تقسيم مجموعة البيانات وبروتوكول التقييم.
    ملاحظة: النتيجة المتوقعة من هذا القسم هي دليل تدريب كاشف SportsMOT موحد يحتوي على التعليقات المحولة، وبيان التحويل، وملفات تقسيم مجموعة البيانات المطلوبة لتجهيز الكاشف وتقييم التتبع.

2. تحضير مخرجات الكاشف

  1. قم بضبط كاشف الكائنات بدقة باستخدام مجموعة تدريب SportsMOT المُعدة. قم بتحسين الكاشف باستخدام خسارة التصنيف وخسارة انحدار المربع المحيط المحددة في المعادلة 1. استخدم دقة إدخال الكاشف، وحجم الدفعة، ومعدل التعلم، وعدد حقبات التدريب، ومعلمات التدريب الأخرى الواردة في إعداد التنفيذ وجدول المواد
    Ldet = Lcls + Lbox   (1)
    هنا،  تشير Ldet  إلى إجمالي خسارة الكاشف، وتشير Lcls  إلى خسارة التصنيف، وتشير Lbox  إلى خسارة انحدار المربع المحيط.
    ملاحظة: تم تدريب نقطة فحص الكاشف المستخدمة في التجارب الأساسية (المعرف الداخلي للتجربة e3) باستخدام إطار عمل Ultralytics YOLO مع تكوين مجموعة بيانات SportsMOT بتنسيق YOLO‏ (data/processed/SportsMOT_yolo/data.yaml). قم بتنفيذ تدريب الكاشف باستخدام الأمر التالي: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. بعد التدريب، استخدم نقطة الفحص ذات الأداء الأفضل الناتجة لإنشاء مخرجات الكاشف لتسلسلات التحقق باستخدام الأمر التالي: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. احفظ نقطة فحص الكاشف المدربة، وملف البيانات الوصفية المقابل، وسجل التدريب بعد انتهاء التدريب.
    ملاحظة: في هذه الدراسة، تم حفظ نقطة فحص الكاشف المستخدمة في التجارب الرسمية كـ:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. وتم حفظ ملف البيانات الوصفية المقابل كـ: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. وكان دليل مخرجات الكاشف المستخدم لتجارب التحقق الرئيسية من SportsMOT هو: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. قم بتشغيل الكاشف المدرب على كل تسلسل تحقق لإنشاء المربعات المحيطة بالرياضيين ودرجات الثقة. قم بتصدير ملف كشف واحد لكل تسلسل يحتوي على فهرس الإطار، وإحداثيات المربع المحيط، وثقة الكشف، وتسمية الفئة.
    ملاحظة: في عملية التحقق من SportsMOT المستخدمة في التجارب الرئيسية، أدى استخدام عتبة ثقة بقيمة 0.05 إلى توليد 343,990 عملية كشف للرياضيين.
  4. افحص دليل مخرجات الكاشف قبل استنتاج التتبع. تأكد من أن كل تسلسل له ملف كشف مقابل، وأن فهارس الإطارات تطابق تسلسل الصور المُعد، وأن كل سجل كشف يحتوي على درجة ثقة.
    ملاحظة: النتيجة المتوقعة من هذا القسم هي دليل مخرجات كاشف كامل يعمل كمدخل لاستخراج دلالات القمصان، وتقسيم مستويات الثقة، وارتباط التتبع.

3. استخراج الميزات الدلالية للقميص

  1. استخدم ملفات مخرجات الكاشف لقص مناطق الرياضيين من كل إطار فيديو. احفظ كل صورة مقصوصة للرياضي مع معرف التسلسل، وفهرس الإطار، وفهرس الكشف. استبعد القصص غير الصالحة التي تحتوي على محتوى صور مفقود أو مربعات إحاطة تمتد خارج حدود الصورة. حافظ على الربط بين اسم ملف كل قص وسجل الكشف الأصلي الخاص به بحيث يمكن مطابقة الميزات الدلالية المستخرجة مع عملية الكشف المقابلة أثناء ربط التتبع.
  2. استخرج ميزات لون القميص من صور الرياضيين المقصوصة باستخدام نص استخراج الميزات الدلالية المستخدم في هذه الدراسة.
    ملاحظة: تتوفر نصوص استخراج الميزات الدلالية (scripts/extract_fast_color_semantics.py و scripts/formal_extract_semantics.py) في مستودع الكود المصدري لـ JerseyTrack عبر (https://doi.org/10.5281/zenodo.21274352). لا يلزم وجود ملف تكوين منفصل؛ حيث يتم تقديم جميع معاملات التشغيل من خلال وسائط سطر الأوامر.
    قم بتوليد واصفات لون القميص باستخدام الأمر التالي: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. قم بتوليد الميزات الدلالية لرقم اللاعب باستخدام نموذج OCR عبر الأمر التالي: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. يتم ربط واصفات لون القميص ومخرجات احتمالية رقم اللاعب الناتجة عن طريق معرف التسلسل وتُدمج في ملفات الميزات الدلالية المستخدمة أثناء ربط التتبع.
  3. حول كل صورة مقصوصة للرياضي إلى فضاء الألوان Hue, Saturation, Value (HSV). استخرج بكسلات المقدمة من منطقة القميص ولخّص لون القميص السائد باستخدام تجميع K-means حيث K = 3. قم بتطبيع واصف اللون الناتج باستخدام تطبيع L2 قبل مقارنة الميزات.
  4. درب فرع التعرف على رقم اللاعب باستخدام صور الرياضيين المقصوصة بحجم إدخال 128 × 64 بكسل. قم بتوليد تسميات وهمية لأرقام اللاعبين باستخدام إجراء التوسيم بإشراف ضعيف المستخدم في هذه الدراسة. استبعد القصص التي تحتوي على مناطق أرقام لاعبين غير مرئية، أو غير مقروءة، أو محجوبة بشدة، أو ذات ثقة منخفضة من حساب خسارة التعرف الضوئي على الحروف (OCR).
  5. قم بتحسين فرع OCR باستخدام خسارة الإنتروبيا المتقاطعة المحددة في المعادلة 2.
    figure-protocol-2 (2)
    هنا، يشير Locr إلى خسارة OCR، ويشير yi  إلى تسمية رقم اللاعب الخاضعة للإشراف، وتشير figure-protocol-3 إلى فئة رقم اللاعب المتوقعة.
  6. قم بتحسين وحدة استخراج الميزات الدلالية باستخدام المُحسّن التكيفي، ومعدل التعلم، وحجم الدفعة، واضمحلال الوزن، ومدة التدريب المدرجة في جدول المواد. ادمج خسارة الكاشف وخسارة OCR باستخدام هدف التدريب الإجمالي المحدد في المعادلة 3.
    Ltotal = Ldet + γLocr   (3)
    هنا، يشير Ltotal إلى إجمالي خسارة التدريب، ويشير Ldet إلى خسارة الكاشف المحددة في المعادلة 1، ويشير Locr إلى خسارة OCR المحددة في المعادلة 2، وتشير γ إلى معامل الوزن المحدد من قبل المستخدم لخسارة OCR.
  7. طبق فرع OCR المدرب على كل صورة مقصوصة للرياضي. احفظ فئة رقم اللاعب المتوقعة أو متجه الاحتمالية لكل قص. إذا كان رقم اللاعب غير مرئي أو كانت ثقة OCR أقل من العتبة المحددة في التنفيذ، فسجل ميزة رقم اللاعب على أنها غير متوفرة بدلاً من فرض توقع.
  8. ادمج واصف لون القميص ومخرجات رقم اللاعب في ملف الميزات الدلالية المستخدم بواسطة وحدة التتبع.
    ملاحظة: في عملية تحقق SportsMOT الرئيسية، عالج نص الاستخراج الدلالي 343,990 عملية كشف دون وجود إطارات مفقودة أو قصص غير صالحة. في حزمة المراجعة الحالية، سجل ملخص الاستخراج الدلالي دقة إجمالية لاستخراج دلالات اللون وOCR بلغت 86.7% في ظل إعدادات SportsMOT التي تم تقييمها. النتيجة المتوقعة من هذا القسم هي ملف ميزات دلالية يتم فيه ربط كل سجل كشف صالح بواصف لون القميص، ومخرجات رقم اللاعب عند توفرها، وعلامة تشير إلى ما إذا كانت المعلومات الدلالية متاحة لربط التتبع.

4. مستويات الثقة في اكتشاف التقسيم

  1. قم بتحميل ملف مخرجات الكاشف لكل تسلسل فيديو. اجمع درجات الثقة لجميع عمليات رصد الرياضيين في كل إطار.
  2. قسم درجات الثقة على مستوى الإطار إلى فترات ثقة عالية ومتوسطة ومنخفضة باستخدام تجميع K-means مع K = 3، باتباع سير عمل الربط الموجه بالثقة الموضح في الشكل 2. حدد عتبات الثقة التكيفية عن طريق تقليل التباين داخل التجمع وفقاً لـ المعادلة 4.
    figure-protocol-4  (4)
    هنا، يشير sd إلى درجة الثقة لعملية الرصد d؛ وتشير D1، و D2، و D3 إلى فترات الثقة العالية والمتوسطة والمنخفضة على التوالي؛ وتشير μ1، و μ2، و μ3 إلى متوسط درجات الثقة للفترات الثلاث؛ و τ1 و τ2 تشيران إلى عتبات الثقة التكيفية التي تم الحصول عليها من نتائج تجميع K-means.
    ملاحظة: يتوفر برنامج تقسيم الثقة (scripts/formal_partition_confidence.py) في مستودع الكود المصدري لـ JerseyTrack عبر الرابط (https://doi.org/10.5281/zenodo.21274352). تستخدم وحدة تقسيم الثقة إجراء تجميع K-means أحادي البعد يعتمد على NumPy مع K = 3. لا يتطلب الأمر ملف تكوين منفصل؛ حيث يتم تحديد دليل الإدخال، ودليل المخرجات، ومعامل التجميع من خلال وسائط سطر الأوامر. قم بتنفيذ إجراء تقسيم الثقة باستخدام الأمر التالي: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. يتم تحديد التبعيات البرمجية المطلوبة، بما في ذلك إصدار NumPy، في ملف environment.yml.
  3. قم بتشغيل إجراء تقسيم الثقة باستخدام دليل مخرجات الكاشف كمدخل.
    ملاحظة: في هذه الدراسة، كان دليل مخرجات الكاشف هو: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. وكان دليل مخرجات تقسيم الثقة هو: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. تضمنت ملفات المخرجات الناتجة ملفات CSV لدرجة الثقة لكل تسلسل، و _confidence_frame_summary.csv، و _confidence_runtime.csv.
  4. خصص تسمية لمستوى الثقة لكل عملية رصد. صنف عمليات الرصد ذات الثقة العالية للربط القائم على الحركة، وعمليات الرصد ذات الثقة المتوسطة للربط الدلالي الحركي، وعمليات الرصد ذات الثقة المنخفضة لاستعادة المسار فقط. احتفظ بدرجة الثقة الأصلية جنباً إلى جنب مع تسمية مستوى الثقة المخصصة.
  5. افحص توزيعات درجات الثقة والإطارات التمثيلية، كما هو موضح في الشكل 3. تحقق من أن عمليات الرصد ذات الثقة العالية تتوافق بشكل أساسي مع صناديق الإحاطة الكاملة والموثوقة للرياضيين، بينما تحتوي عمليات الرصد ذات الثقة المتوسطة والمنخفضة بشكل أساسي على عمليات رصد جزئية أو محجوبة أو مشوشة أو ضعيفة.
    ملاحظة: النتيجة المتوقعة من هذا القسم هي ملف تقسيم الثقة الذي يحتوي على فهرس الرصد، ودرجة الثقة الأصلية، ومستوى الثقة المخصص، وعتبات الثقة التكيفية على مستوى الإطار لكل عملية رصد.

figure-protocol-5
الشكل 2. استراتيجية الربط الموجهة بالثقة. يقوم سير العمل بتقسيم ثقة الكشف إلى فترات ثقة عالية، ومتوسطة، ومنخفضة باستخدام تجميع الثقة التكيفي. يتم ربط عمليات الكشف ذات الثقة العالية باستخدام تشابه الحركة، وعمليات الكشف ذات الثقة المتوسطة باستخدام تشابه الحركة والتشابه الدلالي للقميص معاً، بينما تُستخدم عمليات الكشف ذات الثقة المنخفضة لاستعادة المسار بمساعدة الدلالات مع التحقق متعدد الإطارات. يلخص اللوح الأيمن الصياغة الرياضية المستخدمة لتقسيم الثقة والربط. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

figure-protocol-6
الشكل 3. توزيع درجات ثقة الكشف. يوضح المدرج التكراري عدد صناديق الكشف عن الرياضيين ضمن خمسة فواصل ثقة لتسلسلات كرة القدم وكرة السلة والكرة الطائرة في مجموعة بيانات SportsMOT. ويوضح هذا التوزيع الاختلافات في ثقة الكاشف عبر الفئات الرياضية التي تم تقييمها. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

5. إجراء الارتباط الموجه بالثقة

  1. قم بتحميل ملف مخرجات الكاشف، وملف السمات الدلالية، وملف تقسيم الثقة لكل تسلسل فيديو. ابدأ تشغيل المتعقب باستخدام أولى عمليات الكشف الصالحة، وحافظ على حالة مسار واحدة لكل رياضي يتم تتبعه. وبالنسبة لكل إطار لاحق، تنبأ بموضع كل مسار موجود باستخدام نموذج حركة مرشح كالمان (Kalman filter).
  2. احسب تشابه الحركة بين كل مسار متوقع وعملية رصد مرشحة باستخدام مسافة ماهالانوبيس المحددة في المعادلة 5.
    figure-protocol-7  (5)
    هنا، figure-protocol-8 يشير إلى Iالمسار رقم th في الإطار ك, figure-protocol-9 يشير إلى حالة مسار التنبؤ المعتمد على مرشح كالمان، ديرجى تقديم النص الذي ترغب في ترجمته. يشير إلى اكتشاف المرشح، figure-protocol-10 يشير إلى مصفوفة التباين المشترك العكسية لحالة المسار المتوقع، و Sكلمة يشير إلى مسافة الحركة بين المسار المتوقع وعملية الكشف.
    ملاحظة: تم تنفيذ سير عمل الربط الأساسي في الملف jerseytrack/formal_tracker.py ويتم تنفيذه من خلال scripts/formal_track.py، وكلاهما متاح في مستودع الكود المصدري لـ JerseyTrack عبر الرابط (https://doi.org/10.5281/zenodo.21274352). لا يلزم وجود ملف تكوين منفصل، حيث يتم توفير جميع معاملات وقت التشغيل، بما في ذلك عتبات الثقة، والحد الأقصى لعمر التتبع، ومعاملات وزن الحركة، ووزن المسافة المركزية، من خلال وسائط سطر الأوامر. تم توفير أمر التنفيذ الكامل وإعدادات المعاملات في الخطوة 6.2. يستخدم التنفيذ خوارزمية تعيين المجموع الخطي من SciPy للمطابقة المجرية (Hungarian matching) ومكتبة NumPy للربط القائم على التكلفة.
  3. قم بتشغيل سير عمل التتبع باستخدام ملف مخرجات الكاشف، وملف السمات الدلالية، وملف تقسيم الثقة كمدخلات.
    ملاحظة: في هذه الدراسة، تم تنفيذ متتبع النواة (core tracker) في jerseytrack\formal_tracker.py، ونُفِّذ سير عمل التتبع باستخدام scripts\formal_track.py.
  4. اربط عمليات الكشف ذات الثقة العالية بالمسارات الموجودة باستخدام اتساق الحركة. حدّث المسارات المتطابقة وقم ببدء مسارات جديدة فقط عندما تستوفي عمليات الكشف ذات الثقة العالية غير المتطابقة معايير بدء المسار.
  5. افحص مخرجات الاستخراج الدلالي للقميص الموضحة في الشكل 4، وبناء متجه السمات الدلالية للقميص لكل عملية رصد من خلال دمج واصف لون الفريق وسمة رقم اللاعب وفقاً لـ المعادلة 6.
    فالمجهر الإلكتروني الماسح يبدو أن النص الذي قدمته غير مكتمل أو يحتوي على رموز غير نصية. يرجى تقديم النص الإنجليزي المراد ترجمته لضمان الدقة العلمية واللغوية في الترجمة إلى اللغة العربية.عمود;fالمعرف] (6)
    هنا، فالمجهر الإلكتروني الماسح يشير إلى متجه الميزات الدلالية المدمج، فعمود يشير إلى واصف لون الفريق، و فمعرف يشير إلى ميزة رقم اللاعب التي تم إنشاؤها بواسطة فرع التعرف الضوئي على الحروف (OCR).
  6. اربط عمليات الكشف متوسطة الثقة عن طريق دمج تشابه الحركة مع التشابه الدلالي للقمصان. احسب درجة المطابقة المدمجة وفقاً لـ المعادلة 7.
    figure-protocol-11 (7)
    هنا، Sالمجهر الإلكتروني الماسح يشير إلى تشابه جيب التمام بين متجهات السمات الدلالية للمسار وعملية الكشف المرشحة، Sتطوير النماذج (Model Development) يشير إلى مسافة الحركة المحددة في المعادلة 5، و λ يشير إلى معامل الاندماج التكيفي الذي يوازن بين مصطلحي التشابه الحركي والتشابه الدلالي.
  7. احسب معامل الاندماج التكيفي وفقاً لـ المعادلة 8.
    figure-protocol-12 (8)
    هنا، λيشير إلى معامل وزن الحركة الأولي، σsd يشير إلى الانحراف المعياري لدرجات الثقة في الكشف في الإطار الحالي، و σالحد الأقصى يشير إلى الانحراف المعياري الأقصى لدرجة الثقة المستخدم في عملية التسوية.
  8. استخدم عمليات الكشف ذات الثقة المنخفضة لاستعادة المسار فقط. ولا تطابق عمليات الكشف ذات الثقة المنخفضة مع المسارات المنقطعة إلا عند توفر معلومات دلالية واستيفاء معايير الاستعادة. وقم بتطبيق التحقق متعدد الإطارات قبل استعادة هوية المسار، مع استبعاد عمليات الكشف التي تفشل في التحقق.
    ملاحظة: عند عدم توفر ميزة رقم اللاعب، يتم إجراء الربط باستخدام المعلومات الدلالية المتاحة واتساق الحركة بدلاً من فرض مطابقة رقم اللاعب. النتيجة المتوقعة لهذا القسم هي سجل تتبع لكل إطار يتضمن هويات المسارات، ومربعات الإحاطة، وتسميات مستوى الثقة، وتكاليف الحركة، والمعلومات الدلالية، وقرارات الربط النهائية. في حزمة أدلة المراجعة، تم تخزين نتائج التتبع تحت المسار التالي: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
الشكل 4. استخراج السمات الدلالية للقمصان. تم تدوين عمليات اكتشاف ممثلة للرياضيين مع واصفات ألوان الفريق ومعلومات أرقام اللاعبين المستخرجة بواسطة وحدة استخراج السمات الدلالية للقمصان. ومن ثم يتم دمج السمات الدلالية المستخرجة في عملية ربط البيانات الموجهة بالثقة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

6. تشغيل استدلال التتبع وتصدير النتائج

  1. قم بتشغيل استدلال التتبع لكل تسلسل فيديو باستخدام ملفات مخرجات الكاشف، وملفات السمات الدلالية، وملفات تقسيم الثقة التي تم إعدادها. قم بمعالجة إطارات الفيديو بترتيب زمني بحيث يتم تحديث حالات المسار، والسجل الدلالي، وقرارات استعادة المسار بشكل متسق طوال التسلسل. استخدم تهيئة الاستدلال نفسها لجميع التسلسلات التي يتم تقييمها، ما لم يتم الإبلاغ صراحةً عن إعداد خاص بمجموعة بيانات معينة.
    ملاحظة: تم تنفيذ استدلال التتبع باستخدام scripts/formal_track.py، والمتاح في مستودع الكود المصدري لـ JerseyTrack عبر الرابط (https://doi.org/10.5281/zenodo.21274352). لا يلزم وجود ملف تهيئة منفصل. قم بتنفيذ استدلال التتبع باستخدام الأمر التالي: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. احتفظت جميع المعلمات غير المحددة بالقيم الافتراضية المسجلة في الكود المصدري المؤرشف.
  2. بعد عملية الاستدلال، قم بتطبيق تسلسل المعالجة اللاحقة الأساسي باستخدام الأوامر التالية: python scripts/merge_tracklets.py و python scripts/sweep_track_filter.py --min-len 95.
  3. قم بتصدير نتائج التتبع بالتنسيق المطلوب من قبل مجموعة أدوات التقييم. قم بتضمين فهرس الإطار، وهوية المسار، وإحداثيات مربع الإحاطة، وجميع الحقول المطلوبة في تنسيق تقييم المعيار. احفظ ملف نتيجة تتبع واحد لكل تسلسل باستخدام اصطلاح تسمية ملفات متسق بحيث يمكن مطابقة كل ملف نتائج مع ملف تعليقات الحقيقة الأرضية المقابل له.
  4. طبق فقط عمليات المعالجة اللاحقة المستخدمة في هذه الدراسة. قم بدمج المسارات الصغيرة (tracklets) وتصفية المسارات باستخدام سكربتات المعالجة اللاحقة الموضحة في حزمة المراجعة.
    ملاحظة: في هذه الدراسة، استخدم سير عمل المعالجة اللاحقة السكربتات التالية:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. افحص نتائج التتبع المصدرة قبل التقييم الكمي. تأكد من أن هويات المسارات تظل رقمية ومتسقة داخل كل تسلسل، وأنه لا توجد فهارس إطارات مفقودة، وأن جميع مربعات الإحاطة تظل ضمن حدود الصورة.
    ملاحظة: النتيجة المتوقعة من هذا القسم هي مجموعة كاملة من ملفات نتائج التتبع على مستوى التسلسل الجاهزة للتقييم الكمي.

7. تقييم أداء التتبع

  1. قم بتقييم ملفات نتائج التتبع المصدرة باستخدام مجموعة أدوات التقييم المدرجة في جدول الموادقم بمطابقة كل ملف لنتائج التتبع مع ملف التعليقات التوضيحية المرجعي (ground-truth) وتقسيم مجموعة البيانات المقابل له. استخدم تهيئة التقييم نفسها لجميع الطرق المقارنة لضمان أن تكون الاختلافات في الأداء ناشئة عن نتائج التتبع وليس عن إعدادات التقييم.
  2. قم بتشغيل التقييم باستخدام الأمر التالي
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _الجولة1\الحد_الأدنى_للطول95 --مجلد_المخرجات outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    ملاحظة: أُجري التقييم باستخدام تطبيق مقياس TrackEval القياسي (الإصدار 1.3.0) المؤرشف ضمن حزمة إعادة الإنتاجية JerseyTrack. ولم يتم إجراء أي تعديلات على تطبيقات مقاييس دقة التتبع من الرتبة العليا (HOTA)، أو CLEAR، أو مقياس الهوية (Identity). يتضمن المستودع غلاف تنفيذ على نمط MOTChallenge الموجود في المسار evaluation/trackeval/scripts/run_mot_challenge.py، والذي يقوم بتكوين مسارات مجموعة البيانات والنتائج واستدعاء مقاييس تقييم TrackEval القياسية.
  3. سجل مقاييس التقييم الواردة في المخطوطة، بما في ذلك دقة تتبع الكائنات المتعددة (MOTA)، ودرجة F1 للهوية (IDF1)، ودقة التتبع من الرتبة الأعلى (HOTA)، ودقة الكشف (DetA)، ودقة الربط (AssA)، والإيجابيات الكاذبة (FPs)، والسلبيات الكاذبة (FNs)، وأحداث تبديل الهوية. قم بتصدير ملخص التقييم في جدول، واحتفظ بملفات التقييم الخاصة بكل تسلسل لأغراض التحقق.
  4. عند مقارنة JerseyTrack بالطرق المرجعية، استخدم نفس تقسيم مجموعة البيانات، ومخرجات الكاشف، وتكوين التقييم لجميع الطرق. قم بتسجيل مجموعة البيانات، ومصدر مخرجات الكاشف، وتكوين مجموعة أدوات التقييم، وقيم المقاييس لكل مقارنة.
  5. افحص سجلات التقييم للتحقق من تقييم جميع التسلسلات بنجاح وعدم فقدان أي من ملفات نتائج التتبع.
    ملاحظة: في هذه الدراسة، تم تخزين ملف ملخص TrackEval الأساسي في: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    الجولة 1\الحد الأدنى للطول 95\تقييم المسار\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. والنتيجة المتوقعة من هذا القسم هي جدول ملخص تقييم كامل، إلى جانب ملفات المقاييس الخاصة بكل تسلسل والتي تدعم النتائج المسجلة والتحقق اللاحق.

النتائج

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يعرض هذا القسم النتائج الكمية والنوعية التي تم الحصول عليها من تجارب تتبع الأشياء المتعددة في الرياضات التي تم تقييمها. وتركز النتائج على دقة التتبع، والحفاظ على الهوية، وجودة الربط، والمتانة في ظل إعدادات مجموعة البيانات المختبرة. تقتصر ادعاءات الأداء على الطرق المقيّمة، ومجموعات البيانات، ومخرجات الكاشف، وتكوين مجموعة أدوات التقييم الموصوفة في البروتوكول وإعداد التنفيذ.

الإعداد التجريبي وتصميم التقييم

مجموعة البيانات والمعالجة المسبقة:

استُخدمت مجموعة بيانات SportsMOT كمرجع أساسي لتجهيز الكاشف، واستدلال التتبع، والتقييم الكمي. تحتوي مجموعة البيانات هذه على 240 تسلسلاً فيديو وأكثر من 150,000 إطار صوري تشمل سيناريوهات كرة القدم، وكرة السلة، والكرة الطائرة (الشكل 5). وفي التقييم الرسمي، حُسبت نتائج SportsMOT الرئيسية باستخدام تقسيم التحقق (validation split) جنباً إلى جنب مع مخرجات الكاشف، وتكوين التتبع، وإعدادات TrackEval الموضحة في البروتوكول. كما أُجري تقييم عبر مجموعات البيانات على TeamTrack وSoccerNet Tracking وMOT17 وMOT20 لفحص مدى انتقال الأداء عبر أنواع مختلفة من مجموعات البيانات بدلاً من إجراء مقارنات مباشرة على مستوى المقاييس بين مجموعات البيانات.

figure-results-1
الشكل 5. مجموعات بيانات تمثيلية مستخدمة للتقييم. توضح الإطارات النموذجية تسلسلات تمثيلية لكرة القدم، وكرة السلة، والكرة الطائرة المستخدمة في التقييم التجريبي. ويسلط الشكل الضوء على التباينات في وجهة نظر الكاميرا، وكثافة اللاعبين، وتعقيد المشهد عبر مجموعات البيانات التي تم تقييمها. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

نُظمت بيانات SportsMOT وفقاً لبنية مجموعة البيانات الرسمية، وحُوّلت إلى تنسيق تدريب الكاشف الموضح في البروتوكول. احتوت بيانات التدريب والتحقق من SportsMOT المُحوَّلة على 90 تسلسلاً، و55,544 إطاراً، و608,152 جسماً مُعلماً. استُخدم قسم التدريب لإعداد الكاشف وضبط المعلمات، بينما استُخدم قسم التحقق لإجراء تقييم التتبع الرسمي الوارد في هذه الدراسة. أُعيد تحجيم جميع إطارات الإدخال وفقاً لتكوين الكاشف المذكور في البروتوكول و... جدول الموادطُبِّق إجراء المعالجة المسبقة ذاته أثناء تحضير الكاشف، واستخراج الميزات الدلالية، والاستدلال على التتبع، وتقييم TrackEval، وذلك لضمان أن تعكس الاختلافات المُبلغ عنها استراتيجية ربط التتبع بشكل أساسي بدلاً من الاختلافات في معالجة البيانات.

مؤشرات التقييم:

تم تقييم أداء التتبع باستخدام بروتوكول تقييم متوافق مع MOTChallenge تم تنفيذه باستخدام مجموعة أدوات التقييم المدرجة في جدول المواد. وتصف المقاييس المسجلة ثلاثة جوانب من أداء MOT في الرياضات: دقة التتبع الإجمالية، والحفاظ على الهوية، وجودة الربط بالكشف. وقد استُخدمت مقاييس MOTA وIDF1 وHOTA كـمقاييس تقييم أساسية44,45. حيث يلخص MOTA الإيجابيات الكاذبة، والسلبيات الكاذبة، وتبديلات الهوية في درجة إجمالية لدقة التتبع. ويقيس IDF1 الاتساق بين المسارات المتوقعة وهويات الحقيقة الأرضية. أما HOTA فيقيم بشكل مشترك دقة الكشف ودقة الربط، وبالتالي يحدد التوازن بين تحديد موقع الهدف وربط المسار. كما تم تسجيل DetA وAssA كمقاييس تكميلية. واستُخدمت FPs وFNs وتبديلات الهوية (IDs) لتوصيف مصادر الخطأ المتعلقة بالكشوفات الكاذبة، والكشوفات المفقودة، وتغيرات الهوية. ولإجراء المقارنات بين الطرق المتبعة في SportsMOT، استُخدمت نفس مخرجات الكاشف وتكوين مجموعة أدوات التقييم لتقليل تأثير تباين الكاشف والاختلافات في إعدادات التقييم. وبالنسبة للمقارنات عبر مجموعات البيانات، فقد تم تفسير قيم المقاييس كـنتائج تقييم داخل مجموعة البيانات الواحدة بدلاً من كونها دليلاً على تفوق الأداء المطلق عبر مجموعات البيانات المختلفة.

تهيئة البيئة التجريبية والمعاملات:

أُجريت التجارب باستخدام موارد الأجهزة والبرامج المدرجة في جدول المواد. وقد استُخدمت نفس البيئة الحوسبية، وإطار عمل الكاشف، ومخرجات الكاشف، ومجموعة أدوات التقييم طوال تجارب SportsMOT الأساسية للحفاظ على الاتساق أثناء تحضير الكاشف، واستدلال التتبع، وتقييم الأداء. تم تدريب إطار عمل الكاشف المدرج في جدول المواد باستخدام حجم دفعة (batch size) قدره 16، ومعدل تعلم أولي قدره 0.01، و80 حقبة تدريبية (training epochs). وفي وحدة استخراج الدلالات الخاصة بالقميص، استخدم تجميع الألوان خوارزمية K-means بقيمة K = 3، واستخدم فرع التعرف الضوئي على الحروف (OCR) شبكة عصبية تكرارية تلافيفية خفيفة الوزن بحجم إدخال 128 × 64 بكسل. تم تحسين فرع OCR باستخدام المحسن التكيفي المدرج في جدول المواد بمعدل تعلم 1 × 10⁻3، واضمحلال وزن (weight decay) قدره 1 × 10⁻5، وحجم دفعة 64، و40 حقبة تدريبية. لم يُستخدم أي جدولة إضافية لمعدل التعلم أثناء تدريب وحدة استخراج الميزات الدلالية. عُومل معامل ترجيح خسارة OCR (γ) كمعلمة فائقة يحددها المستخدم، واختير بناءً على أداء مجموعة التحقق. استخدم تقسيم مستويات الثقة تقسيم K-means التكيفي، حيث تم حساب τ₁ وτ₂ من توزيع ثقة الكشف لكل إطار بدلاً من تحديدها يدوياً قبل الاستدلال.

تتبع الأداء عبر مختلف الرياضات وتعقيد السيناريوهات

الأداء الكمي تحت ظروف رياضية وظروف مشهدية مختلفة:

تم تقييم أداء التتبع وفقاً لعاملين للتجميع: فئة الرياضة وتعقيد المشهد. شمل تحليل فئة الرياضة تسلسلات لكرة القدم، وكرة السلة، والكرة الطائرة. أما تحليل تعقيد المشهد فقد نظر في مستوى الانسداد، وسرعة الحركة، وكثافة الأهداف باستخدام معايير التجميع نفسها عبر التسلسلات التي تم تقييمها. واتبعت المقاييس المسجلة بروتوكول التقييم الموضح في القسم 7 من البروتوكول. 

يلخص الشكل 6 نتائج التتبع الكمي تحت فئات رياضية وظروف تعقيد مشهد مختلفة. يوضح الشكل 6A قيم MOTA و DetA عبر تسلسلات كرة القدم وكرة السلة والكرة الطائرة. ويوضح الشكل 6B تباين MOTA تحت مستويات مختلفة من الانسداد وسرعة الحركة وكثافة الأهداف. أما الشكل 6C فيوضح أعداد FP و FN التراكمية لكل بُعد من أبعاد تعقيد المشهد.

figure-results-2
الشكل 6. أداء التتبع عبر الفئات الرياضية وظروف المشاهد. (A) دقة تتبع الكائنات المتعددة (MOTA) ودقة الكشف (DetA) لكرة القدم، وكرة السلة، والكرة الطائرة، والمتوسط العام. (B) مقياس MOTA عبر ظروف مشاهد تمثيلية بمستويات مختلفة من الاحتجاب، وكثافة اللاعبين، وتعقيد الحركة. (C) أعداد الإيجابيات الكاذبة (FPs) والسلبيات الكاذبة (FNs) عبر ظروف المشاهد التي تم تقييمها. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

عبر فئات الرياضات الثلاث، حقق نظام JerseyTrack متوسط MOTA بنسبة 88.9% ومتوسط DetA بنسبة 80.2%. وبلغ الفرق في MOTA بين فئات الرياضات 1.3 نقطة مئوية، حيث سُجلت أعلى قيمة لـ MOTA في تتابعات الكرة الطائرة (89.2%) وأدنى قيمة في تتابعات كرة السلة (87.9%). وتتسق قيمة MOTA المنخفضة الملاحظة في تتابعات كرة السلة مع ارتفاع وتيرة التفاعلات القريبة والانسداد الكثيف في التتابعات التي تم تقييمها. وفي ظروف المشاهد الأقل تعقيداً، بما في ذلك الانسداد الخفيف، وسرعة الحركة المنخفضة، والتوزيع المتباعد للأهداف، وصلت قيمة MOTA إلى 91.8% و93.1% و93.8% على التوالي. أما في ظروف المشاهد الأكثر تعقيداً، فقد انخفضت قيمة MOTA إلى 84.9% في حالة الانسداد الشديد، و83.6% في حالة الحركة عالية السرعة، و83.1% في حالة التوزيع الكثيف للأهداف. وتظهر هذه النتائج أن أداء التتبع انخفض مع زيادة تعقيد المشهد، بينما ظل ضمن النطاق المسجل عبر سيناريوهات الرياضات التي تم تقييمها.

تتبع الاتساق عبر سيناريوهات رياضية تمثيلية:

يعرض الشكل 7 أمثلة تتبع تمثيلية توضح الاتساق الزمني لنظام JerseyTrack في ظل ثلاثة سيناريوهات رياضية صعبة: التفاعلات الكثيفة بين اللاعبين، والاحتجاب الجزئي المطول، والتغيرات السريعة في الاتجاه. وعبر هذه المتواليات التمثيلية، حافظ المتعقب على هويات مسارات متسقة على الرغم من التداخل المتكرر بين الرياضيين والحركة الديناميكية. وقد لوحظ تفتت في الهوية بشكل أساسي أثناء الاحتجاب الشديد أو عندما أصبحت دلالات القميص غير متاحة مؤقتًا؛ ومع ذلك، مكنت استراتيجية الربط الموجهة بالثقة من استعادة المسار بعد ظهور عمليات كشف موثوقة مرة أخرى. وتدعم هذه الأمثلة التمثيلية نوعيًا النتائج الكمية الموضحة في الشكل 6 من خلال إثبات الحفاظ المستقر على الهوية في ظل ظروف التتبع الرياضي التي تم تقييمها.

figure-results-3
الشكل 7. نتائج تتبع نموذجية تم إنتاجها بواسطة JerseyTrack. توضح لقطات متتالية من تسلسلات كرة السلة وكرة القدم والكرة الطائرة الحفاظ على هويات الرياضيين ومساراتهم أثناء التتبع. تمثل المربعات المحيطة الملونة الهويات التي تم تتبعها والمحافظة عليها عبر إطارات الفيديو المتتالية. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

نتائج الاستئصال للحفاظ على الهوية:

أُجري تحليل استئصالي (ablation analysis) لفحص مساهمات استراتيجية الربط الموجه بالثقة ووحدة دمج دلالات القميص في الحفاظ على الهوية. تمت مقارنة أربعة متغيرات من النموذج: V0، وهو النموذج المرجعي بدون الربط الموجه بالثقة أو دمج دلالات القميص؛ V1، المتغير الذي يستخدم الربط الموجه بالثقة فقط؛ V2، المتغير الذي يستخدم دمج دلالات القميص فقط؛ وV3، تكوين JerseyTrack الكامل الذي يدمج كلا المكونين. ركز التقييم على المقاييس المتعلقة بالهوية، بما في ذلك IDs وIDF1 ودقة الهوية (IDP) واستدعاء الهوية (IDR). تظهر أنماط الحفاظ على الهوية التمثيلية في الشكل 8.

figure-results-4
الشكل 8. تحليل الاستئصال للارتباط الدلالي للقميص الموجه بالثقة. (A) إجمالي تبديلات الهوية (IDs) ودرجة F1 للهوية (IDF1) لمتغيرات النموذج التي تم تقييمها. (B) مقارنة تبديلات الهوية (IDs) بين النموذج الكامل (V3) والتكوين المرجعي (V0) في ظل سيناريوهات تتبع صعبة وممثلة. (C) قيم IDF1، ودقة الهوية (IDP)، واسترجاع الهوية (IDR) للنموذج الكامل عبر سيناريوهات تتبع مختلفة. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

في إطار التحقق العام من نموذج SportsMOT، حقق تكوين V3 الكامل أدنى عدد من حالات تغيير الهوية (IDs) وأعلى قيمة لـ IDF1 من بين متغيرات النموذج الأربعة. حيث سجل V3 عدد 2,768 حالة ID، وهو ما يمثل 477 عملية تبديل هوية أقل من V0، وحقق قيمة IDF1 بلغت 74.3%، مما يمثل زيادة قدرها 7.1 نقطة مئوية عن V0. وتشير هذه النتائج إلى أن الوحدتين ساهمتا معاً في الحفاظ على الهوية في ظل ظروف تتبع الرياضيين التي تم تقييمها. كما أظهرت مقارنة المتغيرات ذات الوحدة الواحدة مع التكوين الكامل أن الوحدتين أثرتا على مصادر مختلفة من أخطاء التتبع؛ حيث قللت استراتيجية الربط الموجه بالثقة من أخطاء المطابقة المرتبطة بعدم استقرار الثقة في الكشف وعدم اليقين في تحديد الموقع، بينما وفرت وحدة دمج دلالات القميص معلومات إضافية عن الهوية عندما كانت معلومات الحركة وحدها غير كافية. وقد حقق تكوين V3 الكامل أداءً أفضل فيما يتعلق بالهوية مقارنة بأي من المتغيرات ذات الوحدة الواحدة، مما يشير إلى أن الوحدتين قدما مساهمات تكميلية وليست فائضة.

أظهرت النتائج على مستوى السيناريو وجود فروق أكبر في ظل ظروف الحفاظ على الهوية الأكثر تحدياً. فخلال فترات الحجب طويلة المدة، سجل V3 عدد 215 ID مقارنة بـ 482 لـ V0. وفي سيناريوهات الفريق الواحد الكثيفة التي تضم من 6 إلى 10 لاعبين، سجل V3 عدد 328 ID مقارنة بـ 615 لـ V0. وتحت تأثير التغيرات الاتجاهية عالية السرعة، سجل V3 عدد 482 ID مقارنة بـ 960 لـ V0. وتتسق هذه الانخفاضات مع الاستخدام المقصود للإشارات الدلالية أثناء الحجب والتفاعلات الكثيفة، ومع الربط الموجه بالثقة في ظل تذبذب ثقة الكشف أثناء الحركة السريعة. وتشير اتجاهات IDP وIDR الموضحة في Figure 8C إلى أن الانخفاض في عدد IDs لم يصاحبه انخفاض جوهري في دقة الهوية (identity precision) أو استرجاع الهوية (identity recall). وقد حافظ التكوين الكامل على قيم IDF1 أعلى من 71% عبر السيناريوهات الصعبة التي تم تقييمها، مع ملاحظة قيم أقل في ظل التفاعلات الكثيفة للفريق الواحد والتغيرات الاتجاهية عالية السرعة. وتشير هذه النتائج إلى تحسن في اتساق الهوية تحت الظروف التي تم تقييمها، مع تحديد التفاعلات الكثيفة والحركة السريعة كمصادر رئيسية متبقية لتدهور الأداء.

نتائج التقييم عبر مجموعات البيانات:

أُجري تقييم عبر مجموعات بيانات مختلفة لفحص ما إذا كان سلوك التتبع الملحوظ في SportsMOT يمكن الحفاظ عليه في ظل ظروف مجموعات بيانات مختلفة. شمل التقييم مجموعتي بيانات خاصتين بالرياضة، وهما SoccerNet Tracking وTeamTrack، ومجموعتي بيانات عامتين للتتبع متعدد الأجسام (MOT)، وهما MOT17 وMOT20. وكان الغرض من هذه التجربة هو فحص انتقال الأداء عبر أنواع مختلفة من مجموعات البيانات. ولم تُستخدم النتائج للادعاء بتفوق مباشر على مستوى المقاييس عبر مجموعات البيانات لأن بروتوكولات التعليق التوضيحي، وتكوين المشهد، وزوايا رؤية الكاميرا، وفئات الأهداف تختلف فيما بينها.

الجدول 1 يلخص نتائج التقييم عبر مجموعات البيانات المختلفة. في مجموعات البيانات الخاصة بالرياضة، حافظ JerseyTrack على قيم MOTA وIDF1 مستقرة نسبياً مقارنة بإعدادات التحقق الرئيسية لـ SportsMOT. يشير هذا الاتجاه إلى أن استراتيجية الربط الموجهة بالثقة والإشارات الدلالية المتعلقة بالقميص ظلت فعالة عندما احتفظت مشاهد التتبع بالخصائص البصرية للرياضات الجماعية، بما في ذلك الزي الموحد المتكرر، والتفاعلات الكثيفة بين الرياضيين، والانسداد المتكرر. أما في مجموعات بيانات MOT العامة، فقد حافظت الطريقة على قيم MOTA وDetA تنافسية، بينما كانت قيمة IDF1 أقل مما لوحظ في مجموعات البيانات الخاصة بالرياضة. يتفق هذا النمط مع غياب إشارات لون القميص وأرقام اللاعبين في MOT17 وMOT20، والتي يستخدمها نموذج الاندماج الدلالي. وتحت هذه الظروف، ظل مكون الربط الموجه بالثقة قابلاً للتطبيق، بينما ساهم الفرع الدلالي بمعلومات أقل تحديداً للهوية مقارنة بما قدمه في فيديوهات الرياضات الجماعية. وبشكل عام، تشير هذه النتائج إلى أن JerseyTrack انتقل بفعالية أكبر إلى مجموعات البيانات التي تحتوي على دلالات بصرية رياضية متخصصة مقارنة بمجموعات بيانات تتبع المشاة العامة. وبناءً على ذلك، يدعم التقييم عبر مجموعات البيانات التطبيق المقصود لهذه الطريقة كمتتبع موجه نحو الرياضة، مع تحديد غياب الدلالات الصريحة للقمصان كعامل محدد لمجموعات بيانات MOT غير الرياضية.

مجموعة البياناتMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

الجدول 1: نتائج التقييم عبر مجموعات البيانات المختلفة. أداء تتبع JerseyTrack الذي تم تقييمه على أربع مجموعات بيانات مرجعية عامة. تم تسجيل دقة تتبع الكائنات المتعددة (MOTA)، ودرجة F1 للهوية (IDF1)، ودقة الكشف (DetA)، وسرعة المعالجة المقاسة بعدد الإطارات في الثانية (FPS). تشير القيم الأعلى إلى أداء أفضل بالنسبة لـ MOTA وIDF1 وDetA وFPS.

المتانة تحت ظروف الاضطراب الخاضعة للرقابة

أُجريت تجارب اضطراب محكومة لفحص استقرار نظام JerseyTrack تحت تأثير الاضطرابات الشائعة في الرؤية وجودة الكشف التي تظهر في مقاطع الفيديو الرياضية. وقد صُنفت الاضطرابات التي تم تقييمها إلى ثلاث فئات: اضطراب الميزات الدلالية، واضطراب صندوق الكشف، والاضطراب البيئي. شملت اضطرابات الميزات الدلالية حجب رقم اللاعب، وتشويه الصورة (blur)، وتدهور الدقة، وتشابه ألوان القمصان. وشملت اضطرابات صندوق الكشف إزاحة صندوق الإحاطة، وتقلب الثقة في الكشف، وصناديق الكشف الخاطئة. أما الاضطرابات البيئية فشملت الضوضاء الشبيهة بالمطر، والتدهور الشبيه بالضباب، والإضاءة القوية، وتداخل الظلال. ويلخص الشكل 9 أداء التتبع في ظل ظروف الاضطرابات هذه. ففي حالة اضطراب الميزات الدلالية، انخفض أداء التتبع مع تدهور رؤية رقم اللاعب وجودة الاقتصاص. وعندما تم حجب 40% من منطقة رقم اللاعب، انخفض مقياس MOTA بمقدار 3.2 نقطة مئوية وانخفض IDF1 بمقدار 5.3 نقطة مئوية بالنسبة إلى حالة عدم وجود اضطراب، بينما ظلت دقة الاستخراج الدلالي عند 86.7%. وتشير هذه النتائج إلى أن لون القميص وإشارات رقم اللاعب قد وفرتا معلومات تكميلية عندما أصبحت إحدى الإشارات الدلالية أقل موثوقية. وفي حالة اضطراب صندوق الكشف، أظهرت الطريقة تدهوراً متوسطاً في الأداء بدلاً من الفشل المفاجئ؛ فعندما أزيحت صناديق الكشف بمقدار ±10 بكسل وتم إدخال ضوضاء غاوسية على درجات الثقة، ظل الانخفاض في MOTA دون 3 نقاط مئوية، وظلت الزيادة في IDs ضمن نطاق 16%. ويتسق هذا الاتجاه مع استراتيجية الربط الموجهة بالثقة، والتي يتم فيها معالجة عمليات الكشف ذات الثقة المتوسطة والمنخفضة باستخدام قيود ربط إضافية بدلاً من اتباع نفس الاستراتيجية المطبقة على عمليات الكشف ذات الثقة العالية.

figure-results-5
الشكل 9. تقييم المتانة تحت تأثير اضطرابات متحكم بها. (A) التغيرات في دقة تتبع الأشياء المتعددة (MOTA)، ودرجة F1 للهوية (IDF1)، وتبديلات الهوية (IDs) مع زيادة حجب أرقام القمصان. (B) تدهور الأداء تحت ظروف تداخل تمثيلية. (C) الزيادة في تبديلات الهوية (IDs) تحت أنواع مختلفة من التداخل. (D) دقة استخراج دلالات القميص تحت ظروف الاضطراب التي تم تقييمها. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

في ظل الاضطرابات البيئية، ظل الانخفاض في مقاييس التتبع الأساسية دون 5 نقاط مئوية تحت الظروف التي تم تقييمها، وبقيت دقة الاستخراج الدلالي عند 87.2%. وقد أدى استخدام واصفات الألوان القائمة على نموذج HSV إلى تقليل الحساسية تجاه تغيرات الإضاءة، بينما احتفظ فرع OCR بمعلومات أرقام اللاعبين القابلة للاستخدام في مجموعة فرعية من قصاصات الصور الضبابية أو المتدهورة. وتشير هذه النتائج إلى أن الوحدة الدلالية ظلت قابلة للاستخدام في ظل ظروف الاضطراب التي تم تقييمها، رغم أن موثوقيتها ظلت تعتمد على مدى رؤية القميص وجودة القصاصة. وبوجه عام، أظهرت تجارب الاضطراب المنضبطة أن JerseyTrack حافظ على أداء تتبع قابل للقياس تحت الاضطرابات الدلالية، وجودة الكشف، والاضطرابات البيئية التي خضعت للتقييم. وينبغي تفسير هذه النتائج ضمن نطاق الاضطراب الذي تم اختباره. ولم يتم تقييم إعادة التعرف المنهجي خارج نطاق الرؤية، أو الفوضى الشديدة في الخلفية، أو الانسداد الكامل طويل الأمد بشكل منفصل في هذه التجربة، وسيتم مناقشتها كقيود في قسم المناقشة.

تحليل مساهمة الوحدة وتمييز السمات

تم تحليل مساهمة الوحدات والتمييز بين الميزات بشكل أكبر لفحص كيفية تأثير المكونين المقترحين على أداء التتبع المرتبط بالهوية. استخدم تحليل مساهمة الوحدات المتغيرات الأربعة للنموذج المحددة في تحليل الاستئصال، بينما قارن تحليل التمييز بين الميزات ميزات Re-ID التقليدية، والميزات المعتمدة على اللون فقط، والميزات المعتمدة على رقم اللاعب فقط، وميزات دلالات القميص المدمجة. استُخدمت نسبة المسافة بين الفئات/داخل الفئة لوصف قابلية فصل الميزات، حيث تشير القيم الأكبر إلى فصل أكبر بين الهويات المختلفة مقارنة بالتباين داخل الهوية نفسها. يلخص الجدول 2 تحليل مساهمة الوحدات. في التقييم العام، كانت المساهمة المقدرة لاستراتيجية الربط الموجهة بالثقة 41.7%، والمساهمة المقدرة لدمج دلالات القميص 47.6%، بينما عُزي الـ 10.7% المتبقية إلى الاستخدام المشترك للمكونين. تشير هذه القيم إلى أن كلا المكونين قد ساهما في التحسن الملحوظ، في حين استفاد التكوين الكامل من استخدامهما معاً بدلاً من الاعتماد على أي مكون بمفرده. وقد تباين نمط المساهمة عبر أنواع المشاهد؛ ففي حالات الاحتجاب الشديد، ارتفعت المساهمة المقدرة لدمج دلالات القميص إلى 69.4%، وهو ما يتفق مع انخفاض موثوقية إشارات الحركة عندما يكون الرياضيون محجوبين جزئياً أو مؤقتاً. أما في حالات الحركة عالية السرعة، فقد وصلت المساهمة المقدرة للربط الموجه بالثقة إلى 44.3%، ووصل الكسب المشترك إلى 20.6%، مما يشير إلى أن تقسيم مستوى الثقة أصبح أكثر أهمية عندما تذبذبت ثقة الكشف بسبب الحركة السريعة أو عدم اليقين في تحديد الموقع.

متغير النموذجسيناريو الاختبارMOTA↑IDF1↑IDs↓مساهمة الوحدةالربح التآزري
V0 (الأساسي)المشهد العام83.567.23245
مشاهد محجوبة بشدة77.861.53862
مشهد حركة عالية السرعة77.162.33689
V1 (الربط الموجه بالثقة)المشهد العام86.370.9289341.7
مشاهد محجوبة بشدة80.965.9341529.8
مشهد حركة عالية السرعة81.467.9302444.3
V2 (الربط الدلالي للقميص)المشهد العام85.271.8293747.6
مشاهد محجوبة بشدة82.772.8275369.4
مشهد حركة عالية السرعة80.166.8315735.1
V3 (JerseyTrack الكامل)المشهد العام88.974.3276810.7
مشاهد محجوبة بشدة84.975.626890.8
مشهد حركة عالية السرعة83.671.5284220.6

الجدول 2: تحليل الاستئصال لمساهمات الوحدات. مقارنة الأداء لمتغيرات مختلفة من نموذج JerseyTrack في سيناريوهات عامة، وسيناريوهات الانسداد الشديد، وسيناريوهات الحركة عالية السرعة. يتم تقرير دقة تتبع الكائنات المتعددة (MOTA)، ودرجة F1 للهوية (IDF1)، وعدد تبديلات الهوية (IDs) جنبًا إلى جنب مع مساهمة الوحدة المقدرة والمكسب التآزري. تشير القيم الأعلى إلى أداء أفضل بالنسبة لـ MOTA وIDF1 ومساهمة الوحدة والمكسب التآزري، بينما تشير القيم الأدنى إلى أداء أفضل بالنسبة لـ IDs.

الجدول 3 يلخص تحليل تمييز السمات. حققت السمة الدلالية المدمجة للقميص نسبة مسافة بين الفئات/داخل الفئة بلغت 5.63، مقارنة بـ 1.82 لسمات Re-ID التقليدية، وهو ما يقابل تحسناً نسبياً قدره 209.3% في مقياس نسبة المسافة. كما أدت السمات المعتمدة على اللون فقط أو على رقم اللاعب فقط إلى تحسين قابلية فصل السمات مقارنة بسمات Re-ID التقليدية، على الرغم من أن كل مؤشر فردي ظل عرضة لحالات فشل محددة، بما في ذلك تشابه ألوان الفريق، وحجب رقم اللاعب، وضبابية الحركة، ومناطق القميص غير المقروءة. ومن بين تمثيلات السمات التي تم تقييمها، حقق التمثيل الدلالي المدمج أعلى قابلية لفصل السمات، وهو ما يقابل أعلى قيمة IDF1 وأقل عدد ID تم رصده في تحليل الاستئصال. وتدعم هذه النتائج استخدام المؤشرات الدلالية الخاصة بالقميص كمعلومات هوية تكميلية لتتبع الأجسام المتعددة (MOT) في الرياضات عندما يكون للرياضيين مظاهر متشابهة وتكون معلومات الحركة وحدها غير كافية. تقتصر هذه الملاحظات على إعدادات SportsMOT التي تم تقييمها، ولا ينبغي تفسيرها كدليل على أن دلالات القميص تحل جميع غموض الهوية في كل فيديو رياضي.

نوع الميزةنسبة المسافة بين الفئات/داخل الفئةالتحسن النسبي (%)IDF1↑IDs↓
ميزات إعادة التعريف التقليدية1.8265.73482
ميزات لون الفريق3.1774.269.83125
ميزات رقم اللاعب3.4991.870.53018
الميزات الدلالية المدمجة للقميص5.63209.374.32768

الجدول 3: تحليل التمييز لتمثيلات الميزات المختلفة. مقارنة لتمييز الميزات باستخدام ميزات إعادة التعرف (Re-ID) التقليدية، وميزات لون القميص، وميزات رقم اللاعب، والميزات الدلالية المدمجة. تم تسجيل نسبة المسافة بين الفئات إلى المسافة داخل الفئة، والتحسن النسبي في تمييز الميزات، ودرجة F1 للهوية (IDF1)، وعدد تبديلات الهوية (IDs). تشير القيم الأعلى إلى أداء أفضل بالنسبة لنسبة المسافة، والتحسن النسبي، وIDF1، بينما تشير القيم الأقل إلى أداء أفضل بالنسبة لـ IDs.

مقارنة مرجعية مع طرق تتبع الأجسام المتعددة (MOT) الحالية

أُجريت مقارنة مرجعية لمقارنة JerseyTrack مع طرق تتبع الأهداف المتعددة (MOT) التمثيلية تحت نفس إعدادات التحقق من SportsMOT. وقد شملت الطرق المقارنة كلاً من QDTrack وDeepSORT وByteTrack وFairMOT وDeep OC-SORT وMOTR. استخدمت جميع الطرق نفس مخرجات الكاشف التي تم إنتاجها بواسطة إطار الكشف المدرج في جدول المواد، وذلك لتركيز المقارنة على أداء ربط التتبع بدلاً من التباين في الكاشف. واعتمد التقييم على المقاييس المحددة في القسم 7 من البروتوكول. شملت مقاييس التقييم الأساسية MOTA وHOTA وIDF1، بينما شملت المقاييس المساعدة DetA وAssA وFPs وFNs وIDs. يلخص الجدول 4 المقارنة الكمية على مجموعة التحقق من SportsMOT، ويعرض الشكل 10 مقارنة بصرية لدقة التتبع، وسرعة الاستدلال، وتوزيع HOTA عبر المشاهد الرياضية التي تم تقييمها. حقق JerseyTrack أعلى قيمة MOTA بين الطرق المقارنة، حيث وصلت إلى 88.9%. وكانت هذه القيمة أعلى بـ 1.1 نقطة مئوية من قيمة Deep OC-SORT (87.8%) وأعلى بـ 2.5 نقطة مئوية من قيمة ByteTrack (86.4%). وبناءً على ذلك، حقق JerseyTrack أعلى دقة تتبع إجمالية بين الطرق المقارنة تحت إعدادات التحقق من SportsMOT التي تم تقييمها. وبالنسبة لـ HOTA، حقق JerseyTrack نسبة 69.9%، مقارنة بـ 64.4% لـ Deep OC-SORT و62.8% لـ ByteTrack. وتتوافق هذه الفروق مع تحسينات قدرها 5.5 و7.1 نقطة مئوية على التوالي، مما يشير إلى توازن أعلى بين أداء الكشف والربط تحت نفس إعدادات التقييم.

الطريقةمؤشر التحدب والمنطقة المتاحة (MOTA)↑HOTA↑عامل التمايز التحريضي 1 (IDF1)↑ديت إيه (DetA)↑AssA↑بروتين فلوري (FP)↓فن (FN)↓المعرفات↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
بايت تراك (ByteTrack)86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
مستقبل الموتورين (MOTR)82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

الجدول 4: مقارنة أداء JerseyTrack وطرق تتبع الأجسام المتعددة التمثيلية على مجموعة التحقق لـ SportsMOT.مقارنة JerseyTrack مع طرق تتبع الأجسام المتعددة (MOT) التمثيلية على مجموعة بيانات التحقق SportsMOT. تشمل المقاييس المسجلة دقة تتبع الأجسام المتعددة (MOTA)، ودقة التتبع من الرتب العليا (HOTA)، ودرجة F1 للهوية (IDF1)، ودقة الكشف (DetA)، ودقة الربط (AssA)، والإيجابيات الكاذبة (FP)، والسلبيات الكاذبة (FN)، وعدد تبديلات الهوية (IDs). تشير القيم الأعلى إلى أداء أفضل بالنسبة لـ MOTA وHOTA وIDF1 وDetA وAssA، بينما تشير القيم الأقل إلى أداء أفضل بالنسبة لـ FP وFN وIDs.

figure-results-6
الشكل 10. مقارنة الأداء مع طرق تتبع الأجسام المتعددة التمثيلية. (A) مقارنة دقة تتبع الأجسام المتعددة (MOTA) وعدد الإطارات في الثانية (FPS) لـ JerseyTrack وطرق تتبع الأجسام المتعددة التمثيلية التي تم تقييمها باستخدام مجموعة بيانات SportsMOT. (B) توزيع دقة التتبع من الرتبة الأعلى (HOTA) عبر طرق التتبع التي تم تقييمها. يرجى النقر هنا لعرض نسخة أكبر من هذا الشكل.

بالنسبة للحفاظ على الهوية، حقق JerseyTrack قيمة IDF1 بلغت 74.3%، مقارنة بـ 69.9% لـ Deep OC-SORT و67.7% لـ ByteTrack. كما سجل JerseyTrack عدد 2,768 معرفاً (IDs)، وهو أقل من 3,211 معرفاً سجلها Deep OC-SORT و4,192 معرفاً سجلها ByteTrack. وتتوافق هذه الملاحظات مع نتائج دراسة الاستئصال الموضحة في الشكل 8  والجدول 2، حيث أدت تهيئة JerseyTrack الكاملة إلى تقليل تبديل الهوية مقارنة بمتغيرات النموذج المرجعية. أما فيما يخص جودة الكشف والربط، فقد حقق JerseyTrack قيمة DetA بلغت 80.2% وقيمة AssA بلغت 54.3%. ومقارنة بـ Deep OC-SORT، حسن JerseyTrack قيمة DetA بمقدار 2.0 نقطة مئوية وقيمة AssA بمقدار 2.2 نقطة مئوية. كما سجل JerseyTrack عدداً أقل من الإيجابيات الكاذبة (FP) والسلبيات الكاذبة (FN) مقارنة بالطرق الأخرى المقارنة والمذكورة في الجدول 4، حيث سجل 21,953 FP و67,160 FN. وبشكل عام، أظهرت مقارنة المعايير أن JerseyTrack حقق أعلى القيم لمقاييس التتبع الأساسية من بين الطرق التي تم تقييمها في إطار تحقق SportsMOT. وتتفق هذه النتائج مع التحسينات الملحوظة في الحفاظ على الهوية واستقرار الربط التي تم الحصول عليها باستخدام الربط الموجه بالثقة والدمج الدلالي للقميص. وتقتصر هذه المقارنة على مخرجات الكاشف المشتركة وتهيئة تحقق SportsMOT المستخدمة في هذه الدراسة.

نتائج حساسية المعلمات

أُجري تحليل حساسية المعاملات لفحص كيفية تأثير معاملات التنفيذ الرئيسية على أداء التتبع في ظل إعدادات التحقق الخاصة بـ SportsMOT. تم تقييم ثلاثة معاملات: معامل وزن خسارة التعرف الضوئي على الحروف (γ)، وعدد العناقيد الهرمية لمستوى الثقة (K)، ومعدل تعلم شبكة التعرف الضوئي على الحروف (η). يلخص الجدول 5 قيم MOTA وIDF1 وHOTA وIDs التي تم الحصول عليها تحت إعدادات المعاملات المختلفة.

المعيارالقيمةMOTA↑IDF1↑HOTA↑IDs↓
وزن خسارة OCR (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (الأمثل)88.974.369.92,768
188.273.869.32,792
عدد عناقيد الثقة (K)286.772.168.52,876
3 (الأمثل)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
معدل تعلم OCR (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (الأمثل)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

الجدول 5: تحليل حساسية المعاملات. أداء التتبع الذي تم الحصول عليه باستخدام إعدادات معاملات مختلفة لنظام JerseyTrack. تم تسجيل دقة تتبع الكائنات المتعددة (MOTA)، ومقياس F1 للهوية (IDF1)، ودقة التتبع من الرتبة العليا (HOTA)، وعدد تبديلات الهوية (IDs) لقيم مختلفة من معامل ترجيح خسارة التعرف الضوئي على الحروف (OCR) (γ)، وعدد عناقيد الثقة (K)، ومعدل تعلم التعرف الضوئي على الحروف (η). تتوافق قيم المعاملات المحددة كقيم مثلى مع الإعدادات المستخدمة في التجارب المذكورة. تشير القيم الأعلى إلى أداء أفضل بالنسبة لـ MOTA وIDF1 وHOTA، بينما تشير القيم الأقل إلى أداء أفضل بالنسبة لـ IDs.

بالنسبة لمعامل وزن خسارة التعرف الضوئي على الحروف (γ)، تم الحصول على أفضل أداء تم تقييمه عند γ = 0.8. وفي ظل هذا الإعداد، حقق JerseyTrack قيمة MOTA بلغت 88.9%، وIDF1 بنسبة 74.3%، وHOTA بنسبة 69.9%، و2,768 ID. وعندما تم خفض γ إلى 0.2، انخفضت قيم MOTA وIDF1 وHOTA إلى 84.7% و69.4% و66.2% على التوالي، بينما ارتفع عدد الـ IDs إلى 2,944. وعندما تم زيادة γ إلى 1.0، انخفضت مقاييس الأداء قليلاً مقارنة بـ γ = 0.8، حيث بلغت قيمة MOTA نسبة 88.2%، وIDF1 نسبة 73.8%، وHOTA نسبة 69.3%، و2,792 ID. وتشير هذه النتائج إلى أن عدم كفاية الإشراف على التعرف الضوئي على الحروف قد قلل من القدرة على تمييز أرقام اللاعبين، بينما لم تؤدِ زيادة وزن خسارة التعرف الضوئي على الحروف بما يتجاوز القيمة المثلى التي تم تقييمها إلى تحسين أداء التتبع في ظل الظروف المختبرة.

بالنسبة لعدد العناقيد الهرمية لمستوى الثقة (K)، تم الحصول على أفضل أداء تم تقييمه عند K = 3. يتوافق هذا الإعداد مع استراتيجية الربط ذات الثقة العالية والمتوسطة والمنخفضة الموضحة في الطريقة. وعندما كانت K = 2، كان تقسيم الثقة أقل تفصيلاً، وانخفضت قيم MOTA وIDF1 وHOTA إلى 86.7% و72.1% و68.5% على التوالي. وعندما زادت K إلى 4 أو 5، انخفض الأداء أيضاً مقارنة بـ K = 3، مما يشير إلى أن التقسيم المفرط أدى إلى توزيع عمليات الكشف على مجموعات ثقة ضيقة للغاية وقلل من استقرار استراتيجية الربط. وتدعم هذه النتائج استخدام ثلاثة مستويات من الثقة في تكوين JerseyTrack الذي تم تقييمه.

بالنسبة لمعدل تعلم (η) شبكة التعرف الضوئي على الحروف (OCR)، تم الحصول على أفضل أداء تم تقييمه عند η = 1 × 10-3. وعند معدل تعلم أقل قدره 1 × 10-4، انخفضت قيم MOTA و IDF1 و HOTA إلى 85.9% و 70.8% و 67.3% على التوالي، بينما ارتفع عدد المعرفات (IDs) إلى 2,934. وعند معدل تعلم أعلى قدره 1 × 10-2، انخفضت قيم MOTA و IDF1 و HOTA إلى 86.5% و 71.6% و 68.7% على التوالي، بينما ارتفع عدد المعرفات (IDs) إلى 2,889. وتشير هذه النتائج إلى أن فرع OCR كان حساساً لاختيار معدل التعلم، حيث وفر المعدل 1 × 10-3 أفضل توازن بين التعرف على عدد اللاعبين وأداء الحفاظ على الهوية في ظل الظروف التي تم تقييمها.

بشكل عام، يوضح الجدول 5 أن مجموعة المعاملات γ = 0.8 و K = 3 و η = 1 × 10-3 حققت أعلى قيم مقيمة لكل من MOTA و IDF1 و HOTA، بالتزامن مع أقل عدد من معرفات الأجسام (IDs). كما أظهر تحليل الحساسية أن الانحرافات المتوسطة عن قيم هذه المعاملات أدت إلى تغييرات ملموسة، ولكن غير مفاجئة، في أداء التتبع. وبناءً على ذلك، استُخدمت إعدادات المعاملات هذه في المقارنة المرجعية وتجارب التحقق الأساسية لـ SportsMOT الواردة في هذه الدراسة.

توافر البيانات

تتوفر ملخصات التقييم الأولية، ومخرجات التتبع النهائية، وسجلات البيئة، وملفات تعيين مجموعات البيانات، وملفات الملخصات الوسيطة التي تدعم نتائج هذه الدراسة في مستودع عام على الرابط https://doi.org/10.5281/zenodo.21274353. أما مجموعات بيانات المعايير المرجعية العامة الأصلية المستخدمة في هذه الدراسة، بما في ذلك SportsMOT وTeamTrack وSoccerNet Tracking وMOT17 وMOT20، فهي متاحة من مزوديها المعنيين ولم يتم إعادة توزيعها في المستودع.

المناقشة

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

قيمت هذه الدراسة سير عمل لتتبع الأجسام المتعددة (MOT) في الرياضات موجه بالثقة، والذي يجمع بين تقسيم الكشف بناءً على الثقة وبين الإشارات الدلالية لقمصان اللاعبين. وقد تم بحث الربط الموجه بالثقة ودمج الميزات الدلالية كاستراتيجيات تكميلية لتحسين ربط البيانات في تتبع الأجسام المتعددة12,20,23,24,46. وتظهر النتائج أن تكوين JerseyTrack الكامل قد أدى إلى تحسين الحفاظ على الهوية واستقرار الربط في ظل إعدادات التحقق من SportsMOT التي تم تقييمها. وقد وصلت نتيجة التحقق الرئيسية لـ SportsMOT إلى 88.9% لـ MOTA، و69.9% لـ HOTA، و74.3% لـ IDF1، و80.2% لـ DetA، و54.3% لـ AssA. ويجب تفسير هذه القيم ضمن سياق مخرجات الكاشف، وتقسيم مجموعة البيانات، وتكوين TrackEval الموضح في البروتوكول.

تعد عملية تقسيم مستويات الثقة خطوة حاسمة في سير العمل، حيث تتيح تطبيق استراتيجيات ربط مختلفة وفقًا لمدى موثوقية مخرجات الكاشف20,22,23,24. ومن خلال فصل عمليات الكشف إلى مجموعات ذات ثقة عالية ومتوسطة ومنخفضة، يطبق JerseyTrack قواعد ربط مختلفة على عمليات الكشف ذات مستويات الموثوقية المتباينة. يتم ربط عمليات الكشف ذات الثقة العالية بشكل أساسي من خلال اتساق الحركة، بينما تستخدم عمليات الكشف ذات الثقة المتوسطة دلالات الحركة والقميص معًا. أما عمليات الكشف ذات الثقة المنخفضة، فلا تُستخدم لتهيئة مسارات جديدة، ويتم النظر فيها فقط أثناء استعادة المسار. وقد قلل هذا التصميم من خطر تسبب عمليات الكشف الضعيفة أو الإيجابيات الكاذبة في إنشاء هويات غير مستقرة، مع السماح في الوقت ذاته لعمليات الكشف الجزئية بالمساهمة في الاستعادة عند توفر أدلة دلالية إضافية8,11,20. والخطوة الحاسمة الثانية هي استخراج دلالات القميص؛ حيث توفر ميزات ألوان الفريق قيدًا على مستوى الفريق، بينما توفر ميزات أرقام اللاعبين إشارة هوية أكثر دقة عندما تكون منطقة الرقم مرئية وقابلة للقراءة35,41,42,43. وتشير نتائج دراسة الاستئصال (ablation) إلى أن هذه الإشارات تكون أكثر فائدة في حالات التفاعل الكثيف بين لاعبي الفريق الواحد وحالات الاحتجاب، حيث يكون الربط القائم على الحركة وحدها أقل موثوقية. ومع ذلك، يجب التعامل مع دلالات القميص كأدلة مساعدة وليس كبديل كامل للربط الحركي، إذ يمكن أن تكون أرقام اللاعبين غير قابلة للقراءة بسبب الضبابية، أو الاقتطاع، أو وضعيات الرؤية الخلفية، أو الاحتجاب الشديد، أو انخفاض دقة الصورة. كما لا يمكن لميزات ألوان الفريق التمييز بين الرياضيين من الفريق نفسه عند عدم توفر معلومات الرقم35,42,43. وتوضح نتائج مجموعات البيانات المتقاطعة نطاق عمل هذه الطريقة بشكل أكبر؛ فقد انتقل JerseyTrack بشكل أكثر طبيعية إلى مجموعات بيانات الرياضات الجماعية مقارنة بمجموعات بيانات تتبع الأجسام المتعددة (MOT) للمشاة بشكل عام، لأن الفرع الدلالي صُمم بناءً على لون القميص وإشارات أرقام اللاعبين19,33,34,35,36,37. وفي مجموعات بيانات MOT العامة، ظل مكون الربط الموجه بالثقة قابلًا للتطبيق، ولكن الفرع الدلالي الخاص بالرياضة ساهم بقدر أقل من معلومات الهوية. وبناءً على ذلك، فإن هذه الطريقة هي الأكثر ملاءمة لمقاطع فيديو الرياضات الجماعية التي يرتدي فيها الرياضيون زيًا مميزًا وتكون منطقة القميص مرئية بما يكفي للاستخراج الدلالي19,33,34,35,36,37.

لا تزال هناك عدة قيود. أولاً، تعتمد الطريقة على جودة مخرجات الكاشف؛ حيث تؤدي حالات الإخفاق الشديدة في الكشف أو صناديق الإحاطة غير الدقيقة إلى تقليل موثوقية كل من التنبؤ بالحركة والاقتصاص الدلالي14,17,46. ثانياً، لم يتم تحسين إعادة التعريف طويلة المدى خارج نطاق الرؤية بشكل منفصل في التنفيذ الحالي. فعندما يغادر الرياضي مجال رؤية الكاميرا لفترة طويلة ثم يعود لاحقاً، قد لا تكون استراتيجية استعادة المسار الحالية كافية لاستعادة الهوية الأصلية19,34. ثالثاً، يمكن أن يؤدي التشويش الشديد في الخلفية، وتداخل اللاعبين، وضبابية الحركة، وأرقام القمصان غير المقروءة إلى تقليل موثوقية الميزات الدلالية14,35,42,46. رابعاً، ركز التقييم الحالي على مجموعات البيانات المرجعية العامة وإعدادات الاضطراب المتحكم بها؛ وقد يتطلب النشر في فيديوهات البث التي تحتوي على قطع في الكاميرا، وتغييرات في التكبير، ووجهات نظر غير قياسية، وحدات معالجة مسبقة إضافية أو وحدات لإعادة التعريف19,33,34.

تتمثل النتيجة العملية الرئيسية في إمكانية دمج الربط الموجه بالثقة والإشارات الدلالية الخاصة بالقمصان في مسار عمل نمطي لتتبع الكائنات المتعددة (MOT) دون تغيير هيكل الكاشف. وتطبق هذه القدرة في مهام تحليل الرياضات مثل استخراج مسارات الرياضيين، وتحليل حركة الفريق، ومراجعة الأحداث التكتيكية، وتوصيف الفيديو شبه التلقائي1,4,33,36. ويجب أن تركز الأعمال المستقبلية على تحسين إعادة التعرف عند الخروج من مجال الرؤية، ومعالجة تشويش الخلفية، وتجميع الميزات الزمنية، والتعرف الأكثر قوة على أرقام اللاعبين في حالات الضبابية الشديدة أو الاحتجاب14,19,34,46.

باختصار، يُعد JerseyTrack طريقة لتتبع الأجسام المتعددة (MOT) في الرياضات، تجمع بين الربط الموجه بالثقة والدمج الدلالي للقمصان. تقوم هذه الطريقة بتقسيم عمليات الكشف إلى مجموعات ذات ثقة عالية ومتوسطة ومنخفضة، وتطبق قواعد ربط مختلفة وفقاً لموثوقية الكشف، بينما تستخدم لون القميص ودلائل رقم اللاعب كمعلومات هوية مساعدة أثناء الربط متوسط الثقة واستعادة المسار. وفي إطار إعدادات التحقق من SportsMOT التي تم تقييمها، أظهر JerseyTrack تحسناً في دقة التتبع والحفاظ على الهوية مقارنة بتكوينات الخط الأساسي التي تم تقييمها. وأظهرت نتائج دراسة الاستئصال أن التكوين الكامل قلل من تبديلات الهوية مقارنة بالخط الأساسي والمتغيرات أحادية الوحدة، كما أظهرت مقارنة المعيار قيمًا أعلى لمقاييس التتبع الرئيسية تحت تكوين مخرجات الكاشف والتقييم المشترك. وتدعم هذه النتائج استخدام معلومات مستوى الثقة والدلائل الدلالية الخاصة بالقميص لتتبع الرياضيين في فيديوهات الرياضات الجماعية، لا سيما عندما تكون مناطق القميص مرئية وعندما يوفر لون الفريق أو معلومات رقم اللاعب أدلة هوية تكميلية20,35,46. وقد يؤدي معالجة القيود المحددة إلى تحسين قابلية تطبيق سير العمل المقترح في سيناريوهات تتبع رياضية أكثر تحدياً.

الإفصاحات

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

يصرح المؤلفون بأنه لا توجد لديهم أي تضاربات في المصالح المالية.

شكر وتقدير

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

ليس لدى المؤلفين أي شكر لتقديمه.

المواد

قائمة المواد المستخدمة في هذه المقالة
الاسمالشركةرقم فهرسيالتعليقات
CUDA RuntimeNVIDIAVersion 12.8بيئة تشغيل الحوسبة باستخدام وحدة معالجة الرسوميات (GPU) المستخدمة لتدريب الكاشف، واستخراج الميزات الدلالية، واستنتاج التتبع.
EasyOCRJaided AIVersion 1.7.2مجموعة أدوات التعرف الضوئي على الحروف المستخدمة للتعرف على أرقام اللاعبين.
JerseyTrack source codeAuthorsN/Aتنفيذ مخصص يحتوي على برمجيات إعداد البيانات، واستخراج الميزات الدلالية، وتقسيم الثقة، والتتبع، وما بعد المعالجة، والتقييم. متاح على: https://doi.org/10.5281/zenodo.21274352
Lightweight CRNN OCR modelAuthorsN/Aشبكة عصبية تكرارية تلافيفية (CRNN) مخصصة وخفيفة الوزن مستخدمة للتعرف على أرقام اللاعبين.
MOT17 datasetMOTChallengeN/Aمجموعة بيانات مرجعية عامة مستخدمة للتقييم عبر مجموعات البيانات. متاحة من: https://motchallenge.net/data/MOT17/
MOT20 datasetMOTChallengeN/Aمجموعة بيانات مرجعية عامة مستخدمة للتقييم عبر مجموعات البيانات. متاحة من: https://motchallenge.net/data/MOT20/
motmetricsmotmetrics DevelopersVersion 1.4.0مكتبة مستخدمة لحسابات مقاييس تتبع الأجسام المتعددة التشخيصية.
NVIDIA GPUNVIDIAGeForce RTX 5090 D V2وحدة معالجة الرسوميات المستخدمة لتدريب الكاشف واستنتاج التتبع.
NVIDIA GPU DriverNVIDIAVersion 610.62برنامج تشغيل وحدة معالجة الرسوميات المستخدم في البيئة التجريبية.
NumPyNumPy DevelopersVersion 2.4.4مكتبة الحوسبة العددية المستخدمة لمعالجة الميزات والتعامل مع البيانات.
OpenCVOpenCVVersion 4.10.0مكتبة الرؤية الحاسوبية المستخدمة لتحميل الصور، واقتصاصها، ومعالجتها مسبقاً، وتصورها.
PythonPython Software FoundationVersion 3.12.2لغة البرمجة المستخدمة في كامل سير العمل.
PyTorchPyTorch FoundationVersion 2.11.0+cu128إطار عمل التعلم العميق المستخدم لتنفيذ الكاشف والنماذج الدلالية.
scikit-learnscikit-learn DevelopersVersion 1.9.0مكتبة تعلم الآلة المستخدمة لتجميع K-means أثناء استخراج ألوان القمصان وتقسيم الثقة.
SoccerNet Tracking datasetSoccerNetN/Aمرجع عام لتتبع كرة القدم مستخدم للتقييم عبر مجموعات البيانات. متاح من: https://www.soccer-net.org/tasks/tracking
SportsMOT datasetSportsMOT BenchmarkN/Aمجموعة البيانات المرجعية الأساسية المستخدمة لإعداد الكاشف وتقييم التتبع. متاحة من: https://deeperaction.github.io/datasets/sportsmot.html
TeamTrack datasetTeamTrack BenchmarkN/Aمرجع عام لتتبع الرياضة مستخدم للتقييم عبر مجموعات البيانات. متاح من: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationVersion 0.26.0+cu128مكتبة الرؤية الحاسوبية المستخدمة مع PyTorch لتحويل الصور ودعم النماذج.
TrackEvalTrackEval DevelopersVersion 1.3.0مجموعة أدوات التقييم المستخدمة لحساب دقة تتبع الأجسام المتعددة (MOTA)، ودرجة F1 للهوية (IDF1)، ودقة التتبع من الرتب العليا (HOTA)، ودقة الكشف (DetA)، ودقة الربط (AssA)، والإيجابيات الكاذبة (FP)، والسلبيات الكاذبة (FN)، وتبديلات الهوية (IDs).
UltralyticsUltralyticsVersion 8.4.90إطار عمل كشف الأجسام المستخدم لتدريب الكاشف وتوليد عمليات كشف الرياضيين.

المراجع

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

إعادة الطباعة والأذونات

طلب إذن لإعادة استخدام النص أو الأشكال في مقالة JoVE هذه

طلب إذن

الوسوم

SportsMOT

مقالات ذات صلة