$$\rightleftharpoonup{xx}$$
$$\longleftharp{xx}$$,
$$\longrightharp{xx}$$,
W tej sekcji przedstawiono ilościowe i jakościowe wyniki uzyskane w ramach ocenianych eksperymentów z zakresu wielobiektowego śledzenia w sporcie. Wyniki skupiają się na dokładności śledzenia, zachowaniu tożsamości obiektów, jakości asocjacji oraz odporności w ramach przetestowanych ustawień zbioru danych. Twierdzenia dotyczące wydajności są ograniczone do ocenianych metod, zbiorów danych, wyników detektora oraz konfiguracji zestawu narzędzi ewaluacyjnych opisanych w Protokole i Konfiguracji Implementacji.
Ustawienie eksperymentalne i projekt oceny
Zbiór danych i przetwarzanie wstępne:
Zbiór SportsMOT posłużył jako główny punkt odniesienia dla przygotowania detektora, wnioskowania śledzenia oraz oceny ilościowej. Zbiór danych zawiera 240 sekwencji wideo i ponad 150 000 klatek obrazu obejmujących scenariusze z piłki nożnej, koszykówki i siatkówki (Rysunek 5). W formalnej ocenie główne wyniki dla SportsMOT obliczono przy użyciu podziału walidacyjnego wraz z wynikami detektora, konfiguracją śledzenia i ustawieniami TrackEval opisanymi w protokole. Ewaluacja międzyzbiorowa została przeprowadzona na zbiorach TeamTrack, SoccerNet Tracking, MOT17 i MOT20 w celu zbadania transferu wydajności między różnymi typami zbiorów danych, a nie w celu bezpośredniego porównywania zestawów danych na poziomie metryk.

Rycina 5. Reprezentatywne zestawy danych wykorzystane do ewaluacji. Przykładowe klatki obrazu przedstawiają reprezentatywne sekwencje rozgrywek piłki nożnej, koszykówki i siatkówki użyte w ewaluacji eksperymentalnej. Rycina podkreśla różnice w punkcie widzenia kamery, zagęszczeniu graczy oraz złożoności scen w ewaluowanych zestawach danych. Prosimy kliknąć tutaj, aby wyświetlić większą wersję tej ryciny.
Dane SportsMOT zostały zorganizowane zgodnie z oficjalną strukturą zbioru danych i przekonwertowane na format treningu detektora opisany w Protokole. Przekonwertowane dane treningowe i walidacyjne SportsMOT obejmowały 90 sekwencji, 55 544 klatki i 608 152 adnotowane obiekty. Partycja treningowa została wykorzystana do przygotowania detektora i dostrojenia parametrów, natomiast partycja walidacyjna posłużyła do formalnej oceny śledzenia przedstawionej w niniejszym badaniu. Wszystkie klatki wejściowe zostały zmienione pod kątem rozmiaru zgodnie z konfiguracją detektora opisaną w Protokole oraz w Tabeli Materiałów. Ta sama procedura wstępnego przetwarzania była stosowana podczas przygotowania detektora, ekstrakcji cech semantycznych, wnioskowania śledzenia oraz oceny TrackEval, aby zgłaszane różnice odzwierciedlały przede wszystkim strategię asocjacji śledzenia, a nie różnice w przetwarzaniu danych.
Wskaźniki oceny:
Wydajność śledzenia została oceniona przy użyciu protokołu ewaluacyjnego zgodnego z MOTChallenge, zaimplementowanego za pomocą zestawu narzędzi ewaluacyjnych wymienionego w Tabeli Materiałów. Raportowane metryki opisują trzy aspekty wydajności MOT w sporcie: ogólną dokładność śledzenia, zachowanie tożsamości oraz jakość detekcji i asocjacji. W качестве głównych metryk ewaluacyjnych wykorzystano MOTA, IDF1 oraz HOTA44,45. MOTA podsumowuje wyniki fałszywie dodatnie, fałszywie ujemne oraz zmiany tożsamości w postaci ogólnego wyniku dokładności śledzenia. IDF1 mierzy spójność pomiędzy trajektoriami przewidywanymi a tożsamościami rzeczywistymi (ground-truth). HOTA wspólnie ocenia dokładność detekcji i dokładność asocjacji, a tym samym charakteryzuje równowagę między lokalizacją celu a asocjacją trajektorii. Jako metryki uzupełniające raportowano DetA i AssA. FP, FN oraz zmiany tożsamości (ID) wykorzystano do charakterystyki źródeł błędów związanych z błędnymi detekcjami, pominiętymi detekcjami oraz zmianami tożsamości. W celu porównania metod w ramach SportsMOT zastosowano te same wyniki detektora i konfigurację zestawu narzędzi ewaluacyjnych, aby zminimalizować wpływ zmienności detektora i różnic w ustawieniach ewaluacji. W przypadku porównań między zbiorami danych wartości metryk interpretowano jako wyniki ewaluacji wewnątrz zbioru, a nie jako dowód absolutnej przewagi wydajności między różnymi zbiorami danych.
Konfiguracja środowiska eksperymentalnego i parametrów:
Eksperymenty przeprowadzono przy użyciu zasobów sprzętowych i programowych wymienionych w Tabeli Materiałów. W głównych eksperymentach SportsMOT stosowano to samo środowisko obliczeniowe, strukturę detektora, wyjścia detektora oraz zestaw narzędzi ewaluacyjnych, aby zachować spójność podczas przygotowania detektora, wnioskowania śledzenia i oceny wydajności. Struktura detektora wymieniona w Tabeli Materiałów została przeszkolona przy rozmiarze partii (batch size) wynoszącym 16, początkowej szybkości uczenia 0,01 oraz 80 epokach uczenia. W module semantycznej ekstrakcji koszulek do klastrowania kolorów wykorzystano algorytm K-means z K = 3, a gałąź OCR wykorzystała lekką splotową rekurencyjną sieć neuronową z rozmiarem wejścia 128 × 64 pikseli. Gałąź OCR zoptymalizowano przy użyciu adaptacyjnego optymalizatora wymienionego w Tabeli Materiałów z szybkością uczenia 1 × 10⁻3, zanikiem wag (weight decay) 1 × 10⁻5, rozmiarem partii 64 i 40 epokami uczenia. Podczas uczenia modułu ekstrakcji cech semantycznych nie stosowano dodatkowego harmonogramowania szybkości uczenia. Współczynnik wagowy straty OCR (γ) traktowano jako hiperparametr definiowany przez użytkownika i dobierano na podstawie wydajności zestawu walidacyjnego. Stratyfikacja poziomu ufności wykorzystywała adaptacyjny podział K-means, w którym τ₁ i τ₂ były obliczane na podstawie rozkładu ufności detekcji dla każdej klatki, a nie definiowane ręcznie przed wnioskowaniem.
Monitorowanie wydajności w różnych dyscyplinach sportowych i przy różnym stopniu złożoności scenariuszy
Wydajność ilościowa w różnych dyscyplinach sportowych i warunkach otoczenia:
Wydajność śledzenia oceniano w ramach dwóch czynników grupowania: kategorii sportu oraz złożoności sceny. Analiza kategorii sportowych obejmowała sekwencje piłki nożnej, koszykówki i siatkówki. Analiza złożoności sceny uwzględniała poziom przesłonięcia, prędkość ruchu oraz gęstość obiektów, stosując te same kryteria grupowania we wszystkich ocenianych sekwencjach. Raportowane metryki były zgodne z protokołem oceny opisanym w rozdziale 7 Protokołu.
Rysunek 6 podsumowuje wyniki ilościowego śledzenia w różnych kategoriach sportowych i warunkach złożoności sceny. Rysunek 6A przedstawia wartości MOTA i DetA dla sekwencji piłki nożnej, koszykówki i siatkówki. Rysunek 6B przedstawia zmienność MOTA przy różnych poziomach przesłonięcia, prędkości ruchu i gęstości obiektów. Rysunek 6C przedstawia skumulowaną liczbę błędów FP i FN dla każdego wymiaru złożoności sceny.

Rysunek 6. Wydajność śledzenia w różnych kategoriach sportowych i warunkach scenicznych. (A) Dokładność śledzenia wielu obiektów (MOTA) oraz dokładność detekcji (DetA) dla piłki nożnej, koszykówki, siatkówki oraz średnia ogólna. (B) MOTA w reprezentatywnych warunkach scenicznych o różnym stopniu przesłonięcia, zagęszczeniu zawodników i złożoności ruchu. (C) Liczba fałszywie dodatnich (FP) i fałszywie ujemnych (FN) wyników w ocenianych warunkach scenicznych. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.
W trzech kategoriach sportowych JerseyTrack osiągnął średnią wartość MOTA na poziomie 88,9% oraz średnią wartość DetA wynoszącą 80,2%. Różnica w MOTA pomiędzy kategoriami sportowymi wyniosła 1,3 punktu procentowego, przy czym najwyższy wskaźnik MOTA odnotowano dla sekwencji siatkówki (89,2%), a najniższy dla sekwencji koszykówki (87,9%). Niższe MOTA zaobserwowane dla sekwencji koszykarskich jest zgodne z większą częstotliwością interakcji w bliskim zasięgu i gęstym przesłanianiem w analizowanych sekwencjach. W mniej złożonych warunkach scenicznych, obejmujących lekkie przesłanianie, niską prędkość ruchu i rzadki rozkład celów, MOTA osiągnęła odpowiednio 91,8%, 93,1% i 93,8%. W bardziej złożonych warunkach scenicznych MOTA spadła do 84,9% przy silnym przesłanianiu, 83,6% przy ruchu o wysokiej prędkości i 83,1% przy gęstym rozkładzie celów. Wyniki te pokazują, że wydajność śledzenia spadała wraz ze wzrostem złożoności sceny, pozostając jednocześnie w raportowanym zakresie we wszystkich ocenianych scenariuszach sportowych.
Śledzenie spójności w reprezentatywnych scenariuszach sportowych:
Rysunek 7 przedstawia reprezentatywne przykłady śledzenia, ilustrujące spójność czasową systemu JerseyTrack w trzech wymagających scenariuszach sportowych: gęstych interakcjach między zawodnikami, przedłużonym częściowym przesłonięciu oraz gwałtownych zmianach kierunku. W tych reprezentatywnych sekwencjach tracker zachował spójne tożsamości trajektorii pomimo częstych nakładania się sportowców i dynamicznego ruchu. Fragmentacja tożsamości była obserwowana głównie podczas silnego przesłonięcia lub w momentach, gdy semantyka koszulki stawała się tymczasowo niedostępna; jednak strategia asocjacji sterowana poziomem ufności umożliwiła odzyskanie trajektorii po ponownym pojawieniu się wiarygodnych detekcji. Przykłady te jakościowo potwierdzają wyniki ilościowe przedstawione na Rysunku 6, demonstrując stabilne zachowanie tożsamości w ocenianych warunkach śledzenia sportowego.

Rysunek 7. Reprezentatywne wyniki śledzenia uzyskane za pomocą JerseyTrack. Kolejne klatki z sekwencji koszykówki, piłki nożnej i siatkówki ilustrują utrzymanie tożsamości i trajektorii sportowców podczas śledzenia. Kolorowe ramki ograniczające reprezentują śledzone tożsamości utrzymane w kolejnych klatkach wideo. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.
Wyniki ablacji dla zachowania tożsamości:
Przeprowadzono analizę ablacyjną, aby zbadać wkład strategii asocjacji sterowanej pewnością oraz modułu fuzji semantycznej koszulek w zachowanie tożsamości. Porównano cztery warianty modelu: V0, model bazowy bez asocjacji sterowanej pewnością i bez fuzji semantycznej koszulek; V1, wariant wykorzystujący wyłącznie asocjację sterowaną pewnością; V2, wariant wykorzystujący wyłącznie fuzję semantyczną koszulek; oraz V3, pełną konfigurację JerseyTrack obejmującą oba komponenty. Ewaluacja skupiła się na metrykach związanych z tożsamością, w tym IDs, IDF1, precyzji tożsamości (IDP) oraz czułości tożsamości (IDR). Reprezentatywne wzorce zachowania tożsamości przedstawiono na Rysunku 8.

Rysunek 8. Analiza ablacyjna semantycznych powiązań koszulki sterowanych stopniem pewności. (A) Całkowita liczba zmian tożsamości (IDs) oraz wskaźnik IDF1 (IDentity F1 Score) dla ocenianych wariantów modelu. (B) Porównanie liczby IDs między kompletnym modelem (V3) a konfiguracją bazową (V0) w reprezentatywnych, wymagających scenariuszach śledzenia. (C) IDF1, precyzja tożsamości (IDP) oraz czułość tożsamości (IDR) kompletnego modelu w różnych scenariuszach śledzenia. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.
W ogólnym ustawieniu walidacji SportsMOT pełna konfiguracja V3 zapewniła najniższą liczbę ID oraz najwyższy wskaźnik IDF1 spośród czterech wariantów modelu. V3 odnotowała 2 768 ID, co oznacza o 477 mniej przełączeń tożsamości niż w przypadku V0, i osiągnęła wartość IDF1 na poziomie 74,3%, co stanowi wzrost o 7,1 punktu procentowego w stosunku do V0. Wyniki te wskazują, że oba moduły wspólnie przyczyniły się do zachowania tożsamości w ocenianych warunkach śledzenia sportowego. Porównanie wariantów z jednym modułem z pełną konfiguracją wykazało ponadto, że oba moduły wpływały na różne źródła błędów śledzenia. Strategia asocjacji kierowana pewnością (confidence-guided association strategy) zredukowała błędy dopasowania związane z niestabilną pewnością detekcji i niepewnością lokalizacji, podczas gdy moduł semantycznej fuzji koszulek (jersey semantic fusion module) dostarczył dodatkowych informacji o tożsamości w sytuacjach, gdy same informacje o ruchu były niewystarczające. Pełna konfiguracja V3 osiągnęła lepsze wyniki w zakresie tożsamości niż którykolwiek z wariantów z jednym modułem, co sugeruje, że oba moduły dostarczyły wkładów komplementarnych, a nie redundantnych.
Wyniki na poziomie scenariuszy wykazały większe różnice w trudniejszych warunkach zachowania tożsamości. Podczas długotrwałego przysłonięcia V3 zarejestrowało 215 ID w porównaniu do 482 dla V0. W gęstych scenariuszach z zawodnikami z tej samej drużyny, obejmujących od 6 do 10 graczy, V3 zarejestrowało 328 ID w porównaniu do 615 dla V0. Przy szybkich zmianach kierunku V3 zarejestrowało 482 ID w porównaniu do 960 dla V0. Redukcje te są zgodne z zamierzonym wykorzystaniem wskazówek semantycznych podczas przysłonięcia i gęstych interakcji, a także z asocjacją sterowaną poziomem pewności przy fluktuacyjnej pewności detekcji podczas gwałtownego ruchu. Trendy IDP i IDR przedstawione na Rysunku 8C wskazują, że redukcji liczby ID nie towarzyszył istotny spadek precyzji tożsamości ani kompletności tożsamości. Pełna konfiguracja utrzymała wartości IDF1 powyżej 71% we wszystkich ocenianych trudnych scenariuszach, przy czym niższe wartości zaobserwowano podczas gęstych interakcji zawodników z tej samej drużyny oraz szybkich zmian kierunku. Wyniki te wskazują na poprawę spójności tożsamości w ocenianych warunkach, identyfikując jednocześnie gęste interakcje i gwałtowny ruch jako główne pozostałe źródła pogorszenia wydajności.
Wyniki ewaluacji międzyzbiorowej:
Przeprowadzono ewaluację międzyzbiorową, aby sprawdzić, czy zachowanie śledzenia zaobserwowane w zbiorze SportsMOT może zostać utrzymane w różnych warunkach zbiorów danych. Ewaluacja objęła dwa zbiory specyficzne dla sportu, SoccerNet Tracking i TeamTrack, oraz dwa ogólne zbiory MOT: MOT17 i MOT20. Celem tego eksperymentu było zbadanie transferu wydajności pomiędzy różnymi typami zbiorów danych. Wyników nie wykorzystano do wykazania bezpośredniej przewagi na poziomie metryk między zbiorami, ponieważ protokoły adnotacji, kompozycja scen, punkty widzenia kamer oraz kategorie obiektów różnią się od siebie.
Tabela 1 podsumowuje wyniki ewaluacji międzyzbiorowej. W przypadku zbiorów danych specyficznych dla sportu, JerseyTrack utrzymał stosunkowo stabilne wartości MOTA i IDF1 w porównaniu z głównym ustawieniem walidacyjnym SportsMOT. Tendencja ta sugeruje, że strategia asocjacji kierowana pewnością (confidence-guided association) oraz semantyczne wskazówki związane z koszulkami pozostały skuteczne, gdy sceny śledzenia zachowały wizualne charakterystyki sportów drużynowych, w tym powtarzające się mundury, gęste interakcje sportowców i częste przesłonięcia. W ogólnych zbiorach danych MOT metoda utrzymała konkurencyjne wartości MOTA i DetA, podczas gdy IDF1 było niższe niż obserwowane w zbiorach specyficznych dla sportu. Wzorzec ten jest spójny z brakiem informacji o kolorze koszulek i numerach zawodników w zbiorach MOT17 i MOT20, które są wykorzystywane przez moduł fuzji semantycznej. W tych warunkach komponent asocjacji kierowanej pewnością pozostał przydatny, podczas gdy gałąź semantyczna dostarczyła mniej informacji specyficznych dla tożsamości niż w przypadku filmów ze sportów drużynowych. Ogólnie rzecz biorąc, wyniki te wskazują, że JerseyTrack przenosił się skuteczniej na zbiory danych zawierające specyficzną dla sportu semantykę wizualną niż na ogólne zbiory danych do śledzenia pieszych. Ewaluacja międzyzbiorowa potwierdza zatem zamierzone zastosowanie metody jako trackera zorientowanego na sport, jednocześnie identyfikując brak jawnej semantyki koszulek jako czynnik ograniczający w przypadku nie-sportowych zbiorów danych MOT.
| Zbiór danych | MOTA↑ | IDF1↑ | DetA↑ | FPS↑ |
| SoccerNet Tracking | 86.8 | 71.3 | 77.9 | 32.1 |
| TeamTrack | 86.2 | 70.7 | 77.3 | 32.8 |
| MOT17 | 84.7 | 69.5 | 76.1 | 33.9 |
| MOT20 | 84.1 | 68.9 | 75.3 | 33.2 |
Tabela 1: Wyniki ewaluacji międzyzbiorowej. Wydajność śledzenia systemu JerseyTrack oceniona na czterech publicznych zbiorach danych referencyjnych. Przedstawiono dokładność śledzenia wielu obiektów (MOTA), wskaźnik F1 tożsamości (IDF1), dokładność detekcji (DetA) oraz prędkość przetwarzania mierzoną w klatkach na sekundę (FPS). Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1, DetA oraz FPS.
Odporność w kontrolowanych warunkach perturbacji
Przeprowadzono eksperymenty z kontrolowanymi zaburzeniami, aby zbadać stabilność systemu JerseyTrack w obliczu typowych zakłóceń wizualnych i jakościowych detekcji występujących w nagraniach wideo ze sportu. Ewaluowane zaburzenia podzielono na trzy kategorie: zaburzenia cech semantycznych, zaburzenia ramek detekcji oraz zaburzenia środowiskowe. Zaburzenia cech semantycznych obejmowały przesłonięcie numeru zawodnika, rozmycie obrazu, degradację rozdzielczości oraz podobne kolory koszulek. Zaburzenia ramek detekcji obejmowały przesunięcie ramki ograniczającej, fluktuacje ufności detekcji oraz fałszywe ramki detekcji. Zaburzenia środowiskowe obejmowały szum imitujący deszcz, degradację imitującą mgłę, silne oświetlenie oraz interferencje cieni. Rysunek 9 podsumowuje wydajność śledzenia w tych warunkach zaburzeń. W przypadku zaburzeń cech semantycznych wydajność śledzenia spadała wraz z pogarszaniem się widoczności numeru zawodnika i jakości wykadrowanego obrazu. Gdy 40% obszaru numeru zawodnika było przesłonięte, wskaźnik MOTA spadł o 3,2 punktu procentowego, a IDF1 o 5,3 punktu procentowego w stosunku do warunków bez zaburzeń, podczas gdy dokładność ekstrakcji semantycznej pozostała na poziomie 86,7%. Wyniki te wskazują, że kolor koszulki i wskazówki dotyczące numeru zawodnika dostarczały uzupełniających informacji w sytuacjach, gdy jedna z cech semantycznych stała się mniej wiarygodna. W przypadku zaburzeń ramek detekcji metoda wykazała umiarkowany spadek wydajności, a nie gwałtowną awarię. Gdy ramki detekcji przesunięto o ±10 pikseli, a wyniki ufności zaburzono szumem gaussowskim, spadek MOTA pozostał poniżej 3 punktów procentowych, a wzrost liczby ID zmieścił się w granicach 16%. Tendencja ta jest zgodna ze strategią asocjacji sterowaną ufnością, w której detekcje o średniej i niskiej ufności są przetwarzane przy użyciu dodatkowych ograniczeń asocjacyjnych, zamiast stosowania tej samej strategii, która obowiązuje dla detekcji o wysokiej ufności.

Rysunek 9. Ocena odporności przy kontrolowanych perturbacjach. (A) Zmiany dokładności śledzenia wielu obiektów (MOTA), wyniku F1 dla tożsamości (IDF1) oraz przełączeń tożsamości (IDs) wraz ze wzrostem przesłonięcia numeru na koszulce. (B) Spadek wydajności w reprezentatywnych warunkach zakłóceń. (C) Wzrost liczby IDs przy różnych rodzajach zakłóceń. (D) Dokładność ekstrakcji semantycznej koszulek w ocenianych warunkach perturbacji. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.
W warunkach perturbacji środowiskowych spadki głównych wskaźników śledzenia pozostały poniżej 5 punktów procentowych w ocenianych warunkach, a dokładność ekstrakcji semantycznej wyniosła 87,2%. Zastosowanie deskryptorów koloru opartych na modelu HSV zmniejszyło wrażliwość na zmiany oświetlenia, podczas gdy gałąź OCR zachowała użyteczne informacje o numerach zawodników dla podzbioru rozmytych lub zdegradowanych wycinków obrazu. Wyniki te wskazują, że moduł semantyczny pozostał użyteczny w ocenianych warunkach perturbacji, choć jego niezawodność nadal zależała od widoczności koszulki i jakości wycinka. Ogólnie rzecz biorąc, kontrolowane eksperymenty z perturbacjami wykazały, że JerseyTrack utrzymał mierzalną wydajność śledzenia w ocenianych perturbacjach semantycznych, jakości detekcji oraz środowiskowych. Wnioski te należy interpretować w zakresie testowanych perturbacji. Systematyczna reidentyfikacja poza polem widzenia, silne zakłócenia tła oraz długotrwałe całkowite przesłonięcie nie były oceniane oddzielnie w tym eksperymencie i są omówione jako ograniczenia w sekcji Dyskusja.
Analiza wkładu modułu i dyskryminacji cech
Dalszej analizie poddano wkład poszczególnych modułów oraz dyskryminację cech, aby zbadać, w jaki sposób dwa zaproponowane komponenty wpłynęły na wydajność śledzenia powiązanego z tożsamością. Analiza wkładu modułów wykorzystała cztery warianty modelu zdefiniowane w analizie ablacyjnej, natomiast analiza dyskryminacji cech porównywała tradycyjne cechy Re-ID, cechy oparte wyłącznie na kolorze, cechy oparte wyłącznie na numerze zawodnika oraz połączone semantyczne cechy koszulek. Do opisu separowalności cech wykorzystano stosunek odległości międzyklasowej do wewnątrzklasowej, gdzie większe wartości wskazywały na większy stopień rozdzielenia różnych tożsamości w stosunku do zmienności w obrębie tej samej tożsamości. Tabela 2 podsumowuje analizę wkładu modułów. W ogólnej ocenie szacowany wkład strategii asocjacji kierowanej pewnością wyniósł 41,7%, szacowany wkład fuzji semantycznej koszulek wyniósł 47,6%, a pozostałe 10,7% przypisano łącznemu zastosowaniu obu komponentów. Wartości te wskazują, że oba komponenty przyczyniły się do zaobserwowanej poprawy, natomiast pełna konfiguracja odniosła korzyść z ich wspólnego zastosowania, a nie z pojedynczego komponentu. Wzorzec wkładu różnił się w zależności od typu sceny. Przy silnej okluzji szacowany wkład fuzji semantycznej koszulek wzrósł do 69,4%, co jest zgodne z ograniczoną niezawodnością wskazówek dotyczących ruchu w sytuacjach, gdy sportowcy byli częściowo lub tymczasowo zasłonięci. Przy ruchu o wysokiej prędkości szacowany wkład asocjacji kierowanej pewnością osiągnął 44,3%, a zysk łączny wyniósł 20,6%, co wskazuje, że partycjonowanie na poziomie pewności stało się bardziej istotne, gdy pewność detekcji wahała się z powodu szybkiego ruchu lub niepewności lokalizacji.
| Wariant modelu | Scenariusz testowy | MOTA↑ | IDF1↑ | IDs↓ | Wkład modułu | Zysk synergiczny |
| V0 (Baseline) | Całkowita scena | 83.5 | 67.2 | 3245 | – | – |
| Sceny z silnymi przesłonięciami | 77.8 | 61.5 | 3862 | – | – |
| Scena z ruchem o dużej prędkości | 77.1 | 62.3 | 3689 | – | – |
| V1 (Asocjacja sterowana ufnością) | Całkowita scena | 86.3 | 70.9 | 2893 | 41.7 | – |
| Sceny z silnymi przesłonięciami | 80.9 | 65.9 | 3415 | 29.8 | – |
| Scena z ruchem o dużej prędkości | 81.4 | 67.9 | 3024 | 44.3 | – |
| V2 (Semantyczna asocjacja koszulek) | Całkowita scena | 85.2 | 71.8 | 2937 | 47.6 | – |
| Sceny z silnymi przesłonięciami | 82.7 | 72.8 | 2753 | 69.4 | – |
| Scena z ruchem o dużej prędkości | 80.1 | 66.8 | 3157 | 35.1 | – |
| V3 (Kompletny JerseyTrack) | Całkowita scena | 88.9 | 74.3 | 2768 | – | 10.7 |
| Sceny z silnymi przesłonięciami | 84.9 | 75.6 | 2689 | – | 0.8 |
| Scena z ruchem o dużej prędkości | 83.6 | 71.5 | 2842 | – | 20.6 |
Tabela 2: Analiza ablacyjna wkładu poszczególnych modułów. Porównanie wydajności różnych wariantów modelu JerseyTrack w scenariuszach ogólnych, z silnymi przesłonami oraz przy szybkim ruchu. Wartości Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1) oraz liczba zmian tożsamości (IDs) są przedstawione wraz z szacowanym wkładem modułów i zyskiem synergicznym. Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1, wkładu modułów i zysku synergicznego, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.
Tabela 3 podsumowuje analizę dyskryminacji cech. Połączona cecha semantyczna koszulki osiągnęła stosunek odległości międzyklasowej do wewnątrzklasowej na poziomie 5,63, w porównaniu do 1,82 dla tradycyjnych cech Re-ID, co odpowiada względnej poprawie o 209,3% w pomiarze stosunku odległości. Cechy oparte wyłącznie na kolorze oraz wyłącznie na numerze zawodnika również poprawiły separowalność cech w stosunku do tradycyjnych cech Re-ID, choć każdy poszczególny wskaźnik pozostawał podatny na konkretne przypadki błędów, w tym podobne kolory drużyn, zasłonięcie numeru zawodnika, rozmycie ruchu oraz nieczytelne obszary koszulek. Spośród ocenianych reprezentacji cech, połączona reprezentacja semantyczna osiągnęła najwyższą separowalność cech i odpowiadała najwyższej wartości IDF1 oraz najniższej liczbie identyfikatorów (ID count) zaobserwowanej w analizie ablacyjnej. Wyniki te wspierają zastosowanie specyficznych semantycznych wskazówek dotyczących koszulek jako uzupełniających informacji o tożsamości w systemach Sports MOT, gdy sportowcy mają podobny wygląd, a same informacje o ruchu są niewystarczające. Obserwacje te ograniczają się do ocenianego ustawienia SportsMOT i nie powinny być interpretowane jako dowód na to, że semantyka koszulek rozwiązuje wszelkie niejednoznaczności tożsamości w każdym materiale wideo ze sportu.
| Typ cechy | Stosunek dystansu międzyklasowego do wewnątrzklasowego | Względna poprawa (%) | IDF1↑ | IDs↓ |
| Tradycyjne cechy Re-ID | 1.82 | – | 65.7 | 3482 |
| Cechy koloru drużyny | 3.17 | 74.2 | 69.8 | 3125 |
| Cechy numeru zawodnika | 3.49 | 91.8 | 70.5 | 3018 |
| Zintegrowane semantyczne cechy koszulki | 5.63 | 209.3 | 74.3 | 2768 |
Tabela 3: Analiza dyskryminacji różnych reprezentacji cech. Porównanie dyskryminacji cech z wykorzystaniem tradycyjnych cech re-identyfikacji (Re-ID), cech koloru koszulki, cech numerów zawodników oraz połączonych cech semantycznych. Przedstawiono stosunek odległości międzyklasowej do wewnątrzklasowej, względną poprawę dyskryminacji cech, wynik IDentity F1 Score (IDF1) oraz liczbę zmian tożsamości (IDs). Wyższe wartości wskazują na lepszą wydajność w przypadku stosunku odległości, względnej poprawy i IDF1, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.
Porównanie referencyjne z istniejącymi metodami MOT
Przeprowadzono porównanie referencyjne w celu zestawienia metody JerseyTrack z reprezentatywnymi metodami MOT w tych samych warunkach walidacji SportsMOT. Porównane metody obejmowały QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT oraz MOTR. Wszystkie metody wykorzystywały te same wyniki detekcji wygenerowane przez framework detektora wymieniony w Tabeli Materiałów, tak aby porównanie skupiało się na wydajności asocjacji śledzenia, a nie na zmienności detektora. Ocena została przeprowadzona z wykorzystaniem metryk zdefiniowanych w sekcji 7 protokołu. Główne metryki oceny obejmowały MOTA, HOTA oraz IDF1. Metryki pomocnicze obejmowały DetA, AssA, FPs, FNs oraz IDs. Tabela 4 podsumowuje porównanie ilościowe na zbiorze walidacyjnym SportsMOT, a Rysunek 10 przedstawia wizualne porównanie dokładności śledzenia, szybkości inferencji oraz rozkładu HOTA w ocenianych scenach sportowych. JerseyTrack osiągnął najwyższą wartość MOTA spośród porównywanych metod, wynoszącą 88,9%. Wartość ta była o 1,1 punktu procentowego wyższa niż w przypadku Deep OC-SORT (87,8%) i o 2,5 punktu procentowego wyższa niż w przypadku ByteTrack (86,4%). Zatem w ocenianych warunkach walidacji SportsMOT, JerseyTrack osiągnął najwyższą ogólną dokładność śledzenia spośród porównanych metod. W przypadku HOTA, JerseyTrack osiągnął wynik 69,9%, w porównaniu do 64,4% dla Deep OC-SORT i 62,8% dla ByteTrack. Różnice te odpowiadają poprawie odpowiednio o 5,5 i 7,1 punktu procentowego, co wskazuje na lepszą równowagę między wydajnością detekcji a asocjacji w tych samych warunkach oceny.
| Metoda | MOTA↑ | HOTA↑ | IDF1↑ | DetA↑ | AssA↑ | FP↓ | FN↓ | IDs↓ |
| QDTrack | 75.9 | 53.7 | 51.6 | 65.6 | 39.7 | 96,324 | 89,871 | 8,216 |
| DeepSORT | 77.6 | 54.1 | 53.2 | 67.3 | 44 | 76,228 | 86,319 | 6,836 |
| ByteTrack | 86.4 | 62.8 | 67.7 | 73.8 | 50.9 | 33,752 | 78,698 | 4,192 |
| FairMOT | 84.1 | 54.7 | 62.5 | 77.8 | 47.8 | 45,187 | 83,620 | 4,817 |
| Deep OC-SORT | 87.8 | 64.4 | 69.9 | 78.2 | 52.1 | 25,012 | 74,385 | 3,211 |
| MOTR | 82.9 | 57.2 | 58.4 | 68.9 | 46.1 | 54,931 | 85,063 | 5,137 |
| JerseyTrack | 88.9 | 69.9 | 74.3 | 80.2 | 54.3 | 21,953 | 67,160 | 2,768 |
Tabela 4: Porównanie wydajności JerseyTrack i reprezentatywnych metod śledzenia wielu obiektów na zbiorze walidacyjnym SportsMOT.Porównanie JerseyTrack z reprezentatywnymi metodami śledzenia wielu obiektów (MOT) na zbiorze walidacyjnym SportsMOT. Raportowane metryki obejmują dokładność śledzenia wielu obiektów (MOTA), dokładność śledzenia wyższego rzędu (HOTA), wynik F1 dla tożsamości (IDF1), dokładność detekcji (DetA), dokładność asocjacji (AssA), liczbę fałszywych trafień (FP), liczbę fałszywych negatywów (FN) oraz liczbę przełączeń tożsamości (IDs). Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, HOTA, IDF1, DetA i AssA, podczas gdy niższe wartości wskazują na lepszą wydajność dla FP, FN i IDs.

Rysunek 10. Porównanie wydajności z reprezentatywnymi metodami śledzenia wielu obiektów. (A) Porównanie dokładności śledzenia wielu obiektów (MOTA) oraz liczby klatek na sekundę (FPS) dla JerseyTrack i reprezentatywnych metod śledzenia wielu obiektów ocenianych na zbiorze danych SportsMOT. (B) Rozkład dokładności śledzenia wyższego rzędu (HOTA) w ocenianych metodach śledzenia. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.
W zakresie zachowania tożsamości JerseyTrack osiągnął wskaźnik IDF1 na poziomie 74,3%, w porównaniu do 69,9% dla Deep OC-SORT i 67,7% dla ByteTrack. JerseyTrack odnotował również 2 768 identyfikatorów (ID), co jest liczbą niższą niż 3 211 ID odnotowanych przez Deep OC-SORT oraz 4 192 ID odnotowanych przez ByteTrack. Obserwacje te są zgodne z wynikami ablacji przedstawionymi na Rysunku 8 i w Tabeli 2, w których pełna konfiguracja JerseyTrack ograniczyła zmianę tożsamości w stosunku do wariantów modelu bazowego. W zakresie jakości detekcji i asocjacji JerseyTrack osiągnął DetA na poziomie 80,2% oraz AssA na poziomie 54,3%. W porównaniu z Deep OC-SORT, JerseyTrack poprawił DetA o 2,0 punktu procentowego, a AssA o 2,2 punktu procentowego. JerseyTrack wygenerował również mniej błędów FP i FN niż pozostałe metody porównawcze raportowane w Tabeli 4, odnotowując 21 953 FP i 67 160 FN. Ogólnie porównanie benchmarkowe wykazało, że JerseyTrack osiągnął najwyższe wartości dla głównych metryk śledzenia spośród ocenianych metod w ustawieniach walidacyjnych SportsMOT. Wyniki te są zgodne z zaobserwowaną poprawą w zachowaniu tożsamości i stabilności asocjacji uzyskanej dzięki asocjacji sterowanej pewnością (confidence-guided association) oraz semantycznej fuzji koszulek. Porównanie jest ograniczone do wspólnych wyników detektora oraz konfiguracji walidacyjnej SportsMOT zastosowanej w niniejszym badaniu.
Wyniki analizy czułości parametrów
Przeprowadzono analizę wrażliwości parametrów, aby zbadać, w jaki sposób kluczowe parametry implementacji wpływały na wydajność śledzenia w warunkach walidacji SportsMOT. Ewaluowano trzy parametry: współczynnik wagowy straty OCR (γ), liczbę hierarchicznych klastrów poziomu ufności (K) oraz szybkość uczenia sieci OCR (η). Tabela 5 podsumowuje wartości MOTA, IDF1, HOTA i IDs uzyskane dla różnych ustawień parametrów.
| Parametr | Wartość | MOTA↑ | IDF1↑ | HOTA↑ | IDs↓ |
| Waga straty OCR (γ) | 0.2 | 84.7 | 69.4 | 66.2 | 2,944 |
| 0.4 | 86.3 | 71.5 | 68.2 | 2,893 |
| 0.6 | 87.9 | 73.1 | 68.9 | 2,815 |
| 0.8 (optymalna) | 88.9 | 74.3 | 69.9 | 2,768 |
| 1 | 88.2 | 73.8 | 69.3 | 2,792 |
| Liczba klastrów ufności (K) | 2 | 86.7 | 72.1 | 68.5 | 2,876 |
| 3 (optymalna) | 88.9 | 74.3 | 69.9 | 2,768 |
| 4 | 88.1 | 73.6 | 69.7 | 2,803 |
| 5 | 87.3 | 72.8 | 69.2 | 2,851 |
| Szybkość uczenia OCR (η) | 1 × 10⁻⁴ | 85.9 | 70.8 | 67.3 | 2,934 |
| 5 × 10⁻⁴ | 87.6 | 72.7 | 68.7 | 2,832 |
| 1 × 10⁻³ (optymalna) | 88.9 | 74.3 | 69.9 | 2,768 |
| 5 × 10⁻³ | 87.8 | 73.2 | 69 | 2,817 |
| 1 × 10⁻² | 86.5 | 71.6 | 68.7 | 2,889 |
Tabela 5: Analiza czułości parametrów. Wydajność śledzenia uzyskana przy zastosowaniu różnych ustawień parametrów dla JerseyTrack. Podano wartości dokładności śledzenia wielu obiektów (MOTA), wyniku F1 tożsamości (IDF1), dokładności śledzenia wyższego rzędu (HOTA) oraz liczbę przełączeń tożsamości (IDs) dla różnych wartości współczynnika wagowego straty optycznego rozpoznawania znaków (OCR) (γ), liczby klastrów ufności (K) oraz prędkości uczenia OCR (η). Wartości parametrów zidentyfikowane jako optymalne odpowiadają ustawieniom zastosowanym w raportowanych eksperymentach. Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1 i HOTA, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.
W przypadku współczynnika wagowego straty OCR (γ), najlepszą ocenioną wydajność uzyskano przy γ = 0.8. Przy tym ustawieniu JerseyTrack osiągnął wskaźnik MOTA na poziomie 88.9%, IDF1 wynoszący 74.3%, HOTA na poziomie 69.9% oraz 2 768 ID. Gdy γ zmniejszono do 0.2, wartości MOTA, IDF1 i HOTA spadły odpowiednio do 84.7%, 69.4% i 66.2%, podczas gdy liczba ID wzrosła do 2 944. Gdy zwiększono γ do 1.0, metryki wydajności nieznacznie spadły w stosunku do γ = 0.8, osiągając MOTA 88.2%, IDF1 73.8%, HOTA 69.3% oraz 2 792 ID. Wyniki te wskazują, że niewystarczający nadzór OCR ograniczył zdolność rozróżniania numerów graczy, natomiast zwiększenie wagi straty OCR powyżej ocenionego optimum nie poprawiło wydajności śledzenia w testowanych warunkach.
W przypadku liczby klastrów hierarchicznych dla poziomu ufności (K), najlepszą ocenioną wydajność uzyskano dla K = 3. Ustawienie to odpowiada strategii asocjacji o wysokim, średnim i niskim poziomie ufności opisanej w metodzie. Przy K = 2 partycjonowanie ufności było mniej szczegółowe, a wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 86,7%, 72,1% i 68,5%. Gdy K wzrosło do 4 lub 5, wydajność również spadła w stosunku do K = 3, co sugeruje, że nadmierne partycjonowanie podzieliło detekcje na zbyt wąskie grupy ufności i zmniejszyło stabilność strategii asocjacji. Wyniki te potwierdzają zasadność zastosowania trzech poziomów ufności w ocenianej konfiguracji JerseyTrack.
W przypadku współczynnika uczenia sieci OCR (η), najlepszą ocenioną wydajność uzyskano dla η = 1 × 10-3. Przy niższym współczynniku uczenia wynoszącym 1 × 10-4 wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 85,9%, 70,8% i 67,3%, natomiast liczba ID wzrosła do 2 934. Przy wyższym współczynniku uczenia wynoszącym 1 × 10-2 wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 86,5%, 71,6% i 68,7%, a liczba ID wzrosła do 2 889. Wyniki te wskazują, że gałąź OCR była wrażliwa na dobór współczynnika uczenia, przy czym wartość 1 × 10-3 zapewniła najlepszą równowagę między rozpoznawaniem liczby graczy a wydajnością zachowania tożsamości w ocenianych warunkach.
Ogólnie Tabela 5 pokazuje, że kombinacja parametrów γ = 0.8, K = 3 oraz η = 1 × 10-3 pozwoliła uzyskać najwyższe ocenione wartości MOTA, IDF1 i HOTA przy jednoczesnej najniższej liczbie ID. Analiza wrażliwości wykazała również, że umiarkowane odchylenia od tych wartości parametrów skutkowały mierzalnymi, ale nie gwałtownymi zmianami w wydajności śledzenia. W związku z tym te ustawienia parametrów zostały wykorzystane do porównania referencyjnego oraz głównych eksperymentów walidacyjnych SportsMOT opisanych w niniejszym badaniu.
Dostępność danych
Surowe podsumowania ewaluacji, końcowe wyniki śledzenia, zapisy środowiska, pliki mapowania zbiorów danych oraz pośrednie pliki podsumowujące, wspierające wyniki niniejszego badania, są dostępne w publicznym repozytorium pod adresem https://doi.org/10.5281/zenodo.21274353. Oryginalne publiczne zestawy danych referencyjnych użyte w tym badaniu, w tym SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 i MOT20, są dostępne u ich odpowiednich dostawców i nie zostały udostępnione ponownie w repozytorium.