Artykuł metodologiczny

Metoda śledzenia wielu obiektów sterowana stopniem pewności w materiałach wideo ze zdarzeń sportowych z wykorzystaniem semantycznej fuzji koszulek

DOI:

10.3791/71557

14 sierpnia 2026

W tym artykule

Podsumowanie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejszy protokół opisuje proces wielobiektowego śledzenia sterowanego poziomem pewności dla nagrań wideo ze zdarzeń sportowych, który integruje informacje o kolorze koszulki i numerze zawodnika w celu poprawy asocjacji trajektorii oraz spójności tożsamości w warunkach wahań pewności, okluzji oraz wizualnego podobieństwa zawodników.

Streszczenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Śledzenie wielu obiektów (Multi-Object Tracking, MOT) w nagraniach wideo ze zdarzeń sportowych dostarcza informacji o trajektoriach niezbędnych do analizy taktycznej, interpretacji zachowań zawodników oraz zautomatyzowanej analizy statystycznej. Jednak scenariusze sportowe często wiążą się z szybkimi zmianami kierunku, nagłymi zatrzymaniami, częstymi przesłonięciami obiektów oraz wizualnym podobieństwem członków tej samej drużyny, co prowadzi do wahań pewności detekcji i błędów w identyfikacji podczas asocjacji między klatkami. Aby rozwiązać te problemy, w niniejszym badaniu przedstawiono JerseyTrack – metodę MOT w sporcie sterowaną poziomem pewności, opartą na fuzji semantycznej koszulek. Przepływ pracy adaptacyjnie dzieli ramki detekcji na przedziały wysokiej, średniej i niskiej pewności, zgodnie z rozkładem pewności w każdej klatce. Detekcje o wysokiej pewności są asocjowane głównie w oparciu o podobieństwo ruchu, natomiast w przypadku detekcji o średniej i niskiej pewności dodatkowo wykorzystuje się cechy koloru koszulki oraz numeru zawodnika, wyodrębnione za pomocą klastrowania kolorów i lekkiego modelu optycznego rozpoznawania znaków (Optical Character Recognition, OCR). Cechy semantyczne te są łączone z informacjami o ruchu podczas dopasowania uzupełniającego, aby poprawić ciągłość trajektorii i spójność identyfikacji. Metodę oceniono na zbiorze danych SportsMOT. JerseyTrack osiągnął wynik 88,9% dla dokładności śledzenia wielu obiektów (Multiple Object Tracking Accuracy, MOTA), 74,3% dla wskaźnika IDF1 (IDentity F1 Score) oraz 69,9% dla dokładności śledzenia wyższego rzędu (Higher Order Tracking Accuracy, HOTA), co wykazuje poprawę wydajności śledzenia w analizowanych warunkach sportowych. Niniejszy protokół zapewnia odtwarzalny schemat integrowania asocjacji sterowanej pewnością z semantycznymi informacjami o koszulkach w celu usprawnienia śledzenia wielu obiektów w filmach sportowych.

Wprowadzenie

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Śledzenie wielu obiektów (MOT) zapewnia ciągłą lokalizację obiektów i utrzymanie ich tożsamości w sekwencjach wideo, co umożliwia ekstrakcję trajektorii sportowców, analizę taktyczną oraz zautomatyzowaną analizę statystyczną w aplikacjach do analizy wideo w sporcie1,2,3. Niezawodne informacje wizualne są również powiązane z podejmowaniem decyzji specyficznych dla danej dyscypliny oraz oceną wyników w nauce o sporcie, co dodatkowo podkreśla wartość stabilnych danych o ruchu pochodzących z wideo dla dalszej analizy sportowej4. W scenariuszach sportowych niezawodność danych taktycznych zależy od ciągłości trajektorii śledzenia oraz spójności tożsamości celów.

W porównaniu do ogólnych scenariuszy MOT, filmy sportowe charakteryzują się gwałtownymi zmianami kierunku, nagłymi zatrzymaniami, skokami, gęstymi interakcjami oraz częstymi przesłonięciami. Czynniki te powodują znaczne wahania poziomu ufności ramek detekcyjnych i zwiększają częstotliwość detekcji o niskiej ufności, co może przerywać asocjację trajektorii5,6. Jednolite stroje drużynowe dodatkowo ograniczają zdolność dyskryminacyjną ogólnych cech wyglądu i zwiększają ryzyko pomyłek w identyfikacji wizualnie podobnych członków tej samej drużyny7,8. Gdy przesłonięcia i podobieństwo wyglądu występują w tej samej sekwencji, ufność detekcji spada, a informacje o wyglądzie celu stają się niepełne, co utrudnia asocjację trajektorii i utrzymanie tożsamości9,10. W MOT re-identyfikacja (Re-ID) odnosi się do procesu wiązania tej samej tożsamości celu w różnych klatkach, okresach przesłonięcia lub w przypadkach ponownego pojawienia się w kadrze, z wykorzystaniem wizualnych dowodów związanych z tożsamością. W filmach ze sportów drużynowych ogólne wskazówki Re-ID mogą być osłabione, ponieważ sportowcy z tej samej drużyny często noszą podobne stroje i mają zbliżoną budowę ciała. Przegląd literatury technicznej wskazuje, że fragmentacja trajektorii i pomyłki w identyfikacji w sportowym MOT są zazwyczaj rozwiązywane za pomocą dwóch komplementarnych podejść: wykorzystania poziomu ufności detekcji oraz wzmocnienia wskazówek tożsamości. JerseyTrack sytuuje się na przecięciu tych podejść, regulując wykorzystanie semantycznych wskazówek dotyczących strojów w zależności od jakości detekcji, zamiast jednolicie stosować informacje o kolorze i numerze zawodnika do wszystkich detekcji.

Niniejsze badanie przedstawia JerseyTrack, metodę śledzenia wielu obiektów (MOT) w sporcie, kierowaną poziomem ufności i opartą na semantycznej fuzji strojów sportowych. Metoda została opracowana dla nagrań wideo z dyscyplin zespołowych, w których sportowcy noszą widoczne stroje, a wyniki detekcji dostarczają ramki ograniczające wraz z wynikiem ufności. JerseyTrack łączy cztery główne komponenty: detekcję sportowców, partycjonowanie poziomów ufności, ekstrakcję semantycznych cech stroju oraz kaskadową asocjację międzyklatkową. Ufność detekcji jest wykorzystywana do adaptacyjnego podziału detekcji na grupy o wysokiej, średniej i niskiej ufności, które są przetwarzane przy użyciu różnych strategii asocjacji. Detekcje o wysokiej ufności są powiązane głównie na podstawie informacji o ruchu, podczas gdy w przypadku detekcji o średniej i niskiej ufności dodatkowo uwzględnia się kolor stroju oraz numer zawodnika, aby poprawić utrzymanie tożsamości w sytuacjach słabej widoczności dowodów wizualnych. Metoda jest przeznaczona do zadań analizy wideo sportowego wymagających stabilnych trajektorii sportowców, takich jak analiza taktyczna i interpretacja zachowań graczy.

Zaproponowane podejście posiada również ograniczenia operacyjne. Ekstrakcja semantyczna koszulek może być utrudniona przez silne przesłonięcia, rozmycie ruchu, niską rozdzielczość obrazu, nietypowe pozy zawodników lub niewidoczne numery na koszulkach. W takich przypadkach semantyczne wskazówki oparte na koszulkach mogą stać się niekompletne, a proces asocjacji w większym stopniu opiera się na spójności ruchu i weryfikacji wieloklatkowej. W związku z tym deklarowana wydajność w niniejszym badaniu jest ograniczona do ewaluowanych zbiorów danych i ustawień eksperymentalnych. Eksperymenty na zbiorze danych SportsMOT pokazują, że JerseyTrack poprawia ewaluowane metryki śledzenia i redukuje liczbę zdarzeń przełączania tożsamości w przetestowanych warunkach śledzenia sportowego. Główna trudność MOT w filmach sportowych polega na utrzymaniu ciągłości trajektorii i spójności tożsamości przy szybkim ruchu, przesłonięciach i podobieństwie wyglądu. Istniejące badania powiązane z JerseyTrack można szeroko podzielić na dwa kierunki badawcze: wykorzystanie pewności detekcji do asocjacji trajektorii oraz wzmacnianie wskazówek tożsamości poprzez specyficzne dla sportu cechy semantyczne.

Poziom ufności detekcji (detection confidence) jest szeroko stosowany do szacowania niezawodności ramek detekcji oraz do kierowania asocjacją trajektorii w MOT. Wczesne metody śledzenia zazwyczaj traktowały ufność jako binarny kryterium filtrowania, w którym detekcje poniżej ustalonego progu były usuwane w celu redukcji wyników fałszywie dodatnich11,12. Strategia ta redukuje liczbę zakłóconych detekcji, ale może również odrzucić rzeczywiste cele w przypadku okluzji, szybkiego ruchu lub niskiej jakości obrazu, co prowadzi do fragmentacji trajektorii13,14,15. Podobne strategie filtrowania wykazały również, że stałe progi ufności są wrażliwe na zmienność sceny i jakość detekcji16,17. Aby usprawnić wykorzystanie detekcji o niskim poziomie ufności, w ByteTrack wprowadzono strategię asocjacji, która zachowuje ramki o niskiej ufności jako potencjalne cele dla dopasowania wtórnego i łączy je z istniejącymi trajektoriami poprzez podobieństwo ruchu i historię trajektorii18. McByte rozszerza asocjację w sportowym MOT, wprowadzając czasowo propagowane maski segmentacji jako wskazówkę asocjacyjną, co poprawia odporność w warunkach szybkiego ruchu, okluzji i przesunięć kamery bez konieczności dodatkowego trenowania dla każdego wideo19. Powiązane badania zmodyfikowały również wykorzystanie detekcji o niskiej ufności, aby zachować słabe, ale potencjalnie poprawne cele podczas asocjacji20,21,22. Strategie asocjacji adaptacyjne względem ufności doprecyzowały następnie kryteria dopasowania zgodnie ze spójnością ruchu i niezawodnością detekcji23,24,25. Metody udoskonalania trajektorii oparte na regresji ramek detekcji i optymalizacji gładkości trajektorii były również stosowane w celu redukcji fragmentacji trajektorii26,27,28. Dodatkowe strategie udoskonalania zapewniają uzupełniające wsparcie dla zachowania ciągłości trajektorii w złożonych warunkach ruchu29. Czasowo spójny przepływ obiektów (temporal coherent object flow) dodatkowo modeluje czasową spójność na poziomie obiektu pomiędzy klatkami, stanowiąc kolejne podejście zorientowane na asocjację w celu redukcji przerw w trajektoriach w złożonych scenariuszach MOT30. Metody fuzji trackerów uczą się również z wyników wielu trackerów i wykorzystują oparte na uczeniu strategie selekcji lub fuzji, aby poprawić odporność śledzenia w różnych benchmarkach MOT31. Łącznie badania te wskazują, że asocjacja uwzględniająca ufność pomaga odzyskać przerwane trajektorie; jednak wskazówki dotyczące ufności i ruchu dostarczają ograniczone informacje o tożsamości, gdy zawodnicy z tej samej drużyny mają podobny wygląd wizualny. Chociaż metody te skutecznie łagodzą fragmentację trajektorii w scenariuszach ogólnych, napotykają one na inherentne ograniczenia w ustawieniach sportowych, ponieważ zawodnicy z tej samej drużyny często mają bardzo podobny wygląd, a poleganie wyłącznie na informacjach o ufności i ruchu nie może zapewnić wystarczającej podstawy do rozróżnienia tożsamości32,33,34. Nawet gdy ramki o niskiej ufności są skutecznie odzyskiwane, podobieństwo cech nadal może prowadzić do zamiany tożsamości (identity switching), co utrudnia spełnienie rygorystycznych wymagań dotyczących spójności tożsamości w analizie sportowej.

W celu poprawy dyskryminacji tożsamości w śledzeniu sportowców wykorzystywano również specyficzne dla sportu wskazówki tożsamościowe. Semantyczne informacje z koszulek, takie jak kolor drużyny i numer zawodnika, dostarczają wskazówek tożsamościowych, które są bardziej bezpośrednio związane z sytuacjami sportowymi niż ogólne osadzenia wyglądu35,36,37. Kolor koszulki był wykorzystywany do wspierania dyskryminacji na poziomie drużyny i redukcji pomyłek między drużynami, podczas gdy rozpoznawanie numeru zawodnika dostarcza bardziej precyzyjnej wskazówki tożsamościowej, gdy obszar numeru jest widoczny i czytelny38,39. Istniejące badania nad śledzeniem w sporcie włączyły specyficzne dla domeny cechy wizualne oraz rozpoznawanie kolorów koszulek, aby poprawić asocjację zawodników w zatłoczonych warunkach sportowych40,41. Powiązane prace nad rozpoznawaniem numerów na koszulkach i syntetycznymi danymi numerowymi dodatkowo wspierają modelowanie tożsamości w warunkach niskiej rozdzielczości lub częściowego przesłonięcia42,43. Badania te wskazują, że semantyka koszulek może wzmocnić reprezentację tożsamości w sports MOT. Jednak większość metod śledzenia wzbogaconych semantycznie nie modeluje w sposób wystarczający relacji między pewnością detekcji a jakością cech semantycznych. Detekcje o wysokiej pewności mogą już zawierać niezawodne informacje przestrzenne i dotyczące wyglądu, co sprawia, że powtarzająca się ekstrakcja semantyczna jest mniej efektywna. Detekcje o niskiej pewności często cierpią z powodu przesłonięcia, rozmycia, ucięcia lub niskiej rozdzielczości, co zmniejsza niezawodność wskazówek dotyczących koloru i numeru zawodnika. Ograniczenie to motywuje do zaprojektowania asocjacji sterowanej pewnością, w której semantyka koszulek jest wprowadzana w zależności od jakości detekcji, a nie stosowana jednolicie do wszystkich detekcji. Przejrzane badania pokazują, że asocjacja świadoma pewności i modelowanie semantyczne koszulek odnoszą się do różnych aspektów sports MOT. Strategie oparte na pewności określają głównie, czy detekcja powinna uczestniczyć w asocjacji i w jaki sposób powinna zostać dopasowana do istniejących trajektorii, podczas gdy strategie semantyczne koszulek przede wszystkim wzmacniają reprezentację tożsamości poprzez wskazówki specyficzne dla sportu. Jednak te dwa mechanizmy są często projektowane jako osobne komponenty. W rezultacie wskazówki semantyczne nie zawsze są dostosowywane do jakości detekcji, a poziomy pewności nie regulują bezpośrednio wykorzystania informacji o kolorze i numerze zawodnika podczas asocjacji. Rozdzielność ta ogranicza wspólne radzenie sobie z fragmentacją trajektorii i pomyłkami w tożsamości w materiałach wideo z gier zespołowych. Pozostała luka badawcza polega na powiązaniu oceny jakości pewności detekcji z semantyczną asocjacją koszulek w ramach tego samego procesu śledzenia.

Protokół

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Niniejsze badanie obejmowało wtórną analizę publicznie dostępnych wzorcowych zestawów danych wideo, mianowicie SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 oraz MOT20. Nie rekrutowano uczestników, nie przeprowadzano żadnych interwencji ani nie gromadzono nowych danych pochodzących od ludzi. Zgodnie z obowiązującymi wymogami instytucjonalnymi Uniwersytetu Bangkok Thonburi, badanie to nie wymagało zgody komisji etycznej.

Poniższy protokół opisuje przebieg prac wykorzystanych do reprodukcji JerseyTrack, od przygotowania danych po ewaluację śledzenia. Proces obejmuje przygotowanie zbioru danych, przygotowanie detektora, semantyczną ekstrakcję koszulek, partycjonowanie poziomów ufności, asocjację sterowaną poziomem ufności, inferencję śledzenia oraz ewaluację wydajności, co przedstawiono podsumowująco na Rysunku 1. Wymagane oprogramowanie, zbiory danych i zasoby sprzętowe wymieniono w Tabeli materiałów.

figure-protocol-1
Rycina 1. Ogólny schemat działania metody JerseyTrack. Schemat obejmuje ekstrakcję cech semantycznych koszulek, wstępne dopasowanie obiektów, uzupełniające dopasowanie sterowane poziomem ufności oraz fuzję cech. Cechy koloru drużyny i numeru zawodnika są ekstrahowane z wykrytych obszarów sportowców i włączane do procesu asocjacji w celu poprawy dopasowania trajektorii w warunkach niepewnej detekcji. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tej ryciny.

1. Przygotowanie zbiorów danych i struktury katalogów

  1. Pobierz publiczne zbiory danych referencyjnych wymienione w Tabeli Materiałów. Wykorzystaj SportsMOT jako główny zbiór danych do przygotowania detektora i ewaluacji śledzenia. Zachowaj TeamTrack, SoccerNet Tracking, MOT17 oraz MOT20 do ewaluacji międzyzbiorowej.
  2. Przechowuj wszystkie zbiory danych w ujednoliconym katalogu projektu. Upewnij się, że detektor, moduł ekstrakcji semantycznej, moduł śledzenia oraz zestaw narzędzi do ewaluacji korzystają z identycznych identyfikatorów sekwencji.
  3. Konwertuj oficjalne adnotacje SportsMOT na format treningowy dla detektora, używając skryptu do przygotowania danych zastosowanego w niniejszym badaniu. Wykonaj poniższą komendę:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Skrypt do przygotowania danych (scripts/prepare_data.py) jest dostępny w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Wymagane zależności programistyczne są określone w pliku environment.yml, w tym Python 3.12, PyTorch 2.11.0 oraz OpenCV 4.10 lub nowsze. Skonfiguruj środowisko programistyczne za pomocą poniższej komendy: conda env create -f environment.yml. Uruchom skrypt do przygotowania danych za pomocą poniższej komendy: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Zweryfikuj, czy konwersja wygenerowała plik konfiguracji treningowej detektora: data\processed\SportsMOT_yolo\data.yaml oraz manifest konwersji: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    UWAGA: W niniejszym badaniu przekonwertowany zbiór treningowy i walidacyjny SportsMOT zawierał 90 sekwencji, 55 544 klatki i 608 152 adnotowane obiekty.
  6. Przejrzyj reprezentatywne sekwencje, aby upewnić się, że kolejność klatek, współrzędne ramek ograniczających (bounding-box) i etykiety tożsamości są spójne z oryginalnymi adnotacjami referencyjnymi.
  7. Przechowuj przekonwertowane pliki adnotacji bez modyfikacji podczas przygotowania detektora, wnioskowania śledzenia i ewaluacji, tak aby wszystkie metody korzystały z tego samego podziału zbioru danych i protokołu ewaluacji.
    UWAGA: Oczekiwanym wynikiem tej sekcji jest ustandaryzowany katalog treningowy detektora SportsMOT zawierający przekonwertowane adnotacje, manifest konwersji oraz pliki podziału zbioru danych wymagane do przygotowania detektora i ewaluacji śledzenia.

2. Przygotowanie wyjść detektora

  1. Przeprowadź dostrajanie (fine-tuning) detektora obiektów, wykorzystując przygotowany zestaw treningowy SportsMOT. Zoptymalizuj detektor, stosując stratę klasyfikacji oraz stratę regresji ramek otaczających zdefiniowane w Równaniu 1. Użyj rozdzielczości wejściowej detektora, wielkości partii (batch size), współczynnika uczenia, liczby epok treningowych oraz pozostałych parametrów treningowych opisanych w konfiguracji implementacji i w Tabeli Materiałów
    Ldet = Lcls + Lbox   (1)
    Gdzie  Ldet  oznacza całkowitą stratę detektora, Lcls  oznacza stratę klasyfikacji, a Lbox  stratę regresji ramek otaczających.
    UWAGA: Punkt kontrolny (checkpoint) detektora użyty w głównych eksperymentach (wewnętrzny identyfikator eksperymentu e3) został przeszkolony przy użyciu frameworka Ultralytics YOLO z konfiguracją zbioru danych SportsMOT w formacie YOLO (data/processed/SportsMOT_yolo/data.yaml). Uruchom trening detektora za pomocą następującego polecenia: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Po zakończeniu treningu użyj najlepszego punktu kontrolnego do wygenerowania wyników detekcji dla sekwencji walidacyjnych za pomocą następującego polecenia: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Zapisz przeszkolony punkt kontrolny detektora, odpowiadający plik metadanych oraz log treningowy po zakończeniu procesu.
    UWAGA: W niniejszym badaniu punkt kontrolny detektora użyty w eksperymentach formalnych został zapisany jako:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Odpowiadający mu plik metadanych został zapisany jako: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. Katalog z wynikami detekcji użyty w głównych eksperymentach walidacyjnych SportsMOT to: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Uruchom przeszkolony detektor na każdej sekwencji walidacyjnej, aby wygenerować ramki otaczające sportowców oraz wyniki ufności (confidence scores). Eksportuj jeden plik detekcji dla każdej sekwencji, zawierający indeks klatki, współrzędne ramki otaczającej, ufność detekcji oraz etykietę klasy.
    UWAGA: W przebiegu walidacji SportsMOT użytym w głównych eksperymentach, próg ufności wynoszący 0.05 wygenerował 343 990 detekcji sportowców.
  4. Przejrzyj katalog z wynikami detekcji przed rozpoczęciem inferencji śledzenia. Potwierdź, że każda sekwencja posiada odpowiadający jej plik detekcji, że indeksy klatek zgadzają się z przygotowaną sekwencją obrazów i że każdy rekord detekcji zawiera wynik ufności.
    UWAGA: Oczekiwanym rezultatem tej sekcji jest kompletny katalog z wynikami detekcji, który posłuży jako dane wejściowe do semantycznej ekstrakcji koszulek, partycjonowania poziomów ufności oraz asocjacji śledzenia.

3. Wyodrębnianie cech semantycznych koszulki

  1. Wykorzystaj pliki wyjściowe z detektora, aby wyciąć obszary sportowców z każdej klatki wideo. Zapisz każdy wycięty obraz sportowca wraz z identyfikatorem sekwencji, indeksem klatki i indeksem detekcji. Wyklucz nieprawidłowe wycięcia z brakującą zawartością obrazu lub ramkami ograniczającymi wykraczającymi poza granice obrazu. Zachowaj powiązanie między nazwą pliku każdego wycięcia a oryginalnym rekordem detekcji, aby wyekstrahowane cechy semantyczne mogły zostać dopasowane do odpowiedniej detekcji podczas asocjacji śledzenia.
  2. Wyekstrahuj cechy koloru koszulki z wyciętych obrazów sportowców, używając skryptu ekstrakcji semantycznej zastosowanego w niniejszym badaniu.
    UWAGA: Skrypty ekstrakcji cech semantycznych (scripts/extract_fast_color_semantics.py oraz scripts/formal_extract_semantics.py) są dostępne w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Oddzielny plik konfiguracyjny nie jest wymagany; wszystkie parametry uruchomieniowe są przekazywane za pomocą argumentów wiersza poleceń.
    Wygeneruj deskryptory koloru koszulki za pomocą następującego polecenia: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Wygeneruj cechy semantyczne numerów zawodników za pomocą modelu OCR, używając następującego polecenia: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. Wygenerowane deskryptory koloru koszulki i wyniki prawdopodobieństwa numerów zawodników są powiązane za pomocą identyfikatora sekwencji i połączone w plikach cech semantycznych wykorzystywanych podczas asocjacji śledzenia.
  3. Konwertuj każdy wycięty obraz sportowca do przestrzeni kolorów Hue, Saturation, Value (HSV). Wyekstrahuj piksele pierwszego planu z obszaru koszulki i podsumuj dominujący kolor koszulki, stosując klasteryzację K-średnich z K = 3. Przed porównaniem cech znormalizuj otrzymany deskryptor koloru za pomocą normalizacji L2.
  4. Wytrenuj gałąź rozpoznawania numerów zawodników, używając wyciętych obrazów sportowców o rozmiarze wejściowym 128 × 64 pikseli. Wygeneruj pseudoetykiety numerów zawodników, stosując procedurę etykietowania ze słabym nadzorem zastosowaną w niniejszym badaniu. Wyklucz z obliczeń straty rozpoznawania optycznego znaków (OCR) wycięcia z niewidocznymi, nieczytelnymi, silnie zasłoniętymi lub niskopoziomowymi obszarami numerów zawodników.
  5. Zoptymalizuj gałąź OCR, używając straty entropii krzyżowej zdefiniowanej w Równaniu 2.
    figure-protocol-2 (2)
    Tutaj Locr oznacza stratę OCR, yi  oznacza nadzorowaną etykietę numeru zawodnika, a figure-protocol-3 oznacza przewidzianą kategorię numeru zawodnika.
  6. Zoptymalizuj moduł ekstrakcji cech semantycznych, używając adaptacyjnego optymalizatora, tempa uczenia, rozmiaru partii, rozkładu wag oraz czasu trwania treningu wymienionych w Tabeli Materiałów. Połącz stratę detektora i stratę OCR, stosując całkowity cel treningowy zdefiniowany w Równaniu 3.
    Ltotal = Ldet + γLocr   (3)
    Tutaj Ltotal oznacza całkowitą stratę treningową, Ldet oznacza stratę detektora zdefiniowaną w Równaniu 1, Locr oznacza stratę OCR zdefiniowaną w Równaniu 2, a γ oznacza zdefiniowany przez użytkownika współczynnik wagowy dla straty OCR.
  7. Zastosuj wytrenowaną gałąź OCR do każdego wyciętego obrazu sportowca. Zapisz przewidzianą kategorię numeru zawodnika lub wektor prawdopodobieństwa dla każdego wycięcia. Jeśli numer zawodnika nie jest widoczny lub pewność OCR jest poniżej progu zdefiniowanego w implementacji, zapisz cechę numeru zawodnika jako niedostępną, zamiast wymuszać predykcję.
  8. Połącz deskryptor koloru koszulki i wynik numeru zawodnika w pliku cech semantycznych wykorzystywanym przez moduł śledzenia.
    UWAGA: W głównym przebiegu walidacji SportsMOT skrypt ekstrakcji semantycznej przetworzył 343 990 detekcji bez brakujących klatek lub nieprawidłowych wycięć. W obecnym pakiecie rewizyjnym podsumowanie ekstrakcji semantycznej wykazało ogólną dokładność ekstrakcji semantycznej koloru i OCR na poziomie 86,7% w oceniających ustawieniach SportsMOT. Oczekiwanym wynikiem tej sekcji jest plik cech semantycznych, w którym każdy poprawny rekord detekcji jest powiązany z deskryptorem koloru koszulki, wynikiem numeru zawodnika (jeśli dostępny) oraz flagą wskazującą, czy informacje semantyczne są dostępne dla asocjacji śledzenia.

4. Poziomy ufności wykrywania partycji

  1. Wczytaj plik z wynikami detektora dla każdej sekwencji wideo. Zbierz wyniki pewności (confidence scores) dla wszystkich detekcji sportowców w każdej klatce.
  2. Podziel wyniki pewności na poziomie klatek na przedziały wysokiej, średniej i niskiej pewności, stosując klasteryzację K-średnich z K = 3, zgodnie z przepływem asocjacji sterowanej pewnością przedstawionym na Rysunku 2. Wyznacz adaptacyjne progi pewności poprzez minimalizację wariancji wewnątrzklastrowej zgodnie z Równaniem 4.
    figure-protocol-4  (4)
    Tutaj sd oznacza wynik pewności detekcji d; D1, D2 i D3 oznaczają odpowiednio przedziały wysokiej, średniej i niskiej pewności; μ1, μ2 i μ3 oznaczają średnie wyniki pewności dla trzech przedziałów; a  τ1 oraz  τ2 oznaczają adaptacyjne progi pewności uzyskane z wyników klasteryzacji K-średnich.
    UWAGA: Skrypt do podziału pewności (scripts/formal_partition_confidence.py) jest dostępny w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Moduł podziału pewności wykorzystuje jednowymiarową procedurę klasteryzacji K-średnich opartą na bibliotece NumPy z K = 3. Nie jest wymagany osobny plik konfiguracyjny; katalog wejściowy, katalog wyjściowy oraz parametr klasteryzacji są określane za pomocą argumentów wiersza poleceń. Wykonaj procedurę podziału pewności za pomocą następującego polecenia: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Wymagane zależności programowe, w tym wersja NumPy, są określone w pliku environment.yml.
  3. Uruchom procedurę podziału pewności, wskazując katalog z wynikami detektora jako wejście.
    UWAGA: W niniejszym badaniu katalog z wynikami detektora był: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. Katalog wyjściowy podziału pewności był: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. Wygenerowane pliki wyjściowe obejmowały pliki CSV z pewnością dla każdej sekwencji, _confidence_frame_summary.csv oraz _confidence_runtime.csv.
  4. Przypisz etykietę poziomu pewności do każdej detekcji. Oznacz detekcje o wysokiej pewności do asocjacji opartej na ruchu, detekcje o średniej pewności do asocjacji semantyczno-ruchowej, a detekcje o niskiej pewności wyłącznie do odzyskiwania trajektorii. Zachowaj oryginalny wynik pewności wraz z przypisaną etykietą poziomu pewności.
  5. Przeanalizuj rozkłady wyników pewności oraz reprezentatywne klatki, jak zilustrowano na Rysunku 3. Zweryfikuj, czy detekcje o wysokiej pewności odpowiadają głównie kompletnym i wiarygodnym ramkom ograniczającym sportowców, podczas gdy detekcje o średniej i niskiej pewności zawierają głównie detekcje częściowe, przysłonięte, rozmyte lub słabe.
    UWAGA: Oczekiwanym wynikiem tej sekcji jest plik podziału pewności zawierający indeks detekcji, oryginalny wynik pewności, przypisany poziom pewności oraz adaptacyjne progi pewności na poziomie klatki dla każdej detekcji.

figure-protocol-5
Rycina 2. Strategia asocjacji kierowana poziomem pewności. Przepływ pracy dzieli pewność detekcji na przedziały wysokiej, średniej i niskiej pewności z wykorzystaniem adaptacyjnego klastrowania pewności. Detekcje o wysokiej pewności są asocjowane na podstawie podobieństwa ruchu, detekcje o średniej pewności są asocjowane przy użyciu połączonego podobieństwa ruchu i semantyki koszulki, natomiast detekcje o niskiej pewności służą do semantycznie wspomaganej odzyskiwania trajektorii z weryfikacją wieloklatkową. Prawy panel podsumowuje sformułowanie matematyczne zastosowane do podziału pewności i asocjacji. Kliknij tutaj, aby zobaczyć powiększoną wersję tej ryciny.

figure-protocol-6
Rycina 3. Rozkład wyników pewności detekcji. Histogram przedstawia liczbę ramek detekcji sportowców w pięciu przedziałach pewności dla sekwencji piłki nożnej, koszykówki i siatkówki w zbiorze danych SportsMOT. Rozkład ilustruje różnice w pewności detektora pomiędzy ocenianymi kategoriami sportowymi. Aby wyświetlić powiększoną wersję tej ryciny, kliknij tutaj.

5. Przeprowadzenie asocjacji z prowadzeniem przez poziom ufności

  1. Wczytaj plik z wynikami detektora, plik cech semantycznych oraz plik partycji ufności dla każdej sekwencji wideo. Zainicjuj tracker, wykorzystując pierwsze poprawne detekcje, i utrzymuj stan jednej trajektorii dla każdego śledzonego sportowca. Dla każdej kolejnej klatki przewiduj pozycję każdej istniejącej trajektorii, korzystając z modelu ruchu filtra Kalmana.
  2. Oblicz podobieństwo ruchu między każdą przewidzianą trajektorią a kandydowaną detekcją, stosując odległość Mahalanobisa zdefiniowaną w Równaniu 5.
    figure-protocol-7  (5)
    W tym zapisie figure-protocol-8 oznacza I-tą trajektorię w klatce k, figure-protocol-9 oznacza stan trajektorii przewidziany przez filtr Kalmana, dj oznacza kandyдованą detekcję, figure-protocol-10 oznacza odwróconą macierz kowariancji stanu przewidzianej trajektorii, a Smot oznacza odległość ruchu między przewidzianą trajektorią a detekcją.
    UWAGA: Główny proces asocjacji jest zaimplementowany w pliku jerseytrack/formal_tracker.py i wykonywany za pomocą skryptu scripts/formal_track.py; oba są dostępne w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Nie jest wymagany oddzielny plik konfiguracyjny. Wszystkie parametry uruchomieniowe, w tym progi ufności, maksymalny wiek trajektorii, współczynniki wag ruchu oraz waga odległości środka, są przekazywane jako argumenty wiersza poleceń. Pełna komenda wykonawcza i ustawienia parametrów znajdują się w Kroku 6.2. Implementacja wykorzystuje algorytm liniowego przypisania sumarycznego z biblioteki SciPy do dopasowania węgierskiego oraz bibliotekę NumPy do asocjacji opartej na kosztach.
  3. Uruchom proces śledzenia, wykorzystując jako dane wejściowe plik z wynikami detektora, plik cech semantycznych oraz plik partycji ufności.
    UWAGA: W niniejszym badaniu główny tracker został zaimplementowany w jerseytrack\formal_tracker.py, a proces śledzenia wykonano za pomocą scripts\formal_track.py.
  4. Powiąż detekcje o wysokiej ufności z istniejącymi trajektoriami, opierając się na spójności ruchu. Zaktualizuj dopasowane trajektorie i inicjuj nowe trajektorie tylko wtedy, gdy niedopasowane detekcje o wysokiej ufności spełniają kryteria inicjalizacji trajektorii.
  5. Przeanalizuj wyniki ekstrakcji cech semantycznych koszulek przedstawione na Rysunku 4 i stwórz wektor cech semantycznych koszulki dla każdej detekcji, łącząc deskryptor koloru drużyny i cechę numeru zawodnika zgodnie z Równaniem 6.
    fsem = [fcol;fid] (6)
    W tym zapisie fsem oznacza zintegrowany wektor cech semantycznych, fcol oznacza deskryptor koloru drużyny, a fid oznacza cechę numeru zawodnika wygenerowaną przez moduł OCR.
  6. Powiąż detekcje o średniej ufności, łącząc podobieństwo ruchu z podobieństwem semantycznym koszulek. Oblicz zintegrowaną wartość dopasowania zgodnie z Równaniem 7.
    figure-protocol-11 (7)
    W tym zapisie Ssem oznacza podobieństwo cosinusowe między wektorami cech semantycznych trajektorii i kandydowanej detekcji, Smot oznacza odległość ruchu zdefiniowaną w Równaniu 5, a λ oznacza adaptacyjny współczynnik fuzji balansujący składniki podobieństwa ruchu i podobieństwa semantycznego.
  7. Oblicz adaptacyjny współczynnik fuzji zgodnie z Równaniem 8.
    figure-protocol-12 (8)
    W tym zapisie λoznacza początkowy współczynnik wagi ruchu, σsd oznacza odchylenie standardowe wyników ufności detekcji w aktualnej klatce, a σmax oznacza maksymalne odchylenie standardowe wyniku ufności użyte do normalizacji.
  8. Wykorzystaj detekcje o niskiej ufności wyłącznie do odzyskiwania trajektorii. Dopasuj detekcje o niskiej ufności do przerwanych trajektorii tylko wtedy, gdy dostępne są informacje semantyczne i spełnione są kryteria odzyskiwania. Zastosuj weryfikację wieloklatkową przed przywróceniem tożsamości trajektorii i odrzuć detekcje, które nie przeszły weryfikacji.
    UWAGA: Gdy cecha numeru zawodnika jest niedostępna, wykonaj asocjację w oparciu o dostępne informacje semantyczne i spójność ruchu, zamiast wymuszać dopasowanie numeru zawodnika. Oczekiwanym wynikiem tej sekcji jest klatka po klatce zapis śledzenia zawierający tożsamości trajektorii, ramki ograniczające (bounding boxes), etykiety poziomu ufności, koszty ruchu, informacje semantyczne i ostateczne decyzje asocjacyjne. W pakiecie dowodowym z rewizji wyniki śledzenia zostały zapisane w: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Rysunek 4. Ekstrakcja cech semantycznych koszulek. Reprezentatywne detekcje sportowców są opisane wyekstrahowanymi deskryptorami kolorów drużyn oraz informacjami o numerach zawodników, wygenerowanymi przez moduł ekstrakcji semantyki koszulek. Wyekstrahowane cechy semantyczne są następnie włączone do asocjacji danych sterowanej poziomem ufności. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

6. Uruchomienie wnioskowania śledzenia i eksport wyników

  1. Przeprowadź wnioskowanie śledzenia (tracking inference) dla każdej sekwencji wideo, korzystając z przygotowanych plików z wynikami detektora, plików cech semantycznych oraz plików partycji ufności. Przetwarzaj klatki wideo w kolejności chronologicznej, aby stany trajektorii, historia semantyczna i decyzje o odzyskiwaniu trajektorii były aktualizowane spójnie w całej sekwencji. Dla wszystkich ewaluowanych sekwencji stosuj tę samą konfigurację wnioskowania, chyba że w raporcie określono wyraźnie ustawienia specyficzne dla danego zbioru danych.
    UWAGA: Wnioskowanie śledzenia zostało wykonane za pomocą skryptu scripts/formal_track.py, który jest dostępny w repozytorium kodu źródłowego JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Nie jest wymagany oddzielny plik konfiguracyjny. Uruchom wnioskowanie śledzenia za pomocą następującego polecenia: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Wszystkie niewskazane parametry zachowały wartości domyślne zapisane w zarchiwizowanym kodzie źródłowym.
  2. Po wnioskowaniu zastosuj główną sekwencję postprocesowania, używając następujących poleceń: python scripts/merge_tracklets.py oraz python scripts/sweep_track_filter.py --min-len 95.
  3. Wyeksportuj wyniki śledzenia w formacie wymaganym przez zestaw narzędzi ewaluacyjnych. Uwzględnij indeks klatki, identyfikator trajektorii, współrzędne ramki ograniczającej (bounding-box) oraz wszystkie pola wymagane przez format ewaluacji benchmarku. Zapisz jeden plik z wynikami śledzenia dla każdej sekwencji, stosując spójną konwencję nazewnictwa plików, aby każdy plik z wynikami mógł zostać dopasowany do odpowiadającego mu pliku adnotacji prawdy obiektywnej (ground-truth).
  4. Zastosuj wyłącznie operacje postprocesowania użyte w niniejszym badaniu. Przeprowadź łączenie fragmentów trajektorii (tracklet merging) oraz filtrowanie śledzenia przy użyciu skryptów do postprocesowania opisanych w pakiecie rewizyjnym.
    UWAGA: W niniejszym badaniu w przepływie pracy postprocesowania wykorzystano następujące skrypty:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Przejrzyj wyeksportowane wyniki śledzenia przed ewaluacją ilościową. Potwierdź, że identyfikatory trajektorii pozostają numeryczne i spójne w obrębie każdej sekwencji, że nie brakuje żadnych indeksów klatek oraz że wszystkie ramki ograniczające znajdują się w granicach obrazu.
    UWAGA: Oczekiwanym wynikiem tej sekcji jest kompletny zestaw plików z wynikami śledzenia na poziomie sekwencji, gotowych do ewaluacji ilościowej.

7. Ocena wydajności śledzenia

  1. Ocenić wyeksportowane pliki z wynikami śledzenia, korzystając z zestawu narzędzi ewaluacyjnych wymienionego w Tabeli materiałów. Dopasować każdy plik z wynikami śledzenia do odpowiadającego mu pliku adnotacji prawdy obiektywnej (ground-truth) oraz odpowiedniego podzbioru danych. Dla wszystkich porównywanych metod zastosować tę samą konfigurację ewaluacji, aby mieć pewność, że różnice w wydajności wynikają z rezultatów śledzenia, a nie z ustawień ewaluacyjnych.
  2. Uruchomić ewaluację za pomocą następującego polecenia
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine
    _round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    UWAGA: Ewaluację przeprowadzono przy użyciu standardowej implementacji metryk TrackEval (wersja 1.3.0) zarchiwizowanej w pakiecie reprodukowalności JerseyTrack. Nie wprowadzono żadnych modyfikacji do implementacji metryk Higher Order Tracking Accuracy (HOTA), CLEAR ani Identity. Repozytorium zawiera wrapper wykonawczy w stylu MOTChallenge, znajdujący się w evaluation/trackeval/scripts/run_mot_challenge.py, który konfiguruje ścieżki do zbioru danych i wyników oraz wywołuje standardowe metryki ewaluacyjne TrackEval.
  3. Zarejestrować metryki ewaluacyjne opisane w manuskrypcie, w tym Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA), Detection Accuracy (DetA), Association Accuracy (AssA), liczbę fałszywych alarmów (FPs), liczbę pominięć (FNs) oraz zdarzenia zmiany tożsamości (identity-switching events). Wyeksportować podsumowanie ewaluacji w formie tabeli i zachować pliki ewaluacji dla poszczególnych sekwencji w celu weryfikacji.
  4. Podczas porównywania metody JerseyTrack z metodami bazowymi, dla wszystkich metod stosować ten sam podzbiór danych, wyniki detektora oraz konfigurację ewaluacji. Zarejestrować zestaw danych, źródło wyników detektora, konfigurację narzędzi ewaluacyjnych oraz wartości metryk dla każdego porównania.
  5. Przejrzeć logi ewaluacji, aby upewnić się, że wszystkie sekwencje zostały pomyślnie ocenione i że nie brakuje żadnych plików z wynikami śledzenia.
    UWAGA: W niniejszym badaniu główny plik podsumowania TrackEval był przechowywany w: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Oczekiwanym rezultatem tej sekcji jest kompletna tabela podsumowująca ewaluację wraz z plikami metryk dla poszczególnych sekwencji, stanowiącymi podstawę dla raportowanych wyników i późniejszej weryfikacji.

Wyniki

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W tej sekcji przedstawiono ilościowe i jakościowe wyniki uzyskane w ramach ocenianych eksperymentów z zakresu wielobiektowego śledzenia w sporcie. Wyniki skupiają się na dokładności śledzenia, zachowaniu tożsamości obiektów, jakości asocjacji oraz odporności w ramach przetestowanych ustawień zbioru danych. Twierdzenia dotyczące wydajności są ograniczone do ocenianych metod, zbiorów danych, wyników detektora oraz konfiguracji zestawu narzędzi ewaluacyjnych opisanych w Protokole i Konfiguracji Implementacji.

Ustawienie eksperymentalne i projekt oceny

Zbiór danych i przetwarzanie wstępne:

Zbiór SportsMOT posłużył jako główny punkt odniesienia dla przygotowania detektora, wnioskowania śledzenia oraz oceny ilościowej. Zbiór danych zawiera 240 sekwencji wideo i ponad 150 000 klatek obrazu obejmujących scenariusze z piłki nożnej, koszykówki i siatkówki (Rysunek 5). W formalnej ocenie główne wyniki dla SportsMOT obliczono przy użyciu podziału walidacyjnego wraz z wynikami detektora, konfiguracją śledzenia i ustawieniami TrackEval opisanymi w protokole. Ewaluacja międzyzbiorowa została przeprowadzona na zbiorach TeamTrack, SoccerNet Tracking, MOT17 i MOT20 w celu zbadania transferu wydajności między różnymi typami zbiorów danych, a nie w celu bezpośredniego porównywania zestawów danych na poziomie metryk.

figure-results-1
Rycina 5. Reprezentatywne zestawy danych wykorzystane do ewaluacji. Przykładowe klatki obrazu przedstawiają reprezentatywne sekwencje rozgrywek piłki nożnej, koszykówki i siatkówki użyte w ewaluacji eksperymentalnej. Rycina podkreśla różnice w punkcie widzenia kamery, zagęszczeniu graczy oraz złożoności scen w ewaluowanych zestawach danych. Prosimy kliknąć tutaj, aby wyświetlić większą wersję tej ryciny.

Dane SportsMOT zostały zorganizowane zgodnie z oficjalną strukturą zbioru danych i przekonwertowane na format treningu detektora opisany w Protokole. Przekonwertowane dane treningowe i walidacyjne SportsMOT obejmowały 90 sekwencji, 55 544 klatki i 608 152 adnotowane obiekty. Partycja treningowa została wykorzystana do przygotowania detektora i dostrojenia parametrów, natomiast partycja walidacyjna posłużyła do formalnej oceny śledzenia przedstawionej w niniejszym badaniu. Wszystkie klatki wejściowe zostały zmienione pod kątem rozmiaru zgodnie z konfiguracją detektora opisaną w Protokole oraz w Tabeli Materiałów. Ta sama procedura wstępnego przetwarzania była stosowana podczas przygotowania detektora, ekstrakcji cech semantycznych, wnioskowania śledzenia oraz oceny TrackEval, aby zgłaszane różnice odzwierciedlały przede wszystkim strategię asocjacji śledzenia, a nie różnice w przetwarzaniu danych.

Wskaźniki oceny:

Wydajność śledzenia została oceniona przy użyciu protokołu ewaluacyjnego zgodnego z MOTChallenge, zaimplementowanego za pomocą zestawu narzędzi ewaluacyjnych wymienionego w Tabeli Materiałów. Raportowane metryki opisują trzy aspekty wydajności MOT w sporcie: ogólną dokładność śledzenia, zachowanie tożsamości oraz jakość detekcji i asocjacji. W качестве głównych metryk ewaluacyjnych wykorzystano MOTA, IDF1 oraz HOTA44,45. MOTA podsumowuje wyniki fałszywie dodatnie, fałszywie ujemne oraz zmiany tożsamości w postaci ogólnego wyniku dokładności śledzenia. IDF1 mierzy spójność pomiędzy trajektoriami przewidywanymi a tożsamościami rzeczywistymi (ground-truth). HOTA wspólnie ocenia dokładność detekcji i dokładność asocjacji, a tym samym charakteryzuje równowagę między lokalizacją celu a asocjacją trajektorii. Jako metryki uzupełniające raportowano DetA i AssA. FP, FN oraz zmiany tożsamości (ID) wykorzystano do charakterystyki źródeł błędów związanych z błędnymi detekcjami, pominiętymi detekcjami oraz zmianami tożsamości. W celu porównania metod w ramach SportsMOT zastosowano te same wyniki detektora i konfigurację zestawu narzędzi ewaluacyjnych, aby zminimalizować wpływ zmienności detektora i różnic w ustawieniach ewaluacji. W przypadku porównań między zbiorami danych wartości metryk interpretowano jako wyniki ewaluacji wewnątrz zbioru, a nie jako dowód absolutnej przewagi wydajności między różnymi zbiorami danych.

Konfiguracja środowiska eksperymentalnego i parametrów:

Eksperymenty przeprowadzono przy użyciu zasobów sprzętowych i programowych wymienionych w Tabeli Materiałów. W głównych eksperymentach SportsMOT stosowano to samo środowisko obliczeniowe, strukturę detektora, wyjścia detektora oraz zestaw narzędzi ewaluacyjnych, aby zachować spójność podczas przygotowania detektora, wnioskowania śledzenia i oceny wydajności. Struktura detektora wymieniona w Tabeli Materiałów została przeszkolona przy rozmiarze partii (batch size) wynoszącym 16, początkowej szybkości uczenia 0,01 oraz 80 epokach uczenia. W module semantycznej ekstrakcji koszulek do klastrowania kolorów wykorzystano algorytm K-means z K = 3, a gałąź OCR wykorzystała lekką splotową rekurencyjną sieć neuronową z rozmiarem wejścia 128 × 64 pikseli. Gałąź OCR zoptymalizowano przy użyciu adaptacyjnego optymalizatora wymienionego w Tabeli Materiałów z szybkością uczenia 1 × 10⁻3, zanikiem wag (weight decay) 1 × 10⁻5, rozmiarem partii 64 i 40 epokami uczenia. Podczas uczenia modułu ekstrakcji cech semantycznych nie stosowano dodatkowego harmonogramowania szybkości uczenia. Współczynnik wagowy straty OCR (γ) traktowano jako hiperparametr definiowany przez użytkownika i dobierano na podstawie wydajności zestawu walidacyjnego. Stratyfikacja poziomu ufności wykorzystywała adaptacyjny podział K-means, w którym τ₁ i τ₂ były obliczane na podstawie rozkładu ufności detekcji dla każdej klatki, a nie definiowane ręcznie przed wnioskowaniem.

Monitorowanie wydajności w różnych dyscyplinach sportowych i przy różnym stopniu złożoności scenariuszy

Wydajność ilościowa w różnych dyscyplinach sportowych i warunkach otoczenia:

Wydajność śledzenia oceniano w ramach dwóch czynników grupowania: kategorii sportu oraz złożoności sceny. Analiza kategorii sportowych obejmowała sekwencje piłki nożnej, koszykówki i siatkówki. Analiza złożoności sceny uwzględniała poziom przesłonięcia, prędkość ruchu oraz gęstość obiektów, stosując te same kryteria grupowania we wszystkich ocenianych sekwencjach. Raportowane metryki były zgodne z protokołem oceny opisanym w rozdziale 7 Protokołu. 

Rysunek 6 podsumowuje wyniki ilościowego śledzenia w różnych kategoriach sportowych i warunkach złożoności sceny. Rysunek 6A przedstawia wartości MOTA i DetA dla sekwencji piłki nożnej, koszykówki i siatkówki. Rysunek 6B przedstawia zmienność MOTA przy różnych poziomach przesłonięcia, prędkości ruchu i gęstości obiektów. Rysunek 6C przedstawia skumulowaną liczbę błędów FP i FN dla każdego wymiaru złożoności sceny.

figure-results-2
Rysunek 6. Wydajność śledzenia w różnych kategoriach sportowych i warunkach scenicznych. (A) Dokładność śledzenia wielu obiektów (MOTA) oraz dokładność detekcji (DetA) dla piłki nożnej, koszykówki, siatkówki oraz średnia ogólna. (B) MOTA w reprezentatywnych warunkach scenicznych o różnym stopniu przesłonięcia, zagęszczeniu zawodników i złożoności ruchu. (C) Liczba fałszywie dodatnich (FP) i fałszywie ujemnych (FN) wyników w ocenianych warunkach scenicznych. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

W trzech kategoriach sportowych JerseyTrack osiągnął średnią wartość MOTA na poziomie 88,9% oraz średnią wartość DetA wynoszącą 80,2%. Różnica w MOTA pomiędzy kategoriami sportowymi wyniosła 1,3 punktu procentowego, przy czym najwyższy wskaźnik MOTA odnotowano dla sekwencji siatkówki (89,2%), a najniższy dla sekwencji koszykówki (87,9%). Niższe MOTA zaobserwowane dla sekwencji koszykarskich jest zgodne z większą częstotliwością interakcji w bliskim zasięgu i gęstym przesłanianiem w analizowanych sekwencjach. W mniej złożonych warunkach scenicznych, obejmujących lekkie przesłanianie, niską prędkość ruchu i rzadki rozkład celów, MOTA osiągnęła odpowiednio 91,8%, 93,1% i 93,8%. W bardziej złożonych warunkach scenicznych MOTA spadła do 84,9% przy silnym przesłanianiu, 83,6% przy ruchu o wysokiej prędkości i 83,1% przy gęstym rozkładzie celów. Wyniki te pokazują, że wydajność śledzenia spadała wraz ze wzrostem złożoności sceny, pozostając jednocześnie w raportowanym zakresie we wszystkich ocenianych scenariuszach sportowych.

Śledzenie spójności w reprezentatywnych scenariuszach sportowych:

Rysunek 7 przedstawia reprezentatywne przykłady śledzenia, ilustrujące spójność czasową systemu JerseyTrack w trzech wymagających scenariuszach sportowych: gęstych interakcjach między zawodnikami, przedłużonym częściowym przesłonięciu oraz gwałtownych zmianach kierunku. W tych reprezentatywnych sekwencjach tracker zachował spójne tożsamości trajektorii pomimo częstych nakładania się sportowców i dynamicznego ruchu. Fragmentacja tożsamości była obserwowana głównie podczas silnego przesłonięcia lub w momentach, gdy semantyka koszulki stawała się tymczasowo niedostępna; jednak strategia asocjacji sterowana poziomem ufności umożliwiła odzyskanie trajektorii po ponownym pojawieniu się wiarygodnych detekcji. Przykłady te jakościowo potwierdzają wyniki ilościowe przedstawione na Rysunku 6, demonstrując stabilne zachowanie tożsamości w ocenianych warunkach śledzenia sportowego.

figure-results-3
Rysunek 7. Reprezentatywne wyniki śledzenia uzyskane za pomocą JerseyTrack. Kolejne klatki z sekwencji koszykówki, piłki nożnej i siatkówki ilustrują utrzymanie tożsamości i trajektorii sportowców podczas śledzenia. Kolorowe ramki ograniczające reprezentują śledzone tożsamości utrzymane w kolejnych klatkach wideo. Proszę kliknąć tutaj, aby wyświetlić powiększoną wersję tego rysunku.

Wyniki ablacji dla zachowania tożsamości:

Przeprowadzono analizę ablacyjną, aby zbadać wkład strategii asocjacji sterowanej pewnością oraz modułu fuzji semantycznej koszulek w zachowanie tożsamości. Porównano cztery warianty modelu: V0, model bazowy bez asocjacji sterowanej pewnością i bez fuzji semantycznej koszulek; V1, wariant wykorzystujący wyłącznie asocjację sterowaną pewnością; V2, wariant wykorzystujący wyłącznie fuzję semantyczną koszulek; oraz V3, pełną konfigurację JerseyTrack obejmującą oba komponenty. Ewaluacja skupiła się na metrykach związanych z tożsamością, w tym IDs, IDF1, precyzji tożsamości (IDP) oraz czułości tożsamości (IDR). Reprezentatywne wzorce zachowania tożsamości przedstawiono na Rysunku 8.

figure-results-4
Rysunek 8. Analiza ablacyjna semantycznych powiązań koszulki sterowanych stopniem pewności. (A) Całkowita liczba zmian tożsamości (IDs) oraz wskaźnik IDF1 (IDentity F1 Score) dla ocenianych wariantów modelu. (B) Porównanie liczby IDs między kompletnym modelem (V3) a konfiguracją bazową (V0) w reprezentatywnych, wymagających scenariuszach śledzenia. (C) IDF1, precyzja tożsamości (IDP) oraz czułość tożsamości (IDR) kompletnego modelu w różnych scenariuszach śledzenia. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

W ogólnym ustawieniu walidacji SportsMOT pełna konfiguracja V3 zapewniła najniższą liczbę ID oraz najwyższy wskaźnik IDF1 spośród czterech wariantów modelu. V3 odnotowała 2 768 ID, co oznacza o 477 mniej przełączeń tożsamości niż w przypadku V0, i osiągnęła wartość IDF1 na poziomie 74,3%, co stanowi wzrost o 7,1 punktu procentowego w stosunku do V0. Wyniki te wskazują, że oba moduły wspólnie przyczyniły się do zachowania tożsamości w ocenianych warunkach śledzenia sportowego. Porównanie wariantów z jednym modułem z pełną konfiguracją wykazało ponadto, że oba moduły wpływały na różne źródła błędów śledzenia. Strategia asocjacji kierowana pewnością (confidence-guided association strategy) zredukowała błędy dopasowania związane z niestabilną pewnością detekcji i niepewnością lokalizacji, podczas gdy moduł semantycznej fuzji koszulek (jersey semantic fusion module) dostarczył dodatkowych informacji o tożsamości w sytuacjach, gdy same informacje o ruchu były niewystarczające. Pełna konfiguracja V3 osiągnęła lepsze wyniki w zakresie tożsamości niż którykolwiek z wariantów z jednym modułem, co sugeruje, że oba moduły dostarczyły wkładów komplementarnych, a nie redundantnych.

Wyniki na poziomie scenariuszy wykazały większe różnice w trudniejszych warunkach zachowania tożsamości. Podczas długotrwałego przysłonięcia V3 zarejestrowało 215 ID w porównaniu do 482 dla V0. W gęstych scenariuszach z zawodnikami z tej samej drużyny, obejmujących od 6 do 10 graczy, V3 zarejestrowało 328 ID w porównaniu do 615 dla V0. Przy szybkich zmianach kierunku V3 zarejestrowało 482 ID w porównaniu do 960 dla V0. Redukcje te są zgodne z zamierzonym wykorzystaniem wskazówek semantycznych podczas przysłonięcia i gęstych interakcji, a także z asocjacją sterowaną poziomem pewności przy fluktuacyjnej pewności detekcji podczas gwałtownego ruchu. Trendy IDP i IDR przedstawione na Rysunku 8C wskazują, że redukcji liczby ID nie towarzyszył istotny spadek precyzji tożsamości ani kompletności tożsamości. Pełna konfiguracja utrzymała wartości IDF1 powyżej 71% we wszystkich ocenianych trudnych scenariuszach, przy czym niższe wartości zaobserwowano podczas gęstych interakcji zawodników z tej samej drużyny oraz szybkich zmian kierunku. Wyniki te wskazują na poprawę spójności tożsamości w ocenianych warunkach, identyfikując jednocześnie gęste interakcje i gwałtowny ruch jako główne pozostałe źródła pogorszenia wydajności.

Wyniki ewaluacji międzyzbiorowej:

Przeprowadzono ewaluację międzyzbiorową, aby sprawdzić, czy zachowanie śledzenia zaobserwowane w zbiorze SportsMOT może zostać utrzymane w różnych warunkach zbiorów danych. Ewaluacja objęła dwa zbiory specyficzne dla sportu, SoccerNet Tracking i TeamTrack, oraz dwa ogólne zbiory MOT: MOT17 i MOT20. Celem tego eksperymentu było zbadanie transferu wydajności pomiędzy różnymi typami zbiorów danych. Wyników nie wykorzystano do wykazania bezpośredniej przewagi na poziomie metryk między zbiorami, ponieważ protokoły adnotacji, kompozycja scen, punkty widzenia kamer oraz kategorie obiektów różnią się od siebie.

Tabela 1 podsumowuje wyniki ewaluacji międzyzbiorowej. W przypadku zbiorów danych specyficznych dla sportu, JerseyTrack utrzymał stosunkowo stabilne wartości MOTA i IDF1 w porównaniu z głównym ustawieniem walidacyjnym SportsMOT. Tendencja ta sugeruje, że strategia asocjacji kierowana pewnością (confidence-guided association) oraz semantyczne wskazówki związane z koszulkami pozostały skuteczne, gdy sceny śledzenia zachowały wizualne charakterystyki sportów drużynowych, w tym powtarzające się mundury, gęste interakcje sportowców i częste przesłonięcia. W ogólnych zbiorach danych MOT metoda utrzymała konkurencyjne wartości MOTA i DetA, podczas gdy IDF1 było niższe niż obserwowane w zbiorach specyficznych dla sportu. Wzorzec ten jest spójny z brakiem informacji o kolorze koszulek i numerach zawodników w zbiorach MOT17 i MOT20, które są wykorzystywane przez moduł fuzji semantycznej. W tych warunkach komponent asocjacji kierowanej pewnością pozostał przydatny, podczas gdy gałąź semantyczna dostarczyła mniej informacji specyficznych dla tożsamości niż w przypadku filmów ze sportów drużynowych. Ogólnie rzecz biorąc, wyniki te wskazują, że JerseyTrack przenosił się skuteczniej na zbiory danych zawierające specyficzną dla sportu semantykę wizualną niż na ogólne zbiory danych do śledzenia pieszych. Ewaluacja międzyzbiorowa potwierdza zatem zamierzone zastosowanie metody jako trackera zorientowanego na sport, jednocześnie identyfikując brak jawnej semantyki koszulek jako czynnik ograniczający w przypadku nie-sportowych zbiorów danych MOT.

Zbiór danychMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86.871.377.932.1
TeamTrack86.270.777.332.8
MOT1784.769.576.133.9
MOT2084.168.975.333.2

Tabela 1: Wyniki ewaluacji międzyzbiorowej. Wydajność śledzenia systemu JerseyTrack oceniona na czterech publicznych zbiorach danych referencyjnych. Przedstawiono dokładność śledzenia wielu obiektów (MOTA), wskaźnik F1 tożsamości (IDF1), dokładność detekcji (DetA) oraz prędkość przetwarzania mierzoną w klatkach na sekundę (FPS). Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1, DetA oraz FPS.

Odporność w kontrolowanych warunkach perturbacji

Przeprowadzono eksperymenty z kontrolowanymi zaburzeniami, aby zbadać stabilność systemu JerseyTrack w obliczu typowych zakłóceń wizualnych i jakościowych detekcji występujących w nagraniach wideo ze sportu. Ewaluowane zaburzenia podzielono na trzy kategorie: zaburzenia cech semantycznych, zaburzenia ramek detekcji oraz zaburzenia środowiskowe. Zaburzenia cech semantycznych obejmowały przesłonięcie numeru zawodnika, rozmycie obrazu, degradację rozdzielczości oraz podobne kolory koszulek. Zaburzenia ramek detekcji obejmowały przesunięcie ramki ograniczającej, fluktuacje ufności detekcji oraz fałszywe ramki detekcji. Zaburzenia środowiskowe obejmowały szum imitujący deszcz, degradację imitującą mgłę, silne oświetlenie oraz interferencje cieni. Rysunek 9 podsumowuje wydajność śledzenia w tych warunkach zaburzeń. W przypadku zaburzeń cech semantycznych wydajność śledzenia spadała wraz z pogarszaniem się widoczności numeru zawodnika i jakości wykadrowanego obrazu. Gdy 40% obszaru numeru zawodnika było przesłonięte, wskaźnik MOTA spadł o 3,2 punktu procentowego, a IDF1 o 5,3 punktu procentowego w stosunku do warunków bez zaburzeń, podczas gdy dokładność ekstrakcji semantycznej pozostała na poziomie 86,7%. Wyniki te wskazują, że kolor koszulki i wskazówki dotyczące numeru zawodnika dostarczały uzupełniających informacji w sytuacjach, gdy jedna z cech semantycznych stała się mniej wiarygodna. W przypadku zaburzeń ramek detekcji metoda wykazała umiarkowany spadek wydajności, a nie gwałtowną awarię. Gdy ramki detekcji przesunięto o ±10 pikseli, a wyniki ufności zaburzono szumem gaussowskim, spadek MOTA pozostał poniżej 3 punktów procentowych, a wzrost liczby ID zmieścił się w granicach 16%. Tendencja ta jest zgodna ze strategią asocjacji sterowaną ufnością, w której detekcje o średniej i niskiej ufności są przetwarzane przy użyciu dodatkowych ograniczeń asocjacyjnych, zamiast stosowania tej samej strategii, która obowiązuje dla detekcji o wysokiej ufności.

figure-results-5
Rysunek 9. Ocena odporności przy kontrolowanych perturbacjach. (A) Zmiany dokładności śledzenia wielu obiektów (MOTA), wyniku F1 dla tożsamości (IDF1) oraz przełączeń tożsamości (IDs) wraz ze wzrostem przesłonięcia numeru na koszulce. (B) Spadek wydajności w reprezentatywnych warunkach zakłóceń. (C) Wzrost liczby IDs przy różnych rodzajach zakłóceń. (D) Dokładność ekstrakcji semantycznej koszulek w ocenianych warunkach perturbacji. Kliknij tutaj, aby wyświetlić powiększoną wersję tego rysunku.

W warunkach perturbacji środowiskowych spadki głównych wskaźników śledzenia pozostały poniżej 5 punktów procentowych w ocenianych warunkach, a dokładność ekstrakcji semantycznej wyniosła 87,2%. Zastosowanie deskryptorów koloru opartych na modelu HSV zmniejszyło wrażliwość na zmiany oświetlenia, podczas gdy gałąź OCR zachowała użyteczne informacje o numerach zawodników dla podzbioru rozmytych lub zdegradowanych wycinków obrazu. Wyniki te wskazują, że moduł semantyczny pozostał użyteczny w ocenianych warunkach perturbacji, choć jego niezawodność nadal zależała od widoczności koszulki i jakości wycinka. Ogólnie rzecz biorąc, kontrolowane eksperymenty z perturbacjami wykazały, że JerseyTrack utrzymał mierzalną wydajność śledzenia w ocenianych perturbacjach semantycznych, jakości detekcji oraz środowiskowych. Wnioski te należy interpretować w zakresie testowanych perturbacji. Systematyczna reidentyfikacja poza polem widzenia, silne zakłócenia tła oraz długotrwałe całkowite przesłonięcie nie były oceniane oddzielnie w tym eksperymencie i są omówione jako ograniczenia w sekcji Dyskusja.

Analiza wkładu modułu i dyskryminacji cech

Dalszej analizie poddano wkład poszczególnych modułów oraz dyskryminację cech, aby zbadać, w jaki sposób dwa zaproponowane komponenty wpłynęły na wydajność śledzenia powiązanego z tożsamością. Analiza wkładu modułów wykorzystała cztery warianty modelu zdefiniowane w analizie ablacyjnej, natomiast analiza dyskryminacji cech porównywała tradycyjne cechy Re-ID, cechy oparte wyłącznie na kolorze, cechy oparte wyłącznie na numerze zawodnika oraz połączone semantyczne cechy koszulek. Do opisu separowalności cech wykorzystano stosunek odległości międzyklasowej do wewnątrzklasowej, gdzie większe wartości wskazywały na większy stopień rozdzielenia różnych tożsamości w stosunku do zmienności w obrębie tej samej tożsamości. Tabela 2 podsumowuje analizę wkładu modułów. W ogólnej ocenie szacowany wkład strategii asocjacji kierowanej pewnością wyniósł 41,7%, szacowany wkład fuzji semantycznej koszulek wyniósł 47,6%, a pozostałe 10,7% przypisano łącznemu zastosowaniu obu komponentów. Wartości te wskazują, że oba komponenty przyczyniły się do zaobserwowanej poprawy, natomiast pełna konfiguracja odniosła korzyść z ich wspólnego zastosowania, a nie z pojedynczego komponentu. Wzorzec wkładu różnił się w zależności od typu sceny. Przy silnej okluzji szacowany wkład fuzji semantycznej koszulek wzrósł do 69,4%, co jest zgodne z ograniczoną niezawodnością wskazówek dotyczących ruchu w sytuacjach, gdy sportowcy byli częściowo lub tymczasowo zasłonięci. Przy ruchu o wysokiej prędkości szacowany wkład asocjacji kierowanej pewnością osiągnął 44,3%, a zysk łączny wyniósł 20,6%, co wskazuje, że partycjonowanie na poziomie pewności stało się bardziej istotne, gdy pewność detekcji wahała się z powodu szybkiego ruchu lub niepewności lokalizacji.

Wariant modeluScenariusz testowyMOTA↑IDF1↑IDs↓Wkład modułuZysk synergiczny
V0 (Baseline)Całkowita scena83.567.23245
Sceny z silnymi przesłonięciami77.861.53862
Scena z ruchem o dużej prędkości77.162.33689
V1 (Asocjacja sterowana ufnością)Całkowita scena86.370.9289341.7
Sceny z silnymi przesłonięciami80.965.9341529.8
Scena z ruchem o dużej prędkości81.467.9302444.3
V2 (Semantyczna asocjacja koszulek)Całkowita scena85.271.8293747.6
Sceny z silnymi przesłonięciami82.772.8275369.4
Scena z ruchem o dużej prędkości80.166.8315735.1
V3 (Kompletny JerseyTrack)Całkowita scena88.974.3276810.7
Sceny z silnymi przesłonięciami84.975.626890.8
Scena z ruchem o dużej prędkości83.671.5284220.6

Tabela 2: Analiza ablacyjna wkładu poszczególnych modułów. Porównanie wydajności różnych wariantów modelu JerseyTrack w scenariuszach ogólnych, z silnymi przesłonami oraz przy szybkim ruchu. Wartości Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1) oraz liczba zmian tożsamości (IDs) są przedstawione wraz z szacowanym wkładem modułów i zyskiem synergicznym. Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1, wkładu modułów i zysku synergicznego, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.

Tabela 3 podsumowuje analizę dyskryminacji cech. Połączona cecha semantyczna koszulki osiągnęła stosunek odległości międzyklasowej do wewnątrzklasowej na poziomie 5,63, w porównaniu do 1,82 dla tradycyjnych cech Re-ID, co odpowiada względnej poprawie o 209,3% w pomiarze stosunku odległości. Cechy oparte wyłącznie na kolorze oraz wyłącznie na numerze zawodnika również poprawiły separowalność cech w stosunku do tradycyjnych cech Re-ID, choć każdy poszczególny wskaźnik pozostawał podatny na konkretne przypadki błędów, w tym podobne kolory drużyn, zasłonięcie numeru zawodnika, rozmycie ruchu oraz nieczytelne obszary koszulek. Spośród ocenianych reprezentacji cech, połączona reprezentacja semantyczna osiągnęła najwyższą separowalność cech i odpowiadała najwyższej wartości IDF1 oraz najniższej liczbie identyfikatorów (ID count) zaobserwowanej w analizie ablacyjnej. Wyniki te wspierają zastosowanie specyficznych semantycznych wskazówek dotyczących koszulek jako uzupełniających informacji o tożsamości w systemach Sports MOT, gdy sportowcy mają podobny wygląd, a same informacje o ruchu są niewystarczające. Obserwacje te ograniczają się do ocenianego ustawienia SportsMOT i nie powinny być interpretowane jako dowód na to, że semantyka koszulek rozwiązuje wszelkie niejednoznaczności tożsamości w każdym materiale wideo ze sportu.

Typ cechyStosunek dystansu międzyklasowego do wewnątrzklasowegoWzględna poprawa (%)IDF1↑IDs↓
Tradycyjne cechy Re-ID1.8265.73482
Cechy koloru drużyny3.1774.269.83125
Cechy numeru zawodnika3.4991.870.53018
Zintegrowane semantyczne cechy koszulki5.63209.374.32768

Tabela 3: Analiza dyskryminacji różnych reprezentacji cech. Porównanie dyskryminacji cech z wykorzystaniem tradycyjnych cech re-identyfikacji (Re-ID), cech koloru koszulki, cech numerów zawodników oraz połączonych cech semantycznych. Przedstawiono stosunek odległości międzyklasowej do wewnątrzklasowej, względną poprawę dyskryminacji cech, wynik IDentity F1 Score (IDF1) oraz liczbę zmian tożsamości (IDs). Wyższe wartości wskazują na lepszą wydajność w przypadku stosunku odległości, względnej poprawy i IDF1, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.

Porównanie referencyjne z istniejącymi metodami MOT

Przeprowadzono porównanie referencyjne w celu zestawienia metody JerseyTrack z reprezentatywnymi metodami MOT w tych samych warunkach walidacji SportsMOT. Porównane metody obejmowały QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT oraz MOTR. Wszystkie metody wykorzystywały te same wyniki detekcji wygenerowane przez framework detektora wymieniony w Tabeli Materiałów, tak aby porównanie skupiało się na wydajności asocjacji śledzenia, a nie na zmienności detektora. Ocena została przeprowadzona z wykorzystaniem metryk zdefiniowanych w sekcji 7 protokołu. Główne metryki oceny obejmowały MOTA, HOTA oraz IDF1. Metryki pomocnicze obejmowały DetA, AssA, FPs, FNs oraz IDs. Tabela 4 podsumowuje porównanie ilościowe na zbiorze walidacyjnym SportsMOT, a Rysunek 10 przedstawia wizualne porównanie dokładności śledzenia, szybkości inferencji oraz rozkładu HOTA w ocenianych scenach sportowych. JerseyTrack osiągnął najwyższą wartość MOTA spośród porównywanych metod, wynoszącą 88,9%. Wartość ta była o 1,1 punktu procentowego wyższa niż w przypadku Deep OC-SORT (87,8%) i o 2,5 punktu procentowego wyższa niż w przypadku ByteTrack (86,4%). Zatem w ocenianych warunkach walidacji SportsMOT, JerseyTrack osiągnął najwyższą ogólną dokładność śledzenia spośród porównanych metod. W przypadku HOTA, JerseyTrack osiągnął wynik 69,9%, w porównaniu do 64,4% dla Deep OC-SORT i 62,8% dla ByteTrack. Różnice te odpowiadają poprawie odpowiednio o 5,5 i 7,1 punktu procentowego, co wskazuje na lepszą równowagę między wydajnością detekcji a asocjacji w tych samych warunkach oceny.

MetodaMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

Tabela 4: Porównanie wydajności JerseyTrack i reprezentatywnych metod śledzenia wielu obiektów na zbiorze walidacyjnym SportsMOT.Porównanie JerseyTrack z reprezentatywnymi metodami śledzenia wielu obiektów (MOT) na zbiorze walidacyjnym SportsMOT. Raportowane metryki obejmują dokładność śledzenia wielu obiektów (MOTA), dokładność śledzenia wyższego rzędu (HOTA), wynik F1 dla tożsamości (IDF1), dokładność detekcji (DetA), dokładność asocjacji (AssA), liczbę fałszywych trafień (FP), liczbę fałszywych negatywów (FN) oraz liczbę przełączeń tożsamości (IDs). Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, HOTA, IDF1, DetA i AssA, podczas gdy niższe wartości wskazują na lepszą wydajność dla FP, FN i IDs.

figure-results-6
Rysunek 10. Porównanie wydajności z reprezentatywnymi metodami śledzenia wielu obiektów. (A) Porównanie dokładności śledzenia wielu obiektów (MOTA) oraz liczby klatek na sekundę (FPS) dla JerseyTrack i reprezentatywnych metod śledzenia wielu obiektów ocenianych na zbiorze danych SportsMOT. (B) Rozkład dokładności śledzenia wyższego rzędu (HOTA) w ocenianych metodach śledzenia. Kliknij tutaj, aby zobaczyć powiększoną wersję tego rysunku.

W zakresie zachowania tożsamości JerseyTrack osiągnął wskaźnik IDF1 na poziomie 74,3%, w porównaniu do 69,9% dla Deep OC-SORT i 67,7% dla ByteTrack. JerseyTrack odnotował również 2 768 identyfikatorów (ID), co jest liczbą niższą niż 3 211 ID odnotowanych przez Deep OC-SORT oraz 4 192 ID odnotowanych przez ByteTrack. Obserwacje te są zgodne z wynikami ablacji przedstawionymi na Rysunku 8  i w Tabeli 2, w których pełna konfiguracja JerseyTrack ograniczyła zmianę tożsamości w stosunku do wariantów modelu bazowego. W zakresie jakości detekcji i asocjacji JerseyTrack osiągnął DetA na poziomie 80,2% oraz AssA na poziomie 54,3%. W porównaniu z Deep OC-SORT, JerseyTrack poprawił DetA o 2,0 punktu procentowego, a AssA o 2,2 punktu procentowego. JerseyTrack wygenerował również mniej błędów FP i FN niż pozostałe metody porównawcze raportowane w Tabeli 4, odnotowując 21 953 FP i 67 160 FN. Ogólnie porównanie benchmarkowe wykazało, że JerseyTrack osiągnął najwyższe wartości dla głównych metryk śledzenia spośród ocenianych metod w ustawieniach walidacyjnych SportsMOT. Wyniki te są zgodne z zaobserwowaną poprawą w zachowaniu tożsamości i stabilności asocjacji uzyskanej dzięki asocjacji sterowanej pewnością (confidence-guided association) oraz semantycznej fuzji koszulek. Porównanie jest ograniczone do wspólnych wyników detektora oraz konfiguracji walidacyjnej SportsMOT zastosowanej w niniejszym badaniu.

Wyniki analizy czułości parametrów

Przeprowadzono analizę wrażliwości parametrów, aby zbadać, w jaki sposób kluczowe parametry implementacji wpływały na wydajność śledzenia w warunkach walidacji SportsMOT. Ewaluowano trzy parametry: współczynnik wagowy straty OCR (γ), liczbę hierarchicznych klastrów poziomu ufności (K) oraz szybkość uczenia sieci OCR (η). Tabela 5 podsumowuje wartości MOTA, IDF1, HOTA i IDs uzyskane dla różnych ustawień parametrów.

ParametrWartośćMOTA↑IDF1↑HOTA↑IDs↓
Waga straty OCR (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (optymalna)88.974.369.92,768
188.273.869.32,792
Liczba klastrów ufności (K)286.772.168.52,876
3 (optymalna)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
Szybkość uczenia OCR (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (optymalna)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

Tabela 5: Analiza czułości parametrów. Wydajność śledzenia uzyskana przy zastosowaniu różnych ustawień parametrów dla JerseyTrack. Podano wartości dokładności śledzenia wielu obiektów (MOTA), wyniku F1 tożsamości (IDF1), dokładności śledzenia wyższego rzędu (HOTA) oraz liczbę przełączeń tożsamości (IDs) dla różnych wartości współczynnika wagowego straty optycznego rozpoznawania znaków (OCR) (γ), liczby klastrów ufności (K) oraz prędkości uczenia OCR (η). Wartości parametrów zidentyfikowane jako optymalne odpowiadają ustawieniom zastosowanym w raportowanych eksperymentach. Wyższe wartości wskazują na lepszą wydajność w przypadku MOTA, IDF1 i HOTA, natomiast niższe wartości wskazują na lepszą wydajność w przypadku IDs.

W przypadku współczynnika wagowego straty OCR (γ), najlepszą ocenioną wydajność uzyskano przy γ = 0.8. Przy tym ustawieniu JerseyTrack osiągnął wskaźnik MOTA na poziomie 88.9%, IDF1 wynoszący 74.3%, HOTA na poziomie 69.9% oraz 2 768 ID. Gdy γ zmniejszono do 0.2, wartości MOTA, IDF1 i HOTA spadły odpowiednio do 84.7%, 69.4% i 66.2%, podczas gdy liczba ID wzrosła do 2 944. Gdy zwiększono γ do 1.0, metryki wydajności nieznacznie spadły w stosunku do γ = 0.8, osiągając MOTA 88.2%, IDF1 73.8%, HOTA 69.3% oraz 2 792 ID. Wyniki te wskazują, że niewystarczający nadzór OCR ograniczył zdolność rozróżniania numerów graczy, natomiast zwiększenie wagi straty OCR powyżej ocenionego optimum nie poprawiło wydajności śledzenia w testowanych warunkach.

W przypadku liczby klastrów hierarchicznych dla poziomu ufności (K), najlepszą ocenioną wydajność uzyskano dla K = 3. Ustawienie to odpowiada strategii asocjacji o wysokim, średnim i niskim poziomie ufności opisanej w metodzie. Przy K = 2 partycjonowanie ufności było mniej szczegółowe, a wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 86,7%, 72,1% i 68,5%. Gdy K wzrosło do 4 lub 5, wydajność również spadła w stosunku do K = 3, co sugeruje, że nadmierne partycjonowanie podzieliło detekcje na zbyt wąskie grupy ufności i zmniejszyło stabilność strategii asocjacji. Wyniki te potwierdzają zasadność zastosowania trzech poziomów ufności w ocenianej konfiguracji JerseyTrack.

W przypadku współczynnika uczenia sieci OCR (η), najlepszą ocenioną wydajność uzyskano dla η = 1 × 10-3. Przy niższym współczynniku uczenia wynoszącym 1 × 10-4 wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 85,9%, 70,8% i 67,3%, natomiast liczba ID wzrosła do 2 934. Przy wyższym współczynniku uczenia wynoszącym 1 × 10-2 wskaźniki MOTA, IDF1 i HOTA spadły odpowiednio do 86,5%, 71,6% i 68,7%, a liczba ID wzrosła do 2 889. Wyniki te wskazują, że gałąź OCR była wrażliwa na dobór współczynnika uczenia, przy czym wartość 1 × 10-3 zapewniła najlepszą równowagę między rozpoznawaniem liczby graczy a wydajnością zachowania tożsamości w ocenianych warunkach.

Ogólnie Tabela 5 pokazuje, że kombinacja parametrów γ = 0.8, K = 3 oraz η = 1 × 10-3 pozwoliła uzyskać najwyższe ocenione wartości MOTA, IDF1 i HOTA przy jednoczesnej najniższej liczbie ID. Analiza wrażliwości wykazała również, że umiarkowane odchylenia od tych wartości parametrów skutkowały mierzalnymi, ale nie gwałtownymi zmianami w wydajności śledzenia. W związku z tym te ustawienia parametrów zostały wykorzystane do porównania referencyjnego oraz głównych eksperymentów walidacyjnych SportsMOT opisanych w niniejszym badaniu.

Dostępność danych

Surowe podsumowania ewaluacji, końcowe wyniki śledzenia, zapisy środowiska, pliki mapowania zbiorów danych oraz pośrednie pliki podsumowujące, wspierające wyniki niniejszego badania, są dostępne w publicznym repozytorium pod adresem https://doi.org/10.5281/zenodo.21274353. Oryginalne publiczne zestawy danych referencyjnych użyte w tym badaniu, w tym SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 i MOT20, są dostępne u ich odpowiednich dostawców i nie zostały udostępnione ponownie w repozytorium.

Dyskusja

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

W niniejszym badaniu oceniono workflow sportowego MOT sterowany pewnością, który łączy partycjonowanie na podstawie pewności detekcji z semantycznymi wskazówkami dotyczącymi koszulek. Asocjację sterowaną pewnością oraz fuzję cech semantycznych badano jako strategie komplementarne, mające na celu poprawę asocjacji danych w śledzeniu wielu obiektów12,20,23,24,46. Wyniki pokazują, że pełna konfiguracja JerseyTrack poprawiła zachowanie tożsamości i stabilność asocjacji w ocenianym ustawieniu walidacyjnym SportsMOT. Główny wynik walidacji SportsMOT osiągnął wartość MOTA na poziomie 88.9%, HOTA 69.9%, IDF1 74.3%, DetA 80.2% oraz AssA 54.3%. Wartości te należy interpretować w odniesieniu do źródła wyjścia detektora, podziału zbioru danych oraz konfiguracji TrackEval opisanych w protokole.

Kluczowym krokiem w procesie jest partycjonowanie poziomu ufności, które umożliwia zastosowanie różnych strategii asocjacji w zależności od niezawodności wyników detektora20,22,23,24. Poprzez podział detekcji na grupy o wysokim, średnim i niskim poziomie ufności, JerseyTrack stosuje różne reguły asocjacji dla detekcji o różnych poziomach niezawodności. Detekcje o wysokim poziomie ufności są powiązane głównie poprzez spójność ruchu, podczas gdy w przypadku detekcji o średnim poziomie ufności wykorzystuje się wspólnie semantykę ruchu i koszulek. Detekcje o niskim poziomie ufności nie są używane do inicjowania nowych trajektorii i są brane pod uwagę wyłącznie podczas odzyskiwania trajektorii. Taka konstrukcja zmniejszyła ryzyko, że słabe detekcje lub wyniki fałszywie dodatnie stworzą niestabilne tożsamości, jednocześnie pozwalając na to, aby częściowe detekcje przyczyniały się do odzyskiwania trajektorii w sytuacji dostępności dodatkowych dowodów semantycznych8,11,20. Drugim krytycznym krokiem jest ekstrakcja semantyki koszulek. Cechy kolorów drużyn stanowią ograniczenie na poziomie drużyny, natomiast cechy numerów zawodników dostarczają bardziej precyzyjnych wskazówek dotyczących tożsamości, gdy obszar numeru jest widoczny i czytelny35,41,42,43. Wyniki ablacji wskazują, że wskazówki te są najbardziej użyteczne w przypadku gęstych interakcji zawodników z tej samej drużyny oraz w sytuacjach okluzji, gdzie asocjacja oparta wyłącznie na ruchu jest mniej niezawodna. Niemniej jednak semantyka koszulek powinna być traktowana jako dowód pomocniczy, a nie jako całkowity zamiennik asocjacji ruchu. Numery zawodników mogą być nieczytelne z powodu rozmycia, ucięcia, ujęć od tyłu, silnej okluzji lub niskiej rozdzielczości obrazu. Cechy kolorów drużyn również nie pozwalają odróżnić sportowców z tej samej drużyny, gdy informacje o numerach są niedostępne35,42,43. Wyniki z różnych zbiorów danych dodatkowo wyjaśniają zakres zastosowania tej metody. JerseyTrack przenosił się bardziej naturalnie na zbiory danych sportów drużynowych niż na ogólne zbiory danych MOT dla pieszych, ponieważ gałąź semantyczna została zaprojektowana w oparciu o kolor koszulek i numery zawodników19,33,34,35,36,37. W przypadku ogólnych zbiorów danych MOT komponent asocjacji sterowany poziomem ufności pozostał możliwy do zastosowania, ale specyficzna dla sportu gałąź semantyczna dostarczyła mniej informacji o tożsamości. W związku z tym metoda ta jest najbardziej odpowiednia dla filmów z gier zespołowych, w których sportowcy noszą charakterystyczne stroje, a obszar koszulki jest wystarczająco widoczny do ekstrakcji semantycznej19,33,34,35,36,37.

Pozostaje kilka ograniczeń. Po pierwsze, metoda zależy od jakości wyników detektora; liczne pominięcia w detekcji lub niedokładne ramki ograniczające (bounding boxes) obniżają wiarygodność zarówno przewidywania ruchu, jak i przycinania semantycznego14,17,46. Po drugie, w bieżącej implementacji nie zoptymalizowano osobno długoterminowej reidentyfikacji obiektów poza polem widzenia. Gdy sportowiec opuszcza pole widzenia kamery na dłuższy czas, a następnie do niego powraca, obecna strategia odzyskiwania trajektorii może być niewystarczająca do przywrócenia pierwotnej tożsamości19,34. Po trzecie, znaczny szum w tle, nakładanie się zawodników, rozmycie ruchu oraz nieczytelne numery na koszulkach mogą obniżać wiarygodność cech semantycznych14,35,42,46. Po czwarte, obecna ocena skupiała się na publicznych zbiorach danych referencyjnych i kontrolowanych ustawieniach perturbacji; wdrożenie w materiałach wideo z transmisji z cięciami montażowymi, zmianami zoomu i niestandardowymi kątami widzenia może wymagać dodatkowych modułów preprocessingu lub reidentyfikacji19,33,34.

Głównym praktycznym wnioskiem jest to, że asocjacje kierowane pewnością (confidence-guided association) oraz semantyczne wskazówki specyficzne dla koszulek mogą zostać zintegrowane z modułowym potokiem MOT bez zmiany struktury detektora. Możliwość ta znajduje zastosowanie w zadaniach analizy sportowej, takich jak ekstrakcja trajektorii sportowców, analiza ruchów zespołu, przegląd zdarzeń taktycznych oraz półautomatyczna adnotacja wideo1,4,33,36. Przyszłe prace powinny skupić się na skuteczniejszej reidentyfikacji obiektów poza polem widzenia, radzeniu sobie z zakłóceniami tła, agregacji cech czasowych oraz bardziej odpornym rozpoznawaniu numerów zawodników w warunkach silnego rozmycia lub przesłonięcia14,19,34,46.

Podsumowując, JerseyTrack jest metodą SportsMOT, która łączy asocjację sterowaną poziomem ufności z semantyczną fuzją strojów. Metoda ta dzieli detekcje na grupy o wysokim, średnim i niskim poziomie ufności i stosuje różne reguły asocjacji w zależności od wiarygodności detekcji, wykorzystując jednocześnie kolor stroju i numery zawodników jako pomocnicze informacje o tożsamości podczas asocjacji o średnim poziomie ufności oraz odzyskiwania trajektorii. W ramach ocenianej konfiguracji walidacyjnej SportsMOT system JerseyTrack wykazał poprawę dokładności śledzenia i lepsze zachowanie tożsamości w porównaniu z analizowanymi konfiguracjami bazowymi. Wyniki ablacji wykazały, że pełna konfiguracja zredukowała liczbę zmian tożsamości w stosunku do wariantu bazowego i wariantów z pojedynczymi modułami, a porównanie z benchmarkiem wykazało wyższe wartości głównych metryk śledzenia przy wspólnej konfiguracji wyjścia detektora i ewaluacji. Wyniki te wspierają wykorzystanie informacji o poziomie ufności oraz specyficznych semantycznych wskazówek dotyczących strojów do śledzenia sportowców w nagraniach z gier zespołowych, szczególnie gdy regiony strojów są widoczne, a kolor drużyny lub numer zawodnika dostarczają uzupełniających dowodów tożsamości20,35,46. Rozwiązanie zidentyfikowanych ograniczeń może w dalszym stopniu poprawić możliwości zastosowania proponowanego przepływu pracy w bardziej wymagających scenariuszach śledzenia w sporcie.

Oświadczenia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy oświadczają, że nie mają żadnych finansowych konfliktów interesów.

Podziękowania

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Autorzy nie mają żadnych podziękowań do zadeklarowania.

Materiały

Lista materiałów użytych w tym artykule
NazwaFirmaNumer katalogowyKomentarze
CUDA RuntimeNVIDIAWersja 12.8Środowisko uruchomieniowe obliczeń GPU wykorzystywane do trenowania detektora, ekstrakcji cech semantycznych i inferencji śledzenia.
EasyOCRJaided AIWersja 1.7.2Zestaw narzędzi do optycznego rozpoznawania znaków wykorzystywany do rozpoznawania numerów zawodników.
Kod źródłowy JerseyTrackAutorzyN/AWłasna implementacja zawierająca skrypty do przygotowania danych, ekstrakcji cech semantycznych, partycjonowania ufności, śledzenia, postprocesowania i ewaluacji. Dostępna pod adresem: https://doi.org/10.5281/zenodo.21274352
Lekki model CRNN OCRAutorzyN/AWłasna konwolucyjna rekurencyjna sieć neuronowa (CRNN) wykorzystywana do rozpoznawania numerów zawodników.
Zbiór danych MOT17MOTChallengeN/APubliczny zbiór danych referencyjnych wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://motchallenge.net/data/MOT17/
Zbiór danych MOT20MOTChallengeN/APubliczny zbiór danych referencyjnych wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://motchallenge.net/data/MOT20/
motmetricsTwórcy motmetricsWersja 1.4.0Biblioteka wykorzystywana do obliczania diagnostycznych metryk śledzenia wielu obiektów.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Jednostka przetwarzania graficznego wykorzystywana do trenowania detektora i inferencji śledzenia.
Sterownik GPU NVIDIANVIDIAWersja 610.62Sterownik GPU wykorzystywany w środowisku eksperymentalnym.
NumPyTwórcy NumPyWersja 2.4.4Biblioteka obliczeń numerycznych wykorzystywana do przetwarzania cech i obsługi danych.
OpenCVOpenCVWersja 4.10.0Biblioteka wizji komputerowej wykorzystywana do ładowania, przycinania, wstępnego przetwarzania i wizualizacji obrazów.
PythonPython Software FoundationWersja 3.12.2Język programowania wykorzystywany w całym przepływie pracy.
PyTorchPyTorch FoundationWersja 2.11.0+cu128Framework głębokiego uczenia wykorzystywany do implementacji detektora i modelu semantycznego.
scikit-learnTwórcy scikit-learnWersja 1.9.0Biblioteka uczenia maszynowego wykorzystywana do klastrowania K-średnich podczas ekstrakcji kolorów koszulek i partycjonowania ufności.
Zbiór danych SoccerNet TrackingSoccerNetN/APubliczny benchmark śledzenia piłki nożnej wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://www.soccer-net.org/tasks/tracking
Zbiór danych SportsMOTSportsMOT BenchmarkN/AGłówny zbiór danych referencyjnych wykorzystywany do przygotowania detektora i ewaluacji śledzenia. Dostępny pod adresem: https://deeperaction.github.io/datasets/sportsmot.html
Zbiór danych TeamTrackTeamTrack BenchmarkN/APubliczny benchmark śledzenia sportowego wykorzystywany do ewaluacji międzyzbiorowej. Dostępny pod adresem: https://atomscott.github.io/TeamTrack/
TorchvisionPyTorch FoundationWersja 0.26.0+cu128Biblioteka wizji komputerowej wykorzystywana z PyTorch do transformacji obrazów i wsparcia modeli.
TrackEvalTwórcy TrackEvalWersja 1.3.0Zestaw narzędzi ewaluacyjnych wykorzystywany do obliczania dokładności śledzenia wielu obiektów (MOTA), wyniku F1 dla tożsamości (IDF1), dokładności śledzenia wyższego rzędu (HOTA), dokładności detekcji (DetA), dokładności asocjacji (AssA), wyników fałszywie dodatnich (FP), fałszywie ujemnych (FN) oraz zmian tożsamości (IDs).
UltralyticsUltralyticsWersja 8.4.90Framework detekcji obiektów wykorzystywany do trenowania detektora i generowania detekcji sportowców.

Bibliografia

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Przedruki i uprawnienia

Poproś o pozwolenie na ponowne wykorzystanie tekstu lub ilustracji tego artykułu JoVE

Poproś o pozwolenie

Tagi

ledzenie sterowane pewno citrajektoria zawodnikapodobie stwo ruchukolor koszulkioptyczne rozpoznawanie znak wsp jno to samo cizbi r danych SportsMOT

Powiązane artykuły