Articolo metodologico

Un metodo di tracciamento multi-oggetto guidato dalla confidenza per video sportivi mediante fusione semantica delle maglie

DOI:

10.3791/71557

14 agosto 2026

In questo articolo

Sommario

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo protocollo descrive un flusso di lavoro per il tracciamento multi-oggetto guidato dalla confidenza applicato a video sportivi, che integra le informazioni sul colore della maglia e sul numero del giocatore per migliorare l'associazione delle traiettorie e la coerenza dell'identità in presenza di fluttuazioni della confidenza, occlusioni e aspetti visivi simili tra gli atleti.

Abstract

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il Multi-Object Tracking (MOT) nei video sportivi fornisce informazioni sulle traiettorie utili per l'analisi tattica, l'interpretazione del comportamento dei giocatori e l'analisi statistica automatizzata. Tuttavia, negli scenari sportivi si verificano spesso cambiamenti rapidi di direzione, arresti bruschi, occlusioni frequenti e compagni di squadra con aspetto visivo simile, causando fluttuazioni nella fiducia del rilevamento e confusione d'identità durante l'associazione tra fotogrammi. Per affrontare queste sfide, questo studio presenta JerseyTrack, un metodo di MOT sportivo guidato dalla fiducia basato sulla fusione semantica della maglia. Il flusso di lavoro suddivide in modo adattivo le box di rilevamento in intervalli di alta, media e bassa fiducia in base alla distribuzione della fiducia di ciascun fotogramma. I rilevamenti ad alta fiducia vengono associati principalmente in base alla similarità del movimento, mentre per quelli a media e bassa fiducia si integrano ulteriormente caratteristiche relative al colore della maglia e al numero del giocatore, estratte tramite clustering del colore e un modello leggero di riconoscimento ottico dei caratteri (OCR). Queste caratteristiche semantiche vengono fuse con le informazioni sul movimento durante l'abbinamento supplementare per migliorare la continuità delle traiettorie e la coerenza d'identità. Il metodo è stato valutato sul dataset SportsMOT. JerseyTrack ha raggiunto un'accuratezza del 88,9% nel Multiple Object Tracking Accuracy (MOTA), un punteggio F1 d'identità (IDF1) del 74,3% e un'accuratezza del 69,9% nel Higher Order Tracking Accuracy (HOTA), dimostrando prestazioni migliorate nel contesto di tracciamento sportivo valutato. Questo protocollo fornisce un flusso di lavoro riproducibile per integrare l'associazione guidata dalla fiducia con informazioni semantiche sulla maglia al fine di migliorare il multi-object tracking nei video sportivi.

Introduzione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Il tracciamento multi-oggetto (MOT) fornisce un localizzazione continua degli oggetti e il mantenimento dell'identità in sequenze video, supportando l'estrazione delle traiettorie degli atleti, l'analisi tattica e l'analisi statistica automatizzata in applicazioni basate su video sportivi1,2,3. Informazioni visive affidabili sono inoltre correlate al processo decisionale specifico dello sport e alla valutazione della prestazione nella scienza dello sport, sottolineando ulteriormente il valore dei dati di movimento stabili derivati dai video per analisi sportive successive4. Negli scenari sportivi, l'affidabilità dei dati tattici dipende dalla continuità delle traiettorie di tracciamento e dalla coerenza delle identità degli obiettivi.

Rispetto agli scenari generali di MOT, i video sportivi contengono rapidi cambi di direzione, arresti bruschi, salti, interazioni fitte e occlusioni frequenti. Questi fattori provocano notevoli fluttuazioni nella confidenza delle scatole di rilevamento e aumentano la frequenza dei rilevamenti a bassa confidenza, che possono interrompere l'associazione delle traiettorie5,6. Le uniformi di squadra uniformi riducono ulteriormente la capacità discriminante delle caratteristiche d'aspetto generali e aumentano la confusione d'identità tra compagni di squadra visivamente simili7,8. Quando occlusione e somiglianza d'aspetto si verificano nella stessa sequenza, la confidenza del rilevamento diminuisce e le informazioni sull'aspetto del bersaglio diventano incomplete, aumentando la difficoltà nell'associazione delle traiettorie e nel mantenimento dell'identità9,10. Nel MOT, il re-identificazione (Re-ID) indica il processo di associazione della stessa identità del bersaglio tra fotogrammi, periodi di occlusione o casi di reingresso, utilizzando evidenze visive legate all'identità. Nei video sportivi di squadra, gli indizi generali di Re-ID possono risultare indeboliti poiché gli atleti della stessa squadra spesso condividono uniformi e aspetti fisici simili. La revisione della letteratura tecnica indica che la frammentazione delle traiettorie e la confusione d'identità nel MOT sportivo sono generalmente affrontate attraverso due approcci complementari: l'utilizzo della confidenza del rilevamento e il potenziamento degli indizi d'identità. JerseyTrack si colloca all'intersezione di questi approcci regolando l'uso degli indizi semantici delle maglie in base alla qualità del rilevamento, piuttosto che applicare in modo uniforme informazioni sul colore e sul numero del giocatore a tutti i rilevamenti.

Questo studio presenta JerseyTrack, un metodo MOT sportivo guidato dalla confidenza, basato sulla fusione semantica delle maglie. Il metodo è progettato per video di sport di squadra in cui gli atleti indossano maglie visibili e i risultati del rilevamento forniscono box delimitatori con punteggi di confidenza. JerseyTrack combina quattro componenti principali: rilevamento degli atleti, partizionamento per livello di confidenza, estrazione di caratteristiche semantiche delle maglie e associazione inter-frame a cascata. La confidenza del rilevamento viene utilizzata per partizionare in modo adattivo i rilevamenti in gruppi ad alta, media e bassa confidenza, che vengono elaborati mediante diverse strategie di associazione. I rilevamenti ad alta confidenza vengono associati principalmente attraverso informazioni di movimento, mentre quelli a media e bassa confidenza integrano ulteriormente informazioni sul colore della maglia e sul numero del giocatore per migliorare il mantenimento dell'identità quando le evidenze visive sono deboli. Il metodo è destinato a compiti di analisi video sportivi che richiedono traiettorie stabili degli atleti, come l'analisi tattica e l'interpretazione del comportamento dei giocatori.

L'approccio proposto presenta anche limitazioni operative. L'estrazione semantica della maglia può essere influenzata da forti occlusioni, sfocature dovute al movimento, bassa risoluzione delle immagini, pose anomale della maglia o numeri dei giocatori non visibili. In questi casi, gli indizi semantici basati sulla maglia possono risultare incompleti, e il processo di associazione si basa maggiormente sulla coerenza del movimento e sulla verifica multi-frame. Pertanto, le affermazioni sulle prestazioni di questo studio sono limitate ai dataset valutati e alle condizioni sperimentali adottate. Gli esperimenti effettuati sul dataset SportsMOT mostrano che JerseyTrack migliora le metriche di tracciamento valutate e riduce gli eventi di cambio di identità nelle condizioni di tracciamento sportivo testate. La principale difficoltà del tracciamento multi-oggetto (MOT) nei video sportivi consiste nel mantenere la continuità delle traiettorie e la coerenza dell'identità in presenza di movimenti rapidi, occlusioni e somiglianze nell'aspetto. Gli studi esistenti relativi a JerseyTrack possono essere suddivisi in due direzioni di ricerca principali: l'utilizzo della confidenza del rilevamento per l'associazione delle traiettorie e il potenziamento degli indizi identitari mediante caratteristiche semantiche specifiche dello sport.

L'affidabilità del rilevamento è stata ampiamente utilizzata per stimare l'affidabilità dei box di rilevamento e guidare l'associazione delle traiettorie nel MOT. I primi metodi di tracciamento trattavano solitamente l'affidabilità come un criterio binario di filtraggio, in cui i rilevamenti al di sotto di una soglia fissa venivano rimossi per ridurre i falsi positivi11,12. Questa strategia riduce i rilevamenti rumorosi ma può anche scartare obiettivi reali in caso di occlusione, movimento rapido o bassa qualità dell'immagine, causando frammentazione delle traiettorie13,14,15. Strategie di filtraggio simili hanno inoltre dimostrato che soglie fisse di affidabilità sono sensibili alle variazioni della scena e alla qualità del rilevamento16,17. Per migliorare l'utilizzo dei rilevamenti a bassa affidabilità, ByteTrack ha introdotto una strategia di associazione che mantiene i box a bassa affidabilità come obiettivi candidati per un abbinamento secondario e li collega alle traiettorie esistenti attraverso la similarità del movimento e la cronologia della traiettoria18. McByte estende ulteriormente l'associazione nel MOT sportivo incorporando maschere di segmentazione propagate temporalmente come indicazione per l'associazione, migliorando la robustezza in condizioni di movimento rapido, occlusione e spostamento della telecamera senza ulteriore addestramento per ogni video19. Studi correlati hanno inoltre modificato l'uso dei rilevamenti a bassa affidabilità per mantenere obiettivi deboli ma potenzialmente validi durante l'associazione20,21,22. Le strategie di associazione adattive all'affidabilità hanno successivamente perfezionato i criteri di abbinamento in base alla coerenza del movimento e all'affidabilità del rilevamento23,24,25. Metodi di affinamento delle traiettorie basati sulla regressione dei box di rilevamento e sull'ottimizzazione della regolarità delle traiettorie sono stati anch'essi utilizzati per ridurre la frammentazione delle traiettorie26,27,28. Ulteriori strategie di affinamento forniscono un supporto complementare per mantenere la continuità delle traiettorie in condizioni di movimento complesse29. Il flusso oggetto temporalmente coerente modella ulteriormente la coerenza temporale a livello oggetto tra i fotogrammi, fornendo un altro approccio orientato all'associazione per ridurre l'interruzione delle traiettorie in scenari MOT complessi30. I metodi di fusione dei tracker apprendono anche dagli output di più tracker e utilizzano strategie di selezione o fusione basate sull'apprendimento per migliorare la robustezza del tracciamento su diversi benchmark MOT31. Nel complesso, questi studi indicano che l'associazione consapevole dell'affidabilità aiuta a recuperare traiettorie interrotte; tuttavia, l'affidabilità e gli indizi del movimento forniscono informazioni limitate sull'identità quando i giocatori della stessa squadra hanno aspetti visivi simili. Sebbene questi metodi attenuino efficacemente la frammentazione delle traiettorie in scenari generali, presentano limitazioni intrinseche negli ambienti sportivi poiché i giocatori della stessa squadra spesso hanno aspetti visivi altamente simili, e fare affidamento esclusivamente su informazioni di affidabilità e movimento non può fornire una base sufficiente per la differenziazione dell'identità32,33,34. Anche quando i box a bassa affidabilità vengono recuperati efficacemente, la similarità delle caratteristiche può comunque portare a scambi di identità, rendendo difficile soddisfare i rigorosi requisiti di coerenza identitaria dell'analisi sportiva.

Segnali identitari specifici dello sport sono stati utilizzati anche per migliorare la discriminazione dell'identità nel tracciamento degli atleti. Informazioni semantiche relative alle maglie, come il colore della squadra e il numero del giocatore, forniscono indizi identitari più direttamente collegati agli scenari sportivi rispetto agli embedding di aspetto generale35,36,37. Il colore della maglia è stato utilizzato per supportare la discriminazione a livello di squadra e ridurre la confusione tra squadre diverse, mentre il riconoscimento del numero del giocatore fornisce un indizio identitario più preciso quando la zona del numero è visibile e leggibile38,39. Studi esistenti sul tracciamento sportivo hanno integrato caratteristiche visive specifiche del dominio e il riconoscimento del colore della maglia per migliorare l'associazione tra giocatori in condizioni di affollamento tipiche degli eventi sportivi40,41. Lavori precedenti sul riconoscimento del numero di maglia e sull'uso di dati numerici sintetici ulteriormente supportano la modellizzazione dell'identità in condizioni di bassa risoluzione o parziale occlusione42,43. Questi studi indicano che la semantica delle maglie può rafforzare la rappresentazione dell'identità nel tracciamento multi-oggetto applicato agli sport (MOT). Tuttavia, la maggior parte dei metodi di tracciamento potenziati da informazioni semantiche non modella in modo sufficiente la relazione tra la fiducia nel rilevamento (detection confidence) e la qualità delle caratteristiche semantiche. I rilevamenti ad alta fiducia possono già contenere informazioni spaziali e di aspetto affidabili, rendendo meno efficiente un'ulteriore estrazione semantica. I rilevamenti a bassa fiducia spesso soffrono di occlusione, sfocatura, troncamento o bassa risoluzione, riducendo l'affidabilità degli indizi basati sul colore e sul numero del giocatore. Questa limitazione motiva una progettazione dell'associazione guidata dalla fiducia, in cui la semantica delle maglie viene introdotta in base alla qualità del rilevamento piuttosto che essere applicata uniformemente a tutti i rilevamenti. Gli studi esaminati mostrano che l'associazione consapevole della fiducia e la modellizzazione semantica delle maglie affrontano aspetti diversi del tracciamento multi-oggetto negli sport. Le strategie basate sulla fiducia determinano principalmente se un rilevamento debba partecipare all'associazione e come debba essere abbinato alle traiettorie esistenti, mentre le strategie semantiche basate sulle maglie migliorano principalmente la rappresentazione dell'identità attraverso indizi specifici dello sport. Tuttavia, questi due meccanismi sono spesso progettati come componenti separati. Di conseguenza, gli indizi semantici non vengono sempre adattati in base alla qualità del rilevamento, e i livelli di fiducia non regolano direttamente l'uso delle informazioni sul colore e sul numero del giocatore durante l'associazione. Questa separazione limita la gestione congiunta della frammentazione delle traiettorie e della confusione identitaria nei video di sport di squadra. Il gap di ricerca rimanente consiste nel collegare la valutazione della qualità della fiducia nel rilevamento con l'associazione semantica basata sulle maglie all'interno dello stesso flusso di lavoro di tracciamento.

Protocollo

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha coinvolto un'analisi secondaria di dataset video pubblici disponibili, in particolare SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 e MOT20. Non sono stati reclutati partecipanti, non è stata effettuata alcuna intervento e non sono stati raccolti nuovi dati riguardanti soggetti umani. L'approvazione del comitato etico non era richiesta per questo studio secondo i requisiti istituzionali applicabili della Bangkok Thonburi University.

Il seguente protocollo descrive il flusso di lavoro utilizzato per riprodurre JerseyTrack, dalla preparazione dei dati alla valutazione del tracciamento. Il flusso di lavoro comprende la preparazione del dataset, la preparazione del rilevatore, l'estrazione semantica della maglietta, la partizione per livello di confidenza, l'associazione guidata dalla confidenza, l'inferenza del tracciamento e la valutazione delle prestazioni, come riassunto in Figura 1. Il software, i dataset e le risorse hardware necessari sono elencati nella Tabella dei materiali.

figure-protocol-1
Figura 1. Flusso di lavoro complessivo del metodo JerseyTrack. Il flusso di lavoro comprende l'estrazione di caratteristiche semantiche delle maglie, l'abbinamento iniziale degli oggetti, l'abbinamento supplementare guidato dalla confidenza e la fusione delle caratteristiche. Le caratteristiche relative al colore della squadra e al numero del giocatore vengono estratte dalle regioni degli atleti rilevati e integrate nel processo di associazione per migliorare l'accoppiamento delle traiettorie in condizioni di rilevamento incerto. Cliccare qui per visualizzare una versione ingrandita di questa figura.

1. Preparare i set di dati e la struttura delle directory

  1. Scaricare i dataset pubblici di benchmark elencati nella Tabella dei Materiali. Utilizzare SportsMOT come dataset principale per la preparazione del rilevatore e la valutazione del tracciamento. Conservare TeamTrack, SoccerNet Tracking, MOT17 e MOT20 per la valutazione incrociata tra dataset.
  2. Archiviare tutti i dataset all'interno di una directory di progetto unificata. Assicurarsi che il rilevatore, il modulo di estrazione semantica, il modulo di tracciamento e il toolkit di valutazione utilizzino identificatori di sequenza identici.
  3. Convertire le annotazioni ufficiali di SportsMOT nel formato di addestramento del rilevatore utilizzando lo script di preparazione dati impiegato in questo studio. Eseguire il seguente comando:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Lo script di preparazione dati (scripts/prepare_data.py) è disponibile nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Le dipendenze software richieste sono specificate nel file environment.yml, inclusi Python 3.12, PyTorch 2.11.0 e OpenCV 4.10 o versioni successive. Configurare l'ambiente software utilizzando il seguente comando: conda env create -f environment.yml. Eseguire lo script di preparazione dati con il seguente comando: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Verificare che la conversione generi il file di configurazione per l'addestramento del rilevatore: data\processed\SportsMOT_yolo\data.yaml e il manifesto di conversione: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    NOTA: In questo studio, il dataset di addestramento e validazione di SportsMOT convertito conteneva 90 sequenze, 55.544 fotogrammi e 608.152 oggetti annotati.
  6. Esaminare alcune sequenze rappresentative per verificare che l'ordine dei fotogrammi, le coordinate dei bounding box e le etichette di identità siano coerenti con le annotazioni originali del benchmark.
  7. Conservare i file di annotazione convertiti senza modifiche durante tutta la preparazione del rilevatore, l'inferenza del tracciamento e la valutazione, in modo che tutti i metodi utilizzino la stessa partizione del dataset e lo stesso protocollo di valutazione.
    NOTA: Il risultato atteso di questa sezione è una directory standardizzata per l'addestramento del rilevatore SportsMOT, contenente le annotazioni convertite, il manifesto di conversione e i file di suddivisione del dataset necessari per la preparazione del rilevatore e la valutazione del tracciamento.

2. Preparare le uscite del rivelatore

  1. Ottimizzare l'object detector utilizzando la suddivisione di addestramento SportsMOT preparata. Ottimizzare il detector utilizzando la perdita di classificazione e la perdita di regressione del bounding box definite nell'Equazione 1. Utilizzare la risoluzione di input del detector, la dimensione del batch, il tasso di apprendimento, il numero di epoche di addestramento e gli altri parametri di addestramento riportati nell'ambiente di implementazione e nella Tabella dei Materiali
    Ldet = Lcls + Lbox   (1)
    Dove, Ldet  indica la perdita totale del detector, Lcls  indica la perdita di classificazione, Lbox  indica la perdita di regressione del bounding box.
    NOTA: Il checkpoint del detector utilizzato negli esperimenti principali (identificativo interno dell'esperimento e3) è stato addestrato utilizzando il framework Ultralytics YOLO con la configurazione del dataset SportsMOT in formato YOLO (data/processed/SportsMOT_yolo/data.yaml). Eseguire l'addestramento del detector con il seguente comando: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Dopo l'addestramento, utilizzare il checkpoint con le migliori prestazioni risultante per generare le uscite del detector per le sequenze di validazione con il seguente comando: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Salvare il checkpoint del detector addestrato, il corrispondente file di metadati e il log di addestramento dopo l'addestramento.
    NOTA: In questo studio, il checkpoint del detector utilizzato per gli esperimenti formali è stato salvato come:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Il file di metadati corrispondente è stato salvato come: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. La directory delle uscite del detector utilizzata per i principali esperimenti di validazione di SportsMOT era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Eseguire il detector addestrato su ciascuna sequenza di validazione per generare i bounding box degli atleti e i punteggi di confidenza. Esportare un file di rilevamento per ogni sequenza contenente l'indice del fotogramma, le coordinate del bounding box, il punteggio di confidenza del rilevamento e l'etichetta della classe.
    NOTA: Nell'esecuzione di validazione di SportsMOT utilizzata per gli esperimenti principali, una soglia di confidenza pari a 0,05 ha generato 343.990 rilevamenti di atleti.
  4. Ispezionare la directory delle uscite del detector prima dell'inferenza del tracking. Verificare che ogni sequenza abbia un file di rilevamento corrispondente, che gli indici dei fotogrammi corrispondano alla sequenza di immagini preparata e che ogni record di rilevamento contenga un punteggio di confidenza.
    NOTA: Il risultato atteso di questa sezione è una directory delle uscite del detector completa, che funge da input per l'estrazione semantica delle maglie, la partizione per livello di confidenza e l'associazione nel tracking.

3. Estrarre le caratteristiche semantiche della maglia

  1. Utilizzare i file di output del rilevatore per ritagliare le regioni degli atleti da ogni fotogramma video. Salvare ogni immagine ritagliata dell'atleta con il suo identificatore di sequenza, indice del fotogramma e indice di rilevamento. Escludere i ritagli non validi con contenuto immagine mancante o box delimitatori che si estendono oltre i bordi dell'immagine. Mantenere il collegamento tra ogni nome file del ritaglio e il relativo record di rilevamento originale in modo che le caratteristiche semantiche estratte possano essere associate al corrispondente rilevamento durante l'associazione nel tracciamento.
  2. Estrarre le caratteristiche del colore della maglia dalle immagini ritagliate degli atleti utilizzando lo script di estrazione semantica impiegato in questo studio.
    NOTA: Gli script per l'estrazione delle caratteristiche semantiche (scripts/extract_fast_color_semantics.py e scripts/formal_extract_semantics.py) sono disponibili nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Non è richiesto alcun file di configurazione separato; tutti i parametri di esecuzione vengono forniti tramite argomenti da riga di comando.
    Generare i descrittori del colore della maglia utilizzando il seguente comando: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Generare le caratteristiche semantiche del numero del giocatore utilizzando il modello OCR con il seguente comando: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. I descrittori del colore della maglia generati e le uscite di probabilità del numero del giocatore sono collegati tramite identificatore di sequenza e combinati nei file delle caratteristiche semantiche utilizzati durante l'associazione nel tracciamento.
  3. Convertire ogni immagine ritagliata dell'atleta nello spazio colore Hue, Saturation, Value (HSV). Estrarre i pixel in primo piano dalla regione della maglia e riassumere il colore dominante della maglia utilizzando il clustering K-means con K = 3. Normalizzare il descrittore del colore risultante utilizzando la normalizzazione L2 prima del confronto tra caratteristiche.
  4. Addestrare il ramo di riconoscimento del numero del giocatore utilizzando immagini ritagliate degli atleti con una dimensione di ingresso di 128 × 64 pixel. Generare etichette pseudo-supervisionate per il numero del giocatore utilizzando la procedura di etichettatura debolmente supervisionata impiegata in questo studio. Escludere i ritagli con numeri del giocatore invisibili, illeggibili, fortemente occlusi o con regioni a bassa confidenza dal calcolo della perdita OCR (Optical Character Recognition).
  5. Ottimizzare il ramo OCR utilizzando la perdita di entropia incrociata definita nella Equazione 2.
    figure-protocol-2 (2)
    In questo caso, Locr indica la perdita OCR, yi indica l'etichetta supervisionata del numero del giocatore e figure-protocol-3 indica la categoria prevista del numero del giocatore.
  6. Ottimizzare il modulo di estrazione delle caratteristiche semantiche utilizzando l'ottimizzatore adattivo, la velocità di apprendimento, la dimensione del batch, il decadimento del peso e la durata dell'addestramento elencati nella Tabella dei Materiali. Combinare la perdita del rilevatore e la perdita OCR utilizzando l'obiettivo totale di addestramento definito nella Equazione 3.
    Ltotale = Ldet + γLocr   (3)
    In questo caso, Ltotale indica la perdita totale di addestramento, Ldet indica la perdita del rilevatore definita nella Equazione 1, Locr indica la perdita OCR definita nella Equazione 2 e indica il coefficiente di ponderazione definito dall'utente per la perdita OCR.
  7. Applicare il ramo OCR addestrato a ogni immagine ritagliata dell'atleta. Salvare la categoria prevista del numero del giocatore o il vettore di probabilità per ogni ritaglio. Se il numero del giocatore non è visibile o la confidenza OCR è inferiore alla soglia definita nell'implementazione, registrare la caratteristica del numero del giocatore come non disponibile anziché forzare una previsione.
  8. Combinare il descrittore del colore della maglia e l'uscita del numero del giocatore nel file delle caratteristiche semantiche utilizzato dal modulo di tracciamento.
    NOTA: Nella principale esecuzione di validazione di SportsMOT, lo script di estrazione semantica ha elaborato 343.990 rilevamenti senza perdere fotogrammi o generare ritagli non validi. Nel pacchetto di revisione attuale, il riassunto dell'estrazione semantica ha riportato un'accuratezza complessiva di estrazione semantica colore-e-OCR del 86,7% nell'ambiente SportsMOT valutato. Il risultato atteso di questa sezione è un file di caratteristiche semantiche in cui ogni record di rilevamento valido è collegato a un descrittore del colore della maglia, a un'uscita del numero del giocatore quando disponibile e a un indicatore che segnala se le informazioni semantiche sono disponibili per l'associazione nel tracciamento.

4. Livelli di confidenza nel rilevamento delle partizioni

  1. Caricare il file di output del rilevatore per ogni sequenza video. Raccogliere i punteggi di confidenza di tutti i rilevamenti degli atleti in ogni fotogramma.
  2. Partizionare i punteggi di confidenza a livello di fotogramma in intervalli di alta, media e bassa confidenza utilizzando il clustering K-means con K = 3, seguendo il flusso di lavoro di associazione guidata dalla confidenza mostrato in Figura 2. Determinare le soglie di confidenza adattive minimizzando la varianza all'interno dei cluster secondo Equazione 4.
    figure-protocol-4  (4)
    Dove sd indica il punteggio di confidenza del rilevamento d; D1, D2 e D3 indicano rispettivamente gli intervalli di alta, media e bassa confidenza; μ1, μ2 e μ3 indicano i punteggi medi di confidenza dei tre intervalli; e τ1 e τ2 indicano le soglie di confidenza adattive ottenute dai risultati del clustering K-means.
    NOTA: Lo script di partizionamento della confidenza (scripts/formal_partition_confidence.py) è disponibile nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Il modulo di partizionamento della confidenza utilizza una procedura di clustering K-means unidimensionale basata su NumPy con K = 3. Non è richiesto alcun file di configurazione separato; la directory di input, la directory di output e il parametro di clustering vengono specificati tramite argomenti da riga di comando. Eseguire la procedura di partizionamento della confidenza utilizzando il seguente comando: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Le dipendenze software richieste, inclusa la versione di NumPy, sono specificate in environment.yml.
  3. Eseguire la procedura di partizionamento della confidenza utilizzando la directory di output del rilevatore come input.
    NOTA: In questo studio, la directory di output del rilevatore era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. La directory di output del partizionamento della confidenza era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. I file di output generati includevano i file CSV di confidenza per sequenza, _confidence_frame_summary.csv e _confidence_runtime.csv.
  4. Assegnare un'etichetta di livello di confidenza a ogni rilevamento. Etichettare i rilevamenti ad alta confidenza per l'associazione basata sul movimento, i rilevamenti a media confidenza per l'associazione di tipo motion-semantic e i rilevamenti a bassa confidenza solo per il recupero delle traiettorie. Conservare il punteggio di confidenza originale insieme all'etichetta di livello di confidenza assegnata.
  5. Esaminare le distribuzioni dei punteggi di confidenza e i fotogrammi rappresentativi, come illustrato in Figura 3. Verificare che i rilevamenti ad alta confidenza corrispondano prevalentemente a box delimitatori completi e affidabili degli atleti, mentre i rilevamenti a media e bassa confidenza contengano principalmente rilevamenti parziali, occlusi, sfocati o deboli.
    NOTA: Il risultato atteso di questa sezione è un file di partizionamento della confidenza contenente l'indice del rilevamento, il punteggio originale di confidenza, il livello di confidenza assegnato e le soglie adattive di confidenza a livello di fotogramma per ogni rilevamento.

figure-protocol-5
Figura 2. Strategia di associazione guidata dalla confidenza. Il flusso di lavoro suddivide la confidenza di rilevamento in intervalli ad alta, media e bassa confidenza mediante clustering adattivo della confidenza. I rilevamenti ad alta confidenza vengono associati utilizzando la similarità del movimento, quelli a media confidenza vengono associati combinando similarità del movimento e similarità semantica della maglia, mentre i rilevamenti a bassa confidenza vengono utilizzati per il recupero delle traiettorie assistito da informazioni semantiche con verifica su più fotogrammi. Il pannello destro riassume la formulazione matematica impiegata per la suddivisione in base alla confidenza e per l'associazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.

figure-protocol-6
Figura 3. Distribuzione dei punteggi di confidenza di rilevamento. L'istogramma mostra il numero di box di rilevamento degli atleti all'interno di cinque intervalli di confidenza per le sequenze di calcio, pallacanestro e pallavolo nel dataset SportsMOT. La distribuzione illustra le differenze nella confidenza del rilevatore tra le categorie sportive valutate. Cliccare qui per visualizzare una versione ingrandita di questa figura.

5. Eseguire l'associazione guidata dalla fiducia

  1. Caricare il file di output del rilevatore, il file delle caratteristiche semantiche e il file di partizione della confidenza per ogni sequenza video. Inizializzare il tracker utilizzando i primi rilevamenti validi e mantenere uno stato di traiettoria per ogni atleta tracciato. Per ogni fotogramma successivo, prevedere la posizione di ogni traiettoria esistente utilizzando il modello di movimento del filtro di Kalman.
  2. Calcolare la similarità di movimento tra ogni traiettoria prevista e il rilevamento candidato utilizzando la distanza di Mahalanobis definita in Equazione 5.
    figure-protocol-7  (5)
    In questa formula, figure-protocol-8 indica la traiettoria I-esima nel fotogramma k, figure-protocol-9 indica lo stato previsto della traiettoria tramite Kalman, dj indica il rilevamento candidato, figure-protocol-10 indica la matrice inversa della covarianza dello stato della traiettoria prevista e Smot indica la distanza di movimento tra la traiettoria prevista e il rilevamento.
    NOTA: Il flusso di lavoro principale di associazione è implementato in jerseytrack/formal_tracker.py ed eseguito tramite scripts/formal_track.py, entrambi disponibili nel repository del codice sorgente JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Non è richiesto alcun file di configurazione separato. Tutti i parametri di esecuzione, inclusi i livelli di confidenza, l'età massima della traccia, i coefficienti di peso del movimento e il peso della distanza centrale, vengono forniti tramite argomenti da riga di comando. Il comando completo di esecuzione e le impostazioni dei parametri sono forniti al punto 6.2. L'implementazione utilizza l'algoritmo di assegnazione lineare di SciPy per l'appaiamento ungherese e NumPy per l'associazione basata sui costi.
  3. Eseguire il flusso di lavoro di tracciamento utilizzando come input il file di output del rilevatore, il file delle caratteristiche semantiche e il file di partizione della confidenza.
    NOTA: In questo studio, il tracker principale è stato implementato in jerseytrack\formal_tracker.py, e il flusso di lavoro di tracciamento è stato eseguito utilizzando scripts\formal_track.py.
  4. Associare i rilevamenti ad alta confidenza alle traiettorie esistenti utilizzando la coerenza del movimento. Aggiornare le traiettorie associate e inizializzare nuove traiettorie solo quando i rilevamenti ad alta confidenza non associati soddisfano i criteri di inizializzazione della traiettoria.
  5. Esaminare gli output dell'estrazione semantica della maglietta illustrati in Figura 4, e costruire il vettore di caratteristiche semantiche della maglietta per ogni rilevamento combinando il descrittore del colore della squadra e la caratteristica del numero del giocatore secondo Equazione 6.
    fsem = [fcol;fid] (6)
    In questa formula, fsem  indica il vettore di caratteristiche semantiche fuso, fcol indica il descrittore del colore della squadra e fid indica la caratteristica del numero del giocatore generata dal ramo OCR.
  6. Associare i rilevamenti a confidenza media combinando la similarità di movimento con la similarità semantica della maglietta. Calcolare il punteggio di abbinamento fuso secondo Equazione 7.
    figure-protocol-11 (7)
    In questa formula, Ssem indica la similarità coseno tra i vettori di caratteristiche semantiche della traiettoria e del rilevamento candidato, Smot indica la distanza di movimento definita in Equazione 5 e  λ indica il coefficiente di fusione adattivo che bilancia i termini di similarità di movimento e semantica.
  7. Calcolare il coefficiente di fusione adattivo secondo Equazione 8.
    figure-protocol-12 (8)
    In questa formula, λ indica il coefficiente iniziale di peso del movimento,  σsd indica la deviazione standard dei punteggi di confidenza del rilevamento nel fotogramma corrente e  σmax indica la deviazione standard massima dei punteggi di confidenza utilizzata per la normalizzazione.
  8. Utilizzare i rilevamenti a bassa confidenza solo per il recupero della traiettoria. Associare i rilevamenti a bassa confidenza con traiettorie interrotte solo quando è disponibile informazione semantica e i criteri di recupero sono soddisfatti. Applicare una verifica su più fotogrammi prima di ripristinare l'identità di una traiettoria e scartare i rilevamenti che non superano la verifica.
    NOTA: Quando la caratteristica del numero del giocatore non è disponibile, effettuare l'associazione utilizzando l'informazione semantica disponibile e la coerenza del movimento, piuttosto che forzare una corrispondenza del numero del giocatore. Il risultato atteso di questa sezione è un registro di tracciamento fotogramma per fotogramma contenente identità delle traiettorie, box delimitatori, etichette di livello di confidenza, costi di movimento, informazioni semantiche e decisioni finali di associazione. Nel pacchetto di prova della revisione, i risultati del tracciamento sono stati archiviati in: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

figure-protocol-13
Figura 4. Estrazione di caratteristiche semantiche dalla maglietta. I rilevamenti rappresentativi degli atleti sono annotati con i descrittori di colore della squadra e le informazioni sul numero del giocatore generati dal modulo di estrazione delle caratteristiche semantiche della maglietta. Le caratteristiche semantiche estratte vengono successivamente incorporate nell'associazione dati guidata dalla fiducia. Cliccare qui per visualizzare una versione ingrandita di questa figura.

6. Eseguire il tracciamento inferenziale ed esportare i risultati

  1. Eseguire l'inferenza di tracciamento per ogni sequenza video utilizzando i file di output del rilevatore preparati, i file delle caratteristiche semantiche e i file di partizione della confidenza. Elaborare i fotogrammi video in ordine cronologico in modo che gli stati delle traiettorie, la cronologia semantica e le decisioni di recupero delle traiettorie vengano aggiornati in modo coerente lungo tutta la sequenza. Utilizzare la stessa configurazione di inferenza per tutte le sequenze valutate, a meno che non sia esplicitamente indicata un'impostazione specifica per il dataset.
    NOTA: L'inferenza di tracciamento è stata eseguita utilizzando lo script/formal_track.py, disponibile nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Non è richiesto alcun file di configurazione separato. Eseguire l'inferenza di tracciamento utilizzando il seguente comando: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Tutti i parametri non specificati hanno mantenuto i valori predefiniti registrati nel codice sorgente archiviato.
  2. Dopo l'inferenza, applicare la sequenza principale di post-elaborazione utilizzando i seguenti comandi: python scripts/merge_tracklets.py e python scripts/sweep_track_filter.py --min-len 95.
  3. Esportare i risultati del tracciamento nel formato richiesto dal toolkit di valutazione. Includere l'indice del fotogramma, l'identità della traiettoria, le coordinate del bounding box e tutti i campi richiesti dal formato di valutazione del benchmark. Salvare un file di risultati di tracciamento per ogni sequenza utilizzando una convenzione di denominazione dei file coerente, in modo che ogni file di risultati possa essere abbinato al corrispondente file di annotazione del ground-truth.
  4. Applicare esclusivamente le operazioni di post-elaborazione utilizzate in questo studio. Eseguire l'unione dei tracklet e il filtraggio dei tracciamenti utilizzando gli script di post-elaborazione descritti nel pacchetto di revisione.
    NOTA: In questo studio, il flusso di lavoro di post-elaborazione ha utilizzato gli script seguenti:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Ispezionare i risultati di tracciamento esportati prima della valutazione quantitativa. Verificare che le identità delle traiettorie rimangano numeriche e coerenti all'interno di ogni sequenza, che non manchino indici di fotogrammi e che tutti i bounding box rimangano entro i limiti dell'immagine.
    NOTA: Il risultato atteso di questa sezione è un insieme completo di file di risultati di tracciamento a livello di sequenza, pronti per la valutazione quantitativa.

7. Valutare le prestazioni del tracciamento

  1. Valutare i file dei risultati di tracciamento esportati utilizzando il toolkit di valutazione elencato nella Tabella dei Materiali. Associare ogni file di risultati di tracciamento al corrispondente file di annotazione di riferimento (ground-truth) e alla suddivisione del dataset. Utilizzare la stessa configurazione di valutazione per tutti i metodi confrontati, al fine di garantire che le differenze di prestazione derivino dai risultati di tracciamento e non dalle impostazioni di valutazione.
  2. Eseguire la valutazione utilizzando il seguente comando
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOTA: La valutazione è stata effettuata utilizzando l'implementazione standard delle metriche di TrackEval (Versione 1.3.0) archiviata all'interno del pacchetto di riproducibilità JerseyTrack. Non sono state apportate modifiche alle implementazioni delle metriche Higher Order Tracking Accuracy (HOTA), CLEAR o Identity. Il repository include lo script di esecuzione in stile MOTChallenge, situato in evaluation/trackeval/scripts/run_mot_challenge.py, che configura i percorsi del dataset e dei risultati e richiama le metriche di valutazione standard di TrackEval.
  3. Registrare le metriche di valutazione riportate nel manoscritto, inclusi Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA), Detection Accuracy (DetA), Association Accuracy (AssA), falsi positivi (FPs), falsi negativi (FNs) e gli eventi di cambio di identità (identity-switching). Esportare il riepilogo della valutazione come tabella e conservare i file di valutazione per sequenza per la verifica.
  4. Quando si confronta JerseyTrack con i metodi di riferimento (baseline), utilizzare la stessa suddivisione del dataset, gli stessi output del rilevatore (detector) e la stessa configurazione di valutazione per tutti i metodi. Registrare il dataset, la fonte degli output del rilevatore, la configurazione del toolkit di valutazione e i valori delle metriche per ogni confronto.
  5. Esaminare i log di valutazione per verificare che tutte le sequenze siano state valutate correttamente e che non manchino file di risultati di tracciamento.
    NOTA: In questo studio, il file principale di riepilogo di TrackEval è stato conservato in: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Il risultato atteso di questa sezione è una tabella completa di riepilogo della valutazione, insieme ai file delle metriche per sequenza, a supporto dei Risultati riportati e della successiva verifica.

Risultati

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questa sezione riporta i risultati quantitativi e qualitativi ottenuti dagli esperimenti di tracciamento multi-oggetto nello sport valutati. I risultati si concentrano sull'accuratezza del tracciamento, sulla conservazione dell'identità, sulla qualità dell'associazione e sulla robustezza nelle condizioni impostate dal dataset testato. Le affermazioni sulle prestazioni si riferiscono esclusivamente ai metodi valutati, ai dataset, agli output del rilevatore e alla configurazione del toolkit di valutazione descritti nel Protocollo e nell'Impostazione dell'Implementazione.

Impostazione sperimentale e progettazione della valutazione

Dati e preelaborazione:

SportsMOT è stato utilizzato come benchmark principale per la preparazione del rilevatore, l'inferenza del tracciamento e la valutazione quantitativa. Il dataset contiene 240 sequenze video e oltre 150.000 fotogrammi di immagine relativi a scenari di calcio, pallacanestro e pallavolo (Figura 5). Nella valutazione formale, i principali risultati di SportsMOT sono stati calcolati utilizzando la suddivisione di convalida insieme agli output del rilevatore, alla configurazione del tracciamento e alle impostazioni di TrackEval descritte nel Protocollo. È stata effettuata una valutazione incrociata sui dataset TeamTrack, SoccerNet Tracking, MOT17 e MOT20 per esaminare il trasferimento delle prestazioni tra diversi tipi di dataset, piuttosto che per effettuare confronti diretti a livello di metriche tra dataset.

figure-results-1
Figura 5. Set di dati rappresentativi utilizzati per la valutazione. I fotogrammi di esempio illustrano sequenze rappresentative di calcio, pallacanestro e pallavolo utilizzate per la valutazione sperimentale. La figura evidenzia le variazioni del punto di vista della telecamera, della densità dei giocatori e della complessità della scena nei diversi set di dati valutati. Cliccare qui per visualizzare una versione ingrandita di questa figura.

I dati SportsMOT sono stati organizzati secondo la struttura ufficiale del dataset e convertiti nel formato per l'addestramento del rilevatore descritto nel Protocollo. I dati convertiti di addestramento e convalida di SportsMOT contenevano 90 sequenze, 55.544 fotogrammi e 608.152 oggetti annotati. La partizione di addestramento è stata utilizzata per la preparazione del rilevatore e la taratura dei parametri, mentre la partizione di convalida è stata utilizzata per la valutazione formale del tracciamento riportata in questo studio. Tutti i fotogrammi di input sono stati ridimensionati secondo la configurazione del rilevatore riportata nel Protocollo e nella Tabella dei Materiali. La stessa procedura di preelaborazione è stata applicata durante la preparazione del rilevatore, l'estrazione delle caratteristiche semantiche, l'inferenza del tracciamento e la valutazione con TrackEval, in modo che le differenze riportate riflettessero principalmente la strategia di associazione nel tracciamento piuttosto che differenze nell'elaborazione dei dati.

Indicatori di valutazione:

Le prestazioni di tracciamento sono state valutate utilizzando un protocollo di valutazione compatibile con MOTChallenge, implementato con il toolkit di valutazione indicato nella Tabella dei Materiali. Le metriche riportate descrivono tre aspetti delle prestazioni di tracciamento nel contesto sportivo: accuratezza complessiva del tracciamento, preservazione dell'identità e qualità della rilevazione-abbinamento. MOTA, IDF1 e HOTA sono state utilizzate come metriche principali di valutazione44,45. MOTA riassume falsi positivi, falsi negativi e cambi di identità in un punteggio complessivo di accuratezza del tracciamento. IDF1 misura la coerenza tra le traiettorie predette e le identità reali. HOTA valuta congiuntamente l'accuratezza della rilevazione e quella dell'abbinamento, caratterizzando quindi l'equilibrio tra localizzazione del bersaglio e associazione delle traiettorie. DetA e AssA sono state riportate come metriche complementari. FPs, FNs e cambi di identità (IDs) sono stati utilizzati per caratterizzare le fonti di errore legate a rilevazioni errate, rilevazioni mancate e cambi di identità. Per i confronti tra metodi su SportsMOT, sono stati utilizzati gli stessi output del rilevatore e la stessa configurazione del toolkit di valutazione, al fine di ridurre l'influenza delle variazioni del rilevatore e delle differenze nelle impostazioni di valutazione. Per i confronti tra diversi dataset, i valori delle metriche sono stati interpretati come risultati di valutazione all'interno dello stesso dataset, piuttosto che come indicazione di una superiorità assoluta delle prestazioni su dataset diversi.

Ambiente sperimentale e configurazione dei parametri:

Gli esperimenti sono stati condotti utilizzando le risorse hardware e software elencate nella Tabella dei Materiali. Lo stesso ambiente computazionale, framework del rilevatore, uscite del rilevatore e toolkit di valutazione sono stati utilizzati durante tutti i principali esperimenti SportsMOT per mantenere la coerenza durante la preparazione del rilevatore, l'inferenza del tracciamento e la valutazione delle prestazioni. Il framework del rilevatore elencato nella Tabella dei Materiali è stato addestrato con una dimensione del batch di 16, un tasso di apprendimento iniziale di 0,01 e 80 epoche di addestramento. Nel modulo di estrazione semantica della maglia, il raggruppamento dei colori ha utilizzato K-means con K = 3, mentre il ramo OCR ha utilizzato una rete neurale convoluzionale ricorrente leggera con una dimensione dell'ingresso di 128 × 64 pixel. Il ramo OCR è stato ottimizzato utilizzando l'ottimizzatore adattivo elencato nella Tabella dei Materiali con un tasso di apprendimento di 1 × 10⁻3, un decadimento del peso di 1 × 10⁻5, una dimensione del batch di 64 e 40 epoche di addestramento. Non è stata utilizzata alcuna pianificazione aggiuntiva del tasso di apprendimento durante l'addestramento del modulo di estrazione delle caratteristiche semantiche. Il coefficiente di ponderazione della perdita OCR (γ) è stato trattato come un iperparametro definito dall'utente e selezionato in base alle prestazioni sul set di validazione. La stratificazione per livello di confidenza ha utilizzato un partizionamento K-means adattivo, in cui τ₁ e τ₂ sono stati calcolati sulla base della distribuzione del livello di confidenza del rilevamento di ciascun fotogramma, piuttosto che essere predefiniti manualmente prima dell'inferenza.

Valutazione delle prestazioni nei diversi sport e in base alla complessità degli scenari

Prestazioni quantitative in diverse discipline sportive e condizioni di scena:

Le prestazioni di tracciamento sono state valutate in base a due fattori di raggruppamento: categoria sportiva e complessità della scena. L'analisi per categoria sportiva ha incluso sequenze di calcio, pallacanestro e pallavolo. L'analisi della complessità della scena ha preso in considerazione il livello di ostruzione, la velocità del movimento e la densità del bersaglio, utilizzando gli stessi criteri di raggruppamento per tutte le sequenze valutate. Le metriche riportate hanno seguito il protocollo di valutazione descritto nella Sezione 7 del Protocollo. 

Figura 6 riassume i risultati del tracciamento quantitativo in diverse categorie sportive e condizioni di complessità della scena. Figura 6A riporta MOTA e DetA attraverso sequenze di calcio, pallacanestro e pallavolo. Figura 6B riporta la variazione di MOTA in base a diversi livelli di ostruzione, velocità del movimento e densità del bersaglio. Figura 6C riporta i conteggi cumulativi di FP e FN per ciascuna dimensione della complessità della scena.

figure-results-2
Figura 6. Valutazione delle prestazioni tra le diverse categorie sportive e condizioni di scena. (A) Accuratezza nel tracciamento di oggetti multipli (MOTA) e accuratezza nel rilevamento (DetA) per calcio, pallacanestro, pallavolo e la media complessiva. (B) MOTA nelle diverse condizioni di scena rappresentative, con livelli variabili di occlusione, densità dei giocatori e complessità del movimento. (C) Numero di falsi positivi (FP) e falsi negativi (FN) nelle condizioni di scena valutate. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Nelle tre categorie sportive, JerseyTrack ha raggiunto una MOTA media dell'88,9% e una DetA media del 80,2%. La differenza di MOTA tra le categorie sportive è stata di 1,3 punti percentuali, con il valore più alto osservato per le sequenze di pallavolo (89,2%) e il più basso per quelle di pallacanestro (87,9%). La MOTA inferiore osservata nelle sequenze di pallacanestro è coerente con la maggiore frequenza di interazioni ravvicinate e di occlusioni dense nelle sequenze valutate. In condizioni di scena meno complesse, incluse occlusioni leggere, bassa velocità di movimento e distribuzione rada dei bersagli, la MOTA ha raggiunto rispettivamente il 91,8%, il 93,1% e il 93,8%. In condizioni di scena più complesse, la MOTA è diminuita all'84,9% in caso di occlusione pesante, all'83,6% in caso di movimento ad alta velocità e all'83,1% con distribuzione densa dei bersagli. Questi risultati mostrano che le prestazioni del tracciamento sono diminuite all'aumentare della complessità della scena, pur rimanendo entro l'intervallo riportato per gli scenari sportivi valutati.

Monitoraggio della coerenza in scenari sportivi rappresentativi:

Figura 7 presenta esempi rappresentativi di tracciamento che illustrano la coerenza temporale di JerseyTrack in tre scenari sportivi complessi: interazioni ravvicinate tra giocatori, occlusioni parziali prolungate e cambiamenti rapidi di direzione. In tutte queste sequenze rappresentative, il tracciatore ha mantenuto identità di traiettoria costanti nonostante il frequente sovrapporsi degli atleti e il movimento dinamico. La frammentazione dell'identità è stata osservata principalmente in caso di occlusione grave o quando le informazioni semantiche delle maglie sono diventate temporaneamente non disponibili; tuttavia, la strategia di associazione guidata dalla confidenza ha permesso il recupero della traiettoria non appena sono ricomparse rilevazioni affidabili. Questi esempi rappresentativi supportano qualitativamente i risultati quantitativi mostrati nella Figura 6, dimostrando una conservazione stabile dell'identità nelle condizioni di tracciamento sportivo valutate.

figure-results-3
Figura 7. Risultati rappresentativi del tracciamento prodotti da JerseyTrack. Frame consecutivi di sequenze di pallacanestro, calcio e pallavolo illustrano il mantenimento delle identità e delle traiettorie degli atleti durante il tracciamento. I riquadri delimitatori colorati rappresentano le identità tracciate mantenute attraverso frame video successivi. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Risultati dell'ablazione per la conservazione dell'identità:

È stata condotta un'analisi di ablazione per esaminare i contributi della strategia di associazione guidata dalla confidenza e del modulo di fusione semantica della maglietta al mantenimento dell'identità. Sono stati confrontati quattro varianti del modello: V0, il modello di base senza associazione guidata dalla confidenza né fusione semantica della maglietta; V1, la variante che utilizza solo l'associazione guidata dalla confidenza; V2, la variante che utilizza solo la fusione semantica della maglietta; e V3, la configurazione completa di JerseyTrack che incorpora entrambi i componenti. La valutazione si è concentrata su metriche relative all'identità, inclusi ID, IDF1, Precisione dell'Identità (IDP) e Richiamo dell'Identità (IDR). I modelli rappresentativi di mantenimento dell'identità sono mostrati in Figura 8.

figure-results-4
Figura 8. Analisi di ablazione dell'associazione semantica delle maglie guidata dalla fiducia. (A) Numero complessivo di cambio di identità (IDs) e punteggio F1 di identità (IDF1) per le diverse varianti del modello valutate. (B) Confronto dei cambio di identità (IDs) tra il modello completo (V3) e la configurazione di base (V0) in scenari di tracciamento rappresentativi e complessi. (C) IDF1, precisione di identità (IDP) e richiamo di identità (IDR) del modello completo in diversi scenari di tracciamento. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Nell'ambito generale della validazione SportsMOT, la configurazione completa V3 ha prodotto il numero più basso di ID e l'IDF1 più elevato tra le quattro varianti del modello. La V3 ha registrato 2.768 ID, con 477 commutazioni di identità in meno rispetto alla V0, raggiungendo un IDF1 del 74,3%, con un incremento di 7,1 punti percentuali rispetto alla V0. Questi risultati indicano che i due moduli hanno contribuito congiuntamente alla preservazione dell'identità nelle condizioni di tracciamento sportivo valutate. Il confronto tra le varianti con singolo modulo e la configurazione completa ha inoltre mostrato che i due moduli influenzano diverse fonti di errore nel tracciamento. La strategia di associazione guidata dalla confidenza ha ridotto gli errori di abbinamento legati all'instabilità della confidenza del rilevamento e all'incertezza nella localizzazione, mentre il modulo di fusione semantica della maglia ha fornito informazioni aggiuntive sull'identità quando le informazioni di movimento da sole non erano sufficienti. La configurazione completa V3 ha ottenuto prestazioni migliori rispetto a ciascuna delle varianti con singolo modulo per quanto riguarda gli aspetti legati all'identità, suggerendo che i due moduli apportano contributi complementari piuttosto che ridondanti.

I risultati a livello di scenario hanno mostrato differenze maggiori in condizioni più difficili di preservazione dell'identità. Durante l'occlusione di lunga durata, V3 ha registrato 215 ID rispetto ai 482 di V0. Negli scenari densi con giocatori della stessa squadra (6–10 giocatori), V3 ha registrato 328 ID rispetto ai 615 di V0. In presenza di cambiamenti di direzione ad alta velocità, V3 ha registrato 482 ID rispetto ai 960 di V0. Queste riduzioni sono coerenti con l'uso previsto di indizi semantici durante l'occlusione e le interazioni dense, nonché con l'associazione guidata dalla confidenza in condizioni di rilevamento variabile durante movimenti rapidi. Le tendenze di IDP e IDR mostrate nella Figura 8C indicano che la riduzione degli ID non è stata accompagnata da una riduzione sostanziale né della precisione né del richiamo dell'identità. La configurazione completa ha mantenuto valori IDF1 superiori al 71% in tutti gli scenari difficili valutati, con valori inferiori osservati nelle interazioni dense tra giocatori della stessa squadra e nei cambiamenti di direzione ad alta velocità. Questi risultati indicano un miglioramento della coerenza identitaria nelle condizioni valutate, identificando al contempo le interazioni dense e il movimento rapido come le principali fonti residue di degrado delle prestazioni.

Risultati della valutazione incrociata tra dataset:

È stata condotta una valutazione incrociata tra dataset per verificare se il comportamento di tracciamento osservato su SportsMOT potesse essere mantenuto in condizioni diverse di dataset. La valutazione ha incluso due dataset specifici per lo sport, SoccerNet Tracking e TeamTrack, e due dataset MOT generici, MOT17 e MOT20. Lo scopo di questo esperimento era esaminare il trasferimento delle prestazioni tra diversi tipi di dataset. I risultati non sono stati utilizzati per affermare una superiorità diretta a livello metrico tra i dataset, poiché i protocolli di annotazione, la composizione delle scene, i punti di vista delle telecamere e le categorie di destinazione differiscono.

Tabella 1 riassume i risultati della valutazione incrociata tra dataset. Nei dataset specifici per gli sport, JerseyTrack ha mantenuto valori relativamente stabili di MOTA e IDF1 rispetto all’impostazione principale di validazione di SportsMOT. Questa tendenza suggerisce che la strategia di associazione guidata dalla confidenza e gli indizi semantici legati alle maglie sono rimasti efficaci quando le scene di tracciamento hanno conservato le caratteristiche visive degli sport di squadra, inclusi uniformi ripetute, interazioni fitte tra atleti e occlusioni frequenti. Nei dataset MOT generici, il metodo ha mantenuto valori competitivi di MOTA e DetA, mentre l’IDF1 è risultato inferiore rispetto a quello osservato nei dataset specifici per gli sport. Questo andamento è coerente con l’assenza di indizi relativi al colore della maglia e al numero del giocatore in MOT17 e MOT20, che vengono sfruttati dal modulo di fusione semantica. In queste condizioni, il componente di associazione guidata dalla confidenza è rimasto applicabile, mentre il ramo semantico ha fornito meno informazioni specifiche sull’identità rispetto al caso dei video di sport di squadra. Nel complesso, questi risultati indicano che JerseyTrack si trasferisce in modo più efficace a dataset contenenti semantica visiva specifica per gli sport, piuttosto che a dataset generici di tracciamento di pedoni. La valutazione incrociata tra dataset supporta quindi l’applicazione prevista del metodo come tracker orientato agli sport, identificando al contempo l’assenza di semantica esplicita della maglia come un fattore limitante nei dataset MOT non sportivi.

DatasetMOTA↑IDF1↑DetA↑FPS↑
SoccerNet Tracking86,871,377,932,1
TeamTrack86,270,777,332,8
MOT1784,769,576,133,9
MOT2084,168,975,333,2

Tabella 1: Risultati della valutazione incrociata tra dataset. Prestazioni di tracciamento di JerseyTrack valutate su quattro dataset pubblici di riferimento. Vengono riportati l'accuratezza nel tracciamento di più oggetti (MOTA), il punteggio F1 di identità (IDF1), l'accuratezza del rilevamento (DetA) e la velocità di elaborazione misurata in frame al secondo (FPS). Valori più elevati indicano prestazioni migliori per MOTA, IDF1, DetA e FPS.

Robustezza in condizioni di perturbazione controllate

Sono stati condotti esperimenti di perturbazione controllata per esaminare la stabilità di JerseyTrack in presenza di comuni disturbi visivi e di qualità del rilevamento riscontrati nei video sportivi. Le perturbazioni valutate sono state raggruppate in tre categorie: perturbazione delle caratteristiche semantiche, perturbazione del riquadro di rilevamento e perturbazione ambientale. Le perturbazioni delle caratteristiche semantiche includevano l'occlusione del numero del giocatore, sfocatura dell'immagine, degrado della risoluzione e colori delle maglie simili. Le perturbazioni del riquadro di rilevamento includevano lo spostamento del riquadro delimitatore, fluttuazioni della confidenza di rilevamento e riquadri di rilevamento falsi. Le perturbazioni ambientali includevano rumore simile alla pioggia, degrado simile alla nebbia, illuminazione intensa e interferenza delle ombre. Figura 9 riassume le prestazioni di tracciamento in queste condizioni di perturbazione. Nella perturbazione delle caratteristiche semantiche, le prestazioni di tracciamento sono diminuite all'aumentare del deterioramento della visibilità del numero del giocatore e della qualità del ritaglio. Quando il 40% della regione del numero del giocatore era occlusa, MOTA è diminuito di 3,2 punti percentuali e IDF1 di 5,3 punti percentuali rispetto alla condizione senza perturbazione, mentre l'accuratezza dell'estrazione semantica è rimasta al 86,7%. Questi risultati indicano che i suggerimenti relativi al colore della maglia e al numero del giocatore forniscono informazioni complementari quando un suggerimento semantico diventa meno affidabile. Nella perturbazione del riquadro di rilevamento, il metodo ha mostrato un degrado moderato delle prestazioni piuttosto che un malfunzionamento improvviso. Quando i riquadri di rilevamento sono stati spostati di ±10 pixel e i punteggi di confidenza sono stati perturbati con rumore gaussiano, la diminuzione di MOTA è rimasta inferiore a 3 punti percentuali e l'aumento degli ID entro il 16%. Questa tendenza è coerente con la strategia di associazione guidata dalla confidenza, in cui i rilevamenti a confidenza media e bassa sono elaborati utilizzando vincoli aggiuntivi di associazione, piuttosto che la stessa strategia applicata ai rilevamenti ad alta confidenza.

figure-results-5
Figura 9. Valutazione della robustezza sotto perturbazioni controllate. (A) Variazioni dell'accuratezza nel tracciamento multiplo di oggetti (MOTA), del punteggio F1 di identità (IDF1) e degli scambi di identità (IDs) con l'aumento dell'occlusione del numero sulla maglia. (B) Degrado delle prestazioni in condizioni di interferenza rappresentative. (C) Aumento degli scambi di identità (IDs) sotto diversi tipi di interferenza. (D) Accuratezza nell'estrazione semantica del numero sulla maglia nelle condizioni di perturbazione valutate. Cliccare qui per visualizzare una versione ingrandita di questa figura.

In seguito a perturbazioni ambientali, le riduzioni delle metriche principali di tracciamento sono rimaste al di sotto dei 5 punti percentuali nelle condizioni valutate, e l'accuratezza dell'estrazione semantica è rimasta al 87,2%. L'uso di descrittori cromatici basati sullo spazio HSV ha ridotto la sensibilità ai cambiamenti di illuminazione, mentre il ramo OCR ha mantenuto informazioni utilizzabili sui numeri dei giocatori per un sottoinsieme di ritagli d'immagine sfocati o degradati. Questi risultati indicano che il modulo semantico è rimasto utilizzabile nelle condizioni di perturbazione valutate, sebbene la sua affidabilità continui a dipendere dalla visibilità delle maglie e dalla qualità dei ritagli. Nel complesso, gli esperimenti di perturbazione controllata hanno mostrato che JerseyTrack ha mantenuto prestazioni di tracciamento misurabili sotto le perturbazioni semantiche, di qualità del rilevamento e ambientali valutate. Questi risultati devono essere interpretati nell'ambito dell'intervallo di perturbazione testato. La ridentificazione sistematica fuori campo, l'elevato affollamento dello sfondo e l'occlusione completa a lungo termine non sono state valutate separatamente in questo esperimento e sono discusse come limitazioni nella sezione Discussione.

Analisi della contribuzione del modulo e della discriminazione delle caratteristiche

Il contributo del modulo e la discriminazione delle caratteristiche sono stati ulteriormente analizzati per esaminare in che modo i due componenti proposti hanno influenzato le prestazioni nel tracciamento legato all'identità. L'analisi del contributo del modulo ha utilizzato le quattro varianti del modello definite nell'analisi di ablazione, mentre l'analisi della discriminazione delle caratteristiche ha confrontato le caratteristiche tradizionali di Re-ID, le caratteristiche basate solo sul colore, le caratteristiche basate solo sul numero del giocatore e le caratteristiche semantiche fuse della maglia. Il rapporto tra distanza inter-classe e distanza intra-classe è stato utilizzato per descrivere la separabilità delle caratteristiche, con valori più elevati che indicano una maggiore separazione tra identità diverse rispetto alla variazione all'interno della stessa identità. Tabella 2 riassume l'analisi del contributo del modulo. Nella valutazione complessiva, il contributo stimato della strategia di associazione guidata dalla confidenza è stato del 41,7%, il contributo stimato della fusione semantica della maglia è stato del 47,6% e il restante 10,7% è stato attribuito all'uso combinato dei due componenti. Questi valori indicano che entrambi i componenti hanno contribuito al miglioramento osservato, mentre la configurazione completa ha tratto beneficio dall'uso combinato piuttosto che dall'impiego di un singolo componente. Il modello di contributo variava a seconda del tipo di scena. In caso di forti occlusioni, il contributo stimato della fusione semantica della maglia è aumentato al 69,4%, il che è coerente con l'affidabilità ridotta dei segnali di movimento quando gli atleti erano parzialmente o temporaneamente occlusi. Durante movimenti ad alta velocità, il contributo stimato dell'associazione guidata dalla confidenza ha raggiunto il 44,3% e il guadagno combinato ha raggiunto il 20,6%, indicando che la partizione in base al livello di confidenza diventava più rilevante quando la confidenza del rilevamento oscillava a causa del movimento rapido o dell'incertezza nella localizzazione.

Variante del modelloScenario di testMOTA↑IDF1↑IDs↓Contributo del moduloGuadagno sinergico
V0 (Baseline)Scena complessiva83,567,23245
Scene fortemente occluse77,861,53862
Scena con movimento ad alta velocità77,162,33689
V1 (Associazione guidata dalla confidenza)Scena complessiva86,370,9289341,7
Scene fortemente occluse80,965,9341529,8
Scena con movimento ad alta velocità81,467,9302444,3
V2 (Associazione semantica della maglia)Scena complessiva85,271,8293747,6
Scene fortemente occluse82,772,8275369,4
Scena con movimento ad alta velocità80,166,8315735,1
V3 (JerseyTrack completo)Scena complessiva88,974,3276810,7
Scene fortemente occluse84,975,626890,8
Scena con movimento ad alta velocità83,671,5284220,6

Tabella 2: Analisi di ablazione dei contributi dei moduli. Confronto delle prestazioni di diverse varianti del modello JerseyTrack nei casi generali, con forte occlusione e con movimento ad alta velocità. Vengono riportati l'accuratezza nel tracciamento di oggetti multipli (MOTA), il punteggio F1 di identità (IDF1) e il numero di cambiamenti di identità (IDs), insieme al contributo stimato del modulo e al guadagno sinergico. Valori più elevati indicano prestazioni migliori per MOTA, IDF1, contributo del modulo e guadagno sinergico, mentre valori più bassi indicano prestazioni migliori per IDs.

Tabella 3 riassume l'analisi di discriminazione delle caratteristiche. La caratteristica semantica fusa della maglietta ha raggiunto un rapporto tra distanza inter-classe e intra-classe di 5,63, rispetto a 1,82 delle caratteristiche Re-ID tradizionali, corrispondente a un miglioramento relativo del 209,3% nella misura del rapporto tra distanze. Le caratteristiche basate solo sul colore o solo sul numero del giocatore hanno anch'esse migliorato la separabilità delle caratteristiche rispetto alle caratteristiche Re-ID tradizionali, sebbene ciascun singolo indizio rimanesse suscettibile a specifici casi di errore, inclusi colori delle squadre simili, occlusione del numero del giocatore, sfocatura dovuta al movimento e aree della maglietta illeggibili. Tra le rappresentazioni di caratteristiche valutate, la rappresentazione semantica fusa ha ottenuto la maggiore separabilità e si è associata al valore più alto di IDF1 e al conteggio ID più basso osservato nell'analisi di ablazione. Questi risultati sostengono l'utilizzo di indizi semantici specifici della maglietta come informazione identitaria complementare nel tracking multi-oggetto in ambito sportivo (sports MOT), quando gli atleti hanno aspetti simili e l'informazione sul movimento da sola non è sufficiente. Tali osservazioni sono limitate all'ambiente SportsMOT valutato e non devono essere interpretate come prova che la semantica delle magliette risolva ogni ambiguità identitaria in tutti i video sportivi.

Tipo di caratteristicaRapporto tra distanza inter-classe/intra-classeMiglioramento relativo (%)IDF1↑IDs↓
Caratteristiche Re-ID tradizionali1.8265.73482
Caratteristiche del colore della squadra3.1774.269.83125
Caratteristiche del numero del giocatore3.4991.870.53018
Caratteristiche semantiche fuse della maglia5.63209.374.32768

Tabella 3: Analisi di discriminazione di diverse rappresentazioni delle caratteristiche. Confronto della discriminazione delle caratteristiche mediante l'uso di caratteristiche tradizionali di ri-identificazione (Re-ID), caratteristiche del colore della maglia, caratteristiche del numero del giocatore e caratteristiche semantiche fuse. Sono riportati il rapporto tra distanza inter-classe/intra-classe, il miglioramento relativo nella discriminazione delle caratteristiche, il punteggio F1 di identità (IDF1) e il numero di cambi di identità (IDs). Valori più elevati indicano una prestazione migliore per il rapporto di distanza, il miglioramento relativo e l'IDF1, mentre valori più bassi indicano una prestazione migliore per gli IDs.

Confronto di riferimento con i metodi MOT esistenti

È stato effettuato un confronto di riferimento per mettere a confronto JerseyTrack con metodi MOT rappresentativi nello stesso contesto di validazione SportsMOT. I metodi confrontati includevano QDTrack, DeepSORT, ByteTrack, FairMOT, Deep OC-SORT e MOTR. Tutti i metodi hanno utilizzato gli stessi output del rilevatore generati dal framework del rilevatore elencato nella Tabella dei Materiali, in modo che il confronto si concentrasse sulle prestazioni di associazione del tracciamento piuttosto che sulle variazioni del rilevatore. La valutazione ha utilizzato le metriche definite nella Sezione 7 del Protocollo . Le metriche principali di valutazione includevano MOTA, HOTA e IDF1. Le metriche secondarie includevano DetA, AssA, FPs, FNs e IDs. Tabella 4 riassume il confronto quantitativo sulla suddivisione di validazione SportsMOT, e Figura 10 presenta un confronto visivo dell'accuratezza del tracciamento, della velocità di inferenza e della distribuzione di HOTA nei diversi scenari sportivi valutati. JerseyTrack ha ottenuto il valore più alto di MOTA tra i metodi confrontati, raggiungendo l'88,9%. Questo valore era di 1,1 punti percentuali superiore rispetto a quello di Deep OC-SORT (87,8%) e di 2,5 punti percentuali superiore rispetto a ByteTrack (86,4%). Nel contesto di validazione SportsMOT valutato, JerseyTrack ha quindi ottenuto l'accuratezza complessiva più elevata tra i metodi confrontati. Per quanto riguarda HOTA, JerseyTrack ha raggiunto il 69,9%, rispetto al 64,4% di Deep OC-SORT e al 62,8% di ByteTrack. Queste differenze corrispondono a miglioramenti rispettivamente di 5,5 e 7,1 punti percentuali, indicando un equilibrio maggiore tra prestazioni di rilevamento e di associazione nello stesso contesto di valutazione.

MetodoMOTA↑HOTA↑IDF1↑DetA↑AssA↑FP↓FN↓IDs↓
QDTrack75.953.751.665.639.796,32489,8718,216
DeepSORT77.654.153.267.34476,22886,3196,836
ByteTrack86.462.867.773.850.933,75278,6984,192
FairMOT84.154.762.577.847.845,18783,6204,817
Deep OC-SORT87.864.469.978.252.125,01274,3853,211
MOTR82.957.258.468.946.154,93185,0635,137
JerseyTrack88.969.974.380.254.321,95367,1602,768

Tabella 4: Confronto delle prestazioni di JerseyTrack e di metodi rappresentativi di tracciamento multi-oggetto sul sottoinsieme di convalida di SportsMOT. Confronto di JerseyTrack con metodi rappresentativi di tracciamento multi-oggetto (MOT) sul dataset di convalida di SportsMOT. Le metriche riportate includono l'accuratezza del tracciamento multi-oggetto (MOTA), l'accuratezza del tracciamento di ordine superiore (HOTA), il punteggio F1 di identità (IDF1), l'accuratezza del rilevamento (DetA), l'accuratezza dell'associazione (AssA), i falsi positivi (FP), i falsi negativi (FN) e il numero di cambiamenti di identità (IDs). Valori più elevati indicano prestazioni migliori per MOTA, HOTA, IDF1, DetA e AssA, mentre valori più bassi indicano prestazioni migliori per FP, FN e IDs.

figure-results-6
Figura 10. Confronto delle prestazioni con metodi rappresentativi di tracciamento multi-oggetto. (A) Confronto dell'accuratezza nel tracciamento di più oggetti (MOTA) e dei fotogrammi al secondo (FPS) per JerseyTrack e per metodi rappresentativi di tracciamento multi-oggetto valutati sul dataset SportsMOT. (B) Distribuzione dell'accuratezza di tracciamento di ordine superiore (HOTA) tra i metodi di tracciamento valutati. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Per la preservazione dell'identità, JerseyTrack ha raggiunto un IDF1 del 74,3%, rispetto al 69,9% di Deep OC-SORT e al 67,7% di ByteTrack. JerseyTrack ha inoltre registrato 2.768 ID, meno dei 3.211 ID registrati da Deep OC-SORT e dei 4.192 ID registrati da ByteTrack. Queste osservazioni sono coerenti con i risultati dell'analisi per esclusione presentati in Figura 8  e Tabella 2, nei quali la configurazione completa di JerseyTrack ha ridotto gli scambi di identità rispetto alle varianti del modello di riferimento. Per quanto riguarda la qualità di rilevamento e associazione, JerseyTrack ha ottenuto un DetA del 80,2% e un AssA del 54,3%. Rispetto a Deep OC-SORT, JerseyTrack ha migliorato il DetA di 2,0 punti percentuali e l'AssA di 2,2 punti percentuali. JerseyTrack ha prodotto anche meno FP e FN rispetto agli altri metodi confrontati riportati in Tabella 4, registrando 21.953 FP e 67.160 FN. Nel complesso, il confronto tramite benchmark ha mostrato che JerseyTrack ha ottenuto i valori più elevati per le metriche principali di tracciamento tra i metodi valutati nel contesto di validazione SportsMOT. Questi risultati sono coerenti con i miglioramenti osservati nella preservazione dell'identità e nella stabilità dell'associazione ottenuti utilizzando l'associazione guidata dalla confidenza e la fusione semantica delle maglie. Il confronto è limitato agli output del rilevatore condivisi e alla configurazione di validazione SportsMOT utilizzata in questo studio.

Risultati della sensibilità dei parametri

È stata condotta un'analisi della sensibilità dei parametri per esaminare come i parametri chiave di implementazione influenzassero le prestazioni di tracciamento nel contesto di validazione SportsMOT. Sono stati valutati tre parametri: il coefficiente di ponderazione della perdita OCR (γ), il numero di cluster gerarchici per livello di confidenza (K) e il tasso di apprendimento della rete OCR (η). Tabella 5 riassume i valori di MOTA, IDF1, HOTA e ID ottenuti con diverse impostazioni dei parametri.

ParametroValoreMOTA↑IDF1↑HOTA↑IDs↓
Peso della perdita OCR (γ)0.284.769.466.22,944
0.486.371.568.22,893
0.687.973.168.92,815
0.8 (ottimale)88.974.369.92,768
188.273.869.32,792
Numero di cluster di confidenza (K)286.772.168.52,876
3 (ottimale)88.974.369.92,768
488.173.669.72,803
587.372.869.22,851
Tasso di apprendimento OCR (η)1 × 10⁻⁴85.970.867.32,934
5 × 10⁻⁴87.672.768.72,832
1 × 10⁻³ (ottimale)88.974.369.92,768
5 × 10⁻³87.873.2692,817
1 × 10⁻²86.571.668.72,889

Tabella 5: Analisi della sensibilità dei parametri. Prestazioni di tracciamento ottenute utilizzando diverse impostazioni dei parametri per JerseyTrack. Sono riportati l'Accuratezza del Tracciamento di Oggetti Multipli (MOTA), il punteggio F1 di Identità (IDF1), l'Accuratezza del Tracciamento di Ordine Superiore (HOTA) e il numero di cambiamenti di identità (IDs) per diversi valori del coefficiente di ponderazione della perdita di Riconoscimento Ottico dei Caratteri (OCR) (γ), del numero di cluster di confidenza (K) e della velocità di apprendimento OCR (η). I valori dei parametri identificati come ottimali corrispondono alle impostazioni utilizzate negli esperimenti descritti. Valori più elevati indicano prestazioni migliori per MOTA, IDF1 e HOTA, mentre valori più bassi indicano prestazioni migliori per IDs.

Per il coefficiente di ponderazione della perdita OCR (γ), le migliori prestazioni valutate sono state ottenute con γ = 0,8. In queste condizioni, JerseyTrack ha raggiunto un valore MOTA del 88,9%, un IDF1 del 74,3%, un HOTA del 69,9% e 2.768 ID. Quando γ è stato ridotto a 0,2, i valori MOTA, IDF1 e HOTA sono diminuiti rispettivamente all'84,7%, al 69,4% e al 66,2%, mentre il numero di ID è aumentato a 2.944. Quando γ è stato aumentato a 1,0, le metriche di prestazione sono leggermente diminuite rispetto a γ = 0,8, con un MOTA dell'88,2%, un IDF1 del 73,8%, un HOTA del 69,3% e 2.792 ID. Questi risultati indicano che una supervisione OCR insufficiente ha ridotto la capacità di discriminare i numeri dei giocatori, mentre l'aumento del coefficiente di ponderazione della perdita OCR oltre il valore ottimale valutato non ha migliorato le prestazioni di tracciamento nelle condizioni testate.

Per il numero gerarchico di cluster in base al livello di confidenza (K), la prestazione migliore è stata ottenuta con K = 3. Questa impostazione corrisponde alla strategia di associazione ad alta, media e bassa confidenza descritta nel metodo. Quando K = 2, la partizione per livelli di confidenza risultava meno granulare e MOTA, IDF1 e HOTA diminuivano rispettivamente all'86,7%, al 72,1% e al 68,5%. Quando K aumentava a 4 o 5, le prestazioni diminuivano ulteriormente rispetto a K = 3, suggerendo che una partizione eccessiva suddivideva i rilevamenti in gruppi di confidenza troppo ristretti, riducendo la stabilità della strategia di associazione. Questi risultati sostengono l'utilizzo di tre livelli di confidenza nella configurazione di JerseyTrack valutata.

Per il tasso di apprendimento della rete OCR (η), le migliori prestazioni valutate sono state ottenute con η = 1 × 10-3. Con un tasso di apprendimento inferiore di 1 × 10-4, MOTA, IDF1 e HOTA sono diminuiti rispettivamente all'85,9%, al 70,8% e al 67,3%, mentre il numero di ID è aumentato a 2.934. Con un tasso di apprendimento superiore di 1 × 10-2, MOTA, IDF1 e HOTA sono diminuiti rispettivamente all'86,5%, al 71,6% e al 68,7%, mentre il numero di ID è aumentato a 2.889. Questi risultati indicano che il ramo OCR era sensibile alla scelta del tasso di apprendimento, con 1 × 10-3 che ha fornito il miglior equilibrio tra riconoscimento del numero dei giocatori e mantenimento dell'identità nelle condizioni valutate.

Complessivamente, Tabella 5 mostra che la combinazione di parametri γ = 0.8, K = 3 e η = 1 × 10-3 ha prodotto i valori più elevati di MOTA, IDF1 e HOTA, insieme al numero più basso di ID. L'analisi di sensibilità ha inoltre mostrato che scostamenti moderati da questi valori dei parametri determinano cambiamenti misurabili, ma non bruschi, nelle prestazioni di tracciamento. Di conseguenza, queste impostazioni dei parametri sono state utilizzate per il confronto di riferimento e per i principali esperimenti di validazione di SportsMOT riportati in questo studio.

Disponibilità dei dati

I riepiloghi grezzi delle valutazioni, gli output finali del tracciamento, i record ambientali, i file di mappatura del dataset e i file intermedi di riepilogo che supportano i risultati di questo studio sono disponibili in un archivio pubblico all'indirizzo https://doi.org/10.5281/zenodo.21274353. I dataset pubblici originali utilizzati come riferimento in questo studio, inclusi SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 e MOT20, sono disponibili dai rispettivi fornitori e non vengono ridistribuiti nell'archivio.

Discussione

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Questo studio ha valutato un flusso di lavoro per il MOT sportivo guidato dalla confidenza, che combina la partizione basata sulla confidenza del rilevamento con indizi semantici delle maglie. L'associazione guidata dalla confidenza e la fusione delle caratteristiche semantiche sono state analizzate come strategie complementari per migliorare l'associazione dei dati nel multi-object tracking12,20,23,24,46. I risultati mostrano che la configurazione completa di JerseyTrack ha migliorato la conservazione dell'identità e la stabilità dell'associazione nel contesto di validazione SportsMOT valutato. Il risultato principale della validazione SportsMOT ha raggiunto un MOTA del 88,9%, un HOTA del 69,9%, un IDF1 del 74,3%, un DetA dell'80,2% e un AssA del 54,3%. Questi valori devono essere interpretati alla luce della sorgente dell'output del rilevatore, della suddivisione del dataset e della configurazione di TrackEval descritte nel Protocollo.

Un passaggio critico nel flusso di lavoro è la partizione per livello di confidenza, che consente di applicare diverse strategie di associazione in base all'affidabilità degli output del rilevatore20,22,23,24. Separando i rilevamenti in gruppi ad alta, media e bassa confidenza, JerseyTrack applica regole di associazione diverse ai rilevamenti con diversi livelli di affidabilità. I rilevamenti ad alta confidenza vengono associati principalmente in base alla coerenza del movimento, mentre quelli a media confidenza utilizzano insieme movimento e semantica della maglia. I rilevamenti a bassa confidenza non vengono utilizzati per inizializzare nuove traiettorie e sono considerati soltanto durante il recupero delle traiettorie. Questa progettazione ha ridotto il rischio che rilevamenti deboli o falsi positivi generassero identità instabili, pur permettendo ai rilevamenti parziali di contribuire al recupero quando ulteriore evidenza semantica era disponibile8,11,20. Il secondo passaggio critico è l'estrazione della semantica della maglia. Le caratteristiche del colore della maglia forniscono un vincolo a livello di squadra, mentre le caratteristiche del numero del giocatore forniscono un indizio identitario più preciso quando la zona del numero è visibile e leggibile35,41,42,43. I risultati delle analisi di ablazione indicano che questi indizi sono particolarmente utili nei casi di interazione ravvicinata tra giocatori della stessa squadra e di occultamento, in cui l'associazione basata solo sul movimento è meno affidabile. Tuttavia, la semantica della maglia deve essere considerata come evidenza ausiliaria e non come sostituto completo dell'associazione basata sul movimento. I numeri dei giocatori possono risultare illeggibili in caso di sfocatura, troncamento, posa posteriore, occultamento grave o bassa risoluzione dell'immagine. Inoltre, le caratteristiche del colore della squadra non riescono a distinguere gli atleti appartenenti alla stessa squadra quando l'informazione sul numero non è disponibile35,42,43. I risultati su dataset diversi chiariscono ulteriormente l'ambito di applicazione del metodo. JerseyTrack si è trasferito in modo più naturale a dataset di sport di squadra rispetto a dataset generali di tracciamento di pedoni (MOT), poiché il ramo semantico è stato progettato attorno agli indizi del colore della maglia e del numero del giocatore19,33,34,35,36,37. Su dataset MOT generali, il componente di associazione guidata dalla confidenza rimane applicabile, ma il ramo semantico specifico per gli sport contribuisce con minori informazioni identitarie. Pertanto, il metodo è particolarmente adatto a video di sport di squadra in cui gli atleti indossano uniformi distinguibili e la zona della maglia è sufficientemente visibile per l'estrazione semantica19,33,34,35,36,37.

Permangono diverse limitazioni. In primo luogo, il metodo dipende dalla qualità degli output del rilevatore; rilevamenti gravemente mancati o box delimitatori inaccurati riducono l'affidabilità sia della previsione del movimento che del ritaglio semantico14,17,46. In secondo luogo, nel presente implementazione non è stata ottimizzata separatamente la ridentificazione a lungo termine quando il soggetto è fuori campo. Quando un atleta esce dall'inquadratura per un periodo prolungato e successivamente rientra, la strategia attuale di recupero della traiettoria potrebbe non essere sufficiente a ripristinare l'identità originale19,34. In terzo luogo, un forte disturbo dello sfondo, giocatori sovrapposti, sfocature di movimento e numeri sulle maglie illeggibili possono ridurre l'affidabilità delle caratteristiche semantiche14,35,42,46. In quarto luogo, la valutazione attuale si è concentrata su dataset pubblici di riferimento e su configurazioni di perturbazione controllate; il deployment in video trasmessi, con tagli della telecamera, variazioni di zoom e punti di vista non standard, potrebbe richiedere ulteriori moduli di preelaborazione o di ridentificazione19,33,34.

L'implicazione pratica principale è che l'associazione guidata dalla confidenza e gli indizi semantici specifici della maglia possono essere integrati in una pipeline modulare di MOT senza modificare la struttura del rilevatore. Questa capacità è applicabile a compiti di analisi sportiva come l'estrazione delle traiettorie degli atleti, l'analisi dei movimenti della squadra, la revisione degli eventi tattici e l'annotazione video semi-automatica1,4,33,36. I futuri sviluppi dovrebbero concentrarsi su un'identificazione più solida fuori dal campo visivo, sulla gestione del rumore di fondo, sull'aggregazione delle caratteristiche temporali e su un riconoscimento più robusto del numero dei giocatori in condizioni di forte sfocatura o occlusione14,19,34,46.

In sintesi, JerseyTrack è un metodo MOT per lo sport che combina l'associazione guidata dalla confidenza con la fusione semantica delle maglie. Il metodo suddivide i rilevamenti in gruppi ad alta, media e bassa confidenza e applica regole di associazione diverse in base all'affidabilità dei rilevamenti, utilizzando al contempo il colore della maglia e il numero del giocatore come informazioni ausiliarie sull'identità durante l'associazione a confidenza media e il recupero delle traiettorie. Nell'ambito dell'impostazione di validazione SportsMOT valutata, JerseyTrack ha dimostrato un miglioramento dell'accuratezza del tracciamento e della conservazione dell'identità rispetto alle configurazioni di base valutate. I risultati dell'analisi per sottrazione hanno mostrato che la configurazione completa riduce gli scambi di identità rispetto alla configurazione di base e alle varianti con singolo modulo, mentre il confronto con i benchmark ha evidenziato valori più elevati per le metriche principali di tracciamento nell'ambito della stessa configurazione di uscita del rilevatore e di valutazione. Questi risultati avvalorano l'utilizzo dell'informazione sui livelli di confidenza e di indizi semantici specifici della maglia per il tracciamento degli atleti nei video di sport di squadra, in particolare quando le aree delle maglie sono visibili e le informazioni sul colore della squadra o sul numero del giocatore forniscono ulteriore evidenza identitaria20,35,46. Affrontare le limitazioni individuate potrebbe ulteriormente migliorare l'applicabilità del flusso di lavoro proposto a scenari di tracciamento sportivo più complessi.

Dichiarazioni

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori dichiarano di non avere conflitti di interessi finanziari.

Ringraziamenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,

Gli autori non hanno ringraziamenti da dichiarare.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
CUDA RuntimeNVIDIAVersione 12.8Runtime di calcolo GPU utilizzato per l'addestramento del rilevatore, l'estrazione di caratteristiche semantiche e l'inferenza del tracciamento.
EasyOCRJaided AIVersione 1.7.2Kit di strumenti per il riconoscimento ottico dei caratteri utilizzato per il riconoscimento dei numeri dei giocatori.
Codice sorgente di JerseyTrackAutoriN/DImplementazione personalizzata contenente gli script per la preparazione dei dati, l'estrazione di caratteristiche semantiche, la partizione di confidenza, il tracciamento, la post-elaborazione e la valutazione. Disponibile all'indirizzo: https://doi.org/10.5281/zenodo.21274352
Modello OCR CRNN leggeroAutoriN/DReti neurali convoluzionali ricorrenti personalizzate (CRNN) utilizzate per il riconoscimento dei numeri dei giocatori.
Dataset MOT17MOTChallengeN/DDataset pubblico di riferimento utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://motchallenge.net/data/MOT17/
Dataset MOT20MOTChallengeN/DDataset pubblico di riferimento utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://motchallenge.net/data/MOT20/
motmetricsSviluppatori di motmetricsVersione 1.4.0Libreria utilizzata per il calcolo delle metriche diagnostiche di tracciamento multi-oggetto.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Unità di elaborazione grafica utilizzata per l'addestramento del rilevatore e l'inferenza del tracciamento.
Driver GPU NVIDIANVIDIAVersione 610.62Driver GPU utilizzato nell'ambiente sperimentale.
NumPySviluppatori di NumPyVersione 2.4.4Libreria di calcolo numerico utilizzata per l'elaborazione delle caratteristiche e la gestione dei dati.
OpenCVOpenCVVersione 4.10.0Libreria di visione artificiale utilizzata per il caricamento, il ritaglio, la pre-elaborazione e la visualizzazione delle immagini.
PythonFondazione Python SoftwareVersione 3.12.2Linguaggio di programmazione utilizzato in tutto il flusso di lavoro.
PyTorchFondazione PyTorchVersione 2.11.0+cu128Framework di apprendimento profondo utilizzato per l'implementazione del rilevatore e del modello semantico.
scikit-learnSviluppatori di scikit-learnVersione 1.9.0Libreria di apprendimento automatico utilizzata per il clustering K-means durante l'estrazione del colore della maglia e la partizione di confidenza.
Dataset SoccerNet TrackingSoccerNetN/DBenchmark pubblico per il tracciamento del calcio utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://www.soccer-net.org/tasks/tracking
Dataset SportsMOTBenchmark SportsMOTN/DDataset principale di riferimento utilizzato per la preparazione del rilevatore e la valutazione del tracciamento. Disponibile da: https://deeperaction.github.io/datasets/sportsmot.html
Dataset TeamTrackBenchmark TeamTrackN/DBenchmark pubblico per il tracciamento sportivo utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://atomscott.github.io/TeamTrack/
TorchvisionFondazione PyTorchVersione 0.26.0+cu128Libreria di visione artificiale utilizzata con PyTorch per le trasformazioni delle immagini e il supporto ai modelli.
TrackEvalSviluppatori di TrackEvalVersione 1.3.0Kit di strumenti di valutazione utilizzato per calcolare l'accuratezza del tracciamento multi-oggetto (MOTA), il punteggio F1 di identità (IDF1), l'accuratezza del tracciamento di ordine superiore (HOTA), l'accuratezza del rilevamento (DetA), l'accuratezza dell'associazione (AssA), i falsi positivi (FP), i falsi negativi (FN) e i cambi di identità (IDs).
UltralyticsUltralyticsVersione 8.4.90Framework di rilevamento oggetti utilizzato per addestrare il rilevatore e generare i rilevamenti degli atleti.

Riferimenti

Loading...
$$\rightleftharpoonup{xx}$$ $$\longleftharp{xx}$$, $$\longrightharp{xx}$$,
  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Ristampe e permessi

Richiedi il permesso di riutilizzare il testo o le figure di questo articolo JoVE

Richiedi permesso

Tag

Tracciamento guidato dalla confidenzatraiettoria del giocatoresomiglianza del movimentocolore della magliariconoscimento ottico dei carattericoerenza dell identitdataset SportsMOT

Articoli correlati