È richiesta un abbonamento a JoVE per visualizzare questo contenuto. Accedi o inizia la tua prova gratuita.

Articolo metodologico

Un metodo di tracciamento multi-oggetto guidato dalla confidenza per video sportivi mediante fusione semantica delle maglie

40 visualizzazioni

DOI:

10.3791/71557

14 agosto 2026

In questo articolo

Sommario

Questo protocollo descrive un flusso di lavoro per il tracciamento multi-oggetto guidato dalla confidenza applicato a video sportivi, che integra le informazioni sul colore della maglia e sul numero del giocatore per migliorare l'associazione delle traiettorie e la coerenza dell'identità in presenza di fluttuazioni della confidenza, occlusioni e aspetti visivi simili tra gli atleti.

Abstract

Il Multi-Object Tracking (MOT) nei video sportivi fornisce informazioni sulle traiettorie utili per l'analisi tattica, l'interpretazione del comportamento dei giocatori e l'analisi statistica automatizzata. Tuttavia, negli scenari sportivi si verificano spesso cambiamenti rapidi di direzione, arresti bruschi, occlusioni frequenti e compagni di squadra con aspetto visivo simile, causando fluttuazioni nella fiducia del rilevamento e confusione d'identità durante l'associazione tra fotogrammi. Per affrontare queste sfide, questo studio presenta JerseyTrack, un metodo di MOT sportivo guidato dalla fiducia basato sulla fusione semantica della maglia. Il flusso di lavoro suddivide in modo adattivo le box di rilevamento in intervalli di alta, media e bassa fiducia in base alla distribuzione della fiducia di ciascun fotogramma. I rilevamenti ad alta fiducia vengono associati principalmente in base alla similarità del movimento, mentre per quelli a media e bassa fiducia si integrano ulteriormente caratteristiche relative al colore della maglia e al numero del giocatore, estratte tramite clustering del colore e un modello leggero di riconoscimento ottico dei caratteri (OCR). Queste caratteristiche semantiche vengono fuse con le informazioni sul movimento durante l'abbinamento supplementare per migliorare la continuità delle traiettorie e la coerenza d'identità. Il metodo è stato valutato sul dataset SportsMOT. JerseyTrack ha raggiunto un'accuratezza del 88,9% nel Multiple Object Tracking Accuracy (MOTA), un punteggio F1 d'identità (IDF1) del 74,3% e un'accuratezza del 69,9% nel Higher Order Tracking Accuracy (HOTA), dimostrando prestazioni migliorate nel contesto di tracciamento sportivo valutato. Questo protocollo fornisce un flusso di lavoro riproducibile per integrare l'associazione guidata dalla fiducia con informazioni semantiche sulla maglia al fine di migliorare il multi-object tracking nei video sportivi.

Introduzione

Il tracciamento multi-oggetto (MOT) fornisce un localizzazione continua degli oggetti e il mantenimento dell'identità in sequenze video, supportando l'estrazione delle traiettorie degli atleti, l'analisi tattica e l'analisi statistica automatizzata in applicazioni basate su video sportivi1,2,3. Informazioni visive affidabili sono inoltre correlate al processo decisionale specifico dello sport e alla valutazione della prestazione nella scienza dello sport, sottolineando ulteriormente il valore dei dati di movimento stabili derivati dai video per analisi sportive successive4. Negli scenari sportivi, l'affidabilità dei dati tattici dipende dalla continuità delle traiettorie di tracciamento e dalla coerenza delle identità degli obiettivi.

Rispetto agli scenari generali di MOT, i video sportivi contengono rapidi cambi di direzione, arresti bruschi, salti, interazioni fitte e occlusioni frequenti. Questi fattori provocano notevoli fluttuazioni nella confidenza delle scatole di rilevamento e aumentano la frequenza dei rilevamenti a bassa confidenza, che possono interrompere l'associazione delle traiettorie5,6. Le uniformi di squadra uniformi riducono ulteriormente la capacità discriminante delle caratteristiche d'aspetto generali e aumentano la confusione d'identità tra compagni di squadra visivamente simili7,8. Quando occlusione e somiglianza d'aspetto si verificano nella stessa sequenza, la confidenza del rilevamento diminuisce e le informazioni sull'aspetto del bersaglio diventano incomplete, aumentando la difficoltà nell'associazione delle traiettorie e nel mantenimento dell'identità9,10. Nel MOT, il re-identificazione (Re-ID) indica il processo di associazione della stessa identità del bersaglio tra fotogrammi, periodi di occlusione o casi di reingresso, utilizzando evidenze visive legate all'identità. Nei video sportivi di squadra, gli indizi generali di Re-ID possono risultare indeboliti poiché gli atleti della stessa squadra spesso condividono uniformi e aspetti fisici simili. La revisione della letteratura tecnica indica che la frammentazione delle traiettorie e la confusione d'identità nel MOT sportivo sono generalmente affrontate attraverso due approcci complementari: l'utilizzo della confidenza del rilevamento e il potenziamento degli indizi d'identità. JerseyTrack si colloca all'intersezione di questi approcci regolando l'uso degli indizi semantici delle maglie in base alla qualità del rilevamento, piuttosto che applicare in modo uniforme informazioni sul colore e sul numero del giocatore a tutti i rilevamenti.

Questo studio presenta JerseyTrack, un metodo MOT sportivo guidato dalla confidenza, basato sulla fusione semantica delle maglie. Il metodo è progettato per video di sport di squadra in cui gli atleti indossano maglie visibili e i risultati del rilevamento forniscono box delimitatori con punteggi di confidenza. JerseyTrack combina quattro componenti principali: rilevamento degli atleti, partizionamento per livello di confidenza, estrazione di caratteristiche semantiche delle maglie e associazione inter-frame a cascata. La confidenza del rilevamento viene utilizzata per partizionare in modo adattivo i rilevamenti in gruppi ad alta, media e bassa confidenza, che vengono elaborati mediante diverse strategie di associazione. I rilevamenti ad alta confidenza vengono associati principalmente attraverso informazioni di movimento, mentre quelli a media e bassa confidenza integrano ulteriormente informazioni sul colore della maglia e sul numero del giocatore per migliorare il mantenimento dell'identità quando le evidenze visive sono deboli. Il metodo è destinato a compiti di analisi video sportivi che richiedono traiettorie stabili degli atleti, come l'analisi tattica e l'interpretazione del comportamento dei giocatori.

L'approccio proposto presenta anche limitazioni operative. L'estrazione semantica della maglia può essere influenzata da forti occlusioni, sfocature dovute al movimento, bassa risoluzione delle immagini, pose anomale della maglia o numeri dei giocatori non visibili. In questi casi, gli indizi semantici basati sulla maglia possono risultare incompleti, e il processo di associazione si basa maggiormente sulla coerenza del movimento e sulla verifica multi-frame. Pertanto, le affermazioni sulle prestazioni di questo studio sono limitate ai dataset valutati e alle condizioni sperimentali adottate. Gli esperimenti effettuati sul dataset SportsMOT mostrano che JerseyTrack migliora le metriche di tracciamento valutate e riduce gli eventi di cambio di identità nelle condizioni di tracciamento sportivo testate. La principale difficoltà del tracciamento multi-oggetto (MOT) nei video sportivi consiste nel mantenere la continuità delle traiettorie e la coerenza dell'identità in presenza di movimenti rapidi, occlusioni e somiglianze nell'aspetto. Gli studi esistenti relativi a JerseyTrack possono essere suddivisi in due direzioni di ricerca principali: l'utilizzo della confidenza del rilevamento per l'associazione delle traiettorie e il potenziamento degli indizi identitari mediante caratteristiche semantiche specifiche dello sport.

L'affidabilità del rilevamento è stata ampiamente utilizzata per stimare l'affidabilità dei box di rilevamento e guidare l'associazione delle traiettorie nel MOT. I primi metodi di tracciamento trattavano solitamente l'affidabilità come un criterio binario di filtraggio, in cui i rilevamenti al di sotto di una soglia fissa venivano rimossi per ridurre i falsi positivi11,12. Questa strategia riduce i rilevamenti rumorosi ma può anche scartare obiettivi reali in caso di occlusione, movimento rapido o bassa qualità dell'immagine, causando frammentazione delle traiettorie13,14,15. Strategie di filtraggio simili hanno inoltre dimostrato che soglie fisse di affidabilità sono sensibili alle variazioni della scena e alla qualità del rilevamento16,17. Per migliorare l'utilizzo dei rilevamenti a bassa affidabilità, ByteTrack ha introdotto una strategia di associazione che mantiene i box a bassa affidabilità come obiettivi candidati per un abbinamento secondario e li collega alle traiettorie esistenti attraverso la similarità del movimento e la cronologia della traiettoria18. McByte estende ulteriormente l'associazione nel MOT sportivo incorporando maschere di segmentazione propagate temporalmente come indicazione per l'associazione, migliorando la robustezza in condizioni di movimento rapido, occlusione e spostamento della telecamera senza ulteriore addestramento per ogni video19. Studi correlati hanno inoltre modificato l'uso dei rilevamenti a bassa affidabilità per mantenere obiettivi deboli ma potenzialmente validi durante l'associazione20,21,22. Le strategie di associazione adattive all'affidabilità hanno successivamente perfezionato i criteri di abbinamento in base alla coerenza del movimento e all'affidabilità del rilevamento23,24,25. Metodi di affinamento delle traiettorie basati sulla regressione dei box di rilevamento e sull'ottimizzazione della regolarità delle traiettorie sono stati anch'essi utilizzati per ridurre la frammentazione delle traiettorie26,27,28. Ulteriori strategie di affinamento forniscono un supporto complementare per mantenere la continuità delle traiettorie in condizioni di movimento complesse29. Il flusso oggetto temporalmente coerente modella ulteriormente la coerenza temporale a livello oggetto tra i fotogrammi, fornendo un altro approccio orientato all'associazione per ridurre l'interruzione delle traiettorie in scenari MOT complessi30. I metodi di fusione dei tracker apprendono anche dagli output di più tracker e utilizzano strategie di selezione o fusione basate sull'apprendimento per migliorare la robustezza del tracciamento su diversi benchmark MOT31. Nel complesso, questi studi indicano che l'associazione consapevole dell'affidabilità aiuta a recuperare traiettorie interrotte; tuttavia, l'affidabilità e gli indizi del movimento forniscono informazioni limitate sull'identità quando i giocatori della stessa squadra hanno aspetti visivi simili. Sebbene questi metodi attenuino efficacemente la frammentazione delle traiettorie in scenari generali, presentano limitazioni intrinseche negli ambienti sportivi poiché i giocatori della stessa squadra spesso hanno aspetti visivi altamente simili, e fare affidamento esclusivamente su informazioni di affidabilità e movimento non può fornire una base sufficiente per la differenziazione dell'identità32,33,34. Anche quando i box a bassa affidabilità vengono recuperati efficacemente, la similarità delle caratteristiche può comunque portare a scambi di identità, rendendo difficile soddisfare i rigorosi requisiti di coerenza identitaria dell'analisi sportiva.

Segnali identitari specifici dello sport sono stati utilizzati anche per migliorare la discriminazione dell'identità nel tracciamento degli atleti. Informazioni semantiche relative alle maglie, come il colore della squadra e il numero del giocatore, forniscono indizi identitari più direttamente collegati agli scenari sportivi rispetto agli embedding di aspetto generale35,36,37. Il colore della maglia è stato utilizzato per supportare la discriminazione a livello di squadra e ridurre la confusione tra squadre diverse, mentre il riconoscimento del numero del giocatore fornisce un indizio identitario più preciso quando la zona del numero è visibile e leggibile38,39. Studi esistenti sul tracciamento sportivo hanno integrato caratteristiche visive specifiche del dominio e il riconoscimento del colore della maglia per migliorare l'associazione tra giocatori in condizioni di affollamento tipiche degli eventi sportivi40,41. Lavori precedenti sul riconoscimento del numero di maglia e sull'uso di dati numerici sintetici ulteriormente supportano la modellizzazione dell'identità in condizioni di bassa risoluzione o parziale occlusione42,43. Questi studi indicano che la semantica delle maglie può rafforzare la rappresentazione dell'identità nel tracciamento multi-oggetto applicato agli sport (MOT). Tuttavia, la maggior parte dei metodi di tracciamento potenziati da informazioni semantiche non modella in modo sufficiente la relazione tra la fiducia nel rilevamento (detection confidence) e la qualità delle caratteristiche semantiche. I rilevamenti ad alta fiducia possono già contenere informazioni spaziali e di aspetto affidabili, rendendo meno efficiente un'ulteriore estrazione semantica. I rilevamenti a bassa fiducia spesso soffrono di occlusione, sfocatura, troncamento o bassa risoluzione, riducendo l'affidabilità degli indizi basati sul colore e sul numero del giocatore. Questa limitazione motiva una progettazione dell'associazione guidata dalla fiducia, in cui la semantica delle maglie viene introdotta in base alla qualità del rilevamento piuttosto che essere applicata uniformemente a tutti i rilevamenti. Gli studi esaminati mostrano che l'associazione consapevole della fiducia e la modellizzazione semantica delle maglie affrontano aspetti diversi del tracciamento multi-oggetto negli sport. Le strategie basate sulla fiducia determinano principalmente se un rilevamento debba partecipare all'associazione e come debba essere abbinato alle traiettorie esistenti, mentre le strategie semantiche basate sulle maglie migliorano principalmente la rappresentazione dell'identità attraverso indizi specifici dello sport. Tuttavia, questi due meccanismi sono spesso progettati come componenti separati. Di conseguenza, gli indizi semantici non vengono sempre adattati in base alla qualità del rilevamento, e i livelli di fiducia non regolano direttamente l'uso delle informazioni sul colore e sul numero del giocatore durante l'associazione. Questa separazione limita la gestione congiunta della frammentazione delle traiettorie e della confusione identitaria nei video di sport di squadra. Il gap di ricerca rimanente consiste nel collegare la valutazione della qualità della fiducia nel rilevamento con l'associazione semantica basata sulle maglie all'interno dello stesso flusso di lavoro di tracciamento.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Protocollo

Questo studio ha coinvolto un'analisi secondaria di dataset video pubblici disponibili, in particolare SportsMOT, TeamTrack, SoccerNet Tracking, MOT17 e MOT20. Non sono stati reclutati partecipanti, non è stata effettuata alcuna intervento e non sono stati raccolti nuovi dati riguardanti soggetti umani. L'approvazione del comitato etico non era richiesta per questo studio secondo i requisiti istituzionali applicabili della Bangkok Thonburi University.

Il seguente protocollo descrive il flusso di lavoro utilizzato per riprodurre JerseyTrack, dalla preparazione dei dati alla valutazione del tracciamento. Il flusso di lavoro comprende la preparazione del dataset, la preparazione del rilevatore, l'estrazione semantica della maglietta, la partizione per livello di confidenza, l'associazione guidata dalla confidenza, l'inferenza del tracciamento e la valutazione delle prestazioni, come riassunto in Figura 1. Il software, i dataset e le risorse hardware necessari sono elencati nella Tabella dei materiali.

Diagramma di estrazione delle caratteristiche della maglia utilizzando caratteristiche di aspetto; previsione dello stato; processo di associazione dei dati.
Figura 1. Flusso di lavoro generale del metodo JerseyTrack. Il flusso di lavoro comprende l'estrazione di caratteristiche semantiche della maglia, l'abbinamento iniziale degli oggetti, un abbinamento supplementare guidato dalla confidenza e la fusione delle caratteristiche. Le caratteristiche relative al colore della squadra e al numero del giocatore vengono estratte dalle regioni degli atleti rilevati e integrate nel processo di associazione per migliorare l'abbinamento delle traiettorie in condizioni di rilevamento incerto. Cliccare qui per visualizzare una versione ingrandita di questa figura.

1. Preparare i set di dati e la struttura delle directory

  1. Scaricare i dataset pubblici di riferimento elencati nella Tabella dei Materiali. Utilizzare SportsMOT come dataset principale per la preparazione del rilevatore e la valutazione del tracciamento. Mantenere TeamTrack, SoccerNet Tracking, MOT17 e MOT20 per la valutazione incrociata tra dataset.
  2. Archiviare tutti i dataset all'interno di una directory di progetto unificata. Assicurarsi che il rilevatore, il modulo di estrazione semantica, il modulo di tracciamento e il toolkit di valutazione utilizzino identificatori di sequenza identici.
  3. Convertire le annotazioni ufficiali di SportsMOT nel formato di addestramento del rilevatore utilizzando lo script di preparazione dati impiegato in questo studio. Eseguire il seguente comando:
    ..\venv\Scripts\python.exe scripts\prepare_data.py --config configs\datasets.local.json --dataset SportsMOT --out data\processed\SportsMOT_yolo --splits train val.
  4. Lo script di preparazione dati (scripts/prepare_data.py) è disponibile nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Le dipendenze software richieste sono specificate nel file environment.yml, inclusi Python 3.12, PyTorch 2.11.0 e OpenCV 4.10 o versioni successive. Configurare l'ambiente software utilizzando il seguente comando: conda env create -f environment.yml. Eseguire lo script di preparazione dati con il seguente comando: python scripts/prepare_data.py --config configs/datasets.local.json --dataset SportsMOT --out data/processed/SportsMOT_yolo --splits train val.
  5. Verificare che la conversione generi il file di configurazione per l'addestramento del rilevatore: data\processed\SportsMOT_yolo\data.yaml e il manifesto della conversione: data\processed\SportsMOT_yolo\conversion_manifest.csv.
    NOTA: In questo studio, il dataset di addestramento e validazione di SportsMOT convertito conteneva 90 sequenze, 55.544 fotogrammi e 608.152 oggetti annotati.
  6. Esaminare alcune sequenze rappresentative per verificare che l'ordine dei fotogrammi, le coordinate dei riquadri di delimitazione e le etichette di identità siano coerenti con le annotazioni originali del benchmark.
  7. Mantenere invariati i file di annotazione convertiti durante tutta la preparazione del rilevatore, l'inferenza del tracciamento e la valutazione, in modo che tutti i metodi utilizzino la stessa partizione del dataset e lo stesso protocollo di valutazione.
    NOTA: Il risultato atteso di questa sezione è una directory standardizzata per l'addestramento del rilevatore SportsMOT contenente le annotazioni convertite, il manifesto della conversione e i file di suddivisione del dataset necessari per la preparazione del rilevatore e la valutazione del tracciamento.

2. Preparare le uscite del rivelatore

  1. Ottimizzare il rilevatore di oggetti utilizzando la suddivisione di addestramento SportsMOT preparata. Ottimizzare il rilevatore utilizzando la perdita di classificazione e la perdita di regressione del bounding box definite nella Equazione 1. Utilizzare la risoluzione di input del rilevatore, la dimensione del batch, il tasso di apprendimento, il numero di epoche di addestramento e gli altri parametri di addestramento riportati nell'ambiente di implementazione e nella Tabella dei Materiali
    Ldet = Lcls + Lbox   (1)
    In questo caso, Ldet  indica la perdita totale del rilevatore, Lcls indica la perdita di classificazione, Lbox  indica la perdita di regressione del bounding box.
    NOTA: Il checkpoint del rilevatore utilizzato negli esperimenti principali (identificativo interno dell'esperimento e3) è stato addestrato utilizzando il framework Ultralytics YOLO con la configurazione del dataset SportsMOT in formato YOLO (data/processed/SportsMOT_yolo/data.yaml). Eseguire l'addestramento del rilevatore utilizzando il seguente comando: yolo detect train data=data/processed/SportsMOT_yolo/data.yaml model=yolo11x.pt epochs=80 imgsz=960 batch=16 lr0=0.01 project=outputs/formal name=checkpoints/detector device=0. Dopo l'addestramento, utilizzare il checkpoint con le prestazioni migliori risultante per generare le uscite del rilevatore per le sequenze di validazione utilizzando il seguente comando: python scripts/formal_detect_yolo.py --dataset-root datasets/SportsMOT/dataset --split val --model outputs/formal/checkpoints/detector/weights/best.pt --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --imgsz 960 --conf 0.05 --device 0 --batch 16.
  2. Salvare il checkpoint del rilevatore addestrato, il corrispondente file di metadati e il log di addestramento dopo l'addestramento.
    NOTA: In questo studio, il checkpoint del rilevatore utilizzato per gli esperimenti formali è stato salvato come:
    outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.pt. Il corrispondente file di metadati è stato salvato come: outputs\formal\checkpoints\detector\sportsmot_yolo11x_i960_e3_best.json. La directory delle uscite del rilevatore utilizzata per gli esperimenti principali di validazione di SportsMOT era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections.
  3. Eseguire il rilevatore addestrato su ciascuna sequenza di validazione per generare i bounding box degli atleti e i punteggi di confidenza. Esportare un file di rilevamento per ogni sequenza contenente l'indice del fotogramma, le coordinate del bounding box, il livello di confidenza del rilevamento e l'etichetta della classe.
    NOTA: Nell'esecuzione di validazione di SportsMOT utilizzata per gli esperimenti principali, una soglia di confidenza pari a 0,05 ha generato 343.990 rilevamenti di atleti.
  4. Ispezionare la directory delle uscite del rilevatore prima dell'inferenza di tracciamento. Verificare che ogni sequenza abbia un file di rilevamento corrispondente, che gli indici dei fotogrammi corrispondano alla sequenza di immagini preparata e che ogni record di rilevamento contenga un punteggio di confidenza.
    NOTA: Il risultato atteso di questa sezione è una directory delle uscite del rilevatore completa, che funge da input per l'estrazione semantica della maglia, la partizione per livello di confidenza e l'associazione di tracciamento.

3. Estrarre le caratteristiche semantiche della maglia

  1. Utilizzare i file di output del rilevatore per ritagliare le regioni degli atleti da ogni fotogramma video. Salvare ogni immagine ritagliata dell'atleta con il suo identificatore di sequenza, indice del fotogramma e indice di rilevamento. Escludere i ritagli non validi con contenuto immagine mancante o box di delimitazione che si estendono al di fuori dei bordi dell'immagine. Mantenere il collegamento tra ogni nome file del ritaglio e il relativo record di rilevamento originale in modo che le caratteristiche semantiche estratte possano essere associate al rilevamento corrispondente durante l'associazione nel tracciamento.
  2. Estrarre le caratteristiche del colore della maglia dalle immagini ritagliate degli atleti utilizzando lo script di estrazione semantica impiegato in questo studio.
    NOTA: Gli script di estrazione delle caratteristiche semantiche (scripts/extract_fast_color_semantics.py e scripts/formal_extract_semantics.py) sono disponibili nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Non è richiesto alcun file di configurazione separato; tutti i parametri di esecuzione vengono forniti tramite argomenti da riga di comando.
    Generare descrittori del colore della maglia utilizzando il seguente comando: python scripts/extract_fast_color_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color. Generare le caratteristiche semantiche del numero del giocatore utilizzando il modello OCR con il seguente comando: python scripts/formal_extract_semantics.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --frames-root datasets/SportsMOT/dataset/val --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_ocr. I descrittori del colore della maglia generati e le uscite di probabilità del numero del giocatore sono collegati tramite identificatore di sequenza e combinati nei file delle caratteristiche semantiche utilizzati durante l'associazione nel tracciamento.
  3. Convertire ogni immagine ritagliata dell'atleta nello spazio colore Hue, Saturation, Value (HSV). Estrarre i pixel in primo piano dalla regione della maglia e riassumere il colore dominante della maglia utilizzando il clustering K-means con K = 3. Normalizzare il descrittore del colore risultante utilizzando la normalizzazione L2 prima del confronto delle caratteristiche.
  4. Addestrare il ramo di riconoscimento del numero del giocatore utilizzando immagini ritagliate degli atleti con una dimensione di ingresso di 128 × 64 pixel. Generare etichette pseudo-pseudo del numero del giocatore utilizzando la procedura di etichettatura debolmente supervisionata impiegata in questo studio. Escludere i ritagli con numeri del giocatore invisibili, illeggibili, fortemente occlusi o con regioni a bassa confidenza dal calcolo della perdita OCR (Optical Character Recognition).
  5. Ottimizzare il ramo OCR utilizzando la perdita di entropia incrociata definita nella Equazione 2.
    Formula della perdita di entropia incrociata \(L_{ocr}=-\sum_{i=1}^{N}y_i\log(\hat{y}_i)\), equazione per la classificazione. (2)
    In questo caso, Locr indica la perdita OCR, yi indica l'etichetta supervisionata del numero del giocatore e Equazione di regressione polinomiale, ŷᵢ=β₀+β₁xᵢ+…+βₙxᵢⁿ, grafico di analisi statistica indica la categoria prevista del numero del giocatore.
  6. Ottimizzare il modulo di estrazione delle caratteristiche semantiche utilizzando l'ottimizzatore adattivo, la velocità di apprendimento, la dimensione del batch, il decadimento del peso e la durata dell'addestramento elencati nella Tabella dei Materiali. Combinare la perdita del rilevatore e la perdita OCR utilizzando l'obiettivo totale di addestramento definito nella Equazione 3.
    Ltotale = Ldet + γLocr   (3)
    In questo caso, Ltotale indica la perdita totale di addestramento, Ldet indica la perdita del rilevatore definita nella Equazione 1, Locr indica la perdita OCR definita nella Equazione 2 e indica il coefficiente di ponderazione definito dall'utente per la perdita OCR.
  7. Applicare il ramo OCR addestrato a ogni immagine ritagliata dell'atleta. Salvare la categoria prevista del numero del giocatore o il vettore di probabilità per ogni ritaglio. Se il numero del giocatore non è visibile o la confidenza OCR è al di sotto della soglia definita nell'implementazione, registrare la caratteristica del numero del giocatore come non disponibile anziché forzare una previsione.
  8. Combinare il descrittore del colore della maglia e l'uscita del numero del giocatore nel file delle caratteristiche semantiche utilizzato dal modulo di tracciamento.
    NOTA: Nella principale esecuzione di convalida SportsMOT, lo script di estrazione semantica ha elaborato 343.990 rilevamenti senza fotogrammi mancanti o ritagli non validi. Nel pacchetto di revisione attuale, il riassunto dell'estrazione semantica ha riportato un'accuratezza complessiva di estrazione semantica colore-e-OCR del 86,7% nell'ambiente SportsMOT valutato. Il risultato atteso di questa sezione è un file di caratteristiche semantiche in cui ogni record di rilevamento valido è collegato a un descrittore del colore della maglia, a un'uscita del numero del giocatore quando disponibile e a un indicatore che segnala se le informazioni semantiche sono disponibili per l'associazione nel tracciamento.

4. Livelli di confidenza nel rilevamento delle partizioni

  1. Caricare il file di output del rilevatore per ogni sequenza video. Raccogliere i punteggi di confidenza di tutti i rilevamenti degli atleti in ogni fotogramma.
  2. Partizionare i punteggi di confidenza a livello di fotogramma in intervalli di alta, media e bassa confidenza utilizzando il clustering K-means con K = 3, seguendo il flusso di lavoro di associazione guidato dalla confidenza mostrato in Figura 2. Determinare le soglie di confidenza adattive minimizzando la varianza all'interno dei cluster secondo la Equazione 4.
    Formula simbolo di equilibrio statico; J_conf=min Σ(sd-μ_i)^2; ottimizzazione matematica.  (4)
    In questo caso, sd indica il punteggio di confidenza del rilevamento d; D1, D2 e D3 indicano rispettivamente gli intervalli di alta, media e bassa confidenza; μ1, μ2 e μ3 indicano i punteggi medi di confidenza dei tre intervalli; τ1 e τ2 indicano le soglie di confidenza adattive ottenute dai risultati del clustering K-means.
    NOTA: Lo script di partizionamento della confidenza (scripts/formal_partition_confidence.py) è disponibile nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Il modulo di partizionamento della confidenza utilizza una procedura di clustering K-means unidimensionale basata su NumPy con K = 3. Non è richiesto alcun file di configurazione separato; la directory di input, la directory di output e il parametro di clustering sono specificati tramite argomenti da riga di comando. Eseguire la procedura di partizionamento della confidenza utilizzando il seguente comando: python scripts/formal_partition_confidence.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --k 3. Le dipendenze software richieste, inclusa la versione di NumPy, sono specificate in environment.yml.
  3. Eseguire la procedura di partizionamento della confidenza utilizzando la directory di output del rilevatore come input.
    NOTA: In questo studio, la directory di output del rilevatore era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\detections. La directory di output del partizionamento della confidenza era: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_threshold_sweep\t005\confidence. I file di output generati includevano i file CSV di confidenza per sequenza, _confidence_frame_summary.csv e _confidence_runtime.csv.
  4. Assegnare un'etichetta di livello di confidenza a ogni rilevamento. Etichettare i rilevamenti ad alta confidenza per l'associazione basata sul movimento, quelli a media confidenza per l'associazione motion-semantica e quelli a bassa confidenza solo per il recupero delle traiettorie. Conservare il punteggio di confidenza originale insieme all'etichetta di livello di confidenza assegnata.
  5. Esaminare le distribuzioni dei punteggi di confidenza e i fotogrammi rappresentativi, come illustrato in Figura 3. Verificare che i rilevamenti ad alta confidenza corrispondano prevalentemente a box delimitatori completi e affidabili degli atleti, mentre i rilevamenti a media e bassa confidenza contengano principalmente rilevamenti parziali, occlusi, sfocati o deboli.
    NOTA: Il risultato atteso di questa sezione è un file di partizionamento della confidenza contenente l'indice del rilevamento, il punteggio di confidenza originale, il livello di confidenza assegnato e le soglie di confidenza adattive a livello di fotogramma per ogni rilevamento.

Analisi video guidata dalla confidenza; diagramma con clustering K-means e calcoli di intervallo per la correlazione.
Figura 2. Strategia di associazione guidata dalla confidenza. Il flusso di lavoro suddivide la confidenza di rilevamento in intervalli ad alta, media e bassa confidenza mediante clustering adattivo della confidenza. I rilevamenti ad alta confidenza vengono associati utilizzando la similarità del movimento, quelli a media confidenza mediante una combinazione di similarità del movimento e similarità semantica della maglia, mentre i rilevamenti a bassa confidenza vengono utilizzati per il recupero delle traiettorie assistito da informazioni semantiche con verifica su più fotogrammi. Il pannello destro riassume la formulazione matematica impiegata per la suddivisione della confidenza e l'associazione. Cliccare qui per visualizzare una versione ingrandita di questa figura.

Istogramma che confronta le decisioni sugli sport in base all'intervallo di confidenza; calcio, pallacanestro, pallavolo.
Figura 3. Distribuzione dei punteggi di confidenza di rilevamento. L'istogramma mostra il numero di riquadri di rilevamento degli atleti all'interno di cinque intervalli di confidenza per le sequenze di calcio, pallacanestro e pallavolo nel dataset SportsMOT. La distribuzione illustra le differenze nella confidenza del rilevatore tra le categorie sportive valutate. Cliccare qui per visualizzare una versione ingrandita di questa figura.

5. Eseguire l'associazione guidata dalla confidenza

  1. Caricare il file di output del rilevatore, il file delle caratteristiche semantiche e il file di partizione della confidenza per ogni sequenza video. Inizializzare il tracker utilizzando i primi rilevamenti validi e mantenere uno stato di traiettoria per ogni atleta tracciato. Per ogni fotogramma successivo, prevedere la posizione di ogni traiettoria esistente utilizzando il modello di movimento del filtro di Kalman.
  2. Calcolare la similarità di movimento tra ogni traiettoria prevista e il rilevamento candidato utilizzando la distanza di Mahalanobis definita nella Equazione 5.
    Formula matematica per l'equilibrio statico, equazione: S_mot(t_i^k,d_j) con matrice di covarianza.  (5)
    In questo caso, equilibrio statico, ΣFx=0, ΣFy=0, diagramma di bilancio delle forze, concetto di fisica, tecnica di risoluzione dei problemi indica la traiettoria I-esima nel fotogramma k, Diagramma di equilibrio statico, ΣFx=0, che mostra vettori di forza e bilancio, schema didattico di fisica. indica lo stato della traiettoria previsto dal filtro di Kalman, dj indica il rilevamento candidato, Equazione di equilibrio statico Σi^{-1}; diagramma con simboli matematici per uso didattico. indica la matrice di covarianza inversa dello stato della traiettoria prevista, e Smot indica la distanza di movimento tra la traiettoria prevista e il rilevamento.
    NOTA: Il flusso di lavoro principale di associazione è implementato in jerseytrack/formal_tracker.py ed eseguito tramite scripts/formal_track.py, entrambi disponibili nel repository del codice sorgente JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Non è richiesto alcun file di configurazione separato. Tutti i parametri di esecuzione, inclusi i valori soglia di confidenza, l'età massima della traccia, i coefficienti di peso del movimento e il peso della distanza centrale, vengono forniti tramite argomenti da riga di comando. Il comando completo di esecuzione e le impostazioni dei parametri sono forniti al punto 6.2. L'implementazione utilizza l'algoritmo di assegnazione della somma lineare di SciPy per la corrispondenza ungherese e NumPy per l'associazione basata sui costi.
  3. Eseguire il flusso di lavoro di tracciamento utilizzando come input il file di output del rilevatore, il file delle caratteristiche semantiche e il file di partizione della confidenza.
    NOTA: In questo studio, il tracker principale è stato implementato in jerseytrack\formal_tracker.py, e il flusso di lavoro di tracciamento è stato eseguito utilizzando scripts\formal_track.py.
  4. Associare i rilevamenti ad alta confidenza alle traiettorie esistenti utilizzando la coerenza del movimento. Aggiornare le traiettorie corrispondenti e inizializzare nuove traiettorie solo quando i rilevamenti ad alta confidenza non corrisposti soddisfano i criteri di inizializzazione della traiettoria.
  5. Esaminare gli output dell'estrazione semantica della maglia illustrati nella Figura 4 e costruire il vettore di caratteristiche semantiche della maglia per ogni rilevamento combinando il descrittore del colore della squadra e la caratteristica del numero del giocatore secondo la Equazione 6.
    fsem = [fcol;fid] (6)
    In questo caso, fsem  indica il vettore di caratteristiche semantiche fuso, fcol indica il descrittore del colore della squadra, e fid indica la caratteristica del numero del giocatore generata dal ramo OCR.
  6. Associare i rilevamenti a media confidenza combinando la similarità di movimento con la similarità semantica della maglia. Calcolare il punteggio di corrispondenza fuso secondo la Equazione 7.
    Equazione per la fusione del punteggio di movimento e semantico, Sf=λ(Sm/max(Sm))+(1-λ)(1-Sem). (7)
    In questo caso, Ssem indica la similarità coseno tra i vettori di caratteristiche semantiche della traiettoria e del rilevamento candidato, Smot indica la distanza di movimento definita nella Equazione 5, e λ indica il coefficiente di fusione adattivo che bilancia i termini di similarità di movimento e semantica.
  7. Calcolare il coefficiente di fusione adattivo secondo la Equazione 8.
    Equilibrio statico; λ=λ₀exp(-σsd/σmax); formula relativa alla distribuzione delle sollecitazioni nei materiali. (8)
    In questo caso, λ indica il coefficiente iniziale di peso del movimento, σsd indica la deviazione standard dei punteggi di confidenza del rilevamento nel fotogramma corrente, e σmax indica la deviazione standard massima del punteggio di confidenza utilizzata per la normalizzazione.
  8. Utilizzare i rilevamenti a bassa confidenza solo per il recupero della traiettoria. Associare i rilevamenti a bassa confidenza alle traiettorie interrotte solo quando è disponibile l'informazione semantica e sono soddisfatti i criteri di recupero. Applicare una verifica su più fotogrammi prima di ripristinare l'identità di una traiettoria e scartare i rilevamenti che non superano la verifica.
    NOTA: Quando la caratteristica del numero del giocatore non è disponibile, eseguire l'associazione utilizzando le informazioni semantiche disponibili e la coerenza del movimento, piuttosto che forzare una corrispondenza del numero del giocatore. Il risultato atteso di questa sezione è un registro di tracciamento fotogramma per fotogramma contenente identità delle traiettorie, box delimitatori, etichette di livello di confidenza, costi di movimento, informazioni semantiche e decisioni finali di associazione. Nel pacchetto di evidenze della revisione, i risultati del tracciamento sono stati archiviati in: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2\age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1\tracking.

Diagramma di analisi di una partita di pallavolo con dati di tracciamento dei giocatori per ottenere informazioni sulle prestazioni.
Figura 4. Estrazione di caratteristiche semantiche della maglietta. I rilevamenti rappresentativi degli atleti sono annotati con i descrittori del colore della squadra e le informazioni sul numero del giocatore generati dal modulo di estrazione semantica della maglietta. Le caratteristiche semantiche estratte vengono successivamente incorporate nell'associazione dei dati guidata dalla confidenza. Cliccare qui per visualizzare una versione ingrandita di questa figura.

6. Eseguire il tracciamento inferenziale ed esportare i risultati

  1. Eseguire l'inferenza del tracciamento per ogni sequenza video utilizzando i file di output del rilevatore preparati, i file delle caratteristiche semantiche e i file di partizione della confidenza. Elaborare i fotogrammi video in ordine cronologico in modo che gli stati delle traiettorie, la cronologia semantica e le decisioni di recupero delle traiettorie vengano aggiornati in modo coerente lungo tutta la sequenza. Utilizzare la stessa configurazione di inferenza per tutte le sequenze valutate, a meno che non sia esplicitamente indicata un'impostazione specifica per il dataset.
    NOTA: L'inferenza del tracciamento è stata eseguita utilizzando lo script/formal_track.py, disponibile nel repository del codice sorgente di JerseyTrack (https://doi.org/10.5281/zenodo.21274352). Non è richiesto alcun file di configurazione separato. Eseguire l'inferenza del tracciamento con il seguente comando: python scripts/formal_track.py --detections-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/detections --semantic-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_t005_color --confidence-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_threshold_sweep/t005/confidence --out-dir outputs/formal_runs/sportsmot_val_yolo11x_i960_e3_center_motion_sweep_round2/age45_h0p95_m0p94_l0p58_mw0p65_lw0p5_va0p25_hsp0p0_cdw0p1/tracking --max-age 45 --high-threshold 0.95 --medium-threshold 0.94 --low-threshold 0.58 --medium-motion-weight 0.65 --low-motion-weight 0.5 --velocity-alpha 0.25 --center-distance-weight 0.1. Tutti i parametri non specificati hanno mantenuto i valori predefiniti registrati nel codice sorgente archiviato.
  2. Dopo l'inferenza, applicare la sequenza principale di post-elaborazione utilizzando i seguenti comandi: python scripts/merge_tracklets.py e python scripts/sweep_track_filter.py --min-len 95.
  3. Esportare i risultati del tracciamento nel formato richiesto dal toolkit di valutazione. Includere l'indice del fotogramma, l'identità della traiettoria, le coordinate del bounding box e tutti i campi richiesti dal formato di valutazione del benchmark. Salvare un file di risultati di tracciamento per ogni sequenza utilizzando una convenzione di denominazione dei file coerente, in modo che ciascun file di risultati possa essere abbinato al corrispondente file di annotazione reale.
  4. Applicare esclusivamente le operazioni di post-elaborazione utilizzate in questo studio. Eseguire l'unione dei tracklet e il filtraggio delle tracce utilizzando gli script di post-elaborazione descritti nel pacchetto di revisione.
    NOTA: In questo studio, il flusso di lavoro di post-elaborazione ha utilizzato gli script seguenti:
    ⋅ scripts\merge_tracklets.py
    ⋅ scripts\sweep_track_filter.py
    ⋅ scripts\correct_identity_swaps.py
    ⋅ scripts\sweep_identity_swap_correction.py
    ⋅ scripts\interpolate_tracks.py
    ⋅ scripts\sweep_track_interpolation.py
  5. Ispezionare i risultati del tracciamento esportati prima della valutazione quantitativa. Verificare che le identità delle traiettorie rimangano numeriche e coerenti all'interno di ciascuna sequenza, che non manchino indici di fotogramma e che tutti i bounding box rimangano entro i limiti dell'immagine.
    NOTA: Il risultato atteso di questa sezione è un insieme completo di file di risultati di tracciamento a livello di sequenza, pronti per la valutazione quantitativa.

7. Valutare le prestazioni del tracciamento

  1. Valutare i file dei risultati di tracciamento esportati utilizzando il toolkit di valutazione elencato nella Tabella dei Materiali. Associare ciascun file di risultati di tracciamento al corrispondente file di annotazione di riferimento (ground-truth) e alla suddivisione del dataset. Utilizzare la stessa configurazione di valutazione per tutti i metodi confrontati, al fine di garantire che le differenze di prestazione derivino dai risultati di tracciamento e non dalle impostazioni di valutazione.
  2. Eseguire la valutazione utilizzando il seguente comando
    \.venv\Scripts\python.exe evaluation\trackeval\scripts\nun_mot_challenge.py --GT_FOLDER datasets\SportsMOT\dataset\val --RESULTS_DIR outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95 --OUTPUT_FOLDER outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval --TRACKERS_TO_EVAL JerseyTrack_i960_e3_center_motion_minlen95 --BENCHMARK SportsMOT --SPLIT_TO_EVAL val
    NOTA: La valutazione è stata effettuata utilizzando l'implementazione standard delle metriche di TrackEval (Versione 1.3.0), archiviata all'interno del pacchetto di riproducibilità di JerseyTrack. Non sono state apportate modifiche alle implementazioni delle metriche Higher Order Tracking Accuracy (HOTA), CLEAR o Identity. Il repository include un wrapper di esecuzione in stile MOTChallenge, situato in evaluation/trackeval/scripts/run_mot_challenge.py, che configura i percorsi del dataset e dei risultati e richiama le metriche di valutazione standard di TrackEval.
  3. Registrare le metriche di valutazione riportate nel manoscritto, inclusi Multiple Object Tracking Accuracy (MOTA), IDentity F1 Score (IDF1), Higher Order Tracking Accuracy (HOTA), Detection Accuracy (DetA), Association Accuracy (AssA), falsi positivi (FPs), falsi negativi (FNs) e gli eventi di cambio di identità. Esportare il riepilogo della valutazione sotto forma di tabella e conservare i file di valutazione per sequenza per la verifica.
  4. Quando si confronta JerseyTrack con i metodi di riferimento (baseline), utilizzare la stessa suddivisione del dataset, gli stessi output del rilevatore (detector) e la stessa configurazione di valutazione per tutti i metodi. Registrare il dataset, la fonte degli output del rilevatore, la configurazione del toolkit di valutazione e i valori delle metriche per ciascun confronto.
  5. Esaminare i log di valutazione per verificare che tutte le sequenze siano state valutate correttamente e che non manchino file di risultati di tracciamento.
    NOTA: In questo studio, il file riassuntivo principale di TrackEval è stato conservato in: outputs\formal_runs\sportsmot_val_yolo11x_i960_e3_center_motion_filter_fine_
    round1\minlen95\trackeval\JerseyTrack_i960_
    e3_center_motion_minlen95\pedestrian_summary.txt. Il risultato atteso di questa sezione è una tabella completa di riepilogo della valutazione, insieme ai file delle metriche per sequenza, a supporto dei Risultati riportati e della successiva verifica.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Risultati

Questa sezione riporta i risultati quantitativi e qualitativi ottenuti dagli esperimenti di tracciamento multi-oggetto nello sport valutati. I risultati si concentrano sull'accuratezza del tracciamento, sulla conservazione dell'identità, sulla qualità dell'associazione e sulla robustezza nelle condizioni impostate dal dataset testato. Le affermazioni sulle prestazioni si limitano ai metodi valutati, ai dataset, agli output del rilevatore e alla configurazione del toolkit di valutazione descritti nel Protocollo e nell'Imp...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Discussione

Questo studio ha valutato un flusso di lavoro per il MOT sportivo guidato dalla confidenza, che combina la partizione basata sulla confidenza del rilevamento con indizi semantici delle maglie. L'associazione guidata dalla confidenza e la fusione delle caratteristiche semantiche sono state analizzate come strategie complementari per migliorare l'associazione dei dati nel multi-object tracking12,20,23,...

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Dichiarazioni

Gli autori dichiarano di non avere conflitti di interessi finanziari.

Ringraziamenti

Gli autori non hanno ringraziamenti da dichiarare.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Materiali

Elenco dei materiali utilizzati in questo articolo
NomeAziendaNumero di catalogoCommenti
CUDA RuntimeNVIDIAVersione 12.8Runtime di calcolo GPU utilizzato per l'addestramento del rilevatore, l'estrazione di caratteristiche semantiche e l'inferenza del tracciamento.
EasyOCRJaided AIVersione 1.7.2Kit di strumenti per il riconoscimento ottico dei caratteri utilizzato per il riconoscimento dei numeri dei giocatori.
Codice sorgente di JerseyTrackAutoriN/DImplementazione personalizzata contenente gli script per la preparazione dei dati, l'estrazione di caratteristiche semantiche, la partizione di confidenza, il tracciamento, la post-elaborazione e la valutazione. Disponibile all'indirizzo: https://doi.org/10.5281/zenodo.21274352
Modello OCR CRNN leggeroAutoriN/DReti neurali convoluzionali ricorrenti personalizzate (CRNN) utilizzate per il riconoscimento dei numeri dei giocatori.
Dataset MOT17MOTChallengeN/DDataset pubblico di riferimento utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://motchallenge.net/data/MOT17/
Dataset MOT20MOTChallengeN/DDataset pubblico di riferimento utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://motchallenge.net/data/MOT20/
motmetricsSviluppatori di motmetricsVersione 1.4.0Libreria utilizzata per il calcolo delle metriche diagnostiche di tracciamento multi-oggetto.
GPU NVIDIANVIDIAGeForce RTX 5090 D V2Unità di elaborazione grafica utilizzata per l'addestramento del rilevatore e l'inferenza del tracciamento.
Driver GPU NVIDIANVIDIAVersione 610.62Driver GPU utilizzato nell'ambiente sperimentale.
NumPySviluppatori di NumPyVersione 2.4.4Libreria di calcolo numerico utilizzata per l'elaborazione delle caratteristiche e la gestione dei dati.
OpenCVOpenCVVersione 4.10.0Libreria di visione artificiale utilizzata per il caricamento, il ritaglio, la pre-elaborazione e la visualizzazione delle immagini.
PythonFondazione Python SoftwareVersione 3.12.2Linguaggio di programmazione utilizzato in tutto il flusso di lavoro.
PyTorchFondazione PyTorchVersione 2.11.0+cu128Framework di apprendimento profondo utilizzato per l'implementazione del rilevatore e del modello semantico.
scikit-learnSviluppatori di scikit-learnVersione 1.9.0Libreria di apprendimento automatico utilizzata per il clustering K-means durante l'estrazione del colore della maglia e la partizione di confidenza.
Dataset SoccerNet TrackingSoccerNetN/DBenchmark pubblico per il tracciamento del calcio utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://www.soccer-net.org/tasks/tracking
Dataset SportsMOTBenchmark SportsMOTN/DDataset principale di riferimento utilizzato per la preparazione del rilevatore e la valutazione del tracciamento. Disponibile da: https://deeperaction.github.io/datasets/sportsmot.html
Dataset TeamTrackBenchmark TeamTrackN/DBenchmark pubblico per il tracciamento sportivo utilizzato per la valutazione incrociata tra dataset. Disponibile da: https://atomscott.github.io/TeamTrack/
TorchvisionFondazione PyTorchVersione 0.26.0+cu128Libreria di visione artificiale utilizzata con PyTorch per le trasformazioni delle immagini e il supporto ai modelli.
TrackEvalSviluppatori di TrackEvalVersione 1.3.0Kit di strumenti di valutazione utilizzato per calcolare l'accuratezza del tracciamento multi-oggetto (MOTA), il punteggio F1 di identità (IDF1), l'accuratezza del tracciamento di ordine superiore (HOTA), l'accuratezza del rilevamento (DetA), l'accuratezza dell'associazione (AssA), i falsi positivi (FP), i falsi negativi (FN) e i cambi di identità (IDs).
UltralyticsUltralyticsVersione 8.4.90Framework di rilevamento oggetti utilizzato per addestrare il rilevatore e generare i rilevamenti degli atleti.

Riferimenti

  1. Naik BT, Hashmi MF, Bokde ND. A comprehensive review of computer vision in sports: open issues, future trends and research directions. Applied Sciences. 2022;12(9):4429-46.
  2. Cao W, Wang X, Liu X, Xu Y. A deep learning framework for multi-object tracking in team-sports videos. IET Computer Vision. 2024;18(5):574-90.
  3. Fu X, et al. A novel dataset for multi-view multi-player tracking in soccer scenarios. Applied Sciences. 2023;13(9):5361-77.
  4. Guo Y, et al. Does visual training enhance athletes' decision-making skills and sport-specific performance? A systematic review and meta-analysis. Scand J Med Sci Sports. 2025;35(10):e70140.
  5. Chen X, et al. Multi-object detection and tracking based on CRF network and spatio-temporal attention for sports videos. Scientific Reports. 2025;15(1):6808-21.
  6. Cheng X, Zhao H, Deng Y, Shen S. Multi-object tracking with predictive information fusion and adaptive measurement noise. Applied Sciences. 2025;15(2):736-48.
  7. Hu Q, Scott A, Yeung C, Fujii K. Basketball-SORT: an association method for complex multi-object occlusion problems in basketball multi-object tracking. Multimedia Tools Appl. 2024;83(38):86281-97.
  8. Meng W, Duan S, Ma S, Hu B. Motion-Perception Multi-Object Tracking (MPMOT): enhancing multi-object tracking performance via motion-aware data association and trajectory connection. Journal of Imaging. 2025;11(5):144.
  9. Nie G, Wang X, Zhang D, Wang H. SCT-Diff: seamless contextual tracking via diffusion trajectory. Journal of Imaging. 2026;12(1):38.
  10. Yue Y, et al. Improving multi-object tracking by full occlusion handle and adaptive feature fusion. IET Image Processing. 2023;17(12):3423-40.
  11. Li H, et al. Synergistic-aware cascaded association and trajectory refinement for multi-object tracking. Image Vis Comput. 2025;154:105695.
  12. Wang C, Xie H. FCD-Net: feature decorrelation and confidence-driven dynamic fusion for robust pedestrian recognition in autonomous driving. IEEE Trans Intell Transp Syst. 2025;26(1):1-13.
  13. Wan S, Chen W. Improved multi-target athlete tracking in sports videos using IYOLOv8-MTD and enhanced DeepSORT with hybrid attention and IMM. Informatica. 2025;49(35):101-16.
  14. Sun Z, et al. Multiple pedestrian tracking under occlusion: a survey and outlook. IEEE Trans Circuits Syst Video Technol. 2025;35(2):1009-27.
  15. Qian H, et al. Low-altitude multi-object tracking via graph neural networks with cross-attention and reliable neighbor guidance. Remote Sensing. 2025;17(20):3502.
  16. Liu C, Li H, Wang Z. FastTrack: a highly efficient and generic GPU-based multi-object tracking method with parallel Kalman filter. Int J Comput Vis. 2024;132(5):1463-83.
  17. Urdiales J, Martín D, Armingol JM. An improved deep learning architecture for multi-object tracking systems. Integr Comput Aided Eng. 2023;30(2):121-34.
  18. You L, et al. Multi-object vehicle detection and tracking algorithm based on improved YOLOv8 and ByteTrack. Electronics. 2024;13(15):3033.
  19. Stanczyk T, Yoon S, Bremond F. No train yet gain: towards generic multi-object tracking in sports and beyond [conference paper]. In: Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition Workshops; 2025. p. 6085-94. https://doi.org/10.48550/arXiv.2506.01373
  20. Mandel T, et al. Detection confidence driven multi-object tracking to recover reliable tracks from unreliable detections. Pattern Recognit. 2023;135:109107.
  21. Hou M, Wu Y, Shi H, Mu X. A two-stage multi-object tracking algorithm with transformer and attention mechanism. Scientific Reports. 2025;15(1):31414.
  22. Wenkel S, et al. Confidence score: the forgotten dimension of object detection performance evaluation. Sensors. 2021;21(13):4350.
  23. Zhang F, Hu Y, Li Z, Luo D. Two-stage multi-object tracking via low confidence dynamic adaptive matching enhancement for autonomous driving. Applied Soft Computing. 2025;168:112101.
  24. Stanojevic VD, Todorovic BT. BoostTrack: boosting the similarity measure and detection confidence for improved multiple object tracking. Mach Vis Appl. 2024;35(3):53.
  25. Tan S, Kuang Z, Jin B. AppleYOLO: apple yield estimation method using improved YOLOv8 based on Deep OC-SORT. Expert Syst Appl. 2025;272:126764.
  26. Li YF, et al. Multi-object tracking with robust object regression and association. Comput Vis Image Underst. 2023;227:103586.
  27. Mao H, Chen Y, Li Z, Chen F, Chen P. SCTracker: multi-object tracking with shape and confidence constraints. IEEE Sensors Journal. 2023;24(3):3123-30.
  28. Ma J, Yang J, Zhang J, Fu F. Online multiple object tracker with enhanced features. Journal of Electronic Imaging. 2023;32(1):013030.
  29. Liu Y, et al. A full-detection association tracker with confidence optimization for real-time multi-object tracking. J Real-Time Image Process. 2024;21(4):1-15.
  30. Song Z, et al. Temporal coherent object flow for multi-object tracking [conference paper]. In: Proceedings of the AAAI Conference on Artificial Intelligence; 2025;39(7):6978-86. https://doi.org/10.1609/aaai.v39i7.32749.
  31. Scarrica VM, Staiano A. Learning from outputs: improving multi-object tracking performance by tracker fusion. Technologies. 2024;12(12):239.
  32. Miah M, Bilodeau GA, Saunier N. Learning data association for multi-object tracking using only coordinates. Pattern Recognit. 2025;160:111169.
  33. Yang C, Yang M, Li H. A survey on soccer player detection and tracking with videos. Visual Computer. 2025;41(2):815-29.
  34. Pham DT, Thuy NTT, Tran LQ. SportsORT: overcoming challenges of multi-object tracking in sports through domain-specific features and out-of-view re-association. Mach Vis Appl. 2025;36(6):1-17.
  35. Naik BT, Hashmi MF, Geem ZW, Bokde ND. DeepPlayer-Track: player and referee tracking with jersey color recognition in soccer. IEEE Access. 2022;10:32494-509.
  36. Scott A, et al. TeamTrack: a dataset for multi-sport multi-object tracking in full-pitch videos. Sports Engineering. 2024;27(2):24.
  37. Vats K, et al. Player tracking and identification in ice hockey. Expert Syst Appl. 2023;213:119250.
  38. Liu W, Yao J, Jiang F, Wang M. An improved multi-object tracking algorithm designed for complex environments. Sensors. 2025;25(17):5325.
  39. Kausalya K, Kanaga Suba Raja S. OTRN-DCN: an optimized transformer-based residual network with deep convolutional network for action recognition and multi-object tracking of adaptive segmentation using soccer sports video. Int J Wavelets Multiresolut Inf Process. 2024;22(1):2350034.
  40. Lopes JM, et al. Object and event detection pipeline for rink hockey games. Future Internet. 2024;16(6):179.
  41. Thulasya Naik B, Hashmi MF, Gupta A. EIoU-distance loss: an automated team-wise player detection and tracking with jersey colour recognition in soccer. Connection Science. 2024;36(1):2291991.
  42. Liu H, et al. Automated player identification and indexing using two-stage deep learning network. Scientific Reports. 2023;13(1):10036.
  43. Bhargavi D, Gholami S, Pelaez Coyotl E. Jersey number detection using synthetic data in a low-data regime. Front Artif Intell. 2022;5:988113.
  44. Dendorfer P, et al. MOTChallenge: a benchmark for single-camera multiple target tracking. Int J Comput Vis. 2021;129(4):845-81.
  45. Luiten J, et al. HOTA: a higher order metric for evaluating multi-object tracking. Int J Comput Vis. 2021;129(2):548-78.
  46. Pal SK, Pramanik A, Maiti J, Mitra P. Deep learning in multi-object video tracking: a review. Mach Vis Appl. 2021;51(9):6400-29.

Accesso limitato. Accedi o avvia una prova gratuita per visualizzare questo contenuto.

Ristampe e permessi

Tag

Tracciamento guidato dalla confidenzatraiettoria del giocatoresomiglianza del movimentocolore della magliariconoscimento ottico dei carattericoerenza dell identitdataset SportsMOT